Benchmark em andamento — 161 runs medidos

Quem realmente
entrega código?

18 modelos de IA. 9 tarefas reais de vibe coding. Zero hype.
Julgamento cego, custo medido, código auditável. Os números não mentem.

18
Modelos
9
Testes
161
Runs
$0,42
~Custo/run
Scroll
Modelos testados 18 6 vendors diferentes
Tarefas reais 9 Do zero + dia a dia
Runs medidos 161 161 julgados pelo painel cego
Custo médio $0,42 por run
resultados brutos

Tabela de resultados

Cada linha é um run real. Custo em USD, recalculado a partir dos tokens reais e preços de tabela de cada vendor. Destaque = entrega mais barata do teste.

Modelo Teste Veredito Custo Tokens Idas Tempo
001 Quero um app 3D interativo Defeitos
$0,04
9.310 8 38s
Anthropic
001 Quero um app 3D interativo Entregou
$0,06
5.271 3 1m 0s
Z
Zhipu
001 Quero um app 3D interativo Defeitos
$0,11
12.783 2 3m 7s
Z
Zhipu
001 Quero um app 3D interativo Defeitos
$0,11
21.172 2 9m 4s
G
001 Quero um app 3D interativo Defeitos
$0,15est
16.522 1m 37s
001 Quero um app 3D interativo Quebrou
$0,20
11.942 2 19s
xAI
001 Quero um app 3D interativo Defeitos
$0,20
14.216 5 1m 35s
Anthropic
001 Quero um app 3D interativo Defeitos
$0,25
7.953 5 1m 18s
OpenAI
001 Quero um app 3D interativo Entregou
$0,31
34.148 9 10m 32s
OpenAI
001 Quero um app 3D interativo Entregou
$0,38
55.483 15 34m 24s
Anthropic
001 Quero um app 3D interativo Defeitos
$0,48
11.452 4 2m 20s
M
Moonshot AI
001 Quero um app 3D interativo Entregou
$0,64
23.384 15 4m 14s
Anthropic
001 Quero um app 3D interativo Entregou
$0,69
38.466 4 9m 11s
Anthropic
001 Quero um app 3D interativo Defeitos
$0,78
9.077 2 1m 47s
OpenAI
001 Quero um app 3D interativo Entregou
$0,98
32.047 23 10m 45s
OpenAI
001 Quero um app 3D interativo Entregou
$1,65
34.791 50 23m 53s
OpenAI
001 Quero um app 3D interativo Defeitos
$3,29
40.878 46 17m 35s
OpenAI
001 Quero um app 3D interativo Defeitos
$4,02
42.427 57 21m 42s
002 Clona esse site Entregou
$0,05
12.660 6 47s
Anthropic
002 Clona esse site Entregou
$0,07
6.552 3 1m 11s
Z
Zhipu
002 Clona esse site Entregou
$0,09
8.757 2 54s
Z
Zhipu
002 Clona esse site Defeitos
$0,10
13.707 2 3m 17s
G
002 Clona esse site Defeitos
$0,11est
12.706 56s
xAI
002 Clona esse site Entregou
$0,18
15.704 3 1m 42s
002 Clona esse site Entregou
$0,19
11.226 2 19s
OpenAI
002 Clona esse site Entregou
$0,22
30.799 19 22m 4s
OpenAI
002 Clona esse site Defeitos
$0,22
21.045 14 6m 38s
Anthropic
002 Clona esse site Entregou
$0,22
8.835 6 1m 37s
OpenAI
002 Clona esse site Defeitos
$0,32
13.388 12 4m 20s
M
Moonshot AI
002 Clona esse site Entregou
$0,44
20.984 5 2m 42s
Anthropic
002 Clona esse site Entregou
$0,67
13.133 8 3m 2s
OpenAI
002 Clona esse site Entregou
$0,91
26.144 31 17m 54s
Anthropic
002 Clona esse site Entregou
$0,92
48.036 3 8m 48s
Anthropic
002 Clona esse site Entregou
$0,94
12.708 2 2m 31s
OpenAI
002 Clona esse site Defeitos
$1,15
19.904 16 7m 25s
OpenAI
002 Clona esse site Entregou
$3,99
47.527 60 25m 26s
003 Brinquedo de física Entregou
$0,02
4.203 4 21s
Z
Zhipu
003 Brinquedo de física Entregou
$0,04
3.515 2 44s
Anthropic
003 Brinquedo de física Entregou
$0,04
3.876 2 43s
G
003 Brinquedo de física Entregou
$0,11est
12.031 1m 1s
OpenAI
003 Brinquedo de física Entregou
$0,13
14.975 8 4m 55s
M
Moonshot AI
003 Brinquedo de física Entregou
$0,13
5.015 3 30s
Anthropic
003 Brinquedo de física Entregou
$0,13
4.543 3 1m 2s
Z
Zhipu
003 Brinquedo de física Entregou
$0,14
16.118 4 5m 9s
OpenAI
003 Brinquedo de física Entregou
$0,16
26.647 9 6m 30s
003 Brinquedo de física Entregou
$0,17
9.761 4 18s
Anthropic
003 Brinquedo de física Entregou
$0,18
6.824 5 1m 6s
xAI
003 Brinquedo de física Entregou
$0,20
10.089 7 1m 11s
Anthropic
003 Brinquedo de física Entregou
$0,29
6.916 3 1m 27s
OpenAI
003 Brinquedo de física Entregou
$0,30
10.166 10 3m 20s
Anthropic
003 Brinquedo de física Entregou
$0,59
6.589 3 1m 28s
OpenAI
003 Brinquedo de física Entregou
$0,63
20.930 24 13m 42s
OpenAI
003 Brinquedo de física Entregou
$0,79
14.572 12 5m 17s
OpenAI
003 Brinquedo de física Entregou
$2,12
28.366 37 17m 21s
OpenAI
004 Faz um jogo Quebrou
$0,03
4.116 9 31m 4s
004 Faz um jogo Defeitos
$0,04
10.477 6 34s
Anthropic
004 Faz um jogo Quebrou
$0,06
5.850 2 43s
Z
Zhipu
004 Faz um jogo Entregou
$0,07
10.634 2 5m 22s
G
004 Faz um jogo Quebrou
$0,18est
19.474 5m 3s
Z
Zhipu
004 Faz um jogo Defeitos
$0,19
24.113 4 5m 57s
xAI
004 Faz um jogo Entregou
$0,20
14.675 4 1m 31s
OpenAI
004 Faz um jogo Defeitos
$0,25
29.652 10 9m 10s
Anthropic
004 Faz um jogo Defeitos
$0,28
14.505 6 1m 56s
Anthropic
004 Faz um jogo Defeitos
$0,59
16.888 2 3m 6s
OpenAI
004 Faz um jogo Entregou
$0,77
28.006 17 8m 55s
Anthropic
004 Faz um jogo Defeitos
$0,82
40.753 2 8m 11s
M
Moonshot AI
004 Faz um jogo Defeitos
$1,19
46.151 23 13m 50s
Anthropic
004 Faz um jogo Entregou
$2,11
30.648 3 6m 1s
OpenAI
004 Faz um jogo Defeitos
$2,43
39.875 57 30m 51s
OpenAI
004 Faz um jogo Defeitos
$3,15
50.604 32 34m 12s
OpenAI
004 Faz um jogo Entregou
$6,13
44.294 46 16m 36s
G
101 Acha esse bug pra mim Entregou
$0,01est
565 11s
101 Acha esse bug pra mim Entregou
$0,01
897 4 6s
OpenAI
101 Acha esse bug pra mim Entregou
$0,02
975 4 30s
OpenAI
101 Acha esse bug pra mim Defeitos
$0,03
3.939 7 1m 45s
Z
Zhipu
101 Acha esse bug pra mim Entregou
$0,03
476 5 16s
Z
Zhipu
101 Acha esse bug pra mim Entregou
$0,04
827 6 35s
OpenAI
101 Acha esse bug pra mim Entregou
$0,04
585 4 19s
101 Acha esse bug pra mim Defeitos
$0,04
1.076 3 7s
Anthropic
101 Acha esse bug pra mim Entregou
$0,05
1.673 6 24s
M
Moonshot AI
101 Acha esse bug pra mim Entregou
$0,07
1.332 4 45s
OpenAI
101 Acha esse bug pra mim Entregou
$0,08
649 4 18s
xAI
101 Acha esse bug pra mim Entregou
$0,10
953 5 12s
OpenAI
101 Acha esse bug pra mim Defeitos
$0,11
3.088 5 1m 8s
Anthropic
101 Acha esse bug pra mim Entregou
$0,12
916 6 33s
OpenAI
101 Acha esse bug pra mim Defeitos
$0,17
2.909 7 1m 6s
Anthropic
101 Acha esse bug pra mim Entregou
$0,18
1.504 7 29s
Anthropic
101 Acha esse bug pra mim Entregou
$0,30
1.793 7 41s
Anthropic
101 Acha esse bug pra mim Entregou
$0,31
1.093 4 33s
103 Adiciona um filtro no meu app Entregou
$0,02
2.652 5 17s
G
103 Adiciona um filtro no meu app Entregou
$0,02est
2.110 24s
Z
Zhipu
103 Adiciona um filtro no meu app Entregou
$0,03
1.215 8 25s
OpenAI
103 Adiciona um filtro no meu app Entregou
$0,03
2.050 6 44s
OpenAI
103 Adiciona um filtro no meu app Entregou
$0,05
5.783 9 1m 33s
Anthropic
103 Adiciona um filtro no meu app Entregou
$0,06
2.604 9 37s
103 Adiciona um filtro no meu app Entregou
$0,06
2.667 5 9s
OpenAI
103 Adiciona um filtro no meu app Entregou
$0,07
1.517 5 34s
Z
Zhipu
103 Adiciona um filtro no meu app Entregou
$0,09
2.101 9 1m 31s
xAI
103 Adiciona um filtro no meu app Entregou
$0,09
1.985 4 17s
OpenAI
103 Adiciona um filtro no meu app Entregou
$0,10
2.800 5 1m 2s
OpenAI
103 Adiciona um filtro no meu app Entregou
$0,11
1.321 5 34s
Anthropic
103 Adiciona um filtro no meu app Entregou
$0,11
1.793 8 42s
M
Moonshot AI
103 Adiciona um filtro no meu app Entregou
$0,18
5.731 9 3m 0s
Anthropic
103 Adiciona um filtro no meu app Entregou
$0,18
2.741 14 46s
OpenAI
103 Adiciona um filtro no meu app Entregou
$0,20
2.435 6 1m 10s
Anthropic
103 Adiciona um filtro no meu app Entregou
$0,20
3.138 8 50s
Anthropic
103 Adiciona um filtro no meu app Entregou
$0,49
2.864 10 1m 16s
G
104 Conserta o mobile sem mexer no desktop Entregou
$0,01est
1.567 33s
104 Conserta o mobile sem mexer no desktop Entregou
$0,02
4.506 8 34s
Anthropic
104 Conserta o mobile sem mexer no desktop Entregou
$0,03
1.535 4 25s
Z
Zhipu
104 Conserta o mobile sem mexer no desktop Entregou
$0,04
2.067 4 1m 52s
OpenAI
104 Conserta o mobile sem mexer no desktop Defeitos
$0,04
2.871 6 57s
104 Conserta o mobile sem mexer no desktop Entregou
$0,05
2.585 3 9s
Z
Zhipu
104 Conserta o mobile sem mexer no desktop Entregou
$0,08
7.943 5 2m 46s
OpenAI
104 Conserta o mobile sem mexer no desktop Defeitos
$0,09
1.957 6 44s
xAI
104 Conserta o mobile sem mexer no desktop Entregou
$0,10
2.731 4 24s
Anthropic
104 Conserta o mobile sem mexer no desktop Defeitos
$0,10
2.051 6 41s
OpenAI
104 Conserta o mobile sem mexer no desktop Entregou
$0,11
19.654 7 4m 50s
OpenAI
104 Conserta o mobile sem mexer no desktop Defeitos
$0,18
2.229 7 48s
M
Moonshot AI
104 Conserta o mobile sem mexer no desktop Entregou
$0,20
5.840 9 3m 57s
Anthropic
104 Conserta o mobile sem mexer no desktop Entregou
$0,25
4.761 5 1m 15s
OpenAI
104 Conserta o mobile sem mexer no desktop Defeitos
$0,43
10.965 19 4m 10s
Anthropic
104 Conserta o mobile sem mexer no desktop Entregou
$0,70
6.613 8 2m 15s
OpenAI
104 Conserta o mobile sem mexer no desktop Defeitos
$0,77
9.114 22 3m 38s
Anthropic
104 Conserta o mobile sem mexer no desktop Defeitos
$1,28
39.071 60 10m 43s
105 Revisa esse código antes de eu subir Entregou
$0,02
5.852 4 30s
G
105 Revisa esse código antes de eu subir Entregou
$0,03est
3.169 28s
Z
Zhipu
105 Revisa esse código antes de eu subir Entregou
$0,05
3.758 4 5m 0s
Anthropic
105 Revisa esse código antes de eu subir Entregou
$0,07
4.893 9 1m 7s
105 Revisa esse código antes de eu subir Entregou
$0,08
4.210 3 11s
OpenAI
105 Revisa esse código antes de eu subir Entregou
$0,09
14.960 6 3m 40s
OpenAI
105 Revisa esse código antes de eu subir Entregou
$0,09
7.688 6 2m 25s
Z
Zhipu
105 Revisa esse código antes de eu subir Entregou
$0,09
8.193 5 3m 14s
xAI
105 Revisa esse código antes de eu subir Entregou
$0,11
6.507 3 1m 0s
OpenAI
105 Revisa esse código antes de eu subir Entregou
$0,13
4.379 6 1m 26s
OpenAI
105 Revisa esse código antes de eu subir Entregou
$0,13
5.886 5 3m 35s
M
Moonshot AI
105 Revisa esse código antes de eu subir Entregou
$0,18
7.464 3 4m 16s
Anthropic
105 Revisa esse código antes de eu subir Entregou
$0,18
6.355 5 2m 0s
Anthropic
105 Revisa esse código antes de eu subir Entregou
$0,25
9.600 8 2m 1s
OpenAI
105 Revisa esse código antes de eu subir Entregou
$0,30
6.250 5 2m 5s
OpenAI
105 Revisa esse código antes de eu subir Entregou
$0,30
6.074 5 2m 18s
Anthropic
105 Revisa esse código antes de eu subir Entregou
$0,34
7.841 5 2m 10s
Anthropic
105 Revisa esse código antes de eu subir Entregou
$0,69
8.008 5 2m 13s
108 Gera um relatório desse CSV zoado Entregou
$0,07
5.953 10 38s
Anthropic
108 Gera um relatório desse CSV zoado Quebrou
$0,10
5.487 5 58s
G
108 Gera um relatório desse CSV zoado Entregou
$0,10est
10.962 1m 52s
Z
Zhipu
108 Gera um relatório desse CSV zoado Quebrou
$0,10
5.396 6 5m 14s
OpenAI
108 Gera um relatório desse CSV zoado Entregou
$0,11
9.873 12 3m 10s
108 Gera um relatório desse CSV zoado Entregou
$0,16
7.935 6 18s
OpenAI
108 Gera um relatório desse CSV zoado Entregou
$0,17
28.415 16 7m 17s
xAI
108 Gera um relatório desse CSV zoado Entregou
$0,24
6.551 5 46s
OpenAI
108 Gera um relatório desse CSV zoado Entregou
$0,27
6.255 11 2m 9s
Z
Zhipu
108 Gera um relatório desse CSV zoado Entregou
$0,37
20.820 25 8m 25s
Anthropic
108 Gera um relatório desse CSV zoado Entregou
$0,40
15.506 17 2m 56s
M
Moonshot AI
108 Gera um relatório desse CSV zoado Entregou
$0,41
13.974 17 7m 13s
Anthropic
108 Gera um relatório desse CSV zoado Entregou
$0,42
7.771 12 2m 3s
OpenAI
108 Gera um relatório desse CSV zoado Entregou
$0,51
15.612 19 5m 11s
OpenAI
108 Gera um relatório desse CSV zoado Entregou
$0,56
7.497 10 2m 40s
OpenAI
108 Gera um relatório desse CSV zoado Entregou
$0,59
10.913 10 3m 33s
Anthropic
108 Gera um relatório desse CSV zoado Entregou
$0,75
15.908 10 3m 36s
Anthropic
108 Gera um relatório desse CSV zoado Entregou
$0,83
7.794 11 2m 12s

Legenda: Entregou funcionou perfeitamente Defeitos funciona, mas com problemas Quebrou não funciona ou não entregou

ranking

Placar por modelo

Posição e score saem do julgamento cego (scores.json: qualidade 50% · preço 25% · velocidade 25%). Sem veredito, sem número.

# Modelo Score Preço 1M in/out Runs Vereditos Tokens out Custo medido
#1 0,938 $0,50 / $2,50 9de 9 testes 7 entregou 2 defeitos 56.510 $0,28em 9 de 9 runs
#2
xAI
0,928 $2 / $6 9de 9 testes 8 entregou 1 defeitos 73.411 $1,40em 9 de 9 runs
#3 0,887 $1,75 / $14 8de 9 testes 6 entregou 1 defeitos 1 quebrou 51.402 $0,95em 8 de 8 runs
#4
G
0,866 $1,50 / $9 9de 9 testes 6 entregou 2 defeitos 1 quebrou 79.106 $0,71em 9 de 9 runs
#5
Anthropic
0,858 $1 / $5 9de 9 testes 7 entregou 2 quebrou 37.741 $0,53em 9 de 9 runs
#6
Z
Zhipu
0,843 $1,20 / $4 9de 9 testes 7 entregou 1 defeitos 1 quebrou 56.990 $0,56em 9 de 9 runs
#7
Anthropic
0,837 $3 / $15 9de 9 testes 7 entregou 2 defeitos 150.684 $3,49em 9 de 9 runs
#8
OpenAI
0,837 $1 / $6 9de 9 testes 6 entregou 3 defeitos 123.277 $1,20em 9 de 9 runs
#9
M
Moonshot AI
0,807 $3 / $15 9de 9 testes 8 entregou 1 defeitos 129.875 $3,43em 9 de 9 runs
#10
Z
Zhipu
0,799 $1,40 / $4,40 9de 9 testes 6 entregou 3 defeitos 106.605 $1,21em 9 de 9 runs
#11
Anthropic
0,799 $5 / $25 9de 9 testes 7 entregou 2 defeitos 81.830 $3,86em 9 de 9 runs
#12
OpenAI
0,780 $2,50 / $15 9de 9 testes 7 entregou 2 defeitos 136.433 $6,22em 9 de 9 runs
#13
Anthropic
0,771 $2 / $10preço promocional até 31/08/2026 (depois $3/$15) 9de 9 testes 6 entregou 3 defeitos 106.539 $3,22em 9 de 9 runs
#14
Anthropic
0,765 $10 / $50 9de 9 testes 8 entregou 1 defeitos 85.394 $7,43em 9 de 9 runs
#15
OpenAI
0,760 $2,50 / $15 9de 9 testes 6 entregou 3 defeitos 121.958 $3,64em 9 de 9 runs
#16
OpenAI
0,714 $0,75 / $4,50 9de 9 testes 7 entregou 1 defeitos 1 quebrou 189.796 $1,23em 9 de 9 runs
#17
OpenAI
0,646 $5 / $30 9de 9 testes 5 entregou 4 defeitos 151.269 $13,40em 9 de 9 runs
#18
OpenAI
0,644 $5 / $30 9de 9 testes 6 entregou 3 defeitos 186.694 $14,50em 9 de 9 runs
a bateria

Os testes

Nada de benchmark de engenheiro. São pedidos que um vibe coder faz de verdade. Trilha 3 (harness com squad): squads recomendados →

Teste Pedido Trilha Categoria Runs
001 “Quero um app 3D interativo” Benchmark 3D interativo 18 runs duelo do teste 001 — sistema-solar-3d →
002 “Clona esse site” Benchmark clone de site 18 runs duelo do teste 002 — site-apple →
003 “Brinquedo de física” Benchmark física/canvas 18 runs duelo do teste 003 — fisica-mouse →
004 “Faz um jogo” Benchmark jogo 3D 17 runs duelo do teste 004 — fps →
101 “Acha esse bug pra mim” Dia a dia debug 18 runs duelo do teste 101 — caca-bug →
103 “Adiciona um filtro no meu app” Dia a dia feature em código existente 18 runs duelo do teste 103 — feature-alheia →
104 “Conserta o mobile sem mexer no desktop” Dia a dia CSS responsivo 18 runs duelo do teste 104 — css-mobile →
105 “Revisa esse código antes de eu subir” Dia a dia code review 18 runs duelo do teste 105 — revisar-codigo →
108 “Gera um relatório desse CSV zoado” Dia a dia dados 18 runs duelo do teste 108 — dado-sujo →
metodologia

Como o benchmark é feito

Não confiamos em benchmark de modelo. Números auto-reportados medem "o modelo acerta a prova". A gente mede outra coisa: o modelo entrega o app?

01 — Isolamento

Modelo isolado no CLI oficial

Cada modelo roda no CLI do próprio vendor, mas em modo base virgem: sem skills, sem MCP, sem subagentes. Medimos o modelo puro.

02 — Prompt

Prompt verbatim, um chute

O prompt canônico vai byte a byte (sha256 registrado). Sem prefixo, sem ajuda. Uma tentativa. Um turno. Sem socorro.

03 — Custo

Custo real, fonte primária

Custo e tokens vêm da contabilidade interna de cada CLI. Sempre recalculado pelos preços de tabela. Anti-burla: se descarrega num modelo auxiliar, aparece aqui.

04 — Auditoria

Auditoria de lisura

Antes de julgar, verificamos: single-shot, prompt verbatim, sem subagente, artefato escrito pelo modelo. Run reprovado não entra no julgamento.

05 — Cegueira

Julgamento cego

Runs anonimizados e embaralhados. O juiz não sabe qual modelo gerou qual artefato. Quem gera nunca julga. A régua não entorta.

06 — Verificação

Verificação em browser

Playwright abre cada artefato, tira screenshots, coleta console.log, preenche critérios binários pass/fail. Sem "parece bom".

duelos

Comparativos 1v1

Cada par de modelos, lado a lado, teste por teste. Quem entrega mais? Quem gasta menos? Quem quebra quando o outro funciona?

Ver todos os 137 duelos →

perguntas frequentes

FAQ

Qual é o melhor modelo de IA para programar?

No nosso julgamento cego, Grok Composer 2.5 Fast lidera o ranking geral com score 0,938 (qualidade 50%, preço 25%, velocidade 25%) sobre 9 tarefas reais de vibe coding.

Qual é a IA mais barata que entrega código?

Grok Composer 2.5 Fast fechou a bateria inteira por $0,28 (9 tarefas), com 7 entregas limpas — o menor custo total medido.

Claude ou GPT: qual entrega mais código?

Na bateria atual, os modelos Claude (Anthropic) somam 35 entregas limpas em 45 runs; os GPT (OpenAI) somam 43 em 62 runs. O placar teste a teste está nos comparativos.

Como o julgamento funciona?

Cada artefato é anonimizado e embaralhado antes de ir pro painel cego — o juiz não sabe qual modelo gerou o quê. Verificação em browser com Playwright, critérios binários, custo recalculado dos tokens reais. Quem gera nunca julga.

Quer ver o benchmark rodar ao vivo?

Toda vez que um modelo novo lança, a gente roda a bateria completa — e o harness Overclock entra no final para provar que orquestração vence solo.

Experimentar Overclock → Ver código no GitHub