teste 002 · benchmark · clone de site

“Clona esse site”

site-apple — todos os modelos recebem o mesmo prompt, verbatim, uma vez.

prompt canônico
$ Crie um único arquivo HTML que recrie a página inicial da Apple (apple.com). Navbar fixa no topo com o menu da Apple (logo, produtos, busca, sacola). Hero de produto em destaque: imagem grande centralizada, título grande, subtítulo e dois …
ler o prompt canônico →
Grok Composer 2.5 Fast
$0,05 abrir ↗
▶ carregar preview
Entregou idas: 6 tempo: 47s score: 1,00
Haiku 4.5
$0,07 abrir ↗
▶ carregar preview
Entregou idas: 3 tempo: 1m 11s score: 0,99
Z
GLM 5 Turbo
$0,09 abrir ↗
▶ carregar preview
Entregou idas: 2 tempo: 54s score: 0,99
Z
GLM 5.2
$0,10 abrir ↗
▶ carregar preview
Defeitos idas: 2 tempo: 3m 17s score: 0,72
G
Gemini 3.5 Flash
$0,11est abrir ↗
▶ carregar preview
Defeitos idas: — tempo: 56s score: 0,74
Grok 4.5
$0,18 abrir ↗
▶ carregar preview
Entregou idas: 3 tempo: 1m 42s score: 0,98
GPT-5.3 Codex Spark
$0,19 abrir ↗
▶ carregar preview
Entregou idas: 2 tempo: 19s score: 0,99
GPT-5.4 Mini
$0,22 abrir ↗
▶ carregar preview
Entregou idas: 19 tempo: 22m 4s score: 0,77
GPT-5.6 Luna
$0,22 abrir ↗
▶ carregar preview
Defeitos idas: 14 tempo: 6m 38s score: 0,68
Sonnet 5
$0,22 abrir ↗
▶ carregar preview
Entregou idas: 6 tempo: 1m 37s score: 0,98
GPT-5.4
$0,32 abrir ↗
▶ carregar preview
Defeitos idas: 12 tempo: 4m 20s score: 0,69
M
Kimi K3
$0,44 abrir ↗
▶ carregar preview
Entregou idas: 5 tempo: 2m 42s score: 0,95
Opus 4.8
$0,67 abrir ↗
▶ carregar preview
Entregou idas: 8 tempo: 3m 2s score: 0,93
GPT-5.6 Terra
$0,91 abrir ↗
▶ carregar preview
Entregou idas: 31 tempo: 17m 54s score: 0,77
Sonnet 4.6
$0,92 abrir ↗
▶ carregar preview
Entregou idas: 3 tempo: 8m 48s score: 0,86
Fable 5
$0,94 abrir ↗
▶ carregar preview
Entregou idas: 2 tempo: 2m 31s score: 0,92
GPT-5.5
$1,15 abrir ↗
▶ carregar preview
Defeitos idas: 16 tempo: 7m 25s score: 0,61
GPT-5.6 Sol
$3,99 abrir ↗
▶ carregar preview
Entregou idas: 60 tempo: 25m 26s score: 0,50

Lado a lado

Modelo Veredito Score Custo Tokens out Idas Tempo Run
Entregou 1,00 $0,05 12.660 6 47s abrir →
Anthropic
Entregou 0,99 $0,07 6.552 3 1m 11s abrir →
Z
Zhipu
Entregou 0,99 $0,09 8.757 2 54s abrir →
Z
Zhipu
Defeitos 0,72 $0,10 13.707 2 3m 17s abrir →
G
Defeitos 0,74 $0,11est 12.706 56s abrir →
xAI
Entregou 0,98 $0,18 15.704 3 1m 42s abrir →
Entregou 0,99 $0,19 11.226 2 19s abrir →
OpenAI
Entregou 0,77 $0,22 30.799 19 22m 4s abrir →
OpenAI
Defeitos 0,68 $0,22 21.045 14 6m 38s abrir →
Anthropic
Entregou 0,98 $0,22 8.835 6 1m 37s abrir →
OpenAI
Defeitos 0,69 $0,32 13.388 12 4m 20s abrir →
M
Moonshot AI
Entregou 0,95 $0,44 20.984 5 2m 42s abrir →
Anthropic
Entregou 0,93 $0,67 13.133 8 3m 2s abrir →
OpenAI
Entregou 0,77 $0,91 26.144 31 17m 54s abrir →
Anthropic
Entregou 0,86 $0,92 48.036 3 8m 48s abrir →
Anthropic
Entregou 0,92 $0,94 12.708 2 2m 31s abrir →
OpenAI
Defeitos 0,61 $1,15 19.904 16 7m 25s abrir →
OpenAI
Entregou 0,50 $3,99 47.527 60 25m 26s abrir →
custo medido (18 de 18 runs) $10,79

Análise

18 de 18 runs julgados pelo painel cego. Score = qualidade 50% · preço 25% · velocidade 25% (scores.json).

Como cada modelo se saiu

Grok 4.5: Run do teste 002 (clone da home da Apple): 191s. Ferramentas: list_dir×2, write×2, search_replace×12. Artefato de 1436 linhas. Sem dependência externa.

GPT-5.6 Luna: Run do teste 002 (clone da home da Apple): 5 rounds, 178s, US$0.09. Ferramentas: exec×4. Artefato de 277 linhas. Sem dependência externa.

Sonnet 5: Run do teste 002 (clone da home da Apple): 5 rounds, 90s, US$0.18. Ferramentas: Bash×3, Write×1. Artefato de 593 linhas. Sem dependência externa.

Opus 4.8: Run do teste 002 (clone da home da Apple): 8 rounds, 232s, US$0.78. Ferramentas: Write×1, Edit×5, Bash×1. Artefato de 783 linhas. Sem dependência externa.

GPT-5.6 Terra: Run do teste 002 (clone da home da Apple): 4 rounds, 114s, US$0.14. Ferramentas: exec×3. Artefato de 94 linhas. Sem dependência externa.

Sonnet 4.6: Run do teste 002 (clone da home da Apple): 2 rounds, 185s, US$0.36. Ferramentas: Write×1. Artefato de 1085 linhas. Sem dependência externa.

Fable 5: Run do teste 002 (clone da home da Apple): 2 rounds, 164s, US$0.99. Ferramentas: Write×1. Artefato de 730 linhas. Sem dependência externa.

GPT-5.6 Sol: Run do teste 002 (clone da home da Apple): 9 rounds, 244s, US$0.58. Ferramentas: exec×8. Artefato de 625 linhas. Sem dependência externa.