“Clona esse site”
site-apple — todos os modelos recebem o mesmo prompt, verbatim, uma vez.
ler o prompt canônico →
Lado a lado
| Modelo | Veredito | Score | Custo | Tokens out | Idas | Tempo | Run |
|---|---|---|---|---|---|---|---|
| Entregou | 1,00 | $0,05 | 12.660 | 6 | 47s | abrir → | |
Anthropic
|
Entregou | 0,99 | $0,07 | 6.552 | 3 | 1m 11s | abrir → |
Z
Zhipu
|
Entregou | 0,99 | $0,09 | 8.757 | 2 | 54s | abrir → |
Z
Zhipu
|
Defeitos | 0,72 | $0,10 | 13.707 | 2 | 3m 17s | abrir → |
G
Google
|
Defeitos | 0,74 | $0,11est | 12.706 | — | 56s | abrir → |
xAI
|
Entregou | 0,98 | $0,18 | 15.704 | 3 | 1m 42s | abrir → |
OpenAI
|
Entregou | 0,99 | $0,19 | 11.226 | 2 | 19s | abrir → |
OpenAI
|
Entregou | 0,77 | $0,22 | 30.799 | 19 | 22m 4s | abrir → |
OpenAI
|
Defeitos | 0,68 | $0,22 | 21.045 | 14 | 6m 38s | abrir → |
Anthropic
|
Entregou | 0,98 | $0,22 | 8.835 | 6 | 1m 37s | abrir → |
OpenAI
|
Defeitos | 0,69 | $0,32 | 13.388 | 12 | 4m 20s | abrir → |
M
Moonshot AI
|
Entregou | 0,95 | $0,44 | 20.984 | 5 | 2m 42s | abrir → |
Anthropic
|
Entregou | 0,93 | $0,67 | 13.133 | 8 | 3m 2s | abrir → |
OpenAI
|
Entregou | 0,77 | $0,91 | 26.144 | 31 | 17m 54s | abrir → |
Anthropic
|
Entregou | 0,86 | $0,92 | 48.036 | 3 | 8m 48s | abrir → |
Anthropic
|
Entregou | 0,92 | $0,94 | 12.708 | 2 | 2m 31s | abrir → |
OpenAI
|
Defeitos | 0,61 | $1,15 | 19.904 | 16 | 7m 25s | abrir → |
OpenAI
|
Entregou | 0,50 | $3,99 | 47.527 | 60 | 25m 26s | abrir → |
| custo medido (18 de 18 runs) | — | — | $10,79 | — | — | — | — |
Análise
18 de 18 runs julgados pelo painel cego. Score = qualidade 50% · preço 25% · velocidade 25% (scores.json).Como cada modelo se saiu
Grok 4.5: Run do teste 002 (clone da home da Apple): 191s. Ferramentas: list_dir×2, write×2, search_replace×12. Artefato de 1436 linhas. Sem dependência externa.
GPT-5.6 Luna: Run do teste 002 (clone da home da Apple): 5 rounds, 178s, US$0.09. Ferramentas: exec×4. Artefato de 277 linhas. Sem dependência externa.
Sonnet 5: Run do teste 002 (clone da home da Apple): 5 rounds, 90s, US$0.18. Ferramentas: Bash×3, Write×1. Artefato de 593 linhas. Sem dependência externa.
Opus 4.8: Run do teste 002 (clone da home da Apple): 8 rounds, 232s, US$0.78. Ferramentas: Write×1, Edit×5, Bash×1. Artefato de 783 linhas. Sem dependência externa.
GPT-5.6 Terra: Run do teste 002 (clone da home da Apple): 4 rounds, 114s, US$0.14. Ferramentas: exec×3. Artefato de 94 linhas. Sem dependência externa.
Sonnet 4.6: Run do teste 002 (clone da home da Apple): 2 rounds, 185s, US$0.36. Ferramentas: Write×1. Artefato de 1085 linhas. Sem dependência externa.
Fable 5: Run do teste 002 (clone da home da Apple): 2 rounds, 164s, US$0.99. Ferramentas: Write×1. Artefato de 730 linhas. Sem dependência externa.
GPT-5.6 Sol: Run do teste 002 (clone da home da Apple): 9 rounds, 244s, US$0.58. Ferramentas: exec×8. Artefato de 625 linhas. Sem dependência externa.