“Faz um jogo”
fps — todos os modelos recebem o mesmo prompt, verbatim, uma vez.
ler o prompt canônico →
Lado a lado
| Modelo | Veredito | Score | Custo | Tokens out | Idas | Tempo | Run |
|---|---|---|---|---|---|---|---|
OpenAI
|
Quebrou | 0,27 | $0,03 | 4.116 | 9 | 31m 4s | abrir → |
| Defeitos | 0,75 | $0,04 | 10.477 | 6 | 34s | abrir → | |
Anthropic
|
Quebrou | 0,50 | $0,06 | 5.850 | 2 | 43s | abrir → |
Z
Zhipu
|
Entregou | 0,96 | $0,07 | 10.634 | 2 | 5m 22s | abrir → |
G
Google
|
Quebrou | 0,46 | $0,18est | 19.474 | — | 5m 3s | abrir → |
Z
Zhipu
|
Defeitos | 0,70 | $0,19 | 24.113 | 4 | 5m 57s | abrir → |
xAI
|
Entregou | 0,99 | $0,20 | 14.675 | 4 | 1m 31s | abrir → |
OpenAI
|
Defeitos | 0,68 | $0,25 | 29.652 | 10 | 9m 10s | abrir → |
Anthropic
|
Defeitos | 0,73 | $0,28 | 14.505 | 6 | 1m 56s | abrir → |
Anthropic
|
Defeitos | 0,71 | $0,59 | 16.888 | 2 | 3m 6s | abrir → |
OpenAI
|
Entregou | 0,91 | $0,77 | 28.006 | 17 | 8m 55s | abrir → |
Anthropic
|
Defeitos | 0,66 | $0,82 | 40.753 | 2 | 8m 11s | abrir → |
M
Moonshot AI
|
Defeitos | 0,60 | $1,19 | 46.151 | 23 | 13m 50s | abrir → |
Anthropic
|
Entregou | 0,87 | $2,11 | 30.648 | 3 | 6m 1s | abrir → |
OpenAI
|
Defeitos | 0,43 | $2,43 | 39.875 | 57 | 30m 51s | abrir → |
OpenAI
|
Defeitos | 0,37 | $3,15 | 50.604 | 32 | 34m 12s | abrir → |
OpenAI
|
Entregou | 0,63 | $6,13 | 44.294 | 46 | 16m 36s | abrir → |
| custo medido (17 de 17 runs) | — | — | $18,47 | — | — | — | — |
Análise
17 de 17 runs julgados pelo painel cego. Score = qualidade 50% · preço 25% · velocidade 25% (scores.json).Como cada modelo se saiu
Grok 4.5: Run do teste 004 (jogo FPS): 115s. Ferramentas: list_dir×2, write×2. Artefato de 1075 linhas. Sem dependência externa.
GPT-5.6 Luna: Run do teste 004 (jogo FPS): 6 rounds, 210s, US$0.10. Ferramentas: exec×5. Artefato de 278 linhas. Usa lib externa: cdn.jsdelivr.net.
Sonnet 5: Run do teste 004 (jogo FPS): 11 rounds, 251s, US$0.55. Ferramentas: Bash×5, Write×1, Edit×2, ToolSearch×1, Read×1. Artefato de 739 linhas. Usa lib externa: unpkg.com.
Opus 4.8: Run do teste 004 (jogo FPS): 81 rounds, 1731s, US$7.26. Ferramentas: Bash×31, Write×3, Read×11, Edit×35. Artefato de 1702 linhas. Sem dependência externa.
Sonnet 4.6: Run do teste 004 (jogo FPS): 3 rounds, 908s, US$1.38. Ferramentas: Write×1, Bash×1. Artefato de 792 linhas. Usa lib externa: cdn.jsdelivr.net.
Fable 5: Run do teste 004 (jogo FPS): 4 rounds, 342s, US$2.00. Ferramentas: Write×1, Bash×1, Edit×1. Artefato de 873 linhas. Sem dependência externa.
GPT-5.6 Terra: Run do teste 004 (jogo FPS): 5 rounds, 141s, US$0.18. Ferramentas: exec×4. Artefato de 135 linhas. Sem dependência externa.
GPT-5.6 Sol: Run do teste 004 (jogo FPS): 25 rounds, 449s, US$1.25. Ferramentas: exec×22, wait×2. Artefato de 277 linhas. Sem dependência externa.