“Brinquedo de física”
fisica-mouse — todos os modelos recebem o mesmo prompt, verbatim, uma vez.
ler o prompt canônico →
Lado a lado
| Modelo | Veredito | Score | Custo | Tokens out | Idas | Tempo | Run |
|---|---|---|---|---|---|---|---|
| Entregou | 1,00 | $0,02 | 4.203 | 4 | 21s | abrir → | |
Z
Zhipu
|
Entregou | 0,99 | $0,04 | 3.515 | 2 | 44s | abrir → |
Anthropic
|
Entregou | 0,99 | $0,04 | 3.876 | 2 | 43s | abrir → |
G
Google
|
Entregou | 0,98 | $0,11est | 12.031 | — | 1m 1s | abrir → |
OpenAI
|
Entregou | 0,92 | $0,13 | 14.975 | 8 | 4m 55s | abrir → |
M
Moonshot AI
|
Entregou | 0,98 | $0,13 | 5.015 | 3 | 30s | abrir → |
Anthropic
|
Entregou | 0,98 | $0,13 | 4.543 | 3 | 1m 2s | abrir → |
Z
Zhipu
|
Entregou | 0,91 | $0,14 | 16.118 | 4 | 5m 9s | abrir → |
OpenAI
|
Entregou | 0,89 | $0,16 | 26.647 | 9 | 6m 30s | abrir → |
OpenAI
|
Entregou | 0,98 | $0,17 | 9.761 | 4 | 18s | abrir → |
Anthropic
|
Entregou | 0,97 | $0,18 | 6.824 | 5 | 1m 6s | abrir → |
xAI
|
Entregou | 0,97 | $0,20 | 10.089 | 7 | 1m 11s | abrir → |
Anthropic
|
Entregou | 0,95 | $0,29 | 6.916 | 3 | 1m 27s | abrir → |
OpenAI
|
Entregou | 0,92 | $0,30 | 10.166 | 10 | 3m 20s | abrir → |
Anthropic
|
Entregou | 0,92 | $0,59 | 6.589 | 3 | 1m 28s | abrir → |
OpenAI
|
Entregou | 0,73 | $0,63 | 20.930 | 24 | 13m 42s | abrir → |
OpenAI
|
Entregou | 0,83 | $0,79 | 14.572 | 12 | 5m 17s | abrir → |
OpenAI
|
Entregou | 0,50 | $2,12 | 28.366 | 37 | 17m 21s | abrir → |
| custo medido (18 de 18 runs) | — | — | $6,17 | — | — | — | — |
Análise
18 de 18 runs julgados pelo painel cego. Score = qualidade 50% · preço 25% · velocidade 25% (scores.json).Como cada modelo se saiu
GPT-5.6 Luna: Run do teste 003 (física de bolinhas): 5 rounds, 113s, US$0.06. Ferramentas: exec×4. Artefato de 258 linhas. Sem dependência externa.
Sonnet 4.6: Run do teste 003 (física de bolinhas): 2 rounds, 168s, US$0.29. Ferramentas: Write×1. Artefato de 324 linhas. Sem dependência externa.
Sonnet 5: Run do teste 003 (física de bolinhas): 4 rounds, 102s, US$0.20. Ferramentas: Bash×2, Write×1. Artefato de 353 linhas. Sem dependência externa.
Grok 4.5: Run do teste 003 (física de bolinhas): 58s. Ferramentas: write×2, search_replace×4. Artefato de 541 linhas. Sem dependência externa.
Opus 4.8: Run do teste 003 (física de bolinhas): 4 rounds, 140s, US$0.45. Ferramentas: Write×1, Bash×2. Artefato de 437 linhas. Sem dependência externa.
Fable 5: Run do teste 003 (física de bolinhas): 2 rounds, 77s, US$0.55. Ferramentas: Write×1. Artefato de 424 linhas. Sem dependência externa.
GPT-5.6 Terra: Run do teste 003 (física de bolinhas): 4 rounds, 93s, US$0.12. Ferramentas: exec×3. Artefato de 225 linhas. Sem dependência externa.
GPT-5.6 Sol: Run do teste 003 (física de bolinhas): 8 rounds, 171s, US$0.45. Ferramentas: exec×7. Artefato de 575 linhas. Sem dependência externa.