duelo direto
Sonnet 4.6 vs GPT-5.4 Mini
Placar 8×1 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.
Placar por teste
8 × 1
Sonnet 4.6 × GPT-5.4 Mini
Custo da bateria
$3,49 vs $1,23
soma dos runs medidos
Vencedor geral
Sonnet 4.6
score do ranking cego
| Teste | Sonnet 4.6 | GPT-5.4 Mini | Vencedor |
|---|---|---|---|
| 001 3D interativo | Entregou $0,69 · 9m 11s · score 0,89 | Entregou $0,38 · 34m 24s · score 0,73 | Sonnet 4.6 |
| 002 clone de site | Entregou $0,92 · 8m 48s · score 0,86 | Entregou $0,22 · 22m 4s · score 0,77 | Sonnet 4.6 |
| 003 física/canvas | Entregou $0,13 · 1m 2s · score 0,98 | Entregou $0,16 · 6m 30s · score 0,89 | Sonnet 4.6 |
| 004 jogo 3D | Defeitos $0,82 · 8m 11s · score 0,66 | Quebrou $0,03 · 31m 4s · score 0,27 | Sonnet 4.6 |
| 101 debug | Entregou $0,12 · 33s · score 0,84 | Defeitos $0,03 · 1m 45s · score 0,48 | Sonnet 4.6 |
| 103 feature em código existente | Entregou $0,11 · 42s · score 0,90 | Entregou $0,05 · 1m 33s · score 0,86 | Sonnet 4.6 |
| 104 CSS responsivo | Defeitos $0,10 · 41s · score 0,72 | Entregou $0,11 · 4m 50s · score 0,87 | GPT-5.4 Mini |
| 105 code review | Entregou $0,18 · 2m 0s · score 0,85 | Entregou $0,09 · 3m 40s · score 0,80 | Sonnet 4.6 |
| 108 dados | Entregou $0,42 · 2m 3s · score 0,83 | Entregou $0,17 · 7m 17s · score 0,75 | Sonnet 4.6 |
veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)
Onde Sonnet 4.6 leva
- Complexidade 3D e física (001, 003): scores máximos (0.89–0.98) contra 0.73–0.89, com velocidade 3.7–6.3x superior — 551s vs 2064s no interativo, 62s vs 390s na física.
- Confiabilidade em falhas (004, 101): GPT quebra completamente em jogo 3D (0.27) e tem defeitos em debug (0.48); Sonnet entrega algo utilizável mesmo com defeitos (0.66, 0.84).
- Consistência geral (002, 103, 105, 108): vence em 5 de 6 testes restantes com scores 0.83–0.86, mantendo velocidade 2–2.5x melhor.
Onde GPT-5.4 Mini leva
- CSS responsivo (104): único vencedor com 0.87 vs defeitos do Sonnet (0.72) — o único teste onde GPT entrega clean sem compromissos.
Qual escolher
Sonnet 4.6 para produção: domina 88.9% dos testes, especialmente em tarefas complexas que quebram outros modelos (3D, physics, debug). Custo 2.8x maior ($3.49 vs $1.23) é compensado por confiabilidade. GPT-5.4 Mini só se orçamento for crítico e a carga for CSS/styling — caso contrário, o risco de falhas custosas (jogo 3D quebrou, debug deficiente) inviabiliza economizar $2.25 por bateria.
Outros duelos
Fable 5 vs GPT-5.4 Mini
GLM 5.2 vs GPT-5.4 Mini
GLM 5 Turbo vs GPT-5.4 Mini
GLM 5 Turbo vs Sonnet 4.6
GPT-5.3 Codex Spark vs GPT-5.4 Mini
GPT-5.3 Codex Spark vs Sonnet 4.6
GPT-5.4 Mini vs GPT-5.5
GPT-5.4 Mini vs GPT-5.6 Sol
GPT-5.4 vs GPT-5.4 Mini
GPT-5.6 Luna vs GPT-5.4 Mini
GPT-5.6 Terra vs GPT-5.4 Mini
Grok 4.5 vs GPT-5.4 Mini
Grok 4.5 vs Sonnet 4.6
Grok Composer 2.5 Fast vs GPT-5.4 Mini
Grok Composer 2.5 Fast vs Sonnet 4.6
Haiku 4.5 vs GPT-5.4 Mini
Kimi K3 vs GPT-5.4 Mini
Kimi K3 vs Sonnet 4.6
Opus 4.8 vs GPT-5.4 Mini
Sonnet 4.6 vs Fable 5
Sonnet 4.6 vs GLM 5.2
Sonnet 4.6 vs GPT-5.4
Sonnet 4.6 vs GPT-5.5
Sonnet 4.6 vs GPT-5.6 Luna
Sonnet 4.6 vs GPT-5.6 Sol
Sonnet 4.6 vs GPT-5.6 Terra
Sonnet 4.6 vs Haiku 4.5
Sonnet 4.6 vs Opus 4.8
Sonnet 4.6 vs Sonnet 5
Sonnet 5 vs GPT-5.4 Mini