duelo direto

Sonnet 4.6 vs GPT-5.4 Mini

Placar 8×1 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 8 × 1 Sonnet 4.6 × GPT-5.4 Mini
Custo da bateria $3,49 vs $1,23 soma dos runs medidos
Vencedor geral Sonnet 4.6 score do ranking cego
Teste Sonnet 4.6 GPT-5.4 Mini Vencedor
001 3D interativo Entregou $0,69 · 9m 11s · score 0,89 Entregou $0,38 · 34m 24s · score 0,73 Sonnet 4.6
002 clone de site Entregou $0,92 · 8m 48s · score 0,86 Entregou $0,22 · 22m 4s · score 0,77 Sonnet 4.6
003 física/canvas Entregou $0,13 · 1m 2s · score 0,98 Entregou $0,16 · 6m 30s · score 0,89 Sonnet 4.6
004 jogo 3D Defeitos $0,82 · 8m 11s · score 0,66 Quebrou $0,03 · 31m 4s · score 0,27 Sonnet 4.6
101 debug Entregou $0,12 · 33s · score 0,84 Defeitos $0,03 · 1m 45s · score 0,48 Sonnet 4.6
103 feature em código existente Entregou $0,11 · 42s · score 0,90 Entregou $0,05 · 1m 33s · score 0,86 Sonnet 4.6
104 CSS responsivo Defeitos $0,10 · 41s · score 0,72 Entregou $0,11 · 4m 50s · score 0,87 GPT-5.4 Mini
105 code review Entregou $0,18 · 2m 0s · score 0,85 Entregou $0,09 · 3m 40s · score 0,80 Sonnet 4.6
108 dados Entregou $0,42 · 2m 3s · score 0,83 Entregou $0,17 · 7m 17s · score 0,75 Sonnet 4.6

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Sonnet 4.6 leva

  • Complexidade 3D e física (001, 003): scores máximos (0.89–0.98) contra 0.73–0.89, com velocidade 3.7–6.3x superior — 551s vs 2064s no interativo, 62s vs 390s na física.
  • Confiabilidade em falhas (004, 101): GPT quebra completamente em jogo 3D (0.27) e tem defeitos em debug (0.48); Sonnet entrega algo utilizável mesmo com defeitos (0.66, 0.84).
  • Consistência geral (002, 103, 105, 108): vence em 5 de 6 testes restantes com scores 0.83–0.86, mantendo velocidade 2–2.5x melhor.

Onde GPT-5.4 Mini leva

  • CSS responsivo (104): único vencedor com 0.87 vs defeitos do Sonnet (0.72) — o único teste onde GPT entrega clean sem compromissos.

Qual escolher

Sonnet 4.6 para produção: domina 88.9% dos testes, especialmente em tarefas complexas que quebram outros modelos (3D, physics, debug). Custo 2.8x maior ($3.49 vs $1.23) é compensado por confiabilidade. GPT-5.4 Mini só se orçamento for crítico e a carga for CSS/styling — caso contrário, o risco de falhas custosas (jogo 3D quebrou, debug deficiente) inviabiliza economizar $2.25 por bateria.

Outros duelos