duelo direto

Sonnet 4.6 vs GPT-5.6 Luna

Placar 2×7 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 2 × 7 Sonnet 4.6 × GPT-5.6 Luna
Custo da bateria $3,49 vs $1,20 soma dos runs medidos
Vencedor geral Sonnet 4.6 score do ranking cego
Teste Sonnet 4.6 GPT-5.6 Luna Vencedor
001 3D interativo Entregou $0,69 · 9m 11s · score 0,89 Entregou $0,31 · 10m 32s · score 0,91 GPT-5.6 Luna
002 clone de site Entregou $0,92 · 8m 48s · score 0,86 Defeitos $0,22 · 6m 38s · score 0,68 Sonnet 4.6
003 física/canvas Entregou $0,13 · 1m 2s · score 0,98 Entregou $0,13 · 4m 55s · score 0,92 Sonnet 4.6
004 jogo 3D Defeitos $0,82 · 8m 11s · score 0,66 Defeitos $0,25 · 9m 10s · score 0,68 GPT-5.6 Luna
101 debug Entregou $0,12 · 33s · score 0,84 Entregou $0,02 · 30s · score 0,92 GPT-5.6 Luna
103 feature em código existente Entregou $0,11 · 42s · score 0,90 Entregou $0,03 · 44s · score 0,94 GPT-5.6 Luna
104 CSS responsivo Defeitos $0,10 · 41s · score 0,72 Defeitos $0,04 · 57s · score 0,73 GPT-5.6 Luna
105 code review Entregou $0,18 · 2m 0s · score 0,85 Entregou $0,09 · 2m 25s · score 0,86 GPT-5.6 Luna
108 dados Entregou $0,42 · 2m 3s · score 0,83 Entregou $0,11 · 3m 10s · score 0,90 GPT-5.6 Luna

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Sonnet 4.6 leva

  • Clone de site: quality superior (0.86 vs 0.68 defeitos) apesar de custo 4x maior ($0.92 vs $0.22), garantindo entrega robusta onde Luna falha
  • Física/canvas: score marginal superior (0.98 vs 0.92) com tempo similar (62s vs 295s para ambos), mostrando precisão melhor em simulações

Onde GPT-5.6 Luna leva

  • Eficiência de custo: 7 vitórias com orçamento 65% menor ($1.20 vs $3.49), dominando 3D interativo (0.91 vs 0.89), debug (0.92 vs 0.84), feature em código (0.89 vs 0.85) e dados (0.90 vs 0.83)
  • Velocidade em debug e feature: 10-14x mais rápido em debug ($0.02 vs $0.12, 30s vs 33s) e feature ($0.03 vs $0.11, 44s vs 42s), reduzindo atrito iterativo

Qual escolher

Sonnet 4.6 vence no ranking, mas GPT-5.6 Luna é vencedora prática: mesmo score geral (0.8312 vs 0.8305), custa 65% menos ($1.20 vs $3.49) e vence 7 de 9 testes. Use Sonnet 4.6 apenas para clone de site crítico—em todos outros contextos, Luna entrega mais valor.

Outros duelos