duelo direto

GPT-5.6 Sol vs GPT-5.5

Placar 4×5 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 4 × 5 GPT-5.6 Sol × GPT-5.5
Custo da bateria $14,50 vs $13,40 soma dos runs medidos
Vencedor geral GPT-5.5 score do ranking cego
Teste GPT-5.6 Sol GPT-5.5 Vencedor
001 3D interativo Defeitos $4,02 · 21m 42s · score 0,34 Defeitos $3,29 · 17m 35s · score 0,42 GPT-5.5
002 clone de site Entregou $3,99 · 25m 26s · score 0,50 Defeitos $1,15 · 7m 25s · score 0,61 GPT-5.5
003 física/canvas Entregou $2,12 · 17m 21s · score 0,50 Entregou $0,79 · 5m 17s · score 0,83 GPT-5.5
004 jogo 3D Defeitos $3,15 · 34m 12s · score 0,37 Entregou $6,13 · 16m 36s · score 0,63 GPT-5.5
101 debug Entregou $0,08 · 18s · score 0,91 Defeitos $0,17 · 1m 6s · score 0,46 GPT-5.6 Sol
103 feature em código existente Entregou $0,11 · 34s · score 0,91 Entregou $0,20 · 1m 10s · score 0,81 GPT-5.6 Sol
104 CSS responsivo Defeitos $0,18 · 48s · score 0,70 Defeitos $0,77 · 3m 38s · score 0,52 GPT-5.6 Sol
105 code review Entregou $0,30 · 2m 18s · score 0,79 Entregou $0,30 · 2m 5s · score 0,80 GPT-5.5
108 dados Entregou $0,56 · 2m 40s · score 0,77 Entregou $0,59 · 3m 33s · score 0,73 GPT-5.6 Sol

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde GPT-5.6 Sol leva

  • Debug e code: Sol atua muito mais rápido e com scores superiores (0.88–0.91 vs 0.46–0.72)
  • CSS responsivo: Sol acerta (0.70) onde GPT-5.5 falha (0.52)
  • Dados: Sol supera ligeiramente (0.77 vs 0.73)

Onde GPT-5.5 leva

  • Tarefas visuais e interativas (3D, clone, física, jogo): GPT-5.5 entrega de 0.61–0.83 vs Sol 0.34–0.50 (muitos defeitos)
  • O custo é praticamente idêntico ($14.50 vs $13.40), então não há vantagem orçamentária aqui

Qual escolher

Comparação fraca: ambos são caros e medíocres. Se forçado a escolher entre esses dois, Sol vence no ranking (0.6398 vs 0.6354), mas nenhum dos dois é recomendação — use Fable 5, GPT-5.4 ou Mini em vez disso.

Outros duelos