duelo direto

Opus 4.8 vs GPT-5.5

Placar 7×2 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 7 × 2 Opus 4.8 × GPT-5.5
Custo da bateria $3,86 vs $13,40 soma dos runs medidos
Vencedor geral Opus 4.8 score do ranking cego
Teste Opus 4.8 GPT-5.5 Vencedor
001 3D interativo Defeitos $0,48 · 2m 20s · score 0,71 Defeitos $3,29 · 17m 35s · score 0,42 Opus 4.8
002 clone de site Entregou $0,67 · 3m 2s · score 0,93 Defeitos $1,15 · 7m 25s · score 0,61 Opus 4.8
003 física/canvas Entregou $0,29 · 1m 27s · score 0,95 Entregou $0,79 · 5m 17s · score 0,83 Opus 4.8
004 jogo 3D Defeitos $0,59 · 3m 6s · score 0,71 Entregou $6,13 · 16m 36s · score 0,63 Opus 4.8
101 debug Entregou $0,30 · 41s · score 0,67 Defeitos $0,17 · 1m 6s · score 0,46 Opus 4.8
103 feature em código existente Entregou $0,20 · 50s · score 0,84 Entregou $0,20 · 1m 10s · score 0,81 Opus 4.8
104 CSS responsivo Entregou $0,25 · 1m 15s · score 0,93 Defeitos $0,77 · 3m 38s · score 0,52 Opus 4.8
105 code review Entregou $0,34 · 2m 10s · score 0,78 Entregou $0,30 · 2m 5s · score 0,80 GPT-5.5
108 dados Entregou $0,75 · 3m 36s · score 0,68 Entregou $0,59 · 3m 33s · score 0,73 GPT-5.5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Opus 4.8 leva

  • Clone de site (0.93 vs 0.61): Opus entrega pleno, GPT-5.5 falha completamente
  • Física/Canvas (0.95 vs 0.83): 12% superior mesmo com GPT-5.5 passando
  • 3D interativo (0.71 vs 0.42): ambos frágeis, Opus 70% melhor
  • Jogo 3D: Opus defeito (0.71) vs GPT-5.5 entrega porém score 0.63 — Opus leva
  • Debug (0.67 vs 0.46): diagnosis 45% superior
  • Feature em código (0.78 vs 0.72): refinamento consistente, mesma faixa de custo
  • CSS responsivo (0.93 vs 0.52): estilos onde GPT-5.5 desaba

Onde GPT-5.5 leva

  • Code review (0.80 vs 0.78): margem infinitesimal (0.02 pontos)
  • Dados (0.73 vs 0.68): score 7% melhor, custo igual, velocidade similar

Qual escolher

Opus 4.8 domina 7/9 testes com vantagem clara. GPT-5.5 só vence em análise marginal (review, dados) com diferenças de ~0.05 pontos — não justifica custo 247% maior ($13.40 vs $3.86). Use Opus para qualquer projeto que exija confiabilidade; GPT-5.5 é economia pura e cara.

Outros duelos