duelo direto

Grok 4.5 vs GPT-5.5

Placar 9×0 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 9 × 0 Grok 4.5 × GPT-5.5
Custo da bateria $1,40 vs $13,40 soma dos runs medidos
Vencedor geral Grok 4.5 score do ranking cego
Teste Grok 4.5 GPT-5.5 Vencedor
001 3D interativo Defeitos $0,20 · 1m 35s · score 0,73 Defeitos $3,29 · 17m 35s · score 0,42 Grok 4.5
002 clone de site Entregou $0,18 · 1m 42s · score 0,98 Defeitos $1,15 · 7m 25s · score 0,61 Grok 4.5
003 física/canvas Entregou $0,20 · 1m 11s · score 0,97 Entregou $0,79 · 5m 17s · score 0,83 Grok 4.5
004 jogo 3D Entregou $0,20 · 1m 31s · score 0,99 Entregou $6,13 · 16m 36s · score 0,63 Grok 4.5
101 debug Entregou $0,10 · 12s · score 0,91 Defeitos $0,17 · 1m 6s · score 0,46 Grok 4.5
103 feature em código existente Entregou $0,09 · 17s · score 0,95 Entregou $0,20 · 1m 10s · score 0,81 Grok 4.5
104 CSS responsivo Entregou $0,10 · 24s · score 0,98 Defeitos $0,77 · 3m 38s · score 0,52 Grok 4.5
105 code review Entregou $0,11 · 1m 0s · score 0,93 Entregou $0,30 · 2m 5s · score 0,80 Grok 4.5
108 dados Entregou $0,24 · 46s · score 0,93 Entregou $0,59 · 3m 33s · score 0,73 Grok 4.5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Grok 4.5 leva

  • Todos os 9 testes: vitória clara em score (+0.31 a +0.48 média) e velocidade (10–20x mais rápido)
  • Jogo 3D (teste 004): Grok 0.99 em $0.20/91s vs 5-5 0.63 em $6.13/996s
  • Custo total: Grok $1.40 vs 5-5 $13.40 (9.5x mais barato) com qualidade superior

Onde GPT-5.5 leva

  • Nenhum teste vencido; 5-5 é o modelo mais custoso e lento desta bateria

Qual escolher

Grok 4.5 é a única resposta racional: vence todos os 9 testes, custa 9.5x menos e é 10–20x mais rápido. GPT-5.5 é um modelo não-competitivo neste cenário; seu custo elevado não se traduz em qualidade.

Outros duelos