duelo direto

Grok 4.5 vs GPT-5.6 Sol

Placar 8×1 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 8 × 1 Grok 4.5 × GPT-5.6 Sol
Custo da bateria $1,40 vs $14,50 soma dos runs medidos
Vencedor geral Grok 4.5 score do ranking cego
Teste Grok 4.5 GPT-5.6 Sol Vencedor
001 3D interativo Defeitos $0,20 · 1m 35s · score 0,73 Defeitos $4,02 · 21m 42s · score 0,34 Grok 4.5
002 clone de site Entregou $0,18 · 1m 42s · score 0,98 Entregou $3,99 · 25m 26s · score 0,50 Grok 4.5
003 física/canvas Entregou $0,20 · 1m 11s · score 0,97 Entregou $2,12 · 17m 21s · score 0,50 Grok 4.5
004 jogo 3D Entregou $0,20 · 1m 31s · score 0,99 Defeitos $3,15 · 34m 12s · score 0,37 Grok 4.5
101 debug Entregou $0,10 · 12s · score 0,91 Entregou $0,08 · 18s · score 0,91 GPT-5.6 Sol
103 feature em código existente Entregou $0,09 · 17s · score 0,95 Entregou $0,11 · 34s · score 0,91 Grok 4.5
104 CSS responsivo Entregou $0,10 · 24s · score 0,98 Defeitos $0,18 · 48s · score 0,70 Grok 4.5
105 code review Entregou $0,11 · 1m 0s · score 0,93 Entregou $0,30 · 2m 18s · score 0,79 Grok 4.5
108 dados Entregou $0,24 · 46s · score 0,93 Entregou $0,56 · 2m 40s · score 0,77 Grok 4.5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Grok 4.5 leva

  • Tarefas criativas (clone, física, jogo 3D): Grok 0.97–0.99 em <102s vs Sol defeituoso/lento (0.34–0.50 em 1041–2052s)
  • Custo absoluto: Grok $1.40 vs Sol $14.50 (10.3x mais barato)
  • Engenharia (feature, CSS, code review): Grok 0.93–0.98 em <60s vs Sol 0.70–0.88 em 34–138s

Onde GPT-5.6 Sol leva

  • Debug (teste 101): Sol 0.91 em 18s vs Grok 0.91 em 12s (técnico: scores iguais, Sol ligeiramente mais lento, ambos entregam)

Qual escolher

Grok 4.5 é a escolha inequívoca: vence 8 de 9, custa 10x menos e é 10–20x mais rápido. Sol é uma anomalia cara; única vantagem teórica é parity em debug, mas Grok chega lá 6s antes por $0.02 menos.

Outros duelos