duelo direto

Grok 4.5 vs GPT-5.6 Terra

Placar 8×1 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 8 × 1 Grok 4.5 × GPT-5.6 Terra
Custo da bateria $1,40 vs $6,22 soma dos runs medidos
Vencedor geral Grok 4.5 score do ranking cego
Teste Grok 4.5 GPT-5.6 Terra Vencedor
001 3D interativo Defeitos $0,20 · 1m 35s · score 0,73 Entregou $1,65 · 23m 53s · score 0,73 Grok 4.5
002 clone de site Entregou $0,18 · 1m 42s · score 0,98 Entregou $0,91 · 17m 54s · score 0,77 Grok 4.5
003 física/canvas Entregou $0,20 · 1m 11s · score 0,97 Entregou $0,63 · 13m 42s · score 0,73 Grok 4.5
004 jogo 3D Entregou $0,20 · 1m 31s · score 0,99 Defeitos $2,43 · 30m 51s · score 0,43 Grok 4.5
101 debug Entregou $0,10 · 12s · score 0,91 Entregou $0,04 · 19s · score 0,94 GPT-5.6 Terra
103 feature em código existente Entregou $0,09 · 17s · score 0,95 Entregou $0,07 · 34s · score 0,94 Grok 4.5
104 CSS responsivo Entregou $0,10 · 24s · score 0,98 Defeitos $0,09 · 44s · score 0,72 Grok 4.5
105 code review Entregou $0,11 · 1m 0s · score 0,93 Entregou $0,13 · 1m 26s · score 0,90 Grok 4.5
108 dados Entregou $0,24 · 46s · score 0,93 Entregou $0,27 · 2m 9s · score 0,88 Grok 4.5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Grok 4.5 leva

  • Tarefas criativas (3D, clone de site, física/canvas, jogos): entrega funcionais com scores 0.97–0.99, custo 5–10x menor e velocidade 10–20x superior
  • Tarefas de engenharia (feature, CSS, code review): score consistentemente acima de 0.93 com tempo de resposta 2–3s
  • Economia geral: bateria completa por $1.40 contra $6.22 do rival, mesmo com desempenho igual ou superior

Onde GPT-5.6 Terra leva

  • Debug (teste 101): score 0.94 vs 0.91, embora Grok seja mais rápido (12s vs 19s)
  • Tarefas visuais com defeitos: em 3D interativo, entrega algo (0.73 score) onde Grok tem "defeitos", mas ambos ficam abaixo do ideal

Qual escolher

Grok 4.5 é a escolha padrão: custeia metade do preço, roda 5–10x mais rápido e entrega qualidade igual ou melhor em 89% dos testes. Considere GPT-5.6 Terra só se debug for crítico e a diferença de 3 pontos percentuais justificar 4x o custo.

Outros duelos