duelo direto

Grok 4.5 vs GPT-5.6 Luna

Placar 7×2 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 7 × 2 Grok 4.5 × GPT-5.6 Luna
Custo da bateria $1,40 vs $1,20 soma dos runs medidos
Vencedor geral Grok 4.5 score do ranking cego
Teste Grok 4.5 GPT-5.6 Luna Vencedor
001 3D interativo Defeitos $0,20 · 1m 35s · score 0,73 Entregou $0,31 · 10m 32s · score 0,91 GPT-5.6 Luna
002 clone de site Entregou $0,18 · 1m 42s · score 0,98 Defeitos $0,22 · 6m 38s · score 0,68 Grok 4.5
003 física/canvas Entregou $0,20 · 1m 11s · score 0,97 Entregou $0,13 · 4m 55s · score 0,92 Grok 4.5
004 jogo 3D Entregou $0,20 · 1m 31s · score 0,99 Defeitos $0,25 · 9m 10s · score 0,68 Grok 4.5
101 debug Entregou $0,10 · 12s · score 0,91 Entregou $0,02 · 30s · score 0,92 GPT-5.6 Luna
103 feature em código existente Entregou $0,09 · 17s · score 0,95 Entregou $0,03 · 44s · score 0,94 Grok 4.5
104 CSS responsivo Entregou $0,10 · 24s · score 0,98 Defeitos $0,04 · 57s · score 0,73 Grok 4.5
105 code review Entregou $0,11 · 1m 0s · score 0,93 Entregou $0,09 · 2m 25s · score 0,86 Grok 4.5
108 dados Entregou $0,24 · 46s · score 0,93 Entregou $0,11 · 3m 10s · score 0,90 Grok 4.5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Grok 4.5 leva

  • 7 dos 9 testes: clone de site, física/canvas, jogo 3D, features, CSS, code review e dados.
  • Velocidade consistente: 12–102s vs 30–632s do Luna, com scores superiores ou iguais.
  • Custo: praticamente igual ($1.402 vs $1.202, diferença marginal).

Onde GPT-5.6 Luna leva

  • 3D interativo (001): score 0.91 vs 0.73, mas leva 632s (mais de 10 minutos).
  • Debug (101): score 0.92 vs 0.91, praticamente empate.

Qual escolher

Grok 4.5 — custo quase idêntico mas 5–10x mais rápido em tudo que importa (clone, física, games, dados). Luna parece ganhar em 3D interativo mas leva 632s enquanto Grok entrega em 95s; o trade-off não compensa. Escolha clara para velocidade + consistência.

Outros duelos