duelo direto

Grok 4.5 vs GPT-5.3 Codex Spark

Placar 2×6 em 8 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 2 × 6 Grok 4.5 × GPT-5.3 Codex Spark
Custo da bateria $1,40 vs $0,95 soma dos runs medidos
Vencedor geral Grok 4.5 score do ranking cego
Teste Grok 4.5 GPT-5.3 Codex Spark Vencedor
001 3D interativo Defeitos $0,20 · 1m 35s · score 0,73 Quebrou $0,20 · 19s · score 0,49 Grok 4.5
002 clone de site Entregou $0,18 · 1m 42s · score 0,98 Entregou $0,19 · 19s · score 0,99 GPT-5.3 Codex Spark
003 física/canvas Entregou $0,20 · 1m 11s · score 0,97 Entregou $0,17 · 18s · score 0,98 GPT-5.3 Codex Spark
004 jogo 3D Entregou $0,20 · 1m 31s · score 0,99
101 debug Entregou $0,10 · 12s · score 0,91 Defeitos $0,04 · 7s · score 0,71 Grok 4.5
103 feature em código existente Entregou $0,09 · 17s · score 0,95 Entregou $0,06 · 9s · score 0,98 GPT-5.3 Codex Spark
104 CSS responsivo Entregou $0,10 · 24s · score 0,98 Entregou $0,05 · 9s · score 0,99 GPT-5.3 Codex Spark
105 code review Entregou $0,11 · 1m 0s · score 0,93 Entregou $0,08 · 11s · score 0,98 GPT-5.3 Codex Spark
108 dados Entregou $0,24 · 46s · score 0,93 Entregou $0,16 · 18s · score 0,97 GPT-5.3 Codex Spark

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Grok 4.5 leva

  • 3D interativo (001): entrega algo funcional com score 0.73 contra falha total do Codex (0.49).
  • Jogo 3D (004): entrega completa (0.986) enquanto Codex não entrega, derrota automática.
  • Debug (101): score 0.91 vs defeitos do Codex (0.71), mostrando robustez em refatoração.

Onde GPT-5.3 Codex Spark leva

  • Clone de site (002): score 0.99 vs 0.98, praticamente empatado mas Spark 19s vs 102s do Grok.
  • Física/Canvas (003): score 0.98 vs 0.97, praticamente empatado mas 18s vs 71s.
  • Features, CSS, code review, dados: domina em velocidade (5–18s vs 60–240s) e scores ligeiramente superiores, exceto dados onde ambos entregam bem.

Qual escolher

Grok 4.5 se você precisa de garantia: não falha em tarefas 3D/jogo mesmo que com defeitos, cumpre deadlines criticos e mais confiável em contexto complexo. Codex Spark para tarefas simples e rápidas (CSS, features, reviews): 10x mais rápido, custo 33% menor, suficiente para manutenção e refator — não use em codegen visual ou de lógica pesada.

Outros duelos