duelo direto

Kimi K3 vs Grok 4.5

Placar 2×7 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 2 × 7 Kimi K3 × Grok 4.5
Custo da bateria $3,43 vs $1,40 soma dos runs medidos
Vencedor geral Grok 4.5 score do ranking cego
Teste Kimi K3 Grok 4.5 Vencedor
001 3D interativo Entregou $0,64 · 4m 14s · score 0,93 Defeitos $0,20 · 1m 35s · score 0,73 Kimi K3
002 clone de site Entregou $0,44 · 2m 42s · score 0,95 Entregou $0,18 · 1m 42s · score 0,98 Grok 4.5
003 física/canvas Entregou $0,13 · 30s · score 0,98 Entregou $0,20 · 1m 11s · score 0,97 Kimi K3
004 jogo 3D Defeitos $1,19 · 13m 50s · score 0,60 Entregou $0,20 · 1m 31s · score 0,99 Grok 4.5
101 debug Entregou $0,07 · 45s · score 0,85 Entregou $0,10 · 12s · score 0,91 Grok 4.5
103 feature em código existente Entregou $0,18 · 3m 0s · score 0,66 Entregou $0,09 · 17s · score 0,95 Grok 4.5
104 CSS responsivo Entregou $0,20 · 3m 57s · score 0,87 Entregou $0,10 · 24s · score 0,98 Grok 4.5
105 code review Entregou $0,18 · 4m 16s · score 0,73 Entregou $0,11 · 1m 0s · score 0,93 Grok 4.5
108 dados Entregou $0,41 · 7m 13s · score 0,68 Entregou $0,24 · 46s · score 0,93 Grok 4.5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Kimi K3 leva

  • 3D interativo (0.93 vs 0.73): única entrega limpa do duelo nesse teste — Grok saiu com ⚠️ e score bem abaixo, apesar de ser 2.7x mais rápido e 3x mais barato
  • Física/canvas (0.98 vs 0.97): vitória por fio de score, com vantagem clara de tempo e custo (30s / $0.13 vs 71s / $0.20)

Onde Grok 4.5 leva

  • Clone de site (0.98 vs 0.95): ambos ✅, mas Grok fecha mais barato e mais rápido ($0.18 / 102s vs $0.44 / 162s)
  • Jogo 3D (0.99 vs 0.60): o contraste mais duro da bateria — entrega limpa em 91s por $0.20 contra ⚠️ do Kimi em 830s e $1.19
  • Debug (0.91 vs 0.85): score maior e 3.8x mais rápido (12s vs 45s), com custo quase no mesmo patamar
  • Feature em código existente (0.95 vs 0.66): salto grande de qualidade e 10x mais rápido (17s vs 180s), pela metade do preço
  • CSS responsivo (0.98 vs 0.87): score superior em ~10x menos tempo (24s vs 237s) e metade do custo
  • Code review (0.93 vs 0.73): análise melhor pontuada em 60s vs 256s, ainda mais barata
  • Dados (0.93 vs 0.68): vitória clara de score com 9x menos tempo (46s vs 433s) e ~40% menos custo

Leitura

Grok 4.5 vence o placar por 7 a 2 e o ranking geral (#2 / 0.9283 vs #9 / 0.807), com bateria ~2.5x mais barata ($1.40 vs $3.43) e lista de preço mais enxuta ($2.0/$6.0 vs $3/$15 por MTok). O Kimi só se destaca onde a entrega 3D interativa precisa fechar limpa e, de forma apertada, em física/canvas; no restante — sobretudo jogo 3D, feature, CSS, review e dados — o Grok combina score mais alto com latência e custo bem menores. Pelos números, Grok 4.5 é a escolha dominante do duelo; Kimi K3 entra só se o caso de uso for o nicho em que ele pontuou acima.

Outros duelos