duelo direto

Kimi K3 vs GPT-5.4

Placar 5×4 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 5 × 4 Kimi K3 × GPT-5.4
Custo da bateria $3,43 vs $3,64 soma dos runs medidos
Vencedor geral Kimi K3 score do ranking cego
Teste Kimi K3 GPT-5.4 Vencedor
001 3D interativo Entregou $0,64 · 4m 14s · score 0,93 Entregou $0,98 · 10m 45s · score 0,86 Kimi K3
002 clone de site Entregou $0,44 · 2m 42s · score 0,95 Defeitos $0,32 · 4m 20s · score 0,69 Kimi K3
003 física/canvas Entregou $0,13 · 30s · score 0,98 Entregou $0,30 · 3m 20s · score 0,92 Kimi K3
004 jogo 3D Defeitos $1,19 · 13m 50s · score 0,60 Entregou $0,77 · 8m 55s · score 0,91 GPT-5.4
101 debug Entregou $0,07 · 45s · score 0,85 Defeitos $0,11 · 1m 8s · score 0,51 Kimi K3
103 feature em código existente Entregou $0,18 · 3m 0s · score 0,66 Entregou $0,10 · 1m 2s · score 0,88 GPT-5.4
104 CSS responsivo Entregou $0,20 · 3m 57s · score 0,87 Defeitos $0,43 · 4m 10s · score 0,57 Kimi K3
105 code review Entregou $0,18 · 4m 16s · score 0,73 Entregou $0,13 · 3m 35s · score 0,78 GPT-5.4
108 dados Entregou $0,41 · 7m 13s · score 0,68 Entregou $0,51 · 5m 11s · score 0,71 GPT-5.4

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Kimi K3 leva

  • 3D interativo (0.93 vs 0.86): entrega limpa e 2.5x mais rápida (254s vs 645s), com 35% menos custo ($0.64 vs $0.98)
  • Clone de site (0.95 vs 0.69): único dos dois com ✅ — o GPT-5.4 saiu com ⚠️ e score bem abaixo, apesar de ser um pouco mais barato
  • Física/canvas (0.98 vs 0.92): quase perfeito em 30s por $0.13 — 6.7x mais rápido e 2.3x mais barato
  • Debug (0.85 vs 0.51): caça-bug limpa por $0.07; o GPT-5.4 ficou em ⚠️ com score 0.51
  • CSS responsivo (0.87 vs 0.57): ✅ sólido contra ⚠️ do GPT-5.4, por menos da metade do preço ($0.20 vs $0.43)

Onde GPT-5.4 leva

  • Jogo 3D (0.91 vs 0.60): o teste mais pesado inverteu o placar — ✅ em 535s por $0.77 contra ⚠️ do K3 (830s, $1.19, score 0.60)
  • Feature em código existente (0.88 vs 0.66): 3x mais rápido (62s vs 180s) e quase metade do custo ($0.10 vs $0.18)
  • Code review (0.78 vs 0.73): score um pouco melhor, mais barato ($0.13 vs $0.18) e um pouco mais rápido
  • Dados (0.71 vs 0.68): vantagem estreita de score, com tempo melhor (311s vs 433s)

Leitura

O Kimi K3 fecha a bateria na frente no ranking (#9 vs #15) e no placar (5×4), com custo total quase empatado e ligeiramente favorável ($3.43 vs $3.64). O padrão é claro: em greenfield visual e diagnóstico — 3D interativo, clone, física/canvas, debug, CSS — o K3 entrega score alto com ✅ e, em vários casos, velocidade bem maior. O GPT-5.4 reage onde o trabalho exige profundidade em código vivo ou no teste 3D mais pesado (jogo 3D, feature em base existente, review, dados), e no 004 a diferença é gritante (0.91 vs 0.60). No preço de lista o GPT-5.4 é um pouco mais barato no input ($2.5 vs $3 por MTok), mas na bateria o K3 saiu um pouco mais econômico e com melhor qualidade média — vantagem de volume no dia a dia, com o GPT-5.4 ainda preferível quando o gargalo é jogo 3D ou mexer fino em codebase já existente.

Outros duelos