duelo direto

Kimi K3 vs GPT-5.4 Mini

Placar 6×3 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 6 × 3 Kimi K3 × GPT-5.4 Mini
Custo da bateria $3,43 vs $1,23 soma dos runs medidos
Vencedor geral Kimi K3 score do ranking cego
Teste Kimi K3 GPT-5.4 Mini Vencedor
001 3D interativo Entregou $0,64 · 4m 14s · score 0,93 Entregou $0,38 · 34m 24s · score 0,73 Kimi K3
002 clone de site Entregou $0,44 · 2m 42s · score 0,95 Entregou $0,22 · 22m 4s · score 0,77 Kimi K3
003 física/canvas Entregou $0,13 · 30s · score 0,98 Entregou $0,16 · 6m 30s · score 0,89 Kimi K3
004 jogo 3D Defeitos $1,19 · 13m 50s · score 0,60 Quebrou $0,03 · 31m 4s · score 0,27 Kimi K3
101 debug Entregou $0,07 · 45s · score 0,85 Defeitos $0,03 · 1m 45s · score 0,48 Kimi K3
103 feature em código existente Entregou $0,18 · 3m 0s · score 0,66 Entregou $0,05 · 1m 33s · score 0,86 GPT-5.4 Mini
104 CSS responsivo Entregou $0,20 · 3m 57s · score 0,87 Entregou $0,11 · 4m 50s · score 0,87 Kimi K3
105 code review Entregou $0,18 · 4m 16s · score 0,73 Entregou $0,09 · 3m 40s · score 0,80 GPT-5.4 Mini
108 dados Entregou $0,41 · 7m 13s · score 0,68 Entregou $0,17 · 7m 17s · score 0,75 GPT-5.4 Mini

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Kimi K3 leva

  • 3D interativo (0.93 vs 0.73): score bem mais alto e 8x mais rápido (254s vs 2064s) — o Mini barateia ($0.38 vs $0.64) mas demora demais
  • Clone de site (0.95 vs 0.77): entrega superior em 162s contra 1324s do Mini
  • Física/canvas (0.98 vs 0.89): quase perfeito em 30s; o Mini leva 390s e ainda custa um pouco mais ($0.16 vs $0.13)
  • Jogo 3D (0.60 vs 0.27): único dos dois que não quebrou — ⚠️ com score 0.60 contra ❌ do Mini (0.27 em 1864s)
  • Debug (0.85 vs 0.48): caça-bug limpo em 45s; o Mini ficou em ⚠️ com score 0.48
  • CSS responsivo (0.87 vs 0.87): empate de score; o K3 fecha em 237s contra 290s do Mini

Onde GPT-5.4 Mini leva

  • Feature em código existente (0.86 vs 0.66): score bem acima, metade do tempo (93s vs 180s) e quase 4x mais barato ($0.05 vs $0.18)
  • Code review (0.80 vs 0.73): análise melhor pontuada, mais rápida (220s vs 256s) e pela metade do preço ($0.09 vs $0.18)
  • Dados (0.75 vs 0.68): score superior com custo bem menor ($0.17 vs $0.41) e tempo praticamente igual (437s vs 433s)

Leitura

O K3 vence o duelo de qualidade (6×3, ranking 0.8070 vs 0.7139), mas a bateria inteira do Mini sai por $1.23 contra $3.43 do K3 — token de lista bem mais barato ($0.75/$4.5 vs $3/$15 por MTok). O desconto, porém, vem com latência pesada: no 001 o Mini leva 2064s (contra 254s do K3) e no 004 simplesmente quebra (❌ · 0.27), enquanto o K3 ao menos entrega com defeitos (⚠️ · 0.60). O Mini brilha em tarefas de código existente — feature, review e dados — onde é mais barato e pontua melhor. Para 3D, clone, física e debug, o K3 é o operário que entrega e termina em tempo decente.

Outros duelos