duelo direto

Kimi K3 vs GPT-5.5

Placar 5×4 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 5 × 4 Kimi K3 × GPT-5.5
Custo da bateria $3,43 vs $13,40 soma dos runs medidos
Vencedor geral Kimi K3 score do ranking cego
Teste Kimi K3 GPT-5.5 Vencedor
001 3D interativo Entregou $0,64 · 4m 14s · score 0,93 Defeitos $3,29 · 17m 35s · score 0,42 Kimi K3
002 clone de site Entregou $0,44 · 2m 42s · score 0,95 Defeitos $1,15 · 7m 25s · score 0,61 Kimi K3
003 física/canvas Entregou $0,13 · 30s · score 0,98 Entregou $0,79 · 5m 17s · score 0,83 Kimi K3
004 jogo 3D Defeitos $1,19 · 13m 50s · score 0,60 Entregou $6,13 · 16m 36s · score 0,63 GPT-5.5
101 debug Entregou $0,07 · 45s · score 0,85 Defeitos $0,17 · 1m 6s · score 0,46 Kimi K3
103 feature em código existente Entregou $0,18 · 3m 0s · score 0,66 Entregou $0,20 · 1m 10s · score 0,81 GPT-5.5
104 CSS responsivo Entregou $0,20 · 3m 57s · score 0,87 Defeitos $0,77 · 3m 38s · score 0,52 Kimi K3
105 code review Entregou $0,18 · 4m 16s · score 0,73 Entregou $0,30 · 2m 5s · score 0,80 GPT-5.5
108 dados Entregou $0,41 · 7m 13s · score 0,68 Entregou $0,59 · 3m 33s · score 0,73 GPT-5.5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Kimi K3 leva

  • 3D interativo (0.93 vs 0.42): entrega limpa por $0.64 em 254s — o GPT-5.5 ficou em ⚠️, $3.29 e 1055s
  • Clone de site (0.95 vs 0.61): ✅ completo e 2.6x mais barato ($0.44 vs $1.15), enquanto o GPT-5.5 saiu com defeitos
  • Física/canvas (0.98 vs 0.83): 10.5x mais rápido (30s vs 317s) e 6x mais barato ($0.13 vs $0.79)
  • Debug (0.85 vs 0.46): caça-bug por $0.07 em 45s — o GPT-5.5 marcou ⚠️ a $0.17
  • CSS responsivo (0.87 vs 0.52): ✅ estável por $0.20 contra ⚠️ do GPT-5.5 a $0.77

Onde GPT-5.5 leva

  • Jogo 3D (0.63 vs 0.60): vitória apertada de score com entrega ✅, mas a $6.13 e 996s — o K3 ficou em ⚠️ a $1.19
  • Feature em código existente (0.81 vs 0.66): mais rápido (70s vs 180s) e score bem acima, custo quase empatado ($0.20 vs $0.18)
  • Code review (0.80 vs 0.73): análise melhor pontuada e em metade do tempo (125s vs 256s)
  • Dados (0.73 vs 0.68): score ligeiramente à frente e 2x mais rápido (213s vs 433s)

Leitura

O Kimi K3 fecha a bateria na frente no ranking (#9 vs #17) e no placar (5×4), pagando $3.43 contra $13.40 do GPT-5.5 — o GPT-5.5 custou 3.9x mais a bateria, com lista $5/$30 por MTok frente a $3/$15 do K3. O padrão se divide: nos testes de construção visual e debug (3D interativo, clone, física/canvas, CSS, debug), o K3 entrega ✅ com scores altos e custo baixo, enquanto o GPT-5.5 acumula ⚠️ e tempos longos. Já em feature em código existente, code review e dados, o GPT-5.5 puxa score e velocidade — e no jogo 3D vence por margem estreita, mas caro. No dia a dia de agent coding, o K3 compra mais qualidade por dólar; o premium do GPT-5.5 só se justifica quando a tarefa pede intervenção cirúrgica em código já vivo.

Outros duelos