Kimi K3 vs GPT-5.5
Placar 5×4 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.
| Teste | Kimi K3 | GPT-5.5 | Vencedor |
|---|---|---|---|
| 001 3D interativo | Entregou $0,64 · 4m 14s · score 0,93 | Defeitos $3,29 · 17m 35s · score 0,42 | Kimi K3 |
| 002 clone de site | Entregou $0,44 · 2m 42s · score 0,95 | Defeitos $1,15 · 7m 25s · score 0,61 | Kimi K3 |
| 003 física/canvas | Entregou $0,13 · 30s · score 0,98 | Entregou $0,79 · 5m 17s · score 0,83 | Kimi K3 |
| 004 jogo 3D | Defeitos $1,19 · 13m 50s · score 0,60 | Entregou $6,13 · 16m 36s · score 0,63 | GPT-5.5 |
| 101 debug | Entregou $0,07 · 45s · score 0,85 | Defeitos $0,17 · 1m 6s · score 0,46 | Kimi K3 |
| 103 feature em código existente | Entregou $0,18 · 3m 0s · score 0,66 | Entregou $0,20 · 1m 10s · score 0,81 | GPT-5.5 |
| 104 CSS responsivo | Entregou $0,20 · 3m 57s · score 0,87 | Defeitos $0,77 · 3m 38s · score 0,52 | Kimi K3 |
| 105 code review | Entregou $0,18 · 4m 16s · score 0,73 | Entregou $0,30 · 2m 5s · score 0,80 | GPT-5.5 |
| 108 dados | Entregou $0,41 · 7m 13s · score 0,68 | Entregou $0,59 · 3m 33s · score 0,73 | GPT-5.5 |
veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)
Onde Kimi K3 leva
- 3D interativo (0.93 vs 0.42): entrega limpa por $0.64 em 254s — o GPT-5.5 ficou em ⚠️, $3.29 e 1055s
- Clone de site (0.95 vs 0.61): ✅ completo e 2.6x mais barato ($0.44 vs $1.15), enquanto o GPT-5.5 saiu com defeitos
- Física/canvas (0.98 vs 0.83): 10.5x mais rápido (30s vs 317s) e 6x mais barato ($0.13 vs $0.79)
- Debug (0.85 vs 0.46): caça-bug por $0.07 em 45s — o GPT-5.5 marcou ⚠️ a $0.17
- CSS responsivo (0.87 vs 0.52): ✅ estável por $0.20 contra ⚠️ do GPT-5.5 a $0.77
Onde GPT-5.5 leva
- Jogo 3D (0.63 vs 0.60): vitória apertada de score com entrega ✅, mas a $6.13 e 996s — o K3 ficou em ⚠️ a $1.19
- Feature em código existente (0.81 vs 0.66): mais rápido (70s vs 180s) e score bem acima, custo quase empatado ($0.20 vs $0.18)
- Code review (0.80 vs 0.73): análise melhor pontuada e em metade do tempo (125s vs 256s)
- Dados (0.73 vs 0.68): score ligeiramente à frente e 2x mais rápido (213s vs 433s)
Leitura
O Kimi K3 fecha a bateria na frente no ranking (#9 vs #17) e no placar (5×4), pagando $3.43 contra $13.40 do GPT-5.5 — o GPT-5.5 custou 3.9x mais a bateria, com lista $5/$30 por MTok frente a $3/$15 do K3. O padrão se divide: nos testes de construção visual e debug (3D interativo, clone, física/canvas, CSS, debug), o K3 entrega ✅ com scores altos e custo baixo, enquanto o GPT-5.5 acumula ⚠️ e tempos longos. Já em feature em código existente, code review e dados, o GPT-5.5 puxa score e velocidade — e no jogo 3D vence por margem estreita, mas caro. No dia a dia de agent coding, o K3 compra mais qualidade por dólar; o premium do GPT-5.5 só se justifica quando a tarefa pede intervenção cirúrgica em código já vivo.