Kimi K3 vs GPT-5.6 Terra
Placar 5×4 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.
| Teste | Kimi K3 | GPT-5.6 Terra | Vencedor |
|---|---|---|---|
| 001 3D interativo | Entregou $0,64 · 4m 14s · score 0,93 | Entregou $1,65 · 23m 53s · score 0,73 | Kimi K3 |
| 002 clone de site | Entregou $0,44 · 2m 42s · score 0,95 | Entregou $0,91 · 17m 54s · score 0,77 | Kimi K3 |
| 003 física/canvas | Entregou $0,13 · 30s · score 0,98 | Entregou $0,63 · 13m 42s · score 0,73 | Kimi K3 |
| 004 jogo 3D | Defeitos $1,19 · 13m 50s · score 0,60 | Defeitos $2,43 · 30m 51s · score 0,43 | Kimi K3 |
| 101 debug | Entregou $0,07 · 45s · score 0,85 | Entregou $0,04 · 19s · score 0,94 | GPT-5.6 Terra |
| 103 feature em código existente | Entregou $0,18 · 3m 0s · score 0,66 | Entregou $0,07 · 34s · score 0,94 | GPT-5.6 Terra |
| 104 CSS responsivo | Entregou $0,20 · 3m 57s · score 0,87 | Defeitos $0,09 · 44s · score 0,72 | Kimi K3 |
| 105 code review | Entregou $0,18 · 4m 16s · score 0,73 | Entregou $0,13 · 1m 26s · score 0,90 | GPT-5.6 Terra |
| 108 dados | Entregou $0,41 · 7m 13s · score 0,68 | Entregou $0,27 · 2m 9s · score 0,88 | GPT-5.6 Terra |
veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)
Onde Kimi K3 leva
- 3D interativo (0.93 vs 0.73): score bem acima e 2.6x mais barato ($0.64 vs $1.65), em 254s contra 1433s do Terra
- Clone de site (0.95 vs 0.77): entrega mais fiel por metade do preço ($0.44 vs $0.91) e 6.6x mais rápido (162s vs 1074s)
- Física/canvas (0.98 vs 0.73): quase perfeito em 30s por $0.13 — o Terra gastou $0.63 e 822s para 0.73
- Jogo 3D (0.60 vs 0.43): os dois saíram com ⚠️, mas o K3 ainda pontuou melhor e custou metade ($1.19 vs $2.43) em menos da metade do tempo (830s vs 1851s)
- CSS responsivo (0.87 vs 0.72): único ✅ limpo dos dois neste teste — o Terra foi mais barato e rápido ($0.09 · 44s), mas com defeitos e score menor
Onde GPT-5.6 Terra leva
- Debug (0.94 vs 0.85): caça-bug mais afiada, em 19s por $0.04 — mais barato e 2x mais rápido que o K3
- Feature em código existente (0.94 vs 0.66): salto grande de score, por $0.07 em 34s contra $0.18 e 180s do K3
- Code review (0.90 vs 0.73): análise mais precisa e 3x mais rápida (86s vs 256s), ainda um pouco mais barata ($0.13 vs $0.18)
- Dados (0.88 vs 0.68): score bem superior em 129s por $0.27 — o K3 levou 433s e $0.41 para 0.68
Leitura
O K3 vence o placar (5×4) e o ranking geral (#9 vs #12) por 55% do custo da bateria ($3.43 vs $6.22), mesmo com token de lista um pouco mais caro no input ($3/$15 vs $2.5/$15 por MTok). O padrão é nítido: no front pesado — 3D, clone, física, jogo — o K3 entrega score alto (ou menos pior) e fecha muito mais rápido e barato; no mid-stack — debug, feature em código existente, review, dados — o Terra é cirúrgico, barato por chamada e bem acima em score. Quem otimiza por qualidade no greenfield visual paga o K3; quem vive em codebase e análise de código tem o Terra mais afiado, mas a conta total da bateria ainda sobe.