Kimi K3 vs GLM 5.2
Placar 4×5 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.
| Teste | Kimi K3 | GLM 5.2 | Vencedor |
|---|---|---|---|
| 001 3D interativo | Entregou $0,64 · 4m 14s · score 0,93 | Defeitos $0,11 · 3m 7s · score 0,73 | Kimi K3 |
| 002 clone de site | Entregou $0,44 · 2m 42s · score 0,95 | Defeitos $0,10 · 3m 17s · score 0,72 | Kimi K3 |
| 003 física/canvas | Entregou $0,13 · 30s · score 0,98 | Entregou $0,14 · 5m 9s · score 0,91 | Kimi K3 |
| 004 jogo 3D | Defeitos $1,19 · 13m 50s · score 0,60 | Defeitos $0,19 · 5m 57s · score 0,70 | GLM 5.2 |
| 101 debug | Entregou $0,07 · 45s · score 0,85 | Entregou $0,04 · 35s · score 0,90 | GLM 5.2 |
| 103 feature em código existente | Entregou $0,18 · 3m 0s · score 0,66 | Entregou $0,09 · 1m 31s · score 0,84 | GLM 5.2 |
| 104 CSS responsivo | Entregou $0,20 · 3m 57s · score 0,87 | Entregou $0,08 · 2m 46s · score 0,93 | GLM 5.2 |
| 105 code review | Entregou $0,18 · 4m 16s · score 0,73 | Entregou $0,09 · 3m 14s · score 0,82 | GLM 5.2 |
| 108 dados | Entregou $0,41 · 7m 13s · score 0,68 | Entregou $0,37 · 8m 25s · score 0,65 | Kimi K3 |
veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)
Onde Kimi K3 leva
- 3D interativo (0.93 vs 0.73): entrega limpa (✅) contra artefato com defeitos (⚠️) do GLM — diferença de 0.20 no score
- Clone de site (0.95 vs 0.72): mesmo padrão, K3 fecha sem ressalvas e abre 0.23 de vantagem de qualidade
- Física/canvas (0.98 vs 0.91): quase perfeito e 10× mais rápido (30s vs 309s), com custo praticamente igual ($0.13 vs $0.14)
- Dados (0.68 vs 0.65): vitória apertada de score, ainda um pouco mais barato e um pouco mais rápido que o GLM
Onde GLM 5.2 leva
- Jogo 3D (0.70 vs 0.60): os dois saem com ⚠️, mas o GLM custa 6× menos ($0.19 vs $1.19) e termina em menos da metade do tempo (357s vs 830s)
- Debug (0.90 vs 0.85): caça-bug mais pontuada, mais barata ($0.04 vs $0.07) e mais rápida (35s vs 45s)
- Feature em código existente (0.84 vs 0.66): maior gap a favor do GLM na bateria de “código existente” — metade do preço e metade do tempo
- CSS responsivo (0.93 vs 0.87): melhor score por 40% do custo e ~30% menos tempo
- Code review (0.82 vs 0.73): análise mais forte e mais barata ($0.09 vs $0.18), com 62s de vantagem
Leitura
Duelo de vizinhos no ranking (#9 vs #10), mas com perfis opostos. O Kimi K3 vence o placar geral por esmagar nos testes generativos de UI/3D (001–003), onde o GLM entrega com defeitos e scores bem mais baixos; o GLM 5.2, por outro lado, vence 5 de 9 testes — sobretudo a trilha de manutenção (debug, feature, CSS, review) — e fecha a bateria por 35% do custo ($1.21 vs $3.43), com lista de tokens também mais barata ($1.4/$4.4 vs $3/$15 por MTok). Em resumo: K3 quando a qualidade visual/interativa manda; GLM 5.2 quando o dia a dia de código e o orçamento mandam.