duelo direto

Kimi K3 vs GPT-5.6 Sol

Placar 5×4 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 5 × 4 Kimi K3 × GPT-5.6 Sol
Custo da bateria $3,43 vs $14,50 soma dos runs medidos
Vencedor geral Kimi K3 score do ranking cego
Teste Kimi K3 GPT-5.6 Sol Vencedor
001 3D interativo Entregou $0,64 · 4m 14s · score 0,93 Defeitos $4,02 · 21m 42s · score 0,34 Kimi K3
002 clone de site Entregou $0,44 · 2m 42s · score 0,95 Entregou $3,99 · 25m 26s · score 0,50 Kimi K3
003 física/canvas Entregou $0,13 · 30s · score 0,98 Entregou $2,12 · 17m 21s · score 0,50 Kimi K3
004 jogo 3D Defeitos $1,19 · 13m 50s · score 0,60 Defeitos $3,15 · 34m 12s · score 0,37 Kimi K3
101 debug Entregou $0,07 · 45s · score 0,85 Entregou $0,08 · 18s · score 0,91 GPT-5.6 Sol
103 feature em código existente Entregou $0,18 · 3m 0s · score 0,66 Entregou $0,11 · 34s · score 0,91 GPT-5.6 Sol
104 CSS responsivo Entregou $0,20 · 3m 57s · score 0,87 Defeitos $0,18 · 48s · score 0,70 Kimi K3
105 code review Entregou $0,18 · 4m 16s · score 0,73 Entregou $0,30 · 2m 18s · score 0,79 GPT-5.6 Sol
108 dados Entregou $0,41 · 7m 13s · score 0,68 Entregou $0,56 · 2m 40s · score 0,77 GPT-5.6 Sol

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Kimi K3 leva

  • 3D interativo (0.93 vs 0.34): entrega limpa por $0.64 em 254s — o Sol ficou em ⚠️ com score 0.34, $4.02 e 1302s
  • Clone de site (0.95 vs 0.50): quase o dobro de score por cerca de 1/9 do preço ($0.44 vs $3.99) e 9x mais rápido (162s vs 1526s)
  • Física/canvas (0.98 vs 0.50): 0.98 em 30s por $0.13 contra 0.50 em 1041s por $2.12
  • Jogo 3D (0.60 vs 0.37): ambos ⚠️, mas o K3 ainda venceu em score e em custo ($1.19 / 830s vs $3.15 / 2052s)
  • CSS responsivo (0.87 vs 0.70): ✅ com 0.87 contra ⚠️ do Sol com 0.70 — qualidade maior por custo quase igual ($0.20 vs $0.18)

Onde GPT-5.6 Sol leva

  • Debug (0.91 vs 0.85): score e tempo melhores (18s vs 45s) com custo quase idêntico ($0.08 vs $0.07)
  • Feature em código existente (0.91 vs 0.66): 0.91 em 34s por $0.11 — o K3 ficou em 0.66, 180s e $0.18
  • Code review (0.79 vs 0.73): review melhor pontuada e mais rápida (138s vs 256s), embora um pouco mais cara ($0.30 vs $0.18)
  • Dados (0.77 vs 0.68): score e velocidade (160s vs 433s) a favor do Sol, com custo próximo ($0.56 vs $0.41)

Leitura

Kimi K3 venceu o ranking (#9 · 0.8070 vs #18 · 0.6440) e o placar (5×4), com a bateria inteira a $3.43 contra $14.50 do Sol — cerca de 4.2x mais barato, alinhado ao preço de lista ($3/$15 vs $5/$30 por MTok). O padrão é claro: no bloco de construção (3D, clone, física, jogo, CSS) o K3 entrega score alto com custo e tempo baixos; no bloco de manutenção em código existente (debug, feature, review, dados) o Sol é mais cirúrgico — scores 0.91 / 0.91 / 0.79 / 0.77 e tempos bem menores. Quem paga o premium do Sol compra precisão em tarefas pontuais; quem olha a bateria completa e o ranking fica com o K3.

Outros duelos