duelo direto

Kimi K3 vs GPT-5.6 Luna

Placar 4×5 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 4 × 5 Kimi K3 × GPT-5.6 Luna
Custo da bateria $3,43 vs $1,20 soma dos runs medidos
Vencedor geral GPT-5.6 Luna score do ranking cego
Teste Kimi K3 GPT-5.6 Luna Vencedor
001 3D interativo Entregou $0,64 · 4m 14s · score 0,93 Entregou $0,31 · 10m 32s · score 0,91 Kimi K3
002 clone de site Entregou $0,44 · 2m 42s · score 0,95 Defeitos $0,22 · 6m 38s · score 0,68 Kimi K3
003 física/canvas Entregou $0,13 · 30s · score 0,98 Entregou $0,13 · 4m 55s · score 0,92 Kimi K3
004 jogo 3D Defeitos $1,19 · 13m 50s · score 0,60 Defeitos $0,25 · 9m 10s · score 0,68 GPT-5.6 Luna
101 debug Entregou $0,07 · 45s · score 0,85 Entregou $0,02 · 30s · score 0,92 GPT-5.6 Luna
103 feature em código existente Entregou $0,18 · 3m 0s · score 0,66 Entregou $0,03 · 44s · score 0,94 GPT-5.6 Luna
104 CSS responsivo Entregou $0,20 · 3m 57s · score 0,87 Defeitos $0,04 · 57s · score 0,73 Kimi K3
105 code review Entregou $0,18 · 4m 16s · score 0,73 Entregou $0,09 · 2m 25s · score 0,86 GPT-5.6 Luna
108 dados Entregou $0,41 · 7m 13s · score 0,68 Entregou $0,11 · 3m 10s · score 0,90 GPT-5.6 Luna

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Kimi K3 leva

  • 3D interativo (0.93 vs 0.91): score um pouco acima e bem mais rápido (254s vs 632s), ainda que o Luna saia por metade do preço ($0.31 vs $0.64)
  • Clone de site (0.95 vs 0.68): única entrega limpa (✅ contra ⚠️) — 0.95 de score em 162s, enquanto o Luna ficou em 0.68 com defeitos
  • Física/canvas (0.98 vs 0.92): mesmo custo ($0.13) e quase 10x mais rápido (30s vs 295s) com o melhor score da bateria
  • CSS responsivo (0.87 vs 0.73): entrega limpa (✅) contra ⚠️ do Luna — o K3 paga $0.20 e 237s por qualidade que o Luna não sustentou a $0.04

Onde GPT-5.6 Luna leva

  • Jogo 3D (0.68 vs 0.60): os dois saíram com ⚠️, mas o Luna pontuou melhor por $0.25 (vs $1.19) e 550s (vs 830s)
  • Debug (0.92 vs 0.85): caça-bug mais pontuada por $0.02 em 30s — 3.5x mais barato e um terço mais rápido
  • Feature em código existente (0.94 vs 0.66): salto claro de score e de eficiência ($0.03 / 44s vs $0.18 / 180s)
  • Code review (0.86 vs 0.73): review mais forte por metade do custo ($0.09 vs $0.18) e bem mais rápida (145s vs 256s)
  • Dados (0.90 vs 0.68): análise bem superior por $0.11 em 190s — o K3 gastou $0.41 e 433s por score bem menor

Leitura

O Luna fecha o duelo no ranking geral (#8 · 0.8365 vs #9 · 0.8070) e no placar por teste (5×4), com bateria a 35% do custo do K3 ($1.20 vs $3.43) e lista de token mais barata ($1/$6 vs $3/$15 por MTok). O padrão se divide limpo: o K3 vence onde a entrega visual/greenfield exige qualidade bruta — clone (0.95), física (0.98), 3D interativo e CSS limpo —, mas custa mais e, no CSS, demora. O Luna domina o trabalho em código existente e análise (debug, feature, review, dados) com scores altos, poucos dólares e tempos curtos; no jogo 3D, os dois falham com ⚠️, mas o Luna ainda entrega mais score por uma fração do preço. Em qualidade vs custo, o Luna é o vencedor geral; o K3 sobra quando o artefato precisa “parecer pronto” na primeira entrega.

Outros duelos