duelo direto

GLM 5.2 vs GPT-5.6 Terra

Placar 3×6 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 3 × 6 GLM 5.2 × GPT-5.6 Terra
Custo da bateria $1,21 vs $6,22 soma dos runs medidos
Vencedor geral GLM 5.2 score do ranking cego
Teste GLM 5.2 GPT-5.6 Terra Vencedor
001 3D interativo Defeitos $0,11 · 3m 7s · score 0,73 Entregou $1,65 · 23m 53s · score 0,73 GPT-5.6 Terra
002 clone de site Defeitos $0,10 · 3m 17s · score 0,72 Entregou $0,91 · 17m 54s · score 0,77 GPT-5.6 Terra
003 física/canvas Entregou $0,14 · 5m 9s · score 0,91 Entregou $0,63 · 13m 42s · score 0,73 GLM 5.2
004 jogo 3D Defeitos $0,19 · 5m 57s · score 0,70 Defeitos $2,43 · 30m 51s · score 0,43 GLM 5.2
101 debug Entregou $0,04 · 35s · score 0,90 Entregou $0,04 · 19s · score 0,94 GPT-5.6 Terra
103 feature em código existente Entregou $0,09 · 1m 31s · score 0,84 Entregou $0,07 · 34s · score 0,94 GPT-5.6 Terra
104 CSS responsivo Entregou $0,08 · 2m 46s · score 0,93 Defeitos $0,09 · 44s · score 0,72 GLM 5.2
105 code review Entregou $0,09 · 3m 14s · score 0,82 Entregou $0,13 · 1m 26s · score 0,90 GPT-5.6 Terra
108 dados Entregou $0,37 · 8m 25s · score 0,65 Entregou $0,27 · 2m 9s · score 0,88 GPT-5.6 Terra

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde GLM 5.2 leva

  • Física/Canvas (0.91 vs 0.73): lógica visual 24% superior a custo 78% menor
  • Jogo 3D (ambos frágeis, mas 0.70 vs 0.43): GLM quase 2x melhor, Terra custa 12x mais ($2.43 vs $0.19)
  • CSS responsivo (0.93 vs 0.72): estilos onde Terra falha, GLM custa praticamente igual ($0.08 vs $0.09)

Onde GPT-5.6 Terra leva

  • 3D interativo (0.73 vs 0.73): empatado em score, mas Terra entrega e GLM tem defeito; Terra custa mais porém
  • Clone de site (0.77 vs 0.72): GLM fraqueja, Terra entrega; diferença marginal (0.05)
  • Debug (0.94 vs 0.90): score 4% melhor com mesma faixa de custo
  • Feature em código (0.90 vs 0.72): refinamento 25% melhor, Terra 3x mais rápido (34s vs 91s)
  • Code review (0.90 vs 0.82): score 9.7% melhor, marginalmente mais rápido
  • Dados (0.88 vs 0.65): 35% superior em análise, 3.8x mais rápido

Qual escolher

GLM 5.2 se custo é prioridade máxima (5x mais barato) e você aceita risco — excelente em visuais (física, canvas, CSS), mas falha em tarefas de alto nível (clone, 3D). GPT-5.6 Terra se confiabilidade importa: vence 6/9, melhor em análise (dados) e refinamento (feature, code review), justificado pelos $5.02 extras apenas se projeto crítico que precisa de velocidade e precisão simultâneas (debug, dados).

Outros duelos