duelo direto

GLM 5 Turbo vs Sonnet 5

Placar 6×3 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 6 × 3 GLM 5 Turbo × Sonnet 5
Custo da bateria $0,56 vs $3,22 soma dos runs medidos
Vencedor geral GLM 5 Turbo score do ranking cego
Teste GLM 5 Turbo Sonnet 5 Vencedor
001 3D interativo Defeitos $0,11 · 9m 4s · score 0,68 Defeitos $0,25 · 1m 18s · score 0,73 Sonnet 5
002 clone de site Entregou $0,09 · 54s · score 0,99 Entregou $0,22 · 1m 37s · score 0,98 GLM 5 Turbo
003 física/canvas Entregou $0,04 · 44s · score 0,99 Entregou $0,18 · 1m 6s · score 0,97 GLM 5 Turbo
004 jogo 3D Entregou $0,07 · 5m 22s · score 0,96 Defeitos $0,28 · 1m 56s · score 0,73 GLM 5 Turbo
101 debug Entregou $0,03 · 16s · score 0,95 Entregou $0,18 · 29s · score 0,80 GLM 5 Turbo
103 feature em código existente Entregou $0,03 · 25s · score 0,97 Entregou $0,18 · 46s · score 0,86 GLM 5 Turbo
104 CSS responsivo Entregou $0,04 · 1m 52s · score 0,95 Defeitos $1,28 · 10m 43s · score 0,25 GLM 5 Turbo
105 code review Entregou $0,05 · 5m 0s · score 0,74 Entregou $0,25 · 2m 1s · score 0,82 Sonnet 5
108 dados Quebrou $0,10 · 5m 14s · score 0,34 Entregou $0,40 · 2m 56s · score 0,81 Sonnet 5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde GLM 5 Turbo leva

  • Velocidade e eficiência em tasks padronizadas: domina clone de site (0.99 vs 0.98), física/canvas (0.99 vs 0.97) e CSS responsivo com 7x menos custo ($0.04 vs $1.28), entregando em minutos onde o Sonnet toma 10+ minutos e ainda falha
  • Confiabilidade em tarefas de engenharia: 100% de entrega em debug (0.95 vs 0.80 em 16s), feature em código existente (0.95 vs 0.80) e jogo 3D (0.96 vs defeitos), mostrando robustez estrutural mesmo em problemas complexos

Onde Sonnet 5 leva

  • 3D interativo: entrega defeitos mas com score melhor (0.73 vs 0.68) e resolução 7x mais rápida (78s vs 544s)
  • Code review e manipulação de dados: score superior em review (0.82 vs 0.74) e é o único que entrega em dados (0.81 vs quebra), mostrando melhor compreensão de contexto numérico e análise qualitativa

Qual escolher

GLM 5 Turbo é a escolha dominante para implementação: 6 vitórias, custo 82% menor ($0.56 vs $3.22) e entrega confiável em problemas de engenharia. Use Sonnet 5 apenas para code review qualitativo ou quando dados estruturados são críticos—paga bem mais por isso.

Outros duelos