duelo direto

GLM 5.2 vs GPT-5.5

Placar 8×1 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 8 × 1 GLM 5.2 × GPT-5.5
Custo da bateria $1,21 vs $13,40 soma dos runs medidos
Vencedor geral GLM 5.2 score do ranking cego
Teste GLM 5.2 GPT-5.5 Vencedor
001 3D interativo Defeitos $0,11 · 3m 7s · score 0,73 Defeitos $3,29 · 17m 35s · score 0,42 GLM 5.2
002 clone de site Defeitos $0,10 · 3m 17s · score 0,72 Defeitos $1,15 · 7m 25s · score 0,61 GLM 5.2
003 física/canvas Entregou $0,14 · 5m 9s · score 0,91 Entregou $0,79 · 5m 17s · score 0,83 GLM 5.2
004 jogo 3D Defeitos $0,19 · 5m 57s · score 0,70 Entregou $6,13 · 16m 36s · score 0,63 GLM 5.2
101 debug Entregou $0,04 · 35s · score 0,90 Defeitos $0,17 · 1m 6s · score 0,46 GLM 5.2
103 feature em código existente Entregou $0,09 · 1m 31s · score 0,84 Entregou $0,20 · 1m 10s · score 0,81 GLM 5.2
104 CSS responsivo Entregou $0,08 · 2m 46s · score 0,93 Defeitos $0,77 · 3m 38s · score 0,52 GLM 5.2
105 code review Entregou $0,09 · 3m 14s · score 0,82 Entregou $0,30 · 2m 5s · score 0,80 GLM 5.2
108 dados Entregou $0,37 · 8m 25s · score 0,65 Entregou $0,59 · 3m 33s · score 0,73 GPT-5.5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde GLM 5.2 leva

  • 3D e canvas (001, 003, 004): GLM scores 73%, 91%, 70% contra 42%, 83%, 63% do GPT-5.5; GLM é 10-30x mais barato nestes testes
  • Debug (101) e CSS (104): scores excepcionais (0.90, 0.93) com custo mínimo; GPT-5.5 falha em debug (defeitos, score 0.46)
  • Code review (105): GLM 0.82 vs GPT-5.5 0.80, com custo 3x menor ($0.09 vs $0.30)

Onde GPT-5.5 leva

  • Features em código (103): scores empatados (0.72 ambos), mas GPT-5.5 é ligeiramente mais rápido (70s vs 91s), mesmo custando mais
  • Dados (108): score superior (0.73 vs 0.65) e 2.4x mais rápido (213s vs 505s), compensando custo adicional

Qual escolher

GLM 5.2 é a escolha econômica clara — 11x mais barato no total ($1.21 vs $13.40) com qualidade consistentemente melhor em projetos estruturados. GPT-5.5 só vale a pena em pipelines de dados onde a velocidade justifica o investimento; para tudo mais, GLM vence.

Outros duelos