duelo direto

GLM 5.2 vs GPT-5.4 Mini

Placar 5×4 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 5 × 4 GLM 5.2 × GPT-5.4 Mini
Custo da bateria $1,21 vs $1,23 soma dos runs medidos
Vencedor geral GLM 5.2 score do ranking cego
Teste GLM 5.2 GPT-5.4 Mini Vencedor
001 3D interativo Defeitos $0,11 · 3m 7s · score 0,73 Entregou $0,38 · 34m 24s · score 0,73 GPT-5.4 Mini
002 clone de site Defeitos $0,10 · 3m 17s · score 0,72 Entregou $0,22 · 22m 4s · score 0,77 GPT-5.4 Mini
003 física/canvas Entregou $0,14 · 5m 9s · score 0,91 Entregou $0,16 · 6m 30s · score 0,89 GLM 5.2
004 jogo 3D Defeitos $0,19 · 5m 57s · score 0,70 Quebrou $0,03 · 31m 4s · score 0,27 GLM 5.2
101 debug Entregou $0,04 · 35s · score 0,90 Defeitos $0,03 · 1m 45s · score 0,48 GLM 5.2
103 feature em código existente Entregou $0,09 · 1m 31s · score 0,84 Entregou $0,05 · 1m 33s · score 0,86 GPT-5.4 Mini
104 CSS responsivo Entregou $0,08 · 2m 46s · score 0,93 Entregou $0,11 · 4m 50s · score 0,87 GLM 5.2
105 code review Entregou $0,09 · 3m 14s · score 0,82 Entregou $0,09 · 3m 40s · score 0,80 GLM 5.2
108 dados Entregou $0,37 · 8m 25s · score 0,65 Entregou $0,17 · 7m 17s · score 0,75 GPT-5.4 Mini

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde GLM 5.2 leva

  • Física e canvas (003): entrega completa com score 0.91, mais eficiente em custo ($0.14 vs $0.16) e tempo (309s vs 390s)
  • Jogos 3D (004): gpt-5-4-mini quebrou completamente (score 0.27), enquanto GLM entregou com defeitos (score 0.70)
  • Debug e qualidade de código (101, 104, 105): domina em análise e correção, com scores altos (0.90, 0.93, 0.82) e tempos competitivos

Onde GPT-5.4 Mini leva

  • 3D interativo (001) e clone de site (002): entrega completa em ambos, enquanto GLM teve defeitos; score similar em 001 (0.73 vs 0.73) e melhor em 002 (0.77 vs 0.72)
  • Features em código (103): entrega limpa com score ligeiramente melhor (0.73 vs 0.72) e mais barato ($0.05 vs $0.09)
  • Processamento de dados (108): score superior (0.75 vs 0.65), embora ambos tenham entregado

Qual escolher

GLM 5.2 é a escolha mais sólida para trabalhos estruturados (CSS, debug, física), especialmente em casos complexos onde a qualidade compensa o tempo. GPT-5.4 Mini excele em tarefas web rápidas (clones, features) com custo menor, mas falha em projetos 3D ambiciosos — escolha GLM se a confiabilidade importa mais que velocidade.

Outros duelos