duelo direto
Opus 4.8 vs GPT-5.4 Mini
Placar 5×4 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.
Placar por teste
5 × 4
Opus 4.8 × GPT-5.4 Mini
Custo da bateria
$3,86 vs $1,23
soma dos runs medidos
Vencedor geral
Opus 4.8
score do ranking cego
| Teste | Opus 4.8 | GPT-5.4 Mini | Vencedor |
|---|---|---|---|
| 001 3D interativo | Defeitos $0,48 · 2m 20s · score 0,71 | Entregou $0,38 · 34m 24s · score 0,73 | GPT-5.4 Mini |
| 002 clone de site | Entregou $0,67 · 3m 2s · score 0,93 | Entregou $0,22 · 22m 4s · score 0,77 | Opus 4.8 |
| 003 física/canvas | Entregou $0,29 · 1m 27s · score 0,95 | Entregou $0,16 · 6m 30s · score 0,89 | Opus 4.8 |
| 004 jogo 3D | Defeitos $0,59 · 3m 6s · score 0,71 | Quebrou $0,03 · 31m 4s · score 0,27 | Opus 4.8 |
| 101 debug | Entregou $0,30 · 41s · score 0,67 | Defeitos $0,03 · 1m 45s · score 0,48 | Opus 4.8 |
| 103 feature em código existente | Entregou $0,20 · 50s · score 0,84 | Entregou $0,05 · 1m 33s · score 0,86 | GPT-5.4 Mini |
| 104 CSS responsivo | Entregou $0,25 · 1m 15s · score 0,93 | Entregou $0,11 · 4m 50s · score 0,87 | Opus 4.8 |
| 105 code review | Entregou $0,34 · 2m 10s · score 0,78 | Entregou $0,09 · 3m 40s · score 0,80 | GPT-5.4 Mini |
| 108 dados | Entregou $0,75 · 3m 36s · score 0,68 | Entregou $0,17 · 7m 17s · score 0,75 | GPT-5.4 Mini |
veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)
Onde Opus 4.8 leva
- Clone de site (0.93 vs 0.77): entrega 16% superior com tempo 7x menor
- Física/Canvas (0.95 vs 0.89): precisão em lógica visual complexa
- Jogo 3D: Mini quebrou completamente (score 0.27); Opus teve defeito mas score 0.71
- Feature em código (0.78 vs 0.73): refinamento de lógica existente mais seguro
- CSS responsivo (0.93 vs 0.87): estilos responsivos com margem clara
Onde GPT-5.4 Mini leva
- 3D interativo: Mini entrega marginal (0.73 vs defeito 0.71 do Opus), mas ambos frágeis
- Code review (0.80 vs 0.78): custo 73% menor ($0.09 vs $0.34) por qualidade comparável
- Dados (0.75 vs 0.68): score ligeiramente superior com custo 77% menor
Qual escolher
Opus 4.8 é a escolha padrão — 6 vitórias claras, melhor em qualidade absoluta e velocidade, prova confiável em gamedev. GPT-5.4 Mini só se orçamento for crítico (custo 68% menor no total): funciona para review e análise de dados, mas quebra em tarefas complexas como 3D e estrutura. Mini não é backup do Opus — é trade-off consciente entre custo e confiabilidade.
Outros duelos
Fable 5 vs GPT-5.4 Mini
GLM 5.2 vs GPT-5.4 Mini
GLM 5 Turbo vs GPT-5.4 Mini
GLM 5 Turbo vs Opus 4.8
GPT-5.3 Codex Spark vs GPT-5.4 Mini
GPT-5.3 Codex Spark vs Opus 4.8
GPT-5.4 Mini vs GPT-5.5
GPT-5.4 Mini vs GPT-5.6 Sol
GPT-5.4 vs GPT-5.4 Mini
GPT-5.6 Luna vs GPT-5.4 Mini
GPT-5.6 Luna vs Opus 4.8
GPT-5.6 Terra vs GPT-5.4 Mini
Grok 4.5 vs GPT-5.4 Mini
Grok 4.5 vs Opus 4.8
Grok Composer 2.5 Fast vs GPT-5.4 Mini
Grok Composer 2.5 Fast vs Opus 4.8
Haiku 4.5 vs GPT-5.4 Mini
Haiku 4.5 vs Opus 4.8
Kimi K3 vs GPT-5.4 Mini
Kimi K3 vs Opus 4.8
Opus 4.8 vs Fable 5
Opus 4.8 vs GLM 5.2
Opus 4.8 vs GPT-5.4
Opus 4.8 vs GPT-5.5
Opus 4.8 vs GPT-5.6 Sol
Opus 4.8 vs GPT-5.6 Terra
Opus 4.8 vs Sonnet 5
Sonnet 4.6 vs GPT-5.4 Mini
Sonnet 4.6 vs Opus 4.8
Sonnet 5 vs GPT-5.4 Mini