Anthropic

Opus 4.8

Era o topo da linha da Anthropic até o Fable 5; a própria Anthropic posiciona o Fable 5 como seu sucessor de upgrade — o Opus segue em US$5/US$25 como degrau do meio.

O perfeccionista compulsivo: US$9,49 (o mais caro da bateria, 40% do custo total) e 99 rounds, dos quais 81 só no FPS — 31 Bash, 35 Edits, 11 Reads em 29 minutos de lapidação. Zero libs externas em todos os testes: escreve tudo na mão.

4/4 runs auditados: single-shot, prompt verbatim, sem subagentes, sem skills, zero violações.

ranking geral
#11 · score 0,799
julgamento cego (scores.json)
preço de entrada
$5 / 1M tokens
preço de saída
$25 / 1M tokens
custo total medido
$3,86
em 9 de 9 runs
vereditos
7 entregou 2 defeitos
painel cego, rubrica v2
janela de contexto
1M tokens
docs oficiais Anthropic, jul/2026
saída máxima
128k tokens
docs oficiais Anthropic, jul/2026
lançamento
cache
write 1,25× / read 0,10×
Anthropic — fórmula universal do benchmark, dossiê §8

Benchmarks oficiais

BenchmarkScoreFonteNota
SWE-Bench Pro 69,2% Anthropic
Terminal-Bench 2.1 82,7% Anthropic a OpenAI reporta o mesmo modelo no mesmo benchmark em 78,9% — divergência de auto-reporte entre labs
Terminal-Bench 2.1 78,9% OpenAI número da tabela divulgada pela OpenAI para o mesmo modelo
FrontierCode Diamond (xhigh) 13,4% Anthropic
GDPval-AA 1890 Anthropic pontuação, não %
OSWorld-Verified 83,4% Anthropic
Humanity's Last Exam (com ferramentas) 57,9% Anthropic
Humanity's Last Exam (sem ferramentas) 49,8% Anthropic
Blueprint-Bench 2 14,5% Anthropic
ExploitBench (Cap%) 40,0% Anthropic
HealthBench Professional 56,9% Anthropic
Score composto Artificial Analysis 56 Artificial Analysis ⚠️ reportado por fonte secundária

números auto-reportados pelos vendors — o placar deste site mede outra coisa: se o app entrega.

Asteriscos

  • Divergência de auto-reporte: Terminal-Bench 2.1 = 82,7% segundo a Anthropic, 78,9% segundo a OpenAI — cada lab roda a própria bateria e publica o número que sai.
  • Scores oficiais auto-reportados pela Anthropic (tabela publicada com o lançamento do Fable 5).

Comportamento medido (v0)

verificou no browser
1/4
idas na bateria
18

Leitura

Verificador seletivo: só abriu o navegador no FPS (o mais difícil), onde teve 1 erro e fez 2 Edits; escreveu e parou nos outros 3. O mais enxuto em linhas (305/382/233/704). Custo da bateria: $3,49 — 4,5× menos que o Fable 5.

Runs na bateria

001 · sistema-solar-3d 3D interativo Defeitos abrir ↗
▶ carregar preview
custo$0,48 tokens out11.452 idas4 duração2m 20s score0,71 acabamento1/1 tokens input_uncached220 tokens cache_read140.825 tokens cache_write40.682

Run do teste 001 (sistema solar 3D): 6 rounds, 304s, US$1.00. Ferramentas: Write×2, Bash×2, Read×1. Artefato de 614 linhas. Sem dependência externa.

fairnessauditado, single-shot, prompt verbatim, sem subagentes, sem skills

002 · site-apple clone de site Entregou abrir ↗
▶ carregar preview
custo$0,67 tokens out13.133 idas8 duração3m 2s score0,93 acabamento1/1 tokens input_uncached369 tokens cache_read206.291 tokens cache_write27.564

Run do teste 002 (clone da home da Apple): 8 rounds, 232s, US$0.78. Ferramentas: Write×1, Edit×5, Bash×1. Artefato de 783 linhas. Sem dependência externa.

fairnessauditado, single-shot, prompt verbatim, sem subagentes, sem skills

003 · fisica-mouse física/canvas Entregou abrir ↗
▶ carregar preview
custo$0,29 tokens out6.916 idas3 duração1m 27s score0,95 acabamento1/1 tokens input_uncached216 tokens cache_read67.543 tokens cache_write18.730

Run do teste 003 (física de bolinhas): 4 rounds, 140s, US$0.45. Ferramentas: Write×1, Bash×2. Artefato de 437 linhas. Sem dependência externa.

fairnessauditado, single-shot, prompt verbatim, sem subagentes, sem skills

004 · fps jogo 3D Defeitos abrir ↗
▶ carregar preview
custo$0,59 tokens out16.888 idas2 duração3m 6s score0,71 acabamento1/1 tokens input_uncached2.449 tokens cache_read7.530.454 tokens cache_write136.447

Run do teste 004 (jogo FPS): 81 rounds, 1731s, US$7.26. Ferramentas: Bash×31, Write×3, Read×11, Edit×35. Artefato de 1702 linhas. Sem dependência externa.

fairnessauditado, single-shot, prompt verbatim, sem subagentes, sem skills

101 · caca-bug debug Entregou abrir ↗
▶ carregar preview
custo$0,30 tokens out1.793 idas7 duração41s score0,67 acabamento1/1
103 · feature-alheia feature em código existente Entregou abrir ↗
▶ carregar preview
custo$0,20 tokens out3.138 idas8 duração50s score0,84 acabamento1/1
104 · css-mobile CSS responsivo Entregou abrir ↗
▶ carregar preview
custo$0,25 tokens out4.761 idas5 duração1m 15s score0,93 acabamento1/1
105 · revisar-codigo code review Entregou abrir ↗
▶ carregar preview
custo$0,34 tokens out7.841 idas5 duração2m 10s score0,78 acabamento1/1
108 · dado-sujo dados Entregou abrir ↗
▶ carregar preview
custo$0,75 tokens out15.908 idas10 duração3m 36s score0,68 acabamento1/1

Duelos diretos

Perguntas frequentes

Quanto custa Claude Opus 4.8 pra programar?

Preço de tabela: $5/1M tokens de entrada e $25/1M de saída. Na prática, medimos $3,86 em 9 tarefas reais de vibe coding — média de $0,43 por tarefa.

Claude Opus 4.8 vale a pena pra código?

No julgamento cego, Claude Opus 4.8 ficou em #11 no ranking geral (score 0,799), com 7 entregas limpas, 2 com defeitos e 0 quebradas em 9 testes.