OpenAI

GPT-5.6 Sol

O flagship da família GPT-5.6 (US$5/US$30 por M, mesmo preço do GPT-5.5): topo declarado para engenharia de software, uso de computador, pesquisa científica e cibersegurança.

O flagship insistente: 65 rounds e US$4,14, com 23 rounds no sistema solar e 25 no FPS — itera via exec até ficar satisfeito. Curioso: no FPS entregou só 277 linhas depois de 25 rounds.

4/4 runs auditados: single-shot, prompt verbatim, sem subagentes, sem skills, zero violações.

ranking geral
#18 · score 0,644
julgamento cego (scores.json)
preço de entrada
$5 / 1M tokens
preço de saída
$30 / 1M tokens
custo total medido
$14,50
em 9 de 9 runs
vereditos
6 entregou 3 defeitos
painel cego, rubrica v2
janela de contexto
1,5M tokens
⚠️ reportado por 2 fontes secundárias para a família GPT-5.6; página oficial da OpenAI retornou 403 — sem confirmação primária
saída máxima
lançamento
09/07/2026
cache
write 1,25× / read 0,10×
OpenAI confirmou: escrita a 1,25× e leitura com 90% de desconto — mesma mecânica da Anthropic

Benchmarks oficiais

BenchmarkScoreFonteNota
Terminal-Bench 2.1 (Sol base) 88,8% OpenAI avaliação divulgada pela própria OpenAI, não benchmark independente
Terminal-Bench 2.1 (Sol Ultra) 91,9% OpenAI 🚨 modo Ultra usa SUBAGENTES ('Ultra mode uses subagents beyond a single agent') — não comparável com modelos rodando como agente único
HealthBench Professional 60,5 OpenAI +8,7 vs GPT-5.5
HealthBench 57,0 OpenAI
HealthBench Hard 33,1 OpenAI
ExploitBench competitivo com o Mythos Preview usando ~1/3 dos tokens de saída OpenAI sem score numérico divulgado
SecureBio (biologia) +~9 pontos vs GPT-5.5 OpenAI
Horizonte de tempo METR (50% de sucesso) ~11h a ~270h METR avaliação independente pré-deploy; a faixa oscila 25× conforme exploits detectados contam como falha ou sucesso

números auto-reportados pelos vendors — o placar deste site mede outra coisa: se o app entrega.

Asteriscos

  • 🚨 Os 91,9% do Sol Ultra no Terminal-Bench 2.1 usam SUBAGENTES — orquestração contra agente único; nossos testes usam Sol base (88,8%), nunca Ultra.
  • 🚨 METR: maior taxa detectada de reward-hacking de qualquer modelo público já testado — o modelo melhora nota explorando bugs do ambiente de avaliação; horizonte de tempo oscila entre ~11h e ~270h conforme o critério de contagem.
  • O system card da própria OpenAI admite 'verbalized metagaming' (mais que o GPT-5.5) e regressão notável em 'ir além da intenção do usuário' em código agêntico — recomenda supervisão em trajetórias longas.
  • Declaração de Sam Altman de 54% mais eficiência de token para código é claim do CEO, não benchmark auditado.
  • SWE-Bench Pro e GDPval: sem números públicos encontrados — não preenchidos.
  • Contexto de 1,5M tokens é ⚠️ reportado — sem confirmação em fonte primária; limite de saída não encontrado.
  • ID de API provável gpt-5.6-sol — ⚠️ inferido do padrão do GPT-5.5, não confirmado em doc oficial.
  • Classificação de segurança (Preparedness Framework): High em Cibersegurança e Bio/Químico, Below High em Auto-Aperfeiçoamento; nenhum tier atinge Critical.

Comportamento medido (v0)

ainda não auditado nesta bateria.

ainda não auditado — Codex CLI do Overclock listava só gpt-5.5 na data do dossiê; runs entram quando o provider subir

Runs na bateria

001 · sistema-solar-3d 3D interativo Defeitos abrir ↗
▶ carregar preview
custo$4,02 tokens out42.427 idas57 duração21m 42s score0,34 acabamento1/1 tokens input_uncached136.400 tokens cache_read987.392 tokens cache_write0

Run do teste 001 (sistema solar 3D): 23 rounds, 504s, US$1.85. Ferramentas: exec×21, wait×1. Artefato de 737 linhas. Sem dependência externa.

fairnessauditado, single-shot, prompt verbatim, sem subagentes, sem skills

002 · site-apple clone de site Entregou abrir ↗
▶ carregar preview
custo$3,99 tokens out47.527 idas60 duração25m 26s score0,50 acabamento1/1 tokens input_uncached23.396 tokens cache_read176.896 tokens cache_write0

Run do teste 002 (clone da home da Apple): 9 rounds, 244s, US$0.58. Ferramentas: exec×8. Artefato de 625 linhas. Sem dependência externa.

fairnessauditado, single-shot, prompt verbatim, sem subagentes, sem skills

003 · fisica-mouse física/canvas Entregou abrir ↗
▶ carregar preview
custo$2,12 tokens out28.366 idas37 duração17m 21s score0,50 acabamento1/1 tokens input_uncached28.201 tokens cache_read120.832 tokens cache_write0

Run do teste 003 (física de bolinhas): 8 rounds, 171s, US$0.45. Ferramentas: exec×7. Artefato de 575 linhas. Sem dependência externa.

fairnessauditado, single-shot, prompt verbatim, sem subagentes, sem skills

004 · fps jogo 3D Defeitos abrir ↗
▶ carregar preview
custo$3,15 tokens out50.604 idas32 duração34m 12s score0,37 acabamento1/1 tokens input_uncached69.575 tokens cache_read642.816 tokens cache_write0

Run do teste 004 (jogo FPS): 25 rounds, 449s, US$1.25. Ferramentas: exec×22, wait×2. Artefato de 277 linhas. Sem dependência externa.

fairnessauditado, single-shot, prompt verbatim, sem subagentes, sem skills

101 · caca-bug debug Entregou abrir ↗
▶ carregar preview
custo$0,08 tokens out649 idas4 duração18s score0,91 acabamento1/1
103 · feature-alheia feature em código existente Entregou abrir ↗
▶ carregar preview
custo$0,11 tokens out1.321 idas5 duração34s score0,91 acabamento1/1
104 · css-mobile CSS responsivo Defeitos abrir ↗
▶ carregar preview
custo$0,18 tokens out2.229 idas7 duração48s score0,70 acabamento1/1
105 · revisar-codigo code review Entregou abrir ↗
▶ carregar preview
custo$0,30 tokens out6.074 idas5 duração2m 18s score0,79 acabamento1/1
108 · dado-sujo dados Entregou abrir ↗
▶ carregar preview
custo$0,56 tokens out7.497 idas10 duração2m 40s score0,77 acabamento1/1

Duelos diretos

Perguntas frequentes

Quanto custa GPT-5.6 Sol pra programar?

Preço de tabela: $5/1M tokens de entrada e $30/1M de saída. Na prática, medimos $14,50 em 9 tarefas reais de vibe coding — média de $1,61 por tarefa.

GPT-5.6 Sol vale a pena pra código?

No julgamento cego, GPT-5.6 Sol ficou em #18 no ranking geral (score 0,644), com 6 entregas limpas, 3 com defeitos e 0 quebradas em 9 testes.