
Claude Opus 5.5 vs Claude Opus 5: Os Níveis de Esforço Não Significam a Mesma Coisa
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
A primeira coisa a saber antes de comparar Claude Opus 5.5 com Claude Opus 5 é que os dois modelos não compartilham a mesma escala de esforço, e quase todo comparativo direto que você ler esta semana ignora isso. O Opus 5 usa por padrão esforço high. O Opus 5.5 usa por padrão medium, e, em um mesmo nível nominal, ele pensa mais por turno do que seu antecessor. Portanto, "Opus 5.5 no padrão versus Opus 5 no padrão" não é um experimento controlado — é uma comparação entre duas quantidades diferentes de raciocínio. O próprio fornecedor admite isso em seu guia de migração: teste vários níveis de esforço e não reutilize as configurações do Opus 5, porque níveis de mesmo nome não correspondem ao mesmo orçamento de raciocínio. Depois de controlar isso, a diferença entre os dois modelos diminui em alguns pontos, aumenta em outros, e a decisão de atualizar passa a depender de algo que não seja a capacidade bruta — o custo por tarefa concluída, e quatro mudanças na API que vão quebrar o código que roda no Opus 5 hoje.
O que realmente difere, especificação por especificação

Os dois modelos estão mais próximos no papel do que os números de versão sugerem:
• Preço — Claude Opus 5.5 a $4.00 de entrada / $20.00 de saída por milhão de tokens vs. Claude Opus 5 a $5.00 / $25.00
• Leitura de cache — $0.20 por milhão vs $0.50 por milhão, um corte de 60% no item de custo que domina as execuções agênticas
• Gravação em cache — US$ 5 por milhão para a janela de 5 minutos e US$ 8 para a janela de 1 hora no 5.5, contra US$ 6,25 no Opus 5
• Contexto e saída — 1M de tokens de contexto e 128K de saída em ambos; ambos alcançam 300K de saída na Batch API atrás do output-300k-2026-03-24 cabeçalho beta
• Esforço padrão — médio no Opus 5.5 vs alto no Opus 5
• Thinking — adaptativo e sempre ativado em ambos, mas no Opus 5.5 não pode mais ser desativado de forma alguma
• Data de corte de conhecimento — junho de 2026 vs maio de 2026
• Latência — A Anthropic classifica o Opus 5.5 como "moderado" em comparação com a atual linha de modelos, e afirma que ele gera resultados mais de 30% mais rapidamente do que o Opus 5
• Descontinuação — não antes de 22 de setembro de 2027 para o Opus 5.5, e não antes de 24 de julho de 2027 para o Opus 5
Observe o que não é diferente: janela de contexto, teto de saída, desconto de lote e o modelo de raciocínio adaptativo sempre ativo. O Opus 5.5 não é um modelo com contexto maior ou saída mais longa. É um modelo mais barato, mais rápido e mais eficiente em tokens, dentro do mesmo envelope.
Benchmarks, e o asterisco do esforço em cada um deles

Estes números vêm do material de lançamento da Anthropic — reportados pelo próprio fornecedor, obtidos com os seus próprios modelos — e a configuração de esforço importa mais aqui do que o nome do modelo:
• Terminal-Bench 4.0 — 66,4% vs 52,3%, com a execução do Opus 5.5 em esforço xhigh em vez do padrão
• FrontierCode v1.1 (Principal) — 54,4% vs 48,0%, e 54,6% para Opus 5.5 no esforço médio padrão
• CursorBench 4.0 — 57,8% vs 46,6%, e 52,5% no médio
• GDPval-AA v2.1 — 1846 Elo vs 1708
• AutomationBench — 40,0% vs 26,9%
• Humanity's Last Exam, com ferramentas — 67,7% vs 63,6%
• Terminal-Bench-Science 0.1 — 58,7% vs 29,0%, a maior diferença do conjunto
• OSWorld 2.0 — 81,8% parcial vs 74,0%
• Cartografia, com ferramentas — 89,0% vs 83,4%
O resultado do FrontierCode é o que deve ser estudado. O Opus 5.5 obtém 54,4% em xhigh e 54,6% em medium — estatisticamente o mesmo número, com uma fração do orçamento de pensamento. Qualquer que seja a melhoria que a Anthropic tenha feito, nesse benchmark ela não vem de pensar mais. O CursorBench segue o caminho oposto: 57,8% em xhigh contra 52,5% em medium, uma diferença de cinco pontos que diz que o esforço ainda compra precisão real em algumas tarefas. A lição não é "usar medium" ou "usar xhigh"; é que o nível certo de esforço agora é uma medição por carga de trabalho, e o velho hábito de deixar o Opus 5 no seu padrão alto já não diz nada sobre o novo modelo.
A Anthropic acrescenta uma ressalva que vale repetir: neste nível de capacidade, as margens de benchmark são "um guia menos confiável para diferenças do mundo real", e a empresa diz que sua diferença interna para o Claude Fable 5.1 é menor do que as pontuações publicadas sugerem. Isso é um fornecedor dizendo para você não superinterpretar a própria tabela.
O custo por tarefa concluída é a comparação que decide.
O preço por token é a unidade errada para um agente, e é nesta comparação que isso fica evidente. O próprio exemplo prático da Anthropic: uma análise de fusão que levou 63 minutos no Opus 5.5 e custou 50% menos do que a mesma tarefa no Opus 5, que levou 93 minutos. A tabela de preços explica parte disso — um corte de 20% na entrada e na saída, 60% nas leituras de cache —, mas não tudo. O resto é o modelo usar menos tokens e menos turnos para chegar ao mesmo lugar. Depoimentos de clientes publicados com o lançamento apontam na mesma direção: a Box relata um terço dos tokens e respostas cerca de 40% menos verbosas, a Kiro aproximadamente metade dos tokens com 40% menos chamadas, a Factory 20–25% menos tokens de saída, e o GitHub entre os menores números de tokens e etapas que já mediu.
Essas são declarações de clientes publicadas por fornecedores, não resultados auditados, e a afirmação agregada "cerca de 40% mais barato em cargas de trabalho típicas" é a caracterização da Anthropic de uma média entre as cargas de trabalho que ela selecionou. A versão honesta para o seu próprio planejamento: assuma que o corte de 20% no preço de tabela é real e confiável, trate os 20% extras como uma hipótese que você pode testar em uma tarde executando a mesma tarefa nos dois modelos e contando tokens.
Uma nota estrutural sobre por que o corte no preço do cache tem um impacto maior do que se poderia esperar. Um agente que reenvia um prompt de sistema longo e uma árvore de arquivos a cada turno paga tarifas de leitura de cache sobre a maior parte da sua entrada, e não tarifas de entrada nova. Reduzir isso de $0.50 para $0.20 por milhão muda a economia de sessões de longa duração muito mais do que a tarifa anunciada — e é a razão pela qual uma carga de trabalho que era marginalmente viável no Opus 5 pode se tornar claramente viável no Opus 5.5 sem qualquer alteração nos seus prompts.
As quatro mudanças interruptivas, como uma lista de verificação de migração
O Opus 5.5 é um novo modelo, e não um Opus 5 renomeado, e as notas de migração da Anthropic listam quatro mudanças que quebrarão código que já está em execução em produção:
• O Thinking não pode ser desativado. Qualquer caminho de código que desativava o Thinking gerará erro ou alterará o comportamento, e a profundidade agora é controlada apenas pelo parâmetro effort.
• O uso forçado de ferramentas retorna um erro. Um tool_choice que força uma ferramenta nomeada não é suportado.
• Os blocos de pensamento estão atrelados ao modelo que os produziu e à conversa, de modo que não podem ser reproduzidos entre modelos como alguns pipelines pressupõem.
• A anterior computer_20251124, ferramenta de uso do computador, não é aceita na API Claude ou no Google Cloud.
Há uma quinta mudança que não faz nenhum teste falhar e, portanto, é mais perigosa. O texto entre chamadas de ferramenta agora retorna dentro de blocos de pensamento cujo texto fica vazio na configuração de exibição padrão. Se seu aplicativo transmite esse texto aos usuários como atualizações de progresso, ele fica silencioso entre chamadas de ferramenta até você definir um valor de exibição que retorne o texto. Todos os testes passam; a interface simplesmente para de narrar.
Os três primeiros também se aplicam ao Claude Fable 5.1, portanto, uma equipe que já migrou para esse modelo já fez parte desse trabalho. Uma equipe que ainda está no Opus 5 não.
Quando o Opus 5 ainda é a escolha certa
A atualização não é automática, e há quatro razões reais para ficar:
• Previsibilidade de custos. O Opus 5 é um modelo que você já caracterizou. Se o seu orçamento é modelado com base no consumo de tokens dele, migrar para um modelo que pensa uma quantidade diferente no mesmo nível de esforço nominal invalida o modelo até que você faça uma nova medição.
• Compatibilidade. Se qualquer parte da sua stack depender de desativar o pensamento, forçar uma ferramenta ou a ferramenta mais antiga de uso do computador, a migração é trabalho de código, não uma simples troca de string.
• Roteamento de salvaguardas. O Opus 5.5 vem com salvaguardas da classe Fable 5.1, o que significa que a maioria das solicitações de cibersegurança é redirecionada para o Claude Opus 4.8 e trabalhos de biologia recorrem ao Claude Opus 5, a menos que sua conta seja verificada. Se o seu produto estiver em qualquer um desses domínios, "atualizar" pode significar que seus usuários recebem respostas de um modelo menor. O Opus 5 não tem esse roteamento.
• Longevidade. O Opus 5 não vai a lugar nenhum tão cedo — a Anthropic indica a reforma como não antes de 24 de julho de 2027, o que representa dez meses.
Para todos os outros, a conta é simples: mais capacidade, preço mais baixo, menos tokens e um checklist de migração que um único engenheiro consegue percorrer em um dia.
Executando ambos durante a troca

A parte incómoda de qualquer migração de um modelo de topo é o meio do caminho: quer o Opus 5.5 no tráfego novo sem apostar o caminho de produção num modelo que ainda não caracterizou com as suas próprias definições de esforço, e quer manter o Opus 5 a servir enquanto descobre. Isto é um problema de encaminhamento, e não de re-plataforma, e vale a pena ser preciso quanto ao que está onde. O Claude Opus 5 já está no OrcaRouter ao preço de tabela da própria Anthropic com 0% de margem — o preço de tabela do fornecedor é repassado diretamente, pelo que uma alteração de tarifa do fornecedor fica ativa do nosso lado no mesmo dia, em vez de só após uma sincronização. O Claude Opus 5.5 ainda não é uma das nossas rotas; está disponível através da própria API da Anthropic e das principais clouds. Quando chegar, passa a ser mais uma rota na mesma chave em vez de um segundo contrato e um segundo SDK, o que lhe permite colocar uma percentagem do tráfego no novo modelo enquanto o failover automático mantém o resto no que já caracterizou. Compor uma chamada entre os dois — um rascunho de um e uma passagem de verificação do outro — é uma linha de routing-DSL.
Seja preciso quanto ao que isso lhe traz. Isso não lhe dá um benchmark independente do Opus 5.5; nada ainda dá, porque as únicas comparações diretas publicadas são as da própria Anthropic, e os rastreadores independentes ainda estão definindo configurações de esforço. O que isso lhe dá é a única medição que é de fato preditiva da sua fatura, nos seus prompts, no nível de esforço que você vai colocar em produção.
A regra de decisão
Se você está começando algo novo, use o Claude Opus 5.5 e comece com esforço médio, depois meça se o baixo se sustenta na sua tarefa — a Anthropic relata que o baixo se aproxima das configurações mais altas em várias avaliações de código, com um custo muito menor, e os números do FrontierCode acima sugerem que o padrão não está deixando muita coisa na mesa.
Se você estiver executando o Claude Opus 5 em produção, o gatilho para migrar não é a tabela de benchmarks. É se você consegue absorver quatro mudanças de API e se sua carga de trabalho se enquadra em cibersegurança ou biologia, onde o roteamento de salvaguardas silenciosamente encaminhará parte do seu tráfego para um modelo menor. Todo o resto nesta atualização é um corte de preço vestindo as roupas de um lançamento de modelo, e vale a pena aproveitar.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
