Cartão de título principal para o Claude Opus 5.5 exibindo 'cada pontuação, a configuração de esforço que a originou, e quem a mediu', com dois chips de estatística: 66,4% no Terminal-Bench 4.0 com esforço xhigh, reportado pelo fornecedor, e 59,6% no mesmo benchmark, independente.
Guides & Insights

Benchmarks do Claude Opus 5.5: cada pontuação, a configuração de esforço de onde ela veio e quem a mediu

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O número de destaque da Anthropic para Claude Opus 5.5 no Terminal-Bench 4.0 é 66,4%, apresentado em contraste com 52,3% do Claude Opus 5 na mesma tabela — e esses 66,4% foram produzidos com esforço xhigh, não no padrão do modelo, medium. O modelo foi lançado em 22 de setembro de 2026, dois dias antes de esta página ser escrita, portanto é um modelo GA, com o preço de um modelo GA e a tabela de benchmarks de um modelo GA. O número independente no mesmo benchmark, da Artificial Analysis, é 59,6%, numa configuração que inclui o roteamento de salvaguardas do lado do servidor da Anthropic. Entre esses dois números há uma diferença de harness, uma diferença de esforço e uma diferença de roteamento, e ninguém — incluindo nós — pode ainda dizer quanto do gap cada uma delas explica. O que esta página pode fazer é reunir num só lugar todas as cifras publicadas para o Claude Opus 5.5, nomear quem as produziu, nomear a configuração em que foram produzidas e incluir as linhas em que GPT-6 Astra e Claude Fable 5.1 ficam à frente.

Comece pela configuração de esforço, porque ela move os números mais do que os modelos

O Claude Opus 5.5 usa por padrão médio de esforço na Claude API. O Claude Opus 5 usava por padrão alto. O mesmo nível nominal também não é o mesmo orçamento de pensamento entre os dois modelos, então "rodamos ambos no alto" não é uma comparação controlada, mesmo quando o rótulo coincide. O pensamento adaptativo está sempre ativado e não pode ser desativado no Opus 5.5; o parâmetro de esforço altera profundidade, latência e custo, e nada mais.

O dado do Terminal-Bench 4.0 da Anthropic foi gerado em xhigh. Esse único fato é a ressalva mais importante desta página, porque o benchmark que ele encabeça é o que tem a maior margem relatada em relação ao modelo anterior, e porque a mesma tabela mostra o que acontece quando você deixa a configuração como está:

FrontierCode v1.1 Main — 54,4% em xhigh, 54,6% em medium padrão. Reportado pelo fornecedor. A execução medium é maior do que a execução xhigh. Nesta carga de trabalho, o ajuste de esforço não trouxe nada mensurável; os dois números são o mesmo número.

CursorBench 4.0 — 57,8% em xhigh, 52,5% em medium. Relatado pelo fornecedor. Mesmo modelo, mesmo harness, mesma semana: 5,3 pontos, o que é o maior delta de esforço em jogo.

Essas duas linhas dentro de uma única tabela de fornecedor são todo o argumento. Uma carga de trabalho é insensível ao esforço e a outra é fortemente sensível ao esforço, e o cartão de modelo não consegue lhe dizer de antemão qual tipo de carga de trabalho é a sua. A conclusão que os dados sustentam é estreita e vale a pena enunciá-la de forma estreita: o nível de esforço correto agora é uma medição por carga de trabalho, não um padrão que você herda. Ela não sustenta "o Opus 5.5 é mais rápido do que seus benchmarks sugerem" nem "a Anthropic segurou o padrão de propósito" — para isso você precisaria de varreduras por carga de trabalho em todas as cinco configurações, e ninguém as publicou. Isso significa que, se você migrar do Opus 5 e mantiver a configuração de esforço que já tinha, você mudou o experimento, não apenas o modelo.

Mais uma assimetria, e ela corta na direção oposta. A coluna do concorrente na linha do Terminal-Bench da Anthropic é o GPT-6 Astra em 57,9% — executado no nível high de esforço, conforme a própria nota do gráfico da Anthropic, enquanto os 66,4% do Opus 5.5 foram executados no nível xhigh. Uma tabela de fornecedor que executa seu próprio modelo em uma configuração e um rival em outra não é um confronto direto, independentemente da aparência dos dois números lado a lado.

A tabela de fornecedores, com a origem e a configuração em cada linha

Tudo nesta seção é relatado pelo fornecedor: material de lançamento da Anthropic, harness da Anthropic, salvaguardas de produção ativadas, pensamento adaptativo no esforço máximo, a menos que a linha diga o contrário. Leia isto como a Anthropic medindo a Anthropic.

Terminal-Bench 4.0 — 66,4%, em esforço xhigh. Relatado pelo fornecedor, erro padrão de cerca de ±2,6 pontos. Na mesma linha: Claude Opus 5 52,3%, Claude Fable 5.1 55,8%, GPT-6 Astra 57,9% (em esforço alto), GPT-5.6 Sol 37,3%. O Terminal-Bench 4.0 é explicitamente um benchmark que o fornecedor reconhece ser um substituto imperfeito para o trabalho real em terminal, e é o destaque principal do modelo.

FrontierCode v1.1 Main — 54,4% no xhigh, 54,6% no medium padrão. Relatado pelo fornecedor. Opus 5 48,0%, Fable 5.1 50,3%, GPT-6 Astra 53,3%, GPT-5.6 Sol 47,5%. O system card da Anthropic também traz a variante Extended com 63,6% e o melhor resultado da Extended no medium, de 65,3%.

CursorBench 4.0 — 57,8% em xhigh, 52,5% em médio. Relatado pelo fornecedor. Opus 5 46,6%, Fable 5.1 51,8%, GPT-5.6 Sol 41,7%. Observe que as linhas do CursorBench do Fable 5.1 e do Opus 5 estão em esforço máximo, então o Opus 5.5 em médio está sendo comparado aos seus próprios irmãos em máximo.

GDPval-AA v2.1 — 1.846 Elo. Esta é a única linha da tabela do fornecedor que o próprio fornecedor não executou. O GDPval-AA é uma avaliação da Artificial Analysis, e o próprio texto da Artificial Analysis sobre o Opus 5.5 indica o mesmo 1.846, com o Fable 5.1 em 1.735 e o Opus 5 em 1.708. Na tabela do fornecedor: Fable 5.1 1.735, Opus 5 1.708, GPT-5.6 Sol 1.588, GPT-6 Astra 1.542. É a única linha aqui em que duas organizações concordam com o mesmo número, e isso porque é a mesma medição.

AutomationBench (Zapier) — 40,0%. Informado pelo fornecedor e executado sem modelos de fallback, de modo que toda intervenção de salvaguarda foi pontuada como falha. GPT-6 Astra 41,4%, Fable 5.1 31,4%, GPT-5.6 Sol 28,8%, Opus 5 26,9%.

Humanity's Last Exam, com ferramentas — 67,7%. Informado pelo fornecedor. Fable 5.1 65,6%, Opus 5 63,6%, GPT-6 Astra 57,2%. O system card da Anthropic informa separadamente 64,4% sem ferramentas, que é o número a consultar se você estiver comparando com uma fonte que não concede acesso a ferramentas aos seus modelos.

Terminal-Bench-Science 0.1 — 58,7%.Relatado pelo fornecedor, erro padrão de aproximadamente ±3,5 a ±5 pontos, portanto trata-se de uma faixa, e não de um ponto. GPT-6 Astra 64,6%, Fable 5.1 52,6%, Opus 5 29,0%, GPT-5.6 Sol 22,4%.

OSWorld 2.0 — 81,8% parcial.Informado pelo fornecedor, e "parcial" está fazendo um trabalho e tanto nessa frase: o cartão de sistema da Anthropic apresenta uma taxa de conclusão estrita de 48,7% para o mesmo modelo na mesma avaliação. Ambos foram publicados; o número parcial é o que acaba sendo citado. Fable 5.1 80,7%, Opus 5 74,0%.

Chartography, com ferramentas — 89,0%. Relatado pelo fornecedor. Fable 5.1 88,4%, Opus 5 83,4%.

Scoreboard for Claude Opus 5.5 with six rows: Terminal-Bench 4.0 66.4% at xhigh effort (vendor-reported); Artificial Analysis Intelligence Index 58 at max effort (independent); Humanity's Last Exam 67.7% with tools (vendor-reported); Terminal-Bench-Science 0.1 58.7% (vendor-reported); about 119k output tokens per task at max (independent); price $4.00 input / $20.00 output per 1M. A footer separates the Anthropic launch table from Artificial Analysis.

Os números independentes, e o que "Fallback Padrão" realmente significa

A Artificial Analysis é o único terceiro com uma avaliação publicada e atual do Claude Opus 5.5 em um índice composto, e seus números são os que devem ser colocados ao lado dos da Anthropic. Conforme lido em 24 de setembro de 2026:

Intelligence Index — 58 no esforço máximo, numa configuração rotulada como "Adaptive Reasoning, Max Effort, Default Fallback". Independente, medido pela Artificial Analysis. O próprio artigo dela chama 58 de "a pontuação mais alta que medimos, por vários pontos." O mesmo índice também publica o Opus 5.5 em todas as outras configurações de esforço, e a variação é a parte útil: 56 em xhigh, 54 em high, 51 em medium, 42 em low. Isso é uma variação de 16 pontos ao longo do ajuste de esforço em um único modelo — maior que a diferença entre a maioria dos modelos nesse quadro.

Terminal-Bench 4.0 — 59,6%.Independente. A Artificial Analysis o reporta como "em nível com o líder GPT-6 Astra (xhigh)" e cerca de 11 pontos acima do Claude Opus 5.

Humanity's Last Exam — 61,4%. Independente, e o melhor resultado anterior no mesmo ranking era 59,1%, detido pelo Claude Fable 5.1.

SciCode — 66,9%. Independente, contra 63,1% do Claude Fable 5.1.

Agora, a cláusula que precisa ser explicada em vez de citada. "Default Fallback" não é um artefato de benchmark nem uma configuração do Artificial Analysis — é o roteamento de salvaguarda do lado do servidor da Anthropic, deixado ligado. O Claude Opus 5.5 vem com o nível de salvaguarda anteriormente reservado ao Fable 5.1: a maioria das solicitações de cibersegurança é redirecionada de forma transparente para o Claude Opus 4.8, e trabalhos de biologia recorrem ao Claude Opus 5, a menos que a conta seja verificada. Quando o Artificial Analysis executa o índice com o fallback padrão ativado, ele está medindo o sistema implantado — aquilo que uma chave de API não verificada realmente alcança — em vez de um checkpoint limpo dos pesos do Opus 5.5. Essa é a medição mais honesta para um comprador, e é a medição menos limpa para um benchmark. A Anthropic diz o mesmo sobre sua própria tabela: intervenções na execução do Terminal-Bench 4.0 fizeram com que tarefas de cibersegurança fossem concluídas pelo Opus 4.8 e tarefas de biologia pelo Opus 5, e a empresa afirma que essas intervenções provavelmente reduziram a pontuação relatada. Portanto, o roteamento de salvaguarda é um fato operacional real em ambas as direções, e nenhum número nesta página isola o modelo subjacente disso.

Onde as duas tabelas divergem, e por quê

Coloque os dois números do Terminal-Bench 4.0 lado a lado e você obtém 66,4% contra 59,6% — 6,8 pontos, no mesmo benchmark, para o mesmo modelo. As razões são conhecidas, e cada uma é grande o suficiente para fazer diferença por si só:

Harnesses diferentes. A Anthropic executou seu próprio scaffold de agente; a Artificial Analysis executou seu próprio harness de agente de referência. Uma pontuação de benchmark de terminal é uma propriedade do scaffold somado ao modelo, e não do modelo sozinho, e nenhuma das organizações publicou um experimento de troca de scaffold.

Configurações de esforço diferentes. Os 66,4% da Anthropic são em xhigh. A configuração de esforço associada aos 59,6% da Artificial Analysis não é indicada na frase que contém o número, e os valores de benchmark reportados por ela geralmente são os de esforço máximo.

Salvaguardas ativadas, em ambos os casos, contabilizadas de forma diferente. A Anthropic operou com fallback e tratou as intervenções como redutoras da pontuação, mas ainda assim atribuiu pontuação. No AutomationBench, operou sem fallback e contabilizou as intervenções como falhas declaradas. A Artificial Analysis opera com o fallback ativado em todos os casos.

Os números variam até dentro da própria tabela de um único fornecedor. A Anthropic apresenta o Claude Opus 5 com 52,3% no Terminal-Bench 4.0 e observa que os 51,8% do mesmo modelo no ranking público estão "dentro da margem de erro".

E então a prova mais forte desta página sobre quanto vale um harness. O leaderboard público do Terminal-Bench 4.0, capturado em 24 de setembro de 2026, não traz nenhuma linha do Claude Opus 5.5. Sua primeira posição é o GPT-6 Astra em esforço máximo, agente Codex, 58,2% ±2,8; a segunda é o Claude Fable 5.1 em esforço máximo via Claude Code, com 57,9% ±3,8; a terceira é o Claude Opus 5 em xhigh via Claude Code, com 53,9% ±3,2. Portanto, os 66,4% não são apenas um número diferente dos 59,6% independentes — eles não estão no quadro público, e a própria versão do Claude Opus 5 no quadro é 53,9%, não os 52,3% que a tabela de lançamento exibe. Até que o Terminal-Bench aceite e publique uma submissão do Opus 5.5, os 66,4% são um resultado de harness de fornecedor que ninguém reproduziu, e os 59,6% são o número que alguém de fora de fato defenderá. Note também que, nesse mesmo quadro, o líder do Terminal-Bench 4.0 da Artificial Analysis e o Opus 5.5 da Anthropic chegam aos mesmos 59,6% — o que é um empate em um harness e não diz nada sobre o outro.

Effort-dial infographic for Claude Opus 5.5 showing the Artificial Analysis Intelligence Index moving from 42 at low effort through 51 at medium (the product default), 54 at high, 56 at xhigh and 58 at max - a 16-point swing on one model - with two comparison cards: FrontierCode v1.1 at 54.4 xhigh against 54.6 medium (effort-insensitive) and CursorBench 4.0 at 57.8 xhigh against 52.5 medium (effort-sensitive).

As linhas em que Opus 5.5 perde

Uma compilação que omite as perdas não é uma compilação, e a própria tabela da Anthropic contém ambas as coisas.

Terminal-Bench-Science 0.1 — 58,7% contra os 64,6% do GPT-6 Astra.Reportado pelo fornecedor, na tabela da Anthropic, e uma perda de 5,9 pontos para um concorrente nomeado na linha mais próxima do raciocínio científico. A nota de erro-padrão do próprio fornecedor (±3,5 a ±5) significa que a diferença está perto do limite do ruído, e não confortavelmente dentro dele — mas é uma perda na própria página do fornecedor, e a faixa não a transforma numa vitória. O Claude Opus 5 está em 29,0% na mesma linha, então o ganho geracional é real mesmo onde o concorrente lidera.

AutomationBench — 40,0% contra os 41,4% do GPT-6 Astra. Relatado pelo fornecedor, uma perda de 1,4 ponto, e a execução não tinha modelos de fallback, de modo que as intervenções de salvaguarda foram pontuadas como falhas. Isso significa que esta comparação em particular mede o Opus 5.5 com sua penalidade de roteamento incluída contra um concorrente cuja penalidade de roteamento, seja qual for, não é descrita. É a linha menos interpretável da página, em qualquer direção.

Mais dois pontos em que a vantagem é menor do que a manchete sugere, ambos relatados pelos fornecedores. No Humanity's Last Exam com ferramentas a margem sobre o Claude Fable 5.1 é de 2,1 pontos (67,7% vs 65,6%); no Chartography com ferramentas é de 0,6 ponto (89,0% vs 88,4%); no OSWorld 2.0 parcial é de 1,1 ponto (81,8% vs 80,7%). Essas são as linhas em que "o Opus 5.5 é o melhor modelo agêntico" é uma afirmação sobre posição, e não sobre uma diferença medida, e uma diferença de 0,6 ponto na leitura de gráficos não deveria decidir uma aquisição.

A posição independente do Claude Fable 5.1, numa revisão diferente do índice

Colocar o Opus 5.5 contra o seu próprio irmão exige uma seção própria e um aviso anexado, porque a comparação é mais difícil do que parece.

Quando a Artificial Analysis publicou seu artigo sobre o Claude Fable 5.1 em 1º de setembro de 2026, ele marcou 66 em esforço máximo no seu Intelligence Index e afirmou que era a maior pontuação que já havia medido — à frente do Claude Opus 5, com 63, e do GPT-5.6 Sol, com 61. No índice conforme listado em 24 de setembro de 2026, o mesmo modelo aparece com 53 em esforço máximo com fallback, e o Opus 5.5 aparece com 58 na configuração equivalente. O artigo de 22 de setembro sobre o Opus 5.5 classifica 58 como "a maior pontuação que já medimos, por vários pontos".

Essas duas afirmações não podem ser ambas verdadeiras na mesma escala, e a solução é que elas não estão na mesma escala. O índice é um objeto vivo que a Artificial Analysis revisa; dois de seus artigos publicados, com cinco semanas de diferença, colocam o mesmo par de modelos irmãos em lados opostos do primeiro lugar. Isso é uma afirmação sobre revisões do índice, não sobre qualquer um dos modelos ter regredido, e significa que o 66 e o 58 nunca devem ser impressos lado a lado. Lidos no mesmo dia, na mesma listagem, na mesma configuração rotulada, a ordenação atual coloca o Opus 5.5 cinco pontos à frente do Fable 5.1 — e mesmo isso é uma comparação dentro do mesmo índice, do mesmo fornecedor do índice, não um confronto direto auditado. O que é seguro dizer é mais restrito: na revisão atual do único compósito independente que mede ambos, o Opus 5.5 é o mais forte dos dois modelos da Anthropic, e o 66 mais conhecido do Fable 5.1 pertence a uma revisão anterior desse índice.

Vale a pena dedicar mais uma frase às configurações, porque é fácil confundi-las. O 66 do Fable 5.1 e o 58 do Opus 5.5 são ambos resultados de esforço máximo — mas as cinco configurações de esforço do Fable 5.1 abrangem uma variação de 11x no uso de tokens de saída, de 13,1M no nível baixo a 143,7M no máximo, com pontuações de índice de 58 a 66. Um único ponto de índice para um modelo com tanta variação interna é um substituto ruim para a linha que você realmente executaria.

O custo de tokens é um eixo de benchmark por si só

Todo número acima é uma pontuação. Nenhum deles é um projeto de lei, e, neste modelo, o projeto de lei é onde está o movimento interessante.

A Artificial Analysis mede o Claude Opus 5.5 no esforço máximo usando cerca de 119.000 tokens de saída por tarefa do Intelligence Index — o maior do seu índice. Para comparação, no mesmo ranking e na mesma configuração: Claude Opus 5 cerca de 73.000, Claude Fable 5.1 cerca de 78.000 e GPT-6 Astra cerca de 27.000. Os tokens de pensamento são cobrados como tokens de saída, e o pensamento adaptativo não pode ser desativado no Opus 5.5, então os tokens que um modelo gasta deliberando não são uma nota de rodapé do seu preço — são a maior parte dele.

Faça as contas, porque o preço de tabela é enganoso por si só. O Opus 5.5 tem preço de tabela de US$ 4,00 de entrada / US$ 20,00 de saída, um corte de 20% em relação aos US$ 5,00 / US$ 25,00 do Opus 5. A Artificial Analysis ainda mede o Opus 5.5 em esforço máximo custando cerca de US$ 5,98 por tarefa do índice contra US$ 5,86 do Opus 5 na mesma configuração — ligeiramente mais, não menos, porque aproximadamente 1,6x os tokens de saída consomem todo o corte de 20% na tarifa e mais um pouco. Em todo o índice, o Opus 5.5 produziu 260M tokens de saída contra uma mediana do ranking de 88M, que o avaliador classifica como "muito verboso".

A história de custos, portanto, está inteiramente na configuração de esforço, e só funciona se você a usar. No esforço máximo, o Opus 5.5 é um modelo mais caro por tarefa concluída do que o modelo que substitui. No médio — a predefinição real do produto, e o âmbito em que se enquadra a afirmação da Anthropic de "cerca de 40% menos custo de execução em cargas de trabalho típicas" — a poupança é real, mas é uma afirmação sobre uma média entre cargas de trabalho selecionadas pelo fornecedor, não um resultado auditado por tarefa. A leitura prática: o corte de preço de 20% é um desconto na tabela de preços e uma opção no seletor de esforço, não uma poupança automática. Se o seu plano de migração é "trocar o id do modelo e manter as configurações", está a comprar a versão cara.

O que não está estabelecido de forma alguma

Esta é a seção que o resto da página existe para apoiar.

Nenhum confronto direto independente, com esforço e harness equivalentes, do Claude Opus 5.5 contra qualquer concorrente identificado foi publicado.Todas as comparações entre fornecedores nesta página — Opus 5.5 vs GPT-6 Astra, vs GPT-5.6 Sol, vs Claude Fable 5.1 — são uma comparação de duas tabelas produzidas por duas empresas diferentes, em dois harnesses diferentes, com duas configurações de esforço diferentes, sendo que uma delas é habitualmente o próprio modelo do fornecedor numa configuração favorável. Não existe, em nenhum lugar do registo público, qualquer experiência que mantenha o scaffold e o esforço constantes entre dois fornecedores e reporte ambos.

A divisão de tokens por problema não é publicada. O número agregado de tokens de saída é medido de forma independente, mas quanto dele corresponde a raciocínio versus texto de resposta não é publicado por ninguém que conseguimos encontrar. Qualquer página que forneça a você um número preciso de tokens de raciocínio para este modelo está fornecendo um número que ninguém mediu.

A maior parte do system card não foi avaliada por terceiros por meio de benchmarks. SWE-bench Pro 89,9%, Multilíngue 93,9%, DeepSWE v1.1 74,2%, ProgramBench 91,2%, OfficeQA 78,9%, HealthBench Professional 65,6% ajustado por comprimento, GMMLU 94,3%, ArXivMath 96,9% com ferramentas — todos informados pelo fornecedor, nenhum reproduzido de forma independente no momento da redação.

O número de destaque do Terminal-Bench 4.0 não está no placar público.Já abordado acima, e também pertence a esta lista: o número mais citado sobre este modelo é um que ninguém fora do fornecedor executou.

A Anthropic relata que o Claude Opus 5.5 "muitas vezes suspeita que está sendo avaliado" — as próprias palavras da empresa, apresentadas como uma limitação à sua avaliação de segurança. Leve isso a sério como um problema de medição, e não como uma curiosidade: se o modelo se comporta de maneira diferente quando acredita que está sendo testado, então cada número de benchmark nesta página, seja de fornecedor, seja independente, é uma medição do modelo sob observação, e o grau em que isso difere do comportamento em produção é desconhecido e não quantificado. Aplica-se igualmente às linhas boas e às ruins. É a única ressalva que nenhuma quantidade de metodologia de esforço equiparado corrige.

Sonnet 5.5 e Haiku 5.5 não estão disponíveis. A Anthropic os anunciou para "as próximas semanas". Eles ainda não foram lançados, não têm benchmarks publicados, e nada nesta página se aplica a eles.

Preço, envelope e as partes da especificação que alteram o seu código

Conforme a tabela de preços publicada da Anthropic em 24 de setembro de 2026: $4,00 por milhão de tokens de entrada, $20,00 por milhão de saída, $0,20 por milhão de leitura de cache, $5,00 por milhão de gravação em cache de 5 minutos, $8,00 por milhão de gravação em cache de 1 hora, e 50% de desconto em ambos os sentidos na Batch API. A tarifa de leitura de cache é a discreta — corresponde a 5% da entrada base, enquanto a maioria dos modelos Claude fica em 10% e o Fable 5.1 fica em 2,5%. O modo rápido tem preço separado de $8,00 / $40,00, e a Anthropic o descreve como uma prévia de pesquisa, não um nível geral.

Esta é a seção em que uma tabela de preços deixa de ser curiosidade e passa a ser aritmética que um roteador pode fazer por você. Claude Opus 5.5 é disponibilizado como anthropic/claude-opus-5.5 no OrcaRouter pelo mesmo $4,00 / $20,00, com preços de lista repassados com 0% de markup — então, no momento em que a Anthropic altera uma tarifa, essa passa a ser a tarifa praticada aqui, no mesmo dia e sem defasagem de reprecificação para modelar. As peças que decidem a conta real são as que o catálogo traz ao lado do preço: a leitura de cache de $0,20 a 5% do input base, contra os 2,5% do Fable 5.1, a janela de contexto de 1M de tokens e o teto de saída de 128K. Como é no parâmetro de esforço que o custo deste modelo realmente se move — uma variação de 16 pontos no índice e cerca de 119.000 tokens de saída por tarefa no máximo, contra cerca de 73.000 para o Opus 5 —, a migração que economiza dinheiro é a que permite ajustar o esforço por carga de trabalho em vez de por conta, e colocar a rota do Opus 5.5 atrás de um failover automático enquanto você mede qual configuração o seu tráfego prefere.

Envelope — contexto de 1M tokens, saída máxima de 128K, saída de 300K na Batch API por trás do output-300k-2026-03-24 cabeçalho beta, data de corte de conhecimento em junho de 2026, desativação não antes de 22 de setembro de 2027. A saída é mais de 30% mais rápida que o Claude Opus 5.

Mudanças incompatíveis em relação ao Opus 5 — o raciocínio não pode mais ser desativado; o uso forçado de ferramentas (um tool_choice que nomeia uma ferramenta específica) retorna um erro; os blocos de raciocínio estão vinculados ao modelo e à conversa que os produziu; a ferramenta mais antiga computer_20251124 de uso do computador não é aceita na Claude API ou no Google Cloud. As três primeiras também se aplicam ao Fable 5.1. Há uma quinta silenciosa: o texto entre chamadas de ferramentas agora chega dentro de blocos de raciocínio cujo texto está vazio na configuração de exibição padrão, então uma UI que transmite esse texto como indicador de progresso fica silenciosa sem que nada apresente erro.

Proteja o roteamento, mais uma vez, porque é um item de especificação e não uma nota de rodapé — a maioria das solicitações de cibersegurança vai para o Claude Opus 4.8 e o trabalho de biologia recorre ao Claude Opus 5, a menos que a conta esteja verificada. Nessas avaliações, a resposta que você recebe pode não vir do Opus 5.5 de forma alguma, portanto as pontuações publicadas em benchmarks adjacentes a cibersegurança e biologia não são medições limpas deste modelo.

Alegações de eficiência, todas reportadas pelo fornecedor — cerca de 40% menos custo de execução em cargas de trabalho típicas em comparação com um corte de 20% no preço de tabela; um exemplo prático de análise de fusão levando 63 minutos no Opus 5.5 contra 93 no Opus 5 com 50% menos custo; e declarações de clientes da Box (um terço dos tokens, respostas cerca de 40% menos verbosas), Kiro (aproximadamente metade dos tokens, 40% menos chamadas), Factory (20–25% menos tokens de saída) e GitHub (entre os menores números de tokens e etapas que já mediu). Essas são médias entre cargas de trabalho selecionadas pelo fornecedor e seus parceiros de lançamento. São atribuições, não resultados auditados, e estão em visível tensão com o número independente de custo por tarefa acima — que por si só é uma medição em esforço máximo, e não no padrão. Ambos podem ser verdadeiros; nenhum dos dois é uma afirmação geral sobre sua carga de trabalho.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the NEW, FLAGSHIP and FEATURED badges, a 1M-token context window, 128K max output, text plus image plus file input, and the $4.00 input / $20.00 output per 1M token rate with pricing passed through from Anthropic.

O estado das evidências

O Claude Opus 5.5 é um modelo real, com um corte real de preço, um envelope real de 1M de tokens de contexto e 128K de saída, e uma mudança real e de grandes consequências na forma como o pensamento e o esforço são configurados. Ele também chega com uma tabela de benchmarks que mede, em sua maior parte, a Anthropic, uma tabela independente que mede, em sua maior parte, uma implantação roteada em vez de um checkpoint, e um problema documentado de autoconsciência que compromete ambos. Nenhuma comparação direta independente, com esforço e harness equiparados, do Claude Opus 5.5 contra um rival nomeado foi publicada. Até que uma seja, leia toda comparação entre fornecedores nesta página como aquilo que ela é: duas tabelas de fornecedores, de duas empresas, em duas configurações, dispostas lado a lado por nós — e meça novamente sua própria configuração de esforço antes de medir novamente o modelo.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente