Cartão de título hero gerado para Claude Sonnet 5.5 vs Claude Opus 5.5, com o subtítulo 'Os benchmarks convergem, a conta não', mostrando US$ 2,00 e US$ 10,00 por milhão de tokens à esquerda contra US$ 4,00 e US$ 20,00 à direita, com o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Claude Sonnet 5.5 vs Claude Opus 5.5: os benchmarks convergem, a conta não

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Claude Sonnet 5.5 atingiu disponibilidade geral em 28 de setembro de 2026, a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída. O Claude Opus 5.5, carro-chefe da Anthropic, foi lançado seis dias antes, em 22 de setembro, a US$ 4,00 e US$ 20,00 — exatamente o dobro em ambas as linhas. A leitura óbvia é que o Opus 5.5 é o teto e o Sonnet 5.5 é a concessão que você faz quando o orçamento é real. A própria tabela de lançamento da Anthropic não sustenta essa leitura. Nos números publicados pela empresa, o Claude Sonnet 5.5 registra 1844 contra 1846 do Opus 5.5 no GDPval-AA v2.1, 1811 contra 1822 no AA-Briefcase v1.1, e 70,6% contra 66,4% no Terminal-Bench 4.0 — ele vence o único benchmark que mede trabalho realmente realizado dentro de um terminal. Duas linhas abaixo desses números, a própria legenda da Anthropic afirma que o Opus 5.5 "permanece claramente mais forte em trabalhos complexos e abertos". Ambas as afirmações são verdadeiras, e descobrir como sustentá-las ao mesmo tempo é a maior parte do propósito desta comparação.

O que a tabela de lançamento diz, e o que ela se recusa a dizer

O padrão no bloco de benchmarks da Anthropic é o de um modelo que fechou a maior parte da diferença, e não o de um que assumiu a liderança. O GDPval-AA v2.1, um conjunto de tarefas com peso econômico, é um empate de dois pontos. O AA-Briefcase v1.1, uma avaliação de documentos e entregáveis, é um empate de onze pontos. O CursorBench 4.0 vai na direção oposta: 55,5% para o Sonnet 5.5 contra 57,8% para o Opus 5.5. O OSWorld 2.1 fica em 80,1% contra 81,8%, e o Humanity's Last Exam em 64,5% com ferramentas contra 67,7%. Apenas o Terminal-Bench 4.0 quebra o padrão, e quebra com força — 70,6% contra 66,4%, uma vantagem de quatro pontos do Sonnet em trabalho agêntico de linha de comando.

Leia os rótulos das linhas em vez dos números e algo mais aparece. Várias dessas entradas do Opus 5.5 trazem uma anotação de esforço — 66,4% em Xhigh — e uma nota de rodapé afirma que a configuração Max obtém pontuação inferior a Xhigh no FrontierCode, não superior. Mais esforço não é monotônico. Uma equipe preocupada com o orçamento que assume que o "esforço máximo" é uma melhoria gratuita está comprando tokens para obter uma resposta pior em pelo menos um dos próprios testes da Anthropic. E no FrontierCode 1.1, a mesma nota de rodapé coloca o Sonnet 5.5 em 46,2% na configuração Max, contra 54,4% do Opus 5.5, que é o número isolado mais claro de onde o modelo principal ainda abre vantagem: trabalho de código de horizonte longo sob uma definição de tarefa que recompensa a persistência.

Há mais uma ressalva que vale a pena declarar claramente em vez de enterrar. A Anthropic observa que as execuções do GDPval-AA e do AA-Briefcase que ela publica foram realizadas em uma implantação de pré-lançamento que carregava um bug de saídas estruturadas. Isso afeta ambos os modelos na mesma tabela, então a comparação não é invalidada, mas significa que os números absolutos devem ser tratados como um instantâneo, e não como um resultado definitivo. Tabelas de benchmarks de fornecedores são artefatos de marketing com um apêndice de metodologia, e esta vem com seu apêndice anexado.

Onde a medição independente cai

O Artificial Analysis avalia ambos os modelos em um único harness, na mesma configuração que ele denomina "Raciocínio Adaptativo, Esforço Máximo, Fallback Padrão," no Intelligence Index v4.3. O Claude Opus 5.5 está em 58. O Claude Sonnet 5.5 está em 56. Isso é uma diferença de dois pontos em uma escala na qual o mesmo avaliador coloca o Opus 5 em 51, o Sonnet 5 em 38, o DeepSeek V4 Pro em 36 e o Gemini 3.1 Pro Preview em 30. Um novo Sonnet chegando dois pontos abaixo do carro-chefe e cinco pontos acima da geração anterior do Opus é a afirmação substancial deste lançamento, e é uma afirmação de terceiros e não do fornecedor.

Então, a mesma página inverte a economia disso. A Artificial Analysis relata que uma execução de avaliação do Sonnet 5.5 custa US$ 7,60 por tarefa, contra US$ 5,98 do Opus 5.5, embora o Sonnet 5.5 tenha metade do preço por token. A causa está bem ali na página: o Sonnet 5.5 gerou 410 milhões de tokens em toda a suíte de índices, contra uma mediana de 88 milhões para os modelos que ela acompanha — "muito verboso", nas palavras do avaliador. O Opus 5.5 gerou 260 milhões na mesma suíte. A US$ 10 por milhão de tokens de saída contra US$ 20, o fator de verbosidade de aproximadamente 1,6 ainda deixa o Sonnet 5.5 pagando cerca de 27% mais por tarefa concluída.

Esta é a parte da comparação que uma tabela de preços por token não consegue mostrar, e é por isso que os dois valores coexistem sem contradição. Por token, o Sonnet 5.5 custa metade. Por tarefa concluída, num conjunto de avaliação com prompts abertos e sem disciplina de comprimento de saída, pode ser mais caro. A decisão real é saber qual dessas situações descreve a sua carga de trabalho.

Níveis de esforço, tetos de saída e a forma da integração

Para um comprador, as propriedades mecanicamente importantes são quase idênticas entre estes dois modelos.

• Contexto — 1.000.000 de tokens em ambos, do mesmo provedor, portanto as suposições de engenharia de prompt se transferem sem alteração

• Saída máxima — 128.000 tokens em ambos; a geração em massa não é um diferencial aqui

• Modalidade — entrada de texto, imagem e arquivo em ambos; nenhum dos dois aceita áudio ou vídeo

• Controle de raciocínio — pensamento adaptativo em ambos, com a profundidade definida por um parâmetro de esforço em vez de um orçamento de tokens de pensamento. Na Claude Platform, o padrão é alto; nos Claude apps, é médio

• Escrita de cache — US$ 5,00 por milhão para o Claude Opus 5.5 contra US$ 2,50 para o Claude Sonnet 5.5, a única linha em que o modelo mais barato também é o modelo mais barato de alimentar com um prefixo reconstruído

• Leitura de cache — $0,20 por milhão em ambos, um empate exato na linha que domina execuções longas de agentes

Como as superfícies coincidem, a migração entre elas é uma mudança de string de modelo e uma nova medição do esforço, não um projeto de integração. Isso é incomum entre fornecedores e é a razão pela qual este par específico vale a pena comparar: os dois candidatos diferem em preço e em profundidade, não na API que você precisa escrever.

Uma diferença operacional merece uma linha própria. A Anthropic afirma que Claude Sonnet 5.5 é o primeiro Sonnet a ser lançado com salvaguardas cibernéticas e fallbacks no mesmo patamar dos seus modelos de topo, o que significa que pedidos de cibersegurança de maior risco são visivelmente encaminhados para o Sonnet anterior em vez de serem respondidos pelo modelo que indicou. Se a sua carga de trabalho tocar nesse domínio, a string do modelo não é garantia de qual modelo respondeu — em nenhum dos níveis. A Anthropic também observa que, se executar o Sonnet com o thinking desativado, tem de mudar para um comportamento between-tools, o que é uma alteração de código e não uma flag de configuração. Nenhum desses pontos é razão para evitar o modelo; ambos são razões para saber antes de colocar em produção.

Na OrcaRouter, o Claude Opus 5.5 já pode ser roteado hoje com a mesma credencial que qualquer outro modelo do catálogo, ao preço de tabela do provedor, com 0% de margem, com failover automático disponível por baixo. O Claude Sonnet 5.5 ainda não é uma rota na nossa plataforma — o modelo tem um dia de vida e, enquanto não estiver listado, a declaração honesta é que você o acessaria pela própria API da Anthropic. Qualquer pessoa que atualmente executa o Opus 5.5 por meio de nós pode calcular o preço da troca no dia em que ela chegar sem mudar mais nada na sua integração.

Qual deles colocar onde

A divisão que decorre dos números: Claude Sonnet 5.5 para trabalho de agente vinculado ao terminal, onde é o mais forte dos dois no próprio número do Terminal-Bench 4.0 da Anthropic e custa metade do preço; Claude Sonnet 5.5 para qualquer coisa com perfil de throughput, já que a diferença de custo só diminui quando a tarefa exige saídas longas; Claude Opus 5.5 para trabalho da classe FrontierCode, refatorações de horizonte longo em grandes bases de código, e qualquer carga de trabalho em que a margem de 54,4% a 46,2% reflita o formato do seu problema real e não uma linha de ranking.

Se suas tarefas são abertas e você não consegue prever o comprimento da saída, trate o preço por token como o número totalmente errado. Meça tokens por tarefa concluída no seu próprio tráfego durante uma semana antes de se decidir por um caminho ou pelo outro; o número da artificial-analysis de $7.60 contra $5.98 é um aviso de que o modelo barato pode sair perdendo na métrica que você realmente paga.

O veredito honesto: isto já não é uma troca entre capacidade e custo. É uma questão de saber se o seu trabalho é limitado. Para tarefas limitadas, de grande volume e orientadas por ferramentas, o modelo mais barato é também o melhor com base nas evidências disponíveis, e o modelo principal não vale o dobro. Para trabalho aberto e de longo prazo, a própria frase da Anthropic — de que o Opus 5.5 continua claramente mais forte — é a que se deve acreditar, e nenhuma quantidade de convergência de benchmarks muda isso por enquanto.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5.5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56 at $7.60 per task, Terminal-Bench 4.0 (vendor) 70.6%, GDPval-AA v2.1 (vendor) 1844. Right column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, cache write $5.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 58 at $5.98 per task, Terminal-Bench 4.0 (vendor) 66.4%, GDPval-AA v2.1 (vendor) 1846. The card heading reads "Claude Sonnet 5.5 against Claude Opus 5.5: eight rows, two of them on a different instrument", and a footer line reads "Per-token prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Terminal-Bench and GDPval-AA rows are Anthropic's own launch table, run on a pre-release deployment, and are not the same instrument as the index."Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 4.57-second p50 time to first token, and the $4.00 input and $20.00 output prices per million tokens.