
Claude Sonnet 5.5 vs Claude Opus 5.5: os benchmarks convergem, a conta não
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O Claude Sonnet 5.5 atingiu disponibilidade geral em 28 de setembro de 2026, a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída. O Claude Opus 5.5, carro-chefe da Anthropic, foi lançado seis dias antes, em 22 de setembro, a US$ 4,00 e US$ 20,00 — exatamente o dobro em ambas as linhas. A leitura óbvia é que o Opus 5.5 é o teto e o Sonnet 5.5 é a concessão que você faz quando o orçamento é real. A própria tabela de lançamento da Anthropic não sustenta essa leitura. Nos números publicados pela empresa, o Claude Sonnet 5.5 registra 1844 contra 1846 do Opus 5.5 no GDPval-AA v2.1, 1811 contra 1822 no AA-Briefcase v1.1, e 70,6% contra 66,4% no Terminal-Bench 4.0 — ele vence o único benchmark que mede trabalho realmente realizado dentro de um terminal. Duas linhas abaixo desses números, a própria legenda da Anthropic afirma que o Opus 5.5 "permanece claramente mais forte em trabalhos complexos e abertos". Ambas as afirmações são verdadeiras, e descobrir como sustentá-las ao mesmo tempo é a maior parte do propósito desta comparação.
O que a tabela de lançamento diz, e o que ela se recusa a dizer
O padrão no bloco de benchmarks da Anthropic é o de um modelo que fechou a maior parte da diferença, e não o de um que assumiu a liderança. O GDPval-AA v2.1, um conjunto de tarefas com peso econômico, é um empate de dois pontos. O AA-Briefcase v1.1, uma avaliação de documentos e entregáveis, é um empate de onze pontos. O CursorBench 4.0 vai na direção oposta: 55,5% para o Sonnet 5.5 contra 57,8% para o Opus 5.5. O OSWorld 2.1 fica em 80,1% contra 81,8%, e o Humanity's Last Exam em 64,5% com ferramentas contra 67,7%. Apenas o Terminal-Bench 4.0 quebra o padrão, e quebra com força — 70,6% contra 66,4%, uma vantagem de quatro pontos do Sonnet em trabalho agêntico de linha de comando.
Leia os rótulos das linhas em vez dos números e algo mais aparece. Várias dessas entradas do Opus 5.5 trazem uma anotação de esforço — 66,4% em Xhigh — e uma nota de rodapé afirma que a configuração Max obtém pontuação inferior a Xhigh no FrontierCode, não superior. Mais esforço não é monotônico. Uma equipe preocupada com o orçamento que assume que o "esforço máximo" é uma melhoria gratuita está comprando tokens para obter uma resposta pior em pelo menos um dos próprios testes da Anthropic. E no FrontierCode 1.1, a mesma nota de rodapé coloca o Sonnet 5.5 em 46,2% na configuração Max, contra 54,4% do Opus 5.5, que é o número isolado mais claro de onde o modelo principal ainda abre vantagem: trabalho de código de horizonte longo sob uma definição de tarefa que recompensa a persistência.
Há mais uma ressalva que vale a pena declarar claramente em vez de enterrar. A Anthropic observa que as execuções do GDPval-AA e do AA-Briefcase que ela publica foram realizadas em uma implantação de pré-lançamento que carregava um bug de saídas estruturadas. Isso afeta ambos os modelos na mesma tabela, então a comparação não é invalidada, mas significa que os números absolutos devem ser tratados como um instantâneo, e não como um resultado definitivo. Tabelas de benchmarks de fornecedores são artefatos de marketing com um apêndice de metodologia, e esta vem com seu apêndice anexado.
Onde a medição independente cai
O Artificial Analysis avalia ambos os modelos em um único harness, na mesma configuração que ele denomina "Raciocínio Adaptativo, Esforço Máximo, Fallback Padrão," no Intelligence Index v4.3. O Claude Opus 5.5 está em 58. O Claude Sonnet 5.5 está em 56. Isso é uma diferença de dois pontos em uma escala na qual o mesmo avaliador coloca o Opus 5 em 51, o Sonnet 5 em 38, o DeepSeek V4 Pro em 36 e o Gemini 3.1 Pro Preview em 30. Um novo Sonnet chegando dois pontos abaixo do carro-chefe e cinco pontos acima da geração anterior do Opus é a afirmação substancial deste lançamento, e é uma afirmação de terceiros e não do fornecedor.
Então, a mesma página inverte a economia disso. A Artificial Analysis relata que uma execução de avaliação do Sonnet 5.5 custa US$ 7,60 por tarefa, contra US$ 5,98 do Opus 5.5, embora o Sonnet 5.5 tenha metade do preço por token. A causa está bem ali na página: o Sonnet 5.5 gerou 410 milhões de tokens em toda a suíte de índices, contra uma mediana de 88 milhões para os modelos que ela acompanha — "muito verboso", nas palavras do avaliador. O Opus 5.5 gerou 260 milhões na mesma suíte. A US$ 10 por milhão de tokens de saída contra US$ 20, o fator de verbosidade de aproximadamente 1,6 ainda deixa o Sonnet 5.5 pagando cerca de 27% mais por tarefa concluída.
Esta é a parte da comparação que uma tabela de preços por token não consegue mostrar, e é por isso que os dois valores coexistem sem contradição. Por token, o Sonnet 5.5 custa metade. Por tarefa concluída, num conjunto de avaliação com prompts abertos e sem disciplina de comprimento de saída, pode ser mais caro. A decisão real é saber qual dessas situações descreve a sua carga de trabalho.
Níveis de esforço, tetos de saída e a forma da integração
Para um comprador, as propriedades mecanicamente importantes são quase idênticas entre estes dois modelos.
• Contexto — 1.000.000 de tokens em ambos, do mesmo provedor, portanto as suposições de engenharia de prompt se transferem sem alteração
• Saída máxima — 128.000 tokens em ambos; a geração em massa não é um diferencial aqui
• Modalidade — entrada de texto, imagem e arquivo em ambos; nenhum dos dois aceita áudio ou vídeo
• Controle de raciocínio — pensamento adaptativo em ambos, com a profundidade definida por um parâmetro de esforço em vez de um orçamento de tokens de pensamento. Na Claude Platform, o padrão é alto; nos Claude apps, é médio
• Escrita de cache — US$ 5,00 por milhão para o Claude Opus 5.5 contra US$ 2,50 para o Claude Sonnet 5.5, a única linha em que o modelo mais barato também é o modelo mais barato de alimentar com um prefixo reconstruído
• Leitura de cache — $0,20 por milhão em ambos, um empate exato na linha que domina execuções longas de agentes
Como as superfícies coincidem, a migração entre elas é uma mudança de string de modelo e uma nova medição do esforço, não um projeto de integração. Isso é incomum entre fornecedores e é a razão pela qual este par específico vale a pena comparar: os dois candidatos diferem em preço e em profundidade, não na API que você precisa escrever.
Uma diferença operacional merece uma linha própria. A Anthropic afirma que Claude Sonnet 5.5 é o primeiro Sonnet a ser lançado com salvaguardas cibernéticas e fallbacks no mesmo patamar dos seus modelos de topo, o que significa que pedidos de cibersegurança de maior risco são visivelmente encaminhados para o Sonnet anterior em vez de serem respondidos pelo modelo que indicou. Se a sua carga de trabalho tocar nesse domínio, a string do modelo não é garantia de qual modelo respondeu — em nenhum dos níveis. A Anthropic também observa que, se executar o Sonnet com o thinking desativado, tem de mudar para um comportamento between-tools, o que é uma alteração de código e não uma flag de configuração. Nenhum desses pontos é razão para evitar o modelo; ambos são razões para saber antes de colocar em produção.
Na OrcaRouter, o Claude Opus 5.5 já pode ser roteado hoje com a mesma credencial que qualquer outro modelo do catálogo, ao preço de tabela do provedor, com 0% de margem, com failover automático disponível por baixo. O Claude Sonnet 5.5 ainda não é uma rota na nossa plataforma — o modelo tem um dia de vida e, enquanto não estiver listado, a declaração honesta é que você o acessaria pela própria API da Anthropic. Qualquer pessoa que atualmente executa o Opus 5.5 por meio de nós pode calcular o preço da troca no dia em que ela chegar sem mudar mais nada na sua integração.
Qual deles colocar onde
A divisão que decorre dos números: Claude Sonnet 5.5 para trabalho de agente vinculado ao terminal, onde é o mais forte dos dois no próprio número do Terminal-Bench 4.0 da Anthropic e custa metade do preço; Claude Sonnet 5.5 para qualquer coisa com perfil de throughput, já que a diferença de custo só diminui quando a tarefa exige saídas longas; Claude Opus 5.5 para trabalho da classe FrontierCode, refatorações de horizonte longo em grandes bases de código, e qualquer carga de trabalho em que a margem de 54,4% a 46,2% reflita o formato do seu problema real e não uma linha de ranking.
Se suas tarefas são abertas e você não consegue prever o comprimento da saída, trate o preço por token como o número totalmente errado. Meça tokens por tarefa concluída no seu próprio tráfego durante uma semana antes de se decidir por um caminho ou pelo outro; o número da artificial-analysis de $7.60 contra $5.98 é um aviso de que o modelo barato pode sair perdendo na métrica que você realmente paga.
O veredito honesto: isto já não é uma troca entre capacidade e custo. É uma questão de saber se o seu trabalho é limitado. Para tarefas limitadas, de grande volume e orientadas por ferramentas, o modelo mais barato é também o melhor com base nas evidências disponíveis, e o modelo principal não vale o dobro. Para trabalho aberto e de longo prazo, a própria frase da Anthropic — de que o Opus 5.5 continua claramente mais forte — é a que se deve acreditar, e nenhuma quantidade de convergência de benchmarks muda isso por enquanto.



