
Claude Sonnet 5.5 vs Claude Opus 5: mais barato em cada linha e à frente no índice
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O Claude Opus 5 foi lançado em 24 de julho de 2026, a US$ 5,00 por milhão de tokens de entrada e US$ 25,00 por milhão de tokens de saída. O Claude Sonnet 5.5 chegou à disponibilidade geral em 28 de setembro de 2026, a US$ 2,00 e US$ 10,00. Isso representa um corte de 60% na entrada e de 60% na saída para um modelo duas gerações mais recente — e, no harness que a Artificial Analysis executa com ambos, um modelo que alcança 56 no Intelligence Index v4.3, contra 51 do Claude Opus 5. Esta é a rara comparação em que o modelo mais novo e mais barato também é o de maior pontuação em um índice de terceiros, e em que o argumento que resta a favor do incumbente não é a posição no benchmark, mas um tipo específico de trabalho. Ambos os modelos aceitam 1M tokens de contexto, ambos geram até 128K tokens, ambos leem texto, imagens e arquivos, e ambos configuram o raciocínio por meio de um parâmetro de esforço, e não de um orçamento de tokens de pensamento. Como as superfícies são as mesmas, escolher entre eles é puramente uma questão de quanto custa uma tarefa concluída e de quais tarefas falham.
Dois lançamentos, uma interface
Comece pelo quão pouco muda, pois é mais do que na maioria dos saltos de geração.
• Janela de contexto — 1.000.000 de tokens em ambos
• Saída máxima — 128.000 tokens em ambos
Modalidade de entrada — texto, imagem e arquivo em ambos; sem áudio, sem vídeo em nenhum dos dois
• Raciocínio — pensamento adaptativo com esforço configurável em ambos, de modo que a profundidade seja um parâmetro da requisição e não uma string de modelo separada
• Capacidades — visão, ferramentas, JSON e raciocínio em ambos, conforme as entradas do catálogo do OrcaRouter para anthropic/claude-opus-5e a linha Sonnet
A consequência prática é que um prompt escrito para o Claude Opus 5 não precisa ser reescrito para rodar no Claude Sonnet 5.5, e um loop de agente ajustado em torno de um teto de saída de 128K não precisa de um novo nível. A migração é uma troca de string de modelo mais uma reverificação de qual configuração de esforço você tinha fixado — nada mais. Para equipes que viveram as transições multimodais e multiparâmetro dos últimos dois anos, essa é a manchete, não o benchmark.
A única coisa que realmente muda é o preço, e ele muda em cada linha, e não apenas nas duas do slide de marketing.
• Entrada — US$ 2,00 por milhão contra US$ 5,00, um corte de 60%
• Saída — US$ 10,00 por milhão contra US$ 25,00, um corte de 60%
• Leitura de cache — $0,20 por milhão contra $0,50, um corte de 60%
• Escrita em cache — $2,50 por milhão contra $10,00 para a janela de cinco minutos, um corte de 75%
Se você executa um agente que relê um prefixo longo a cada turno, a linha de leitura de cache é a que paga a migração. A US$ 0,20 contra US$ 0,50, cada token em cache numa sessão longa fica em 40% do seu custo antigo, e as leituras de cache são a maior parte da contagem de tokens na maioria dos loops agênticos. A economia se acumula de um jeito que o número de destaque por token não captura.
De onde vêm os cinco pontos
A Artificial Analysis atribui ao Claude Sonnet 5.5 uma pontuação de 56 e ao Claude Opus 5 uma pontuação de 51 no Intelligence Index v4.3, ambos medidos na configuração "Adaptive Reasoning, Max Effort". Cinco pontos não são um erro de arredondamento nessa escala — para dar contexto, o mesmo avaliador coloca o Sonnet 5 em 38 e o Gemini 3.1 Pro Preview em 30, então a diferença entre o Claude Opus 5 e o Claude Sonnet 5.5 é um terço da diferença entre o Claude Opus 5 e a geração anterior do Sonnet.
Os próprios números de lançamento da Anthropic para o Claude Sonnet 5.5 apontam na mesma direção, com um instrumento diferente. A empresa relata 70,6% no Terminal-Bench 4.0 — o mesmo teste no qual o Claude Opus 5 está documentado com 89,1% em uma tabela anterior da Anthropic, um valor que usou uma revisão de harness diferente e não deve ser subtraído do mais recente. Esse é o cuidado de fontes mais importante deste artigo: o Terminal-Bench passou para a versão 4.0 em algum momento de 2026, o índice que o contém foi revisado para v4.3 para corresponder, e comparações entre versões desse benchmark não são aritméticas. Quando um número tiver uma versão associada, cite a versão.
O que pode ser comparado de forma limpa é a progressão do próprio fornecedor no lado Sonnet — de 10,3% no Terminal-Bench 4.0 para o Sonnet 5 a 70,6% para o Sonnet 5.5 — e a leitura do índice de terceiros, em que ambos os números vêm da mesma estrutura de avaliação no mesmo dia. Com base nessa evidência, o sucessor realmente ultrapassou o carro-chefe de julho em raciocínio geral, o que é uma afirmação mais forte do que qualquer slide de fornecedor apresenta.
A armadilha do comprimento da saída
É aqui que a aritmética deixa de ser gentil com o modelo mais novo.
A Artificial Analysis relata que avaliar o Claude Sonnet 5.5 em sua suíte de índices custa US$ 7,60 por tarefa. O Claude Opus 5 custa US$ 5,86 por tarefa na mesma suíte. O modelo mais recente, com 60% de desconto em cada linha da tabela de preços, é cerca de 30% mais caro para concluir uma tarefa. O motivo está no mesmo relatório: o Sonnet 5.5 emitiu 410 milhões de tokens em toda a suíte, contra uma mediana de 88 milhões entre os modelos monitorados, o que o avaliador classifica como "muito verboso". O Claude Opus 5 emitiu 140 milhões na mesma suíte.
Faça a divisão e o mecanismo é simples. O Sonnet 5.5 produz aproximadamente três vezes mais tokens de saída do que o Claude Opus 5 em trabalho idêntico, a 40% do preço de saída. Três vezes 0,4 é 1,2 — uma penalidade de 20% antes dos efeitos de cache, o que fica próximo do resultado de US$ 7,60 contra US$ 5,86. O preço por token não está errado; ele simplesmente não é o número que governa a fatura.
Isto não torna o modelo mais recente a pior compra. Faz com que a decisão dependa de algo que a maioria das comparações omite: se a sua carga de trabalho lhe permite limitar a saída. Uma tarefa de sumarização com uma instrução de comprimento, um pipeline de extração estruturada que produz JSON, um classificador que devolve um rótulo — em todos esses casos a verbosidade nunca chega a manifestar-se, e o corte de 60% na tabela de preços é dinheiro real. Um agente sem objetivo definido a quem se pede para "corrigir o repositório", sem disciplina de saída, dá ao Sonnet 5.5 três vezes mais corda.
Configurações de esforço e a migração para a qual ninguém reserva orçamento
Ambos os modelos expõem a profundidade de raciocínio por meio de um parâmetro de esforço com vários níveis, e ambos trazem um padrão em vez de um valor fixo — alto na Claude Platform, médio nos aplicativos Claude. A tentação em uma migração é deixar a configuração onde estava no modelo antigo e considerar a tarefa concluída.
Isso é um erro por um motivo mensurável. A própria nota de rodapé da Anthropic para o Claude Sonnet 5.5 afirma que a configuração Max effort obtém pontuação inferior a Xhigh no FrontierCode, o que significa que o esforço não é um ajuste monotônico e a configuração mais alta não é uma melhoria gratuita. Defina o esforço medindo sua tarefa, não escolhendo a opção mais cara disponível.
Há também uma diferença comportamental rígida do lado do Sonnet que vale a pena conhecer antes de uma implantação. A Anthropic afirma que o Claude Sonnet 5.5 é o primeiro Sonnet a ser lançado com salvaguardas cibernéticas e mecanismos de fallback equivalentes aos de seus modelos de ponta, então solicitações de segurança de maior risco visivelmente fazem fallback para o Sonnet anterior, em vez de serem atendidas pelo modelo que você indicou. Se sua carga de trabalho estiver nesse domínio, seus logs mostrarão um modelo que você não solicitou. O Claude Opus 5 é anterior a esse arranjo na linha Sonnet, embora a mesma classe de roteamento exista em toda a linha de produtos da Anthropic para trabalhos de biologia e cibersegurança nas camadas de ponta.
Na OrcaRouter, ambos os endpoints estão ativos hoje — anthropic/claude-opus-5 e anthropic/claude-sonnet-5 encontram-se no mesmo catálogo que todo o resto, com o preço de tabela do fornecedor e 0% de margem — e o Claude Sonnet 5.5 ficará acessível nessa mesma credencial assim que for listado. A capacidade relevante, entretanto, é o failover automático: se um nível da Anthropic estiver limitado por taxa ou a devolver erros, o pedido pode ser redirecionado para o outro sem qualquer alteração no código, o que é a cobertura mais barata possível contra o risco de estarmos errados nesta comparação.
A decisão, enunciada como regra
Se o seu trabalho tem escopo delimitado — você controla o formato da saída, os prompts são estruturados e a contagem de tokens por tarefa é previsível — migre para o Claude Sonnet 5.5 e aproveite a redução de 60%. O índice concorda, a tabela de preços concorda, e não resta nenhum argumento de capacidade do outro lado.
Se o seu trabalho for aberto e agêntico, execute o experimento antes de acreditar em qualquer uma das tabelas de preços. Meça os tokens por tarefa concluída no seu próprio tráfego durante uma semana em cada modelo; o resultado de US$ 7,60 contra US$ 5,86 de terceiros é um alerta específico de que a tabela de tarifas mais barata pode produzir a conta maior. O Claude Opus 5 continua sendo a opção padrão mais segura para trabalho autônomo de longo horizonte até você ter esse número.
O veredito honesto: esta é a primeira geração Sonnet em que o argumento do modelo principal se baseia no formato da tarefa, e não na capacidade bruta, e quem ainda toma a decisão apenas pelo nome do modelo agora está deixando 60% na mesa ou pagando 30% mais por tarefa concluída, dependendo só do lado para o qual chuta.



Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
