
Claude Sonnet 5.5 vs Claude Sonnet 5: Preços Idênticos, Faturas Diferentes
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Dois modelos do mesmo fornecedor, do mesmo nível, com o mesmo nome e — em cada linha da tabela de preços publicada — o mesmo preço. O Claude Sonnet 5 foi lançado em 30 de junho de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída. O Claude Sonnet 5.5 alcançou disponibilidade geral em 28 de setembro de 2026, a US$ 2,00 e US$ 10,00, com leituras de cache a US$ 0,20 e gravações de cache de cinco minutos a US$ 2,50 em ambos. Nada no preço mudou. O que mudou é tudo aquilo que uma tabela de preços não mede, e o resultado é que um desses dois modelos é substancialmente mais barato de operar do que o outro, apesar de custar exatamente o mesmo por token. A própria manchete da Anthropic para o lançamento diz isso sem chegar a dizê-lo: até 30% menos custo para a maioria dos trabalhos, com uma tabela de preços inalterada. A única forma de as duas frases serem verdadeiras é se o modelo mais novo concluir o mesmo trabalho com menos tokens, que é o que os benchmarks mostram e o que os números independentes por tarefa confirmam.
O Claude Sonnet 5.5 é mais caro que o Claude Sonnet 5?
Não — e a questão merece ser levada a sério de qualquer modo, porque inúmeras migrações deram errado ao tratar uma tabela de tarifas fixas como uma fatura fixa.
Por token, os dois modelos são idênticos: US$ 2,00 de entrada, US$ 10,00 de saída, US$ 0,20 para ler um token em cache, US$ 2,50 para gravar um. Não há faixa escalonada nem sobretaxa de contexto longo. Seja qual for o modelo mais novo, não se trata de um aumento de preço disfarçado de geração.
Por tarefa concluída, o cenário se inverte dependendo de qual carga de trabalho você está descrevendo. A Artificial Analysis relata um custo de US$ 5,09 por tarefa para o Claude Sonnet 5 e US$ 7,60 por tarefa para o Claude Sonnet 5.5 no mesmo conjunto Intelligence Index v4.3 — o modelo mais novo é 49% mais caro para concluir uma tarefa, a uma taxa idêntica. O mesmo relatório observa que o Sonnet 5.5 emitiu 410 milhões de tokens em todo o conjunto, contra 370 milhões do Sonnet 5, ambos frente a uma mediana de 88 milhões para o campo monitorado. Nos prompts abertos do avaliador, o modelo mais novo simplesmente escreve mais e, a preços iguais, mais tokens representa uma conta maior.
A alegação da Anthropic de ser 30% mais barata é uma alegação do fornecedor sobre as cargas de trabalho que ela mesma escolheu. A medição de terceiros de US$ 7,60 contra US$ 5,09 é uma medição em um conjunto diferente. Nenhuma das duas está errada; a discordância é a história toda, e o fator decisivo é se suas tarefas limitam a própria saída.
O que realmente mudou entre as duas gerações
A tabela de preços é estática; o modelo não. Dispostos em uma única lista, os deltas são grandes e em sua maioria unidirecionais.
• Terminal-Bench 4.0 — 70,6% para Claude Sonnet 5.5 contra 10,3% para Claude Sonnet 5, o maior salto de uma única geração que a Anthropic já publicou neste teste
• CursorBench 4.0 — 55,5% contra 34,1%
• Cartografia, sem ferramentas — 61,6% contra 15,6%
• GDPval-AA v2.1 — 1844 contra 1449
• AA-Briefcase v1.1 — 1811 contra 1359
• Humanity's Last Exam, com ferramentas — 64,5% contra 54,9%
• OSWorld 2.1, conclusão parcial — 80,1% contra 57,0%
• Índice de Inteligência Artificial Analysis v4.3 — 56 contra 38, uma diferença de dezoito pontos numa escala de terceiros medida sob a mesma configuração "Adaptive Reasoning, Max Effort"
A forma dessa lista não é progresso uniforme. Chartography passando de 15,6% para 61,6% e Terminal-Bench de 10,3% para 70,6% parecem capacidades que estavam ausentes e agora estão presentes, não capacidades que melhoraram. Humanity's Last Exam subindo dez pontos e OSWorld vinte e três pontos a um preço inalterado é o padrão de uma geração que fechou lacunas específicas em vez de uma que ficou geralmente mais inteligente. A lacuna de dezoito pontos no índice é a média aritmética disso: real, grande e concentrada no uso de ferramentas, execução de código e trabalho visual.
Uma nota de rodapé é importante para quem lê atentamente a tabela do fornecedor. A Anthropic afirma que, no FrontierCode, a configuração de esforço Max obtém pontuação inferior à do Xhigh, e sinaliza que as execuções do GDPval- e do AA-Briefcase foram realizadas em uma implantação de pré-lançamento que continha um bug de saídas estruturadas. Os números acima ainda são os melhores disponíveis, mas trate-os como um instantâneo de uma única implantação, e não como uma propriedade permanente do modelo.
Por que o preço é igual e a conta não é?
Três mecanismos, em ordem decrescente do quanto eles movem uma fatura real.
A primeira é a disciplina de comprimento da saída. O Sonnet 5.5 é um agente mais capaz, o que significa que faz mais antes de responder e, em uma suíte sem restrição de comprimento, escreve cerca de 11% mais do que o Sonnet 5, embora custe o mesmo por token. Em uma carga de trabalho que limita a saída — extração para um esquema fixo, classificação, resumos delimitados —, esses 11% nunca se materializam e a alegação de 30% torna-se crível, porque o ganho está em chegar à resposta em menos turnos, e não em usar menos tokens por turno.
O segundo é o comportamento do cache, e é a razão pela qual um preço de leitura de cache inalterado não significa um custo de cache inalterado. Leituras e gravações de cache são precificadas de forma idêntica nos dois modelos, portanto qualquer mudança no volume de tokens em cache repercute diretamente na fatura. Um modelo que leva menos turnos para concluir uma tarefa agêntica lê seu prefixo menos vezes. Isso é uma economia sem nenhuma mudança de preço por trás, e é invisível em todas as tabelas de comparação que listam apenas as linhas da tabela de preços.
A terceira é a que a maioria das equipes erra no dia da migração: o padrão de esforço. O Claude Sonnet 5.5 configura o raciocínio por meio de um parâmetro effort com as definições low, medium, high, xhigh e max, usando high como padrão na Claude Platform e medium nos Claude apps. Se você migrou de uma implantação do Sonnet 5 em que tinha fixado um orçamento de raciocínio, o novo padrão pode ter uma profundidade diferente da que você estava pagando. Meça antes de presumir uma economia ou um aumento.
Há também uma consequência comportamental que vale a pena sinalizar antes da implantação, e não depois. A Anthropic afirma que o Claude Sonnet 5.5 é o primeiro Sonnet a ser lançado com salvaguardas cibernéticas e fallbacks no mesmo patamar de seus modelos de ponta, de modo que solicitações de cibersegurança de maior risco fazem fallback de forma visível para o Sonnet anterior. Seus logs mostrarão um modelo que você não solicitou. De modo relacionado, se você executar o Sonnet com o thinking desativado, precisará mudar para um comportamento entre ferramentas — uma alteração de código, não uma flag.
Na OrcaRouter, anthropic/claude-sonnet-5 é roteável hoje com uma única credencial ao preço de tabela do provedor, com 0% de markup, ao lado de Claude Opus 5.5, Claude Opus 5, DeepSeek V4 Pro e Gemini 3.1 Pro Preview. O próprio Claude Sonnet 5.5 ainda não é uma rota na nossa plataforma, então a forma prática desta comparação neste momento é que uma equipe que já executa o Sonnet 5 pode medir o delta no dia em que ele for listado sem tocar em uma chave de API, e pode fazer failover entre camadas nesse meio tempo alterando uma string.
Perguntas que as pessoas fazem antes de trocar
Posso executar os dois ao mesmo tempo e comparar no meu próprio tráfego? Ainda não por meio de uma única credencial OrcaRouter, já que Claude Sonnet 5.5 não é uma rota listada. A solução alternativa é executar o modelo mais novo na API da própria Anthropic e o mais antigo por meio de nós, depois comparar tokens por tarefa concluída em vez de custo por token, porque é nessa métrica que os dois modelos realmente diferem.
O preço inalterado significa que a Anthropic não está cobrando pela nova capacidade?Isso significa que o preço de tabela está sendo mantido estável enquanto o modelo melhora, o que segue o mesmo padrão das duas gerações anteriores do Sonnet. Se isso persistirá é uma questão comercial, não técnica, e a janela de descontinuação publicada — não antes de setembro de 2027 — é o único compromisso associado.
Em qual número devo confiar, nos 30% da Anthropic ou nos 49% de terceiros?Nenhum deles como afirmação geral. O número da Anthropic descreve cargas de trabalho em que o modelo chega a uma resposta em menos turnos; o número da Artificial Analysis descreve um conjunto de índices sem restrições, no qual a verbosidade pode crescer livremente. Escolha o que se assemelha ao seu conjunto de prompts e, se você não conseguir dizer qual é, essa ambiguidade já é a resposta — meça-a.
Conclusão
Claude Sonnet 5.5 não é um aumento de preço, mas também não é automaticamente uma economia. A Anthropic manteve todas as linhas da tabela de preços inalteradas e colocou o modelo por baixo dela, o que significa que todo o argumento econômico depende de tokens por tarefa concluída — um número 30% melhor nas cargas de trabalho que o fornecedor escolheu e 49% pior na suíte que um avaliador independente escolheu. Se as suas tarefas limitam a própria saída, mude e aproveite a vitória. Se não limitarem, o preço inalterado não é motivo para pular a medição, porque você pode pagar 50% a mais por tarefa por um modelo que é inequivocamente melhor no trabalho.



