Um cartão de título do Claude Sonnet 5.5 com o cabeçalho 'mesmo preço, menos trabalho', com o subtítulo '$2 / $10 por milhão de tokens, inalterado em relação ao Sonnet 5' e três cartões de estatísticas com os valores 56 (AA Intelligence Index), #3 / 216 (posição nesse índice) e $7.60 (custo por tarefa no esforço máximo).
Guides & Insights

Claude Sonnet 5.5: a alegação de custo de 30% e as seis mudanças que quebram o código do Sonnet 5

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Claude Sonnet 5.5 foi lançado em 28 de setembro de 2026 exatamente com as mesmas tarifas do Claude Sonnet 5 — US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída, US$ 0,20 por milhão de leituras em cache — enquanto o anúncio da Anthro​pic abre com "roda 30%+ mais rápido e custa até 30% menos para a maioria do trabalho". Ambas as afirmações são verdadeiras, e a distância entre elas é a história inteira. A economia não está na tabela de tarifas, porque a tabela de tarifas não mudou. Ela vem de rodar o modelo em uma configuração de esforço mais baixa do que o antecessor precisava, o que significa que o número de 30% é uma afirmação sobre um ponto de operação que você precisa escolher, não um preço que você herda. A medição independente torna a bifurcação nítida: no Artificial Analysis, Claude Sonnet 5.5 no esforço máximo custa US$ 7,60 por tarefa no Intelligence Index, contra US$ 5,09 do Claude Sonnet 5 no máximo — cerca de 49% a mais, e não 30% a menos. Isso não é uma contradição do número da Anthro​pic. É a outra ponta da mesma curva, e é onde a maioria das migrações vai acabar por padrão se ninguém refizer sua varredura de esforço.

Duas reivindicações usando um número

O post da Anthropic faz a alegação por tarefa em três lugares, e cada uma se apoia no esforço. A versão mais forte: no Terminal-Bench 4.0, no esforço Médio — o padrão nos aplicativos da Claude —, o Sonnet 5.5 "supera em muito a melhor pontuação do Sonnet 5 por menos de um décimo do custo por tarefa". No AA-Briefcase v1.1, no esforço Médio, ele supera a melhor pontuação do Sonnet 5 por cerca de um nono do custo. No CursorBench 4.0, no esforço Baixo, ele excede a melhor pontuação do Sonnet 5 por menos de um décimo.

Leia tudo isso como um conjunto e o mecanismo fica claro. O piso do Sonnet 5.5 fica acima do teto do Sonnet 5 em várias avaliações. Você não obtém os 30% pagando menos por token; você os obtém por não precisar mais da configuração cara. A Anthropic diz exatamente isso na documentação de migração, uma página depois do material de marketing: "Os níveis de esforço são recalibrados. Um nível de esforço não produz a mesma quantidade de raciocínio que produzia no Claude Sonnet 5. Rode novamente sua varredura de níveis de esforço em vez de reaproveitar uma configuração."

Essa frase é a linha mais importante do ponto de vista operacional que a Anthropic publicou esta semana, e é a que não entrou na maior parte da cobertura do lançamento.

O que a Anthropic publicou — informado pelo fornecedor, não reproduzido

Tudo nesta seção é medição da própria Anthropic, proveniente do anúncio e do system card do Sonnet 5.5. É uma alegação de fornecedor, não um resultado independente, e a trilha de notas de rodapé importa tanto quanto os números de destaque.

• Terminal-Bench 4.0 (codificação agêntica) — Sonnet 5.5 70,6% vs Sonnet 5 10,3%. Trata-se de um salto de sete vezes na linha mais citada de todas, e é o número com que a maior parte da cobertura abriu.

• FrontierCode 1.1 (Main) — Sonnet 5.5 52,1% em Xhigh e 46,2% em Max; Sonnet 5 42,4%; Claude Opus 5.5 54,4%; GPT-6 Sol 49,3%. Observe a inversão: Sonnet 5.5 pontua mais baixo em Max do que em Xhigh.

• CursorBench 4.0 — 55,5% para o Sonnet 5.5 vs. 34,1% para o Sonnet 5 e 57,8% para o Opus 5.5. O CursorBench 4.0 não reporta o GPT-6 Sol publicamente.

• GDPval-AA v2.1 (trabalho de conhecimento) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 nos mesmos quatro modelos.

• Humanity's Last Exam (com ferramentas) — 64,5% / 54,9% / 67,7%.

• OSWorld 2.1 (uso de computador, crédito parcial) — 80,1% / 57,0% / 81,8%.

• Chartography (reconhecimento visual de gráficos, sem ferramentas) — 61,6% / 15,6% / 64,4% / 53,6%.

Três notas de rodapé merecem acompanhar essas linhas em vez de ficar abaixo delas. Primeira, o número de 66,4% do Opus 5.5 no Terminal-Bench 4.0 é reportado com esforço Xhigh, a configuração de maior pontuação do Opus 5.5. Segunda, explica-se a inversão do FrontierCode Max: no Max, o Sonnet 5.5 executava com mais frequência a habilidade de revisão de código do Claude Code, que divide a revisão entre muitos subagentes, e em dois casos isso gerou um timeout ou edições além do escopo da tarefa — o FrontierCode penaliza alterações fora do escopo mesmo quando são boas. Terceira, e a menos confortável para o fornecedor, a Artificial Analysis executou o GDPval-AA e o AA-Briefcase em uma implantação pré-lançamento do Sonnet 5.5 que, segundo a Anthropic, tinha um bug que degradava as respostas a solicitações de saída estruturada. A Anthropic espera que o efeito seja pequeno e que subestime o Sonnet 5.5, e afirma que o bug foi corrigido. Também observa que a OpenAI corrigiu recentemente um bug de compreensão de imagens no GPT-6 Sol, de modo que os números do GPT-6 Sol nessas linhas podem ainda não refletir o modelo atual.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

O que a execução independente diz sobre o mesmo modelo

A Artificial Analysis tem o Sonnet 5.5 medido, e sua página nomeia a configuração exata: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". Na mesma revisão do índice, 216 modelos na classe:

• Claude Sonnet 5.5 — Intelligence Index 56, classificado em #3 de 216. Custo de $7,60 por tarefa do índice. Gerou 410M de tokens de saída durante a execução do índice, contra uma mediana de 88M.

• Claude Sonnet 5 — Índice 38, classificado em #58 de 216, em sua própria página rotulada "(Raciocínio Adaptativo, Esforço Máximo)". Custo de $5,09 por tarefa. 370M de tokens de saída.

• Claude Opus 5.5 — Índice 58, em 1º lugar entre 216. US$ 5,98 por tarefa. 95,3 tokens de saída por segundo.

• GPT-6 Sol — Índice 48, classificado em #20 de 216, no preço de lista de $2/$10. $1,06 por tarefa, 89,8 tokens de saída por segundo.

A diferença no Intelligence Index — 56 contra 38, dezoito pontos — é a confirmação independente mais forte neste texto, e é o número que um leitor deveria realmente levar consigo. O número de custo é o que precisa de uma ressalva, e vale a pena declará-la com exatidão: ambos os pontos são configurações de esforço máximo, e esforço máximo num modelo que raciocina por mais tempo é um lugar deliberadamente caro de se posicionar. O Sonnet 5.5 queimou 410M tokens na execução do índice em que o Sonnet 5 queimou 370M, e ambos estão muito acima da mediana de 88M. Um modelo que pensa por mais tempo na configuração máxima custa mais na configuração máxima. O que o número refuta não é "mais barato por tarefa", mas qualquer leitura dele como uma propriedade do modelo, e não da configuração.

A Artificial Analysis ainda não publicou uma velocidade de saída para o Sonnet 5.5 — sua página indica N/A para tokens de saída por segundo, em comparação com 78,7 para o Sonnet 5 e 95,3 para o Opus 5.5. Portanto, a parte "30%+ mais rápido" da afirmação da Anthropic é apenas indicativa neste momento. Trate isso como direcional até que terceiros o meçam.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

De onde vem realmente a economia e como obtê-la

Se você aceitar o mecanismo, as instruções de migração se escrevem sozinhas, e a Anthropic as publicou:

• Comece em high por padrão, e não com o que quer que a sua configuração do Sonnet 5 tenha indicado. A orientação da Anthropic é high, a menos que sua carga de trabalho seja agêntica ou sensível à latência.

• Codificação agêntica e uso de ferramentas com várias etapas — comece no nível médio para tarefas bem especificadas e avance para o nível alto para as mais difíceis ou mais longas.

• Chat e outros trabalhos sensíveis à latência — comece em médio ou baixo. Esta é a faixa onde vivem as alegações de "um décimo do custo".

Há uma explicação coerente para o motivo pelo qual a configuração mais baixa funciona, e não é marketing. Os primeiros testadores da Anthropic relataram que o Sonnet 5.5 agrupa chamadas de ferramentas em lote mais do que o Sonnet 5 fazia, produzindo menos etapas por tarefa. A observação da CodeRabbit no anúncio é incomumente específica para uma citação de lançamento: a "tendência do Sonnet 5 de recorrer à pesquisa na web com demasiada frequência e o seu elevado uso de tokens desapareceram ambos neste novo modelo". O Sonnet 5.5 também manteve o mesmo tokenizador do Sonnet 5, então texto idêntico custa tokens idênticos — a redução está em menos turnos e menos chamadas redundantes, não num vocabulário mais barato. Isso também significa que as contagens de tokens nos seus logs permanecem comparáveis ao longo da atualização, o que torna a medição antes e depois direta.

As seis mudanças que quebram ou alteram o código do Sonnet 5

Esta é a parte do lançamento que custa tempo de engenharia, e é onde o guia de migração vale mais do que o gráfico de benchmarks. Cinco dos seis retornam erros graves; o sexto falha silenciosamente.

• thinking: {"type": "disabled"} agora retorna um 400. O substituto é thinking: {"type": "between_tools"}, que desativa o thinking inicial e é a configuração de thinking mais baixa neste modelo. Funciona com esforço low, medium e high, não requer cabeçalho beta e está disponível em todas as plataformas que servem o Sonnet 5.5. Com esforço xhigh ou max, o próprio between_tools retorna um 400 — use thinking adaptativo (omita o campo ou envie {"type": "adaptive"}) se precisar desses níveis. Com between_tools, você também não pode mudar o esforço no meio da conversa.

• O uso forçado de ferramentas não é compatível.O tool_choice definido como {"type": "any"} ou {"type": "tool", "name": "..."} retorna um 400 com a mensagem "tool_choice: type 'tool' and 'any' are not supported for this model." A mesma verificação se aplica ao endpoint de contagem de tokens. A substituição documentada para entrada válida conforme o esquema é tool_choice: {"type": "auto"} mais strict: true na ferramenta, ou mover o esquema para saídas estruturadas.

• Os blocos de pensamento estão vinculados ao modelo e à conversa. O Sonnet 5.5 lê blocos de pensamento de Sonnet 5, Opus 4.8, Haiku 4.5 e anteriores — não de Opus 5, Opus 5.5, ou qualquer modelo Fable ou Mythos. Nenhum outro modelo lê os blocos do Sonnet 5.5. Mova uma conversa do Sonnet 5 para o 5.5 e o raciocínio sobrevive; mova-a do Sonnet 5.5 para qualquer outra coisa e os turnos posteriores são executados sem ele. Separadamente, a API agora verifica se o prompt do sistema, a lista de ferramentas ou uma mensagem anterior mudou desde que um bloco de pensamento foi produzido, e em contas criadas em ou após 31 de agosto de 2026, ela retorna um 400 quando isso ocorreu. Mantenha as conversas somente com acréscimos, ou envie o cabeçalho beta thinking-binding-controls-2026-08-01 com prefix_mismatch_behavior: "drop_block".

• computer_20251124 é rejeitado na API do Claude e no Google Cloud. O uso de computador nesses serviços exige o toolset computer_toolset_20260801. O Amazon Bedrock ainda aceita a ferramenta mais antiga — uma divergência entre plataformas que vale a pena destacar se você executar o mesmo agente em ambas.

• Alguns emparelhamentos de conselheiro não estão mais disponíveis. Um executor Sonnet 5.5 aceita Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 ou o próprio Sonnet 5.5 como conselheiro. Conselheiros Opus 4.8, Opus 4.7 e Sonnet 5, que funcionam com um executor Sonnet 5, retornam um 400 com um executor Sonnet 5.5. Todo conselheiro que o Sonnet 5.5 aceita retorna conselhos criptografados, então seu cliente não consegue ler o texto do conselho.

• O texto entre chamadas de ferramentas agora chega dentro de blocos de pensamento — e, na configuração padrão de display: "omitted", ele fica vazio. Este é o caso silencioso. Notas com mais de uma ou duas frases entre chamadas de ferramentas voltam como blocos de pensamento de atualização de progresso, em vez de texto. Um aplicativo que transmite essa narração aos usuários fica em silêncio entre chamadas de ferramentas, sem erro e sem nada nos logs. A solução é definir thinking.display para que o texto seja retornado, ou mudar para between_tools, caso em que o texto volta como texto comum.

Mais duas coisas que uma migração afeta, nenhuma delas um erro. Monitoramento de recusas: o Sonnet 5.5 retorna stop_reason: "refusal" com um objeto stop_details que nomeia uma de cinco áreas de política — cyber, bio, frontier_llm, reasoning_extraction, general_harms — e o fallback do lado do servidor da Anthropic tentará novamente recusas de cyber e frontier_llm no Sonnet 5, mas não as outras três. E a postura de segurança realmente mudou: o Sonnet 5.5 é o primeiro modelo Sonnet a ser lançado com salvaguardas cibernéticas e fallbacks como a classe Opus, o que significa que solicitações de cibersegurança de maior risco visivelmente passam para o Sonnet 5, e o primeiro Sonnet com classificadores contra extração de raciocínio. Se a proposta de valor do seu produto é uma ferramenta de segurança, teste esse limite antes de lançar a troca de modelo.

Preços, e o que está genuinamente na nossa rota hoje

A tabela de preços permanece inalterada em relação ao Sonnet 5, e sua forma publicada completa é curta o suficiente para ser enunciada de forma simples:

• Entrada — $2,00 por milhão de tokens. Saída — $10,00 por milhão de tokens. Ambos idênticos ao Sonnet 5, confirmado na página de modelos da Anthropic para o Sonnet 5.5.

• Leitura de cache — $0,20 por milhão, um desconto de 90% na entrada; Escrita de cache de 5 minutos $2,50 por milhão; Escrita de cache de 1 hora $4,00 por milhão. O prompt mínimo cacheável é de 512 tokens no Sonnet 5.5, abaixo dos 1.024 no Sonnet 5.

• Lote — 50% de desconto nas duas direções, ou seja, $1,00 / $5,00 por milhão. Na API Message Batches, a saída pode chegar a 300 mil tokens com o cabeçalho beta output-300k-2026-03-24.

• Contra o Opus 5.5 — O Sonnet 5.5 custa exatamente metade: $2/$10 contra $4/$20, com as gravações em cache pela metade e as leituras em cache idênticas a $0.20. É essa a migração que compensa, e a Anthropic afirma-o sem rodeios: os dois modelos complementam-se melhor quando o Sonnet funciona com esforço inferior, e o Opus "continua claramente mais forte em trabalho complexo e aberto que exige julgamento sustentado."

• Contexto e saída — contexto de 1M tokens, saída máxima de 128K, pensamento adaptativo ativado por padrão, esforço padrão alto, corte de conhecimento confiável em junho de 2026, retenção zero de dados disponível, descontinuação não antes de 28 de setembro de 2027.

Uma nota de disponibilidade que preferimos declarar a deixar subentendida: O Claude Sonnet 5.5 não consta do nosso catálogo de modelos em 29 de setembro de 2026. O seu antecessor anthropic/claude-sonnet-5 e o seu irmão maior anthropic/claude-opus-5.5 ambos constam, e as suas tarifas do nosso lado são as do próprio fornecedor — $2.00 de entrada, $10.00 de saída, $0.20 de leitura de cache, $2.50 de escrita de cache para o Sonnet 5, sem qualquer margem acrescentada, pelo que uma alteração de preço do fornecedor fica em vigor aqui no mesmo dia em que entra em vigor, e não no ciclo de faturação seguinte. É essa última propriedade que torna a leitura de uma tabela de preços útil em vez de decorativa.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

O que você pode fazer com isso hoje

A sequência honesta para uma equipe que já roda o Claude Sonnet 5 em produção tem três passos, e nenhum deles é «trocar a string do modelo e observar o grafo».

Primeiro, refaça a varredura de esforço. Se você trouxe uma configuração alta ou máxima do Sonnet 5 porque era isso que seu padrão de qualidade exigia, agora você está pagando por raciocínio que não precisa mais comprar. Os números independentes de custo por tarefa dizem que o topo da escala ficou mais caro, não mais barato, e todas as próprias alegações de custo do fornecedor descrevem o meio dela. Segundo, corrija os dois caminhos de erro antes do deploy — pensamento desativado e uso forçado de ferramentas — porque ambos falham de forma ruidosa e imediata, o que é a boa notícia. Terceiro, fique de olho no caminho de narração, porque ele falha silenciosamente.

Se o modelo ainda não estiver na rota que você usa, a maneira de baixo risco de avaliá-lo é executá-lo em paralelo, e não em substituição: mantenha o Sonnet 5 fixado como fallback na mesma chave, de modo que uma recusa, um timeout ou uma avaliação ruim encaminhe a solicitação para o modelo em que você já confia, e o failover automáticofecha o ciclo sem uma segunda integração. Esse é todo o argumento para avaliar um modelo não comprovado atrás de um único endpoint em vez de na frente dos seus usuários — e isso se aplica em dobro aqui, porque as categorias de recusa do Sonnet 5.5 são novas e sua calibração de esforço não é, explicitamente, a mesma do seu antecessor. Quando você estiver pronto para mudar o padrão, o catálogo em uma única chave chega a mais de 200 modelos, o que faz da comparação uma mudança de configuração em vez de um segundo contrato.

O que assistir

Três coisas vão esclarecer as questões em aberto neste texto, e nenhuma delas aconteceu ainda.

Uma medição independente da velocidade de saída é a primeira. A Anthropic afirma ser mais de 30% mais rápida que o Sonnet 5; a Artificial Analysis ainda não publicou um número para o Sonnet 5.5, e essa alegação faz um trabalho real no argumento de custo, já que um modelo mais rápido conclui a mesma tarefa em menos tempo de relógio e, muitas vezes, com menos tokens. O Claude Haiku 5.5 é o segundo — a Anthropic diz que ele chega "nas próximas semanas" e ficará abaixo do Sonnet 5.5, o que muda o cálculo para a faixa de chat de alto volume, em que esforço médio e baixo já tornam o Sonnet 5.5 competitivo. O terceiro é a rodada de correção: a Artificial Analysis executou o GDPval-AA e o AA-Briefcase em uma build de pré-lançamento com um bug de saída estruturada; a Anthropic espera que essas pontuações subestimem o modelo, e nenhum dos dois números foi recalculado. Se eles subirem, a lacuna de trabalho de conhecimento em relação ao Opus 5.5 diminui ainda mais e o argumento de "metade do preço" fica mais forte.

Até então, o resumo defensável é mais restrito do que o anúncio e mais útil do que o gráfico de benchmark. Claude Sonnet 5.5 representa um ganho de inteligência de dezoito pontos em relação ao Sonnet 5 no índice independente, com os mesmos preços publicados, com uma economia real e mensurável disponível para quem desce a escala de esforço — e uma penalidade real e mensurável para quem não o faz.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente