
Claude Sonnet 5.5: O Padrão Intermediário, Totalmente Especificado
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 64 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Claude Sonnet 5.5 é o modelo de gama média da linha Claude, lançado em 28 de setembro de 2026, e o preço é o motivo que por si só justifica uma página dedicada: 2 dólares por milhão de tokens de entrada e 10 dólares por milhão de tokens de saída, contra 4 e 20 dólares do Claude Opus 5.5, o carro-chefe lançado seis dias antes. Ou seja, metade do preço de saída por 1,62 ponto do Artificial Analysis Intelligence Index — 56,00 para o modelo de gama média contra 57,62 para o carro-chefe, ambos os valores medidos pela Artificial Analysis na revisão v4.3.2 do índice, e não por nós nem pelo fornecedor. Acima dos dois está o Claude Fable 5.1, a 10 / 50 dólares e 53,35 na mesma revisão: mais caro do que o carro-chefe e atrás dele. Pelo mesmo preço de tabela de 2 / 10 dólares do Claude Sonnet 5.5 está o GPT-6.1 Sol da OpenAI, com 51,83 — 417 centésimos de índice do outro lado da linha, que é a comparação que um leitor a ponderar o modelo de gama média tem realmente de fazer.
Esta página é uma referência, e são as datas que explicam o motivo, não a atualidade. O Claude Sonnet 5.5 completa dez dias em 2026-10-08, o que o coloca fora da janela de sete dias na qual este blog noticia novidades. O que está dentro dessa janela é um evento de seis dias atrás: duas publicações no X datadas de 2026-10-02, alegando que um modelo sucessor desta família supera um rival que o próprio fornecedor concluiu e reteve. Essa alegação não tem id de modelo, nem tabela de preços, nem janela de contexto e nem benchmark por trás dela em nenhum registro alcançável a partir daqui, e não é o assunto desta página — a cadeia de fontes, a verificação de ausência na superfície do fornecedor e a dispersão do índice de cinco modelos pertencem integralmente ao artigo que este blog já publicou sob o título "O Claude Fable 5.5 superou o GPT-6.1 Astra antes de ele existir — e é isso que é interessante", datado de 2026-10-03. O que essa alegação produziu foi uma fila de leitores perguntando em qual modelo Claude já lançado padronizar enquanto esperam, e essa pergunta exige uma página sobre o modelo que existe. Esta é ela.
O que foi lançado em 28 de setembro de 2026
A documentação do próprio fornecedor apresenta a especificação diretamente, e ela é uma continuação do nível, e não um novo formato. Tudo abaixo foi lido da documentação da Claude Platform da Anthropic em 2026-10-08, portanto é a especificação da Anthropic, não um teste independente dela.
• Lançado — 28 de setembro de 2026. A própria página de documentação do modelo começa com a frase "Mais recente. Lançado em 28 de setembro de 2026."
• Posicionamento — "A melhor combinação de velocidade e inteligência", com a latência comparativa listada como Rápido em comparação a Moderado para o Claude Opus 5.5, Mais lento para o Claude Fable 5.1 e Mais rápido para o nível pequeno.
• ID do modelo — claude-sonnet-5-5 na API Claude, no Google Cloud, no Microsoft Foundry e no Claude na AWS; anthropic.claude-sonnet-5-5 no Amazon Bedrock. Todo ID de modelo Claude é um snapshot fixo, portanto a string não é um ponteiro que muda sob seus pés.
• Contexto e saída — 1.000.000 de tokens de contexto e 128.000 tokens de saída síncrona na API Messages, chegando a 300.000 com o output-300k-2026-03-24 cabeçalho beta na API Message Batches.
• Thinking — adaptativo, sempre ativado por padrão, com um esforço padrão de high. A configuração mais baixa é between_tools, que desativa o pensamento antecipado e é aceita em high esforço ou abaixo. Definir temperature, top_p ou top_k para qualquer coisa diferente do seu padrão retorna um erro 400, então uma solicitação migrada de um modelo Claude mais antigo com uma temperatura ajustada falhará ruidosamente em vez de silenciosamente.
• Corte de conhecimento — junho de 2026, tanto para o corte confiável quanto para o corte dos dados de treinamento.
• Ciclo de vida — Ativo (mais recente), com compromisso de descontinuação não antes de 28 de setembro de 2027 nas plataformas operadas pela Anthropic. O Amazon Bedrock e o Google Cloud definem suas próprias datas.
A forma como o fornecedor apresenta o lançamento merece citação porque é uma afirmação, e não uma medição: o anúncio da Anthropic descreve o Claude Sonnet 5.5 como “uma evolução clara em relação ao Sonnet 5, que roda 30% mais rápido e custa até 30% menos na maioria dos trabalhos”. Essa frase é do fornecedor, não foi reproduzida por nós, e é o tipo de afirmação que depende inteiramente de qual trabalho você coloca diante dela. Há também um custo de migração associado ao lançamento que não é assunto desta página: cinco mudanças incompatíveis afetam código que já roda no Claude Sonnet 5, e uma sexta altera o formato da resposta sem fazer nenhuma requisição falhar. Essa contabilidade faz parte do artigo sobre a implementação que este blog publicou na semana do lançamento, e é a primeira coisa a ler se você tem o Sonnet 5 em produção hoje.

Os 1,62 pontos, e a metade do preço
As pontuações independentes para este modelo vêm de um único lugar, e carregam um número que decide a discussão. A Artificial Analysis mede o Claude Sonnet 5.5 em 56,00 no seu Intelligence Index, revisão v4.3.2, na configuração que a página nomeia como "Claude Sonnet 5.5 (Max, Default Fallback)". Lemos essa página em 2026-10-08. Na mesma revisão, no mesmo dia:
• Claude Opus 5.5 — 57,62, lançado em 2026-09-22, $4 / $20
• Claude Sonnet 5.5 — 56,00, lançado em 28/09/2026, US$ 2 / US$ 10
• Claude Fable 5.1 — 53,35, lançado em 2026-09-01, $10 / $50
• GPT-6 Astra — 52,67, lançado em 03/09/2026, $10 / $50, com um nível de contexto longo acima de 272.000 tokens de prompt a $20 / $75
• GPT-6.1 Sol — 51,83, lançado em 2026-09-29, $2 / $10
Indicar qual revisão importa, porque uma pontuação de uma versão do índice não é comparável à pontuação de outra: a v4.3.2 incorpora dez avaliações — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1 — e a composição desse conjunto mudou ao longo das revisões. Todos os cinco números acima vêm da mesma revisão, motivo pelo qual podem ser lidos uns em relação aos outros e pelo qual nenhum deles pode ser lido em relação a um número citado de uma versão anterior.
A comparação de preços é a parte que decide o comportamento. A taxa de saída do Claude Sonnet 5.5 é metade da do Claude Opus 5.5, e sua taxa de entrada também é metade; na própria tabela do fornecedor, o modelo intermediário custa $2 / $10, enquanto o modelo topo de linha custa $4 / $20. Combine os dois números publicados e a proporção é gritante: por dólar do preço de tabela da saída, o Claude Sonnet 5.5 carrega 5,60 pontos de índice e o Claude Opus 5.5 carrega 2,88 — quase o dobro de índice por dólar de saída, na própria tabela de preços da Anthropic e na própria medição da Artificial Analysis. Isso é aritmética sobre dois números publicados, e não uma medição de nada, e é a forma honesta do argumento em favor do modelo intermediário. Também não é um veredito: um ponto de índice não é uma unidade de correção, e o ponto do restante desta página é do que o 1,62 é feito e do que não é.

A tabela de preços, e as duas linhas que mais oscilam
Lista de preços completa da Anthropic, consultada em 2026-10-08. Todos os números desta seção são do fornecedor.
• Entrada — $2,00 por milhão de tokens. Saída — $10,00 por milhão, e os tokens de raciocínio são cobrados como saída, o que não pode ser suprimido aqui porque o raciocínio adaptativo está ativado por padrão.
• Leitura de cache — US$ 0,10 por milhão, que a Anthropic documenta como 5 por cento do preço base de entrada. É o mesmo desconto proporcional apresentado pelo Claude Opus 5.5, portanto o cache não altera o ranking entre os dois, e de fato significa que uma longa execução de agente que mantém um prefixo estável paga um décimo da tarifa de entrada por tudo o que relê.
• Gravação no cache — US$ 2,50 por milhão para o cache de cinco minutos, US$ 4,00 para o cache de uma hora. O comprimento mínimo de prompt armazenável em cache é de 512 tokens, então prompts curtos não conseguem obter o desconto de forma alguma.
• Batch API — 50% de desconto em ambos os sentidos, ou seja, $1.00 de entrada e $5.00 de saída para trabalho que pode esperar.
• Sem sobretaxa de contexto longo — A Anthropic cobra a janela completa de 1M de tokens à tarifa padrão por token neste modelo, então uma requisição de 900.000 tokens custa o mesmo por token que uma de 9.000. Isso é uma diferença real em relação ao GPT-6 Astra, cujo nível de contexto longo acima de 272.000 tokens de prompt sobe para $20 / $75 — vale mencionar porque é o único ponto em que os números de destaque dos dois fornecedores divergem acentuadamente quando um prompt fica longo.
Duas linhas, no fim das contas, decidem a maioria das faturas, e não a tarifa anunciada: o desconto de leitura de cache ao longo de uma longa execução de agente, e o desconto de lote para qualquer coisa assíncrona. O valor anunciado de $2 / $10 é o que acaba sendo comparado em um ranking; já as linhas de cache e de lote são aquelas a partir das quais uma fatura mensal é de fato montada.
O que a lacuna significa e o que não significa
O Intelligence Index é um número sobre um conjunto fixo de tarefas, e essa única propriedade explica a maior parte da confusão em torno dele. As dez avaliações por trás do v4.3.2 incluem codificação agêntica e trabalho em terminal, raciocínio científico de nível de pós-graduação, um conjunto de engenharia de software, um conjunto de automação agêntica e um conjunto de recuperação de contexto longo, ponderados em um composto. Um modelo que está 1,62 pontos atrás de outro está atrás nesse composto — não na sua carga de trabalho, que pode ponderar esses dez em uma proporção completamente diferente e pode conter tarefas que nenhum deles representa.
Na prática, isso significa uma divisão pela forma do trabalho, e não pelo prestígio da camada. O próprio seletor de modelos da Anthropic explicita essa divisão, e vale a pena lê-lo, porque ele não bajula a camada intermediária: a documentação diz aos leitores para “começar com o Claude Opus 5.5 para a maioria das cargas de trabalho” e recorrer ao Claude Fable 5.1 “para raciocínio exigente e trabalho agêntico de horizonte longo, ou quando suas avaliações no Claude Opus 5.5 com esforço maior ainda ficarem aquém”. O Claude Sonnet 5.5 não é o modelo com o qual essa frase começa. É o modelo que a mesma documentação descreve como a melhor combinação de velocidade e inteligência, com a latência comparativa mais rápida fora da camada pequena — o que é um argumento diferente, e mais restrito.
Então, a leitura honesta é esta. O modelo intermediário costuma ser a resposta certa para trabalho bem delimitado em volume: funcionalidades e correções de bugs em uma base de código conhecida, extração e classificação com um formato de saída definido, ciclos de chamada de ferramentas em que a parte difícil é a infraestrutura de execução, e não o raciocínio, e qualquer coisa em que um primeiro token rápido e um baixo custo por chamada importem mais do que os últimos dois por cento de capacidade. O modelo principal justifica seu preço quando o trabalho é genuinamente de horizonte longo — execuções de agente de várias horas, refatorações que abrangem arquivos que o prompt não consegue conter de uma só vez, e avaliações no modelo intermediário que ficam mensuravelmente aquém com esforço mais alto. Essa última condição é do próprio fornecedor, e é testável: aumente o nível de esforço no modelo intermediário, rode sua própria avaliação e veja se isso fecha a lacuna. Se fechar, o 1,62 não era essencial para você. Se não fechar, você comprou sua resposta com seus próprios números, e não com o composto de outra pessoa.
O que a diferença não significa é que 1,62 pontos sejam nada. É a margem inteira entre dois modelos e, numa estrutura de avaliação fixa sob condições idênticas, é uma ordenação real. É simplesmente uma ordenação de um conjunto específico de tarefas, com esforço máximo e fallback padrão, e não diz nada sobre qual dos dois é a melhor compra para uma carga de trabalho na qual nenhum deles foi avaliado em benchmark.
A armadilha do nome: qual página do Claude Sonnet 5.5 é esta
Um leitor que pesquisa o nome deste modelo encontra várias páginas neste blog que se parecem com esta, mas não são. A datada de 2026-09-24 é a página de antecipação: foi escrita antes de o modelo ser lançado, e seu assunto era uma única publicação no X alegando um teste sigiloso, reconstruída com base nos números do modelo que substituiria. A publicada na semana de lançamento é o artigo de implantação: seu assunto são as cinco alterações que quebram compatibilidade e afetam código já em execução no Claude Sonnet 5, além da sexta alteração que modifica o formato da resposta sem gerar erro. Há também uma série de páginas de comparação que colocam o nome deste modelo contra modelos de outros fornecedores, e uma página de aplicação sobre o que a promoção do lançamento abrange.
Nenhuma delas é a página do modelo, e é essa a lacuna que este texto preenche. Esta página é a referência que um leitor alcança depois de pesquisar o nome do próprio modelo: o que é, quanto custa, o que mede e a que trabalho ele pertence. Os detalhes de migração da página de implementação e a crítica de fontes da página de antecipação permanecem onde estão; se você tem código do Sonnet 5 em produção, a página de implementação é o seu primeiro clique, e esta página é o que lhe diz se o modelo para o qual você está migrando é o que você quer.
Vale a pena corrigir um hábito de nomenclatura enquanto estamos aqui, porque ele induz a erro por si só. O sufixo 5.5 indica uma geração, não uma posição. Claude Sonnet 5.5 e Claude Opus 5.5 são da mesma geração da mesma família, e o número antes do ponto é o nível. Nada no sufixo indica qual deles vence um benchmark.
Disponibilidade, datada
Claude Sonnet 5.5 está no OrcaRouter desde o seu lançamento, como anthropic/claude-sonnet-5.5, ao preço de tabela da própria Anthropic, sem nenhuma margem adicional: US$ 2,00 de entrada e US$ 10,00 de saída por milhão de tokens, os dois valores lidos do nosso próprio endpoint de modelo em 2026-10-08 e correspondendo linha a linha à tabela de preços do fornecedor. Nossa página para ele traz a mesma janela de contexto de 1M de tokens e saída máxima de 128K, lista texto, imagem e arquivo como tipos de entrada aceitos e texto como a única saída, marca-o como lançado em 2026-09-28 e não descontinuado, e mostra que ele pode ser acessado tanto pelo endpoint chat-completions compatível com OpenAI quanto pelo endpoint messages da própria Anthropic — o que o torna uma mudança direta para uma integração que já fala qualquer um dos dois.
Tudo o resto no mesmo catálogo é acessível a partir da mesma chave: uma API para mais de 200 modelos, com preço de tabela do fornecedor repassado com 0% de margem de modo que um corte de preço do fornecedor chega ao cliente no dia em que é anunciado, failover automático quando um endpoint se degrada, e uma DSL de roteamento para os casos em que você quer fixar um modelo ou compor vários em uma única resposta. É essa combinação que torna a pergunta desta página barata de responder, em vez de cara. Ambos os modelos da comparação acima estão atrás da mesma credencial, portanto o preço com que você compara é o preço publicado pelo próprio fornecedor, e não o de um revendedor, e o teste de versão custa uma execução de avaliação em vez de um projeto de migração: direcione uma fração do tráfego para anthropic/claude-sonnet-5.5, mantenha o resto no modelo principal, e deixe que seus próprios números de custo por tarefa concluída decidam qual deles deve ser o padrão.

A versão curta
O Claude Sonnet 5.5 é um modelo de nível intermediário, com números próximos aos do carro-chefe e metade do preço de saída do carro-chefe, e os três fatos que decidem se ele será seu padrão são estes. Ele fica 1,62 ponto atrás do Claude Opus 5.5 no índice v4.3.2 da Artificial Analysis, com 56,00 contra 57,62, sendo ambos os números medidos na mesma revisão e na mesma configuração de esforço máximo com fallback padrão. Ele custa US$ 2 / US$ 10 contra US$ 4 / US$ 20 do carro-chefe, com os descontos de cache e de lote proporcionais em vez de diferentes, de modo que a diferença de preço sobrevive a todos os descontos que qualquer um dos modelos oferece. E ele usa high como esforço padrão, enquanto o padrão do carro-chefe é medium, o que significa que uma configuração herdada do carro-chefe roda um nível mais alto aqui, e não mais baixo, e o custo disso é você quem precisa medir, em vez de presumir.
O próprio seletor da Anthropic ainda começa no Claude Opus 5.5 para a maioria das cargas de trabalho, e vale a pena saber disso antes de padronizar qualquer coisa. Mas, para a maioria dos leitores que chegam a esta página pesquisando o nome deste modelo, o intermediário é o padrão sensato, e o carro-chefe é a exceção que você compra quando suas próprias evals exigem — trabalho bem delimitado em volume, latência rápida, uma janela de um milhão de tokens sem sobretaxa de contexto longo e uma tarifa que reduz pela metade a linha de saída. Ambos estão a uma chave de distância no OrcaRouter, e a eval que decide entre eles custa uma tarde, não uma migração.
Comparados neste artigo4
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
