Um cartão de destaque intitulado 'Claude Haiku 5.5 vs Claude Sonnet 5.5', com o subtítulo 'Seis dias e um nível de diferença'. Dois cartões arredondados ficam lado a lado: o da esquerda, com o título 'Claude Haiku 5.5' e linhas que trazem Índice 43, US$ 0,21 por tarefa e Lançado em 7 de outubro de 2026; o da direita, com o título 'Claude Sonnet 5.5' e linhas que trazem Índice 56, US$ 7,60 por tarefa e Lançado em 28 de setembro de 2026. Entre eles, um selo centralizado traz 'lacuna de custo medida de 36x'. Uma linha de rodapé traz 'Custo por tarefa e Índice de Inteligência por Artificial Analysis; ambos os modelos com contexto de 1M.'
Guides & Insights

Claude Haiku 5.5 vs Claude Sonnet 5.5: Uma Tabela de Preços 20x, uma Fatura Medida 36x

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Haiku 5.5 e Claude Sonnet 5.5 distam seis dias e um nível na mesma família, compartilham uma janela de contexto de um milhão de tokens e respondem no mesmo formato de API. Na tabela de preços publicada, o mais barato custa um quinto do mais caro na faixa em que a maioria das requisições se enquadra. No painel independente da Artificial Analysis, a diferença é ainda maior: US$ 0,21 para concluir uma tarefa do Intelligence Index no Claude Haiku 5.5, contra US$ 7,60 no Claude Sonnet 5.5, para um Intelligence Index de 43 contra 56. O sinal que deu origem a este artigo colocou o Claude Haiku 5.5 como "muito melhor que o GPT-6 Luna" e "mais próximo do Sonnet 5.5". A primeira metade disso corresponde, grosso modo, ao que o próprio comparativo do fornecedor mostra. A segunda metade é onde as medições deixam de concordar com o marketing, e vale a pena ser preciso sobre qual delas.

Dois modelos, seis dias e um nível de diferença

Claude Haiku 5.5 foi lançado em 7 de outubro de 2026 sob o ID do modelo claude-haiku-5-5. É o substituto direto do Claude Haiku 4.5, recebe texto e imagens e retorna texto, e é o primeiro modelo da classe Haiku ao qual a Anthropic deu uma configuração de esforço ajustável — Baixo, Médio, Alto, Xhigh e Máximo, com médio como padrão da API. A Anthropic o chama de "o modelo pequeno mais barato, mais rápido e mais capaz que já lançamos", e sua nota de rodapé qualifica isso como mais rápido na velocidade padrão de cada modelo, ainda atrás dos modelos Opus quando estes operam em Modo Rápido.

O Claude Sonnet 5.5 chegou seis dias antes, em 28 de setembro de 2026, como claude-sonnet-5-5 — o nível que a Anthropic posiciona como a melhor combinação de velocidade e inteligência, e o que ela recomenda para codificação agêntica complexa. Mesma janela de um milhão de tokens. Diferentemente do Claude Haiku 5.5, ele não tem faixa de preço por comprimento de prompt, o que acaba importando mais do que a vantagem de seis dias.

Ambos já estão disponíveis em todas as plataformas, incluindo Amazon Web Services, Google Cloud e Microsoft Azure, e ambos trazem um compromisso de descontinuação não antes de um ano após o lançamento — 7 de outubro de 2027 para Claude Haiku 5.5, 28 de setembro de 2027 para Claude Sonnet 5.5. A Anthropic afirma que Claude Sonnet 5.5 está disponível com retenção zero de dados, equivalente a Claude Opus 5.5 e Claude Sonnet 5.

A tabela de preços, ambos os lados, em um só lugar

Por milhão de tokens, em dólares americanos, conforme as tarifas publicadas da Anthropic:

• Entrada — Claude Haiku 5.5: US$ 0,10 para prompts de até 100.000 tokens; US$ 0,50 acima desse limite; Claude Sonnet 5.5: US$ 2,00 fixo, sem escalonamento.

• Saída — Claude Haiku 5.5 $0,50 até 100.000 tokens, $2,50 acima disso; Claude Sonnet 5.5 $10,00 fixo.

• Leituras de cache — Claude Haiku 5.5 $0.01 na faixa inferior e $0.05 acima dela; Claude Sonnet 5.5 $0.10. A Anthropic reduziu pela metade as leituras de cache do Claude Sonnet 5.5, de $0.20, ao mesmo tempo que o lançamento do Haiku, e afirma que, como as leituras de cache representam uma grande parte do uso de tokens agênticos, o Claude Sonnet 5.5 agora custa cerca de 20% menos na maioria dos trabalhos agênticos.

• Gravações no cache — Claude Haiku 5.5 US$ 0,125 para uma gravação de cinco minutos e US$ 0,20 para uma gravação de uma hora na faixa inferior, US$ 0,625 e US$ 1,00 acima dela; Claude Sonnet 5.5 US$ 2,50 para uma gravação de cinco minutos e US$ 4,00 para uma hora.

Batch — a API Batch tem 50% de desconto tanto na entrada quanto na saída. Isso coloca o Claude Haiku 5.5 a $0.05 $0.05 abaixo da linha de 100.000 tokens e $0.25 $1.25 acima dela, contra o Claude Sonnet 5.5 a $1.00 e $5.00.

Ao comparar essas linhas, o padrão é consistente: na faixa inferior, você vê uma diferença de 20x na entrada e uma diferença de 20x na saída; acima da linha, 4x e 4x. A chamada principal da Anthropic é "cerca de 75% menos custo para executar", em média, em comparação com o Claude Haiku 4.5, refinada em uma nota de rodapé para 90% mais barato abaixo de 100.000 tokens e 50% mais barato acima disso, com a mudança do tokenizador incorporada a essa média.

O passo de 100.000 tokens é onde a aritmética vira

Duas coisas puxam em direções opostas, e apenas uma delas está na tabela de preços. Os preços caem drasticamente em relação ao Claude Haiku 4.5. Ao mesmo tempo, o Claude Haiku 5.5 traz um tokenizador atualizado, semelhante aos do Claude Sonnet 5.5 e do Claude Opus 5.5, que, segundo a Anthropic, "usa um pouco mais de tokens por tarefa" — então um prompt idêntico chega como um número maior de tokens faturáveis do que teria na geração anterior. A média de 75% é o resultado líquido de ambos, e é um número do fornecedor.

A linha de 100.000 tokens é o que pega as pessoas. A Anthropic cobra o Claude Haiku 5.5 com base no comprimento do prompt: uma requisição cujo prompt excede 100.000 tokens paga os preços mais altos pela requisição inteira, não apenas pelos tokens que ultrapassam o limite. O comprimento do prompt conta todos os tokens de entrada, incluindo leituras de cache e gravações de cache, e cada requisição é precificada individualmente — uma requisição longa paga a faixa mais alta mesmo quando parte do prompt é um acerto de cache, e as requisições anteriores mantêm os preços pelos quais foram cobradas. Um pipeline de recuperação que fica confortavelmente em 90.000 tokens paga US$ 0,10 e US$ 0,50. Um pequeno ajuste na janela e a requisição inteira é reprecificada em US$ 0,50 e US$ 2,50. O Claude Sonnet 5.5 não faz isso, porque a janela completa de um milhão de tokens é cobrada pelo preço padrão.

Duas consequências decorrem disso, apontando em direções opostas. Primeiro, o cruzamento que se espera — contexto longo fazendo com que o modelo caro se torne o mais barato — não acontece: o Claude Haiku 5.5 acima da linha ainda é um quarto do Claude Sonnet 5.5 na tabela de preços. Segundo, a diferença com que você contava diminui de 20x para 4x exatamente quando sua carga de trabalho fica pesada, que é exatamente quando os números absolutos começam a importar. O degrau é a razão pela qual um pipeline sensível a custos precisa de sua própria linha de orçamento, em vez de uma tarifa por token.

O que cada fornecedor relata que pontua

Tudo nesta seção é informado pelo fornecedor e não foi reproduzido por terceiros. A Anthropic publica o mesmo conjunto de comparações nas páginas do Claude Haiku 5.5 e do Claude Sonnet 5.5, e, onde as duas páginas se sobrepõem, elas concordam:

• GDPval-AA v2.1, trabalho de conhecimento — 1.620 para Claude Haiku 5.5, contra 1.840 para Claude Sonnet 5.5, 735 para Claude Haiku 4.5 e 1.437 para GPT-6 Luna.

• AA-Briefcase v1.1 — 1.578 para o Claude Haiku 5.5, contra 1.824 do Claude Sonnet 5.5, 614 do Claude Haiku 4.5 e 1.336 do GPT-6 Luna.

• OSWorld 2.1, uso de computador, subconjunto offline — 72,4% para Claude Haiku 5.5, contra 83,9% para Claude Sonnet 5.5, 15,7% para Claude Haiku 4.5 e 48,9% para GPT-6 Luna.

• Terminal-Bench 4.0, codificação agêntica — 39,2% para Claude Haiku 5.5, contra 70,6% para Claude Sonnet 5.5, 0,0% para Claude Haiku 4.5 e 16,4% para GPT-6 Luna.

• FrontierCode 1.1, Main — 46,4% para Claude Haiku 5.5, contra 52,1% para Claude Sonnet 5.5 em esforço Xhigh, 42,4% para GPT-6 Luna. A Anthropic também destaca que o Claude Sonnet 5.5 pontua mais baixo em esforço Max do que em Xhigh neste caso, o que atribui ao uso mais frequente de uma habilidade de revisão de código causando timeouts ou edições fora do escopo.

• Cartografia, raciocínio visual sem ferramentas — 46,4% para Claude Haiku 5.5, contra 61,6% para Claude Sonnet 5.5, 6,4% para Claude Haiku 4.5 e 29,1% para GPT-6 Luna.

• Humanity's Last Exam — 45,9% sem ferramentas e 57,4% com elas para o Claude Haiku 5.5; 64,5% com ferramentas para o Claude Sonnet 5.5, 18,7% para o Claude Haiku 4.5 e 56,9% sem ferramentas para o Claude Sonnet 5.5 na mesma página. A Anthropic observa que os números da família GPT-6 podem estar desatualizados porque a OpenAI corrigiu um bug de compreensão de imagens e as pontuações de terceiros ainda não tinham sido todas atualizadas.

Duas dessas linhas merecem ser lidas duas vezes. No FrontierCode, os dois modelos estão realmente próximos — 46,4% contra 52,1% — e no Chartography, onde não há ferramentas nas quais se esconder, a diferença é de 15 pontos. O Terminal-Bench 4.0 não está nem perto: 39,2% contra 70,6% é uma classe de capacidade diferente, e é por isso que a página do Claude Sonnet 5.5 da Anthropic ainda aponta para Claude Sonnet 5.5 e Claude Opus 5.5 para codificação agêntica complexa e apresenta o Claude Haiku 5.5 como o modelo para trabalho restrito e de alto volume.

O que o conselho independente acrescenta

Os números da Anthropic comparam os seus próprios modelos entre si e com um concorrente. Um painel independente coloca ambos frente a todo o setor, e a métrica que ele reporta e que os fornecedores não reportam é o custo por tarefa concluída.

O Artificial Analysis pontua o Claude Haiku 5.5 no Max effort com um Intelligence Index de 43, bem acima da mediana de 13 entre modelos comparáveis, gerando 440M tokens de saída no Intelligence Index, contra uma mediana de 100M — muito verboso —, a US$ 0,10 de entrada e US$ 0,50 de saída por milhão, e 242 tokens de saída por segundo. Seu custo medido é de US$ 0,21 por Intelligence Index.

O mesmo ranking pontua o Claude Sonnet 5.5 com 56, contra uma mediana de 26, gerando 410 milhões de tokens de saída contra uma mediana de 88 milhões, a US$ 2,00 de entrada e US$ 10,00 de saída com um desconto de cache de 90%. Seu custo medido é de US$ 7,60 por tarefa do Intelligence Index.

A headless capture of the Artificial Analysis model page for Claude Haiku 5.5 at Max effort, showing the header 'Claude Haiku 5.5 (Max)' with the Anthropic vendor label and release month October 2026, a rank strip reading Intelligence #2/182, Speed #8/182, Cost #46/182 and Verbosity #62/182, the price strip In $0.10, Out $0.50 and $0.21 per task, a Comparison Summary stating an Artificial Analysis Intelligence Index of 43 against a median of 13 with 440M output tokens generated, and an output-token speed of 242 tokens per second described as notably fast. A specification panel confirms a 1M-token context window, reasoning enabled, text and image input and text output.A headless capture of the Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), showing the Anthropic vendor label and release month September 2026, a rank strip reading Intelligence #3/216, Cost #98/216 and Verbosity #102/216, the price strip In $2.00, Out $10.00, a 90% cache discount and $7.60 per task, a Comparison Summary stating an Intelligence Index of 56 against a median of 26 with 410M output tokens generated against a median of 88M, and a specification panel showing a 1M-token context window and text and image input.

Coloque essas duas linhas lado a lado e a proporção conta a história. US$ 0,21 contra US$ 7,60 é um pouco mais de 36x, e os dois modelos estão praticamente empatados em verbosidade — 440M tokens de saída contra 410M — então esse multiplicador é quase inteiramente a tabela de preços fazendo o que ela diz que fará. Na própria tabela de preços do fornecedor, a mesma comparação é 20x. O excedente vem das coisas que um preço por token não consegue mostrar: o modelo mais barato chega à sua resposta em menos tokens cobrados por tarefa nesta configuração de esforço, e as leituras de cache são cobradas a um décimo da tarifa do Claude Sonnet 5.5. Mesmo ambiente de teste, mesmas tarefas, medição independente.

A generated two-column comparison scoreboard titled 'Claude Haiku 5.5 vs Claude Sonnet 5.5 - the scoreboard'. The left column, headed Claude Haiku 5.5, reads AA Intelligence Index: 43; Cost per Index task: $0.21; Input / output per 1M: $0.10 / $0.50; Output speed: 242 tok/s; Context window: 1M; Terminal-Bench 4.0: 39.2%. The right column, headed Claude Sonnet 5.5, reads AA Intelligence Index: 56; Cost per Index task: $7.60; Input / output per 1M: $2.00 / $10.00; Output speed: not published; Context window: 1M; Terminal-Bench 4.0: 70.6%. A footer line reads 'Index, cost per task and speed per Artificial Analysis; Terminal-Bench vendor-reported.'

Onde o plano barato realmente acaba

Os números de clientes que a Anthropic publica decidem a divisão com mais frequência do que os benchmarks, e todos apontam na mesma direção. A Asana relata latência mais de 30% menor na conclusão de tarefas e inferência até 2,5x mais rápida por turno de agente. A Box relata uma pontuação 11 pontos acima do Claude Haiku 4.5 com cerca de metade da latência. A HubSpot relata a melhor pontuação que já viu em seu próprio conjunto, 92,8% em média de três execuções, com a maior taxa de acerto e a menor taxa de falsos positivos. A AlphaSense realiza cerca de 8 milhões de chamadas por semana através do "Ask in Document" e relata uma melhoria estatisticamente significativa em relação ao Claude Haiku 4.5, 0,84 contra 0,76. A Cognition relata que, com o Claude Haiku 5.5 como parceiro, seu agente Fusion mantém uma pontuação FrontierCode de 66,2.

Nenhum desses é um agente de horizonte longo. São soluções pontuais — uma etapa bem definida, ficando mais rápidas e mais baratas. É para esse formato que o Claude Haiku 5.5 foi construído, e é também o formato em que a vantagem de custo de 36x é dinheiro de verdade, e não um erro de arredondamento. A vantagem se acumula com o volume de chamadas e evapora com a profundidade das chamadas: cem mil chamadas de classificação por dia a $0,10 de entrada e $0,50 de saída é um item de linha que você percebe sumindo, enquanto cem turnos de agente por sessão, cada um relendo o contexto acumulado, é um item de linha que cresce de forma superlinear porque cada turno além do limite paga a faixa mais alta.

O contra-argumento do Claude Sonnet 5.5 é o custo por tentativa, e não o custo por token. A Anthropic diz que ele é mais de 30% mais rápido que o Claude Sonnet 5 e custa até 30% menos para a maioria dos trabalhos, com a economia vindo da necessidade de menos tokens em vez de tarifas mais baixas. Testadores independentes quantificam isso: o Slack relata aproximadamente 14% menos tokens de saída, a Balyasny cerca de 121k tokens por resposta contra 497k, a Box 2,4x mais rápida com 12% menos tokens, a Lovable aproximadamente um terço menos chamadas de ferramentas e cerca de metade das execuções de shell, a Atlassian com Rovo Agents até 30% mais rápidos, e a Base44 3,6 iterações por build contra 7,7 para o Claude Opus 5. Um turno que acerta vence quatro que não.

Há um terceiro fator atuando em sentido contrário. A Anthropic transferiu o esforço para um ajuste no nível do modelo nesta geração — a configuração de esforço do Claude Haiku 5.5 é definida uma vez por requisição, em vez de dimensionada como um orçamento de raciocínio por requisição, e o antigo modo budget_tokens está obsoleto nos modelos 4.6 e não é aceito nos posteriores. Para uma frota que chama um mesmo ID de modelo a partir de muitos serviços, isso é uma simplificação. Para qualquer coisa que dimensionava o próprio raciocínio por chamada, é uma reescrita.

Executando ambos atrás de um único endpoint

A razão pela qual vale a pena acertar essa decisão é que a metade errada dela é cara de desfazer: religar um caminho de produção de um ID de modelo para outro significa mexer em todos os pontos de chamada que assumiam o comportamento do antigo. A forma mais barata de descobrir a que camada uma carga de trabalho pertence é executar ambas por trás de um único endpoint e mover o tráfego entre elas por configuração em vez de por refatoração.

É para isso que o OrcaRouter serve. O Claude Sonnet 5.5 está no catálogo como anthropic/claude-sonnet-5.5, ao lado de Claude Sonnet 5, Claude Opus 5.5 e Claude Haiku 4.5 — o nível Haiku mais antigo continua disponível como ponto de referência enquanto você migra dele. A plataforma repassa o preço de tabela do provedor sem nenhuma margem, então os US$ 2,00 e US$ 10,00 acima são as tarifas que você paga, e o mesmo vale no sentido inverso: quando um fornecedor reajusta o preço, o novo preço já está valendo aqui no mesmo dia, e foi assim que o corte no preço de leitura de cache do Claude Sonnet 5.5 chegou até nós. Dois recursos fazem o trabalho que esta decisão específica exige. O failover automático mantém um modelo que você ainda está avaliando fora do seu caminho crítico por conta própria, e a DSL de roteamento permite enviar chamadas com menos de 100.000 tokens para o nível barato e encaminhar as de contexto longo ou horizonte longo para o mais caro no mesmo fluxo de requisições, sem um segundo contrato ou um segundo SDK.

Para ser preciso sobre o que está e o que não está hospedado: Claude Sonnet 5.5 pode ser roteado através de nós hoje. Claude Haiku 5.5 ainda não está no catálogo. Até que esteja, ele fica na própria API da Anthropic e nas três plataformas de nuvem listadas acima.

Como decidir

Escolha o Claude Haiku 5.5 quando a tarefa for restrita, de alto volume e verificável — classificação, extração, roteamento, sumarização, o trabalho por turno dentro de um agente que você já construiu. A diferença de preço de 20x é justamente o ponto aí, a etapa de 100.000 tokens é evitável por design, e o valor de US$ 0,21 por tarefa, medido de forma independente, mostra que o ganho sobrevive fora do próprio laboratório do fornecedor. Ajuste o controle de esforço por classe de tarefa em vez de deixá-lo no padrão; em um modelo da classe Haiku, a diferença entre Low e Max é um multiplicador de custo, não uma preferência de qualidade.

Escolha Claude Sonnet 5.5 quando a tarefa for de horizonte longo, agêntica ou não verificável — código que precisa compilar, uso de computador que precisa deixar a tela em um estado conhecido, qualquer coisa em que uma resposta errada custe mais do que a chamada. Terminal-Bench 4.0 com 70,6% contra 39,6% não é uma nuance, é uma classe de capacidade diferente, e a tabela de preços fixa significa que um contexto longo não reprecifica silenciosamente toda a solicitação. Se sua carga de trabalho estiver genuinamente em um ponto intermediário, a resposta honesta é que nenhum dos modelos tem ainda um amplo conjunto de reprodução de terceiros por trás dele, as pontuações do índice vêm de um único harness, e os números do fornecedor citados acima são do próprio fornecedor.

O que mudaria esta resposta

Três coisas merecem atenção, e nenhuma delas é um lançamento de benchmark. A primeira é se avaliações independentes do Claude Haiku 5.5 nos níveis de esforço Low, High e Xhigh — não apenas Max — mostram a mesma relação de custo por tarefa, porque o ajuste de esforço é a alavanca mais barata da comparação e a menos medida. A segunda é se o degrau de 100.000 tokens sobrevive; uma terceira faixa, ou nenhuma faixa na próxima geração, mudaria a aritmética para todo pipeline de recuperação na linha mais do que qualquer pontuação isolada de benchmark. A terceira é o tokenizador. Se um checkpoint posterior tokenizar o mesmo texto à taxa mais antiga, a média de 75% da Anthropic se torna um piso em vez de uma meta, e a diferença em relação ao Claude Sonnet 5.5 aumenta sem que nenhum dos preços se altere.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente