Um cartão de título gerado com o texto 'Claude Haiku 5.5 está no ar', com o selo de lançamento 'GA 7 de out. de 2026', dois cartões informativos com os textos 'Entrada $0,10 / 1M até 100 mil tokens' e 'Saída $0,50 / 1M até 100 mil tokens', e uma linha de rodapé com o texto 'Um corte de manchete, duas notas de rodapé: 90% abaixo do limite, 50% acima dele, com cerca de 30% mais tokens.' O logotipo real da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Claude Haiku 5.5 já está disponível a US$ 0,10 por milhão de tokens: a alegação de 75% e suas duas notas de rodapé

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Anthropic colocou o Claude Haiku 5.5 em disponibilidade geral em 7 de outubro de 2026, a US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída — os mesmos dois números que a OpenAI cobra pelo GPT-6 Luna, e um quinto do que o Claude Haiku 4.5 custa desde 2025, quando foi lançado a US$ 1,00 e US$ 5,00. A manchete do post de lançamento da Anthropic é que o novo modelo custa "cerca de 75% menos para rodar" do que seu antecessor, em média, e é esse número que toda sinopse desde então repetiu. Ele vem acompanhado de duas notas de rodapé que a maioria dessas sinopses ignorou: abaixo de 100.000 tokens o corte é de 90%, acima disso o corte é de 50%, e o Claude Haiku 5.5 usa o tokenizador mais recente compartilhado com o Claude 4.7 e posteriores, então o mesmo texto conta como aproximadamente 30% mais tokens do que no Claude Haiku 4.5. Ou seja, os 75% são uma afirmação sobre uma conta, não sobre uma tabela de preços, e para quem tem prompts longos essas são coisas diferentes. A própria tabela comparativa do fornecedor também traz GPT-6 Luna e Claude Sonnet 5.5 como colunas ao lado dele, o que torna a documentação de lançamento excepcionalmente fácil de contestar.

A aritmética por trás de "75% menos"

Consulte primeiro a tabela de preços, porque ela não é fixa. A entrada custa US$ 0,10 por milhão até 100.000 tokens e US$ 0,50 por milhão acima disso — cinco vezes. A saída custa US$ 0,50 e depois US$ 2,50. O cache segue o mesmo escalonamento: uma gravação de cache de cinco minutos custa US$ 0,125 por milhão abaixo do limite e US$ 0,625 acima dele, uma gravação de uma hora custa US$ 0,20 e US$ 1,00, e uma leitura de cache custa US$ 0,01 e US$ 0,05. A API Message Batches concede 50% de desconto em ambos os medidores, e, no caminho de lote, o modelo oferece suporte a até 300.000 tokens de saída com o output-300k-2026-03-24 como cabeçalho beta.

Agora, acrescente o tokenizador a isso, porque é aí que a alegação principal fica interessante. Um prompt que media 90.000 tokens no tokenizador do Claude Haiku 4.5 mede cerca de 117.000 no novo. Ele não mudou de tamanho, mas ultrapassou a linha de 100.000 tokens, então é cobrado a US$ 0,50 por milhão de entrada em vez de US$ 0,10. No Claude Haiku 4.5, esse mesmo conteúdo custava US$ 0,09 de entrada (US$ 1,00 por milhão × 0,09 milhão). No Claude Haiku 5.5, custa US$ 0,0585. Isso é um corte de 35% — real, e muito longe de 90%. O número de 90% se aplica a requisições que permanecem abaixo da linha depois que o tokenizador as expande, que é onde vive uma grande parte do tráfego de chamadas curtas: uma chamada de classificação de 20.000 tokens passa a 26.000 tokens, permanece na primeira faixa, e aí o preço de entrada é realmente um décimo do que era.

Três coisas decorrem disso, e vale a pena separá-las em vez de fazer uma média:

• Chamadas curtas recebem o desconto integral. Extração, roteamento, classificação, sumarização de um documento que fica abaixo do limite — essas veem o valor de 90% na entrada e na saída, menos a expansão do tokenizador.

• As chamadas longas têm cerca de um terço de desconto, não três quartos. Um pedido que ultrapasse 100.000 tokens após retokenização paga US$ 0,50 e US$ 2,50 por milhão — ainda metade das tarifas do Claude Haiku 4.5, mas o escalão em que se enquadra é o dobro do escalão anunciado.

• O "75% menos em média" é um número ponderado pelo tráfego e é da Anthropic. É a descrição do próprio fornecedor sobre o seu próprio mix esperado, e a Anthropic é explícita ao afirmar que um prompt abaixo do limiar representava cerca de 90% das solicitações ao Haiku anterior. Se o seu mix não se parecer com esse mix, a sua média não se parecerá com essa média — e a única forma de saber qual é qual é contar tokens no seu próprio tráfego, no novo tokenizador, antes de definir um orçamento.

A generated one-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' with six rows reading 'Input: $0.10 / 1M up to 100K, then $0.50', 'Output: $0.50 / 1M up to 100K, then $2.50', 'Context: 1,000,000 tokens', 'Independent score: 43 at Max effort, rank 2 of 182', 'Cost per task: $0.21', and 'Throughput: 241.9 tokens per second', with a footer reading 'Independent figures per Artificial Analysis; pricing per Anthropic.' The real OrcaRouter logo is composited bottom-right.

O que mais foi lançado junto com ele

O modelo não é apenas um preço. Vários detalhes do lançamento mudam a forma como você escreve código para ele, e um deles vai quebrar um cliente existente.

• O pensamento adaptativo está ativado por padrão, com um seletor de esforço de Baixo a Máximo e padrão médio. Este é o primeiro modelo da classe Haiku com uma configuração de esforço ajustável, e é a principal alavanca tanto para a qualidade quanto para o custo por resposta.

• Os parâmetros de amostragem são rejeitados. Enviar um valor não padrão de temperature, top_p ou top_k retorna um 400. Qualquer migração que tenha carregado esses argumentos adiante falhará ruidosamente na primeira requisição em vez de degradar silenciosamente, o que é pelo menos um modo de falha honesto.

• contexto de 1M tokens e até 128.000 tokens de saída na API Messages síncrona, com data de corte de conhecimento em junho de 2026 e compromisso de descontinuação não antes de 7 de outubro de 2027.

• Cinco plataformas no primeiro dia: a API da Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform na AWS. Isso é um lançamento no mesmo dia, em vez da disponibilização por etapas que esses lançamentos costumam adotar.

• As ferramentas também avançaram. Os SDKs de Python e TypeScript da Anthropic agora oferecem suporte a computer use e browser use em beta, e a empresa adicionou créditos mensais de API para assinantes Max 5x (US$ 100), Max 20x (US$ 200) e Team (até US$ 500 compartilhados).

• A postura de segurança é mais restrita do que o preço sugere. A Anthropic afirma que as salvaguardas cibernéticas do Claude Haiku 5.5 são mais restritivas do que as do Claude Haiku 4.5, mas menos restritivas do que as dos recentes modelos de fronteira — uso defensivo mais amplo do que o permitido pelo Claude Sonnet 5.5, com testes de penetração ainda bloqueados — e que as salvaguardas de biologia são equivalentes às do Claude Sonnet 5, Claude Sonnet 5.5 e Claude Opus 5. As avaliações de alinhamento melhoraram amplamente em relação ao predecessor no próprio conjunto de avaliações da Anthropic.

O que diz a tabela do fornecedor, e o que diz o conselho independente

A Anthropic publicou uma tabela de benchmark com três colunas de comparação, e vale a pena lê-la como um documento sobre como os fornecedores argumentam. Todos os números abaixo são informados pelos fornecedores, produzidos nos harnesses da Anthropic, e nenhum deles foi reproduzido de forma independente; onde o GPT-6 Luna aparece, é a Anthropic executando suas próprias avaliações contra o modelo de um concorrente.

• Trabalho de conhecimento — GDPval-AA v2.1 em 1620 para o Claude Haiku 5.5, contra 735 para o Claude Haiku 4.5, 1437 para o GPT-6 Luna e 1840 para o Claude Sonnet 5.5. AA-Briefcase v1.1 em 1578, 614, 1336 e 1824.

• Uso de computador — OSWorld 2.1 offline a 72,4% contra 15,7%, 48,9% e 83,9%.

• Raciocínio — Humanity's Last Exam com 45,9% sem ferramentas e 57,4% com elas, contra 10,2% e 18,7% para Claude Haiku 4.5 e 56,9% e 64,5% para Claude Sonnet 5.5.

• Programação agêntica — Terminal-Bench 4.0 com 39,2% contra 0,0%, 16,4% e 70,6%. FrontierCode 1.1 (Main) com 46,4% contra 42,4% do GPT-6 Luna e 52,1% do Claude Sonnet 5.5.

• Leitura de gráficos — Chartography em 46,4% sem ferramentas contra 6,4%, 29,1% e 61,6%.

Naquela tabela, o Claude Haiku 5.5 vence todas as linhas contra tanto o Haiku quanto o GPT-6 Luna, e perde a maioria delas para o Claude Sonnet 5.5 — que é a forma honesta de um nível pequeno: um grande avanço geracional, e ainda assim um nível abaixo do modelo intermediário no trabalho mais difícil. Hinton diz isso mesmo no post, recomendando o Sonnet 5.5 e o Opus 5 para codificação agêntica complexa, enquanto posiciona o Haiku para resumos, classificação e funções de subagente.

O panorama independente é mais nuançado e exige mais atenção. A Artificial Analysis mede o Claude Haiku 5.5 no esforço Max em 43 no seu Intelligence Index v4.3.2, segundo entre 182 modelos, e 241,9 tokens de saída por segundo — rápido, como anunciado. Ela também mede um custo de US$ 0,21 por tarefa concluída do Index, porque o modelo gerou 440 milhões de tokens de saída ao executar a suíte, contra uma mediana de 100 milhões; o avaliador o descreve como muito prolixo. O GPT-6 Luna, com 38 no mesmo índice, custa US$ 0,07 por tarefa. Mesmo preço de tabela, o triplo da conta. Isso não é uma contradição da alegação de lançamento — é o mesmo fenômeno sobre o qual a alegação de lançamento trata, visto pelo outro lado: a tabela de tarifas é o que você paga por token, e o número que você realmente paga é a tarifa multiplicada pelos tokens, e o Claude Haiku 5.5 gasta mais deles por resposta do que seus rivais. O esforço é a alavanca; o padrão do modelo é médio, e não Max, e uma equipe que o fixar em um nível mais baixo verá tanto uma conta menor quanto uma pontuação menor.

Chamando-o de um só lugar

A questão de migração que este lançamento cria não é "é melhor?", mas sim "quanto custa o meu tráfego nele", e essa resposta depende do comprimento dos seus prompts, da sua taxa de acertos de cache e da configuração de esforço que você escolher. Chegar lá significa executar o seu próprio conjunto de prompts nas duas gerações — o que é barato de fazer por trás de um único endpoint e trabalhoso de fazer em dois.

O próprio Claude Haiku 5.5 ainda não está no catálogo do OrcaRouter, e dizer isso claramente é mais útil do que sugerir o contrário. O resto da linha da Anthropic é: Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 são todos chamáveis por nós hoje pelo preço de tabela do provedor com 0% de markup repassado, então a perna "antes" de um teste de migração roda na mesma chave que você manteria depois, e um corte de preço do fornecedor nessa perna fica ativo do nosso lado no mesmo dia. A perna "depois" é a API da Anthropic até que o novo modelo chegue a um runtime que nós roteamos. O que o endpoint compartilhado lhe proporciona nesse meio-tempo é failover automático por baixo da chamada, para que um novo modelo possa carregar tráfego de produção sem que o caminho dependa dele, e o DSL de roteamento para o caso em que a escalada de Haiku para Sonnet pertence à rota, e não ao código da sua aplicação.

A screenshot of OrcaRouter's model page for anthropic/claude-haiku-4.5, showing the model card and its list pricing of $1.00 per million input tokens and $5.00 per million output tokens, captured in English.

Dois resultados de clientes no lançamento valem a pena ser levados adiante como pistas, e não como prova. A Asana relata uma redução de mais de 30% na latência e inferência até 2,5x mais rápida por turno de agente; a HubSpot relata 92,8% em média em três execuções em sua suíte de CRM; a AlphaSense relata 0,84 contra 0,76 em 400 consultas. Esses são números de clientes selecionados pelo fornecedor no próprio anúncio do fornecedor, e seu valor está em dizer quais cargas de trabalho testar primeiro, não em dizer o que você vai obter.

O que mudaria o cenário?

O número de 75% será resolvido da mesma forma que toda alegação de fornecedor ponderada por tráfego é resolvida: pela sua própria fatura. O que está genuinamente em aberto do lado independente é o número de custo por tarefa. Se ele se mantiver à medida que mais execuções se acumulam, o resumo honesto deste lançamento é que a Anthropic cortou a tabela de preços em 80% e criou um modelo que gasta mais tokens por resposta, de modo que a economia efetiva é real, grande, depende da carga de trabalho e raramente é o número do cartaz. Se ele diminuir com configurações de esforço e armazenamento em cache, o nível parece ainda melhor. De qualquer forma, o número a verificar antes de uma migração é a sua própria contagem de tokens por tarefa com o novo tokenizador — esse é o único número que o post de lançamento não pode lhe dar.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente