Um cartão hero gerado exibindo 'Resumo Diário de IA — 8 de outubro de 2026' com um selo NEWS, a manchete 'Claude Haiku 5.5 é lançado e as leituras de cache do Sonnet 5.5 caem pela metade', e quatro chips exibindo $0,10 / $0,50 por 1M, contexto de 1M de tokens, esforço padrão Médio e leitura de cache de $0,20 para $0,10.
Engineering & Research

Resumo diário de IA, 8 de outubro: Claude Haiku 5.5 chega a US$ 0,10 e leituras de cache do Sonnet 5.5 caem pela metade

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Claude Haiku 5.5 foi lançado em 7 de outubro de 2026, e é a coisa mais barata que a empresa já disponibilizou por meio de uma API: US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída em prompts de até 100.000 tokens, com uma janela de contexto de 1 milhão de tokens e um controle de esforço que vai de Baixo a Máximo. No mesmo dia, sem um post de lançamento próprio, as leituras de cache de prompt no Claude Sonnet 5.5 caíram de US$ 0,20 para US$ 0,10 por milhão de tokens. Um deles é um produto e o outro é uma linha orçamentária, e a linha orçamentária é a que movimentará mais dinheiro neste trimestre.

O preço primeiro, porque é a parte sobre a qual você pode agir hoje. Depois o esforço, que é a coisa que decide o preço silenciosamente. Depois o corte de cache, sobre o qual metade das pessoas que pagam pelo Sonnet 5.5 só vai ficar sabendo na próxima fatura.

O que é o Claude Haiku 5.5, na ordem que importa

A formulação do próprio fornecedor é "o modelo pequeno mais barato, mais rápido e mais capaz que já lançamos", e a data de lançamento é 7 de outubro de 2026 — um dia antes deste resumo. O ID do modelo é claude-haiku-5-5. Ele aceita texto e imagem como entrada e gera texto como saída. A janela de contexto é de 1.000.000 de tokens, ante 200.000 no Claude Haiku 4.5, e a saída máxima é de 128.000 tokens, com um cabeçalho beta na Batch API que eleva esse valor para 300.000. A data de corte do treinamento é junho de 2026, e a Anthropic se compromete a não descontinuá-lo antes de 7 de outubro de 2027.

O ponto que mais importa para qualquer pessoa que roteia tráfego não é a janela de contexto. É que este é o primeiro modelo da classe Haiku com esforço ajustável. O esforço tem os níveis Low, Medium, High, Xhigh e Max, o padrão é Medium, e o pensamento adaptativo vem ativado por padrão — um recurso de Sonnet e Opus chegando um nível abaixo. O post de lançamento também traz duas coisas que são sobre comprar em vez de construir: créditos mensais de API para os planos Claude Max e Team, $100 no Max 5x e $200 no Max 20x, com até $500 em créditos compartilhados para o Team, e suporte beta a computer-use e browser-use nos SDKs. A segurança acompanha o nível: as salvaguardas cibernéticas são mais rígidas que as do Claude Haiku 4.5, com solicitações de teste de penetração ainda bloqueadas, e as salvaguardas de biologia correspondem às do Claude Sonnet 5, Claude Sonnet 5.5 e Claude Opus 5.

A capture of Anthropic's Claude Haiku 5.5 announcement page showing the October 7, 2026 date, the headline framing Claude Haiku 5.5 as a performance, pricing and safety upgrade, and the on-page sections for Performance, Pricing, Safety and Further updates.

O preço, e o penhasco de 100.000 tokens no meio disso

A tarifa anunciada é de US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. Leia o asterisco: essa é a tarifa para prompts de até 100.000 tokens. Acima de 100.000, os dois números são multiplicados por cinco, passando para US$ 0,50 de entrada e US$ 2,50 de saída. As gravações de cache custam US$ 0,125 por milhão na camada de cinco minutos e US$ 0,20 na camada de uma hora dentro dessa faixa, e as leituras de cache custam US$ 0,01 por milhão — um décimo da tarifa de entrada, que é o maior desconto de cache que a Anthropic já publicou em qualquer modelo. O Batch reduz tudo pela metade novamente: US$ 0,05 e US$ 0,25 dentro da faixa barata, US$ 0,25 e US$ 1,25 acima dela.

Compare isso com o Claude Haiku 4.5, que ainda consta na tabela de preços com um valor fixo de US$ 1.00 de entrada e US$ 5.00 de saída, sem faixas de preço baseadas no contexto, leitura de cache de US$ 0.10 e uma janela de 200.000 tokens. O novo modelo custa um décimo do preço no mesmo formato de prompt, com cinco vezes mais contexto. Não há cálculo de migração a fazer aqui; os números não chegam perto.

O penhasco é a parte em torno da qual se deve projetar. Um prompt de 99.000 tokens custa 99 centavos por mil chamadas à taxa de entrada. Um prompt de 101.000 tokens custa $5,05 por mil. Dois mil tokens de diferença resultam em uma fatura 5x maior, então qualquer coisa que você construa na faixa barata deve ou permanecer confortavelmente abaixo de 100.000 tokens ou estar deliberadamente e consistentemente acima disso — o pior resultado é um pipeline que fica na linha divisória e paga a taxa alta em metade do seu tráfego.

O esforço agora é um parâmetro de preço, e o padrão não é o mais barato

Como o esforço é definido por padrão como Médio e o pensamento vem ativado por padrão, o preço de etiqueta e o preço real não são o mesmo número. Tokens de raciocínio são cobrados como tokens de saída. Na própria execução publicada pela Anthropic do Artificial Analysis Intelligence Index — relatada pelo fornecedor, não reproduzida por nós —, o Claude Haiku 5.5 emite aproximadamente 162.000 tokens por tarefa, dos quais cerca de 129.000 são de raciocínio. O modelo mediano do índice emite algo em torno de 100 milhões de tokens ao longo da suíte; o Haiku 5.5 gasta 440 milhões. A US$ 0,50 por milhão de tokens de saída, essa verbosidade é acessível, e é exatamente esse o ponto: à tarifa do Haiku 5.5, pensar muito ainda é mais barato do que pensar pouco em um modelo que cobra US$ 5,00 pela saída.

Defina o nível de esforço como Baixo para decisões de classificação, extração e encaminhamento em que você quer uma resposta rápida em vez de uma resposta ponderada, e deixe-o em Médio para qualquer coisa que um usuário vá ler. Mudar para Baixo também é a forma confiável de manter um agente verboso dentro da faixa de 100.000 tokens, porque reduz os tokens de raciocínio antes de reduzir a qualidade da resposta.

A linha mais discreta: leituras de cache do Sonnet 5.5 reduzidas pela metade

Claude Sonnet 5.5 lê o prompt em cache a US$ 0,10 por milhão de tokens desde 7 de outubro, ante US$ 0,20. O preço de entrada do Sonnet 5.5 é US$ 2,00 e o de saída é US$ 10,00, então um multiplicador de 0,05x para leitura de cache agora é o mesmo multiplicador que o Haiku 5.5 tem, aplicado a uma taxa de entrada vinte vezes maior. A estimativa da própria Anthropic é de que isso reduz o custo da maioria do trabalho agêntico em cerca de 20%, o que é uma afirmação sobre o formato da carga de trabalho, e não sobre um benchmark: ela só se sustenta se uma grande parte da sua entrada for um prefixo estável que você reenvia a cada turno. Se seus prompts forem únicos em cada chamada, essa mudança não custa nada e não economiza nada.

Vale a pena notar o que esse corte implica. A Anthropic está precificando prefixos de longa duração de forma agressiva no modelo de nível intermediário exatamente no momento em que lança um modelo pequeno muito barato, o que soa como um argumento a favor de uma arquitetura de dois modelos: um ramo Sonnet 5.5 com cache quente para o trabalho que exige julgamento, e um ramo Haiku 5.5 para o volume que não exige.

O que os números independentes mostram, um dia depois

A Artificial Analysis pontuou o Claude Haiku 5.5 no dia seguinte ao lançamento. Seu Intelligence Index registra 43 no geral, com a configuração Max-effort reportada em 43,40, segundo de 182 modelos no ranking. O custo por tarefa de índice é US$ 0,21, o 46º mais barato. O preço combinado com uma proporção de 7:2:1 entre entrada, entrada em cache e saída é de US$ 0,08 por milhão, que é o número que faz a comparação de níveis anterior parecer injusta para todo o resto. A velocidade de saída é de 243,4 tokens por segundo, a nona mais rápida do ranking, com uma latência reportada do primeiro token de cerca de 0,3 segundos e um desconto de cache de 90%.

Essa cifra de 440 milhões de tokens de saída é a ressalva atrelada ao 43. A pontuação é real e executada de forma independente; a verbosidade também. Um modelo que pensa tanto é barato por token e nem sempre barato por tarefa, e a diferença entre esses dois números é onde uma decisão de roteamento de fato reside.

Para se ter uma ideia de escala, as próprias comparações publicadas pela Anthropic colocam o Claude Haiku 5.5 em 1620 no GDPval-AA v2.1, contra 735 do Claude Haiku 4.5; 72,4% no OSWorld 2.1, contra 15,7%; 45,9% no Humanity's Last Exam sem ferramentas, contra 10,2%; e 39,2% no Terminal-Bench 4.0, contra 0,0%. Esses são números relatados pelo fornecedor em avaliações escolhidas pelo fornecedor e devem ser interpretados como indicativos, mas a direção não é sutil — não se trata de uma pequena atualização de um modelo pequeno.

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing an Artificial Analysis Intelligence Index of 43 ranked second of 182, a cost per index task of $0.21, a blended price of $0.08 per million tokens, output speed of 243.4 tokens per second, a 1M-token context window and a $0.01-per-million cache read.

Acessar esses modelos sem um segundo contrato

O Claude Haiku 5.5 está disponível por meio da própria API da Anthropic e, a partir daí, onde quer que os modelos da Anthropic sejam revendidos. No catálogo da OrcaRouter, a linha Anthropic hoje inclui anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 e anthropic/claude-fable-5.1 — não hospedamos o Claude Haiku 5.5, e este documento não vai fingir o contrário. O que oferecemos é o nível acima dele, e a OrcaRouter repassa o preço de tabela do provedor com 0% de markup, e é por isso que o corte no preço de leitura de cache do Sonnet 5.5 apareceu nos nossos preços no mesmo dia em que a Anthropic o fez, em vez de num ciclo programado de reprecificação.

A versão prática: se você quiser testar o Haiku 5.5 em uma etapa de classificação enquanto sua etapa de julgamento permanece no Claude Sonnet 5.5, você fica com duas chaves em vez de uma, e a camada de roteamento é onde o A/B é decidido. Esse é todo o argumento a favor de um gateway em vez de uma integração direta — um endpoint, strings de modelo e um caminho de failover quando um provedor oscila.

A capture of the OrcaRouter models catalogue showing the filterable model list with input-modality, context-length, input-price, status and series filters, the line counting the model list and providers on one API key and one bill, and model cards carrying per-million input and output prices.

O que observar a partir daqui

Três coisas. Se provedores terceiros começarem a revender o Haiku 5.5 a uma taxa combinada abaixo de US$ 0,10, que é o ponto em que a camada de roteamento se paga em vez de apenas simplificar a aquisição. Se a Anthropic estende o limite da faixa de 100.000 tokens, já que um abismo exatamente em 100.000 é um lugar estranho para um modelo com janela de 1M de tokens ter um. E se o número de verbosidade de 440 milhões de tokens cai em uma versão pontual, porque esse único número é o que separa o Haiku 5.5 de ser o padrão óbvio para toda a metade inferior de uma stack de produção.