
Resumo diário de IA, 8 de outubro: Claude Haiku 5.5 chega a US$ 0,10 e leituras de cache do Sonnet 5.5 caem pela metade
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O Claude Haiku 5.5 foi lançado em 7 de outubro de 2026, e é a coisa mais barata que a empresa já disponibilizou por meio de uma API: US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída em prompts de até 100.000 tokens, com uma janela de contexto de 1 milhão de tokens e um controle de esforço que vai de Baixo a Máximo. No mesmo dia, sem um post de lançamento próprio, as leituras de cache de prompt no Claude Sonnet 5.5 caíram de US$ 0,20 para US$ 0,10 por milhão de tokens. Um deles é um produto e o outro é uma linha orçamentária, e a linha orçamentária é a que movimentará mais dinheiro neste trimestre.
O preço primeiro, porque é a parte sobre a qual você pode agir hoje. Depois o esforço, que é a coisa que decide o preço silenciosamente. Depois o corte de cache, sobre o qual metade das pessoas que pagam pelo Sonnet 5.5 só vai ficar sabendo na próxima fatura.
O que é o Claude Haiku 5.5, na ordem que importa
A formulação do próprio fornecedor é "o modelo pequeno mais barato, mais rápido e mais capaz que já lançamos", e a data de lançamento é 7 de outubro de 2026 — um dia antes deste resumo. O ID do modelo é claude-haiku-5-5. Ele aceita texto e imagem como entrada e gera texto como saída. A janela de contexto é de 1.000.000 de tokens, ante 200.000 no Claude Haiku 4.5, e a saída máxima é de 128.000 tokens, com um cabeçalho beta na Batch API que eleva esse valor para 300.000. A data de corte do treinamento é junho de 2026, e a Anthropic se compromete a não descontinuá-lo antes de 7 de outubro de 2027.
O ponto que mais importa para qualquer pessoa que roteia tráfego não é a janela de contexto. É que este é o primeiro modelo da classe Haiku com esforço ajustável. O esforço tem os níveis Low, Medium, High, Xhigh e Max, o padrão é Medium, e o pensamento adaptativo vem ativado por padrão — um recurso de Sonnet e Opus chegando um nível abaixo. O post de lançamento também traz duas coisas que são sobre comprar em vez de construir: créditos mensais de API para os planos Claude Max e Team, $100 no Max 5x e $200 no Max 20x, com até $500 em créditos compartilhados para o Team, e suporte beta a computer-use e browser-use nos SDKs. A segurança acompanha o nível: as salvaguardas cibernéticas são mais rígidas que as do Claude Haiku 4.5, com solicitações de teste de penetração ainda bloqueadas, e as salvaguardas de biologia correspondem às do Claude Sonnet 5, Claude Sonnet 5.5 e Claude Opus 5.

O preço, e o penhasco de 100.000 tokens no meio disso
A tarifa anunciada é de US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. Leia o asterisco: essa é a tarifa para prompts de até 100.000 tokens. Acima de 100.000, os dois números são multiplicados por cinco, passando para US$ 0,50 de entrada e US$ 2,50 de saída. As gravações de cache custam US$ 0,125 por milhão na camada de cinco minutos e US$ 0,20 na camada de uma hora dentro dessa faixa, e as leituras de cache custam US$ 0,01 por milhão — um décimo da tarifa de entrada, que é o maior desconto de cache que a Anthropic já publicou em qualquer modelo. O Batch reduz tudo pela metade novamente: US$ 0,05 e US$ 0,25 dentro da faixa barata, US$ 0,25 e US$ 1,25 acima dela.
Compare isso com o Claude Haiku 4.5, que ainda consta na tabela de preços com um valor fixo de US$ 1.00 de entrada e US$ 5.00 de saída, sem faixas de preço baseadas no contexto, leitura de cache de US$ 0.10 e uma janela de 200.000 tokens. O novo modelo custa um décimo do preço no mesmo formato de prompt, com cinco vezes mais contexto. Não há cálculo de migração a fazer aqui; os números não chegam perto.
O penhasco é a parte em torno da qual se deve projetar. Um prompt de 99.000 tokens custa 99 centavos por mil chamadas à taxa de entrada. Um prompt de 101.000 tokens custa $5,05 por mil. Dois mil tokens de diferença resultam em uma fatura 5x maior, então qualquer coisa que você construa na faixa barata deve ou permanecer confortavelmente abaixo de 100.000 tokens ou estar deliberadamente e consistentemente acima disso — o pior resultado é um pipeline que fica na linha divisória e paga a taxa alta em metade do seu tráfego.
O esforço agora é um parâmetro de preço, e o padrão não é o mais barato
Como o esforço é definido por padrão como Médio e o pensamento vem ativado por padrão, o preço de etiqueta e o preço real não são o mesmo número. Tokens de raciocínio são cobrados como tokens de saída. Na própria execução publicada pela Anthropic do Artificial Analysis Intelligence Index — relatada pelo fornecedor, não reproduzida por nós —, o Claude Haiku 5.5 emite aproximadamente 162.000 tokens por tarefa, dos quais cerca de 129.000 são de raciocínio. O modelo mediano do índice emite algo em torno de 100 milhões de tokens ao longo da suíte; o Haiku 5.5 gasta 440 milhões. A US$ 0,50 por milhão de tokens de saída, essa verbosidade é acessível, e é exatamente esse o ponto: à tarifa do Haiku 5.5, pensar muito ainda é mais barato do que pensar pouco em um modelo que cobra US$ 5,00 pela saída.
Defina o nível de esforço como Baixo para decisões de classificação, extração e encaminhamento em que você quer uma resposta rápida em vez de uma resposta ponderada, e deixe-o em Médio para qualquer coisa que um usuário vá ler. Mudar para Baixo também é a forma confiável de manter um agente verboso dentro da faixa de 100.000 tokens, porque reduz os tokens de raciocínio antes de reduzir a qualidade da resposta.
A linha mais discreta: leituras de cache do Sonnet 5.5 reduzidas pela metade
Claude Sonnet 5.5 lê o prompt em cache a US$ 0,10 por milhão de tokens desde 7 de outubro, ante US$ 0,20. O preço de entrada do Sonnet 5.5 é US$ 2,00 e o de saída é US$ 10,00, então um multiplicador de 0,05x para leitura de cache agora é o mesmo multiplicador que o Haiku 5.5 tem, aplicado a uma taxa de entrada vinte vezes maior. A estimativa da própria Anthropic é de que isso reduz o custo da maioria do trabalho agêntico em cerca de 20%, o que é uma afirmação sobre o formato da carga de trabalho, e não sobre um benchmark: ela só se sustenta se uma grande parte da sua entrada for um prefixo estável que você reenvia a cada turno. Se seus prompts forem únicos em cada chamada, essa mudança não custa nada e não economiza nada.
Vale a pena notar o que esse corte implica. A Anthropic está precificando prefixos de longa duração de forma agressiva no modelo de nível intermediário exatamente no momento em que lança um modelo pequeno muito barato, o que soa como um argumento a favor de uma arquitetura de dois modelos: um ramo Sonnet 5.5 com cache quente para o trabalho que exige julgamento, e um ramo Haiku 5.5 para o volume que não exige.
O que os números independentes mostram, um dia depois
A Artificial Analysis pontuou o Claude Haiku 5.5 no dia seguinte ao lançamento. Seu Intelligence Index registra 43 no geral, com a configuração Max-effort reportada em 43,40, segundo de 182 modelos no ranking. O custo por tarefa de índice é US$ 0,21, o 46º mais barato. O preço combinado com uma proporção de 7:2:1 entre entrada, entrada em cache e saída é de US$ 0,08 por milhão, que é o número que faz a comparação de níveis anterior parecer injusta para todo o resto. A velocidade de saída é de 243,4 tokens por segundo, a nona mais rápida do ranking, com uma latência reportada do primeiro token de cerca de 0,3 segundos e um desconto de cache de 90%.
Essa cifra de 440 milhões de tokens de saída é a ressalva atrelada ao 43. A pontuação é real e executada de forma independente; a verbosidade também. Um modelo que pensa tanto é barato por token e nem sempre barato por tarefa, e a diferença entre esses dois números é onde uma decisão de roteamento de fato reside.
Para se ter uma ideia de escala, as próprias comparações publicadas pela Anthropic colocam o Claude Haiku 5.5 em 1620 no GDPval-AA v2.1, contra 735 do Claude Haiku 4.5; 72,4% no OSWorld 2.1, contra 15,7%; 45,9% no Humanity's Last Exam sem ferramentas, contra 10,2%; e 39,2% no Terminal-Bench 4.0, contra 0,0%. Esses são números relatados pelo fornecedor em avaliações escolhidas pelo fornecedor e devem ser interpretados como indicativos, mas a direção não é sutil — não se trata de uma pequena atualização de um modelo pequeno.

Acessar esses modelos sem um segundo contrato
O Claude Haiku 5.5 está disponível por meio da própria API da Anthropic e, a partir daí, onde quer que os modelos da Anthropic sejam revendidos. No catálogo da OrcaRouter, a linha Anthropic hoje inclui anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 e anthropic/claude-fable-5.1 — não hospedamos o Claude Haiku 5.5, e este documento não vai fingir o contrário. O que oferecemos é o nível acima dele, e a OrcaRouter repassa o preço de tabela do provedor com 0% de markup, e é por isso que o corte no preço de leitura de cache do Sonnet 5.5 apareceu nos nossos preços no mesmo dia em que a Anthropic o fez, em vez de num ciclo programado de reprecificação.
A versão prática: se você quiser testar o Haiku 5.5 em uma etapa de classificação enquanto sua etapa de julgamento permanece no Claude Sonnet 5.5, você fica com duas chaves em vez de uma, e a camada de roteamento é onde o A/B é decidido. Esse é todo o argumento a favor de um gateway em vez de uma integração direta — um endpoint, strings de modelo e um caminho de failover quando um provedor oscila.

O que observar a partir daqui
Três coisas. Se provedores terceiros começarem a revender o Haiku 5.5 a uma taxa combinada abaixo de US$ 0,10, que é o ponto em que a camada de roteamento se paga em vez de apenas simplificar a aquisição. Se a Anthropic estende o limite da faixa de 100.000 tokens, já que um abismo exatamente em 100.000 é um lugar estranho para um modelo com janela de 1M de tokens ter um. E se o número de verbosidade de 440 milhões de tokens cai em uma versão pontual, porque esse único número é o que separa o Haiku 5.5 de ser o padrão óbvio para toda a metade inferior de uma stack de produção.
