
A verdadeira história do Claude Haiku 5.5 é o penhasco dos 100K: o que o novo Haiku cobra além de 100.000 tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Claude Haiku 5.5 chegou em 7 de outubro de 2026 com um preço de manchete de US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída, e o número que foi repetido em todo lugar foi o que a própria Anthropic colocou no anúncio: um corte de 90% em relação à tarifa do Haiku 4.5 para os mesmos dois itens. A redução de 90% é real. Ela também está restrita a metade de uma dimensão da conta, e no momento em que uma requisição ultrapassa 100.000 tokens, cada tarifa aplicável faz algo que a cobertura do lançamento em grande parte ignorou. Este artigo é sobre essa linha divisória — quanto ela custa, quais cargas de trabalho realmente a atingem e por que "90% mais barato" é uma afirmação sobre uma fatia da conta, e não sobre a sua conta.
Os dois preços, e onde eles se alternam
Anthropic publica duas colunas para o modelo, e a alternância entre elas é um único limiar no tamanho da solicitação, em vez de qualquer configuração do modelo que você escolha:
• Nível curto, igual ou abaixo de 100.000 tokens — US$ 0,10 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída (lista da Anthropic) • Nível longo, acima de 100.000 tokens — US$ 0,50 por milhão de tokens de entrada, US$ 2,50 por milhão de tokens de saída (lista da Anthropic) • Leituras de cache — US$ 0,01 por milhão (nível curto) e US$ 0,05 por milhão (nível longo) • Batch API — 50% de desconto em qualquer uma das colunas, e um comprimento máximo de saída de 300.000 tokens • Saída máxima padrão — 128.000 tokens, com uma janela de contexto de 1 milhão de tokens em ambos os níveis

Essas são as tarifas publicadas da própria Anthropic, não tarifas medidas, e são a tabela atual: o preço de um modelo tão novo ainda não teve tempo de mudar, embora a Anthropic não tenha qualquer compromisso de mantê-lo.
Leia esses quatro números em ordem e a forma da coisa fica óbvia. Cada tarifa no nível de contexto longo é exatamente cinco vezes a tarifa de contexto curto, e o limiar é o mesmo de 100.000 tokens para todos eles de uma vez. Não há curva gradual, não há interpolação, não há faixa intermediária — uma solicitação de 99.000 tokens e uma de 101.000 tokens diferem por um fator de cinco em cada token da fatura, não apenas nos 2.000 tokens que cruzaram a linha. É essa a parte que faz disto um penhasco em vez de uma rampa, e é a parte que o enquadramento de "90% mais barato" não consegue ver.

Por que o corte parece maior do que é
Em comparação com o Haiku 4.5, a comparação feita pela Anthropic, a faixa curta representa uma redução real de 90 por cento tanto na entrada quanto na saída — o Haiku 4.5 custava US$ 1,00 e US$ 5,00 por milhão para as mesmas duas colunas. A faixa longa é outra história: US$ 0,50 e US$ 2,50 contra os mesmos US$ 1,00 e US$ 5,00 é um corte de 50 por cento, não de 90 por cento. Portanto, a versão honesta da alegação de lançamento é que o Claude Haiku 5.5 é 90 por cento mais barato que o Haiku 4.5 abaixo de 100.000 tokens e 50 por cento mais barato acima disso, o que é exatamente a divisão que a própria documentação da Anthropic apresenta quando você lê as duas colunas em vez de uma. A porcentagem única não está errada; é a porcentagem da faixa curta, apresentada sem a sua condição.
Há uma segunda coisa puxando na direção oposta, e ela é a mais interessante porque é fácil de não perceber e difícil de contornar. O Claude Haiku 5.5 vem com um novo tokenizador, e a própria orientação da Anthropic coloca a contagem de tokens de um determinado texto cerca de 30 por cento mais alta do que o Haiku 4.5 produzia para o mesmo conteúdo. O que você pagava por token caiu, e o que você paga por token do *seu* texto subiu cerca de um terço, em relação à contabilidade do modelo antigo. O número líquido declarado pela Anthropic, de que o modelo é cerca de 75 por cento mais barato de executar em média, já incorpora isso — um corte de 90 por cento no preço de tabela menos uma inflação de tokens de cerca de 30 por cento fica nessa faixa em tráfego de contexto curto —, mas os dois efeitos são separáveis e vale a pena separá-los. A mudança de preço é uma alteração no preço de tabela que você lê em uma página; a mudança de tokenizador altera quantas unidades desse preço seus prompts existentes consomem, e aparece nas suas próprias contagens de tokens antes de aparecer em qualquer outro lugar.
Para uma carga de trabalho que já ficava confortavelmente abaixo de 100.000 tokens por chamada, o efeito prático é uma redução direta no custo por chamada, parcialmente compensada pelo tokenizador. Para uma que não ficava, a aritmética corre ao contrário duas vezes na metade longa.
O que realmente vive acima de 100.000 tokens?
O reflexo é classificar a precificação de contexto longo como “codificação agêntica e RAG, não nós”. Isso é precipitado demais, porque a linha de 100.000 tokens é uma linha por requisição, e o tamanho por requisição não é a mesma coisa que o tamanho da tarefa. Alguns padrões a cruzam rotineiramente:
• Um agente de leitura de código-base que mantém um grande conjunto de trabalho em contexto ao longo de uma sessão, em vez de recuperá-lo novamente a cada passo
• Análise de documentos e contratos em que a entrada é um PDF longo, além de suas próprias instruções e exemplos few-shot — o tipo de prompt que tinha 60.000 tokens antes de alguém adicionar os exemplos
• Pipelines de ingestão que agrupam muitos itens pequenos em uma única chamada para amortizar a sobrecarga por chamada e, ao fazê-lo, levam todo o lote a ultrapassar o limite
• Produtos de chat que mantêm um histórico completo da conversa inline, em vez de resumi-lo, nos quais a solicitação cresce monotonicamente até que algo a trunque
• Entradas no estilo de transcrição de áudio e de vídeo longo, que representam exatamente o tipo de tráfego que uma janela de 1 milhão de tokens é anunciada como capaz de viabilizar
A janela de contexto de 1 milhão de tokens é a parte da ficha técnica que faz o penhasco valer a pena ser discutido. A Anthropic está vendendo a capacidade de entregar ao modelo uma requisição muito grande, e a precificação é estruturada de modo que os últimos 900.000 tokens dessa requisição custam cinco vezes o que os primeiros 100.000 custaram. Ambos os fatos são intencionais; eles apenas são anunciados em lugares diferentes. Se a janela de contexto longo é o motivo pelo qual você está considerando este modelo, a coluna de contexto longo é a sua coluna, e a porcentagem de lançamento é a de outra pessoa.
A pressão que o preço exerce sobre o nível Flash
A intenção declarada da Anthropic por trás do modelo é ocupar a ponta barata e de alto rendimento da pilha, e a lista de preços reflete essa intenção de forma clara. A reportagem da Bloomberg sobre o lançamento enquadrou-o como a Anthropic defendendo sua posição de menor custo contra concorrentes de pesos abertos mais baratos, e o enquadramento do lado do fornecedor foi além — que o novo Haiku está precificado para ficar bem abaixo de seus rivais diretos por uma margem ampla.
A comparação só é limpa no escalão curto, onde $0.10 e $0.50 são agressivamente baixos. Acima de 100.000 tokens, as tarifas de $0.50 e $2.50 já não praticam preços mais baixos do que os do escalão curto de ninguém; são números comuns de escalão intermédio. A alegação de "margem ampla" do fornecedor é uma afirmação sobre a primeira coluna da tabela de tarifas, e a Anthropic tem o direito de fazer essa afirmação aí — é uma leitura precisa dos números que publica. Não é uma afirmação sobre o que uma carga de trabalho de contexto longo paga, e não deve ser citada como tal.
O restante do modelo, brevemente.
O Claude Haiku 5.5 mantém os recursos que foram lançados nas linhas Sonnet e Opus, em vez de reduzi-los para a classe de tamanho. O pensamento adaptativo com uma configuração de esforço padrão definida como média está presente, e este é o primeiro modelo da classe Haiku com um dial de esforço ajustável que vai de Baixo a Máximo. O corte de conhecimento é junho de 2026 e o ID do modelo é claude-haiku-5-5. A Anthropic declara uma data de descontinuação não antes de 7 de outubro de 2027 — a mesma data do lançamento, um ano depois — e o modelo está listado no Amazon Bedrock, no Google Cloud e no Microsoft Azure, juntamente com a API própria da Anthropic.

Do lado dos benchmarks, tudo no post de lançamento carrega o mesmo rótulo de proveniência e o merece: são números divulgados pelo fornecedor, medidos pela empresa que vende o modelo, sem nenhuma reprodução independente publicada no momento da redação.
• GDPval-AA v2.1 — 1.620 relatados pelo fornecedor para Claude Haiku 5.5, contra 735 para Haiku 4.5 no mesmo ambiente de teste
• AA-Briefcase v1.1 — 1.578 reportados pelo fornecedor, contra 614 da geração anterior
• OSWorld 2.1 — 72,4 por cento reportados pelo fornecedor, contra 15,7 por cento
• Terminal-Bench 4.0 — 39,2 relatado pelo fornecedor, contra 0,0
• Humanity's Last Exam — 45,9 por cento relatados pelo fornecedor, ou 57,4 com uso de ferramentas
O tamanho desses deltas é o motivo para sinalizá-los, em vez de citá-los. Um salto de 15,7 para 72,4 em um benchmark de agente de SO medido pelo próprio fornecedor do modelo é um número a ser considerado com reservas até que uma terceira parte execute o mesmo harness. A Artificial Analysis publicou seu próprio índice para o modelo com data do início de outubro de 2026 — um valor independente de 43,395, com 0,329 no Terminal-Bench Hard e 0,444 no HLE — e esse é o conjunto que se deve citar quando a alegação precisa resistir a uma contestação. Os números do fornecedor e os números independentes não estão em conflito; são simplesmente harnesses diferentes, e misturá-los em uma única frase é como um post de blog acaba afirmando que uma avaliação de fornecedor é um fato.
A nota de infraestrutura, já que operamos uma
A Anthropic vende o Claude Haiku 5.5 através da sua própria API e através do Bedrock, Google Cloud e Azure. Se está a decidir qual destes chamar, ou está a adicioná-lo ao lado dos outros modelos que já tem na sua stack, note que o preço de tabela do fornecedor é o mesmo onde quer que seja vendido, e a OrcaRouter foi criada para repassar esse preço de tabela com margem zero — por isso, uma alteração de preço da Anthropic neste modelo fica ativa do nosso lado no mesmo dia, e não com atraso. O nosso catálogo também inclui qwen/qwen3.8-flash a $0,15 e $0,47 por milhão e z-ai/glm-5.3-flash a $0,15 e $0,50, o par que mais vezes acaba na posição ao lado de um modelo da classe Haiku, na mesma chave e na mesma fatura — o que faz com que uma stack mista custe um contrato em vez de três. Não servimos o próprio Claude Haiku 5.5; para isso, chame a Anthropic diretamente.
Um corolário prático do precipício, se encaminhar mais do que um modelo: a fronteira dos 100 000 tokens é um ponto em que um pedido que antes era barato se torna caro sem que nada no pedido mude de forma significativa. Se a sua camada de encaminhamento puder fazer failover, a configuração sensata é manter o tráfego de contexto longo apontado para o modelo que for realmente barato acima do limiar e deixar o tráfego de contexto curto recair sobre o que for barato abaixo dele, em vez de assumir que a tarifa anunciada de um modelo se aplica a ambos.
O que tirar do lançamento
O corte de preço é real e é grande, abaixo de 100.000 tokens. O modelo é o primeiro Haiku com um conjunto de recursos já entregue por completo e um controle de esforço, o que importa mais para uso agêntico do que o preço. Os deltas de benchmark são relatados pelo fornecedor e devem ser rotulados assim toda vez que forem repetidos. E a tabela de preços tem um degrau em 100.000 tokens que multiplica todas as tarifas por cinco de uma só vez — que é a única coisa sobre este lançamento que um leitor da sua stack, e não um leitor do comunicado à imprensa, mais precisa saber antes que o orçamento de tokens do próximo sprint seja definido.
Se você quiser verificar a aritmética em relação ao seu próprio tráfego, os dois números a extrair são o percentil 95 do tamanho das suas solicitações e a sua parcela de gastos com solicitações acima de 100.000 tokens. Se o primeiro estiver abaixo da linha, os 90 por cento se aplicam a você e a cobertura do lançamento estava certa sobre a sua situação. Se o segundo for uma fatia significativa da conta, o número que importa é o 50, e vale a pena refazer a estimativa de custo para qualquer modelo da pilha que você tenha escolhido com base na suposição dos 90.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
