
Claude Haiku 5.5: um corte de preço de 90%, um novo tokenizador e o vídeo que a Anthropic não postou
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Alguém digitou uma frase em Claude Haiku 5.5 e recebeu de volta um filme de lançamento finalizado. O prompt, publicado no X na noite de 7 de outubro de 2026, diz na íntegra: "faça um vídeo 10 vezes mais bombástico para o seu lançamento que mostre o quão bom motion designer você é." A legenda da publicação tem três palavras — "Feito de primeira" — e traz o clipe como anexo. Sem novas tentativas, sem storyboard, sem editor. Se é isso que o modelo mais barato da linha Claude faz agora, esse nível deixou de ser uma concessão.
Essa é a metade interessante do lançamento. A outra metade é aritmética, e é aí que está a notícia de verdade: Claude Haiku 5.5 custa US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída para prompts de até 100.000 tokens, em comparação com Claude Haiku 4.5, cujo preço fixo é de US$ 1 e US$ 5. A própria nota de rodapé da Anthropic chama isso de 90% mais baixo no caso comum — e então diz, no mesmo fôlego, que o número com o qual um comprador deveria planejar é mais próximo de 75%. Os dois números estão corretos, e a diferença entre eles é a coisa mais importante deste lançamento.
O que a Anthropic declarou publicamente em 7 de outubro
A publicação de lançamento do fornecedor e a sua documentação de preços concordam quanto à forma da coisa, e trata-se de um passo maior do que aquele que um corte de preços costuma trazer consigo.

• Preço — $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída para prompts de até 100.000 tokens. Acima desse limite, a mesma solicitação é cobrada a $0,50 e $2,50. Leituras de cache custam $0,01 por milhão até 100K e $0,05 acima disso; gravações de cache custam $0,125 e $0,625.
Contexto — 1M de tokens, com um limite de saída de 128.000 tokens. Essa é a mesma janela e o mesmo teto de saída que Claude Fable 5.1, Claude Opus 5.5 e Claude Sonnet 5.5 possuem, reproduzidos na camada mais barata.
• Thinking — pensamento adaptativo com o parâmetro effort, com medium como padrão. A Anthropic afirma que este é o primeiro modelo da classe Haiku com uma configuração de esforço ajustável, o que significa que o mesmo id de modelo pode ser executado de forma econômica ou cuidadosa sem alterar mais nada.
• Tokenizador — o tokenizador mais recente, compartilhado com o Claude 4.7 e versões posteriores, que "produz aproximadamente 30% mais tokens para o mesmo texto". A documentação da Anthropic diz que o aumento exato depende do conteúdo e do formato da carga de trabalho.
• Ciclo de vida — data de corte do conhecimento em junho de 2026, e um compromisso de descontinuação de "não antes de 7 de outubro de 2027."
• Disponibilidade — a API do Claude, Amazon Web Services, Google Cloud, Microsoft Azure e o Claude Platform on AWS, todos ao mesmo tempo desde o primeiro dia.
O selo 10x e a realidade de 75%
Dez vezes mais barato é o número que vai circular mais longe, e é o que tem maior probabilidade de acabar no lugar errado no modelo orçamentário de alguém. Aplica-se a prompts de até 100.000 tokens. O Haiku 5.5 não mantém essa tarifa para toda a janela.
• Até 100.000 tokens — US$ 0,10 de entrada e US$ 0,50 de saída, contra US$ 1 e US$ 5 do Haiku 4.5. Esse é o corte de 90%, e a Anthropic diz que 90% das solicitações ao modelo Haiku anterior caíam nessa faixa.
• Mais de 100.000 tokens — US$ 0,50 de entrada e US$ 2,50 de saída. Ainda exatamente metade do que o Haiku 4.5 cobrava, na mesma solicitação, sem teto a atingir.
• O tokenizador — o mesmo texto passa a ter cerca de 30% mais tokens do que tinha no Haiku 4.5, portanto o corte por token não se traduz numa redução equivalente da fatura.
• A média do próprio fornecedor — a Anthropic descreve a combinação como "cerca de 75% menos para executar". Esse é o número dela, não uma medição independente, e é o que se deve colocar numa previsão.
• Economia de cache — as leituras de cache caíram de US$ 0,10 para US$ 0,01 por milhão na faixa comum, o que importa mais do que a tarifa de entrada para qualquer pipeline que reenvia um longo prefixo compartilhado.
O valor de 75% também explica algo que um leitor poderia, de outra forma, interpretar como uma contradição. Os dois números destacados não estão em conflito; um é uma taxa sobre um formato de requisição, o outro é uma estimativa combinada sobre uma mistura real de tráfego que inclui a minoria acima de 100K e os tokens extras do tokenizador. Se você estiver modelando gastos, use 75% e verifique sua própria distribuição de comprimentos de prompt antes de acreditar em algo melhor.
O que o vídeo afirma, e o que não afirma
O clipe é real, o prompt é citado literalmente acima, e o carimbo de data/hora — 19:49 UTC de 7 de outubro, aproximadamente o mesmo dia em que o modelo entrou no ar — é verificável. A atribuição é a um usuário individual, não à Anthropic.
Essa distinção importa aqui, porque a própria página de produto da Anthropic para o Claude Haiku 5.5 não traz nenhum vídeo incorporado: nenhum player, nenhum arquivo de mídia, apenas um link para o canal da empresa no YouTube. Se um filme de lançamento foi feito com o modelo, o fornecedor não disse isso. Portanto, a afirmação precisa é restrita: um usuário relata ter gerado um vídeo de lançamento em uma única tentativa com o Claude Haiku 5.5, e publicou o prompt. Se foi em uma única tentativa, quanto custou e quanto dele sobreviveu à edição são todas alegações de uma única fonte. Trate o clipe como uma demonstração, não como um benchmark.
O motivo pelo qual ainda vale a pena mencioná-lo é que a geração de vídeo não está nas especificações do modelo. O Haiku 5.5 recebe texto e imagens e devolve texto. Um resultado de motion design com essa qualidade implica que o modelo estava comandando outra coisa — um caminho de geração de código, um pipeline de renderização, um loop de ferramentas — em vez de produzir os quadros ele mesmo. Isso é uma declaração sobre orquestração agêntica a $0.10 de entrada, que é a parte realmente surpreendente.
Os números que a Anthropic publicou
A tabela de lançamento do fornecedor é um antes e depois em comparação com o Haiku 4.5, com GPT-6 Luna e Claude Sonnet 5.5 nas mesmas colunas, para efeito de escala. Todo número abaixo é resultado de avaliação reportado pela própria Anthropic, executado no harness da Anthropic, e é reproduzido, mas não verificado de forma independente.

• Trabalho de conhecimento — GDPval-AA v2.1 com 1620, contra 735 do Haiku 4.5, 1437 do GPT-6 Luna e 1840 do Sonnet 5.5. AA-Briefcase v1.1 com 1578, contra 614, 1336 e 1824.
• Uso de computador — OSWorld 2.1 a 72,4% no subconjunto offline, contra 15,7% do Haiku 4.5, 48,9% do GPT-6 Luna e 83,9% do Sonnet 5.5.
• Raciocínio multidisciplinar — Humanity's Last Exam com 45,9% sem ferramentas e 57,4% com elas, contra 10,2% e 18,7% para o Ha 4.5.
• Codificação agêntica — Terminal-Bench 4.0 em 39,2% contra 0,0%, 16,4% e 70,6%. FrontierCode 1.1 (Main) em 46,4% contra 42,4% para GPT-6 Luna e 52,1% para Sonnet 5.5.
• Raciocínio visual — Chartography em 46,4% sem ferramentas, contra 6,4%, 29,1% e 61,6%.
A Anthropic também é incomumente direta sobre onde o nível pequeno não vence. Seu próprio comentário sobre o gráfico do Terminal-Bench diz que Sonnet 5.5 e Opus 5.5 "continuam sendo melhores escolhas para tarefas complexas de codificação agêntica", e posiciona o Haiku 5.5 para compactação, sumarização e trabalho de subagente. As citações de clientes no post apontam na mesma direção e trazem a mesma ressalva — estes são parceiros de acesso antecipado descrevendo suas próprias avaliações, não auditorias: A Asana relata mais de 30% de latência menor para conclusões de tarefas e inferência até 2.5x mais rápida por turno de agente; A HubSpot relata 92.8% em média em três execuções em uma suíte de portais de CRM; A AlphaSense relata 0.84 contra 0.76 em 400 consultas em uma carga de trabalho que realiza cerca de 8M de chamadas por semana; A Box relata 11 pontos a mais que o Haiku 4.5 com aproximadamente metade da latência; A Rogo descreve um subagente Haiku 5.5 extraindo uma linha de receita de segmento de um 10-K; e a Cognition relata que o Devin Fusion mantém uma pontuação FrontierCode de 66.2 com o Haiku 5.5 como parceiro.
O que diz o conselho independente
As tabelas do fornecedor pertencem ao próprio fornecedor. A primeira colocação externa é o número mais útil para quem decide se o nível avançou o suficiente para mudar um pipeline de produção.

A Artificial Analysis atribui ao Claude Haiku 5.5 uma pontuação de 43 em seu Intelligence Index v4.3.2 na configuração Max do modelo, classificando-o em segundo lugar entre os 182 modelos desse ranking e bem acima da mediana de 13 do ranking. A mesma página mede 242 tokens de saída por segundo — nono entre 182 — e um custo de US$ 0,21 por tarefa do Intelligence Index.
Há duas coisas nessa página que valem mais do que a manchete. A primeira é a verbosidade: ao avaliar o Index, a Artificial Analysis registrou 440 milhões de tokens de saída, contra uma mediana de 100 milhões, e descreve o modelo como "muito verboso". Um preço de tabela é cobrado por token, então um modelo que pensa longamente paga por isso — que é exatamente por que o valor de custo por tarefa fica em US$ 0,21 em vez de perto de zero, e por que o corte de 90% na entrada não é a história toda. A segunda é a escada de esforço: a mesma página expõe configurações de Max até Low, e o padrão da Anthropic é medium, não max. O 43 do ranking é o topo dessa escada, não a configuração que você obtém se não fizer nada.
Executando o nível abaixo do nível que você já pode chamar
O Claude Haiku 5.5 não está no catálogo do OrcaRouter, e valeria a pena dizer isso claramente em vez de sugerir o contrário: o intervalo no dia de lançamento entre um modelo existir e um modelo ser roteável costuma ser de dias, e às vezes maior.
O que está no catálogo da Anthropic hoje é Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5, cada um pelo preço de tabela do provedor, repassado com 0% de margem, então qualquer corte que a Anthropic faça chega ao nosso lado no mesmo dia em que chega ao lado deles. Essa é a ponte prática para quem quer testar o padrão de subagentes agora: uma cascata que envia os turnos de rotina para o Haiku 4.5 e escala os difíceis para cima funciona hoje com uma única chave e um único SDK, e trocar a perna pequena para o Haiku 5.5 depois é uma mudança de model-id, e não uma migração. O failover automático fica por baixo de quaisquer pernas que você escolher, então uma tarde ruim de um único provedor não leva o pipeline junto.
Se você preferir não esperar de forma alguma, a mesma faixa de entrada de $0,10 já está ocupada pelo GPT-6 Luna, que nós roteamos, e que mantém essa tarifa até 272.000 tokens antes de aumentar.
Quem deve se mover, e quem não deve
Se a sua carga de trabalho for classificação, extração, roteamento, compactação ou sumarização em volume, e os seus prompts ficarem abaixo de 100.000 tokens, o caso é simples: a taxa é um décimo do que era, a janela é cinco vezes mais ampla, e o ajuste de esforço permite fazer a troca inversa quando uma requisição exigir. Faça o orçamento com cerca de 75% a menos e você não terá surpresas.
Se os seus prompts costumam passar de 100.000 tokens, você está comprando um corte de 50%, e não de 90%, e ainda vale a pena dedicar a tarde a comparar preços entre modelos para contextos longos — há vários no mercado com preço igual ou inferior à tarifa acima de 100K desta faixa.
E se a sua eval ainda falha em trabalho no formato do Terminal-Bench, este não é o modelo que resolve isso; a Anthropic diz isso ela mesma, e os 39,2% contra os 70,6% do Sonnet 5.5 são a evidência mais limpa do post. O resumo honesto do dia 7 de outubro é que o piso da inteligência útil caiu bastante e o teto não se moveu nada.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
