
Claude Haiku 5.5 vs Claude Haiku 4.5: O corte de preço de 90% não é uma economia de 90%
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Claude Haiku 5.5 tem o preço de US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída para prompts de até 100.000 tokens. Claude Haiku 4.5 custa US$ 1 e US$ 5, fixos, por toda a janela de 200.000 tokens que sempre teve. A Anthropic apresenta a diferença como "90% menor" em uma nota de rodapé e "cerca de 75% menos para executar" na frase acima dela — e o intervalo de onze meses entre os dois modelos é exatamente a distância entre esses dois números.
Isso não é um truque de marketing. É a forma honesta de uma geração de modelo que mudou seu tokenizador, seu padrão de raciocínio e sua janela de contexto ao mesmo tempo que seu preço, e significa que qualquer pessoa que troque o id do modelo e espere que a conta caia por um fator de dez ficará decepcionada com a aritmética, e não com o produto.
Ambos os modelos, como enviados
Tudo abaixo é por milhão de tokens, em dólares norte-americanos, e foi lido na própria documentação de preços e modelos da Anthropic em 2026-10-08, salvo indicação em contrário.

• Entrada — Claude Haiku 5.5 $0.10 até 100.000 tokens, $0.50 acima disso; Claude Haiku 4.5 $1.00 independentemente do comprimento.
• Saída — Claude Haiku 5.5 $0.50 até 100.000 tokens, $2.50 acima disso; Claude Haiku 4.5 $5.00 independentemente do comprimento.
• Leituras de cache — Claude Haiku 5.5 $0,01 até 100.000 tokens e $0,05 acima; Claude Haiku 4.5 $0,10. Gravações de cache — $0,125 e $0,625 em comparação com $1,25.
• Contexto — 1M de tokens contra 200.000. Saída máxima — 128.000 tokens contra 64.000.
Pensamento — Claude Haiku 5.5 é adaptativo e vem ativado por padrão, com um seletor de esforço definido como médio por padrão; Claude Haiku 4.5 usa o formato manual mais antigo e não tem parâmetro de esforço algum.
• Pontuação independente — Artificial Analysis Intelligence Index v4.3.2. Claude Haiku 5.5 (Max) com 43,40, segundo de 182 modelos, e Claude 4.5 Haiku com 16,88, trigésimo de 61 — com o avaliador sinalizando a pontuação do 4.5 como estimada.
• Velocidade — a mesma fonte mede 242 tokens de saída por segundo para o Claude Haiku 5.5, contra 89,7 para a geração 4.5, que é o único ponto em que o modelo antigo ainda parece confortável.
Onde a história do décimo do preço desmorona
Três coisas corroem o corte, e apenas a primeira delas é o próprio aviso da Anthropic.
O tokenizador é o grande ponto. O Claude Haiku 5.5 usa o tokenizador mais novo introduzido com o Claude 4.7, e a documentação da Anthropic afirma que o mesmo texto "conta aproximadamente 30% mais tokens do que no Claude Haiku 4.5". Você não está pagando um décimo da tarifa pelo mesmo número de tokens; está pagando um décimo da tarifa por aproximadamente 1,3 vezes o número de tokens. O próprio guia de migração do fornecedor coloca isso como o segundo item da lista de verificação, antes de qualquer alteração de código: reconte seus prompts e depois reveja max_tokens e suas estimativas de custo.
Os tokens de raciocínio são cobrados como tokens de saída, e o Claude Haiku 5.5 pensa por padrão. A página de lançamento da Anthropic deixa explícito que o modelo é "muito verboso" por si só nos gráficos, e a medição independente corrobora isso de forma mais contundente do que o fornecedor: ao avaliar o Intelligence Index, a Artificial Analysis registrou 440 milhões de tokens de saída do Claude Haiku 5.5 contra uma mediana de 100 milhões em geral, e sinalizou o modelo como muito verboso. Uma tarifa de entrada barata não ajuda uma carga de trabalho cuja fatura é majoritariamente de saída.
O patamar de 100.000 tokens é o terceiro. Acima dele, as tarifas são US$ 0,50 e US$ 2,50 — metade do que o Claude Haiku 4.5 cobrava, na mesma requisição, o que é um bom negócio e não é o negócio sobre o qual a maioria dos leitores terá lido. A Anthropic diz que prompts abaixo do limite representaram cerca de 90% das requisições ao modelo Haiku anterior, que é o número que torna a oferta sustentável como manchete; é também o mix de tráfego do próprio fornecedor, não o seu.

Quanto custa o mesmo trabalho aos dois modelos
O custo por tarefa concluída é a métrica que sobrevive aos três efeitos acima, porque cobra do modelo tudo o que ele emitiu, não apenas o que você enviou a ele.
A Artificial Analysis coloca o Claude Haiku 5.5 (Max) a US$ 0,21 por tarefa do Intelligence Index — o valor que publica ao lado de uma taxa de entrada de US$ 0,10 e de saída de US$ 0,50. Ela não publica nenhum valor de custo por tarefa para a geração 4.5; o bloco mostra "desconhecido", porque o modelo nunca foi executado no Index em uma configuração de raciocínio. O que a página publica é um preço de tabela bruto de US$ 1,00 e US$ 5,00 e uma pontuação medida diferente e mais baixa.
Portanto, a comparação honesta para um comprador não é 10x em tokens, mas algo mais próximo disto: um décimo da tarifa de entrada com 30% mais tokens, metade da tarifa de saída quando você ultrapassa 100K, e um modelo que gasta mais tokens de saída por resposta do que seu antecessor — contra um salto de capacidade de 16,88 para 43,40 no mesmo painel independente. A cifra de 75% que a Anthropic cita para cargas de trabalho médias é o número sensato para planejamento. Também é uma estimativa combinada do fornecedor sobre uma combinação de tráfego que você não controla.
A migração não é uma simples troca de model-id
O guia de migração da Anthropic tem dez itens para quem está migrando do Claude Haiku 4.5, e vários são falhas graves, não meros conselhos.
• O pensamento manual falha — thinking: {"type": "enabled", "budget_tokens": N} retorna um erro. O pensamento adaptativo o substitui, e thinking.display precisa ser definido como "summarized" se você quiser ver o raciocínio de alguma forma.
• Os parâmetros de amostragem quebram — temperature, top_p e top_k todos têm que sair da requisição.
• O prefill do assistente quebra — uma conversa que termina em um turno do assistente retorna um erro; termine-a em um turno do usuário.
• Alterações na ordem dos blocos — uma resposta pode começar com blocos de pensamento, então o código que lê o primeiro bloco de conteúdo como a resposta precisa selecionar por type instead.
• As recusas são novas — o modelo executa classificadores de segurança, pode retornar stop_reason: "refusal", e não há fallback do lado do servidor.
• O replay é restrito — os blocos de pensamento funcionam apenas na conta que os produziu, ou em uma conta vinculada a ela.
• O Priority Tier não é transferido — as organizações que possuem um compromisso de Priority Tier no Claude Haiku 4.5 precisam planejar a capacidade separadamente, porque o tier não é compatível com o Claude Haiku 5.5.
Dois desses merecem mais atenção do que os demais. O motivo de parada por recusa é uma mudança no fluxo de controle em qualquer loop que pressupunha que toda resposta tem conteúdo, e os blocos de pensamento vinculados à conta quebram qualquer fila que armazena conversas e as reproduz por meio de um pool de credenciais. Nenhum dos dois aparece antes da produção.
Executando ambos os níveis sob uma única chave
A questão prática para a maioria das equipes não é qual destes dois modelos é melhor, porque a resposta depende inteiramente de qual chamada você está fazendo. É se o elo barato de uma cascata pode ser atualizado independentemente de tudo ao seu redor.
O Claude Haiku 4.5 está hoje no catálogo do OrcaRouter ao preço de tabela da Anthropic, com 0% de margem, por isso a tarifa do fornecedor é repassada diretamente e qualquer alteração que a Anthropic faça nela aparece do nosso lado no mesmo dia. O Claude Sonnet 5.5 e o Claude Opus 5.5 também estão lá, o que significa que um pipeline de dois níveis — modelo pequeno para a maioria rotineira, modelo maior para a escalada — pode ser montado agora com uma chave, um SDK e failover automático por baixo, e a perna pequena trocada pelo Claude Haiku 5.5 mais tarde como uma mudança de model-id em vez de uma reescrita.
Claude Haiku 5.5 ainda não está no catálogo, e vale a pena dizer isso claramente em vez de deixar implícito. Uma lacuna no dia do lançamento entre um modelo ser lançado e um modelo poder ser roteado é normal e não é uma promessa sobre quando ela se fecha; os modelos que podem ser chamados por nós nesta manhã são os nomeados acima.

Quem deve trocar, e qual chamada trocar primeiro
Se o seu tráfego do Haiku 4.5 for classificação, extração, roteamento, compactação ou sumarização com prompts abaixo de 100.000 tokens, migre — a tarifa é um décimo, a janela é cinco vezes mais ampla, e o ajuste de esforço oferece uma alavanca de custo que o modelo antigo nunca teve. Faça um orçamento cerca de 75% menor e reconcilie com suas próprias contagens de tokens depois de uma semana.
Se os seus prompts ultrapassarem regularmente 100 000 tokens, está a comprar um corte de 50% em vez de um de 90%, e o segundo escalão altera a comparação de formas que fazem valer a pena procurar alternativas: a tarifa de saída acima de 100K de $2,50 está acima do que vários modelos pequenos concorrentes cobram pela janela inteira.
E se você está no Haiku 4.5 porque era a única opção barata que cabia em um documento de 200.000 tokens, observe o que mudou. A janela agora é de um milhão de tokens, o que é um produto diferente, e o motivo para manter o modelo antigo desapareceu silenciosamente, junto com o motivo de ele ser barato.
