Um cartão principal gerado para 'Um décimo da tarifa não é um décimo da fatura', com o selo 'GENERATION GAP', o antetítulo 'DOIS MODELOS HAIKU, ONZE MESES DE DIFERENÇA' e o subtítulo 'Claude Haiku 5.5 contra Claude Haiku 4.5 em preço, tokens e o novo passo de 100.000 tokens.' Quatro chips exibem '$0.10 / $0.50', '$1.00 / $5.00', 'contexto de 1M' e '30% mais tokens'. Dois cartões abaixo estão rotulados como 'O QUE A TARIFA DIZ' ('90% mais baixo na entrada e na saída abaixo de 100.000 tokens') e 'O QUE A FATURA DIZ' ('cerca de 75% menos para operar, com cerca de 30% mais tokens'). Um rodapé diz 'Documentação de preços do fornecedor consultada em 8 de outubro de 2026.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Claude Haiku 5.5 vs Claude Haiku 4.5: O corte de preço de 90% não é uma economia de 90%

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Haiku 5.5 tem o preço de US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída para prompts de até 100.000 tokens. Claude Haiku 4.5 custa US$ 1 e US$ 5, fixos, por toda a janela de 200.000 tokens que sempre teve. A Ant​hropic apresenta a diferença como "90% menor" em uma nota de rodapé e "cerca de 75% menos para executar" na frase acima dela — e o intervalo de onze meses entre os dois modelos é exatamente a distância entre esses dois números.

Isso não é um truque de marketing. É a forma honesta de uma geração de modelo que mudou seu tokenizador, seu padrão de raciocínio e sua janela de contexto ao mesmo tempo que seu preço, e significa que qualquer pessoa que troque o id do modelo e espere que a conta caia por um fator de dez ficará decepcionada com a aritmética, e não com o produto.

Ambos os modelos, como enviados

Tudo abaixo é por milhão de tokens, em dólares norte-americanos, e foi lido na própria documentação de preços e modelos da Anthropic em 2026-10-08, salvo indicação em contrário.

A generated scoreboard titled 'Claude Haiku 5.5 vs Claude Haiku 4.5 - as shipped'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cache read $0.01 and $0.05, context 1M tokens, maximum output 128,000 tokens, thinking adaptive with an effort dial. Claude Haiku 4.5 reads input $1.00 flat, output $5.00 flat, cache read $0.10, context 200,000 tokens, maximum output 64,000 tokens, thinking manual with no effort dial. A footer reads 'Vendors' published list rates and model documentation.'

• Entrada — Claude Haiku 5.5 $0.10 até 100.000 tokens, $0.50 acima disso; Claude Haiku 4.5 $1.00 independentemente do comprimento.

• Saída — Claude Haiku 5.5 $0.50 até 100.000 tokens, $2.50 acima disso; Claude Haiku 4.5 $5.00 independentemente do comprimento.

• Leituras de cache — Claude Haiku 5.5 $0,01 até 100.000 tokens e $0,05 acima; Claude Haiku 4.5 $0,10. Gravações de cache — $0,125 e $0,625 em comparação com $1,25.

• Contexto — 1M de tokens contra 200.000. Saída máxima — 128.000 tokens contra 64.000.

Pensamento — Claude Haiku 5.5 é adaptativo e vem ativado por padrão, com um seletor de esforço definido como médio por padrão; Claude Haiku 4.5 usa o formato manual mais antigo e não tem parâmetro de esforço algum.

• Pontuação independente — Artificial Analysis Intelligence Index v4.3.2. Claude Haiku 5.5 (Max) com 43,40, segundo de 182 modelos, e Claude 4.5 Haiku com 16,88, trigésimo de 61 — com o avaliador sinalizando a pontuação do 4.5 como estimada.

• Velocidade — a mesma fonte mede 242 tokens de saída por segundo para o Claude Haiku 5.5, contra 89,7 para a geração 4.5, que é o único ponto em que o modelo antigo ainda parece confortável.

Onde a história do décimo do preço desmorona

Três coisas corroem o corte, e apenas a primeira delas é o próprio aviso da Anthropic.

O tokenizador é o grande ponto. O Claude Haiku 5.5 usa o tokenizador mais novo introduzido com o Claude 4.7, e a documentação da Anthropic afirma que o mesmo texto "conta aproximadamente 30% mais tokens do que no Claude Haiku 4.5". Você não está pagando um décimo da tarifa pelo mesmo número de tokens; está pagando um décimo da tarifa por aproximadamente 1,3 vezes o número de tokens. O próprio guia de migração do fornecedor coloca isso como o segundo item da lista de verificação, antes de qualquer alteração de código: reconte seus prompts e depois reveja max_tokens e suas estimativas de custo.

Os tokens de raciocínio são cobrados como tokens de saída, e o Claude Haiku 5.5 pensa por padrão. A página de lançamento da Anthropic deixa explícito que o modelo é "muito verboso" por si só nos gráficos, e a medição independente corrobora isso de forma mais contundente do que o fornecedor: ao avaliar o Intelligence Index, a Artificial Analysis registrou 440 milhões de tokens de saída do Claude Haiku 5.5 contra uma mediana de 100 milhões em geral, e sinalizou o modelo como muito verboso. Uma tarifa de entrada barata não ajuda uma carga de trabalho cuja fatura é majoritariamente de saída.

O patamar de 100.000 tokens é o terceiro. Acima dele, as tarifas são US$ 0,50 e US$ 2,50 — metade do que o Claude Haiku 4.5 cobrava, na mesma requisição, o que é um bom negócio e não é o negócio sobre o qual a maioria dos leitores terá lido. A Anthropic diz que prompts abaixo do limite representaram cerca de 90% das requisições ao modelo Haiku anterior, que é o número que torna a oferta sustentável como manchete; é também o mix de tráfego do próprio fornecedor, não o seu.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 row in the models table and the published rate card beneath it, with the input, output, cache read and cache write rates and the prompt-length thresholds set out per million tokens.

Quanto custa o mesmo trabalho aos dois modelos

O custo por tarefa concluída é a métrica que sobrevive aos três efeitos acima, porque cobra do modelo tudo o que ele emitiu, não apenas o que você enviou a ele.

A Artificial Analysis coloca o Claude Haiku 5.5 (Max) a US$ 0,21 por tarefa do Intelligence Index — o valor que publica ao lado de uma taxa de entrada de US$ 0,10 e de saída de US$ 0,50. Ela não publica nenhum valor de custo por tarefa para a geração 4.5; o bloco mostra "desconhecido", porque o modelo nunca foi executado no Index em uma configuração de raciocínio. O que a página publica é um preço de tabela bruto de US$ 1,00 e US$ 5,00 e uma pontuação medida diferente e mais baixa.

Portanto, a comparação honesta para um comprador não é 10x em tokens, mas algo mais próximo disto: um décimo da tarifa de entrada com 30% mais tokens, metade da tarifa de saída quando você ultrapassa 100K, e um modelo que gasta mais tokens de saída por resposta do que seu antecessor — contra um salto de capacidade de 16,88 para 43,40 no mesmo painel independente. A cifra de 75% que a Ant​hropic cita para cargas de trabalho médias é o número sensato para planejamento. Também é uma estimativa combinada do fornecedor sobre uma combinação de tráfego que você não controla.

A migração não é uma simples troca de model-id

O guia de migração da Anthropic tem dez itens para quem está migrando do Claude Haiku 4.5, e vários são falhas graves, não meros conselhos.

• O pensamento manual falha — thinking: {"type": "enabled", "budget_tokens": N} retorna um erro. O pensamento adaptativo o substitui, e thinking.display precisa ser definido como "summarized" se você quiser ver o raciocínio de alguma forma.

• Os parâmetros de amostragem quebram — temperature, top_p e top_k todos têm que sair da requisição.

• O prefill do assistente quebra — uma conversa que termina em um turno do assistente retorna um erro; termine-a em um turno do usuário.

• Alterações na ordem dos blocos — uma resposta pode começar com blocos de pensamento, então o código que lê o primeiro bloco de conteúdo como a resposta precisa selecionar por type instead.

• As recusas são novas — o modelo executa classificadores de segurança, pode retornar stop_reason: "refusal", e não há fallback do lado do servidor.

• O replay é restrito — os blocos de pensamento funcionam apenas na conta que os produziu, ou em uma conta vinculada a ela.

• O Priority Tier não é transferido — as organizações que possuem um compromisso de Priority Tier no Claude Haiku 4.5 precisam planejar a capacidade separadamente, porque o tier não é compatível com o Claude Haiku 5.5.

Dois desses merecem mais atenção do que os demais. O motivo de parada por recusa é uma mudança no fluxo de controle em qualquer loop que pressupunha que toda resposta tem conteúdo, e os blocos de pensamento vinculados à conta quebram qualquer fila que armazena conversas e as reproduz por meio de um pool de credenciais. Nenhum dos dois aparece antes da produção.

Executando ambos os níveis sob uma única chave

A questão prática para a maioria das equipes não é qual destes dois modelos é melhor, porque a resposta depende inteiramente de qual chamada você está fazendo. É se o elo barato de uma cascata pode ser atualizado independentemente de tudo ao seu redor.

O Claude Haiku 4.5 está hoje no catálogo do OrcaRouter ao preço de tabela da Anthropic, com 0% de margem, por isso a tarifa do fornecedor é repassada diretamente e qualquer alteração que a Anthropic faça nela aparece do nosso lado no mesmo dia. O Claude Sonnet 5.5 e o Claude Opus 5.5 também estão lá, o que significa que um pipeline de dois níveis — modelo pequeno para a maioria rotineira, modelo maior para a escalada — pode ser montado agora com uma chave, um SDK e failover automático por baixo, e a perna pequena trocada pelo Claude Haiku 5.5 mais tarde como uma mudança de model-id em vez de uma reescrita.

Claude Haiku 5.5 ainda não está no catálogo, e vale a pena dizer isso claramente em vez de deixar implícito. Uma lacuna no dia do lançamento entre um modelo ser lançado e um modelo poder ser roteado é normal e não é uma promessa sobre quando ela se fecha; os modelos que podem ser chamados por nós nesta manhã são os nomeados acima.

A screenshot of the OrcaRouter catalogue page for Claude Haiku 4.5, showing the model identifier, the provider Anthropic, the model description and a stat strip carrying the $1.00 per million input and $5.00 per million output rates alongside the context window and maximum output.

Quem deve trocar, e qual chamada trocar primeiro

Se o seu tráfego do Haiku 4.5 for classificação, extração, roteamento, compactação ou sumarização com prompts abaixo de 100.000 tokens, migre — a tarifa é um décimo, a janela é cinco vezes mais ampla, e o ajuste de esforço oferece uma alavanca de custo que o modelo antigo nunca teve. Faça um orçamento cerca de 75% menor e reconcilie com suas próprias contagens de tokens depois de uma semana.

Se os seus prompts ultrapassarem regularmente 100 000 tokens, está a comprar um corte de 50% em vez de um de 90%, e o segundo escalão altera a comparação de formas que fazem valer a pena procurar alternativas: a tarifa de saída acima de 100K de $2,50 está acima do que vários modelos pequenos concorrentes cobram pela janela inteira.

E se você está no Haiku 4.5 porque era a única opção barata que cabia em um documento de 200.000 tokens, observe o que mudou. A janela agora é de um milhão de tokens, o que é um produto diferente, e o motivo para manter o modelo antigo desapareceu silenciosamente, junto com o motivo de ele ser barato.