
Claude Haiku 5.5 vs DeepSeek V4 Flash: Anthropic acaba de derrubar o piso de preços
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Durante dois anos, o segmento barato do mercado tinha uma forma que todos conheciam: os laboratórios americanos cobravam mais e os laboratórios chineses cobravam menos, e você escolhia seu lado de acordo. Claude Haiku 5.5 quebrou isso em 7 de outubro de 2026, ao ser lançado a $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída — o que está abaixo da taxa publicada para DeepSeek V4 Flash, o modelo que tem sido o ponto de referência para o barato desde o verão.
É uma vitória mais estreita do que parece, e as razões valem mais do que a manchete. A tarifa da Anthropic só vale para prompts de até 100.000 tokens. Acima disso, ela passa a US$ 0,50 e US$ 2,50, o que é várias vezes o preço da DeepSeek. E a própria tabela da DeepSeek tem um formato que ninguém copia: o preço dobra durante duas janelas em dias úteis. Dois fornecedores, duas ideias completamente diferentes do que "barato" significa.
O que cada fornecedor realmente publica
Por milhão de tokens, em dólares americanos. Os números da Anthropic vêm da documentação de preços da Anthropic; os números da DeepSeek vêm da própria página Modelos e Preços da DeepSeek, que é a referência autoritativa para o modelo.

• Entrada — Claude Haiku 5.5: US$ 0,10 até 100.000 tokens, US$ 0,50 acima disso. DeepSeek V4 Flash: US$ 0,15 fora de pico, US$ 0,30 nas janelas de pico.
• Saída — Claude Haiku 5.5 $0,50 até 100.000 tokens, $2,50 acima disso. DeepSeek V4 Flash $0,60 fora do horário de pico, $1,20 no horário de pico.
• Entrada em cache — Claude Haiku 5.5 $0.01 até 100.000 tokens e $0.05 acima. DeepSeek V4 Flash $0.003 fora de pico e $0.006 em horário de pico, sendo mais de três vezes mais barato.
• Janelas de pico — a Anthropic não tem nenhuma; a tarifa muda com o comprimento do prompt e nada mais. A DeepSeek dobra a tarifa entre 01:00 e 04:00 e novamente entre 06:00 e 10:00 UTC, de segunda a sexta-feira, excluindo feriados públicos chineses.
• Contexto e saída — 1M tokens e 128.000 de saída máxima para Claude Haiku 5.5; 1M tokens e 384.000 de saída máxima para DeepSeek V4 Flash.
• Modalidade — O Claude Haiku 5.5 aceita texto e imagens; o DeepSeek V4 Flash é apenas texto, e a visão fica no modelo irmão, e não neste.
• Pontuação independente — O Artificial Analysis Intelligence Index v4.3.2 coloca o Claude Haiku 5.5 (Max) em 43,40, segundo entre 182 modelos, e o DeepSeek V4 Flash 0731 (Max) em 34,33, décimo entre 117.
• Velocidade — a mesma fonte mede 241,9 tokens de saída por segundo para o Claude Haiku 5.5 e 222,0 para o DeepSeek V4 Flash, o segundo mais rápido em seu próprio ranking.
O crossover é a história inteira.
Alinhe os dois cartões em uma única solicitação e a comparação se inverte duas vezes.
Abaixo de 100.000, a Anthropic fica em US$ 0,10 contra US$ 0,15 na entrada e US$ 0,50 contra US$ 0,60 na saída. É a primeira vez que um modelo pequeno da Anthropic fica abaixo da tarifa do DeepSeek Flash em termos comparáveis, e é esse o fato que abre o post de lançamento.
Acima de 100.000 tokens, a relação se inverte drasticamente. A entrada de US$ 0,50 da Anthropic é mais de três vezes a tarifa fora de pico da DeepSeek, e a saída de US$ 2,50 é mais de quatro vezes essa tarifa. Um pipeline de recuperação ou de documentos longos que rotineiramente monta prompts de 150.000 tokens não é, de forma alguma, um cliente do Claude Haiku 5.5; é um cliente do modelo que já estava usando.
E nas duas janelas de dias úteis da DeepSeek, a segunda comparação se estreita na direção oposta, porque a própria taxa da DeepSeek dobra, enquanto a da Anthropic não se move. Nenhuma das estruturas dos fornecedores é melhor em abstrato. Uma precifica com base em quanto você envia; a outra, com base em quando você envia, e apenas uma dessas coisas está sob seu controle no momento da requisição.
Quanto custa uma tarefa concluída, que é o único justo
As tarifas de tabela são por token, e os dois modelos não emitem o mesmo número de tokens para o mesmo trabalho. É aí que a aritmética do lançamento fica desconfortável para a Anthropic.
A Artificial Analysis estima o Claude Haiku 5.5 (Max) em US$ 0,21 por tarefa do Intelligence Index e o DeepSeek V4 Flash 0731 (Max) em US$ 0,22 por tarefa. Um décimo da taxa de entrada, uma janela mais ampla e uma diferença de 26 pontos no Intelligence Index — 43,40 contra 34,33 — e o custo medido de concluir uma tarefa fica a um centavo do modelo que deveria ser mais caro que ele.
O motivo está na mesma página. Ao avaliar o Index, o Claude Haiku 5.5 gerou 440 milhões de tokens de saída contra uma mediana de 100 milhões, e o avaliador o considera muito prolixo. O DeepSeek V4 Flash gerou 240 milhões contra uma mediana de 140 milhões e também é considerado muito prolixo. Ambos os modelos pensam longamente, ambos cobram o pensamento como saída, e a saída é o medidor que decide a fatura. O corte de noventa por cento na entrada é real e é cobrado na metade menor da fatura.
Há um segundo efeito, mais silencioso. A própria documentação da Anthropic diz que o Claude Haiku 5.5 usa o tokenizador mais recente compartilhado com o Claude 4.7 e posteriores, então o mesmo texto conta como aproximadamente 30% mais tokens do que contava no Claude Haiku 4.5. A taxa caiu por um fator de dez; a contagem de tokens não caiu em nada e, no mesmo texto, aumentou.

O modelo por trás do nome DeepSeek também mudou.
Quem for comparar esses dois com base numa tabela de benchmark de meses atrás deveria saber disto antes de fazê-lo.
A página de preços da DeepSeek agora lista deepseek-flash como o nome do modelo, respaldado pelo DeepSeek-V4.1-Flash, e afirma que o id legado deepseek-v4-flash ainda é aceito, mas que "os modelos correspondentes foram descontinuados" — as requisições sob o nome antigo são atendidas pelo modelo mais novo e cobradas ao preço do Flash. Em outras palavras, o id manteve seu nome, seu preço e seu lugar na escalação, e os pesos por baixo dele mudaram.
Isso não é uma crítica; é um alerta sobre a data a que uma tabela de benchmark se refere. A entrada do Artificial Analysis que este texto cita é referente ao lançamento 0731 do DeepSeek V4 Flash na sua configuração Max, que é o modelo que o quadro mediu, e não constitui automaticamente uma afirmação sobre o que quer que responda a esse id hoje. O Claude Haiku 5.5 da Anthropic, em contrapartida, é um id fixo, sem sufixo de data e sem alias, e a sua colocação no Index está datada da sua própria semana de lançamento.
Dois modelos, um endpoint
O motivo pelo qual é fácil resolver essa comparação por conta própria, em vez de em uma ficha técnica, é que ambos os lados podem ser chamados do mesmo lugar — com uma exceção que vale mencionar.
O DeepSeek V4 Flash está hoje no catálogo da OrcaRouter, e o failover automático fica por baixo dele, pelo que a perna DeepSeek desta comparação pode ser chamada por nós esta manhã em vez de apenas lermos sobre ela. Uma cautela que vale a pena declarar em vez de deixar para você descobrir: a nossa própria tarifa listada para este modelo é de $0,22 de entrada e $0,66 de saída por milhão de tokens, o que fica acima da tabela off-peak da DeepSeek e abaixo da de pico. Trate a página da DeepSeek, e não a nossa, como a autoridade sobre a estrutura de pico e fora de pico, e a nossa como um único número combinado para iniciar uma execução medida. Claude Sonnet 5.5 e Claude Opus 5.5 também estão no catálogo. Assim, um A/B entre uma perna DeepSeek Flash e uma perna Claude é uma chave e um SDK, e o DSL de roteamento irá compô-los numa única chamada se a lógica de escalonamento pertencer à rota e não à aplicação.
O Claude Haiku 5.5 ainda não está no catálogo. Isso não é uma evasiva — significa que o lado da Anthropic desta comparação atualmente tem de ser acessado diretamente na Anthropic, e o lado da DeepSeek não. Se quiser a camada barata da linha DeepSeek na mesma chave que o resto da sua stack hoje, essa parte já está no ar.

Qual escolher
Se as suas chamadas forem curtas — classificação, extração, roteamento, sumarização, turnos de subagente — e couberem em menos de 100.000 tokens, o Claude Haiku 5.5 é agora o modelo mais barato nas duas métricas e o mais forte no ranking independente, e o caso é simples. É também o único dos dois que aceita uma imagem.
Se as suas chamadas forem longas, se você reenviar um grande prefixo compartilhado, ou se puder agendar, a aritmética aponta no sentido oposto — e o faz por uma margem ampla: a entrada em cache da DeepSeek a US$ 0,003 fora de pico é uma ordem de magnitude inferior aos US$ 0,01 da Anthropic, o teto de saída dela é três vezes maior, e o desconto fora de pico dela é um problema de agendamento, e não uma limitação do produto.
O que o lançamento de fato estabeleceu é mais restrito do que "a Anthropic agora está barata". Ele estabeleceu que os laboratórios americanos cobrarão menos do que os chineses no caso de prompt curto, e que é no caso de prompt curto que está a maior parte do tráfego de produção. Tudo além de 100.000 tokens ainda é o mercado do outro modelo.
