
Claude Haiku 5.5 vs DeepSeek V4.1 Flash: O preço mais baixo não significa o modelo mais barato
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Na tabela de preços, isso não chega nem perto. Claude Haiku 5.5, que o fornecedor lançou em 7 de outubro de 2026, está listado a US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. DeepSeek V4.1 Flash, lançado em 10 de setembro de 2026, está listado a US$ 0,30 e US$ 1,20 no painel independente, ou US$ 0,15 e US$ 0,60 na própria tabela fora de pico do fornecedor. O fornecedor é entre duas e três vezes mais barato nas duas métricas, e é a primeira vez que um modelo da classe Haiku fica abaixo da tarifa do DeepSeek Flash.
Então você mede quanto custa uma tarefa concluída, e a diferença desmorona. Na mesma execução de avaliação, uma tarefa do Intelligence Index custa $0,21 no Claude Haiku 5.5 e $0,27 no DeepSeek V4.1 Flash — uma vantagem de 20%, não de 200%. A razão está na mesma página: o Claude Haiku 5.5 gerou 162.164 tokens de saída por tarefa, contra 88.574 do DeepSeek. Você paga menos por token e compra quase o dobro deles.
Essa inversão é a comparação inteira, e tudo o que vem abaixo é um argumento sobre em qual lado dela sua carga de trabalho recai.
Ambas as tabelas de preços, lidas como estão escritas
Por milhão de tokens em dólares americanos. Os valores da Anthropic provêm da própria documentação de preços da Anthropic; os da DeepSeek provêm da página Model & Pricing da DeepSeek, que é a tabela oficial para a sua estrutura de horário de pico e fora de pico. As medições independentes são do Artificial Analysis Intelligence Index v4.3.2, consultado em 2026-10-08.

• Entrada — Claude Haiku 5.5 $0,10 até 100.000 tokens e $0,50 acima disso. DeepSeek V4.1 Flash $0,30 fixo no cartão do quadro, ou $0,15 nas janelas fora de pico da DeepSeek.
• Saída — Claude Haiku 5.5 $0,50 até 100.000 tokens e $2,50 acima. DeepSeek V4.1 Flash $1,20 fixo, ou $0,60 fora de pico.
• Entrada em cache — Claude Haiku 5.5: US$ 0,01 abaixo de 100.000 tokens e US$ 0,05 acima, um desconto de 90%. DeepSeek V4.1 Flash: US$ 0,006, um desconto de 98%. Este é o único medidor em que o cartão DeepSeek é mais barato em termos absolutos, e a diferença é maior do que as pessoas esperam.
• Preços por horário do dia — a Anthropic não tem nenhum. A DeepSeek dobra ambos os medidores entre 01:00 e 04:00 e novamente entre 06:00 e 10:00 UTC em dias de semana, excluindo feriados públicos chineses. Todas as outras horas, incluindo todo o fim de semana, são fora de pico.
• Contexto e limite de saída — 1M de tokens cada. O Claude Haiku 5.5 limita uma única resposta a 128.000 tokens; o DeepSeek V4.1 Flash limita-a a 384.000.
• Pesos — o Claude Haiku 5.5 é proprietário, disponível apenas via API, id do modelo claude-haiku-5-5. O DeepSeek V4.1 Flash é aberto sob a licença MIT, com 552B parâmetros totais e 16B ativos, no Hugging Face.
• Modalidade — ambos recebem texto e imagens e retornam texto. Nenhum dos dois é nativo de vídeo.
• Pontuação independente — 43,40 para Claude Haiku 5.5 (Max) contra 39,46 para DeepSeek V4.1 Flash (Max). Uma diferença de 3,94 pontos em um ranking de 182 modelos.

Por que o número por tarefa supera o número por token
As tarifas de tabela são cotadas por token porque é isso que é contabilizado. Elas são um guia ruim para o custo de uma carga de trabalho, porque um modelo de raciocínio decide quantos tokens uma tarefa exige, e os dois modelos aqui divergem por um fator de 1,8.
Claude Haiku 5.5 emite 162.164 tokens de saída por tarefa do Intelligence Index, divididos em 129.047 de raciocínio e 33.118 de resposta. O DeepSeek V4.1 Flash emite 88.574, divididos em 62.670 de raciocínio e 25.904 de resposta. Ambos cobram o raciocínio como saída. Assim, o modelo com taxa de saída 60% menor gasta quase o dobro no medidor caro, e a aritmética os deixa a menos de seis centavos de diferença um do outro.
Há um segundo efeito puxando na mesma direção. A execução do índice é dominada tanto pela entrada quanto pela saída, porque o harness reenvia o contexto: os US$ 0,2128 por tarefa do Claude Haiku 5.5 se dividem em US$ 0,1317 de entrada e US$ 0,0811 de saída, e, dentro da linha de entrada, US$ 0,0954 disso são leituras de cache e US$ 0,0337 são escritas de cache, contra apenas US$ 0,0026 de entrada nova. Os US$ 0,2652 do DeepSeek se dividem em US$ 0,1589 de entrada e US$ 0,1063 de saída, com US$ 0,0966 da entrada em escritas de cache. Os dois modelos leem aproximadamente a mesma quantidade de contexto em cache; o DeepSeek paga mais pelas mesmas leituras e escritas.
O post de lançamento da Anthropic abre com uma advertência semelhante. Ele diz que o Haiku 5.5 é "especialmente bom custo-benefício quando usado para tarefas com prompts de até 100.000 tokens, que correspondem a 90% das solicitações feitas ao nosso modelo Haiku anterior." Esse qualificador tem um peso real — veja a queda brusca abaixo.
O penhasco de 100.000 tokens é a verdadeira bifurcação.
A Anthropic não cobra um preço fixo pelo Claude Haiku 5.5. As tarifas de US$ 0,10 e US$ 0,50 valem para prompts de até 100.000 tokens e depois passam a US$ 0,50 e US$ 2,50 — um salto de cinco vezes na entrada e de cinco vezes na saída, aplicado à solicitação inteira, e não apenas ao excedente.
A estrutura da DeepSeek é completamente diferente. Sua tarifa depende de quando você envia, não de quanto. Um prompt de 150.000 tokens custa o mesmo por token que um prompt de 500 tokens, com o valor dobrado em duas janelas de dias úteis.
Coloque um pipeline de prompt longo nos dois e a comparação se inverte drasticamente. Com 150.000 tokens de entrada e 20.000 de saída, o Claude Haiku 5.5 cobra US$ 0,125 de entrada e US$ 0,05 de saída — US$ 0,175 pela chamada —, enquanto o DeepSeek fora de pico cobra US$ 0,0225 e US$ 0,012, o que fica abaixo de quatro centavos. Ou seja, o DeepSeek vence por um fator de aproximadamente 4,5, nos mesmos dois modelos em que o caso de prompt curto tinha a Anthropic vencendo por três.
Nenhuma das estruturas é melhor em abstrato. Uma define o preço pela quantidade que você envia, a outra pelo momento em que você envia, e apenas uma dessas duas variáveis está sob seu controle no momento da solicitação.
A outra alavanca da DeepSeek que ninguém precifica
A linha de cache merece uma análise própria, porque é o medidor mais barato de toda esta comparação e é o que cresce com o volume de produção em vez de encolher.
A taxa de acerto de cache da DeepSeek é de US$ 0,006 por milhão de tokens, com um desconto declarado de 98% — cerca de um sexto dos US$ 0,01 da Anthropic e uma fração do que custa a entrada nova em ambos os lados. Qualquer coisa que reenvie um prefixo estável — um prompt de sistema longo, um conjunto de documentos recuperados, um esquema de ferramenta — paga essa taxa em cada turno após o primeiro. A execução de índice acima já mostra o quão grande é essa parcela: US$ 0,0954 do custo de entrada por tarefa do Claude Haiku 5.5 são leituras de cache, provenientes de apenas US$ 0,0026 de entrada não cacheada.
Então a divisão prática é mais estreita do que “a Anthropic é mais barata”. Se as suas requisições forem curtas, de turno único e com cache quente, o Claude Haiku 5.5 está à frente no preço, à frente em capacidade por 3,94 pontos de índice e à frente nas linhas agênticas compostas. Se as suas requisições forem longas, ou com muitos prefixos, ou agendáveis para as janelas fora de pico da DeepSeek, o DeepSeek V4.1 Flash domina em custo e não é por pouco.
O que você pode realmente chamar hoje
Ambos os modelos são acessíveis, mas não de forma simétrica, e vale a pena declarar essa assimetria em vez de deixá-la para você descobrir.
O DeepSeek V4.1 Flash já está no catálogo da OrcaRouter, repassado ao preço de tabela do provedor com 0% de margem — o que aqui importa mais do que o habitual, porque a tarifa da DeepSeek tem uma estrutura de picos. Listamos $0.15 de entrada e $0.60 de saída com $0.003 de leitura de cache e as duas janelas de duplicação em dias úteis inscritas no registro de preços, para que um pedido encaminhado para o percurso da DeepSeek seja cobrado tal como a DeepSeek cobra, e não com base numa média combinada. O failover automático fica por baixo da rota, para que um 429 em janela de pico ou uma interrupção parcial do provedor transfira a chamada em vez de a falhar.
O Claude Haiku 5.5 não está no catálogo. O modelo da Anthropic é acessível diretamente pela Anthropic e por meio de seus três parceiros de nuvem — AWS, Google Cloud e Microsoft Azure, que o post de lançamento nomeia — e essa é a única maneira honesta de dizer isso. O que o catálogo traz da linha Anthropic é Claude Sonnet 5.5 e Claude Opus 5.5, e é isso que faz com que um caminho de escalonamento de uma chamada de classificação barata para uma chamada agêntica de nível intermediário seja uma configuração de roteamento, e não uma segunda integração.

Qual escolher
Se o seu tráfego é classificação, extração, decisões de roteamento, sumarização e turnos de subagente — prompts curtos, alto volume, imagens no meio — Claude Haiku 5.5 é o melhor modelo e, abaixo de 100.000 tokens, o mais barato. Ele pontua 3,94 pontos de índice a mais, aceita imagens, e a Anthropic oferece um controle de esforço ajustável para que você possa trocar capacidade por custo por chamada sem mudar de modelo.
Se o seu tráfego for de documentos longos, com uso intenso de recuperação, ou se você puder agendá-lo, o DeepSeek V4.1 Flash vence na aritmética: de três a quatro vezes mais barato por chamada longa, uma taxa de cache de um sexto da da Anthropic, um teto de resposta de 384.000 tokens e pesos abertos que você pode manter caso o modelo por token deixe de ser viável.
O que esta comparação na verdade estabelece é mais restrito do que “a Anthropic é a opção barata agora”. Ela estabelece que um modelo Anthropic pequeno consegue ser mais barato do que uma tarifa do DeepSeek Flash no preço de etiqueta e, ainda assim, ficar a menos de 20% dela na fatura — e que a distância entre esses dois fatos é uma configuração de verbosidade.
Uma API para mais de 200 modelos, uma única chave, failover automático por baixo, para que um erro 429 em horário de pico ou uma indisponibilidade do provedor redirecione a chamada em vez de falhá-la.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
