Cartão de título principal com o texto 'Preços do DeepSeek V4.1 Flash', a linha '$0.15 de entrada, $0.60 de saída, $0.003 por acerto de cache', a legenda 'A cada 1M de tokens, fora de pico. Horários de pico dobram todas as tarifas.', e três cartões com o texto 'Acerto de cache: 50x mais barato que uma falha de cache', 'Contexto de 1M de tokens' e 'Pesos abertos, licença MIT'
Guides & Insights

Preços do DeepSeek V4.1 Flash: A Tabela Completa de Tarifas e o Número de Cache Hits Que Decide Sua Fatura

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O DeepSeek V4.1 Flash está em disponibilidade geral desde 10/09/2026 e, a partir de hoje, sua tabela de preços publicada é o mais barato da categoria superior do mercado de modelos: US$ 0,15 por milhão de tokens de entrada, US$ 0,60 por milhão de saída e US$ 0,003 por milhão em acertos de cache. Esses três números são da coluna fora de pico. Durante as janelas de pico da DeepSeek nos dias úteis, todos eles dobram, inclusive os acertos de cache. A comparação que importa não é com o próprio carro-chefe envelhecido da DeepSeek — o DeepSeek-V4-Pro-0813 está listado a US$ 0,66 / US$ 1,98 por milhão fora de pico, então o Flash é cerca de 4x mais barato que seu próprio irmão na entrada —, mas com o segmento de fronteira fechado que os compradores realmente usam como referência de preço: GPT-5.6 Sol, Claude Opus 5 e Gemini 3.8 Flash, cada um dos quais cobra uma ordem de magnitude a mais por token.

Uma correção antes dos números, porque o vazamento que precedeu este lançamento ainda está circulando. Os números que se espalharam antes da GA descreviam um corte de preço que chegaria "amanhã". Os preços são reais; a contextualização não era. O V4.1 Flash foi lançado em 2026-09-10 com essas tarifas já em vigor, e o próprio changelog da DeepSeek registra a redução como parte do lançamento, e não como um corte posterior. Tudo abaixo foi extraído da página de preços ao vivo da DeepSeek hoje, 2026-09-16.

A tabela de preços completa, com data de 16/09/2026

A DeepSeek publica uma planilha que abrange os SKUs atuais, com cada item de linha dividido em uma coluna de pico e uma fora de pico. Para o id do modelo deepseek-flash, que atende ao DeepSeek-V4.1-Flash, as tarifas publicadas são:

Entrada, falha na cache — US$ 0,15 por 1 milhão de tokens fora de pico; US$ 0,30 por 1 milhão em horário de pico

Entrada, acerto de cache — $0,003 por 1 milhão de tokens fora de pico; $0,006 por 1 milhão no pico

Saída — $0,60 por 1 milhão de tokens fora do horário de pico; $1,20 por 1 milhão em horário de pico

Janela de contexto — 1 milhão de tokens, com saída máxima de 384K

Limite de simultaneidade — 2.500 solicitações simultâneas no SKU Flash

IDs de modelos legadosdeepseek-v4-flash e deepseek-v4-flash-vision-exp foram descontinuados como produtos separados, mas ainda são encaminhados para o V4.1 Flash, cobrados aos preços do Flash

A diferença entre as duas primeiras linhas é a história inteira desta planilha. Um cache hit custa 50x menos que um cache miss fora de pico — um desconto de 98%, que é também como a Artificial Analysis o representa em seu modelo de custos. Nada mais no card move uma fatura tão longe assim.

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

O pico não é um erro de arredondamento, e está cronometrado para Pequim

As janelas de pico da DeepSeek são de segunda a sexta, 01:00–04:00 UTC e 06:00–10:00 UTC. Tudo fora delas — incluindo todos os horários de fim de semana — é cobrado pela metade da tarifa. A duplicação se aplica a todas as três linhas, então um cache miss em horário de pico custa US$ 0,30 e a saída em horário de pico custa US$ 1,20.

Onde essas janelas caem depende inteiramente de onde você está. Em Pequim, são 09:00–12:00 e 14:00–18:00 — dois blocos de trabalho, e é justamente esse o ponto. Em Berlim, em setembro, a segunda janela é 08:00–12:00 CEST: a manhã inteira de uma equipe europeia é de pico. Em Nova York, a mesma janela é 02:00–06:00 EDT. Uma equipe baseada nos EUA em horário normal praticamente nunca é cobrada no pico, e uma equipe da UE paga o dobro toda manhã antes do almoço. Se você está escolhendo quando executar uma tarefa em lote, essa é uma decisão que vale US$ 0,15 por milhão de tokens e não custa nada tomar.

O que o preço por acerto de cache realmente faz com a conta de um agente

Os acertos de cache são automáticos no DeepSeek — a documentação diz que o cache em disco é ativado por padrão para todos os usuários, sem qualquer alteração no código —, portanto o desconto não é algo para o qual você precise arquitetar sua solução. Ele também é best-effort, não garantido: a DeepSeek afirma que não há TTL fixo, que um cache não utilizado é limpo "normalmente em algumas horas a alguns dias" e que o sistema não promete uma taxa de acerto de 100%. Vale a pena ler os campos prompt_cache_hit_tokens e prompt_cache_miss_tokens da resposta antes de modelar qualquer coisa com base nisso.

A aritmética importa mais do que o adjetivo. Considere um agente de programação com um prefixo estável de 40.000 tokens — prompt de sistema, esquemas de ferramentas, contexto do repositório — executado em uma sessão de 60 turnos, em que cada turno acrescenta cerca de 2.000 tokens de saída de ferramenta e o modelo emite cerca de 1.200 tokens. A entrada total ao longo da sessão é de 5,94 milhões de tokens, e a saída total, de 72.000 tokens.

Faturado sem qualquer cache, fora de pico: 5.94M de entrada a $0.15 dá $0.891, mais 72.000 de saída a $0.60 dá $0.043 — cerca de $0.93 pela sessão.

Cobrado com o prefixo em cache, que é o que realmente acontece por padrão: 5,782M desses tokens de entrada chegam como acertos de cache a $0.003 ($0.017), 158.000 chegam como erros de cache a $0.15 ($0.024), e os mesmos 72.000 tokens de saída custam $0.043. Cerca de $0.084 — aproximadamente 11x mais barato. A entrada cai de 95% da conta para 49% dela, a parte em cache sozinha representa 21%, e os tokens de saída se tornam a maior linha individual. Mesmo modelo, mesma sessão, mesma saída — a única coisa que mudou foi se o prefixo foi reutilizado.

Observe o que não está na planilha da DeepSeek: um item de linha de gravação de cache. A Anthropic cobra 1,25x a entrada base para preencher um cache de 5 minutos e 2x por uma hora; a tabela da DeepSeek lista apenas acertos e erros, e seu guia de cache não descreve nenhuma taxa de gravação ou armazenamento. Se você está comparando a economia de cache entre fornecedores em vez das tarifas de token em destaque, essa ausência vale mais do que o desconto de 50x em acertos sugere.

É também por isso que o detalhe de repasse no DeepSeek V4.1 Flash no OrcaRouter importa aqui. Cobramos pela própria tarifa de tabela do provedor, sem nenhuma margem, então uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, em vez de esperarmos por uma rodada de reprecificação — e as colunas de acerto de cache e de pico/fora de pico que você vê acima são aquelas com base nas quais você é de fato cobrado, não uma aproximação combinada delas.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

Versus DeepSeek-V4-Pro-0813: uma diferença de 4x, e uma aposentadoria que não aconteceu

A comparação interna óbvia é o SKU de topo de gama, e é menos dramática do que a taxa anunciada sugere. O DeepSeek-V4-Pro-0813, o id do modelo deepseek-v4-pro, custa $0.66 por 1M de entrada numa falha de cache e $1.98 por 1M de saída fora de hora de ponta, duplicando em hora de ponta para $1.32 e $3.96. Os seus acertos de cache custam $0.022 fora de hora de ponta — mais de 7x os do Flash.

Entrada sem cache hit — $0,15 vs $0,66 fora de pico, portanto o Flash é 4,4x mais barato

Saída — $0,60 vs $1,98 fora de pico, então o Flash é 3,3x mais barato

Entrada com acerto de cache — $0,003 vs $0,022 fora de pico, então o Flash é 7,3x mais barato

Contexto e teto de saída — idênticos em 1M e 384K em ambos os SKUs

Concorrência — 2.500 no Flash contra 500 no V4 Pro, uma diferença de 5x que desaparece totalmente da tabela de preços

Três coisas sobre esta comparação são fáceis de errar. Primeiro, o argumento de reutilização é mais forte no modelo principal em termos absolutos, mesmo que o Flash tenha o multiplicador maior: fazer cache de um milhão de tokens economiza US$ 0,638 no V4 Pro e US$ 0,147 no Flash, porque a taxa de miss do modelo principal já é muito mais alta desde o início. Segundo, o modelo que todos esperavam que tivesse sido descontinuado não foi: a DeepSeek anunciou que deixaria de atender o V4 Pro em 2026-09-14 e encaminharia essas requisições para o Flash, gerou uma reação negativa dos desenvolvedores por trocar um modelo de backend em fluxos de trabalho de produção, e reverteu a decisão em 2026-09-11. O V4 Pro continua sendo atendido, com cobrança inalterada. Terceiro, e esta é a armadilha em que a cobertura do vazamento caiu — não há um V4.1 Pro lançado. O DeepSeek-V4-Pro-0813 continua sendo o SKU principal, e o fornecedor não lançou um sucessor com esse nome. Qualquer pessoa que esteja precificando uma migração para "V4.1 Pro" está precificando um modelo que não existe.

Versus o nível de fronteira fechado

Em comparação com os modelos fechados que os compradores realmente consideram, o multiplicador é o dado principal. Todos os números abaixo vêm da página de preços publicada por cada fornecedor hoje.

GPT-5.6 Sol — tem preço de tabela de US$ 5,00 por 1M de entrada e US$ 30,00 por 1M de saída no nível de contexto curto da OpenAI, atualmente com uma tarifa promocional de US$ 4,00 / US$ 20,00 que a OpenAI diz estar disponível pelo menos até 2026-11-21, com entrada em cache a US$ 0,40. Em comparação com a tarifa promocional, o DeepSeek V4.1 Flash é 26,7x mais barato na entrada e 33,3x na saída; em comparação com a tabela, 33x e 50x. O acerto de cache do Sol custa 133x o do Flash.

Claude Opus 5 — $5,00 por 1M de entrada e $25,00 por 1M de saída, com acertos de cache a $0,50 por 1M na tabela publicada da Anthropic. Isso representa 33x a taxa de entrada do Flash, 42x a sua taxa de saída e 167x a sua taxa de acertos de cache. As gravações de cache de 5 minutos da Anthropic acrescentam mais 1,25x por cima; a tabela da DeepSeek não tem linha equivalente.

Gemini 3.8 Flash — US$ 0,75 por 1M de entrada e US$ 3,75 por 1M de saída até 31/12/2026, com ambas as tarifas programadas para dobrar em 01/01/2027, entrada em cache a US$ 0,075 e — esta é a linha que se repete em uma fatura real — armazenamento de cache a US$ 0,50 por 1M de tokens por hora. O Flash é 5x mais barato na entrada, 6,25x na saída e 25x em acertos de cache em comparação a ele, e a DeepSeek não cobra nada para manter um cache.

O contexto de capacidade é o que mantém isso honesto. No Intelligence Index v4.3 da Artificial Analysis, o DeepSeek V4.1 Flash (raciocínio, esforço máximo) obtém 40 pontos e ocupa a 6ª posição entre 113 modelos, a US$ 0,27 por tarefa do índice e 214,4 tokens de saída por segundo. Esse é um posicionamento genuinamente adjacente à fronteira a um preço 26 vezes abaixo do nível com o qual está sendo comparado — mas a mesma medição mostra que ele é um dos modelos mais verbosos que a AA já testou, gerando 250M tokens de saída ao longo da execução do índice, contra uma mediana de 140M. A verbosidade não muda o preço por token, mas muda sim a conta. Um modelo que escreve 62% mais tokens do que a mediana ainda custa muito menos aqui, mas "barato por token" e "barato por tarefa" são afirmações diferentes, e só a segunda é o que você paga.

Existe um plano gratuito?

Não. A própria página de preços da DeepSeek não documenta nenhum nível gratuito de API, nenhuma cota mensal gratuita e nenhum modelo gratuito — a cobrança é conforme o uso, contra um saldo pré-pago ou concedido, com o saldo concedido consumido primeiro. O app de chat para consumidores é gratuito; a API por trás do deepseek-flash não é, e não há endpoint gratuito para ela na plataforma da DeepSeek. Vários gateways de terceiros anunciam acesso gratuito ou de teste a este modelo, e nós trataríamos todos eles como superfícies de prototipagem em vez de backends de produção, porque esses termos mudam sem aviso e nenhum deles traz a tabela de preços do próprio fornecedor.

As alegações de eficiência por trás do preço

O preço não é um subsídio, pelo menos segundo a própria DeepSeek. O model card e o relatório técnico do fornecedor descrevem o V4.1 Flash como uma mistura de especialistas de 552B parâmetros em um layout codificador-decodificador causal que ativa cerca de 8B parâmetros por token durante o prefill e 16B durante o decode — assimétrico por design, barato de ler e mais caro de escrever. Do lado da memória, a DeepSeek relata um cache KV global de cerca de 890 bytes por token, aproximadamente um quarto do cache do DeepSeek-V4-Flash, e uma pegada de cache persistente em torno de um oitavo dele sob cargas de trabalho idênticas, alcançada ao descartar o estado de janela deslizante e reproduzir os últimos 128 tokens em caso de acerto. Estas são medições relatadas pelo fornecedor em hardware do próprio fornecedor, e o relatório técnico não afirma equivalência matemática à computação completa para o caminho de replay.

A contagem de parâmetros é o único número nesta versão que está genuinamente em aberto, e vale a pena ser preciso sobre o motivo. A prosa da DeepSeek reporta 552B, e essa é a espinha dorsal — a parte que faz a computação. Ao lado dela está o Engram, uma tabela de consulta de memória condicional que o model card dimensiona em 196B parâmetros, acessada por consulta de token em vez de computada. Some-os e você chega perto de 748B, que é o número defendido por uma análise comunitária amplamente lida no r/LocalLLaMA horas depois de os pesos chegarem, e que o próprio painel de arquivos do repositório do Hugging Face empurra ainda mais para cima, na direção de 763B. Relatos comunitários de implantação contabilizaram o checkpoint em cerca de 510 GB em 48 shards, enviado nativamente quantizado como pesos densos FP8 com especialistas FP4. Trate o total como disputado e o número da espinha dorsal como reportado pelo fornecedor. As contagens de parâmetros ativos são as que determinam a velocidade; os pesos residentes são os que decidem se o modelo inicia ou não.

A auto-hospedagem é uma alternativa real a esse preço, sob a licença MIT

Os pesos estão em deepseek-ai/DeepSeek-V4.1-Flash sob a licença MIT, que permite uso comercial, modificação e redistribuição. Isso faz da tabela de preços da API uma escolha, e não um pedágio: com a MIT, nada na licença impede você de servir este modelo por conta própria e pagar por computação em vez de tokens.

O que isso não faz é tornar barato de fazer. O checkpoint tem aproximadamente 510 GB de pesos residentes antes de cache e ativações, a DeepSeek não declara nenhum requisito de GPU em lugar algum do repositório, e relatos de implantação da comunidade colocam o piso prático em um nó com várias GPUs, e não em uma estação de trabalho. Três stacks de serving entregaram suporte day-0 em 2026-09-10 — vLLM, SGLang com Miles e a adaptação NeuWare da Cambricon, baseada em vLLM, para seus próprios aceleradores —, mas no dia do lançamento o vLLM e o SGLang entregaram imagens de preview dedicadas em vez de pacotes oficiais, e o llama.cpp não havia mesclado o suporte à arquitetura V4.1. A auto-hospedagem em hardware de consumidor não é a alternativa ao preço da API hoje; um nó alugado com 8 GPUs é. Se o seu volume for grande o suficiente para amortizar isso, a licença permite; se não for, US$ 0,15 por milhão de tokens é a resposta mais barata, e não é por pouco.

O que a tabela de preços realmente pede que você decida

Três coisas, por ordem de quanto dinheiro movem. Mantenha um prefixo de prompt estável e deixe o cache fazer o seu trabalho — é automático, é um desconto de 50x, e em um loop de agente de 60 turnos transforma uma sessão de $0.93 em uma de $0.084. Execute seu tráfego em lote fora de 01:00–04:00 e 06:00–10:00 UTC nos dias de semana, o que, para uma equipe dos EUA, não muda nada e, para uma equipe europeia, significa mover a tarefa da manhã para a tarde. E se está comparando isto com o próprio flagship da DeepSeek, lembre-se de que o flagship ainda está em promoção — a retirada programada foi cancelada em 2026-09-11, ambos os SKUs ficam atrás de uma única chave, e a troca entre eles é uma mudança de model-id e não uma migração.

O que a tabela de tarifas não lhe diz é se o modelo é bom o suficiente para a sua carga de trabalho, e os números para isso são mais recentes e mais escassos do que a planilha de preços. O posicionamento no índice da Artificial Analysis é uma única medição com esforço máximo de raciocínio, as linhas de benchmark do fornecedor são informadas pelo fornecedor, e a contagem de parâmetros está em disputa. O preço é a parte já definida deste lançamento. Precifique sua migração com base nele e teste a capacidade antes de se comprometer com ele.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente