Um cartão de título hero para 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash' com o subtítulo 'Mesma tabela de preços Flash. Um modelo retreinado.', emblemas em formato de pílula que dizem 'LANÇADO EM 10 SET 2026' e 'ATUALIZAÇÃO DE NÍVEL FLASH', e o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Flash: Mesma Tabela de Preços Flash, um Modelo Re-Treinado

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A semana em que o DeepSeek V4.1 Flash passou de suposto sucessor a modelo Flash oficialmente distribuído foi curta e barulhenta. Em 8 de setembro, o modelo surgiu como um teste de API de dois dias sob o id de modelo deepseek-v4.1-flash-expires-on-0910 — uma versão que a própria DeepSeek chamou de "versão intermediária". Em 9 de setembro, sua plataforma aberta disse que o lançamento oficial, o DeepSeek V4.1 Flash, chegaria por volta de 10 de setembro e que ele "supera de forma abrangente" o DeepSeek V4 Pro em capacidade, custo, velocidade e tempo de ponta a ponta. Em 10 de setembro, o aviso de lançamento veio acompanhado de uma nova tabela de preços da série Flash, cortada às 12h, horário de Pequim, algo que o DeepSeek V4 Flash não via desde um aumento de preço em agosto. Seja o que for verdade, o cavalo de batalha de texto DeepSeek V4 Flash não é mais a forma mais recente de executar uma carga de trabalho Flash, e este artigo é sobre o que isso realmente muda para o aplicativo que você está executando hoje.

Comparações tão cedo são desequilibradas, e vale a pena dizer isso antes que os números cheguem. O DeepSeek V4 Flash tem uma ficha técnica publicada, um mês de tráfego de produção por trás da atualização DeepSeek-V4-Flash-0731, pesos abertos e medições independentes da Artificial Analysis. O DeepSeek V4.1 Flash tem um anúncio oficial, dois dias de testes de velocidade da comunidade, e ainda não tem ficha técnica publicada, relatório técnico ou pontuação de terceiros. As afirmações do fornecedor estão rotuladas como afirmações do fornecedor abaixo; os números da comunidade estão rotulados como medidos pela comunidade.

O tier Flash acabou de resetar — três mudanças, uma semana

DeepSeek V4 Flash, o modelo de mistura de especialistas com 284B parâmetros e 13B ativos, tem sido a escolha padrão sensata de baixo custo e alta taxa de transferência para uma grande parcela do tráfego de texto em produção desde sua atualização de 31 de julho. Três anúncios em três dias abalaram o terreno sob ele:

• 8 de setembro — A DeepSeek abriu um beta de tempo limitado do V4.1 Flash para qualquer conta de API, limitado a 20 solicitações simultâneas e programado para expirar em 10 de setembro, sob um nome de modelo que carregava sua própria data de expiração.

• 9 de setembro — a plataforma aberta anunciou o lançamento formal do DeepSeek V4.1 Flash para por volta de 10 de setembro, descrevendo uma nova estrutura de modelo com suporte multimodal nativo e afirmando que ele supera o DeepSeek V4 Pro em desempenho, custo, velocidade e tempo total de conclusão.

— 10 de setembro — o lançamento oficial traz uma nova lista de preços da série Flash, com efeito às 12h00, horário de Pequim, reduzindo as tarifas que o DeepSeek V4 Flash cobra desde um aumento em 17 de agosto que gerou fortes críticas de desenvolvedores.

O último desses merece destaque próprio porque é o raro corte de preço que é, de fato, um corte de preço. Na nova lista, a entrada fora do pico com acerto de cache cai de ¥0,05 para ¥0,02 por milhão de tokens — uma redução de 60% — enquanto a entrada com falha de cache passa de ¥1,5 para ¥1 e a saída, de ¥4,5 para ¥4. As tarifas de horário de pico são o dobro dos valores fora do pico. Em termos aproximados de dólar americano, isso representa cerca de US$ 0,003 por milhão de tokens de entrada com acerto de cache, US$ 0,14 por milhão de tokens de entrada com falha de cache e US$ 0,56 por milhão de tokens de saída fora do pico, com o dobro no horário de pico. A lacuna de 24 dias entre o aumento de agosto e este corte não foi um acidente de agenda; a redefinição de preços faz parte do lançamento do V4.1 Flash.

Mesmo nível, modelo diferente

A leitura mais fácil é que o V4.1 Flash é o V4 Flash com a velocidade aumentada. Não é. A atualização 0731 foi uma atualização pós-treinamento na base existente do DeepSeek V4 Flash — mesma arquitetura, mesmo layout de mistura de especialistas com 284B no total / 13B ativos. A descrição do DeepSeek sobre o V4.1 Flash aponta para algo maior: uma nova estrutura de modelo, que vários veículos interpretaram como uma nova rodada de pré-treinamento em vez de um ajuste fino. A distinção é importante porque um modelo retreinado não herda o comportamento do modelo antigo da mesma forma que uma atualização — o prompting, a chamada de ferramentas e o estilo de saída podem mudar mesmo onde a capacidade não muda.

• Arquitetura — DeepSeek V4.1 Flash: nova estrutura de modelo, descrita pela DeepSeek como uma construção nova com entrada multimodal nativa. DeepSeek V4 Flash: o refresh pós-treinamento V4-Flash-0731 de um MoE de 284B total / 13B ativo.

• Entrada — O V4.1 Flash lida com entrada de texto e imagem nativamente no modelo base; o DeepSeek V4 Flash é somente texto, e imagens requerem a build complementar separada DeepSeek-V4-Flash-Vision-Exp.

• Contexto e saída — O DeepSeek V4 Flash publica 1M de contexto e 384K de saída máxima; os materiais de lançamento da DeepSeek dizem que o V4.1 Flash mantém a janela de contexto em escala de milhões de tokens, mas nenhuma ficha técnica formal foi publicada.

• Concorrência — o DeepSeek V4 Flash lista um teto de 2.500 conexões simultâneas; o beta do V4.1 Flash foi limitado a 20 e a alegação de "alta concorrência" do DeepSeek para a versão de lançamento ainda não era respaldada por um número publicado no momento da redação.

{{1}}Pesos{{/1}} — {{2}}DeepSeek V4 Flash tem pesos abertos sob licença MIT; nada foi anunciado para o V4.1 Flash.{{/2}}

Avaliação independente — O DeepSeek V4 Flash foi medido pela Artificial Analysis; o DeepSeek V4.1 Flash ainda não possui pontuação de terceiros.

O ponto sobre texto versus multimodal merece uma frase extra mesmo em uma comparação de texto, porque é ele que define para quem o V4.1 Flash é feito. Se o seu pipeline usava o DeepSeek V4 Flash para texto e o DeepSeek-V4-Flash-Vision-Exp para imagens, o V4.1 Flash é a primeira compilação do DeepSeek que cobre ambos os caminhos em um único modelo — um endpoint para manter, sem encoder acoplado à parte.

A two-column comparison scoreboard titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — the scoreboard': left column DeepSeek V4.1 Flash — Architecture New pre-trained structure, Context window 1M expected (not published), Speed (output) ~280-500 tok/s (community), Multimodal input Native text + image, Price (off-peak, per 1M) Flash list from Sep 10, Open weights Not announced; right column DeepSeek V4 Flash — Architecture V4-Flash-0731, 284B/13B MoE, Context window 1M in / 384K out, Speed (output) ~120-140 tok/s (AA-measured), Multimodal input Text only; Vision-Exp bolt-on, Price (off-peak, per 1M) Flash list from Sep 10, Open weights MIT-licensed; footer 'V4.1 Flash figures vendor- and community-reported; DeepSeek V4 Flash per Artificial Analysis and DeepSeek API docs.'

Onde eles realmente divergem: throughput e quanto custa uma tarefa concluída.

A preços equivalentes, os dois modelos se separam pela velocidade, e é na velocidade que os números ficam mais altos. A Artificial Analysis mede o DeepSeek V4 Flash 0731 em aproximadamente 120–140 tokens por segundo na própria API do DeepSeek, dependendo da configuração e da janela de medição. Testadores do primeiro dia do V4.1 Flash relataram geração sustentada entre cerca de 280 e 500 tokens por segundo, dependendo da tarefa, com picos acima de 500 em execuções de baixa concorrência; os números mais altos são medidos pela comunidade, não publicados pelo fornecedor, e tokens por segundo nunca é uma propriedade intrínseca de um modelo. Ainda assim, a direção é consistente em todos os relatos do primeiro dia, e a própria afirmação do DeepSeek de geração mais rápida e menor tempo total de conclusão aponta na mesma direção.

Essa diferença de velocidade muda a equação econômica mesmo com os dois modelos na mesma tabela de preços, porque você paga por token e os tokens chegam mais rápido. Um trabalho de recuperação de contexto longo ou geração de código que levava um minuto no V4 Flash pode terminar em uma fração do tempo no V4.1 Flash pelo mesmo preço por token — vários testadores do primeiro dia relataram velocidade de ponta a ponta cinco a seis vezes maior exatamente nessas classes de tarefas. As reclamações iniciais da versão beta de que "ele gasta dinheiro mais rápido" eram o outro lado da mesma moeda: com um preço por token inalterado, um modelo que emite tokens duas a três vezes mais rápido consome o saldo mais rapidamente por minuto. Se o custo por tarefa realmente cai depende de o novo modelo terminar com menos tokens e menos tentativas, o que é exatamente o que ninguém ainda pode provar.

Na própria tabela de preços, os dois modelos ficam lado a lado. Por milhão de tokens fora do horário de pico, na lista de 10 de setembro: ¥0,02 para entrada com cache hit, ¥1 para entrada com cache miss e ¥4 para saída; no pico, o dobro — a mesma lista que se aplicava ao nível Flash antes do corte era ¥0,05, ¥1,5 e ¥4,5. Para uma carga de trabalho com uso intenso de cache, o corte é o destaque: ¥0,02 contra ¥0,05 é uma redução de 60% nos tokens que compõem a maior parte de um fluxo de entrada de autocomplete ou loop de agente. Para um trabalho de ingestão de dados novos que não acerta o cache, a economia fica mais perto de um terço. Nada disso torna o V4.1 Flash mais barato por token do que o V4 Flash — eles compartilham a mesma tabela —, mas o maior throughput da arquitetura é o diferencial, e isso não custa nada extra.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the three public models — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak) and published concurrency limits.

Os recibos são para o V4 Flash; as reivindicações são para o V4.1 Flash.

O fato mais importante sobre benchmarks neste confronto, agora, é que não existe nenhum benchmark para o novo modelo. A alegação principal do DeepSeek V4.1 Flash — de que ele supera de forma abrangente o DeepSeek V4 Pro em capacidade, custo e velocidade — é relatada pelo fornecedor e não foi reproduzida. Nenhuma contagem de parâmetros, nenhuma tabela de avaliação e nenhum relatório técnico foram publicados, e a Artificial Analysis não o havia medido até a redação deste texto. Contra uma família de modelos cujo último lançamento principal atraiu escrutínio independente, "trust us, it beats the Pro" é uma afirmação que o leitor deve manter à distância até que um terceiro o avalie.

DeepSeek V4 Flash, em contraste, tem um rastro documental real. A Artificial Analysis conta a build de raciocínio 0731 entre os modelos líderes de sua classe, pontua-a bem acima da mediana para modelos de peso aberto comparáveis e mede seu throughput de saída na própria API da DeepSeek na faixa de ~120–140 tokens por segundo citada acima. Esses são os números contra os quais a V4.1 Flash será avaliada quando sua própria pontuação for divulgada, e eles estabelecem um padrão mais alto do que o rótulo "Flash rápido e barato" sugere. O modelo que a nova build está substituindo não é fraco; é um cavalo de batalha de peso aberto genuinamente forte. É isso que torna a decisão de atualização real, e não meramente cerimonial.

O roteamento está fazendo o trabalho pesado — dentro do DeepSeek, e para você.

A parte mais subnotificada deste lançamento é que a DeepSeek está roteando o tráfego entre seus próprios modelos. Seu anúncio é explícito: assim que o V4.1 Flash estiver ativo e até que o V4.1 Pro seja lançado, toda requisição de API direcionada a deepseek-v4-pro será atendida pelo DeepSeek V4.1 Flash e cobrada pelo preço da camada Flash. Quem usa o V4 Pro obtém a nova arquitetura e uma fração do custo por token sem mudar uma linha de código. Observe o que não é roteado: chamadas deepseek-v4-flash. O modelo Flash antigo continua atendendo quem ainda aponta para ele, e é exatamente por isso que esta comparação existe — se você está no V4 Pro, a troca acontece por você; se você está no V4 Flash, é uma decisão que você precisa tomar.

Um fornecedor decidir discretamente que um modelo mais barato deve atender às chamadas direcionadas ao seu modelo premium é um endosso impressionante do V4.1 Flash — e é também a mesma lógica que uma camada de roteamento aplica entre fornecedores. Essa é a lacuna que uma plataforma como a OrcaRouter preenche: uma API para mais de 200 modelos, com os preços de tabela dos provedores repassados com margem de 0%, de modo que o corte de preço da DeepSeek na Flash em 10 de setembro está ativo do nosso lado no mesmo dia. DeepSeek V4 Flash no OrcaRouter continua podendo ser chamado com a mesma chave de todos os outros modelos que você executa, o que torna genuinamente barata a maneira segura de adotar um modelo recém-lançado: direcione uma fatia do tráfego para o DeepSeek V4.1 Flash na API da própria DeepSeek, mantenha o DeepSeek V4 Flash como fallback automático na mesma regra de roteamento e deixe o failover lidar com os casos limite enquanto a nova arquitetura prova seu valor.

DeepSeek V4.1 Flash vs DeepSeek V4 Flash: qual você deve chamar?

Se a resposta honesta fosse apenas um modelo para todos, não haveria artigo. Os dois agora atendem a perfis de risco diferentes, e a divisão é excepcionalmente nítida.

A two-panel decision infographic titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — which should you call?': left panel 'Move to DeepSeek V4.1 Flash' with bullets Starting a new Flash workload today / Latency- or throughput-bound tasks / Needs native image input in one model / Comfortable with day-one risk; right panel 'Stay on DeepSeek V4 Flash' with bullets Serving production at high concurrency / Relies on open weights / self-hosting / Prompts and evals tuned to V4-Flash-0731 / Wants published limits and track record; footer 'No independent benchmark for V4.1 Flash yet — keep V4 Flash as the fallback.'

Mude para o DeepSeek V4.1 Flash se você estiver iniciando uma nova carga de trabalho Flash hoje, se latência e throughput forem a restrição limitante, se quiser entrada de imagem sem manter um segundo modelo, ou se estiver disposto a deixar o próprio roteamento do DeepSeek mitigar o risco da alegação Pro-tier. O modelo está na API de primeira parte do DeepSeek sob o nome deepseek-v4.1-flash, precificado no mesmo cartão Flash que o modelo que substitui, e todos os sinais do primeiro dia indicam que é substancialmente mais rápido.

Permaneça no DeepSeek V4 Flash se você estiver servindo tráfego de produção no teto publicado de 2.500 conexões simultâneas, se você depender dos seus pesos abertos para auto-hospedagem ou conformidade, ou se seus prompts, evals e lógica de chamada de ferramentas foram ajustados ao comportamento da versão 0731 e não conseguem absorver as idiossincrasias de um modelo re-treinado logo no primeiro dia. Uma nova rodada de pré-treinamento é uma mudança de comportamento, não apenas de velocidade, e a compilação 0731 é a versão com um mês de evidências.

Para a maioria das equipes, o padrão defensável é o caminho do meio: trate o DeepSeek V4.1 Flash como o padrão para novas cargas de trabalho, mantenha o DeepSeek V4 Flash como failover para a carga de trabalho que paga as contas e deixe que o primeiro scorecard independente — além de uma ficha de especificações publicada e um número de concorrência — resolva a discussão que nenhum beta de dois dias consegue resolver. A camada Flash acabou de ganhar um novo mecanismo; o antigo não está obsoleto, é o benchmark.

Curioso para ver como é o tráfego de classe Pro enquanto a DeepSeek o roteia para o V4.1 Flash a preços de Flash?DeepSeek V4 Pro no OrcaRouter — ambos em uma única chave, cobrados pelo preço de tabela da DeepSeek.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente