Cartão de título de destaque com o texto 'DeepSeek V4.1 Flash vs DeepSeek V4 Pro' e o subtítulo 'A transferência agendada, cancelada em 2026-09-11', dois cartões com os textos 'DeepSeek V4.1 Flash — AA Index 40, $0.15 / $0.60' e 'DeepSeek V4 Pro 0813 — AA Index 36, $0.66 / $1.98', e um rodapé com o texto 'AA Index conforme a Artificial Analysis; preços conforme a DeepSeek, fora de pico, por 1M de tokens.'
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: A transferência que a DeepSeek agendou e depois cancelou

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O DeepSeek V4.1 Flash foi lançado em 2026-09-10, e o DeepSeek V4 Pro já deveria ter sido desativado a esta altura. O plano, anunciado dois dias antes do lançamento do Flash e confirmado no dia do lançamento, era que, em 2026-09-14 às 12:00 no horário de Pequim, toda solicitação para deepseek-v4-pro seria silenciosamente redirecionada para o mais novo e mais barato deepseek-flash e seria cobrada com as tarifas do Flash. A DeepSeek cancelou isso em 2026-09-11 depois que desenvolvedores protestaram, e em 2026-09-14 o prazo passou com o V4 Pro ainda ativo e sua cobrança inalterada. Portanto, esta não é uma comparação de lançamento — o modelo à esquerda tem oito dias de idade e o modelo à direita é um carro-chefe de um ano, em seu quarto mês de disponibilidade geral. É uma comparação de dois modelos cujo fabricante publicou benchmarks dizendo que o barato venceu, depois descobriu que seus usuários discordavam e recuou. Essa sequência é a coisa mais útil que alguém publicou sobre qualquer um dos dois modelos neste mês, porque é exatamente a decisão que você está prestes a tomar.

O que realmente aconteceu, em ordem

A cronologia importa mais do que qualquer benchmark isolado aqui, porque a reversão é a história e o anúncio foi deliberadamente discreto.

2026-09-09 — A DeepSeek informa aos usuários que, antes da chegada do V4.1 Pro, as solicitações do V4 Pro serão encaminhadas para o V4.1 Flash e cobradas com as tarifas do Flash. A mensagem é que o Flash superou de forma abrangente o Pro em desempenho, custo, velocidade e tempo de conclusão de tarefas.

10/09/2026 — O DeepSeek V4.1 Flash entra em disponibilidade geral no aplicativo, na web e na API. Os pesos são publicados no Hugging Face sob a licença MIT. O nome do modelo na API passa a ser deepseek-flash. Os modelos da geração anterior deepseek-v4-flash e deepseek-v4-flash-vision-exp são descontinuados definitivamente, com seus IDs legados temporariamente redirecionados para o V4.1 Flash. O desligamento do Pro foi adiado para 14/09/2026, 12:00 horário de Pequim (04:00 UTC).

2026-09-11 — DeepSeek recua. Em resposta à demanda dos usuários, afirma que o serviço da API do V4 Pro continuará após 2026-09-14, com a cobrança inalterada, e a mudança automática para o V4.1 Flash está cancelada.

2026-09-14 — o prazo termina. O V4 Pro continua a ser servido a $0,66 / $1,98 por milhão de tokens fora de horas de pico.

A assimetria nessa sequência é o artigo inteiro. Usuários do Flash foram migrados, quisessem ou não — o antigo ID do V4 Flash agora responde com um modelo diferente. Usuários do Pro tiveram uma trégua, e o motivo não é que o V4 Pro tenha benchmarks melhores. É que sistemas de produção tinham sido ajustados para ele: prompts, scaffolds de agentes, harnesses de avaliação e pressupostos de reprodutibilidade que uma troca de backend invalida sem nenhuma mudança de código do lado de quem faz a chamada. A página de comparação da DeepSeek ainda lista os dois modelos hoje, lado a lado, o que mostra que a empresa pretende servir ambos.

Lado a lado: os dois SKUs

Tudo o que está abaixo é a especificação publicada pela própria DeepSeek, a menos que uma fonte seja citada. Os preços são por milhão de tokens, fora de pico, com a tarifa de pico entre parênteses — os horários de pico da DeepSeek são entre 01:00 e 04:00 e novamente entre 06:00 e 10:00 UTC, de segunda a sexta-feira, e todos os outros horários são fora de pico, à metade da tarifa de pico.

Nome do modelo da APIdeepseek-flash (DeepSeek-V4.1-Flash) versus deepseek-v4-pro (DeepSeek-V4-Pro-0813).

Entrada, falha de cache — $0,15 ($0,30) vs $0,66 ($1,32).

Entrada, acerto no cache — $0,003 ($0,006) vs $0,022 ($0,044).

Saída — $0.60 ($1.20) vs $1.98 ($3.96).

Contexto / saída máxima — 1M tokens / 384K em ambos. Idêntico.

Entrada de imagem — suportada nativamente no Flash; listada como não suportada no V4 Pro.

Limite de simultaneidade — 2.500 no Flash contra 500 no V4 Pro.

Parâmetros reportados — Flash: 552B no total, número do fornecedor, com uma contestação credível da comunidade (mais sobre isso abaixo). V4 Pro: 1,6T no total, ~49B ativos, que a Artificial Analysis também lista e a página de receitas do vLLM confirma.

Orçamento ativo por token — O Flash ativa cerca de 8B no prefill e 16B no decode por design, que é o ponto de sua arquitetura; o Pro ativa ~49B por token.

Licença — pesos abertos MIT em ambos.

Data de GA — Flash 2026-09-10; V4 Pro 0813 2026-08-13, após uma prévia de abril.

Two-column scoreboard comparing DeepSeek V4.1 Flash and DeepSeek V4 Pro 0813 across six dimensions: AA Intelligence Index 40 vs 36, input $0.15 vs $0.66 per 1M off-peak, output $0.60 vs $1.98 per 1M off-peak, output speed 214.4 vs 94.4 tokens/s, image input supported vs not supported, and concurrency limit 2,500 vs 500, with a footer reading 'AA Intelligence Index and output speed per Artificial Analysis; prices, image input and concurrency per DeepSeek, off-peak.'

A diferença de preço é todo o argumento.

A entrada é 4,4× mais cara no Pro. A saída é 3,3×. Os acertos de cache — o nível que domina uma longa execução de agente com um prompt de sistema estável — são 7,3×. Como o pico dobra em cada nível de ambos os lados, a proporção é idêntica no pico; a diferença não é um artefato de desconto.

Coloque uma carga de trabalho nele. Considere um agente de codificação que processa 10M de tokens de entrada por mês com uma taxa de acerto de cache de 70% e 2M de tokens de saída. No V4.1 Flash fora do horário de pico, isso dá US$ 0,45 de entrada nova, US$ 0,021 de entrada em cache e US$ 1,20 de saída: US$ 1,67. No V4 Pro fora do horário de pico, são US$ 1,98, US$ 0,154 e US$ 3,96: US$ 6,09. Cerca de 3,6×, em uma carga de trabalho deliberadamente comum.

Essa é a lista do próprio DeepSeek, e é o preço que você realmente paga aqui: a OrcaRouter repassa as tarifas de tabela dos provedores com 0% de margem, portanto uma mudança de preço da DeepSeek chega ao nosso lado no mesmo dia, em vez de ser reembalada. Os dois modelos ficam na mesma chave, o que importa para a seção mais abaixo — aquela sobre testar uma migração que você já não precisa fazer.

Screenshot of DeepSeek's official Models & Pricing page showing deepseek-flash and deepseek-v4-pro side by side: vision supported for Flash and 'Not supported' for V4 Pro; cache-hit input $0.003 vs $0.022 off-peak; cache-miss input $0.15 vs $0.66; output $0.60 vs $1.98; concurrency limit 2500 vs 500; and a footnote stating that in response to user demand DeepSeek will continue providing V4 Pro API services after September 14, 2026 with billing unchanged.

Onde o DeepSeek V4.1 Flash realmente vence

A evidência mais forte a favor do Flash não é a tabela de benchmarks da DeepSeek. É a Artificial Analysis, que é independente e lida diretamente de suas páginas de modelo.

Índice de Inteligência — Flash (Raciocínio, Esforço Máximo) pontua 40, classificado em #6 de 113 modelos. V4 Pro 0813 (Raciocínio, Esforço Máximo) pontua 36, classificado em #7. Mesmo índice, mesma configuração de esforço, quatro pontos de diferença, com o modelo mais barato à frente.

Velocidade de saída — 214,4 tokens/s contra 94,4 tokens/s. Isso é 2,3×, e é medido, não apenas alegado.

Tempo até o primeiro token — 1,21s contra 1,74s.

DeepSWE v1.1 — 74,2 para o Flash na tabela de classificação monitorada, primeiro lugar, à frente do GPT-6 Astra com 74,10, do Claude Opus 5 com 74,00 e do Gemini 3.8 Flash com 73,70. O 62,7 do V4 Pro 0813 no mesmo benchmark é o próprio número da DeepSeek. A margem no topo é de 0,2 pontos, o que é um empate, não uma vitória — mas uma diferença de 11,5 pontos em relação ao Pro não é um empate.

Eficiência de serviço — O decodificador do Flash deriva seu KV global do estado oculto final do codificador em vez de recalculá-lo a cada camada, e é isso que produz a ativação assimétrica de 8B no prefill / 16B no decode. O perfil InferenceX da SemiAnalysis situa o cache KV em cerca de 890 bytes por token — aproximadamente um quarto do V4 Flash —, com o armazenamento KV persistente reduzido a cerca de um oitavo. Essa é a razão pela qual o preço é o que é, e também é por isso que o modelo está disponível com 2.500 de concorrência, enquanto o Pro tem limite de 500.

Visão na API disponibilizada — não apenas nos pesos. A própria página de preços da DeepSeek lista a entrada de imagem como suportada para o Flash e não suportada para o V4 Pro, e a DeepSeek descreve-o como o seu primeiro flagship com compreensão multimodal nativa. Este é o primeiro flagship da DeepSeek em que ler uma captura de tela não exige um endpoint separado.

Todos os outros números de destaque que você verá citados — Terminal-Bench 2.1 em 90,6, GPQA Diamond em 90,9, Codeforces 3471 — são do próprio DeepSeek, não reproduzidos por nós, e devem ser lidos tendo isso em mente.

Onde o DeepSeek V4 Pro ainda é a escolha certa

Seria fácil descartar o V4 Pro depois de uma semana como essa. A descontinuação revertida diz o contrário, e a ficha técnica também.

A Pro carrega 1,6T de parâmetros totais e ativa ~49B por token, contra os 16B da Flash na decodificação. Independentemente do que o índice diga, a capacidade por token é um recurso real, e as cargas de trabalho em que isso se manifesta são as de horizonte longo: execuções de agente com várias horas, grandes refatorações, tarefas em que uma decisão errada no início custa toda a trajetória. Uma diferença de quatro pontos no índice mede a média de dez avaliações, não a cauda da sua distribuição.

O Pro também é a quantidade conhecida. Está disponível geralmente desde 2026-08-13, após uma prévia em abril, e a build 0813 obteve seu desempenho a partir do pós-treinamento, e não da arquitetura — mesma contagem de parâmetros, mesma forma da prévia, comportamento diferente. Isso representa quatro meses de ferramentas da comunidade, harnesses de agentes publicados, padrões de prompt e modos de falha. O Flash está em GA há oito dias, e o ecossistema ao seu redor é correspondentemente escasso. Se a confiabilidade da sua equipe vem de saber exatamente como um modelo falha, o Pro é onde esse conhecimento reside.

E o serviço não parou. O compromisso da DeepSeek é explícito e sua cobrança permanece inalterada, os pesos são MIT, e o V4 Pro ainda está em nosso catálogo pelo mesmo preço de tabela. A depreciação cancelada não é um adiamento da execução — é uma declaração de que a DeepSeek pretende continuar atendendo a esse nível.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro showing the model ID deepseek/deepseek-v4-pro, the description 'DeepSeek V4 Pro flagship MoE — 1.6T total / 49B active params, 1M context', 1M-token context and 384K max output, text-only input, $0.66 per 1M input tokens and $1.98 per 1M output tokens, and p50 TTFT of 5.79 seconds.

Três coisas para criticar em ambos os modelos

Salvaguardas, porque errar esta decisão custa caro.

A contagem de parâmetros é contestada. 552B é o número da DeepSeek. Uma análise confiável da comunidade defende que o checkpoint lançado tem 748B — o backbone transformer de 552B mais a tabela de memória condicional Engram de ~196B, que é uma estrutura de consulta acessada em dois pontos da rede, e não uma camada pela qual o sinal flui. O download publicado é de 510,3 GB distribuídos em 48 shards safetensors de pesos densos FP8 com especialistas roteados FP4. Ambos os números podem estar corretos ao mesmo tempo, dependendo de se você conta a recuperação separadamente da computação. Trate 552B como informado pelo fornecedor e verifique o espaço em disco antes de planejar uma implantação.

Uma pontuação de leaderboard é uma tela, não um contrato. O 74,2 do DeepSWE v1.1 é um benchmark de harness. Uma auditoria autopublicada pelo EyesTech Systems Lab afirma que essas pontuações da classe Flash desmoronam quando transferidas para repositórios multifile isolados do mundo real — colocando o DeepSeek V4.1 Flash em 31,4% no SWE-bench Pro contra 74,2% de manchete, uma queda maior que a dos modelos de fronteira em sua própria comparação. Essa auditoria não é independente — o autor vende uma ferramenta para detectar exatamente a exploração de harness que ele descreve — e não vimos nenhuma replicação dela. Ainda assim, é a postura correta: verifique em seus próprios repositórios antes de migrar.

A verbosidade é um item de custo. Artificial Analysis mediu o V4.1 Flash gerando 250M tokens de saída ao longo de sua execução no Intelligence Index, em comparação com uma mediana de 140M para modelos comparáveis de pesos abertos, e o classifica como muito verboso. A saída é o lado caro nesta tabela de preços, então um modelo que pensa em voz alta consome suas próprias economias. Em uma carga de trabalho com uso intenso de raciocínio, faça o orçamento pela contagem de tokens, não apenas pelo preço dos tokens.

Mais uma coisa, dita sem rodeios para que ninguém faça planos com base em um boato: DeepSeek V4.1 Pro não foi lançado. A migração cancelada foi apresentada como uma solução provisória "antes do lançamento do V4.1 Pro", e nada disso mudou.

Escolha o DeepSeek V4.1 Flash se

• Sua carga de trabalho é de alto volume, sensível à latência ou limitada por custo — classificação, extração, roteamento, sumarização, chat, a maioria da geração de código.

• Você precisa de entrada de imagem no mesmo endpoint que o texto. Este é o primeiro modelo principal da DeepSeek em que isso é uma única chamada, em vez de um segundo modelo.

• Seus prompts são armazenáveis em cache. Com 7,3× em acertos de cache, a diferença é maior exatamente onde o tráfego de agentes acontece, e um prompt de sistema estável constitui a maior parte da entrada de uma execução longa.

• Você está começando do zero esta semana e não tem nenhum harness ajustado às peculiaridades de um modelo específico. Não há nada a proteger.

• Você quer o teto de concorrência mais alto. 2.500 contra 500 é uma diferença de cinco vezes na quantidade que você consegue processar antes de começar a entrar em fila.

Escolha o DeepSeek V4 Pro se

• Você já tem produção ajustada contra isso. A reversão significa que você tem tempo — use-o para testar, em vez de evitar a pergunta.

• Suas tarefas são de longo horizonte e caras em caso de falha, e você mediu que ~49B parâmetros ativos por token lhe proporcionam algo que os 16B do Flash não proporcionam, nos seus dados, e não em um ranking.

• Você precisa de um comportamento previsível, somente de texto, sem nenhum caminho de visão para considerar, ou tem baselines de avaliação que uma troca de modelo invalidaria no meio do estudo.

• Seu padrão de acesso é de baixo volume e alto risco, em que 3,6× em uma conta pequena não é o termo decisivo.

Se você já construiu em cima do DeepSeek V4 Pro

A coisa útil que mudou em 2026-09-11 é que a sua migração deixou de ser um prazo e passou a ser uma decisão. Isso é estritamente melhor para você e estritamente pior para a sua caixa de entrada, porque a decisão ainda precisa ser tomada e agora ninguém a está tomando por você.

Comece pelo preço. A diferença de 3,3–4,4× é o número que você está deixando na mesa, e o exemplo prático acima transforma isso em um valor mensal em cerca de um minuto. Depois, teste da única forma que importa: espelhe uma fração do tráfego de produção para o Flash, mantenha o Pro no caminho principal e compare as saídas nas suas próprias tarefas. Como os dois modelos respondem na mesma chave ao preço de tabela do provedor, com failover automático, essa execução em espelho é uma mudança de roteamento, e não uma segunda integração, e o roteador pode devolver uma requisição ao Pro sem que você precise escrever o fallback. Equipes que queimam tokens em uma migração que não pediram são exatamente o motivo pelo qual a camada de roteamento existe.

Não presuma que o Flash seja uma substituição direta. É uma arquitetura diferente — um codificador–decodificador causal de 40 camadas com ativação assimétrica — e é mais verboso no raciocínio. O comportamento no nível do prompt não será transferido de forma limpa em nenhuma das direções, então meça a migração pelas saídas, não pelo índice.

O que assistir

Três coisas determinam como esta combinação estará daqui a um mês. Primeiro, se o V4.1 Pro será lançado e restaurará um nível Pro de verdade — toda a migração cancelada era explicitamente uma solução temporária para ele, então o roadmap da DeepSeek ainda tem uma lacuna em forma de carro-chefe. Segundo, se a trégua sobrevive ao próximo movimento de preços da DeepSeek; uma empresa disposta a programar um redirecionamento silencioso uma vez aprendeu que não pode, não que não deveria. Terceiro, se alguém fora da DeepSeek reproduz os números de benchmark do Flash em repositórios não modificados, que é o único resultado que resolveria a discussão entre eficiência e capacidade da qual toda esta comparação depende. Até lá, a posição honesta é a que a própria reversão implica: o Flash é a melhor opção padrão para qualquer coisa nova, o Pro é a melhor aposta para qualquer coisa já construída, e a DeepSeek acabou de lhe dizer que atenderá às duas enquanto você descobre qual delas você é.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente