Cartão de título principal: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — mesmo fornecedor, gerações diferentes
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: mesmo fornecedor, gerações diferentes

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O interessante de colocar o DeepSeek V4.1 Flash contra o DeepSeek V4 Pro é que o modelo mais novo não é o maior. O DeepSeek V4 Pro é um modelo de mistura de especialistas de 1,6 trilhão de parâmetros, com 49 bilhões de parâmetros ativos, e continua sendo disponibilizado. O DeepSeek V4.1 Flash é um MoE de 552 bilhões de parâmetros, com 8 bilhões ativos na entrada e 16 bilhões ativos na saída, e é o modelo que a DeepSeek criou para substituí-lo. Ambos estão na tabela de preços do mesmo provedor, ambos aceitam um milhão de tokens de contexto e ambos são distribuídos sob a licença MIT. Escolher entre eles não é uma questão de tamanho. É uma questão de qual arquitetura você quer pagar, e a resposta mudou em 10 de setembro de 2026.

O que realmente difere, lado a lado

• Parâmetros — V4.1 Flash: 552B no total / 8B ativos na entrada e 16B na saída vs. V4 Pro: 1,6T no total / 49B ativos. O V4 Pro tem aproximadamente três vezes o número total de parâmetros e seis vezes a contagem de ativos no lado da entrada.

• Arquitetura — O V4.1 Flash é um Codificador-Decodificador Causal, uma nova arquitetura de base em comparação com o design anterior do V4 Pro. Esta é a diferença substancial entre os dois e a razão pela qual o ".1" não é um lançamento pontual.

• Preço por 1M de tokens — V4.1 Flash $0,15 de entrada / $0,60 de saída fora de pico vs. V4 Pro $0,66 de entrada / $1,98 de saída, nas listagens da OrcaRouter.

• Entrada em cache — V4.1 Flash $0,003 por 1M vs V4 Pro $0,024 por 1M.

• Cache KV por token — V4.1 Flash 890 bytes vs. a pegada maior do V4 Pro. Com um milhão de tokens de contexto, este é o item de linha que decide se uma transcrição longa de agente permanece residente.

• Contexto e saída — 1M de contexto e 384K de saída máxima em ambos. Nível.

• Latência observada até o primeiro token — V4.1 Flash 2,63 s p50 vs V4 Pro 3,58 s p50, na telemetria de 7 dias do OrcaRouter, com p95 de 10,00 s para o V4 Pro.

• Modalidades de entrada — o V4.1 Flash aceita texto e imagens, enquanto o V4 Pro aceita apenas texto na entrada e na saída, nas mesmas listagens. O modelo mais novo é o mais amplo dos dois em termos de entrada, além de ser o mais barato em custo.

Leia a lista sem o enquadramento do fornecedor e o padrão é incomum. O sucessor é mais barato em cada linha, mais rápido até o primeiro token, mais amplo na entrada e menor em cada linha. É assim que uma mudança genuína de arquitetura se parece quando se concretiza, e é por isso que "qual é melhor" tem uma resposta curta aqui e uma mais longa por baixo dela.

Two-column scoreboard: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — total parameters 552B vs 1.6T, active parameters 8B input and 16B output vs 49B, architecture Causal Encoder-Decoder vs an earlier design, price per 1M tokens $0.15 input and $0.60 output vs $0.66 and $1.98, max output 384K tokens vs 384K tokens, and release date 2026-09-10 vs still served and not retired

O cronograma do V4 Pro, porque é importante para qualquer pessoa que ainda o esteja executando.

O DeepSeek V4 Pro estava programado para ser descontinuado. A API seria desligada em 14 de setembro de 2026 às 12:00, horário de Pequim, com o tráfego redirecionado para o V4.1 Flash. Isso não aconteceu. Em 11 de setembro, o fornecedor reverteu a decisão, declarando que "Em resposta à demanda dos usuários, decidimos continuar oferecendo serviços de API para o DeepSeek V4 Pro após 14 de setembro de 2026, com o método de cobrança permanecendo inalterado."

Duas coisas decorrem disso, e vale a pena ser preciso quanto a ambas, porque a situação convida a interpretações excessivas.

O primeiro é que o V4 Pro não está descontinuado. É um modelo com suporte e preço inalterado, e é para ele que o próprio aviso da DeepSeek direciona o tráfego existente do V4 Pro. Se você tem um caminho de produção fixado nele, nada foi retirado.

A segunda é que o DeepSeek V4.1 Pro não existe. O aviso de descontinuação referia que o tráfego do V4 Pro estava a ser servido pelo V4.1 Flash "até ao lançamento do V4.1-Pro", o que deu origem a alguma especulação sobre um irmão maior. Em 22 de setembro de 2026, não existe API do V4.1 Pro, nem ficha de modelo, nem pesos, nem anúncio. Um relatório de 21 de setembro de 2026 sugeriu um modelo de 2 trilhões de parâmetros previsto para meados a finais de outubro, o que é uma alegação de fonte única sobre um produto não anunciado e deve ser tratada como tal. Quem planeia capacidade em torno do lançamento do V4.1 Pro está a planear com base num rumor.

Qual deles realmente ligar

O caso de migração é direto, e é o que a própria DeepSeek fez ao direcionar o tráfego do V4 Pro para o novo modelo. Pelos números acima, o V4.1 Flash é mais barato, mais rápido até o primeiro token e mais rápido em estado estacionário, com um cache KV menor por token. Se sua carga de trabalho for uma carga de trabalho do V4 Pro que não está fazendo algo que apenas 49B parâmetros ativos podem fazer, o modelo mais novo é o melhor instrumento em custo e latência, e não há trade-off a ponderar.

O argumento a favor de permanecer no V4 Pro tem a ver com o que um número muito maior de parâmetros ativos lhe proporciona em raciocínio difícil e trabalho agêntico de longo horizonte, e é um argumento que você tem de defender com suas próprias avaliações, e não com uma ficha técnica. A razão é que os dois modelos não são comparados num painel público comum de forma que os isole: o DeepSeek V4.1 Flash aparece no Agents on Rails sweep de 21 de setembro de 2026 com 17% em esforço máximo, enquanto o V4 Pro não está nesse painel. Não há um número de confronto direto a que se possa apontar. O que existe é um argumento plausível a partir da arquitetura — seis vezes o número de parâmetros ativos é muita capacidade para se deixar de lado — e é um argumento, não uma medição.

Duas notas práticas para quem estiver movendo tráfego entre eles. Primeiro, o cronograma de horário de pico se aplica a ambos os modelos, então uma comparação de custos feita na hora errada do dia estará errada por um fator de dois; o pico é das 01:00–04:00 e das 06:00–10:00 UTC em dias de semana, e os fins de semana são inteiramente fora de pico. Segundo, os dois modelos compartilham uma janela de contexto e um teto de saída, então uma migração não altera seu orçamento de prompt — o que torna a troca excepcionalmente de baixo risco no lado da aplicação.

Executando ambos através de um único endpoint

A situação em que se quer genuinamente ambos é o período de transição, e é mais comum do que parece: uma equipa que quer passar para o V4.1 Flash, mas tem um pipeline cujo comportamento na nova arquitetura ainda não foi verificado. Executar os dois lado a lado através de fornecedores separados significa dois contratos e dois conjuntos de chaves para aquilo que, ao nível do modelo, é um único fornecedor.

Ambos estão no OrcaRouter sob uma única chave, o que reduz isso a uma decisão de encaminhamento. O OrcaRouter repassa o preço de tabela do fornecedor com 0% de margem, pelo que os valores acima são as tarifas do próprio DeepSeek e não as nossas, e o horário de pico e fora de pico da DeepSeek aplica-se exatamente como a DeepSeek o define — incluindo uma alteração de preço a meio da transição, que fica ativa do nosso lado no próprio dia. Pode enviar uma fração do tráfego para o novo modelo e comparar os resultados, ou encaminhar por tipo de tarefa, e colocar failover automático por trás do novo caminho, para que, se o V4.1 Flash fizer algo inesperado com os seus dados, o pedido vá parar ao V4 Pro em vez de a uma página de erro.

Dado que o fornecedor já mudou de ideia uma vez sobre qual destes modelos será descontinuado, manter ambos acessíveis por meio de uma única integração é a opção que não exige que você preveja a próxima reversão.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model id with a flagship badge, 1M-token context, 384K max output, text input and text output, $0.66 input and $1.98 output per 1M tokens, a cache rate of $0.024, and observed time to first token of 3.58 s at p50 and 10.00 s at p95

O que assistir

• Se o preço do V4 Pro ou seu status de descontinuação voltar a mudar. A reversão de setembro deixou explícito que a cobrança permaneceria inalterada, e é esse o compromisso que se deve cobrar do fornecedor.

• Se o V4.1 Pro vai se tornar realidade. Enquanto não houver um cartão de modelo ou um lançamento de pesos, a história do parâmetro 2T é um rumor com uma única fonte.

• Uma avaliação independente que roda ambos os modelos na mesma bancada. Até que uma exista, a comparação honesta entre esses dois se dá em termos de custo, latência e arquitetura, que são mensuráveis, além de um palpite fundamentado sobre capacidade, que não é.

Até que chegue o terceiro desses, o resumo preciso é: o DeepSeek V4.1 Flash é o sucessor mais barato e mais rápido do DeepSeek V4 Pro; o V4 Pro ainda tem suporte, com preço inalterado; e a questão de saber se a arquitetura mais nova sacrifica capacidade é algo que nenhum benchmark público responde atualmente.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente