
DeepSeek V4.1 Flash: Um Modelo Base Totalmente Novo com Número de Release Pontual
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligência49Código
O DeepSeek V4.1 Flash foi lançado em 10 de setembro de 2026: pesos abertos sob licença MIT, contexto de um milhão de tokens, uma arquitetura Causal Encoder-Decoder inédita e uma espinha dorsal de mistura de especialistas com 552 bilhões de parâmetros, que o próprio cartão de modelo da DeepSeek categoriza sob o que a empresa chama de sua "nova família de arquiteturas". É também, se o rastreador que sinalizou a nomenclatura estiver certo, a primeira vez que a DeepSeek atribuiu um número de versão .1 a um modelo base completamente novo — um rótulo que normalmente indica um ajuste, não uma reconstrução. O DeepSeek V4.1 Pro, o carro-chefe que esse número agora implica, ainda não existe.
Essa incompatibilidade vale mais do que uma mera discussão de nomenclatura. Quem comparar as gerações do DeepSeek pelo número da versão lerá "V4 Flash para V4.1 Flash" como um simples patch e dosará a atenção de acordo. A arquitetura subjacente diz o contrário, e a decisão da própria empresa de aposentar um carro-chefe de 1,6 trilhão de parâmetros em favor de um modelo Flash diz o contrário ainda mais alto.

O que realmente foi lançado em 10 de setembro
Este não é um vazamento nem uma versão beta. O teste de API de dois dias que começou em 8 de setembro com o ID de modelo deepseek-v4.1-flash-expires-on-0910 terminou como seu sufixo indicava, e o lançamento real chegou hoje ao aplicativo web da DeepSeek, ao aplicativo móvel e à API própria, com pesos e um relatório técnico publicados no Hugging Face sob deepseek-ai/DeepSeek-V4.1-Flash.
Os detalhes práticos importam mais do que a cerimônia:
• Nome do modelo — use deepseek-flash. Os nomes legados deepseek-v4-flash e deepseek-v4-flash-vision-exp ainda são aceitos, mas não correspondem mais aos modelos de antes: ambos foram descontinuados, e as solicitações que os mencionam são atendidas pelo DeepSeek V4.1 Flash e cobradas pela tarifa Flash.
• O que vem na caixa — parâmetros de backbone de 552B, janela de contexto de 1M tokens, saída máxima de 384K, saída JSON, chamada de funções e um modo de pensamento ativado por padrão com configurações de esforço baixo, alto e máximo.
• Licença — MIT, pesos incluídos, com uma pasta de inferência e um módulo de codificação separado no repositório. A DeepSeek está explicitamente convidando a comunidade de código aberto a construir suporte de inferência, o que é o sinal padrão de que o serviço no dia zero nos principais runtimes é uma questão de dias, não de semanas.
O .1 que não é um point release
A afirmação que deu início a este artigo veio de teortaxesTex, um observador pseudônimo, mas muito seguido, da DeepSeek, em uma postagem de 10 de setembro: de que esta é "a primeira vez que a DeepSeek rotula um modelo base completamente novo com uma versão de lançamento .1", de que o V4.1 é "mais diferente do V4 do que, digamos, o LLaMA 3 é do LLaMA 1", e de que a DeepSeek "ainda não acha que isso valha um V5" — sem que o autor da postagem pudesse dizer por que não.
Trate a parte causal como inferência e a parte estrutural como verificável. A inferência — por que a DeepSeek escolheu .1 em vez de V5 — é a leitura de um observador e nada mais; ninguém fora da empresa explicou a decisão, e os próprios materiais da DeepSeek nunca a abordam. A parte verificável é a arquitetura, e ela não parece uma atualização pontual. O changelog da DeepSeek descreve o V4.1 Flash como "o menor modelo da nossa nova família de arquiteturas", o que é uma frase estranha para se escrever sobre um incremento de versão: um incremento de versão estende uma família, não a funda.
Há um custo real para a ambiguidade, e ele recai sobre os compradores, não sobre a DeepSeek. Os números de versão são o sinal mais barato que um desenvolvedor tem para saber "isto é uma nova geração ou um ajuste, e quanto do meu orçamento de avaliação isso merece?" A DeepSeek agora tornou esse sinal não confiável em uma direção — um modelo que funda uma família de arquiteturas fica a uma casa decimal de distância de um que mudou sua receita de pós-treinamento. A empresa pode manter a designação V5 na reserva. Todos os que fazem uma avaliação de migração pagam pela confusão.
O que "nova arquitetura" significa nos pesos
O cartão do modelo é invulgarmente específico, o que torna a afirmação geracional fácil de testar sem um único benchmark. Quatro coisas se destacam.

• {{1}}Ativação assimétrica{{/1}} — a divisão {{2}}Causal Encoder-Decoder{{/2}} é um {{3}}transformer de 40 camadas{{/3}} organizado como um {{4}}codificador causal de 20 camadas{{/4}} seguido por um {{5}}decodificador de 20 camadas{{/5}}, onde o {{6}}cache KV global{{/6}} do decodificador é {{7}}projetado a partir dos estados ocultos finais do codificador{{/7}} em vez de {{8}}derivado do próprio cache de cada camada do decodificador{{/8}}. O objetivo desse design é que o modelo ativa apenas {{9}}8B de parâmetros por token durante o prefill{{/9}} e {{10}}16B durante a decodificação{{/10}}. {{11}}Cargas de trabalho de agente intensivas em entrada{{/11}} — {{12}}documentos longos, rastros longos de ferramentas{{/12}} — ficam com {{13}}a metade barata do modelo{{/13}}; a geração fica com {{14}}a metade cara{{/14}}.
• Compressão de cache KV, medida por token — o DeepSeek-V4.1-Flash executa o cache KV principal em FP4 a 890 bytes por token, o que a ficha técnica coloca em aproximadamente um quarto do DeepSeek V4 Flash. A cobertura chinesa foi além e enquadrou a compressão em relação ao modelo V4 de primeira geração como uma redução de 437×; esse número maior é uma aritmética proveniente do fornecedor com base em uma linha de base diferente, portanto trate-o como uma afirmação, e não como uma medição.
• SWA Bounded Replay — a atenção de janela deslizante normalmente força você a persistir o estado KV em SSD para reconstruir o contexto. Em vez disso, este método reconstrói os estados KV de SWA ausentes reproduzindo apenas a janela mais recente de tokens, reduzindo a pegada KV persistente para cerca de um oitavo da do DeepSeek V4 Flash.
• Compressed Sparse Attention 2 — cada camada de atenção opera em um de três modos estáticos (Full, Reindex ou Reuse), compartilhando o estado de KV e do indexador entre as camadas, com um indexador esparso hierárquico que limita o custo das camadas mais profundas independentemente do comprimento do contexto.
Lendo esses quatro juntos, o quadro estratégico fica legível: esta é uma arquitetura de esparsidade e eficiência de cache antes de tudo, dimensionada para que a mesma estrutura possa ser escalada posteriormente. A menção a uma "nova família de arquiteturas" está fazendo um trabalho real — é uma declaração de que há mais por vir.
Os benchmarks: informados pelo fornecedor e ainda não contestados.
DeepSeek publicou um conjunto de benchmarks com o lançamento. Nos números da própria empresa, V4.1 Flash pontua GPQA Diamond 90.9, um rating Codeforces de 3471, MathArena Apex 65.6, Terminal-Bench 2.1 a 90.6, DeepSWE v1.1 a 74.2, e 63.9 em HLE com ferramentas — o último carregando uma nota de rodapé restringindo o valor base de 36.8 ao subconjunto somente texto desse benchmark.
Rotule-os pelo que são. São números relatados pelo fornecedor, publicados sem uma avaliação independente que os acompanhe, e são os números que a DeepSeek usou para justificar a aposentadoria de seu próprio carro-chefe — o que faz deles os números que mais valem a pena verificar. Na data do lançamento em 10 de setembro, a Artificial Analysis ainda não havia publicado uma medição do DeepSeek V4.1 Flash, e a própria página do modelo no Hugging Face ainda trazia a nota de que o modelo "não é implantado por nenhum provedor de inferência". A afirmação central deste lançamento — de que um modelo de nível Flash supera de forma abrangente um carro-chefe de 1,6 trilhão de parâmetros em desempenho, custo, velocidade e tempo total de processamento — é, no momento, uma alegação do fornecedor sem auditoria externa.
Há uma ressalva honesta do outro lado também. O mesmo relatório do fornecedor mostra o V4.1 Flash vencendo 13 de 16 comparações contra o Kimi K3 e 11 de 13 contra o GLM-5.3, enquanto ainda fica atrás do GPT-5.6 Sol e do Claude Opus 5 nas tarefas mais recentes do Terminal-Bench 3.0 e 4.0 e no ProgramBench. Essa é uma forma coerente — mais forte no trabalho de codificação, terminal e automação de agentes para o qual esta arquitetura é otimizada, mais fraca em tarefas de raciocínio de fronteira — e é a forma que um passo geracional real teria.
O preço e o switch de roteamento que vale a pena agendar.
A nova precificação entrou em vigor com o lançamento, e é a mesma tabela de preços do Flash de antes, em vez de um corte: emdeepseek-flash, a entrada com cache hit custa US$ 0,003 por milhão de tokens fora do horário de pico e US$ 0,006 no horário de pico; a entrada com cache miss, US$ 0,15 e US$ 0,30; e a saída, US$ 0,60 e US$ 1,20. O horário de pico custa exatamente o dobro do fora de pico e se aplica das 01:00 às 04:00 e das 06:00 às 10:00 UTC em dias úteis.
O corte recai, em vez disso, sobre o tráfego Pro. O DeepSeek V4 Pro tem preço de US$ 0,022 e US$ 0,044 para entrada com cache hit, US$ 0,66 e US$ 1,32 para entrada com cache miss e US$ 1,98 e US$ 3,96 para saída — então rotear solicitações com nome Pro para o V4.1 Flash reduz o custo de saída delas em cerca de 70% enquanto, segundo a DeepSeek, eleva a capacidade que as responde.

Esse redirecionamento está agendado, não é hipotético. Após as 12:00, horário de Pequim, em 14 de setembro de 2026, solicitações que especificam o nome deepseek-v4-pro vão para a V4.1 Flash e são cobradas pelo preço da Flash, e permanecem assim até o lançamento do DeepSeek V4.1 Pro. Se a sua integração tem o nome do modelo Pro codificado, nada quebra — você recebe um modelo diferente por cerca de um terço do preço de saída, sem alteração de código e sem aviso além de uma entrada no changelog. Se você faz o roteamento por nível de capacidade em vez de pelo nome do modelo, 14 de setembro é a data para testar novamente.
O que isso significa se você ligar para a DeepSeek hoje
OrcaRouter ainda não oferece o DeepSeek V4.1 Flash — até hoje, a página do modelo deepseek-v4.1-flash retorna "model not found", e preferimos dizer isso claramente do que dar a entender o contrário. Daí decorrem duas coisas. Primeiro, o redirecionamento anunciado pela DeepSeek é um comportamento de API de primeira parte, portanto a mudança de 14 de setembro ocorre no endpoint da própria DeepSeek, independentemente de como você o acessa. Segundo, se você quiser a nova arquitetura hoje, você está chamando o fornecedor diretamente.
O que fazemos é rotear o restante da linha DeepSeek em uma única chave: DeepSeek V4 Flash e DeepSeek V4 Pro, juntamente com mais de 200 outros modelos. Os preços lá são os preços de lista do fornecedor DeepSeek repassados com margem de 0%, o que é o que importa para um lançamento como este — quando um fornecedor corta um preço, o corte entra em vigor no nosso lado no mesmo dia, em vez de após um ciclo de reajuste. E quando o V4.1 Flash chegar ao catálogo, a meia tarifa fora de pico acima é a tarifa, não um desconto que negociamos.
O argumento de roteamento para um modelo tão novo não é realmente sobre preço. É sobre quanto do seu caminho de produção você aposta em uma arquitetura de primeira semana sem benchmark independente e sem serviço de terceiros. Manter o novo modelo atrás de um nível que você possa trocar — ou testá-lo em uma chave que não seja a sua chave de produção — é a diferença entre uma avaliação e um incidente.
O que resolveria a questão da nomenclatura?
Três coisas, em ordem crescente de quanto elas te diriam.
Uma avaliação independente do DeepSeek V4.1 Flash testaria a alegação sobre a arquitetura em uma estrutura de testes de terceiros. Essa é a única medição que transforma uma tabela do fornecedor em um fato, e é a notícia mais provável de surgir em seguida.
DeepSeek V4.1 Pro testaria a alegação da família. O aviso de roteamento o nomeou como o ponto final da janela Pro-to-Flash, o que faz dele o modelo em torno do qual toda esta versão é estruturada — e continua sendo o que a DeepSeek menos confirmou: sem cartão, sem contagem de parâmetros, sem data, sem pesos, sem preço.
E a útil, ainda que pouco glamorosa: se a DeepSeek fará isso novamente. Um segundo rótulo .1 em outro novo modelo base transformaria uma anomalia em uma convenção, e uma convenção é algo com que um desenvolvedor pode contar. Um modelo é uma curiosidade. A nomenclatura só se torna enganosa de maneira útil quando há um padrão.
Por enquanto, a leitura prática se divide claramente por quem você é. Se você está no DeepSeek V4 Pro, marque 14 de setembro no calendário e refaça suas avaliações antes disso, porque o modelo por trás desse nome está mudando, quer você peça ou não. Se você está no DeepSeek V4 Flash, você já está sendo migrado, pelo mesmo preço, para uma arquitetura que a DeepSeek construiu para escalar. E se você estava esperando pelo V5, a resposta honesta é que a DeepSeek aparentemente lançou a geração e se recusou a nomeá-la — o que é o tipo de coisa que só se pode fazer uma vez antes que as pessoas parem de confiar no número.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
