
DeepSeek V4.1 Flash Lança Beta de API de Dois Dias: Nova Arquitetura, Multimodal Nativo e Ambição de Nível Pro
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1541Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligência49Código
O DeepSeek V4.1 Flash apareceu exatamente onde a DeepSeek testa as coisas antes de anunciá-las: dentro da API em produção, sob um ID de modelo que carrega a própria data de validade. O ID — deepseek-v4.1-flash-expires-on-0910 — entrou em operação em 8 de setembro de 2026, depois que a equipe da DeepSeek publicou um teste interno de "versão intermediária" nos grupos oficiais da comunidade, e esse 0910 no final é a história em miniatura. É uma build inserida no ambiente real da API para um teste limitado, programada para sair do ar por volta de 10 de setembro, antes do post de lançamento oficial que, na expectativa dos informantes que sinalizaram o modelo, deve sair "muito em breve". Não é um lançamento. Não há model card, nem relatório técnico, nem entrada no changelog e, até esta noite, a página pública Models & Pricing da DeepSeek ainda lista apenas DeepSeek V4 Flash, DeepSeek V4 Pro e DeepSeek-V4-Flash-Vision-Exp.
Tudo o que segue abaixo deve ser lido tendo esse asterisco em mente. O canal oficial aqui é um anúncio de grupo comunitário e um formulário de feedback que o acompanha, não uma nota de versão. O que segue é a união desse anúncio, a cobertura da mídia chinesa dentro de horas após a sua publicação, e as medições de primeiro dia feitas por desenvolvedores que apontaram suas próprias chaves para o endpoint — com as alegações do fornecedor e os números da comunidade identificados como aquilo que são.
O que realmente aconteceu hoje
Por volta das 15h00 do dia 8 de setembro, no horário de Pequim, a equipe da DeepSeek informou aos seus grupos comunitários oficiais que uma versão intermediária — descrita em chinês como 中间版本, um checkpoint intermediário — estava sendo aberta para testes limitados no ambiente real da API antes do lançamento de uma versão final. Qualquer pessoa com uma chave de API da DeepSeek pode chamá-la: mantenha sua URL base e chave existentes e defina o nome do modelo como deepseek-v4.1-flash-expires-on-0910. Essa é toda a história do acesso — não há endpoint separado, nem lista de espera, nem novo console.
O envelope prático é apertado. O sufixo codifica o plano: a versão de teste "expirará automaticamente e ficará offline em 10 de setembro", deixando aproximadamente dois dias de atividade. Cada conta está limitada a 20 solicitações simultâneas — contra o limite de 2.500 de concorrência que a DeepSeek publica para deepseek-v4-flash — o que é um forte indício sobre a intenção: isso é para testes funcionais e avaliação, não para direcionar tráfego de produção.
• O que é — um checkpoint de "versão intermediária" colocado na API em produção para testes de curto prazo antes de um build oficial.
• Onde é executado — a própria API da DeepSeek; URL base e chave inalteradas, nome do modelo trocado para deepseek-v4.1-flash-expires-on-0910.
• Quanto tempo — o nome diz expires-on-0910; espera-se que o teste saia do ar por volta de 10 de setembro.
• Quem pode chamá-lo — qualquer conta com uma chave DeepSeek, com 20 solicitações simultâneas por conta.

O que o beta cobra: a tabela de preços do DeepSeek V4 Flash
DeepSeek disse que o teste é cobrado pelas mesmas tarifas do deepseek-v4-flash, e que a tabela de preços atual desse modelo é a que se aplica. Desde o reajuste de 16 de agosto de 2026, a DeepSeek adota preços de pico/fora de pico; os valores exatos são os oficiais para o nível Flash:
• Entrada, cache hit — $0,007 por 1M de tokens fora de pico, $0,014 no pico
• Entrada, cache miss — US$ 0,22 por 1M de tokens fora do pico, US$ 0,44 no pico
Saída — US$ 0,66 por 1M de tokens fora do horário de pico, US$ 1,32 no horário de pico
• Horários de pico — 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta-feira; todos os demais horários são de menor demanda, com metade da tarifa de pico.

Observe o que não mudou: o preço por token. A alegação da DeepSeek de que o V4.1 Flash é de "menor custo" é, portanto, uma alegação de eficiência, não um corte de preço — um ponto que vários testadores de primeiro dia descobriram do jeito caro, ao ver uma sessão de cinco minutos consumir visivelmente mais do seu saldo do que o mesmo tempo real no DeepSeek V4 Flash, porque o modelo gasta tokens muito mais rápido. Se o custo por tarefa realmente cai depende de ele concluir o trabalho com menos tokens e menos tentativas, algo que ninguém pode avaliar com dois dias de testes de velocidade.
O que "nova arquitetura, multimodal nativo" significa — até agora, não verificado
A descrição oficial da DeepSeek sobre o V4.1 Flash se resume a quatro afirmações: nova estrutura de modelo, suporte multimodal nativo, capacidade mais forte e geração mais rápida. A afirmação sobre a arquitetura é a que se destaca, pois quebra um padrão. A atualização anterior, DeepSeek V4 Flash 0731, foi uma atualização de pós-treinamento que manteve a mesma arquitetura e escala do seu preview; a formulação da DeepSeek aqui aponta para uma mudança estrutural, e vários veículos interpretaram isso como um sinal de que o modelo passou por um novo pré-treinamento, em vez de apenas um ajuste fino. Além disso, tudo é inferência. A especulação da comunidade sobre mecanismos de atenção alterados, redes de especialistas ou um módulo de visão integrado é exatamente isso — especulação. Nenhuma contagem de parâmetros, nenhum valor de janela de contexto, nenhuma tabela de benchmarks e nenhum relatório técnico foi publicado.
A expressão "native multimodal" importa por um motivo específico. O DeepSeek-V4-Flash-Vision-Exp, lançado em 21 de agosto e com pesos abertos desde 31 de agosto, acoplou um codificador de visão à base de texto do DeepSeek V4 Flash — os materiais da própria DeepSeek descreviam o par como um modelo de texto mais um caminho de visão externo. O V4.1 Flash, por sua vez, é descrito como multimodal desde a base, com as entradas de imagem e texto processadas pelo próprio modelo base. Em princípio, essa é uma diferença arquitetural real, mas a especificação das modalidades não foi publicada: o que os testadores exercitaram foi texto mais imagens, e o leitor deve tratar "multimodal" como confirmado apenas nesse sentido de texto e imagem, até que um model card apareça. Se um conjunto mais amplo de entradas faz parte do plano é, até o momento em que escrevo, algo desconhecido, e não confirmado.
A velocidade é o destaque — e é uma medição comunitária.
O número que circula no primeiro dia é de aproximadamente 420 tokens de saída por segundo em gerações longas, com picos relatados acima de 500 tokens/s em execuções individuais. Um teste amplamente compartilhado gerou mais de 71.000 tokens em menos de três minutos. Nada disso é oficial: são medições de desenvolvedores contra o endpoint beta, sob condições não controladas, e a DeepSeek não publicou nenhum benchmark de velocidade próprio. Para efeito de comparação, a Artificial Analysis mede o endpoint público DeepSeek V4 Flash 0731 em aproximadamente 128 tokens/s, portanto os primeiros relatos apontam para um salto de throughput bruto na ordem de três vezes ou mais — com a ressalva usual de que o throughput depende do comprimento da entrada, da concorrência e das condições do servidor.
As comparações de ponta a ponta contra o DeepSeek-V4-Flash-Vision-Exp são onde a lacuna parece mais ampla, porque medem a mesma tarefa consecutivamente. Os testadores relataram aproximadamente 6× mais rápido de ponta a ponta em uma tarefa de geração de código SVG, cerca de 5,2× em uma recuperação de contexto longo de 49 mil tokens, por volta de 5× em uma tarefa de grande porte de geração e otimização de SQL, 4,6× em um problema algorítmico e 3,9× em uma tarefa de refatoração assíncrona. Trate esses números como indicativos, não precisos: números de ponta a ponta da mesma tarefa incluem o tempo de raciocínio, a latência do primeiro token e a velocidade de geração, e vêm de testadores individuais em vez de uma suíte controlada. A direção consistente em todos eles é o sinal interessante, não qualquer multiplicador individual.
A questão no cerne do beta
O detalhe mais estratégico está escondido no formulário de feedback que a DeepSeek anexou ao teste. Além de perguntas sobre frameworks de agentes e cenários do mundo real, ele pergunta diretamente aos testadores se a versão intermediária DeepSeek V4.1 Flash "pode substituir totalmente o DeepSeek V4 Pro online". É uma pergunta notável para uma empresa colocar diante dos usuários, porque o DeepSeek V4 Pro está três patamares de preço acima do Flash: às tarifas oficiais atuais, o modelo Pro cobra US$ 0,66 por 1M de tokens de entrada (cache miss) e US$ 1,98 por 1M de tokens de saída fora do horário de pico, contra US$ 0,22 e US$ 0,66 do DeepSeek V4 Flash — um 3× limpo em cada linha. Se um modelo da camada Flash realmente se aproxima da capacidade do nível Pro a preços de Flash, a pergunta se responde sozinha para uma grande parcela de usuários, e a DeepSeek sabe disso.
Lido em conjunto com a expressão “nova estrutura”, o questionário sugere que o V4.1 Flash é o primeiro passo visível de algo maior do que uma atualização pontual — uma linha Flash reposicionada para reduzir a distância até o carro-chefe, da mesma forma que a DeepSeek repetidamente usou um modelo mais barato e mais rápido para redefinir as expectativas do mercado sobre o que uma faixa de preço oferece. Nada disso é confirmado por um benchmark; é uma leitura estratégica de uma pergunta de duas frases. Mas é a coisa mais interessante que a DeepSeek disse sobre o V4.1 Flash o dia todo.
Onde experimentar e o que executar em produção enquanto isso.
Durante a janela de teste, o único lugar para acessar o V4.1 Flash é a própria API da DeepSeek — não há hospedagem de terceiros para uma build que expira em dois dias, e ninguém deve conectar um caminho de produção a um ID de modelo que está programado para parar de responder. O uso sensato dos próximos dois dias é a avaliação: execute suas cargas de trabalho representativas, meça a qualidade e a economia real de tokens, e trate todo número de velocidade que você vir como anedótico até que um lançamento formal apareça com um model card.
Para o tráfego que precisa continuar funcionando, a linha pública do DeepSeek permanece inalterada, e é aí que uma camada de roteamento mostra seu valor. No OrcaRouter, o DeepSeek V4 Flash, o DeepSeek V4 Pro e o DeepSeek-V4-Flash-Vision-Exp são todos acessíveis por meio de uma única API pelo preço de tabela do DeepSeek repassado sem nenhuma margem — portanto, o corte de preço de agosto está ativo do nosso lado desde o dia em que foi lançado, não quando uma planilha de margens finalmente se deu ao trabalho. Quando um V4.1 Flash oficial eventualmente chegar aos provedores, a mesma configuração é o caminho de baixo custo de migração para adotá-lo: envie uma parte do tráfego para o novo modelo, mantenha o DeepSeek V4 Flash ou o V4 Pro como failover automático e deixe o DSL do roteador decidir quais chamadas merecem o modelo não comprovado e quais devem permanecer no cavalo de batalha. Você não precisa apostar um caminho de produção em uma beta de dois dias para descobrir se ela é boa.

Perguntas em aberto
• Quando sai o lançamento oficial? O sinal que marcou este modelo diz que uma publicação de lançamento é esperada "muito em breve"; a vida útil de dois dias da versão beta sugere que a DeepSeek não pretende deixar o mundo esperando por muito tempo.
• A compilação final corresponde a esta? Testadores independentes que acompanham os ciclos de testes da DeepSeek observam que a empresa parece estar executando várias compilações candidatas em paralelo, e o candidato mais rápido em um teste inicial nem sempre é o que é lançado — portanto, os números de velocidade de hoje podem não descrever o modelo GA.
• Quais são as especificações? Contagem de parâmetros, detalhes da arquitetura, comprimento do contexto e a lista completa de modalidades de entrada não são divulgados, e todos são as primeiras coisas que uma avaliação real precisa.
• O preço se mantém, e o "menor custo" sobrevive ao contato com cargas de trabalho reais? O beta cobra nas tarifas do DeepSeek V4 Flash; um lançamento pode trazer uma nova tabela de preços, e o custo por tarefa não é medido.
Será que ele realmente consegue cumprir as funções de um Pro? O questionário faz a pergunta, mas somente avaliações independentes em suítes agênticas e de raciocínio — os benchmarks que separam hoje o nível Flash do nível Pro — podem respondê-la.
Se você tem uma chave DeepSeek, o prazo de dois dias é a questão central: chame deepseek-v4.1-flash-expires-on-0910 antes que ele desapareça, execute suas próprias cargas de trabalho e registre os números sob a rubrica “medidos pela comunidade, condições variam”. Para todos os outros, o que acompanhar é o post de lançamento e a pergunta por trás dele — se o nível mais barato do DeepSeek acabou de começar a mirar no seu mais caro.
Enquanto a versão beta de dois dias se estabiliza, o modelo Flash estável que você pode rodar hoje está a apenas uma chamada de API: DeepSeek V4 Flash no OrcaRouter — ao preço de tabela da DeepSeek, repassado com 0% de markup.
E o carro-chefe que o questionário beta continua pedindo aos testadores para compararem com o V4.1 Flash:DeepSeek V4 Pro no OrcaRouter.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
