
Lançamento Oficial do DeepSeek V4 Flash: O Modelo Barato, Rápido e Agêntico com Contexto de 1M, Explicado
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
DeepSeek V4 Flash é a metade barata da linha V4 da DeepSeek, e os resultados independentes finalmente o alcançaram: no conjunto AIME 2026 do MathArena, ele pontua 95,83%, estatisticamente indistinguível dos 96,67% do DeepSeek V4 Pro, com cerca de um nono do custo por problema. A build oficial de beta público, -0731, foi lançada em 31 de julho de 2026 com a mesma arquitetura da prévia de abril — um modelo de mistura de especialistas com 284 bilhões de parâmetros, 13B ativos e contexto de 1 milhão de tokens — mas com uma rodada extra de pós-treinamento que melhorou drasticamente sua capacidade agêntica, de codificação e de chamada de ferramentas, além de suporte nativo à API Responses e adaptações específicas para agentes no estilo Codex. Este guia cobre o que o lançamento realmente mudou, o que dizem as avaliações do fornecedor e as independentes, quanto custa levando em conta o quanto ele pensa e como chamá-lo.
Nota de precisão: os detalhes do lançamento e as pontuações agentivas principais abaixo vêm do changelog oficial da API da DeepSeek (datado de 2026-07-31) e são relatados pelo fornecedor, executados na própria plataforma de testes da DeepSeek — trate-os como indicativos e execute suas próprias avaliações. Números independentes são atribuídos onde aparecem: Artificial Analysis para o Índice de Inteligência e seus componentes, MathArena para AIME 2026, a própria lista de preços da DeepSeek para preços. Onde algo se baseia no relato de um único profissional em vez de uma avaliação publicada, a frase assim o diz. Especificações e preços mudam; verifique antes de construir.
TL;DR. O V4 Flash é o irmão econômico do gigante DeepSeek V4 Pro: um MoE de 284B com 13B ativos, com contexto de 1M de tokens e até 384K de saída, otimizado para trabalho agêntico de alto volume e baixa latência. O lançamento oficial de 31 de julho é um upgrade pós-treinamento — mesmo tamanho, agentes e codificação materialmente melhores — que também adiciona suporte nativo à Responses-API e ao Codex. A DeepSeek relata pontuações fortes em tarefas agênticas e de codificação (ex.: Terminal-Bench 2.1 82,7, Toolathlon 70,3), e a Artificial Analysis, desde então, avaliou a build -0731 com 50 em seu Intelligence Index: dez pontos acima da prévia de abril, seis acima do V4 Pro, que é muito maior, e no mesmo nível do Gemini 3.6 Flash. Ele custa cerca de US$ 0,15 / US$ 0,29 por milhão de tokens de entrada/saída, aproximadamente um terço do preço do V4 Pro. Apenas a API Flash foi atualizada; o V4 Pro e o app/site da DeepSeek permanecem inalterados. No OrcaRouter, você o obtém com 0% de markup por meio de um endpoint compatível com OpenAI.
Principais conclusões
• Lançamento oficial (build -0731, 31 de julho de 2026): uma atualização pós-treinamento da prévia — mesma arquitetura, agentes muito mais fortes, programação e uso de ferramentas.
• Arquitetura inalterada: 284B total / 13B ativos (MoE), contexto de 1M de tokens (1,048,576), saída de até 384K, entrada somente de texto, com raciocínio, ferramentas e JSON.
• Novo: suporte nativo à API Responses, além de adaptação específica para Codex; continua a oferecer suporte às interfaces OpenAI ChatCompletions e estilo Anthropic. ID do modelo deepseek-v4-flash.
• Ganhos de agente/codificação relatados pela DeepSeek: Terminal-Bench 2.1 82.7, Toolathlon (verificado) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• Muito barato: cerca de US$ 0,15 / US$ 0,29 por 1M de tokens de entrada/saída — aproximadamente um terço dos US$ 0,44 / US$ 0,88 do V4 Pro — e a DeepSeek precifica acertos de cache em US$ 0,0028 por 1M, cerca de 98% abaixo da entrada sem cache. Apenas a API Flash mudou; Pro e app/web permanecem os mesmos.
O que o lançamento oficial realmente atualizou
V4 Flash apareceu pela primeira vez como prévia em 24 de abril de 2026. O lançamento oficial de 31 de julho de 2026 (a -0731 build, conforme o changelog da API da DeepSeek) é explicitamente não uma nova arquitetura: os parâmetros totais e ativos (284B / 13B) e o contexto de 1M permanecem inalterados. O que mudou foi o pós-treinamento — fine-tuning adicional que, segundo a DeepSeek, melhorou significativamente as capacidades centrais de agente, codificação e chamada de ferramentas. Duas adições práticas são importantes: o V4 Flash agora suporta nativamente a Responses API e é especificamente adaptado para agentes de codificação estilo Codex, ao mesmo tempo em que ainda fala interfaces estilo OpenAI ChatCompletions e Anthropic. É importante notar que apenas a Flash API foi atualizada neste lançamento; o V4 Pro e as experiências de app/web da DeepSeek permanecem inalterados. Para equipes, isso significa uma melhoria que pode ser adotada diretamente para cargas de trabalho de agente, pelo mesmo preço, sem migração.

Arquitetura: um MoE de pequena ativação construído para throughput
V4 Flash é um modelo de mistura de especialistas com aproximadamente 284 bilhões de parâmetros totais, mas apenas cerca de 13 bilhões ativos por token. Essa contagem baixa de parâmetros ativos é o ponto: mantém a inferência rápida e barata, enquanto um grande pool de especialistas preserva a qualidade. A janela de contexto é de 1.048.576 tokens completos (cerca de 1M), com uma saída máxima muito grande de 384K, e o modelo suporta raciocínio (pensamento estendido), chamada de ferramentas e JSON estruturado. A entrada é somente texto. O objetivo de design — trabalho agentivo de alto volume e baixa latência — aparece nos números de serviço: um p50 de tempo até o primeiro token em torno de 394 milissegundos e saída de cerca de 184 tokens por segundo nas medições do OrcaRouter.
Benchmarks: o que dizem os números oficiais
O lançamento oficial aposta fortemente em avaliações de agentes e de programação, executadas com o próprio harness da DeepSeek (configurações de modo mínimo / esforço máximo). Veja como interpretar os principais resultados, todos relatados pela DeepSeek:
• Terminal-Bench 2.1: 82.7 — tarefas agênticas de linha de comando/software em um terminal real. Uma pontuação alta aqui indica um modelo que realmente consegue operar ferramentas e shells, e não apenas responder perguntas.
• Toolathlon (verificado): 70.3 e Automation Bench (Público): 25.1 — amplitude e confiabilidade do uso de ferramentas e automação de ponta a ponta. A confiabilidade da chamada de ferramentas é a característica decisiva para agentes.
• Cybergym: 76.7 — resolução de problemas agêntica no estilo segurança/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — codificação de engenharia de software e full-stack, desde geração em nível de repositório até tarefas difíceis de ciência de dados. O forte DSBench-FullStack (68.7) indica competência prática em codificação multi-arquivo.
• Agent Last Exam: 25.2 — um desafio de raciocínio agêntico deliberadamente difícil, onde até os melhores modelos pontuam baixo; útil como um sinal relativo, não absoluto.
Para contexto independente, a Artificial Analysis avaliou agora a própria build -0731 e atribui-lhe 50 no Artificial Analysis Intelligence Index — dez pontos acima da pré-visualização de abril que substitui, seis pontos acima do muito maior V4 Pro, e ao nível do Gemini 3.6 Flash. Os seus resultados por componente: GPQA Diamond 91%, AA-LCR 66%, Humanity's Last Exam 37%, SciCode 50%, τ³-Bench Banking 31%, CritPt 17%, e um Elo de 1559 no GDPval-AA v2. Dois deles merecem uma segunda análise. A Artificial Analysis mediu o Terminal-Bench 2.1 em 79% contra os 82,7 reportados pela DeepSeek — próximo, mas inferior, que é a direção em que os números do harness do fornecedor normalmente erram. E no AA-Omniscience o modelo fica em -16 com uma alta taxa de alucinação medida, pelo que a narrativa do "barato e agêntico" não se estende à recordação factual não supervisionada. Essa é a forma mais precisa de ler este modelo: raciocínio forte por dólar, conhecimento fraco por consulta.
Matemática competitiva: o único lugar onde Flash se iguala à Pro
A leitura independente mais útil sobre o raciocínio do V4 Flash vem do MathArena, que executa cada modelo quatro vezes em cada problema de uma competição recém-lançada e publica a grade por problema. No AIME 2026 — as duas provas, 30 problemas, quatro execuções cada — o V4 Flash em modo de raciocínio máximo pontua 95,83% ±3,58%, contra os 96,67% ±3,21% do DeepSeek V4 Pro. Esses intervalos se sobrepõem quase completamente: neste benchmark, o modelo pequeno não é mensuravelmente pior que o carro-chefe. É na coluna de custo que eles se separam. O MathArena coloca uma execução do V4 Flash a US$ 0,009 por problema, contra US$ 0,082 para o V4 Pro — cerca de nove vezes mais barato para a mesma precisão, o que é um argumento mais forte para o nível de eficiência do que qualquer coisa no próprio anúncio da DeepSeek.
Duas ressalvas vêm no mesmo fôlego. A MathArena sinaliza ambas as entradas do DeepSeek com um aviso de contaminação, um rótulo que ela usa para um modelo lançado depois que a competição apareceu, então parte dessa precisão pode ser memorização em vez de raciocínio. E a versão que a MathArena testou é datada de 2026-04-24 — a prévia de abril, não a compilação -0731. No momento em que escrevo, não há uma pontuação independente do AIME 2026 para o lançamento oficial, e o próprio cartão do modelo DeepSeek não publica nenhum benchmark de matemática para ele, somente os de agente.
A grade também mostra onde está o teto. Quase todos os modelos no quadro resolvem a maior parte do AIME 2026; o problema que os distingue é o problema 15. Apenas duas entradas o resolvem em todas as quatro execuções — GPT-5.5 com esforço extra-alto e Claude Opus 4.8 no máximo. V4 Flash marca zero de quatro ali, e o mesmo faz V4 Pro, juntamente com GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 e Claude Opus 4.7.
Esse último detalhe é o que torna um relatório de 5 de agosto de 2026 digno de nota. O comentarista de IA @teortaxesTex postou que a build -0731 de fato resolveu o problema 15 do AIME 2026, levando cerca de 1.006 segundos e aproximadamente 100.000 tokens de saída, e descreveu o modelo começando visivelmente a burlar o problema antes de abandonar o atalho e resolvê-lo honestamente. Esta é uma única execução de um profissional, não um resultado de benchmark: ela não foi reproduzida, nenhum leaderboard público avaliou a build -0731, e uma transcrição isolada não é uma avaliação. O que pode ser verificado é a consistência interna, e ela se sustenta — a Artificial Analysis mede a saída deste modelo em cerca de 116 tokens por segundo, e 1.006 segundos nessa taxa equivalem a aproximadamente 117.000 tokens, a mesma faixa do número relatado. Uma resposta de 100.000 tokens também está bem dentro do que a DeepSeek espera, já que ela recomenda permitir até 384 mil tokens de saída com esforço de raciocínio alto ou máximo. Ambos os números ficam em cerca de três vezes as médias medidas pela MathArena para este modelo (33.588 tokens de saída e 6m 50s por resposta), o que é de se esperar no problema mais difícil do conjunto. Ou seja: plausível na forma, não verificado no resultado e, se for reproduzido, é um salto real em relação à build de pré-visualização, que falha nesse problema quatro em cada quatro vezes.
Preços: o número que muda orçamentos
No OrcaRouter, que repassa o preço do provedor com markup de 0%, o V4 Flash custa cerca de US$ 0,15 por milhão de tokens de entrada e US$ 0,29 por milhão de tokens de saída, e a DeepSeek manteve os preços estáveis para este upgrade. Isso é aproximadamente um terço dos US$ 0,44 / US$ 0,88 do DeepSeek V4 Pro. Acertos de cache são mais baratos do que a maioria das pessoas imagina: a DeepSeek lista entrada em cache a US$ 0,0028 por milhão, cerca de 98% abaixo da entrada nova, que é o que torna agentes e chat com um prompt de sistema estável tão baratos de manter em execução. Em termos reais, 10 milhões de tokens por mês com uma divisão de 70% entrada / 30% saída custam da ordem de alguns dólares; escalando para um bilhão de tokens, a diferença contra um modelo carro-chefe vira um item que o financeiro percebe.
Em um modelo de raciocínio, porém, a tabela de preços é a metade menos interessante da conta — o que move orçamentos é quantos tokens o modelo decide gastar. A Artificial Analysis precisou de cerca de 206 milhões de tokens de saída para rodar seu Intelligence Index completo no V4 Flash, aproximadamente o dobro da mediana de ~100 milhões entre os modelos que testa, e o descreve como rápido, porém muito verboso. Fazendo as contas, uma única resposta de 100.000 tokens custa cerca de três centavos, e o teto de saída de 384K limita uma resposta a quase onze centavos. Barato em termos absolutos, mas algumas centenas de vezes o custo de uma resposta curta — por isso o esforço de raciocínio é uma alavanca de orçamento, e não um botão de qualidade que você deixa travado no máximo. O relato prático de Simon Willison chega ao mesmo ponto pela direção contrária: nas configurações padrão, a geração de respostas nos testes dele foi decepcionante, e elevar o esforço de raciocínio para alto a melhorou substancialmente. Meça suas próprias solicitações pesadas antes de assumir que a taxa anunciada é o seu custo.
Onde o V4 Flash se encaixa: a escada do DeepSeek V4
A linha V4 da DeepSeek é uma escada. O V4 Pro é o carro-chefe — um modelo de raciocínio e codificação muito maior e de primeira linha. O V4 Flash é a camada de eficiência: muito menos computação ativa, uma fração do preço e, após esta atualização de pós-treinamento, uma capacidade agêntica e de codificação genuinamente forte. O fato de a DeepSeek ter investido em tornar o Flash um melhor agente (Responses API, adaptação para Codex, benchmarks de uso de ferramentas) mostra onde ela espera que o volume se concentre. Mas os números do AIME 2026 complicam a versão simplista dessa história a favor do Flash: em matemática competitiva, os dois modelos ficam dentro das margens de erro um do outro, então "enviar os problemas difíceis para o Pro" não é automaticamente a decisão certa. A divisão honesta é que o Pro oferece amplitude de conhecimento e o trabalho agêntico mais difícil, não uma chance melhor de resolver um problema difícil de matemática — e é por isso que rotear pela dificuldade medida nas suas próprias tarefas é melhor do que usar por padrão o maior modelo.

Três cenários do mundo real
1. Agentes de codificação e fluxos de trabalho estilo Codex
The -0731 build's native Responses-API and Codex support, plus its Terminal-Bench (82.7) and DSBench-FullStack (68.7) scores, make V4 Flash a strong, cheap engine for autonomous coding agents — issue-fixing, refactors, test generation, multi-step tool use.
2. Agentes que usam ferramentas em grande volume
Primeiros tokens rápidos (~394 ms), alta vazão (~184 tok/s), contexto de 1M e forte confiabilidade no Toolathlon (70.3) atendem agentes de produção que chamam ferramentas em escala — recuperação, automação, orquestração.
3. Processamento de documentos longos com orçamento limitado
O contexto completo de 1M de tokens e a saída de 384K lidam com resumo, análise ou transformação de entradas muito grandes — logs, bases de código, relatórios longos — em uma única passada, de forma econômica.
Como acessar o V4 Flash
Você pode chamar o V4 Flash diretamente na API da DeepSeek (model id deepseek-v4-flash; ela suporta a Responses API, o OpenAI ChatCompletions e interfaces no estilo Anthropic), ou por meio de um endpoint independente de fornecedor. O OrcaRouter expõe o V4 Flash com margem de 0% por meio de um único endpoint compatível com OpenAI (deepseek/deepseek-v4-flash) junto com mais de 200 outros modelos — para que você possa compará-lo com GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max e Kimi K3 em um só lugar, e rotear cada requisição para o que for mais barato para a tarefa. Como o preço é repassado sem margem, uma alteração de preço da DeepSeek chega à sua fatura no dia em que é publicada. E como a interface é compatível com OpenAI, adotar o V4 Flash — ou deixar de usá-lo após uma semana de medição — é uma mudança de configuração, não uma reintegração.

Limitações e ressalvas honestas
O V4 Flash é um modelo de eficiência, não um carro-chefe, mas os dados independentes tornaram essa fronteira mais específica do que “pior em tarefas difíceis”. No AIME 2026, ele iguala o V4 Pro dentro dos intervalos de confiança; onde ele claramente fica para trás é na amplitude de conhecimento — AA-Omniscience -16 e uma alta taxa medida de alucinação — e no trabalho agêntico mais exigente. A entrada é somente texto, sem entrada nativa de imagem. Os principais resultados agênticos são relatados pela DeepSeek em seu próprio harness, e o único número que um laboratório independente reexecutou veio mais baixo (a Artificial Analysis mediu Terminal-Bench 2.1 em 79% contra os 82,7 relatados); portanto, trate os números do fornecedor como direcionais. E “barato por token” não é “barato por tarefa”: este modelo é mensuravelmente verboso, então limite o esforço de raciocínio e as iterações de ferramentas em chamadas simples, em vez de deixar o esforço máximo ativado por padrão. Valide na sua própria carga de trabalho antes de comprometer tráfego de produção.
Perguntas Frequentes
O que é DeepSeek V4 Flash?
O modelo de eficiência da DeepSeek na linha V4: um modelo de mistura de especialistas com 284B / 13B ativos, contexto de 1M de tokens, até 384K de saída, otimizado para trabalhos rápidos, de alto volume, agênticos e de codificação. Seu lançamento oficial (build -0731) foi publicado em 31 de julho de 2026.
O que mudou no lançamento oficial?
A arquitetura permanece inalterada; é uma atualização pós-treinamento que melhora significativamente as capacidades de agente, codificação e chamada de ferramentas, e adiciona suporte nativo à Responses-API com adaptação do Codex. Apenas a Flash API foi atualizada — o V4 Pro e o app/web continuam os mesmos.
Quanto custa o V4 Flash?
Cerca de $0.15 por milhão de tokens de entrada e $0.29 por milhão de tokens de saída no OrcaRouter (margem de 0%) — aproximadamente um terço dos $0.44 / $0.88 do V4 Pro — com acertos de cache listados a $0.0028 por milhão, cerca de 98% abaixo da entrada nova. Os preços permaneceram estáveis nesta versão. Faça um orçamento para o volume de tokens, bem como para a taxa: este é um modelo de raciocínio verboso, e uma resposta de 100.000 tokens custa cerca de três centavos.
Quão bom é o V4 Flash em tarefas de agente e de codificação?
DeepSeek relata pontuações fortes: Terminal-Bench 2.1 82.7, Toolathlon (verificado) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — todos os números do harness do fornecedor, então verifique em suas próprias tarefas.
O V4 Flash é bom em matemática de competição?
Melhor do que o preço sugere. Na grade AIME 2026 da MathArena, a versão de pré-visualização de abril pontua 95,83% em quatro execuções de 30 problemas — dentro do intervalo de confiança dos 96,67% do V4 Pro, a cerca de um nono do custo por problema — embora a MathArena sinalize ambos os modelos por possível contaminação e ainda não tenha avaliado a versão -0731. O único problema que ela nunca resolve é o problema 15, que apenas GPT-5.5 com esforço extra-alto e Claude Opus 4.8 com resolução máxima resolvem de forma confiável.
Como o V4 Flash se compara ao V4 Pro?
Pro é o carro-chefe de longe maior para o raciocínio e a codificação mais difíceis; Flash é o nível de eficiência com cerca de 1/3 do preço e forte capacidade agêntica/de codificação. Roteie tarefas difíceis para o Pro, todo o resto para o Flash.
Qual é a janela de contexto?
Um total de 1.048.576 tokens (cerca de 1M), com até 384K tokens de saída.
O V4 Flash é multimodal?
Não — a entrada é somente texto. Ela suporta raciocínio, chamada de ferramentas e saída JSON.
O V4 Flash funciona com a API Responses e o Codex?
Sim — o lançamento -0731 adiciona suporte nativo para Responses-API e adaptação específica para Codex, além de interfaces no estilo OpenAI ChatCompletions e Anthropic.
Como uso o V4 Flash?
Diretamente pela API da DeepSeek, ou pelo endpoint da OrcaRouter compatível com OpenAI com margem de 0% (deepseek/deepseek-v4-flash), onde você também pode comparar e rotear entre modelos concorrentes.
Conclusão
O lançamento oficial do DeepSeek V4 Flash mantém a receita barata e rápida e o torna um agente muito melhor: o mesmo MoE de 284B / 13B ativos e contexto de 1M, pós-treinado para melhorar a codificação e o uso de ferramentas, com suporte nativo a Responses-API e Codex, pelo mesmo ~$0.15 / $0.29. Os números independentes agora respaldam a maior parte do discurso — a Artificial Analysis coloca o build -0731 no mesmo nível do Gemini 3.6 Flash em inteligência, e a MathArena tem o build de preview igualando o V4 Pro no AIME 2026 por um nono do custo por problema. O que a taxa baixa não compra é amplitude de conhecimento ou um passe livre para verbosidade: este modelo pensa com aproximadamente o dobro do orçamento de tokens de um modelo mediano, então sua conta por tarefa depende mais do esforço de raciocínio que você permite do que do preço anunciado. Execute-o por um endpoint compatível com OpenAI e sem margem de lucro, como o OrcaRouter, meça o que suas próprias solicitações complexas realmente gastam e direcione para um modelo topo de linha somente onde a medição indicar que você deve.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
