
Lançamento Oficial do DeepSeek V4 Flash: O Modelo Barato, Rápido e Agêntico com Contexto de 1M, Explicado
- qwenNOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 224 tok/s
- orcaNOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOVOAnthropic: Claude Opus 52026-07-2461Inteligência78Código
- googleNOVOGoogle: Gemini 3.6 Flash2026-07-2150Inteligência69Código
- googleNOVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligência77Código
- grokxAI: Grok 4.52026-07-0854Inteligência72Código
- tencentTencent: Hy32026-07-0641Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
- z-aiZ.ai: GLM 5.22026-06-1651Inteligência69Código60Matemática
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligência61Código61Matemática
- anthropicAnthropic: Claude Fable 52026-06-0960Inteligência77Código
- qwenQwen: Qwen3.7 Plus2026-06-0139Inteligência56Código59Matemática
O modelo de eficiência da DeepSeek, V4 Flash, passou da versão prévia para um lançamento oficial em beta público — o code>-0731/code> build foi lançado em 31 de julho de 2026. A arquitetura não mudou (ainda é um modelo de mistura de especialistas com 284 bilhões de parâmetros e contexto de 1 milhão de tokens), mas uma rodada de pós-treinamento adicional melhorou significativamente suas habilidades agênticas, de codificação e de chamada de ferramentas, e agora ele oferece suporte nativo à API Responses, com adaptações específicas para agentes estilo Codex. Este guia explica o que é o V4 Flash, o que o lançamento oficial realmente melhorou, como interpretar seus benchmarks (relatados pela DeepSeek), quanto custa e como usá-lo — todos os números com a fonte indicada.
Nota de precisão: os detalhes do lançamento e as pontuações de benchmark abaixo vêm do {{1}}changelog oficial da API da DeepSeek (datado de 2026-07-31){{/1}}; {{2}}arquitetura, contexto e preços foram verificados em relação à página do modelo do OrcaRouter{{/2}}; {{3}}os índices compostos do Artificial Analysis são independentes{{/3}}. {{4}}Os benchmarks relatados pela DeepSeek usam suas próprias configurações de harness{{/4}} — {{5}}trate-os como números do fornecedor e execute suas próprias avaliações{{/5}}. {{6}}Especificações e preços mudam; verifique antes de construir.{{/6}}
Em resumo. V4 Flash é o irmão econômico do gigante DeepSeek V4 Pro: um MoE de 284B / 13B ativos, com contexto de 1M de tokens e até 384K de saída, ajustado para trabalhos agênticos de alto volume e baixa latência. O lançamento oficial de 31 de julho é uma atualização pós-treinamento — mesmo tamanho, agentes e codificação materialmente melhores — que também adiciona suporte nativo à Responses-API e ao Codex. A DeepSeek relata pontuações fortes em agêntico/codificação (ex.: Terminal-Bench 2.1 82.7, Toolathlon 70.3), e custa cerca de US$ 0,15 / US$ 0,29 por milhão de tokens de entrada/saída, aproximadamente um terço do preço do V4 Pro. Somente a API Flash foi atualizada; o V4 Pro e o aplicativo/site da DeepSeek permanecem inalterados. No OrcaRouter você obtém isso com margem de 0% por meio de um endpoint compatível com OpenAI.
Principais conclusões
• Lançamento oficial (build -0731, 31 de julho de 2026): uma atualização pós-treinamento da prévia — mesma arquitetura, agentes muito mais fortes, programação e uso de ferramentas.
• Arquitetura inalterada: 284B total / 13B ativos (MoE), contexto de 1M de tokens (1,048,576), saída de até 384K, entrada somente de texto, com raciocínio, ferramentas e JSON.
• Novo: suporte nativo à API Responses, além de adaptação específica para Codex; continua a suportar interfaces estilo ChatCompletions da OpenAI e Anthropic. ID do modelo code>deepseek-v4-flash/code>.
• Ganhos de agente/codificação relatados pela DeepSeek: Terminal-Bench 2.1 82.7, Toolathlon (verificado) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• Muito barato: cerca de $0.15 / $0.29 por 1M de tokens de entrada/saída com ~$0.02 de leituras de cache (OrcaRouter, 0% de markup) — aproximadamente um terço dos $0.44 / $0.88 do V4 Pro. Apenas a Flash API mudou; Pro e app/web são os mesmos.
O que o lançamento oficial realmente atualizou
O V4 Flash apareceu pela primeira vez como prévia em 24 de abril de 2026. O lançamento oficial de 31 de julho de 2026 (a code>-0731/code> build, de acordo com o changelog da API da DeepSeek) é explicitamente não uma nova arquitetura: os parâmetros totais e ativos (284B / 13B) e o contexto de 1M permanecem inalterados. O que mudou foi o pós-treinamento — um ajuste fino extra que, segundo a DeepSeek, melhorou significativamente as capacidades principais de agente, codificação e chamada de ferramentas. Duas adições práticas importam: o V4 Flash agora suporta nativamente a API Responses e é especificamente adaptado para agentes de codificação no estilo Codex, ao mesmo tempo que ainda fala com as interfaces ChatCompletions da OpenAI e no estilo Anthropic. Importante: apenas a API Flash foi atualizada neste lançamento; o V4 Pro e as experiências de aplicativo/web da DeepSeek permanecem inalterados. Para as equipes, isso significa uma melhoria direta para cargas de trabalho de agente pelo mesmo preço, sem migração.

Arquitetura: um MoE de pequena ativação construído para throughput
V4 Flash é um modelo de mistura de especialistas com aproximadamente 284 bilhões de parâmetros totais, mas apenas cerca de 13 bilhões ativos por token. Essa contagem baixa de parâmetros ativos é o ponto: mantém a inferência rápida e barata, enquanto um grande pool de especialistas preserva a qualidade. A janela de contexto é de 1.048.576 tokens completos (cerca de 1M), com uma saída máxima muito grande de 384K, e o modelo suporta raciocínio (pensamento estendido), chamada de ferramentas e JSON estruturado. A entrada é somente texto. O objetivo de design — trabalho agentivo de alto volume e baixa latência — aparece nos números de serviço: um p50 de tempo até o primeiro token em torno de 394 milissegundos e saída de cerca de 184 tokens por segundo nas medições do OrcaRouter.
Benchmarks: o que dizem os números oficiais
O lançamento oficial aposta fortemente em avaliações de agentes e de programação, executadas com o próprio harness da DeepSeek (configurações de modo mínimo / esforço máximo). Veja como interpretar os principais resultados, todos relatados pela DeepSeek:
• Terminal-Bench 2.1: 82.7 — tarefas agênticas de linha de comando/software em um terminal real. Uma pontuação alta aqui indica um modelo que realmente consegue operar ferramentas e shells, e não apenas responder perguntas.
• Toolathlon (verificado): 70.3 e Automation Bench (Público): 25.1 — amplitude e confiabilidade do uso de ferramentas e automação de ponta a ponta. A confiabilidade da chamada de ferramentas é a característica decisiva para agentes.
• Cybergym: 76.7 — resolução de problemas agêntica no estilo segurança/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — codificação de engenharia de software e full-stack, desde geração em nível de repositório até tarefas difíceis de ciência de dados. O forte DSBench-FullStack (68.7) indica competência prática em codificação multi-arquivo.
• Agent Last Exam: 25.2 — um desafio de raciocínio agêntico deliberadamente difícil, onde até os melhores modelos pontuam baixo; útil como um sinal relativo, não absoluto.
Para contexto independente, a Artificial Analysis (avaliada em 2026-06-25, build de pré-visualização) posicionou o V4 Flash em cerca de 56,2 AA Coding, 40,3 AA Intelligence e 50,0 AA Math — um generalista com inclinação para codificação, acima da mediana dos modelos abertos. O ajuste oficial pós-treinamento visa diretamente o eixo agêntico/codificação, então espere que o build mais recente se mostre mais forte exatamente nessas tarefas. Como sempre, os números do harness do fornecedor tendem a ser otimistas; valide em suas próprias cargas de trabalho.
Preços: o número que muda orçamentos
No OrcaRouter, que repassa o preço do provedor com margem de 0%, o V4 Flash custa cerca de US$ 0,15 por milhão de tokens de entrada e US$ 0,29 por milhão de tokens de saída, com leituras de cache em torno de US$ 0,02 — e a DeepSeek manteve o preço baixo neste lançamento (sem aumento para a atualização). Isso é aproximadamente um terço dos US$ 0,44 / US$ 0,88 do DeepSeek V4 Pro. Em termos práticos: 10 milhões de tokens por mês, com uma divisão de 70% de entrada / 30% de saída, custam algo como alguns dólares no V4 Flash; se você escalar para um bilhão de tokens, a diferença em relação a um modelo principal vira um item que o financeiro nota. O cache de prompt reduz ainda mais o custo para agentes e chats com um prompt de sistema estável, já que a entrada em cache é cobrada a cerca de um décimo do valor da entrada nova. Capacidade agêntica mais barata pelo mesmo preço baixo é toda a proposta deste lançamento.
Onde o V4 Flash se encaixa: a escada do DeepSeek V4
A linha V4 da DeepSeek é uma escada. O V4 Pro é o carro-chefe — um modelo de raciocínio e codificação muito maior e de primeira linha. O V4 Flash é a camada de eficiência: muito menos computação ativa, uma fração do preço e, após esta atualização de pós-treinamento, capacidade de agente e codificação genuinamente forte. O fato de a DeepSeek ter investido em tornar o Flash um melhor agente (Responses API, adaptação ao Codex, benchmarks de uso de ferramentas) mostra para onde ela espera que o volume flua: tráfego diário de agentes e codificação no Flash, e o raciocínio mais difícil reservado ao Pro. Isso reflete o padrão da indústria toda: uma opção barata como padrão e um carro-chefe premium — e é por isso que rotear por dificuldade é melhor do que usar o maior modelo por padrão.

Três cenários do mundo real
1. Agentes de codificação e fluxos de trabalho estilo Codex
The -0731 build's native Responses-API and Codex support, plus its Terminal-Bench (82.7) and DSBench-FullStack (68.7) scores, make V4 Flash a strong, cheap engine for autonomous coding agents — issue-fixing, refactors, test generation, multi-step tool use.
2. Agentes que usam ferramentas em grande volume
Primeiros tokens rápidos (~394 ms), alta vazão (~184 tok/s), contexto de 1M e forte confiabilidade no Toolathlon (70.3) atendem agentes de produção que chamam ferramentas em escala — recuperação, automação, orquestração.
3. Processamento de documentos longos com orçamento limitado
O contexto completo de 1M de tokens e a saída de 384K lidam com resumo, análise ou transformação de entradas muito grandes — logs, bases de código, relatórios longos — em uma única passada, de forma econômica.
Como acessar o V4 Flash
Você pode chamar o V4 Flash diretamente na API da DeepSeek (id do modelo code>deepseek-v4-flash/code>; suporta a Responses API, OpenAI ChatCompletions e interfaces no estilo Anthropic), ou através de um endpoint neutro de fornecedor. a href="https://www.orcarouter.ai/">OrcaRouter/a> expõe o V4 Flash com margem de 0% através de um único endpoint compatível com OpenAI (code>deepseek/deepseek-v4-flash/code>) ao lado de 185+ outros modelos — para você poder compará-lo com GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 e Kimi K3 em um só lugar, e rotear cada solicitação para o que for mais barato para a tarefa. Como é compatível com OpenAI, adotar o V4 Flash — ou deixar de usá-lo — é uma mudança de configuração, não uma reintegração.

Limitações e ressalvas honestas
V4 Flash é um modelo de eficiência, não um carro-chefe: nos raciocínios mais difíceis, fica atrás do V4 Pro e dos principais modelos ocidentais. A entrada é somente texto (sem entrada nativa de imagem). As pontuações de benchmark aqui são relatadas pela DeepSeek usando sua própria estrutura de testes; portanto, trate os números exatos como indicativos e espere que avaliações independentes fiquem um pouco mais baixas. E "barato por token" não é "barato por tarefa" se você deixar loops de raciocínio ou de agentes rodarem por muito tempo — limite o esforço de raciocínio e as iterações de ferramentas em chamadas simples. Valide em sua própria carga de trabalho antes de enviar tráfego de produção.
Perguntas Frequentes
O que é DeepSeek V4 Flash?
O modelo de eficiência da DeepSeek na linha V4: um modelo de mistura de especialistas com 284B / 13B ativos, contexto de 1M de tokens, até 384K de saída, otimizado para trabalhos rápidos, de alto volume, agênticos e de codificação. Seu lançamento oficial (build -0731) foi publicado em 31 de julho de 2026.
O que mudou no lançamento oficial?
A arquitetura permanece inalterada; é uma atualização pós-treinamento que melhora significativamente as capacidades de agente, codificação e chamada de ferramentas, e adiciona suporte nativo à Responses-API com adaptação do Codex. Apenas a Flash API foi atualizada — o V4 Pro e o app/web continuam os mesmos.
Quanto custa o V4 Flash?
Cerca de US$ 0,15 por milhão de tokens de entrada e US$ 0,29 por milhão de tokens de saída no OrcaRouter (margem de 0%), com ~US$ 0,02 em leituras de cache — aproximadamente um terço dos US$ 0,44 / US$ 0,88 do V4 Pro. Os preços continuaram baixos nesta versão.
Quão bom é o V4 Flash em tarefas de agente e de codificação?
DeepSeek relata pontuações fortes: Terminal-Bench 2.1 82.7, Toolathlon (verificado) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — todos os números do harness do fornecedor, então verifique em suas próprias tarefas.
Como o V4 Flash se compara ao V4 Pro?
Pro é o carro-chefe de longe maior para o raciocínio e a codificação mais difíceis; Flash é o nível de eficiência com cerca de 1/3 do preço e forte capacidade agêntica/de codificação. Roteie tarefas difíceis para o Pro, todo o resto para o Flash.
Qual é a janela de contexto?
Um total de 1.048.576 tokens (cerca de 1M), com até 384K tokens de saída.
O V4 Flash é multimodal?
Não — a entrada é somente texto. Ela suporta raciocínio, chamada de ferramentas e saída JSON.
O V4 Flash funciona com a API Responses e o Codex?
Sim — o lançamento -0731 adiciona suporte nativo para Responses-API e adaptação específica para Codex, além de interfaces no estilo OpenAI ChatCompletions e Anthropic.
Como uso o V4 Flash?
Diretamente pela API da DeepSeek, ou através do endpoint da OrcaRouter compatível com OpenAI, com 0% de markup (code>deepseek/deepseek-v4-flash/code>), onde você também pode comparar e rotear entre modelos concorrentes.
Conclusão
O lançamento oficial do DeepSeek V4 Flash mantém a receita barata e rápida e o torna um agente muito melhor: mesma MoE de 284B / 13B ativos e contexto de 1M, mas com pós-treinamento para codificação e uso de ferramentas mais fortes, com suporte nativo a Responses-API e Codex — pelo mesmo preço de ~$0,15 / $0,29. Não é um carro-chefe e não é multimodal, mas para a grande maioria de trabalhos agênticos, de codificação e de documentos longos, é uma das melhores opções de custo-benefício por token em 2026. Experimente por meio de um endpoint compatível com OpenAI e sem margem de lucro, como o OrcaRouter, e roteie a minoria mais difícil das solicitações para um carro-chefe — essa combinação é difícil de superar em custo.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
