Lançamento Oficial do DeepSeek V4 Flash: O Modelo Barato, Rápido e Agêntico com Contexto de 1M, Explicado
Guides & Insights

Lançamento Oficial do DeepSeek V4 Flash: O Modelo Barato, Rápido e Agêntico com Contexto de 1M, Explicado

Autor

jinhao song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O modelo de eficiência da DeepSeek, V4 Flash, passou da versão prévia para um lançamento oficial em beta público — o code>-0731/code> build foi lançado em 31 de julho de 2026. A arquitetura não mudou (ainda é um modelo de mistura de especialistas com 284 bilhões de parâmetros e contexto de 1 milhão de tokens), mas uma rodada de pós-treinamento adicional melhorou significativamente suas habilidades agênticas, de codificação e de chamada de ferramentas, e agora ele oferece suporte nativo à API Responses, com adaptações específicas para agentes estilo Codex. Este guia explica o que é o V4 Flash, o que o lançamento oficial realmente melhorou, como interpretar seus benchmarks (relatados pela DeepSeek), quanto custa e como usá-lo — todos os números com a fonte indicada.

Nota de precisão: os detalhes do lançamento e as pontuações de benchmark abaixo vêm do {{1}}changelog oficial da API da DeepSeek (datado de 2026-07-31){{/1}}; {{2}}arquitetura, contexto e preços foram verificados em relação à página do modelo do OrcaRouter{{/2}}; {{3}}os índices compostos do Artificial Analysis são independentes{{/3}}. {{4}}Os benchmarks relatados pela DeepSeek usam suas próprias configurações de harness{{/4}} — {{5}}trate-os como números do fornecedor e execute suas próprias avaliações{{/5}}. {{6}}Especificações e preços mudam; verifique antes de construir.{{/6}}

Em resumo. V4 Flash é o irmão econômico do gigante DeepSeek V4 Pro: um MoE de 284B / 13B ativos, com contexto de 1M de tokens e até 384K de saída, ajustado para trabalhos agênticos de alto volume e baixa latência. O lançamento oficial de 31 de julho é uma atualização pós-treinamento — mesmo tamanho, agentes e codificação materialmente melhores — que também adiciona suporte nativo à Responses-API e ao Codex. A DeepSeek relata pontuações fortes em agêntico/codificação (ex.: Terminal-Bench 2.1 82.7, Toolathlon 70.3), e custa cerca de US$ 0,15 / US$ 0,29 por milhão de tokens de entrada/saída, aproximadamente um terço do preço do V4 Pro. Somente a API Flash foi atualizada; o V4 Pro e o aplicativo/site da DeepSeek permanecem inalterados. No OrcaRouter você obtém isso com margem de 0% por meio de um endpoint compatível com OpenAI.

Principais conclusões

• Lançamento oficial (build -0731, 31 de julho de 2026): uma atualização pós-treinamento da prévia — mesma arquitetura, agentes muito mais fortes, programação e uso de ferramentas.

• Arquitetura inalterada: 284B total / 13B ativos (MoE), contexto de 1M de tokens (1,048,576), saída de até 384K, entrada somente de texto, com raciocínio, ferramentas e JSON.

• Novo: suporte nativo à API Responses, além de adaptação específica para Codex; continua a suportar interfaces estilo ChatCompletions da OpenAI e Anthropic. ID do modelo code>deepseek-v4-flash/code>.

• Ganhos de agente/codificação relatados pela DeepSeek: Terminal-Bench 2.1 82.7, Toolathlon (verificado) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• Muito barato: cerca de $0.15 / $0.29 por 1M de tokens de entrada/saída com ~$0.02 de leituras de cache (OrcaRouter, 0% de markup) — aproximadamente um terço dos $0.44 / $0.88 do V4 Pro. Apenas a Flash API mudou; Pro e app/web são os mesmos.

O que o lançamento oficial realmente atualizou

O V4 Flash apareceu pela primeira vez como prévia em 24 de abril de 2026. O lançamento oficial de 31 de julho de 2026 (a code>-0731/code> build, de acordo com o changelog da API da DeepSeek) é explicitamente não uma nova arquitetura: os parâmetros totais e ativos (284B / 13B) e o contexto de 1M permanecem inalterados. O que mudou foi o pós-treinamento — um ajuste fino extra que, segundo a DeepSeek, melhorou significativamente as capacidades principais de agente, codificação e chamada de ferramentas. Duas adições práticas importam: o V4 Flash agora suporta nativamente a API Responses e é especificamente adaptado para agentes de codificação no estilo Codex, ao mesmo tempo que ainda fala com as interfaces ChatCompletions da OpenAI e no estilo Anthropic. Importante: apenas a API Flash foi atualizada neste lançamento; o V4 Pro e as experiências de aplicativo/web da DeepSeek permanecem inalterados. Para as equipes, isso significa uma melhoria direta para cargas de trabalho de agente pelo mesmo preço, sem migração.

Arquitetura: um MoE de pequena ativação construído para throughput

V4 Flash é um modelo de mistura de especialistas com aproximadamente 284 bilhões de parâmetros totais, mas apenas cerca de 13 bilhões ativos por token. Essa contagem baixa de parâmetros ativos é o ponto: mantém a inferência rápida e barata, enquanto um grande pool de especialistas preserva a qualidade. A janela de contexto é de 1.048.576 tokens completos (cerca de 1M), com uma saída máxima muito grande de 384K, e o modelo suporta raciocínio (pensamento estendido), chamada de ferramentas e JSON estruturado. A entrada é somente texto. O objetivo de design — trabalho agentivo de alto volume e baixa latência — aparece nos números de serviço: um p50 de tempo até o primeiro token em torno de 394 milissegundos e saída de cerca de 184 tokens por segundo nas medições do OrcaRouter.

Benchmarks: o que dizem os números oficiais

O lançamento oficial aposta fortemente em avaliações de agentes e de programação, executadas com o próprio harness da DeepSeek (configurações de modo mínimo / esforço máximo). Veja como interpretar os principais resultados, todos relatados pela DeepSeek:

• Terminal-Bench 2.1: 82.7 — tarefas agênticas de linha de comando/software em um terminal real. Uma pontuação alta aqui indica um modelo que realmente consegue operar ferramentas e shells, e não apenas responder perguntas.

• Toolathlon (verificado): 70.3 e Automation Bench (Público): 25.1 — amplitude e confiabilidade do uso de ferramentas e automação de ponta a ponta. A confiabilidade da chamada de ferramentas é a característica decisiva para agentes.

• Cybergym: 76.7 — resolução de problemas agêntica no estilo segurança/CTF.

• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — codificação de engenharia de software e full-stack, desde geração em nível de repositório até tarefas difíceis de ciência de dados. O forte DSBench-FullStack (68.7) indica competência prática em codificação multi-arquivo.

• Agent Last Exam: 25.2 — um desafio de raciocínio agêntico deliberadamente difícil, onde até os melhores modelos pontuam baixo; útil como um sinal relativo, não absoluto.

Para contexto independente, a Artificial Analysis (avaliada em 2026-06-25, build de pré-visualização) posicionou o V4 Flash em cerca de 56,2 AA Coding, 40,3 AA Intelligence e 50,0 AA Math — um generalista com inclinação para codificação, acima da mediana dos modelos abertos. O ajuste oficial pós-treinamento visa diretamente o eixo agêntico/codificação, então espere que o build mais recente se mostre mais forte exatamente nessas tarefas. Como sempre, os números do harness do fornecedor tendem a ser otimistas; valide em suas próprias cargas de trabalho.

Preços: o número que muda orçamentos

No OrcaRouter, que repassa o preço do provedor com margem de 0%, o V4 Flash custa cerca de US$ 0,15 por milhão de tokens de entrada e US$ 0,29 por milhão de tokens de saída, com leituras de cache em torno de US$ 0,02 — e a DeepSeek manteve o preço baixo neste lançamento (sem aumento para a atualização). Isso é aproximadamente um terço dos US$ 0,44 / US$ 0,88 do DeepSeek V4 Pro. Em termos práticos: 10 milhões de tokens por mês, com uma divisão de 70% de entrada / 30% de saída, custam algo como alguns dólares no V4 Flash; se você escalar para um bilhão de tokens, a diferença em relação a um modelo principal vira um item que o financeiro nota. O cache de prompt reduz ainda mais o custo para agentes e chats com um prompt de sistema estável, já que a entrada em cache é cobrada a cerca de um décimo do valor da entrada nova. Capacidade agêntica mais barata pelo mesmo preço baixo é toda a proposta deste lançamento.

Onde o V4 Flash se encaixa: a escada do DeepSeek V4

A linha V4 da DeepSeek é uma escada. O V4 Pro é o carro-chefe — um modelo de raciocínio e codificação muito maior e de primeira linha. O V4 Flash é a camada de eficiência: muito menos computação ativa, uma fração do preço e, após esta atualização de pós-treinamento, capacidade de agente e codificação genuinamente forte. O fato de a DeepSeek ter investido em tornar o Flash um melhor agente (Responses API, adaptação ao Codex, benchmarks de uso de ferramentas) mostra para onde ela espera que o volume flua: tráfego diário de agentes e codificação no Flash, e o raciocínio mais difícil reservado ao Pro. Isso reflete o padrão da indústria toda: uma opção barata como padrão e um carro-chefe premium — e é por isso que rotear por dificuldade é melhor do que usar o maior modelo por padrão.

Três cenários do mundo real

1. Agentes de codificação e fluxos de trabalho estilo Codex

The -0731 build's native Responses-API and Codex support, plus its Terminal-Bench (82.7) and DSBench-FullStack (68.7) scores, make V4 Flash a strong, cheap engine for autonomous coding agents — issue-fixing, refactors, test generation, multi-step tool use.

2. Agentes que usam ferramentas em grande volume

Primeiros tokens rápidos (~394 ms), alta vazão (~184 tok/s), contexto de 1M e forte confiabilidade no Toolathlon (70.3) atendem agentes de produção que chamam ferramentas em escala — recuperação, automação, orquestração.

3. Processamento de documentos longos com orçamento limitado

O contexto completo de 1M de tokens e a saída de 384K lidam com resumo, análise ou transformação de entradas muito grandes — logs, bases de código, relatórios longos — em uma única passada, de forma econômica.

Como acessar o V4 Flash

Você pode chamar o V4 Flash diretamente na API da DeepSeek (id do modelo code>deepseek-v4-flash/code>; suporta a Responses API, OpenAI ChatCompletions e interfaces no estilo Anthropic), ou através de um endpoint neutro de fornecedor. a href="https://www.orcarouter.ai/">OrcaRouter/a> expõe o V4 Flash com margem de 0% através de um único endpoint compatível com OpenAI (code>deepseek/deepseek-v4-flash/code>) ao lado de 185+ outros modelos — para você poder compará-lo com GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 e Kimi K3 em um só lugar, e rotear cada solicitação para o que for mais barato para a tarefa. Como é compatível com OpenAI, adotar o V4 Flash — ou deixar de usá-lo — é uma mudança de configuração, não uma reintegração.

Limitações e ressalvas honestas

V4 Flash é um modelo de eficiência, não um carro-chefe: nos raciocínios mais difíceis, fica atrás do V4 Pro e dos principais modelos ocidentais. A entrada é somente texto (sem entrada nativa de imagem). As pontuações de benchmark aqui são relatadas pela DeepSeek usando sua própria estrutura de testes; portanto, trate os números exatos como indicativos e espere que avaliações independentes fiquem um pouco mais baixas. E "barato por token" não é "barato por tarefa" se você deixar loops de raciocínio ou de agentes rodarem por muito tempo — limite o esforço de raciocínio e as iterações de ferramentas em chamadas simples. Valide em sua própria carga de trabalho antes de enviar tráfego de produção.

Perguntas Frequentes

O que é DeepSeek V4 Flash?

O modelo de eficiência da DeepSeek na linha V4: um modelo de mistura de especialistas com 284B / 13B ativos, contexto de 1M de tokens, até 384K de saída, otimizado para trabalhos rápidos, de alto volume, agênticos e de codificação. Seu lançamento oficial (build -0731) foi publicado em 31 de julho de 2026.

O que mudou no lançamento oficial?

A arquitetura permanece inalterada; é uma atualização pós-treinamento que melhora significativamente as capacidades de agente, codificação e chamada de ferramentas, e adiciona suporte nativo à Responses-API com adaptação do Codex. Apenas a Flash API foi atualizada — o V4 Pro e o app/web continuam os mesmos.

Quanto custa o V4 Flash?

Cerca de US$ 0,15 por milhão de tokens de entrada e US$ 0,29 por milhão de tokens de saída no OrcaRouter (margem de 0%), com ~US$ 0,02 em leituras de cache — aproximadamente um terço dos US$ 0,44 / US$ 0,88 do V4 Pro. Os preços continuaram baixos nesta versão.

Quão bom é o V4 Flash em tarefas de agente e de codificação?

DeepSeek relata pontuações fortes: Terminal-Bench 2.1 82.7, Toolathlon (verificado) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — todos os números do harness do fornecedor, então verifique em suas próprias tarefas.

Como o V4 Flash se compara ao V4 Pro?

Pro é o carro-chefe de longe maior para o raciocínio e a codificação mais difíceis; Flash é o nível de eficiência com cerca de 1/3 do preço e forte capacidade agêntica/de codificação. Roteie tarefas difíceis para o Pro, todo o resto para o Flash.

Qual é a janela de contexto?

Um total de 1.048.576 tokens (cerca de 1M), com até 384K tokens de saída.

O V4 Flash é multimodal?

Não — a entrada é somente texto. Ela suporta raciocínio, chamada de ferramentas e saída JSON.

O V4 Flash funciona com a API Responses e o Codex?

Sim — o lançamento -0731 adiciona suporte nativo para Responses-API e adaptação específica para Codex, além de interfaces no estilo OpenAI ChatCompletions e Anthropic.

Como uso o V4 Flash?

Diretamente pela API da DeepSeek, ou através do endpoint da OrcaRouter compatível com OpenAI, com 0% de markup (code>deepseek/deepseek-v4-flash/code>), onde você também pode comparar e rotear entre modelos concorrentes.

Conclusão

O lançamento oficial do DeepSeek V4 Flash mantém a receita barata e rápida e o torna um agente muito melhor: mesma MoE de 284B / 13B ativos e contexto de 1M, mas com pós-treinamento para codificação e uso de ferramentas mais fortes, com suporte nativo a Responses-API e Codex — pelo mesmo preço de ~$0,15 / $0,29. Não é um carro-chefe e não é multimodal, mas para a grande maioria de trabalhos agênticos, de codificação e de documentos longos, é uma das melhores opções de custo-benefício por token em 2026. Experimente por meio de um endpoint compatível com OpenAI e sem margem de lucro, como o OrcaRouter, e roteie a minoria mais difícil das solicitações para um carro-chefe — essa combinação é difícil de superar em custo.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube