DeepSeek V4 Flash vs V4 Pro: O Nível de Eficiência vs o Carro-Chefe, Comparados
Guides & Insights

DeepSeek V4 Flash vs V4 Pro: O Nível de Eficiência vs o Carro-Chefe, Comparados

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A linha V4 da DeepSeek é uma escada de dois degraus: V4 Flash, o modelo de eficiência barato e rápido — agora em seu lançamento oficial -0731 com agentes muito mais fortes — e V4 Pro, o grande carro-chefe para o raciocínio e a codificação mais difíceis, que passou para sua versão GA oficial (0813) em 12 de agosto de 2026. O interessante é quão pouco os separa no trabalho prático e quão muito os separa no preço. Este guia compara os dois em capacidade, custo, velocidade e adequação, com cada número identificado por fonte.

Nota de precisão: as pontuações de agente/codificação do V4 Flash são informadas pela DeepSeek (changelog oficial, 31/07/2026, harness da DeepSeek); as pontuações de GA (0813) do V4 Pro são igualmente informadas pela DeepSeek no mesmo harness, e nenhuma avaliação independente da build 0813 foi publicada até o momento. Os preços estão atualizados até 12 de agosto de 2026; o corte de preço do GA é repassado no OrcaRouter com margem de 0%. Os números do harness do fornecedor tendem a ser otimistas — verifique em suas próprias tarefas.

TL;DR. O V4 Flash é um MoE de 284B / 13B ativos a US$ 0,08 / US$ 0,18 por milhão de tokens; o V4 Pro é o carro-chefe muito maior, agora em sua build GA oficial (0813) a US$ 0,435 / US$ 0,87 — cerca de cinco vezes o preço do Flash, abaixo das aproximadamente quatorze vezes antes do corte de preços de agosto. Na codificação prática, o Flash fica a poucos pontos do Pro (ex.: SWE-bench Verified ~79% vs ~80,6%, conforme relatado por agregadores), e o upgrade de pós-treinamento -0731 torna o Flash um agente forte por direito próprio. Use o Pro para os raciocínios mais difíceis e para a codificação de múltiplos arquivos mais exigente; use o Flash para a maioria do alto volume — e roteie por dificuldade para obter a maior parte da qualidade do Pro por cerca de um quinto do custo.

Principais conclusões

• Tamanho e preço: Flash custa US$ 0,08 / US$ 0,18 com 284B / 13B ativos; Pro é o carro-chefe muito maior, a US$ 0,435 / US$ 0,87 — Flash custa cerca de um quinto do preço, e o corte de preço do GA da Pro reduziu a antiga diferença de ~14x para cerca de 5x.

• A lacuna de codificação é pequena: no agregador SWE-bench Verified, ~79% (Flash) vs ~80,6% (Pro, era de preview; a versão GA ainda não tem pontuações independentes); no harness da DeepSeek, a versão GA do Pro registra 87,9 no Terminal-Bench 2.1, contra 82,7 do Flash.

• Ambos compartilham o contexto de 1M de tokens e a saída de 384K; ambos são somente texto, com raciocínio, ferramentas e JSON.

• O Flash é mais rápido e mais barato de servir (p50 TTFT ~394 ms, ~184 tok/s); o Pro troca velocidade por capacidade máxima.

• Melhor prática: rotear por dificuldade — Flash para o volume, Pro para a minoria difícil.

O que cada modelo é

V4 Flash é a camada de eficiência: um modelo de mistura de especialistas com 284B no total, mas apenas ~13B de parâmetros ativos, contexto de 1M de tokens, até 384K de saída, otimizado para trabalho agêntico de alto volume e baixa latência. Sua versão oficial -0731 (31 de julho de 2026) é uma atualização de pós-treinamento que aprimorou os agentes, a programação e o uso de ferramentas, e adicionou suporte nativo a Responses-API e Codex. O V4 Pro é o carro-chefe da DeepSeek — um modelo muito maior, construído para os desafios mais difíceis de raciocínio e programação, onde a capacidade máxima importa mais do que o custo. Ele ficou em preview desde abril e depois passou para sua versão GA oficial em 12 de agosto de 2026, com um preço muito mais baixo. Ambos pertencem à mesma família V4 e compartilham o contexto de 1M, entrada somente de texto e suporte a raciocínio/ferramentas/JSON.

Capacidade: quão próximo o Flash está do Pro?

Mais próximos do que a diferença de preço sugere, pelo menos em codificação prática. Avaliações agregadoras colocam o V4 Flash (Max) em cerca de 79.0% no SWE-bench Verified — resolvendo problemas reais do GitHub — contra cerca de 80.6% do V4 Pro testado em sua era de preview. A versão GA (0813) é nova demais para pontuações independentes — nenhuma foi publicada ainda — então a melhor comparação disponível do Pro é o próprio harness da DeepSeek, onde a versão GA registra Terminal-Bench 2.1 87.9 e DeepSWE 62.7, contra os números -0731 do Flash, de 82.7 e 54.4 (todos informados pela DeepSeek). Onde o Pro se destaca é no extremo mais difícil: o raciocínio multi-etapas mais complexo, a codificação multi-arquivo mais complicada e tarefas onde um orçamento maior de parâmetros ativos realmente ajuda. Se a maior parte do seu trabalho é "difícil, mas não de fronteira", o Flash dá conta; reserve o Pro para a minoria genuinamente de fronteira.

Preço e velocidade: a vantagem decisiva do Flash

É aqui que os dois mais divergem — e onde a matemática acabou de mudar. O Flash custa $0.08 / $0.18 por milhão de tokens de entrada/saída; o build GA oficial do V4 Pro (0813) custa $0.435 / $0.87 — cerca de cinco vezes o preço do Flash. Isso ainda é um prêmio real, mas uma fração da diferença de ~14x antes do corte de preço: a listagem anterior do deepseek-v4-pro estava em $1.168 / $2.336, portanto o build GA é aproximadamente 63% mais barato. Em um mês de 10 milhões de tokens com 70% de entrada, o Flash fica em cerca de $1.10 e o Pro em cerca de $5.66 — a proporção se mantém conforme você escala para bilhões de tokens. O Flash também é feito para throughput (p50 TTFT ~394 ms, ~184 tok/s), então é a opção mais adequada para agentes sensíveis à latência e de alto volume. O prêmio do Pro compra capacidade de pico, não velocidade ou economia — mas com a diferença em ~5x em vez de ~14x, o preço dessa margem de topo caiu bastante.

O padrão correto: rotear por dificuldade

Você não precisa escolher um. A configuração de alta qualidade mais barata envia a maioria das solicitações, de fáceis a moderadas, para o Flash e escala apenas as mais difíceis para o Pro. Como ambos são da mesma família, com o mesmo contexto e as mesmas interfaces, esse roteamento é perfeito — e a atualização -0731 significa que o Flash agora lida com mais da camada intermediária antes que você precise escalar. Bem feito, o roteamento por dificuldade entrega a maior parte da qualidade do Pro por um custo próximo ao do Flash, e o corte de preço do GA torna a escalada ocasional para o Pro notavelmente mais barata do que era durante a prévia.

Qual você deve escolher?

Escolha V4 Flash se…

Você executa cargas de trabalho de alto volume, agentivas, de codificação ou de documentos longos, onde custo e velocidade importam, e a qualidade "quase de primeira linha" é suficiente — o que, após a atualização -0731, cobre muito terreno.

Escolha V4 Pro se…

Você precisa de capacidade máxima para o raciocínio mais difícil e a codificação multiarquivo mais exigente, e está disposto a pagar cerca de 5x o preço do Flash por esse espaço de sobra de alto nível — uma exigência muito mais fácil do que o prêmio de ~14x que o preço da era de pré-visualização carregava.

Use ambos por meio de um endpoint.

Ambos estão disponíveis em OrcaRouter com margem de 0% por meio de um endpoint compatível com OpenAI — Flash como deepseek/deepseek-v4-flash-0731 e Pro como o oficial deepseek/deepseek-v4-pro-0813 build GA — para que você possa implementar roteamento por dificuldade como uma escolha de configuração, avaliar ambos em suas próprias tarefas e alternar o tráfego sem reintegrar. Essa é a maneira mais simples de aproveitar as economias do Flash enquanto mantém o Pro à mão para a minoria difícil.

Perguntas Frequentes

O V4 Flash é tão bom quanto o V4 Pro?

Em codificação prática, quase — agregador SWE-bench Verified ~79% vs ~80.6% (era de pré-visualização para o Pro; a versão GA ainda não tem pontuações independentes). No raciocínio mais difícil e na codificação mais complexa, o Pro lidera. Para a maioria das cargas de trabalho, o Flash é suficiente após a atualização -0731.

Quanto mais barato é o V4 Flash?

O Flash custa cerca de um quinto do preço do Pro: $0,08 / $0,18 por milhão de tokens, contra $0,435 / $0,87 do GA Pro. Antes do corte de preços de agosto do Pro, a diferença era de ~14x; agora é de cerca de 5x.

Eles compartilham a mesma janela de contexto?

Sim — ambos oferecem um contexto de 1M tokens (1,048,576) e até 384K de saída.

Qual é mais rápido?

Flash, por design — p50 tempo até o primeiro token em torno de 394 ms e ~184 tokens/segundo, otimizado para uso de alto volume e baixa latência.

Posso usar ambos juntos?

Sim — roteie por dificuldade através do endpoint único do OrcaRouter: Flash para o volume, Pro para as tarefas mais difíceis.

Conclusão

{{1}}V4 Flash vs V4 Pro é eficiência versus capacidade de pico{{/1}}. {{2}}O Flash oferece a maior parte da capacidade prática de codificação do Pro, além de um agente genuinamente forte após a atualização {{3}}-0731{{/3}}, a cerca de um quinto do preço e com maior velocidade; o build GA oficial do Pro é o carro-chefe para os trabalhos mais difíceis, e seu corte de preço — para US$ 0,435 / US$ 0,87, cerca de cinco vezes o Flash em vez dos antigos quatorze — torna esse topo de linha {{4}}mais acessível do que nunca{{/4}}. A jogada inteligente não é escolher um ou outro — é fazer o roteamento por dificuldade através de um único endpoint como o OrcaRouter, de modo que o volume rode barato no Flash e apenas a minoria difícil pague pelo Pro.{{/2}}

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube