
Análise do DeepSeek V4: Os Modelos Sérios Mais Baratos de 1M de Tokens em IA?
- anthropicNOVOAnthropic: Claude Opus 52026-07-2461Inteligência78Código
- googleNOVOGoogle: Gemini 3.6 Flash2026-07-2150Inteligência69Código
- googleNOVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaNOVOMeta: Muse Spark 1.12026-07-1651Inteligência71Código
- kimiNOVOMoonshotAI: Kimi K32026-07-1557Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligência77Código
- grokxAI: Grok 4.52026-07-0854Inteligência72Código
- tencentTencent: Hy32026-07-0641Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
- z-aiZ.ai: GLM 5.22026-06-1651Inteligência69Código60Matemática
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligência61Código61Matemática
- anthropicAnthropic: Claude Fable 52026-06-0960Inteligência77Código
- qwenQwen: Qwen3.7 Plus2026-06-0139Inteligência56Código59Matemática
- minimaxMiniMax: MiniMax M32026-05-3144Inteligência59Código59Matemática
- AnthropicAnthropic: Claude Opus 4.82026-05-2856Inteligência74Código68Matemática
DeepSeek lançou a família V4 em 24 de abril de 2026 — dois modelos, V4-Pro e V4-Flash, ao vivo na API e de código aberto desde o primeiro dia — e silenciosamente redefiniu o padrão do que custa uma capacidade séria de IA. Ambos os modelos têm uma janela de contexto de 1 milhão de tokens como padrão, ambos oferecem modos de pensamento e não pensamento, e o principal V4-Pro custa no máximo US$ 0,87 por milhão de tokens de saída: um preço que supera todos os modelos comparáveis de 1 milhão de contexto no mercado, abertos ou fechados.
E julho é o mês das decisões. Em um aviso datado de 29 de junho, a DeepSeek confirmou que a versão oficial do V4 chega em meados de julho de 2026, prometendo melhorias de recursos e desempenho — e introduzindo preços de pico que dobram as tarifas durante os horários comerciais de Pequim. Dez dias depois, em 24 de julho, os nomes dos modelos legados `deepseek-chat` e `deepseek-reasoner` serão aposentados de vez. Esta análise cobre o que o V4 realmente é, quanto custa hoje e após o lançamento oficial, onde ele vence, onde claramente não vence, e o que fazer antes dos prazos.
Veredito rápido
Considere o DeepSeek V4 se você…
- Executar cargas de trabalho de produção de alto volume onde o custo unitário decide o que é viável — o preço do V4 está em uma classe própria.
Precisa de contexto longo de forma barata: 1 milhão de tokens padrão, até 384 mil tokens de saída por resposta, com descontos agressivos de cache de contexto.
- Quer integração drop-in — a API fala tanto os formatos OpenAI ChatCompletions quanto Anthropic, então as ferramentas existentes funcionam quase sempre.
- Valorize pesos abertos e opções de auto-hospedagem, especialmente o menor V4-Flash
Adie (ou desvie) se você…
- Execute agentes autônomos de longo horizonte — na tabela de comparação entre modelos publicada por Z.ai, o V4-Pro fica atrás tanto do GLM-5.2 quanto da fronteira fechada em benchmarks de estilo maratona.
- Precisa de entrada de imagem: V4 é apenas texto
- Confie em preços fixos 24 horas por dia — a partir do lançamento oficial em meados de julho de 2026, as tarifas de horário de pico dobram durante as janelas de negócios de Pequim (fora do pico mantém as tarifas atuais)
O que é DeepSeek V4?
V4 é a quarta geração da família de modelos da DeepSeek, lançada como dois modelos Mixture-of-Experts. DeepSeek-V4-Pro é o carro-chefe: 1,6 trilhão de parâmetros totais com 49 bilhões ativos por token. DeepSeek-V4-Flash é a camada de eficiência: 284 bilhões no total, 13 bilhões ativos. Ambos executam uma janela de contexto de 1M tokens por padrão nos serviços oficiais da DeepSeek e oferecem dois modos — pensamento para problemas difíceis, não pensante para velocidade — sob os IDs de modelo deepseek-v4-pro e `deepseek-v4-flash`.
Dois detalhes de posicionamento são importantes. Primeiro, o V4 foi lançado como uma pré-visualização que a DeepSeek trata como utilizável em produção — e de acordo com o aviso da empresa de 29 de junho, a versão oficial chega em meados de julho de 2026 com "otimizações de recursos e melhorias de desempenho." Segundo, foi lançado de código aberto, continuando o padrão da DeepSeek de liberar pesos publicamente — o que mantém a auto-hospedagem e o ajuste fino na mesa, realisticamente para o Flash 284B mais do que para o Pro 1.6T.
Quais são as novidades do DeepSeek V4?

Um contexto de 1M-tokens como padrão, não um upsell.Todo serviço oficial do DeepSeek agora oferece a janela completa de um milhão de tokens como padrão — sem SKU de contexto longo separado, sem taxa premium.
Amplo espaço de saída. Ambos os modelos suportam até 384K tokens de saída por resposta — o triplo do que a maioria dos concorrentes com contexto de 1M permite — o que é importante para geração de código de arquivo inteiro, extrações estruturadas longas e escrita de relatórios.
Modos duplos em um único endpoint.Modo de pensamento para problemas difíceis, modo sem pensamento para chamadas rápidas e baratas, alternável por requisição em vez de por modelo.
Dois níveis com um formato de API. Pro para capacidade, Flash para volume — mesmo contexto, mesmos modos, mesma integração.
Compatibilidade de API dupla. O V4 fala nativamente tanto os formatos OpenAI ChatCompletions quanto Anthropic API, então a maioria das ferramentas de agente existentes se conectam sem reescrita.
Preços: quanto realmente custa

Esta é a seção que torna o V4 famoso. V4-Pro custa $0.435 por milhão de tokens de entrada e $0.87 por milhão de saída. V4-Flash custa $0.14 e $0.28.Acertos de cache em contexto repetido são listados a bem abaixo de um centavo por milhão de tokens — efetivamente gratuitos para loops de agente que releem o mesmo estado do projeto.
Para escala: GLM-5.2, por si só celebrado como o melhor custo-benefício do verão, custa $1,40 / $4,40. Claude Sonnet 5 custa $3 / $15, Claude Opus 4.8 $5 / $25. O preço de saída do V4-Pro é um quinto do GLM-5.2 e aproximadamente 3% do Opus 4.8. Mesmo que o V4-Pro perca algumas comparações diretas de qualidade — e ele perde — a economia muda quais perguntas valem a pena fazer a qualquer modelo.
Uma mudança está chegando com o lançamento oficial. De acordo com o aviso da DeepSeek de 29 de junho, a partir de meados de julho, todos os preços dos tokens dobram durante os horários de pico — 09:00–12:00 e 14:00–18:00 horário de Pequim — enquanto as horas fora de pico mantêm as tarifas atuais. Mesmo duplicado, o preço de saída de pico do V4-Pro (cerca de $1.74 por milhão) ainda é inferior à tarifa padrão do GLM-5.2, mas a era do preço fixo termina com a prévia: se seu tráfego atingir o pico durante o horário comercial chinês, modele a variação — ou agende e roteie ao redor dela.
Pontuação da avaliação
As pontuações abaixo são nossa avaliação editorial baseada na documentação oficial da DeepSeek e na tabela de benchmarks entre modelos publicada pela Z.ai — trate os números entre fornecedores como contexto de terceiros, e não como alegações da própria DeepSeek.

- Codificação: 8/10 — capaz em engenharia do dia a dia; não é o líder de peso aberto
- Uso agentivo / de ferramentas: 7/10 — boa orquestração de ferramentas, fraco em autonomia de longa duração
- Raciocínio: 8/10 — boas notas em matemática e ciências para a classe de preço
- Eficiência de custo: 10/10 — nada comparável chega perto
- Contexto e documentos longos: 9/10 — 1M entrada, 384K saída, acertos de cache quase gratuitos
- Velocidade: 8/10 — contagens de parâmetros ativos enxutas, além de um modo sem raciocínio para caminhos rápidos
Geral: ~8.3/10 — o rei do custo-benefício de meados de 2026, com um asterisco de longo prazo.
Prós
- Preço que redefine a curva: $0,14–$0,87 por milhão de tokens em toda a família.
Padrão de contexto de 1M com saída de 384K — o maior limite de saída em sua classe.
Modos de pensamento e não-pensamento em um único endpoint, comutável por requisição
A compatibilidade de API da OpenAI e da Anthropic significa atrito de migração próximo de zero.
- Pesos de código aberto mantêm a auto-hospedagem e o ajuste fino em aberto.
Contras
- O trabalho agente de longo horizonte é a clara fraqueza — na tabela publicada pela Z.ai, V4-Pro pontua 29.0 no FrontierSWE onde GLM-5.2 obtém 74.4 e Claude Opus 4.8 75.1
Apenas texto: sem entrada de imagem na API V4.
- A precificação de horário de pico chega com o lançamento oficial de meados de julho — as tarifas dobram durante as janelas comerciais de Pequim, então os orçamentos deixam de ser planos.
- Ainda é uma prévia até meados de julho, então o comportamento pode mudar com a versão oficial.
- A aposentadoria do deepseek-chat e deepseek-reasoner em 24 de julho de 2026 força os usuários legados a migrarem no cronograma da DeepSeek.
- Auto-hospedar o Pro de 1,6 trilhão de parâmetros é impraticável para quase todos (Flash, com 284B, é o alvo realista).
Como o DeepSeek V4 se compara

V4-Pro vs V4-Flash.Mesmo contexto, mesmos modos, mesma API — a diferença é qualidade versus throughput com uma diferença de preço de 3x. Um padrão sensato: Flash para resumos, extração, classificação e chat; Pro para código, análise e qualquer coisa que um humano revise.
vs GLM-5.2.A disputa de pesos abertos do verão, e é genuinamente equilibrada em valor. GLM-5.2 é o codificador mais forte — na tabela publicada da Z.ai, ele lidera o V4-Pro por 81.0 a 64.0 no Terminal-Bench 2.1 e domina trabalhos de horizonte longo (74.4 contra 29.0 no FrontierSWE) — enquanto a V4 contrapõe com preços 3 a 5 vezes menores e o triplo do teto de saída. Os pipelines de volume tendem para V4; os agentes de codificação tendem para GLM-5.2.
versus a fronteira fechada. Claude Opus 4.8 e GPT-5.5 continuam sendo modelos claramente mais fortes em benchmarks difíceis. Mas com uma diferença de preço por saída de 30 a 60 vezes versus Opus 4.8, o V4 não está tentando vencer essa luta — ele está tentando tornar 90% do seu tráfego barato demais para justificar o envio para qualquer outro lugar.
O prazo de 24 de julho: migração de nomes legados

Se sua integração ainda chama `deepseek-chat` ou `deepseek-reasoner`, esses nomes param de funcionar após 24 de julho de 2026, 15:59 UTC. Atualmente eles roteiam para V4-Flash, o que significa que seu tráfego já está rodando na economia V4 — mas após o corte, as requisições falham completamente. A migração em si é uma linha (`model: "deepseek-v4-pro"` ou `"deepseek-v4-flash"`), então o trabalho real é re-testar prompts contra o comportamento V4 e decidir, endpoint por endpoint, qual camada cada carga de trabalho merece — ou colocar um roteador na frente para que a próxima descontinuação seja uma alteração de configuração em vez de uma alteração de código.
Quem deve usar DeepSeek V4?
Produtos de alto volume — suporte, sumarização, extração, classificação — onde o preço do V4 torna recursos marginais lucrativos
Cargas de trabalho de documentos longos e com uso intensivo de RAG que preenchem janelas de 1 milhão de tokens diariamente e lucram com acessos ao cache quase gratuitos.
Equipes gerando saídas longas: bases de código, relatórios, dados estruturados — 384K de saída é o teto da classe
Construtores conscientes dos custos que desejam um padrão capaz e estão satisfeitos em escalar os 10% difíceis em outro lugar.
Quem deve procurar em outro lugar?
Equipes cuja carga de trabalho principal são agentes autônomos de longa duração — GLM-5.2 ou um flagship fechado é a via mais segura
Fluxos de trabalho dependentes de visão (V4 não captura imagens)
Qualquer pessoa que precise de um rótulo contratual 'stable' hoje, em vez de uma pré-visualização.
O DeepSeek V4 vale a pena?
Pelo preço, com certeza sim — como uma via, não uma religião. O V4 não supera o melhor codificador de peso aberto (GLM-5.2) nem os carros-chefe de fronteira em qualidade, e seus números de agente de longo horizonte são genuinamente fracos. O que ele faz é tornar enormes porções do trabalho cotidiano de IA — os resumos, extrações, rascunhos e trocas de chat que dominam as contas reais de tokens — quase nada custam. O padrão vencedor é o V4 como piso de volume, com vias de escalada acima dele.
Veredito final
O DeepSeek V4 é o benchmark de custo-benefício contra o qual todos os outros modelos agora são medidos — nossa nota: ~8,3/10. Use o Flash onde o volume é prioridade, o Pro onde a qualidade importa mas os orçamentos são reais, e direcione o trabalho de alto nível para um modelo mais forte. Refaça sua matemática de custos quando os preços de pico chegarem em meados de julho — o barato continua barato, mas deixa de ser fixo. E se você ainda usa deepseek-chat ou deepseek-reasoner: tem até 24 de julho. Migre.
Usando DeepSeek V4 através do OrcaRouter
Uma estratégia de três faixas — V4 para volume, um modelo aberto ou fechado mais forte para tarefas difíceis, e uma alternativa de fallback para confiabilidade — é exatamente a configuração que é dolorosa de executar manualmente e trivial por trás de um gateway. O OrcaRouter serve o DeepSeek V4 junto com GLM-5.2, Claude, GPT, Gemini e mais de 200 outros modelos através de um único endpoint compatível com OpenAI, pelos preços da lista de provedores sem margem de token: o roteamento inteligente seleciona a faixa por requisição, o failover automático cobre os contratempos da era de pré-visualização, e a observabilidade por modelo mostra o custo real de cada faixa por tarefa concluída. Ele também neutraliza mudanças do lado do provedor, como a aposentadoria do nome em 24 de julho ou os preços de pico de meados de julho — quando um nome de modelo morre ou uma janela de preço se abre, você atualiza uma regra de roteamento, não seu código-fonte.


Perguntas Frequentes
O DeepSeek V4 já está disponível?
Sim — V4-Pro e V4-Flash estão disponíveis na API DeepSeek desde 24 de abril de 2026, sob os IDs de modelo deepseek-v4-pro e deepseek-v4-flash, com pesos de código aberto. Oficialmente, é uma prévia; o aviso da DeepSeek de 29 de junho coloca a versão oficial em meados de julho de 2026.
Qual é o preço de horário de pico do DeepSeek?
Anunciado para o lançamento oficial: a partir de meados de julho de 2026, todos os preços dos tokens dobram durante os horários comerciais de Pequim (09:00-12:00 e 14:00-18:00, horário de Pequim), enquanto os horários de menor movimento mantêm as taxas atuais. O tráfego que atinge pico fora do horário comercial chinês — a maioria das cargas de trabalho ocidentais — evita amplamente a sobretaxa.
O que acontece com deepseek-chat e deepseek-reasoner?
Eles atualmente roteiam automaticamente para V4-Flash, mas após 24 de julho de 2026 (15:59 UTC) ambos os nomes serão totalmente retirados e as solicitações falharão. Atualize o parâmetro do modelo explicitamente antes do prazo.
Devo usar V4-Pro ou V4-Flash?
Flash para trabalho de volume que um humano nunca revisa linha por linha — resumos, extração, classificação, chat. Pro para código, análise e rascunho, a aproximadamente 3 vezes o preço do Flash, mas ainda muito abaixo de qualquer modelo comparável.
O DeepSeek V4 é melhor que o GLM-5.2?
Mais barato, não melhor. Na tabela publicada da Z.ai, o GLM-5.2 lidera claramente em codificação e domina o trabalho de agentes de longo horizonte; a V4 contrapõe com preços 3–5x mais baixos, um teto de saída de 384K e hits de cache quase gratuitos. Muitas equipes usam ambos: V4 para volume, GLM-5.2 para agentes de codificação.
DeepSeek V4 pode lidar com imagens?
Não — a API V4 é apenas texto. Encaminhe tarefas de visão (capturas de tela, PDFs como pixels, gráficos) para um modelo multimodal como Claude ou Gemini.
Posso hospedar o DeepSeek V4 por conta própria?
Os pesos são de código aberto, mas seja realista sobre a escala: V4-Pro é um MoE de 1,6T parâmetros — território de data center — enquanto o V4-Flash de 284B é o alvo prático de auto-hospedagem para equipes com bons recursos.
O V4 funciona com minhas ferramentas existentes do OpenAI ou do Claude?
Principalmente sim — a API suporta nativamente os formatos OpenAI ChatCompletions e Anthropic, portanto frameworks de agentes e SDKs construídos para qualquer um deles geralmente se conectam com uma alteração de base-URL e model-name.
Posso usar o DeepSeek V4 através do OrcaRouter?
Sim — os modelos DeepSeek estão disponíveis no OrcaRouter pelos preços da lista de provedores sem margem, ao lado do GLM, Claude, GPT e Gemini, para que você possa executar a divisão de volume mais escalonamento por trás de um endpoint.
Pronto para tornar sua fatura de tokens monótona? Crie sua conta OrcaRouter, aponte seu cliente compatível com OpenAI para um endpoint e direcione o volume para o DeepSeek V4 enquanto modelos mais fortes lidam com o cume — com markup zero de tokens e uma integração à prova de 24 de julho.
