
DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash: Mesmo Preço, Um Vê
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
DeepSeek V4 Flash Vision (Exp) e DeepSeek V4 Flash são o mesmo modelo com exatamente uma diferença, e essa diferença é toda a história: o modelo de visão vê imagens e o modelo de texto não. Lançado hoje, 21 de agosto de 2026, como uma versão experimental, o DeepSeek V4 Flash Vision (Exp) mantém o cérebro de texto do DeepSeek V4 Flash inalterado — o mesmo contexto de 1M tokens, a mesma saída máxima de 384K tokens, os mesmos preços por token — e adiciona entrada de imagens, o que reorganiza suas pontuações nos benchmarks de agentes em que o modelo de texto falha silenciosamente. A única questão real é se "experimental" custa mais do que economiza.
Os dois modelos
O DeepSeek V4 Flash é o cavalo de batalha econômico oficial da empresa: um modelo de Mistura de Especialistas com cerca de 284B de parâmetros totais e 13B ativos, somente texto, otimizado para cargas de trabalho cotidianas de alta concorrência, com um orçamento de concorrência de 2.500 tokens por segundo na API do fornecedor. O DeepSeek V4 Flash Vision (Exp) é a mesma família de pesos com um codificador de visão na frente, cobrado de forma idêntica e marcado como experimental. Tudo abaixo dos olhos é compartilhado.
• Parâmetros — Vision-Exp: 284B total / 13B MoE ativos vs V4-Flash: 284B total / 13B MoE ativos (mesma família)
• Entrada — Vision-Exp: texto + imagens (JPEG, PNG, GIF, WebP) vs V4-Flash: somente texto
• Contexto — Vision-Exp: 1M tokens vs V4-Flash: 1M tokens
• Saída máxima — Vision-Exp: 384K tokens vs V4-Flash: 384K tokens
• Modos de pensamento — ambos suportam pensamento e não-pensamento
• Formatos de API — ambos: Chat Completions, Messages, Responses
• Preço — idêntico (ambos cobram às tarifas de token de pico/fora de pico da V4-Flash)
• Status — Vision-Exp: experimental, sem data de GA vs V4-Flash: lançamento oficial (V4-Flash-0731)

Onde a visão muda o placar
Em texto puro, a DeepSeek diz que os dois estão em pé de igualdade, e não há razão para duvidar — o modelo de visão é construído a partir da mesma capacidade de texto. A divergência aparece em benchmarks de agentes que contêm capturas de tela, gráficos e imagens de UI, onde o modelo somente-texto literalmente ignora o conteúdo multimodal. Todos os valores abaixo são relatados pelo fornecedor na nota de lançamento de hoje, não reproduzidos de forma independente:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2
• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4
• Chartography — Vision-Exp 64.3 (V4-Flash não pode tentar)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash não pode tentar)

O maior salto individual é o ApexBench, onde adicionar visão eleva a pontuação de 26,2 para 36,5 — uma mudança de dez pontos que não resulta de o modelo pensar mais, mas sim de finalmente ler a tarefa. Para um agente que opera através de uma tela — um navegador, uma área de trabalho, um terminal com saída renderizada — o modelo de texto estava voando às cegas exatamente nas partes da tarefa que carregam a informação.
A questão do preço tem uma resposta.
Não há diferença de preço, e é aqui que a comparação se torna uma escolha óbvia em uma direção. DeepSeek V4 Flash Vision (Exp) cobra exatamente as mesmas tarifas que o DeepSeek V4 Flash, que desde 16 de agosto de 2026 têm sido pico/fora de pico:
• Entrada, cache miss — US$ 0,22 por 1M de tokens fora do horário de pico, US$ 0,44 no horário de pico (ambos os modelos)
• Entrada, cache hit — $0,007 por 1M de tokens fora do horário de pico, $0,014 no pico (ambos os modelos)
• Saída — $0,66 por 1M de tokens fora do horário de pico, $1,32 no horário de pico (ambos os modelos)
• Horários de pico — 01:00–04:00 e 06:00–10:00 UTC, ambos os modelos
O único custo adicional que a visão traz é a própria imagem: cada imagem é tokenizada em até 384 tokens, então uma captura de tela custa aproximadamente 0,0085 centavos fora do horário de pico. Mesmo um agente com uso intenso de visão, lendo 50 imagens por execução, adiciona menos de um centavo ao custo de entrada. Escolher o modelo de texto para economizar dinheiro é escolher centavos em vez de visão — a economia não é real.
Quando escolher qual
Escolha o DeepSeek V4 Flash Vision (Exp) se seu pipeline puder receber uma imagem. Agentes de teste de UI e QA baseado em capturas de tela, agentes de navegação web que precisam ler a página em que estão, extração de gráficos e diagramas, capturas de tela de documentos, capturas de mensagens de erro da tela do usuário — em todos esses casos, o modelo de visão é estritamente melhor pelo mesmo preço. Não há penalidade na qualidade do texto, segundo o fornecedor, então o único motivo para não usá-lo é a estabilidade.
Escolha o DeepSeek V4 Flash se o seu tráfego for puramente texto e nada nele mudar. Para conclusão de código, recuperação e loops de agente somente texto, os dois modelos pontuam igualmente em texto e o lançamento oficial é a aposta mais segura por definição. Se você já está no V4-Flash e nunca envia uma imagem, não há motivo para mudar — e também não há motivo para não ter a opção na sua configuração de roteamento.
A única diferença real: status experimental
Tudo acima dos olhos é idêntico; o custo da visão é insignificante; os benchmarks favorecem o modelo de visão. O único fator que pode legitimamente mantê-lo no DeepSeek V4 Flash em produção é o fato de o modelo de visão ser experimental. A DeepSeek o rotula assim, não fornece data de GA e afirma que ele não é recomendado para uso em produção. O cérebro de texto por trás dele é comprovado, mas o caminho da visão é novo, e uma superfície de API experimental é exatamente onde você não quer uma falha silenciosa às 2 da manhã.
Este é o único lugar onde a comparação não é resolvida pelas especificações, e também é o único lugar onde um roteador muda a resposta. No OrcaRouter, ambos os modelos estão ativos — deepseek/deepseek-v4-flash-vision-exp e deepseek/deepseek-v4-flash — atrás de uma única chave de API pelo preço de tabela do provedor, repassado sem nenhum acréscimo. Como a mesma plataforma roteia ambos, você pode adotar o modelo de visão onde ele se paga e fixar o restante na versão oficial, com failover automático para que um soluço experimental nunca derrube todo o pipeline. Você obtém o ganho de dez pontos no ApexBench nas chamadas que precisam dele e a estabilidade da versão oficial nas chamadas que não precisam, sem um segundo contrato ou um segundo caminho de código.

Conclusão
Se a sua carga de trabalho puder receber imagens, o DeepSeek V4 Flash Vision (Exp) supera o DeepSeek V4 Flash em todos os aspectos que importam e só perde naquele que você pode contornar com engenharia: o status experimental. Se a sua carga de trabalho for de texto puro, os modelos são equivalentes na saída e o lançamento oficial vence em estabilidade. Os dois não são realmente concorrentes — o modelo de visão é o modelo de texto com uma habilidade desbloqueada, sem custo adicional. A única decisão que vale a pena tomar é quanto do seu tráfego você está disposto a direcionar para uma API experimental, e isso é uma decisão de roteamento, não uma decisão de modelo.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
