
DeepSeek V4 Flash Vision (Exp) Chega à API: Mesmo Preço do V4-Flash, Agora com Olhos
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
DeepSeek V4 Flash Vision (Exp) entrou no ar hoje, 21 de agosto de 2026, na plataforma de API da DeepSeek, e o número mais importante do anúncio não é um benchmark — é o preço: este modelo de visão experimental cobra exatamente as mesmas taxas de tokens que o DeepSeek V4 Flash, o cavalo de batalha somente de texto cuja capacidade de texto puro ele iguala por completo. Isso faz desta a primeira vez que a própria API da DeepSeek aceita imagens, e significa que a maneira mais barata de executar um agente de contexto de 1M acabou de se tornar multimodal gratuitamente.
O que realmente foi lançado
DeepSeek V4 Flash Vision (Exp) é um modelo multimodal experimental, acessado com o ID de modelo deepseek-v4-flash-vision-exp. Ele recebe texto e imagens e produz texto, em uma janela de contexto de 1M de tokens com saída máxima de 384K, nos modos com e sem pensamento. Ele suporta o formato Chat Completions, Messages no estilo Anthropic e o formato Responses, que é o trio que um framework de agentes precisa para integrá-lo sem um adaptador personalizado.
Na entrada de imagens, o DeepSeek aceita JPEG, PNG, GIF e WebP, fornecidos de três formas: base64 embutido, uma URL externa ou um arquivo enviado pela nova Files API. Ainda não há entrada de vídeo ou áudio — a "visão" aqui é apenas de imagens estáticas.

A própria posição da DeepSeek, em sua nota de lançamento: capacidade de texto puro — agentes, raciocínio, conhecimento de mundo — está no mesmo nível do lançamento oficial do DeepSeek V4 Flash, enquanto a capacidade de agente multimodal dá um salto significativo e fica próxima do Opus-4.8. Essa é uma afirmação do fornecedor, não reproduzida, e que vale a pena ler com atenção, porque o detalhe do benchmark por trás dela é mais interessante do que o título.
Por que o salto no benchmark é maior do que parece
Todos os números a seguir são da própria DeepSeek, publicados hoje na nota de lançamento, não verificados de forma independente. Nos benchmarks de agentes que incorporam capturas de tela e imagens, o DeepSeek V4 Flash somente texto não os lê — ele simplesmente ignora as partes multimodais da tarefa. O DeepSeek V4 Flash Vision (Exp) realmente olha, e é por isso que os deltas são tão grandes:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (V4-Flash somente texto não pode tentar)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash somente texto não pode tentar)

Dois desses números merecem uma segunda olhada. No Agents' Last Exam, o Vision-Exp (27.3) supera por pouco o Opus-4.8 (25.7), e no DeepSWE ele também vence o Opus-4.8 (59.3 contra 58.0). É nisso que "próximo do Opus-4.8" realmente se baseia — não em um único resultado de destaque, mas em uma faixa de benchmarks agênticos em que ver a tela fecha a maior parte da lacuna para o modelo multimodal de fronteira, ao mesmo tempo em que o subcotiza em preço por cerca de uma ordem de grandeza.
Quanto custa uma imagem, até o decimal
As imagens são tokenizadas para faturamento — até 384 tokens cada — e depois cobradas pelas mesmas taxas por token que o DeepSeek V4 Flash. Como a DeepSeek transferiu todos os seus modelos para o preço de pico/fora de pico em 16 de agosto de 2026, os números exatos dependem de quando você fizer a chamada:
• Entrada, cache miss — US$ 0,22 por 1M de tokens fora do pico, US$ 0,44 no pico
• Entrada, cache hit — $0,007 por 1M de tokens fora de pico, $0,014 no pico
Saída — US$ 0,66 por 1M de tokens fora do horário de pico, US$ 1,32 no horário de pico
• Horários de pico — 01:00–04:00 e 06:00–10:00 UTC (todos os outros horários fora de pico)
Faça as contas e o custo da visão quase desaparece. Uma imagem no seu limite de 384 tokens custa cerca de 0,0085 centavos fora do pico e 0,017 centavos no pico, como entrada. Um agente que lê 50 capturas de tela em uma única execução adiciona aproximadamente meio centavo de tokens de entrada — antes mesmo de o modelo escrever seu primeiro token de saída. O DeepSeek também limita a resolução antes da inferência: o nível de detalhe baixo redimensiona para 512×512, e o alto/original pré-escala a imagem (as pequenas até cerca de 384×384, as grandes para cerca de 800×800), de modo que um original em alta resolução nunca é alimentado ao modelo em sua contagem nativa de pixels.
O elenco de apoio: uma API Files gratuita e o Harness 0.1.1
Dois componentes de infraestrutura foram lançados junto com o modelo. A API Files está no ar e é gratuita: envie uma imagem uma vez, referencie-a por file_id e reutilize-a em várias solicitações sem reenviar os bytes — algo significativo para um agente de navegação que mantém uma página em contexto ao longo de várias interações. E o DeepSeek Harness 0.1.1, lançado no mesmo dia, tem suporte imediato para o novo modelo, de modo que o harness que executa benchmarks e impulsiona cargas de trabalho de agentes do DeepSeek pode usá-lo imediatamente.
A ressalva de produção, declarada claramente
Este é um modelo experimental. A DeepSeek o rotula explicitamente como tal, não anunciou nenhuma data de GA e recomenda contra executá-lo diretamente em produção; o plano declarado é iterar com base no feedback e lançar uma versão estável mais tarde. A consequência prática é que o cérebro de texto é comprovado — é a mesma família de pesos que alimenta o V4-Flash — mas o caminho de visão é código novo, e ninguém fora da DeepSeek o testou sob estresse em escala.
Essa é exatamente a situação em que uma camada de roteamento mostra seu valor. No OrcaRouter, tanto deepseek/deepseek-v4-flash-vision-exp quanto deepseek/deepseek-v4-flash estão ativos por trás de uma única API, pelo preço da lista da DeepSeek, repassado sem nenhum acréscimo. Você pode direcionar o tráfego com imagens para o modelo experimental e, na mesma configuração, definir um failover automático para uma alternativa no momento em que ele apresentar erro ou expirar — o que reduz o risco de todo o problema de "código novo". O DSL de roteamento também permite que você envie apenas as chamadas que realmente contêm imagens para o modelo de visão e mantenha o tráfego de texto puro no DeepSeek V4 Flash, capturando os ganhos de benchmark onde eles existem e não pagando nada extra onde não existem.

O que assistir em seguida
As perguntas em aberto são as usuais para um lançamento experimental. Quando o DeepSeek V4 Flash Vision (Exp) chega à disponibilidade geral, e o preço se mantém? A entrada de vídeo ou áudio vem depois — o modelo é hoje apenas de imagens estáticas, o que deixa os grandes modelos multimodais de fronteira sem oposição em mídia em movimento. E as avaliações independentes (a primeira execução de terceiros no ApexBench ou Terminal-Bench) reproduzem os números publicados? O interessante é que, mesmo que todos os benchmarks caiam, a única afirmação que já é econômica — visão a preço de texto — é um fato de precificação, não uma afirmação de benchmark, e isso não precisa ser reproduzido.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
