Um cartão de título hero para o DeepSeek-V4-Flash-Vision-Exp com o subtítulo 'Mesmo preço do V4-Flash, agora com olhos', um ícone linear de olho e etiqueta de preço, um pequeno selo arredondado com o texto 'EXPERIMENTAL • API • 2026-08-21' e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) Chega à API: Mesmo Preço do V4-Flash, Agora com Olhos

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

DeepSeek V4 Flash Vision (Exp) entrou no ar hoje, 21 de agosto de 2026, na plataforma de API da Deep​Seek, e o número mais importante do anúncio não é um benchmark — é o preço: este modelo de visão experimental cobra exatamente as mesmas taxas de tokens que o DeepSeek V4 Flash, o cavalo de batalha somente de texto cuja capacidade de texto puro ele iguala por completo. Isso faz desta a primeira vez que a própria API da Deep​Seek aceita imagens, e significa que a maneira mais barata de executar um agente de contexto de 1M acabou de se tornar multimodal gratuitamente.

O que realmente foi lançado

DeepSeek V4 Flash Vision (Exp) é um modelo multimodal experimental, acessado com o ID de modelo deepseek-v4-flash-vision-exp. Ele recebe texto e imagens e produz texto, em uma janela de contexto de 1M de tokens com saída máxima de 384K, nos modos com e sem pensamento. Ele suporta o formato Chat Completions, Messages no estilo Anthropic e o formato Responses, que é o trio que um framework de agentes precisa para integrá-lo sem um adaptador personalizado.

Na entrada de imagens, o Deep​Seek aceita JPEG, PNG, GIF e WebP, fornecidos de três formas: base64 embutido, uma URL externa ou um arquivo enviado pela nova Files API. Ainda não há entrada de vídeo ou áudio — a "visão" aqui é apenas de imagens estáticas.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

A própria posição da DeepSeek, em sua nota de lançamento: capacidade de texto puro — agentes, raciocínio, conhecimento de mundo — está no mesmo nível do lançamento oficial do DeepSeek V4 Flash, enquanto a capacidade de agente multimodal dá um salto significativo e fica próxima do Opus-4.8. Essa é uma afirmação do fornecedor, não reproduzida, e que vale a pena ler com atenção, porque o detalhe do benchmark por trás dela é mais interessante do que o título.

Por que o salto no benchmark é maior do que parece

Todos os números a seguir são da própria Deep​Seek, publicados hoje na nota de lançamento, não verificados de forma independente. Nos benchmarks de agentes que incorporam capturas de tela e imagens, o DeepSeek V4 Flash somente texto não os lê — ele simplesmente ignora as partes multimodais da tarefa. O DeepSeek V4 Flash Vision (Exp) realmente olha, e é por isso que os deltas são tão grandes:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (V4-Flash somente texto não pode tentar)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash somente texto não pode tentar)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Dois desses números merecem uma segunda olhada. No Agents' Last Exam, o Vision-Exp (27.3) supera por pouco o Opus-4.8 (25.7), e no DeepSWE ele também vence o Opus-4.8 (59.3 contra 58.0). É nisso que "próximo do Opus-4.8" realmente se baseia — não em um único resultado de destaque, mas em uma faixa de benchmarks agênticos em que ver a tela fecha a maior parte da lacuna para o modelo multimodal de fronteira, ao mesmo tempo em que o subcotiza em preço por cerca de uma ordem de grandeza.

Quanto custa uma imagem, até o decimal

As imagens são tokenizadas para faturamento — até 384 tokens cada — e depois cobradas pelas mesmas taxas por token que o DeepSeek V4 Flash. Como a Deep​Seek transferiu todos os seus modelos para o preço de pico/fora de pico em 16 de agosto de 2026, os números exatos dependem de quando você fizer a chamada:

• Entrada, cache miss — US$ 0,22 por 1M de tokens fora do pico, US$ 0,44 no pico

• Entrada, cache hit — $0,007 por 1M de tokens fora de pico, $0,014 no pico

Saída — US$ 0,66 por 1M de tokens fora do horário de pico, US$ 1,32 no horário de pico

• Horários de pico — 01:00–04:00 e 06:00–10:00 UTC (todos os outros horários fora de pico)

Faça as contas e o custo da visão quase desaparece. Uma imagem no seu limite de 384 tokens custa cerca de 0,0085 centavos fora do pico e 0,017 centavos no pico, como entrada. Um agente que lê 50 capturas de tela em uma única execução adiciona aproximadamente meio centavo de tokens de entrada — antes mesmo de o modelo escrever seu primeiro token de saída. O Deep​Seek também limita a resolução antes da inferência: o nível de detalhe baixo redimensiona para 512×512, e o alto/original pré-escala a imagem (as pequenas até cerca de 384×384, as grandes para cerca de 800×800), de modo que um original em alta resolução nunca é alimentado ao modelo em sua contagem nativa de pixels.

O elenco de apoio: uma API Files gratuita e o Harness 0.1.1

Dois componentes de infraestrutura foram lançados junto com o modelo. A API Files está no ar e é gratuita: envie uma imagem uma vez, referencie-a por file_id e reutilize-a em várias solicitações sem reenviar os bytes — algo significativo para um agente de navegação que mantém uma página em contexto ao longo de várias interações. E o Deep​Seek Harness 0.1.1, lançado no mesmo dia, tem suporte imediato para o novo modelo, de modo que o harness que executa benchmarks e impulsiona cargas de trabalho de agentes do Deep​Seek pode usá-lo imediatamente.

A ressalva de produção, declarada claramente

Este é um modelo experimental. A Deep​Seek o rotula explicitamente como tal, não anunciou nenhuma data de GA e recomenda contra executá-lo diretamente em produção; o plano declarado é iterar com base no feedback e lançar uma versão estável mais tarde. A consequência prática é que o cérebro de texto é comprovado — é a mesma família de pesos que alimenta o V4-Flash — mas o caminho de visão é código novo, e ninguém fora da Deep​Seek o testou sob estresse em escala.

Essa é exatamente a situação em que uma camada de roteamento mostra seu valor. No OrcaRouter, tanto deepseek/deepseek-v4-flash-vision-exp quanto deepseek/deepseek-v4-flash estão ativos por trás de uma única API, pelo preço da lista da Deep​Seek, repassado sem nenhum acréscimo. Você pode direcionar o tráfego com imagens para o modelo experimental e, na mesma configuração, definir um failover automático para uma alternativa no momento em que ele apresentar erro ou expirar — o que reduz o risco de todo o problema de "código novo". O DSL de roteamento também permite que você envie apenas as chamadas que realmente contêm imagens para o modelo de visão e mantenha o tráfego de texto puro no DeepSeek V4 Flash, capturando os ganhos de benchmark onde eles existem e não pagando nada extra onde não existem.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

O que assistir em seguida

As perguntas em aberto são as usuais para um lançamento experimental. Quando o DeepSeek V4 Flash Vision (Exp) chega à disponibilidade geral, e o preço se mantém? A entrada de vídeo ou áudio vem depois — o modelo é hoje apenas de imagens estáticas, o que deixa os grandes modelos multimodais de fronteira sem oposição em mídia em movimento. E as avaliações independentes (a primeira execução de terceiros no ApexBench ou Terminal-Bench) reproduzem os números publicados? O interessante é que, mesmo que todos os benchmarks caiam, a única afirmação que já é econômica — visão a preço de texto — é um fato de precificação, não uma afirmação de benchmark, e isso não precisa ser reproduzido.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube