Una tarjeta de título principal para DeepSeek-V4-Flash-Vision-Exp con el subtítulo 'Mismo precio que V4-Flash, ahora con ojos', un icono de línea de ojo y etiqueta de precio, una pequeña insignia redondeada que dice 'EXPERIMENTAL • API • 2026-08-21', y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) ya está disponible en la API: mismo precio que V4-Flash, ahora con ojos

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

DeepSeek V4 Flash Vision (Exp) se lanzó hoy, 21 de agosto de 2026, en la plataforma API de DeepSeek, y el número más importante del anuncio no es un benchmark: es el precio. Este modelo de visión experimental factura exactamente las mismas tarifas por token que DeepSeek V4 Flash, el versátil modelo de solo texto cuyas capacidades puras iguala por completo. Esto supone la primera vez que la API propia de DeepSeek acepta imágenes, y significa que la forma más barata de ejecutar un agente con contexto de 1M se vuelve multimodal gratis.

Lo que realmente se envió

DeepSeek V4 Flash Vision (Exp) es un modelo multimodal experimental, al que se accede con el ID de modelo deepseek-v4-flash-vision-exp. Acepta texto e imágenes como entrada y produce texto como salida, en una ventana de contexto de 1M de tokens con una salida máxima de 384K, en modos de razonamiento y no razonamiento. Es compatible con el formato Chat Completions, Mensajes de estilo Anthropic y el formato Responses, que es el trío que un framework de agentes necesita para integrarlo sin un adaptador personalizado.

En la entrada de imágenes, Deep​Seek acepta JPEG, PNG, GIF y WebP, transmitidos de tres formas: base64 en línea, una URL externa o un archivo subido a través de la nueva API de Files. Aún no hay entrada de video o audio: la "visión" aquí es solo de imágenes fijas.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

El propio posicionamiento de Deep​Seek, en su nota de lanzamiento: la capacidad de texto puro — agentes, razonamiento, conocimiento del mundo — está a la par con el lanzamiento oficial de Deep​Seek V4 Flash, mientras que la capacidad de agente multimodal da un gran salto y se acerca a Opus-4.8. Esa es una afirmación del proveedor, no reproducida, y vale la pena leerla con atención, porque el detalle de los benchmarks detrás de ella es más interesante que el titular.

Por qué el salto del benchmark es mayor de lo que parece

Todas las siguientes cifras son propias de DeepSeek, publicadas hoy en la nota de lanzamiento, no verificadas de forma independiente. En los benchmarks de agentes que incorporan capturas de pantalla e imágenes, el DeepSeek V4 Flash, solo texto, no las lee: simplemente ignora las partes multimodales de la tarea. DeepSeek V4 Flash Vision (Exp) sí las mira, por lo que las diferencias son tan grandes:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)

• Último Examen de los Agentes — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (V4-Flash de solo texto no puede intentarlo)

• ZeroBench Pass@5 — Vision-Exp 35.0 (el V4-Flash de solo texto no puede intentarlo)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Dos de esos números merecen una segunda mirada. En Agents' Last Exam, Vision-Exp (27.3) supera por poco a Opus-4.8 (25.7), y en DeepSWE también vence a Opus-4.8 (59.3 frente a 58.0). En eso se basa realmente lo de «cerca de Opus-4.8»: no en un único resultado destacado, sino en un conjunto de benchmarks agénticos donde ver la pantalla cierra la mayor parte de la brecha con el modelo multimodal de frontera, mientras lo subvende en precio por aproximadamente un orden de magnitud.

Lo que cuesta una imagen, hasta el decimal

Las imágenes se tokenizan para la facturación — hasta 384 tokens cada una — y luego se cobran a las mismas tarifas por token que DeepSeek V4 Flash. Debido a que Deep​Seek trasladó todos sus modelos a precios punta/valle el 16 de agosto de 2026, los números exactos dependen de cuándo llames:

• Entrada, fallo de caché: $0,22 por 1M de tokens fuera de horas pico, $0,44 en horas pico

• Entrada, acierto de caché — $0.007 por 1M de tokens fuera de horas punta, $0.014 en horas punta

• Salida — $0.66 por 1M de tokens en horas valle, $1.32 en horas pico

• Horas punta — 01:00–04:00 y 06:00–10:00 UTC (todas las demás horas son valle)

Haz los cálculos y el costo de la visión casi desaparece. Una imagen en su límite de 384 tokens cuesta unos 0,0085 centavos fuera de horas punta y 0,017 centavos en horas punta, como entrada. Un agente que lee 50 capturas de pantalla en una sola ejecución añade aproximadamente medio centavo de tokens de entrada — antes incluso de que el modelo escriba su primer token de salida. Deep​Seek también limita la resolución antes de la inferencia: el nivel de detalle bajo reduce a 512×512, y el alto/original escala previamente la imagen (las pequeñas hasta aproximadamente 384×384, las grandes hasta aproximadamente 800×800), de modo que una imagen original de alta resolución nunca se alimenta al modelo con su recuento de píxeles nativo.

El reparto secundario: una API de Files gratuita y Harness 0.1.1

Dos componentes de infraestructura se lanzaron junto con el modelo. La API de Files ya está disponible y es gratuita: sube una imagen una sola vez, haz referencia a ella mediante file_id y reutilízala en varias solicitudes sin tener que reenviar los bytes — algo relevante para un agente de navegación que mantiene una página en contexto a lo largo de varios turnos. Y Deep​Seek Harness 0.1.1, publicado el mismo día, ofrece compatibilidad nativa con el nuevo modelo, por lo que el harness que evalúa y ejecuta las cargas de trabajo agénticas de Deep​Seek puede utilizarlo de inmediato.

La advertencia de producción, expresada claramente

Este es un modelo experimental. Deep​Seek lo etiqueta explícitamente como tal, no ha anunciado ninguna fecha de disponibilidad general y recomienda no ejecutarlo directamente en producción; el plan declarado es iterar sobre los comentarios y lanzar una versión estable más adelante. La consecuencia práctica es que el cerebro de texto está probado — es la misma familia de pesos que impulsa V4-Flash — pero la ruta de visión es código nuevo, y nadie fuera de Deep​Seek lo ha sometido a pruebas de estrés a escala.

Esa es exactamente la situación en la que una capa de enrutamiento demuestra su utilidad. En OrcaRouter, tanto deepseek/deepseek-v4-flash-vision-exp como deepseek/deepseek-v4-flash están activos detrás de una sola API, al precio de lista de Deep​Seek transmitido sin ningún margen. Puede dirigir el tráfico con imágenes al modelo experimental y, en la misma configuración, establecer una conmutación por error automática a un respaldo en el momento en que falle o se agote el tiempo de espera, lo que reduce el riesgo de todo el problema del «código nuevo». El DSL de enrutamiento también le permite enviar solo las llamadas que realmente contienen imágenes al modelo de visión y mantener el tráfico de solo texto en DeepSeek V4 Flash, capturando las ganancias de referencia donde existen y sin pagar nada extra donde no existen.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

Qué ver a continuación

Las preguntas abiertas son las habituales para un lanzamiento experimental. ¿Cuándo llega DeepSeek V4 Flash Vision (Exp) a GA y se mantendrá el precio? ¿Seguirán las entradas de vídeo o audio? — el modelo hoy solo procesa imágenes fijas, lo que deja a los grandes modelos multimodales de frontera sin oposición en los medios en movimiento. ¿Y las evaluaciones independientes (la primera ejecución de terceros en ApexBench o Terminal-Bench) reproducirán las cifras publicadas? Lo interesante es que, incluso si todos los benchmarks bajan, la única afirmación que ya es rentable — visión a precios de texto — es un hecho de precios, no una afirmación basada en benchmarks, y eso no necesita reproducirse.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube