
DeepSeek V4 Flash Vision (Exp) ya está disponible en la API: mismo precio que V4-Flash, ahora con ojos
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
DeepSeek V4 Flash Vision (Exp) se lanzó hoy, 21 de agosto de 2026, en la plataforma API de DeepSeek, y el número más importante del anuncio no es un benchmark: es el precio. Este modelo de visión experimental factura exactamente las mismas tarifas por token que DeepSeek V4 Flash, el versátil modelo de solo texto cuyas capacidades puras iguala por completo. Esto supone la primera vez que la API propia de DeepSeek acepta imágenes, y significa que la forma más barata de ejecutar un agente con contexto de 1M se vuelve multimodal gratis.
Lo que realmente se envió
DeepSeek V4 Flash Vision (Exp) es un modelo multimodal experimental, al que se accede con el ID de modelo deepseek-v4-flash-vision-exp. Acepta texto e imágenes como entrada y produce texto como salida, en una ventana de contexto de 1M de tokens con una salida máxima de 384K, en modos de razonamiento y no razonamiento. Es compatible con el formato Chat Completions, Mensajes de estilo Anthropic y el formato Responses, que es el trío que un framework de agentes necesita para integrarlo sin un adaptador personalizado.
En la entrada de imágenes, DeepSeek acepta JPEG, PNG, GIF y WebP, transmitidos de tres formas: base64 en línea, una URL externa o un archivo subido a través de la nueva API de Files. Aún no hay entrada de video o audio: la "visión" aquí es solo de imágenes fijas.

El propio posicionamiento de DeepSeek, en su nota de lanzamiento: la capacidad de texto puro — agentes, razonamiento, conocimiento del mundo — está a la par con el lanzamiento oficial de DeepSeek V4 Flash, mientras que la capacidad de agente multimodal da un gran salto y se acerca a Opus-4.8. Esa es una afirmación del proveedor, no reproducida, y vale la pena leerla con atención, porque el detalle de los benchmarks detrás de ella es más interesante que el titular.
Por qué el salto del benchmark es mayor de lo que parece
Todas las siguientes cifras son propias de DeepSeek, publicadas hoy en la nota de lanzamiento, no verificadas de forma independiente. En los benchmarks de agentes que incorporan capturas de pantalla e imágenes, el DeepSeek V4 Flash, solo texto, no las lee: simplemente ignora las partes multimodales de la tarea. DeepSeek V4 Flash Vision (Exp) sí las mira, por lo que las diferencias son tan grandes:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)
• Último Examen de los Agentes — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (V4-Flash de solo texto no puede intentarlo)
• ZeroBench Pass@5 — Vision-Exp 35.0 (el V4-Flash de solo texto no puede intentarlo)

Dos de esos números merecen una segunda mirada. En Agents' Last Exam, Vision-Exp (27.3) supera por poco a Opus-4.8 (25.7), y en DeepSWE también vence a Opus-4.8 (59.3 frente a 58.0). En eso se basa realmente lo de «cerca de Opus-4.8»: no en un único resultado destacado, sino en un conjunto de benchmarks agénticos donde ver la pantalla cierra la mayor parte de la brecha con el modelo multimodal de frontera, mientras lo subvende en precio por aproximadamente un orden de magnitud.
Lo que cuesta una imagen, hasta el decimal
Las imágenes se tokenizan para la facturación — hasta 384 tokens cada una — y luego se cobran a las mismas tarifas por token que DeepSeek V4 Flash. Debido a que DeepSeek trasladó todos sus modelos a precios punta/valle el 16 de agosto de 2026, los números exactos dependen de cuándo llames:
• Entrada, fallo de caché: $0,22 por 1M de tokens fuera de horas pico, $0,44 en horas pico
• Entrada, acierto de caché — $0.007 por 1M de tokens fuera de horas punta, $0.014 en horas punta
• Salida — $0.66 por 1M de tokens en horas valle, $1.32 en horas pico
• Horas punta — 01:00–04:00 y 06:00–10:00 UTC (todas las demás horas son valle)
Haz los cálculos y el costo de la visión casi desaparece. Una imagen en su límite de 384 tokens cuesta unos 0,0085 centavos fuera de horas punta y 0,017 centavos en horas punta, como entrada. Un agente que lee 50 capturas de pantalla en una sola ejecución añade aproximadamente medio centavo de tokens de entrada — antes incluso de que el modelo escriba su primer token de salida. DeepSeek también limita la resolución antes de la inferencia: el nivel de detalle bajo reduce a 512×512, y el alto/original escala previamente la imagen (las pequeñas hasta aproximadamente 384×384, las grandes hasta aproximadamente 800×800), de modo que una imagen original de alta resolución nunca se alimenta al modelo con su recuento de píxeles nativo.
El reparto secundario: una API de Files gratuita y Harness 0.1.1
Dos componentes de infraestructura se lanzaron junto con el modelo. La API de Files ya está disponible y es gratuita: sube una imagen una sola vez, haz referencia a ella mediante file_id y reutilízala en varias solicitudes sin tener que reenviar los bytes — algo relevante para un agente de navegación que mantiene una página en contexto a lo largo de varios turnos. Y DeepSeek Harness 0.1.1, publicado el mismo día, ofrece compatibilidad nativa con el nuevo modelo, por lo que el harness que evalúa y ejecuta las cargas de trabajo agénticas de DeepSeek puede utilizarlo de inmediato.
La advertencia de producción, expresada claramente
Este es un modelo experimental. DeepSeek lo etiqueta explícitamente como tal, no ha anunciado ninguna fecha de disponibilidad general y recomienda no ejecutarlo directamente en producción; el plan declarado es iterar sobre los comentarios y lanzar una versión estable más adelante. La consecuencia práctica es que el cerebro de texto está probado — es la misma familia de pesos que impulsa V4-Flash — pero la ruta de visión es código nuevo, y nadie fuera de DeepSeek lo ha sometido a pruebas de estrés a escala.
Esa es exactamente la situación en la que una capa de enrutamiento demuestra su utilidad. En OrcaRouter, tanto deepseek/deepseek-v4-flash-vision-exp como deepseek/deepseek-v4-flash están activos detrás de una sola API, al precio de lista de DeepSeek transmitido sin ningún margen. Puede dirigir el tráfico con imágenes al modelo experimental y, en la misma configuración, establecer una conmutación por error automática a un respaldo en el momento en que falle o se agote el tiempo de espera, lo que reduce el riesgo de todo el problema del «código nuevo». El DSL de enrutamiento también le permite enviar solo las llamadas que realmente contienen imágenes al modelo de visión y mantener el tráfico de solo texto en DeepSeek V4 Flash, capturando las ganancias de referencia donde existen y sin pagar nada extra donde no existen.

Qué ver a continuación
Las preguntas abiertas son las habituales para un lanzamiento experimental. ¿Cuándo llega DeepSeek V4 Flash Vision (Exp) a GA y se mantendrá el precio? ¿Seguirán las entradas de vídeo o audio? — el modelo hoy solo procesa imágenes fijas, lo que deja a los grandes modelos multimodales de frontera sin oposición en los medios en movimiento. ¿Y las evaluaciones independientes (la primera ejecución de terceros en ApexBench o Terminal-Bench) reproducirán las cifras publicadas? Lo interesante es que, incluso si todos los benchmarks bajan, la única afirmación que ya es rentable — visión a precios de texto — es un hecho de precios, no una afirmación basada en benchmarks, y eso no necesita reproducirse.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
