Una tarjeta de título hero para 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash' con el subtítulo 'Mismo precio, uno ve', un icono lineal de ojo a la izquierda y un icono lineal de documento de texto a la derecha, separados por un divisor fino y neutro, y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash: Mismo precio, uno ve

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

DeepSeek V4 Flash Vision (Exp) y DeepSeek V4 Flash son el mismo modelo con exactamente una diferencia, y esa diferencia lo es todo: el modelo de visión ve imágenes y el modelo de texto no. Lanzado hoy, 21 de agosto de 2026, como una versión experimental, DeepSeek V4 Flash Vision (Exp) conserva el cerebro de texto de DeepSeek V4 Flash sin cambios: el mismo contexto de 1M de tokens, la misma salida máxima de 384K, los mismos precios por token — y añade la entrada de imágenes, lo que reordena sus puntuaciones en los benchmarks de agentes donde el modelo de texto falla silenciosamente. La única pregunta real es si "experimental" te cuesta más de lo que te ahorra.

Los dos modelos

DeepSeek V4 Flash es el caballo de batalla económico oficial de la empresa: un modelo de Mezcla de Expertos con aproximadamente 284 mil millones de parámetros en total y 13 mil millones activos, solo de texto, optimizado para cargas de trabajo cotidianas de alta concurrencia, con un presupuesto de concurrencia de 2500 tokens por segundo en la API del proveedor. DeepSeek V4 Flash Vision (Exp) pertenece a la misma familia de pesos con un codificador de visión al frente, facturado de forma idéntica y marcado como experimental. Todo lo que está por debajo de los ojos es compartido.

• Parámetros — Vision-Exp: 284B total / 13B MoE activo vs V4-Flash: 284B total / 13B MoE activo (misma familia)

• Entrada — Vision-Exp: texto + imágenes (JPEG, PNG, GIF, WebP) vs V4-Flash: solo texto

• Contexto — Vision-Exp: 1M tokens vs V4-Flash: 1M tokens

• Salida máxima — Vision-Exp: 384K tokens vs V4-Flash: 384K tokens

• Modos de pensamiento — ambos admiten pensamiento y no pensamiento

• Formatos de API — ambos: Chat Completions, Messages, Responses

• Precio — idéntico (ambos facturan a las tarifas de tokens pico/valle de V4-Flash)

• Estado — Vision-Exp: experimental, sin fecha de GA vs V4-Flash: lanzamiento oficial (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Donde la visión cambia el marcador

En texto puro, Deep​Seek dice que ambos están a la par, y no hay razón para dudarlo: el modelo de visión está construido sobre la misma capacidad de texto. La divergencia aparece en los benchmarks de agentes que contienen capturas de pantalla, gráficos e imágenes de interfaz de usuario, donde el modelo solo de texto ignora literalmente el contenido multimodal. Todas las cifras a continuación son reportadas por el proveedor en la nota de lanzamiento de hoy, no reproducidas de forma independiente:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2

• El último examen de los agentes — Vision-Exp 27.3 vs V4-Flash 25.2

• Terminal-Bench 2.1 — Vision-Exp 83.9 frente a V4-Flash 82.7

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4

• Chartography — Vision-Exp 64.3 (V4-Flash no puede intentarlo)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash no puede intentarlo)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

El mayor salto individual es ApexBench, donde añadir visión eleva la puntuación de 26,2 a 36,5 — un cambio de diez puntos que no se debe a que el modelo piense más, sino a que por fin lee la tarea. Para un agente que opera a través de una pantalla — un navegador, un escritorio, una terminal con salida renderizada — el modelo de texto volaba a ciegas precisamente en las partes de la tarea que contienen la información.

La pregunta del precio tiene una respuesta.

No hay diferencia de precio, y aquí es donde la comparación se convierte en una decisión obvia en una dirección. DeepSeek V4 Flash Vision (Exp) factura exactamente a las mismas tarifas que DeepSeek V4 Flash, que desde el 16 de agosto de 2026 han sido de pico/valle:

• Entrada, cache miss — $0.22 por 1M tokens en horas valle, $0.44 en horas punta (ambos modelos)

• Entrada, acierto de caché — $0.007 por 1M de tokens en horas valle, $0.014 en horas punta (ambos modelos)

• Salida — $0.66 por 1M de tokens fuera de horas punta, $1.32 en horas punta (ambos modelos)

• Horas punta — 01:00–04:00 y 06:00–10:00 UTC, ambos modelos

El único coste adicional que aporta la visión es la propia imagen: cada imagen se tokeniza en hasta 384 tokens, por lo que una captura de pantalla cuesta aproximadamente 0,0085 céntimos fuera de las horas punta. Incluso un agente con mucho uso de visión que lea 50 imágenes por ejecución añade menos de un céntimo de entrada. Elegir el modelo de texto para ahorrar dinero es elegir céntimos en lugar de vista — el ahorro no es real.

Cuándo elegir cuál

Elige DeepSeek V4 Flash Vision (Exp) si tu pipeline puede recibir alguna vez una imagen. Agentes de pruebas de UI y de control de calidad basados en capturas de pantalla, agentes de navegación web que necesitan leer la página en la que están, extracción de gráficos y diagramas, capturas de pantalla de documentos, capturas de mensajes de error desde la pantalla de un usuario — en todos esos casos, el modelo de visión es estrictamente mejor al mismo precio. No hay penalización en la calidad del texto, según el proveedor, así que la única razón para no usarlo es la estabilidad.

Elige DeepSeek V4 Flash si tu tráfico es texto puro y nada de eso cambiará. Para completado de código, recuperación y bucles de agentes solo de texto, los dos modelos puntúan igual en texto y el lanzamiento oficial es la apuesta más segura por definición. Si ya estás en V4-Flash y nunca envías una imagen, no hay razón para cambiar — y tampoco hay razón para no tener la opción en tu configuración de enrutamiento.

La única diferencia real: estado experimental

Todo lo que hay por encima de los ojos es idéntico; el costo de la visión es insignificante; los benchmarks favorecen al modelo de visión. El único factor que puede legítimamente mantenerte en DeepSeek V4 Flash en producción es que el modelo de visión es experimental. Deep​Seek lo etiqueta así, no da una fecha de disponibilidad general (GA), y afirma que no se recomienda para uso en producción. El cerebro de texto que está detrás está probado, pero el camino de visión es nuevo, y una superficie de API experimental es exactamente donde no quieres un fallo silencioso a las 2 a. m.

Este es el único lugar donde la comparación no se resuelve con las especificaciones, y también es el único lugar donde un router cambia la respuesta. En OrcaRouter ambos modelos están activos — deepseek/deepseek-v4-flash-vision-exp y deepseek/deepseek-v4-flash — bajo una única clave de API al precio de lista del proveedor, traspasada sin margen alguno. Como la misma plataforma enruta ambos, puedes adoptar el modelo de visión donde demuestra su valía y fijar el resto a la versión oficial, con conmutación automática ante fallos para que un contratiempo experimental nunca derribe todo el pipeline. Obtienes la mejora de diez puntos en ApexBench en las llamadas que la necesitan y la estabilidad de la versión oficial en las que no, sin un segundo contrato ni una segunda ruta de código.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

En resumen

Si tu carga de trabajo puede recibir imágenes, DeepSeek V4 Flash Vision (Exp) supera a DeepSeek V4 Flash en todos los ejes que importan y solo pierde en el eje que puedes sortear con ingeniería: el estado experimental. Si tu carga de trabajo es texto puro, los modelos son iguales en cuanto a salida y la versión oficial gana en estabilidad. Los dos no son realmente competidores: el modelo de visión es el modelo de texto con una habilidad desbloqueada, sin costo adicional. La única decisión que vale la pena tomar es cuánto de tu tráfico estás dispuesto a apuntar a una API experimental, y eso es una decisión de enrutamiento, no una decisión de modelo.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube