
Ling-3.0-flash-VL vs. DeepSeek V4 Flash Vision Exp: dos apuestas por la visión abierta
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Ling-3.0-flash-VL y DeepSeek V4 Flash Vision Exp son los dos modelos de visión de pesos abiertos en esta clase de peso que un equipo puede descargar y servir de forma realista hoy, y fueron creados por personas que no coinciden en para qué sirve la visión. Ling-3.0-flash-VL, del laboratorio inclusionAI de Ant Group, activa alrededor de 5.5B de sus 124B parámetros por token y trata la visión como algo que debe aplicarse dentro de un bucle de retroalimentación —generar, renderizar, mirar, corregir— al costo de inferencia más bajo posible. DeepSeek V4 Flash Vision Exp, el primer desarrollo multimodal de DeepSeek, combina una ventana de contexto de 1M de tokens con 384K tokens de salida máxima y trata la visión como una entrada más que un agente lee en su camino a terminar un trabajo largo. Uno está optimizado para lo poco que cuesta pensar. El otro está optimizado para lo mucho que puede contener mientras lo hace.
Esa diferencia, no un delta de benchmark, es lo que debería guiar la elección. Los dos modelos no tienen un protocolo de evaluación compartido con el que compararse, y solo uno de ellos tiene siquiera una puntuación independiente. Lo que sigue es la forma honesta del enfrentamiento: las apuestas arquitectónicas, las especificaciones que realmente divergen, la situación de los benchmarks, incluyendo por qué es escasa, cuánto cuesta cada uno y cuál gana para qué trabajo — además de la parte en la que decimos sin rodeos cuál de los dos está en nuestro catálogo.
Las dos apuestas, enunciadas con precisión.
El lado Ling de esto es una apuesta por la esparsidad de activación como la palanca de costo principal. Ling-3.0-flash-VL es una mezcla de expertos dispersa con 124B de parámetros totales —la tarjeta del modelo muestra alrededor de 124.8B, y el recetario de SGLang describe 5.1B activos donde la tarjeta dice aproximadamente 5.5B— ejecutando un tronco híbrido de 42 capas que alterna Kimi Delta Attention con bloques MLA con compuerta en una proporción de 5:1. Un codificador de visión de resolución arbitraria y un proyector MLP de dos capas alimentan ese tronco, con VideoRoPE encargándose de la posición espacial y temporal para que los fotogramas de video queden en un orden coherente. La consecuencia arquitectónica es un modelo cuyo costo por token es una pequeña fracción de un denso de 124B, que es exactamente la razón por la que aparece en la frontera de inteligencia versus parámetros activos.
El lado de DeepSeek es una apuesta por el contexto y la resistencia agéntica. DeepSeek V4 Flash Vision Exp toma la arquitectura de texto de DeepSeek-V4-Flash y añade un codificador de visión y un alineador, luego continúa el entrenamiento — una fuente sitúa el resultado en torno a 305B parámetros, algo que DeepSeek no ha confirmado en detalle. Tiene una ventana de contexto de 1.048.576 tokens y 384.000 tokens de salida máxima, admite salida JSON, llamadas a herramientas, la API de Responses, la API de Anthropic y la continuación con prefijo de conversación, y DeepSeek ha sido explícito en que este no es un modelo de preguntas y respuestas visuales. Es percepción para agentes: leer capturas de pantalla web, interfaces de software y gráficos, y luego continuar con llamadas a herramientas. Las imágenes se convierten en tokens y se facturan como tales, con un límite de 384 tokens por imagen.
Lee esos dos párrafos juntos y la forma de la decisión aparece. Si tu carga de trabajo consiste en “mirar esto, decidir algo, actuar, volver a mirar”, el recuento de parámetros activos de Ling es lo que hace que el bucle sea asequible y su diseño de retroalimentación visual apunta exactamente a eso. Si tu carga de trabajo consiste en “leer este documento de 400 páginas que contiene figuras y seguir adelante”, la ventana de contexto de DeepSeek es la característica y nada del lado de Ling compite con ella.
Por qué la comparación de benchmarks es más endeble de lo que parece
Esta es la sección que la mayoría de las comparativas omiten, y omitirla produce una tabla de números que no significa nada. Este es el estado real de la evidencia.
Ling-3.0-flash-VL tiene una medición independiente: 25 en el Artificial Analysis Intelligence Index v4.3, clasificado en el puesto n.º 2 de 64 en su clase de tamaño frente a una mediana de clase de 8. La ficha del proveedor afirma por separado 42 en el protocolo Intelligence Index v4.1.1, que es una escala retirada y no comparable; considera el 42 como no reproducido.
DeepSeek V4 Flash Vision Exp no tiene ninguna página de Artificial Analysis en absoluto. Todos los números publicados para él son de DeepSeek, proceden del anuncio de lanzamiento, y varios de ellos son explícitamente relativos a Opus-4.8 en lugar de a un protocolo fijo. Eso no es una crítica a los números; es una afirmación sobre lo que se puede hacer con ellos. No se puede poner un modelo puntuado de forma independiente y un modelo puntuado solo por el proveedor en la misma columna y declarar un ganador, y cualquier página que lo haga está fabricando un resultado.
Lo que es legítimo es comparar cada modelo con su propio historial declarado, con la procedencia adjunta:
• Ling-3.0-flash-VL, independiente — Intelligence Index 25 en v4.3, n.º 2 de 64 en su clase, mediana de clase 8, según Artificial Analysisbr /> • Ling-3.0-flash-VL, proveedor — 42 en el protocolo retirado v4.1.1, y 1.441 frente a los 1.440 de GPT-5.4 en la Image-to-WebDev Arena como "linthium"; ambos reportados por el proveedor y el margen de la arena está dentro del ruido de Elobr /> • DeepSeek V4 Flash Vision Exp, proveedor — Terminal Bench 2.1 83,9; DeepSWE 59,3 frente a los 58,0 de Opus-4.8; Agents' Last Exam 27,3 frente a los 25,7 de Opus-4.8; Toolathlon-Verified 75,9; Cybergym 75,3; Chartography 64,3; NL2Repo 57,7; DSBench-Hard 63,6; ZeroBench Pass@5 35,0; ApexBench Pass@1 36,5; AutomationBench 25,7br /> • DeepSeek V4 Flash Vision Exp, independiente — ninguno publicado
Fíjate en de qué se compone mayormente la lista de DeepSeek: evaluaciones de agentes e ingeniería de software, no evaluaciones de visión. El propio planteamiento de DeepSeek es que, en tareas de texto puro, el modelo de visión iguala al DeepSeek-V4-Flash oficial sin ninguna regresión, y que las mejoras se dan en los benchmarks de agentes multimodales, donde DeepSeek describe el resultado como cercano a Opus-4.8 en lugar de superarlo, y admite una brecha de unos diez puntos en las tareas estructuradas de ciencia de datos y código NL2Repo y DSBench-Hard. Ese es un conjunto de afirmaciones inusualmente prudente, y te indica que el modelo se vende como una mejora de percepción para una pila de agentes ya existente, y no como un nuevo techo.

Las especificaciones que realmente divergen
La mayor parte de las dos fichas técnicas coincide: ambas son de pesos abiertos bajo MIT, ambas aceptan texto e imágenes como entrada y devuelven texto, ambas incluyen pesos BF16 con compilaciones cuantizadas, ambas tienen recetas de servicio publicadas y ambas manejan video de alguna forma. Las divergencias se concentran en cuatro puntos.
• Parámetros — Ling-3.0-flash-VL tiene 124B en total con aproximadamente 5,5B activos por token; se reporta que DeepSeek V4 Flash Vision Exp ronda los 305B sin ninguna cifra publicada de parámetros activosbr /> • Ventana de contexto — Ling-3.0-flash-VL mide 262K tokens según Artificial Analysis frente a los 256K que indica su propia ficha de modelo; DeepSeek V4 Flash Vision Exp alcanza 1.048.576 tokens de forma nativabr /> • Salida máxima — Ling-3.0-flash-VL es mucho más corta, en las decenas de miles de tokens; DeepSeek V4 Flash Vision Exp llega a 384.000br /> • Manejo de imágenes — Ling-3.0-flash-VL acepta hasta 40 imágenes por solicitud de hasta 16.384 × 784 píxeles cada una, solo en base64; DeepSeek V4 Flash Vision Exp acepta base64, URL externas o una referencia de la Files API, y limita el coste de imagen a 384 tokens por imagenbr /> • Parámetros activos — Ling-3.0-flash-VL activa aproximadamente 5,5B por token; DeepSeek V4 Flash Vision Exp no ha publicado ninguna cifra de parámetros activos
La fila del manejo de imágenes es la que queda subestimada. Un límite máximo estricto de 384 tokens por imagen significa que un gráfico denso o una captura de pantalla de página completa se comprime hasta un presupuesto más o menos equivalente al de una miniatura: barato, y con pérdida de una manera que importa para las tareas de lectura detallada. El enfoque de Ling va en la dirección opuesta: un presupuesto de píxeles por imagen muy grande, transporte exclusivamente en base64 y, por lo tanto, una carga útil de solicitud mucho más pesada. Cuál sea mejor depende enteramente de si tus imágenes son fotografías de documentos que necesitas leer con precisión, o capturas de pantalla de interfaces que necesitas entender de forma aproximada.
La segunda fila subestimada es la salida máxima. El techo de decenas de miles de tokens de Ling-3.0-flash-VL está bien para un bucle de describir y luego corregir, y resulta limitante para cualquier cosa que quiera emitir un artefacto grande — un archivo largo generado, una reescritura completa de un documento, un diff de varios miles de líneas. La salida de 384K de DeepSeek existe precisamente porque su carga de trabajo prevista termina en un resultado grande de llamada a herramienta o en un artefacto generado. Si tu pipeline espera que el modelo devuelva algo largo, esa única fila decide el enfrentamiento antes de que lo haga cualquier benchmark.
Precio, y la diferencia entre gratis y sin precio
DeepSeek V4 Flash Vision Exp tiene una cifra real en nuestro catálogo: $0.24 por 1M de tokens de entrada y $0.73 por 1M de tokens de salida, con una ventana de contexto de 1,048,576 tokens y una salida máxima de 384,000 tokens, accesible como deepseek/deepseek-v4-flash-vision-exp. Es una tarifa publicada, facturada de la misma forma que el V4-Flash de texto, con imágenes convertidas a tokens a hasta 384 por imagen. Es una tarifa que puedes poner en una hoja de cálculo.
Ling-3.0-flash-VL no tiene ninguna. La página de Artificial Analysis lo lista en $0,00 por 1M de entrada y $0,00 por 1M de salida frente a medianas de $0,14 y $0,40 entre sus pares, pero eso refleja la prueba gratuita que se ejecuta en Ling Studio de Ant, no una tarifa. La documentación multimodal de Ant no publica ningún precio por token para el modelo de visión, así que no hay nada con lo que contrastar el cero. Su hermano solo de texto, Ling-3.0-flash, se ha listado en torno a $0,075 por 1M de entrada y $0,22 por 1M de salida, y los lanzamientos de Ling específicos de dominio de Ant salieron como API gratuitas, lo que sugiere una forma final similar — pero una sugerencia no es un precio.
Si los ponemos uno al lado del otro con honestidad, la comparación de costos es esta: un modelo tiene una tarifa, el otro tiene una ventana promocional y una conjetura plausible. Cualquiera que afirme que Ling-3.0-flash-VL es más barato que DeepSeek V4 Flash Vision Exp está comparando una prueba gratuita con un precio de lista. La afirmación defendible es que Ling-3.0-flash-VL muy probablemente sea más barato por token una vez que se fije su precio, porque 5.5B de parámetros activos es una ventaja estructural que ningún cambio de tarifa borra — con la salvedad de que la verbosidad de Ling-3.0-flash-VL merma parte de esa ventaja. Artificial Analysis registra que consume 160M tokens de salida en el Intelligence Index, clasificado en el puesto n.º 8 de 64 frente a una mediana de 84M y etiquetado como «muy verboso». Pagas por cada token emitido, así que un modelo que dice casi el doble para llegar a la misma respuesta devuelve parte de lo que gana con su activación dispersa.
¿Cuál, para qué?
El árbol de decisión honesto se bifurca según el contexto y la longitud de salida antes que por cualquier otra cosa, porque esas son las dimensiones en las que los dos modelos no son sustitutos.
Elige DeepSeek V4 Flash Vision Expcuando tu trabajo sea largo y termine en un artefacto: documentos de varios cientos de páginas con figuras, bases de código leídas de principio a fin, bucles de agentes que necesitan emitir un resultado grande, cargas de trabajo en las que quieres pasar una imagen mediante URL o una referencia de Files API en lugar de base64, y pipelines en los que necesitas la Responses API, la continuación de prefijo o una tarifa publicada por token con la que puedas presupuestar. También es el único de los dos con un proveedor que afirma tener paridad con su propio modelo de texto en tareas de texto, lo cual importa si un modelo está reemplazando a dos en tu stack.
Elige Ling-3.0-flash-VL cuando tu restricción vinculante sea el coste por llamada y tu ciclo sea corto: automatización de GUI, inspección repetida de capturas de pantalla, generación de front-end con un ciclo de renderizar y corregir, comprobaciones puntuales de documentos médicos o financieros en las que necesites alta resolución por imagen y puedas aceptar una salida pequeña. El recuento de 5,5B de parámetros activos es la razón para elegirlo, la licencia MIT es la razón por la que es seguro autoalojarlo, y el diseño de bucle de retroalimentación visual está orientado exactamente al patrón observar-actuar-verificar-corregir. Ten en cuenta que estás eligiendo un modelo sin precio establecido, con una vía de entrada gratuita y sin ningún compromiso sobre lo que venga después.
Y si lo que en realidad necesitas es un solo modelo que lea imágenes con solvencia sin ninguno de los dos extremos —sin truco de dispersión de 5.5B, sin ventana de un millón de tokens—, entonces ninguno de estos dos es la respuesta interesante, y los modelos de visión ordinarios de gama media te servirán mejor y más barato que cualquiera de los dos especialistas.
Ejecutarlos, y dónde encajamos con honestidad
DeepSeek V4 Flash Vision Exp está en nuestro catálogo. Puedes llamarlo a través del endpoint compatible con OpenAI de OrcaRouter con la cadena de modelo deepseek/deepseek-v4-flash-vision-exp, usando la misma clave que utilizas para todo lo demás, a la tarifa publicada de $0.24/$0.73 sin nada añadido: el precio de lista del proveedor se transmite tal cual, así que si DeepSeek recorta la tarifa, te llega el mismo día en lugar de en la próxima renovación de contrato. Si vas a incorporar un modelo de visión a una ruta de producción por primera vez, este es el más seguro de los dos para empezar sobre una capa de enrutamiento, porque puedes configurar una cadena de respaldo de modo que un error del proveedor se reintente contra otra ruta antes de que empiece tu respuesta. Nadie quiere que su primera llamada de visión en producción sea la que le enseñe lo que es el fallo de un único proveedor.

Ling-3.0-flash-VL no está en nuestro catálogo, y no vamos a insinuar lo contrario. Se puede acceder a él a través de la propia plataforma de Ant, que publica un endpoint compatible con OpenAI y otro compatible con Anthropic, mediante acceso de prueba gratuito en Ling Studio, y a través de los pesos abiertos en Hugging Face, que puedes servir tú mismo con la receta publicada de SGLang o con el propio fork de vLLM de Ant. Una cosa que conviene verificar antes de invertir en esa vía: los ejemplos de la API de Ant usan el identificador Ling-3.0-flash-VL-rc1, un marcador de release candidate, y si el checkpoint servido coincide con los pesos abiertos no se ha resuelto públicamente. Si haces un benchmark contra la API alojada esperando que las cifras se trasladen a un despliegue BF16 autoalojado, comprueba esa suposición primero.

El resumen que resiste el escrutinio: estas no son respuestas rivales a una misma pregunta. DeepSeek V4 Flash Vision Exp es una capa de percepción de contexto largo para agentes, con un precio publicado y una hoja de resultados de referencia reportada por el proveedor que se apoya en evaluaciones agénticas. Ling-3.0-flash-VL es un modelo de visión de bajo costo de servicio, con una única puntuación independiente genuina, un nivel gratuito sin precio publicado y un diseño orientado a bucles correctivos cortos. Ajusta la forma de tu carga de trabajo a la forma del modelo, y el hecho de que solo uno de ellos tenga una puntuación independiente en la tabla debería influir en cuánto peso le das al marketing del otro.
La misma clave llega al resto del catálogo, y puedes explorar el catálogo completo de modelos para ver qué más hay detrás de un endpoint compatible con OpenAI.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
