Una tarjeta de título principal para la comparación 'Ling-3.0-flash-VL vs Ling 3.0 Flash' con el subtítulo 'Un cerebro de 124B, ahora con ojos'. Sobre el titular hay dos iconos lineales planos — un documento de texto a la izquierda y un ojo sobre un marco de foto a la derecha — y debajo del subtítulo, dos etiquetas separadas por un divisor fino: 'MISMO BACKBONE MOE HÍBRIDO-LINEAL' y 'UNA AÑADE ENTRADA NATIVA DE IMAGEN Y VIDEO'. No aparecen cifras ni precios. El logotipo de OrcaRouter se superpone en la esquina inferior derecha.
Guides & Insights

Ling-3.0-flash-VL vs Ling 3.0 Flash: un mismo cerebro de 124B, ahora con ojos

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ling-3.0-flash-VL y Ling 3.0 Flash no son rivales, y leer esta pareja como un enfrentamiento de modelos te llevará a una conclusión equivocada. Ling-3.0-flash-VL es el checkpoint de visión-lenguaje que el laboratorio inclusionAI de Ant Group lanzó esta semana — los pesos están en Hugging Face bajo una licencia MIT desde el 4 de septiembre de 2026 — y está construido directamente sobre Ling 3.0 Flash, el modelo de texto de pesos abiertos de 124 mil millones de parámetros del laboratorio que ha anclado su nivel rápido desde finales de julio. Ambos comparten el mismo diseño híbrido lineal de MoE, las mismas economías de activación dispersa, la misma receta de servicio con contexto de 256K y la misma licencia MIT. Lo que el checkpoint VL añade es lo único que el modelo de texto nunca tuvo: entrada nativa de imágenes y video, procesada a través de un codificador ViT, un proyector MLP de dos capas y codificación temporal VideoRoPE. Así que la comparación se reduce a una única pregunta práctica: si tu carga de trabajo nunca mira una imagen, ¿merece la pena cambiar al modelo con ojos?

La razón por la que la pregunta merece la pena plantearla es que inclusionAI no presenta Ling-3.0-flash-VL como una línea de producto separada. Su ficha de modelo lo llama «nuestro próximo modelo multimodal nativo», construido sobre Ling-3.0-flash, que hereda la capacidad de lenguaje, razonamiento y contexto largo de ese modelo y las extiende con una visión que participa en el bucle completo de comprensión, razonamiento, actuación y verificación — no una visión como entrada añadida. Para una familia de modelos cuyo lanzamiento insignia anterior era explícitamente solo texto, eso es un cambio real, y cambia sobre qué checkpoint debería estandarizarse un equipo de texto y herramientas.

Dos checkpoints, un backbone

Ling 3.0 Flash, el oponente en esta comparación, es el más maduro de los dos. Anunciado a finales de julio de 2026 y publicado como código abierto bajo la licencia MIT el 7 de agosto, es un modelo híbrido-lineal de mezcla de expertos con 124B de parámetros totales y aproximadamente 5.1B activos por token: 35 capas KDA y 7 capas Gated MLA apiladas en una proporción de 5:1, 512 expertos enrutados con 8 activados, un contexto nativo de 256K servido a 262,144 tokens. Es solo de texto, con soporte de llamada a herramientas, razonamiento habilitado por defecto a través de la plantilla de chat y un perfil de costo inusualmente bajo para su tamaño. Es también la mitad documentada del par: Artificial Analysis lo incluye en su tabla de clasificación en vivo, donde ocupa el primer puesto entre los 63 modelos de su clase, y ha medido una salida de aproximadamente 313 tokens por segundo en la API del proveedor.

Ling-3.0-flash-VL mantiene esa arquitectura y le añade una pila visual encima. La ficha describe un codificador visual ViT cuyas características se alinean en el espacio de texto mediante un proyector MLP de dos capas, con VideoRoPE codificando tanto la posición espacial como el orden temporal para que el modelo pueda hacer localización de eventos y razonamiento sobre vídeos largos. La columna vertebral es el mismo híbrido 5:1 de KDA a MLA, esta vez con 124B en total / 5,5B activos por token, y un tronco de 42 capas. Las entradas son texto, imagen y vídeo; la salida es texto. Se anuncia un contexto de hasta 1M de tokens, con la receta recomendada de SGLang sirviendo 256K mediante escalado YaRN. Al igual que su hermano de texto, viene con el modo de pensamiento activado por defecto (se desactiva por solicitud con chat_template_kwargs) y se ejecuta bajo SGLang o un fork personalizado de vLLM de inclusionAI. La versión BF16 ocupa unos 250 GB en disco repartidos en 64 fragmentos safetensor, la misma clase de cuarto de terabyte que los pesos del modelo de texto.

¿Qué tan reciente es? Al momento de redactar esto, el repositorio VL tiene un número de descargas en las docenas, su tarjeta de modelo todavía se estaba actualizando, y Artificial Analysis no lo ha listado. Todo lo que aparece a continuación que no esté explícitamente atribuido a Artificial Analysis es reporte propio de inclusionAI.

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash-VL, showing the header '@inclusionAI Ling-3.0-flash-VL', the 'Model card' and 'Files and versions' tabs, the introduction text 'We are introducing Ling-3.0-flash-VL, our next-generation native multimodal model' together with the 124B total / 5.5B activated / up to 1M context summary, and the right-hand sidebar noting License: mit, 42 downloads last month, Safetensors ~125B params, and 'This model isn't deployed — ask for provider support'.

El marcador

La asimetría aquí no es de calidad — es de modalidad. Seis dimensiones capturan la decisión:

Inteligencia (ficha del proveedor, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, reportado por el proveedor. Ling 3.0 Flash: 38, la cifra anterior del índice que cita la tarjeta.

Tablero en vivo de AA de hoy (v4.3) — Ling-3.0-flash-VL: aún no listado. Ling 3.0 Flash: estimado 25, clasificado #1 de 63 en su categoría.

Entradas — Ling-3.0-flash-VL: texto, imagen y video. Ling 3.0 Flash: solo texto.

Contexto — ambos afirman hasta 1M de tokens; ambos se sirven prácticamente a 256K (262,144) hoy.

Precio — Ling-3.0-flash-VL: aún sin precio de lista; únicamente pesos abiertos MIT. Ling 3.0 Flash: alrededor de $0.07 por 1M de entrada y $0.22 por 1M de salida en la API de primera parte del proveedor.

Elígelo para — Ling-3.0-flash-VL: documentos, capturas de pantalla, gráficos, vídeo y agentes que actúan en la GUI. Ling 3.0 Flash: llamada a herramientas con gran carga de texto y pipelines agénticos de horizonte largo.

A two-column scoreboard titled 'Ling-3.0-flash-VL vs Ling 3.0 Flash — the scoreboard'. Left column 'Ling-3.0-flash-VL': 'Intelligence (vendor card, AA Index v4.1.1): 42 — vendor-reported', 'AA live board today (v4.3): not listed yet', 'Inputs: text, image, video', 'Context: up to 1M; 256K recipe', 'Price: no list price — MIT open weights', 'Pick it for: documents, video, GUI agents'. Right column 'Ling 3.0 Flash': 'Intelligence (vendor card, AA Index v4.1.1): 38 — earlier AA figure', 'AA live board today (v4.3): 25 estimated, #1 of 63 in class', 'Inputs: text only', 'Context: 256K native; 1M claimed', 'Price: $0.07 / $0.22 per 1M (vendor API)', 'Pick it for: text-heavy agentic pipelines'. Footer reads 'VL figures vendor-reported; Flash figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

El marcador al que el modelo de texto no puede entrar

Aquí es donde los dos realmente divergen, y la divergencia es estructural más que competitiva: en los benchmarks de imagen y video, el Ling 3.0 Flash de solo texto no figura en absoluto, porque no puede aceptar la entrada. La propia tabla de Ling-3.0-flash-VL — la evaluación de inclusionAI, no reproducida, realizada en parte internamente y en parte contra las API de los competidores bajo las condiciones de prueba oficiales — presenta cifras en las tres categorías que la ficha del modelo destaca. En la comprensión de imágenes complejas, muestra un 79,0 en MMMU-Pro y un 84,87 en MathVision, con un 19,88 mucho más bajo en Humanity's Last Exam-Multimodal, lo que refleja lo difícil que es ese conjunto para todos. En tareas de documentos y gráficos es sólido: obtiene un 91,35 en OmniDocBench1.5 y un 81,30 en CharXiv_RQ. Y en las suites agéntico-multimodales que hacen interesante este lanzamiento — un 59,9 en ClawEval-MM, un 90,83 en WebVoyager y un 57,69 en Vision2Web — se le pide que lea una interfaz y actúe sobre ella, lo cual es precisamente la tarea de agente de GUI que el modelo de solo texto no puede realizar.

Si se leen en contexto, surge un panorama coherente: no es un modelo afinado para ganar trivias sobre imágenes, sino para convertir píxeles en acción — {{1}}leer la maquetación, interpretar el gráfico, manejar la página{{/1}}. En la tabla del propio proveedor, lidera la comparativa a tres bandas ({{2}}Qwen3.8-27B con alto esfuerzo de razonamiento, Gemini 3.5 Flash-Lite y Kimi-K2.6{{/2}}) en OmniDocBench, WebVoyager y ClawEval-MM, y va por detrás en conjuntos exigentes de conocimiento y razonamiento como MathVision y HLE-MM. {{3}}Trata todas esas cifras como afirmaciones de inclusionAI hasta que un laboratorio independiente las confirme{{/3}} — pero la dirección del ajuste es clara y consistente.

El único número que vale la pena discutir: 42 vs 38

La afirmación con más probabilidades de llevar a un equipo de solo texto a cambiar es la principal: inclusionAI informa de que Ling-3.0-flash-VL obtiene una puntuación de 42 en el Artificial Analysis Intelligence Index (v4.1.1), cuatro puntos por encima de los 38 que atribuye a Ling 3.0 Flash en la misma versión del índice. Nótese qué mide ese índice: la puntuación compuesta v4.1.1 se nutre de suites de texto y de agentes (GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam y similares), ninguna de las cuales implica tareas de imagen. Así pues, el proveedor afirma que añadir entrenamiento visual al backbone compartido mejoró la inteligencia textual del modelo en cuatro puntos, no simplemente que ahora pueda describir imágenes. Esa es una afirmación llamativa y totalmente plausible: el ajuste multimodal por instrucciones suele potenciar la capacidad textual.

Dos salvedades sobre las fuentes mantienen esa cifra en perspectiva. Primero, el 38 corresponde a una generación anterior del índice: Artificial Analysis ha movido desde entonces su panel en vivo a una versión más nueva del índice (v4.3), donde actualmente sitúa a Ling 3.0 Flash en un estimado de 25, aunque sigue clasificándolo primero entre los 63 modelos de su clase. El par 42-vs-38 del proveedor se basa en la escala anterior, por lo que no debe leerse como "cuatro puntos por encima de donde AA puntúa hoy al modelo de texto". Segundo, el 42 es la cifra propia de inclusionAI para un modelo que Artificial Analysis aún no ha listado, e inclusionAI no ha publicado los resultados del checkpoint VL en los conjuntos de pruebas de texto individuales (SWE-Bench, Terminal-Bench) que su propia tabla del modelo de texto desglosa. Cuatro puntos es exactamente la magnitud de mejora que uno querría reproducir antes de migrar un pipeline de solo texto basándose en ello.

A screenshot of the Artificial Analysis model page for Ling 3.0 Flash, showing the heading 'Ling 3.0 Flash — Intelligence, Performance & Price Analysis', 'Released August 2026', an estimated 25 on the Artificial Analysis Intelligence Index with a #1-of-63 rank in its class, pricing near $0.07 per 1M input and $0.22 per 1M output tokens, roughly 313 output tokens per second, and technical specs listing text-only input, a 262k context window, and 124B total / 5.1B active parameters.

Precio: uno tiene precio de lista, el otro no.

La comparación de costos es actualmente una comparación con un solo precio incluido. Ling 3.0 Flash se puede invocar hoy en la API de primera parte del proveedor por aproximadamente $0.07 por 1M de entrada y $0.22 por 1M de salida — precios fijados por el proveedor, confirmados en la lista de Artificial Analysis — con entrada en caché más barata, y sus descuentos de lanzamiento han terminado. Ling-3.0-flash-VL no tiene un precio de API publicado en ningún sitio; todavía no puedes pagar por token por ella. Si la quieres esta semana, la alojas tú mismo: pesos MIT de aproximadamente 250 GB en BF16, en la misma clase de hardware que ya requiere el modelo de texto — 4× GPUs de 141 GB (H20-3e o H200) o un nodo Blackwell de 4 GPUs con paralelismo tensorial 4, u 8× H100/H800 de 80 GB con TP8.

Eso replantea la economía para un equipo de solo texto. Si compras tokens, el modelo de texto a $0.07/$0.22 es barato y probado. Si ya estás autoalojando el modelo de texto 124B, el checkpoint VL no es una segunda compra de infraestructura: son otros ~250 GB de pesos en la misma clase de máquina, y esa adición solo se justifica si las cargas de trabajo realmente consumen píxeles. El modelo con ojos solo se amortiza cuando los ojos están en el bucle.

Quién debería elegir cuál

Solo texto y alto volumen — quédate en Ling 3.0 Flash. Obtienes un modelo probado y con clasificación AA, un precio real por token y llamadas a herramientas maduras. El aumento de cuatro puntos en el índice del modelo VL no se ha reproducido y su rendimiento en el lado del texto no se ha medido; todavía no hay evidencia de que sea el mejor modelo de texto, solo la afirmación de que lo es.

La visión entra en el bucle — documentos, capturas de pantalla, gráficos, fotos, fotogramas de video o una interfaz de usuario que tu agente deba leer y clicar — Ling-3.0-flash-VL es la opción obvia, porque es la misma columna vertebral de razonamiento que ya conoces, con el stack de visión incorporado, en lugar de un modelo multimodal aparte que tengas que reevaluar desde cero.

Tráfico mixto, sin decidir — la medida de bajo riesgo es mantener ambos accesibles y enrutar según la solicitud en lugar de rediseñar la arquitectura en torno a uno solo. Esa es la propiedad que un gateway de modelos existe para brindarte: una API para más de 200 modelos, precios de lista del proveedor trasladados sin margen adicional y conmutación automática por error cuando un proveedor se degrada. Ninguno de los checkpoints de Ling está todavía detrás de un endpoint de OrcaRouter — el precio del modelo de texto es el del propio proveedor y el modelo VL no tiene precio alojado en absoluto —, pero cuando el VL obtenga uno, mover un subconjunto del tráfico hacia él y medirlo es un cambio de configuración, no un proyecto de integración.

¿Qué falta todavía?

Una ejecución independiente de Ling-3.0-flash-VL en una versión actual del Artificial Analysis Intelligence Index — el 42 es lo que inclusionAI afirma sobre una versión anterior del índice.

• Cualquier precio de API alojada para el modelo VL, que es el mayor obstáculo para la adopción casual.

• Se publicaron divisiones solo de texto (SWE-Bench Pro, Terminal-Bench 2.1) para el checkpoint de VL, de modo que un equipo centrado en texto pueda verificar que la pila de visión no le costó nada.

• Una cifra de latencia de extremo a extremo o de rendimiento para VL bajo carga de imagen — se mide la velocidad del modelo de texto; la del modelo de visión no.

• Confirmación neutral del gráfico de vision-benchmark, partes del cual se ejecutaron en el propio entorno de pruebas de inclusionAI y al menos un benchmark interno está previsto para su posterior publicación.

El veredicto

Esto no es un concurso de calidad de modelos; es una decisión de modalidad acompañada de una afirmación de cuatro puntos. Si tus entradas son texto, sigue usando Ling 3.0 Flash — es más barato, figura en la lista AA y sus resultados han sido medidos, y la ventaja del modelo VL sobre él es por ahora una cifra del proveedor en una escala de índice más antigua. Si tu carga de trabajo parte de una pantalla — una página de documento, una captura de pantalla, un gráfico, un fotograma de vídeo, una GUI que tu agente debe operar — Ling-3.0-flash-VL es el mismo cerebro de 124B que ya conoces, ahora capaz de ver, y esa es una opción genuinamente nueva que no existía en el nivel rápido de Ling hace una semana. Adóptalo donde la visión sea real, valida el 42 antes de migrar nada basándote en ello, y mantén la elección reversible en la capa de enrutamiento hasta que lleguen una puntuación independiente y un precio de lista.