Una tarjeta de título para Ling-3.0-flash-VL que resume el modelo como una mezcla de expertos multimodal nativa de 124B parámetros y 5,5B activos del laboratorio inclusionAI de Ant Group, publicada en septiembre de 2026 bajo la licencia MIT, con una puntuación de 25 en el Artificial Analysis Intelligence Index v4.3 y que entrega 142,9 tokens de salida por segundo.
Guides & Insights

Ling-3.0-flash-VL: el modelo de visión activa de 5,5B de Ant llega al 25 en el Intelligence Index

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ling-3.0-flash-VL ahora tiene una cifra de benchmark que nadie de Ant Group escribió, y esa es la noticia. El primer modelo nativamente multimodal del laboratorio inclusionAI de Ant obtiene una puntuación de 25 en el Artificial Analysis Intelligence Index — una medición independiente, en la escala v4.3 actual, publicada junto con una página del modelo que detalla su velocidad, latencia y precio. Llega tres semanas después de que la propia ficha de modelo del proveedor afirmara 42 en el mismo índice, y lo más útil que un lector puede hacer con esas dos cifras es entender por qué no son una contradicción: Ant midió con el protocolo Intelligence Index v4.1.1, Artificial Analysis midió con v4.3, y esas son varas de medir distintas construidas a partir de conjuntos de evaluación diferentes. La cifra del proveedor no sobrevivió al contacto con un tercero, sino que más bien se volvió a medir en una escala que no existía cuando se escribió.

El modelo que hay debajo de la puntuación es una mezcla dispersa de expertos con 124B de parámetros totales y aproximadamente 5,5B activos por token, publicado bajo la licencia MIT con pesos BF16 y FP8, que acepta texto, imágenes y vídeo y devuelve texto. Esa cifra de parámetros activos es todo el argumento de la cosa. Con 5,5B activos, Ling-3.0-flash-VL se sitúa en lo que se ha convertido en la curva más interesante de los modelos abiertos —la frontera de la inteligencia trazada frente a los parámetros activados en lugar del tamaño total—, y está ahí porque hace una cantidad decente de trabajo por unidad de cómputo de inferencia, no porque sea enorme.

Este artículo cubre lo que realmente se lanzó y cuándo, lo que dice la prueba independiente, por qué la afirmación sobre Pareto se sostiene mejor que la mayoría, cuánto cuesta el modelo y dónde puedes invocarlo realmente. La versión corta, para quien solo quiera eso: Ling-3.0-flash-VL es real, de pesos abiertos, inusualmente barato de servir, de forma medible por encima del promedio para su clase de tamaño, y notablemente más verboso y más lento de lanzar de lo que sugiere la puntuación bruta. El 42 que proclama su proveedor nunca se reprodujo de forma independiente y no es comparable con el 25 que ahora está en la tabla.

Lo que realmente se lanzó, y la línea de tiempo que no deja de aplanarse

La cobertura de este lanzamiento tiende a reducir varios eventos separados a una única fecha de lanzamiento, y las fechas importan porque explican por qué los primeros artículos describían un modelo que nadie fuera de Ant podía puntuar. El repositorio de Hugging Face inclusionAI/Ling-3.0-flash-VL se creó el 4 de septiembre de 2026 — 64 fragmentos de pesos BF16, una licencia MIT, una pila de código personalizado para la bailing_moe_v3_vl arquitectura y, durante unos días, casi nadie lo descargaba. La cuantización FP8 llegó después, el 8 de septiembre, aproximadamente 126 GB repartidos en 64 fragmentos, con la torre de visión mantenida a mayor precisión que los pesos de los expertos. Artificial Analysis enumera el lanzamiento como 10 de septiembre de 2026, que es la fecha a la que se ancla su propia página, y la página del modelo que contiene la puntuación se publicó por entonces.

Así que "publicado en septiembre de 2026" es exacto, pero inútil. La secuencia práctica fue: los pesos el día 4, un segundo formato de precisión el día 8 y una medición independiente el día 10. La razón por la que esto importa es que un modelo con los pesos en disco pero sin un endpoint alojado y sin una puntuación de terceros, para la mayoría de los equipos, todavía no es algo que se pueda evaluar: es una descarga para la que hay que aprovisionar. Ling-3.0-flash-VL cruzó esa línea cuando existían tanto la API como la puntuación independiente.

El soporte de servicio llegó junto con los pesos, no después de ellos. Ant publicó una guía de despliegue de SGLang y mantiene un fork de vLLM ajustado para Ling para la arquitectura, que es la parte de un lanzamiento abierto que suele retrasarse semanas. Aquí no se retrasó.

El número en el tablero, y el de la tarjeta

Aquí está el panorama independiente de Artificial Analysis, que es la única medición de terceros de este modelo que existe actualmente:

• Índice de inteligencia — 25 en v4.3, clasificado n.º 2 de 64 en su clase de tamaño, frente a una mediana de clase de 8br /> • Parámetros totales — 124Bbr /> • Parámetros activos — 5,5B por tokenbr /> • Velocidad de salida — 142,9 tokens/segundo, n.º 10 de 64, frente a una mediana de sus pares de 105,1br /> • Tiempo hasta el primer token — 2,21 segundos, frente a una mediana de sus pares de 2,29br /> • Ventana de contexto — 262K tokens según lo medido por Artificial Analysis, frente a los 256K que indica la propia ficha del modelobr /> • Licencia — MIT, pesos abiertos

Y aquí está la cifra del proveedor junto a la que tan a menudo se imprime: 42 en el protocolo Artificial Analysis Intelligence Index v4.1.1, cuatro puntos por encima de lo que el modelo de solo texto Ling-3.0-flash obtuvo en el mismo protocolo. Esa afirmación figura en la ficha del modelo, no tiene ninguna traza de evaluación publicada y no es la cifra que reporta Artificial Analysis. Dos cosas son ciertas a la vez: el 42 no se ha reproducido y no es prueba de nada deshonesto, porque v4.1.1 y v4.3 no miden lo mismo. Artificial Analysis reformuló su índice en septiembre de 2026 y volvió a puntuar todo su cuadro; la v4.3 incorpora diez evaluaciones, entre ellas AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 y Humanity's Last Exam. Cualquier artículo que siga citando un 42 junto a un 25 sin indicar la versión está comparando dos pruebas distintas y llamándolo una caída.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

El detalle que vale la pena destacar más allá de la puntuación principal es la verbosidad. Artificial Analysis registra que Ling-3.0-flash-VL gasta 160M tokens de salida para completar el Intelligence Index, lo clasifica en el puesto n.º 8 de 64 frente a una mediana de 84M, y lo etiqueta como «muy verboso». Para un modelo cuyo argumento de venta es la inferencia barata gracias a un pequeño número de parámetros activos, eso va directamente en contra de ese argumento. Pagas por token, no por parámetro. Un modelo que activa 5,5B pero emite casi el doble del número mediano de tokens para responder a las mismas preguntas devuelve parte de esa ventaja estructural a la hora de pagar — que es exactamente el tipo de interacción que oculta una tabla de precios por token y que expone una medición de coste por tarea.

La afirmación de Pareto, sometida a un poco de presión

La afirmación de que Ling-3.0-flash-VL se sitúa en la frontera de Pareto entre inteligencia y parámetros activos es, de manera inusual, una que los datos independientes respaldan en lugar de simplemente permitir. La mediana de la clase en este índice es 8; Ling-3.0-flash-VL obtiene 25; y lo hace mientras activa 5.5B parámetros por token. Para los equipos cuya restricción vinculante es el rendimiento servible —un único acelerador, un presupuesto fijo de solicitudes, un despliegue en el borde—, esa relación lo decide todo, y es una demostración genuinamente sólida.

Dos salvedades impiden que sea una victoria limpia. La primera es la discrepancia en el recuento de parámetros: la ficha del modelo dice aproximadamente 5,5B activos, mientras que el recetario de SGLang describe un modelo de 5,1B activos. Ambos son documentos de Ant, la diferencia es pequeña y cambia ligeramente la forma de la curva, no su dirección. La segunda es que "frontier" es una afirmación relativa sobre un campo que avanza cada semana. Ser el mejor en inteligencia por parámetro activo en un tamaño dado es una posición que se mantiene hasta que se lance el siguiente modelo de esa banda, y esta banda está abarrotada.

La propia demostración estrella del proveedor —que Ling-3.0-flash-VL, compitiendo en la Image-to-WebDev Arena bajo el alias «linthium», obtuvo 1,441 frente a los GPT-5.4, con 1,440, debería leerse como un gancho para captar la atención más que como un resultado. Un margen de un punto está dentro del ruido de un Elo de arena, lo reporta el propio proveedor y no es el tipo de diferencia que decida nada. La afirmación de capacidad que hay detrás es más interesante que la cifra: el modelo está construido para un bucle de retroalimentación visual en el que genera código de front-end a partir de un diseño, renderiza su propia salida, observa el renderizado y corrige —observar, actuar, verificar, corregir, en lugar de describir una sola vez y detenerse.

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

Lo que cuesta, que es menos claro de lo que parece.

La página de Artificial Analysis incluye Ling-3.0-flash-VL a $0.00 por 1M de tokens de entrada y $0.00 por 1M de tokens de salida, frente a las medianas de sus pares de $0.14 y $0.40. Eso no es un precio. Es la apariencia de uno. Artificial Analysis pone precio al endpoint que puede ver, y el endpoint que puede ver es gratuito — el modelo se ejecuta en Ling Studio de Ant como una prueba gratuita, y el acceso promocional gratuito es lo que refleja el listado. La propia documentación multimodal de Ant no publica en absoluto precios por token para el modelo de visión, así que no hay una tarifa de proveedor con la que contrastar el cero. Para hacerse una idea de la escala, el hermano solo de texto Ling-3.0-flash se ha listado alrededor de $0.075 por 1M de entrada y $0.22 por 1M de salida, y las variantes Ling específicas de dominio de Ant también se lanzaron como API gratuitas.

Trate el cero como una ventana de pruebas y no como una tarifa. Los niveles gratuitos de los modelos recién lanzados son un instrumento de captación de clientes, y la suposición honesta para la planificación es que Ling-3.0-flash-VL acabará teniendo un precio en torno al de su hermano de texto. También hay una ambigüedad vigente que la llegada de un endpoint de pago no resolverá: los propios ejemplos de API de Ant usan el identificador de modelo Ling-3.0-flash-VL-rc1, un marcador de candidato a lanzamiento, y sigue sin estar claro si el checkpoint servido es idéntico byte a byte a los pesos abiertos del 4 de septiembre. Si está evaluando sus propios prompts contra la API alojada y espera que los resultados se trasladen a una compilación BF16 autoalojada, esa es una suposición que debería poner a prueba antes de construir sobre ella.

El panorama de costos se invierte según de qué lado estés. Para un equipo que ya tiene aceleradores, la compilación en FP8 de aproximadamente 126 GB cabe dentro de un nodo de clase 80 GB de ocho vías, y el recuento de 5.5B de parámetros activos significa que estás pagando el costo amortizado de ese nodo contra una huella de cómputo por token muy pequeña — la versión más barata posible de este modelo es la que sirves tú mismo. Para un equipo sin aceleradores, la pregunta es si un endpoint de pago llega antes de que se cierre el nivel gratuito.

Dónde puedes llamarlo de verdad, incluida la parte en la que decimos no

Se puede acceder a Ling-3.0-flash-VL a través de la propia plataforma de Ant — un endpoint compatible con OpenAI en api.ant-ling.com/v1/chat/completions y uno compatible con Anthropic junto a él — además de acceso de prueba gratuito en Ling Studio, además de pesos abiertos que puedes servir tú mismo. Las pasarelas independientes también han comenzado a listarlo, y esa es genuinamente la forma más rápida de probarlo sin aprovisionar nada.

Lo que vale la pena decir con claridad es que OrcaRouter no enruta Ling-3.0-flash-VL hoy. No está en nuestro catálogo de modelos, así que cualquier cosa que leas aquí sobre invocarlo a través de nosotros sería ficción, y preferiríamos que lo supieras desde el principio. Lo que sí enrutamos es el modelo de visión más directamente comparable a él: DeepSeek V4 Flash Vision Exp, la versión multimodal experimental de DeepSeek, que está disponible en nuestro catálogo con una ventana de contexto de 1M de tokens y una tarifa publicada. Si tu requisito real es un modelo de visión capaz detrás de un único endpoint compatible con OpenAI —con una cadena de respaldo configurada de modo que, ante un fallo momentáneo de un proveedor, se reintente antes de que comience tu respuesta, y con los precios de lista del proveedor transferidos sin añadir nada por encima, de modo que un cambio de precio del proveedor te llegue el mismo día en que entra en vigor—, ese es el modelo que deberías probar primero mientras Ling-3.0-flash-VL siga fuera del catálogo.

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

Qué observar a partir de ahora

Tres cosas decidirán si este lanzamiento parece significativo dentro de seis meses. La primera es una segunda ejecución independiente: una puntuación de un solo evaluador es un punto de datos, y la pregunta interesante es si la ubicación de Ling-3.0-flash-VL en la curva de inteligencia frente a parámetros activos sobrevive a un harness distinto. La segunda es un precio real. Hasta que Ant publique una tarifa para el modelo de visión, toda comparación de costos que lo incluya es una estimación vestida de número, y el nivel gratuito está haciendo el trabajo que de otro modo haría un precio. La tercera es el delta de calidad de FP8: la torre de visión se mantuvo deliberadamente a mayor precisión que los pesos de expertos en esa compilación, y si la versión cuantizada iguala a BF16 en tareas visuales de grano fino es exactamente el tipo de pregunta que solo aparece cuando la gente la ejecuta en producción en lugar de someterla a benchmarks.

El veredicto disponible hoy es más limitado de lo que sugería la cobertura del lanzamiento y más útil que la puntuación por sí sola. Ling-3.0-flash-VL es un modelo de visión real, con licencia MIT y autoalojable, que activa una pequeña fracción de sus 124B parámetros, obtiene 25 en un índice independiente actual frente a una mediana de clase de 8, y cede parte de esa ventaja por su verbosidad. Ese es un buen modelo con un perfil honesto. El 42 de la ficha es un número de una regla que ya no existe.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario