Una tarjeta de título principal generada para Ling-3.0-flash-VL, subtitulada 'Ant abre un modelo multimodal en la línea rápida Ling', que muestra tres iconos de entrada etiquetados como Texto, Imagen y Vídeo corto que alimentan un chip con la lectura '124B MoE disperso · 5.5B activo' hacia un icono de salida de texto, con chips de pie de página 'Pesos MIT', 'API en vivo' y 'FP8', y la nota 'pesos publicados el 4 de septiembre de 2026', y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Ling-3.0-flash-VL: Ant lanza un modelo multimodal en la línea rápida Ling.

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 4 de septiembre de 2026, el laboratorio inclusionAI de Ant Group publicó pesos con licencia MIT para Ling-3.0-flash-VL en Hugging Face y, ese mismo día, actualizó la documentación para desarrolladores de la plataforma Ant Ling para que coincidiera. Ling-3.0-flash-VL es el primer checkpoint con capacidad de visión en la familia Ling-3.0-flash: la misma red troncal de mezcla dispersa de expertos de aproximadamente 124 mil millones de parámetros que convirtió al Ling-3.0-flash, solo de texto, en uno de los modelos de razonamiento económicos más comentados del final del verano, ahora leyendo imágenes y clips de video cortos además de texto. La cuantización FP8 siguió el 8 de septiembre, la mañana en que se escribe esto. Así, en cuatro días el lanzamiento adquirió tres superficies sobre las que un lector puede actuar: pesos abiertos, una API oficial en la plataforma Ling de Ant y una puntuación de 42 reportada por el proveedor en el protocolo Artificial Analysis Intelligence Index versión 4.1.1, cuatro puntos por encima de los 38 medidos de forma independiente para la versión de solo texto. Lo que aún no ha adquirido es un anuncio formal: la tarjeta de Hugging Face y el tutorial para desarrolladores son todo el lanzamiento, por lo que este artículo separa lo que declara el proveedor de lo que un externo puede verificar.

El lanzamiento importa por lo que supone para el mapa de productos de Ant. Hasta mediados de 2026, el trabajo multimodal dentro de la cartera de modelos de Ant residía en la línea separada Ming, mientras que Ling-3.0-flash estaba posicionado — incluso en el explicador de este blog sobre el modelo de texto — como el nivel rápido de texto y herramientas para agentes, programación e investigación profunda. Ling-3.0-flash-VL rompe esa frontera: aporta información visual a un modelo de razonamiento construido en torno a una huella de parámetros activados inusualmente pequeña y a ejecuciones agénticas largas, y entrega el resultado a los desarrolladores de tres formas a la vez. Eso lo convierte en una decisión genuinamente distinta de las variantes anteriores ajustadas por dominio (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), que se publicaron como API gratuitas sin pesos. Este es abierto, se ejecuta en la plataforma de pago de Ant, y es tan reciente que nadie fuera del proveedor ha publicado todavía una ejecución independiente. Ese último dato es el más importante del artículo.

¿Qué se lanzó, y cuándo?

Todas las fechas que aparecen a continuación pueden verificarse en los repositorios y los documentos; ninguna de ellas se basa en un comunicado de prensa que no existe.

• 4 de septiembre — el repositorio inclusionAI/Ling-3.0-flash-VL de Hugging Face fue creado a las 15:24 UTC con 64 fragmentos bf16 de pesos, un stack de código personalizado completo para la bailing_moe_v3_vl arquitectura, una plantilla de chat con el razonamiento activado por defecto y una licencia MIT. El número de descargas es de decenas al momento de escribir esto: es una publicación que solo un vigilante de repositorios habría detectado el primer día.

• 4 de septiembre: el portal para desarrolladores de la plataforma Ling de Ant añadió el tutorial de comprensión multimodal que documenta el modelo en la API oficial (la propia etiqueta de «última actualización» de la página indica el 4 de septiembre de 2026). Los medios chinos especializados en desarrollo informaron de la capacidad al día siguiente, presentándola como comprensión de imágenes y videos cortos para la respuesta a preguntas visuales y el análisis de contenido.

A partir del 5 de septiembre — el soporte de servicio y despliegue apareció rápido: un cookbook de despliegue de SGLang para el modelo, un fork personalizado de vLLM mantenido por la organización inclusionAI, y un listado de biblioteca de despliegue con tus propios pesos (bring-your-own-weights) con un endpoint de chat-completions listo para usar. Estos son runtimes e infraestructura, no anuncios, pero te indican que el modelo fue construido para ser servido, no solo publicado.

• 8 de septiembre — la cuantización FP8 inclusionAI/Ling-3.0-flash-VL-fp8 aterrizó (64 shards, ~126 GB), con la torre de visión deliberadamente dejada en mayor precisión mientras los pesos del MoE se comprimen a FP8 E4M3. Para autoalojamiento en menos o más pequeñas GPU, este es el checkpoint que la mayoría de la gente realmente descargará.

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

La tarjeta anterior es lo más cercano a una publicación de lanzamiento que tiene esta versión: descripción del modelo, arquitectura, enlaces a las recetas de SGLang y vLLM, y ningún anuncio en cualquier otro lugar que podamos encontrar. Obsérvese la discrepancia que merece señalarse desde el principio: la tarjeta del modelo dice «solo 5.5B de parámetros activados por token», mientras que el libro de cocina de SGLang escrito en torno al mismo lanzamiento describe un modelo con «5.1B activos». En un checkpoint completamente nuevo, la diferencia probablemente se deba al cálculo de la torre de visión y no a que sean dos modelos distintos, pero es exactamente el tipo de detalle que debería etiquetarse como no resuelto en lugar de pasarse por alto.

Un modelo de 124B que activa 5.5B — ahora con ojos

Ling-3.0-flash-VL mantiene la receta híbrida de sparse-MoE que definió a su homólogo de texto. La ficha describe una red troncal de 42 capas que alterna capas Kimi-Delta-Attention y Gated-MLA en una proporción de 5:1 — el mismo ritmo estructural que Ling-3.0-flash — con unos parámetros totales de alrededor de 124 800 millones y solo una pequeña fracción activada por token. Lo nuevo es la pila de percepción: un codificador visual ViT que alimenta un proyector MLP de dos capas hacia la red troncal del lenguaje, además de VideoRoPE para codificar la posición espacial y temporal, de modo que los fotogramas de video lleguen con un orden sobre el que el modelo pueda razonar. La entrada es texto, imagen y video; la salida es texto.

• Parámetros — 124B en total, ~5.5B activados por token según la ficha del proveedor (consulte la advertencia contable anterior).

Contexto: se anuncia como "hasta 1M de tokens"; las recetas de implementación que existen hoy en día ejercen 256K mediante YaRN rope scaling, que es la cifra práctica realista para planificar hasta que alguien publique una ejecución verificada más larga.

• Thinking — el razonamiento está activado por defecto a través de la plantilla de chat; tanto los ejemplos oficiales de la API como las recetas de servicio muestran un interruptor enable_thinking: false por solicitud para llamadas sensibles a la latencia.

• Licencia — MIT, ambos formatos de precisión, sin cláusulas adicionales. Esta es la misma licencia limpia que hizo destacar la publicación del código abierto del modelo de texto en agosto, y es la razón principal por la que el autoalojamiento es una opción realista en lugar de una zona gris.

La intención de diseño importa tanto como la ficha técnica. Ant posiciona Ling-3.0-flash-VL como un modelo que «aporta información visual al proceso completo de comprensión, razonamiento, actuación y verificación» — el lenguaje de las cargas de trabajo agénticas, no el de la descripción de imágenes. Un modelo capaz de observar una grabación de pantalla de 30 segundos, mantener en contexto una larga sesión de llamadas a herramientas y conservar un coste de activación cercano a los 5.000 millones de parámetros está orientado directamente a los agentes de uso de ordenador y a los agentes basados en vídeo corto. Se trata de un producto distinto de los modelos de visión y lenguaje optimizados para responder a preguntas sobre una sola imagen, y es el marco con el que debe leerse cada benchmark que aparece a continuación.

Lo que la API oficial realmente acepta

El tutorial de la plataforma Ant Ling documenta Ling-3.0-flash-VL en dos formas de API: un endpoint compatible con OpenAI en api.ant-ling.com/v1/chat/completions y uno compatible con Anthropic en api.ant-ling.com/anthropic/v1/messages. Las restricciones conviene conocerlas antes de desarrollar sobre ella:

• Imágenes — JPEG y PNG, solo en base64, hasta 40 imágenes por solicitud, cada imagen de hasta 16 384 × 784 píxeles y cada cadena base64 de hasta 32 MB. El parámetro image_url.detail, compatible con OpenAI, se ignora; el motor decide la resolución internamente.

• Video: MP4, MOV o WMV, un clip por solicitud, con un máximo de 30 segundos, muestreado a una frecuencia fija de 2 fotogramas por segundo hasta 32 fotogramas, en base64 hasta 32 MB. El video funciona solo en el endpoint compatible con OpenAI; el endpoint compatible con Anthropic acepta texto e imágenes, pero no video.

• Identificador del modelo: los ejemplos de curl del tutorial llaman al modelo Ling-3.0-flash-VL-rc1 en lugar de Ling-3.0-flash-VL. Ese sufijo -rc1 es un marcador de versión candidata y una cuestión genuinamente abierta: nada en la documentación dice qué pesos está sirviendo la plataforma ni si el checkpoint de la API coincide con la compilación de pesos abiertos del 4 de septiembre. Si estás evaluando la API contra los pesos abiertos, eso es lo primero que hay que probar, no una suposición que dar por sentada.

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

La página anterior es donde residen las restricciones de entrada — formatos de imagen y video, límites por solicitud y las dos formas de endpoints. También es donde se confirma que el modelo es una API comercial activa y no un stub de solo documentación.

Los números — y quién los reportó

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

El único número destacado en la ficha es el 42 en el protocolo versión 4.1.1 del Índice de Inteligencia de Artificial Analysis, que Ant afirma que está cuatro puntos por delante de la puntuación de 38 del Ling-3.0-flash, que es solo de texto. La distinción en esa oración es crucial. El 38 es una medición de Artificial Analysis — realizada de forma independiente, publicada en su tabla de clasificación y citada con aprobación en toda la cobertura de la industria sobre el modelo de texto. El 42 es una afirmación en la propia ficha del modelo de Ant, hecha bajo un protocolo del índice de AA pero que Artificial Analysis aún no ha registrado, ya que no tenía ninguna página para Ling-3.0-flash-VL al momento de escribir esto. Nadie fuera de Ant ha ejecutado este checkpoint todavía. Trata el 42 como una cifra del proveedor, de la misma familia que produjo el genuino 38 del modelo de texto: una razón para mirar, no un número para citar como establecido.

Todo lo demás del anuncio es cualitativo o metodológico. La ficha describe el modelo en una tabla de capacidades de «comprender, razonar, actuar» y alude a una evaluación agéntica de Terminal-Bench bajo un protocolo estilo AA, pero no publica resultados numéricos de texto que podamos reproducir aquí. La guía de despliegue recoge valores de precisión (MMMU-Pro, GSM8K) asociados a configuraciones de servicio concretas: merece la pena consultarlos, aunque son mediciones próximas a la infraestructura, no evaluaciones independientes. El resumen honesto es breve: un modelo de razonamiento plausible, barato de servir y con capacidades de visión, pero sin marcador independiente público todavía.

Lo que cuesta, y lo que sugiere la historia familiar

El tutorial multimodal de Ant no incluye un precio por token para Ling-3.0-flash-VL, por lo que cualquier cantidad que se mencione aquí es una inferencia, claramente indicada como tal. La referencia útil es su homólogo de texto en la misma plataforma: el precio de lista oficial de Ling-3.0-flash es de unos $0.075 por 1M de tokens de entrada y $0.22 por 1M de tokens de salida, con lecturas de caché aproximadamente un 80% más baratas, mientras que la consola china lo cotiza en renminbi (¥0.40 de entrada / ¥1.20 de salida por 1M de tokens) tras una promoción inicial de 75% de descuento que finalizó el 31 de agosto. Un modelo multimodal de 124B-A5.5B es más caro de servir que un modelo de texto de 124B-A5.1B —la torre de visión es densa y se ejecuta para cada token de imagen—, por lo que un precio igual o moderadamente superior a esa banda es la estimación razonable. El historial de la familia también apunta en sentido contrario: las variantes de dominio Fin y Sante se lanzaron como API gratuitas; Ant ha demostrado que usará un precio de cero para impulsar la adopción de una variante de Ling que quiere en el mercado. Si la VL sigue la banda de precios del modelo de texto de pago o el patrón de la variante gratuita, simplemente todavía no es público.

Para la ruta de autoalojamiento, las cifras son concretas porque los archivos son públicos. La versión bf16 supone una descarga de aproximadamente 250 GB repartidos en 64 shards — una cuestión que requiere múltiples GPU salvo en los nodos individuales más grandes —, mientras que la versión FP8 (~126 GB, con la torre de visión mantenida en bf16) cabe sin problemas en un nodo con 8 aceleradores de clase 80 GB y es la versión que la mayoría de los equipos ejecutará realmente. Las afirmaciones sobre throughput del serving cookbook existen, pero tienen sesgo de proveedor; cabe esperar la advertencia habitual de que los token/s reales dependen de tu hardware y de tu lote.

Dónde encaja una capa de enrutamiento — honestamente

En el lanzamiento, ningún gateway importante de modelos de terceros que hayamos revisado lista Ling-3.0-flash-VL, y OrcaRouter — la plataforma de enrutamiento a la que pertenece este blog — tampoco lo sirve. Nada en este artículo debería leerse como si lo hiciera. Ese es el estado honesto de un modelo de cuatro días, y vale la pena decirlo sin rodeos porque las opciones que un lector tiene hoy son exactamente dos: llamar a la API oficial de Ant o autoalojar los pesos MIT. El ángulo del enrutamiento es lo que viene después. Una vez que un modelo así llega al servicio de terceros, la economía de un router de paso directo es la razón para preferirlo en la evaluación: el precio de lista del proveedor se traslada con un margen del 0%, así que un recorte de precio del proveedor (o un experimento de nivel gratuito como los lanzamientos de Fin y Sante) está disponible el mismo día en que se anuncia, y la conmutación automática por error te permite apuntar una carga de trabajo real a un modelo abierto de pocos días sin apostar tu stack por la disponibilidad de un solo proveedor o el comportamiento de un solo checkpoint. Para una familia que ha ajustado sus precios una vez y se ha fragmentado en cuatro variantes en seis semanas, eso no es una hipótesis: es la diferencia entre volver a probar a mano cada vez que Ant se mueve y volver a probar una sola vez a través de una API.

Qué ver

Esta versión es tan reciente que las señales útiles son, en su mayoría, comprobaciones que cualquiera puede realizar. Primero, si Artificial Analysis (u otro laboratorio independiente) lista Ling-3.0-flash-VL y confirma o corrige el 42 — ese único dato separa «el mejor modelo de la familia» de «otro número de proveedor». Segundo, si el identificador -rc1 en la API oficial se corresponde con los pesos abiertos del 4 de septiembre; si no es así, la API y la ruta de autoalojamiento son modelos distintos y cada comparación que leas debe indicar cuál usó. Tercero, el precio: una tarifa VL publicada en la plataforma Ling, y si sigue la banda de pago del modelo de texto o el manual de la API gratuita de Fin/Sante. Cuarto, si el checkpoint FP8 mantiene la precisión de la tarjeta en el servicio real — que la torre de visión se mantenga en bf16 es una buena señal, pero las afirmaciones sobre visión cuantificada requieren una ejecución, no una configuración. Y quinto, la cuestión del mapa de producto: con la visión ahora dentro de la línea rápida Ling, observa si Ant mantiene a Ming como una marca multimodal separada o deja que ambas converjan.

Para un desarrollador, la respuesta a corto plazo es breve. Si quieres construir sobre esto hoy, la API oficial es la ruta de infraestructura cero y los pesos FP8 son la ruta de autoalojamiento, y ambas son reales desde esta semana. Si quieres construir sobre el número 42, espera a que alguien fuera de Ant lo reproduzca. Todo lo genuinamente útil de Ling-3.0-flash-VL — pesos MIT, una arquitectura plausible, un diseño agresivo de precio por activación y una puntuación del proveedor que merece tomarse en serio — está en su lugar; todo lo que lo convertiría en una opción segura por defecto sigue pendiente.