Ling-3.0-flash: Lo que ahora sabemos sobre el MoE de peso abierto de nivel rápido de Ant Group
Guides & Insights

Ling-3.0-flash: Lo que ahora sabemos sobre el MoE de peso abierto de nivel rápido de Ant Group

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El laboratorio InclusionAI de Ant Group ha lanzado oficialmente Ling-3.0-flash — anunciado el 24 de julio de 2026 y publicado como código abierto bajo la licencia MIT el 7 de agosto — y el panorama ha cambiado mucho desde la vista previa que publicamos aquí en julio. Es un modelo nativo de razonamiento híbrido de mezcla de expertos con 124B de parámetros totales y solo 5.1B activos por token, diseñado como el nivel rápido y económico de la familia Ling. Los dos números que lo cambiaron todo: Artificial Analysis ahora lo puntúa con 38 en el Índice de Inteligencia (24 puntos más que la generación anterior de nivel rápido, Ling-2.6-flash) y lo coloca en la frontera de Pareto de pesos abiertos por inteligencia frente a parámetros totales. Los pesos ya están disponibles en Hugging Face y ModelScope.

{{1}}Cuando cubrimos este modelo por primera vez el 24 de julio, el resumen honesto era:{{/1}} {{2}}solo API{{/2}}, {{3}}sin pesos{{/3}}, {{4}}sin declaración de licencia{{/4}}, {{5}}sin benchmark independiente{{/5}}. {{6}}Las cuatro afirmaciones están ahora desactualizadas.{{/6}} {{7}}Ant publicó los pesos con licencia MIT el 7 de agosto{{/7}}, {{8}}y Artificial Analysis ha publicado desde entonces una evaluación independiente completa.{{/8}} {{9}}Esta actualización revisa el informe original en consecuencia{{/9}} — {{10}}las etiquetas de «no verificado» que dominaban la publicación de julio ahora se aplican a un conjunto mucho más limitado de afirmaciones, principalmente las cifras de velocidad máxima de Ant, en lugar de al modelo en su conjunto.{{/10}}

Resumen. Ling-3.0-flash es el MoE de pesos abiertos de nivel rápido de Ant Group: 124B en total / 5,1B activos, licencia MIT, contexto nativo de 256K (262K en su versión servida). Artificial Analysis le otorga un Intelligence Index de 38 — 24 puntos más que la generación anterior, Ling-2.6-flash, y en la frontera de Pareto de pesos abiertos entre inteligencia y parámetros totales — con una salida medida de unos 368 tokens/seg. Los pesos están en Hugging Face y ModelScope bajo licencia MIT. Siguen siendo solo del proveedor: la afirmación de un rendimiento máximo de más de 1.100 tokens/seg, la cifra de un tiempo hasta el primer token inferior a 100 ms y la tabla de benchmarks de la ficha del modelo. El precio de la API de primera parte es de $0,075 por entrada / $0,22 por salida por 1M de tokens (80% de descuento en aciertos de caché); el nivel gratuito de lanzamiento terminó el 3 de agosto.

Conclusiones clave

• Es el nivel rápido/económico, no el modelo insignia.El modelo insignia de 1 billón de parámetros de la generación anterior sigue siendo el modelo más grande de InclusionAI; Ling-3.0-flash es el hermano más pequeño y veloz, orientado a texto de gran volumen y llamadas a herramientas.

• Los pesos ahora están abiertos bajo MIT. Los pesos se publicaron en Hugging Face (inclusionAI/Ling-3.0-flash) y ModelScope el 7 de agosto bajo la licencia MIT, un cambio respecto al panorama de "solo API" de julio.

• Por fin tiene una puntuación independiente. Artificial Analysis mide un Intelligence Index de 38, 24 más que Ling-2.6-flash, y sitúa al modelo en la frontera de Pareto de pesos abiertos para inteligencia frente a parámetros totales.

• La velocidad ahora se mide en parte.AA alcanza aproximadamente 368 tokens/seg de salida y un tiempo hasta el primer token de ~1,98 s; la cifra máxima de 1.100+ tokens/seg que Ant anuncia sigue siendo solo del proveedor.

• El precio está fijado y la oferta gratuita de lanzamiento ha terminado. La API de primera parte lista $0.075 de entrada / $0.22 de salida por cada 1M de tokens, con un 80% de descuento por aciertos de caché; el nivel gratuito de lanzamiento terminó el 3 de agosto.

• Es una pieza de una familia de tres modelos. InclusionAI divide su línea en Ling (MoE de propósito general para texto y herramientas, este modelo), Ring (razonamiento) y Ming (multimodal).

Una nota sobre cómo leer esta actualización: esta es una revisión de la vista previa del 24 de julio, escrita después de que los pesos se hicieran públicos y aparecieran las primeras puntuaciones independientes. Cada especificación, benchmark y precio a continuación está etiquetado con su fuente. Cuando Ant Group es la única fuente — las afirmaciones de velocidad máxima y la tabla de benchmarks de la tarjeta del modelo — lo decimos claramente. Cuando Artificial Analysis ha medido algo de forma independiente, lo citamos.

Lo que realmente sabemos

La arquitectura ahora está completamente documentada en la ficha del modelo. Ling-3.0-flash utiliza una pila nativa de atención lineal híbrida — Atención Delta Kimi (KDA) y capas Gated MLA alternadas en una proporción 5:1 (35 KDA + 7 MLA), con gating diagonal de grano fino en KDA — sobre una MoE dispersa de 1/64 (512 expertos enrutados, 8 activados por token). Así es como alcanza 124B de parámetros totales con solo 5.1B activos. La ventana de contexto es de 256K de forma nativa, servida a 262,144 tokens en las recetas de inferencia, y Ant afirma que la arquitectura escala a 1M. La longitud máxima de salida no se revela. El modelo es solo de texto con soporte de llamada a herramientas; la entrada multimodal vive en la línea Ming separada.

El laboratorio publica dos formatos de pesos — BF16 (aproximadamente 255 GB) y FP8 (aproximadamente 128 GB) — y las variantes cuantizadas por la comunidad ya están enlazadas desde la tarjeta del modelo. Las recetas de despliegue propias del laboratorio se dirigen a SGLang y vLLM.

Disponibilidad: pesos abiertos bajo la licencia MIT

El 7 de agosto, el equipo InclusionAI de Ant Group publicó los pesos como código abierto bajo la licencia MIT en Hugging Face (inclusionAI/Ling-3.0-flash) y ModelScope. Esa es una licencia permisiva y de uso comercial: la misma con la que se lanzaron Ling 2.0 y Ling 2.6, y significa que puedes autoalojar, ajustar y desplegar Ling-3.0-flash por tu cuenta en lugar de alquilarlo a través de una API. El modelo también se puede invocar mediante la API de desarrollador de Ant y varias plataformas de terceros. Para un modelo de nivel rápido a este precio, la pregunta más interesante es si autoalojarlo (FP8 funciona aproximadamente con 128 GB) o quedarse con una API.

Puntuaciones independientes: un índice de inteligencia AA de 38.

El cambio más significativo con respecto a la publicación de julio es que ahora existen cifras independientes. Artificial Analysis tiene una página para Ling-3.0-flash y lo mide en 38 en el Índice de Inteligencia — 24 puntos por encima de la generación anterior de nivel rápido, Ling-2.6-flash (14), y a la par con MiMo-V2.5 y Qwen 3.6 27B mientras activa una fracción de sus parámetros. Artificial Analysis también sitúa al modelo en la frontera de Pareto de pesos abiertos en cuanto a inteligencia frente a parámetros totales: ningún modelo de pesos abiertos con menos parámetros totales obtiene una puntuación más alta. El líder de pesos abiertos de nivel flash en AA, DeepSeek V4 Flash, sigue obteniendo una puntuación más alta (Índice 52 con esfuerzo de razonamiento máximo).

Los resultados agénticos y de contexto largo también son sólidos en cuanto a dirección. En el conjunto τ3-Bench Banking de AA, Ling-3.0-flash obtiene un 27%, el segundo entre los modelos de pesos abiertos de gama flash, por detrás de DeepSeek V4 Flash (39%). En GDPval-AA v2 alcanza un Elo de 1108, frente a los 545 de Ling-2.6-flash. Ant entrenó el modelo en más de 10.000 entornos interactivos (según informa el proveedor) y lo presenta como un nodo de ejecución para flujos de trabajo agénticos: rápido, barato y desechable, dejando el razonamiento pesado a un modelo insignia más grande.

Una advertencia sobre las fuentes: la tabla de benchmarks en la tarjeta del modelo de Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — es reportada por el propio proveedor y aún no ha sido reproducida de forma independiente. Trátala como afirmaciones del propio laboratorio, en la misma categoría que las cifras de velocidad máxima que aparecen más abajo.

Velocidad: medida, luego afirmada.

La historia de la velocidad es ahora dos historias diferentes. De forma independiente, Artificial Analysis mide aproximadamente 368 tokens/seg de salida y un tiempo hasta el primer token de ~1,98 s en la API de primera parte — realmente rápido para un MoE con 5,1B activos, y suficiente para situar al modelo cerca de la cima de su clase en velocidad. Por separado, Ant Group afirma una tasa de salida promedio superior a 1.100 tokens/seg en configuraciones de GPU específicas y un tiempo hasta el primer token inferior a 100 ms, con una capa de caché jerárquica a nivel de clúster construida sobre SGLang HiCache y Mooncake. Ese segundo conjunto de cifras es exclusivo del proveedor — medido en hardware y configuraciones de lotes que Ant controla, sin una nueva ejecución independiente publicada. Para la planificación, usa la cifra de AA; trata los 1.100+ tok/s como un techo de marketing que debes verificar en tu propia carga de trabajo.

Precios: baratos, y la promoción ha terminado.

Artificial Analysis lista la API de primera parte en $0.075 por 1M de tokens de entrada y $0.22 por 1M de salida, con aciertos de caché en $0.015 (−80 %) — todos precios fijados por el proveedor. El nivel gratuito de lanzamiento (500k tokens gratuitos/día, acceso gratuito a la API) terminó el 3 de agosto, y Ant realizó un período temporal de 75 % de descuento en su Ling Studio hasta el 31 de agosto de 2026, después del cual se aplica el precio de lista. Incluso al precio de lista completo, $0.075/$0.22 coloca a Ling-3.0-flash firmemente en el nivel económico para un modelo con un índice de 38.

A precios tan bajos, el costo de cambiar importa más que el precio por token. OrcaRouter existe para que ese cambio sea barato: una API para más de 200 modelos, precios de lista de los proveedores trasladados sin margen y conmutación automática entre proveedores, de modo que, cuando un modelo recién abierto como este se ve bien sobre el papel, puedes probarlo con tu carga de trabajo real sin un segundo contrato y volver a un modelo diferente con la misma clave si no cumple con una tarea específica.

La familia Ling / Ring / Ming

Ling-3.0-flash no existe de forma aislada: InclusionAI organiza sus versiones en tres familias con nombre, cada una orientada a una función distinta. Ling es la línea MoE de propósito general para generación de texto cotidiano y llamada de herramientas, y Ling-3.0-flash se sitúa en su extremo rápido/económico, un paso por debajo del buque insignia de 1T de parámetros de la generación anterior. Ring es la línea centrada en el razonamiento, diseñada para cadenas de pensamiento de varios pasos. Ming es la línea multimodal. Si tu tarea requiere un razonamiento más profundo o entrada de imágenes, el modelo de InclusionAI adecuado probablemente no sea Ling-3.0-flash: está pensado para volumen y velocidad dentro del ámbito de texto y herramientas.

Para quién es: tres escenarios

1. Pipelines de texto o de llamada a herramientas de alto volumen y sensibles a la latencia

Este es el terreno natural del modelo. Con un Index independiente de 38, una licencia MIT y aproximadamente 368 tok/s medidos, la apuesta por el nivel rápido ya es comprobable en lugar de hipotética: puedes pasar tu propio conjunto de evaluación por él, o descargar los pesos y autoalojarlo. Pero no construyas sobre el techo de 1,100+ tok/s del proveedor hasta que lo hayas medido en tu carga de trabajo.

2. Equipos que quieren un contexto largo con un presupuesto limitado.

Un contexto nativo de 256K (262K servidos) con una ruta declarada hacia 1M, a $0.075/$0.22, es una combinación atractiva para trabajos con mucha recuperación o procesamiento de documentos. Los números de contexto largo de la tarjeta del modelo son proporcionados por el proveedor, por lo que debes preseleccionarlo comparándolo con opciones de contexto largo ya establecidas y verificar en tu propio corpus antes de comprometerte.

3. Observadores que siguen el panorama de MoE en China y la hoja de ruta de InclusionAI

La pregunta de julio — ¿seguiría InclusionAI en pie? — ahora tiene respuesta: sí, MIT, y rápido. El aterrizaje de Ling-3.0-flash en la frontera de Pareto de AA con 5.1B activos es un dato relevante para cualquiera que siga cómo los laboratorios chinos compiten en eficiencia en lugar de en el número bruto de parámetros.

¿Qué sigue sin verificar?

Una lista breve, ahora que las grandes brechas están cerradas. Las afirmaciones de velocidad máxima del proveedor (1,100+ tok/s, TTFT inferior a 100 ms) no tienen una remedición independiente. La tabla de benchmarks de la tarjeta del modelo es reportada por el proveedor. Las variantes FP4/INT4 y la ruta de implementación de un solo DGX-Spark son declaradas por el proveedor. Y en cuanto al conocimiento, el índice Omniscience de AA muestra que la mejora respecto a la generación anterior provino en gran parte de la abstención — la alucinación cayó (97% → 44%) mientras que la precisión solo aumentó ligeramente (16% → 18%) — así que no confundas el salto principal del índice con un avance del conocimiento en todos los ámbitos.

Cuándo no usarlo

Omite Ling-3.0-flash para trabajo multimodal — esa es la línea Ming. Omítelo si necesitas un buque insignia de razonamiento pesado en lugar de un ejecutor rápido — ese es el carril de Ring. Si planeas autoalojar, presupuesta el hardware real: BF16 es aproximadamente 255GB, FP8 aproximadamente 128GB. Y si una afirmación te importa, verifícala — las cifras de velocidad máxima y contexto largo son de Ant hasta que un laboratorio independiente las vuelva a ejecutar.

Preguntas frecuentes

¿Ling-3.0-flash tiene pesos abiertos?

Sí. Los pesos se publicaron como código abierto el 7 de agosto bajo la licencia MIT, en Hugging Face (inclusionAI/Ling-3.0-flash) y ModelScope. Es una licencia permisiva y comercialmente utilizable — la misma bajo la que se lanzaron Ling 2.0 y Ling 2.6.

¿Cómo se desempeña Ling-3.0-flash en los benchmarks?

Artificial Analysis mide un Índice de Inteligencia de 38, 24 puntos más que Ling-2.6-flash, y sitúa el modelo en la frontera de Pareto de pesos abiertos en cuanto a inteligencia frente a parámetros totales. La tabla de benchmarks en la ficha del modelo de Ant (por ejemplo, SWE-Bench Pro 56.6) la reporta el proveedor y no ha sido reproducida de forma independiente.

¿Qué tan rápido es realmente?

{{1}}Artificial Analysis mide aproximadamente 368 tokens/seg de salida con un tiempo hasta el primer token de ~1,98 s en la API de primera parte.{{/1}} Ant afirma un rendimiento máximo de más de 1100 tokens/seg y un TTFT inferior a 100 ms en configuraciones de GPU especificadas — {{2}}esas son cifras del proveedor sin una nueva medición independiente.{{/2}}

¿Cuánto cuesta Ling-3.0-flash?

AA lista la API de primera parte a $0.075 por 1M de tokens de entrada y $0.22 por 1M de salida, con un descuento del 80% en aciertos de caché. El nivel gratuito de lanzamiento terminó el 3 de agosto, y un período temporal de 75% de descuento en Ling Studio se extiende hasta el 31 de agosto de 2026.

¿Qué tan grande es la ventana de contexto?

256K nativamente, servido a 262,144 tokens; Ant afirma que la arquitectura escala a 1M. No se divulga la longitud máxima de salida.

¿Cuál es la diferencia entre Ling, Ring y Ming?

Ling es la línea MoE de propósito general de InclusionAI para texto y llamada de herramientas, y Ling-3.0-flash se sitúa en su extremo rápido/económico. Ring es la línea centrada en el razonamiento. Ming maneja tareas multimodales. Son familias separadas para diferentes trabajos, no niveles de un mismo modelo.

¿Es Ling-3.0-flash lo mismo que el buque insignia anterior de 1T?

No. Ling-3.0-flash es la versión más nueva y pequeña de la capa rápida (124B en total / 5.1B activos). El buque insignia de 1T parámetros de la generación anterior sigue siendo el modelo más grande.

¿Debería usar Ling-3.0-flash en producción hoy?

Es más defendible que en {{1}}julio{{/1}}, ahora que hay una puntuación independiente {{2}}y una licencia MIT{{/2}}. {{3}}Primero ejecute su propio conjunto de evaluación, verifique las afirmaciones de velocidad del proveedor contra su carga de trabajo y decida entre la API y el autoalojamiento{{/3}} ({{4}}FP8 se ejecuta en aproximadamente 128 GB{{/4}}). {{5}}Los números restantes exclusivos del proveedor son lo bastante acotados como para planificar en torno a ellos{{/5}}.

En resumen

Ling-3.0-flash pasó de “hoja de especificaciones y afirmaciones del proveedor” a “pesos abiertos y puntuación independiente” en dos semanas. Un Índice de Inteligencia AA de 38 con 5.1B de parámetros activos —en la frontera de Pareto de pesos abiertos, con licencia MIT, a $0.075/$0.22— la convierte en uno de los modelos de pesos abiertos más eficientes a los que puedes apuntar ahora mismo, y uno que realmente puedes ejecutar tú mismo. Las advertencias son más limitadas de lo que eran: las cifras de velocidad máxima y de la ficha del modelo siguen siendo de Ant hasta que un laboratorio independiente las reproduzca. Para texto de alto volumen y llamadas a herramientas a este precio, se ha ganado una evaluación real.