Tarjeta hero editorial generada, titulada «Ling-3.1-flash: anunciado, no abierto», con el subtítulo «~560B parámetros totales · ~25B activos por token · hasta 1M de contexto». Tres tarjetas etiquetadas dicen «Pesos: aún no publicados», «Benchmarks: solo reportados por el proveedor» y «Sin licencia · sin tarjeta del modelo · sin descarga».
Guides & Insights

Ling-3.1-flash se anuncia, no es abierto: ~560B parámetros, un contexto de 1M de tokens y una gráfica que solo Ant ha ejecutado

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El equipo Ling de Ant Group puso cifras a su próximo modelo de la categoría rápida el 30 de septiembre de 2026 y, en la misma frase, dijo que todavía no puedes tenerlo. Ling-3.1-flash es una mezcla de expertos de aproximadamente 560 mil millones de parámetros que activa alrededor de 25 mil millones de parámetros por token y tiene una ventana de contexto de hasta 1 millón de tokens, según el anuncio del modelo que Ant publicó desde su propia cuenta @AntLingAGI. La frase que define este lanzamiento es la que sigue a las especificaciones: «Planeamos publicar el modelo como código abierto pronto». A día de hoy no hay repositorio de Ling-3.1-flash en Hugging Face, ni licencia, ni archivo de pesos descargable, ni evaluación de nadie fuera de Ant Group. Lo que existe es una gráfica de benchmark, una superficie de producto activa y una promesa.

Esa distinción lo es todo, y vale la pena decirlo sin rodeos, porque el encuadre que llega primero a la mayoría de la gente —un lanzamiento de pesos abiertos de clase 500B desde China que queda cerca de la frontera— describe algo que no ha ocurrido. Ling-3.1-flash no es un lanzamiento abierto. Es uno anunciado. Los dos no están cerca, y la brecha entre ellos es exactamente donde un lector puede quemarse: si planificas capacidad, presupuestas un piloto o redactas una nota de adquisición en torno a pesos abiertos que aún no existen, estás planificando a partir de un comunicado de prensa.

Lo que el anuncio realmente contiene

La publicación es breve y las cifras que contiene son específicas. Ant afirma un recuento total de parámetros de unos 560 mil millones frente a aproximadamente 25 mil millones activos por token, una proporción cercana a 1 de cada 22, ligeramente más densa que la generación Ling-3.0-flash a la que sucede —ese modelo funciona con 124B en total frente a 5,1B activos, alrededor de 1 de cada 24, en un cuerpo de menos de una cuarta parte del tamaño—. El contexto se cita como «hasta 1M tokens», cuatro veces la ventana de 262.144 tokens que la familia Ling-3.0-flash ofrece hoy. Se adjuntan tres puntuaciones destacadas: 1.673 Elo en GDPVal-AA v2.1, 75,16 en FrontierSWE y 65,35 en HealthBench Professional.

Todas y cada una de esas cifras están reportadas por el proveedor, son de primera fuente y no se han publicado en ningún formato que un tercero pueda reproducir. No hay arnés de evaluación, ni conjunto de prompts, ni configuración de ejecución, ni semilla; y, más fundamentalmente, no hay pesos con los que ejecutarlos. Si las cifras de Ant son correctas, el modelo se sitúa en el nivel más alto de los lanzamientos chinos de modelos abiertos; actualmente no hay forma de averiguar si son correctas.

El gráfico, y la advertencia inherente a él

Ant Group's own Ling-3.1-flash benchmark card, published from the @AntLingAGI account on 30 September 2026. Multi-panel bar charts compare Ling-3.1-flash against GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3 and GLM 5.3 Flash, and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states that HealthBench Professional was evaluated in the AQ environment.

Ant publicó Ling-3.1-flash junto con una tarjeta comparativa de varios paneles que lo sitúa en un campo de modelos de frontera y casi de frontera: GPT-5.6 Sol, Claude Opus 5, Kimi K3, dos entradas de la familia GLM y DeepSeek-V4.1-Flash. En todos los paneles, la barra de Ling se sitúa en lo más alto o cerca de él en las métricas agénticas y de programación, y en la zona media en las de múltiples turnos y las específicas de dominio. Léala tal como es —una selección de tareas del propio proveedor, extraída de un conjunto que incluye trabajo agéntico de propósito general, programación, tareas del ámbito bancario y atención sanitaria— y es una tarjeta que parece creíble.

Mira quién aparece en ella, sin embargo, y hay algo que llama la atención. Los pares de referencia que Ant eligió son GPT-5.6 Sol y Claude Opus 5. Ambos modelos están ya una generación por detrás. Opus 5.5 y GPT-6 Sol se lanzaron el 22 de septiembre de 2026, el mismo día, y ambos son enrutables hoy. Los modelos más recientes que Ant no incluyó en la tarjeta son precisamente aquellos con los que un lector querría medirla, que es la misma queja que surgió en la primera oleada de comentarios sobre el lanzamiento: el deseo de que un modelo que llega en octubre se hubiera comparado con la frontera de octubre en lugar de la de julio. Eso no es una crítica al modelo, que bien podría mantenerse firme. Es una razón para tratar la tarjeta como una afirmación orientativa más que como un veredicto, y para señalar que la comparación que Ant eligió favorece menos el resultado de lo que lo fecha.

Donde puedes tocarlo, y una nota al pie sin explicación

Hoy hay exactamente un lugar donde Ling-3.1-flash se ejecuta para un usuario: el propio producto de Ant. La interfaz de Ling Studio en ling.tbox.cn incluye Ling-3.1-flash en su selector de modelos, y la propia descripción que la aplicación hace del modelo es más amplia que la ficha de benchmarks: lo posiciona para «agentes de propósito general, búsqueda, trabajo de oficina rutinario y desarrollo de software/código», que es el posicionamiento habitual para este nivel: no el razonador más profundo de la familia, sino el que está pensado para ser invocado de forma constante y económica.

Esa superficie también conlleva el detalle más incómodo del lanzamiento. La propia nota al pie de la tarjeta de benchmark dice que HealthBench Professional —la cifra de 65,35, uno de los tres números del texto del anuncio— fue «evaluado en el entorno AQ», y añade que las capacidades sanitarias de Ling-3.1-flash «actualmente solo pueden experimentarse en AQ». Nada en la tarjeta explica qué es AQ, y ninguna documentación pública que pudiéramos encontrar lo define. Una puntuación destacada con un calificador de entorno adjunto, donde el entorno no tiene nombre, no es un resultado reproducible; es una demo de producto con un número al lado.

Qué es cognoscible y qué no

Clasificar este lanzamiento en esos dos grupos es lo más útil que un lector puede hacer con él hoy.

Lo que se puede saber ahora: los parámetros, el recuento de parámetros activos y la ventana de contexto según lo indicado por el proveedor; los tres benchmarks del proveedor; la existencia del modelo en el propio producto de Ant; el conjunto de comparación que Ant seleccionó; el hecho de que no se hayan publicado pesos, licencia ni tarjeta de modelo; y el hecho de que Artificial Analysis, que puntuó de forma independiente la generación anterior, no tenga una página de Ling-3.1-flash. A la fecha de este escrito, el pipeline de puntuación independiente que hizo legible la cifra de 20 puntos del Intelligence Index de Ling-3.0-flash no ha publicado absolutamente nada sobre 3.1.

No puede saberse ahora: si los pesos se abrirán realmente y bajo qué licencia; si la arquitectura es una versión ampliada de la pila híbrida Ling-3.0 o algo nuevo; cuánto cuesta el modelo a través de la API de Ant, si es que tiene un precio de API; cómo se comporta con contexto largo en la práctica, en contraste con cómo se especifica la ventana; y si las brechas en los benchmarks se mantienen cuando alguien que no es Ant ejecuta las mismas tareas. Cada una de esas es una pregunta que un modelo lanzado responde el primer día y que un modelo anunciado responde en algún día posterior que no se ha programado.

Generated two-column information card. Left column headed "Knowable today" lists five cards: "~560B total / ~25B active (vendor)", "up to 1M-token context (vendor)", "1,673 Elo GDPval-AA v2.1 (vendor)", "available in Ant's Ling Studio only" and "no independent score exists". Right column headed "Not knowable" lists five cards: "whether the weights will open", "the licence terms", "API price per million tokens", "long-context behaviour in practice" and "whether the benchmark gaps hold".

Cómo leer un día como este

El patrón es ahora lo bastante común como para ponerle nombre. Un laboratorio chino con un historial sólido publica una ficha de modelo y una gráfica de benchmark, los números quedan cerca de la frontera, la comunidad reacciona a los números, y los pesos llegan —o no— semanas después. Ling-3.0-flash ejecutó exactamente esa jugada este verano, y vale la pena recordar cómo se resolvió: Ant lo anunció el 24 de julio de 2026 como un modelo solo de API, sin declaración de licencia y sin benchmark independiente, y los pesos bajo MIT no aparecieron en Hugging Face hasta el 7 de agosto, dos semanas después del anuncio. Ling-3.1-flash está en el punto equivalente de ese arco en el día uno, con la diferencia adicional de que esta vez la promesa de código abierto es explícita en el anuncio en lugar de inferirse.

Ninguno de los modelos que Ant eligió como puntos de comparación está en nuestro catálogo como sujeto del artículo: Ling-3.1-flash, Ling-3.0-flash y Ling-3.0-flash-VL devuelven todos "not-found" hoy en el catálogo de OrcaRouter, y no vamos a fingir lo contrario. Pero tres de los pares de esa tabla sí son enrutables ahora mismo: Claude Opus 5, GPT-5.6 Sol y DeepSeek-V4.1-Flash están todos detrás de una sola clave, al precio de lista del proveedor sin margen alguno, con conmutación por error automática entre ellos. Eso importa más de lo que parece en una semana como esta, porque la forma honesta de evaluar un modelo anunciado es ejecutar la comparación que Ant propone —contra los modelos que de verdad puedes invocar— mientras el sujeto de la comparación sigue siendo una tabla.

Cuando lleguen los pesos, la pregunta útil no será si Ling-3.1-flash superó a Opus 5 en una calificación Elo. Será si un MoE de ~560B con ~25B activos puede mantener un contexto de 1M de tokens a un precio que haga que la esparsidad valga la pena, y si la licencia es lo suficientemente permisiva como para autoalojar. Esas son las dos preguntas que el anuncio no responde, y son las únicas que decidirán si esto se convierte en un modelo sobre el que la gente construye o en una diapositiva en la próxima presentación de alguien. Por ahora: el nombre es real, los números son solo de Ant, y los pesos siguen siendo una frase.

Generated horizontal timeline with four milestone nodes. "Jul 24, 2026 — Ling-3.0-flash announced, API-only, no weights, no licence"; "Aug 7, 2026 — MIT weights land on Hugging Face, 14 days later"; "Sep 30, 2026 — Ling-3.1-flash announced: ~560B, ~25B active, 1M context"; and a dashed open node reading "Weights: not yet — 'we plan to open-source soon'", captioned "the same point in the same arc, on day one".