Tarjeta editorial destacada generada titulada “Ling-3.1-flash ya está disponible y es gratis durante dos semanas” con el subtítulo “Lo que el MoE de 560B realmente ofrece hoy”. Cuatro tarjetas redondeadas muestran “Parámetros: 560B en total / ~25B activos”, “Contexto: 262.144 tokens”, “Límite de salida: 32.768 tokens” y “Pesos: sin publicar”, sobre una línea de pie de página que dice “Especificaciones declaradas por el proveedor; no hay precio publicado tras la prueba.”
Guides & Insights

Ling-3.1-flash ya está disponible y es gratis durante dos semanas: lo que realmente ofrece el MoE de 560B

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ling-3.1-flash, el modelo de mezcla de expertos de aproximadamente 560.000 millones de parámetros que el laboratorio inclusionAI de Ant Group anunció entre el 29 y el 30 de septiembre de 2026, dejó de ser un comunicado de prensa esta semana: ahora responde solicitudes en una API comercial en vivo. El modelo se ejecuta como prueba gratuita de dos semanas en una puerta de enlace de inferencia de terceros, y también aparece en el propio producto Ling Studio de Ant —lo que traslada la pregunta de «¿existe?» a «¿qué ofrece realmente?». La respuesta es más limitada de lo que sugieren las cifras destacadas. Ling-3.1-flash es texto de entrada, texto de salida; ofrece un contexto de 262.144 tokens (256K) aunque el anuncio cita 1M como objetivo final; su salida está limitada a 32.768 tokens; y nadie ha publicado el precio que pagarás el día quince, cuando se cierre la ventana gratuita y se suponga que los pesos estarán disponibles a continuación.

Esa brecha entre la tarjeta de anuncio y el endpoint en vivo es lo que conviene retener, porque la mayoría de la cobertura de este lanzamiento lee las especificaciones como si el modelo ya las estuviera entregando hoy. No es así. Ling-3.1-flash es el segundo modelo de este laboratorio en tres meses que llega como lo que el rastreador independiente LLM Releases archiva sin rodeos bajo «pesos no publicados», y la diferencia entre lo que Ant dice que es el modelo y lo que un desarrollador puede invocar ahora mismo es donde un presupuesto o un proyecto piloto puede salir mal de forma silenciosa.

¿Qué cambió entre el anuncio y hoy?

El anuncio en sí fue una publicación de especificaciones: ~560B de parámetros totales, ~25B activos por token, hasta 1M de tokens de contexto, tres cifras destacadas de evaluación y una promesa — «tenemos previsto abrir el código fuente del modelo pronto». Nada de eso ha cambiado. Lo que ha cambiado es la disponibilidad. En cuestión de un día desde el anuncio, se podía acceder al modelo en un edge comercial, y la prueba gratuita expone el mismo endpoint real que expondría una de pago: la misma superficie de API, la misma modalidad de solo texto, el mismo interruptor de modo de pensamiento para trabajo de agentes de largo horizonte.

Para cualquiera que esté decidiendo si dedicarle tiempo de ingeniería, la prueba es toda la historia esta semana, y tiene doble filo. La inferencia gratuita durante dos semanas es una forma genuinamente barata de ver cómo se comporta el modelo con tus propios prompts — algo poco común para un modelo de este tamaño. Pero gratis es un estado promocional, no un precio. Todavía no hay ninguna lista de precios publicada posterior a la prueba para Ling-3.1-flash en ningún sitio, así que cualquier modelo de costes que construyas sobre el nivel gratuito es un marcador de posición hasta que Ant y sus proveedores de alojamiento le pongan números.

La ficha técnica, y las tres cifras que aún son promesas

• Parámetros — 560B en total, ~25B activos por token. Según lo indicado por el proveedor, y aproximadamente el cuádruple de los 124B totales / 5.1B activos de la generación anterior. La proporción de dispersión se mantiene cerca de 1 de cada 22, así que la activación no es drásticamente más ligera — el modelo es simplemente mucho más grande que aquel al que sucede.

• Contexto — servido a 262,144 tokens hoy. "Hasta 1M" es el objetivo una vez que se habilite la ventana; no es lo que te da el endpoint de prueba, y es la lectura errónea más común de este lanzamiento.

• Salida — 32.768 tokens como máximo. Razonable para bucles de agentes, ajustado si pretendes generar documentos largos en una sola pasada.

• Modalidad — entrada de texto, salida de texto. Este es un modelo de texto. La visión, el audio y la entrada de archivos no forman parte del lanzamiento, y no se ha dado una fecha para ellos.

• Reasoning — un stack híbrido con un conmutador explícito de modo de pensamiento, el mismo patrón que utilizó la generación anterior, dirigido a trabajo de agentes de varios pasos y llamada a herramientas en lugar de chat de un solo turno.

• Pesos y licencia: no publicados. Este es el dato que más importa y el que todavía no tiene ningún valor: a día de hoy no existe ningún repositorio de Hugging Face, ni texto de licencia, ni checkpoint descargable alguno.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

La tarjeta de referencia, leída con el descuento que necesita.

El propio informe de Ant sitúa a Ling-3.1-flash en una puntuación agregada de 81,0 en cinco benchmarks de agentes, con 40,4 % en Terminal-Bench 4.0, 55,9 % en SWE-Atlas y 65,35 % en HealthBench Professional; la propia versión de la compañía añade 1.673 Elo en GDPVal-AA v2.1 y 75,16 en FrontierSWE. Todos y cada uno de esos números son de primera mano. No hay harness, ni conjunto de prompts, ni pesos para que nadie más vuelva a ejecutar la suite, lo cual es la advertencia habitual para un modelo en esta etapa —y aquí vale la pena decirlo claramente: una puntuación no reproducida de un proveedor es una afirmación sobre un modelo, no una medición de él.

La tarjeta también es informativa de un modo que sus autores quizá no pretendían. El resultado del 40,4 % en Terminal-Bench 4.0 queda muy por detrás del nivel de frontera; Claude Sonnet 5.5, un modelo de peso medio más que un buque insignia, obtiene un 70,6 % en la misma versión de ese benchmark. La lectura honesta no es que Ling-3.1-flash sea débil —un 40,4 % es una cifra respetable de terminal agéntica para un modelo posicionado en coste—, sino que el encuadre de “cerca de la frontera en benchmarks clave” que circuló en redes sociales el día del anuncio no sobrevive al contacto con las filas específicas. El benchmark donde el modelo se ve más fuerte, HealthBench Professional con 65,35, es también el que lleva la incómoda nota al pie: Ant afirma que se evaluó en un entorno que llama AQ y que la capacidad sanitaria del modelo “actualmente solo puede experimentarse en AQ”, sin definir qué es AQ en ningún lugar público. Una puntuación de titular con un entorno sin nombre adjunto es una demo, no un resultado reproducible.

Por qué un modelo grande que llega en fase de prueba es la verdadera noticia

El movimiento más interesante aquí es la secuencia, no los parámetros. Ling-3.0-flash pasó directamente a pesos abiertos. Este está llegando primero como prueba, con los pesos, la licencia y los precios oficiales aún retenidos, y un compromiso público de abrir el código solo después de que termine el periodo gratuito. Eso es un manual de lanzamiento comercial disfrazado de anuncio de modelo abierto, y es un cambio real que vale la pena seguir: si los pesos llegan bajo una licencia permisiva, la comunidad obtiene un modelo base de 560B para ajustar y destilar; si llegan con ataduras comerciales, la prueba de dos semanas era el producto y la frase "código abierto" era marketing. En cualquier caso, la decisión cae dentro de la ventana de prueba, y es lo que hay que observar, más que cualquier fila concreta de benchmark.

Dónde se ejecuta, y el panorama honesto del enrutamiento

Por ahora, Ling-3.1-flash es accesible a través de la propia superficie de producto del proveedor y mediante plataformas de inferencia de terceros que ejecutan la prueba —y eso es todo. Hoy no está en el catálogo de OrcaRouter; una consulta a nuestra API pública de modelos para Ling-3.1-flash, Ling-3.0-flash y la variante de visión de Ling-3.0 devuelve not-found en todos los casos, y no vamos a fingir lo contrario. Cuando un endpoint de Ant alcance la disponibilidad general con un precio de lista publicado, el modelo de pass-through con el que opera OrcaRouter —precio de lista del proveedor trasladado sin margen alguno, de modo que un recorte de precio del proveedor se active en nuestro lado el mismo día— es exactamente el esquema que le conviene a un modelo cuyo precio aún no está escrito.

Lo que puedes hacer hoy, sin esperar la decisión sobre la licencia, es ejecutar la comparación que de verdad importa para un modelo no probado: medirlo frente a los modelos de la gama Flash que puedes invocar ahora mismo. Gemini 3.8 Flash y DeepSeek-V4.1-Flash están ambos en nuestro catálogo a los precios de lista de sus proveedores, detrás de una única clave de API, con conmutación por error automática entre ellos. Para un modelo en prueba gratuita cuyos pesos y tarifa son ambos desconocidos, esa es la forma sensata de mantenerlo: un candidato más al que puedes dirigir tráfico mientras dure la prueba, y una ruta de producción que no depende de lo que ocurra el día quince.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

Qué hacer esta semana

Si el modelo es relevante para tu trabajo, la prueba es la razón para actuar ahora en lugar de esperar a que se resuelva la cuestión de los pesos abiertos: dos semanas de inferencia gratuita en un MoE de 560B es la evaluación más barata que vas a conseguir, y la respuesta a «¿responde bien a mis prompts?» está disponible hoy, aunque la respuesta a «¿puedo alojarlo yo mismo?» no lo está. Tres cosas que comprobar mientras la ventana esté abierta, en orden:

• Ejecuta tu propia carga de trabajo, no la ficha comparativa. Las cifras publicadas son la selección de tareas de Ant; tus prompts son los que deciden tu stack.

• Prueba el contexto que realmente vas a usar. El endpoint ofrece 262.144 tokens, no 1M. Si tu diseño depende de la ventana más grande, estás diseñando con base en una promesa.

• No bases un modelo de costos en «gratis». Gratis es un estado de dos semanas. Hasta que se publique una lista de precios, planifica volver a un modelo Flash-tier con precio como opción predeterminada y trata Ling-3.1-flash como capacidad adicional.

El anuncio es real y el modelo está en funcionamiento, lo que es más de lo que se podía decir hace una semana. Pero publicado y abierto y funcionando en una prueba son estados distintos, y este es firmemente el segundo: una especificación de 560B, un endpoint de 256K, una ficha de benchmarks únicamente del proveedor y un plazo de dos semanas que es la única fecha límite firme en todo el lanzamiento.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario