
Ling-3.1-flash vs Ling-3.0-flash: Qué cambian realmente una ventana de 1M de tokens y 4,5 veces los parámetros
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 262 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
La familia Ling de Ant Group tiene un nuevo nivel rápido, y esta vez apenas tiene una frase de historia. Ling-3.1-flash se anunció el 30 de septiembre de 2026: aproximadamente 560.000 millones de parámetros totales, unos 25.000 millones activos por token, una ventana de contexto citada de hasta 1 millón de tokens y una frase hecha adjunta: «Planeamos publicar el modelo como código abierto pronto». El modelo al que reemplaza en la cima de la línea rápida, Ling-3.0-flash, es un animal distinto en todos los sentidos: 124.000 millones de parámetros totales, 5.100 millones activos por token, un contexto servido de 262.144 tokens, pesos con licencia MIT en Hugging Face desde el 7 de agosto y una puntuación independiente de 20 en el Artificial Analysis Intelligence Index. Uno de estos modelos lo puedes descargar hoy. Del otro solo puedes leer. Compararlos es genuinamente útil, pero solo si la comparación parte de ahí.
La aritmética del titular es sencilla y ligeramente engañosa. Ling-3.1-flash tiene aproximadamente 4,5 veces el número total de parámetros de Ling-3.0-flash y aproximadamente 4,9 veces el número de parámetros activos: 25B frente a 5,1B por token. Una lectura casual dice: «un modelo mucho más grande, por lo tanto, un modelo mucho más inteligente». La lectura más cuidadosa es que Ant ha conservado aproximadamente la proporción de dispersión mientras escalaba el cuerpo, y lo que eso te aporta es capacidad, no necesariamente profundidad de razonamiento por token: un modelo que enruta 25B de sus 560B a través de cada token hace más trabajo por token que uno que enruta 5,1B, pero también paga aproximadamente cinco veces la computación por token para hacerlo. Dónde cae ese equilibrio depende enteramente de si la arquitectura de Ant maneja los parámetros adicionales de manera eficiente, y esa es una pregunta que el anuncio no responde.
Los dos modelos, uno al lado del otro
Coloque los hechos publicados uno al lado del otro y que las generaciones se separen con claridad. Cada línea a continuación indica lo que Ant o un evaluador independiente ha publicado realmente; cuando falta un número, es porque nadie lo ha publicado.
• Parámetros totales — Ling-3.1-flash: ~560B (proveedor). Ling-3.0-flash: 124B (ficha del modelo).
• Parámetros activos por token — Ling-3.1-flash: ~25B (proveedor). Ling-3.0-flash: 5.1B (ficha del modelo).
• Ventana de contexto — Ling-3.1-flash: hasta 1M de tokens (proveedor). Ling-3.0-flash: 256K nativos, servidos a 262,144 (tarjeta del modelo y recetas de inferencia).
• Pesos y licencia — Ling-3.1-flash: no publicados; sin repositorio, sin licencia (verificado el 30 de septiembre y de nuevo el 1 de octubre de 2026). Ling-3.0-flash: MIT, en Hugging Face como inclusionAI/Ling-3.0-flash y en ModelScope desde el 7 de agosto de 2026.
• Formatos de pesos — Ling-3.1-flash: ninguno disponible. Ling-3.0-flash: BF16 (~255GB) y FP8 (~128GB) del laboratorio, además de cuantizaciones de la comunidad.
• Procedencia del benchmark — Ling-3.1-flash: totalmente reportado por el proveedor, sin arnés público, sin pesos para volver a ejecutar. Ling-3.0-flash: puntuado de forma independiente por Artificial Analysis con un Índice de Inteligencia de 20, con velocidad de salida medida y volumen de generación de tokens publicados junto a él.
• Disponibilidad — Ling-3.1-flash: solo en el producto Ling Studio propio de Ant. Ling-3.0-flash: se puede alojar por cuenta propia y también invocar a través de la API para desarrolladores de Ant.

Para qué es probablemente la capacidad adicional
La propia descripción de una línea que Ant hace de Ling-3.1-flash es lo más informativo del lanzamiento. La aplicación Ling Studio lo presenta para "agentes de propósito general, búsqueda, trabajo de oficina rutinario y desarrollo de software/código": un enfoque de trabajo de oficina y de agentes, no un enfoque de benchmarks de razonamiento. Eso es coherente con cómo está organizada la familia: Ling es la línea de texto y herramientas de propósito general, Ring es la línea de razonamiento y Ming se encarga de lo multimodal. Ling-3.0-flash ocupó el mismo puesto una generación antes, y era explícitamente el nivel rápido y barato, no el buque insignia.
Si interpretas el escalado bajo esa luz, tiene sentido. Las cargas de trabajo agénticas y de invocación de herramientas son largas, repetitivas y necesitan mucho contexto: un único bucle de agente puede consumir decenas de miles de tokens de salida de herramientas acumulada antes de tomar una acción, así que una ventana de 1M de tokens es un requisito funcional, no un adorno de hoja de especificaciones. Escalar el recuento total de parámetros mientras se mantiene una fracción activa grande es la manera de añadir conocimiento del mundo y profundidad en el seguimiento de instrucciones a un modelo que todavía tiene que ser lo bastante rápido como para ubicarse dentro de un bucle. Ant no está construyendo aquí un buque insignia más lento y más inteligente; está construyendo un nivel rápido más grande.
El contraargumento es el costo, y es la misma aritmética que llega desde la dirección opuesta. La capacidad adicional no es gratuita en el momento de la inferencia — se paga en cada token, y Ant no ha publicado ningún precio para Ling-3.1-flash en absoluto: ni una tabla de tarifas de API, ni un descuento por caché, nada comparable a los $0.075/$0.22 por millón de tokens que indica la generación anterior. Ese es el número que falta que decidiría esta comparación, y falta.
Benchmarks, y quién los ejecutó
Ling-3.1-flash llega con tres puntuaciones que parecen sólidas por sí solas: 1.673 de Elo en GDPVal-AA v2.1, 75,16 en FrontierSWE y 65,35 en HealthBench Professional. Las tres son de Ant, tomadas del anuncio, y ninguna ha sido reproducida por un laboratorio externo. La consecuencia práctica es que pueden compararse con cifras de otros proveedores, pero no con cifras independientes; y el Índice de Inteligencia de 20 puntos de Artificial Analysis para Ling-3.0-flash es una cifra independiente en una escala diferente, así que ponerlas una al lado de la otra sería comparar una medición con una afirmación. No hay una página de Ling-3.1-flash en Artificial Analysis en el momento de escribir esto.
Una nota al pie en el propio gráfico de Ant merece señalarse por sí misma. La tarjeta indica que el resultado de HealthBench Professional se evaluó en el «entorno AQ» y que las capacidades sanitarias de Ling-3.1-flash actualmente solo pueden experimentarse en AQ. Ninguna documentación pública explica qué es AQ. Una puntuación destacada que lleva un calificador de entorno sin nombre no es algo que un equipo externo pueda reproducir, ni siquiera una vez que los pesos existan.
¿Cuál usar realmente esta semana?
La cuestión generacional se resuelve de manera distinta según lo que necesites hoy, y para casi todos la respuesta ahora mismo no es el modelo más nuevo.
Si necesitas ejecutar algo esta semana, Ling-3.0-flash es el único de los dos que existe en una forma usable: pesos MIT que puedes autoalojar, FP8 si quieres la huella más pequeña, precios de API de primera parte publicados y una puntuación independiente que te dice qué obtienes. Es un modelo genuinamente bueno en su categoría: la evaluación independiente lo situó en la frontera de Pareto de pesos abiertos en cuanto a inteligencia frente al total de parámetros, y calificó su velocidad como alta, con la advertencia de que es inusualmente verboso y generó alrededor de 260M tokens durante su evaluación, frente a una mediana cercana a 100M.
Si estás planificando para los próximos seis meses, Ling-3.1-flash es la dirección a seguir y todavía no un componente. Las cosas concretas que hay que vigilar antes de que se convierta en uno: si los pesos realmente se abren y bajo qué licencia, si la ventana servida es genuinamente de 1M o una extensión de un contexto nativo más corto, cuánto cuesta por millón de tokens, y si un laboratorio independiente reproduce el 75.16 en FrontierSWE. Que cualquiera de esas cosas se materialice sería motivo para volver a ejecutar la comparación. Ninguna se ha materializado.

Dónde encaja esto en una pila de enrutamiento
Hoy ninguno de los modelos Ling está en nuestro catálogo — Ling-3.0-flash, Ling-3.0-flash-VL y Ling-3.1-flash devuelven no encontrado contra la API de modelos de OrcaRouter, así que la respuesta honesta a «¿puedo llamarlo a través de ustedes?» es no, por ahora. Aquello para lo que una capa de enrutamiento es realmente útil en una semana como esta es la otra mitad del problema: los modelos contra los que compararías a un candidato. Claude Opus 5, GPT-5.6 Sol y DeepSeek-V4.1-Flash son rutas activas al precio de lista del proveedor y sin ningún recargo, y un enrutador que los mantiene detrás de una sola clave con conmutación automática por error es la forma de mantener un sistema de evaluación apuntando a un objetivo cambiante sin mantener cuatro integraciones. Cuando lleguen los pesos de Ling-3.1-flash y la licencia sea legible, esa es también la forma de la decisión: añadir un endpoint, no reconstruir todo el stack.
El resumen generacional es breve. Ling-3.0-flash es un modelo ya lanzado, puntuado de forma independiente y con licencia permisiva que se puede autoalojar hoy mismo. Ling-3.1-flash es una promesa más grande, de mayor contexto y más costosa de ejecutar que Ant aún no ha entregado en ninguna forma que un desarrollador pueda usar. Tratar el segundo como una mejora del primero es el error al que invita este lanzamiento, y los números aún no lo respaldan.

