
Ling-3.1-flash alcanza 41 en el Artificial Analysis Intelligence Index: el MoE de 560B duplica a su predecesor
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Ling-3.1-flash, la mezcla de expertos de 560.000 millones de parámetros de Ant Group, ahora lleva un número que su laboratorio no escribió: 41 en el Artificial Analysis Intelligence Index. El índice lo gestiona el evaluador independiente, en hardware que controla el evaluador, frente a una suite fija, y sitúa al modelo 21 puntos por encima de su propio predecesor directo, Ling-3.1-flash, que se sitúa en 20 en el mismo índice. Ant anunció Ling-3.1-flash a finales de septiembre de 2026, Artificial Analysis data el lanzamiento el 1 de octubre, y es tres meses más joven que el modelo al que duplica.
Esa brecha es la historia. Un movimiento de 21 puntos en un compuesto al que alimentan diez evaluaciones distintas no es el tipo de cosa que un gráfico de proveedor pueda falsear, ni es el tipo de cosa sobre la que este blog podría haber escrito hace quince días, cuando la única medición existente de Ling-3.1-flash era la propia tarjeta de benchmark de Ant: 1.673 de Elo en GDPval-AA v2.1, 75,16 en FrontierSWE, 65,35 en HealthBench Professional. Esos números eran afirmaciones reales de un laboratorio real, pero no reproducidas. El 41 es distinto en esencia. Es la primera cifra de este lanzamiento de la que se puede responsabilizar a un tercero.
Qué mide realmente el 41
El Artificial Analysis Intelligence Index v4.3.2 es un compuesto ponderado de diez evaluaciones: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. Leer un compuesto de forma aislada es un error, por lo que las filas de cada evaluación importan más que el titular:
• GDPval-AA — 1.621,75 para Ling-3.1-flash frente a 948,35 para Ling-3.0-flash. Este es el mayor salto individual del conjunto y en el que se basa la mayor parte del movimiento del índice.
• GDP.pdf — 0,100 en all-pass, frente a 0,054. Sigue siendo bajo en términos absolutos, pero casi se ha duplicado.
• Razonamiento de contexto largo de AA-LCR v1.1 — 0,83 frente a 0,73 del predecesor, y a la par de DeepSeek V4.1 Flash (Max) con 0,84.
• SciCode — 0,541 frente a 0,420. Una mejora en la ciencia de la codificación, no una mejora en la calidad del chat.
• Razonamiento de física de CritPt — 0,180, frente a 0,017 antes. Diez veces el predecesor en una base pequeña.
• AA-Omniscience — +2.22, frente a −17.88 de Ling-3.0-flash. Este se analiza más abajo, porque contradice el titular.
Ling-3.0-flash no se limitó a perder frente a Ling-3.1-flash en estas filas; se desplomó en dos de ellas. Obtuvo 0,032 en AutomationBench-AA y exactamente 0,000 en Terminal-Bench 4.0. Ese es el contexto en el que debe leerse el 41: el predecesor era un modelo de pesos abiertos eficiente y barato que prácticamente no tenía ninguna capacidad de terminal agéntica.

De dónde provino la ganancia: trabajo agéntico, no conversación
Compara las contribuciones al índice de Ling-3.1-flash con las de los dos modelos de la gama Flash con los que más se lo suele poner en fila, y surge un patrón que el agregado oculta. DeepSeek V4.1 Flash (Max) registra 39 en el mismo índice y GLM 5.3 Flash registra 42, de modo que los tres quedan dentro de una banda de tres puntos. Pero llegan ahí desde lugares distintos.
• Trabajo agéntico en terminal — Ling-3.1-flash 0.333 en Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.
• Trabajo agéntico del mundo real — Ling-3.1-flash 1.621,75 Elo en GDPval-AA, DeepSeek V4.1 Flash (Max) 1.600, GLM 5.3 Flash 1.646,86.
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.
• Ciencia de la programación — Ling-3.1-flash 0.541 en SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.
La lectura limitada es que Ling-3.1-flash es competitivo en los benchmarks agénticos y ligeramente superior en SciCode. La lectura útil es que es el más fuerte de los tres en las dos medidas de terminal agéntica a las que la mayoría se refiere cuando dice «¿puede impulsar un bucle de herramientas?», y está por detrás de ambos en la medida de fiabilidad del conocimiento. Eso es una forma específica, no una victoria general, y vale la pena nombrarla antes de que alguien compre una carga de trabajo basándose únicamente en el número del índice.
La factura que llega con un modelo más grande
Ling-3.0-flash tenía un precio de $0.07 por millón de tokens de entrada y $0.22 por millón de tokens de salida en la propia API de Ant, y tenía pesos abiertos bajo MIT. Ling-3.1-flash todavía no es ninguna de esas dos cosas. Artificial Analysis registra su costo operativo en $0.30 por millón de entrada y $0.90 por millón de salida —con una tasa de aciertos de caché de $0.06, un descuento del 80 % sobre la entrada— medido con la propia API de InclusionAI como proveedor de servicio. Eso es aproximadamente un aumento de cuatro veces en el precio de entrada respecto al modelo al que reemplaza, a cambio de una mejora de 21 puntos en el índice.
Que ese intercambio sea bueno depende enteramente de la carga de trabajo, y el propio índice puede ponerle precio: ejecutar las diez evaluaciones del Intelligence Index con Ling-3.1-flash cuesta unos $960 a esas tarifas, frente a aproximadamente $477 con DeepSeek V4.1 Flash (Max) y $280 con GLM 5.3 Flash. La razón no es solo la tarifa. Ling-3.1-flash es un razonador muy locuaz: consumió 220 millones de tokens de salida al procesar el índice, muy por encima de la mediana de su franja de precio, y sus ejecuciones de evaluación promedian unos 357 segundos por tarea, frente a 285 segundos con DeepSeek V4.1 Flash (Max) y 979 segundos con GLM 5.3 Flash. Por tarea, Ling-3.1-flash cuesta alrededor de $0.99, frente a los $0.27 de DeepSeek y los $0.25 de GLM 5.3 Flash.
Nada de esto se ve desde el 41, y todo ello acaba en la factura. Un modelo puede ganar un índice y perder un presupuesto.
Los dos números que contradicen el titular
El primero es la fiabilidad del conocimiento. Ling-3.1-flash obtiene +2,22 en AA-Omniscience, que mide si un modelo sabe lo que sabe: las respuestas correctas suman puntos, las alucinaciones restan puntos y las negativas a responder no cuestan nada. Su tasa de precisión es del 29,1 % y su tasa de alucinación es del 37,9 %. Comparado con sus compañeros de cuadra, ese es el perfil más débil del grupo: GLM 5.3 Flash obtiene +7,47 con una tasa de alucinación del 27,6 %, y DeepSeek V4.1 Flash (Max) obtiene −5,30 con una asombrosa tasa de alucinación del 96,5 % entre las preguntas respondidas. La puntuación compuesta recompensa a Ling-3.1-flash por la capacidad que demuestra, no por la fiabilidad con la que la demuestra, y un modelo que se inventa un tercio de lo que afirma necesita recuperación a su alrededor en producción.
El segundo es el contexto. Artificial Analysis incluye Ling-3.1-flash con una ventana de contexto de 1.000.000 de tokens. El propio material de lanzamiento de Ant también cita 1M como el objetivo. Pero la documentación para desarrolladores de Ant, que enumera las ventanas de la familia modelo por modelo, otorga a Ling-3.0-flash una ventana nativa de 256K ampliable a 1M y todavía no incluye ninguna entrada para Ling-3.1-flash. La fila distintiva de contexto largo que sí se llegó a medir —AA-LCR con 0,83— es una puntuación de razonamiento sobre contexto largo, no una medición de la ventana servida. Considera 1M como el techo declarado y valida la ventana entregada con tu propia solicitud de contexto largo antes de diseñar en función de ella.
Cómo se compara en la hoja de especificaciones
El panorama dimensión por dimensión, el sujeto primero, en cada línea:
• Parámetros totales — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.
• Parámetros activos por token — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash activa la mayor cantidad, y esa es una de las razones por las que su coste de servicio se sitúa donde se sitúa.
• Pesos y licencia — Ling-3.1-flash no publicados (propietario, sin texto de licencia) frente a DeepSeek V4.1 Flash (Max) abierto bajo MIT frente a GLM 5.3 Flash abierto bajo MIT.
• Contexto declarado — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Los tres afirman el mismo techo; solo dos de ellos tienen un checkpoint descargable con el que podrías verificarlo.
• Modalidad — Ling-3.1-flash entrada de texto, salida de texto vs. DeepSeek V4.1 Flash (Max) entrada de texto e imagen vs. GLM 5.3 Flash entrada de texto, imagen y vídeo. Este es el único eje en el que Ling-3.1-flash simplemente se queda atrás, y ninguna fila de benchmark lo compensa.
• Precio en la API del proveedor — Ling-3.1-flash $0.30 / $0.90 por millón de entrada / salida frente a DeepSeek V4.1 Flash (Max) $0.30 / $1.20 frente a GLM 5.3 Flash $0.15 / $0.50.
• Puntuación del índice — 41 vs 39 vs 42. Tres puntos de diferencia en una comparación entre tres no constituyen una clasificación; es un empate que se resuelve dependiendo de a cuál evaluación se parezca la carga de trabajo del lector.
Dónde puedes llamarlo
Ling-3.1-flash no está hoy en el catálogo de OrcaRouter — una consulta a nuestra API pública de modelos para el modelo bajo InclusionAI devuelve no encontrado, y no vamos a insinuar lo contrario. Actualmente se ejecuta en la API propia de Ant y en plataformas de terceros que distribuyen la versión, que es el alcance honesto de su disponibilidad. Lo que vale la pena señalar para quien compare los tres modelos anteriores es que los otros dos se pueden enrutar ahora mismo: DeepSeek V4.1 Flash y GLM 5.3 Flash están ambos en el catálogo de OrcaRouter a los precios de lista de sus proveedores sin ningún recargo, a través de una sola clave de API, con conmutación por error automática entre ellos. Si la comparación anterior indica que tu carga de trabajo valora más la fiabilidad del conocimiento que el trabajo de terminal agéntico, GLM 5.3 Flash es el que deberías probar — y puedes probarlo frente a DeepSeek V4.1 Flash con la misma clave, sin un segundo contrato ni una línea de código de cliente nueva.
Lo que cambia el 41 y lo que no
Lo que cambia es el estatus del lanzamiento. Ling-3.1-flash ya no es una especificación con una tabla de proveedor adjunta; es un modelo con una posición medida de forma independiente, y esa posición es un auténtico salto generacional en capacidad agéntica respecto a Ling-3.0-flash —el tipo de salto que proviene de un cambio de diseño en lugar de más cómputo con la misma receta. Lo que no cambia es nada relacionado con la adquisición. Los pesos siguen siendo cerrados, la licencia aún no está escrita, la modalidad sigue siendo solo texto, y el precio es aproximadamente cuatro veces el de su predecesor por una mejora que se concentra en tareas de agentes y de terminal.
Si tu trabajo son bucles de agentes, conducción de herramientas y cadenas de herramientas largas, el 41 es el número más significativo publicado sobre este modelo hasta ahora y merece una mirada seria mientras la disponibilidad aún se está expandiendo. Si tu trabajo es multimodal, o de respuesta a preguntas críticas para el conocimiento, o de inferencia de alto volumen sensible al presupuesto, el 41 no alcanza tu problema — y GLM 5.3 Flash, ya enrutable y ya abierto bajo MIT a la mitad del precio de salida, es el modelo mejor posicionado de los tres. El índice te dice dónde se encuentra Ling-3.1-flash. No te dice si debería importarte, y esa pregunta se responde con lo que estás construyendo.


Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
