Tarjeta hero editorial generada titulada "Ling-3.1-flash vs Qwen3.8-Flash" con el subtítulo "Dos respuestas a la misma pregunta: ¿cómo se construye un nivel rápido?" Panel izquierdo encabezado "Escalar y anunciar" lleva la leyenda "~560B en total · ~25B activos · 1M de contexto" y una etiqueta que dice "pesos: próximamente". Panel derecho encabezado "Reducir y lanzar" lleva "125B en total · 6B activos · previsualiza Qwen4" y una etiqueta que dice "pesos: en Hugging Face".
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: Dos formas de construir un nivel rápido, y solo una de ellas se lanza

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos laboratorios chinos abordaron este otoño el mismo problema —cómo construir un modelo barato y rápido que sea lo bastante bueno como para estar dentro de un bucle de agente— y llegaron a respuestas opuestas. Ling-3.1-flash, anunciado por Ant Group el 30 de septiembre de 2026, es una mezcla de expertos de aproximadamente 560.000 millones de parámetros que activa unos 25.000 millones de parámetros por token, con una ventana de contexto citada de hasta 1 millón de tokens y la intención declarada de abrir su código «pronto». Qwen3.8-Flash, lanzado por el equipo de Aliba​s Qwe​n el 26 de agosto de 2026, es una mezcla de expertos multimodal de 125.000 millones de parámetros que activa unos 6.000 millones de parámetros por token, con pesos que ya están en Hugging Face bajo el nombre Qwen3.8-Flash-Next, un modelo de producción activo en la API de QwenCloud a 0,15 $ por millón de tokens de entrada y 0,47 $ por millón de salida, y soporte desde el día 0 en SGLang. Un laboratorio aumentó la escala y anunció. El otro redujo la escala y lanzó. Esa diferencia es más instructiva que cualquier benchmark que haya publicado cualquiera de los dos laboratorios.

También es la razón por la que esta comparación debe leerse con cuidado. Ling-3.1-flash no tiene pesos, ni licencia, ni tarjeta de modelo, ni precio de API, ni evaluación independiente; todo el registro publicado es una publicación de anuncio, una tabla de benchmarks del proveedor y un espacio en el propio producto Ling Studio de Ant. Qwen3.8-Flash tiene todo eso y una ventaja de cuatro semanas en haber sido ejecutado por personas que no trabajan para Alibaba. Comparar una elección de arquitectura es justo. Comparar capacidades todavía no lo es.

Las dos decisiones de diseño, y por qué divergen

La apuesta de Qwen es que el nivel rápido sea estructuralmente distinto del buque insignia, y no meramente más pequeño que este. Qwen3.8-Flash activa 6 mil millones de sus 125 mil millones de parámetros —aproximadamente un 95 % de esparsidad— y obtiene su capacidad de dónde se enruta el cómputo, más que de su amplitud bruta. Alibaba ha dejado claro que la arquitectura subyacente, que combina Gated DeltaNet con Qwen Sparse Attention y una tabla de embeddings de N-gramas, es una vista previa temprana de la generación Qwen4, publicada anticipadamente a propósito para que los motores de inferencia, las herramientas de cuantización y los patrones de despliegue puedan madurar en torno a ella antes de que se construyan sobre ella los modelos costosos. El resultado es un modelo que es barato por token por construcción: unos 6 mil millones de parámetros de trabajo en cada token, a un precio que Alibaba fijó en 0,15 USD de entrada y 0,47 USD de salida por millón.

La apuesta de Ant, hasta donde lo revela el anuncio, está más cerca del escalado convencional con un contexto muy largo. Ling-3.1-flash mantiene una gran fracción activa — aproximadamente 25 mil millones por token de 560 mil millones, es decir, alrededor de uno de cada veintidós — y ofrece una ventana de hasta 1 millón de tokens, cuatro veces lo que ofrece la generación anterior de Ling. La aplicación Ling Studio lo describe como diseñado para "agentes de propósito general, búsqueda, trabajo de oficina rutinario y desarrollo de software/código", lo cual es un posicionamiento de gama rápida, pero la economía de los parámetros es la de un modelo mucho más pesado. Con una entrada idéntica, un token que pasa por 25 mil millones de parámetros activos cuesta aproximadamente cuatro veces más cómputo que uno que pasa por 6 mil millones, antes de que entre en juego cualquier decisión de precios.

Ninguno de los dos enfoques es incorrecto, y ambos son respuestas defendibles a "qué limita a un modelo barato". Qwen apuesta a que la esparsidad y un nuevo stack de atención son el techo. Ant apuesta a que el techo es el contexto y el conocimiento del mundo, y que puede permitirse el cómputo. Lo que los separa para un lector no es la filosofía de diseño sino la entrega: un diseño que puedes descargar y medir versus un diseño sobre el que solo puedes leer.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

Lo que te cuesta cada uno y lo que eso significa en la práctica

La brecha de precios no es sutil y no es estrecha. Qwen3.8-Flash se publica a 0,15 USD por millón de tokens de entrada, 0,47 USD por millón de salida y 0,018 USD por millón en lecturas de caché —las mismas cifras en el anuncio de Alibaba, en la ficha del modelo de producción del proveedor y en la página del modelo enrutado que servimos, que es como se ve un traspaso con 0 % de margen cuando lo comparas con tres fuentes. Ant no ha publicado ninguna tarifa para Ling-3.1-flash en absoluto: ningún precio de API, ningún descuento por caché, nada comparable. La única cifra publicada para la línea Ling es la de la generación anterior, que figura a 0,075 USD de entrada y 0,22 USD de salida por millón, aproximadamente la mitad de la tarifa de entrada de Qwen y menos de la mitad de su tarifa de salida. Si el nuevo nivel de Ling tiene un precio cercano a donde se situaba el anterior, tendría un precio inferior al de Qwen3.8-Flash sobre el papel; si su precio se acerca lo más mínimo al cómputo que implican sus 25.000 millones de parámetros activos, no lo hará. En cualquier caso, es una conjetura, porque el número no existe.

El contexto es donde la afirmación de Ling es genuinamente más amplia. Ant declara hasta 1 millón de tokens para Ling-3.1-flash; Qwen3.8-Flash viene con un contexto predeterminado de 1M de tokens en la API de producción y una ventana nativa de 262.144 tokens en los pesos abiertos, ampliable. Sobre la cifra de Ling pesan dos salvedades y ninguna está resuelta. Primero, «hasta 1M» es una especificación, no una medición: nadie ha publicado el comportamiento de recuperación en contextos largos de un modelo que nadie fuera de Ant puede invocar. Segundo, la generación anterior de Ling tenía exactamente la misma brecha entre la ventana anunciada y la explicación arquitectónica que había detrás, y la respuesta solo llegó cuando finalmente se publicaron los pesos, el formato y los límites de contexto. El 1M del titular es una promesa. El 1M de Qwen3.8-Flash es un valor predeterminado servido con el que puedes contrastar la afirmación de Ant.

Por qué «vista previa» es la palabra honesta en un lado de esto.

El propio planteamiento de Alibaba sobre Qwen3.8-Flash es que se trata de una vista previa de arquitectura lanzada bajo un nombre de producción: los pesos abiertos llevan el sufijo «Next» precisamente para que nadie confunda el prototipo con el modelo de servicio ajustado. Ese planteamiento ha sido validado por los acontecimientos más que por el marketing: SGLang ofreció soporte desde el día 0 para Qwen3.8-Flash-Next el día de su lanzamiento, y el modelo también quedó configurado para Transformers, vLLM y TokenSpeed, además de que los pesos han sido adoptados desde entonces por las comunidades de cuantización. Las versiones pronto se volvieron algo corriente, que es el aspecto que tiene un modelo lanzado al mercado.

El anuncio de Ant tiene la misma forma un paso antes: una publicación de especificaciones antes del lanzamiento, con la declaración explícita de que el modelo se publicará como código abierto pronto. Esta es una forma legítima de lanzar — Ling-3.0-flash siguió exactamente ese camino en julio, y los pesos se publicaron bajo MIT el 7 de agosto, unas dos semanas después. Pero el estado de los dos proyectos hoy no es comparable, y ninguna cantidad de lectura de gráficos cierra la brecha. Vale la pena ser específico sobre lo que un externo puede aportar a cada uno.

¿Qué es verificable de forma independiente sobre Ling-3.1-flash hoy: que el anuncio existe y está fechado el 30 de septiembre; que las cifras de parámetros, parámetros activos y contexto son propias de Ant; que el modelo aparece en el producto Ling Studio de Ant; y que no se han publicado pesos, licencia ni ficha del modelo. ¿Qué es verificable de forma independiente sobre Qwen3.8-Flash: que los pesos son descargables en BF16 y FP8; que los términos de la licencia son legibles; que el precio de la API está publicado; y que las afirmaciones de Alibaba sobre benchmarks han estado abiertas a reproducción desde finales de agosto. La segunda lista es más larga, y esa es toda la comparación en miniatura.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

¿Cómo se evaluarían realmente los dos?

Ant publicó una ficha de benchmark con Ling-3.1-flash que lo sitúa frente a GPT-5.6 Sol, Claude Opus 5, Kimi K3, dos variantes de GLM y DeepSeek-V4.1-Flash, con cifras destacadas de 1.673 Elo en GDPVal-AA v2.1, 75,16 en FrontierSWE y 65,35 en HealthBench Professional. Hay dos problemas en esa ficha antes de que alguien discuta las cifras. El primero es el conjunto de comparación: ambos modelos de frontera que Ant eligió están una generación por detrás, ya que Claude Opus 5.5 y GPT-6 Sol entraron en funcionamiento el 22 de septiembre de 2026 y ahora se pueden enrutar, lo que significa que la ficha evalúa con benchmark un modelo de octubre frente a la frontera de julio en lugar de frente a la actual. El segundo es una nota al pie en la propia ficha, que afirma que el resultado de HealthBench Professional provino del "entorno AQ" y que las capacidades sanitarias del modelo actualmente solo pueden experimentarse en AQ — un entorno que ninguna documentación pública define. Una puntuación destacada cuyo entorno de evaluación no se nombra no es reproducible ni siquiera en principio.

Las afirmaciones comparables de Qwen3.8-Flash, por el contrario, se hicieron cuando los pesos ya estaban disponibles, y Alibaba apostó su posicionamiento a una afirmación que cualquiera puede comprobar: que la capacidad proviene de la proporción de dispersión, no del número de parámetros. Cuatro semanas de uso no son un veredicto, pero son suficientes para que las afirmaciones hayan dejado de ser indiscutidas —lo cual es el estado útil para un modelo.

Qué hacer realmente con esto, hoy

Para los desarrolladores, la división práctica es sencilla. Ling-3.1-flash no es un componente que puedas adoptar esta semana: no hay endpoint al que llamar, ni pesos que alojar, ni licencia que comprobar, ni precio con el que presupuestar. Sea cual sea el modelo final, lo útil ahora es establecer un disparador —pesos publicados, licencia permisiva, una puntuación independiente en FrontierSWE que esté cerca de 75.16— y volver a revisarlo. La historia de la propia generación anterior muestra que los pesos pueden llegar dos semanas después del anuncio, así que ese disparador podría activarse pronto.

Qwen3.8-Flash ya es un componente. Está activo en nuestro catálogo como modelo enrutado al precio de lista del proveedor y con cero margen — la ficha de enrutado muestra $0.15 de entrada, $0.47 de salida y $0.018 por millón de lecturas de caché, las mismas cifras que publica Alibaba, que es lo que significa en la práctica una política de 0 % de margen, y no en una diapositiva. Detrás de una sola clave, se sitúa junto a Claude Opus 5, GPT-5.6 Sol y DeepSeek-V4.1-Flash, de modo que la comparación que Ant propone —un candidato frente a la frontera actual— puede ejecutarse apuntando una configuración a dos rutas en lugar de mantener dos integraciones, con un failover automático que se encarga del fin de semana en que un proveedor falla. Esa es la diferencia entre una discusión de arquitectura y un experimento.

El veredicto, en la medida en que se pueda dar: Qwen hizo la apuesta arquitectónica más audaz y tuvo la confianza de publicarla pronto y dejar que la gente la desmontara. Ant hizo la apuesta más pesada —más parámetros, más cómputo activo por token, más contexto— y hasta ahora ha publicado un gráfico en lugar de un modelo. El gráfico se ve bien. El gráfico también es lo único que alguien tiene.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario