Tarjeta de título principal para el artículo 'Qwen3.8-Flash-Next — INFORME DE FILTRACIÓN' con una insignia 'NO VERIFICADO — VISTA PREVIA DE LA ARQUITECTURA QWEN4', el subtítulo 'Alibaba envía la arquitectura Qwen4 antes que el modelo', tres chips que dicen 'Fuente: @kimmonismus', '25 ago 2026' y 'Lanzamiento: 26 ago 23:00 UTC+08', una tarjeta a la izquierda que dice 'La afirmación: un MoE multimodal de pesos abiertos que muestra la arquitectura Qwen4' y una tarjeta a la derecha que dice 'Estado: pesos sin publicar, ~24h para el lanzamiento'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Qwen3.8-Flash-Next ya está disponible: Alibaba lanza la arquitectura Qwen4 antes de que exista Qwen4

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Qwen3.8-Flash-Next por fin tiene cifras que Alibaba no produjo, y no dicen lo que dice la versión más estridente de la historia. En el Artificial Analysis Intelligence Index, reformulado a la v4.3 el 7 de septiembre, la vista previa de pesos abiertos de Alibaba obtiene 40 puntos y ocupa el quinto puesto entre los 113 modelos de su clase de comparación. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) —el modelo con el que se lo sigue comparando— obtiene 35 y ocupa el noveno puesto. Eso no es paridad; es una ventaja de cinco puntos para el modelo más pequeño. También es la primera tabla de clasificación amplia e independiente que llega a un modelo cuyas únicas cifras publicadas, hasta este mes, eran las del propio proveedor. El modelo en sí no es nuevo: los pesos se publicaron en Hugging Face el 24 de agosto y el lanzamiento formal en ModelScope llegó el 26 de agosto. Lo que cambió este mes es que ahora un lector puede verificar las afirmaciones en lugar de aceptarlas sin más.

La indicación para revisar esta publicación provino de @teortaxesTex en X, quien preguntó si la vista previa está silenciosamente subestimada: supuestamente en el mismo nivel de Artificial Analysis que DeepSeek V4 Flash 0731, "casi 4 veces más pequeña", con "casi 3 veces menos parámetros activos". Dos de esas tres afirmaciones no resisten el contacto con los datos publicados, y la corrección favorece al modelo, porque en los números que importan la vista previa está por delante de su comparación, no a su nivel.

Comencemos por el tamaño, donde las cifras no son ambiguas. Qwen3.8-Flash-Next almacena aproximadamente 180B de parámetros — un cuerpo de mezcla de expertos de 125B, una tabla de embeddings de n-gramas independiente de 51B y alrededor de 4B de capas de predicción de múltiples tokens — y activa 6B de ellos por token. DeepSeek V4 Flash 0731 almacena 284B y activa 13B. Esas son las cifras que aparecen en la ficha del modelo de Qwen y en la documentación de DeepSeek, y son las cifras que Artificial Analysis incluye en ambas páginas de los modelos. Las proporciones que arrojan son 1,6x en parámetros almacenados y 2,2x en parámetros activos. Es una historia de eficiencia genuina, y es la razón por la que esta arquitectura importa — pero no es 4x ni 3x. No pudimos encontrar ninguna cifra publicada en ningún lugar que respalde los multiplicadores más grandes. Si la intención era la huella de memoria en servicio en lugar del recuento de parámetros, ese número tampoco está publicado.

¿Qué se anunció?

Alibaba publicó la arquitectura Qwen4 antes de publicar un modelo Qwen4. Qwen3.8-Flash-Next —un modelo multimodal de mezcla de expertos y pesos abiertos, construido sobre la arquitectura de nueva generación que impulsará a la familia Qwen4— salió en dos pasos: el repositorio oficial Qwen/Qwen3.8-Flash-Next se publicó en Hugging Face el 24 de agosto, dos días antes del lanzamiento en ModelScope al que había estado apuntando el temporizador del teaser. El lanzamiento formal en ModelScope se produjo el 26 de agosto a las 23:00 UTC+08:00, con la variante Qwen3.8-Flash servida y con precio al mismo tiempo. La afirmación principal de la tarjeta del modelo, que ha estado circulando desde entonces, es que un modelo que activa 6B parámetros por token supera a Claude Opus 4.6 Max en 8 de 9 benchmarks comparables en la propia tabla de Alibaba. La familia Qwen4 completa, sigue diciendo Alibaba, llegará más tarde.

Si no has estado siguiendo la cadencia de Aliba​ba este mes, el punto de referencia es Qwen3.8-Max — el buque insignia de 2,4 billones de parámetros lanzado el 3 de agosto y publicado como código abierto con el nombre Qwen3.8-2.4T-A95B menos de dos semanas después. Los pesos de Qwen3.8-Flash-Next ya están disponibles menos de un mes después de eso. El mismo laboratorio que publicó un modelo de pesos abiertos de 2,4 billones de parámetros ahora está entregando la arquitectura de la generación posterior, antes de que el buque insignia de esa generación siquiera tenga nombre.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

La parte que vale la pena releer es el propio planteamiento de Alibaba. El modelo se describe como construido sobre la arquitectura de próxima generación "que impulsará la próxima familia Qwen4" —y explícitamente no como Qwen4 en sí mismo. La razón declarada por Alibaba es que los cambios arquitectónicos deberían estar en manos de la comunidad antes de que llegue la familia, para que los runtimes, las cuantizaciones y las aplicaciones estén listos cuando se lance el producto real. Esa es una posición de marketing, pero también es un compromiso técnico: mostrar primero la parte difícil, llevar a la comunidad consigo.

Lo que la tarjeta del modelo resuelve, y lo que no:

Confirmado, según la tarjeta oficial del modelo: Qwen3.8-Flash-Next es de pesos abiertos, multimodal y un modelo de mezcla de expertos basado en la arquitectura Qwen4 — la tarjeta lo denomina «una vista previa experimental de la arquitectura que sustentará a Qwen4».

• Confirmado, según la tarjeta del modelo y la configuración: dos cambios arquitectónicos destacados — Red Delta con Compuerta (GDN) y Atención Dispersa Qw​en (QSA) — dentro de un híbrido de 48 capas que ejecuta 36 capas de atención lineal contra 12 capas de atención completa.

• Confirmado a partir del repositorio: 125B de parámetros totales con 6B activados por token (512 expertos, 10 enrutados más uno compartido) — Artificial Analysis indica 180B una vez que se contabilizan la tabla de embeddings n-gram separada de 51B y las capas MTP — con un contexto nativo de 262.144 tokens extensible a 1.000.000 bajo la Qw​en Community License 1.0.

• Ya no sin confirmar: el modelo ahora ha sido evaluado de forma independiente, y por partida doble. La tabla de Alibaba sigue siendo la del propio proveedor y sigue sin haber sido reproducida, pero ya no es la única evidencia sobre la mesa.

Ya están los primeros resultados independientes, y dicen "por delante", no "empatados"

Artificial Analysis publicó el Intelligence Index v4.3 el 7 de septiembre, y la nueva puntuación es la razón por la que algo de esto es comparable en absoluto. La actualización v4.3 reemplazó Terminal-Bench v2.1 por el mucho más difícil Terminal-Bench v4.0 y cambió τ³-Banking por AutomationBench-AA, un benchmark de flujos de trabajo agénticos creado con Zapier sobre un conjunto de pruebas privado y reservado de 657 tareas. La ponderación del conjunto privado reservado aumentó al 45 %. El propósito declarado era evitar que la frontera manipulase el índice, y el efecto sobre las puntuaciones fue enorme: GPT-6 Astra y Claude Fable 5.1, los dos líderes, quedaron ambos en 53 tras haber obtenido puntuaciones en los sesenta en la escala anterior.

Eso importa cuando se leen los números de la comunidad. Las cifras de «56 frente a 52» que circularon para Qwen3.8-Flash-Next y DeepSeek V4 Flash 0731 a principios de septiembre se calcularon con el índice anterior a la v4.3; con la v4.3, el par se sitúa en 40 y 35. Citar cualquiera de los dos conjuntos frente al otro es comparar dos exámenes distintos.

En el índice actual, así es como se comparan realmente los dos modelos en las propias evaluaciones de Artificial Analysis:

• Índice de Inteligencia — Qwen3.8-Flash-Next 40 (5.º de 113 en su clase) vs. DeepSeek V4 Flash 0731 (Razonamiento, Esfuerzo máximo) 35 (9.º de 113).

• Trabajo de conocimiento agéntico — AA-Briefcase 1587 vs 1259; GDPval-AA v2 1647 vs 1468; AutomationBench-AA 56% vs 54%.

• Terminal y programación — Terminal-Bench v4.0 25% frente a 12%; SciCode 51% frente a 50%.

• Razonamiento general y científico — Humanity's Last Exam 38% vs 39%; CritPt 11% vs 17%; GDP.pdf 16% vs 11%; AA-LCR v1.1 80% vs 80%.

• Recuerdo factual frente a confabulación — AA-Omniscience −10 vs −14, una ventaja de cuatro puntos para la preview de Qwen.

• Precio — $0,15 por millón de entrada / $0,47 por millón de salida frente a $0,44 / $1,32; combinado $0,0882 por millón de tokens frente a $0,2298. Costo por tarea del Intelligence Index: $0,37 frente a $0,22.

• Velocidad y latencia — 53 tokens de salida por segundo frente a 210; tiempo hasta el primer token 2,80 s frente a 0,98 s; respuesta de extremo a extremo 49,76 s frente a 12,88 s; tiempo por tarea 1.572,60 s frente a 221,65 s.

• Uso de tokens — 108k tokens de salida por tarea frente a 62k, de los cuales 72k son tokens de razonamiento frente a 45k. Artificial Analysis califica la versión preliminar como "muy verbosa" y "más lenta que el promedio".

• Contexto y tamaño — 256k tokens vs 1,000k; 180B en total / 6B activos vs 284B / 13B.

Leídos en conjunto, esa es una respuesta más precisa que «del mismo nivel». Qwen3.8-Flash-Next gana el argumento de precisión y eficiencia en casi todos los ejes que mide Artificial Analysis: es el modelo con mayor puntuación, es más pequeño y cuesta aproximadamente un tercio por token. DeepSeek V4 Flash 0731 gana de forma rotunda el argumento de producción: cuatro veces más rendimiento, una cuarta parte de la latencia de extremo a extremo, siete veces menos tiempo real por tarea completada y cuatro veces más ventana de contexto. Y en cuanto al coste por tarea completada —la cifra que sobrevive a la verbosidad de los tokens—, DeepSeek es el modelo más barato, con 0,22 $ frente a 0,37 $, pese a tener un precio de etiqueta más alto. Si «infravalorado» significa «mejor de lo que su reputación sugiere en calidad por parámetro», la etiqueta es justa. Si significa «deberías estar usando este en su lugar», las columnas de velocidad y latencia dicen lo contrario.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

También hay evidencia independiente fuera de Artificial Analysis. Un arnés de terceros, smf-bench, publicó una ejecución «Official A» el 5 de septiembre: Qwen3.8-Flash-Next, en la cuantización NVFP4 de NVIDIA sobre un único DGX Spark, con el razonamiento desactivado, obtuvo 137 de 157 (87,3 %) con un impecable 30 de 30 en su sección de programación, frente a 117 de 157 de una ejecución con dos Spark de DeepSeek V4 Flash Vision-Exp en el mismo arnés de 157 pruebas. Eso es un arnés en una sola clase de máquina, y no sustituye a una evaluación amplia —pero es un segundo punto de datos que apunta en la misma dirección, y proviene de alguien sin interés alguno en ninguno de los dos proveedores.

Lo que realmente es la arquitectura Qwen4

Dos mecanismos sostienen la historia. El primero, GDN — Gated Delta Network — es la capa de atención lineal de Aliba​ba. Mientras que un transformer estándar mantiene una caché de clave-valor que crece con la longitud de la secuencia, una capa GDN mantiene un estado recurrente de tamaño fijo y lo actualiza con una regla de compuerta aprendida; el linaje pasa por DeltaNet y Mamba-2. La ventaja es la que ha estado impulsando discretamente la línea Qw​en desde Qwen3-Next: los contextos largos siguen siendo baratos porque el estado no crece, mientras que una minoría de capas de atención completa permanece en la mezcla para realizar la recuperación precisa en la que la atención lineal es mala. En la generación actual, esa mezcla funciona con aproximadamente tres capas GDN por cada capa de atención completa: el análisis de la comunidad del checkpoint Qwen3.8-2.4T-A95B cuenta 69 capas GDN frente a 23 capas de atención. Qwen3.8-Flash-Next muestra la misma proporción de tres a uno: 36 capas de atención lineal frente a 12 capas de atención completa.

El segundo, QSA —Qwen Sparse Attention—, es la pieza genuinamente nueva, y su descripción pública aún es escasa: la tarjeta del modelo añade que opera a nivel de microbloque con un presupuesto de 512 bloques / 2048 tokens, pero todavía no existe una descripción técnica completa. Esa escasez de detalles es, en sí misma, parte del patrón. La vista previa de Qwen3-Next a finales de 2025 introdujo Gated DeltaNet con la misma documentación escasa, y la arquitectura solo quedó completamente especificada cuando la serie Qwen3.5 la adoptó. Para el lector, la conclusión práctica es la misma en ambos casos: primero aparece el canario de la arquitectura; después, la documentación y los modelos de producción.

El manual que ya funcionó una vez

Aliba​ba ya ha ejecutado esta misma jugada antes, y funcionó. A finales de 2025, Qwen3-Next adelantó Gated DeltaNet y un híbrido de atención lineal y completa. Cuando se lanzó la serie Qwe​n3.5, adoptó ese plano a escala —y el híbrido se ha mantenido a lo largo de la generación Qwen3.8 desde entonces, incluido el buque insignia de 2,4T. La razón por la que el precedente importa aquí es el momento que implica. La familia completa Qwen4 debería esperarse más allá de esta vista previa, no dentro de ella; si la brecha de Qwen3-Next sirve de guía, la distancia entre "aquí está la arquitectura" y "aquí está la familia" se mide en meses. Nada en la ficha del modelo confirma eso —es una inferencia a partir de un patrón que Aliba​ba ya ha ejecutado dos veces.

Lo que todavía no sabemos

Las incógnitas se han reducido, pero no han desaparecido:

• La tabla de benchmarks del proveedor sigue siendo la del proveedor. Artificial Analysis ya ha evaluado el modelo de forma independiente, lo que resuelve el mayor vacío en la cobertura del lanzamiento, pero la propia afirmación principal de Aliba​ba, de que el modelo supera a Claude Opus 4.6 Max en 8 de 9 benchmarks comparables, se apoya en las evaluaciones internas de la propia Aliba​ba (CoWorkBench, JobBench, AndroidWorld) junto con otras públicas, y ninguna de ellas ha sido reproducida por un tercero.

• Si la vista previa es el mismo modelo que el servido. La ficha presenta Qwen3.8-Flash-Next como la vista previa experimental de pesos abiertos, mientras que la variante servida en producción —Qwen3.8-Flash de Qwen Cloud— añade un contexto predeterminado de 1,000,000 de tokens y herramientas integradas. Aún no se indica si ese modelo servido es la misma arquitectura con una ventana de contexto mayor, y las puntuaciones independientes anteriores corresponden a la vista previa de pesos abiertos, no al modelo servido de la API.

• La licencia es conocida y es una licencia real: Qwen Community License 1.0 permite el uso comercial, incluida la venta de obras derivadas, pero requiere un acuerdo comercial por separado con Alibaba si operas un negocio de Model-as-a-Service o de asistente de trabajo con IA que supere un umbral definido de ingresos y usuarios activos mensuales. No es lo mismo que la licencia Qwen3.8-Max condicionada por ingresos, pero vale la pena leerla antes de construir sobre los pesos.

• Un informe de campo que vale la pena señalar: una publicación del 6 de septiembre sobre una compilación comunitaria de NVFP4 registra un fallo de llamada a herramientas con gramática restringida cuando están habilitados tanto el pensamiento como la predicción de varios tokens, atribuido a la ruta de decodificación restringida de xgrammar. Es un error de tiempo de ejecución en una compilación comunitaria cuantizada, no una propiedad del modelo, pero si tu arnés de evaluación se apoya en llamadas a herramientas con gramática restringida, es lo primero que debes probar.

Una familia iterando en un ciclo de dos semanas

La cadencia circundante es una historia por sí misma. Qwen3.8-Max, el buque insignia de 2,4 billones de parámetros, se lanzó el 3 de agosto; el Qwen3.8-2.4T-A95B de pesos abiertos llegó después, el 12–13 de agosto; el Qwen3.8-27B gratuito con Apache-2.0 aterrizó unos días más tarde; y ahora, antes de que termine el mes, se está presentando un avance de la arquitectura de la próxima generación — y una semana después se le somete a benchmarks de forma independiente. Ningún otro laboratorio está iterando a este ritmo. Para un lector que elige modelos, la consecuencia práctica es que "el mejor Qwen" es un blanco móvil — y el delta entre generaciones llega más rápido de lo que suele adaptarse el ecosistema circundante. Comprar una decisión en lugar de un modelo es cada vez más la jugada defendible.

Lo que un desarrollador debería hacer ahora

Las cifras de eficiencia cambian el cálculo del servicio local más de lo que lo hizo el lanzamiento en sí. Un modelo con 6B activos que obtiene 40 en el índice actual es compresible: la cuantización NVFP4 oficial de NVIDIA es la que usó la ejecución de smf-bench del 5 de septiembre, y las compilaciones NVFP4 y FP8 de la comunidad que van más allá ya están en circulación, que es lo que hace que un despliegue de clase GPU única de un modelo almacenado de 180B sea siquiera plausible. La advertencia no ha cambiado: esto es una vista previa no probada, la tabla del proveedor no ha sido reproducida, y la forma de las puntuaciones independientes (fuerte en trabajo de conocimiento y tareas de terminal, más débil en generación de repositorios de horizonte largo y tasas de aprobación de agentes de un solo intento) significa que las debilidades del modelo aparecen exactamente donde viven los cambios de código de producción. Ejecuta una copia de bajo riesgo de una carga de trabajo real contra él antes de que toque algo que importe, y deja que la conmutación por error automática absorba los momentos en que una vista previa se comporta mal.

En cuanto al precio, el panorama que era confuso en el lanzamiento ahora es concreto. Artificial Analysis enumera la tarifa de servicio de la vista previa en $0.15 por millón de tokens de entrada y $0.47 por millón de salida, frente a $0.44 y $1.32 para DeepSeek V4 Flash 0731 — el mismo orden de magnitud que la variante Qwen3.8-Flash servida, que Qwen Cloud lista a ¥1 y ¥3 (aproximadamente $0.16 y $0.47). La variante de producción es la que realmente puedes llamar hoy: se enruta aquí como qwen/qwen3.8-flash, y OrcaRouter transmite el precio de lista del proveedor con un 0% de margen, así que cuando Alibaba mueve ese número, el endpoint se mueve con él el mismo día. Lo mismo ocurre con el modelo de comparación en este artículo — DeepSeek V4 Flash 0731 se enruta como deepseek/deepseek-v4-flash-0731 al precio de lista del proveedor, lo que hace que la mitad del costo por token de la comparación anterior sea comprobable con tu propio tráfico en lugar de con los recuentos de tokens de un benchmark. Lo que no se enruta aquí es la propia vista previa de Flash-Next de pesos abiertos: para usarla hoy, descargas los pesos y los sirves tú mismo, que es precisamente por lo que la historia de cuantización anterior importa más que el precio de lista. El techo que esta generación tiene que superar sigue siendo visible en el mismo endpoint: Qwen3.8-Max (qwen/qwen3.8-max) se sitúa en $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida, también pasado al precio de lista del proveedor.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

La secuencia práctica no ha cambiado mucho, pero la confianza que la respalda sí. Si quieres la variante de producción servida sin descargar 100 GB de pesos, Qwen3.8-Flash ya se puede invocar a precio de lista. Si quieres la arquitectura —GDN, QSA, la tabla de n-gramas, los trucos de offload—, los pesos son descargables y los runtimes están listos: vLLM lo sirve desde el primer día con una ruta de offload que mantiene la tabla de embeddings de n-gramas de 51B parámetros en la memoria del host en lugar de en VRAM permanente, SGLang y TensorRT-LLM están en la lista de Day 0 de NVIDIA, y la biblioteca de Ollama incluye una compilación de MLX que puedes descargar en Apple Silicon. Lo único que hay que dejar de hacer es tratar el modelo como una incógnita en cuanto a calidad. Ya se ha medido, y ha dado buenos resultados.

Qué ver a continuación

• Si los números independientes se mantienen a medida que el índice madura. El 40 de Qwen3.8-Flash-Next viene con una factura de tokens inusualmente alta —quemó 245M de tokens en la ejecución del índice frente a una mediana de 140M— y la propia nota de Artificial Analysis lo califica de «muy verboso». Una puntuación producida por razonar durante más tiempo sigue siendo una puntuación, pero es el tipo de cosa que cambia cuando cambia la evaluación. La próxima revisión del índice es la verdadera prueba de si 40 era un nivel o un máximo local.

• Si el Qwen3.8-Flash servido recibe una puntuación por separado. Cada cifra independiente de este artículo corresponde a la preview de pesos abiertos. La variante de producción con contexto de 1M y herramientas integradas no tiene una puntuación independiente propia, y si es la misma arquitectura bajo un contexto más largo, esa es una evaluación barata que alguien debería publicar.

• Cómo se sostiene en la práctica el soporte de serving desde el día 0: las cifras de rendimiento de GB300 declaradas por el proveedor siguen siendo declaradas por el proveedor, y las configuraciones de paralelismo de expertos TP4 y de offload de KV todavía son lo bastante nuevas como para ser frágiles.

• Cuánto tiempo espera Alibaba antes de que la familia completa de Qwen4 siga a la vista previa.

La parte de lo que sabemos hasta ahora de esta historia ya se ha cerrado en gran medida. La hoja de especificaciones es pública, los pesos se pueden descargar, la arquitectura está confirmada, la variante Qwen3.8-Flash ofrecida ya está activa en APIs alojadas a precio de lista, y el modelo ha sido evaluado de forma independiente por dos partes distintas —con el modelo más pequeño imponiéndose en el apartado de calidad y el más grande en el de rendimiento—. Lo que sigue abierto es si un preview de 6B activos generaliza más allá de los benchmarks contra los que se ajustó, y cuánto tiempo esperará Alibaba antes de que llegue la familia Qwen4 completa. Esa última pregunta sigue siendo la que el lanzamiento deja sin responder, y sigue siendo la que más importará.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario