Tarjeta de título principal para el artículo 'Qwen3.8-Flash-Next — INFORME DE FILTRACIÓN' con una insignia 'NO VERIFICADO — VISTA PREVIA DE LA ARQUITECTURA QWEN4', el subtítulo 'Alibaba envía la arquitectura Qwen4 antes que el modelo', tres chips que dicen 'Fuente: @kimmonismus', '25 ago 2026' y 'Lanzamiento: 26 ago 23:00 UTC+08', una tarjeta a la izquierda que dice 'La afirmación: un MoE multimodal de pesos abiertos que muestra la arquitectura Qwen4' y una tarjeta a la derecha que dice 'Estado: pesos sin publicar, ~24h para el lanzamiento'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Qwen3.8-Flash-Next: Alibaba presenta un adelanto de la arquitectura Qwen4 antes de que Qwen4 exista

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Alibaba está a punto de publicar la arquitectura Qwen4 antes de publicar un modelo Qwen4. Qwen3.8-Flash-Next — un modelo multimodal de mezcla de expertos (mixture-of-experts) de pesos abiertos, construido sobre la arquitectura de próxima generación que impulsará la familia Qwen4 — está programado para hacerse público en ModelScope a las 23:00 hora de Pekín el 26 de agosto de 2026. Alibaba presenta el lanzamiento como una vista previa tecnológica: los desarrolladores obtienen la arquitectura antes, la familia completa Qwen4 llegará más tarde. Al momento de escribir esto, el número de parámetros, la licencia y el precio no están confirmados, así que esta es una pieza de lo-que-sabemos-hasta-ahora — cada dato específico a continuación está etiquetado según su nivel de certeza.

Si no has estado siguiendo el ritmo de lanzamientos de Alibaba este mes, el ancla es Qwen3.8-Max — el buque insignia de 2,4 billones de parámetros lanzado el 3 de agosto y publicado como código abierto como Qwen3.8-2.4T-A95B menos de dos semanas después. Qwen3.8-Flash-Next aterriza menos de un mes después. El mismo laboratorio que publicó un modelo de pesos abiertos de 2,4 billones de parámetros ahora está entregando la arquitectura para la generación siguiente, antes incluso de que se nombre al buque insignia de esa generación.

¿Qué se anunció?

La señal llegó a la arena a través de los canales habituales. Una página teaser de ModelScope para Qwen3.8-Flash-Next se publicó el 25 de agosto con una insignia de "Próximo lanzamiento abierto", el lema "Hacia la próxima generación — velocidad relámpago" y un contador de lanzamiento fijado para el 26 de agosto de 2026 a las 23:00 (UTC+08:00). El equipo de Qw​en de Alibaba publicó el mismo día en X — "La próxima ola de Qw​en está por llegar". La publicación que nos hizo llegar esta noticia, de @kimmonismus en X, describía lo mismo con palabras ligeramente diferentes: un MoE multimodal de pesos abiertos sobre la arquitectura de próxima generación, con acceso anticipado para que la comunidad pueda prepararse para la familia Qwen4.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

La parte que vale la pena releer es el propio enfoque de Alibaba. El modelo se describe como construido sobre la arquitectura de próxima generación «que impulsará la próxima familia Qwen4», y explícitamente no como el propio Qwen4. La razón declarada de Alibaba es que los cambios arquitectónicos deberían estar en manos de la comunidad antes de que llegue la familia, para que los runtimes, las cuantizaciones y las aplicaciones estén listos cuando se lance el producto real. Eso es una postura de marketing, pero también es un compromiso técnico: presentar primero la parte difícil y llevar a la comunidad consigo.

Lo que está confirmado hoy, y lo que no:

• Confirmado, según el teaser y la declaración de Qwen: Qwen3.8-Flash-Next es de pesos abiertos, multimodal y un modelo MoE sobre la arquitectura Qwen4.

• Confirmado, según la declaración de Qw​en: introduce dos cambios arquitectónicos principales — la arquitectura híbrida GDN y Qw​en Sparse Attention (QSA).

• Confirmado, según el teaser: la hora de lanzamiento, 2026-08-26 23:00 (UTC+08:00), en ModelScope.

• No confirmado: parámetros totales o activos, términos de licencia, longitud de contexto, disponibilidad o precio de la API, y todas las puntuaciones de los benchmarks. Aún no existe ninguna evaluación independiente porque los pesos no se han publicado todavía.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Lo que realmente es la arquitectura Qwen4

Dos mecanismos impulsan la historia. El primero, GDN — Gated Delta Network — es la capa de atención lineal de Alibaba. Mientras que un transformer estándar mantiene una caché clave-valor que crece con la longitud de la secuencia, una capa GDN mantiene un estado recurrente de tamaño fijo y lo actualiza mediante una regla de compuerta aprendida; el linaje pasa por DeltaNet y Mamba-2. El beneficio es el que ha estado impulsando en silencio la línea Qw​en desde Qwen3-Next: los contextos largos siguen siendo económicos porque el estado no crece, mientras una minoría de capas de atención completa permanece en la mezcla para realizar la recuperación precisa en la que la atención lineal es deficiente. En la generación actual, esa mezcla tiene aproximadamente tres capas GDN por cada capa de atención completa — el análisis de la comunidad del checkpoint Qwen3.8-2.4T-A95B cuenta 69 capas GDN frente a 23 capas de atención. Qwen3.8-Flash-Next se describe como la "arquitectura híbrida GDN" en exactamente ese linaje.

El segundo, QSA — {{1}}Qw​en Sparse Attention{{/1}} — es el componente genuinamente nuevo, y aún no existe una descripción técnica pública: solo el nombre y su promoción como uno de los dos cambios principales de la vista previa. Esa ausencia de detalle es en sí misma parte del patrón. {{2}}La vista previa de Qwen3-Next{{/2}} a finales de 2025 introdujo Gated DeltaNet con la misma escasez de documentación, y la arquitectura solo se especificó por completo una vez que la {{3}}serie Qw​en3.5{{/3}} la adoptó. Para el lector, la conclusión práctica es la misma en ambos casos: el canario de la arquitectura aparece primero, y la documentación y los modelos de producción aparecen después.

El manual que ya funcionó una vez

Alibaba ya ha ejecutado esta misma jugada antes, y funcionó. A finales de 2025, Qwen3-Next adelantó Gated DeltaNet y un híbrido de atención lineal y atención completa. Cuando la serie Qw​en3.5 se lanzó, adoptó ese plan a gran escala — y el híbrido ha perdurado desde entonces a lo largo de la generación Qw​en3.8, incluido el buque insignia de 2,4T. La razón por la que este precedente importa aquí es el calendario que implica. La familia completa de Qwen4 debería esperarse al otro lado de esta vista previa, no dentro de ella; si la brecha de Qwen3-Next sirve de guía, la distancia entre «aquí está la arquitectura» y «aquí está la familia» se mide en meses. Nada en el adelanto confirma eso — es una inferencia basada en un patrón que Alibaba ya ha ejecutado dos veces.

Lo que todavía no sabemos

Las incógnitas son el punto de un avance, y son reales:

• Parámetros. El teaser no revela ninguno. La especulación de la comunidad en X y Reddit — sin respaldo oficial — apunta a una configuración de aproximadamente 125B en total / 6B activos con una gran tabla de búsqueda de incrustaciones de n-gramas. Trátalo como un rumor.

• El nivel "Flash". En la generación Qw​en3.5, el Qwen3.5-Flash, solo en la nube, era una variante mejorada del Qwen3.5-35B-A3B de peso abierto. Si Qwen3.8-Flash-Next es la contraparte de peso abierto de un modelo Qw​en3.8 de tamaño similar es desconocido; puede ser el modelo de la clase 125B-A6B en su lugar. Ambas lecturas son suposiciones.

• Licencia. Los recientes lanzamientos de Alibaba de Qw​en van desde Apache-2.0 (Qw​en3.8-27B) hasta la licencia Qwen3.8-Max restringida por ingresos. Dónde aterrice Flash-Next determina si puede usarse comercialmente, y en qué contexto.

• Puntos de referencia. La declaración de Qw​en destaca la codificación agéntica, las tareas de horizonte largo y la inteligencia multimodal, pero no se adjuntan cifras y no hay una evaluación independiente hasta que se publiquen los pesos.

Una familia iterando en un ciclo de dos semanas

La cadencia circundante es una historia en sí misma. Qwen3.8-Max, el buque insignia de 2,4 billones de parámetros, se lanzó el 3 de agosto; el Qwen3.8-2.4T-A95B de pesos abiertos le siguió el 12 y 13 de agosto; el Qw​en3.8-27B gratuito con licencia Apache-2.0 aterrizó días después; y ahora, antes de que termine el mes, se muestra un adelanto de la arquitectura de la próxima generación. Ningún otro laboratorio está iterando actualmente a este ritmo. Para un lector que elige modelos, la consecuencia práctica es que «el mejor Qw​en» es un objetivo móvil, y la diferencia entre generaciones llega más rápido de lo que el ecosistema circundante suele adaptarse. Comprar una decisión en lugar de un modelo es cada vez más la opción defendible.

Lo que un desarrollador debería hacer ahora

Planifica la arquitectura, no solo el modelo. Qwen3.8-Flash-Next será una vista previa no probada desde el primer día: sin evaluaciones comparativas independientes, un ecosistema de ejecución aún en desarrollo, y solo afirmaciones del proveedor sobre las fortalezas agénticas y de horizonte largo que importan para las cargas de trabajo que lo usarían. La forma segura de evaluarlo no es conectarlo a una ruta de producción, sino enrutar hacia él una copia de bajo riesgo de una carga de trabajo, comparar el resultado con el modelo actual, y dejar que la conmutación por error automática se encargue de los momentos en que el proveedor que sirve un modelo de pesos abiertos recién lanzado se comporte mal. En OrcaRouter, ese es el mismo endpoint y la misma clave que ya usas: Qwen3.8-Flash-Next y tu modelo actual están detrás de una sola API, y el DSL de enrutamiento puede hacer una prueba A/B de la vista previa contra el modelo actual con el mismo prompt antes de comprometer nada.

El precio, cuando existe, debe leerse de la misma manera. Alibaba no ha anunciado un precio de API para Flash-Next, y los pesos no publicados no se pueden enrutar a ningún lado. Cuando un proveedor lo expone, OrcaRouter pasa el precio de lista del proveedor directamente con un margen de beneficio del 0% — así que cualquiera que sea el número de Alibaba, aparecerá sin cambios, el mismo día. La línea base más cercana que realmente puedes consultar hoy es Qwen3.8-Max (qwen/qwen3.8-max), el buque insignia bajo el cual esta arquitectura eventualmente se ubicará: una ventana de contexto de 1,000,000 de tokens a $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida, transmitida al precio de lista. Mantén ese número en mente cuando baje el precio de Flash-Next; es el costo que la próxima generación tiene que superar.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Qué ver en el lanzamiento

Cuatro cosas importan en el momento en que se acaba el temporizador de lanzamiento:

• El número de parámetros y el nivel de parámetros activos — si se trata del modelo de clase 125B-A6B que describen los rumores o de una entrada más pequeña.

• La licencia — permisiva como Qw​en3.8-27B, o restringida como la licencia Max.

• Si las primeras evaluaciones independientes reproducen las afirmaciones del proveedor sobre codificación agéntica y horizontes largos — los números en los que confiar, no la línea de marketing.

• Cuánto tiempo espera Alibaba antes de que la familia completa de Qwen4 siga a la vista previa.

Nada de eso se puede saber desde aquí. Lo que hoy se sabe es la forma de la decisión que Alibaba ha tomado: apuesta a que vale la pena regalar la próxima generación de su arquitectura antes que el buque insignia. Esa apuesta es la historia — y los pesos se publican mañana.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube