Lanzamiento de Qwen3.8-Flash-Next — Dentro de la vista previa de la arquitectura Qwen4 de Alibaba. Ilustración regenerada.
Guides & Insights

Lanzamiento de Qwen3.8-Flash-Next: Un vistazo a la arquitectura Qwen4 de Alibaba

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El documento más útil que Ali​baba publicó el 26 de agosto de 2026 no fue el kit de prensa, sino un informe técnico. Qwen3.8-Flash-Next, el modelo multimodal de mezcla de expertos de pesos abiertos lanzado ese día, llegó acompañado de un artículo titulado "Sobre el diseño de la arquitectura Qwen3.8-Next: evaluación, eficiencia y estabilidad del entrenamiento", y el informe es la historia. Hace lo que los lanzamientos de proveedores casi nunca hacen: publica las ablaciones, los resultados negativos y los experimentos de recetas de entrenamiento, y luego traza una línea desde cada hallazgo hasta la arquitectura de la familia Qwen4 que este modelo pretende adelantar.

Lo que realmente se envió el 26 de agosto

El modelo en sí es modesto para los estándares de Qw​en de 2026, y eso es deliberado. Qwen3.8-Flash-Next almacena 125B parámetros del modelo principal más una tabla separada de incrustaciones de n-gramas de 51B — aproximadamente 176B antes de un módulo de predicción multi-token de 4B — pero activa solo 6B por token. Es un modelo de mezcla de expertos con 512 expertos, enrutamiento top-10 y 48 capas, con un contexto nativo de 262,144 tokens y extensible a 1M mediante YaRN. Acepta entrada de texto, imagen y video, y genera texto. Los pesos están en Hugging Face y ModelScope bajo la licencia qwen-community-1.0, y el propio blog de Ali​baba lo llama "una vista previa experimental de la arquitectura que sustentará a Qwen4" — el mismo papel que Qwen3-Next desempeñó para la línea Qw​en3.5, un canario que vuela antes del buque insignia.

El mismo día, Ali​baba activó la contraparte comercial: una compilación servida llamada Qwen3.8-Flash en la API de QwenCloud a $0.16 por millón de tokens de entrada y $0.47 por millón de salida. Los dos son fáciles de confundir y vale la pena distinguirlos. Qwen3.8-Flash-Next es la vista previa de pesos abiertos que analiza el informe técnico; Qwen3.8-Flash es la compilación de API de producción, con precio, con un contexto predeterminado de 1M tokens y formatos de solicitud compatibles con Open​AI y Anthropic. El precio, los puntos de referencia y los argumentos de arquitectura descienden de la misma ingeniería.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

Las cuatro apuestas de arquitectura en el informe técnico

La columna vertebral del artículo son cuatro apuestas sobre cómo debería ser un modelo fronterizo de contexto largo y bajo costo, cada una con respaldo experimental adjunto.

Atención: híbrido GDN + QSA. Tres de cada cuatro capas utilizan Gated DeltaNet, una capa de atención lineal que comprime el historial en un estado recurrente de tamaño fijo en lugar de una caché KV que crece con la longitud de la secuencia. La capa restante es Qw​en Sparse Attention, que agrega la secuencia en microbloques, los puntúa de forma económica y ejecuta atención completa solo en las regiones relevantes. Ali​baba reporta aceleraciones de hasta 7.6× en prefill y 4.9× en decode con contexto de 1M; el benchmark propio de SGLang en el día cero midió valores aún mayores, de 10.2× y 6.6×. Con una tasa de acierto de caché de prefijo del 90%, el rendimiento de prefill alcanza 8.6× el de Qwen3.7-Plus. Estas cifras son reportadas por el proveedor y sus socios, no auditadas de forma independiente.

• Flujo residual — Residual con compuerta. La única ruta residual se amplía a cuatro ramas paralelas con compuertas dinámicas elemento a elemento, un diseño multirrama estilo Hyper-Connection con control estilo GatedNorm. La compuerta regula las lecturas y escrituras por rama, lo que, según el artículo, suprime los valores atípicos de activación y, en la práctica, permite almacenar los estados residuales en FP8.

• Embedding — la tabla de n-gramas de 51B. En lugar de un embedding por token, el modelo usa una tabla de búsqueda indexada por el token actual más los anteriores, almacenando frases completas y patrones locales. Cuesta casi nada por token y, como las direcciones de búsqueda se conocen de antemano, puede residir en la memoria del host y precargarse de forma asíncrona, quedando completamente fuera de la memoria de la GPU. Este es el truco que permite que un checkpoint de 176B se ejecute en máquinas de clase 75GB, y se remonta a los embeddings por capa de Gemma 3n y al Engram de Deep​Seek.

Optimización: Muon, ajustado. El entrenamiento utiliza el optimizador Muon, un método de momento basado en ortogonalización, aplicado a mapas lineales bidimensionales (atención, GDN y pesos de los expertos de MoE), mientras que AdamW se mantiene para embeddings, el router y parámetros de bajo rango. El artículo también reporta un resultado negativo que vale la pena leer: el calentamiento del tamaño de lote se descartó después de que resultó costar un 18,8 % más de pasos del optimizador sin mejorar nada.

La tabla de referencia, léase con atención

Cada cifra titular aquí es propia de Qw​en, publicada en la ficha del modelo y en el informe, y nada de ello ha sido reproducido de forma independiente: el modelo tiene un día de vida y ningún tercero lo ha auditado todavía. Aun leyéndolo así, sigue siendo llamativo, porque Qwen3.8-Flash-Next está intercambiando golpes con DeepSeek-V4-Flash-0731, un modelo mucho más grande y consolidado, con 6B de parámetros activos.

• DeepSWE 1.1 — 58.7 frente a 54.4 (reportado por el proveedor).

• SWE-bench Pro — 62,5 frente a 56,0 (reportado por el proveedor).

Toolathlon Verificado — 73.5 contra 70.3 (reportado por el proveedor).

• LiveCodeBench v6 — 91.9 frente a 90.6 (reportado por el proveedor).

• GPQA Diamond — 91.7 frente a 90.8 (reportado por el proveedor).

• IFBench — 81.3 frente a 79.2 (reportado por el proveedor).

Entonces, el fallo que el informe expone abiertamente: NL2Repo-Bench, 48.1 frente a los 54.2 de DeepSeek-V4-Flash-0731 — un déficit real en la generación de código a nivel de repositorio, la única dimensión de codificación agéntica donde el modelo más pequeño no está a la altura. Agents' Last Exam es un empate entre 24.3 y 25.2. En automatización de oficinas, Qw​en reporta 73.9 en CoWorkBench — pero es un benchmark interno y Ali​baba lo mantiene fuera del gráfico principal.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

En visión, la tabla autoinformada muestra AndroidWorld 84.5 frente a 62.0 de Claude Opus 4.6 Max, y RealWorldQA 88.5 frente a 73.9. Humanity's Last Exam es el único titular en el que Qw​en pierde frontalmente contra Claude Opus 4.6 Max — y la evaluación de esa puntuación la realizó el propio GPT-4o, así que incluso esa comparación no es del todo limpia.

El precio: un doceavo del buque insignia.

Luego está el número que importa para los presupuestos. La versión servida de Qwen3.8-Flash cuesta $0,16 por millón de tokens de entrada y $0,47 por millón de tokens de salida en QwenCloud. Eso es aproximadamente una duodécima parte del precio del buque insignia de Ali​baba, Qwen3.8-Max, que cuesta $2,00 por millón de tokens de entrada y $6,00 por millón de tokens de salida —en un modelo que, según el informe, se entrenó con cerca de una novena parte del cómputo de Qwen3.7-Plus. Los proveedores chinos de modelos han pasado el verano recortando los precios de la gama flash, y este lanzamiento es el lado de Qw​en en esa campaña, que llega con una justificación arquitectónica incluida en lugar de un simple descuento.

Para cualquiera que compare dentro de la categoría, las cuentas son más fáciles cuando todos los proveedores muestran el mismo número. OrcaRouter enruta el resto de la familia Qwen — Qwen3.8-Max, Qwen3.8-27B y Qwen3.8 — al precio de lista del proveedor con un margen del 0%, por lo que un recorte de precio del vendedor se refleja en nuestro lado el mismo día en que se anuncia. Qwen3.8-Flash-Next aún no está en nuestro catálogo; cuando llegue a un runtime que enrutamos, encajará en esa misma configuración de una sola clave y precio de lista, sin necesidad de un segundo contrato.

Lo que puedes hacer con él hoy

El soporte de servicio desde el día cero es inusualmente amplio. SGLang incluye una página de cookbook y una imagen dedicada (lmsysorg/sglang:qwen38flashnext); vLLM tiene vllm/vllm-openai:qwen38-flash-next; NVIDIA valida ambos además de TensorRT LLM en un rack GB300 NVL72 a más de 16 000 tokens por segundo por GPU en FP8, y NeMo cubre el ajuste fino. Por debajo de la escala de centro de datos, el modelo se ejecuta en clústeres DGX Spark y estaciones de trabajo 4×RTX PRO 6000, y el tren de cuantización comunitaria del mismo día — los GGUFs de Unsloth y una compilación de 1 bit que cabe en 75 GB de RAM con aproximadamente el 80 % de la precisión completa — significa que el checkpoint almacenado de 176B es realmente ejecutable en hardware que posee un equipo pequeño. Los equipos que prefieran llamarlo en lugar de ejecutarlo pueden acceder a la API de Qwen3.8-Flash a través de QwenCloud de Ali​baba y de varias plataformas de terceros, aunque los pesos abiertos serán lo que la mayoría de los primeros adoptantes elija primero.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

Las cuentas de VRAM detrás de esa lista son la tabla de n-gramas, y es hacia donde convergen a continuación los stacks de serving. El embedding por capa que el informe técnico mantiene fuera de la memoria de la GPU es una estructura de búsqueda pura — por cada token generado, el modelo consulta solo unas 16 de sus 320 millones de filas —, que es lo que hace que descargarla sea barato. vLLM sirve Qwen3.8-Flash-Next desde una imagen de desarrollo dedicada mientras la pull request de soporte de arquitectura sigue abierta, y la pieza más reciente de ese trabajo, una PR en borrador del mismo autor de vLLM (vllm-project/vllm#54371, sin fusionar), añade una ruta de serving con PLE-Offload que mantiene la tabla en la memoria del host y la lee mediante direccionamiento virtual unificado de CUDA en lugar de reservar VRAM. En FP8, la tabla ocupa aproximadamente 48GB de los ~173GB del checkpoint, así que descargarla es la diferencia entre una GPU de centro de datos y una única tarjeta de 96GB — una RTX PRO 6000, o el pool de memoria unificada de un DGX Spark. Es pronto, así que trátalo como una dirección y no como una opción soportada hoy; pero es el runtime poniéndose al día con lo que el informe técnico ya afirmaba, y lo que hay que vigilar si el número de VRAM es lo que te ha estado frenando.

Una vista previa de un día de antigüedad con cifras no reproducidas es el caso de manual para no apostar una ruta de producción en ella, y para eso sirve exactamente la conmutación por error. Si un runtime lleva Qwen3.8-Flash-Next y apuntas un endpoint hacia ella con conmutación automática por error a un modelo en el que ya confías, obtienes el beneficio de la nueva arquitectura en tráfico no crítico y un respaldo limpio cuando falla, sin recablear, porque eso es una regla de enrutamiento, no un cambio de código.

Lo que dice esta vista previa sobre Qwen4

Ali​baba ha hecho esta jugada antes. Qwen3-Next presentó en versión preliminar Gated DeltaNet a finales de 2025 con documentación escasa, y la arquitectura no se especificó por completo hasta que la serie Qw​en3.5 la adoptó a escala. El patrón se repite: Qwen3.8-Flash-Next es el canario, y el informe es la especificación mediante experimentos. Los aspectos concretos a observar son si el buque insignia Qwen4 adopta la división tres a uno de GDN a QSA, si el embedding de n-gramas sobrevive al contacto con el serving de producción a la escala del buque insignia y, sobre todo, si las evaluaciones independientes confirman la ventaja de los 6B activos sobre modelos más grandes. Si la tesis de eficiencia se sostiene, el buque insignia Qwen4 podría lanzarse con costos de serving drásticamente más bajos que los de la generación anterior.

Preguntas frecuentes

¿Son Qwen3.8-Flash-Next y Qwen3.8-Flash el mismo modelo?

No, y la distinción importa. Qwen3.8-Flash-Next es la vista previa de arquitectura de pesos abiertos que analiza el informe técnico; Qwen3.8-Flash es la compilación de API de producción que Ali​baba sirve en QwenCloud a $0.16/$0.47 por millón de tokens con un contexto predeterminado de 1M. Mismo linaje de ingeniería, diferentes artefactos: uno es para autoalojamiento e inspección, el otro es un servicio gestionado con precio.

¿Deberían migrar hoy las cargas de trabajo de producción a ello?

No sin una segunda opinión. Cada benchmark es reportado por el proveedor y no reproducido, la arquitectura es lo suficientemente nueva como para que las pilas de servicio sigan convergiendo — el propio soporte de vLLM todavía está llegando a través de pull requests abiertos — y la única brecha de codificación agéntica (NL2Repo) está exactamente en el tipo de tarea que enfrentan los programadores de producción. Los pesos abiertos hacen que sea barato evaluarlo por uno mismo, y el soporte de SGLang y vLLM desde el primer día hace posible un piloto esta semana — pero un piloto detrás de la conmutación por error es la forma honesta de empezar, no un corte directo.

¿Cuándo sale el verdadero Qwen4?

Alibaba no ha dicho nada. La única señal temporal en este lanzamiento es histórica: el último canario, Qwen3-Next, voló aproximadamente una temporada antes de que la serie Qw​en3.5 adoptara su arquitectura. Con ese ritmo, los buques insignia de Qwen4 están más cerca de lo que parecen — pero el informe trata explícitamente sobre arquitectura, no sobre una hoja de ruta.

El resultado final

Qwen3.8-Flash-Next es el raro lanzamiento donde el paper es el producto. En el propio modelo, la ficha honesta dice: 6B parámetros activos que igualan a modelos mucho más grandes en la mayoría de los benchmarks compartidos, una brecha nombrada en código a nivel de repositorio, un precio servido de una doceava parte del buque insignia, y una arquitectura que es la respuesta de Qwen a cómo un modelo de frontera se abarata. El informe técnico dice para qué es Qwen3.8-Flash-Next — y no es el modelo. Es la evidencia de la arquitectura que será Qwen4, y vale la pena leerlo antes de que Qwen4 se lance, porque la decisión que cambia es la que tomarás cuando llegue Qwen4.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube