Tarjeta de título principal para «Qwen 4 Max anunciado en Apsara 2026» con el subtítulo «Lo que Alibaba confirmó y lo que no», tres insignias tipo píldora que dicen «4 niveles en vista previa», «0 especificaciones publicadas» y «22 de septiembre de 2026», y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Qwen 4 Max anunciado en Apsara 2026: lo que Alibaba confirmó y lo que no

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La conferencia Yunqi en Hangzhou —la Apsara Conference— se utilizó el 22 de septiembre de 2026 para mostrar cuatro modelos que no se han lanzado. El responsable de LLM del laboratorio, Liu Da Yiheng, presentó en el escenario Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus y Qwen 4 27B, describió la familia como entrenada con una arquitectura de nueva generación y solo dijo que llegaría pronto. Al momento de escribir esto, no hay ficha de modelo para ninguno de los cuatro, ni pesos abiertos, ni identificador de API, ni ventana de contexto, ni precio, ni puntuación de benchmark. El flagship más reciente que realmente puedes invocar hoy es Qwen3.8-Max, disponible de forma general desde el 3 de agosto de 2026, y esa distancia entre un anuncio sobre el escenario y un endpoint que se pueda invocar es la parte de esta historia que vale la pena leer con atención.

Los cuatro niveles, y qué se supone que debe ser cada uno

La línea Qwen de Alibaba se ha organizado en niveles de capacidad desde la generación Qwen 3, y el anuncio de Qwen 4 mantuvo esa estructura en lugar de reemplazarla. Lo que se mostró en el escenario fue una lista, no una hoja de especificaciones:

• Qwen 4 Max — el nivel insignia, y el que Alibaba posiciona frente al modelo más destacado de todos los demás laboratorios de frontera

• Qwen 4 Flash — el nivel de alto rendimiento, diseñado para trabajo sensible a la latencia y de gran volumen, más que para razonamiento máximo

• Qwen 4 Plus — el nivel medio equilibrado, históricamente el que ha tenido la mayor amplitud de soporte multimodal

• Qwen 4 27B — la categoría local de pesos abiertos, la que se descarga, se ajusta y se cuantiza por personas que nunca tocan una API alojada

• Arquitectura — descrita como una nueva generación, y descrita como en entrenamiento, lo cual no es lo mismo que estar terminada

• Carga de trabajo principal — tareas agénticas y con uso de herramientas, según el planteamiento de la conferencia, en lugar de chat

• Disponibilidad — ninguna. Ningún nivel tiene fecha de lanzamiento, precio, ventana de contexto, lista de modalidades ni puntuación publicada.

El nivel de 27B es el que hay que seguir de cerca por una razón que no tiene nada que ver con los benchmarks. Es el único nivel de la familia que históricamente se ha lanzado con pesos abiertos, y la generación Qwen 3.8 demostró cuánto trabajo independiente desbloquea eso: a los pocos días de que llegaran los pesos de 27B, la comunidad ya había producido conversiones a MLX, cuantizaciones NVFP4 y ajustes finos sin censura. Un 27B anunciado es la promesa de todo un ecosistema aguas abajo, y es la parte de esta hoja de ruta con la entrega más predecible.

La cifra de 5 a 10 billones de parámetros no pertenece a Qwen 4

La cobertura de la conferencia ha sido imprecisa respecto a una cifra. El objetivo de "5 a 10 billones de parámetros" que circuló junto a la noticia de Qwen 4 no es una especificación de Qwen 4: es una declaración prospectiva sobre las generaciones posteriores, el marco temporal de Qwen 4.5 y Qwen 5. Alibaba no ha asociado ningún recuento de parámetros a Qwen 4 Max y, según la evidencia disponible, sería un error publicar uno.

Esto importa porque el recuento de parámetros es el número en el que se anclan los lectores y el número que se propaga. Una afirmación de 5T parámetros asociada a un modelo sin arquitectura publicada es infalsificable en ambos sentidos: nadie puede confirmarla y nadie puede corregirla una vez que se ha repetido. Si esta semana ves que se describe a Qwen 4 Max como un modelo de varios billones de parámetros, el número se ha tomado prestado de otra diapositiva.

Lo que puede decirse con honestidad es que el buque insignia predecesor es una mezcla de expertos de 2,4 billones de parámetros, con 95 mil millones de parámetros activos por token, confirmado en la tarjeta oficial del modelo para Qwen3.8-Max y en la versión de pesos abiertos que le siguió. Sea lo que sea Qwen 4 Max, esa es la base que tiene que superar, y es una cifra publicada y verificable, no una aspiración de hoja de ruta.

A two-column scoreboard titled "Qwen 4 Max vs the model you can call today". Left column Qwen 4 Max: Release date not given, Input price not given, Output price not given, Context window not given, Open weights not given, Benchmarks not given. Right column Qwen3.8-Max: Release date August 3 2026, Input price $2.00 per 1M tokens, Output price $6.00 per 1M tokens, Context window 1M tokens, Open weights published August 12 2026, Benchmarks vendor and independent. Footer reads "Qwen 4 Max status per Alibaba's September 22 2026 conference; Qwen3.8-Max from its published model card.", with the OrcaRouter logo bottom-right.

La arquitectura no es un rumor: ya se ha lanzado una vista previa de ella.

Lo más útil del anuncio de Qwen 4 es que parte de la arquitectura ya se había publicado bajo un nombre diferente. Qwen3.8-Flash-Next se publicó como código abierto a finales de agosto de 2026, y su tarjeta de modelo lo señala claramente como una vista previa de la arquitectura de Qwen 4. Eso lo convierte en la única evidencia concreta que cualquiera fuera de Alibaba tiene sobre cómo está construida la familia Qwen 4.

Es un modelo disperso con 125 mil millones de parámetros principales más 51 mil millones de parámetros de embeddings de N-gram, que activa aproximadamente 6 mil millones por paso de inferencia. Tiene un contexto nativo de 262.000 tokens que, según la ficha, se extiende hacia 1 millón, y Alibaba informa que se entrenó con un coste aproximadamente un 90 % menor que Qwen3.7-Plus. En la ficha se nombran tres técnicas:

• QSA, un esquema de atención dispersa específico de Qwen, que es el mecanismo detrás de la afirmación de entrenamiento de contexto largo a bajo costo

• Conexiones residuales con compuerta, una medida de estabilidad para redes dispersas profundas

• Embeddings de n-gramas, un almacén de parámetros independiente de 51 mil millones de parámetros que se consulta en lugar de calcularse de forma densa

Si los cuatro niveles de Qwen 4 heredan ese diseño, la consecuencia interesante es económica, no arquitectónica. Una familia diseñada para alcanzar una calidad cercana a la frontera con aproximadamente una décima parte del coste de entrenamiento es una familia que puede venderse a un precio agresivo, y los precios agresivos de Alibaba han sido la fuerza más fiable en la economía de los modelos de pesos abiertos durante dos años. Eso es una predicción, no un hecho, y debería etiquetarse como tal — pero es la razón para seguir esta hoja de ruta en lugar de descartarla.

Qué ejecutar mientras esperas

Nada en el anuncio de Qwen 4 cambia lo que está disponible esta semana, y la respuesta honesta para cualquiera que esté construyendo hoy es la generación Qwen 3.8. Qwen3.8-Max está disponible de forma general desde el 3 de agosto de 2026 a $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida, con tarifa plana en todo el contexto completo de 1 millón de tokens y sin recargo por prompts largos, y sus pesos se publicaron el 12 de agosto de 2026 como Qwen3.8-2.4T-A95B tanto en BF16 como en FP8 bajo una licencia personalizada de Qwen. Es el modelo con el que se medirán los niveles de Qwen 4, y hoy está sirviendo tráfico de producción.

Si quieres comparar la generación de Qwen ya disponible con el resto de la vanguardia sin gestionar una cuenta, una clave y una factura separadas para cada laboratorio, OrcaRouter incluye la familia Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash y Qwen3.8-27B — junto con Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview y GLM 5.3 en un único endpoint compatible con OpenAI. Eso es una sola API para cerca de 200 modelos con 0% de recargo, lo que significa que el precio de lista del proveedor se transfiere sin cambios, de modo que una rebaja de precio del proveedor llega a tu clave el mismo día en lugar de en el siguiente ciclo de facturación. Cuando se lance una versión de Qwen 4, ese mismo catálogo es donde aparecería; hoy, no hay ninguna.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the on-page nav, the 1M token context badge, the model ID qwen/qwen3.8-max, multi-modality shown as text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the code-samples panel with the OpenAI-compatible Python import, the Public benchmarks and Community buzz blocks, and the opening line of the model description calling Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

El resultado final

Qwen 4 Max es un anuncio real y no un producto real, y ambas mitades de esa frase importan. La lista está confirmada: cuatro niveles, una arquitectura de nueva generación, un enfoque agéntico y un nivel de 27B con pesos abiertos que será más importante para más gente de lo que será el buque insignia. Todo lo que una decisión de compra necesita —precio, contexto, modalidad, pesos, puntuaciones, una fecha— falta.

Trata esto como una señal de hoja de ruta con un rastro documental inusualmente bueno, porque el lanzamiento de Qwen3.8-Flash-Next te da la vista previa de la arquitectura gratis y Qwen3.8-Max te da la línea base establecida con pesos publicados y un precio publicado. Sigue el nivel de 27B por el ecosistema que creará y el nivel Flash por la economía del rendimiento. No republices la cifra de 5 a 10 billones de parámetros como un hecho de Qwen 4, y no planifiques una migración en torno a un modelo que no tiene fecha de lanzamiento: planifícala en torno a Qwen3.8-Max y muévete cuando haya un endpoint al que migrar.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario