
Qwen 4.5 y Qwen 5 apuntan a 5 a 10 billones de parámetros: lo que Alibaba dijo y lo que no dijo
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
En su Conferencia Apsara en Hangzhou el 22 de septiembre de 2026, la empresa cuantificó el tamaño de la generación posterior a la próxima. Las Qwen 4.5 y Qwen 5 series están "proyectadas para escalar hasta entre 5 y 10 billones de parámetros", según la redacción del comunicado de prensa en inglés de la propia empresa — una línea de hoja de ruta, no una especificación. Ninguno de los dos modelos tiene fecha de lanzamiento, ficha de modelo, identificador de API, precio ni puntuación de referencia publicada, lo que significa que hoy no se puede invocar nada de ninguno de los dos. El modelo insignia que realmente puedes comprar es Qwen3.8-Max, disponible de forma general desde el 3 de agosto de 2026, con 2,4 billones de parámetros. En los días transcurridos desde la conferencia, esa frase de la hoja de ruta se ha reducido en gran parte de la cobertura a la afirmación de que se acerca un modelo de 10 billones de parámetros — una afirmación más fuerte y más simple que la que hizo la empresa. La distancia entre esas dos frases es de aproximadamente un año de planificación.
La afirmación, y la versión de ella que se difundió
Se dijeron dos cosas en el escenario, y vale la pena separarlas porque conllevan cantidades de información muy diferentes. La primera es una actualización de estado: Qwen 4 está en entrenamiento, con una nueva arquitectura. La segunda es una hoja de ruta: se proyecta que las series Qwen 4.5 y Qwen 5 alcancen una banda de parámetros de 5 a 10 billones.
El comunicado de prensa en inglés de Alibaba atribuye ambos elementos a la empresa y no a un ejecutivo identificado por su nombre. La cobertura de la conferencia, que va más allá, atribuye la hoja de ruta a Liu Da Yiheng, quien dirige el proyecto de modelos de lenguaje de gran escala Qwen en Alibaba Token Hub, y recoge su planteamiento de que el escalado es una vía clave hacia la superinteligencia artificial. Ese planteamiento es el contexto en el que se dio la cifra de parámetros, y explica por qué la cifra es un rango y no un objetivo.
Lo que entonces se difundió fue el extremo superior del rango. Los titulares en inglés que siguieron incluyen al menos uno que describe un modelo de 10 billones de parámetros presentado como adelanto, y varios que describen un plan para un modelo de 5 a 10 billones de parámetros. Ambas son lecturas defendibles de una diapositiva. Ninguna de las dos es una especificación, y la diferencia importa a cualquiera que tenga que planificar en función de eso.
5 billones es el objetivo de una generación y 10 billones lo es de otra
Lo más importante que hay que entender bien de este anuncio es que de 5 a 10 billones es un rango que abarca dos generaciones, no un solo modelo con una tolerancia amplia. La propia frase de Alibaba vincula ese rango con «la próxima serie de modelos Qwen 4.5 y Qwen 5» —la serie, en plural, tomada en conjunto.
La cobertura periodística en chino de la misma conferencia vuelve a ser precisa en una dirección distinta, con titulares que describen modelos posteriores a Qwen 4.5 extendiéndose hasta el rango de 5 a 10 billones. Esa lectura sitúa también el extremo de los 10 billones más allá de Qwen 4.5. La única afirmación en la que coinciden todas las fuentes es que la banda cubre el intervalo de Qwen 4.5 a Qwen 5. La asignación de 10 billones a Qwen 5 en concreto es una inferencia que se convirtió en titular, no una cita.
Para dar una idea de la escala, y estas son las únicas cifras de esta historia que se publican en lugar de proyectarse:
• 5 a 10 billones — el rango de parámetros que el comunicado de prensa de Alibaba atribuye a las series Qwen 4.5 y Qwen 5
• 2,4 billones — total de parámetros de Qwen3.8-Max, el buque insignia ya disponible en el mercado, según su ficha técnica oficial
• 95 mil millones — los parámetros activos por token de Qwen3.8-Max, la cifra que determina cuánto cuesta servir un token
• 10 billones — la parte superior de la banda, y la única parte de ella que llegó a la mayoría de los titulares en inglés
• 0 — el número de especificaciones publicadas, fechas de lanzamiento, precios, ventanas de contexto o puntuaciones de benchmark para Qwen 4.5 o Qwen 5

El número del parámetro que importa es el que nadie publicó
Los parámetros totales son la cifra que un laboratorio elige decir. Los parámetros activos son la cifra que un comprador necesita, y la hoja de ruta no incluye ninguna.
Qwen3.8-Max es un modelo de mezcla de expertos con 2,4 billones de parámetros en total y 95.000 millones activos por token. Esa es una proporción de activación de aproximadamente el 4 %: el modelo guarda una gran cantidad de conocimiento en pesos que no lee en cualquier token dado, y paga cómputo por una pequeña porción de ellos. Los parámetros totales te dicen cuánta memoria ocupa el modelo y qué tamaño de caja necesitas. Los parámetros activos te dicen lo que pagas cada vez que responde.
Si se extrapola esa proporción, la forma del problema se vuelve visible. Un modelo de 10 billones de parámetros construido con el mismo 4 por ciento de activación activaría del orden de 400 mil millones de parámetros por token, más de cuatro veces lo que activa Qwen3.8-Max ahora. Eso es aritmética sobre un supuesto declarado, no una afirmación sobre Qwen 5: aumenta la esparsidad y el número de activos cae; redúcela y sube. Pero es la aritmética la que decide si un modelo de 10 billones de parámetros es un producto servido o un artefacto de investigación, y es el cálculo que el titular de 5 a 10 billones invita a hacer y luego deja sin hacer.
Aquí es también donde la economía del enrutamiento deja de ser abstracta. En OrcaRouter, el precio de lista del proveedor se traslada con 0 % de margen, de modo que una rebaja de precio de un proveedor en un nivel de Qwen está activa en tu clave el mismo día, en lugar de en una renovación. Una generación cuyo coste de servicio es genuinamente incierto es exactamente el caso en el que ese traslado vale más que un descuento negociado por adelantado contra una cifra que nadie ha publicado.
El anuncio del chip es la cronología real
Alibaba anunció la hoja de ruta del modelo y un nuevo acelerador en el mismo comunicado de prensa, y los dos están más conectados de lo que el comunicado dice.
El Zhenwu V900 de T-Head es un procesador de entrenamiento e inferencia con 216 GB de memoria y 1.200 GB/s de ancho de banda entre chips, soporte nativo para FP8 y FP4, y un rendimiento declarado tres veces superior al de su predecesor, el Zhenwu M890, lanzado en mayo. La producción en masa y el lanzamiento comercial están previstos para el primer trimestre de 2027. Un servidor supernodo complementario admite clústeres de hasta 500.000 tarjetas, y T-Head afirma que la línea Zhenwu ha atendido a más de 650 clientes.
Lea los dos anuncios en conjunto y la secuencia resulta legible. Entrenar y servir un modelo de mezcla de expertos a escala de 10 billones es un problema de interconexión antes que un problema de cómputo, porque el paralelismo de expertos implica mover activaciones entre chips constantemente, y un ancho de banda entre chips de 1.200 GB/s es la cifra que determina si eso es viable. Con ese calendario, el silicio sitúa la ventana plausible más temprana para una ejecución a escala frontera de este tipo bien entrado 2027 — y, aun así, que un chip salga al mercado no dice nada sobre que una ejecución de entrenamiento termine. Alibaba conectó ambos temas al incluirlos en un mismo comunicado; la conexión en sí es nuestra lectura, y está etiquetada como tal.
El propio horizonte temporal de la empresa es coherente con ello. El consejero delegado Eddie Wu fijó un objetivo de más de 20 gigavatios de capacidad de centros de datos de Alibaba Cloud a escala mundial para 2032 —un objetivo de capacidad, no capacidad desplegada, y un horizonte de más de cinco años en lugar de uno del próximo trimestre.
Las afirmaciones de automejora que sostienen la hoja de ruta
El motivo por el que un plan de 5 a 10 billones es siquiera discutible, en vez de simplemente caro, es la automejora recursiva: si el pipeline de entrenamiento se mejora a sí mismo, el cómputo necesario por generación disminuye y la frontera se acerca a ser asequible. Esa es la afirmación que sustenta la hoja de ruta, y también es lo menos verificable que dijo Alibaba.
Lo que la compañía informó: Qwen3.8-Max completó 33 ciclos iterativos a lo largo de aproximadamente un mes de trabajo totalmente automatizado que abarcó el diseño de pipelines, la validación de datos y el diagnóstico de errores, y elevó su puntuación de Artificial Analysis de 40 a 45. En un experimento de diseño de chips, el modelo dedicó más de 60 horas de auto-mejora a lo largo de un ciclo de vida de diseño, realizó más de 10.000 llamadas a herramientas de automatización de diseño electrónico y redujo el área del chip en un 42 por ciento sin pérdida de rendimiento. Un informe de la conferencia también recoge una mejora del 96 por ciento en el rendimiento de inferencia gracias al ajuste autónomo de una nueva GPU T-Head.
Estos son datos reportados por el proveedor y no han sido replicados de forma independiente. Y no se trata de un tecnicismo: un bucle autónomo que califica sus propios experimentos se está midiendo contra su propio evaluador, y el mundo exterior no tiene forma de verificar los criterios de evaluación. La cobertura de la conferencia, por lo general, lo ha señalado así, y los lectores deberían darlo por sentado.
Hay una segunda trampa en la misma afirmación, y tiene que ver con las etiquetas, no con la honestidad. Alibaba no dijo contra qué revisión del Artificial Analysis Intelligence Index se mide su movimiento de 40 a 45, y ese índice se ha reconstruido desde que se lanzó este modelo. La página actual de Artificial Analysis para Qwen3.8 Max (0902) indica 45 —una cifra independiente, según la revisión vigente hoy—. La lectura registrada para el mismo modelo a mediados de agosto, bajo la revisión entonces vigente, era 56. Un 45 y un 56 no son la misma medición en las mismas unidades, y restar uno del otro produce un número que no significa nada. Lo que la página no recoge es el 40 desde el que Alibaba dice que mejoró: el punto de partida de ese delta es de la propia empresa, y solo el punto final coincide con donde ahora se sitúa la lectura independiente. Lee el movimiento como una dirección, no como una medición.

¿Qué lanzó Alibaba en la misma conferencia?
Si quitamos la hoja de ruta, la conferencia aún contenía lanzamientos reales, todos ellos multimodales:
• Qwen3.8-LiveTranslate — interpretación simultánea, con la latencia (LAAL) reducida casi un 20 por ciento, de 2,8 segundos a 2,3 segundos
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS y Qwen-Audio-3.1-Realtime — una suite de voz renovada
• Qwen-Audio-3.1-TTS-Next — paisajes sonoros cinematográficos que combinan diálogo y ambiente a partir de un guion de texto, destinados a audiolibros, cine y televisión, pódcasts y videojuegos
• Qwen-Image 3.1 — generación de imágenes optimizada para el diseño creativo y el marketing de comercio electrónico, prevista para finales de este año, con generación nativa de fondos transparentes
• Qwen Intelligence — una plataforma agéntica full-stack dirigida a fabricantes de smartphones
Cada elemento de esa lista es un producto con una ventana de entrega. La afirmación a escala de frontera es el único punto de la agenda al que no se le ha puesto fecha, y el contraste no es casualidad: lanzar el nivel multimodal es lo que financia un año de hoja de ruta, y la hoja de ruta es lo que hace que la próxima ronda de financiación o el próximo contrato en la nube sea una historia en lugar de una hoja de cálculo. Ambas cosas son reales. Solo una de ellas es algo a lo que puedes llamar.
¿Qué es invocable hoy y qué tiene que cambiar para que eso cambie?
La generación Qwen 3.8 sigue siendo la totalidad de la línea comprable. Qwen3.8-Max está disponible de forma general desde el 3 de agosto de 2026 a $2.00 por millón de tokens de entrada y $6.00 por millón de salida, sin variación en toda la ventana de contexto de 1,000,000 de tokens y sin recargo por prompts largos. Sus pesos se publicaron el 12 de agosto de 2026 como Qwen3.8-2.4T-A95B en BF16 y FP8 bajo una licencia personalizada de Qwen. Su tabla de benchmarks del proveedor es sólida y no auditada — Terminal-Bench 2.1 en 86.6, GPQA Diamond en 92.6, OSWorld-Verified en 86.1, todas cifras de la propia Alibaba —. La imagen independiente es menos halagüeña que la del proveedor: Artificial Analysis sitúa Qwen3.8 Max (0902) en un Intelligence Index de 45, 24.º de 212 modelos, con $5.41 de coste medido por tarea del Intelligence Index y 39.2 tokens de salida por segundo — 159.º de 212, cerca del extremo lento del campo. La misma página indica que la ventana de contexto es de 984k frente a los 1,000,000 de nuestra propia página del modelo, una diferencia que conviene conocer antes de dimensionar un trabajo de contexto largo. Puntuación de nivel frontera, velocidad de mitad de tabla: ese es el resumen honesto del buque insignia en producción, y es la línea base que cualquier Qwen 4.5 tiene que superar en ambos ejes a la vez.

OrcaRouter incluye la familia Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash y qwen3.8-27b — en un único endpoint compatible con OpenAI junto con más de 200 otros modelos, lo que significa que un nivel Qwen 4.5 sería un cambio de id de modelo en una clave existente en lugar de un nuevo contrato con el proveedor, una nueva factura y un nuevo SDK. Cuando se lance uno, ese catálogo es donde aparecería. Hoy, ni Qwen 4.5 ni Qwen 5 están en él, porque ninguno de los dos se ha lanzado — y ninguna cantidad de prensa sobre la hoja de ruta cambia eso.
El uso práctico de una hoja de ruta como esta es lo opuesto a un plan de migración. Si un nivel de Qwen 4.5 con el tiempo parece plausible para tu carga de trabajo, la forma barata de averiguarlo es enrutar una porción de tráfico real hacia él detrás de un fallback automático, de modo que un modelo que resulte lento, caro o peor que el actual te cueste un porcentaje de una carga de trabajo en lugar de un cuarto. Para eso está la conmutación por error, y un modelo de frontera no probado, de apenas días de antigüedad, es el caso más claro para usarla.
Qué observar y qué no creer todavía
Una línea de la hoja de ruta se convierte en una versión cuando aparece un pequeño conjunto de cosas concretas. Una ficha de modelo que incluye un recuento total de parámetros, un recuento de parámetros activos y una ventana de contexto. Un identificador de API que se puede pasar en una solicitud. Pesos en un hub de modelos. Una entrada en una clasificación independiente con una fecha asociada. Un precio. Cualquiera de esas cosas es una señal; la mayoría de ellas juntas es un lanzamiento.
Cosas que no son un lanzamiento, por muy técnicas que parezcan: una mención en una conferencia; el pull request de un framework de servicio que añade una rama de arquitectura para una compilación experimental de Qwen, que es trabajo sobre el motor en la pila de inferencia de alguien en lugar de un modelo al que puedas llamar; un id de snapshot con fecha para una generación que ya se lanzó; y una publicación en redes sociales que parafrasea un comentario hecho en un escenario. La señal que produjo este artículo fue la última de esas cosas, y la razón por la que valía la pena escribir sobre ello es que la afirmación subyacente se puede verificar contra el propio comunicado de prensa de Alibaba — de donde provienen la franja de 5 a 10 billones, el estatus de Qwen 4 y las cifras de RSI. La señal apuntaba a la historia; no es la historia.
La pregunta a corto plazo es más limitada de lo que sugieren los titulares. Alibaba ha dicho que Qwen 4 está en entrenamiento, lo que sitúa a Qwen 4 por delante tanto de 4.5 como de 5 en la secuencia, así que lo próximo que vale la pena observar no es un modelo de 10 billones de parámetros, sino si Qwen 4 llega con una ficha de modelo, un precio y un endpoint, y cuándo. Hasta que algo de esa cadena se materialice, la postura honesta sobre la franja de 5 a 10 billones es que se trata de una dirección de avance, divulgada oficialmente, sin ninguna especificación adjunta y sin fecha. Planifique con Qwen3.8-Max, siga de cerca la franja de 4.5 y 5 como una tesis de escalado más que como un producto, y trate cada recuento de parámetros que vea para un modelo sin ficha de modelo como un pronóstico.
