
Qwen3.8-Max frente a Qwen 3.8: un núcleo de 2.4T, alquilado o ejecutado — tras la actualización 0902
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El 2 de septiembre de 2026, Alibaba lanzó una actualización con fecha de Qwen3.8-Max — la versión que designa como Qwen3.8-Max-0902 — y un ranking independiente de programación colocó la nueva instantánea en el #1 esa misma semana. La versión descargable de ese mismo núcleo de 2,4 billones de parámetros, el modelo al que la mayoría se refiere cuando escribe «Qwen 3.8» sin sufijo, sigue en su checkpoint del 12 de agosto: solo texto, con el razonamiento siempre activado, y está a cientos de gigabytes de poder ejecutarse en cualquier cosa más pequeña que un rack de GPU. Esa brecha entre el buque insignia alojado y los pesos abiertos no existía en agosto. Es ahora toda la comparación, y es por eso que el mismo modelo se te sigue vendiendo bajo dos nombres.
Qwen3.8-Max es el buque insignia alojado de Alibaba: un modelo de mezcla dispersa de expertos de 2,4 billones de parámetros, con unos 95 mil millones de parámetros activos por token, disponible en una API de pago desde el 3 de agosto y con una ventana de contexto multimodal de 1 millón de tokens. Qwen 3.8, tomado como nombre independiente, es el lanzamiento abierto de la misma generación —en concreto, Qwen3.8-2.4T-A95B, los pesos que Alibaba publicó el 12 de agosto bajo una licencia personalizada. No son dos hermanos, uno barato y otro premium. Son el mismo cerebro vendido de dos maneras, y una ronda de post-entrenamiento en septiembre ha empezado a separar las dos versiones. Este artículo aclara cuál de los "Qwen 3.8" estás viendo en realidad, qué cambió con la actualización 0902 y qué ruta —alquilar la API o ejecutar los pesos— deberías seguir hoy.
La pareja que no es una rivalidad
Antes de las fechas y las tarifas, la arquitectura: Qwen3.8-Max y Qwen3.8-2.4T-A95B comparten un diseño MoE de grano fino con 512 expertos por capa (10 enrutados más uno compartido, por capa), 92 capas y una pila híbrida en la que 69 de las 92 capas usan atención lineal — Gated DeltaNet combinado con atención con compuertas — con atención completa intercalada para el trabajo de contexto largo. Por eso la ficha del modelo puede afirmar un contexto de un millón de tokens en la API y por eso la versión abierta alcanza un 262K nativo que se extiende hacia el millón con la configuración de servicio adecuada. Las diferencias entre los dos nombres no están en la arquitectura de los pesos; están en los bordes, y los bordes se han movido desde el 2 de septiembre.
• Parámetros — Qwen3.8-Max: 2.4T en total / ~95B activos, MoE. Qwen3.8-2.4T-A95B: el mismo núcleo, la misma cantidad de activos.
• Entrega — Qwen3.8-Max: API alojada, disponible desde el 3 de agosto, actualizada como Qwen3.8-Max-0902 el 2 de septiembre. Qwen3.8-2.4T-A95B: pesos descargables, publicados por primera vez el 12 de agosto, sin un checkpoint más reciente desde entonces.
• Modalidad — Qwen3.8-Max: entrada de texto, imagen y video. Qwen3.8-2.4T-A95B: solo texto.
• Control de razonamiento — Qwen3.8-Max: alternancia de pensamiento, incluido un modo sin pensamiento. Qwen3.8-2.4T-A95B: pensamiento siempre activado, con solo un dial de esfuerzo de razonamiento (bajo / alto / extra-alto).
• Herramientas — Qwen3.8-Max: llamada nativa a funciones, cinco herramientas integradas y salida estructurada. Qwen3.8-2.4T-A95B: sin capa de herramientas nativa; lo que obtienes depende del framework de inferencia con el que lo sirvas.
Lo que cambió la actualización del 2 de septiembre
La versión 0902 es una pasada de post-entrenamiento, no una nueva arquitectura. Alibaba la orientó hacia las dos cosas por las que Qwen3.8-Max ya era conocido — la programación y el "cowork", su nombre para el trabajo agéntico de largo horizonte y el trabajo de oficina — y las cifras que se publicaron a su alrededor son la razón por la que esta actualización importa. En la clasificación independiente de Code Arena: WebDev, Qwen3.8-Max-0902 debutó con 1.691 Elo, un salto de 22 puntos sobre la versión anterior y suficiente para ocupar el primer puesto desde su llegada. Alibaba también presenta la versión como el modelo con mejor puntuación en la frontera de Pareto coste-rendimiento de esa tabla, con una tarifa combinada de unos 5 dólares por millón de tokens — el precio de lista de 2 y 6 dólares ponderado por el tráfico agéntico de alto volumen de salida, aproximadamente una cuarta parte de lo que cuesta una llamada comparable a un modelo de frontera en otros sitios. El lector debe distinguir bien estas cifras: los 1.691 Elo son un resultado independiente de arena; el marco de la frontera de Pareto es la caracterización que hace la propia Alibaba de esa tabla independiente.
Las evaluaciones internas de Alibaba para el pase 0902, reportadas por el proveedor y no reproducidas, muestran la misma dirección: Terminal-Bench 3.0 sube de 11.3 a 29.0, ProgramBench de 10.5 a 28.0, JobBench de 53.4 a 64.0, y WorkArena Elo de 1,348 a 1,468. Interprétalos como “la actualización movió los ejes agénticos y de codificación”, no como puntuaciones verificadas. En el lado de la inteligencia general, el Intelligence Index de Artificial Analysis sitúa a Qwen3.8-Max en 56: competitivo, pero no es la razón para optar por él; los resultados de codificación y agénticos sí lo son.
La parte que la mayoría de la cobertura ha pasado por alto es que el post-entrenamiento 0902 es, al momento de escribir esto, solo API. Alibaba no ha publicado un checkpoint abierto del modelo actualizado — los pesos de Qwen3.8-2.4T-A95B en Hugging Face todavía se remontan al lanzamiento del 12 de agosto. Eso significa que el Qwen3.8-Max alojado y el núcleo descargable ya no son el mismo modelo como lo eran a mediados de agosto. La API tiene el post-entrenamiento de septiembre; los pesos no. Si toda tu razón para ejecutar la versión abierta era reproducir exactamente lo que hace el modelo insignia, esa suposición dejó de ser cierta silenciosamente el 2 de septiembre.

Los cinco puntos en los que realmente difieren
Dejando de lado la arquitectura compartida, las diferencias prácticas se alinean claramente. La modalidad es el primer filtro: si tu carga de trabajo incluye imágenes o vídeo (capturas de pantalla, gráficos, documentos con figuras, fotogramas de vídeo), solo Qwen3.8-Max las admite, y su ventana de 1M de tokens es nativa, no una extensión. La variante de pesos abiertos es solo de texto. El control de razonamiento es el segundo: la API alojada puede ejecutarse con el pensamiento desactivado, lo cual es importante para la extracción de gran volumen y sensible a la latencia, donde una cadena de pensamiento es pura sobrecarga; la variante abierta no puede desactivarlo. Las herramientas son el tercero: la llamada a funciones, las cinco herramientas integradas y el modo JSON forman parte del producto alojado, mientras que la variante abierta depende de lo que ofrezca tu capa de servicio.
El contexto es más sutil de lo que sugiere la ficha técnica. Ambos lados pueden alcanzar aproximadamente un millón de tokens, pero el modelo alojado lo hace de forma nativa con entrada multimodal, mientras que el contexto nativo de 262K de la versión abierta debe ampliarse en la configuración, y cada token de esa ventana ampliada es texto. Los límites de salida también difieren: la API permite hasta unos 131K tokens de salida, y la versión abierta suele configurarse con un límite similar, pero el límite práctico en el lado abierto lo establece tu stack de servicio, no el modelo.
Lo que realmente cuesta cada ruta
Aquí es donde las dos entregas dejan de ser comparables por completo. Qwen3.8-Max tiene un precio de lista: 2,00 $ por millón de tokens de entrada, 6,00 $ por millón de tokens de salida y 0,25 $ por millón de tokens de caché entrada. Dado que OrcaRouter transmite los precios de lista de los proveedores con un margen del 0 %, esa es la tarifa que pagas aquí, y cuando Alibaba la cambia, el nuevo número está disponible el mismo día. La instantánea 0902 está fijada por separado como qwen/qwen3.8-max-0902 para los equipos que quieren un comportamiento reproducible: mismo precio, mismas capacidades, pero un punto de control fijo en lugar del modelo continuo. En el tráfico de OrcaRouter, la mediana de tiempo hasta el primer token a 7 días para Qwen3.8-Max es de aproximadamente 2 a 4 segundos, y Artificial Analysis mide alrededor de 45 a 48 tokens de salida por segundo: no es lento, pero es verboso, por lo que las tareas agénticas con este modelo pueden consumir cantidades sorprendentes de tokens a pesar de la tarifa económica.

Qwen3.8-2.4T-A95B no tiene un precio de lista, porque el precio es tu infraestructura. Los pesos BF16 alcanzan aproximadamente 4,9 TB, e incluso la compilación oficial en FP8 ronda los 2,4 TB, así que estamos ante hardware a escala de rack: las configuraciones de despliegue documentadas más pequeñas empiezan con unas ocho GPU B300 o GB300, y un rack GB300 NVL72 completo es el despliegue de referencia. La cuantización agresiva cambia el mínimo: una compilación NVFP4 cabe en aproximadamente 1,3 TB, y la cuantización por capas de 1 bit de Unsloth comprime el modelo hasta unos 397 GB, que es lo que por fin hace viable un único nodo bien aprovisionado; pero cada una de esas vías presupone que operas con GPU a escala de centro de datos. Los proveedores externos que ofrecen el checkpoint abierto te venderán tokens por debajo del precio por token del Qwen3.8-Max, pero a cambio pierdes la entrada multimodal, el modo no pensante, las herramientas nativas y el post-entrenamiento 0902, y todavía no se ha publicado ningún benchmark independiente de ese checkpoint descargable en sí. La ficha del modelo de la propia Alibaba es clara sobre la relación: describe Qwen3.8-Max como la versión oficial construida sobre Qwen3.8-2.4T-A95B, que añade entrada de visión, soporte del modo no pensante, un contexto por defecto de 1M y herramientas integradas sobre el núcleo abierto.

Cifras independientes frente a afirmaciones de los proveedores.
La honestidad sobre las fuentes importa más aquí que en la mayoría de las comparaciones, porque la evidencia de los dos bandos tiene edades muy diferentes. Qwen3.8-Max ha sido puntuado de forma independiente: el resultado de 1.691 en Code Arena: WebDev correspondiente a la compilación 0902 y el índice de inteligencia de 56 de Artificial Analysis son mediciones de terceros, y el precio que hace interesante la afirmación de la frontera de Pareto es una tarifa publicada. Qwen3.8-2.4T-A95B todavía no tiene eso: la tabla de benchmarks que publicó Alibaba describe el núcleo de la clase Max, no una ejecución independiente del checkpoint descargable, por lo que el lado abierto de esta comparación sigue siendo, en gran medida, «el proveedor dice que el núcleo puntúa así». Si tienes que decidir entre ambos por capacidades, trata las cifras principales de los pesos abiertos como afirmaciones hasta que un tercero las ejecute.
Quién debería elegir cuál
La decisión se desprende de la lista anterior. Recurre al Qwen3.8-Max alojado — hoy, específicamente la compilación 0902 — cuando necesites el post-entrenamiento de septiembre, entrada de imagen o video, un modo sin razonamiento, herramientas nativas y salida estructurada, o una ventana de un millón de tokens sin tener que levantar infraestructura. Esa es la posición fronteriza en codificación y agentes, y a $2/$6 con $0.25 por entrada en caché, tiene un precio agresivo para lo que ofrece.
Elige Qwen3.8-2.4T-A95B cuando el control pesa más que la conveniencia: necesitas los pesos en tu propio hardware o en un proveedor que ya utilices; quieres un checkpoint fijo que puedas auditar y reproducir; o tu volumen sostenido hace que el coste por token sea el término dominante y estás en condiciones de ejecutar un MoE de 2.4T. Acepta la lista de contrapartidas —solo texto, razonamiento siempre activo, sin herramientas nativas, aún sin el posentrenamiento 0902— y verifica los términos de la licencia para tu tramo de ingresos, porque la licencia personalizada de Qwen3.8-Max no es Apache 2.0 e impone condiciones adicionales a los grandes operadores comerciales.
Si tu carga de trabajo es de gran volumen, de una sola GPU o sensible a la latencia, ninguna de estas puede ser el carril correcto: el hermano de 27 mil millones de parámetros de la generación, Qwen3.8-27B, es el indicado para eso, y se cubre por separado en nuestra comparación de Qwen3.8-27B vs Qwen3.8-Max.
Cómo probar ambos sin arriesgar tu stack
La forma limpia de hacer esta llamada es ejecutar ambos lados con tus propios prompts, y aquí es donde una capa de enrutamiento demuestra su valor en lugar de añadir una a posteriori. Qwen3.8-Max y la instantánea fijada Qwen3.8-Max-0902 se encuentran tras un único endpoint compatible con OpenAI en OrcaRouter, de modo que cambiar entre el buque insignia en evolución continua y el checkpoint reproducible es un cambio de ID de modelo, no un redespliegue. Cuando un equipo decide traer los pesos abiertos a sus propias instalaciones, el DSL de enrutamiento puede situar al frente un endpoint vLLM o SGLang autoalojado que sirva Qwen3.8-2.4T-A95B y colocarlo en el mismo grafo de llamadas: tráfico masivo hacia tu propio despliegue, prompts complejos y solicitudes multimodales derivados al Qwen3.8-Max alojado, con conmutación automática por error entre ambos. Probar un nuevo checkpoint de esa manera cuesta un cambio de configuración, no una migración, que es exactamente lo que quieres cuando los dos lados de esta comparación aún se mueven a velocidades distintas.
El resultado final
Qwen3.8-Max y Qwen 3.8 no son dos modelos compitiendo por el mismo puesto. Son un mismo núcleo de 2,4 billones de parámetros ofrecido como API alquilada y como pesos descargables, y la actualización del 2 de septiembre hizo que las dos entregas signifiquieran cosas distintas. Alquila la API y obtienes el post-entrenamiento 0902 que tomó la delantera en Code Arena: WebDev, además de visión, un modo sin razonamiento, herramientas nativas y una ventana nativa de un millón de tokens, a $2/$6 con $0.25 por entrada en caché. Ejecuta los pesos abiertos y obtienes la misma arquitectura congelada en su estado del 12 de agosto — solo texto, razonamiento siempre activado — sin puntuaciones independientes todavía y con una factura de hardware de centro de datos. Si las mejoras de septiembre en código y agentes te importan, solo uno de los dos nombres las tiene hoy. Si el control reproducible te importa más, solo uno de los dos nombres es tuyo para conservar.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
