Una tarjeta de título principal para 'Qwen3.8-Max vs Qwen3.7-Max' con el subtítulo 'Dos niveles Max, 16 puntos de índice y una promoción que invierte el precio', y un pie de página que señala que las cifras de Qwen3.8-Max provienen de la divulgación de Alibaba del 22 de septiembre de 2026 y de Artificial Analysis, mientras que las cifras de Qwen3.7-Max provienen de Artificial Analysis.
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max: dos niveles Max, 16 puntos de índice y una promo que invierte el precio

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hace cuatro días, el proveedor nos dijo que Qwen3.8-Max no es el modelo que lanzó en agosto. En un comunicado de prensa fechado el 22 de septiembre de 2026, desde la Apsara Conference en Hangzhou, la empresa reveló que su buque insignia completó 33 ciclos iterativos de trabajo de entrenamiento y postentrenamiento totalmente automatizados durante más de un mes, y que la versión resultante elevó su Artificial Analysis Intelligence Index de 40 a 45. El ID del modelo nunca cambió. El número detrás de él, sí.

Eso importa sobre todo en un lugar concreto: la comparación entre Qwen3.8-Max y Qwen3.7-Max, el nivel Max al que reemplazó. Qwen3.8-Max alcanzó disponibilidad general el 3 de agosto de 2026; Qwen3.7-Max se lanzó en mayo. Sobre el papel, esto parece una decisión generacional fácil: buque insignia más nuevo, puntuación más alta, sigamos adelante. Los números dicen algo más incómodo. El nivel anterior es de tres a cuatro veces más rápido, aproximadamente cinco veces más barato por tarea completada e idéntico al más nuevo en pruebas de conocimiento puro. El nivel más nuevo es multimodal, drásticamente mejor en trabajo agéntico y más barato en la tarifa internacional. A cuál deberías llamar depende de una pregunta que la mayoría de las comparaciones omite: si estás comprando conocimiento o comprando llamadas a herramientas.

Lo que realmente afirma la divulgación de Apsara

La divulgación es una declaración de proveedor, publicada por Alibaba en su propio sitio de prensa, y debe leerse como tal. Lo que afirma es específico: durante más de un mes de ejecuciones totalmente automatizadas que abarcaron diseño de pipelines, validación de datos, experimentación iterativa y diagnóstico de errores, Qwen3.8-Max completó 33 ciclos, y la optimización autónoma del entrenamiento junto con técnicas posteriores al entrenamiento produjeron el cambio en la puntuación. Alibaba también describió un segundo experimento en diseño de chips, donde el modelo realizó más de 60 horas de automejora a lo largo de un ciclo de vida de diseño, realizó más de 10.000 llamadas a herramientas EDA, y produjo módulos de bus de chip de grado de producción mientras reducía el área del chip en un 42% sin ningún compromiso de rendimiento declarado. Todo eso es el relato de Alibaba sobre su propio modelo, no reproducido por nadie fuera de la empresa.

El movimiento de la puntuación en sí, sin embargo, no es una afirmación del proveedor. El Index es de Artificial Analysis, y el 45 está en la página de Qwen3.8 Max (0902) de ese tercero. El 40 del que se movió está en la página de la misma organización para la compilación del 3 de agosto, que ahora está marcada como obsoleta y apunta hacia la actual. Así que el delta es una causa reportada por el proveedor asociada a un efecto puntuado de forma independiente, lo cual es una posición más sólida que cualquiera de las dos mitades por separado. También es, a la fecha de este escrito, la evidencia pública más concreta que cualquiera tiene de que un laboratorio de frontera movió la capacidad medida de su producto insignia sin lanzar un nuevo número de versión.

Otras dos cosas sobre el lanzamiento son fáciles de pasar por alto y ambas son fundamentales. En primer lugar, Alibaba confirmó que Qwen 4 está en entrenamiento, y se prevé que las series Qwen 4.5 y Qwen 5 escalen a entre 5 y 10 billones de parámetros. En segundo lugar, hay una instantánea fechada del modelo renovado. Alibaba fijó la compilación post-entrenada como qwen3.8-max-0902 el 2 de septiembre, y se puede enrutar por separado. Esa fijación es la respuesta práctica a todo lo que implica la divulgación de RSI, y volveremos a ella.

El marcador

Seis dimensiones, ambos lados, con la disciplina de fuentes mantenida explícita porque las dos columnas no están verificadas por igual.

• Ventana de contexto — Qwen3.8-Max 1.000.000 tokens vs. Qwen3.7-Max 1.000.000 tokens (idénticas)

• Salida máxima — 131.072 tokens frente a 131.072 tokens según las propias páginas del modelo de Alibaba (idénticos; ten en cuenta que nuestra página de catálogo para Qwen3.7-Max indica 64.000, una discrepancia que señalamos en lugar de ocultarla)

• Modalidad de entrada — texto, imagen y video vs solo texto

• Precio de lista internacional por 1M de tokens — $2.00 de entrada / $6.00 de salida frente a $2.50 de entrada / $7.50 de salida; la misma tabla de tarifas ya cobra a ambos modelos $1.65 / $4.951 en Pekín, Fráncfort y Virginia

• Índice de Inteligencia de Artificial Analysis — 45 vs 29

• Velocidad de salida independiente — 39,7 tokens/seg vs. 211,3 tokens/seg, medida frente a la misma clase de comparación de 211 modelos, donde Artificial Analysis califica al nivel más nuevo como notablemente lento y al más antiguo como notablemente rápido

Las dos últimas filas son todo el artículo. En la misma familia de índices, el nivel más nuevo está 16 puntos por delante. En velocidad, está más de cinco veces por detrás.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

De dónde vienen los 16 puntos — y de dónde no

Divide el Index en sus partes y la forma de la actualización queda clara, y no es la forma que sugiere el marketing.

En conocimiento y razonamiento, los dos modelos están prácticamente empatados. GPQA Diamond: 92,8 vs 92,3. Humanity's Last Exam: 43,1 vs 40,5. Recuperación de contexto largo: 80,33 vs 79. SciCode: 52,1 vs 49,5. Si tu carga de trabajo consiste en responder preguntas sobre un corpus extenso, el salto generacional es un error de redondeo. Pagar varias veces más por ello sería difícil de justificar.

En el trabajo agéntico y de programación, la brecha se abre con fuerza. Terminal-Bench 2.1: 88.76 vs 74.53. El índice de programación de Artificial Analysis: 76.2 vs 66. Y la divergencia más amplia del conjunto es la tarea de uso de herramientas bancarias, donde Qwen3.8-Max registra 47.84 frente a los 11.75 de Qwen3.7-Max —una brecha de cuatro veces en exactamente la capacidad que la descripción de RSI afirma que los ciclos automatizados estaban optimizando: diseño de pipelines, validación de datos, experimentación iterativa y diagnóstico de errores. Un modelo que pasa un mes mejorando su propio bucle de entrenamiento es un modelo que se volvió mejor en bucles.

Una advertencia honesta sobre esas filas individuales. Ambas páginas de modelo pertenecen a la misma familia de revisiones del Intelligence Index (v4.3 y v4.3.2), lo que hace que la comparación principal de 45 frente a 29 sea justa. Las filas por benchmark no son de la misma cohorte: las cifras a nivel de tarea de Qwen3.7-Max datan de la ventana de evaluación de mayo, mientras que las de Qwen3.8-Max provienen de la serie de septiembre. Fíjate en la dirección de la tendencia, no en la tercera cifra significativa.

La cuestión del precio son dos cuestiones

En la tarifa internacional de Alibaba, el Max más reciente es más barato que el que reemplazó: $2.00 / $6.00 para Qwen3.8-Max frente a $2.50 / $7.50 para Qwen3.7-Max, por millón de tokens. Una reducción del 20% en ambas direcciones a medida que avanza la generación es inusual y merece mención por sí sola. La economía de la caché también favorece al nivel más reciente: caché implícita a $0.25 frente a $0.50, lectura de caché explícita a $0.17 frente a $0.25.

Esa es la primera pregunta, y tiene una respuesta regional que la mayoría de las coberturas aplana. Alibaba cobra a ambos modelos $1.65 de entrada / $4.951 de salida en Beijing, Frankfurt y Virginia. La diferencia del 20 % existe solo en la tarjeta internacional de Singapur. Si tu tráfico llega a las otras tres regiones, los tokens de entrada y salida cuestan lo mismo para ambos niveles Max hoy, y la decisión se reduce a la pura capacidad — momento en el que el modelo más nuevo gana en todo excepto en el rendimiento, y ya no queda ninguna aritmética por hacer.

La segunda pregunta es la trampa. Actualmente, Qwen3.7-Max no cuesta $2.50 / $7.50. Se ofrece a $1.25 / $3.75 — la mitad del precio de lista, una tarifa promocional. Eso hace que el nivel de la generación anterior sea hoy la opción más barata, por un amplio margen. También significa que el precio que puedes medir esta semana no es el precio al que te estarías comprometiendo. La propia página del modelo de Alibaba indica claramente que la tabla publicada muestra los precios originales "sin incluir ninguna promoción por tiempo limitado" y te remite a la consola para consultar las ofertas vigentes. Una promoción es, por definición, una tarifa que puede terminar. Si termina, Qwen3.7-Max no solo se vuelve más caro de lo que es hoy; se vuelve un 25% más caro que el modelo que lo supera.

Trasladamos la tarifa del proveedor sin aplicar ningún margen (0 % de recargo), de modo que tanto el precio de lista como la promoción se actualizan de nuestro lado el mismo día en que cambian, lo cual resulta cómodo para una comparación y poco útil si lo que intentas es hacer un presupuesto. Construye el modelo tomando como base la tarjeta de precios de lista y considera la tarifa promocional como un beneficio adicional.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

La cifra que invierte el argumento del costo

El precio por token no es lo que cuesta una tarea. Artificial Analysis publica una cifra de coste por tarea que incorpora la economía de la caché, el volumen de razonamiento y la longitud de las respuestas, y, según esa métrica, surge una clasificación completamente distinta: $5,41 por tarea de Intelligence Index para Qwen3.8-Maxfrente a$1,15 para Qwen3.7-Max. Un sobrecoste de 4,7×, frente a una tarifa por token que es un 20 % más barata o idéntica según tu región.

La diferencia es en gran medida verbosidad. En la misma evaluación, el modelo más nuevo generó 190M de tokens de salida frente a los del anterior, 120M, y razona extensamente para llegar a sus respuestas. Si pagas por token de salida en una carga de trabajo de gran volumen y dificultad moderada, el Max más nuevo no es el modelo más barato a ningún precio por token en ninguna de las dos tarifas. Es el más caro, y el precio de lista por token es el instrumento equivocado para decidirlo.

Velocidad, y lo que muestra nuestro propio tráfico

La brecha de rendimiento es lo suficientemente grande como para cambiar de arquitectura. Artificial Analysis sitúa a Qwen3.8-Max en 39,7 tokens por segundo —su resumen califica al modelo de notablemente lento— frente a 211,3 de Qwen3.7-Max, al que califica de notablemente rápido. Esa es la diferencia entre un modelo que pones detrás de una superficie interactiva y uno que pones detrás de una cola — y en Qwen3.8-Max es lo primero que te muestra nuestro propio panel de estadísticas.

La telemetría de nuestro propio playground durante los siete días hasta el 25 de septiembre cuenta una historia algo más matizada sobre la latencia, y viene con una advertencia: estas son nuestras mediciones en nuestro enrutamiento, no un benchmark controlado. Qwen3.8-Max mostró una mediana de 2.611 ms hasta la primera respuesta a 54,7 tokens por segundo con una tasa de error del 2,45 %; la build 0902 fijada mostró una mediana de 3.360 ms a 46,2 tokens por segundo con una tasa de error notablemente más limpia del 0,66 %. Qwen3.7-Max se situó en una mediana de 4.509 ms, pero con 169,8 tokens por segundo y una tasa de error del 3,80 %. Así que el nivel más antiguo responde más lentamente al principio y luego transmite tres veces más rápido, aunque falla con más frecuencia. Si tu carga de trabajo es a ráfagas, esa diferencia en la tasa de error merece más atención que la mediana.

Ambos niveles están activos en una sola clave de OrcaRouter junto con la instantánea fijada, con conmutación automática por error entre proveedores. Para una comparación como esta, ese es el punto práctico: medir tus propios prompts frente a ambas generaciones Max es un cambio de configuración, no un segundo contrato.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

La reproducibilidad es ahora el factor decisivo

Esta es la parte de la divulgación de Apsara que nadie ha valorado. Un ID de modelo activo cuya capacidad medida pasó de 40 a 45 en un mes, sin cambio de versión ni anuncio en ese momento, es un riesgo para la reproducibilidad. Si el comportamiento de tu producto depende de un ID cambiante, tienes un modelo que puede mejorar —o desplazarse— por debajo de una suite de evaluación congelada, una biblioteca de prompts en caché o un conjunto de regresión aprobado.

Ambas generaciones ofrecen instantáneas con fecha, y esa es la mitigación. Alibaba documenta Qwen3.7-Max como funcionalmente equivalente a qwen3.7-max-2026-05-20, con compilaciones fechadas adicionales en 2026-05-17 y 2026-06-08. Qwen3.8-Max tiene qwen3.8-max-0902, la compilación de septiembre con post-entrenamiento, que es a lo que se refiere el 45. Si vas a desplegar algo que necesite reproducirse, fija el ID con fecha y trata el flotante como un objetivo de staging. Los ciclos de RSI son una característica del ID flotante; la fijación es la forma de excluirte de ellos.

Un detalle de nomenclatura que conviene conocer para no malinterpretar el catálogo. Alibaba incluye una tercera forma con fecha, qwen3.8-max-2026-09-02, junto con el alias 0902; ambas se refieren a la misma compilación. La versión original del 3 de agosto ya no es enrutable desde nuestro lado — servimos Qwen3.8-Max, su pin 0902, y Qwen3.7-Max.

¿Quién debería elegir cuál?

La decisión no se divide según qué modelo sea mejor. Se divide según qué estás comprando.

Quédate con Qwen3.7-Max si tu carga de trabajo es solo de texto, más intensiva en conocimiento que en herramientas y sensible al rendimiento —clasificación de gran volumen, extracción, recuperación de contexto largo, resumen por lotes. En GPQA Diamond y en la recuperación de contexto largo está a un punto del modelo más nuevo, transmite de tres a cuatro veces más rápido y cuesta $1.15 por tarea frente a $5.41. También es la respuesta correcta para cualquiera que quiera una segunda opinión barata en una configuración de fusión o enrutamiento, porque, a su tarifa promocional, está en una clase de precio completamente distinta. Dos advertencias: la promoción es una promoción, y Artificial Analysis ya ha señalado que el modelo está obsoleto, superado por Qwen3.8-Max. No inicies un compromiso de varios años con él.

Cámbiate a Qwen3.8-Max si se cumple alguna de estas condiciones: necesitas entrada de imagen o vídeo, que Qwen3.7-Max no admite en absoluto; tu carga de trabajo es agéntica, con cadenas largas de llamadas a herramientas o bucles de codificación de varios pasos, donde el 88.76 frente al 74.53 en Terminal-Bench 2.1 y la brecha cuádruple en el uso de herramientas marcan la diferencia entre llegar a producción o no; o escribes según la tarifa internacional de Singapur, donde el modelo más reciente es simplemente un 20 % más barato y no hay ninguna disyuntiva que sopesar. Fija qwen3.8-max-0902 si necesitas que el comportamiento permanezca estable.

Si está en Pekín, Fráncfort o Virginia, la elección es más clara de lo que sugiere cualquier comparación: ambos niveles Max cuestan $1.65 / $4.951 por millón de tokens. Idénticos. A esas tarifas, no pagar nada extra por entrada multimodal, un Índice 16 puntos superior y una puntuación de uso de herramientas cuatro veces mejor no es una decisión, es gratis — y la única razón para quedarse en Qwen3.7-Max pasa a ser el rendimiento bruto.

Dos preguntas que merecen una respuesta directa

¿La ejecución de entrenamiento de 33 ciclos significa que el modelo cambió bajo el tráfico de API existente? Eso es lo que implica la divulgación, y es por lo que existe la fijación con fecha. Alibaba describe el modelo mejorado como "el Qwen3.8-Max actualizado", que es el ID flotante, no uno nuevo. Si tenías cargas de trabajo en el ID flotante hasta septiembre, fueron servidas por un modelo cuya capacidad medida cambió durante esa ventana. Alibaba no ha publicado un registro de cambios para las compilaciones intermedias, así que la única forma fiable de saber qué comportamiento tienes es fijarlo.

¿Está verificada de forma independiente la afirmación sobre el RSI? La puntuación que produjo sí lo está: el Índice es de Artificial Analysis, y el 45 aparece en su página. El mecanismo que lo sustenta es la propia descripción de Alibaba de su propio proceso de entrenamiento, sin replicación externa, sin protocolo de evaluación publicado y sin ningún tercero observando los 33 ciclos. Trata "33 ciclos iterativos" como una afirmación del proveedor y "45 después de 40" como un par de valores medidos. No son el mismo tipo de declaración, y la diferencia es la razón por la que el titular merece leerse con atención en lugar de repetirse.

Lo próximo que hay que observar no es Qwen 4. Es si la promoción a mitad de precio de Qwen3.7-Max sobrevive a la llegada del modelo que está destinado a reemplazarlo. Si no lo hace, muchísimos equipos descubrirán que estaban comparando un precio de lista con un descuento, y que el mayor de dos hermanos era el más caro desde el principio.