
Qwen3.8 Max Prime: Alibaba coloca una segunda carta de tarifas junto a su buque insignia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 584 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
El 22 de septiembre de 2026, en la Conferencia Yunqi en Hangzhou, la línea de negocio MaaS de Alibaba anunció un nivel de servicio al que llama modo Prime — 优速模式 — y le puso un nuevo ID de modelo en la lista de precios: qwen3.8-max-prime. Ese ID no es un nuevo modelo. Es Qwen3.8-Max, el modelo insignia de mezcla de expertos dispersa de 2,4 billones de parámetros que alcanzó disponibilidad general el 3 de agosto de 2026, entregado a través de una vía más rápida. Qwen3.8 Max Prime tiene los mismos pesos, la misma ventana de contexto, las mismas herramientas y los mismos límites de uso que el modelo base. Lo que difiere es el rendimiento y el precio, y el precio aproximadamente se duplica.
Esta es la segunda vez en siete semanas que Alibaba cambia la forma en que se vende Qwen3.8-Max sin cambiar lo que es. El 2 de septiembre, la empresa lanzó una actualización post-entrenada etiquetada como Qwen3.8-Max-0902, centrada en programación y trabajo agéntico, solo por API. El 22 de septiembre añadió el nivel de velocidad. Ninguno fue un lanzamiento, e interpretar cualquiera de los dos como si lo fuera te costará dinero.

Qué es realmente Prime mode
La propia documentación de Alibaba describe el modo Prime como un canal para "escenarios sensibles a la velocidad de salida" — asistentes de programación con IA, razonamiento de agentes de varios pasos, conversación en tiempo real — y expone el beneficio con claridad: los TPS se elevan a 1,5 a 2 veces los de la API estándar. No hay ningún parámetro nuevo que configurar. Basta con cambiar el valor de model al ID de Prime y ya estarás en la vía rápida.
La documentación es igualmente explícita sobre lo que no cambia: "las capacidades y restricciones de uso admitidas por el modelo son las mismas que las del modelo original". Así que no hay un contexto mayor, ni un mejor modo de razonamiento, ni una superficie de herramientas adicional. Es la misma pila de servicio, pero con más margen detrás.
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
La tarjeta de tarifas, léala con atención.
La página de precios internacional de Alibaba enumera los dos ID uno junto al otro, lo que hace que la comparación sea inusualmente clara. Por millón de tokens:
• Entrada — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65
• Salida — qwen3.8-max-prime $9.902 vs qwen3.8-max $4.951
• Acierto de caché — qwen3.8-max-prime $0.413 frente a una tarifa de lectura de caché en el ID estándar que la misma página incluye como línea de descuento
• Relación — 2,0× tanto en la entrada como en la salida, no una aproximación redondeada, sino la aritmética literal de las cifras publicadas
En la tabla de tarifas de China se mantiene el mismo 2× en yuanes: ¥24 de entrada y ¥72 de salida por millón para el Prime ID frente a ¥12 y ¥36 para el estándar, con aciertos de caché a ¥3.
La cifra de lanzamiento ampliamente citada para Qwen3.8-Max es de $2 por entrada y $6 por salida por millón. Ese es el titular con el que se publicó la cobertura de agosto, y no es el número que figura hoy en la tarifa internacional. Si vas a modelar el gasto, usa la tarifa de tu región en lugar del titular de lanzamiento, y vuelve a consultarla antes de comprometerte — Alibaba ha revisado esta página dos veces desde el 2 de septiembre.

La regla de limitación es la verdadera funcionalidad
La línea que la mayoría de la gente pasa por alto es la que más importa para producción. La documentación de Prime de Alibaba afirma que cuando tu uso alcanza el límite de tasa, si la plataforma aún tiene recursos libres, no se te limitará, por lo que el rendimiento realmente disponible para ti no caerá por debajo del límite indicado.
Eso es un techo blando con un suelo duro, que es una forma diferente de un límite de nivel estándar. Significa que la cifra de 1,5–2× es una promesa sobre el suelo, no un tope en el techo: bajo contención obtienes el límite, y con capacidad inactiva puedes obtener más. Para un bucle de agente que dispara docenas de llamadas secuenciales, esa asimetría vale más que el multiplicador de TPS bruto, porque es la latencia de cola en la llamada más lenta la que determina si tu flujo de trabajo termina.
Los límites dinámicos de TPM para modelos estándar se escalonan según el gasto mensual en Model Studio; la misma familia de documentación muestra el ID base qwen3.8-max con 5.000.000, 10.000.000 y 20.000.000 de TPM en los distintos niveles, actualizados mensualmente. Prime no elimina esa estructura; cambia la forma en que impacta.

Lo que nadie ha medido todavía
Aquí está la brecha honesta. La cifra de 1,5–2× es declarada por el proveedor. No existe ninguna medición independiente del rendimiento en modo Prime que podamos encontrar, y eso importa porque las propias cifras independientes de la compilación estándar no son favorecedoras en cuanto a velocidad.
Artificial Analysis, que evalúa modelos con su propio sistema de evaluación, actualmente puntúa a Qwen3.8-Max en la compilación 0902 con un Intelligence Index de 45, con GPQA Diamond en 92,8%, Terminal-Bench Hard en 38,9% y Humanity's Last Exam en 43,1% — y sitúa su coste medido por tarea en $5,41. Estas son cifras independientes para el SKU estándar, capturadas el 24/09/2026. También son un recordatorio de que el índice se ha revisado desde la cobertura del lanzamiento de agosto, así que no pongas un valor de índice antiguo junto a uno actual y lo llames una tendencia.
Lo que AA no tiene es una fila Prime. Hasta que alguien lo mida, la afirmación sobre la velocidad es únicamente de Alibaba, y la postura correcta es probarla con tu propia carga de trabajo en lugar de asumir que está en lo más alto de la gama.
En qué situación deja esto la decisión de enrutamiento
Prime es un nivel que Alibaba vende en su propia API, y ese es el único lugar para conseguirlo. No alojamos qwen3.8-max-prime aquí. Lo que OrcaRouter sí enruta es el estándar Qwen3.8-Max y su versión fijada por fecha Qwen3.8-Max-0902, ambos en la misma clave que el resto de la familia Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — junto con más de 200 otros modelos, con el precio de lista del proveedor trasladado con un 0 % de margen. Esa última parte es la razón por la que la actualización del 2 de septiembre y cualquier cambio futuro en las tarifas de Max llegan a nuestro lado el mismo día en que llegan al de Alibaba.
La división práctica es la siguiente. Ejecuta tu tráfico predeterminado en el ID estándar a través de un enrutador, donde la conmutación por error te protege si se degrada la ruta de un único proveedor. Traslada las llamadas específicas en las que la latencia del reloj de pared es el producto —la finalización interactiva, el paso de agente más ajustado— a Prime, y valora esa decisión frente al 2× en lugar de frente al 1,5×.
Quién debería cambiar, y quién debería esperar
Cambia si tus usuarios están esperando tokens: un autocompletado, un turno de chat, un bucle de edición de código donde un humano está observando. En la parte superior del rango de velocidad, Prime es de coste neutro por segundo de latencia eliminado: pagas exactamente el doble por exactamente la mitad del tiempo. En la parte inferior del rango, estás pagando 2× por 1.5×, lo que representa una prima del 33% por segundo ahorrado. Si tu carga de trabajo es un trabajo por lotes que se ejecuta durante la noche, esa prima no te compra nada que necesitaras.
Ojo si tu modelo de costos se basa en el titular de lanzamiento de $2/$6, o si tus solicitudes tienen mucho peso de entrada. La afirmación de velocidad del proveedor se refiere a TPS —tokens de salida por segundo—, y el prefill es una etapa distinta del pipeline. Una solicitud de contexto largo paga el doble por los tokens de entrada, sin importar si la salida llega más rápido. Mide ese caso antes de migrarlo.
Y revisa la fecha en tu tarjeta de tarifas. Qwen3.8-Max lleva en el mercado desde el 3 de agosto, se ha renovado una vez y se ha reempaquetado una vez, y todavía tiene siete semanas de antigüedad. El nivel es la noticia; el modelo no.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
