Tarjeta de título generada para Step 5 Preview vs Qwen 3.8 Max Prime que dice 'un punto de índice, cuatro dólares y treinta y ocho centavos', con tres chips de estadísticas: Artificial Analysis Intelligence Index 44 frente a 45, coste por tarea de índice $1.03 frente a $5.41, y precio de salida $2.70 frente a $9.902 por millón de tokens. El logotipo de OrcaRouter se encuentra en una franja blanca en la parte inferior derecha.
Guides & Insights

Vista previa del Paso 5 vs Qwen 3.8 Prime: un punto de índice, cuatro dólares y treinta y ocho centavos

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Empieza por lo que un cuadro de búsqueda no te dirá. Qwen 3.8 Max Prime no es un modelo. Es una vía de servicio: los mismos pesos de Qwen3.8-Max que el proveedor llevó a disponibilidad general el 3 de agosto de 2026, vendidos bajo un segundo ID de modelo a exactamente el doble de la tarifa internacional. Step 5 Preview, el buque insignia cerrado de StepFun, abrió su API el 20 de septiembre de 2026 y es un modelo en el sentido ordinario: un endpoint, un precio, un único conjunto de pesos que no puedes poseer. Así que la versión honesta de esta comparación enfrenta un modelo medido contra un nivel sin medir, y la aritmética que se desprende es más cruda de lo que cualquiera de los dos proveedores pondría en una diapositiva. En el índice independiente Artificial Analysis Intelligence Index, los dos están a un punto de distancia, 44 frente a 45, y en lo que cuesta una tarea completada, están a $1.03 frente a $5.41 de distancia. Un punto, cuatro dólares con treinta y ocho centavos por tarea, y eso es antes de haber comprado algo de la velocidad por la que Prime realmente cobra.

Lo que sigue es ese número desglosado: de dónde viene, por qué el Qwen ID estándar ya es la mitad más cara de la comparación antes de que Prime duplique nada, y qué compran y qué no compran los cuatro dólares extra por tarea.

El nombre está haciendo un trabajo que el producto no hace.

Alibaba anunció Prime —优速模式, modo rápido— en la Conferencia Yunqi el 22 de septiembre de 2026 y lo publicó como una línea en la lista de precios de Model Studio. La propia documentación de Alibaba no deja lugar a dudas sobre qué cambia: la velocidad de salida se eleva a entre 1,5 y 2 veces la de la API estándar y, en palabras del proveedor, las capacidades y las restricciones de uso son idénticas a las del modelo original. Ni un nuevo número de parámetros, ni un nuevo contrato de endpoint, ni ninguna capacidad que no tenga el ID estándar. Cambias el nombre del modelo en el cuerpo de la solicitud y ya estás en la vía rápida.

Generated two-column comparison scoreboard for Step 5 Preview and Qwen 3.8 Max Prime across six shared rows: what the name refers to, 'a model' against 'a serving lane for Qwen3.8-Max'; Artificial Analysis Intelligence Index 44 against 45, measured on the standard Qwen ID with no Prime row; cost per index task $1.03 against $5.41; output price $2.70 against $9.902 per million tokens; output speed 87 against 35.4 tokens per second, again measured on the standard ID; and weights, 'proprietary, BF16 checkpoint promised 15 October' against 'proprietary, none'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and were measured on the standard Qwen3.8-Max ID rather than on Prime, and that rate cards are Alibaba's international list price and StepFun's own. The OrcaRouter logo sits in a white strip at the bottom right.

Eso convierte el término de búsqueda en una trampa. Alguien que busca un buque insignia de Qwen más nuevo que Qwen3.8-Max encuentra "Prime" y lo lee como un número de versión. Es un precio. Todo lo que el nombre implica sobre capacidad lo aporta el propio Qwen3.8-Max: un modelo de mezcla dispersa de expertos de 2,4 billones de parámetros con aproximadamente 95 mil millones de parámetros activos por token, 512 expertos por capa y un contexto de 983.616 tokens en la configuración que probó el panel independiente.

Step 5 Preview no tiene una ambigüedad equivalente, y tiene el problema opuesto. StepFun lo lista con aproximadamente 600 mil millones de parámetros totales con 27 mil millones activos, entrada de texto, imagen y video, una ventana de contexto de 1M de tokens y un límite de salida documentado de 64,000 tokens, con esfuerzo de razonamiento seleccionable en bajo, medio o alto. Es propietario. Se ha prometido un checkpoint BF16 para el 15 de octubre de 2026 y no se ha lanzado; espejos comunitarios de una compilación BF16 han circulado en Hugging Face desde el día en que se abrió la API, pero las resubidas no son un lanzamiento y StepFun no ha publicado ningún anuncio de pesos abiertos.

Así que la pareja está realmente desequilibrada antes de que llegue un solo benchmark: un modelo en vista previa que podría convertirse en una descarga, frente a un nivel de servicio con precio ajustado de un modelo que no lo hará.

Cuánto cuesta un punto del índice

Ambos modelos han sido evaluados por el mismo evaluador independiente, y aquí es donde la comparación se vuelve incómoda para el relato de que resulta más barato por token. Sigue leyendo el 10 de octubre de 2026:

• Index — Step 5 Preview 44, muy por encima de una mediana de 26 de modelos comparables. Qwen3.8-Max en la compilación 0902, 45. Un punto.

• Coste por tarea de indexación completada — 1,03 $ frente a 5,41 $. Más de cinco veces mejor.

• Precio de salida — $2.70 frente a $6.00 por millón de tokens en el ID estándar, que pasa a $9.902 una vez que te cambias a Prime. Step 5 Preview es 2.2 veces más barato que el estándar y 3.7 veces más barato que Prime.

• Precio de entrada — $1.00 frente a $2.00 del estándar y $3.301 en Prime. La imagen especular de la columna de salida, y la que más importa una vez que se lee el desglose de costos a continuación.

• Acierto de caché — $0.10 por millón de tokens en Step 5 Preview, un descuento del 90 por ciento; $0.25 en Qwen3.8-Max, un descuento del 87,5 por ciento que la propia página del proveedor redondea al 88 por ciento.

• Tokens de salida por segundo — 87 frente a 35,4. Aquí Qwen es el lento, y por un factor de aproximadamente dos veces y media.

Las columnas por token y la columna por tarea no coinciden, y la columna por tarea es la que hay que creer, por una razón que solo aparece si abres el desglose de costos. En la ejecución de índice de Step 5 Preview, 0,85 $ de los 1,03 $ son del lado de entrada y 0,17 $ son de salida. En la de Qwen3.8-Max, 4,76 $ de los 5,41 $ son del lado de entrada y 0,65 $ son de salida. Los precios de lista difieren en aproximadamente un factor de dos; las facturas por tarea difieren en un factor de cinco, porque la ejecución de Qwen envió alrededor de 9.900 millones de tokens de entrada a través del harness frente a los 5.500 millones de Step 5 Preview, y porque la mayor parte de ese volumen es tráfico de caché que se vuelve a leer con el descuento que conceda el proveedor en lugar de a la tarifa anunciada.

El Step 5 Preview es descrito por el consejo como muy verboso, con aproximadamente 160 millones de tokens de salida en toda la suite frente a una mediana de 82 millones — y el Qwen3.8-Max se describe con exactamente las mismas palabras, con aproximadamente 190 millones frente a esa misma mediana. Ninguno de los dos es un modelo que responda de forma breve. Si la longitud de salida es lo que esperabas optimizar, ninguna de las dos columnas te sirve de ayuda.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), showing an Intelligence Index of 45 ranked 32 of 227 with a comparable-model median of 26, speed ranked 190 of 227, cost ranked 105 of 227 and verbosity ranked 103 of 227, pricing of $2.00 per million input tokens and $6.00 per million output tokens with an 88 percent cache discount, a measured cost of $5.41 per index task, 190 million output tokens generated across the run against an 82 million median, about 35 output tokens per second, and a 984k-token context.

La comparación tiene un hueco, y tiene forma de Prime

Todas las cifras de la sección anterior se midieron con el Qwen3.8-Max ID estándar. Ninguna de ellas se midió con Prime.

Eso no es un detalle técnico. Toda la propuesta de Prime es que los tokens llegan más rápido, y el único dato de velocidad del tablero para esta familia es el de 35,4 tokens de salida por segundo del ID estándar —el más lento de los tres ID analizados aquí por un amplio margen, y la única fila en la que Qwen3.8-Max no solo es caro, sino que rinde visiblemente por debajo. Si Prime alcanza el límite superior del rango declarado por Alibaba, ese 35,4 pasa a ser algo así como 70, todavía por debajo de los 87 de Step 5 Preview, aunque con un coste 3,7 veces mayor por token de salida. Si alcanza el límite inferior del rango, se queda en aproximadamente 53.

Esos son estimaciones basadas en un multiplicador declarado por el proveedor, no en mediciones, y deberían etiquetarse como tales. Nadie que hayamos podido encontrar ha publicado una prueba independiente de rendimiento del modo Prime. La cifra de 1,5 a 2× es de la propia Alibaba, y es la única afirmación que sostiene todo el nivel.

El único detalle estructural que argumenta a favor de Prime es la regla de limitación de velocidad, y es fácil pasarla por alto. La documentación de Alibaba afirma que, con Prime, cuando el volumen de llamadas alcanza el límite de velocidad, si la plataforma aún tiene recursos disponibles, la solicitud no se limita, por lo que el rendimiento disponible para usted no cae por debajo del límite indicado. Eso es un techo blando con un suelo duro: en condiciones de contención obtiene el límite, con capacidad inactiva puede obtener más. Para un bucle de agente que dispara docenas de llamadas secuenciales, importa más que la mediana, porque la llamada más lenta decide cuándo termina el bucle. También es la explicación más clara de por qué Prime existe como producto. Alibaba está vendiendo posición en la cola de una capacidad que ya ha construido, y cobrando el doble por el derecho a ser atendido primero en ella.

Lo que dicen las dos tarifas cuando las pones lado a lado

Alibaba publica sus filas de Qwen contiguas entre sí, lo que hace que la aritmética del nivel sea inusualmente limpia. En la página internacional, la fila Prime indica $3.301 de entrada y $9.902 de salida por millón de tokens, frente a $1.65 y $4.951 para el ID estándar y para su pin 0902. Eso es exactamente 2.0 en ambas columnas — no una aproximación redondeada, sino la proporción literal de las cifras publicadas. La página de precios en inglés de StepFun incluye Step 5 Preview a $1.00 de entrada, $0.10 en un acierto de caché y $2.70 de salida, con la entrada de fallo de caché incluyendo el costo de escribir contenido nuevo en la caché. La cifra publicada por el proveedor para aciertos de caché es un descuento del 90 por ciento; el panel independiente registra un 95 por ciento a partir de los mismos materiales, y vale la pena saber contra cuál de los dos se está modelando.

Pon las tres tarjetas en una sola columna y el panorama queda claro. Salida de Prime, $9.902. Salida de Qwen estándar, $6.00 en el registro del tablero y $4.951 en la propia página internacional de Alibaba. Salida de Step 5 Preview, $2.70. Y en el carril barato que nadie anuncia, la lectura de caché de Step 5 Preview es de $0.10 frente a los $0.25 de Qwen — lo cual importa más que la columna de salida para cualquier carga de trabajo que repita su prefijo.

Una advertencia sobre los números obsoletos, porque a esta familia le han cambiado el precio más de una vez en siete semanas. El ampliamente citado $2 de entrada y $6 de salida para Qwen3.8-Max es el titular del lanzamiento de agosto, y sigue siendo lo que muestra la pestaña de Singapur de Alibaba. Las filas internacional y global ahora indican $1.65 y $4.951. Si vas a modelar el gasto, usa la tabla de tarifas de tu región y vuelve a leerla el día en que te comprometas.

Dos formas de leer el 2×

Como Prime es el mismo modelo al doble del precio del standard ID, la prima es fácil de fijar y difícil de justificar. En lo más alto de la gama de Alibaba pagas 2× por 2× la velocidad, lo que resulta neutro en coste por segundo de latencia eliminado. En lo más bajo pagas 2× por 1,5×, una prima del 33 por ciento por segundo ahorrado. Ninguno de los dos extremos es irrazonable para trabajo interactivo; ninguno es defendible para un lote nocturno. Por eso el consejo habitual sobre el nivel —llamadas sensibles a la latencia en Prime, todo lo demás en el standard ID— es también el consejo correcto.

La comparación con Step 5 Preview es donde el razonamiento cambia de forma, y esta es la parte que el enfoque de "vs" hace visible. Prime no compite con Step 5 Preview en precio en absoluto. El ID estándar ya es más caro por token de salida que Step 5 Preview, cinco veces más caro por tarea completada, y obtiene un punto más. Prime multiplica el lado del costo de una ecuación que ya estaba perdiendo y recupera velocidad de la que Step 5 Preview tiene más, gratis. Si lo que necesitas de esta familia es velocidad, la afirmación honesta es que el modelo del otro lado de esta página te da 87 tokens por segundo a $2.70 por millón de tokens de salida, y la vía rápida te da un rango que llega como máximo, según los propios números de Alibaba, a alrededor de 70 a $9.902.

Eso no es un argumento de que Step 5 Preview gane. Es un argumento de que el valor de Prime es completamente interno a la propia línea de productos de Alibaba, y de que su caso se basa en cargas de trabajo donde la ventaja de un punto en el índice de Qwen3.8-Max, su contexto de 983.616 tokens o su perfil de tareas diferente hacen un trabajo que un contexto de Step 5 Preview de 1M tokens no hace. Lo cual es la comparación que nadie puede realizar todavía, porque la fila de Prime no existe en ningún tablero independiente.

Generated rate-card infographic comparing three published price lists in one column: Qwen 3.8 Max Prime at $3.301 input and $9.902 output per million tokens, the standard qwen3.8-max and qwen3.8-max-0902 IDs at $1.65 and $4.951 on Alibaba's international page against the $2 and $6 still shown on its Singapore tab, and Step 5 Preview at $1.00 input, $0.10 cached input and $2.70 output from StepFun's English pricing page. A footer reads that the Prime row is exactly 2.0 times the standard row on both columns and that all figures are vendor list prices read on 10 October 2026.

Dónde queda esto para un comprador

Ninguno de estos dos está en Orca. Se puede acceder a Step a través de las propias plataformas de Step y de un puñado de plataformas de terceros; Prime es un nivel de Alibaba Model Studio servido en un endpoint con alcance específico para el modelo; y puedes contrastar ambas afirmaciones con nuestro catálogo en el mismo minuto en que las lees, lo cual es una prueba mejor que fiarte de nuestra palabra.

Lo que enrutamos es un producto distinto de la misma familia, y resulta ser al que la aritmética de este artículo no deja de remitir. El Qwen3.8-Max estándar y su pin con fecha Qwen3.8-Max-0902 están en el catálogo bajo la misma clave que sus hermanos Qwen3.8-Max-Preview, Qwen3.8-Flash y Qwen3.8-27B, junto con más de 200 otros modelos, con el precio de lista del proveedor trasladado con un margen del 0 por ciento. De eso se derivan dos cosas, y ambas inciden en la decisión anterior. La primera es que un cambio en la tarifa de Alibaba aparece de nuestro lado el mismo día en que Alibaba lo publica — precisamente la propiedad que deseas de un proveedor que ya ha cambiado el precio de esta familia dos veces en siete semanas. La segunda es que tu línea base deja de ser una apuesta por un solo proveedor: el ID estándar es el nivel que más probablemente mantengas en tu ruta predeterminada, y mantenerlo detrás de una capa de enrutamiento en lugar de una integración directa es lo que hace que la decisión sobre Prime sea reversible por endpoint en lugar de por contrato.

Si tienes que elegir entre los dos nombres del título de este artículo, la decisión es sencilla. Recurre a Step 5 Preview cuando quieras la puntuación, la entrada de vídeo e imágenes y el descuento de caché del 90 por ciento, y acepta que estás alquilando una vista previa cuyo checkpoint es una promesa para el 15 de octubre en lugar de una licencia. Recurre a Qwen 3.8 Max Prime solo si ya estás comprometido con Qwen3.8-Max y has medido, con tus propios prompts, que los 35 tokens por segundo del ID estándar son lo que te está costando dinero — y valora esa decisión frente al 2× en lugar de frente al 1,5×, porque el tope de la gama de un proveedor no es el número que verás en producción.

La medición que zanjaría esto no existe, y vale la pena decirlo sin rodeos en lugar de maquillarlo. Alguien tiene que pasar Prime por un arnés que también ejecute Step 5 Preview, publicar una distribución de rendimiento en lugar de un multiplicador, y poner una cifra de coste por tarea junto al punto de índice que compra. Hasta entonces, los únicos números que ambas partes comparten son las dos tarifas, y dicen lo mismo desde direcciones opuestas: la vía rápida es la forma más cara de comprar un token de Qwen3.8-Max, y la más lenta de comprar un segundo de reloj de pared frente a lo que la alternativa cobra por ese mismo segundo.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario