Tarjeta de título generada para Step 5 Preview que dice 'Step 5 Preview — la filtración hasta ahora', enumerando seis especificaciones como filas de etiqueta y valor: parámetros totales alrededor de 600B, activados por inferencia alrededor de 27B, entrada de texto e imagen, ventana de contexto 1M de tokens, AA Intelligence Index 44, y precio de $1.00 de entrada y $2.70 de salida por 1M de tokens. Un pie de página dice 'Todas las cifras son de terceros y no auditadas - StepFun no ha anunciado este modelo.' El logotipo de OrcaRouter se encuentra en la esquina inferior derecha.
Guides & Insights

Vista previa de Step 5: el modelo insignia de 600B no anunciado de StepFun ya está en la tabla de clasificación

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Step 5 Preview tiene una posición en la tabla de clasificación, un precio publicado, una velocidad de salida medida y una puntuación del Índice de Inteligencia de 44 — la misma puntuación que Kimi K3, un modelo aproximadamente cinco veces su tamaño. Lo que no tiene es un lanzamiento. StepFun no lo ha anunciado, la propia documentación de la plataforma de StepFun no lo incluye, y no hay pesos para descargar. Cada cifra a continuación proviene de un tercero que obtuvo acceso antes de que el proveedor dijera algo públicamente, lo que convierte esto en un artículo de lo que sabemos hasta ahora en lugar de una reseña. Lea los números como evidencia de lo que está por venir, no como una ficha técnica.

La filtración es la noticia

El primer rastro público de Step 5 Preview es una ejecución de evaluación. Artificial Analysis tiene una página de modelo activa para él, puntuada a través de la propia API de StepFun bajo la etiqueta de prueba step-5-preview-b, y la plataforma fecha el modelo el 18 de septiembre de 2026. Esa página es de donde provienen el 44, el precio, la medición de velocidad y las filas de benchmark de este artículo.

Frente a eso, el lado del proveedor está vacío. La documentación para desarrolladores de StepFun enumera modelos hasta Step 3.7 Flash y Step 3.5 Flash y se detiene: no hay step-5, ni entrada de vista previa. La organización stepfun-ai en Hugging Face no tiene ningún repositorio de Step 5, lo que es coherente con un modelo insignia de pesos cerrados y no con un descuido. Informes de la comunidad en foros de desarrolladores chinos apuntan a una posible presentación en el evento AGI Frontier en Shanghái el 19 de septiembre, que sería aproximadamente un día después de que salieran a la luz las evaluaciones. Al momento de escribir esto, nadie fuera de StepFun dispone de una especificación oficial, un precio oficial ni un nombre oficial para la versión que se lanzará.

El propio nombre ya es la primera pista de que esto es una preview y no un lanzamiento. StepFun se saltó por completo la línea Step 4.x y pasó directamente al Step 5. Un modelo publicado bajo un sufijo de tipo Preview, evaluado con benchmarks antes de contar siquiera con una página de producto, es un modelo que el proveedor todavía está calibrando: el precio, el enrutamiento y los límites pueden cambiar antes de su disponibilidad general.

Cómo se ve la especificación, hasta donde se puede saber

Estas son las cifras que circulan, y son las afirmaciones más repetidas de la filtración — lo cual no es lo mismo que las más confirmadas:

• Parámetros totales — unos 600B, frente a aproximadamente 2,8T de Kimi K3

• Activados por inferencia: unos 27B, aproximadamente el 4,5 % del total, una proporción de mezcla de expertos inusualmente dispersa

• Modalidades de entrada: texto e imágenes; la salida es solo texto

• Razonamiento — sí, con pensamiento extendido

• Ventana de contexto — 1M tokens en Artificial Analysis; una configuración de terceros independiente que circula en herramientas de desarrollo indica 350,000 con una salida máxima de 64,000

• Disponibilidad de peso — cerrado, sin repositorio

Esa contradicción en la ventana de contexto merece señalarse con claridad, porque nadie la ha resuelto. Una ventana de 1M de tokens y una ventana de 350k tokens son productos diferentes con costos de memoria distintos, y la segunda cifra conlleva un límite de salida de 64k del que la primera no dice nada. Si estás planeando un pipeline de documentos largos basándote en el número de 1M, la configuración de 350k es la razón para esperar a una página del proveedor. Los recuentos de parámetros tienen una vaguedad similar: el rastreador de DataLearner todavía registra la arquitectura MoE y los recuentos de parámetros de Step 5 Preview como no disponibles, lo que significa que el par 600B/27B —el dato más citado sobre este modelo— es también uno de los menos confirmados oficialmente.

El número interesante es 27B, no 600B

Los modelos dispersos de mezcla de expertos solo gastan cómputo en los expertos a los que un token realmente se enruta, por lo que la cifra de parámetros activados es la que rige cómo se comporta el modelo en producción. Con aproximadamente 27B activos, Step 5 Preview realiza trabajo por token en el mismo rango que modelos de una fracción de su tamaño, mientras que el total de 600B es en gran medida una cuestión de huella de memoria.

Se derivan dos consecuencias, y ambas aparecen en las mediciones de terceros. El costo de servicio está ligado a los parámetros activados, lo cual es parte de por qué el precio está donde está. Y la velocidad por token también se beneficia: Artificial Analysis mide 99,8 tokens de salida por segundo, en el puesto 42 de 200 modelos, frente a una mediana de 64,6. El tiempo hasta el primer token es de 2,96 segundos frente a una mediana de aproximadamente 3,57 segundos. Si la división 600B/27B es precisa, este es un modelo diseñado para ser económico de servir en lugar de económico de alojar — una distinción importante si usted es quien paga por las GPUs en lugar de por los tokens.

Dónde queda en el Intelligence Index

Artificial Analysis puntúa Step 5 Preview con 44 en el Intelligence Index v4.3, que incorpora diez evaluaciones. Eso lo coloca en el puesto 25 de 200 modelos en la clasificación y muy por encima del modelo mediano que puntúa el índice, que se sitúa en 25.

• Índice de Inteligencia — Step 5 Preview 44 vs Kimi K3 44

• Justo arriba — GLM-5.3 y Claude Opus 5, ambos en 45

• Justo debajo — DeepSeek V4.1 Flash con 40 y DeepSeek V4 Pro con 36

• Terminal-Bench 4.0 — Step 5 Preview 33,3 % frente a Kimi K3 con aproximadamente 12,6 %, y frente a DeepSeek V4.1 Flash con 26,8 %

• SciCode — 59% para Step 5 Preview, a la par de Kimi K3

• Velocidad de salida — 99.8 tokens por segundo frente a una mediana del sector de 64.6

El titular es el empate con Kimi K3, y la lectura honesta es más estrecha de lo que sugieren los titulares. Igualar un modelo de 2,8 T de parámetros en un índice agregado con 600B en total es un resultado de eficiencia real, pero el agregado oculta su forma: la diferencia en Terminal-Bench 4.0 a favor de Step 5 Preview es dramática, mientras que el resultado de SciCode es un empate absoluto. La paridad agregada en un índice no es paridad en todas partes, y una compilación preliminar es el momento menos fiable para asumir que las diferencias se mantendrán.

Una discrepancia más que vale la pena mencionar: Artificial Analysis informa 44, mientras que el rastreador independiente de DataLearner registra la misma ejecución como 43.6. Es una diferencia de redondeo más que un desacuerdo sobre la capacidad, pero es el tipo de cosa que ilustra lo que ocurre con los números de este modelo en general: son lecturas de terceros de un modelo no anunciado, tomadas en momentos ligeramente distintos, y ninguna de ellas ha sido confirmada por StepFun. Ninguno de estos benchmarks es reportado por el proveedor, lo cual tiene doble filo: nadie en StepFun ha reclamado un número aquí, y nadie en StepFun ha respaldado ninguno tampoco.

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

El precio, y la verbosidad que se lo come.

El precio es la parte de esta filtración que afectará a un presupuesto más pronto. A través de la API de StepFun, Artificial Analysis registra lo siguiente:

• Entrada — $1.00 por millón de tokens, frente a una mediana de $1.88 para modelos comparables

• Salida — $2,70 por millón de tokens, frente a una mediana de $10,00

• Caché — un descuento de caché del 95 %, lo que sitúa los aciertos de caché en aproximadamente $0,05 por millón de tokens

• Combinado — aproximadamente $0,51 por millón de tokens con una proporción de 7:2:1 de aciertos de caché, entrada y salida

• Costo por tarea del Intelligence Index — $0.71

• Coste de una ejecución completa de indexación — 918,34 $ en total

El precio de salida de $2.70 es la línea que más importa, porque es menos de una quinta parte de lo que Kimi K3 cobra por el mismo millón de tokens a $15.00. Pero hay un detalle que una comparación por token oculta, y Artificial Analysis lo mide directamente: la verbosidad. Step 5 Preview generó 160M tokens de salida para completar el Intelligence Index, frente a una mediana de 90M para el conjunto y una posición 65 de 200 en esa medida.

Haz las cuentas. A $2.70 por millón, 160M tokens de salida son unos $432 — aproximadamente la mitad del costo total de $918.34 de toda la ejecución del índice, gastada en la verbosidad del propio modelo y no en las tareas. Si haces pasar esos mismos 160M tokens por la tarifa de salida de $15.00 de Kimi K3, llegas a $2,400, que es de donde viene la ventaja de precio. Pero la advertencia práctica es para cualquiera que estime costos tomando un recuento de tokens de otro modelo: Step 5 Preview escribe alrededor de 1.8 veces la mediana, así que una carga de trabajo intensiva en salida obtiene la tarifa más barata y más tokens al mismo tiempo. El descuento se mantiene, pero es menor de lo que sugiere la comparación de $1.00/$2.70 frente a $3.00/$15.00, y su magnitud depende por completo de lo charlatán que tus prompts hagan que sea el modelo.

El descuento de caché del 95 % es la otra palanca, y es inusualmente agresivo. Una carga de trabajo con una alta reutilización de prompts —un prompt de sistema largo, un documento fijo, una base de código compartida— se acerca mucho más a la tarifa combinada de $0.51 que a la tarifa de entrada de $1.00. Esa cifra combinada asume una proporción de 7:2:1, que es una suposición de modelado más que una garantía, pero es la forma correcta de aritmética para contrastarla con tu propio tráfico.

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

Con qué se están encontrando los primeros probadores

Estos son informes individuales de foros de desarrolladores y publicaciones en redes sociales en los días previos y posteriores a la filtración, no mediciones, y deben ponderarse en consecuencia:

• La llamada a herramientas es la queja más habitual — se seleccionan nombres de herramientas incorrectos y se intentan hacer ediciones sin leer antes el archivo de destino

• Errores reportados más allá de aproximadamente 340.000 tokens de contexto, que es el modo de fallo que hay que vigilar si la ventana de 1M resulta ser la cifra real

• El filtrado de contenido trunca las salidas en algunos prompts

• Las impresiones sobre la capacidad están divididas: algunos probadores lo sitúan por encima de GLM-5.3 Flash, otros lo sitúan por debajo de DeepSeek V4.1 Flash

Que una compilación de vista previa no publicada falle al usar herramientas no es un escándalo: para eso está la etiqueta de vista previa. Pero sí significa que el 44 no debería interpretarse como una promesa sobre la fiabilidad agéntica, porque el Intelligence Index no evalúa aquello de lo que más se quejan los primeros probadores.

Cómo lo llamarías realmente — y qué usar mientras tanto

OrcaRouter no enruta Step 5 Preview. No hay ningún endpoint público ni pesos, así que no hay nada que enrutar, y ninguna plataforma de terceros puede afirmar honestamente lo contrario todavía. Cualquiera que te diga dónde llamarlo hoy está describiendo un endpoint de evaluación, no un producto.

Los modelos con los que se lo compara son otro asunto. Kimi K3, GLM-5.3 y DeepSeek V4.1 Flash están todos disponibles a través de OrcaRouter, junto con 199 modelos de 15 proveedores tras una única clave de API y una única factura. El precio se traslada al precio de lista del proveedor con un 0 % de margen, lo que importa más de lo habitual en un modelo como este: si el $1.00/$2.70 de Step 5 Preview se mantiene en el lanzamiento y luego cambia, una ruta de traspaso directo se mueve el mismo día en lugar de hacerlo según el calendario de reajuste de precios de otro.

Cuando finalmente sea invocable, la manera sensata de ejecutar un modelo cercano a uno no lanzado es la forma en que ejecutarías cualquier modelo en el que aún no confías — detrás de una ruta con conmutación por error automática, de modo que un fallo de llamada a herramienta o un error de contexto largo recaiga en un modelo que funcione en lugar de derribar tu aplicación con él. Ese es el patrón que los informes iniciales defienden aquí específicamente: una compilación preliminar con problemas reportados de llamada a herramientas y errores de contexto largo es exactamente el modelo que quieres que tenga un respaldo detrás, no uno que quieras en una ruta de producción por sí solo.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

¿Qué haría que esto pasara de ser una filtración a un lanzamiento?

Tres cosas que hay que observar, en orden de cuánto resolverían. Primero, una página de modelo y precios en la propia plataforma para desarrolladores de StepFun: en el momento en que step-5 aparece en la lista de modelos, la hoja de especificaciones del proveedor reemplaza toda lectura de terceros en este artículo, incluidos el par 600B/27B y la afirmación de contexto de 1M. Segundo, la resolución de la contradicción de contexto de 1M frente a 350k; un límite de salida de 64k bajo una ventana de 1M es una diferencia significativa para cualquiera que construya pipelines de documentos largos o agénticos, y actualmente no está resuelta. Tercero, si el precio es una postura de lanzamiento o una línea permanente —el precio de vista previa en los modelos insignia chinos tiene un historial de cambiar cuando la capacidad se vuelve escasa, y $2.70 por millón de tokens de salida es lo suficientemente agresivo como para invitar a esa pregunta.

Hasta que al menos el primero de esos se materialice, el resumen honesto es que Step 5 Preview parece un modelo genuinamente eficiente —600B en total haciendo un trabajo agregado de clase 2.8T, a un precio varias veces más bajo que el del resto—, con una especificación no verificada, una verdadera penalización por verbosidad y una reputación en llamadas a herramientas que aún no se ha ganado. Vale la pena tenerlo en cuenta para planificar. Todavía no vale la pena apostar por una ruta de producción basada en él.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario