
Se anuncia Step 5 Preview: qué incluye realmente el buque insignia de 600B de StepFun y qué sigue faltando
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun anunció Step 5 Preview el 20 de septiembre de 2026 — un modelo insignia de mezcla dispersa de expertos de 600 mil millones de parámetros con 27B parámetros activos por token, una ventana de contexto de 1M tokens, entrada de imagen nativa y una puntuación de 44 en el Índice de Inteligencia de Artificial Analysis. La API se abrió ese mismo día. Lo que no se abrió es el modelo en sí: el repositorio de Hugging Face stepfun-ai/Step-5-Preview-BF16 ya existía en la tarde del anuncio y contiene exactamente un archivo, .gitattributes, sin pesos, sin licencia, sin tarjeta de modelo y sin configuración. Los propios materiales de StepFun sitúan la publicación de pesos abiertos el 15 de octubre de 2026. Así que el resumen honesto en una línea de este lanzamiento es que el modelo se puede invocar hoy y descargar en unas tres semanas y media, y esas son dos cosas diferentes. Este es también el mismo modelo que este blog cubrió hoy más temprano como una filtración no anunciada, evaluado bajo una etiqueta de prueba antes de que StepFun hubiera publicado una página de producto — un recordatorio útil de que una vista previa puede pasar de filtración a lanzamiento sin que cambie un solo número.
El repo es un marcador de posición, y esa es toda la historia
Cuando un proveedor publica pesos, el repositorio es la evidencia. Tiene un archivo de licencia, una configuración con un recuento de parámetros, un README con el uso previsto y la tabla de evaluación, y fragmentos de safetensors cuyo tamaño total te dice si la afirmación sobre los parámetros es real. stepfun-ai/Step-5-Preview-BF16 no tiene nada de eso. El registro de la API de Hugging Face para él muestra una marca de tiempo de creación de 2026-09-20T03:52Z, cero descargas, dos me gusta, un objeto de configuración vacío, sin pipeline_tag, sin licencia y un único archivo hermano. La página de la organización StepFun lo incluye en su lista, y no incluye ningún otro repositorio de Step 5 — ni una versión en FP8, ni una versión en NVFP4, ni GGUF, ninguna de las variantes de cuantización que acompañaron a Step-3.7-Flash en junio.
Interpreta eso como una cuestión de planificación, no como un misterio. El sufijo BF16 en el nombre del repositorio es la pista reveladora: un laboratorio que tiene la intención de publicar primero un checkpoint bfloat16 —el formato a partir del cual haces ajuste fino y cuantizas, antes de que lleguen las compilaciones de servicio FP8 y NVFP4— nombra así el repositorio en el momento de crearlo y lo completa después. StepFun ha dicho el 15 de octubre en sus propios materiales de anuncio. Hasta entonces, el repositorio es una declaración de intención, y lo único que demuestra es que StepFun ha reservado el espacio de nombres.
Esto importa por una razón práctica. El Preview como sufijo y los pesos faltantes son la misma señal que apunta en la misma dirección: el modelo es invocable, el precio está fijado y el artefacto que ejecutarías en tu propio hardware aún no existe. Cualquier plan que asuma un Step 5 Preview autoalojado antes de mediados de octubre es un plan sin ningún artefacto detrás.
¿Qué se anunció realmente?
El enfoque de StepFun es limitado y específico: Step 5 Preview es un modelo base para el trabajo agéntico del mundo real —programación con IA, ingeniería de software, trabajo profesional del conocimiento y finanzas—, con énfasis en el contexto largo, las llamadas a herramientas multiturno y la ejecución sostenida más que en la calidad del chat. La empresa se saltó por completo la línea Step 4.x, pasando de Step-3.7-Flash directamente a Step 5, lo cual es en sí mismo una declaración sobre la magnitud del salto que considera que esto representa.
Vale la pena señalar un detalle de fechas, porque es el tipo de cosa que hace tropezar un calendario de adquisiciones: Artificial Analysis data este modelo el 18 de septiembre de 2026, dos días antes del propio anuncio de StepFun. El board puntúa un modelo cuando puede alcanzarlo, y esa diferencia de dos días es el retraso habitual entre que un modelo se vuelve invocable y un proveedor escribe sobre él. El anuncio de StepFun —20 de septiembre, con la API y Studio abriendo el mismo día— es la fecha que se debe citar, y la fecha de los pesos del 15 de octubre proviene de los mismos materiales.
La especificación tal como se publicó:
• Parámetros totales — 600B, mezcla dispersa de expertos
• Activos por token — 27B, aproximadamente el 4,5 % del total, una proporción inusualmente dispersa
• Ventana de contexto — 1M tokens
• Entrada — texto e imágenes de forma nativa; la salida es solo texto
• Razonamiento — sí, con pensamiento extendido
• Precio: $1.00 por millón de tokens de entrada, $2.70 por millón de tokens de salida, con un 95 % de descuento por caché
• Disponibilidad — API y Studio disponibles desde el 20 de septiembre; pesos previstos para el 15 de octubre
La afirmación de eficiencia con la que StepFun lidera es que la división 600B/27B coloca al modelo en la frontera de Pareto —capacidad por unidad de cómputo—, y la empresa lo enmarca como tres generaciones de la misma búsqueda, desde Step-3.5-Flash pasando por Step-3.7-Flash hasta esta. Es una historia coherente, y la proporción dispersa es el mecanismo: con 27B activos, el costo de servicio por token se sitúa en la banda de un modelo mucho más pequeño, mientras que el total de 600B es sobre todo una cuestión de huella de memoria.
Las afirmaciones de los proveedores y las cifras de terceros que las acompañan
En los materiales de lanzamiento aparecen dos clases de cifras, y no deberían interpretarse de la misma manera. Las evaluaciones propias de StepFun son la primera clase: una afirmación de coste para una sola tarea de un octavo de Claude Opus 5; un segundo puesto por detrás de GPT-6 Astra o de Claude Opus 5 en ALE-CLI, FrontierFinance y DRACO; una ejecución de optimización del kernel de GPU de 24 horas que elevó el rendimiento máximo del kernel MLA a 508 TFLOPS frente a los 493 de Claude Opus 5; un experimento automatizado de post-entrenamiento que llevó a Qwen3-30B-A3B del 53,3% al 60% en AIME24; DeepSWE v1.1 con un 67,7% y su StepCodeBench interno con un 49,0%. StepFun construyó StepCodeBench por su cuenta —553 repositorios de código, nueve tipos de tareas, 33 lenguajes de programación—, lo que lo convierte en un instrumento razonable para medir su propio modelo y no en uno independiente.
La segunda clase la mide un tercero, y es la parte con la que hay que planificar. Artificial Analysis le otorga a Step 5 Preview una puntuación de 44 en Intelligence Index v4.3.2, lo que lo sitúa en el puesto 24 de 200 modelos — al mismo nivel que Kimi K3, un punto por detrás de GLM-5.3, y al mismo nivel que la configuración de esfuerzo de razonamiento medio de Claude Opus 5. En Terminal-Bench 4.0, la misma tabla registra un 33,3%, por delante de DeepSeek V4.1 Flash, con un 26,8%, y muy por delante de Kimi K3, con aproximadamente un 12,6%. La velocidad de salida mide 99,8 tokens por segundo y el tiempo hasta el primer token, 2,96 segundos — ambas cifras de la misma ejecución independiente, y ambas el tipo de dato que determina si un bucle de agente se percibe como interactivo.
Una cifra de terceros apunta en sentido contrario y merece estar junto al precio. La misma ejecución del índice usó 160 M tokens de salida para Step 5 Preview frente a una mediana de 92 M entre los modelos evaluados: el modelo es verboso. A $2.70 por millón de tokens de salida, esa verbosidad no es gratis: 160 M tokens de salida son aproximadamente $432 de los $922.84 que costó la ejecución en total, y en un modelo que cobrara tres veces más, sería la línea dominante de la factura. Un precio destacado bajo y un alto recuento de tokens por tarea son las dos mitades de un mismo número, y el costo por tarea del índice —$0.71— ya contiene ambos.

Lo que la filtración acertó, y lo único que no resolvió
La cobertura anterior de este blog se escribió a partir de una ejecución de evaluación que apareció antes de cualquier anuncio, y señaló las afirmaciones que no podía confirmar. El anuncio resolvió la mayoría de ellas. El par 600B/27B ahora está declarado por el proveedor en lugar de inferido. La ventana de contexto de 1M tokens ahora figura en la propia especificación de StepFun, en lugar de solo en una tabla de terceros. El precio de $1.00 y $2.70 es el precio. El nombre es Step 5 Preview, no una alternativa rumoreada.
Lo que el anuncio no hizo fue resolver la contradicción de la ventana de contexto que planteó la cobertura de la filtración. Una configuración separada de terceros que circula en herramientas de desarrollo listaba el modelo con 350.000 tokens de contexto y una salida máxima de 64.000 tokens. Una ventana de 1M y una de 350k son productos diferentes con costes de memoria diferentes, y un techo de salida de 64k es una restricción dura precisamente para el trabajo agéntico de horizonte largo para el que se vende este modelo. El anuncio de StepFun dice 1M y no menciona ningún tope de salida. Vale la pena saber en cuál termina tu enrutamiento antes de construir un pipeline que dependa de la respuesta, y esa es una pregunta para la documentación del proveedor, no para una tabla de clasificación.
Lo otro que el lanzamiento no cambió es la reproducción independiente. Cada fila de benchmark de arriba que no procede de Artificial Analysis es de StepFun, ejecutada con los arneses de StepFun, y ningún tercero ha reproducido los resultados agénticos. El patrón de los buques insignia de los laboratorios chinos de este año es que el índice agregado se mantiene y las filas destacadas del proveedor se desvían; toma el agregado como la cifra de planificación.
A qué puedes llamar hoy y qué derivar mientras tanto
Step 5 Preview no está en nuestro catálogo, y OrcaRouter no lo enruta: hay una API pública y un Studio por parte de StepFun, y es ahí donde se ejecuta. Lo que sí tenemos es el conjunto de modelos con los que se lo está midiendo, detrás de una sola clave: DeepSeek V4.1 Flash a $0.15 de entrada y $0.60 de salida por millón, GLM-5.3 a $1.26 y $3.96 frente a los $1.40 y $4.40 que lista Z.ai, Claude Opus 5 a $5.00 y $25.00, y Kimi K3 junto a ellos. Esa es la forma práctica de las próximas tres semanas: una preview con la que puedes hacer benchmark, y un conjunto de modelos de producción en los que realmente puedes confiar, accesibles a través de una única API para más de 200 modelos, con el precio de lista del proveedor traspasado con un 0% de margen — así que si el precio de StepFun se mueve antes de octubre, la cifra que pagarías se mueve con él el mismo día, no en la renovación.
La conmutación por error automática vale más de lo habitual en esta ventana, porque el modo de fallo de una preview no es que sea mala, sino que tiene la capacidad limitada. Un modelo que abrió su API el día del anuncio y todavía no tiene pesos es un modelo cuya flota de servicio aún se está construyendo, y un endpoint de preview que se degrada a las 2 de la madrugada se lleva consigo tu bucle de agente. Pon la preview detrás de un router con un modelo contrastado como respaldo y obtienes una señal de calidad sobre tu propia carga de trabajo sin apostar una ruta de producción a una flota sin probar.

La fecha que importa es el 15 de octubre
Todo lo anterior es provisional en un aspecto concreto: los pesos son lo que hace permanente a un modelo. Una vista previa cerrada a $1.00 y $2.70 es un buen precio de un único proveedor, y un checkpoint BF16 bajo una licencia publicada es un precio que ya no controla ningún proveedor por sí solo. StepFun se ha comprometido con la segunda para el 15 de octubre, y el nombre del repositorio que ya ha reservado dice bfloat16 primero.
Lo que hay que vigilar de aquí a entonces es acotado y comprobable. ¿Se llena el repositorio — y con qué licencia? ¿Confirma un archivo de configuración 600B en total y 27B activos? ¿Publica StepFun el límite de salida junto con la ventana de contexto, resolviendo la cuestión de 350k/64k? ¿Se mantiene el precio una vez que la preview pierde su sufijo? Esas cuatro respuestas deciden si Step 5 Preview se convierte en un modelo que autoalojas, un modelo que alquilas o un modelo que evalúas una vez y dejas atrás. Hasta que el repositorio tenga más que un .gitattributes en él, el anuncio es el comienzo de la historia en lugar de su final.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
