
Step 5 Preview vs Muse Glimmer: la API Frontier y el modelo para portátil
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
En una tabla de clasificación, Step 5 Preview y Muse Glimmer no están cerca: 44 contra 17 en el Artificial Analysis Intelligence Index — una diferencia de veintisiete puntos en una escala cuyo líder actual se sitúa en la parte alta de los cincuenta — que ninguna cantidad de ajuste podrá cerrar. En la pregunta que un equipo realmente tiene que responder — dónde se ejecutan mis tokens — son competidores directos. Step 5 Preview es el buque insignia de StepFun, anunciado el 20 de septiembre de 2026, con aproximadamente 600 mil millones de parámetros totales y 27 mil millones activos, un contexto de 1M de tokens, a un precio de $1.00 por millón de tokens de entrada y $2.70 por millón de tokens de salida, y solo accesible a través de una red. Muse Glimmer es el modelo agéntico de pesos abiertos de 30 mil millones de parámetros de Meta Superintelligence Labs, publicado el 10 de agosto de 2026 bajo Apache 2.0, distribuido cuantizado a 4 bits para que quepa en menos de 20 GB de memoria y funcione en una sola GPU de consumo con la red desconectada. La forma correcta de leer este emparejamiento no es "cuál es más inteligente". Es "cuál de las dos restricciones — capacidad o perímetro — es la que tu carga de trabajo no puede mover."
La comparación también es un correctivo útil para un hábito que ha adoptado este mercado: tratar la puntuación de un índice compuesto como todo el valor de un modelo. La brecha de veintisiete puntos es real y no es el único número en el archivo. En recuperación de contexto largo, el mismo panel independiente sitúa a Muse Glimmer a menos de medio punto de modelos de pesos abiertos de una categoría de peso mucho mayor, y los propios benchmarks agénticos de Meta son respetables para un modelo que se ejecuta en una laptop. Mientras tanto, la debilidad más citada de Step 5 Preview no es la capacidad en absoluto, sino la verbosidad, y permanece cerrado hasta que lleguen sus pesos prometidos el 15 de octubre.
Dos modelos, dos objetos completamente diferentes
Step 5 Preview es un sistema de mezcla de expertos servido desde la infraestructura de StepFun: unos 600 000 millones de parámetros totales, 27 000 millones activos por token, entrada de texto e imagen, una ventana de contexto de 1 millón de tokens y una puntuación independiente de 44 en el Intelligence Index frente a una mediana de 26 entre modelos comparables. Su salida funciona a 87 tokens por segundo frente a una media de 78 en la medición de ese mismo ranking, y generó unos 160 millones de tokens de salida en el conjunto de tareas del índice, donde el modelo mediano emite unos 82 millones — aproximadamente el doble de texto por unidad de trabajo, facturado a 2,70 $ por millón. Los pesos BF16 se prometieron para el 15 de octubre de 2026 y aún no están en el repositorio, así que hoy el modelo existe para ti solo como una API.
Muse Glimmer es el objeto opuesto. Es un modelo de 30B parámetros entrenado mediante destilación de logits a partir del maestro Muse Spark, más grande, de Meta, y luego ajustado con datos agénticos de contexto largo y reforzado para el uso de herramientas. Meta lo distribuye cuantizado a 4 bits, lo que reduce la memoria de más de 55 GB en precisión completa a menos de 20 GB —dentro de un límite de VRAM de 24 GB o 32 GB— y fue probado por Meta en una Nvidia RTX 5090 y en silicio Apple M4 Max y M5 Max. Acepta entrada de texto e imágenes en más de cien idiomas, admite un contexto de 131.072 tokens ampliable a 262.144, y está diseñado para tomar un objetivo, dividirlo en pasos, llamar a herramientas y reintentar una llamada fallida en lugar de detenerse. Es Apache 2.0, y funciona sin conexión.
• Puntuación independiente — Step 5 Preview: 44 frente a una mediana de 26 en su clase vs. Muse Glimmer: 17 en el mismo índice en su configuración alta.
• Escala — Vista previa de Step 5: alrededor de 600B en total, 27B activos por StepFun frente a Muse Glimmer: 30B en total, cuantizado a 4 bits por debajo de 20 GB.
• Ventana de contexto — Step 5 Preview: 1M tokens vs Muse Glimmer: 131,072 ampliables a 262,144, según Meta.
• Precio — Step 5 Preview: $1.00 de entrada / $2.70 de salida por millón de tokens, publicado frente a Muse Glimmer: sin cargo por token; tú aportas la GPU.
• Dónde se ejecuta — Vista previa del paso 5: los servidores del proveedor, a través de HTTP frente a Muse Glimmer: tu propio hardware, sin conexión.
• Licencia — Step 5 Preview: vista previa cerrada, pesos prometidos para el 15 de octubre de 2026 vs Muse Glimmer: Apache 2.0, descargable ya.
• Recuperación de contexto largo — Muse Glimmer obtiene 80,0 en la evaluación de razonamiento de contexto largo del índice, a medio punto de modelos que cuestan varias veces más que su gama de precio y lo bastante cerca de la lectura de Step 5 Preview como para que la diferencia no sea relevante a la hora de decidir en tareas de búsqueda de datos concretos.
Los veintisiete puntos, y lo que no miden
Un modelo de 30B destilado para ejecutarse en 20 GB de memoria va a perder frente a un modelo insignia de 600B en un índice de inteligencia general, y el propio material de Meta no afirma lo contrario: una de sus formulaciones dice sin rodeos que Glimmer no está diseñado para igualar la potencia de razonamiento bruta de los modelos en la nube a escala completa. Así que la puntuación de 17 no es un veredicto sobre la ingeniería; es el resultado esperado de sopesar un objetivo diferente. La pregunta correcta es cuáles de tus tareas cubre realmente esa brecha.
La lectura de contexto largo es donde ambos se acercan más y donde la intuición falla. Muse Glimmer obtiene 80,0 en la evaluación de razonamiento de contexto largo del ranking, una puntuación que no tendría nada de notable para un modelo de frontera y que sí es notable para uno que se ejecuta en una GPU de consumo. Si tu carga de trabajo consiste en recuperación, resumen o extracción sobre documentos largos, un modelo local a ese nivel no es obviamente la herramienta equivocada, y el hecho de que la solicitud nunca salga de tu máquina es una característica que no puedes comprarle a una API a ningún precio.
Luego está la parte de la comparación que los números de Meta no muestran. Un estudio revisado por pares sobre orquestación multiagente probó Muse-Glimmer-30B en un entorno controlado —misma tarea, mismo banco de pruebas, mismos consultores— y descubrió que no recuperó ninguno de los candidatos producidos por modelos frontera más grandes, fallando en los tres intentos en cada configuración. Eso es un único estudio de una sola configuración, y es el tipo de evidencia que una página de modelo nunca expone. Para los pipelines agénticos en los que un orquestador más débil tiene que recuperarse del fallo de un modelo más fuerte, es el resultado más relevante para la toma de decisiones en este artículo, y vale la pena leerlo antes que cualquiera de los benchmarks reportados por el proveedor de Meta.
Esos benchmarks, para que conste, son propios de Meta y no han sido reproducidos: 76,0 % en SWE-Bench Verified, 51,2 % en SWE-Bench Pro, 51,7 % en TerminalBench 2.1, 65,9 % en OSWorld-Verified, 83,5 % en GPQA Diamond, 22 % en Humanity's Last Exam y 75,5 en MCP-Atlas. Se miden frente a modelos de su misma clase de tamaño y describen a un agente local capaz, más que a un razonador de frontera.

Dónde cae realmente el límite
La ventaja estructural de Step 5 Preview es que hace el trabajo que no puedes hacer localmente. Un contexto de 1M de tokens, entrada de imágenes, una puntuación medida cercana a la frontera y 87 tokens de salida por segundo sin hardware que comprar: para redactar borradores, planificar, revisar código en un repositorio grande o cualquier cosa en la que el techo del modelo sea el cuello de botella, la API gana y los veintisiete puntos son todo el argumento. El coste de eso es lo opuesto al de Muse Glimmer: los prompts salen de tu perímetro, el precio se vuelve a aplicar en cada token y la verbosidad del modelo hace que las cargas de trabajo de salida larga sean más caras de lo que sugiere la tarifa de $2.70.

La ventaja de Muse Glimmer es que hace el trabajo que no puede salir. Si los datos están regulados, si el presupuesto de latencia es de unos pocos milisegundos, si la máquina está sin conexión o si el coste marginal de la millonésima solicitud tiene que ser cero, entonces ninguna API es candidata — ni esta, ni ninguna. El precio de eso es la capacidad: estás eligiendo un 17 donde existe un 44, y en la orquestación agéntica puede que estés eligiendo un coordinador que no puede recuperarse de los errores de un modelo más fuerte.
Para la mayoría de los equipos, la respuesta no es una elección, sino una división, y esa división necesita un lugar donde vivir. OrcaRouter enruta más de 200 modelos detrás de una sola clave de API y una sola factura con un 0% de margen y el precio de lista del proveedor repercutido tal cual, además de conmutación automática por error y un DSL de enrutamiento para enviar tráfico según tarea, coste o latencia. Ni Step 5 Preview ni Muse Glimmer están en ese catálogo —el buque insignia de StepFun no lo enrutamos nosotros y Glimmer es una descarga local—, así que el valor que se ofrece no es el acceso a ninguno de los dos modelos. Es el conjunto con el que los compararías, invocable con una sola clave hoy, para que la decisión entre local y remoto la determine tu propia distribución de tareas en lugar de la página del proveedor que hayas leído por última vez.

Cómo decidir
Elige Step 5 Preview cuando el techo sea la restricción. Si tus tareas son de final abierto, multimodales, de contexto largo o agénticas en el sentido de necesitar un planificador capaz, el modelo de API es el único de los dos que puede hacerlas, y su precio es lo bastante bajo para su clase como para que pilotarlo sea una partida presupuestaria y no un proyecto. Presupuesta la verbosidad, prevé que la fecha de lanzamiento de los pesos del 15 de octubre se retrase y deja fuera de ello las cargas de trabajo que no deben salir del edificio.
Elige Muse Glimmer cuando el perímetro sea la restricción. Si tus datos no se pueden enviar, si necesitas ejecutarlo en un avión o en una fábrica, o si tus volúmenes hacen que el precio por token sea absurdo, un modelo de 30B con Apache-2.0 que cabe en 20 GB es la opción práctica, y su resultado de recuperación de contexto largo es lo bastante bueno como para que la brecha de capacidades no se note en cada carga de trabajo. Pruébalo en orquestación antes de confiar en él ahí, porque ahí es donde la evidencia independiente es más débil.
Si ambas restricciones se aplican a la vez, ejecuta ambas: local para los datos que no pueden moverse, API para las tareas que necesitan un modelo más grande, y deja que la decisión de enrutamiento sea un cambio de configuración en lugar de una migración. La comparación que importa no es 44 frente a 17. Es cuáles de tus solicitudes pueden permitirse salir de la máquina, y esa es una pregunta que solo tu propio tráfico puede responder.
