Tarjeta comparativa de dos columnas generada con el encabezado 'Step 5 Preview vs Intern-S2 Mobius' y el subtítulo 'Un modelo insignia de 600B que alquilas, o un razonador de 35B que ejecutas'. La tarjeta izquierda, 'Step 5 Preview', dice: AA Index 44 (medido); alrededor de 600B en total / 27B activos; contexto de 1M de tokens; $1.00 de entrada / $2.70 de salida por 1M; API de vista previa cerrada; pesos prometidos para el 15 de octubre de 2026. La tarjeta derecha, 'Intern-S2 Mobius', dice: sin puntuación independiente; 35B de parámetros; contexto no publicado; sin precio de API, autoalojamiento; Apache 2.0 disponible ahora; se afirma una aceleración de aproximadamente 4x, no reproducida. Un pie de página dice: 'Las cifras de Step 5 Preview son según StepFun y Artificial Analysis; las cifras de Intern-S2 Mobius son afirmaciones de InternLM, no reproducidas.'
Engineering & Research

Step 5 Preview vs Intern-S2 Mobius: ¿Necesitas un buque insignia de 600B o un razonador rápido de 35B?

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La razón sincera para comparar Step 5 Preview con Intern-S2 Mobius no es que sean similares. Es que son respuestas a dos preguntas distintas del mismo comprador: el equipo que tiene una carga de trabajo de razonamiento que ejecutar y ningún interés en comprar un clúster. De StepFun: Step 5 Preview, anunciado el 20 de septiembre de 2026, es la respuesta grande: aproximadamente 600 mil millones de parámetros totales con 27 mil millones activos, un contexto de 1M de tokens, una puntuación de 44 en el Artificial Analysis Intelligence Index medida de forma independiente, y un precio publicado de $1.00 por millón de tokens de entrada y $2.70 por millón de tokens de salida. De InternLM: Intern-S2 Mobius, lanzado el 29 de julio de 2026, es la respuesta pequeña: un modelo de pesos abiertos de 35 mil millones de parámetros construido sobre la arquitectura Mobius-v0, preentrenado de forma continua a partir de Qwen3.5-35B, cuya afirmación central no es la capacidad sino la velocidad —aproximadamente 4 veces más rápido de extremo a extremo en benchmarks de razonamiento frente a la base desde la que fue entrenado, sin ninguna puntuación de benchmark independiente de ningún tipo. Uno es un buque insignia que alquilas; el otro es un modelo pequeño que ejecutas. En realidad, la comparación se reduce a si la carga de trabajo que tienes delante justifica siquiera el buque insignia.

Una nota previa antes de las cifras, porque hace perder tiempo real a la gente: InternLM ha lanzado varios modelos bajo la marca Intern-S2, y no son lo mismo. Intern-S2-397B es el buque insignia multimodal científico; Intern-S2 Mobius es el razonador eficiente de 35B del que se habla aquí; una versión anterior de Intern-S2 es, de nuevo, un modelo distinto. Si buscas "Intern-S2" y acabas en tablas de benchmark de un modelo de 397B, estás leyendo sobre un checkpoint diferente.

Lo que cada modelo afirma realmente

Las afirmaciones de Step 5 Preview son las convencionales para un buque insignia de 2026, y una de ellas se verifica de forma independiente. StepFun indica unos 600B de parámetros totales con 27B activos, entrada de texto e imágenes, una ventana de contexto de 1M de tokens, y un precio de $1.00/$2.70 por millón de tokens de entrada y salida. Artificial Analysis lo mide en 44 en su Intelligence Index, por encima de una mediana de 26 de modelos comparables, con una salida de 87 tokens por segundo frente a un promedio de 78 y alrededor de 160 millones de tokens de salida generados en el conjunto de tareas del índice frente a una mediana de 82 millones — aproximadamente el doble de la huella verbosa típica, lo que importa en un modelo facturado por salida.

La afirmación de Intern-S2 Mobius es arquitectónica y más acotada. Su diseño separa el conocimiento de la computación: una Memoria compartida globalmente almacena vectores de conocimiento, y múltiples Razonadores consultan y refinan iterativamente estados ocultos contra ella, en lugar de vincular almacenamiento y computación capa por capa como lo hace un transformer convencional. El beneficio declarado por InternLM es una aceleración de extremo a extremo de aproximadamente 4x en benchmarks de razonamiento frente a Qwen3.5-35B del que desciende, con puntuaciones de razonamiento comparables o superiores, además de cadenas de pensamiento visibles más cortas. El modelo es Apache 2.0, admite entrada de texto e imágenes y se puede descargar.

• Escala — Step 5 Preview: unos 600B en total, 27B activos según StepFun frente a Intern-S2 Mobius: 35B en total.

• Puntuación independiente — Step 5 Preview: 44 en el Artificial Analysis Intelligence Index frente a Intern-S2 Mobius: ninguna publicada por ningún tercero.

• Velocidad — Step 5 Preview: 87 tokens de salida por segundo frente a un promedio de 78, medido por el tablero de índices vs Intern-S2 Mobius: "casi 4x" frente a su propia línea base Qwen3.5-35B, reportado por el proveedor y no reproducido.

• Ventana de contexto — Step 5 Preview: 1M de tokens por StepFun frente a Intern-S2 Mobius: no se ha publicado una cifra de contexto independiente.

• Precio — Step 5 Preview: $1.00 de entrada / $2.70 de salida por millón de tokens frente a Intern-S2 Mobius: sin precio de API; pagas por el hardware.

• Licencia y acceso — Step 5 Preview: vista previa cerrada mediante la API del proveedor, pesos BF16 prometidos para el 15 de octubre de 2026 frente a Intern-S2 Mobius: pesos Apache 2.0 disponibles ahora.

• Verbosidad — Vista previa de Step 5: alrededor de 160M de tokens de salida en toda la suite de índices frente a una mediana de 82M, según el tablero de índices en comparación con Intern-S2 Mobius: trazas de razonamiento visibles más cortas según lo afirmado por InternLM, no medidas por nadie más.

La afirmación de 4x, y por qué ese es el número interesante aquí

Lee las cifras de los dos proveedores en paralelo y la discrepancia es obvia: el titular de StepFun es una puntuación de capacidad; el de InternLM, un multiplicador de rendimiento. Eso no es una coincidencia, y es lo más útil de esta comparación. Una aceleración de 4x de extremo a extremo en tareas de razonamiento, si sobrevive al contacto con el harness de otro, vale más para un despliegue de gran volumen que unos pocos puntos en un índice: cambia la aritmética de ejecutar la carga de trabajo, o incluso de poder ejecutarla. Intern-S2 Mobius apunta a equipos cuyo cuello de botella son los tokens por segundo por dólar, no la capacidad máxima.

La salvedad es que el multiplicador se mide en relación con Qwen3.5-35B, el modelo a partir del cual se preentrenó de forma continua Intern-S2 Mobius, que nunca recibió el entrenamiento de Mobius. Es una comparación contra su propio punto de partida en lugar de contra un rival. No hay una reproducción independiente de la afirmación sobre el rendimiento, ni una puntuación de índice de terceros, ni una ventana de contexto publicada por nadie que no sea el proveedor. Trata «casi 4x» como una señal arquitectónica interesante y una hipótesis para probar en tu propio entorno de pruebas, no como una especificación.

Step 5 Preview tiene el perfil probatorio opuesto. Su cifra de capacidad se mide de forma independiente; su relato de eficiencia es la parte débil. La lectura de verbosidad del índice —unos 160 millones de tokens de salida, frente a los aproximadamente 82 millones que emite el modelo mediano— es el contrapeso honesto a un precio de salida de $2.70, y significa que una carga de trabajo que dependa de generaciones estructuradas largas gastará bastante más de lo que sugiere el precio de etiqueta. Lo que sí tiene y Intern-S2 Mobius no es un precio de API publicado, que es lo que lo hace comparable en primer lugar.

El repositorio de Hugging Face para la compilación del proveedor prometida cuenta la otra mitad de la historia: así es como se ve un lanzamiento de pesos abiertos cuando se ha anunciado pero aún no se ha publicado.

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

Donde la cuestión de la huella realmente importa

La verdadera ventaja de Intern-S2 Mobius no es su puntuación, que nadie ha medido, sino lo que cuesta equivocarse al respecto. Treinta y cinco mil millones de parámetros es un tamaño que un equipo puede servir en hardware que ya posee, evaluar sin una orden de compra y abandonar sin amortizar nada. Esa es una ventaja estructural que el buque insignia no puede igualar, por muchos puntos que obtenga, y es la razón por la que vale la pena hacer esta comparación en lugar de descartarla como un emparejamiento desigual.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

La ventaja del buque insignia es la imagen especular. El contexto de 1M tokens, la entrada de imágenes y la capacidad de razonamiento general medida de Step 5 Preview cubren trabajo que un modelo de 35B probablemente no cubriría bien, y no cuesta nada probarlo durante una ventana gratuita: el modelo ha sido gratuito en tres superficies de desarrollador distintas durante octubre. Ninguno de esos hechos está disponible para un modelo autoalojado: no hay una semana gratuita para ejecutar tus propias GPU, y no hay una lista de precios que convierta la decisión en una partida presupuestaria.

Si quieres que la comparación sobreviva más allá de la ventana promocional, lo que hay que construir es un banco de pruebas, no una preferencia. OrcaRouter enruta más de 200 modelos detrás de una sola clave de API y una sola factura, con un 0% de margen y el precio de lista del proveedor trasladado sin cambios, con conmutación por error automática y un DSL de enrutamiento para dirigir el tráfico según coste, latencia o capacidad. Ni Step 5 Preview ni Intern-S2 Mobius están en ese catálogo —el buque insignia de StepFun no lo enrutamos nosotros e Intern-S2 Mobius es una descarga autoalojada—, así que el valor aquí no es el acceso a ninguno de los dos. Es que los modelos con los que los compararás están a una sola clave de distancia, y una decisión tomada a partir de mediciones se mueve con la evidencia en lugar de con una entrada de blog de lanzamiento.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Cómo decidir

Si tu carga de trabajo es agéntica, multimodal, de contexto largo o abierta —del tipo en el que no puedes enumerar las tareas de antemano—, el modelo insignia es la respuesta, y Step 5 Preview es una instancia razonable de él: medido, con precio, barato de pilotar y reversible por token. Solo presupuesta la verbosidad en lugar de la tarifa anunciada.

Si tu carga de trabajo es de razonamiento acotado, repetitivo y de gran volumen sobre datos que tienen que permanecer dentro de tu perímetro, el modelo pequeño es la respuesta, e Intern-S2 Mobius es un candidato genuino precisamente porque es pequeño: se ejecuta en hardware que ya tienes, es Apache 2.0 y la afirmación sobre la velocidad, si se sostiene, es el tipo de cosa que decide una cuestión de economía unitaria. Entra sabiendo que estás poniendo a prueba la afirmación del proveedor en lugar de heredar el veredicto de otra persona.

El error es tratar la elección como permanente. Compra primero la evaluación del modelo pequeño, porque es el experimento barato; alquila el modelo insignia para las tareas en las que el modelo pequeño falla, porque esa es la reparación barata. Los equipos que mantienen vivas ambas opciones con la misma clave y el mismo arnés terminan tomando esta decisión con sus propios datos, y esa es la única versión que se sostiene cuando cualquiera de los dos proveedores lanza un sucesor.