Carte de comparaison à deux colonnes générée, intitulée « Step 5 Preview vs Intern-S2 Mobius », avec le sous-titre « Un flagship de 600B que vous louez, ou un raisonneur de 35B que vous exécutez ». La carte de gauche, « Step 5 Preview », indique : AA Index 44 (mesuré) ; environ 600B au total / 27B actifs ; contexte de 1M de tokens ; 1,00 $ en entrée / 2,70 $ en sortie par 1M ; API de préversion fermée ; poids promis pour le 15 octobre 2026. La carte de droite, « Intern-S2 Mobius », indique : aucun score indépendant ; 35B paramètres ; contexte non publié ; pas de prix d'API, auto-hébergement ; Apache 2.0 disponible dès maintenant ; accélération d'environ 4x annoncée, non reproduite. Un pied de page indique : « Les chiffres de Step 5 Preview proviennent de StepFun et Artificial Analysis ; les chiffres d'Intern-S2 Mobius sont des affirmations d'InternLM, non reproduites. »
Engineering & Research

Step 5 Preview vs Intern-S2 Mobius : avez-vous besoin d'un modèle phare de 600B, ou d'un raisonneur rapide de 35B ?

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La raison honnête de comparer Step 5 Preview avec Intern-S2 Mobius n'est pas qu'ils se ressemblent. C'est qu'ils sont les réponses à deux questions différentes du même acheteur — l'équipe qui a une charge de travail de raisonnement à exécuter et aucune envie d'acheter un cluster. Le modèle de StepFun, à savoir le Step 5 Preview, annoncé le 20 septembre 2026, est la grande réponse : environ 600 milliards de paramètres totaux avec 27 milliards actifs, un contexte de 1 M de tokens, un score de 44 à l'Artificial Analysis Intelligence Index, mesuré indépendamment, et un prix publié de 1,00 $ par million de tokens d'entrée et de 2,70 $ par million de tokens de sortie. Le modèle d'InternLM, à savoir l'Intern-S2 Mobius, publié le 29 juillet 2026, est la petite réponse : un modèle à poids ouverts de 35 milliards de paramètres construit sur l'architecture Mobius-v0, pré-entraîné en continu à partir de Qwen3.5-35B, dont l'argument central n'est pas la capacité mais la vitesse — environ une accélération de bout en bout de 4x sur les benchmarks de raisonnement par rapport à la base de référence à partir de laquelle il a été entraîné, sans aucun score de benchmark indépendant, quel qu'il soit. L'un est un modèle phare que vous louez ; l'autre est un petit modèle que vous exécutez. La comparaison porte vraiment sur la question de savoir si la charge de travail qui vous attend justifie du tout le modèle phare.

Un point de clarification avant les chiffres, car cela fait perdre du temps réel aux gens : InternLM a publié des modèles sous la bannière Intern-S2, et ce ne sont pas les mêmes choses. Intern-S2-397B est le fleuron multimodal ; Intern-S2 Mobius est le raisonneur efficace de 35B dont il est question ici ; une version antérieure d’Intern-S2 est encore un modèle distinct. Si vous recherchez « Intern-S2 » et tombez sur des tableaux de benchmarks pour un modèle de 397B, vous lisez des informations sur un autre checkpoint.

Ce que chaque modèle prétend.

Les affirmations de Step 5 Preview sont conventionnelles pour un modèle phare de 2026, et l’une d’elles est vérifiée de manière indépendante. StepFun annonce environ 600 milliards de paramètres au total avec 27 milliards actifs, une entrée texte et image, une fenêtre de contexte d’un million de tokens, et un prix de 1,00 $/2,70 $ par million de tokens d’entrée et de sortie. Artificial Analysis le mesure à 44 sur son Intelligence Index, au-dessus d’une médiane de 26 pour les modèles comparables, avec un débit de sortie de 87 tokens par seconde contre une moyenne de 78, et environ 160 millions de tokens de sortie générés sur l’ensemble des tâches de l’indice contre une médiane de 82 millions — soit environ le double de l’empreinte verbeuse typique, ce qui compte pour un modèle facturé à la sortie.

L’affirmation d’Intern-S2 Mobius est d’ordre architectural et plus étroite. Sa conception sépare la connaissance du calcul : une mémoire partagée globalement contient des vecteurs de connaissances, et plusieurs raisonneurs interrogent et affinent itérativement des états cachés par rapport à elle, au lieu de lier le stockage et le calcul couche par couche comme le fait un transformeur classique. Le bénéfice annoncé par InternLM est une accélération de bout en bout d’environ 4x sur les benchmarks de raisonnement par rapport au Qwen3.5-35B dont il descend, avec des scores de raisonnement comparables ou supérieurs, ainsi que des chaînes de pensée visibles plus courtes. Le modèle est sous Apache 2.0, accepte du texte et des images en entrée, et il est téléchargeable.

• Échelle — Step 5 Preview : environ 600 B au total, 27 B actifs selon StepFun, contre Intern-S2 Mobius : 35 B au total.

• Score indépendant — Step 5 Preview : 44 sur l’Artificial Analysis Intelligence Index vs Intern-S2 Mobius : aucun publié par un tiers.

• Vitesse — Step 5 Preview : 87 jetons de sortie par seconde contre une moyenne de 78, mesuré par le classement de l’indice face à Intern-S2 Mobius : « près de 4x » par rapport à sa propre référence Qwen3.5-35B, rapporté par le fournisseur et non reproduit.

• Fenêtre de contexte — Step 5 Preview : 1 M de tokens selon StepFun vs Intern-S2 Mobius : aucune valeur de contexte indépendante publiée.

• Prix — Step 5 Preview : 1,00 $ en entrée / 2,70 $ en sortie par million de tokens, contre Intern-S2 Mobius : pas de tarif d'API ; vous payez le matériel.

• Licence et accès — Step 5 Preview : aperçu fermé via l’API du fournisseur, poids BF16 promis pour le 15 octobre 2026 vs Intern-S2 Mobius : poids Apache 2.0 disponibles dès maintenant.

• Verbosité — Step 5 Preview : environ 160 M de tokens de sortie sur la suite d’index contre une médiane de 82 M, selon le tableau de bord de l’index face à Intern-S2 Mobius : des traces de raisonnement visibles plus courtes revendiquées par InternLM, non mesurées par quiconque d’autre.

L’affirmation du 4x, et pourquoi c’est le nombre intéressant ici

Lisez les chiffres des deux fournisseurs côte à côte et le décalage est évident : le chiffre phare de StepFun est un score de capacité, celui d'InternLM est un multiplicateur de débit. Ce n'est pas une coïncidence, et c'est la chose la plus utile dans cette comparaison. Un gain de vitesse de 4x de bout en bout sur des tâches de raisonnement, s'il survit au contact du harnais de quelqu'un d'autre, vaut plus pour un déploiement à fort volume que quelques points sur un indice — cela change tout simplement l'arithmétique de l'exécution de la charge de travail. Intern-S2 Mobius vise les équipes dont le goulot d'étranglement est le nombre de jetons par seconde par dollar, et non la capacité de pointe.

La réserve est que le multiplicateur est mesuré par rapport à Qwen3.5-35B, le modèle à partir duquel Intern-S2 Mobius a été pré-entraîné de manière continue, qui n’a jamais bénéficié de l’entraînement Mobius. Il s’agit d’une comparaison avec son propre point de départ plutôt qu’avec un rival. Il n’existe aucune reproduction indépendante de l’affirmation sur le débit, aucun score d’indice tiers et aucune fenêtre de contexte publiée par quiconque d’autre que le fournisseur. Considérez « près de 4x » comme un signal architectural intéressant et une hypothèse à tester sur votre propre banc d’essai, et non comme une spécification.

Step 5 Preview présente un profil de preuves opposé. Son score de capacité est mesuré indépendamment ; son histoire d’efficacité est le point faible. La lecture de verbosité du tableau d’indices — environ 160 millions de jetons de sortie là où le modèle médian en émet environ 82 millions — est le contrepoids honnête à un prix de sortie de 2,70 $, et cela signifie qu’une charge de travail qui repose sur de longues générations structurées dépensera sensiblement plus que ne le suggère le prix affiché. Ce qu’il possède en revanche, et qu’Intern-S2 Mobius n’a pas, c’est un prix d’API publié, tout simplement, ce qui le rend comparable en premier lieu.

Le dépôt Hugging Face de la build fournisseur promise raconte l'autre moitié de l'histoire : voici à quoi ressemble une publication à poids ouverts lorsqu'elle a été annoncée mais pas encore livrée.

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

Là où la question de l’empreinte fait vraiment mal

Le véritable avantage d’Intern-S2 Mobius n’est pas son score, que personne n’a mesuré, mais le coût que représente le fait de se tromper à son sujet. Trente-cinq milliards de paramètres, c’est une taille qu’une équipe peut exploiter sur du matériel qu’elle possède déjà, évaluer sans bon de commande et abandonner sans rien passer en perte. C’est un avantage structurel que le modèle phare ne peut égaler, quel que soit le nombre de points qu’il obtient, et c’est la raison pour laquelle cette comparaison vaut la peine d’être faite plutôt que d’être rejetée comme une comparaison déséquilibrée.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

L'avantage du modèle phare est exactement l'inverse. Le contexte de 1 M de tokens de Step 5 Preview, son entrée d'images et sa capacité de raisonnement général mesurée couvrent un travail qu'un modèle 35B est peu susceptible de couvrir correctement, et il n'en coûte rien de l'essayer pendant toute la durée d'une fenêtre gratuite — le modèle a été gratuit sur trois surfaces développeur distinctes au cours du mois d'octobre. Aucun de ces faits n'est disponible pour un modèle auto-hébergé : il n'y a pas de semaine gratuite pour faire tourner ses propres GPU, et il n'y a pas de grille tarifaire qui transforme la décision en ligne de coût.

Si vous voulez que la comparaison survive au-delà de la fenêtre promotionnelle, ce qu'il faut construire, c'est un harnais plutôt qu'une préférence. OrcaRouter achemine plus de 200 modèles derrière une seule clé API et une seule facture à 0 % de marge, avec le prix catalogue du fournisseur répercuté tel quel, avec basculement automatique et un DSL de routage pour orienter le trafic selon le coût, la latence ou les capacités. Ni Step 5 Preview ni Intern-S2 Mobius ne figurent dans ce catalogue — le modèle phare de StepFun n'est pas acheminé par nous et Intern-S2 Mobius est un téléchargement à auto-héberger — donc la valeur ici n'est pas l'accès à l'un ou l'autre. C'est que les modèles par rapport auxquels vous les évaluerez sont à portée d'une clé, et une décision fondée sur des mesures évolue avec les preuves plutôt qu'avec un article de blog de lancement.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Comment décider

Si votre charge de travail est agentique, multimodale, à long contexte ou ouverte — le genre où vous ne pouvez pas énumérer les tâches à l’avance —, le modèle phare est la solution, et Step 5 Preview en est une instance raisonnable : mesuré, tarifé, peu coûteux à tester et réversible au token. Prévoyez simplement un budget pour la verbosité plutôt que pour le tarif affiché.

Si votre charge de travail consiste en un raisonnement étroit, répétitif et à gros volume sur des données qui doivent rester à l’intérieur de votre périmètre, le petit modèle est la solution, et Intern-S2 Mobius est un candidat crédible précisément parce qu’il est petit : il tourne sur le matériel dont vous disposez, il est sous Apache 2.0, et l’affirmation de vitesse, si elle tient, est le genre d’élément qui tranche une question d’économie unitaire. Lancez-vous en sachant que vous testez l’affirmation du fournisseur plutôt que d’hériter du verdict de quelqu’un d’autre.

L’erreur est de considérer ce choix comme définitif. Achetez d’abord l’évaluation du petit modèle, car c’est l’expérience bon marché ; louez le modèle phare pour les tâches où le petit modèle échoue, car c’est la réparation bon marché. Les équipes qui maintiennent les deux options actives sur la même clé et le même harnais finissent par prendre cette décision avec leurs propres données, et c’est la seule version de ce choix qui tient la route lorsque l’un ou l’autre fournisseur lance un successeur.