
Step 5 Preview vs Muse Glimmer : l'API Frontier et le modèle pour ordinateur portable
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Sur un classement, Step 5 Preview et Muse Glimmer ne sont pas proches : 44 contre 17 sur l'Artificial Analysis Intelligence Index — un écart de vingt-sept points sur une échelle dont le leader actuel se situe dans la cinquantaine haute — qu'aucun réglage, aussi poussé soit-il, ne pourra combler. Sur la question à laquelle une équipe doit réellement répondre — où tournent mes tokens — ils sont des concurrents directs. Step 5 Preview est le produit phare de StepFun, annoncé le 20 septembre 2026, environ 600 milliards de paramètres au total, dont 27 milliards actifs, un contexte de 1 M de tokens, au prix de 1,00 $ par million de tokens d'entrée et de 2,70 $ par million de tokens de sortie, et accessible uniquement via un réseau. Muse Glimmer est le modèle agentique à poids ouverts de 30 milliards de paramètres de Meta Superintelligence Labs, publié le 10 août 2026 sous Apache 2.0, livré quantifié en 4 bits afin qu'il tienne en dessous de 20 Go de mémoire et fonctionne sur un seul GPU grand public avec le réseau débranché. La bonne façon de lire cette paire n'est pas « lequel est le plus intelligent ». C'est « laquelle des deux contraintes — la capacité ou le périmètre — est celle que votre charge de travail ne peut pas faire bouger. »
Cette comparaison constitue aussi un correctif utile à une habitude prise par ce marché : considérer le score d’un indice composite comme toute la valeur d’un modèle. L’écart de vingt-sept points est réel, et ce n’est pas le seul chiffre du dossier. En récupération à long contexte, le même classement indépendant place Muse Glimmer à moins d’un demi-point de modèles à poids ouverts d’une classe de taille bien supérieure, et les propres benchmarks agentiques de Meta sont respectables pour un modèle qui tourne sur un ordinateur portable. Quant à Step 5 Preview, sa faiblesse la plus citée n’est pas du tout la capacité mais la verbosité, et il est fermé jusqu’à l’arrivée de ses poids promis le 15 octobre.
Deux modèles, deux objets entièrement différents
Step 5 Preview est un système de mélange d'experts servi depuis l'infrastructure de StepFun : environ 600 B de paramètres au total, 27 B actifs par token, entrée texte et image, une fenêtre de contexte d'un million de tokens, et un score indépendant à l'Intelligence Index de 44, contre une médiane de 26 pour les modèles comparables. Son débit de sortie atteint 87 tokens par seconde, contre une moyenne de 78 selon la mesure de ce même classement, et il a généré environ 160 millions de tokens de sortie sur l'ensemble des tâches de l'indice, là où le modèle médian en produit environ 82 millions — soit à peu près le double de texte par unité de travail, facturé à 2,70 $ le million. Les poids BF16 ont été promis pour le 15 octobre 2026 et ne sont pas encore dans le dépôt ; aujourd'hui, le modèle n'existe donc pour vous que sous forme d'API.
Muse Glimmer est l'objet opposé. C'est un modèle de 30 milliards de paramètres entraîné par distillation de logits à partir du plus grand modèle enseignant Muse Spark de Meta, puis affiné sur des données agentiques à contexte long et renforcé pour l'utilisation d'outils. Meta le livre quantifié en 4 bits, ce qui fait passer la mémoire de plus de 55 Go en pleine précision à moins de 20 Go — dans une enveloppe de 24 Go ou 32 Go de VRAM — et il a été testé par Meta sur une Nvidia RTX 5090 ainsi que sur les puces Apple M4 Max et M5 Max. Il accepte des entrées texte et image dans plus d'une centaine de langues, prend en charge un contexte de 131 072 jetons extensible à 262 144, et est conçu pour prendre un objectif, le décomposer en étapes, appeler des outils et réessayer un appel échoué plutôt que de s'arrêter. Il est sous Apache 2.0 et fonctionne hors ligne.
• Score indépendant — Step 5 Preview : 44 contre une médiane de 26 dans sa catégorie ; face à Muse Glimmer : 17 sur le même indice dans sa configuration haut de gamme.
• Échelle — Step 5 Preview : environ 600 Md au total, 27 Md actifs pour StepFun vs Muse Glimmer : 30 Md au total, quantisé en 4 bits sous 20 Go.
• Fenêtre de contexte — Step 5 Preview : 1 M de tokens contre Muse Glimmer : 131 072, extensible à 262 144, selon Meta.
• Prix — Step 5 Preview : 1,00 $ en entrée / 2,70 $ en sortie par million de tokens, publiés, contre Muse Glimmer : aucun frais par token ; c'est vous qui fournissez le GPU.
• Où cela s'exécute — Aperçu de l'étape 5 : les serveurs du fournisseur, via HTTP vs Muse Glimmer : votre propre matériel, hors ligne.
• Licence — Step 5 Preview : aperçu fermé, poids promis pour le 15 octobre 2026 vs Muse Glimmer : Apache 2.0, téléchargeable dès maintenant.
• Récupération à long contexte — Muse Glimmer obtient 80,0 à l’évaluation du raisonnement à long contexte du tableau de classement, à moins d’un demi-point de modèles dont la classe de prix est plusieurs fois supérieure à la sienne et suffisamment proche de la lecture de Step 5 Preview pour que la différence ne soit pas déterminante pour les tâches de recherche de faits.
Les vingt-sept points, et ce qu’ils ne mesurent pas
Un modèle 30B distillé pour tourner dans 20 Go de mémoire va perdre face à un modèle phare de 600B sur un indice d’intelligence générale, et les propres documents de Meta ne prétendent pas le contraire — l’une de leurs formulations affirme sans détour que Glimmer n’est pas conçu pour égaler la puissance de raisonnement brute des modèles à pleine échelle. Le score de 17 n’est donc pas un verdict sur l’ingénierie ; c’est le résultat attendu du fait de privilégier un objectif différent. La bonne question est de savoir lesquelles de vos tâches cet écart couvre réellement.
C'est dans la lecture en contexte long que les deux se rapprochent le plus et que l'intuition s'effondre. Muse Glimmer obtient 80,0 à l'évaluation de raisonnement en contexte long du classement — un score qui passerait inaperçu pour un modèle de pointe et qui est remarquable pour un modèle tournant sur un GPU grand public. Si votre charge de travail consiste en la récupération, le résumé ou l'extraction sur de longs documents, un modèle local à ce niveau n'est pas manifestement le mauvais outil, et le fait que la requête ne quitte jamais votre machine est une fonctionnalité que vous ne pouvez acheter auprès d'aucune API, à aucun prix.
Ensuite, il y a la partie de la comparaison que les chiffres de Meta ne montrent pas. Une étude évaluée par des pairs sur l'orchestration multi-agents a testé Muse-Glimmer-30B dans un environnement contrôlé — même tâche, même harnais, mêmes consultants — et a constaté qu'il n'a récupéré aucun des candidats produits par des modèles frontières plus grands, échouant aux trois tentatives dans chaque configuration. Il s'agit d'une seule étude d'une seule configuration, et c'est le genre de preuve qu'une page de modèle ne met jamais en avant. Pour les pipelines agentiques où un orchestrateur plus faible doit se remettre de l'échec d'un modèle plus fort, c'est le résultat le plus pertinent pour la décision dans cet article, et cela vaut la peine d'être lu avant tous les benchmarks rapportés par Meta.
Pour être complet, ces benchmarks sont ceux de Meta et n’ont pas été reproduits : 76,0 % sur SWE-Bench Verified, 51,2 % sur SWE-Bench Pro, 51,7 % sur TerminalBench 2.1, 65,9 % sur OSWorld-Verified, 83,5 % sur GPQA Diamond, 22 % sur Humanity’s Last Exam et 75,5 sur MCP-Atlas. Ils sont mesurés face à des modèles de sa propre catégorie de taille, et ils décrivent un agent local performant plutôt qu’un raisonneur de pointe.

Où se situe réellement la limite
L’avantage structurel de Step 5 Preview est qu’il accomplit le travail que vous ne pouvez pas faire localement. Un contexte de 1 M de jetons, une entrée d’image, un score mesuré proche de la frontière et 87 jetons de sortie par seconde sans matériel à acheter : pour la rédaction, la planification, la revue de code sur un grand dépôt, ou tout domaine où le plafond du modèle est le goulot d’étranglement, l’API l’emporte et les vingt-sept points constituent tout l’argument. Le coût de cela est l’inverse de celui de Muse Glimmer : les prompts quittent votre périmètre, le prix se réapplique à chaque jeton, et la verbosité du modèle rend les charges de travail à sortie longue plus coûteuses que ne le suggère le tarif de 2,70 $.

L’avantage de Muse Glimmer, c’est qu’il effectue le travail qui ne peut pas sortir. Si les données sont réglementées, si le budget de latence se compte en quelques millisecondes, si la machine est hors ligne, ou si le coût marginal de la millionième requête doit être nul, alors aucune API n’est envisageable — ni celle-ci, ni aucune autre. Le prix à payer, c’est la capacité : vous choisissez un 17 là où un 44 existe, et dans l’orchestration agentique, vous choisissez peut-être un coordinateur incapable de se remettre des erreurs d’un modèle plus fort.
Pour la plupart des équipes, la réponse n'est pas un choix mais une répartition, et cette répartition doit bien se loger quelque part. OrcaRouter achemine plus de 200 modèles derrière une seule clé API et une seule facture, à 0 % de marge, avec le prix catalogue du fournisseur répercuté, ainsi que le basculement automatique et un DSL de routage pour acheminer le trafic selon la tâche, le coût ou la latence. Ni Step 5 Preview ni Muse Glimmer ne figurent dans ce catalogue — le modèle phare de StepFun n'est pas routé par nous et Glimmer est un téléchargement local — donc la valeur proposée n'est pas l'accès à l'un ou l'autre modèle. C'est l'ensemble par rapport auquel vous les compareriez, appelable avec une seule clé dès aujourd'hui, afin que la décision entre local et distant soit tranchée par votre propre répartition des tâches plutôt que par la page du fournisseur que vous avez consultée en dernier.

Comment décider
Choisissez Step 5 Preview lorsque le plafond est la contrainte. Si vos tâches sont ouvertes, multimodales, à long contexte ou agentiques, au sens où elles requièrent un planificateur performant, le modèle API est le seul des deux à pouvoir les accomplir, et son prix est assez bas pour sa catégorie pour que son déploiement pilote relève d'une ligne budgétaire plutôt que d'un projet. Prévoyez du budget pour la verbosité, prévoyez un report de la date du 15 octobre pour la publication des poids, et tenez à l'écart de ce périmètre les charges de travail qui ne doivent pas quitter l'enceinte de l'entreprise.
Choisissez Muse Glimmer lorsque le périmètre est la contrainte. Si vos données ne peuvent pas être envoyées, si vous devez l’exécuter dans un avion ou dans une usine, ou si vos volumes rendent la tarification par token absurde, un modèle 30B Apache-2.0 qui tient dans 20 Go est le choix pratique, et son résultat de récupération à long contexte est suffisamment bon pour que l’écart de capacités n’apparaisse pas dans chaque charge de travail. Testez-le en orchestration avant de lui faire confiance à cet usage, car c’est là que les preuves indépendantes sont les plus faibles.
Si les deux contraintes s'appliquent en même temps, exécutez les deux : en local pour les données qui ne peuvent pas bouger, via l'API pour les tâches qui ont besoin d'un modèle plus grand, et faites de la décision de routage un simple changement de configuration plutôt qu'une migration. La comparaison qui compte n'est pas 44 contre 17. C'est de savoir lesquelles de vos requêtes peuvent se permettre de quitter la machine, et c'est une question à laquelle seul votre propre trafic peut répondre.
