
Aperçu de Step 5 : le modèle phare 600B non annoncé de StepFun figure déjà dans le classement
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Aperçu de Step 5Il occupe un rang dans un classement, a un prix publié, une vitesse de sortie mesurée et un score de 44 à l'Indice d'Intelligence — le même score que Kimi K3, un modèle environ cinq fois plus grand. Ce qui lui manque, c'est un lancement. StepFun ne l'a pas annoncé, la documentation de la plateforme de StepFun elle-même ne le répertorie pas, et il n'y a aucun poids à télécharger. Chaque chiffre ci-dessous provient d'un tiers qui y a eu accès avant que le fournisseur ne dise quoi que ce soit publiquement, ce qui en fait un article « ce que l'on sait à ce stade » plutôt qu'une critique. Lisez ces chiffres comme la preuve de ce qui s'en vient, et non comme une fiche technique.
La fuite, c'est l'histoire
La première trace publique de Step 5 Preview est une exécution d'évaluation. Artificial Analysis dispose d'une page de modèle en direct pour ce dernier, dont le score a été obtenu via l'API propre à StepFun sous l'étiquette de test step-5-preview-b, la plateforme datant le modèle au 18 septembre 2026. C'est de cette page que proviennent le 44, la tarification, la mesure de vitesse et les lignes de benchmark de cet article.
En face, le côté fournisseur est vide. La documentation destinée aux développeurs de StepFun répertorie des modèles jusqu'à Step 3.7 Flash et Step 3.5 Flash, puis s'arrête — aucun step-5, aucune entrée d'aperçu. L'organisation Hugging Face de stepfun-ai n'a pas de dépôt Step 5, ce qui est cohérent avec un modèle phare à poids fermés plutôt qu'avec un oubli. Des signalements de la communauté sur des forums de développeurs chinois évoquent un éventuel dévoilement lors de l'événement AGI Frontier à Shanghai le 19 septembre, soit environ un jour après l'apparition des évaluations. Au moment de la rédaction, personne en dehors de StepFun ne dispose d'une spécification officielle, d'un prix officiel ou d'un nom officiel pour la version commercialisée.
La dénomination elle-même est le premier indice qu'il s'agit d'un aperçu et non d'un lancement. StepFun a entièrement sauté la gamme Step 4.x pour passer à Step 5. Un modèle publié avec un Preview en suffixe, évalué avant même d'avoir une page produit, est un modèle que le fournisseur est encore en train de calibrer — tarification, routage et limites peuvent tous évoluer avant la disponibilité générale.
À quoi ressemble la spécification, pour autant que quiconque puisse en juger
Ce sont les chiffres qui circulent, et ce sont les affirmations les plus répétées de la fuite — ce qui n’est pas la même chose que ses affirmations les plus confirmées :
• Paramètres totaux — environ 600 B, contre environ 2,8 T pour Kimi K3
• Activés par inférence — environ 27B, soit à peu près 4,5 % du total, un ratio de mélange d’experts inhabituellement clairsemé
• Modalités d'entrée — texte et images ; la sortie est uniquement du texte
• Raisonnement — oui, avec réflexion étendue
• Fenêtre de contexte — 1 M de tokens sur Artificial Analysis ; une configuration tierce distincte circulant dans les outils de développement indique 350 000, avec une sortie maximale de 64 000
• Disponibilité des poids — fermé, aucun dépôt
Cette contradiction autour de la fenêtre de contexte mérite d’être signalée clairement, car personne ne l’a résolue. Une fenêtre de 1 M de tokens et une fenêtre de 350 k tokens correspondent à des produits différents, avec des coûts mémoire différents, et le second chiffre s’accompagne d’un plafond de sortie de 64 k dont le premier ne dit rien. Si vous prévoyez un pipeline de documents longs en vous fondant sur le chiffre de 1 M, la configuration à 350 k est la raison d’attendre une page du fournisseur. Les nombres de paramètres présentent un flou similaire : le tracker de DataLearner indique encore l’architecture MoE et les nombres de paramètres de Step 5 Preview comme indisponibles, ce qui signifie que le couple 600B/27B — le fait le plus cité à propos de ce modèle — est aussi l’un des moins confirmés officiellement.
Le chiffre intéressant est 27B, pas 600B.
Les modèles parcimonieux à mélange d’experts ne consacrent du calcul qu’aux experts vers lesquels un token est réellement routé ; c’est donc le nombre de paramètres activés qui régit le comportement du modèle en production. Avec environ 27B d’actifs, Step 5 Preview fournit par token un travail du même ordre que des modèles d’une fraction de sa taille, tandis que le total de 600B relève largement de l’empreinte mémoire.
Deux conséquences en découlent, et toutes deux apparaissent dans les mesures tierces. Le coût de service suit les paramètres activés, ce qui explique en partie pourquoi le prix est ce qu’il est. Et la vitesse par token en profite aussi : Artificial Analysis mesure 99,8 tokens de sortie par seconde, un classement de 42e sur 200 modèles, contre une médiane de 64,6. Le temps jusqu’au premier token s’établit à 2,96 secondes contre une médiane d’environ 3,57 secondes. Si la répartition 600B/27B est exacte, il s’agit d’un modèle conçu pour être bon marché à servir plutôt qu’à héberger — une distinction importante si c’est vous qui payez les GPU plutôt que les tokens.
Où il se situe dans l'Intelligence Index
Artificial Analysis attribue un score de 44 à Step 5 Preview sur l'Intelligence Index v4.3, qui intègre dix évaluations. Cela place Step 5 Preview au 25e rang sur 200 modèles du classement et bien au-dessus du modèle médian évalué par l'indice, dont le score se situe à 25.
• Indice d'intelligence — Step 5 Preview 44 vs Kimi K3 44
• Juste au-dessus — GLM-5.3 et Claude Opus 5, tous les deux à 45
• Juste en dessous — DeepSeek V4.1 Flash à 40 et DeepSeek V4 Pro à 36
• Terminal-Bench 4.0 — Step 5 Preview 33,3 % contre Kimi K3 à environ 12,6 %, et contre DeepSeek V4.1 Flash à 26,8 %
• SciCode — 59 % pour Step 5 Preview, à égalité avec Kimi K3
• Vitesse de sortie — 99,8 jetons par seconde contre une médiane du secteur de 64,6
Le titre, c'est l'égalité avec Kimi K3, et à y regarder honnêtement, la lecture est plus étroite que ne le laissent entendre les gros titres. Égaler un modèle de 2,8 billions de paramètres sur un indice agrégé avec 600 milliards au total constitue un vrai résultat d'efficacité, mais l'agrégat en masque la forme : l'écart sur Terminal-Bench 4.0 en faveur de Step 5 Preview est spectaculaire, tandis que le résultat sur SciCode est une égalité parfaite. Une parité agrégée sur un indice n'est pas une parité partout, et une version préliminaire est le moment le moins fiable pour supposer que ces écarts se maintiendront.
Une autre divergence qu'il vaut la peine de nommer : Artificial Analysis indique 44, tandis que le tracker indépendant de DataLearner enregistre la même exécution à 43,6. Il s'agit d'un écart d'arrondi plutôt que d'un désaccord sur les capacités, mais c'est le genre de chose qui illustre bien ce qu'il en est des chiffres de ce modèle en général — ce sont des lectures tierces d'un modèle non annoncé, prises à des moments légèrement différents, et aucune n'a été confirmée par StepFun. Aucun de ces benchmarks n'est rapporté par le fournisseur, ce qui joue dans les deux sens : personne chez StepFun n'a revendiqué un chiffre ici, et personne chez StepFun ne s'est non plus porté garant d'un chiffre.

Le prix, et la verbosité qui l’entame.
La tarification est l’élément de cette fuite qui aura le plus tôt une incidence sur un budget. Via l’API de StepFun, Artificial Analysis consigne ce qui suit :
• Entrée — 1,00 $ par million de jetons, contre une médiane de 1,88 $ pour des modèles comparables
• Sortie — 2,70 $ par million de tokens, contre une médiane de 10,00 $
• Cache — une remise de 95 % sur le cache, ramenant les accès au cache à environ 0,05 $ par million de jetons
• Mixte — environ 0,51 $ par million de tokens pour une répartition 7:2:1 entre les hits de cache, les entrées et les sorties
• Coût par tâche Intelligence Index — 0,71 $
• Coût d'une indexation complète — 918,34 $ au total
La sortie à 2,70 $ est la ligne qui compte le plus, car elle représente moins d’un cinquième de ce que Kimi K3 facture pour le même million de tokens à 15,00 $. Mais il y a un piège qu’une comparaison par token dissimule, et qu’Artificial Analysis mesure directement : la verbosité. Step 5 Preview a généré 160 M de tokens de sortie pour compléter l’Intelligence Index, contre une médiane de 90 M pour le secteur et un rang de 65e sur 200 sur cette mesure.
Faites le calcul. À 2,70 $ le million, 160 M de tokens de sortie représentent environ 432 $ — soit à peu près la moitié du coût total de 918,34 $ de toute l'exécution de l'index, dépensé dans la verbosité propre au modèle plutôt que dans les tâches. Faites passer les mêmes 160 M de tokens par le tarif de sortie de Kimi K3, à 15,00 $, et vous obtenez 2 400 $, c'est de là que vient l'avantage de prix. Mais l'avertissement pratique s'adresse à quiconque estime les coûts en reprenant un nombre de tokens d'un autre modèle : Step 5 Preview produit environ 1,8 fois la médiane, ainsi une charge de travail intensive en sortie obtient à la fois le tarif moins cher et davantage de tokens. La remise subsiste, mais elle est plus faible que ne le laisse penser la comparaison entre 1,00 $/2,70 $ et 3,00 $/15,00 $, et son ampleur dépend entièrement de la verbosité que vos prompts induisent chez le modèle.
La remise de 95 % sur le cache est l'autre levier, et elle est inhabituellement agressive. Une charge de travail avec une forte réutilisation de prompt — un long prompt système, un document fixe, une base de code partagée — se situe bien plus près du tarif mixte de 0,51 $ que du tarif d'entrée de 1,00 $. Ce chiffre mixte suppose un ratio 7:2:1, qui relève d'une hypothèse de modélisation plutôt que d'une garantie, mais c'est la bonne forme d'arithmétique à appliquer à votre propre trafic.

Ce que rencontrent les premiers testeurs
Il s'agit de rapports individuels provenant de forums de développeurs et de publications sur les réseaux sociaux dans les jours entourant la fuite, et non de mesures, et ils doivent être pondérés en conséquence :
• L’appel d’outils est la plainte la plus courante — des noms d’outils erronés sont sélectionnés, et des modifications sont tentées sans avoir d’abord lu le fichier cible
• Erreurs signalées au-delà d'environ 340 000 jetons de contexte, ce qui est le mode de défaillance à surveiller si la fenêtre de 1M s'avère être le vrai chiffre
• Le filtrage de contenu tronque les sorties pour certaines invites
• Les impressions sur les capacités divergent : certains testeurs le placent au-dessus de GLM-5.3 Flash, d’autres le placent en dessous de DeepSeek V4.1 Flash
Qu’une version d’aperçu non publiée échoue à l’utilisation d’outils n’est pas un scandale — c’est précisément à cela que sert l’étiquette « preview ». Mais cela signifie bien que le 44 ne doit pas être interprété comme une promesse de fiabilité agentique, car l’Intelligence Index ne teste pas ce dont les premiers testeurs se plaignent le plus.
Comment vous l'appelleriez réellement — et quoi utiliser en attendant
OrcaRouter ne route pas Step 5 Preview. Il n’existe aucun point de terminaison public ni aucun poids, donc il n’y a rien à router, et aucune plateforme tierce ne peut honnêtement prétendre le contraire pour l’instant. Quiconque vous dit où l’appeler aujourd’hui décrit un point de terminaison d’évaluation, pas un produit.
Les modèles par rapport auxquels il est évalué sont une autre affaire. Kimi K3, GLM-5.3 et DeepSeek V4.1 Flash sont tous disponibles via OrcaRouter, aux côtés de 199 modèles issus de 15 fournisseurs, derrière une seule clé API et une seule facture. La tarification est répercutée au prix catalogue du fournisseur, avec 0 % de marge, ce qui compte plus que d’ordinaire pour un modèle comme celui-ci : si le tarif de 1,00 $/2,70 $ de Step 5 Preview se maintient au lancement puis évolue, une route qui répercute les prix s’ajuste le jour même plutôt que selon le calendrier de révision tarifaire d’un tiers.
Lorsqu'il devient effectivement appelable, la façon sensée d'exécuter un modèle proche d'une version non publiée est la même que pour tout modèle auquel vous ne faites pas encore confiance — derrière une route avec basculement automatique, afin qu'un échec d'appel d'outil ou une erreur de contexte long retombe vers un modèle qui fonctionne au lieu d'entraîner votre application dans sa chute. C'est le schéma que les premiers retours défendent ici précisément : une version préliminaire présentant des problèmes signalés d'appel d'outils et des erreurs de contexte long est exactement le modèle derrière lequel on veut un repli, et non celui qu'on veut seul sur un chemin de production.

Qu’est-ce qui transformerait cette fuite en une publication ?
Trois choses à surveiller, par ordre de ce qu'elles permettraient de trancher. Premièrement, une page de modèle et une tarification sur la propre plateforme de développeurs de StepFun — dès l'instant oùstep-5apparaît dans la liste des modèles, la fiche technique du fournisseur remplace toute lecture tierce dans cet article, y compris le duo 600B/27B et l'affirmation d'un contexte de 1 M. Deuxièmement, la résolution de la contradiction entre un contexte de 1 M et de 350 k ; un plafond de sortie de 64 k dans une fenêtre de 1 M constitue une différence significative pour quiconque construit des pipelines de documents longs ou d'agents, et cette question n'est pas encore tranchée. Troisièmement, de savoir si cette tarification est une posture de lancement ou une ligne permanente — les tarifs de préversion sur les modèles phares chinois ont l'habitude de bouger dès que la capacité se resserre, et 2,70 $ par million de jetons de sortie est suffisamment agressif pour susciter cette question.
Tant qu'au moins le premier de ces éléments ne sera pas arrivé, le résumé honnête est que Step 5 Preview ressemble à un modèle véritablement efficace — 600B au total accomplissant un travail agrégé de classe 2,8T, à un prix plusieurs fois inférieur à celui du marché — avec une spécification non vérifiée, une véritable taxe de verbosité, et une réputation en matière d'appel d'outils qui n'a pas encore été méritée. Cela vaut la peine d'être anticipé. Pas encore au point de miser un chemin de production dessus.
Comparés dans cet article4
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
