Carte de titre générée intitulée « Step 5 Preview — ce que dit le dépôt », listant six lignes : paramètres totaux 600 B, activés par token 27 B, fenêtre de contexte 1 M de tokens, entrée texte et image, AA Intelligence Index 44, et le prix 1,00 $ en entrée / 2,70 $ en sortie. Un pied de page indique « StepFun a annoncé le 20 septembre 2026 ; les poids sont attendus le 15 octobre 2026. Chiffre de l’Indice selon Artificial Analysis. »
Engineering & Research

Step 5 Preview est annoncé : ce que le modèle phare 600B de StepFun livre réellement, et ce qui manque encore

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

StepFun a annoncé Step 5 Preview le 20 septembre 2026 — un modèle phare à mélange d'experts clairsemé de 600 milliards de paramètres, avec 27 Md de paramètres actifs par token, une fenêtre de contexte d'un million de tokens, une entrée d'images native et un score de 44 à l'Artificial Analysis Intelligence Index. L'API a ouvert ses portes le jour même. Ce qui n'a pas ouvert, c'est le modèle lui-même : le dépôt Hugging Face stepfun-ai/Step-5-Preview-BF16 existait dès l'après-midi de l'annonce et contient exactement un fichier, .gitattributes, sans poids, sans licence, sans fiche de modèle et sans configuration. Les propres documents de StepFun situent la publication des poids ouverts au 15 octobre 2026. Le résumé honnête en une ligne de ce lancement est donc que le modèle est appelable aujourd'hui et téléchargeable dans environ trois semaines et demie, et ce sont deux choses différentes. C'est aussi le même modèle que ce blog a couvert plus tôt aujourd'hui en tant que fuite non annoncée, évalué sous une balise de test avant que StepFun n'ait publié une page produit — un rappel utile qu'un aperçu peut passer de la fuite au lancement sans qu'un seul chiffre ne change.

Le dépôt est un espace réservé, et c’est toute l’histoire.

Quand un fournisseur publie des poids, le dépôt constitue la preuve. Il contient un fichier de licence, une configuration avec un nombre de paramètres, un README avec l'usage prévu et le tableau d'évaluation, ainsi que des shards safetensors dont la taille totale vous indique si l'affirmation sur le nombre de paramètres est réelle. stepfun-ai/Step-5-Preview-BF16 ne contient rien de tout cela. L'enregistrement de l'API Hugging Face qui lui correspond affiche un horodatage de création du 2026-09-20T03:52Z, zéro téléchargement, deux j'aime, un objet de configuration vide, aucun pipeline_tag, aucune licence et un seul fichier frère. La page de l'organisation StepFun le répertorie, et ne répertorie aucun autre dépôt Step 5 — pas de version FP8, pas de version NVFP4, pas de GGUF, aucune des variantes de quantification qui accompagnaient Step-3.7-Flash en juin.

Interprétez cela comme une question de planification, pas comme un mystère. Le suffixe BF16 dans le nom du dépôt est l’indice révélateur : un laboratoire qui a l’intention de publier d’abord un checkpoint bfloat16 — le format à partir duquel on effectue le fine-tuning et la quantification, avant l’arrivée des builds de service FP8 et NVFP4 — nomme le dépôt ainsi au moment de sa création et le remplit plus tard. StepFun a indiqué le 15 octobre dans ses propres supports d’annonce. D’ici là, le dépôt est une affirmation d’intention, et la seule chose qu’il prouve, c’est que StepFun a réservé l’espace de noms.

Cela importe pour une raison pratique. Le Preview en suffixe et les poids manquants sont le même signal qui pointe dans la même direction : le modèle est appelable, la tarification est fixée, et l'artefact que vous exécuteriez sur votre propre matériel n'existe pas encore. Tout plan qui suppose un Step 5 Preview auto-hébergé avant la mi-octobre est un plan sans artefact derrière lui.

Qu’est-ce qui a été réellement annoncé ?

Le positionnement de StepFun est étroit et précis : Step 5 Preview est un modèle de base destiné au travail agentique dans le monde réel — codage assisté par IA, ingénierie logicielle, travail intellectuel professionnel et finance —, l'accent étant mis sur le contexte long, les appels d'outils multi-tours et l'exécution soutenue plutôt que sur la qualité de la conversation. L'entreprise a purement et simplement sauté toute la gamme Step 4.x, passant directement de Step-3.7-Flash à Step 5, ce qui constitue en soi une déclaration sur l'ampleur du pas qu'elle estime franchir.

Un détail de datation mérite d’être signalé, car c’est le genre de chose qui fait dérailler un calendrier d’approvisionnement : Artificial Analysis situe ce modèle au 18 septembre 2026, deux jours avant l’annonce de StepFun elle-même. Le tableau de bord note un modèle lorsqu’il peut y accéder, et cet écart de deux jours correspond au décalage habituel entre le moment où un modèle devient appelable et celui où un fournisseur en parle par écrit. L’annonce de StepFun — le 20 septembre, avec l’ouverture de l’API et de Studio le jour même — est la date à citer, et la date du 15 octobre pour les poids provient des mêmes documents.

La spécification telle que publiée :

• Paramètres totaux — 600B, mélange d'experts clairsemé

• Actifs par token — 27B, soit environ 4,5 % du total, un ratio inhabituellement faible

• Fenêtre de contexte — 1 M de tokens

• Entrée — texte et images nativement ; la sortie est uniquement du texte

• Raisonnement — oui, avec réflexion étendue

• Prix — 1,00 $ par million de tokens d'entrée, 2,70 $ par million de tokens de sortie, avec une remise de 95 % sur le cache

• Disponibilité — API et Studio ouverts à partir du 20 septembre ; poids prévus pour le 15 octobre

L'argument d'efficacité que StepFun met en avant est que la répartition 600B/27B place le modèle sur la frontière de Pareto — la capacité par unité de calcul — et l'entreprise la présente comme trois générations d'une même quête, de Step-3.5-Flash à Step-3.7-Flash jusqu'à ce modèle-ci. C'est un récit cohérent, et le ratio de parcimonie en est le mécanisme : à 27B actifs, le coût de service par token se situe dans la bande d'un modèle bien plus petit, tandis que le total de 600B relève surtout d'une question d'empreinte mémoire.

Les affirmations des fournisseurs, et les chiffres de tiers qui les accompagnent

Deux catégories de chiffres apparaissent dans les supports de lancement, et elles ne doivent pas être interprétées de la même manière. Les évaluations de StepFun constituent la première catégorie : une affirmation de coût par tâche équivalant à un huitième de celui de Claude Opus 5 ; une deuxième place derrière GPT-6 Astra ou Claude Opus 5 sur ALE-CLI, FrontierFinance et DRACO ; une exécution d’optimisation de noyau GPU de 24 heures qui a porté les performances maximales du noyau MLA à 508 TFLOPS, contre 493 pour Claude Opus 5 ; une expérience automatisée de post-entraînement qui a fait passer Qwen3-30B-A3B de 53,3 % à 60 % sur AIME24 ; DeepSWE v1.1 à 67,7 % et son StepCodeBench interne à 49,0 %. StepFun a développé StepCodeBench lui-même — 553 dépôts de code, neuf types de tâches, 33 langages de programmation — ce qui en fait un instrument raisonnable pour mesurer son propre modèle, et non un instrument indépendant.

La seconde catégorie est mesurée par quelqu'un d'autre, et c'est la partie sur laquelle il faut se baser pour planifier. Artificial Analysis attribue à Step 5 Preview un score de 44 sur l'Intelligence Index v4.3.2, le classant 24e sur 200 modèles — à égalité avec Kimi K3, à un point derrière GLM-5.3, et à égalité avec le réglage d'effort de raisonnement moyen de Claude Opus 5. Sur Terminal-Bench 4.0, le même tableau enregistre 33,3 %, devant DeepSeek V4.1 Flash à 26,8 % et bien devant Kimi K3 à environ 12,6 %. La vitesse de sortie mesure 99,8 jetons par seconde et le temps jusqu'au premier jeton 2,96 seconde — les deux issus de la même exécution indépendante, et tous deux du genre de chiffre qui décide si une boucle d'agent paraît interactive.

Un chiffre émanant d’un tiers va dans l’autre sens et mérite de figurer aux côtés du prix. La même exécution de l’index a utilisé 160 M de tokens de sortie pour Step 5 Preview, contre une médiane de 92 M pour les modèles évalués — le modèle est verbeux. À 2,70 $ par million de tokens de sortie, cette verbosité n’est pas gratuite : 160 M de tokens de sortie représentent environ 432 $ sur un coût total d’exécution de 922,84 $, et sur un modèle facturant trois fois plus, ce serait le poste dominant de la facture. Un prix affiché bas et un nombre élevé de tokens par tâche sont les deux moitiés d’un même chiffre, et le coût par tâche d’index — 0,71 $ — est celui qui contient déjà les deux.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second at rank 45 of 200, cost per Intelligence Index task $0.71 at rank 27 of 200, verbosity 160M output tokens at rank 64 of 200, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Ce que la fuite a vu juste, et la seule chose qu’elle n’a pas tranchée

La couverture antérieure de ce blog avait été rédigée à partir d'une évaluation apparue avant toute annonce, et elle signalait les affirmations qu'elle ne pouvait pas confirmer. L'annonce a résolu la plupart d'entre elles. Le couple 600B/27B est désormais indiqué par le fournisseur plutôt que déduit. La fenêtre de contexte de 1M de tokens figure désormais dans les spécifications de StepFun elles-mêmes, et non plus seulement sur un classement tiers. Le prix est bien de 1,00 $ et 2,70 $. Le nom est Step 5 Preview, et non une autre appellation qui circulait.

Ce que l’annonce n’a pas fait, c’est résoudre la contradiction autour de la fenêtre de contexte soulevée par la couverture de la fuite. Une configuration tierce distincte, qui circulait dans l’outillage des développeurs, indiquait le modèle à 350 000 tokens de contexte avec une sortie maximale de 64 000 tokens. Une fenêtre de 1 M et une fenêtre de 350 k correspondent à des produits différents, avec des coûts mémoire différents, et un plafond de sortie de 64 k constitue une contrainte stricte précisément pour le travail agentique à long horizon pour lequel ce modèle est vendu. L’annonce de StepFun indique 1 M et ne mentionne aucun plafond de sortie. Il est utile de savoir sur laquelle votre routage aboutira avant de construire un pipeline qui dépend de la réponse, et c’est une question qui relève de la documentation du fournisseur plutôt que d’un classement.

L’autre chose que le lancement n’a pas changée, c’est la reproduction indépendante. Chaque ligne de benchmark ci-dessus qui ne provient pas d’Artificial Analysis est celle de StepFun, exécutée sur les harnais de StepFun, et aucun tiers n’a reproduit les résultats agentiques. La tendance qui se dégage des modèles phares des laboratoires chinois cette année, c’est que l’indice agrégé tient bon tandis que les lignes mises en avant par le fournisseur dérivent ; considérez l’agrégat comme le chiffre de référence pour la planification.

Ce que vous pouvez appeler aujourd'hui, et ce qu'il faut rediriger en attendant

Step 5 Preview ne figure pas dans notre catalogue, et OrcaRouter ne le route pas — il existe une API publique et un Studio du côté de StepFun, et c'est là que cela s'exécute. Ce que nous avons, c'est l'ensemble des modèles par rapport auxquels il est évalué, derrière une seule clé : DeepSeek V4.1 Flash à 0,15 $ en entrée et 0,60 $ en sortie par million, GLM-5.3 à 1,26 $ et 3,96 $ contre les 1,40 $ et 4,40 $ affichés par Z.ai, Claude Opus 5 à 5,00 $ et 25,00 $, et Kimi K3 à leurs côtés. Voilà à quoi ressemblent concrètement les trois prochaines semaines : un aperçu sur lequel vous pouvez faire des benchmarks, et un ensemble de modèles de production sur lesquels vous pouvez réellement compter, accessibles via une seule API pour plus de 200 modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge — donc si les tarifs de StepFun changent avant octobre, le montant que vous paieriez évolue avec eux le jour même, pas lors du renouvellement.

Le basculement automatique vaut plus que d'habitude dans cette fenêtre, car le mode de défaillance d'une preview n'est pas qu'elle est mauvaise — c'est qu'elle est limitée en capacité. Un modèle qui a ouvert son API le jour de l'annonce et n'a pas encore de poids est un modèle dont la flotte de serving est encore en construction, et un endpoint de preview qui se dégrade à 2 h du matin emporte votre boucle d'agent avec lui. Placez la preview derrière un routeur avec un modèle éprouvé comme solution de repli et vous obtenez un signal de qualité sur votre propre charge de travail sans parier un chemin de production sur une flotte non éprouvée.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, showing the repository created on September 20, 2026 with one contributor, a single initial commit and a single file listed, .gitattributes at 1.52 kB, with no model card, no license and no configuration.

La date qui compte est le 15 octobre

Tout ce qui précède est provisoire d'une manière bien précise : ce sont les poids qui rendent un modèle permanent. Un aperçu fermé à 1,00 $ et 2,70 $ est un bon prix de la part d'un seul fournisseur, tandis qu'un checkpoint BF16 sous une licence publiée est un prix qu'aucun fournisseur ne contrôle plus à lui seul. StepFun s'est engagé sur la seconde option pour le 15 octobre, et le nom du dépôt qu'il a déjà réservé annonce bfloat16 en premier.

Ce qu'il faut surveiller d'ici là est précis et vérifiable. Le dépôt se remplit-il — et sous quelle licence ? Un fichier de configuration confirme-t-il 600B au total et 27B actifs ? StepFun publie-t-il le plafond de sortie en même temps que la fenêtre de contexte, résolvant la question des 350k/64k ? Le prix tient-il une fois que l'aperçu perd son suffixe ? Ces quatre réponses déterminent si Step 5 Preview devient un modèle que vous hébergez vous-même, un modèle que vous louez ou un modèle que vous évaluez une fois avant de passer à autre chose. Tant que le dépôt n'abrite rien de plus qu'un .gitattributes, l'annonce est le début de l'histoire plutôt que la fin.

Generated two-column infographic titled 'Step 5 Preview — live today vs promised October 15'. The left card 'Callable now' lists rows: API and Studio open September 20, price $1.00 in / $2.70 out, AA Intelligence Index 44, 1M-token context, output speed 99.8 tokens/sec. The right card 'Promised October 15' lists rows: BF16 weights, licence terms, config with parameter counts, output ceiling. A footer reads 'The announcement covers the left card; the right card is unconfirmed until the repository is filled.'

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement