Carte de titre générée intitulée « Step 5 Preview vs Claude Opus 5 — l'écart de prix » avec deux colonnes : Step 5 Preview à AA Index 44, prix $1.00 en entrée / $2.70 en sortie, coût d'exécution de l'indice $922.84 et vitesse de sortie 99.8 tokens/sec ; Claude Opus 5 à AA Index 51, prix $5.00 en entrée / $25.00 en sortie, coût d'exécution de l'indice $7,274.74 et vitesse de sortie 55.3 tokens/sec. Un pied de page indique « 7,9 fois le coût pour 7 points d'indice. Les deux selon l'Artificial Analysis Intelligence Index v4.3.2 à effort de raisonnement maximal. »
Guides & Insights

Step 5 Preview vs Claude Opus 5 : sept points d'indice pour une facture multipliée par sept

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le document de lancement de StepFun pour Step 5 Preview s'ouvre sur une seule affirmation comparative : une seule tâche sur celui-ci coûte un huitième de la même tâche sur Claude Opus 5. Les deux modèles figurent désormais sur le même classement indépendant, de sorte que cette affirmation peut être vérifiée plutôt que discutée. Artificial Analysis a fait passer chacun dans Intelligence Index v4.3.2 — dix évaluations — et a publié ce que chaque exécution a coûté, avec Claude Opus 5 évalué à son propre réglage maximal d'effort de raisonnement. Step 5 Preview : 44 à l'indice, 922,84 $ pour terminer l'exécution. Claude Opus 5 : 51 à l'indice, 7 274,74 $. Cela représente 7,9 fois la dépense pour 7 points de score, et le ratio cité par StepFun s'avère être le ratio exact. Ce que le ratio dissimule est la partie intéressante, car l'écart n'est pas principalement un écart de prix. C'est un écart de verbosité sous les habits d'un écart de prix, et séparer les deux change le modèle que vous devriez mettre face à quelle charge de travail.

Deux coûts d'exécution, une carte, et ce qu'ils contiennent réellement

Le coût total d’exécution est la comparaison unique la plus nette dont on dispose ici, car les deux modèles ont répondu aux mêmes questions dans le même harnais, et aucun des deux fournisseurs n’a produit ce chiffre. C’est aussi le chiffre le plus susceptible d’être mal interprété, ce qui justifie qu’on l’examine de près.

• Score d'indice — Step 5 Preview 44 contre Claude Opus 5 51, Claude Opus 5 a été évalué avec son réglage d'effort de raisonnement maximal

• Coût total pour terminer l’index — Step 5 Preview 922,84 $ vs Claude Opus 5 7 274,74 $

• Prix pondéré pour une répartition 7:2:1 entre cache hit / entrée / sortie — Step 5 Preview : 0,51 $ par million de tokens vs Claude Opus 5 : 3,85 $

• Jetons de sortie générés pendant l'exécution de l'index — Step 5 Preview 160M vs Claude Opus 5 140M

• Prix catalogue — Step 5 Preview 1,00 $ en entrée / 2,70 $ en sortie vs Claude Opus 5 5,00 $ en entrée / 25,00 $ en sortie

Si l’on regarde les lignes trois et cinq ensemble, l’arithmétique cesse d’être une simple comparaison de prix. Le tarif mélangé de Step 5 Preview est 7,5 fois moins cher, et le tarif catalogue est 5 fois moins cher en entrée et 9,3 fois moins cher en sortie — le mélange fait donc un travail que le prix d’entrée ne fait pas. C’est parce que le mélange est pondéré vers la sortie, et c’est sur la sortie que les deux modèles divergent le plus. Claude Opus 5 facture 9,3 fois le tarif de sortie de Step 5 Preview, et les deux modèles écrivent beaucoup : 140 M de tokens de sortie pour Claude Opus 5, contre une médiane de 92 M parmi les modèles que l’indice évalue, et 160 M pour Step 5 Preview, contre la même médiane de 92 M.

Donc, la lecture honnête est plus restrictive que « le modèle bon marché est une bonne affaire ». Step 5 Preview est moins cher sur tous les plans, et ce n’est pas un modèle économe — il produit 74 % de sortie en plus que le modèle médian auquel il est comparé, ce qui est exactement le comportement que le prix est censé pénaliser. Claude Opus 5 produit 52 % de plus que la médiane et facture 9,3 fois plus cher pour chacun de ces tokens. Un appelant qui limite la longueur de sortie obtient un ratio différent de celui qui ne le fait pas.

La question n’est pas de savoir lequel est meilleur. C’est de savoir où se situe le point de bascule.

Supposons que l'indice soit un proxy raisonnable du travail que vous envoyez réellement — tâches agentiques à long horizon, code, utilisation d'outils en plusieurs étapes. Alors le point de bascule est simple à énoncer : Claude Opus 5 doit être au moins 7,9 fois plus utile par tâche avant de valoir son coût, et sur l'indice, il est meilleur de 7 points sur une échelle de 100 points. Ces deux faits ne pointent pas nécessairement dans la même direction, car un écart de 7 points sur l'indice ne signifie pas être 16 % meilleur en tout. C'est l'agrégat de dix évaluations, et la composition compte davantage que le total.

Voilà l’argument pour s’intéresser à la forme des deux scores plutôt qu’au chiffre phare. Le score de Step 5 Preview sur Terminal-Bench 4.0 est de 33,3 % — un véritable résultat agentique, devant DeepSeek V4.1 Flash à 26,8 % — mais rien dans les données publiées ne montre encore qu’il égale Claude Opus 5 sur les évaluations à long horizon, là où le modèle d’Anthropic excelle. Les propres documents de StepFun le concèdent par leur formulation : sur ALE-CLI, FrontierFinance et DRACO, l’entreprise classe Step 5 Preview deuxième, derrière GPT-6 Astra ou Claude Opus 5, et devant les autres modèles ouverts de la comparaison. Une deuxième place pour un cinquième du prix est un très bon résultat. Ce n’est pas non plus la première place, et les tâches où un modèle termine deuxième sont généralement celles où il fallait être premier.

L'autre asymétrie, c'est ce qui se passe lors d'un mauvais appel. Une mauvaise réponse d'un modèle bon marché qui a pris quatre secondes et 2 000 tokens vous coûte la nouvelle tentative ; la même mauvaise réponse de Claude Opus 5, à 25 dollars par million de tokens de sortie, vous coûte la nouvelle tentative plus la délibération. Si votre pipeline réessaie en cas d'échec — la plupart des boucles d'agents le font — le coût effectif par tâche réussie est le chiffre qui compte, et il ne suit pas le même ratio que le prix catalogue, parce que les deux modèles n'échoueront pas au même rythme. Personne n'a encore publié ce chiffre pour Step 5 Preview.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Le contraste des spécifications, dimension par dimension

• Score de l'indice — Step 5 Preview 44 vs Claude Opus 5 51, tous deux sur Intelligence Index v4.3.2, Claude Opus 5 à son réglage d'effort de raisonnement maximal

• Prix par 1 M de tokens — Step 5 Preview 1,00 $ en entrée / 2,70 $ en sortie vs Claude Opus 5 5,00 $ en entrée / 25,00 $ en sortie

• Remise sur le cache — Step 5 Preview 95 % vs Claude Opus 5 90 %

• Contexte — 1 M de tokens dans les deux cas ; StepFun n'a pas publié de plafond de sortie, et celui d'Anthropic est de 128 K

• Entrée — les deux acceptent du texte et des images ; les deux ne produisent que du texte

• Vitesse de sortie — Step 5 Preview 99,8 tokens/s contre Claude Opus 5 55,3 tokens/s

• Surface de contrôle — Step 5 Preview expose la réflexion étendue ; Claude Opus 5 remplace temperature et top_p par un cadran adaptatif d’effort de raisonnement

• Poids — Step 5 Preview fermé aujourd’hui, checkpoint BF16 prévu pour le 15 octobre ; Claude Opus 5 propriétaire sur toute la ligne

• Preuves indépendantes — les deux évaluées par Artificial Analysis ; les lignes de benchmark agentique de StepFun sont exécutées par le fournisseur et non reproduites

Deux lignes méritent une remarque. L'écart de vitesse est bien réel et, en pratique, plus important que ne le suggère le tableau : 99,8 jetons par seconde contre 55,3, c'est un modèle qui termine environ deux fois plus vite sur une même sortie, et le temps jusqu'au premier jeton de Step 5 Preview, de 2,96 secondes, contre 56,84 secondes pour Claude Opus 5 sur le même tableau relève d'un autre ordre de grandeur — encore que ce second chiffre mesure la configuration de raisonnement à effort maximal, où le modèle délibère avant d'émettre quoi que ce soit. Ce n'est pas la latence que voit un appel en production. Face au point de terminaison standard, notre propre catalogue indique un temps jusqu'au premier jeton (p50) de 6,73 secondes pour Claude Opus 5, le chiffre à retenir pour planifier si vous ne demandez pas délibérément un raisonnement maximal.

La ligne de remise sur le cache est celle qui décide discrètement des charges de travail répétées, et elle favorise Step 5 Preview, de 95 % à 90 %. Une boucle d’agent qui renvoie le même prompt système et le même contexte de dépôt à chaque appel repose presque entièrement sur cette remise, de sorte qu’une différence de cinq points se cumule au fil d’une longue session.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

Là où Claude Opus 5 reste la seule réponse

Rien de ce qui précède ne remet en cause le modèle d'Anthropic. Il coûte ce qu'il coûte parce qu'il fait ce que l'indice cherche à mesurer, et il le fait tout en haut du classement — 51 sur l'Intelligence Index v4.3.2, sept points devant Step 5 Preview et à portée des leaders de la génération actuelle. Les charges de travail où un écart agrégé de 7 points sous-estime la différence sont celles qui ne tolèrent pas une réponse de second rang : un refactoring de plusieurs heures où le mode de défaillance est un changement de comportement subtil, un modèle financier où la chaîne de raisonnement doit être auditable, une migration où une mauvaise décision n'est découverte qu'une semaine plus tard. Dans ces cas, la nouvelle tentative n'est pas bon marché, et la délibération est le produit.

Les charges de travail où l’écart n’a pas d’importance sont celles construites à partir de nombreuses petites décisions : étapes de classification et de routage, extraction, résumé, échafaudage de tests, les mille appels qu’un agent effectue entre les deux appels qui comptent vraiment. Pour celles-là, un modèle à 44 qui répond en deux fois moins de temps pour un cinquième du prix des entrées n’est pas un compromis. C’est le choix par défaut correct, le modèle coûteux étant réservé à l’étape qui doit être juste.

Lancer le split sans lancer deux intégrations

La version pratique de cette comparaison est un pipeline à plusieurs niveaux, et si les équipes n'en construisent pas, c'est une question d'achats plutôt que d'ingénierie — deux fournisseurs, deux contrats, deux SDK, deux clés à faire tourner. Claude Opus 5 figure dans notre catalogue à 5,00 $ et 25,00 $, et les modèles de texte moins chers que vous placeriez devant lui figurent dans le même catalogue, tous derrière une seule clé pour plus de 200 modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge. Step 5 Preview ne figure pas sur cette liste — il tourne sur l'API propre à StepFun, et tant que les poids ne sont pas disponibles, c'est le seul endroit où il tourne. Composer cette stratification entre les modèles que nous routons effectivement relève d'une expression de DSL de routage plutôt que d'une modification de code — envoyez les appels de routine au petit modèle, basculez vers le modèle coûteux sur une condition de confiance ou de complexité, et gardez les deux branches derrière le même point de terminaison.

Le basculement automatique est important ici pour une raison précise, et non en tant que fonctionnalité générique. Step 5 Preview a ouvert son API le jour de l’annonce, sans poids publiés ni flotte de service divulguée ; il s’agit d’un point de terminaison d’aperçu vieux de quelques jours, et les points de terminaison d’aperçu sont soumis à des contraintes de capacité que les points de terminaison matures ne connaissent pas. Claude Opus 5 est servi par de nombreux fournisseurs indépendants, ce qui constitue la redondance qu’un aperçu ne peut pas offrir. Conserver un modèle éprouvé comme branche de repli — de notre côté, cela signifie un modèle de production issu du catalogue, et non l’aperçu — est la façon d’obtenir un véritable signal de qualité sur votre propre charge de travail sans faire dépendre votre chemin de production d’une flotte encore en cours de dimensionnement.

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

La règle de décision

Si votre charge de travail se compose d'un petit nombre de tâches très difficiles, Claude Opus 5 n'est pas l'option coûteuse — c'est la moins chère, car la deuxième meilleure réponse coûte plus que la différence. Si votre charge de travail se compose d'un grand nombre de tâches ordinaires comportant un petit nombre de tâches difficiles, Step 5 Preview à 1,00 $ et 2,70 $ avec une remise de cache de 95 % constitue le meilleur choix par défaut, et l'écart de 7 points est surtout une erreur d'arrondi sur un travail qui n'en avait pas besoin.

Ce qui changerait ce calcul, ce sont des preuves indépendantes sur les taux d’échec et sur les lignes agentiques à long horizon. Les propres chiffres de StepFun placent le modèle deuxième sur les évaluations autour desquelles il a construit son lancement, et aucune tierce partie ne les a reproduits. Surveillez le checkpoint du 15 octobre pour deux choses : si la licence autorise le fine-tuning qui vous permettrait de combler un écart de 7 points sur vos propres données, et si la verbosité se maintient une fois le suffixe preview retiré. Le premier changerait le ratio ; le second l’a déjà déplacé une fois.