Carte de titre générée pour Step 5 Preview vs NVIDIA Nemotron 3 Ultra 550B A55B, affichant « vingt et un points d'indice pour vingt cents », avec trois pastilles de statistiques : Artificial Analysis Intelligence Index 44 contre 23, prix de sortie 2,70 $ contre 2,50 $ par million de tokens, et coût par tâche d'indice 1,03 $ contre 0,60 $. Le logo OrcaRouter se trouve dans une bande blanche en bas à droite.
Guides & Insights

Step 5 Preview vs Nemotron 3 Ultra : vingt et un points d'indice pour vingt cents

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'un de ces modèles, vous pouvez le télécharger dès cet après-midi, et c'est celui qui perd par vingt et un points. Step 5 Preview, le fleuron propriétaire de StepFun, a ouvert son API le 20 septembre 2026 et n'a aucun fichier de licence que l'on puisse consulter ; NVIDIA Nemotron 3 Ultra 550B A55Best présent sur Hugging Face depuis le 4 juin 2026 sous une licence permissive, avec ses recettes d'entraînement jointes. Sur l'Artificial Analysis Intelligence Index, le duo affiche 44 contre 23. Sur le prix de sortie, il affiche 2,70 $ contre 2,50 $ par million de tokens. Vingt et un points pour vingt cents, voilà une comparaison qui ne se tranche nettement dans aucun sens, et c'est pourquoi il vaut la peine de la mener correctement plutôt que de survoler les deux chiffres phares et de choisir un camp.

Aucun des deux ne correspond à un lancement cette semaine, et cela compte pour la façon dont il faut lire les chiffres ci-dessous. Tous deux peuvent être appelés depuis des mois, tous deux sont passés par le même harnais d'évaluation indépendant, et ni l'un ni l'autre n'a connu de changement de grille tarifaire sur la période. Ce qui a changé est plus discret et plus intéressant : l'indice sur lequel ils sont notés a été reconstruit en septembre, et tous les deux sont désormais jugés par rapport à deux médianes différentes, tirées de deux populations différentes. C'est là que cette comparaison se joue réellement.

Deux types de produits très différents

Lisez les fiches techniques côte à côte, et la première chose que l’on remarque, c’est qu’elles relèvent à peine de la même catégorie de choses.

• Paramètres — Step 5 Preview représente environ 600 milliards au total, avec 27 milliards actifs par token d’après la documentation de StepFun elle-même ; Nemotron 3 Ultra représente 550 milliards au total, avec 55 milliards actifs, selon le chiffre que le comité indépendant inscrit au regard de sa configuration.

• Architecture — StepFun ne publie pas de description des internes de Step 5 Preview. La fiche technique de NVIDIA documente une approche hybride : des couches Mamba-2 entrelacées, des couches d'attention sélectionnées, une organisation LatentMoE et des têtes de prédiction multi-tokens.

• Fenêtre de contexte — 1 M de tokens sur la fiche technique de Step 5 Preview, avec une sortie maximale de 64 000 tokens, également documentée par StepFun. Nemotron 3 Ultra est enregistré à 262 144 tokens par l'évaluateur qui l'a exécuté ; la fiche du fournisseur annonce jusqu'à 1 M, accessible via une configuration de service plutôt que par défaut.

• Entrée — texte, images et vidéo sur Step 5 Preview, jusqu’à 60 images par requête et fichiers MP4 de moins de 128 Mo. Texte uniquement sur Nemotron 3 Ultra.

• Contrôle du raisonnement — un paramètre documenté d’effort faible, moyen ou élevé du côté de StepFun ; un indicateur de modèle de chat du côté de NVIDIA qui active ou désactive la trace de réflexion.

• Poids — aucun publié pour Step 5 Preview, qui est propriétaire et uniquement accessible via API, avec un checkpoint BF16 que StepFun a annoncé pour le 15 octobre 2026. Nemotron 3 Ultra est livré en versions BF16 et NVFP4 ainsi qu'avec un modèle de récompense GenRM sur Hugging Face sous OpenMDW-1.1.

• Seuil minimal de déploiement — non applicable au modèle API ; huit GPU de classe B200 ou GB200, ou seize H100, sur le modèle ouvert, selon le minimum indiqué par le fournisseur.

• Grille tarifaire — 1,00 $ en entrée, 0,10 $ en cas de succès du cache et 2,70 $ en sortie pour Step 5 Preview, d'après la page de tarification en anglais de StepFun. Environ 0,60 $ en entrée, 0,16 $ en cas de succès du cache et 2,50 $ en sortie pour Nemotron 3 Ultra, et notez bien d'où vient ce couple de tarifs : NVIDIA ne publie aucune grille tarifaire, il s'agit donc de la tarification fournisseur observée que consigne le comité indépendant, et non d'un chiffre communiqué par le fournisseur.

La ligne que la plupart des gens considèrent comme décisive est la première, et c’est la moins informative des huit. Les deux totaux se situent à moins de neuf pour cent l’un de l’autre, tandis que les paramètres actifs diffèrent d’un facteur deux, et ce sont les paramètres actifs qui déterminent le coût de calcul de chaque token généré. Aucun de ces deux chiffres ne prédit un écart de vingt et un points.

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

La médiane est un choix fait avant de lire le score

Le conseil indépendant n’évalue pas les modèles selon un seul champ. Il les répartit en catégories — et la catégorie dans laquelle un modèle atterrit modifie la phrase imprimée sous son score, sans modifier le score.

Step 5 Preview est placé dans la catégorie du raisonnement général, que le classement compte pour 227 modèles, et sa médiane des modèles comparables est de 26. Nemotron 3 Ultra est placé dans la catégorie des poids ouverts, comptée pour 117 modèles, où la médiane est de 18. Ainsi, le même classement décrit 44 comme « bien au-dessus de la moyenne » et 23 comme « au-dessus de la moyenne », et les deux descriptions sont vraies, car 44 est à dix-huit points au-dessus de sa médiane et 23 est à cinq points au-dessus de la sienne.

Ce n’est pas un piège, et ce n’est pas le classement qui est injuste. C’est la bonne façon de présenter un modèle ouvert — on compare un checkpoint téléchargeable à d’autres checkpoints téléchargeables, parce qu’une équipe qui ne peut que se contenter d’un téléchargement ne choisit pas parmi les 227. Mais cela signifie que quiconque cite « au-dessus de la moyenne » à propos de Nemotron 3 Ultra et « au-dessus de la moyenne » à propos d’un 44 compare deux phrases différentes entre elles. Si vous voulez un seul nombre pour la paire, utilisez l’indice brut et acceptez l’écart de vingt et un points ; si vous voulez la décision, utilisez la classe et admettez que vous avez déjà choisi votre terrain.

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

Ce qu'un seul harnais a mesuré sur les deux

On ne peut pas soustraire les tableaux des fournisseurs les uns des autres, car StepFun et NVIDIA ont exécuté des suites différentes à des dates différentes et les documents de NVIDIA ne comportent pas tous les benchmarks rapportés par StepFun. La base honnête est l'intersection : ce qu'un même évaluateur a exécuté sur les deux.

Sur l'Artificial Analysis Intelligence Index, cette intersection est de 44 contre 23. En coût par tâche d'indice accomplie, c'est 1,03 $ contre 0,60 $. En matière de vitesse de sortie, cela s'inverse, et nettement : 87 jetons par seconde pour Step 5 Preview contre 135,6 pour Nemotron 3 Ultra, de sorte que le modèle qui obtient un score presque deux fois plus élevé est celui qui génère sa réponse environ une demi-seconde plus lentement par jeton.

La ligne la plus tranchée est Terminal-Bench 4.0. Step 5 Preview y obtient un score de 33,3 pour cent. Nemotron 3 Ultra obtient 0,5 pour cent. Ce n'est ni un artefact d'arrondi d'un côté ou de l'autre, ni un écart subtil — sur cette suite agentique-terminale précise, le fleuron à poids ouverts ne s'inscrit pratiquement pas. Le piège, c'est que le même tableau affiche aussi le même modèle à 53,9 pour cent sur Terminal-Bench 2.1. Deux benchmarks aux noms presque identiques, deux générations différentes de la même famille de tâches, et un modèle qui se situe à 53,9 sur le plus ancien et à 0,5 sur le plus récent. Si l'on vous a cité un chiffre Nemotron dans les cinquante, c'est de là qu'il vient, et ce n'est pas la suite actuelle.

Un accord mérite d’être mentionné précisément parce qu’il est rare. La propre fiche de NVIDIA annonce 87,0 % sur GPQA sans outils ; l’exécution indépendante a mesuré 86,7 %. Qu’un chiffre de fournisseur et un chiffre externe ne soient séparés que de trois dixièmes de point, voilà à quoi ressemble un tableau d’évaluation digne de confiance, et cela rend le 0,5 % sur Terminal-Bench 4.0 plus facile à accepter comme réel plutôt que comme une erreur d’évaluateur.

Où va réellement l'argent lors d'une exécution d'index

Les prix par token ne permettent guère de prédire ce que coûte une charge de travail, et ce duo le démontre mieux que la plupart. Le tableau publie la décomposition des coûts pour l’exécution complète de l’indice de chaque modèle, et pour ces deux-là, le poste dominant n’est pas la génération.

Le coût de 1,03 $ par tâche de Step 5 Preview se répartit en 0,85 $ d'entrée et 0,17 $ de sortie. Dans le montant d'entrée, 0,62 $ correspond aux lectures de cache, 0,22 $ aux écritures de cache et seulement 0,014 $ à l'entrée nouvelle, non mise en cache. Dans le montant de sortie, 0,12 $ correspond à la trace de raisonnement et 0,06 $ à la réponse finale.

Le coût de 0,60 $ par tâche de Nemotron 3 Ultra se décompose en 0,53 $ d'entrée et 0,07 $ de sortie, et la composition à l'intérieur de la ligne d'entrée est presque l'image miroir — 0,48 $ d'écritures de cache contre seulement 0,04 $ de lectures de cache.

Deux conclusions ressortent. La première est que, dans une évaluation à long horizon avec une forte réutilisation de préfixe, environ quatre-vingts pour cent de ce que vous payez se trouve du côté des entrées, ce qui fait de votre taux de réussite du cache et de votre discipline de contexte les chiffres à optimiser, plutôt que la longueur de votre sortie. La seconde est que les deux modèles arrivent à leur facture différemment : Step 5 Preview paie pour relire un grand préfixe partagé, tandis que Nemotron 3 Ultra paie pour écrire un contenu distinct dans le cache dès le départ. Un coût affiché similaire, deux factures différentes — et si votre charge de travail ressemble davantage à l’un de ces schémas qu’à l’autre, l’ordre à 1,03 $ et 0,60 $ peut s’inverser.

Les chiffres de verbosité expliquent le reste de la ligne de sortie. Step 5 Preview a généré environ 160 millions de tokens de sortie sur l’ensemble de la suite d’index, contre une médiane de 82 millions, ce que le conseil qualifie sans détour de très verbeux. Nemotron 3 Ultra a généré 110 millions contre une médiane de 140 millions, ce qu’il qualifie d’assez concis. Le modèle le moins cher est le laconique, et il l’est dans le sens qui compte pour une facture.

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

Ce que le téléchargement permet d’obtenir, et ce qu’il coûte de le conserver

Le prix de Nemotron 3 Ultra n'est pas de 2,50 $ par million de jetons de sortie si vous prenez le checkpoint. C'est le prix de la location du déploiement de quelqu'un d'autre. Prenez le téléchargement et vous avez acheté un ensemble différent de coûts et un ensemble différent de droits.

Les droits sont concrets et constituent la partie qu'un modèle uniquement API ne peut égaler à aucun prix. OpenMDW-1.1 est fourni avec les poids, et NVIDIA publie les collections de données de pré-entraînement et de post-entraînement ainsi que les recettes d'entraînement qui les accompagnent. Il existe une version NVFP4 qui fait environ la moitié de la taille pour le même modèle, et les poids Ultra ont été pré-entraînés avec une recette NVFP4 plutôt que quantifiés par la suite — c'est pourquoi la petite version est un artefact de premier ordre sur la carte plutôt qu'une expérience communautaire. La position commerciale est clairement énoncée : prêt pour un usage commercial et non commercial.

Les coûts sont tout aussi concrets. Le déploiement minimal est de huit GPU de classe B200 ou de seize H100, et il s’agit du minimum indiqué sur la fiche, non d’une suggestion. La fenêtre de contexte dont vous disposez réellement dépend de la façon dont vous configurez le serving, avec 256K par défaut et 1M derrière un paramètre explicite. Une équipe qui ne peut pas mobiliser une baie ne choisit pas entre ces deux modèles à 1,00 $ et 0,60 $ en entrée ; elle choisit entre un modèle et un bon de commande.

Il existe une version de cette comparaison dans laquelle le modèle ouvert l'emporte sur l'axe dont les gens disent se soucier et qu'ils chiffrent rarement : la dépendance. Step 5 Preview est un point de terminaison que vous appelez et un fournisseur en qui vous avez confiance, avec un checkpoint promis plutôt que livré. Si StepFun révise sa grille tarifaire, resserre ses limites, déprécie l'ID ou connaît une mauvaise semaine, votre seul levier est votre propre gestion des erreurs. Les poids de Nemotron 3 Ultra sont déjà sur disque dans le cluster de quelqu'un, et cela vaut quelque chose de réel, même si ce même modèle est en retard de vingt et un points d'indice.

Il vaut la peine d’être précis sur ce que « promis » signifie de l’autre côté, car le tableau est plus désordonné qu’aucun des deux camps ne l’admet. Plusieurs miroirs tiers d’un modèle BF16 sont apparus sur Hugging Face le 20 septembre, le jour de l’ouverture de l’API, certains dépassant largement un téraoctet de safetensors. Ce sont des republications de la communauté, non une publication d’un fournisseur, et StepFun n’a publié aucune annonce d’open-weights en parallèle. Ce qu’ils établissent, c’est que les poids sont là et que le checkpoint promis du 15 octobre serait une formalisation plutôt qu’une divulgation.

Un nombre qui a bougé pendant que nous le lisions

Un chiffre dans ce texte a changé entre deux lectures de la même page, et il vaut la peine de le nommer, car c’est exactement ainsi qu’une comparaison se périme en silence.

Le conseil indépendant a indiqué un coût de 0,71 $ par tâche de l'indice pour Step 5 Preview dans une couverture datée du 9 octobre 2026. Relu le 10 octobre, la même page indique 1,03 $. Rien n'a changé concernant le modèle durant cette période, car rien ne peut modifier du jour au lendemain les poids d'un modèle disponible uniquement via API. Ce qui a changé, c'est la comptabilité de l'évaluation : lorsque le prix du cache d'un fournisseur évolue, lorsque l'évaluateur révise ses hypothèses de lecture du cache ou lorsqu'un passage est recalculé avec une composition de tokens différente, le chiffre par tâche change, et le score de l'indice non.

Ainsi, traitez le coût par tâche comme un chiffre vivant, horodaté, plutôt que comme une propriété du modèle. Chaque chiffre par tâche dans cet article correspond à la lecture du 10 octobre et est étiqueté comme tel. Si vous établissez un budget à partir de cette page, établissez-le à partir d’un chiffre que vous relevez vous-même le jour où vous vous engagez — et si vous comparez deux écrits de semaines différentes, vérifiez les dates de capture avant de conclure qu’un modèle est devenu moins cher.

Lequel appellerais-tu vraiment

Commençons par le point dérangeant : OrcaRouter n’achemine aucun de ces deux modèles. Step 5 Preview est accessible via l’API propre à StepFun et une poignée de plateformes tierces, et Nemotron 3 Ultra est servi depuis les points de terminaison de NVIDIA ainsi que par plusieurs fournisseurs, et vous pouvez vérifier ces deux affirmations dans notre catalogue au moment même où vous les lisez.

Ce qui reste, c'est la forme de la dépendance plutôt que le choix du modèle, et c'est le seul endroit où une couche de routage justifie ici sa raison d'être. Un aperçu accessible uniquement par API sur le chemin d'un seul fournisseur est précisément la configuration où un mauvais après-midi chez le prestataire devient votre panne, et l'assurance à peu de frais consiste en un plan de contrôle capable de basculer une requête vers une solution de repli qualifiée dès qu'un chemin de fournisseur se dégrade. C'est à cela que sert le basculement automatique : non pas comme substitut à Step 5 Preview, mais comme l'élément que vous placez devant les modèles que vous pouvez réellement appeler, afin qu'un point de terminaison propre à un fournisseur ne soit jamais la seule voie vers la production. Le même catalogue qui permet cela regroupe plus de 200 modèles derrière une seule clé et une seule facture, avec le prix public des fournisseurs répercuté à 0 % de marge — ce qui constitue l'autre moitié de l'argument, car toute modification de la grille tarifaire en amont est effective de notre côté le jour même, et non à la prochaine renégociation de contrat.

Si aucun des deux modèles n’est celui que vous appellerez, voici la version courte. Choisissez Step 5 Preview lorsque vous voulez le score, l’entrée vidéo et image et la remise de 90 % sur le cache, et acceptez que vous louez un aperçu sans licence sur les poids et avec un checkpoint d’octobre que vous n’avez pas encore vu. Prenez Nemotron 3 Ultra lorsque les poids comptent plus que le score — pour des contraintes on-premise, pour le fine-tuning, pour une licence que vous pouvez lire — et budgétisez la baie avant de budgétiser les tokens, car à 0,60 $ le million de tokens d’entrée, un déploiement de 550 milliards de paramètres n’est bon marché que si quelqu’un d’autre paie déjà pour les GPU.

Ce qu'il faut surveiller, c'est le 15 octobre. Si StepFun publie le checkpoint BF16 promis, l'asymétrie centrale de cet article — que seul l'un de ces deux soit un téléchargement — cesse d'être vraie, et les vingt et un points d'indice deviennent beaucoup plus difficiles à écarter. Si la date est repoussée, l'argument en faveur du modèle à poids ouverts se renforce par défaut, ce qui est une étrange façon pour un écart de capacités de se combler, et une façon très courante.