Carte de titre générée intitulée « Step 5 Preview vs Gemini 3.1 Pro — deux previews, à sept mois d'intervalle », avec une frise chronologique indiquant Gemini 3.1 Pro Preview au 19 février 2026, toujours en preview, et Step 5 Preview au 20 septembre 2026, poids attendus le 15 octobre. En dessous, deux cartes : Step 5 Preview avec AA Index 44, entrée texte et image, et temps jusqu'au premier token de 2,96 s ; Gemini 3.1 Pro Preview avec AA Index 30, entrée texte, image, audio, vidéo et fichier, et temps jusqu'au premier token de 35,72 s. Un pied de page indique « Les deux selon Artificial Analysis Intelligence Index v4.3.2. »
Guides & Insights

Step 5 Preview vs Gemini 3.1 Pro : deux modèles appelés Preview, à sept mois d'intervalle

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tous deux Step 5 Preview et Gemini 3.1 Pro portent le mot preview, et le mot ne signifie pas la même chose pour l'un ou pour l'autre. StepFun a annoncé Step 5 Preview le 20 septembre 2026, avec l'API ouverte, les poids prévus pour le 15 octobre, et un dépôt BF16 sur Hugging Face ne contenant rien d'autre qu'un .gitattributes. L'autre est distribué sous le nom de gemini-3.1-pro-preview dans l'API et sous celui de « Gemini 3.1 Pro Preview » sur chaque classement depuis le 19 février 2026, traitant du trafic de production pendant sept mois sans que l'étiquette ne soit jamais retirée. L'un est un véritable aperçu de quelque chose d'inachevé. L'autre est une convention de nommage attachée à un produit fini. Les comparer sur le même axe revient à décider laquelle de ces deux choses vous achetez réellement, et la réponse au second ordre — que le modèle encore appelé « preview » après sept mois soit le plus prévisible des deux — est la partie à retenir dans une décision d'achat.

Ce que dit le même conseil

Artificial Analysis les évalue tous les deux sur l’Intelligence Index v4.3.2, dix évaluations. C’est le seul endroit où ces deux-là ont été mesurés par la même main, et l’écart est plus grand que ne le suggèrent les supports des fournisseurs de part et d’autre.

• Indice d'intelligence — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30

• Classement — Step 5 Preview 24e sur 200 modèles vs Gemini 3.1 Pro Preview 69e sur 200

• Prix par million de tokens — Step 5 Preview 1,00 $ en entrée / 2,70 $ en sortie contre Gemini 3.1 Pro 2,00 $ en entrée / 12,00 $ en sortie

• Remise de cache — Step 5 Preview 95 % vs Gemini 3.1 Pro 90 %

• Vitesse de sortie — Step 5 Preview 99,8 tokens/s vs Gemini 3.1 Pro 118,9 tokens/s

• Temps jusqu’au premier token — Step 5 Preview 2,96 s contre Gemini 3.1 Pro 35,72 s

• Contexte — les deux à 1 M de tokens ; notre catalogue répertorie Gemini 3.1 Pro avec un plafond de sortie de 65 K, StepFun n’en a pas publié.

• Modalités d’entrée — Step 5 Preview : texte et image. Gemini 3.1 Pro : texte, image, audio, vidéo et fichier. Les deux ne produisent que du texte

• Poids — Step 5 Preview fermé aujourd’hui, point de contrôle BF16 prévu le 15 octobre ; Gemini 3.1 Pro propriétaire tout au long

Un écart de 14 points sur une échelle où le sommet du classement se situe à 53 est important, et il faut le signaler à côté de ce qui le rend étrange : les propres chiffres d’évaluation publiés par Google pour ce modèle sont excellents. Le fournisseur annonce 77,1 % sur ARC-AGI-2, 82,8 % sur sa suite multimodale, 94,1 sur GPQA Diamond et 47,0 sur Humanity’s Last Exam. Ce ne sont pas là des chiffres faibles. Ils sont aussi ceux de Google, exécutés sur les propres harnais de Google, et ils mesurent des capacités spécifiques plutôt que l’agrégat que note l’indice. Les deux ensembles de chiffres peuvent être exacts en même temps. Quand l’évaluation phare d’un fournisseur et un composite indépendant divergent à ce point, c’est le composite qui doit servir de référence pour planifier une charge de travail de production, car c’est lui qui pénalise le modèle pour les éléments que le fournisseur n’a pas choisi de mesurer.

Les deux lignes consacrées à la vitesse méritent d’être lues ensemble plutôt que séparément. Gemini 3.1 Pro génère des tokens 19 % plus vite une fois qu’il démarre — 118,9 contre 99,8 — et met 35,72 secondes à démarrer, contre 2,96 pour Step 5 Preview. C’est le profil d’un modèle qui délibère avant d’émettre. Pour une tâche par lots où aucun humain n’attend, le générateur plus rapide l’emporte en débit. Pour une boucle d’agent effectuant des dizaines d’appels dépendants, une différence d’un facteur douze sur le temps jusqu’au premier token fait la différence entre un outil interactif et une file d’attente.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Le seul axe sur lequel Gemini l’emporte haut la main

La modalité n’est pas une note de bas de page dans cette comparaison. Gemini 3.1 Pro accepte le texte, les images, l’audio, la vidéo et des fichiers arbitraires, et Step 5 Preview accepte le texte et les images. Si votre pipeline implique un enregistrement d’écran, un enregistrement d’appel, un ensemble de PDF ou un flux vidéo, un seul de ces deux modèles peut accepter l’entrée, tout court, et l’écart de 14 points à l’indice est sans importance, car l’autre modèle ne peut pas répondre à la question.

Cette asymétrie détermine davantage de charges de travail réelles que ne le font les tableaux de benchmark. L’analyse vidéo, l’analyse de réunions, la transcription audio avec raisonnement et les flux de travail documentaires bâtis sur des fichiers numérisés sont tous des cas où l’étendue de Gemini 3.1 Pro en fait le seul candidat sur cette page. C’est aussi pourquoi le modèle est resté en production pendant sept mois sous une étiquette d’aperçu : les charges de travail qu’il prend en charge sont celles qu’un modèle texte et image plus récent ne peut pas déloger.

Pour le travail sur texte et image, le calcul s'inverse. Step 5 Preview a 14 points d'avance sur l'agrégat, est environ deux fois plus rapide sur le prix des entrées et 4,4 fois moins cher sur les sorties, et répond en un douzième du temps. Sur une charge de travail d'extraction de documents ou de conversation sur captures d'écran, il n'y a aucune raison de payer le supplément et d'attendre les onze secondes de délibération en plus.

Là où la tarification est moins uniforme qu’elle n’y paraît

Les prix affichés minimisent l'écart, et la raison tient à une limite de palier plutôt qu'à un tarif.

Les tarifs de 2,00 $ et de 12,00 $ de Gemini 3.1 Pro s’appliquent jusqu’à 200 000 jetons d’entrée. Au-delà, les deux tarifs passent à 4,00 $ et 18,00 $ — une augmentation de 50 % sur la sortie qui s’applique à l’ensemble de la requête, et non seulement à la portion dépassant le seuil. Les tarifs de 1,00 $ et de 2,70 $ de Step 5 Preview n’ont pas de palier publié ; le prix est le prix, quelle que soit la longueur permise par la fenêtre de contexte.

Les deux modèles annoncent un contexte de 1 M de tokens, ce qui vous invite donc à construire des pipelines à contexte long. Sur l’un d’eux, une requête de 300 000 tokens coûte deux fois ce que la grille tarifaire indique ; sur l’autre, ce n’est pas le cas. C’est un avantage structurel pour Step 5 Preview, précisément dans la catégorie pour laquelle StepFun l’a conçu — le travail agentique à long horizon avec un contexte volumineux et référencé de façon répétée — et il est amplifié par la remise sur le cache, où les 95 % de Step 5 Preview contre les 90 % de Gemini 3.1 Pro creusent encore davantage l’écart sur le schéma de préfixe répété que produit une boucle d’agent.

Calculé approximativement, et signalé comme un calcul arithmétique plutôt qu’un chiffre cité : une boucle d’agent qui envoie un contexte de 250 000 tokens à chacun de quarante tours représente dix millions de tokens d’entrée. Au tarif au-delà de 200 K de Gemini 3.1 Pro, avec le cache qui absorbe le préfixe répété, cela représente une hausse notable par rapport à ce qu’implique le tarif catalogue de 2,00 $. Au tarif forfaitaire de 1,00 $ de Step 5 Preview, avec une remise de cache plus profonde, la même boucle coûte moins cher et, plus important encore, coûte quelque chose que l’on peut prévoir à partir de la grille tarifaire sans devoir d’abord lire le tableau des paliers.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Gemini 3.1 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, time to first token 2.96s, context 1M tokens with no published output cap, and input text and image. The right column gives Gemini 3.1 Pro Preview the rows AA Index 30, price $2.00 / $12.00, $4.00 / $18.00 above 200K input, cache discount 90%, time to first token 35.72s, context 1M tokens with a max output of 65K, and input text, image, audio, video and file. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; Gemini ARC-AGI-2 and multimodal figures are vendor-reported.'

La disponibilité est la différence discrète

Gemini 3.1 Pro est appelable depuis sept mois via l'API de Google et, plus utile pour la planification, via plusieurs fournisseurs indépendants — ce qui rend une valeur de latence p50 significative plutôt qu'anecdotique. Step 5 Preview a ouvert son API le 20 septembre et n'a exactement qu'une seule source. Un point de terminaison à source unique, vieux de quelques jours, est le composant le moins prévisible que l'on puisse placer sur un chemin de production, non pas parce que le modèle est mauvais, mais parce que personne ne connaît encore sa courbe de capacité.

Voilà l'argument en faveur du routage plutôt que du choix. Gemini 3.1 Pro Preview figure dans notre catalogue à 2,00 $ et 12,00 $ avec le palier tarifaire transmis sans modification, et les modèles auxquels il est comparé se trouvent juste à côté, derrière une seule clé pour plus de 200 modèles, avec le prix catalogue du fournisseur transmis à 0 % de marge. Step 5 Preview ne figure pas sur cette liste — il tourne sur l'API propre à StepFun et, tant que les poids ne sont pas disponibles, c'est le seul endroit où il tourne. Le basculement automatique est ce qui permet de tester sans risque un aperçu vieux de quelques jours plutôt que d'en faire un pari : gardez le chemin de production sur un modèle qui a fait ses preuves, envoyez le gros du texte et des images à Step 5 Preview pendant que vous l'évaluez sur votre propre trafic, et laissez le repli tenir quand le point de terminaison de l'aperçu se dégrade. Il n'y a pas de second contrat ni de SDK distinct pour les modèles que nous routons, donc un changement de tarif de Google apparaît sur votre facture sous la forme du chiffre actuel plutôt qu'au renouvellement.

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview at www.orcarouter.ai/models/google/gemini-3.1-pro-preview, showing the model id google/gemini-3.1-pro-preview with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context, a 65K max output and text output, input pricing of $2.00 and output pricing of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, 109.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Lequel achetez-vous réellement ?

Si votre travail arrive sous forme de vidéo, d’audio ou de fichiers, Gemini 3.1 Pro est le seul modèle de cette page capable de les accepter, et l’écart d’index n’entre pas dans la décision. Sept mois en production avec l’étiquette « preview » toujours attachée est un signal de stabilité, pas un avertissement : la convention de nommage perdure parce que Google n’a jamais eu besoin de la modifier, et le modèle se comporte comme le cheval de trait de production qu’il est.

Si votre travail porte sur du texte et des images en volume avec un large contexte répété, Step 5 Preview est en tête sur chaque métrique qui compte — 14 points d'indice, moitié prix en entrée, un tarif de sortie 4,4 fois moins cher, pas de falaise tarifaire, une remise de cache plus importante, et un temps jusqu'au premier token mesuré en secondes plutôt qu'en une demi-minute. Ce que vous achetez là, c'est un point de terminaison à source unique vieux de quelques jours, sans licence publiée ni plafond de sortie publié, ce qui est un risque réel et circonscrit.

Ce qu'il faut surveiller, ce n'est pas l'indice. C'est de savoir si StepFun publie un plafond de sortie en même temps qu'une fenêtre de contexte de 1 M de tokens, car l'annonce du fournisseur reste muette à ce sujet et une configuration tierce distincte qui a circulé pendant la fuite mentionnait un contexte de 350 000 avec un plafond de sortie de 64 000 — un produit sensiblement différent de celui figurant sur la liste de prix. Le plafond de 65 K de Gemini 3.1 Pro, tel que notre catalogue le répertorie, n'est pas généreux non plus, mais il est indiqué, et une limite annoncée est une limite en fonction de laquelle on peut concevoir.