
Step 5 Preview vs GPT-6 Astra : Dix fois le prix d’entrée pour neuf points d’indice
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ces deux modèles ont été annoncés à dix-sept jours d'intervalle et affichés à des tarifs venus de planètes différentes. Step 5 Preview, le modèle à mélange d'experts clairsemé de 600 milliards de paramètres de StepFun annoncé le 20 septembre 2026, facture 1,00 $ par million de tokens d'entrée et 2,70 $ par million de tokens de sortie. GPT-6 Astra, le modèle phare de l'éditeur sorti le 3 septembre 2026, facture 10,00 $ et 50,00 $ pour les mêmes unités en dessous d'un seuil de 272 K tokens en entrée — et 20,00 $ et 75,00 $ au-dessus. Cela représente dix fois le prix d'entrée et environ dix-huit fois le prix de sortie pour un modèle qui obtient neuf points de plus sur l'Intelligence Index indépendant, 53 contre 44. Qu'Astra soit meilleur ne fait aucun doute. Savoir si l'écart vaut trente dollars de plus par million de tokens de sortie pour votre charge de travail, en revanche, est la vraie question, et la réponse change deux fois au fil de cet article.
À quoi sert chaque modèle
Step 5 Preview est conçu et commercialisé pour le travail agentique : codage par IA, ingénierie logicielle, travail intellectuel professionnel, finance. L'architecture est optimisée pour cela — 600B de paramètres au total, avec environ 27B actifs par token, un contexte de 1M de tokens, une entrée texte et image, et un raisonnement avec réflexion étendue. StepFun a sauté toute la gamme Step 4.x pour en arriver là, passant directement de Step-3.7-Flash à Step 5.
GPT-6 Astra est le modèle phare polyvalent d’OpenAI : un contexte de 1 M de tokens, jusqu’à 128 K de tokens en sortie, une entrée en texte, images et fichiers, une sortie en texte, une date de coupure des connaissances au 30 avril 2026, et la prise en charge du raisonnement, du codage et des workflows agentiques. C’est le modèle vers lequel une entreprise se tourne lorsque la réponse doit être exacte et que la facture de tokens n’est pas la contrainte déterminante.
• Indice d’intelligence — Step 5 Preview 44 vs GPT-6 Astra 53
• Paramètres — Step 5 Preview : 600B au total / 27B actifs vs GPT-6 Astra non divulgué
• Contexte et plafond de sortie — tous deux avec un contexte de 1 M de tokens ; Astra indique une fenêtre de 1 050 000 tokens et un plafond de sortie de 128 K, StepFun n’a publié aucun plafond de sortie
• Modalité d'entrée — texte et images vs texte, images et fichiers
• Vitesse de sortie — Step 5 Preview 99,8 tokens/sec vs GPT-6 Astra 59,3 tokens/sec
• Prix pour 1 M de tokens — 1,00 $ en entrée / 2,70 $ en sortie, contre 10,00 $ en entrée / 50,00 $ en sortie en dessous de 272 K en entrée, puis 20,00 $ / 75,00 $ au-dessus
• Cache — Step 5 Preview : 95 % de réduction contre GPT-6 Astra, qui offre une réduction de 90 % sur la lecture avec un tarif d’écriture en cache de 12,50 $ par million
• Coût par tâche de l'indice Intelligence — Step 5 Preview 0,71 $ vs GPT-6 Astra 3,26 $

La facture, ligne par ligne
La tarification de Step 5 Preview est uniforme et bon marché : 1,00 $ en entrée, 2,70 $ en sortie, avec une remise de 95 % sur le cache qui ramène l'entrée mise en cache à près de 0,05 $ par million de tokens. Avec une répartition 7:2:1 entre cache-hit, entrée et sortie — la convention que ce blog utilise pour le trafic d'agents —, le tarif combiné s'établit à près de 0,51 $ par million de tokens, et le coût par tâche d'Intelligence Index ressort à 0,71 $, soit 27e sur 200. La réserve, c'est la verbosité : le modèle a produit 160 M de tokens en sortie sur cet Index, contre une médiane de 92 M, si bien que les décomptes bruts de tokens dépassent ce que le prix affiché laisse entendre.
La tarification de GPT-6 Astra se fait par paliers, et le palier est la partie qui mérite une lecture attentive. En dessous de 272 K jetons d'entrée par requête, c'est 10,00 $ et 50,00 $ ; au-dessus, 20,00 $ et 75,00 $. Le palier est déterminé par le nombre de jetons d'entrée de chaque requête elle-même, ce qui compte plus qu'il n'y paraît pour un modèle vendu sur un contexte de 1 M de jetons — un seul appel à grand contexte franchit la limite et double le tarif pour toute la requête. Les lectures de cache coûtent 1,00 $ par million, soit une remise de 90 %, et les écritures de cache 12,50 $ par million. Avec la même répartition 7:2:1, le tarif mixte avoisine 7,70 $ par million de jetons, et le coût par tâche Index est de 3,26 $, soit le 71e sur 200.
Astra va dans l'autre sens en matière de verbosité, et c'est le modèle concis ici : 60 M de jetons de sortie sur l'Index contre 160 M pour Step 5 Preview, 27e sur 200 pour cette mesure. Moins de jetons à un tarif plus élevé réduit l'écart d'une manière que le multiple brut exagère. Il ne le comble pas — le coût par tâche intègre déjà la verbosité, le comportement du cache et la tarification, et 3,26 $ contre 0,71 $ reste un écart de 4,6 fois.
Ce que les neuf points d’indice permettent d’acheter
Les chiffres phares d'Astra proviennent d'OpenAI elle-même et n'ont pas été reproduits : 96,1 sur GPQA Diamond, 72,6 % sur OSWorld 2.0, 97,6 % sur FrontierMath Tier 4, 57,2 % sur Humanity's Last Exam avec outils, et environ 57,9 % sur Terminal-Bench 4.0. Le chiffre d'ARC-AGI-3 est celui qu'il faut manier avec prudence — OpenAI annonce 99,9 % avec son propre harnais d'adaptateur de fournisseur et 62,7 % sur le harnais standard, et un écart de 37 points entre harnais en dit au moins autant sur le harnais que sur le modèle.
Les chiffres publiés de Step 5 Preview se situent dans la même zone sur les tâches agentiques pour lesquelles il a été conçu, et portent la même réserve : 33,3 % sur Terminal-Bench 4.0, 80,5 sur ProgramBench, 67,7 sur DeepSWE v1.1 et 49,0 sur StepCodeBench, tous provenant de StepFun et aucun reproduit indépendamment. Des fournisseurs différents, des harnais différents, aucune exécution partagée — c'est précisément pourquoi l'écart de neuf points mesuré indépendamment est un chiffre plus utile que n'importe lequel de ceux-ci.
Cet écart est réel et il n’est pas mince. Sur un classement de 200 modèles, 53 et 44 occupent respectivement la troisième et la vingt-quatrième place, et cette séparation se manifeste comme une classe de tâches différente plutôt que comme un score différent sur la même tâche : les victoires publiées d’Astra se concentrent sur le raisonnement à long horizon et l’utilisation de l’ordinateur, là où le haut du classement se détache. Si votre charge de travail se situe là, les neuf points valent plus que la facture.
Une réserve concernant le score d’Astra. Artificial Analysis révise l’Intelligence Index, et les chiffres pour un même modèle varient d’un instantané à l’autre pris à quelques semaines d’intervalle — 52,8, 53 et 54,7 apparaissent tous dans des documents publiés à propos de ce modèle au cours du même mois. Le 53 indiqué sur la page actuelle du modèle est le chiffre à utiliser, et toute comparaison qui place un ancien instantané d’Astra à côté d’un chiffre actuel de Step 5 Preview mesure avec deux règles différentes.

Vitesse et latence sont deux questions différentes.
Sur la vitesse de génération, le classement indépendant est sans équivoque : 99,8 jetons de sortie par seconde pour Step 5 Preview, contre 59,3 pour GPT-6 Astra, lui aussi plus lent que la moyenne de 70 jetons par seconde des modèles mesurés. Dans une boucle de codage interactive, c’est la différence entre une suggestion et une pause, et cela s’accumule au fil d’une session comme une remise de cache.
La latence est l'histoire la plus compliquée, et un chiffre unique induit en erreur à son sujet. Astra achemine le raisonnement avant de l'émettre, de sorte que le temps jusqu'au premier token et le temps jusqu'à une réponse utilisable ne constituent pas la même mesure, et les chiffres publiés à ce sujet varient largement selon que le raisonnement est compté ou non. Sur notre propre trafic au cours des sept derniers jours, le temps médian jusqu'au premier token de GPT-6 Astra est de 6,72 secondes, avec un 95e percentile de 10,00 secondes — le chiffre qu'un appelant expérimente réellement via notre point de terminaison. Artificial Analysis situe le temps jusqu'au premier token de Step 5 Preview à 2,96 secondes sur son propre harnais, et ces deux chiffres ne sont pas mesurés de la même manière, ils ne devraient donc pas être soustraits l'un de l'autre.
Où l'asymétrie du cache se fait réellement sentir
Les deux modèles appliquent une forte remise sur les préfixes répétés et facturent tous les deux leur écriture, et l’écart entre eux est de 20 fois en lecture. La remise de 95 % sur le cache de Step 5 Preview ramène l’entrée mise en cache à près de 0,05 $ par million de tokens. GPT-6 Astra lit le cache à 1,00 $ par million — une remise de 90 % par rapport à un tarif de base dix fois plus élevé — et l’écrit à 12,50 $ par million.
Pour une boucle d'agent qui renvoie le même prompt système et le même contexte de dépôt à chaque tour, c'est le tarif de lecture qui s'accumule, et la remise plus importante sur le modèle moins cher vaut plus que la remise plus faible sur le modèle coûteux. Le mélange d'Astra se situe encore près de 7,70 $ par million de tokens, contre les 0,51 $ de Step 5 Preview avec le même mélange 7:2:1 — un écart de quinze fois qu'une longue session ne comble pas mais creuse.
Exécuter les deux à partir d'une seule touche.
GPT-6 Astra est disponible sur OrcaRouter sous openai/gpt-6-astra aux tarifs catalogue d'OpenAI — 10,00 $ et 50,00 $ par million en dessous du seuil de 272K, 20,00 $ et 75,00 $ au-dessus — répercutés sans aucune marge, de sorte qu'un changement de prix du fournisseur est effectif de notre côté le jour même plutôt qu'au cycle de facturation suivant. Notre propre télémétrie sur sept jours pour ce point de terminaison affiche la médiane de 6,72 secondes et le 95e percentile de 10,00 secondes du délai avant premier token cités plus haut, ainsi que 277,9 M de tokens de trafic l'ayant traversé au cours de la dernière semaine.
Step 5 Preview ne figure pas dans notre catalogue et nous ne le routons pas. Il tourne sur l'API et le Studio propres à StepFun, et c'est le seul endroit où il tourne jusqu'à l'arrivée du point de contrôle du 15 octobre. Cette asymétrie n'est pas un défaut de la comparaison ; c'est la comparaison. La moitié bon marché de cette confrontation est celle qu'il faut aller appeler ailleurs, et la moitié que vous pouvez mettre en production dès aujourd'hui se trouve derrière une seule API pour plus de 200 modèles : GPT-6 Astra aux tarifs ci-dessus, GLM-5.3 à 1,26 $ et 3,96 $, DeepSeek V4 Pro, Claude Opus 5 et le reste, avec un basculement automatique entre fournisseurs qui maintient un chemin stable lorsque la capacité d'un fournisseur évolue, et le DSL de routage qui permet à une tâche de démarrer à bas coût et de monter en puissance seulement quand c'est nécessaire. Cette règle d'escalade est la vraie réponse à un écart de prix de dix fois : l'essentiel d'une charge de travail n'a pas besoin du haut du tableau, et une couche de routage est le moyen d'arrêter de payer pour la partie qui n'en a pas besoin.

Qui devrait choisir quoi
Si votre charge de travail est un agent à long horizon qui doit réussir une tâche difficile — utilisation de l’ordinateur, recherche en plusieurs étapes, travail où une mauvaise réponse coûte plus cher que les tokens —, l’avance de neuf points de GPT-6 Astra est la partie la moins chère de la décision, et la facture correspond à ce que coûte cette capacité. Utilisez-le comme cible d’escalade, pas par défaut, et surveillez le seuil de 272K : une seule requête surdimensionnée double le tarif pour tout ce qu’elle contient.
Si votre charge de travail est constituée de texte agentique à haut volume — génération de code, refactorisations, extraction structurée, la boucle interne d’un assistant de codage —, Step 5 Preview est en avance sur tout ce qui compte pour la facture et l’horloge, et neuf points d’indice survivront probablement mal au contact d’une distribution de tâches qui ne se situe pas au sommet du classement. Le hic n’est pas la performance : le modèle est propriétaire, sans licence publiée, sans autorisation d’utilisation commerciale et sans checkpoint avant le 15 octobre. Vous pouvez l’appeler ; vous ne pouvez pas le posséder, le fine-tuner ni en livrer un dérivé.
Si la réponse n'est pas évidente, le schéma est une répartition par niveau plutôt qu'un choix. Acheminez le trafic général vers un modèle de milieu de gamme et réservez Astra aux requêtes qui exigent le haut du classement — les deux extrémités de cette règle se trouvent derrière une seule clé de notre côté, de sorte que la répartition coûte une règle de routage plutôt qu'un second contrat. Payer des tarifs de modèle phare pour un travail qu'un modèle de milieu de gamme termine correctement, voilà l'erreur sur laquelle porte réellement cette comparaison.
