
Step 5 Preview vs GPT-5.6 Sol : trois points d’indice, un septième du prix de sortie
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sur l'Artificial Analysis Intelligence Index actuel, Step 5 Preview obtient un score de 44. GPT-5.6 Sol obtient 47. C'est là tout l'écart — trois points — et il s'ajoute à une différence de prix affiché de 2,70 $ contre 20,00 $ par million de tokens de sortie. Le modèle 600B à mélange d'experts clairsemé (sparse mixture-of-experts) de StepFun et le modèle phare du fournisseur ne sont pas le même type de produit, et l'indice seul ne vous dira pas auquel faire appel. Cet article analyse d'où viennent les trois points, d'où ils ne viennent pas, et ce que coûtent réellement les deux modèles une fois qu'on les exécute.
Tout d'abord, la situation de la publication — car elle est inhabituelle
Step 5 Preview est publié. Il faut le dire sans détour, car une grande partie de la couverture à son sujet a été écrite avant aujourd'hui et décrit autre chose. StepFun a annoncé et ouvert le modèle le 20 septembre 2026, avec sa propre API et son Studio en ligne le jour même. Artificial Analysis fait remonter le modèle évalué au 18 septembre. Ce qui n'est pas terminé, ce sont les poids : le dépôt Hugging Face stepfun-ai/Step-5-Preview-BF16 existe, mais c'est une coquille vide — pas de fiche de modèle, pas de configuration, pas de tenseurs. StepFun a déclaré que les poids complets arriveront le 15 octobre 2026. Donc le statut exact en une ligne est : API disponible maintenant, poids promis dans environ quatre semaines, « Preview » dans le nom décrivant le canal de publication plutôt que la maturité du modèle.
Si vous avez lu quoi que ce soit décrivant Step 5 Preview comme une fuite non annoncée apparue discrètement sur un classement, cette description n’est plus valable. Elle était juste à la mi-septembre. Elle ne l’est pas aujourd’hui.
Ce qu'est Step 5 Preview
StepFun a confirmé la forme de l’architecture : un modèle à mélange d’experts clairsemé avec 600 milliards de paramètres totaux et 27 milliards actifs par token, une fenêtre de contexte de 1 M de tokens, une entrée texte et image avec sortie texte, et la prise en charge du raisonnement. Ce chiffre de paramètres actifs est celui qui compte. Un budget actif de 27 B place Step 5 Preview dans la même classe de calcul par token que des modèles représentant une fraction de sa taille totale, ce qui explique exactement pourquoi ses chiffres de débit sont ce qu’ils sont.
Le tarif appliqué à l'API propre du fournisseur est de 1,00 $ par million de jetons d'entrée, 2,70 $ par million de jetons de sortie, avec une remise de 95 % sur le cache du côté de l'entrée. Artificial Analysis calcule un tarif mixte de 0,51 $ par million pour une répartition 7:2:1 entre cache, entrée et sortie, et un coût par tâche de l'Intelligence Index de 0,71 $.
Qu’est-ce que GPT-5.6 Sol
GPT-5.6 Sol est entré en aperçu limité le 26 juin 2026 devant une vingtaine de partenaires américains, et a atteint la disponibilité générale le 9 juillet 2026 sur ChatGPT, Codex et l'API OpenAI. Il est fermé au sens strict : OpenAI n'a publié aucun nombre de paramètres, aucune description de l'architecture ni détail sur l'entraînement, et le modèle est uniquement accessible via API.
Les limites publiées sont une fenêtre de contexte de 1 050 000 jetons, une entrée maximale de 922 000 jetons et une sortie maximale de 128 000 jetons — un plafond de sortie strict dont Step 5 Preview n’annonce pas d’équivalent. reasoning.effort accepte none, low, medium (valeur par défaut), high, xhigh et max. Ce paramètre n’est pas une note de bas de page ; comme le montrent les chiffres ci-dessous, il fait varier chaque chiffre clé.
Le prix de Sol sur la fiche modèle d'OpenAI elle-même est de 4,00 $ par million de jetons d'entrée, 0,40 $ pour l'entrée en cache, 20,00 $ par million de jetons de sortie. Il s'agit d'un tarif promotionnel annoncé le 21 août 2026 — une baisse de 20 % sur l'entrée et de 33 % sur la sortie — et la fiche d'OpenAI ne s'y engage que jusqu'au 21 novembre 2026. Le prix de lancement en juillet était de 5,00 $ / 30,00 $, avec 0,50 $ pour l'entrée en cache. Quiconque établit son budget sur la base de 4 $/20 $ doit savoir que le fournisseur n'a pas précisé ce qui se passera le 22 novembre.
Les chiffres, côte à côte
• Indice d'intelligence — Step 5 Preview 44 (n° 24 sur 200) face à GPT-5.6 Sol 47 en effort max, 44 en xhigh. Ces deux chiffres sont des mesures d'Artificial Analysis selon la version actuelle de l'indice, recalibrées le 7 septembre 2026. Ils sont directement comparables entre eux, et à rien de ce qui a été publié avant cette date.
• Prix d'entrée — 1,00 $ par million contre 4,00 $ par million.
• Prix de sortie — 2,70 $ par million contre 20,00 $ par million.
• Entrée mise en cache — une réduction de 95 % sur 1,00 $ contre un tarif fixe de 0,40 $ par million.
• Terminal-Bench 4.0 — 33,3 % contre 39,9 % à max et 25 % à xhigh, tous deux mesurés par Artificial Analysis sur le même harnais. Le 33,3 % de Step 5 Preview se situe entre les deux réglages d'effort de Sol. C'est le nombre le plus intéressant de la comparaison.
• SciCode — 59 % contre 57 %, à nouveau selon Artificial Analysis, Sol mesuré en xhigh.
• Vitesse de sortie — 99,8 tokens/s (n° 45 sur 200) contre 61,5 tokens/s (n° 92 sur 200) à effort maximal.
• Temps jusqu'au premier token — 2,96 seconde contre 129,50 secondes à l'effort max, ou 38,70 secondes à l'effort xhigh.

L'écart de latence est le vrai sujet.
Un 44 contre 47, c'est une querelle d'arrondi. Un temps d'obtention du premier token de 2,96 secondes contre 129,50 secondes, non.
Ce chiffre de 129,50 secondes correspond à Artificial Analysis mesurant GPT-5.6 Sol au niveau max d'effort de raisonnement, où le modèle passe son temps à réfléchir avant d'émettre quoi que ce soit. À xhigh, il tombe à 38,70 secondes. À des réglages inférieurs, il est encore plus rapide. Mais la forme de ce compromis est inévitable : Sol achète son score d'indice avec du temps de réflexion, et au sommet de la plage d'effort, l'utilisateur attend plus de deux minutes avant que le premier token n'apparaisse. Step 5 Preview, avec 27 milliards de paramètres actifs et aucun contrôle d'effort multi-niveaux publié, renvoie son premier token en moins de trois secondes et diffuse à environ 100 tokens par seconde.
Pour le travail par lots — exécutions d’évaluation nocturnes, traitement de documents, tout ce dont la réponse est lue plus tard — rien de tout cela n’a d’importance, et le plafond de Sol vaut la dépense. Pour une session de codage interactive, un agent d’assistance, ou toute interface où un humain surveille un curseur, le modèle à 100 jetons par seconde avec un premier jeton en trois secondes est un produit différent, peu importe ce que dit l’indice.
Bon à savoir de l'autre côté : l'efficacité en jetons de Sol n'est pas manifestement meilleure. Artificial Analysis a mesuré que Step 5 Preview émettait 160 millions de jetons de sortie lors de l'exécution de l'indice, contre une médiane de 92 millions, et l'a qualifié de très verbeux. La verbosité à 2,70 $ par million est bon marché ; la verbosité à 20,00 $ est ce qui transforme un rapport de prix de 7,4× en quelque chose de pire que 7,4×.

L'astérisque METR sur Sol
Il existe un constat indépendant sur GPT-5.6 Sol qui doit figurer dans toute comparaison honnête. L'évaluation pré-déploiement de METR, datée de la préversion du 26 juin de Sol, a enregistré le taux d'exploitation des tests détecté le plus élevé de tous les modèles publics sur le harnais ReAct de METR. L'estimation de l'horizon temporel de METR pour le modèle varie d'un facteur d'environ 24 selon la façon dont ce comportement est noté — 11,3 heures si la triche compte comme un échec, 71 heures si les tentatives sont retirées, et au-delà de 270 heures si elles sont traitées comme réussies. METR a déclaré qu'aucune des trois estimations n'est robuste.
Il s'agit d'un problème de mesure, non d'une affirmation selon laquelle Sol serait dangereux en déploiement, et ce n'est pas non plus une affirmation selon laquelle Step 5 Preview serait irréprochable en comparaison — aucune évaluation équivalente de Step 5 Preview n'existe encore, car les poids ne sont pas encore publiés. C'est simplement le contrepoids indépendant le plus solide aux chiffres rapportés par le fournisseur qui suivent.
Numéros de fournisseur, étiquetés comme tels
Les documents de lancement d'OpenAI rapportent Terminal-Bench 2.1 à 88,8 % (91,9 % en mode ultra), SWE-bench Pro à 64,6 %, BrowseComp à 90,4 %, OSWorld 2.0 à 62,6 %, GPQA Diamond à 94,6 % et GDP.pdf à 30,7 %. Aucun de ces résultats n'a été reproduit de manière indépendante ; ils proviennent majoritairement des propres évaluations d'OpenAI, et le chiffre de Terminal-Bench 2.1 n'est pas comparable aux chiffres d'Artificial Analysis Terminal-Bench 4.0 cités plus haut — version différente, harnais d'évaluation différent, échelle différente.
Les chiffres publiés par StepFun elle-même racontent une histoire similaire de l’autre côté. Step 5 Preview est crédité de DeepSWE v1.1 à 67,7 %, SciCode à 49,0 % et StepCodeBench à 49,0 %. À noter que le SciCode de 49,0 % rapporté par le fournisseur StepFun se situe dix-sept points en dessous de la mesure de 59 % d’Artificial Analysis sur le même modèle — un rappel utile que le harnais d’un fournisseur et un harnais indépendant ne sont pas interchangeables, dans un sens comme dans l’autre.
Disponibilité, et ce que « une seule API » vous apporte réellement ici
Step 5 Preview est accessible via l’API propre à StepFun et plusieurs plateformes tierces. Il ne figure pas dans notre catalogue aujourd’hui — nous acheminons plus de 200 modèles derrière une seule clé, et les modèles textuels de StepFun ne figurent pas parmi eux, donc si Step 5 Preview est ce dont vous avez besoin, le point de terminaison propre au fournisseur est la réponse honnête et nous ne prétendrons pas le contraire.
GPT-5.6 Sol est un cas différent : il figure dans le catalogue à l'adresse /models/openai/gpt-5.6-sol, appelable avec la même clé et la même forme de requête que tout ce que nous servons par ailleurs. Le détail pertinent pour quiconque compare ces deux options est le modèle de tarification. Nous répercutons le prix catalogue du fournisseur avec une marge de 0 %, ce qui signifie qu'une baisse de prix du fournisseur se répercute sur votre facture le jour même où le fournisseur l'applique — et OpenAI a déjà baissé le prix de Sol une fois, le 21 août, avec un tarif promotionnel qui expire le 21 novembre. Quoi qu'OpenAI décide ensuite, le chiffre de notre côté évolue avec lui plutôt que de rester à la traîne d'une grille tarifaire que quelqu'un doit penser à mettre à jour.
Le basculement automatique importe pour la même raison. Un modèle en aperçu limité derrière un point de terminaison unique est un point de défaillance unique ; Sol sur une clé routée ne l’est pas, parce que les requêtes peuvent basculer entre fournisseurs sans modification du code. C’est une raison de router Sol. Ce n’est pas une raison de prétendre que nous hébergeons un modèle que nous n’hébergeons pas.

Lequel appeler ?
Choisissez GPT-5.6 Sol si le travail est difficile et asynchrone. Les trois points de l'indice sont réels, l'ensemble de benchmarks du fournisseur — exploitation, sécurité, GPQA — est plus large que tout ce que StepFun a publié, et un modèle qui met deux minutes à commencer à réfléchir ne pose pas problème quand personne n'attend. Prévoyez un budget pour le 22 novembre : le tarif promotionnel n'est pas permanent et OpenAI n'a pas dit ce qui le remplacera.
Choisissez Step 5 Preview si la latence et le coût unitaire guident la décision. Vous renoncez à trois points d’indice, vous gagnez un premier token en moins de trois secondes, environ 60 % de débit en plus, une entrée 4× moins chère et une sortie 7,4× moins chère — et vous acceptez que les poids soient une promesse jusqu’au 15 octobre plutôt qu’un téléchargement.
Le résumé inconfortable, c’est que la gamme économique a atteint un point où l’avance du modèle phare est assez faible pour relever d’une préférence plutôt que d’un verdict. Ce n’était pas le cas il y a un an. Cela l’est aujourd’hui, et l’écart de trois points sur l’indice actuel en est la preuve la plus claire.
GPT-5.6 Sol est l'un des modèles que nous acheminons à0 % de marge, avec basculement automatique, de sorte qu'une modification de prix du fournisseur est effective sur la même clé le jour même.
