
Step 5 Preview vs Qwen 3.8 Max Prime : Un point d'indice, quatre dollars et trente-huit cents
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Commencez par ce qu'un moteur de recherche ne vous dira pas. Qwen 3.8 Max Prime n'est pas un modèle. C'est une voie de service — les mêmes Qwen3.8-Max poids que l'éditeur a fait passer en disponibilité générale le 3 août 2026, vendus sous un second identifiant de modèle à exactement deux fois le tarif international. Step 5 Preview, le vaisseau amiral fermé de StepFun, a ouvert son API le 20 septembre 2026 et est un modèle au sens ordinaire : un point de terminaison, un prix, un ensemble de poids que vous ne pouvez pas détenir. La version honnête de cette confrontation oppose donc un modèle mesuré à un niveau non mesuré, et l'arithmétique qui en découle est plus crue que ce que l'un ou l'autre des éditeurs mettrait sur une diapositive. Sur l'indice indépendant Artificial Analysis Intelligence Index, les deux sont séparés d'un point, 44 contre 45, et sur ce que coûte une tâche menée à bien, ils sont séparés de 1,03 $ contre 5,41 $. Un point, quatre dollars et trente-huit cents, par tâche — et c'est avant même d'avoir payé quoi que ce soit de la vitesse pour laquelle Prime facture réellement.
Ce qui suit est une décomposition de ce nombre : d’où il vient, pourquoi le Qwen ID standard est déjà la moitié la plus chère de la comparaison avant même que Prime ne double quoi que ce soit, et ce que les quatre dollars supplémentaires par tâche achètent — et n’achètent pas.
Le nom fait le travail que le produit ne fait pas.
Alibaba a annoncé Prime — 优速模式, mode rapide — lors de la Conférence Yunqi le 22 septembre 2026 et l'a publié sous forme de ligne sur la grille tarifaire de Model Studio. La documentation d'Alibaba elle-même est sans ambiguïté sur ce qui change : la vitesse de sortie passe à 1,5 à 2 fois celle de l'API standard et, selon les termes du fournisseur, les capacités et les restrictions d'utilisation sont identiques au modèle d'origine. Aucun nouveau nombre de paramètres, aucun nouveau contrat de point de terminaison, aucune capacité que l'ID standard ne possède pas. Vous changez le nom du modèle dans le corps de la requête et vous êtes sur la voie rapide.

Cela transforme le terme de recherche en piège. Quelqu'un qui cherche un modèle phare Qwen plus récent que Qwen3.8-Max tombe sur « Prime » et l'interprète comme un numéro de version. C'est un prix. Tout ce que le nom suggère en matière de capacités est fourni par Qwen3.8-Max lui-même : un modèle à mélange d'experts clairsemé de 2,4 billions de paramètres, avec environ 95 milliards de paramètres actifs par token, 512 experts par couche, et un contexte de 983 616 tokens sur la configuration testée par le comité indépendant.
Step 5 Preview n'a pas d'ambiguïté équivalente, et il a le problème inverse. StepFun l'annonce à environ 600 milliards de paramètres au total avec 27 milliards actifs, entrée texte, image et vidéo, une fenêtre de contexte de 1 M de tokens et un plafond de sortie documenté de 64 000 tokens, avec un effort de raisonnement sélectionnable sur faible, moyen ou élevé. Il est propriétaire. Un checkpoint BF16 a été promis pour le 15 octobre 2026 et n'a pas été livré ; des miroirs communautaires d'une version BF16 circulent sur Hugging Face depuis le jour de l'ouverture de l'API, mais les ré-uploads ne constituent pas une publication et StepFun n'a publié aucune annonce de poids ouverts.
Ainsi, le duo est véritablement déséquilibré avant même qu'un seul benchmark ne soit publié : un modèle en aperçu qui pourrait devenir un téléchargement, face à un palier de service re-tarifé d'un modèle qui ne le deviendra pas.
Combien coûte un point d'indice
Les deux modèles ont été exécutés par le même évaluateur indépendant, et c’est ici que la comparaison devient inconfortable pour l’argument du « moins cher par token ». À lire le 10 octobre 2026 :
• Indice — Step 5 Preview 44, bien au-dessus d'une médiane de 26 pour les modèles comparables. Qwen3.8-Max sur la build 0902, 45. Un point.
• Coût par tâche d’indexation terminée — 1,03 $ contre 5,41 $. Plus de cinq fois mieux.
• Prix de sortie — 2,70 $ contre 6,00 $ par million de tokens sur l’ID standard, qui passe à 9,902 $ dès que vous passez à Prime. Step 5 Preview est 2,2 fois moins cher que le standard et 3,7 fois moins cher que Prime.
• Prix d’entrée — 1,00 $ contre 2,00 $ standard et 3,301 $ sur Prime. L’image miroir de la colonne de sortie, et celle qui compte davantage une fois qu’on a lu la ventilation des coûts ci-dessous.
• Hit de cache — 0,10 $ par million de tokens sur Step 5 Preview, une remise de 90 % ; 0,25 $ sur Qwen3.8-Max, une remise de 87,5 % que la page du fournisseur elle-même arrondit à 88 %.
• Tokens de sortie par seconde — 87 contre 35,4. Ici, c'est Qwen le lent, et d'un facteur d'environ deux et demi.
Les colonnes par token et la colonne par tâche ne concordent pas, et c'est la colonne par tâche qu'il faut croire, pour une raison qui n'apparaît que si vous ouvrez le détail des coûts. Lors de l'exécution d'index de Step 5 Preview, sur 1,03 $, 0,85 $ concernent le côté entrée et 0,17 $ le côté sortie. Pour celle de Qwen3.8-Max, sur 5,41 $, 4,76 $ concernent le côté entrée et 0,65 $ le côté sortie. Les prix affichés sont séparés d'un facteur d'environ deux ; les factures par tâche le sont d'un facteur cinq, parce que l'exécution de Qwen a fait passer environ 9,9 milliards de tokens d'entrée dans le harness, contre 5,5 milliards pour Step 5 Preview, et parce que l'essentiel de ce volume est du trafic de cache relu à la remise accordée par le fournisseur plutôt qu'au tarif affiché.
Step 5 Preview est décrit par le classement comme très verbeux, à environ 160 millions de tokens de sortie sur l'ensemble de la suite, contre une médiane de 82 millions — et Qwen3.8-Max est décrit dans exactement les mêmes termes, à environ 190 millions contre la même médiane. Ni l'un ni l'autre n'est un modèle qui répond brièvement. Si c'est la longueur de sortie que vous espériez optimiser, aucune des deux colonnes ne vous aide.

La comparaison a un trou, et ce trou a la forme de Prime
Chaque donnée de la section précédente a été mesurée sur le Qwen3.8-Max ID standard. Aucune d’entre elles n’a été mesurée sur Prime.
Ce n'est pas un détail technique. Toute la proposition de Prime est que les tokens arrivent plus vite, et le seul chiffre de vitesse du tableau pour cette famille est celui de l'ID standard : 35,4 tokens de sortie par seconde — de loin le plus lent des trois ID évoqués ici, et la seule ligne où Qwen3.8-Max n'est pas seulement cher mais visiblement en deçà des performances attendues. Si Prime atteint le haut de la fourchette annoncée par Alibaba, ce 35,4 devient quelque chose comme 70, toujours en dessous des 87 de Step 5 Preview, tout en coûtant 3,7 fois plus cher par token de sortie. S'il atteint le bas de la fourchette, il devient environ 53.
Il s'agit d'estimations fondées sur un multiplicateur annoncé par le fournisseur, et non sur des mesures, et elles devraient être présentées comme telles. Personne, parmi ceux que nous avons pu trouver, n'a publié de test de débit indépendant du mode Prime. Le chiffre de 1,5 à 2× est celui d'Alibaba lui-même, et c'est la seule allégation porteuse qui sous-tend l'ensemble du palier.
Le seul détail structurel qui plaide en faveur de Prime est la règle de limitation de débit, et il est facile de la manquer. La documentation d'Alibaba indique que, sous Prime, lorsque le volume d'appels atteint la limite de débit, si la plateforme dispose encore de ressources disponibles, la requête n'est pas limitée — ainsi le débit qui vous est accessible ne descend pas en dessous de la limite annoncée. C'est un plafond souple avec un plancher ferme : en cas de contention, vous obtenez la limite ; en période de capacité inutilisée, vous pouvez obtenir davantage. Pour une boucle d'agent qui envoie des dizaines d'appels séquentiels, cela compte davantage que la médiane, car c'est l'appel le plus lent qui détermine le moment où la boucle se termine. C'est aussi l'explication la plus claire de la raison pour laquelle Prime existe en tant que produit. Alibaba vend une position dans la file d'attente à partir d'une capacité qu'il a déjà construite, et facture le double pour le droit d'être servi en premier.
Ce que disent les deux grilles tarifaires quand on les met côte à côte
Alibaba publie ses lignes Qwen côte à côte, ce qui rend l’arithmétique du palier inhabituellement limpide. Sur la page internationale, la ligne Prime indique 3,301 $ en entrée et 9,902 $ en sortie par million de jetons, contre 1,65 $ et 4,951 $ pour l’ID standard et pour son pin 0902. Cela fait exactement 2,0 sur les deux colonnes — non pas une approximation arrondie, mais le rapport littéral des chiffres publiés. La page de tarification en anglais de StepFun indique Step 5 Preview à 1,00 $ en entrée, 0,10 $ en cas de succès de cache et 2,70 $ en sortie, l’entrée en cas d’échec de cache incluant le coût d’écriture de nouveau contenu dans le cache. Le chiffre de succès de cache publié par le fournisseur correspond à une remise de 90 % ; le tableau indépendant enregistre 95 % à partir des mêmes sources, et il est utile de savoir lequel des deux vous utilisez comme référence pour votre modélisation.
Placez les trois cartes dans une seule colonne, et la forme est claire. Sortie de Prime, 9,902 $. Sortie de Standard Qwen, 6,00 $ sur le registre du tableau et 4,951 $ sur la page internationale d'Alibaba elle-même. Sortie de Step 5 Preview, 2,70 $. Et sur la voie bon marché que personne ne promeut, la lecture du cache de Step 5 Preview est de 0,10 $ contre 0,25 $ pour Qwen — ce qui compte davantage que la colonne de sortie pour toute charge de travail qui répète son préfixe.
Un avertissement au sujet des chiffres périmés, car les tarifs de cette famille ont été révisés plus d'une fois en sept semaines. Les 2 $ en entrée et 6 $ en sortie largement cités pour Qwen3.8-Max correspondent au montant phare du lancement d'août, et c'est encore ce qu'affiche l'onglet Singapour d'Alibaba. Les lignes « international » et « global » affichent désormais 1,65 $ et 4,951 $. Si vous modélisez les dépenses, utilisez la grille tarifaire de votre région et relisez-la le jour où vous vous engagez.
Deux façons de lire le 2×
Parce que Prime est le même modèle à deux fois le prix du standard ID, le surcoût est facile à chiffrer et difficile à justifier. En haut de la gamme d’Alibaba, vous payez 2× pour 2× la vitesse, ce qui est neutre en coût par seconde de latence supprimée. En bas, vous payez 2× pour 1,5×, soit un surcoût de 33 % par seconde gagnée. Aucune des deux extrémités n’est déraisonnable pour du travail interactif ; aucune n’est défendable pour un traitement par lots nocturne. C’est pourquoi le conseil standard concernant ce niveau — les appels sensibles à la latence sur Prime, tout le reste sur le standard ID — est aussi le bon conseil.
La comparaison avec Step 5 Preview est le moment où le raisonnement change de forme, et c'est la partie que la formulation « vs » rend visible. Prime n'entre pas du tout en concurrence avec Step 5 Preview sur le prix. L'ID standard est déjà plus cher par token de sortie que ne l'est Step 5 Preview, cinq fois plus cher par tâche terminée, et il obtient un point de plus. Prime multiplie le côté coût d'une équation déjà perdante et rachète de la vitesse dont Step 5 Preview dispose en plus grande quantité, gratuitement. Si c'est de la vitesse qu'il vous faut dans cette famille, l'affirmation honnête est que le modèle de l'autre côté de cette page vous donne 87 tokens par seconde à 2,70 $ par million de tokens de sortie, et la voie rapide vous donne une fourchette qui culmine, selon les propres chiffres d'Alibaba, autour de 70 à 9,902 $.
Ce n'est pas un argument qui montre que Step 5 Preview l'emporte. C'est un argument selon lequel la valeur de Prime est entièrement interne à la propre gamme de produits d'Alibaba, et selon lequel sa justification repose sur des charges de travail où l'avance d'un point d'indice de Qwen3.8-Max, son contexte de 983 616 jetons ou son profil de tâches différent accomplissent un travail qu'un contexte de 1 M de jetons de Step 5 Preview n'accomplit pas. Ce qui est la comparaison que personne ne peut encore exécuter, parce que la ligne Prime n'existe sur aucun classement indépendant.

Ce que cela signifie pour un acheteur
Ni l’un ni l’autre ne figure sur OrcaRouter. Step 5 Preview est accessible via l’API propre à StepFun et une poignée de plateformes tierces ; Prime est un niveau d’Alibaba Cloud Model Studio exposé sur un point de terminaison limité à l’espace de travail ; et vous pouvez vérifier ces deux affirmations en les confrontant à notre catalogue dans la minute même où vous les lisez, ce qui constitue un meilleur test que de nous croire sur parole.
La route What we do est un produit différent de la même famille, et il se trouve que c’est celui vers lequel l’arithmétique de cet article ne cesse de revenir. Le Qwen3.8-Max standard et son pin daté Qwen3.8-Max-0902 figurent au catalogue sous la même clé que leurs frères Qwen3.8-Max-Preview, Qwen3.8-Flash et Qwen3.8-27B, aux côtés de plus de 200 autres modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge. Deux choses en découlent, et toutes deux pèsent sur la décision ci-dessus. La première est qu’un changement de grille tarifaire chez Alibaba apparaît de notre côté le jour même où Alibaba le publie — précisément la propriété que vous recherchez chez un fournisseur qui a déjà révisé les prix de cette famille deux fois en sept semaines. La seconde est que votre base de référence cesse d’être un pari sur un seul fournisseur : l’ID standard est le palier que vous êtes le plus susceptible de conserver sur votre chemin par défaut, et le fait de le maintenir derrière une couche de routage plutôt qu’une intégration directe est ce qui rend la décision Prime réversible par point de terminaison plutôt que par contrat.
Si vous hésitez entre les deux noms figurant dans le titre de cet article, la distinction est simple. Optez pour Step 5 Preview lorsque vous voulez le score, l’entrée vidéo et image et la remise de 90 % sur le cache, et acceptez que vous louez un aperçu dont le checkpoint est une promesse pour le 15 octobre plutôt qu’une licence. N’optez pour Qwen 3.8 Max Prime que si vous avez déjà fait le choix de Qwen3.8-Max et que vous avez mesuré, sur vos propres prompts, que les 35 tokens par seconde de l’ID standard sont ce qui vous coûte de l’argent — et évaluez cette décision par rapport au 2× plutôt qu’au 1,5×, car le haut de la gamme d’un fournisseur n’est pas le chiffre que vous verrez en production.
La mesure qui permettrait de trancher n’existe pas, et il vaut la peine de le dire sans détour plutôt que de l’enjoliver. Il faut que quelqu’un fasse passer Prime dans un harnais de test qui exécute aussi Step 5 Preview, publie une distribution de débit plutôt qu’un multiplicateur, et place un chiffre de coût par tâche à côté du point d’indice qu’il achète. D’ici là, les seuls chiffres que les deux parties partagent sont les deux grilles tarifaires, et elles disent la même chose dans des directions opposées : la voie rapide est la manière la plus coûteuse d’acheter un jeton Qwen3.8-Max, et la plus lente d’acheter une seconde de temps d’horloge mural par rapport à ce que l’alternative facture pour la même seconde.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
