
Qwen3.8 Max Prime : Alibaba place une seconde grille tarifaire à côté de son produit phare
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 584 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Le 22 septembre 2026, à la conférence Yunqi de Hangzhou, la branche MaaS d'Alibaba a annoncé un niveau de service qu'elle appelle mode Prime — 优速模式 — et a placé un nouvel ID de modèle sur la grille tarifaire pour celui-ci : qwen3.8-max-prime. Cet ID n'est pas un nouveau modèle. Il s'agit de Qwen3.8-Max, le modèle phare à mélange d'experts creux de 2,4 billions de paramètres qui a atteint la disponibilité générale le 3 août 2026, diffusé via une voie plus rapide. Qwen3.8 Max Prime porte les mêmes poids, la même fenêtre de contexte, les mêmes outils et les mêmes limites d'utilisation que le modèle de base. Ce qui diffère, ce sont le débit et le prix, et le prix double environ.
C'est la deuxième fois en sept semaines qu'Alibaba modifie la manière dont Qwen3.8-Max est vendu sans changer ce qu'il est. Le 2 septembre, l'entreprise a publié une actualisation post-entraînée étiquetée Qwen3.8-Max-0902, axée sur le codage et le travail agentique, uniquement via API. Le 22 septembre a ajouté l'offre de vitesse. Aucune des deux n'était un lancement, et interpréter l'une ou l'autre comme tel vous coûtera de l'argent.

Ce qu’est réellement le mode Prime
La propre documentation d'Alibaba décrit le mode Prime comme un canal destiné aux « scénarios sensibles à la vitesse de sortie » — assistants de codage IA, raisonnement d'agent en plusieurs étapes, conversation en temps réel — et énonce clairement l'avantage : le TPS est porté à 1,5 à 2 fois celui de l'API standard. Aucun nouveau paramètre n'est à définir. Vous remplacez la valeur de model par l'ID Prime et vous êtes sur la voie rapide.
La documentation est tout aussi explicite sur ce qui ne change pas : « Les capacités prises en charge par le modèle et les restrictions d'utilisation sont les mêmes que celles du modèle d'origine. » Il n'y a donc pas de contexte plus large, pas de meilleur mode de raisonnement, pas de surface d'outils supplémentaire. C'est la même pile de service, avec plus de marge de capacité derrière elle.
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
La grille tarifaire, à lire attentivement.
La page de tarification internationale d'Alibaba présente les deux ID côte à côte, ce qui rend la comparaison particulièrement claire. Par million de jetons :
• Entrée — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65
• Sortie — qwen3.8-max-prime 9,902 $ vs qwen3.8-max 4,951 $
• Hit de cache — qwen3.8-max-prime 0,413 $ contre un tarif de lecture de cache sur l'ID standard que la même page présente comme ligne de remise
• Ratio — 2,0× à la fois en entrée et en sortie, non pas une approximation arrondie mais l’arithmétique littérale des chiffres publiés
Sur la grille tarifaire chinoise, le même facteur 2 s’applique en yuans : ¥24 en entrée et ¥72 en sortie par million pour le Prime ID, contre ¥12 et ¥36 pour l’offre standard, avec des accès au cache à ¥3.
Le chiffre de lancement largement cité pour Qwen3.8-Max est de 2 $ en entrée et 6 $ en sortie par million. C’est le titre que les articles d’août ont repris, et ce n’est pas le chiffre qui figure sur la grille tarifaire internationale aujourd’hui. Si vous modélisez des dépenses, utilisez la grille tarifaire de votre région plutôt que le titre du lancement, et vérifiez-la à nouveau avant de vous engager — Alibaba a révisé cette page deux fois depuis le 2 septembre.

La règle de limitation est la véritable fonctionnalité
La ligne que la plupart des gens survolent sans s'y arrêter est celle qui compte le plus en production. La documentation d'Alibaba Prime indique que lorsque votre utilisation atteint la limite de débit, si la plateforme dispose encore de ressources disponibles, vous ne serez pas limité, de sorte que le débit réellement à votre disposition ne descendra pas en dessous de la limite annoncée.
C’est un plafond souple avec un plancher ferme, ce qui constitue une forme différente d’une limite de palier standard. Cela signifie que le chiffre de 1,5–2× est une promesse concernant le plancher, et non un plafond de la limite supérieure : en cas de contention, vous obtenez la limite, et en cas de capacité inactive, vous pouvez obtenir davantage. Pour une boucle d’agent qui déclenche des dizaines d’appels séquentiels, cette asymétrie vaut plus que le multiplicateur brut de TPS, car c’est la latence de queue sur l’appel le plus lent qui détermine si votre workflow se termine.
Les limites dynamiques de TPM des modèles standard sont échelonnées selon les dépenses mensuelles de Model Studio — la même famille de documentation indique l’ID de base qwen3.8-max à 5 000 000, 10 000 000 et 20 000 000 TPM selon les paliers, avec une actualisation mensuelle. Prime ne supprime pas cette structure ; il change la manière dont elle mord.

Ce que personne n'a encore mesuré
Voici l’écart, en toute honnêteté. Le chiffre de 1,5–2× est annoncé par le fournisseur. Il n’existe aucune mesure indépendante du débit en Prime-mode que nous puissions trouver, et cela compte parce que les propres chiffres indépendants de la configuration standard ne sont pas flatteurs en matière de vitesse.
Artificial Analysis, qui mesure les modèles sur son propre harnais, attribue actuellement à Qwen3.8-Max, sur la build 0902, un score de 45 à l'Intelligence Index, avec GPQA Diamond à 92,8 %, Terminal-Bench Hard à 38,9 % et Humanity's Last Exam à 43,1 % — et situe son coût mesuré par tâche à $5.41Ce sont des chiffres indépendants sur le SKU standard, relevés le 2026-09-24. Ils rappellent aussi que l'indice a été révisé depuis la couverture du lancement d'août ; ne mettez donc pas une ancienne valeur d'indice à côté d'une valeur actuelle pour en tirer une tendance.
Ce qu'AA n'a pas, c'est une gamme Prime. Tant que personne ne la mesure, l'affirmation de vitesse n'appartient qu'à Alibaba, et la bonne attitude consiste à la tester sur votre propre charge de travail plutôt que de présumer qu'elle se situe au sommet de la gamme.
Ce que cela implique pour la décision de routage
Prime est un palier qu'Alibaba vend sur sa propre API, et c'est le seul endroit où l'obtenir. Nous n'hébergeons pas qwen3.8-max-prime ici. Ce qu'OrcaRouter route, c'est le standard Qwen3.8-Max et son pin daté Qwen3.8-Max-0902, tous deux sur la même clé que le reste de la famille Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — aux côtés de plus de 200 autres modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge. C'est cette dernière partie qui explique pourquoi la mise à jour du 2 septembre et tout futur changement de tarif Max arrivent de notre côté le jour même où ils arrivent chez Alibaba.
La répartition pratique se présente comme suit. Faites passer votre trafic par défaut sur l’ID standard via un routeur, où le basculement vous protège si un seul chemin fournisseur se dégrade. Déplacez les appels spécifiques où la latence en temps réel est le produit — la complétion interactive, l’étape d’agent à délai serré — vers Prime, et évaluez cette décision au regard du 2× plutôt que du 1,5×.
Qui devrait basculer, et qui devrait attendre
Basculez si vos utilisateurs attendent des tokens : une autocomplétion, un tour de conversation, une boucle d’édition de code où un humain surveille. En haut de la plage de vitesse, Prime est neutre en coût par seconde de latence supprimée — vous payez exactement le double pour exactement la moitié du temps. En bas de la plage, vous payez 2× pour 1,5×, soit un surcoût de 33 % par seconde gagnée. Si votre charge de travail est une tâche par lots qui tourne toute la nuit, ce surcoût ne vous apporte rien de ce dont vous aviez besoin.
Attention si votre modèle de coûts s'appuie sur le tarif de lancement affiché de 2 $/6 $, ou si vos requêtes sont à forte composante d'entrée. L'argument de vitesse du fournisseur porte sur les TPS — jetons de sortie par seconde — et le prefill est une étape distincte du pipeline. Une requête à contexte long coûte le double en jetons d'entrée, que la sortie arrive plus vite ou non. Mesurez ce cas avant de migrer.
Et vérifiez la date sur votre grille tarifaire. Qwen3.8-Max est sur le marché depuis le 3 août, a été rafraîchi une fois et repackagé une fois, et il n'a toujours que sept semaines. C'est le palier qui fait l'actualité ; le modèle, non.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
