Une carte de titre principale pour « Qwen3.8-Max vs Qwen3.7-Max » avec le sous-titre « Deux paliers Max, 16 points d'indice et une promo qui inverse le prix », et un pied de page précisant que les chiffres de Qwen3.8-Max proviennent de la divulgation d'Alibaba du 22 sept. 2026 et d'Artificial Analysis, tandis que ceux de Qwen3.7-Max proviennent d'Artificial Analysis.
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max : deux niveaux Max, 16 points d'indice et une promo qui inverse le prix

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il y a quatre jours, le fournisseur nous a dit que Qwen3.8-Maxn'était pas le modèle qu'il avait livré en août. Dans un communiqué de presse daté du 22 septembre 2026, depuis la conférence Apsara de Hangzhou, l'entreprise a révélé que son modèle phare avait suivi 33 cycles itératifsde travail d'entraînement et de post-entraînement entièrement automatisé sur plus d'un mois, et que la version obtenue avait fait passer son Artificial Analysis Intelligence Index de 40 à 45. L'identifiant du modèle n'a jamais changé. Le nombre derrière, si.

Cela compte surtout à un endroit précis : la comparaison entre Qwen3.8-Max et Qwen3.7-Max, le palier Max qu'il a remplacé. Qwen3.8-Max est passé en disponibilité générale le 3 août 2026 ; Qwen3.7-Max est sorti en mai. Sur le papier, cela ressemble à un choix générationnel évident — un nouveau fleuron, un score plus élevé, passons à autre chose. Les chiffres disent quelque chose de plus embarrassant. Le palier plus ancien est trois à quatre fois plus rapide, environ cinq fois moins cher par tâche accomplie, et identique au plus récent sur les benchmarks de connaissances pures. Le plus récent est multimodal, nettement meilleur pour le travail agentique, et moins cher sur la grille tarifaire internationale. Celui que vous devriez appeler dépend d'une question que la plupart des comparaisons ignorent : achetez-vous de la connaissance ou des appels d'outils.

Ce que la divulgation d'Apsara affirme réellement

La divulgation est une déclaration de fournisseur, publiée par Alibaba sur son site de presse, et il convient de la lire comme telle. Ce qu'elle affirme est précis : sur plus d'un mois d'exécutions entièrement automatisées couvrant la conception du pipeline, la validation des données, l'expérimentation itérative et le diagnostic des erreurs, Qwen3.8-Max a accompli 33 cycles, et l'optimisation autonome de l'entraînement ainsi que les techniques de post-entraînement ont produit l'évolution du score. Alibaba a également décrit une seconde expérience en conception de puces, où le modèle a mené plus de 60 heures d'auto-amélioration sur un cycle de conception, effectué plus de 10 000 appels à des outils EDA et produit des modules de bus de puce de qualité production, tout en réduisant la surface de la puce de 42 % sans compromis de performance déclaré. Tout cela relève du compte rendu d'Alibaba sur son propre modèle, non reproduit par quiconque en dehors de l'entreprise.

Le mouvement du score lui-même, toutefois, n’est pas une affirmation de fournisseur. L’Index est celui d’Artificial Analysis, et le 45 figure sur la page Qwen3.8 Max (0902) de ce tiers. Le 40 dont il est parti se trouve sur la page de la même organisation consacrée à la version du 3 août, désormais marquée comme obsolète et renvoyant vers la version actuelle. Le delta est donc une cause rapportée par le fournisseur, rattachée à un effet évalué indépendamment, ce qui constitue une position plus solide que chacune des deux moitiés prise seule. C’est aussi, à l’heure où ces lignes sont écrites, la preuve publique la plus concrète dont on dispose qu’un laboratoire de pointe a fait évoluer la capacité mesurée de son modèle phare sans publier un nouveau numéro de version.

Deux autres éléments concernant cette sortie sont faciles à manquer, et tous deux sont structurants. Premièrement, Alibaba a confirmé que Qwen 4 est en cours d'entraînement, les séries Qwen 4.5 et Qwen 5 devant atteindre 5 à 10 billions de paramètres. Deuxièmement, il existe un instantané daté du modèle actualisé. Alibaba a épinglé la version post-entraînée sous le nom de qwen3.8-max-0902 le 2 septembre, et elle est routable séparément. Cette version épinglée est la réponse pratique à tout ce que la divulgation RSI implique, et nous y reviendrons.

Le tableau d'affichage

Six dimensions, des deux côtés, avec la discipline de sourçage maintenue explicite parce que les deux colonnes ne sont pas également vérifiées.

• Fenêtre de contexte — Qwen3.8-Max 1 000 000 tokens vs Qwen3.7-Max 1 000 000 tokens (identique)

• Sortie maximale — 131 072 jetons contre 131 072 jetons selon les propres pages de modèles d’Alibaba (identiques ; notez que notre page de catalogue pour Qwen3.7-Max indique 64 000, une divergence que nous signalons plutôt que de la masquer)

• Modalité d'entrée — texte, image et vidéo vs texte uniquement

• Prix catalogue international par million de tokens — 2,00 $ en entrée / 6,00 $ en sortie contre 2,50 $ en entrée / 7,50 $ en sortie ; la même grille tarifaire facture déjà aux deux modèles 1,65 $ / 4,951 $ à Pékin, Francfort et Virginie

• Indice d’intelligence Artificial Analysis — 45 contre 29

• Vitesse de sortie indépendante — 39,7 tokens/sec vs 211,3 tokens/sec, mesurée par rapport à la même classe de comparaison de 211 modèles, où Artificial Analysis classe le palier le plus récent comme nettement lent et le plus ancien comme nettement rapide

Les deux dernières lignes constituent tout l’article. Au sein de la même famille d’indices, le niveau le plus récent a 16 points d’avance. Côté vitesse, il est plus de cinq fois en retrait.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

D'où viennent les 16 points — et d'où ils ne viennent pas

Décomposez l'Index en ses parties et la forme de la mise à niveau devient claire, et ce n'est pas la forme que suggère le marketing.

Sur le plan des connaissances et du raisonnement, les deux modèles sont pratiquement à égalité. GPQA Diamond : 92,8 contre 92,3. Humanity's Last Exam : 43,1 contre 40,5. Rappel en contexte long : 80,33 contre 79. SciCode : 52,1 contre 49,5. Si votre charge de travail consiste à répondre à des questions sur un vaste corpus, le saut générationnel est une erreur d'arrondi. Payer un prix plusieurs fois supérieur pour cela serait difficile à justifier.

Sur le travail agentique et de codage, l'écart se creuse brutalement. Terminal-Bench 2.1 : 88,76 contre 74,53. L'indice de codage d'Artificial Analysis : 76,2 contre 66. Et la divergence la plus large de l'ensemble est la tâche d'utilisation d'outils bancaires, où Qwen3.8-Max enregistre 47,84 contre Qwen3.7-Max et ses 11,75 — un écart d'un facteur quatre dans exactement la capacité que la description RSI indique que les cycles automatisés optimisaient : conception de pipelines, validation des données, expérimentation itérative, diagnostic d'erreurs. Un modèle qui passe un mois à améliorer sa propre boucle d'entraînement est un modèle qui s'est amélioré en boucles.

Une mise en garde honnête sur ces lignes individuelles. Les deux pages de modèles relèvent de la même famille de révisions de l'Intelligence Index (v4.3 et v4.3.2), ce qui rend équitable la comparaison phare 45 contre 29. Les lignes par benchmark ne sont pas issues de la même cohorte : les chiffres au niveau des tâches de Qwen3.7-Max datent de la fenêtre d'évaluation de mai, tandis que ceux de Qwen3.8-Max proviennent de la série de septembre. Lisez la direction de l'évolution, pas le troisième chiffre significatif.

La question du prix est en fait deux questions

Sur la grille tarifaire internationale d'Alibaba, le nouveau Max est moins cher que celui qu'il remplace : $2.00 / $6.00 pour Qwen3.8-Max contre $2.50 / $7.50 pour Qwen3.7-Max, par million de tokens. Une baisse de 20 % dans les deux sens à mesure que la génération avance est inhabituelle et mérite d'être signalée en soi. L'économie du cache favorise elle aussi le niveau le plus récent — cache implicite à $0.25 contre $0.50, lecture de cache explicite à $0.17 contre $0.25.

C'est la première question, et elle a une réponse régionale que la plupart de la couverture médiatique aplatit. Alibaba facture les deux modèles $1.65 en entrée / $4.951 en sortie à Pékin, Francfort et en Virginie. L'écart de 20 % n'existe que sur la carte internationale de Singapour. Si votre trafic arrive dans les trois autres régions, les tokens d'entrée et de sortie coûtent le même prix pour les deux niveaux Max aujourd'hui, et la décision se réduit à la pure capacité — auquel cas le modèle le plus récent l'emporte sur tout sauf le débit, et il ne reste plus aucun calcul à faire.

La deuxième question est le piège. Qwen3.7-Max ne coûte pas actuellement 2,50 $ / 7,50 $. Il est proposé à 1,25 $ / 3,75 $ — soit la moitié du tarif catalogue, un tarif promotionnel. Cela fait de l'offre de génération précédente l'option la moins chère aujourd'hui, et de loin. Cela signifie aussi que le prix que vous pouvez mesurer cette semaine n'est pas le prix auquel vous vous engageriez. La page du modèle d'Alibaba elle-même indique clairement que le tableau publié présente les tarifs d'origine « hors toute promotion à durée limitée » et vous renvoie vers la console pour les offres en cours. Une promotion est, par nature, un tarif qui peut prendre fin. Si cela se produit, Qwen3.7-Max ne devient pas simplement plus cher qu'aujourd'hui ; il devient 25 % plus cher que le modèle qui le surpasse.

Nous répercutons le tarif du fournisseur avec 0 % de marge, de sorte que le prix catalogue et la promotion sont tous deux actifs de notre côté le jour même de leur modification — ce qui est pratique pour comparer, mais peu utile si vous essayez d’établir un budget. Construisez le modèle sur la base de la carte tarifaire et considérez le tarif promotionnel comme un gain potentiel.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

Le chiffre qui renverse l’argument du coût

Le prix des tokens n'est pas ce que coûte une tâche. Artificial Analysis publie un chiffre de coût par tâche qui intègre l'économie du cache, le volume de raisonnement et la longueur des réponses, et selon cette mesure, le classement s'inverse complètement : $5.41 par tâche de l'Intelligence Index pour Qwen3.8-Max contre $1.15 pour Qwen3.7-Max. Une prime de 4.7×, face à un tarif par token qui est soit 20% moins cher, soit identique selon votre région.

L'écart tient surtout à la verbosité. Lors de la même évaluation, le modèle plus récent a généré 190 M de tokens de sortie contre les 120 M du modèle plus ancien, et il raisonne longuement pour parvenir à ses réponses. Si vous payez au token de sortie pour une charge de travail à gros volume et modérément difficile, le Max plus récent n'est pas le modèle le moins cher, quel que soit le prix par token sur l'une ou l'autre grille tarifaire. C'est le plus cher, et le prix catalogue par token est le mauvais instrument pour en décider.

La vitesse, et ce que révèle notre propre trafic

L'écart de débit est suffisamment important pour changer d'architecture. Artificial Analysis place Qwen3.8-Max à 39,7 jetons par seconde — son résumé qualifie le modèle de particulièrement lent — contre 211,3 pour Qwen3.7-Max, qu'il qualifie de particulièrement rapide. C'est la différence entre un modèle que l'on place derrière une interface interactive et un modèle que l'on place derrière une file d'attente — et sur Qwen3.8-Max, c'est la première chose que notre propre panneau de statistiques vous montre.

Notre propre télémétrie de playground sur les sept jours précédant le 25 septembre raconte une histoire légèrement plus nuancée en matière de latence, et elle s’accompagne d’une mise en garde : il s’agit de nos mesures sur notre routage, et non d’un benchmark contrôlé. Qwen3.8-Max a affiché un délai médian de 2 611 ms jusqu’à la première réponse, à 54,7 jetons par seconde, avec un taux d’erreur de 2,45 % ; la version 0902 épinglée a affiché un délai médian de 3 360 ms à 46,2 jetons par seconde, avec un taux d’erreur nettement plus faible de 0,66 %. Qwen3.7-Max se situait à un délai médian de 4 509 ms, mais à 169,8 jetons par seconde avec un taux d’erreur de 3,80 %. Ainsi, le niveau plus ancien répond plus lentement au démarrage, puis diffuse trois fois plus vite, tout en échouant plus souvent. Si votre charge de travail est en rafales, cette différence de taux d’erreur mérite plus d’attention que la médiane.

Les deux niveaux sont disponibles sur une seule clé OrcaRouter, aux côtés de l’instantané épinglé, avec basculement automatique entre fournisseurs. Pour une comparaison comme celle-ci, c’est là le point pratique : mesurer vos propres prompts face aux deux générations Max relève d’un changement de configuration, pas d’un second contrat.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

La reproductibilité est désormais le facteur décisif.

Voici la partie de la divulgation d'Apsara que personne n'a intégrée dans les prix. Un ID de modèle en production dont la capacité mesurée est passée de 40 à 45 en un mois, sans changement de version ni annonce à ce moment-là, constitue un risque pour la reproductibilité. Si le comportement de votre produit dépend d'un ID mouvant, vous avez un modèle qui peut s'améliorer — ou se décaler — sous une suite d'évaluation figée, une bibliothèque de prompts en cache ou un ensemble de régression validé.

Les deux générations proposent des instantanés datés, et c'est là la mesure d'atténuation. Qwen3.7-Max est documenté par Alibaba comme fonctionnellement équivalent à qwen3.7-max-2026-05-20, avec d'autres versions datées au 2026-05-17 et au 2026-06-08. Qwen3.8-Max a qwen3.8-max-0902, la version de septembre post-entraînée, celle que désigne le 45. Si vous livrez quoi que ce soit qui doit être reproductible, épinglez l'ID daté et traitez l'ID flottant comme une cible de préproduction. Les cycles RSI sont une caractéristique de l'ID flottant ; l'épinglage est le moyen de vous en exempter.

Un détail de nommage qu'il vaut mieux connaître pour ne pas mal interpréter le catalogue. Alibaba répertorie une troisième forme datée, qwen3.8-max-2026-09-02, aux côtés de l'alias 0902 ; elles désignent la même version. La version originale du 3 août n'est plus routable de notre côté — nous servons Qwen3.8-Max, son pin 0902, et Qwen3.7-Max.

Qui devrait choisir lequel ?

La décision ne se joue pas sur le modèle qui est meilleur. Elle se joue sur ce que vous achetez.

Restez sur Qwen3.7-Max si votre charge de travail est uniquement textuelle, davantage axée sur la connaissance que sur les outils, et sensible au débit — classification à haut volume, extraction, récupération de contexte long, résumé par lots. Sur GPQA Diamond et le rappel de contexte long, il se situe à un point du nouveau modèle, il génère le flux trois à quatre fois plus vite, et il coûte 1,15 $ par tâche contre 5,41 $. C'est aussi la bonne réponse pour quiconque veut un deuxième avis bon marché dans une configuration de fusion ou de routage, car à son tarif promotionnel, il se situe dans une classe de prix totalement différente. Deux mises en garde : la promotion est une promotion, et Artificial Analysis a déjà signalé le modèle comme déprécié, remplacé par Qwen3.8-Max. Ne prenez pas d'engagement pluriannuel sur ce modèle.

Passez à Qwen3.8-Max si l'une de ces conditions est vraie : vous avez besoin d'une entrée image ou vidéo, que Qwen3.7-Max n'accepte pas du tout ; votre charge de travail est agentique, avec de longues chaînes d'appels d'outils ou des boucles de codage à plusieurs étapes, où le 88,76 contre 74,53 sur Terminal-Bench 2.1 et l'écart d'un facteur quatre dans l'utilisation des outils font la différence entre livrer et ne pas livrer ; ou vous écrivez en fonction de la grille tarifaire internationale de Singapour, où le modèle plus récent est tout simplement 20 % moins cher et où il n'y a aucun compromis à peser. Épinglez qwen3.8-max-0902 si vous avez besoin que le comportement reste stable.

Si vous êtes à Pékin, Francfort ou en Virginie, le choix est plus net que ne le suggère n'importe quelle comparaison : les deux niveaux Max coûtent 1,65 $ / 4,951 $ par million de tokens. Identiques. À ces tarifs, ne rien payer de plus pour une entrée multimodale, un Index supérieur de 16 points et un score d'utilisation d'outils quatre fois meilleur n'est pas une décision, c'est gratuit — et la seule raison de rester sur Qwen3.7-Max devient le débit brut.

Deux questions qui méritent une réponse directe

Une exécution d’entraînement de 33 cycles signifie-t-elle que le modèle a changé sous le trafic API existant ? C’est ce que laisse entendre la divulgation, et c’est pourquoi le pin daté existe. Alibaba décrit le modèle amélioré comme « le Qwen3.8-Max mis à jour », qui est l’ID flottant, et non un nouvel ID. Si vous aviez des charges de travail sur l’ID flottant jusqu’en septembre, elles ont été servies par un modèle dont la capacité mesurée a évolué pendant cette fenêtre. Alibaba n’a pas publié de journal des modifications pour les builds intermédiaires, donc le seul moyen fiable de savoir quel comportement vous avez est d’épingler.

L'affirmation RSI est-elle vérifiée de manière indépendante ? Le score qu'elle a produit l'est — l'Index est celui d'Artificial Analysis, et le 45 figure sur leur page. Le mécanisme qui le sous-tend est la propre description par Alibaba de son propre processus d'entraînement, sans réplication externe, sans protocole d'évaluation publié et sans tiers observant les 33 cycles. Considérez « 33 cycles itératifs » comme une affirmation de fournisseur et « 45 après 40 » comme une paire mesurée. Ce ne sont pas le même type d'affirmation, et cette différence est la raison pour laquelle ce titre mérite d'être lu attentivement plutôt que répété.

La prochaine chose à surveiller n’est pas Qwen 4. C’est de savoir si la promotion à moitié prix de Qwen3.7-Max survivra à l’arrivée du modèle censé le remplacer. Si ce n’est pas le cas, un très grand nombre d’équipes découvriront qu’elles comparaient un prix catalogue à une remise, et que l’aîné de deux modèles frères était en réalité le plus cher depuis le début.