Un titre de héros pour « Qwen3.8-Max vs Qwen 3.8 » avec le sous-titre « Un cœur de 2,4 T — API louée ou poids ouverts », des badges pour la mise à jour 0902 du 2 septembre 2026, l'API hébergée à 2 $/6 $ pour 1 M de jetons, et les poids ouverts du 12 août, et un pied de page indiquant que le Code Arena WebDev indépendant n° 1 à 1 691 pour la version 0902 et que le point de contrôle ouvert ne dispose pas encore de scores indépendants.
Guides & Insights

Qwen3.8-Max vs Qwen 3.8 : un cœur 2.4T, loué ou exécuté — après la mise à jour 0902

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 2 septembre 2026, Alibaba a publié une mise à jour datée de Qwen3.8-Max — la build qu’il désigne sous le nom de Qwen3.8-Max-0902 — et un classement indépendant des modèles de code a placé cette nouvelle mouture en tête la même semaine. La version téléchargeable de ce même modèle de base à 2,4 billions de paramètres — celui que la plupart désignent quand ils écrivent « Qwen 3.8 » sans suffixe — est toujours figée à son checkpoint du 12 août : texte uniquement, raisonnement activé en permanence, et des centaines de gigaoctets de trop pour être exécutable sur autre chose qu’un rack de GPU. Cet écart entre le modèle phare hébergé et les poids ouverts n’existait pas en août. Il est désormais toute la comparaison, et c’est pourquoi le même modèle continue de vous être vendu sous deux noms.

Qwen3.8-Max est le produit phare hébergé d'Alibaba : un modèle à mélange d'experts épars de 2 400 milliards de paramètres, avec environ 95 milliards de paramètres actifs par jeton, disponible sur une API payante depuis le 3 août et doté d'une fenêtre de contexte multimodale d'un million de jetons. Qwen 3.8, pris comme nom autonome, est la version ouverte de la même génération, le plus important étant Qwen3.8-2.4T-A95B, les poids publiés par Alibaba le 12 août sous une licence personnalisée. Ce ne sont pas une version économique et une version premium. C'est le même cerveau vendu de deux manières, et une passe de post-entraînement en septembre a commencé à faire diverger les deux offres. Cet article clarifie quel « Qwen 3.8 » vous regardez réellement, ce que la mise à jour 0902 a changé, et quelle voie — louer l'API ou exécuter les poids — vous devriez suivre aujourd'hui.

Le duo qui n'est pas une rivalité.

Avant les dates et les grilles tarifaires, l'architecture : Qwen3.8-Max et Qwen3.8-2.4T-A95B partagent une conception MoE à grain fin avec 512 experts par couche (10 routés plus un partagé, par couche), 92 couches, et une pile hybride dans laquelle 69 des 92 couches utilisent une attention linéaire — Gated DeltaNet combiné à une attention à portes — avec une attention complète entrelacée pour le travail sur les longs contextes. C'est pourquoi la fiche modèle peut revendiquer le contexte d'un million de jetons sur l'API et pourquoi la version ouverte atteint un 262K natif qui s'étend vers un million avec la bonne configuration de service. Les différences entre les deux noms ne résident pas dans l'architecture des poids ; elles se situent aux extrémités, et les extrémités ont bougé depuis le 2 septembre.

• Paramètres — Qwen3.8-Max : 2,4 T au total / ~95 B actifs, MoE. Qwen3.8-2.4T-A95B : même cœur, même nombre d'actifs.

• Livraison — Qwen3.8-Max : API hébergée, disponible depuis le 3 août, mise à jour sous le nom Qwen3.8-Max-0902 le 2 septembre. Qwen3.8-2.4T-A95B : poids téléchargeables, publiés pour la première fois le 12 août, aucun nouveau checkpoint depuis.

Modalités — Qwen3.8-Max : entrée texte, image et vidéo. Qwen3.8-2.4T-A95B : texte uniquement.

Contrôle du raisonnement — Qwen3.8-Max : bascule de la réflexion, y compris un mode sans réflexion. Qwen3.8-2.4T-A95B : réflexion toujours active, avec uniquement un réglage d'effort de raisonnement (faible / élevé / très élevé).

• Outillage — Qwen3.8-Max : appel de fonction natif, cinq outils intégrés et sortie structurée. Qwen3.8-2.4T-A95B : aucune couche d'outils native ; ce que vous obtenez dépend du framework d'inférence avec lequel vous le servez.

Ce que le rafraîchissement du 2 septembre a changé

La build 0902 est une passe de post-entraînement, pas une nouvelle architecture. Alibaba l'a orientée vers les deux domaines pour lesquels Qwen3.8-Max était déjà connu — le codage et le « cowork », son nom pour le travail agentique et bureautique à long horizon — et les chiffres qui l'accompagnent expliquent pourquoi cette mise à jour compte. Sur le classement indépendant Code Arena : WebDev, Qwen3.8-Max-0902 a fait ses débuts à 1 691 Elo, soit un bond de 22 points par rapport à la build précédente, suffisant pour décrocher la première place dès son arrivée. Alibaba présente également la build comme le modèle le mieux noté sur la frontière de Pareto coût-performance de ce classement, à un taux mixte d'environ 5 dollars par million de jetons — le prix catalogue de 2 à 6 dollars pondéré par un trafic agentique où les sorties dominent, soit environ le quart du coût d'un appel comparable passé auprès d'un modèle de pointe ailleurs. Il faut bien distinguer ces chiffres : le score de 1 691 Elo est un résultat d'arène indépendant ; le cadrage « frontière de Pareto », lui, est la propre caractérisation d'Alibaba de ce classement indépendant.

Les évaluations internes d'Alibaba pour la passe 0902, rapportées par le fournisseur et non reproduites, montrent la même tendance : Terminal-Bench 3.0 passant de 11,3 à 29,0, ProgramBench de 10,5 à 28,0, JobBench de 53,4 à 64,0 et WorkArena Elo de 1 348 à 1 468. Interprétez-les comme « la mise à jour a fait bouger les axes agentique et codage », et non comme des scores vérifiés. Côté intelligence générale, l'Intelligence Index d'Artificial Analysis place Qwen3.8-Max à 56 — compétitif, mais pas la raison d'y recourir ; ce sont les résultats en codage et en agentique.

Ce que la plupart des articles ont manqué, c'est que le post-entraînement du 02/09 n'est, à l'heure où j'écris ces lignes, disponible que via l'API. Alibaba n'a pas publié de checkpoint ouvert du modèle actualisé — les poids Qwen3.8-2.4T-A95B sur Hugging Face remontent toujours à la version du 12 août. Cela signifie que le Qwen3.8-Max hébergé et le noyau téléchargeable ne sont plus le même modèle comme ils l'étaient à la mi-août. L'API dispose du post-entraînement de septembre ; les poids, non. Si votre seule raison d'utiliser la version ouverte était de reproduire exactement ce que fait le modèle phare, cette hypothèse a discrètement cessé d'être vraie le 2 septembre.

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

Les cinq points où ils divergent véritablement

Mettez de côté l’architecture partagée, et les différences pratiques se présentent clairement. La modalité est le premier filtre : si votre charge de travail inclut des images ou des vidéos — captures d’écran, graphiques, documents avec figures, images vidéo — seul Qwen3.8-Max les prend en charge, et sa fenêtre d’1 million de jetons est native, non pas une extension. Les poids ouverts sont limités au texte. Le contrôle du raisonnement est le second : l’API hébergée peut fonctionner avec la réflexion désactivée, ce qui compte pour l’extraction sensible à la latence et à grand volume, où une chaîne de pensée est un pur surcoût ; la version ouverte ne peut pas la désactiver. Les outils sont le troisième : l’appel de fonctions, les cinq outils intégrés et le mode JSON font partie du produit hébergé, tandis que la version ouverte dépend de ce que fournit votre couche de service.

Le contexte est plus subtil que ce que suggère la fiche technique. Les deux côtés peuvent atteindre environ un million de jetons, mais le modèle hébergé le fait nativement avec une entrée multimodale, tandis que le contexte natif de 262K de la version ouverte doit être étendu dans la configuration, et chaque jeton de cette fenêtre étendue est du texte. Les limites de sortie diffèrent également — l'API permet jusqu'à environ 131K jetons de sortie, et la version ouverte est généralement configurée avec un plafond similaire, mais le plafond pratique du côté ouvert est fixé par votre pile de service, pas par le modèle.

Ce que chaque itinéraire coûte réellement

C’est là que les deux offres cessent d’être comparables. Qwen3.8-Max a un prix catalogue : 2,00 $ par million de jetons d’entrée, 6,00 $ par million de jetons de sortie et 0,25 $ par million pour l’entrée en cache. Comme OrcaRouter transmet les prix catalogue des fournisseurs avec une marge de 0 %, c’est ce tarif que vous payez ici, et quand Alibaba le modifie, le nouveau montant est en vigueur le jour même. L’instantané 0902 est épinglé séparément sous le nom qwen/qwen3.8-max-0902 pour les équipes qui veulent un comportement reproductible — même prix, mêmes capacités, mais un point de contrôle fixe au lieu du modèle évolutif. Sur le trafic d’OrcaRouter, le délai médian jusqu’au premier jeton sur 7 jours pour Qwen3.8-Max est d’environ 2 à 4 secondes, et Artificial Analysis mesure environ 45 à 48 jetons de sortie par seconde : ce n’est pas lent, mais c’est verbeux, ce qui explique pourquoi les tâches agentiques sur ce modèle peuvent brûler des quantités de jetons surprenantes malgré le tarif avantageux.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

Qwen3.8-2.4T-A95B n'a pas de prix catalogue, car le prix, c'est votre infrastructure. Les poids BF16 représentent environ 4,9 To, et même la version FP8 officielle avoisine les 2,4 To ; il s'agit donc de matériel à l'échelle du rack : les plus petites configurations de service documentées commencent autour de huit GPU B300 ou GB300, et un rack GB300 NVL72 complet constitue le déploiement de référence. Une quantification agressive abaisse le plancher — une version NVFP4 tient dans environ 1,3 To, et la quantification par couches à 1 bit d'Unsloth compresse le modèle à environ 397 Go, ce qui rend enfin envisageable un nœud unique bien provisionné — mais chacune de ces voies suppose que vous opériez des GPU à l'échelle d'un centre de données. Les hébergeurs tiers qui servent le checkpoint ouvert vous vendront des jetons à un prix inférieur au prix par jeton du Max, mais vous perdez au passage l'entrée multimodale, le mode non-thinking, les outils natifs et le post-entraînement 0902, et aucun benchmark indépendant de ce checkpoint téléchargeable lui-même n'a encore été publié. La fiche modèle d'Alibaba est franche sur la relation : elle décrit Qwen3.8-Max comme la version officielle construite sur Qwen3.8-2.4T-A95B, qui ajoute l'entrée vision, la prise en charge du mode non-thinking, un contexte par défaut de 1M et des outils intégrés par-dessus le cœur ouvert.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

Des chiffres indépendants face aux allégations des fournisseurs

La transparence des sources importe davantage ici que dans la plupart des confrontations, car les deux camps présentent des âges de preuves très différents. Qwen3.8-Max a été évalué de manière indépendante : le résultat Code Arena: WebDev 1 691 pour la build 0902 et l'indice d'intelligence de 56 d'Artificial Analysis sont des mesures tierces, et la tarification qui rend la revendication de front de Pareto intéressante est un barème public. Qwen3.8-2.4T-A95B ne dispose pas encore de cela — le tableau de référence publié par Alibaba décrit le cœur de classe Max, et non un passage indépendant du point de contrôle téléchargeable, donc le côté ouvert de cette comparaison reste en grande partie « le fournisseur affirme que le cœur obtient de tels scores ». Si vous tranchez entre eux sur la base des capacités, traitez les chiffres annoncés des poids ouverts comme des déclarations jusqu'à ce qu'un tiers les vérifie.

Qui devrait choisir quoi

La décision découle de la liste ci-dessus. Optez pour le Qwen3.8-Max hébergé — aujourd’hui, précisément la build 0902 — lorsque vous avez besoin du post-entraînement de septembre, d’une entrée d’images ou de vidéos, d’un mode non-pensée, d’outils natifs et d’une sortie structurée, ou d’une fenêtre d’un million de tokens sans avoir à déployer d’infrastructure. C’est la position de pointe en matière de codage et d’agentique, et à $2/$6 avec $0.25 d’entrée en cache, c’est un prix agressif pour ce que c’est.

Choisissez Qwen3.8-2.4T-A95B lorsque le contrôle prime sur la commodité : vous avez besoin des poids sur votre propre matériel ou chez un fournisseur que vous opérez déjà, vous voulez un point de contrôle figé que vous pouvez auditer et reproduire, ou votre volume soutenu fait du coût par jeton le terme dominant et vous êtes prêt à faire tourner un MoE de 2,4T. Acceptez la liste des compromis — texte uniquement, raisonnement toujours activé, pas d'outillage natif, pas encore de post-entraînement 0902 — et vérifiez les conditions de licence pour votre tranche de revenus, car la licence personnalisée Qwen3.8-Max n'est pas Apache 2.0 et ajoute des conditions pour les grands opérateurs commerciaux.

Si votre charge de travail est à fort volume, sur un seul GPU ou sensible à la latence, aucun de ces deux modèles n'est peut-être la bonne voie — le modèle frère de 27 milliards de paramètres de la génération, Qwen3.8-27B, est celui dimensionné pour cela, et il est traité séparément dans notre comparatif Qwen3.8-27B vs Qwen3.8-Max.

Comment essayer les deux sans risquer le tout pour le tout

La manière propre d'effectuer cet appel consiste à exécuter les deux côtés sur vos propres prompts, et c'est là qu'une couche de routage fait ses preuves plutôt que d'être plaquée après coup. Qwen3.8-Max et l'instantané épinglé Qwen3.8-Max-0902 se trouvent tous deux derrière un endpoint compatible OpenAI sur OrcaRouter, si bien que passer du modèle phare en évolution continue au checkpoint reproductible n'est qu'un changement d'identifiant de modèle, pas un redéploiement. Lorsqu'une équipe décide d'internaliser les poids ouverts, le DSL de routage peut servir de frontal à un endpoint vLLM ou SGLang auto-hébergé servant Qwen3.8-2.4T-A95B et l'inscrire dans le même graphe d'appels — le trafic de masse vers votre propre déploiement, les prompts exigeants et les requêtes multimodales étant déversés vers le Qwen3.8-Max hébergé, avec bascule automatique entre les deux. Essayer un nouveau checkpoint de cette façon coûte un changement de configuration plutôt qu'une migration, ce qui est exactement ce que l'on souhaite lorsque les deux côtés de cette comparaison évoluent encore à des vitesses différentes.

En résumé

Qwen3.8-Max et Qwen 3.8 ne sont pas deux modèles en concurrence pour le même poste. Ils forment un unique cœur de 2 400 milliards de paramètres, proposé d'une part en API louée, d'autre part en poids téléchargeables, et la mise à jour du 2 septembre a fait que ces deux formes de livraison ne veulent plus dire la même chose. Louez l'API et vous obtenez le post-entraînement 0902 — celui qui a pris la tête de Code Arena: WebDev — avec en plus la vision, un mode sans raisonnement, des outils natifs et une fenêtre native d'un million de tokens, à 2 $/6 $, avec une entrée en cache à 0,25 $. Faites tourner les poids ouverts et vous obtenez la même architecture figée dans son état du 12 août — texte uniquement, mode raisonnement verrouillé sur « activé » — sans aucun score indépendant pour l'instant et avec la facture du matériel d'un centre de données. Si les gains de septembre en codage et en capacités agentiques comptent pour vous, un seul des deux noms les offre aujourd'hui. Si le contrôle reproductible compte davantage, un seul des deux noms est à vous, pour de bon.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement