Une carte de titre générée intitulée « Qwen 4.5 et Qwen 5 : 5 à 10 billions de paramètres », avec le sous-titre « Une fourchette de feuille de route, pas une spécification », et trois cartes indiquant « Objectif de feuille de route / 5-10 T de paramètres », « Modèle phare commercialisé / Qwen3.8-Max 2,4 T » et « Date de sortie / non annoncée ». Une ligne de pied de page indique « D'après le communiqué de presse d'Alibaba du 22 septembre 2026 ; aucune fiche de modèle publiée. » Style éditorial en vectoriel plat sur fond blanc, avec un lavis dégradé du bleu au cyan et le logo OrcaRouter incrusté en bas à droite.
Guides & Insights

Qwen 4.5 et Qwen 5 visent 5 à 10 billions de paramètres : ce qu'Alibaba a dit et n'a pas dit

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Lors de sa conférence Apsara à Hangzhou, le 22 septembre 2026, l'entreprise a donné une taille à la génération d'après la prochaine. Les séries Qwen 4.5 et Qwen 5 sont « appelées à monter en puissance jusqu'à 5 à 10 billions de paramètres », selon les termes du communiqué de presse en anglais de l'entreprise elle-même — une ligne de feuille de route, pas une spécification. Aucun des deux modèles n'a de date de sortie, de fiche de modèle, d'identifiant d'API, de prix ni de score de benchmark publié, ce qui signifie que rien de l'un ou l'autre n'est appelable aujourd'hui. Le modèle phare que vous pouvez réellement acheter est Qwen3.8-Max, en disponibilité générale depuis le 3 août 2026, avec 2,4 billions de paramètres. Dans les jours qui ont suivi la conférence, cette phrase de feuille de route a été ramenée, dans une grande partie de la couverture médiatique, à l'affirmation qu'un modèle de 10 billions de paramètres arrive — une affirmation plus forte et plus simple que celle formulée par l'entreprise. L'écart entre ces deux phrases représente environ un an de planification.

L'affirmation, et la version de celle-ci qui s'est répandue

Deux choses ont été dites sur scène, et il vaut la peine de les séparer parce qu’elles portent des quantités d’information très différentes. La première est une mise à jour de statut : Qwen 4 est en cours d’entraînement, sur une nouvelle architecture. La seconde est une feuille de route : les séries Qwen 4.5 et Qwen 5 devraient atteindre une fourchette de paramètres de 5 à 10 billions.

Le communiqué de presse en anglais d’Alibaba attribue les deux à l’entreprise plutôt qu’à un dirigeant nommément cité. La couverture de la conférence qui va plus loin attribue la feuille de route à Liu Da Yiheng, qui dirige le projet de grand modèle de langage Qwen au sein d’Alibaba Token Hub, et rapporte son cadrage selon lequel la mise à l’échelle est une voie clé vers la superintelligence artificielle. Ce cadrage constitue le contexte dans lequel le nombre de paramètres a été présenté, et il explique pourquoi ce nombre est une fourchette plutôt qu’un objectif.

Ce qui a alors circulé, c’était le haut de la fourchette. Les gros titres anglais qui ont suivi comprennent au moins un titre décrivant un modèle de 10 000 milliards de paramètres annoncé en teaser, et plusieurs décrivant un projet de modèle de 5 000 à 10 000 milliards de paramètres. Les deux sont des lectures défendables d’une diapositive. Aucune des deux n’est une spécification, et la différence compte pour quiconque doit planifier en fonction de cela.

5 billions est l'objectif d'une génération et 10 billions celui d'une autre

La chose la plus utile à bien comprendre au sujet de cette annonce est que 5 à 10 billions, c’est une fourchette couvrant deux générations, et non un seul modèle doté d’une large tolérance. La phrase d’Alibaba elle-même rattache cette fourchette aux « futures séries de modèles Qwen 4.5 et Qwen 5 » — les séries, au pluriel, prises ensemble.

La couverture médiatique en langue chinoise de la même conférence est, une fois encore, précise dans une autre direction, avec des titres décrivant des modèles postérieurs à Qwen 4.5 s’étendant dans la fourchette des 5 à 10 billions. Cette lecture situe elle aussi l’extrémité des 10 billions au-delà de Qwen 4.5. La seule affirmation sur laquelle toutes les sources s’accordent est que cette fourchette couvre l’intervalle Qwen 4.5–Qwen 5. L’attribution des 10 billions spécifiquement à Qwen 5 est une inférence devenue un titre, et non une citation.

Pour donner un ordre de grandeur, et ce sont les seuls chiffres de ce récit qui soient publiés plutôt que projetés :

• 5 à 10 billions — la fourchette de paramètres que le communiqué de presse d’Alibaba associe aux séries Qwen 4.5 et Qwen 5

• 2,4 billions — nombre total de paramètres de Qwen3.8-Max, le fleuron commercialisé, selon sa fiche modèle officielle

• 95 milliards — les paramètres actifs par token de Qwen3.8-Max, le chiffre qui détermine ce que coûte le traitement d’un token

• 10 000 milliards — le haut de la fourchette, et la seule partie de celle-ci qui a fait la une de la plupart des médias anglophones

• 0 — le nombre de spécifications publiées, de dates de sortie, de prix, de fenêtres de contexte ou de scores de référence pour Qwen 4.5 ou Qwen 5

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

Le numéro de paramètre qui compte est celui que personne n'a publié.

Les paramètres totaux sont le nombre qu'un laboratoire choisit d'annoncer. Les paramètres actifs sont le nombre dont un acheteur a besoin, et la feuille de route n'en inclut aucun.

Qwen3.8-Max est un modèle à mélange d’experts comptant 2,4 billions de paramètres au total et 95 milliards d’actifs par token. Soit un taux d’activation d’environ 4 % : le modèle détient une grande quantité de connaissances dans des poids qu’il ne lit pas pour un token donné, et ne paie du calcul que pour une petite fraction de ceux-ci. Le nombre total de paramètres indique la quantité de mémoire que la chose occupe et la taille de la machine dont vous avez besoin. Les paramètres actifs indiquent ce que vous payez à chaque fois qu’il répond.

En poussant ce ratio plus loin, la forme du problème devient visible. Un modèle de 10 000 milliards de paramètres construit avec le même taux d’activation de 4 pour cent activerait de l’ordre de 400 milliards de paramètres par token — plus de quatre fois ce que Qwen3.8-Max active aujourd’hui. C’est de l’arithmétique fondée sur une hypothèse énoncée, pas une affirmation à propos de Qwen 5 : augmentez la parcimonie et le nombre d’activations baisse, réduisez-la et il grimpe. Mais c’est cette arithmétique qui détermine si un modèle de 10 000 milliards de paramètres est un produit servi ou un artefact de recherche, et c’est le calcul que le titre de 5 à 10 000 milliards de paramètres invite à faire puis laisse inachevé.

C'est aussi là que l'économie du routage cesse d'être abstraite. Sur OrcaRouter, le prix catalogue du fournisseur est répercuté avec 0 % de marge, donc une baisse de prix d'un fournisseur sur un palier Qwen est effective sur votre clé le jour même, plutôt qu'à un renouvellement. Une génération dont le coût de service est réellement incertain est exactement le cas où cette répercussion vaut plus qu'une remise négociée à l'avance sur la base d'un chiffre que personne n'a publié.

L'annonce de la puce est le véritable calendrier

Alibaba a annoncé la feuille de route de ses modèles et un nouvel accélérateur dans le même communiqué de presse, et les deux sont plus liés que ne le dit le communiqué.

Le Zhenwu V900 de T-Head est un processeur d’entraînement et d’inférence doté de 216 Go de mémoire et d’une bande passante inter-puces de 1 200 Go/s, avec prise en charge native de FP8 et FP4, et une performance annoncée trois fois supérieure à celle de son prédécesseur, le Zhenwu M890, sorti en mai. La production de masse et la commercialisation sont prévues pour le premier trimestre 2027. Un serveur supernode associé prend en charge des clusters pouvant compter jusqu’à 500 000 cartes, et T-Head indique que la gamme Zhenwu a servi plus de 650 clients.

Lisez les deux annonces ensemble et la séquence est lisible. Entraîner et servir un modèle de mélange d'experts à l'échelle de 10 000 milliards est un problème d'interconnexion avant d'être un problème de calcul, car le parallélisme d'experts implique de déplacer constamment des activations entre les puces, et 1 200 Go/s de bande passante entre puces est le chiffre qui détermine si cela est réalisable. Le silicium, selon ce calendrier, repousse la première fenêtre plausible pour une exécution de ce type à l'échelle de la frontière à une date bien avancée de 2027 — et même alors, la livraison d'une puce ne dit rien sur l'achèvement d'une exécution d'entraînement. Alibaba a relié les deux sujets en les plaçant dans un même communiqué ; le lien lui-même relève de notre interprétation, et il est présenté comme tel.

L'horizon temporel de l'entreprise elle-même est cohérent avec cela. Le directeur général Eddie Wu a fixé un objectif de plus de 20 gigawatts de capacité mondiale de centres de données Alibaba Cloud d'ici 2032 — un objectif de capacité, et non une capacité déployée, et un horizon de plus de cinq ans plutôt que celui du prochain trimestre.

Les affirmations d'amélioration personnelle qui soutiennent la feuille de route

Ce qui rend un plan de 5 à 10 billions discutable, et non simplement coûteux, c’est l’auto-amélioration récursive : si le pipeline d’entraînement s’améliore lui-même, le calcul nécessaire par génération diminue, et la frontière se rapproche du seuil abordable. C’est l’affirmation porteuse de la feuille de route, et c’est aussi la chose la moins vérifiable qu’Alibaba ait dite.

Ce que l’entreprise a rapporté : Qwen3.8-Max a accompli 33 cycles itératifs sur environ un mois de travail entièrement automatisé couvrant la conception de pipelines, la validation des données et le diagnostic des erreurs, et a fait passer son score Artificial Analysis de 40 à 45. Dans une expérience de conception de puces, le modèle a consacré plus de 60 heures à s’améliorer lui-même tout au long d’un cycle de conception, effectué plus de 10 000 appels à des outils d’automatisation de la conception électronique, et réduit la surface de la puce de 42 % sans perte de performance. Un rapport de la conférence fait également état d’une amélioration de 96 % du débit d’inférence grâce au réglage autonome d’un nouveau GPU T-Head.

Ces résultats sont rapportés par le fournisseur et n’ont pas été reproduits de manière indépendante. Ce n’est pas un détail technique — une boucle autonome qui note ses propres expériences se mesure à son propre évaluateur, et le monde extérieur n’a aucun moyen de vérifier la grille d’évaluation. La couverture de la conférence l’a généralement dit, et les lecteurs devraient le supposer.

Il y a un second piège dans cette même affirmation, et il concerne les étiquettes plutôt que l’honnêteté. Alibaba n’a pas précisé à quelle révision de l’Artificial Analysis Intelligence Index se mesure son passage de 40 à 45, et cet indice a été reconstruit depuis le lancement de ce modèle. La page actuelle d’Artificial Analysis pour Qwen3.8 Max (0902) affiche 45 — un chiffre indépendant, selon la révision en vigueur aujourd’hui. La valeur relevée pour le même modèle à la mi-août, selon la révision alors en vigueur, était de 56. Un 45 et un 56 ne sont pas la même mesure dans les mêmes unités, et soustraire l’un de l’autre produit un nombre qui ne veut rien dire. Ce que la page ne porte pas, c’est le 40 dont Alibaba dit s’être amélioré : le point de départ de ce delta est celui de l’entreprise, et seul le point d’arrivée se trouve, par hasard, là où se situe désormais la lecture indépendante. Lisez ce mouvement comme une direction, non comme une mesure.

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

Ce qu'Alibaba a réellement livré lors de la même conférence

En retirant la feuille de route, la conférence contenait encore de véritables sorties, toutes multimodales :

• Qwen3.8-LiveTranslate — interprétation simultanée, avec une latence (LAAL) réduite de près de 20 %, passant de 2,8 secondes à 2,3 secondes

• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS et Qwen-Audio-3.1-Realtime — une suite vocale actualisée

• Qwen-Audio-3.1-TTS-Next — des paysages sonores cinématographiques qui mêlent dialogues et ambiances à partir d’un script textuel, destinés aux livres audio, au cinéma et à la télévision, aux podcasts et aux jeux

• Qwen-Image 3.1 — génération d'images optimisée pour le design créatif et le marketing e-commerce, prévue pour plus tard cette année, avec génération native de fonds transparents

• Qwen Intelligence — une plateforme agentique full-stack destinée aux fabricants de smartphones

Chaque élément de cette liste est un produit avec une fenêtre de livraison. L'affirmation à l'échelle de la frontière est le seul point de l'ordre du jour sans date associée, et ce contraste n'est pas un accident : livrer l'offre multimodale est ce qui finance une année de feuille de route, et la feuille de route est ce qui transforme le prochain tour de financement ou le prochain contrat cloud en récit plutôt qu'en tableur. Les deux choses sont réelles. Une seule est quelque chose que l'on peut appeler.

Qu'est-ce qui est appelable aujourd'hui, et qu'est-ce qui doit changer pour que cela change ?

La génération Qwen 3.8 constitue toujours l'intégralité de la gamme achetable. Qwen3.8-Max est en disponibilité générale depuis le 3 août 2026 à 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, à tarif unique sur toute la fenêtre de contexte de 1 000 000 de jetons, sans supplément pour les invites longues. Ses poids ont été publiés le 12 août 2026 sous le nom Qwen3.8-2.4T-A95B en BF16 et FP8 sous une licence Qwen personnalisée. Son tableau de benchmarks du fournisseur est solide et non audité — Terminal-Bench 2.1 à 86,6, GPQA Diamond à 92,6, OSWorld-Verified à 86,1, tous des chiffres d'Alibaba lui-même — Le portrait indépendant est moins flatteur que celui du fournisseur : Artificial Analysis classe Qwen3.8 Max (0902) à un indice d'intelligence de 45, 24e sur 212 modèles, à 5,41 $ de coût mesuré par tâche de l'indice d'intelligence et 39,2 jetons de sortie par seconde — 159e sur 212, près du bas de l'échelle du domaine. La même page indique une fenêtre de contexte de 984 k contre 1 000 000 sur notre propre page modèle, un écart qu'il vaut la peine de connaître avant de dimensionner une tâche à contexte long. Score de classe frontière, vitesse dans la moyenne : voilà le résumé honnête du modèle phare livré, et c'est la référence que tout Qwen 4.5 doit battre sur les deux axes à la fois.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter héberge la famille Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash et qwen3.8-27b — sur un point de terminaison compatible OpenAI aux côtés de plus de 200 autres modèles, ce qui signifie qu'un palier Qwen 4.5 serait un changement d'identifiant de modèle sur une clé existante plutôt qu'un nouveau contrat fournisseur, une nouvelle facture et un nouveau SDK. Quand l'un sortira, c'est dans ce catalogue qu'il apparaîtrait. Aujourd'hui, ni Qwen 4.5 ni Qwen 5 n'y figurent, car aucun des deux n'a été publié — et aucune annonce de feuille de route ne changera cela.

L'usage pratique d'une feuille de route comme celle-ci est l'opposé d'un plan de migration. Si un palier Qwen 4.5 finit par sembler plausible pour votre charge de travail, le moyen le moins coûteux de le vérifier est d'acheminer une partie du trafic réel vers lui derrière un basculement automatique, de sorte qu'un modèle qui s'avère lent, coûteux ou pire que le modèle en place ne vous coûte qu'un pourcentage d'une charge de travail plutôt qu'un quart. C'est à cela que sert le basculement, et un modèle de pointe non éprouvé, vieux de quelques jours, en est le cas le plus évident pour y recourir.

Ce qu’il faut surveiller, et ce qu’il ne faut pas encore croire

Une ligne de feuille de route devient une version publiée lorsqu’un petit ensemble d’éléments concrets apparaît. Une fiche de modèle indiquant un nombre total de paramètres, un nombre de paramètres actifs et une fenêtre de contexte. Un identifiant d’API que l’on peut transmettre dans une requête. Des poids sur un hub de modèles. Une entrée sur un classement indépendant, avec une date associée. Un prix. N’importe lequel de ces éléments est un signal ; la plupart d’entre eux réunis constituent un lancement.

Ce qui ne constitue pas une sortie, aussi technique que cela en ait l'air : une mention lors d'une conférence ; la pull request d'un framework de serving ajoutant une branche d'architecture pour une build Qwen expérimentale, ce qui relève du travail sur le moteur de la pile d'inférence de quelqu'un plutôt que d'un modèle que l'on peut appeler ; un identifiant de snapshot daté pour une génération déjà livrée ; et une publication sur les réseaux sociaux paraphrasant une remarque faite sur scène. Le signal à l'origine de cet article était le dernier de ces éléments, et s'il valait la peine d'être traité, c'est que l'affirmation sous-jacente peut être vérifiée dans le communiqué de presse d'Alibaba lui-même — d'où proviennent la fourchette de 5 à 10 billions, le statut de Qwen 4 et les chiffres du RSI. Le signal pointait vers l'histoire ; il n'est pas l'histoire.

La question à court terme est plus étroite que ne le suggèrent les gros titres. Alibaba a déclaré que Qwen 4 est en cours d’entraînement, ce qui place Qwen 4 avant 4.5 et 5 dans la séquence — ainsi, la prochaine chose à surveiller n’est pas un modèle à 10 000 milliards de paramètres, mais de savoir si Qwen 4 arrive avec une fiche de modèle, un prix et un point de terminaison, et quand. Tant que rien dans cette chaîne ne se concrétise, la position honnête sur la fourchette de 5 000 à 10 000 milliards est qu’il s’agit d’une direction envisagée, déclarée publiquement, sans spécification qui y soit attachée et sans date. Prévoyez Qwen3.8-Max, surveillez la fourchette 4.5 et 5 comme une thèse de mise à l’échelle plutôt qu’un produit, et traitez chaque nombre de paramètres que vous voyez pour un modèle sans fiche de modèle comme une prévision.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement