Une carte de titre principale pour « Qwen 4 Max annoncé à Apsara 2026 », avec le sous-titre « Ce qu'Alibaba a confirmé, et ce qu'il n'a pas confirmé », trois badges en forme de pilule indiquant « 4 niveaux en avant-première », « 0 spécification publiée » et « 22 septembre 2026 », ainsi que le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Qwen 4 Max annoncé à Apsara 2026 : ce qu’Alibaba a confirmé, et ce qu’il n’a pas confirmé

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La conférence Yunqi de Hangzhou — l'Apsara Conference — a servi le 22 septembre 2026 à présenter quatre modèles qui n'ont pas encore été livrés. Le responsable des LLM du laboratoire, Liu Da Yiheng, a présenté sur scène Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus et Qwen 4 27B, a décrit la famille comme s'entraînant sur une architecture de nouvelle génération, et s'est contenté de dire qu'elle arriverait bientôt. À l'heure où nous écrivons ces lignes, il n'existe de fiche modèle pour aucun des quatre, ni de poids ouverts, ni d'identifiant d'API, ni de fenêtre de contexte, ni de prix, ni de score de benchmark. Le modèle phare le plus récent que vous pouvez réellement appeler aujourd'hui est Qwen3.8-Max, en disponibilité générale depuis le 3 août 2026, et cet écart entre une annonce sur scène et un point de terminaison appelable est la partie de cette histoire qui mérite d'être lue attentivement.

Les quatre niveaux, et ce que chacun est censé être

La gamme Qwen d'Alibaba est organisée en niveaux de capacités depuis la génération Qwen 3, et l'annonce de Qwen 4 a conservé cette structure plutôt que de la remplacer. Ce qui a été présenté sur scène était une liste, pas une fiche technique :

• Qwen 4 Max — le niveau phare, celui qu'Alibaba positionne face au modèle phare de tous les autres laboratoires de pointe

• Qwen 4 Flash — le niveau à haut débit, conçu pour les charges sensibles à la latence et à fort volume plutôt que pour le raisonnement de pointe

• Qwen 4 Plus — le niveau intermédiaire équilibré, historiquement celui qui offre la plus large palette de prise en charge multimodale

• Qwen 4 27B — le palier local à poids ouverts, celui qui est téléchargé, affiné et quantifié par des personnes qui ne touchent jamais à une API hébergée

• Architecture — décrite comme une nouvelle génération, et décrite comme en cours d’entraînement, ce qui n’est pas la même chose que d’être terminée

• Charge de travail principale — tâches agentiques et faisant appel à des outils, selon le cadrage de la conférence, plutôt que le chat

• Disponibilité — aucune. Aucun niveau n’a de date de sortie, de prix, de fenêtre de contexte, de liste de modalités ni de score publié.

Le palier 27B est celui qu'il faut surveiller, pour une raison qui n'a rien à voir avec les benchmarks. C'est le seul palier de la famille qui, historiquement, a été publié avec des poids ouverts, et la génération Qwen 3.8 a montré tout le travail indépendant que cela débloque : en quelques jours à peine après la mise à disposition des poids 27B, la communauté avait produit des conversions MLX, des quantifications NVFP4 et des fine-tunes non censurés. Un 27B annoncé, c'est la promesse de tout un écosystème en aval, et c'est la partie de cette feuille de route dont la livraison est la plus prévisible.

Le nombre de 5 à 10 billions de paramètres n'appartient pas à Qwen 4

La couverture de la conférence a manqué de rigueur sur un chiffre. L'objectif de « 5 à 10 billions de paramètres » qui a circulé en parallèle des informations sur Qwen 4 n'est pas une spécification de Qwen 4 — il s'agit d'une déclaration prospective concernant les générations ultérieures, la période Qwen 4.5 et Qwen 5. Alibaba n'a associé aucun nombre de paramètres à Qwen 4 Max et, au vu des éléments disponibles, ce serait une erreur d'en publier un.

Cela compte parce que le nombre de paramètres est le chiffre sur lequel les lecteurs s’ancrent et celui qui se propage. Une affirmation de 5 T de paramètres associée à un modèle dont l’architecture n’a pas été publiée est infalsifiable dans les deux sens : personne ne peut la confirmer, et personne ne peut la corriger une fois qu’elle a été répétée. Si vous voyez Qwen 4 Max décrit cette semaine comme un modèle à plusieurs milliers de milliards de paramètres, le chiffre a été emprunté à une autre diapositive.

Ce qui peut être dit honnêtement, c'est que le modèle phare précédent est un mélange d'experts de 2,4 billions de paramètres avec 95 milliards de paramètres actifs par token, confirmé sur la fiche modèle officielle de Qwen3.8-Max et sur la version open-weight qui a suivi. Quoi que Qwen 4 Max finisse par être, c'est la référence qu'il doit surpasser, et c'est un nombre publié et vérifiable plutôt qu'une aspiration de feuille de route.

A two-column scoreboard titled "Qwen 4 Max vs the model you can call today". Left column Qwen 4 Max: Release date not given, Input price not given, Output price not given, Context window not given, Open weights not given, Benchmarks not given. Right column Qwen3.8-Max: Release date August 3 2026, Input price $2.00 per 1M tokens, Output price $6.00 per 1M tokens, Context window 1M tokens, Open weights published August 12 2026, Benchmarks vendor and independent. Footer reads "Qwen 4 Max status per Alibaba's September 22 2026 conference; Qwen3.8-Max from its published model card.", with the OrcaRouter logo bottom-right.

L'architecture n'est pas une rumeur : un aperçu a déjà été livré

La chose la plus utile à propos de l’annonce de Qwen 4 est qu’une partie de l’architecture a déjà été publiée sous un autre nom. Qwen3.8-Flash-Next a été publié en open source fin août 2026, et sa fiche de modèle le présente simplement comme un aperçu de l’architecture Qwen 4. Cela en fait la seule preuve concrète dont dispose quiconque en dehors d’Alibaba sur la manière dont la famille Qwen 4 est construite.

Il s'agit d'un modèle sparse de 125 milliards de paramètres principaux plus 51 milliards de paramètres d'embeddings N-gram, activant environ 6 milliards par étape d'inférence. Il dispose d'un contexte natif de 262 000 tokens que la fiche indique s'étendre vers 1 million, et Alibaba rapporte qu'il a été entraîné à un coût environ 90 % inférieur à celui de Qwen3.7-Plus. Trois techniques sont nommées sur la fiche :

• QSA, un schéma d’attention parcimonieuse spécifique à Qwen, qui est le mécanisme derrière l’affirmation d’un entraînement à long contexte à moindre coût

Connexions résiduelles à porte, une mesure de stabilité pour les réseaux profonds parcimonieux

• Plongements de n-grammes, un magasin de paramètres distinct de 51 milliards de paramètres, consulté plutôt que calculé de manière dense

Si les quatre niveaux de Qwen 4 héritent de cette conception, la conséquence intéressante est économique plutôt qu’architecturale. Une famille conçue pour atteindre une qualité proche de la frontière pour environ un dixième du coût d’entraînement est une famille qui peut être proposée à un prix agressif, et la tarification agressive d’Alibaba a été la force la plus fiable de l’économie des modèles à poids ouverts depuis deux ans. C’est une prédiction, pas un fait, et elle devrait être présentée comme telle — mais c’est la raison de suivre cette feuille de route plutôt que de la rejeter.

Que lancer pendant que vous attendez

Rien dans l'annonce de Qwen 4 ne change ce qui est disponible cette semaine, et la réponse honnête pour quiconque développe aujourd'hui est la génération Qwen 3.8. Qwen3.8-Max est en disponibilité générale depuis le 3 août 2026, à 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, à tarif unique sur toute la fenêtre de contexte d'un million de jetons, sans surcoût pour les invites longues, et ses poids ont été publiés le 12 août 2026 sous le nom Qwen3.8-2.4T-A95B, en BF16 comme en FP8, sous une licence Qwen personnalisée. C'est le modèle auquel les paliers de Qwen 4 seront comparés, et il traite du trafic de production aujourd'hui.

Si vous voulez comparer la génération Qwen actuellement disponible au reste de la frontière sans gérer un compte, une clé et une facturation distincts pour chaque laboratoire, OrcaRouter propose la famille Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash et Qwen3.8-27B — aux côtés de Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview et GLM 5.3 sur un point d'accès compatible OpenAI. C'est une seule API pour près de 200 modèles avec 0 % de marge, ce qui signifie que le prix catalogue du fournisseur est répercuté tel quel : une baisse de prix d'un fournisseur s'applique à votre clé le jour même plutôt qu'au cycle de facturation suivant. Quand une gamme Qwen 4 verra le jour, c'est dans ce même catalogue qu'elle apparaîtra ; aujourd'hui, aucune n'y figure.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the on-page nav, the 1M token context badge, the model ID qwen/qwen3.8-max, multi-modality shown as text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the code-samples panel with the OpenAI-compatible Python import, the Public benchmarks and Community buzz blocks, and the opening line of the model description calling Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

En résumé

Qwen 4 Max est une vraie annonce et non un vrai produit, et les deux parties de cette phrase comptent. La gamme est confirmée : quatre paliers, une architecture de nouvelle génération, une orientation agentique, et un palier 27B à poids ouverts qui comptera plus aux yeux de plus de gens que le modèle phare. Tout ce qu'il faut pour prendre une décision d'achat — prix, contexte, modalité, poids, scores, une date — manque.

Considérez cela comme un signal de feuille de route avec une traçabilité documentaire exceptionnellement bonne, car la sortie de Qwen3.8-Flash-Next vous donne gratuitement un aperçu de l’architecture et Qwen3.8-Max vous fournit la référence en place, avec des poids publiés et un prix publié. Suivez la gamme 27B pour l’écosystème qu’elle va créer et la gamme Flash pour l’économie du débit. Ne republiez pas le chiffre de 5 à 10 billions de paramètres comme un fait concernant Qwen 4, et ne planifiez pas de migration autour d’un modèle qui n’a pas de date de sortie — planifiez-la autour de Qwen3.8-Max, et faites le mouvement lorsqu’il y aura une destination vers laquelle migrer.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement