
Qwen 4 Max annoncé à Apsara 2026 : ce qu’Alibaba a confirmé, et ce qu’il n’a pas confirmé
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La conférence Yunqi de Hangzhou — l'Apsara Conference — a servi le 22 septembre 2026 à présenter quatre modèles qui n'ont pas encore été livrés. Le responsable des LLM du laboratoire, Liu Da Yiheng, a présenté sur scène Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus et Qwen 4 27B, a décrit la famille comme s'entraînant sur une architecture de nouvelle génération, et s'est contenté de dire qu'elle arriverait bientôt. À l'heure où nous écrivons ces lignes, il n'existe de fiche modèle pour aucun des quatre, ni de poids ouverts, ni d'identifiant d'API, ni de fenêtre de contexte, ni de prix, ni de score de benchmark. Le modèle phare le plus récent que vous pouvez réellement appeler aujourd'hui est Qwen3.8-Max, en disponibilité générale depuis le 3 août 2026, et cet écart entre une annonce sur scène et un point de terminaison appelable est la partie de cette histoire qui mérite d'être lue attentivement.
Les quatre niveaux, et ce que chacun est censé être
La gamme Qwen d'Alibaba est organisée en niveaux de capacités depuis la génération Qwen 3, et l'annonce de Qwen 4 a conservé cette structure plutôt que de la remplacer. Ce qui a été présenté sur scène était une liste, pas une fiche technique :
• Qwen 4 Max — le niveau phare, celui qu'Alibaba positionne face au modèle phare de tous les autres laboratoires de pointe
• Qwen 4 Flash — le niveau à haut débit, conçu pour les charges sensibles à la latence et à fort volume plutôt que pour le raisonnement de pointe
• Qwen 4 Plus — le niveau intermédiaire équilibré, historiquement celui qui offre la plus large palette de prise en charge multimodale
• Qwen 4 27B — le palier local à poids ouverts, celui qui est téléchargé, affiné et quantifié par des personnes qui ne touchent jamais à une API hébergée
• Architecture — décrite comme une nouvelle génération, et décrite comme en cours d’entraînement, ce qui n’est pas la même chose que d’être terminée
• Charge de travail principale — tâches agentiques et faisant appel à des outils, selon le cadrage de la conférence, plutôt que le chat
• Disponibilité — aucune. Aucun niveau n’a de date de sortie, de prix, de fenêtre de contexte, de liste de modalités ni de score publié.
Le palier 27B est celui qu'il faut surveiller, pour une raison qui n'a rien à voir avec les benchmarks. C'est le seul palier de la famille qui, historiquement, a été publié avec des poids ouverts, et la génération Qwen 3.8 a montré tout le travail indépendant que cela débloque : en quelques jours à peine après la mise à disposition des poids 27B, la communauté avait produit des conversions MLX, des quantifications NVFP4 et des fine-tunes non censurés. Un 27B annoncé, c'est la promesse de tout un écosystème en aval, et c'est la partie de cette feuille de route dont la livraison est la plus prévisible.
Le nombre de 5 à 10 billions de paramètres n'appartient pas à Qwen 4
La couverture de la conférence a manqué de rigueur sur un chiffre. L'objectif de « 5 à 10 billions de paramètres » qui a circulé en parallèle des informations sur Qwen 4 n'est pas une spécification de Qwen 4 — il s'agit d'une déclaration prospective concernant les générations ultérieures, la période Qwen 4.5 et Qwen 5. Alibaba n'a associé aucun nombre de paramètres à Qwen 4 Max et, au vu des éléments disponibles, ce serait une erreur d'en publier un.
Cela compte parce que le nombre de paramètres est le chiffre sur lequel les lecteurs s’ancrent et celui qui se propage. Une affirmation de 5 T de paramètres associée à un modèle dont l’architecture n’a pas été publiée est infalsifiable dans les deux sens : personne ne peut la confirmer, et personne ne peut la corriger une fois qu’elle a été répétée. Si vous voyez Qwen 4 Max décrit cette semaine comme un modèle à plusieurs milliers de milliards de paramètres, le chiffre a été emprunté à une autre diapositive.
Ce qui peut être dit honnêtement, c'est que le modèle phare précédent est un mélange d'experts de 2,4 billions de paramètres avec 95 milliards de paramètres actifs par token, confirmé sur la fiche modèle officielle de Qwen3.8-Max et sur la version open-weight qui a suivi. Quoi que Qwen 4 Max finisse par être, c'est la référence qu'il doit surpasser, et c'est un nombre publié et vérifiable plutôt qu'une aspiration de feuille de route.

L'architecture n'est pas une rumeur : un aperçu a déjà été livré
La chose la plus utile à propos de l’annonce de Qwen 4 est qu’une partie de l’architecture a déjà été publiée sous un autre nom. Qwen3.8-Flash-Next a été publié en open source fin août 2026, et sa fiche de modèle le présente simplement comme un aperçu de l’architecture Qwen 4. Cela en fait la seule preuve concrète dont dispose quiconque en dehors d’Alibaba sur la manière dont la famille Qwen 4 est construite.
Il s'agit d'un modèle sparse de 125 milliards de paramètres principaux plus 51 milliards de paramètres d'embeddings N-gram, activant environ 6 milliards par étape d'inférence. Il dispose d'un contexte natif de 262 000 tokens que la fiche indique s'étendre vers 1 million, et Alibaba rapporte qu'il a été entraîné à un coût environ 90 % inférieur à celui de Qwen3.7-Plus. Trois techniques sont nommées sur la fiche :
• QSA, un schéma d’attention parcimonieuse spécifique à Qwen, qui est le mécanisme derrière l’affirmation d’un entraînement à long contexte à moindre coût
Connexions résiduelles à porte, une mesure de stabilité pour les réseaux profonds parcimonieux
• Plongements de n-grammes, un magasin de paramètres distinct de 51 milliards de paramètres, consulté plutôt que calculé de manière dense
Si les quatre niveaux de Qwen 4 héritent de cette conception, la conséquence intéressante est économique plutôt qu’architecturale. Une famille conçue pour atteindre une qualité proche de la frontière pour environ un dixième du coût d’entraînement est une famille qui peut être proposée à un prix agressif, et la tarification agressive d’Alibaba a été la force la plus fiable de l’économie des modèles à poids ouverts depuis deux ans. C’est une prédiction, pas un fait, et elle devrait être présentée comme telle — mais c’est la raison de suivre cette feuille de route plutôt que de la rejeter.
Que lancer pendant que vous attendez
Rien dans l'annonce de Qwen 4 ne change ce qui est disponible cette semaine, et la réponse honnête pour quiconque développe aujourd'hui est la génération Qwen 3.8. Qwen3.8-Max est en disponibilité générale depuis le 3 août 2026, à 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, à tarif unique sur toute la fenêtre de contexte d'un million de jetons, sans surcoût pour les invites longues, et ses poids ont été publiés le 12 août 2026 sous le nom Qwen3.8-2.4T-A95B, en BF16 comme en FP8, sous une licence Qwen personnalisée. C'est le modèle auquel les paliers de Qwen 4 seront comparés, et il traite du trafic de production aujourd'hui.
Si vous voulez comparer la génération Qwen actuellement disponible au reste de la frontière sans gérer un compte, une clé et une facturation distincts pour chaque laboratoire, OrcaRouter propose la famille Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash et Qwen3.8-27B — aux côtés de Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview et GLM 5.3 sur un point d'accès compatible OpenAI. C'est une seule API pour près de 200 modèles avec 0 % de marge, ce qui signifie que le prix catalogue du fournisseur est répercuté tel quel : une baisse de prix d'un fournisseur s'applique à votre clé le jour même plutôt qu'au cycle de facturation suivant. Quand une gamme Qwen 4 verra le jour, c'est dans ce même catalogue qu'elle apparaîtra ; aujourd'hui, aucune n'y figure.

En résumé
Qwen 4 Max est une vraie annonce et non un vrai produit, et les deux parties de cette phrase comptent. La gamme est confirmée : quatre paliers, une architecture de nouvelle génération, une orientation agentique, et un palier 27B à poids ouverts qui comptera plus aux yeux de plus de gens que le modèle phare. Tout ce qu'il faut pour prendre une décision d'achat — prix, contexte, modalité, poids, scores, une date — manque.
Considérez cela comme un signal de feuille de route avec une traçabilité documentaire exceptionnellement bonne, car la sortie de Qwen3.8-Flash-Next vous donne gratuitement un aperçu de l’architecture et Qwen3.8-Max vous fournit la référence en place, avec des poids publiés et un prix publié. Suivez la gamme 27B pour l’écosystème qu’elle va créer et la gamme Flash pour l’économie du débit. Ne republiez pas le chiffre de 5 à 10 billions de paramètres comme un fait concernant Qwen 4, et ne planifiez pas de migration autour d’un modèle qui n’a pas de date de sortie — planifiez-la autour de Qwen3.8-Max, et faites le mouvement lorsqu’il y aura une destination vers laquelle migrer.

Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
