
Qwen3.8-Flash-Next : Alibaba dévoile l'architecture Qwen4 avant même que Qwen4 n'existe
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Alibaba s'apprête à publier l'architecture Qwen4 avant même de publier un modèle Qwen4. Qwen3.8-Flash-Next — un modèle multimodal à mélange d'experts (MoE) à poids ouverts, construit sur l'architecture de nouvelle génération qui alimentera la famille Qwen4 — doit être rendu public sur ModelScope à 23 h 00, heure de Beijing, le 26 août 2026. Alibaba présente cette sortie comme un aperçu technologique : les développeurs obtiennent l'architecture en avant-première, la famille complète Qwen4 arrivera plus tard. Au moment où nous écrivons ces lignes, le nombre de paramètres, la licence et le prix ne sont pas confirmés ; il s'agit donc d'un article « ce que nous savons jusqu'ici » — chaque détail ci-dessous est accompagné d'une indication de son degré de fiabilité.
Si vous n'avez pas suivi le rythme d'Alibaba ce mois-ci, le point d'ancrage est Qwen3.8-Max — le fleuron à 2,4 billions de paramètres publié le 3 août et open-sourcé sous le nom de Qwen3.8-2.4T-A95B moins de deux semaines plus tard. Qwen3.8-Flash-Next arrive moins d'un mois après. Le même laboratoire qui a sorti un modèle open-weight à 2,4 billions de paramètres distribue maintenant l'architecture de la génération suivante, avant même que le fleuron de cette génération ne soit nommé.
Qu'est-ce qui a été annoncé ?
Le signal est arrivé dans l'arène par les canaux habituels. Une page teaser ModelScope pour Qwen3.8-Flash-Next a été mise en ligne le 25 août, arborant un badge « Prochaine sortie ouverte », le slogan « Vers la nouvelle génération — vitesse éclair », et un compte à rebours pointant vers le 2026-08-26 23:00 (UTC+08:00). L'équipe Qwen d'Alibaba a publié sur X le même jour : « La prochaine vague Qwen arrive. » Le post qui nous a transmis cette information, de @kimmonismus sur X, décrivait la même chose en des termes légèrement différents : un MoE multimodal à poids ouverts sur une architecture de nouvelle génération, en accès anticipé pour permettre à la communauté de se préparer à la famille Qwen4.

La partie qui mérite d'être relue est le cadrage d'Alibaba lui-même. Le modèle est présenté comme étant construit sur l'architecture de nouvelle génération « qui alimentera la future famille Qwen4 » — et explicitement pas comme Qwen4 lui-même. La raison avancée par Alibaba est que les changements architecturaux doivent être entre les mains de la communauté avant l'arrivée de la famille, afin que les runtimes, les quantifications et les applications soient prêts lorsque le vrai produit sortira. C'est une position marketing, mais c'est aussi un engagement technique : prévisualiser d'abord la partie difficile, emmener la communauté avec soi.
Qu'est-ce qui est confirmé aujourd'hui, et qu'est-ce qui ne l'est pas :
• Confirmé, d'après le teaser et la déclaration de Qwen : Qwen3.8-Flash-Next est un modèle open-weight, multimodal et MoE sur l'architecture Qwen4.
Confirmé, selon la déclaration de Qwen : il introduit deux changements architecturaux majeurs — l’architecture hybride GDN et l’attention sparse Qwen (QSA).
• Confirmé, selon le teaser : l'heure de sortie, 2026-08-26 23:00 (UTC+08:00), sur ModelScope.
• Non confirmé : paramètres totaux ou actifs, conditions de licence, longueur du contexte, disponibilité ou tarification de l'API, et chaque score de benchmark. Aucune évaluation indépendante n'existe encore car les poids ne sont pas publiés.

Ce qu'est réellement l'architecture Qwen4
Deux mécanismes portent le récit. Le premier, GDN — Gated Delta Network — est la couche d'attention linéaire d'Alibaba. Là où un transformer standard conserve un cache clé-valeur qui croît avec la longueur de la séquence, une couche GDN maintient un état récurrent de taille fixe et le met à jour avec une règle de gating apprise ; la lignée passe par DeltaNet et Mamba-2. L'avantage est celui qui alimente discrètement la gamme Qwen depuis Qwen3-Next : les contextes longs restent peu coûteux car l'état ne croît pas, tandis qu'une minorité de couches de pleine attention reste dans le mélange pour effectuer la récupération précise que l'attention linéaire maîtrise mal. Dans la génération actuelle, ce mélange est d'environ trois couches GDN pour chaque couche de pleine attention — l'analyse communautaire du checkpoint Qwen3.8-2.4T-A95B dénombre 69 couches GDN contre 23 couches d'attention. Qwen3.8-Flash-Next est décrit comme « l'architecture hybride GDN » sur exactement cette lignée.
Le second, QSA — Qwen Sparse Attention — est l’élément véritablement nouveau, et il n’existe encore aucune description technique publique : seulement le nom, et son annonce comme l’un des deux changements phares de l’aperçu. Cette absence de détails fait elle-même partie du schéma. L’aperçu de Qwen3-Next à la fin 2025 a introduit Gated DeltaNet avec la même pénurie de documentation, et l’architecture n’a été entièrement spécifiée que lorsque la série Qwen3.5 l’a adoptée. Pour le lecteur, la conclusion pratique est la même dans les deux cas : le canari architectural apparaît d’abord, la documentation et les modèles de production suivent.
Le playbook qui a déjà fonctionné une fois.
Alibaba a déjà joué ce coup-là, et ça a fonctionné. Fin 2025, Qwen3-Next a présenté en avant-première Gated DeltaNet et un hybride d’attention linéaire et complète. Lorsque la série Qwen3.5 est sortie, elle a adopté ce plan à grande échelle — et l’hybride a perduré depuis à travers la génération Qwen3.8, y compris le fleuron 2.4T. La raison pour laquelle ce précédent compte ici, c’est le calendrier qu’il implique. La famille complète Qwen4 devrait être attendue de l’autre côté de cet aperçu, pas à l’intérieur ; si l’écart de Qwen3-Next est une indication, la distance entre « voici l’architecture » et « voici la famille » se mesure en mois. Rien dans le teaser ne confirme cela — c’est une inférence à partir d’un schéma qu’Alibaba a désormais exécuté deux fois.
Ce que nous ne savons toujours pas
Les inconnues sont tout l'intérêt d'un aperçu, et elles sont bien réelles :
• Paramètres. Le teaser n'en dévoile aucun. La spéculation de la communauté sur X et Reddit — sans aucun soutien officiel — pointe vers une configuration d'environ 125B au total / 6B actifs, avec une grande table de correspondance d'embeddings n-gram. Traitez-le comme une rumeur.
• Le niveau « Flash ». Dans la génération Qwen3.5, le Qwen3.5-Flash, exclusivement cloud, était une variante améliorée du Qwen3.5-35B-A3B à poids ouverts. On ignore si le Qwen3.8-Flash-Next est l'équivalent à poids ouverts d'un modèle Qwen3.8 de taille similaire ; il pourrait plutôt s'agir du modèle de classe 125B-A6B. Ces deux interprétations ne sont que des suppositions.
• Licence. Les récentes versions de Qwen d'Alibaba vont de la licence Apache-2.0 (Qwen3.8-27B) à la licence Qwen3.8-Max, soumise à des conditions de revenus. La licence sous laquelle Flash-Next se rangera déterminera si elle peut être utilisée commercialement, et à quelles conditions.
• Benchmarks. Le communiqué de Qwen met en avant le codage agentique, les tâches à long horizon et l’intelligence multimodale, mais aucun chiffre n’est associé et il n’y a pas d’évaluation indépendante avant que les poids ne soient publiés.
Une famille qui itère sur un rythme de deux semaines
Le rythme environnant est une histoire en soi. Qwen3.8-Max, le vaisseau amiral de 2,4 billions de paramètres, est sorti le 3 août ; le modèle open-weight Qwen3.8-2.4T-A95B a suivi les 12 et 13 août ; le Qwen3.8-27B gratuit sous licence Apache-2.0 est arrivé quelques jours plus tard ; et maintenant, avant la fin du mois, l'architecture de la prochaine génération est dévoilée en avant-première. Aucun autre laboratoire ne publie actuellement à ce rythme. Pour un lecteur qui choisit des modèles, la conséquence pratique est que « le meilleur Qwen » est une cible mouvante — et l'écart entre les générations arrive plus vite que ce que l'écosystème environnant met généralement à s'adapter. Acheter une décision plutôt qu'un modèle est de plus en plus la démarche défendable.
Ce qu'un développeur devrait faire maintenant
Planifiez l'architecture, pas seulement le modèle. Qwen3.8-Flash-Next sera un aperçu non éprouvé dès le premier jour : aucun benchmark indépendant, un écosystème d'exécution encore en cours de rattrapage, et uniquement des affirmations du fournisseur pour les points forts agentiques et à long horizon qui comptent pour les charges de travail qui l'utiliseraient. La manière sûre de l'évaluer n'est pas de le brancher sur un chemin de production — c'est de lui envoyer une copie à faible enjeu d'une charge de travail, de comparer la sortie avec le modèle existant, et de laisser le basculement automatique absorber les moments où le fournisseur servant un tout nouveau modèle open-weight se comporte mal. Sur OrcaRouter, c'est le même point de terminaison et la même clé que vous utilisez déjà : Qwen3.8-Flash-Next et votre modèle actuel se situent derrière une même API, et le DSL de routage peut tester l'aperçu en A/B contre le modèle existant avec le même prompt avant que quoi que ce soit ne soit engagé.
Les prix, lorsqu’ils existent, doivent être lus de la même manière. Alibaba n’a pas annoncé de prix API pour Flash-Next, et les poids non publiés ne sont routables nulle part. Lorsqu’un fournisseur les expose, OrcaRouter transmet le prix catalogue du fournisseur tel quel, avec une marge de 0 % — donc quel que soit le chiffre qu’Alibaba finira par annoncer, il apparaîtra inchangé, le jour même. La référence la plus proche que vous puissiez réellement consulter aujourd’hui est Qwen3.8-Max (qwen/qwen3.8-max), le modèle phare sous lequel cette architecture finira par se situer : une fenêtre de contexte d’un million de tokens à 2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie, transmise au prix catalogue. Gardez ce chiffre en tête lorsque le prix de Flash-Next baissera ; c’est le coût que la prochaine génération devra battre.

Que regarder sur un coup de tête
Quatre choses comptent au moment où le minuteur de sortie expire :
• Le nombre de paramètres et le palier de paramètres actifs — qu'il s'agisse du modèle de classe 125B-A6B que décrivent les rumeurs ou d'un modèle plus petit.
• La licence — permissive comme Qwen3.8-27B, ou restreinte comme la licence Max.
• Que les premières évaluations indépendantes reproduisent ou non les affirmations du fournisseur sur le codage agentique et les tâches à long terme — les chiffres auxquels se fier, pas le discours marketing.
• Combien de temps Alibaba attend avant que la famille complète Qwen4 ne suive l'aperçu.
Rien de tout cela n'est connaissable d'ici. Ce qui est connaissable aujourd'hui, c'est la forme de la décision qu'Alibaba a prise : elle parie que la prochaine génération de son architecture mérite d'être donnée avant le produit phare. Ce pari est l'histoire — et les poids sortent demain.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
