Version Qwen3.8-Flash-Next — Au cœur de l’aperçu de l’architecture Qwen4 d’Alibaba. Illustration régénérée.
Guides & Insights

Version Qwen3.8-Flash-Next : Au cœur de l'aperçu de l'architecture Qwen4 d'Alibaba

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le document le plus utile qu'Ali​baba a publié le 26 août 2026 n'était pas le dossier de presse — c'était un rapport technique. {{1}}Qwen3.8-Flash-Next, le modèle multimodal open-weight à mélange d'experts sorti ce jour-là, est arrivé accompagné d'un article intitulé « On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability », et c'est ce rapport qui fait toute l'histoire.{{/1}} {{2}}Il fait ce que les lancements de fournisseurs ne font presque jamais : il publie les ablations, les résultats négatifs et les expériences sur les recettes d'entraînement, puis relie chaque conclusion à l'architecture de la famille Qwen4 que ce modèle est censé préfigurer.{{/2}}

Ce qui est réellement sorti le 26 août

Le modèle lui-même est modeste selon les standards de Qw​en pour 2026, et c'est délibéré. Qwen3.8-Flash-Next stocke 125B paramètres de modèle principal plus une table d'embedding n-gram séparée de 51B — environ 176B avant un module de prédiction multi-tokens de 4B — mais n'active que 6B par token. C'est un modèle de mélange d'experts à 512 experts avec routage top-10 et 48 couches, avec un contexte natif de 262 144 tokens extensible à 1M via YaRN. Il prend en entrée du texte, des images et des vidéos et émet du texte. Les poids sont sur Hugging Face et ModelScope sous la licence qwen-community-1.0, et le blog d'Ali​baba lui-même le qualifie d'« une avant-première expérimentale de l'architecture qui sous-tendra Qwen4 » — le même rôle que Qwen3-Next a joué pour la gamme Qw​en3.5, un canari qui s'envole avant le vaisseau amiral.

Le même jour, Ali​baba a activé son pendant commercial : une version servie appelée Qwen3.8-Flash sur l'API QwenCloud à 0,16 $ par million de jetons en entrée et 0,47 $ par million en sortie. Les deux sont faciles à confondre et il vaut mieux les distinguer. Qwen3.8-Flash-Next est l'aperçu à poids ouverts que le rapport technique dissèque ; Qwen3.8-Flash est la version de production de l'API, tarifée, avec un contexte par défaut de 1 million de jetons et des formats de requête compatibles Open​AI et Anthropic. Le prix, les benchmarks et les arguments d'architecture découlent tous de la même ingénierie.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

Les quatre paris d'architecture dans le rapport technique

L'épine dorsale de l'article repose sur quatre paris concernant ce à quoi devrait ressembler un modèle frontalier à long contexte et à faible coût, chacun étant accompagné de preuves expérimentales.

• Attention — hybride GDN + QSA. Trois couches sur quatre utilisent Gated DeltaNet, une couche d'attention linéaire qui compresse l'historique dans un état récurrent de taille fixe au lieu d'un cache KV qui croît avec la longueur de la séquence. La couche restante est Qw​en Sparse Attention, qui agrège la séquence en micro-blocs, les note à moindre coût, et n'exécute l'attention complète que sur les régions qui comptent. Ali​baba rapporte des accélérations de pré-remplissage allant jusqu'à 7,6× et de décodage de 4,9× pour un contexte de 1M ; le benchmark propre de SGLang, réalisé le jour même, a mesuré des valeurs encore plus élevées, à 10,2× et 6,6×. Avec un taux de succès de cache de préfixe de 90 %, le débit de pré-remplissage atteint 8,6× celui de Qwen3.7-Plus. Ces chiffres sont rapportés par le fournisseur et ses partenaires, et ne sont pas audités de manière indépendante.

• Flux résiduel — Résidu à portes. Le chemin résiduel unique est élargi en quatre branches parallèles avec un gating dynamique par élément, une conception multi-branches de type Hyper-Connection avec un contrôle de type GatedNorm. La porte régule les lectures et écritures par branche, ce qui, selon l'article, supprime les valeurs aberrantes d'activation et, en pratique, permet de stocker les états résiduels en FP8.

• Embedding — la table de n-grammes de 51B. Au lieu d'un embedding par token, le modèle indexe une table de correspondance sur le token courant et les précédents, stockant des phrases entières et des motifs locaux. C'est presque gratuit par token, et comme les adresses de correspondance sont connues à l'avance, elle peut résider dans la mémoire hôte et être préchargée de manière asynchrone, entièrement hors de la mémoire GPU. C'est l'astuce qui permet à un checkpoint stocké de 176B de fonctionner sur des machines de classe 75 Go, et cela remonte aux embeddings par couche de Gemma 3n et à l'Engram de Deep​Seek.

• Optimisation — Muon, réglé. L'entraînement utilise l'optimiseur Muon, une méthode de momentum basée sur l'orthogonalisation, appliquée aux applications linéaires bidimensionnelles (attention, GDN et poids des experts MoE), tandis qu'AdamW est conservé pour les plongements, le routeur et les paramètres de bas rang. L'article rapporte également un résultat négatif qui vaut la peine d'être lu : le warmup de la taille de lot a été abandonné après qu'il s'est avéré coûter 18,8 % de pas d'optimisation en plus sans améliorer quoi que ce soit.

Le tableau de référence, à lire attentivement.

Chaque chiffre clé présenté ici émane de Qw​en lui-même, publié sur la fiche du modèle et dans le rapport, et rien de tout cela n'a été reproduit de manière indépendante — le modèle n'a qu'un jour et aucun tiers ne l'a encore audité. Même vu sous cet angle, le résultat reste frappant : Qwen3.8-Flash-Next rivalise avec DeepSeek-V4-Flash-0731, un modèle nettement plus gros et plus établi, avec seulement 6B paramètres actifs.

DeepSWE 1.1 — 58.7 contre 54.4 (rapporté par le fournisseur).

• SWE-bench Pro — 62.5 contre 56.0 (rapporté par le fournisseur).

• Toolathlon Verified — 73.5 vs 70.3 (rapporté par le fournisseur).

• LiveCodeBench v6 — 91,9 contre 90,6 (rapporté par le fournisseur).

• GPQA Diamond — 91,7 contre 90,8 (rapporté par le fournisseur).

• IFBench — 81,3 contre 79,2 (annoncé par le fournisseur).

Ensuite, l'écart que le rapport expose au grand jour : NL2Repo-Bench, 48.1 contre 54.2 pour DeepSeek-V4-Flash-0731 — un réel déficit en génération de code au niveau du dépôt, la dimension de codage agentique où le modèle plus petit ne suit pas. Agents' Last Exam est un match nul à 24.3 contre 25.2. Sur la bureautique, Qw​en annonce CoWorkBench 73.9 — mais c'est un benchmark interne et Ali​baba ne le fait pas figurer sur le tableau principal.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

En vision, le tableau auto-déclaré montre AndroidWorld 84.5 contre 62.0 pour Claude Opus 4.6 Max, et RealWorldQA 88.5 contre 73.9. Humanity's Last Exam est le seul titre où Qw​en perd carrément face à Claude Opus 4.6 Max — et ce score a lui-même été évalué par GPT-4o, donc même cette comparaison n'est pas propre.

Le prix : un douzième du vaisseau amiral.

Ensuite, le chiffre qui compte pour les budgets. La version servie Qwen3.8-Flash est à 0,16 $ par million de jetons en entrée et 0,47 $ par million en sortie sur QwenCloud. C'est environ un douzième du prix du vaisseau amiral d'Alibaba, Qwen3.8-Max, à 2,00 $ par million en entrée et 6,00 $ par million en sortie — sur un modèle qui, selon le rapport, a été entraîné avec environ un neuvième de la puissance de calcul de Qwen3.7-Plus. Les vendeurs de modèles chinois ont passé l'été à réduire les prix de la gamme flash, et cette sortie est le versant Qwen de cette campagne, arrivant avec une justification architecturale plutôt qu'une simple remise.

Pour quiconque compare dans cette catégorie, les calculs sont plus simples lorsque chaque fournisseur affiche le même chiffre. OrcaRouter achemine le reste de la famille Qw​en — Qwen3.8-Max, Qwen3.8-27B et Qwen3.8 — au prix catalogue du fournisseur avec une marge de 0 %, de sorte qu'une réduction de prix du fournisseur est répercutée chez nous le jour même de son annonce. Qwen3.8-Flash-Next n'est pas encore dans notre catalogue ; lorsqu'il atteindra un runtime que nous routons, il s'intégrera dans cette même configuration en un clic, au prix catalogue, sans second contrat.

Ce que vous pouvez en faire aujourd'hui

Le support de service dès le jour zéro est exceptionnellement large. SGLang fournit une page de cookbook et une image dédiée (lmsysorg/sglang:qwen38flashnext) ; vLLM propose vllm/vllm-openai:qwen38-flash-next ; NVIDIA valide les deux ainsi que TensorRT LLM sur un rack GB300 NVL72 à plus de 16 000 tokens par seconde par GPU en FP8, et NeMo couvre le fine-tuning. En dessous de l'échelle du centre de données, le modèle fonctionne sur des clusters DGX Spark et des stations de travail 4×RTX PRO 6000, et le train de quantifications communautaires du jour même — les GGUFs d'Unsloth et une version 1-bit qui tient dans 75 Go de RAM avec environ 80 % de la précision complète — signifie que le checkpoint de 176B est réellement exécutable sur du matériel qu'une petite équipe possède. Les équipes qui préfèrent l'invoquer plutôt que l'exécuter peuvent accéder à l'API Qwen3.8-Flash via le QwenCloud d'Ali​baba lui-même et plusieurs plateformes tierces, même si ce sont les poids ouverts que la plupart des premiers adoptants choisiront en priorité.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

Le calcul de VRAM derrière cette liste, c'est la table de n-grammes, et c'est le prochain point de convergence des stacks de serving. L'embedding par couche que le rapport technique garde hors de la mémoire GPU est une simple structure de consultation — pour chaque jeton généré, le modèle ne consulte qu'environ 16 de ses 320 millions de lignes — ce qui rend son déchargement peu coûteux. vLLM sert Qwen3.8-Flash-Next depuis une image de développement dédiée pendant que la pull request de support de l'architecture est encore ouverte, et la dernière pièce de ce travail, un brouillon de PR du même auteur de vLLM (vllm-project/vllm#54371, non fusionnée), ajoute un chemin de serving PLE-Offload qui conserve la table en mémoire hôte et la lit via l'adressage virtuel unifié CUDA au lieu de réserver de la VRAM. En FP8, la table représente environ 48 Go du checkpoint de ~173 Go, donc la décharger fait la différence entre un GPU de centre de données et une seule carte de 96 Go — une RTX PRO 6000, ou le pool de mémoire unifiée d'un seul DGX Spark. C'est encore tôt, alors considérez-le comme une orientation plutôt qu'une option prise en charge aujourd'hui ; mais c'est le runtime qui rattrape ce que le rapport technique avançait déjà, et ce qu'il faut surveiller si c'est le chiffre de VRAM qui vous freinait.

Un aperçu d’un jour avec des chiffres non reproduits est le cas d’école pour ne pas miser un chemin de production dessus, et c’est exactement à cela que sert le basculement. Si un runtime embarque Qwen3.8-Flash-Next et que vous pointez un endpoint dessus avec un basculement automatique vers un modèle que vous connaissez déjà, vous obtenez les avantages de la nouvelle architecture sur le trafic non critique et un repli propre quand elle rencontre des difficultés — sans recâblage, car c’est une règle de routage, pas un changement de code.

Ce que cet aperçu dit à propos de Qwen4

Ali​baba a déjà joué cette pièce. Qwen3-Next a dévoilé Gated DeltaNet fin 2025 avec une documentation succincte, et l'architecture n'a été entièrement spécifiée qu'une fois que la série Qw​en3.5 l'a adoptée à grande échelle. Le schéma se répète : Qwen3.8-Flash-Next est le canari, et le rapport est la spécification par l'expérience. Les points concrets à surveiller sont de savoir si le modèle phare Qwen4 adopte la répartition trois-pour-un entre GDN et QSA, si l'embedding n-gram survit au contact du service de production à l'échelle du modèle phare, et surtout si des évaluations indépendantes confirment l'avantage du 6B-actif par rapport à des modèles plus grands. Si la thèse de l'efficacité se confirme, le modèle phare Qwen4 pourrait être lancé avec des coûts de service nettement inférieurs à ceux de la génération précédente.

FAQ

Qwen3.8-Flash-Next et Qwen3.8-Flash — même modèle ?

Non, et la distinction est importante. Qwen3.8-Flash-Next est l'aperçu d'architecture à poids ouverts que le rapport technique analyse ; Qwen3.8-Flash est la version API de production qu'Ali​baba propose sur QwenCloud à 0,16 $/0,47 $ par million de jetons avec un contexte par défaut de 1M. Même lignée technique, artefacts différents — l'un est destiné à l'hébergement autonome et à l'inspection, l'autre est un service managé facturé.

Les charges de travail de production devraient-elles y migrer aujourd'hui ?

Pas sans un second avis. Tous les benchmarks sont rapportés par le fournisseur et non reproduits, l'architecture est assez nouvelle pour que les piles de service soient encore en convergence — le support propre de vLLM arrive encore via des pull requests ouvertes — et la seule lacune en codage agentique (NL2Repo) porte exactement sur le type de tâche que rencontrent les codeurs en production. Les poids ouverts permettent de vous évaluer à peu de frais, et le support day-0 de SGLang et vLLM rend un pilote possible cette semaine — mais un pilote derrière un failover est la façon honnête de commencer, pas un cutover.

Quand est-ce que le vrai Qwen4 sort ?

Ali​baba n'a rien dit. Le seul signal temporel de cette version est historique : le dernier canari, Qwen3-Next, a volé environ une saison avant que la série Qw​en3.5 n'adopte son architecture. À ce rythme, les modèles phares de Qwen4 sont plus proches qu'il n'y paraît — mais le rapport porte explicitement sur l'architecture, pas sur une feuille de route.

En résumé

Qwen3.8-Flash-Next est l'une de ces rares sorties où l'article est le produit. Sur le modèle lui-même, le bilan honnête est le suivant : 6B de paramètres actifs égalant des modèles bien plus grands sur la plupart des benchmarks partagés, une lacune explicitement nommée sur le code au niveau du dépôt, un prix de service d'un douzième de celui du modèle phare, et une architecture qui est la réponse de Qw​en à la question de savoir comment un modèle de pointe devient abordable. Le rapport technique dit à quoi sert Qwen3.8-Flash-Next — et ce n'est pas le modèle. C'est la preuve de l'architecture qui sera Qwen4, et cela vaut la peine d'être lu avant que Qwen4 ne sorte, car la décision qu'il change est celle que vous prendrez lorsque Qwen4 arrivera.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube