Découvrez Qwen3.8-Flash — un MoE multimodal à poids ouverts qui préfigure l'architecture Qwen4. Illustration régénérée.
Guides & Insights

Découvrez Qwen3.8-Flash : un MoE multimodal à poids ouverts qui préfigure l'architecture Qwen4 — 0,15 $/0,47 $ par 1M de tokens sur QwenCloud

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 26 août 2026, l'équipe Qwen a publié en open source les poids de Qwen3.8-Flash — publiés sur Hugging Face et ModelScope sous le nom Qwen3.8-Flash-Next — et a lancé le modèle de production portant le nom Qwen3.8-Flash sur l'API QwenCloud, en confirmant sa tarification officielle le lendemain. Le chiffre phare — officiellement confirmé dans l'annonce même d'Alibaba le 28 août — est un mélange d'experts multimodal de 125 milliards de paramètres qui n'active qu'environ 6 milliards de paramètres par jeton, soit une sparsité d'environ 95 %, construit sur une architecture qu'Alibaba décrit explicitement comme un aperçu précoce de la génération Qwen4. L'API de production est en ligne sur QwenCloud à 0,15 $ par million de jetons d'entrée, 0,47 $ par million de jetons de sortie et 0,016 $ par million en cas de correspondance de cache — le moyen le moins cher de faire tourner quelque chose de structurellement issu du prochain produit phare d'Alibaba, et la première fois que le laboratoire a publié un aperçu d'architecture sous forme de poids ouverts publics avant que la famille complète de modèles n'existe.

Un nombre pèse plus lourd que le reste de la fiche technique : 6B. Qwen3.8-Flash ne tire pas sa capacité de sa taille brute — il la tire de là où il place le calcul. Un corps MoE de 125B, une table d'embeddings N-gram de 51B et un petit module de prédiction multi-tokens stockent près de 180B paramètres sur le disque, pourtant chaque token ne passe qu'à travers 6B d'entre eux. C'est le pari sur lequel repose toute cette version, et c'est la raison pour laquelle le coût d'entraînement a autant baissé.

Ce qui a réellement été livré

Qwen3.8-Flash, sans le suffixe, est désormais le modèle en production, disponible sur l'API QwenCloud et dans le produit Qw​en Office d'Alibaba ; il est livré avec un contexte par défaut de 1M de jetons et des outils intégrés, à 0,15 $/0,47 $ par million de jetons, avec des hits de cache à 0,016 $. Le 28 août, la liste des disponibilités s'est élargie : selon l'annonce d'Alibaba, Qwen3.8-Flash est désormais également accessible via OpenCode Go, l'abonnement à tarif fixe de l'agent de codage en terminal open source — la liste des modèles d'OpenCode le référence sous le nom qwen3.8-flash aux mêmes tarifs de 0,15 $/0,47 $ par million.

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

L'annonce officielle de Qw​en Studio présente la sortie des poids ouverts comme une invitation à l'écosystème : publier les modifications structurelles tôt afin que la communauté et les piles d'inférence puissent s'adapter avant la construction de la gamme complète Qwen4. Le premier signe que cela a fonctionné est SGLang — le moteur d'inférence soutenu par LMSYS — qui a publié un support day-0 pour Qwen3.8-Flash-Next le jour même, le modèle étant également configuré pour Transformers, vLLM et TokenSpeed.

L'architecture est l'histoire.

Ce n’est pas un modèle de la génération Qw​en 3.8 réduit. Qwen3.8-Flash introduit quatre changements que l’équipe affirme que la famille Qwen4 héritera, et chacun cible un goulot d’étranglement différent.

• Attention — Gated DeltaNet plus Qw​en Sparse Attention. Gated DeltaNet (GDN) compresse l'historique en états de taille fixe dans trois couches sur quatre, afin que le modèle ne relise pas tout à chaque étape ; QSA traite ensuite le contexte long comme un problème de recherche — un indexeur léger agrège la séquence en micro-blocs, attribue un score d'importance à chaque bloc et oriente l'attention vers les régions les plus pertinentes. Selon les mesures d'Alibaba, le noyau d'attention QSA est jusqu'à 7,6× plus rapide en préremplissage et 4,9× plus rapide en décodage sur un contexte de 1M de jetons (chiffres annoncés par le fournisseur).

• Résiduel — Résiduel à porte. Le flux résiduel unique devient quatre branches parallèles avec un mécanisme de porte par élément, laissant le réseau décider par jeton combien lire et écrire sur chaque branche ; une branche s'établit en canal longue distance reliant les premières couches d'attention aux plus profondes. Les états résiduels sont stockés en FP8 pour réduire la bande passante mémoire.

• Embedding — Embeddings de n-grammes. Une table de correspondance à 51 milliards de paramètres indexée sur le jeton actuel et plusieurs jetons précédents. Elle ajoute de la capacité sans ajouter de calcul par jeton, et comme la table peut résider en mémoire hôte et être préchargée de manière asynchrone, elle n’occupe pas en permanence la mémoire GPU.

Optimiseur — Muon. Les grands paramètres linéaires 2D (attention, GDN, experts MoE) sont entraînés avec Muon, tandis que les embeddings, le routeur et les parties à faible rang du Gated Residual conservent AdamW ; l'équipe a réajusté la loi de mise à l'échelle pour la nouvelle architecture autour de ce mélange.

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

Pour un développeur, deux de ces éléments comptent immédiatement : la pile d'attention explique pourquoi un contexte de 1M de tokens peut être un standard plutôt qu'un objectif ambitieux, et la table N-gram explique pourquoi un modèle 125B peut encore être servi de manière allégée. Le reste est du matériel d'aperçu pour Qwen4 — et c'est précisément ainsi qu'Alibaba le positionne.

La feuille de benchmark, honnêtement étiquetée

Chaque chiffre de cette section est une évaluation interne d'Alibaba, vieille d'un jour et non reproduite par un laboratoire indépendant au moment de la rédaction. Considérez-les comme des indications, pas comme des résultats définitifs. Sur la suite d'Alibaba, Qwen3.8-Flash-Next (6B actif) enregistre 62,5 sur SWE-bench Pro, 58,7 sur DeepSWE 1.1, 73,9 sur CoWorkBench, 84,5 sur AndroidWorld et 95,7 sur MathVision, avec un score de 55,7 sur JobBench — et la variante de base, Qwen3.8-Flash-Next-Base, serait le meilleur modèle ouvert sur 8 des 14 benchmarks lors d'une confrontation directe, notamment MMLU-Pro, SuperGPQA, BBH et MMMU.

Les affirmations d'Alibaba concernant le positionnement de sa famille de modèles devraient être qualifiées pour ce qu'elles sont : des affirmations. La société affirme que Qwen3.8-Flash bat Claude Opus 4.6 de 9,1 points sur SWE-bench Pro et d'environ 20 points sur JobBench, et se hisse à portée de Claude Opus 4.8. Tout est annoncé par le fournisseur, rien n'est reproduit. Ce qui est vérifiable de manière indépendante aujourd'hui est plus restreint : les poids sont disponibles, la pile d'inférence les exécute déjà, et SGLang a publié son support le même jour. La reproduction indépendante de la feuille de benchmarks est à quelques jours, pas à quelques semaines.

Ce que ça coûte

La tarification est l’élément le plus facile à vérifier, car il s’agit d’un prix publié plutôt que d’un benchmark — et le 27 août, Alibaba a officiellement confirmé le tarif de production de QwenCloud : 0,15 $ par million de jetons en entrée, 0,47 $ par million de jetons en sortie, et 0,016 $ par million en cas de hits de cache, avec un tarif pour la Chine domestique de 0,8 ¥/2,7 ¥/0,1 ¥. Le chiffre des hits de cache est celui qui compte pour les charges de travail agentiques : un agent à contexte long qui relit un large historique à chaque tour ne paie que quelques centimes pour les lectures répétées, ce qui est exactement la charge de travail que vise la pile d’attention de l’aperçu Qwen4. La presse chinoise a immédiatement comparé le prix annoncé à celui des concurrents — environ un tiers de ce que facture DeepSeek-V4-Flash, et une erreur d’arrondi par rapport aux modèles propriétaires de pointe. Selon la propre comptabilité d’Alibaba, le coût de l’exécution de l’entraînement représentait environ un neuvième de celui de Qwen3.7-Plus, et c’est ce levier structurel qui permet au prix de l’API de se situer là où il se situe.

À côté du reste de la famille Qw​en 3.8, l'écart est flagrant : le vaisseau amiral Qwen3.8-Max facture 2,00 $ et 6,00 $ par million de jetons, et il est déjà disponible sur OrcaRouter au prix catalogue du fournisseur, sans aucune marge. Maintenant que l'API de production Qwen3.8-Flash est ouverte, le même principe de répercussion s'applique au tarif officiel de 0,15 $/0,47 $ et au taux de cache-hit de 0,016 $ — une couche de routage fait la différence entre lire une baisse de prix et l'avoir dans une configuration. Les deux modèles derrière une seule clé, bascule entre eux, pas de second contrat.

Ce que « aperçu de Qwen4 » signifie

À lire l'annonce au pied de la lettre, les enjeux sont clairs : ce n'est pas un nouveau palier de Qwen 3.8 — c'est l'architecture de Qwen4 livrée en avance, sous la marque protectrice d'un modèle plus petit et moins cher. Les raisons de procéder ainsi sont solides : les frameworks, la quantification et les schémas de déploiement ont besoin de temps pour mûrir, et un modèle à 6B actifs est un moyen peu coûteux pour la communauté de mettre GDN + QSA à l'épreuve à grande échelle avant qu'Alibaba ne construise le produit coûteux par-dessus. Le revers de la médaille, c'est que le Qwen3.8-Flash de production est une API construite sur une architecture que l'écosystème au sens large est encore en train d'auditer. Les premiers adoptants sont, par construction, l'ensemble de test.

Le chemin rapide pour l'essayer

Aujourd'hui, vous avez quatre options réalistes. Hébergez vous-même les poids ouverts via vLLM, SGLang, Transformers ou TokenSpeed — la version FP8 est le premier arrêt judicieux sur tout ce qui est en deçà d'un nœud complet. Appelez l'API QwenCloud, désormais disponible au tarif officiel de 0,15 $/0,47 $ avec des accès cache à 0,016 $. Utilisez-la dans OpenCode Go, l'abonnement forfaitaire de l'agent de codage en terminal open source, qui a ajouté Qwen3.8-Flash cette semaine (annoncé par Alibaba le 28 août, confirmé sur la propre liste de modèles d'OpenCode). Ou appelez la Flash de production via un routeur comme vous appelez déjà Qwen3.8-Max, avec le tarif officiel transmis sans aucune majoration — aucune intégration sur mesure à maintenir.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

La question ouverte est la vraie : un modèle qui active 6 milliards de ses paramètres peut-il tenir en production sur un large éventail de charges de travail, ou la fiche de benchmark qui semble toute fraîche aujourd'hui le sera-t-elle encore dans un mois ? Ce n'est pas une raison pour attendre — c'est une raison pour le placer derrière un mécanisme de bascule plutôt qu'en tête de toute votre pile. Les poids sont publiés, le prix est fixé, et l'architecture est la direction déclarée d'Alibaba. Les prochaines semaines décideront si 6B suffisait.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube