
Découvrez Qwen3.8-Flash : un MoE multimodal à poids ouverts qui préfigure l'architecture Qwen4 — 0,15 $/0,47 $ par 1M de tokens sur QwenCloud
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Le 26 août 2026, l'équipe Qwen a publié en open source les poids de Qwen3.8-Flash — publiés sur Hugging Face et ModelScope sous le nom Qwen3.8-Flash-Next — et a lancé le modèle de production portant le nom Qwen3.8-Flash sur l'API QwenCloud, en confirmant sa tarification officielle le lendemain. Le chiffre phare — officiellement confirmé dans l'annonce même d'Alibaba le 28 août — est un mélange d'experts multimodal de 125 milliards de paramètres qui n'active qu'environ 6 milliards de paramètres par jeton, soit une sparsité d'environ 95 %, construit sur une architecture qu'Alibaba décrit explicitement comme un aperçu précoce de la génération Qwen4. L'API de production est en ligne sur QwenCloud à 0,15 $ par million de jetons d'entrée, 0,47 $ par million de jetons de sortie et 0,016 $ par million en cas de correspondance de cache — le moyen le moins cher de faire tourner quelque chose de structurellement issu du prochain produit phare d'Alibaba, et la première fois que le laboratoire a publié un aperçu d'architecture sous forme de poids ouverts publics avant que la famille complète de modèles n'existe.
Un nombre pèse plus lourd que le reste de la fiche technique : 6B. Qwen3.8-Flash ne tire pas sa capacité de sa taille brute — il la tire de là où il place le calcul. Un corps MoE de 125B, une table d'embeddings N-gram de 51B et un petit module de prédiction multi-tokens stockent près de 180B paramètres sur le disque, pourtant chaque token ne passe qu'à travers 6B d'entre eux. C'est le pari sur lequel repose toute cette version, et c'est la raison pour laquelle le coût d'entraînement a autant baissé.
Ce qui a réellement été livré
Qwen3.8-Flash, sans le suffixe, est désormais le modèle en production, disponible sur l'API QwenCloud et dans le produit Qwen Office d'Alibaba ; il est livré avec un contexte par défaut de 1M de jetons et des outils intégrés, à 0,15 $/0,47 $ par million de jetons, avec des hits de cache à 0,016 $. Le 28 août, la liste des disponibilités s'est élargie : selon l'annonce d'Alibaba, Qwen3.8-Flash est désormais également accessible via OpenCode Go, l'abonnement à tarif fixe de l'agent de codage en terminal open source — la liste des modèles d'OpenCode le référence sous le nom qwen3.8-flash aux mêmes tarifs de 0,15 $/0,47 $ par million.

L'annonce officielle de Qwen Studio présente la sortie des poids ouverts comme une invitation à l'écosystème : publier les modifications structurelles tôt afin que la communauté et les piles d'inférence puissent s'adapter avant la construction de la gamme complète Qwen4. Le premier signe que cela a fonctionné est SGLang — le moteur d'inférence soutenu par LMSYS — qui a publié un support day-0 pour Qwen3.8-Flash-Next le jour même, le modèle étant également configuré pour Transformers, vLLM et TokenSpeed.
L'architecture est l'histoire.
Ce n’est pas un modèle de la génération Qwen 3.8 réduit. Qwen3.8-Flash introduit quatre changements que l’équipe affirme que la famille Qwen4 héritera, et chacun cible un goulot d’étranglement différent.
• Attention — Gated DeltaNet plus Qwen Sparse Attention. Gated DeltaNet (GDN) compresse l'historique en états de taille fixe dans trois couches sur quatre, afin que le modèle ne relise pas tout à chaque étape ; QSA traite ensuite le contexte long comme un problème de recherche — un indexeur léger agrège la séquence en micro-blocs, attribue un score d'importance à chaque bloc et oriente l'attention vers les régions les plus pertinentes. Selon les mesures d'Alibaba, le noyau d'attention QSA est jusqu'à 7,6× plus rapide en préremplissage et 4,9× plus rapide en décodage sur un contexte de 1M de jetons (chiffres annoncés par le fournisseur).
• Résiduel — Résiduel à porte. Le flux résiduel unique devient quatre branches parallèles avec un mécanisme de porte par élément, laissant le réseau décider par jeton combien lire et écrire sur chaque branche ; une branche s'établit en canal longue distance reliant les premières couches d'attention aux plus profondes. Les états résiduels sont stockés en FP8 pour réduire la bande passante mémoire.
• Embedding — Embeddings de n-grammes. Une table de correspondance à 51 milliards de paramètres indexée sur le jeton actuel et plusieurs jetons précédents. Elle ajoute de la capacité sans ajouter de calcul par jeton, et comme la table peut résider en mémoire hôte et être préchargée de manière asynchrone, elle n’occupe pas en permanence la mémoire GPU.
Optimiseur — Muon. Les grands paramètres linéaires 2D (attention, GDN, experts MoE) sont entraînés avec Muon, tandis que les embeddings, le routeur et les parties à faible rang du Gated Residual conservent AdamW ; l'équipe a réajusté la loi de mise à l'échelle pour la nouvelle architecture autour de ce mélange.

Pour un développeur, deux de ces éléments comptent immédiatement : la pile d'attention explique pourquoi un contexte de 1M de tokens peut être un standard plutôt qu'un objectif ambitieux, et la table N-gram explique pourquoi un modèle 125B peut encore être servi de manière allégée. Le reste est du matériel d'aperçu pour Qwen4 — et c'est précisément ainsi qu'Alibaba le positionne.
La feuille de benchmark, honnêtement étiquetée
Chaque chiffre de cette section est une évaluation interne d'Alibaba, vieille d'un jour et non reproduite par un laboratoire indépendant au moment de la rédaction. Considérez-les comme des indications, pas comme des résultats définitifs. Sur la suite d'Alibaba, Qwen3.8-Flash-Next (6B actif) enregistre 62,5 sur SWE-bench Pro, 58,7 sur DeepSWE 1.1, 73,9 sur CoWorkBench, 84,5 sur AndroidWorld et 95,7 sur MathVision, avec un score de 55,7 sur JobBench — et la variante de base, Qwen3.8-Flash-Next-Base, serait le meilleur modèle ouvert sur 8 des 14 benchmarks lors d'une confrontation directe, notamment MMLU-Pro, SuperGPQA, BBH et MMMU.
Les affirmations d'Alibaba concernant le positionnement de sa famille de modèles devraient être qualifiées pour ce qu'elles sont : des affirmations. La société affirme que Qwen3.8-Flash bat Claude Opus 4.6 de 9,1 points sur SWE-bench Pro et d'environ 20 points sur JobBench, et se hisse à portée de Claude Opus 4.8. Tout est annoncé par le fournisseur, rien n'est reproduit. Ce qui est vérifiable de manière indépendante aujourd'hui est plus restreint : les poids sont disponibles, la pile d'inférence les exécute déjà, et SGLang a publié son support le même jour. La reproduction indépendante de la feuille de benchmarks est à quelques jours, pas à quelques semaines.
Ce que ça coûte
La tarification est l’élément le plus facile à vérifier, car il s’agit d’un prix publié plutôt que d’un benchmark — et le 27 août, Alibaba a officiellement confirmé le tarif de production de QwenCloud : 0,15 $ par million de jetons en entrée, 0,47 $ par million de jetons en sortie, et 0,016 $ par million en cas de hits de cache, avec un tarif pour la Chine domestique de 0,8 ¥/2,7 ¥/0,1 ¥. Le chiffre des hits de cache est celui qui compte pour les charges de travail agentiques : un agent à contexte long qui relit un large historique à chaque tour ne paie que quelques centimes pour les lectures répétées, ce qui est exactement la charge de travail que vise la pile d’attention de l’aperçu Qwen4. La presse chinoise a immédiatement comparé le prix annoncé à celui des concurrents — environ un tiers de ce que facture DeepSeek-V4-Flash, et une erreur d’arrondi par rapport aux modèles propriétaires de pointe. Selon la propre comptabilité d’Alibaba, le coût de l’exécution de l’entraînement représentait environ un neuvième de celui de Qwen3.7-Plus, et c’est ce levier structurel qui permet au prix de l’API de se situer là où il se situe.
À côté du reste de la famille Qwen 3.8, l'écart est flagrant : le vaisseau amiral Qwen3.8-Max facture 2,00 $ et 6,00 $ par million de jetons, et il est déjà disponible sur OrcaRouter au prix catalogue du fournisseur, sans aucune marge. Maintenant que l'API de production Qwen3.8-Flash est ouverte, le même principe de répercussion s'applique au tarif officiel de 0,15 $/0,47 $ et au taux de cache-hit de 0,016 $ — une couche de routage fait la différence entre lire une baisse de prix et l'avoir dans une configuration. Les deux modèles derrière une seule clé, bascule entre eux, pas de second contrat.
Ce que « aperçu de Qwen4 » signifie
À lire l'annonce au pied de la lettre, les enjeux sont clairs : ce n'est pas un nouveau palier de Qwen 3.8 — c'est l'architecture de Qwen4 livrée en avance, sous la marque protectrice d'un modèle plus petit et moins cher. Les raisons de procéder ainsi sont solides : les frameworks, la quantification et les schémas de déploiement ont besoin de temps pour mûrir, et un modèle à 6B actifs est un moyen peu coûteux pour la communauté de mettre GDN + QSA à l'épreuve à grande échelle avant qu'Alibaba ne construise le produit coûteux par-dessus. Le revers de la médaille, c'est que le Qwen3.8-Flash de production est une API construite sur une architecture que l'écosystème au sens large est encore en train d'auditer. Les premiers adoptants sont, par construction, l'ensemble de test.
Le chemin rapide pour l'essayer
Aujourd'hui, vous avez quatre options réalistes. Hébergez vous-même les poids ouverts via vLLM, SGLang, Transformers ou TokenSpeed — la version FP8 est le premier arrêt judicieux sur tout ce qui est en deçà d'un nœud complet. Appelez l'API QwenCloud, désormais disponible au tarif officiel de 0,15 $/0,47 $ avec des accès cache à 0,016 $. Utilisez-la dans OpenCode Go, l'abonnement forfaitaire de l'agent de codage en terminal open source, qui a ajouté Qwen3.8-Flash cette semaine (annoncé par Alibaba le 28 août, confirmé sur la propre liste de modèles d'OpenCode). Ou appelez la Flash de production via un routeur comme vous appelez déjà Qwen3.8-Max, avec le tarif officiel transmis sans aucune majoration — aucune intégration sur mesure à maintenir.

La question ouverte est la vraie : un modèle qui active 6 milliards de ses paramètres peut-il tenir en production sur un large éventail de charges de travail, ou la fiche de benchmark qui semble toute fraîche aujourd'hui le sera-t-elle encore dans un mois ? Ce n'est pas une raison pour attendre — c'est une raison pour le placer derrière un mécanisme de bascule plutôt qu'en tête de toute votre pile. Les poids sont publiés, le prix est fixé, et l'architecture est la direction déclarée d'Alibaba. Les prochaines semaines décideront si 6B suffisait.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
