
Qwen3.8-Flash-Next vs Qwen3.8-27B : le MoE Qwen4-preview face au cheval de bataille open-weights
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 578 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 182 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Ce qui est surprenant avec Qwen3.8-Flash-Next, ce n'est pas qu'Alibaba affirme qu'un modèle n'activant que 6 milliards de paramètres par jeton surpasse la plupart des modèles ouverts — c'est que son utilisation en production exige plus de mémoire que le modèle dense de 27 milliards de paramètres auquel il est comparé. Qwen3.8-Flash-Next, publié en open source le 26 août 2026 en tant qu'aperçu de l'architecture Qwen4, stocke une table de correspondance N-gram de 51 milliards de paramètres dans la RAM système plutôt que dans la VRAM ; Qwen3.8-27B, le modèle dense multimodal sous licence Apache-2.0 sorti à la mi-août et cheval de trait open-weights de l'actuelle génération Qwen 3.8, tient sur une seule carte graphique de 24GB en 4 bits. Sur la propre grille de benchmarks d'Alibaba, le nouveau MoE bat le 27B sur 21 des 22 benchmarks comparés. Côté preuves indépendantes — classements en arène, étude sur un agent juridique, mesures de débit effectuées par des tiers — le 27B est le seul des deux à en avoir. Cette combinaison constitue toute la décision.
Le face-à-face en une ligne : deux modèles open-weight, texte-plus-vision, de la même génération, même contexte natif de 262K, tous deux conçus pour fonctionner hors datacenter — et séparés par l'architecture, la licence, le prix, et par la part de leur histoire qui est vérifiée. Qwen3.8-Flash-Next est le MoE sparse qui préfigure tout ce que Qwen4 est censé hériter. Qwen3.8-27B est le modèle dense qui condense ce qu'Alibaba a appris en construisant le fleuron 2.4T en quelque chose qu'un seul GPU peut exécuter. Choisir entre eux relève moins des capacités — Alibaba affirme que l'aperçu est en avance — que de savoir si l'on fait confiance à une fiche technique vieille d'un jour plutôt qu'à un modèle déjà décortiqué par la communauté.
Le tableau d'affichage
D'abord, les sources : tous les chiffres de Qwen3.8-Flash-Next ci-dessous proviennent d'Alibaba, datent d'un jour et n'ont pas été reproduits de manière indépendante. Les résultats de référence annoncés pour Qwen3.8-27B sont également rapportés par Alibaba, mais le 27B dispose de résultats indépendants — classements en arène de préférence humaine, étude dans le domaine juridique et mesures de débit AMD — que l'aperçu ne peut égaler.
• Paramètres totaux — Qwen3.8-Flash-Next : 125B MoE + 51B N-gram + MTP (~180B stockés), 6B actifs. Qwen3.8-27B : ~27B denses (28B avec encodeur visuel), tous actifs.
• Architecture — Qwen3.8-Flash-Next : aperçu de Qwen4 — Qwen Sparse Attention en alternance avec Gated DeltaNet, résidu à porte, plongements N-grammes, entraîné avec Muon. Qwen3.8-27B : 48 couches d'attention linéaire GDN plus 16 couches d'attention complète (3:1), dense.
• Contexte — les deux natifs à 262 144 jetons, extensibles à 1M via YaRN.
• Modalité — les deux acceptent des entrées texte, image et vidéo et renvoient du texte.
• Licence — Qwen3.8-Flash-Next : qwen-community-1.0. Qwen3.8-27B : Apache 2.0.
• Prix — Qwen3.8-Flash-Next : 0,16 $ / 0,47 $ par million (annoncé ; API de production pas encore ouverte). Qwen3.8-27B : 0,33 $ / 2,40 $ par million, disponible dès aujourd'hui.
• Empreinte d’exécution — Qwen3.8-Flash-Next : table de 51B dans la RAM hôte, ~96 Go de mémoire système plus tout GPU ; FP8 ~186 Go, Q4 GGUF ~82 Go. Qwen3.8-27B : BF16 ~55,6 Go, 4 bits tient sur une carte de 24 Go.
• Preuves indépendantes — Qwen3.8-Flash-Next : aucune pour l'instant. Qwen3.8-27B : modèle ouvert n°1 sur Arena.ai Image-to-WebDev, n°9 au classement général sur Code Arena WebDev, n°1 open-weight sur le benchmark Legal Agent de Harvey, débit mesuré par AMD.

Selon les propres chiffres d'Alibaba, l'aperçu gagne presque tout.
La comparaison publiée par Alibaba donne à Qwen3.8-Flash-Next des scores égaux ou supérieurs sur 21 des 22 benchmarks de langage et de vision par rapport à Qwen3.8-27B, et ces victoires ne sont pas cosmétiques. SWE-bench Pro 62.5 contre 61.7 est une avance marginale, mais DeepSWE 58.7 contre 42.2, JobBench 55.7 contre 33.4 et CoWorkBench 73.9 contre 70.7 constituent de véritables écarts sur exactement les charges de travail agentiques et de bureau visées par le niveau flash. Les chiffres phares de l’aperçu — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — dépassent également les lignes correspondantes du 27B dans le tableau d’Alibaba. C’est la thèse de cette version exposée sous forme de données : la majeure partie des capacités de raisonnement et de codage de la gamme Qwen 3.8, plus grande, pour une fraction de la puissance de calcul active.
Gardez l'étiquette attachée à cette phrase. Ce sont les propres évaluations d'Alibaba, issues de son propre banc d'essai, vieilles d'un jour dans le cas de la version preview et non répliquées pour les deux. L'analyse de l'architecture KGP Talkie qui figure dans ce classement aboutit à la même forme de conclusion, mais elle se base sur la même fiche fournisseur. Un tableau fournisseur est une promesse ; rien dans ce paragraphe n'a été confirmé indépendamment.
Ce que le 27B a et que Flash-Next n'a pas : des preuves
C'est là que l'affrontement cesse d'être déséquilibré. Qwen3.8-27B est ouvert depuis deux semaines, et la communauté a produit trois points de données indépendants. Sur le leaderboard Image-to-WebDev d'Arena.ai — votes humains à l'aveugle pour savoir laquelle de deux sorties anonymisées un spectateur préférerait livrer — le 27B se classe #1 parmi les modèles ouverts et #7 au classement général avec un score annoncé de 1 574. Sur le classement frère Code Arena WebDev, il se place #9 au général avec 1 595, seul modèle de sa catégorie de taille dans le top dix. Harvey, l'entreprise d'IA juridique, et Engram ont mené une étude de cabinet juridique synthétique qui a placé un 27B adapté en tête de leur benchmark d'agents juridiques — avec la réserve que le modèle avait étudié le corpus de test au préalable, ce qui en fait une démonstration de marge de fine-tuning plutôt qu'un score pour les poids d'origine. AMD a publié des mesures de débit Day-0 : 24,5 tokens/s sur un Ryzen AI Max+ 395 et 51,8 tokens/s sur une Radeon AI PRO R9700. Aucun de ces éléments n'est un score de qualité généraliste — il n'existe toujours pas d'indice Artificial Analysis pour le 27B — mais chacun provient d'un tiers qui a réellement exécuté le modèle.
Qwen3.8-Flash-Next n'a rien de tout cela. Toute sa fiche de benchmarks provient d'Alibaba, vieille de quelques heures au moment où j'écris ces lignes, et aucun laboratoire indépendant n'en a reproduit la moindre ligne. Ce n'est pas une accusation ; c'est la définition d'une version vieille d'un jour. Mais c'est exactement l'asymétrie qui devrait guider le choix : sur les seuls chiffres qui existent, l'aperçu est en tête, et chacun de ces chiffres a été écrit par le fournisseur qui veut que vous y croyiez.
Le fork de déploiement
La différence pratique entre ces deux modèles réside dans l'emplacement des paramètres, et cela détermine le matériel dont vous avez besoin. Qwen3.8-Flash-Next décharge délibérément sa table d'embedding N-gram de 51B vers la mémoire hôte, où elle peut être préchargée de manière asynchrone — c'est pourquoi elle ajoute une capacité de 51B paramètres sans ajouter de calcul par token. La conséquence est que le modèle ne tiendra pas dans une carte grand public de 24GB comme un Qwen local pouvait le faire auparavant. Les estimations de la communauté situent un Q4 GGUF à environ 82GB au total (environ 58GB de poids principaux plus la table de correspondance de 24GB), la version FP8 autour de 186GB, la BF16 autour de 360GB ; la configuration qui fonctionne est une machine avec de l'ordre de 96GB de RAM système plus n'importe quel GPU capable de faire tourner les 6B actifs. L'avantage, c'est que le calcul par token est peu coûteux — tout le pari de l'architecture — et que les longs contextes de 1M tokens restent abordables parce que les couches GDN compressent l'historique au lieu d'augmenter le cache KV.
Qwen3.8-27B est, à l'inverse, un modèle dense : chaque token traverse l'intégralité des 27 milliards de paramètres, mais assez petit pour que l'ensemble tienne sur du matériel que vous possédez déjà. Les poids BF16 pèsent environ 55,6 Go ; en 4 bits, il tourne sur une carte de 24 Go comme une RTX 3090 ou une 4090, et les mesures d'AMD montrent qu'il atteint entre 24,5 et 51,8 tokens/s sur du matériel de classe AI Max et Radeon PRO. Si la contrainte est une station de travail unique, la 27B est celle qui tient réellement ; si la contrainte est le coût par token à grande échelle, Flash-Next est celle qui l'emporte sur le papier.
La fourchette de prix
Les prix de l'API racontent la même histoire de l'autre côté. Qwen3.8-27B est en ligne sur OrcaRouter dès aujourd'hui à 0,33 $ par million de jetons d'entrée et 2,40 $ par million de jetons de sortie, le prix catalogue du fournisseur étant répercuté sans aucune marge — l'option d'auto-hébergement est rendue appelable, aucun GPU à acheter. Qwen3.8-Flash-Next n'est encore routé nulle part : les poids ouverts sont la seule voie jusqu'à ce que la version de production Qwen3.8-Flash ouvre sur l'API QwenCloud aux prix annoncés de 0,16 $/0,47 $. Lorsque cette API ouvrira, la même répercussion mettra le prix de 0,16 $/0,47 $ de notre côté le jour même, sur la même clé que le 27B, avec bascule automatique entre les deux — ainsi, la façon d'adopter une architecture d'un jour n'est pas de miser la production dessus, mais d'y diriger une partie du trafic avec le modèle éprouvé comme solution de repli. Une couche de routage peut également se placer devant un modèle que vous servez vous-même, ce qui constitue la voie pratique pour évaluer aujourd'hui les poids ouverts de Flash-Next sans une deuxième intégration.

Lequel exécuter
Choisissez Qwen3.8-Flash-Next si vous voulez suivre la direction Qwen4 dès maintenant, si votre charge de travail est suffisamment volumineuse pour que $0.16/$0.47 contre $0.33/$2.40 représente un vrai chiffre, ou si vous avez assez de RAM pour l'héberger vous-même et que vous êtes à l'aise avec une fiche fournisseur. Choisissez Qwen3.8-27B si vous avez besoin des termes Apache-2.0, d'une seule carte 24 Go, d'un modèle que vous pouvez appeler aujourd'hui, ou d'un tant soit peu de preuves indépendantes — c'est le seul des deux qui ait été exécuté par quelqu'un en dehors d'Alibaba.

Les deux captures ci-dessus sont les surfaces publiques de chaque moitié : la liste OrcaRouter où Qwen3.8-27B est appelable aujourd'hui à 0,33 $/2,40 $, et la fiche du modèle Qwen/Qwen3.8-Flash-Next sur Hugging Face.
And the honest close is a question, because the evidence base is one day old: can a model that activates 6 billion of its parameters keep a 21-of-22 sweep under independent replication, or is the N-gram table that makes it serve lean also the thing that fails on real workloads? The 27B has already survived two weeks of community scrutiny. Flash-Next is where the 27B was two weeks ago — which is the best argument for running them side by side rather than choosing.
