
Qwen3.8-27B : le modèle multimodal compact de la gamme Qwen3.8 d'Alibaba
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 316 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 196 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Qwen3.8-27B est le membre dense et mono-nœud de la génération Qwen3.8 d'Alibaba : un modèle vision-langage natif de 27 milliards de paramètres, publié sur Hugging Face sous licence Apache 2.0, qui accepte du texte, des images et de la vidéo et renvoie du texte avec une fenêtre de contexte de 262 144 jetons. Ceci est la page de référence pour ce modèle — la présentation canonique de ce qu'il est, de ce qu'il en coûte de l'appeler et de ce qu'il peut faire — et il vaut la peine de dire d'emblée pourquoi une page existe pour un modèle dont les poids sont apparus pour la première fois en août 2026 plutôt qu'au cours des sept derniers jours. Nous ne rendons pas compte d'un lancement. Nous répondons à une question récurrente : les lecteurs nous trouvent via le nom « Qwen3.8-27B » des milliers de fois par mois, et jusqu'à présent aucune de nos pages ne possédait cette réponse. La publication du modèle elle-même, datée sur la fiche de Qwen et consignée à la date du 2026-08-14 par Artificial Analysis, est un fait que cette page utilise pour dater le modèle, non un événement qu'elle rapporte.
Lisez cela comme l'exception que c'est : dans une lecture stricte sur sept jours, un modèle de la mi-août 2026 n'est pas récent, et cet élément serait ignoré en tant qu'actualité. La justification est différente ici. Il s'agit d'une page de référence dont les chiffres ont été vérifiés par rapport à la fiche de modèle de Qwen elle-même, au fichier de licence du dépôt, à la grille tarifaire de Qwen Cloud et à Artificial Analysis le 28 septembre 2026, et dont la raison d'être est la demande de recherche que nous avons mesurée en first-party le même jour. Ce n'est pas une seconde annonce, et personne ne devrait l'interpréter comme telle.
Où se situe le 27B dans la gamme Qwen3.8
La génération Qwen3.8 n'est pas un seul modèle, et le suffixe de taille est tout l'intérêt du nom. Les notes du dépôt de Qwen lui-même pour toute la famille rendent la distinction explicite :
• Qwen3.8-27B — 27 milliards de paramètres denses, entrée native d'images et de vidéos, Apache 2.0. Le membre adapté au déploiement : un modèle dimensionné pour tourner sur un seul GPU ou un petit nœud, et le sujet de cette page.
• Qwen3.8-Max, construit sur Qwen3.8-2.4T-A95B — 2 400 milliards de paramètres au total, dont 95 milliards actifs, le modèle de classe Qwen-Max qu'Alibaba ouvre pour la première fois dans cette génération. Son dépôt est assorti d'une licence qwen3.8-max sur mesure plutôt qu'Apache 2.0.
• Qwen3.8-Flash-Next — l'aperçu expérimental de l'architecture qui, selon Qwen, servira de base à Qwen4, publié sous la qwen-community-1.0 licence. Le Qwen3.8-Flash hébergé est construit dessus.
Ainsi, « 27B » n’est pas un niveau de finition du modèle Max ; c’est la classe de taille qu’une seule équipe peut réellement servir. Ce dont Alibaba affirme qu’il hérite, c’est la recette d’entraînement : la fiche décrit Qwen3.8-27B comme reprenant les avancées de la génération en matière de codage, de travail professionnel, de recherche et de tâches agentiques à long horizon, et les compressant dans un checkpoint dense.

L'architecture que Qwen publie
Chaque figure ci-dessous provient de la fiche modèle sur Qwen/Qwen3.8-27B, qui est la documentation propre du fournisseur :
• Paramètres — 27B comme annoncé. Les métadonnées safetensors du dépôt lui-même totalisent 27 781 427 952 paramètres en BF16 répartis sur 18 shards, soit environ 27,8B une fois la tour de vision comptée. Il n'y a pas de mélange d'experts ici : tous les paramètres sont actifs sur chaque token.
• Forme — 64 couches, dimension cachée 5 120, dimension intermédiaire feed-forward 17 408, plongement de jetons et sortie LM 248 320 (avec remplissage).
• Attention hybride — la disposition que Qwen imprime est 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) : trois blocs d'attention linéaire pour chaque bloc d'attention complète, soit un ratio de 3:1. Gated DeltaNet exécute 48 têtes d'attention linéaire pour V et 16 pour QK avec une dimension de tête de 128 ; Gated Attention exécute 24 têtes de requête contre 4 têtes KV avec une dimension de tête de 256, et une dimension rotative de 64. C'est ce ratio qui rend une fenêtre de 262K abordable sur un modèle de 27B, et c'est la même lignée que Qwen3.8-Flash-Next étend avec l'attention éparse.
• Prédiction multi-jetons — la fiche indique que le modèle est entraîné avec MTP sur plusieurs étapes, l'astuce consistant à générer des brouillons qui accélère la génération dans les piles de service compatibles MTP.
• Contrôle de la réflexion — le mode de réflexion est activé par défaut et peut être désactivé par requête. reasoning_effort prend xhigh (la valeur par défaut), medium ou low, et preserve_thinking est activé par défaut afin que les traces de raisonnement soient conservées d'un tour à l'autre au lieu d'être régénérées.
Fenêtre de contexte et plafond de sortie
La fiche indique 262 144 tokens nativement, extensibles à 1 000 000 avec la mise à l’échelle RoPE (YaRN). Les propres recommandations de déploiement de Qwen pour les longues exécutions agentiques, à l’intérieur de cette enveloppe de 1 M, sont d’autoriser jusqu’à 262 144 tokens pour le contenu de raisonnement et jusqu’à 131 072 tokens pour la réponse finale — le plafond est une configuration de déploiement, et non une propriété fixe du checkpoint.
Deux fenêtres méritent d'être distinguées, car il est facile de les confondre. Les poids ouverts tournent nativement à 262 144 ; la version hébergée sur Qwen Cloud, que la fiche du modèle présente comme encore à venir (« le service arrive bientôt »), est répertoriée sur la page modèle de Qwen Cloud avec un contexte de 1 M, une entrée maximale de 991 K, une sortie maximale de 131 K et un budget de raisonnement maximal de 262 K. La fiche technique du produit hébergé n'est pas celle du checkpoint.
Modalités : ce qui entre et ce qui sort
L’entrée est du texte, des images et des vidéos ; la sortie est uniquement du texte. La fiche qualifie Qwen3.8-27B de « modèle vision-langage natif qui comprend les images et les vidéos », et son exemple de code transmet les trois types d’entrée. Il n’y a pas d’entrée audio, pas de génération d’images et pas de sortie vocale. La fiche de modèle d’Artificial Analysis pour le même checkpoint s’accorde sur le périmètre — image, vidéo et texte en entrée, texte en sortie —, ce qui constitue une seconde lecture utile, car il ne s’agit pas de la page d’Alibaba elle-même.
Ce que la version Apache 2.0 autorise réellement
La licence n'est pas un résumé dans un article de blog ; le dépôt contient le texte même de l'Apache License, Version 2.0, et les métadonnées de la fiche déclarent license: apache-2.0. Ce que cela accorde, à la lecture du texte de la licence : une licence de droit d'auteur perpétuelle, mondiale et exempte de redevances, pour reproduire, préparer des œuvres dérivées, afficher publiquement, accorder des sous-licences et distribuer l'œuvre et ses dérivés, ainsi qu'une licence de brevet de la part des contributeurs — l'utilisation commerciale figurant parmi les finalités autorisées, sans restriction de domaine d'utilisation, sans seuil de nombre d'utilisateurs et sans accord commercial distinct. Apache 2.0 est également permissive au sens qui compte pour la distribution de produits : les poids dérivés peuvent être redistribués sous d'autres conditions, à condition de conserver la licence et les mentions d'attribution et d'indiquer ce que vous avez modifié (sections 4a à 4c). La section 6 n'accorde aucun droit sur le nom Qwe n ni sur les marques associées, de sorte qu'un fork sous Apache-2.0 ne peut pas se commercialiser sous le nom Qwe n.
La comparaison au sein de la famille est instructive, et elle est visible depuis les dépôts plutôt que depuis la couverture : le checkpoint 2.4T-A95B se déclare autre avec une qwen3.8-max licence, et Qwen3.8-Flash-Next utilise qwen-community-1.0. Le 27B est, des trois, celui qui arrive sous une simple licence Apache 2.0.
La position de référence indépendante
Artificial Analysis a exécuté le modèle, et son bilan mérite d'être distingué du tableau d'Alibaba, car les deux répondent à des questions différentes. L'indice indépendant, mesuré sur la xhigh configuration :
• Indice d'intelligence 33,7 — la valeur enregistrée d'Artificial Analysis, que sa page de modèle affiche arrondie à 34. Deux classements sont publiés et ils mesurent des ensembles différents : la tuile de synthèse de cette page place le modèle 1er des 142 modèles de sa catégorie de taille, selon la comparaison à catégorie égale que décrit l'infobulle de la page, tandis que la ligne issue d'Artificial Analysis de notre catalogue enregistre 45e sur 145, soit environ le 67e centile. Aucun des deux n'est un classement établi par rapport au même ensemble que l'autre, donc ne les lisez pas comme un seul nombre sous deux formats.
• Coding Index 68.1 — répertorié dans notre catalogue avec artificialanalysis.ai comme source nommée, classé 35e sur 138 au sein du panel de cet indice. Le modèle obtient un meilleur score en codage qu'en intelligence générale, ce qui est cohérent avec la forme du tableau du fournisseur lui-même.
• Échelle d’effort, même harnais — réduire l’effort de raisonnement déplace fortement l’indice : 33,7 à xhigh, 27,6 à medium, 26,2 à low, et 20,2 avec le raisonnement entièrement désactivé. Il s’agit d’un écart mesuré de 13,5 points, et c’est l’argument le plus concret en faveur d’un ajustement de l’effort par charge de travail plutôt que par modèle.
• Là où les deux sources concordent et divergent — sur GPQA Diamond, la fiche d'Alibaba indique 89,2 et Artificial Analysis mesure 90,5. Sur Humanity's Last Exam, la fiche indique 30,8 et Artificial Analysis 33,9. Proches, mais pas identiques, et c'est normal : des harnais différents, des exécutions différentes. Une mise en garde mérite sa place dans l'article plutôt qu'en note de bas de page — aucun tiers n'a publié de comparaison directe entre Qwen3.8-27B et l'un des modèles du tableau comparatif d'Alibaba, exécutés à effort égal sur un harnais identique ; par conséquent, toute comparaison entre modèles sur cette page est une comparaison de mesures distinctes, et non un résultat.

Ce que Qwen signale, et comment l’interpréter
La fiche modèle comporte environ deux douzaines de scores avec des colonnes de comparaison pour Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B et Opus4.6 Max. Tout est déclaré par le fournisseur et non reproduit — l'évaluation d'Alibaba elle-même, publiée par Alibaba — et plusieurs lignes utilisent un harnais Claude Code évalué par une version de GPT-5.4, comme l'indiquent les notes de bas de page de la fiche. Les chiffres phares du fournisseur, sur cette base :
• Codage terminal agentique — Terminal Bench 2.1 (Terminus) 73,0, contre 63,4 pour le Qwen3.6-27B qu’il remplace, avec Opus4.6 Max en tête de la ligne à 78,2.
• Codage agentique SWE-bench Pro 61,7, QwenSWEBench 79.?, DeepSWE 1.1 42,2, NL2Repo-Bench 42,3, LiveCodeBench v6 90,3.
• Agents et travail de bureau — CoWorkBench 70,7, JobBench 33,4, Agents' Last Exam 42,9 au score (Pass@1 20,4).
• Raisonnement général — GPQA Diamond 89,2 ; HLE 30,8 ; IFBench 79,5. Opus4.6 Max arrive en tête des deux lignes de raisonnement dans le tableau du fournisseur lui-même, avec 91,3 et 40,0.
• Vision et utilisation de l'ordinateur — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.
Le résumé honnête de ce tableau est plus restreint que le tableau n’en a l’air. Face à son prédécesseur direct, les gains sont importants et constants — QwenSWEBench 79,0 contre 49,3, DeepSWE 42,2 contre 13,3 — et c’est une affirmation qui porte sur une génération de changement de recette. Face aux modèles de pointe des colonnes voisines, il gagne certaines lignes et en perd d’autres, sur les propres chiffres d’Alibaba, et selon le choix de harnais propre à Alibaba.
En train de l'exécuter.
Les poids se présentent sous la forme de 18 shards BF16 au format Transformers, et la fiche répertorie Hugging Face Transformers, vLLM, SGLang et TokenSpeed comme stacks pris en charge. Nous avons traité séparément les parcours de déploiement local et de quantification, et ce sont les bons endroits pour ce genre de détail : Qwen3.8-27B sur Ollama pour un démon local, et le tour d'horizon détaillé des benchmarks pour le tableau de scores complet, y compris ce qui a changé par rapport à Qwen3.6-27B. Cette page reste centrée sur le modèle lui-même.
Qwen3.8-27B dans notre catalogue
Deux fiches sont en ligne sur OrcaRouter aujourd'hui, côte à côte, et toutes deux ont été relues le 2026-09-28 avant la rédaction de ce paragraphe. qwen/qwen3.8-27best proposé à 0,33 $ par million de tokens d'entrée et 2,40 $ par million de tokens de sortie, avec la fenêtre complète de 262 144 tokens, l'entrée texte, image et vidéo, et les surfaces de raisonnement, d'outils, de sortie structurée et JSON exposées en tant que paramètres. Son homologue obsidian/Qwen3.8-27B — les mêmes poids servis en block-FP8, la tour de vision conservée en pleine précision et, selon les mots de sa propre fiche, « conçu pour fournir des réponses directes et complètes sur un large éventail de prompts » — est proposé à 0,40 $ en entrée et 4,21 $ en sortie. Les deux répondent aux chat completions et à l'API Responses, de sorte qu'une tâche d'analyse de documents ou de captures d'écran peut être dirigée vers l'un ou l'autre modèle avec une seule clé et un seul point de terminaison, sans second contrat ni modification du code.
Pour donner un ordre de grandeur, notre propre playground a fait transiter 105,1 millions de tokens via qwen/qwen3.8-27b au cours des sept derniers jours, avec un temps médian jusqu'au premier octet de 3,8 secondes et un taux d'erreur de 3,3 % sur la même période. Ce sont nos chiffres de service, pas un verdict sur le modèle.

Les recherches qui mènent ici
La demande derrière cette page est très dispersée et se situe juste en dehors du clic. Au cours des 28 jours précédant le 2026-09-25, notre propriété a enregistré 8 931 impressions et 273 clics sur 69 graphies exactes distinctes du nom du modèle — « qwen3.8 27b », « qwen3.8-27b », « qwen 3.8 27b » et des dizaines d'autres façons d'écrire les mêmes trois tokens. Notre meilleure position sur les graphies les plus importantes allait de 9,0 à 10,6. Ce sont des positions que nous devons au hasard d'autres pages, et c'est exactement le problème qu'une page canonique résout : à la neuvième place, vous êtes sur la page, et personne ne clique. Le seul endroit où le trafic convertit est en dehors de l'anglais — une graphie russe du nom se situe à la position 1,8 pour nous et convertit à 14,4 %.
Rien de tout cela n’est une preuve concernant le modèle. C’est une preuve de ce que les gens tapent, et c’est pourquoi cette page existe.
Ce que cela donne : un checkpoint dense de 27B avec un agencement d’attention véritablement inhabituel, une licence permissive, une compréhension vidéo native, des conditions Apache-2.0 qui vous permettent de livrer un dérivé, un classement indépendant en codage dans le quart supérieur de ce que mesure Artificial Analysis, et un tableau du fournisseur solide face à son prédécesseur et mitigé face à la frontière. La question ouverte est celle à laquelle personne en dehors d’Alibaba ne peut encore répondre — comment se comporte en production le chemin hébergé à 1M de tokens, et si l’architecture Flash-Next trouve sa place dans un modèle de cette taille.
Le cœur 2.4T-A95B derrière Qwen3.8-Max est disponible dans le même catalogue : qwen/qwen3.8-maxà 2,00 $ / 6,00 $ par million de tokens, si le 27B n'est pas la taille qu'il vous faut.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
