Carte de titre principale pour Qwen3.8-27B, le modèle dense vision-langage de 27 milliards de paramètres de la gamme Qwen3.8 d'Alibaba, avec le sous-titre « 27B dense - vision-langage natif - Apache 2.0 » et trois pastilles de fonctionnalités indiquant « contexte de 262 144 tokens », « entrée texte + image + vidéo » et « sortie texte », avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Qwen3.8-27B : le modèle multimodal compact de la gamme Qwen3.8 d'Alibaba

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Qwen3.8-27B est le membre dense et mono-nœud de la génération Qwen3.8 d'Alibaba : un modèle vision-langage natif de 27 milliards de paramètres, publié sur Hugging Face sous licence Apache 2.0, qui accepte du texte, des images et de la vidéo et renvoie du texte avec une fenêtre de contexte de 262 144 jetons. Ceci est la page de référence pour ce modèle — la présentation canonique de ce qu'il est, de ce qu'il en coûte de l'appeler et de ce qu'il peut faire — et il vaut la peine de dire d'emblée pourquoi une page existe pour un modèle dont les poids sont apparus pour la première fois en août 2026 plutôt qu'au cours des sept derniers jours. Nous ne rendons pas compte d'un lancement. Nous répondons à une question récurrente : les lecteurs nous trouvent via le nom « Qwen3.8-27B » des milliers de fois par mois, et jusqu'à présent aucune de nos pages ne possédait cette réponse. La publication du modèle elle-même, datée sur la fiche de Qwen et consignée à la date du 2026-08-14 par Artificial Analysis, est un fait que cette page utilise pour dater le modèle, non un événement qu'elle rapporte.

Lisez cela comme l'exception que c'est : dans une lecture stricte sur sept jours, un modèle de la mi-août 2026 n'est pas récent, et cet élément serait ignoré en tant qu'actualité. La justification est différente ici. Il s'agit d'une page de référence dont les chiffres ont été vérifiés par rapport à la fiche de modèle de Qwe​n elle-même, au fichier de licence du dépôt, à la grille tarifaire de Qwe​n Cloud et à Artificial Analysis le 28 septembre 2026, et dont la raison d'être est la demande de recherche que nous avons mesurée en first-party le même jour. Ce n'est pas une seconde annonce, et personne ne devrait l'interpréter comme telle.

Où se situe le 27B dans la gamme Qwen3.8

La génération Qwe​n3.8 n'est pas un seul modèle, et le suffixe de taille est tout l'intérêt du nom. Les notes du dépôt de Qwe​n lui-même pour toute la famille rendent la distinction explicite :

• Qwen3.8-27B — 27 milliards de paramètres denses, entrée native d'images et de vidéos, Apache 2.0. Le membre adapté au déploiement : un modèle dimensionné pour tourner sur un seul GPU ou un petit nœud, et le sujet de cette page.

• Qwen3.8-Max, construit sur Qwen3.8-2.4T-A95B — 2 400 milliards de paramètres au total, dont 95 milliards actifs, le modèle de classe Qwen-Max qu'Alibaba ouvre pour la première fois dans cette génération. Son dépôt est assorti d'une licence qwen3.8-max sur mesure plutôt qu'Apache 2.0.

• Qwen3.8-Flash-Next — l'aperçu expérimental de l'architecture qui, selon Qwe​n, servira de base à Qwen4, publié sous la qwen-community-1.0 licence. Le Qwen3.8-Flash hébergé est construit dessus.

Ainsi, « 27B » n’est pas un niveau de finition du modèle Max ; c’est la classe de taille qu’une seule équipe peut réellement servir. Ce dont Alibaba affirme qu’il hérite, c’est la recette d’entraînement : la fiche décrit Qwen3.8-27B comme reprenant les avancées de la génération en matière de codage, de travail professionnel, de recherche et de tâches agentiques à long horizon, et les compressant dans un checkpoint dense.

Scoreboard infographic titled 'Qwen3.8-27B - the scoreboard' with six rows: Parameters 27B dense (27.8B with vision), Context 262,144 native and 1M with YaRN, Modalities text + image + video in and text out, Licence Apache 2.0 with commercial use, Terminal Bench 2.1 of 73.0 marked vendor-reported, and AA Intelligence Index 33.7 marked independent, with a footer reading 'Qwen figures vendor-reported and unreproduced; AA figures per Artificial Analysis.' and the OrcaRouter logo in the bottom-right corner.

L'architecture que Qwen publie

Chaque figure ci-dessous provient de la fiche modèle sur Qwe​n/Qwen3.8-27B, qui est la documentation propre du fournisseur :

• Paramètres — 27B comme annoncé. Les métadonnées safetensors du dépôt lui-même totalisent 27 781 427 952 paramètres en BF16 répartis sur 18 shards, soit environ 27,8B une fois la tour de vision comptée. Il n'y a pas de mélange d'experts ici : tous les paramètres sont actifs sur chaque token.

• Forme — 64 couches, dimension cachée 5 120, dimension intermédiaire feed-forward 17 408, plongement de jetons et sortie LM 248 320 (avec remplissage).

• Attention hybride — la disposition que Qwe​n imprime est 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) : trois blocs d'attention linéaire pour chaque bloc d'attention complète, soit un ratio de 3:1. Gated DeltaNet exécute 48 têtes d'attention linéaire pour V et 16 pour QK avec une dimension de tête de 128 ; Gated Attention exécute 24 têtes de requête contre 4 têtes KV avec une dimension de tête de 256, et une dimension rotative de 64. C'est ce ratio qui rend une fenêtre de 262K abordable sur un modèle de 27B, et c'est la même lignée que Qwen3.8-Flash-Next étend avec l'attention éparse.

• Prédiction multi-jetons — la fiche indique que le modèle est entraîné avec MTP sur plusieurs étapes, l'astuce consistant à générer des brouillons qui accélère la génération dans les piles de service compatibles MTP.

• Contrôle de la réflexion — le mode de réflexion est activé par défaut et peut être désactivé par requête. reasoning_effort prend xhigh (la valeur par défaut), medium ou low, et preserve_thinking est activé par défaut afin que les traces de raisonnement soient conservées d'un tour à l'autre au lieu d'être régénérées.

Fenêtre de contexte et plafond de sortie

La fiche indique 262 144 tokens nativement, extensibles à 1 000 000 avec la mise à l’échelle RoPE (YaRN). Les propres recommandations de déploiement de Qwen pour les longues exécutions agentiques, à l’intérieur de cette enveloppe de 1 M, sont d’autoriser jusqu’à 262 144 tokens pour le contenu de raisonnement et jusqu’à 131 072 tokens pour la réponse finale — le plafond est une configuration de déploiement, et non une propriété fixe du checkpoint.

Deux fenêtres méritent d'être distinguées, car il est facile de les confondre. Les poids ouverts tournent nativement à 262 144 ; la version hébergée sur Qwe​n Cloud, que la fiche du modèle présente comme encore à venir (« le service arrive bientôt »), est répertoriée sur la page modèle de Qwe​n Cloud avec un contexte de 1 M, une entrée maximale de 991 K, une sortie maximale de 131 K et un budget de raisonnement maximal de 262 K. La fiche technique du produit hébergé n'est pas celle du checkpoint.

Modalités : ce qui entre et ce qui sort

L’entrée est du texte, des images et des vidéos ; la sortie est uniquement du texte. La fiche qualifie Qwen3.8-27B de « modèle vision-langage natif qui comprend les images et les vidéos », et son exemple de code transmet les trois types d’entrée. Il n’y a pas d’entrée audio, pas de génération d’images et pas de sortie vocale. La fiche de modèle d’Artificial Analysis pour le même checkpoint s’accorde sur le périmètre — image, vidéo et texte en entrée, texte en sortie —, ce qui constitue une seconde lecture utile, car il ne s’agit pas de la page d’Alibaba elle-même.

Ce que la version Apache 2.0 autorise réellement

La licence n'est pas un résumé dans un article de blog ; le dépôt contient le texte même de l'Apache License, Version 2.0, et les métadonnées de la fiche déclarent license: apache-2.0. Ce que cela accorde, à la lecture du texte de la licence : une licence de droit d'auteur perpétuelle, mondiale et exempte de redevances, pour reproduire, préparer des œuvres dérivées, afficher publiquement, accorder des sous-licences et distribuer l'œuvre et ses dérivés, ainsi qu'une licence de brevet de la part des contributeurs — l'utilisation commerciale figurant parmi les finalités autorisées, sans restriction de domaine d'utilisation, sans seuil de nombre d'utilisateurs et sans accord commercial distinct. Apache 2.0 est également permissive au sens qui compte pour la distribution de produits : les poids dérivés peuvent être redistribués sous d'autres conditions, à condition de conserver la licence et les mentions d'attribution et d'indiquer ce que vous avez modifié (sections 4a à 4c). La section 6 n'accorde aucun droit sur le nom Qwe n ni sur les marques associées, de sorte qu'un fork sous Apache-2.0 ne peut pas se commercialiser sous le nom Qwe n.

La comparaison au sein de la famille est instructive, et elle est visible depuis les dépôts plutôt que depuis la couverture : le checkpoint 2.4T-A95B se déclare autre avec une qwen3.8-max licence, et Qwen3.8-Flash-Next utilise qwen-community-1.0. Le 27B est, des trois, celui qui arrive sous une simple licence Apache 2.0.

La position de référence indépendante

Artificial Analysis a exécuté le modèle, et son bilan mérite d'être distingué du tableau d'Alibaba, car les deux répondent à des questions différentes. L'indice indépendant, mesuré sur la xhigh configuration :

• Indice d'intelligence 33,7 — la valeur enregistrée d'Artificial Analysis, que sa page de modèle affiche arrondie à 34. Deux classements sont publiés et ils mesurent des ensembles différents : la tuile de synthèse de cette page place le modèle 1er des 142 modèles de sa catégorie de taille, selon la comparaison à catégorie égale que décrit l'infobulle de la page, tandis que la ligne issue d'Artificial Analysis de notre catalogue enregistre 45e sur 145, soit environ le 67e centile. Aucun des deux n'est un classement établi par rapport au même ensemble que l'autre, donc ne les lisez pas comme un seul nombre sous deux formats.

• Coding Index 68.1 — répertorié dans notre catalogue avec artificialanalysis.ai comme source nommée, classé 35e sur 138 au sein du panel de cet indice. Le modèle obtient un meilleur score en codage qu'en intelligence générale, ce qui est cohérent avec la forme du tableau du fournisseur lui-même.

• Échelle d’effort, même harnais — réduire l’effort de raisonnement déplace fortement l’indice : 33,7 à xhigh, 27,6 à medium, 26,2 à low, et 20,2 avec le raisonnement entièrement désactivé. Il s’agit d’un écart mesuré de 13,5 points, et c’est l’argument le plus concret en faveur d’un ajustement de l’effort par charge de travail plutôt que par modèle.

• Là où les deux sources concordent et divergent — sur GPQA Diamond, la fiche d'Aliba​ba indique 89,2 et Artificial Analysis mesure 90,5. Sur Humanity's Last Exam, la fiche indique 30,8 et Artificial Analysis 33,9. Proches, mais pas identiques, et c'est normal : des harnais différents, des exécutions différentes. Une mise en garde mérite sa place dans l'article plutôt qu'en note de bas de page — aucun tiers n'a publié de comparaison directe entre Qwen3.8-27B et l'un des modèles du tableau comparatif d'Aliba​ba, exécutés à effort égal sur un harnais identique ; par conséquent, toute comparaison entre modèles sur cette page est une comparaison de mesures distinctes, et non un résultat.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B in its xhigh configuration showing a same-class comparison rank of 1 of 142 next to an Intelligence tile, 46.6 output tokens per second at rank 55 of 142, $0.50 per million input tokens and $3.00 per million output tokens, a 256k-token context window, 27B total parameters, an Apache 2.0 licence, an open-weights marker and a release month of August 2026, with the summary text reporting a score of 34 on the Artificial Analysis Intelligence Index.

Ce que Qwen signale, et comment l’interpréter

La fiche modèle comporte environ deux douzaines de scores avec des colonnes de comparaison pour Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B et Opus4.6 Max. Tout est déclaré par le fournisseur et non reproduit — l'évaluation d'Aliba​ba elle-même, publiée par Aliba​ba — et plusieurs lignes utilisent un harnais Claude Code évalué par une version de GPT-5.4, comme l'indiquent les notes de bas de page de la fiche. Les chiffres phares du fournisseur, sur cette base :

• Codage terminal agentique — Terminal Bench 2.1 (Terminus) 73,0, contre 63,4 pour le Qwen3.6-27B qu’il remplace, avec Opus4.6 Max en tête de la ligne à 78,2.

• Codage agentique SWE-bench Pro 61,7, QwenSWEBench 79.?, DeepSWE 1.1 42,2, NL2Repo-Bench 42,3, LiveCodeBench v6 90,3.

• Agents et travail de bureau — CoWorkBench 70,7, JobBench 33,4, Agents' Last Exam 42,9 au score (Pass@1 20,4).

• Raisonnement général — GPQA Diamond 89,2 ; HLE 30,8 ; IFBench 79,5. Opus4.6 Max arrive en tête des deux lignes de raisonnement dans le tableau du fournisseur lui-même, avec 91,3 et 40,0.

• Vision et utilisation de l'ordinateur — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.

Le résumé honnête de ce tableau est plus restreint que le tableau n’en a l’air. Face à son prédécesseur direct, les gains sont importants et constants — QwenSWEBench 79,0 contre 49,3, DeepSWE 42,2 contre 13,3 — et c’est une affirmation qui porte sur une génération de changement de recette. Face aux modèles de pointe des colonnes voisines, il gagne certaines lignes et en perd d’autres, sur les propres chiffres d’Aliba​ba, et selon le choix de harnais propre à Aliba​ba.

En train de l'exécuter.

Les poids se présentent sous la forme de 18 shards BF16 au format Transformers, et la fiche répertorie Hugging Face Transformers, vLLM, SGLang et TokenSpeed comme stacks pris en charge. Nous avons traité séparément les parcours de déploiement local et de quantification, et ce sont les bons endroits pour ce genre de détail : Qwen3.8-27B sur Ollama pour un démon local, et le tour d'horizon détaillé des benchmarks pour le tableau de scores complet, y compris ce qui a changé par rapport à Qwen3.6-27B. Cette page reste centrée sur le modèle lui-même.

Qwen3.8-27B dans notre catalogue

Deux fiches sont en ligne sur OrcaRouter aujourd'hui, côte à côte, et toutes deux ont été relues le 2026-09-28 avant la rédaction de ce paragraphe. qwen/qwen3.8-27best proposé à 0,33 $ par million de tokens d'entrée et 2,40 $ par million de tokens de sortie, avec la fenêtre complète de 262 144 tokens, l'entrée texte, image et vidéo, et les surfaces de raisonnement, d'outils, de sortie structurée et JSON exposées en tant que paramètres. Son homologue obsidian/Qwen3.8-27B — les mêmes poids servis en block-FP8, la tour de vision conservée en pleine précision et, selon les mots de sa propre fiche, « conçu pour fournir des réponses directes et complètes sur un large éventail de prompts » — est proposé à 0,40 $ en entrée et 4,21 $ en sortie. Les deux répondent aux chat completions et à l'API Responses, de sorte qu'une tâche d'analyse de documents ou de captures d'écran peut être dirigée vers l'un ou l'autre modèle avec une seule clé et un seul point de terminaison, sans second contrat ni modification du code.

Pour donner un ordre de grandeur, notre propre playground a fait transiter 105,1 millions de tokens via qwen/qwen3.8-27b au cours des sept derniers jours, avec un temps médian jusqu'au premier octet de 3,8 secondes et un taux d'erreur de 3,3 % sur la même période. Ce sont nos chiffres de service, pas un verdict sur le modèle.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing a 262K-token context window, text, image and video input, text output, the vision, tools, JSON and reasoning badges, a 3.80-second p50 time to first token, 105.1M tokens served in seven days, and list pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Les recherches qui mènent ici

La demande derrière cette page est très dispersée et se situe juste en dehors du clic. Au cours des 28 jours précédant le 2026-09-25, notre propriété a enregistré 8 931 impressions et 273 clics sur 69 graphies exactes distinctes du nom du modèle — « qwen3.8 27b », « qwen3.8-27b », « qwen 3.8 27b » et des dizaines d'autres façons d'écrire les mêmes trois tokens. Notre meilleure position sur les graphies les plus importantes allait de 9,0 à 10,6. Ce sont des positions que nous devons au hasard d'autres pages, et c'est exactement le problème qu'une page canonique résout : à la neuvième place, vous êtes sur la page, et personne ne clique. Le seul endroit où le trafic convertit est en dehors de l'anglais — une graphie russe du nom se situe à la position 1,8 pour nous et convertit à 14,4 %.

Rien de tout cela n’est une preuve concernant le modèle. C’est une preuve de ce que les gens tapent, et c’est pourquoi cette page existe.

Ce que cela donne : un checkpoint dense de 27B avec un agencement d’attention véritablement inhabituel, une licence permissive, une compréhension vidéo native, des conditions Apache-2.0 qui vous permettent de livrer un dérivé, un classement indépendant en codage dans le quart supérieur de ce que mesure Artificial Analysis, et un tableau du fournisseur solide face à son prédécesseur et mitigé face à la frontière. La question ouverte est celle à laquelle personne en dehors d’Aliba​ba ne peut encore répondre — comment se comporte en production le chemin hébergé à 1M de tokens, et si l’architecture Flash-Next trouve sa place dans un modèle de cette taille.

Le cœur 2.4T-A95B derrière Qwen3.8-Max est disponible dans le même catalogue : qwen/qwen3.8-maxà 2,00 $ / 6,00 $ par million de tokens, si le 27B n'est pas la taille qu'il vous faut.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement