Un carton de titre indiquant « Qwen3.8-27B » avec le sous-titre « Les poids ouverts arrivent cette semaine », le texte de surtitre « Alibaba Qwen — Ce que nous savons jusqu'à présent », et une ligne de date « Semaine du 10 août 2026 » à côté d'une icône de boîte ouverte et d'une icône de calendrier.
Guides & Insights

Qwen3.8-27B Poids ouverts : la Max est sortie, la 27B non — Ce que l'on sait maintenant

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 13 août 2026, la semaine de poids ouverts qu'Alibaba avait promise pour sa génération Qwen3.8 s'est scindée en deux. Les poids du fleuron de classe Max — Qwen3.8-2.4T-A95B, un modèle de mélange d'experts épars à 2,4 billions de paramètres et la première version Qwen de niveau Max jamais rendue téléchargeable — ont effectivement été publiés, sur Hugging Face et ModelScope, annoncés tard dans la nuit précédente via la communauté ModelScope. Le modèle plus petit dont il est question sur cette page, Qwen3.8-27B, ne l'a pas été : prévu pour la même semaine du 10 août, il ne dispose toujours d'aucun dépôt officiel, de fiche de modèle, de fichier de licence ou de benchmark propre, et les traqueurs tiers décrivent désormais sa sortie comme retardée, sans nouvelle date indiquée. La question à laquelle cette page « ce que nous savons pour l'instant » devait répondre — « quand le 27B sort-il réellement ? » — s'est scindée en deux : pourquoi les poids du Max ont-ils été publiés en premier, et qu'est-il arrivé au 27B ?

Ce document reste un état des lieux de ce que nous savons jusqu'à présent, et non une critique. Qwen3.8-Max, le fleuron de l'API, est en ligne depuis le 3 août à 2 $/6 $ par million de jetons ; son modèle de base à poids ouverts, Qwen3.8-2.4T-A95B, est téléchargeable depuis le 13 août ; et les poids de Qwen3.8-27B ne sont toujours pas publiés. Chaque affirmation ci-dessous est étiquetée comme confirmée, rapportée par le fournisseur ou estimée par la communauté, selon le cas.

Le signal, et ce que la semaine a réellement livré.

Le premier signal était un post sur X de @kimmonismus, qui désignait la « semaine prochaine » comme celle à surveiller : « Q​wen-3.8 27b - Grok 4.6 », avec Astra remarquablement absent de la liste. La moitié Grok de cette semaine a été livrée le 12 août. La moitié Q​wen s'est scindée en deux. Ce que le post capturait, c'était l'humeur des personnes qui suivent les sorties de modèles pour vivre — la sortie des poids ouverts Qwe​n3.8 était l'événement au calendrier, et la semaine est arrivée sans que les détails soient encore arrêtés. Une semaine plus tard, les détails se sont en partie précisés : l'une des deux sorties de poids ouverts promises est arrivée, et ce n'était pas celle que le post nommait.

Qu'est-ce qui est confirmé ?

• La famille est réelle et officiellement annoncée. Alibaba a dévoilé la famille de modèles de base Qwen3.8 le 3 août 2026, après une itération d’aperçu à la mi-juillet.

• Qwen3.8-Max est sorti le même jour. Le produit phare de l'API — un modèle mixture-of-experts à 2,4 billions de paramètres avec environ 95B de paramètres actifs, une fenêtre de contexte de 1M de jetons, et des entrées texte, image et vidéo — a été mis en ligne sur l'API Q​wen au prix de $2/$6 par million de jetons. Il est également disponible via OrcaRouter au même prix catalogue, sans aucune marge.

• Les poids ouverts de Max ont été publiés le 13 août. Qwen3.8-2.4T-A95B — le modèle de base sur lequel repose l'API Qwen3.8-Max — est devenu téléchargeable depuis Hugging Face et ModelScope, avec une version quantifiée FP8 à ses côtés. C'est la première publication de poids ouverts de niveau Max pour Q​wen. Le modèle téléchargeable est purement textuel avec le mode réflexion activé d'office, possède un contexte natif de 256K jetons extensible à environ 1M, et se déploie sur SGLang, vLLM et TokenSpeed.

• Qwen3.8-27B est le petit modèle open-weight de la famille — pas encore sorti. Alibaba le présentait comme la voie réaliste pour un déploiement local et sur site, et s'était engagé à publier ses poids sur Hugging Face et ModelScope en même temps que ceux du Max. Au 13 août, il n'existe toujours pas de dépôt officiel Qwen3.8-27B. L'engagement était réel ; la livraison n'a pas encore eu lieu.

• Le premier score indépendant pour cette génération existe. Artificial Analysis place Qwen3.8-Max à un indice d'intelligence de 56 pour environ 1,14 $ par tâche — vraiment bon, avec les réserves que comporte tout fleuron vieux de quelques jours.

Ce que nous savons réellement du 27B

Le résumé honnête est que « Qwen3.8-27B » reste surtout un nom et un nombre de paramètres. Les faits confirmés sont qu'il s'agit d'un modèle d'environ 27 milliards de paramètres, qu'il est le membre à poids ouverts de la génération Qwe​n3.8, et qu'il est conçu pour un travail sur GPU unique et sur site plutôt que pour un cluster de plusieurs centaines de GPU. Daniel Han d'Unsloth rapporte qu'il devrait tenir dans environ 17 Go de VRAM à sa sortie — une carte prosumer.

Tout le reste n'est pas confirmé. Alibaba n'a pas précisé si le 27B est un modèle dense ou un mélange d'experts, sa fenêtre de contexte, quelles modalités il accepte, ni aucun score de référence propre. Ce qui a changé cette semaine, c'est le calendrier : le Max et le 27B étaient promis pour la même semaine, et seul le Max est arrivé. Les trackers tiers signalent désormais le 27B comme retardé, sans nouvelle date — une lecture communautaire, pas une déclaration officielle d'Alibaba, et il est possible que le dépôt soit encore publié avant la fin de la semaine promise. Mais au moment où j'écris, l'organisation officielle Q​wen sur Hugging Face ne liste aucun Qwen3.8-27B, et la poignée de dépôts « Qwen3.8-27B-FP8 », « -GGUF » et « -MLX » qui apparaissent dans la recherche sont des cartes communautaires provisoires avec des compteurs de téléchargement à un chiffre, pas la version officielle.

Le point de référence utile reste le 27B de la génération précédente : Qwen3.5-27B, un modèle dense à poids ouverts avec une fenêtre de contexte de 32K. C'est une limite inférieure raisonnable que le Qwen3.8-27B doit battre, et un rappel que les modèles de classe 27B de Q​wen ont historiquement été conçus pour fonctionner sur du matériel qu'un développeur possède réellement.

Le Max est le point de référence pour ce que le 27B pourrait hériter.

A comparison scoreboard for Qwen3.8-Max and Qwen3.8-27B, contrasting the Max's 2.4T MoE total parameters, ~95B active params, 1M-token context, / pricing and AA Index 56 with the 27B's ~27B params, TBD context, TBD architecture, self-host and no independent score yet.

Le 27B n'atteindra pas le plafond brut du Max, mais les chiffres du Max — désormais publiés dans une véritable fiche modèle — définissent les attentes quant aux améliorations de cette génération. Dans les propres évaluations d'Alibaba du modèle à poids ouverts, Qwen3.8-2.4T-A95B obtient 93,0 sur PaperBench, 86,1 sur OSworld-Verified, 91,5 sur la CAO paramétrique, 67,7 sur SWE-bench Pro et 86,6 sur Terminal-Bench 2.1, le fournisseur revendiquant une parité avec Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol et Gemini 3.1 Pro. Ce sont des chiffres fournis par le vendeur, publiés dans les documents de lancement et pas encore reproduits par un laboratoire indépendant. Le gain agentique revendiqué lors du lancement de l'API — FrontierSWE passant de 40,7 à 73,5 en une seule génération — se retrouve dans les mêmes documents de lancement. Si ne serait-ce qu'une partie de cette amélioration se transmet à un 27B, cela redéfinirait ce que signifie « bon modèle de codage local » dans sa catégorie.

Une nuance à retenir : le Max téléchargeable n'est pas identique au Max de l'API. Qwen3.8-2.4T-A95B est en texte seul avec le mode de réflexion forcé, tandis que l'API Qwen3.8-Max ajoute une entrée visuelle, un mode sans réflexion et un contexte par défaut de 1M de jetons. Cet écart est exactement le genre de chose qu'un modèle 27B est susceptible d'hériter — et il vaut la peine de s'en souvenir lorsque vous lisez les gros titres de benchmarks "Qwe​n3.8" sans vérifier quelle variante ils décrivent.

Le prix est là où le Max est le plus défendable : 2 $/6 $ par million de jetons sur l'ensemble du contexte de 1 million de jetons via l'API, sans supplément pour les prompts longs. C'est agressif pour une API de pointe, et cela compte pour le calcul du routage — avec ces chiffres, la génération 3.8 devient une option pour les charges de travail qui se tournaient par défaut vers des modèles phares plus chers.

Qu'est-ce qui peut réellement le faire fonctionner ?

A hardware reality-check card for Qwen3.8-27B showing community-projected VRAM requirements: Q4_K_M ~16GB, Q3_K_M ~13GB, Q6_K ~21GB, FP8 ~27GB, full precision H100 80GB, with a footer noting these are community projections based on Qwen 3.6-27B quant sizes.

Pour le 27B, Alibaba n'a toujours pas publié les prérequis matériels, donc les chiffres en circulation restent des projections communautaires basées sur la table de quant du Qwen 3.6-27B — des estimations, pas des spécifications. Les plages de fonctionnement sur lesquelles la plupart des gens s'appuient pour planifier restent inchangées :

• Q4_K_M quant, ~16 Go de VRAM — une RTX 4090 ou équivalent, le point idéal que la plupart des développeurs locaux viseront.

• Q3_K_M quant, ~13GB VRAM — convient à une carte de 12 Go comme la RTX 3060 avec une qualité réduite.

• Quant Q6_K, ~21 Go de VRAM — quasi sans perte sur les cartes de 24 Go.

• Inférence FP8, ~27 Go de VRAM — un seul L40S, selon la projection précédente, pour une inférence de niveau production.

• Pleine précision, H100 80GB — le chemin de la qualité de référence, et pas quelque chose que la plupart des équipes pourront exécuter.

Le nouveau rebondissement : « vous pouvez désormais auto-héberger la génération Qwe​n3.8 » est vrai, mais pas pour le modèle sur lequel les gens avaient basé leurs plans. Les poids ouverts du Max relèvent d'une toute autre catégorie de matériel : le modèle BF16 en pleine précision pèse environ 4,9 To, et la quantification sélective en couches 1-bit d'Unsloth le ramène à environ 397 Go — exécutable, mais uniquement avec 410 Go ou plus de RAM et de VRAM combinées. C'est une infrastructure sérieuse, pas une carte prosumer. C'est exactement le fossé que le 27B est censé combler, ce qui fait de son absence persistante la raison pour laquelle le chemin local mono-GPU n'existe pas encore pour cette génération.

La question de la licence : le Max vient tout juste d’établir le précédent.

La question de licence pour le 27B reste sans réponse, mais « à quoi cela ressemblerait-il » n'est plus une simple hypothèse. Les poids ouverts des Max ont été publiés sous une licence personnalisée intitulée « qwen3.8-max » — pas sous Apache 2.0. Comme rapporté dans la fiche du modèle, elle est généralement gratuite pour un usage commercial et l'hébergement, mais elle déclenche des exigences supplémentaires à grande échelle : les produits comptant plus de 100 millions d'utilisateurs actifs mensuels ou générant plus de 20 millions de dollars de revenus mensuels doivent afficher le nom du modèle, et les entreprises dépassant 50 millions de dollars de revenus annuels qui proposent des services de modèle-en-tant-que-service ou d'assistant de travail IA doivent obtenir une licence séparée. Une affirmation qui circule selon laquelle la licence interdirait l'utilisation aux États-Unis, dans l'UE, au Royaume-Uni et en Corée est fausse — la licence ne contient aucune restriction territoriale.

Pour le 27B spécifiquement, aucune licence n'a été nommée. Mais le Max est sorti sous une licence Qwen personnalisée plutôt que sous Apache 2.0, ce qui fait d'Apache 2.0 une hypothèse peu fiable pour le modèle frère également. L'ancienne licence Tongyi Qianwen — avec sa clause des 100 millions d'utilisateurs actifs mensuels (MAU) — n'est pas celle que le Max a obtenue ; celle du Max est une nouvelle licence à paliers d'échelle. Lisez le fichier LICENSE dans le dépôt réel avant de planifier quoi que ce soit en conséquence, et attendez-vous à ce que celle du 27B ne soit décidée que lorsque son dépôt sera publié.

Timing de la chaîne d'outils : le support dès le premier jour vient d'être prouvé

Les moteurs de serving ont évolué aussi vite que prévu — pour le modèle qui est sorti. Qwen3.8-2.4T-A95B a été lancé avec une prise en charge fonctionnelle par SGLang, vLLM et TokenSpeed, voilà à quoi ressemble « disponible via API presque immédiatement » pour une grande publication open-weights. Pour la 27B, les mêmes moteurs seront probablement les premiers à bouger dès que son dépôt apparaîtra, et la couverture du Max dès le premier jour fait qu'il est raisonnable de s'attendre à ce que la 27B hérite de ce support. Les quantifications communautaires GGUF et AWQ accusent généralement un retard d'une à deux semaines, donc l'expérience « pull and run » à la Ollama n'existera probablement toujours pas le jour de la sortie de la 27B — une configuration manuelle de vLLM ou de llama.cpp sera la voie locale la plus probable au début.

Ce qui reste encore inconnu

Un article de fuite honnête s'arrête à ce qui est réellement public, et la frontière est plus large qu'il y a une semaine dans un sens et plus étroite dans un autre : les questions de Max ont trouvé réponse, celles du 27B non.

• La nouvelle date de sortie. « La semaine du 10 août » était l'engagement ; la semaine est presque terminée et le dépôt n'est pas apparu. Les traqueurs tiers signalent un retard sans nouvelle date, mais Alibaba n'a fait aucune déclaration officielle.

• Architecture. Dense ou MoE pour le 27B, et si MoE, le nombre de paramètres actifs.

• La fiche technique. Fenêtre de contexte, modalités, limites de sortie, mode de raisonnement.

• Benchmarks. Le 27B n'a ni scores officiels ni évaluation indépendante.

• La licence. En suspens jusqu'à ce que le dépôt du 27B soit publié ; la licence personnalisée du Max est le précédent à surveiller.

• Risque de miroir. Le problème des placeholders est maintenant visible dans la nature — des cartes communautaires « Qwen3.8-27B-FP8 », « -GGUF » et « -MLX » existent sans aucun fichier officiel. Jusqu'à ce que l'organisation officielle Qwen publie le dépôt, téléchargez uniquement depuis la page officielle de l'organisation.

Ce que cela signifie pour les constructeurs

Le découpage pratique pour la génération Qwe​n3.8 est désormais triple plutôt que double. Si vous voulez l’API de pointe aujourd’hui, Qwen3.8-Max est disponible via OrcaRouter au tarif public du fournisseur de 2 $ / 6 $, transmis avec une majoration de 0 % — le prix que vous voyez est celui fixé par Alibaba. Si vous voulez auto-héberger le modèle de classe Max, les poids ouverts sont téléchargeables dès maintenant, mais il vous faut le matériel pour un modèle en pleine précision d’environ 4,9 To ou un modèle quantifié d’environ 397 Go. Et si vous voulez le déploiement local sur une seule carte GPU que cette génération était censée offrir, vous attendez toujours le Qwen3.8-27B, qui n’a pas encore été livré. Une clé compatible OpenAI couvre le côté API aujourd’hui, et lorsque l’hébergement du 27B sera stabilisé, la même clé pourra y router.

Screenshot of the OrcaRouter model page for Qwen3.8-Max, showing model id qwen/qwen3.8-max, .00/1M input token pricing, a 1M-token context window, and an OpenAI-compatible Python code sample.

Ce dernier point est le principe général, et c'est exactement ce qu'une version open-weight non éprouvée et retardée sert à tester. Un modèle qui n'a même pas encore été lancé n'a ni historique, ni suite de benchmarks indépendants, ni antécédents d'incidents — et lorsqu'il arrivera, il sera flambant neuf. Le routage est la manière de l'essayer sans engager un parcours orienté client : envoyez-lui le trafic qui peut tolérer l'imprévu, basculez automatiquement vers un modèle éprouvé en cas de comportement anormal, et transférez toute la charge de travail une fois qu'il a gagné votre confiance. La couche de routage est aussi ce qui rend la tarification honnête — quand Alibaba réduit le prix d'un modèle que vous appelez via un seul endpoint, le changement est effectif le jour même, car le prix catalogue est transmis directement.

Que regarder

• Que le dépôt du 27B apparaisse ou non. Une apparition sous l’organisation officielle Q​wen sur Hugging Face ou ModelScope est l’événement qui met fin au retard — et la semaine du 10 août s’est presque écoulée sans aucune.

• Le fichier de licence du 27B.La Max était fournie avec une licence personnalisée à paliers, et non pas Apache 2.0. Que la 27B suive ce précédent est l’élément le plus décisif de sa future annonce.

• Architecture et longueur de contexte. Dense-vs-MoE et la fenêtre de contexte déterminent à quoi sert le 27B.

• Le premier benchmark indépendant. Le 56 du Max sur l'indice Artificial Analysis Intelligence a établi la référence ; la première évaluation externe du 27B vous dira dans quelle mesure les gains de la génération survivent à l'échelle grand public.

• Couverture de la chaîne d'outils.Si le 27B hérite du support SGLang/vLLM/TokenSpeed dès le premier jour comme le Max, et à quelle vitesse les quantifications de la communauté suivent.

FAQ

Est-ce que Qwen3.8-27B a déjà été publié ?

Non. Alibaba l'a annoncé le 3 août 2026, et a déposé les poids sur Hugging Face et ModelScope pour la semaine du 10 août, mais au 13 août, il n'existe aucun dépôt officiel Qwen3.8-27B, aucune fiche de modèle, ni licence. Les poids ouverts de classe Max — Qwen3.8-2.4T-A95B — ont été publiés le 13 août ; ce ne fut pas le cas pour la version 27B, et les outils de suivi tiers indiquent qu'elle est retardée, sans nouvelle date.

Pour exécuter Qwen3.8-27B (un modèle de 27 milliards de paramètres), voici les configurations matérielles recommandées selon le niveau de précision : **Options GPU :** - **Quantification 4 bits** : ~16–18 Go de VRAM → une **NVIDIA RTX 4090 (24 Go)** ou **RTX 3090 (24 Go)** suffit. - **Quantification 8 bits** : ~28–30 Go de VRAM → **RTX 4090 × 2**, **A100 (40 Go)** ou **A6000 (48 Go)**. - **Précision complète FP16** : ~54 Go de VRAM → **A100 (80 Go)** ou **H100 (80 Go)**. **Alternatives :** - **Apple Silicon** : Mac Studio/MacBook Pro avec **64 Go de RAM unifiée** minimum pour la quantification 4 bits (via MLX ou llama.cpp). - **CPU uniquement** : possible avec llama.cpp et 32 Go de RAM, mais très lent (~1–2 tokens/s). **RAM système** : 32 Go minimum recommandés. **Stockage** : ~20 Go d'espace libre pour le modèle quantifié.

Non confirmé, mais les projections de la communauté basées sur le tableau de quantification Qwen 3.6-27B placent un quant Q4_K_M à environ 16 Go de VRAM (un RTX 4090), un quant Q3_K_M à environ 13 Go (cartes 12 Go), un quant Q6_K à environ 21 Go (cartes 24 Go), et un service FP8 à environ 27 Go (un seul L40S). Daniel Han d'Unsloth rapporte environ 17 Go à la sortie. Traitez ces chiffres comme des estimations jusqu'à ce que la fiche officielle du modèle publie des recommandations matérielles.

Qwen3.8-27B est-il disponible via OrcaRouter ?

Pas encore. Qwen3.8-27B est un modèle open-weight, auto-hébergé, et il n'est pas sur la plateforme aujourd'hui. Le fleuron de la même famille — Qwen3.8-Max — est disponible dès maintenant via OrcaRouter au prix catalogue du fournisseur de 2$/6$ par million de tokens avec 0% de marge, et lorsque l'hébergement du 27B se stabilisera, il pourra être ajouté à la même clé compatible OpenAI.

Devrais-je attendre Qwen3.8-27B ou utiliser Qwen3.8-Max aujourd'hui ?

Cela dépend de l'endroit où la charge de travail s'exécute. Si vous avez besoin d'une API de pointe dès maintenant, Qwen3.8-Max est disponible et propose un prix agressif de 2 $ / 6 $ par million de jetons. Si vous souhaitez auto-héberger la classe Max aujourd'hui, Qwen3.8-2.4T-A95B est téléchargeable dès maintenant, mais nécessite du matériel sérieux — environ un modèle en pleine précision de 4,9 To, ou environ 397 Go en quantification, avec plus de 410 Go de RAM et de VRAM combinées. Si vous avez besoin d'un modèle local ou sur site sur une seule carte grand public, Qwen3.8-27B reste celui qu'il faut attendre — c'est la voie d'auto-hébergement réaliste de cette génération, et sa sortie est désormais une question ouverte plutôt qu'une date fixe.

{{1}}La semaine promise est presque écoulée, et la moitié de ce qui était promis n'est pas arrivée.{{/1}} {{2}}Qwen3.8-2.4T-A95B est téléchargeable, sous licence et déployable ; Qwen3.8-27B est confirmé, toujours engagé à publier des poids ouverts, et toujours sans dépôt, sans licence, sans benchmark et sans nouvelle date.{{/2}} {{3}}Surveillez si le dépôt du 27B est publié avant que la semaine promise ne soit entièrement écoulée, ce que dit son fichier de licence à côté de celui du Max, et comment les premières évaluations indépendantes le notent.{{/3}} {{4}}Ces trois signaux vous diront s'il s'agit d'une publication de poids ouverts en deux temps comme une autre, avec le modèle plus petit encore à venir, ou d'un retard à anticiper dans votre planification.{{/4}}

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement