
Test de Qwen3.8-27B : le 27B à poids ouverts qui est « l'Opus à la maison » — testé face au battage médiatique
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 par million de tokens · 22 tok/s
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
Qwen3.8 27B est le meilleur modèle open-weights de 27B que vous pouvez auto-héberger actuellement, et ce n'est pas particulièrement proche. Les poids ont été publiés le 14 août 2026 sous licence Apache 2.0 : un modèle dense de 27B (28B en comptant l'encodeur visuel) avec un contexte natif de 262K, une entrée native d'images et de vidéos, et des scores de codage agentique rapportés par le fournisseur qui se situent à ou au-dessus de Claude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Le prix public est zéro : téléchargez 55.6 GB et exécutez-le. Les réserves sont aussi réelles — les tests indépendants constatent qu'il est environ trois fois plus lent et plus gourmand en tokens que son prédécesseur, tous les benchmarks de la fiche technique sont toujours rapportés par Alibaba, et le contexte de 1M est une fonctionnalité uniquement disponible en cloud. Verdict : si vous avez un GPU de 24 Go ou plus et que vous voulez des capacités proches de la frontière technologique sans facturation à la consommation, auto-hébergez-le — mais allez-y en sachant exactement où les chiffres sont fragiles.
Verdict d'abord : devriez-vous utiliser Qwen3.8 27B ?
Réponse courte — oui pour les charges de travail locales et privées ; attendez les chiffres de tiers avant une décision d'achat. Qwen3.8 27B est le rare modèle où les poids ouverts sont le produit et l'API est la commodité. Parce que la licence est Apache 2.0, le prix par jeton est définitivement nul une fois que vous disposez du matériel, et rien de ce que vous construisez dessus ne peut être re-sous-licencié ou facturé rétroactivement. Ce à quoi vous renoncez, c'est la vitesse, la vérification et la commodité.
Si vous exécutez déjà Qwen3.6-27B et que vous en êtes satisfait, la mise à niveau est réelle mais pas gratuite en termes de temps réel. Si vous venez du lancement de Qwen3.8-Max, il s'agit du membre plus petit et auto-hébergeable de la même génération — un outil différent pour un travail différent.
Les faits essentiels, vérifiés le 15 août 2026.
• Publié — les poids ont été mis en ligne le 14 août 2026 à l'adresse Qwen/Qwen3.8-27B sur Hugging Face, avec un miroir sur ModelScope ; la couverture tenant compte des fuseaux horaires cite également le 13 août, et la sortie est arrivée environ une semaine après l'annonce de la génération Qwen3.8.
• Licence — Apache 2.0 : téléchargement, modification, redistribution, usage commercial, avec une concession explicite de brevets. Permanente.
• Paramètres — 27B dense (28B en comptant l'encodeur visuel), 64 couches, taille cachée 5 120, vocabulaire 248 320.
• Architecture — attention hybride : 48 couches d’attention linéaire Gated DeltaNet contre 16 couches complètes d’attention Gated (un rapport 3:1). C’est ainsi qu’un modèle dense de 27B peut gérer 262K tokens de contexte natif.
• Contexte — 262 144 jetons nativement ; extensible à 1 000 000 via YaRN sur la version hébergée.
• Entrée — image et vidéo natives aux côtés du texte ; renvoie du texte. L'encodeur visuel explique pourquoi le nombre de paramètres s'élève à 28B.
• Réflexion — mode de raisonnement activé par défaut et désactivable par requête ; reasoning_effort (faible/moyen/élevé) et preserve_thinking pour les longues exécutions d'agent.
• Poids — 55,6 Go de safetensors BF16 en 18 fragments ; les FP8 et GGUFs communautaires sont également fournis.
Les spécifications ci-dessus proviennent de la fiche modèle et de la configuration Hugging Face pour Qwen3.8 27B, lues aujourd'hui. Les résultats de benchmark sont rapportés par Alibaba ; à ce jour, aucun laboratoire indépendant ne les a reproduits.
Ce à quoi Qwen3.8 27B excelle vraiment
Le cas le plus convaincant est l'ingénierie logicielle agentique. Alibaba fait état d'un bond de 3x sur DeepSWE 1.1 par rapport au 27B précédent (42.2 vs 13.3) et d'un score supérieur à Claude Opus 4.6 Max sur SWE-bench Pro (61.7 vs 53.4). Ce sont ces chiffres qui lui ont valu le surnom d'« Opus à la maison » — un 27B dense effectuant un travail de codage proche de la frontière sur du matériel qu'une personne peut réellement posséder.

Trois choses, outre les chiffres bruts, en font un achat défendable :
• Multimodal natif.Images et vidéos en entrée, texte en sortie — un document avec des diagrammes ou une démonstration vidéo n'est pas un modèle séparé. Les scores de raisonnement visuel (85.6 avec la fonctionnalité de chaîne de pensée activée, 94.6 en mathématiques visuelles, tous deux rapportés par le fournisseur) sont là où l'encodeur visuel mérite sa place.
• 262K de contexte natif. Les tâches d’agent à long horizon, les grandes bases de code et les transcriptions de plusieurs heures tiennent dans une seule fenêtre. La conception hybride à attention linéaire maintient le coût KV de ce contexte inférieur à celui d’un modèle purement à attention complète de même taille.
• Poids gratuits et permanents.C'est tout l'intérêt de la catégorie : un modèle API fermé est loué ; Qwen3.8 27Bvous appartient. En 4 bits, il fonctionne sur une carte de 24 Go (classe RTX 3090/4090), et AMD a fourni un support dès le premier jour (jusqu'à 24,5 tokens/s sur un Ryzen AI Max+ 395 et 51,8 tokens/s sur une Radeon AI PRO R9700, selon le blog d'AMD).
Là où l'évaluation se corse : vitesse, jetons et vérification
Les tests indépendants jusqu'à présent ne sont qu'un harnais de testeur, pas un laboratoire — mais c'est le meilleur signal dont nous disposons. Exécuter Qwen3.8 27B contre Qwen3.6-27B sur dix tâches du monde réel (évaluées par GPT-5.5 via le harnais llmcompare), le 3.8 a remporté neuf sur dix et a obtenu en moyenne 8,838 contre 6,862 — « l'un des gains d'intelligence les plus impressionnants » que le testeur ait vus. Il a également utilisé près de trois fois plus de jetons et a été considérablement plus lent ; une tâche a duré environ 600 % plus longtemps. L'amélioration de la qualité est donc réelle, tout comme le prix en temps d'horloge.
Quatre autres choses à lui reprocher :
• Aucun benchmark tiers pour l'instant. Tous les chiffres clés de cet article proviennent d'Alibaba et datent du 15 août. La fiche du fournisseur est détaillée, mais aucune reproduction par un laboratoire indépendant n'a eu lieu. Si votre décision repose sur des chiffres vérifiés, attendez-les — les poids seront toujours là.
• Le plancher de VRAM est réel. Le BF16 nécessite un GPU de classe 80 Go. Pour tenir sur une carte de 24 Go, vous devez utiliser du 4 bits, et les retours de la communauté (fil de commentaires dev.to, quelques jours après la sortie) indiquent que les versions quantifiées « perdent le fil après un long contexte ». Poids officiels si vous avez la VRAM ; quantifiés sinon.
• Le contexte de 1M est réservé à la version hébergée. Les poids ouverts plafonnent à 262K. La possibilité d'étendre à 1M est une fonctionnalité hébergée de Qwen Cloud, pas quelque chose qu'une copie locale fait d'emblée.
• « Beats Opus » nécessite des nuances.Les benchmarks agentiques récompensent des comportements spécifiques au harnais, et un commentaire en tête du post de lancement sur dev.to l'a dit sans détour : « ils ne battent pas opus en conditions réelles. » Considérez le classement comme une borne supérieure les bons jours, pas une promesse.
Sa place dans la famille Qwen 3.8
• vs Qwen3.6-27B — la même classe de matériel et un contexte de 262K, mais un bond majeur en termes de capacités, au prix de la vitesse et de l'efficacité des tokens. Si vous exécutez déjà la 3.6 et êtes limité par le débit, rester sur cette version se défend.
• contre Qwen3-Coder-30B-A3B — le Coder est un MoE avec environ 3.3B de paramètres actifs qui tourne beaucoup plus vite (~90–110 tokens/s). Le dense 27B est plus lent par token mais hérite des gains agentiques de la génération ; si les scores d'ingénierie logicielle du 27B se maintiennent lors de tests indépendants, le rôle du Coder-30B se réduit.
• contre Qwen3.8-Max — le fleuron MoE de 2.4T est un modèle de datacenter (uniquement par API, environ $2/$6 par million de jetons dans la presse) avec un contexte de 1M et la vidéo. Le 27B est celui qui est déployable. Ils répondent à des questions différentes.
Coût : la question local-versus-API, réglée.
Pour un modèle fermé, vous comparez les prix par jeton. Pour Qwen3.8 27B le coût marginal d'un jeton est nul sur votre propre matériel — le vrai prix est le GPU initial et votre temps. En 4-bit, cela correspond à une carte de 24 Go ; en BF16, à une machine de classe 80 Go. Si vous n'avez besoin que d'évaluer le modèle, ou si vous manquez de matériel, la solution hébergée existe : OrcaRouter répertorie désormais Qwen3.8 27B avec un palier gratuit à débit limité qui facture 0 $ et renvoie HTTP 429 au-delà du plafond, plus un palier payant à 0,33 $ par million de jetons en entrée et 2,40 $ par million de jetons en sortie (vérifié le 15 août). La version hébergée de Qwen Cloud, avec le contexte de 1 M, est marquée « bientôt disponible. »

Le cadrage honnête : pour un modèle à poids ouverts, un fournisseur est une commodité, pas une dépendance. Le niveau gratuit est le moyen le moins cher possible de décider si un téléchargement de 55,6 Go en vaut la peine. Mais une fois que vous avez décidé, les poids sont l'essentiel — et ils sont gratuits.
Comment vraiment l’essayer
• Évaluation la plus rapide — utilisez le niveau hébergé gratuit avec limite de débit ; s'il répond à vos besoins, vous avez terminé et cela ne coûte rien.
• Vrai test sur votre matériel — téléchargez un GGUF communautaire (la version Q4_K_M pèse environ 17 Go et tient sur une carte de 24 Go) et exécutez-le dans llama.cpp ou Ollama. Passez le modèle de chat Jinja, ou le modèle vous répondra avec des balises de pensée. Pour la vision depuis un GGUF, vous avez aussi besoin du fichier mmproj séparé. Notre guide pour exécuter Qwen3.8 27B localement vous guide pas à pas.
• Pleine précision — huggingface-cli download Qwen/Qwen3.8-27B sur un GPU de classe 80 Go.
• Vérifiez ce que vous avez téléchargé — vérifiez que l’éditeur est l’organisation Qwen et validez les shards par rapport à crc32.txt ; des dépôts similaires sont apparus avant la sortie.
Quand cet avis est erroné (et qui devrait éviter Qwen3.8 27B)
• Vous n'avez pas de GPU et n'en louerez pas. Le niveau gratuit est limité en débit et le niveau payant est à 0,33 $/2,40 $ par million — un petit modèle d'API peut vous servir à moindre coût et plus fiablement. Ce modèle est destiné à ceux qui veulent posséder l'inférence.
• Vous avez besoin d'un SLA. Le niveau hébergé a quelques jours à peine ; la page du modèle OrcaRouter, consultée aujourd'hui, affiche un taux d'erreur de 33,3 % sur les sept derniers jours et une latence p50 du premier jeton de 225 ms. C'est un tout nouveau modèle en charge précoce, pas un contrat de production. Les auto-hébergeurs devraient épingler leur commit de téléchargement et garder une solution de repli.
• Vous avez besoin de benchmarks vérifiés pour une décision d'achat. Les chiffres rapportés par les fournisseurs sont utiles à titre indicatif, mais pas au niveau requis pour un achat. Attendez une reproduction indépendante.
• Un contexte open-weights de 262K ne suffit pas. L'extension 1M n'est aujourd'hui disponible qu'en version hébergée.
• Le débit est votre goulot d'étranglement. La synthèse en masse ou les grands lots vous pénaliseront : c'est un modèle dense de 27B qui consomme aussi environ 3x plus de tokens que son prédécesseur. Pour du travail en masse à bas coût, un modèle plus petit ou plus rapide est gagnant.
• Vous êtes sur une carte de 12 Go. Les GGUFs en 2 bits tiennent, avec une perte de qualité visible ; ce modèle n'est pas pour vous.

En résumé
Qwen3.8 27B est le modèle open-weights 27B le plus puissant disponible aujourd'hui, et il est gratuit pour toujours sous licence Apache 2.0. Si vous disposez d'un GPU de 24 Go ou plus et que vous voulez du codage agentique, un contexte de 262K, et une entrée native d'images/vidéos sans facturation au compteur, c'est le bon choix. Les raisons d'attendre sont tout aussi concrètes : vous avez besoin d'une confirmation indépendante des benchmarks, d'un SLA, de plus de 262K de contexte open-weights, ou d'un débit supérieur à celui d'un 27B dense. Le modèle est sorti, les poids sont réels, et les chiffres sont bons — rappelez-vous simplement à qui appartiennent ces chiffres.
