
Qwen3.8-27B Benchmarks : Le tableau complet, avec les mises en garde associées
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Qwen/Qwen3.8-27B obtient 73.0 sur Terminal-Bench 2.1, 61.7 sur SWE-bench Pro, 90.3 sur LiveCodeBench v6 et 84.3 sur OSWorld-Verified — et chacun de ces chiffres est celui d'Alibaba. Le modèle open-weights de 27 milliards de paramètres est arrivé sur Hugging Face le 14 août 2026 sous licence Apache 2.0, et au cours de ses deux premières semaines, il a décroché trois résultats indépendants de tiers : la première place en open-weights sur le benchmark Legal Agent de Harvey, dans le cadre d'une étude menée par le cabinet de legal-AI Harvey et la société de mémoire Engram ; une 9e place au classement général sur le leaderboard WebDev de Code Arena, seul modèle de sa catégorie de taille dans le top 10, selon l'annonce d'Alibaba du 25 août ; et, annoncée le 26 août, la première place en open-weights sur le leaderboard Image-to-WebDev d'Arena.ai, classé 7e au classement général avec un score annoncé de 1 574. Cette page est le récapitulatif complet et sourcé : les 25 benchmarks officiels de la fiche du modèle, ce qui a changé par rapport à son prédécesseur Qwen3.6-27B, ce qu'un test de débit indépendant d'AMD a mesuré, ces résultats legal-agent et webdev-arena, et les affirmations que vous devez encore considérer comme provisoires.
Un guide de lecture avant les chiffres : « officiel » signifie ici l'évaluation d'Alibaba imprimée sur la fiche modèle de Qwen/Qwen3.8-27B. Elle est fournie par le vendeur et non reproduite. « Indépendant » signifie qu'une personne extérieure au laboratoire l'a mesurée — jusqu'à présent, cela couvre un test de débit matériel, une étude d'agent dans le domaine juridique, et des placements sur deux des classements de développement web d'Arena.ai, le WebDev de Code Arena et l'arène Image-to-WebDev. Les benchmarks dont le harnais de test importe sont signalés en ligne.
Le modèle, une ligne par spécification
• 27B paramètres denses (28B en comptant l’encodeur de vision), 64 couches, taille cachée de 5120.
• Attention hybride — 48 couches d'attention linéaire Gated DeltaNet plus 16 couches d'attention complète, un ratio de 3:1 — ce qui rend une fenêtre de 262K jetons abordable à exécuter.
• Contexte natif de 262 144 jetons, extensible à 1 000 000 avec la mise à l'échelle YaRN.
• Entrée native d'images et de vidéos (sortie de texte), poids Apache 2.0, environ 55,6 GB en BF16.
La version courte : il s'agit du modèle conçu pour reprendre ce qu'Alibaba a appris en construisant Qwen3.8-Max, fort de 2,4 billions de paramètres, et le compresser en quelque chose qu'un seul GPU peut exécuter.
Le tableau de bord : chaque benchmark de la fiche modèle
Tous les scores ci-dessous sont ceux rapportés par Alibaba dans la fiche modèle du 14 août, avec le score de Qwen3.6-27B que le modèle remplace entre parenthèses.
Codage. Terminal-Bench 2.1 (codage terminal agentique) 73,0 (63,4) ; SWE-bench Pro 61,7 (53,5) ; QwenSWEBench 79,0 (49,3) ; DeepSWE 1.1 42,2 (13,3) ; NL2Repo-Bench 42,3 (36,2) ; LiveCodeBench v6 90,3 (83,9). Les exécutions de SWE-bench Pro et de QwenSWEBench ont utilisé le harnais Claude Code, selon une note de bas de page de la fiche du modèle — un point à garder à l'esprit avant de les comparer à un modèle évalué sur un harnais différent.
Agents à long horizon et travail de bureau. CoWorkBench 70,7 (61,0); JobBench 33,4 (21,8); Agents' Last Exam Pass@1 20,4 / score 42,9 (10,6 / 27,3).
Raisonnement et connaissances. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). HLE est évalué par GPT-4o, selon la fiche.
Vision et utilisation de l'ordinateur. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 avec CI / 90.0 sans (85.1); BabyVision 85.6 avec CI / 65.7 sans (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). « CI » est l'amélioration au moment de l'inférence d'Alibaba ; l'écart entre ses états activé et désactivé est le nombre le plus informatif de la fiche sur le score que vous pouvez acheter avec un calcul d'inférence supplémentaire.

Ce qui a réellement changé par rapport à Qwen3.6-27B
Tous les benchmarks de la carte ont augmenté, mais les écarts ne sont pas uniformes — et c'est la forme de l'amélioration qui raconte l'histoire. Les gains se concentrent dans le codage agentique et l'utilisation de l'ordinateur, pas dans le rappel de connaissances :
• DeepSWE 1.1 (codage agentique) 13.3 → 42.2, soit environ un triplement.
• QwenSWEBench 49,3 → 79,0
• Score des agents au dernier examen : 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 et AndroidWorld 70.3 → 81.9
• BabyVision (avec CI) 28.9 → 85.6 — le plus grand gain relatif sur la carte
Entre-temps, GPQA Diamond est passé de 87,8 → 89,2 et RealWorldQA de 84,1 → 85,9 : une progression réelle mais minime. Ce n'est pas une version « plus intelligente sur tout ». C'est une version résolument axée sur les agents qui lisent des écrans, utilisent des outils et écrivent du code sur de nombreuses étapes.

Le premier résultat indépendant : #1 open-weight sur le benchmark Legal Agent de Harvey
Depuis la mise en ligne de cette page, le fait nouveau le plus important est d'ordre juridique, et non technique. Alibaba a annoncé que Qwen3.8-27B est le modèle open-weight n°1 sur le benchmark Legal Agent de Harvey — une affirmation de classement émanant du fournisseur lui-même, à considérer donc comme une déclaration d'Alibaba. Le résultat qui sous-tend cette affirmation est une étude qui n'est pas d'Alibaba : Harvey, l'entreprise d'IA juridique, et Engram, une start-up spécialisée dans la mémoire IA, ont bâti un cabinet d'avocats synthétique nommé Calderwood & Harkness à partir de 100M+ tokens répartis sur environ 10 000 documents et 266 dossiers, puis ont adapté Qwen3.8-27B à celui-ci grâce à une mémoire paramétrique, des notes compressées et un outil de retrieval.
Sur 250 tâches juridiques, le 27B adapté a obtenu une moyenne de 67 %, devançant tous les modèles testés par l’étude — y compris Claude Opus 4.8 — et sur la stricte exactitude tout-ou-rien, il a devancé Opus 4.8 par 30 % contre 25 %, à environ 0,13 $ par requête contre 1,32 $ pour Opus 4.8. Ces chiffres sont rapportés par Harvey/Engram et n’ont pas encore été reproduits de manière indépendante. Avant l’entraînement sur les documents propres du cabinet, le même modèle n’obtenait que 4,7 % aux questions spécifiques au cabinet ; après les avoir étudiés, 72,6 %.
Lisez le #1 avec un gros bémol : le modèle qui a dominé le benchmark avait étudié le corpus de test au préalable, adapté sur les 100M tokens de l’entreprise avant d’être évalué. Cela en fait une démonstration de ce que le 27B peut absorber avec un réglage spécifique au domaine, et non un score pour les poids Apache-2.0 standard sur un banc d’essai neutre — et il ne couvre qu’un seul domaine, le droit, pas la qualité générale. Ce qu’il soutient en revanche, c’est l’argument derrière le tweet : un 27B assez petit pour tourner sur une machine locale est assez puissant pour un travail de niveau professionnel une fois qu’il dispose des bonnes connaissances.
Le deuxième résultat indépendant : #9 au classement général dans le WebDev de Code Arena
Le deuxième résultat indépendant est d'ordre codage, et c'est la raison pour laquelle cette page a changé le 25 août. Code Arena est le classement de développement web d'Arena.ai — le projet anciennement connu sous le nom de WebDev Arena, sur le site anciennement connu sous le nom de LMArena — où les utilisateurs créent de vraies applications avec des paires de modèles anonymisés et votent pour savoir quelle sortie ils préféreraient mettre en production. Sur ce classement public, Qwen3.8-27B se situe à la 9e place au classement général avec un score de 1595, le seul modèle de sa catégorie de taille dans le top 10.
Le classement est la partie indépendante — il s'agit d'un leaderboard tiers que n'importe qui peut ouvrir. Le titre qui l'entoure est le fait d'Alibaba : le cadrage « seul petit modèle dans le top 10 » et les placements associés proviennent de l'annonce de Qwen du 25 août. Ils méritent d'être répétés avec cette étiquette. Le 27B se classe six places sous le Qwen3.8-Max, nettement plus grand (que l'annonce place au 3e rang du classement général), et bien devant le Gemma 4-31B, de taille comparable (que la même annonce place au 80e rang). Le propos n'est pas qu'un 27B batte les modèles de pointe en matière de création d'applications web ; c'est qu'un modèle assez petit pour tourner sur un seul GPU figure dans le top dix d'une arène de codage à l'aveugle dont les autres occupants sont des modèles bien plus grands.
Le troisième résultat indépendant : #1 modèle ouvert sur Image-to-WebDev d'Arena.ai.
Le troisième résultat indépendant est arrivé le 26 août, et c'est le plus fort jamais obtenu pour un modèle de cette taille. Image-to-WebDev est le tableau frère du WebDev de Code Arena sur Arena.ai — l'arène où l'on donne à un modèle une capture d'écran ou une autre référence visuelle et où il doit la transformer en interface web fonctionnelle, avec des votants humains en aveugle qui choisissent le résultat qu'ils préféreraient livrer. Sur ce classement public, Qwen3.8-27B se classe n°1 parmi les modèles ouverts et n°7 au total, avec un score d'arène annoncé de 1 574.
Le classement est la partie indépendante — il figure sur un leaderboard tiers que tout le monde peut ouvrir. Le titre qui l'entoure est une déclaration d'Alibaba : l'annonce du 26 août de l'équipe Qwen présente le 27B comme « au niveau de modèles 100 fois plus gros » sur ce test, une comparaison que le leaderboard ne documente pas. Et un classement de préférence n'est pas un verdict sur la qualité du code — les votes Image-to-WebDev mesurent quelle sortie un humain préférerait livrer, pas si le HTML est sécurisé, accessible ou maintenable. Ce que le résultat établit, c'est qu'un modèle open-weights de 27B est désormais en tête de tout le champ des modèles ouverts pour transformer une image en page, ce qui est la compétence sur laquelle repose une catégorie croissante de produits « screenshot to site ».
Les lacunes honnêtes : là où il perd encore, et les réserves méthodologiques.
Face aux modèles de pointe, le tableau est flatteur mais pas unilatéral. Là où Qwen3.8-27B et Claude Opus 4.6 Max se recoupent, Qwen remporte la majorité — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, et tout le bloc vision. Face au Muse Glimmer-30B de Meta, le rival naturel de la catégorie locale, il remporte haut la main les huit benchmarks communs. Mais il perd tout de même Terminal-Bench 2.1 (73.0 contre 78.2), GPQA Diamond (89.2 contre 91.3), Humanity's Last Exam (30.8 contre 40.0) et NL2Repo-Bench (42.3 contre 47.6) face à Claude Opus 4.6 Max. Si votre charge de travail relève du raisonnement de pointe le plus difficile — mathématiques de frontière, questions massivement multidisciplinaires — le 27B n'y est pas encore.
Trois mises en garde avant de citer tout cela. Premièrement, le tableau de la fiche modèle ci-dessus est encore entièrement rapporté par Alibaba — il n'existe pas encore d'indice Artificial Analysis pour le 27B. Il dispose désormais de trois résultats indépendants de tiers, mais chacun est limité : le classement Code Arena mesure la création d'applications web à partir d'invites textuelles, le classement Image-to-WebDev mesure la transformation d'une capture d'écran en page fonctionnelle, tous deux jugés par des votes à l'aveugle sur des sorties anonymisées, et l'étude sur l'agent juridique Harvey couvre un domaine unique avec un modèle entraîné pour le test. Aucun ne correspond aux poids d'origine exécutés sur un banc d'essai générique. Deuxièmement, la fiche modèle utilise le banc d'essai Claude Code pour SWE-bench Pro et QwenSWEBench, et un juge GPT-4o pour Humanity's Last Exam — les comparaisons avec des modèles évalués sur d'autres configurations feront varier les chiffres. Troisièmement, l'exécution de MathVision par Alibaba a utilisé une invite fixe, tandis que les concurrents ont utilisé la meilleure de deux variantes. Rien de tout cela ne signifie que les résultats sont faux ; cela signifie qu'ils représentent un plafond, et non un plancher, jusqu'à ce que des laboratoires indépendants fassent tourner le modèle sur des bancs d'essai génériques neutres.
Ce qu'il faut pour l'exécuter.
Qwen3.8-27B est un modèle local, ce qui change le sens de « performance » : le débit sur votre propre matériel plutôt qu'une grille tarifaire. Les poids BF16 représentent environ 55,6 Go ; une fois quantifié en 4 bits, il tient sur une carte de 24 Go comme une RTX 3090 ou 4090. AMD a fourni un support Day-0 dès le jour du lancement, et ses propres mesures llama.cpp/Vulkan — août 2026, moyenne de trois essais ou plus — le placent à 24,5 tokens/s sur un Ryzen AI Max+ 395 et à 51,8 tokens/s sur une Radeon AI PRO R9700 avec 32 Go, sur des systèmes dotés de plus d'environ 24 Go de mémoire graphique variable ou de VRAM. Les tests communautaires de la version FP8 sur un NVIDIA GH200 ont tenu 10 requêtes simultanées avec un contexte de 262K et un temps jusqu'au premier token inférieur à 10 ms. Vos propres chiffres seront différents — ce sont les GPU de quelqu'un d'autre — mais la tendance est réelle : c'est la première version de Qwen de cette catégorie qui tourne sur une seule station de travail, et pas seulement dans un test.
Poids libres, ou une API payante ?
La décision que ce modèle impose est celle qui sépare le local de l'hébergé : les poids ne coûtent rien, mais vos GPU ne sont pas gratuits. L'auto-hébergement signifie posséder le silicium — une carte de 24 Go si vous acceptez la quantification 4 bits et une génération plus lente, quelque chose de plus grand pour obtenir le contexte complet de 262K en pleine qualité. L'alternative hébergée sur OrcaRouter est de 0,33 $ par million de jetons d'entrée et de 2,40 $ par million de jetons de sortie, avec le même contexte de 262K et une entrée image et vidéo, et un p50 de temps de premier jeton de 225 ms mesuré sur les sept derniers jours — pas de GPU à acheter, pas de VRAM à surveiller. Le calcul est celui que vous faites toujours avec les poids ouverts : le débit de jetons dont vous avez réellement besoin multiplié par votre coût par jeton, contre le prix fixe d'une carte. En cas de volume soutenu et important, l'auto-hébergement l'emporte ; en cas de volume en rafales ou modeste, payer 0,33 $/2,40 $ vaut mieux que d'acheter du silicium que vous laissez surtout inactif.

L'essentiel
Qwen3.8-27B est le modèle open-weights le plus puissant qu'Alibaba ait placé dans cette catégorie de taille, selon les propres chiffres d'Alibaba : meilleur du tableau en codage agentique, utilisation d'ordinateur et raisonnement visuel, avec une fenêtre de contexte de 262K et des poids sous licence Apache 2.0. La lecture correcte du tableau de bord est conditionnelle — chaque chiffre de la fiche modèle est rapporté par le fournisseur, spécifique au harnais de test et non encore reproduit, et la frontière remporte toujours les benchmarks de raisonnement les plus difficiles. Si vous décidez de l'héberger vous-même ou de l'appeler via une API, considérez le tableau de benchmarks comme la promesse, les chiffres de débit AMD comme la première mesure matérielle indépendante, le résultat de l'agent juridique Harvey comme le premier signe indépendant que les capacités du modèle survivent en dehors des harnais d'Alibaba, et les deux placements en arène webdev — #9 au classement général sur Code Arena's WebDev et #1 modèle open sur Arena.ai's Image-to-WebDev — comme les premières confirmations indépendantes de cette capacité sur les classements de codage. Nous mettrons à jour cette page à mesure que d'autres laboratoires indépendants publieront leurs scores.
