Title card pour le récapitulatif des benchmarks Qwen3.8-27B, montrant une fiche d'évaluation avec un sceau portant la mention {{1}}{{KEEP}}OPEN WEIGHTS{{/KEEP}}{{/1}} et des icônes pour le codage, le débit, la vision, le contexte long et le matériel local, avec des étiquettes indiquant {{2}}27B DENSE{{/2}}, {{3}}262K CONTEXT{{/3}} et {{4}}APACHE 2.0{{/4}}.
Guides & Insights

Qwen3.8-27B Benchmarks : Le tableau complet, avec les mises en garde associées

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Qwen3.8-27B obtient 73,0 sur Terminal-Bench 2.1, 61,7 sur SWE-bench Pro, 90,3 sur LiveCodeBench v6 et 84,3 sur OSWorld-Verified — et chacun de ces chiffres provient d'Alibaba lui-même. Le modèle open-weights de 27 milliards de paramètres est arrivé sur Hugging Face le 14 août 2026 sous licence Apache 2.0, et au 15 août, personne en dehors d'Alibaba n'a indépendamment évalué sa qualité. Cette page est le récapitulatif complet et sourcé : les 25 benchmarks officiels de la fiche modèle, ce qui a changé par rapport à son prédécesseur Qwen3.6-27B, ce qu'un test de débit indépendant d'AMD a mesuré, et quelles affirmations vous devez considérer comme provisoires.

Guide de lecture avant les chiffres : « officiel » signifie ici l'évaluation d'Alibaba indiquée sur la fiche du modèle à l'adresse Qwen/Qwen3.8-27B. Elle est déclarée par le fournisseur et non reproduite. « Indépendant » signifie qu'une personne extérieure au laboratoire l'a mesurée — jusqu'à présent, cela s'applique uniquement au débit matériel, et non à un score de qualité. Les benchmarks dont le harnais d'évaluation est important sont signalés dans le texte.

Le modèle, une ligne par spécification

• 27B paramètres denses (28B en comptant l’encodeur de vision), 64 couches, taille cachée de 5120.

• Attention hybride — 48 couches d'attention linéaire Gated DeltaNet plus 16 couches d'attention complète, un ratio de 3:1 — ce qui rend une fenêtre de 262K jetons abordable à exécuter.

• Contexte natif de 262 144 jetons, extensible à 1 000 000 avec la mise à l'échelle YaRN.

• Entrée native d'images et de vidéos (sortie de texte), poids Apache 2.0, environ 55,6 GB en BF16.

La version courte : il s'agit du modèle conçu pour reprendre ce qu'Alibaba a appris en construisant Qwen3.8-Max, fort de 2,4 billions de paramètres, et le compresser en quelque chose qu'un seul GPU peut exécuter.

Le tableau de bord : chaque benchmark de la fiche modèle

Tous les scores ci-dessous sont ceux rapportés par Alibaba dans la fiche modèle du 14 août, avec le score de Qwen3.6-27B que le modèle remplace entre parenthèses.

Codage. Terminal-Bench 2.1 (codage terminal agentique) 73,0 (63,4) ; SWE-bench Pro 61,7 (53,5) ; QwenSWEBench 79,0 (49,3) ; DeepSWE 1.1 42,2 (13,3) ; NL2Repo-Bench 42,3 (36,2) ; LiveCodeBench v6 90,3 (83,9). Les exécutions de SWE-bench Pro et de QwenSWEBench ont utilisé le harnais Claude Code, selon une note de bas de page de la fiche du modèle — un point à garder à l'esprit avant de les comparer à un modèle évalué sur un harnais différent.

Agents à long horizon et travail de bureau. CoWorkBench 70,7 (61,0); JobBench 33,4 (21,8); Agents' Last Exam Pass@1 20,4 / score 42,9 (10,6 / 27,3).

Raisonnement et connaissances. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). HLE est évalué par GPT-4o, selon la fiche.

Vision et utilisation de l'ordinateur. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 avec CI / 90.0 sans (85.1); BabyVision 85.6 avec CI / 65.7 sans (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). « CI » est l'amélioration au moment de l'inférence d'Alibaba ; l'écart entre ses états activé et désactivé est le nombre le plus informatif de la fiche sur le score que vous pouvez acheter avec un calcul d'inférence supplémentaire.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Ce qui a réellement changé par rapport à Qwen3.6-27B

Tous les benchmarks de la carte ont augmenté, mais les écarts ne sont pas uniformes — et c'est la forme de l'amélioration qui raconte l'histoire. Les gains se concentrent dans le codage agentique et l'utilisation de l'ordinateur, pas dans le rappel de connaissances :

• DeepSWE 1.1 (codage agentique) 13.3 → 42.2, soit environ un triplement.

• QwenSWEBench 49,3 → 79,0

• Score des agents au dernier examen : 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 et AndroidWorld 70.3 → 81.9

• BabyVision (avec CI) 28.9 → 85.6 — le plus grand gain relatif sur la carte

Entre-temps, GPQA Diamond est passé de 87,8 → 89,2 et RealWorldQA de 84,1 → 85,9 : une progression réelle mais minime. Ce n'est pas une version « plus intelligente sur tout ». C'est une version résolument axée sur les agents qui lisent des écrans, utilisent des outils et écrivent du code sur de nombreuses étapes.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Les lacunes honnêtes : là où il perd encore, et les réserves méthodologiques.

Face aux modèles de pointe, le tableau est flatteur mais pas unilatéral. Là où Qwen3.8-27B et Claude Opus 4.6 Max se chevauchent, Qwen remporte la majorité — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, et tout le bloc vision. Face au Muse Glimmer-30B de Meta, le rival naturel de la classe locale, il gagne haut la main les huit benchmarks qui se chevauchent. Mais il perd toujours Terminal-Bench 2.1 (73.0 contre 78.2), GPQA Diamond (89.2 contre 91.3), Humanity's Last Exam (30.8 contre 40.0) et NL2Repo-Bench (42.3 contre 47.6) face à Claude Opus 4.6 Max. Si votre charge de travail est le raisonnement de pointe le plus difficile — mathématiques de pointe, questions massivement multidisciplinaires — le 27B n'y est pas encore.

Trois mises en garde avant de citer tout cela. Premièrement, rien de tout cela n'est vérifié de manière indépendante ; il n'existe ni indice Artificial Analysis, ni exécution LMArena pour le 27B au 15 août, et les harnais d'Alibaba ne sont pas ceux que des tiers utiliseront. Deuxièmement, la carte modèle utilise le harnais Claude Code pour SWE-bench Pro et QwenSWEBench, et un juge GPT-4o pour Humanity's Last Exam — les comparaisons avec des modèles évalués sur d'autres configurations feront varier les chiffres. Troisièmement, l'exécution de MathVision par Alibaba a utilisé un prompt fixe, alors que les concurrents obtenaient la plus élevée des deux variantes. Rien de tout cela ne signifie que les résultats sont faux ; cela signifie qu'ils constituent un plafond, et non un plancher, jusqu'à ce que quelqu'un d'autre exécute le modèle.

Ce qu'il faut pour l'exécuter.

Qwen3.8-27B est un modèle local, ce qui change le sens de {{1}}« performance »{{/1}} : {{2}}le débit sur votre propre matériel au lieu d'une grille tarifaire{{/2}}. Les poids BF16 pèsent environ 55,6 Go ; quantifiés en 4 bits, le modèle tient sur une carte de 24 Go comme une RTX 3090 ou 4090. AMD a fourni un support Day-0 dès le jour du lancement, et ses propres mesures llama.cpp/Vulkan — août 2026, moyenne de trois exécutions ou plus — le placent à {{3}}24,5 tokens/s{{/3}} sur un Ryzen AI Max+ 395 et à {{4}}51,8 tokens/s{{/4}} sur une Radeon AI PRO R9700 avec 32 Go, sur des systèmes dotés de plus d'environ 24 Go de mémoire graphique variable ou de VRAM. Les tests communautaires de la version FP8 sur un NVIDIA GH200 ont tenu {{5}}10 requêtes simultanées avec un contexte de 262K et un temps jusqu'au premier token inférieur à 10 ms{{/5}}. Vos propres chiffres différeront — ce sont les GPU de quelqu'un d'autre — mais la tendance est bien réelle : {{6}}c'est la première version de Qwen de cette catégorie qui tourne, et pas seulement dans un test, sur une seule station de travail{{/6}}.

Poids libres, ou une API payante ?

La décision que ce modèle impose est celle qui sépare le local de l'hébergé : les poids ne coûtent rien, mais vos GPU ne sont pas gratuits. L'auto-hébergement signifie posséder le silicium — une carte de 24 Go si vous acceptez la quantification 4 bits et une génération plus lente, quelque chose de plus grand pour obtenir le contexte complet de 262K en pleine qualité. L'alternative hébergée sur OrcaRouter est de 0,33 $ par million de jetons d'entrée et de 2,40 $ par million de jetons de sortie, avec le même contexte de 262K et une entrée image et vidéo, et un p50 de temps de premier jeton de 225 ms mesuré sur les sept derniers jours — pas de GPU à acheter, pas de VRAM à surveiller. Le calcul est celui que vous faites toujours avec les poids ouverts : le débit de jetons dont vous avez réellement besoin multiplié par votre coût par jeton, contre le prix fixe d'une carte. En cas de volume soutenu et important, l'auto-hébergement l'emporte ; en cas de volume en rafales ou modeste, payer 0,33 $/2,40 $ vaut mieux que d'acheter du silicium que vous laissez surtout inactif.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

En résumé

Qwen3.8-27B est le modèle à poids ouverts le plus puissant qu'Alibaba ait mis dans cette catégorie de taille, selon les propres chiffres d'Alibaba : en tête du tableau en codage agentique, utilisation d'ordinateur et raisonnement visuel, avec une fenêtre de contexte de 262K et des poids sous licence Apache 2.0. La bonne lecture du tableau de scores est conditionnelle — chaque chiffre est rapporté par le fournisseur, spécifique au harnais de test et pas encore reproduit, et les modèles de pointe gagnent toujours les benchmarks de raisonnement les plus difficiles. Si vous décidez de l'auto-héberger ou de l'appeler via une API, traitez le tableau de benchmarks comme la promesse et les chiffres de débit AMD comme la seule mesure indépendante qui existe aujourd'hui. Nous mettrons à jour cette page le jour où un laboratoire indépendant publiera un score.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube