Une carte de titre principale pour la confrontation Qwen3.8-27B vs Qwen 3.8, montrant deux cartes de puce arrondies — le modèle dense 27B avec un contexte de 262K et une licence Apache 2.0 face au cœur MoE de 2,4 T / 95B actifs avec une licence personnalisée — et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Qwen3.8-27B vs Qwen 3.8 : même génération, un GPU contre un rack

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Cette semaine, Alibaba a placé Qwen3.8-27B sur la voie d'inférence rapide de Cerebras — la première fois que le 27B dense dispose d'une option hébergée véritablement rapide — et Artificial Analysis a enfin indexé les deux côtés de cette confrontation. Qwen3.8-27B obtient 34 sur l'AA Intelligence Index. Qwen 3.8, c'est-à-dire le cœur ouvert que la plupart des gens désignent lorsqu'ils écrivent le nom sans suffixe, obtient 40. Ces deux chiffres réinitialisent une comparaison que la couverture du lancement d'août avait dû faire reposer entièrement sur la parole du fournisseur.

Le modèle derrière « Qwen 3.8 » en tant que nom autonome est Qwen3.8-2.4T-A95B : les poids de type mélange d’experts de 2,4 billions de paramètres qu’Aliba​ba a publiés sous une licence personnalisée. Qwen3.8-27B est le membre dense de la même génération — environ 27 milliards de paramètres, Apache 2.0, dimensionné pour un seul GPU. Ils partagent le nom de famille, la longueur de contexte native de 262K et une fenêtre de lancement. Tout le reste à leur sujet est une étude de contrastes : l’un que vous pouvez posséder, l’autre que vous ne pouvez que louer. Voici à quoi chacun sert réellement, maintenant que les deux ont des chiffres indépendants.

La même génération, des formes opposées

Qwen3.8-27B est un modèle dense — 27 B de paramètres (28 B en comptant l’encodeur visuel), 64 couches, une pile d’attention hybride composée de 48 couches d’attention linéaire Gated DeltaNet contre 16 couches d’attention complète. C’est cette hybridation qui permet à un 27B de prendre en charge 262 144 tokens de contexte natif. Qwen3.8-2.4T-A95B est l’architecture phare : 2,4 T de paramètres au total, environ 95 B actifs par token, 92 couches avec 512 experts par couche, et 69 de ces 92 couches en attention linéaire. Même astuce, quatre-vingt-dix fois l’empreinte.

• Architecture — Qwen3.8-27B : 27B dense, chaque token mobilise l’intégralité du modèle. Qwen3.8-2.4T-A95B : 2,4 T au total / ~95 Md actifs en MoE.

• Contexte — les deux à 262 K en natif ; l’extension à 1 M du 27B est disponible uniquement en mode hébergé, le 2,4 T atteint ~984 K en mesure.

• Entrée — Qwen3.8-27B : texte, image et vidéo. Qwen3.8-2.4T-A95B : texte uniquement, réflexion verrouillée activée.

• Licence — Qwen3.8-27B : Apache 2.0. Qwen3.8-2.4T-A95B : licence personnalisée Qwen3.8-Max.

• Poids — Qwen3.8-27B : 55,6 Go en BF16, se quantifie en une version Q4 d'environ 16 Go. Qwen3.8-2.4T-A95B : ~2,4 To en BF16, une baie de GPU, pas un ordinateur de bureau.

• Où vous les rencontrez — Qwen3.8-27B : auto-hébergé ou loué pour pas cher. Qwen3.8-2.4T-A95B : loué, car aucune personne sensée ne possède la baie.

Des chiffres indépendants, enfin

Chaque article comparatif d’août sur Qwen3.8-27B portait la même réserve : « pas encore de scores indépendants ». Ce n’est plus le cas. Artificial Analysis dispose depuis cette semaine de mesures pour les deux modèles, et la forme des données est vraiment intéressante.

Sur l'Intelligence Index, Qwen3.8-2.4T-A95B obtient un score de 40 et se classe 4e sur 113 dans sa catégorie. Qwen3.8-27B obtient 34, ce qui le place premier sur 140 modèles de sa catégorie de taille 4–40B à poids ouverts, une performance véritablement solide pour un modèle dense de 27B. Les deux sont lents selon des mesures indépendantes : 39,0 jetons de sortie par seconde pour le 27B et 38,1 pour le 2.4T, contre une médiane de catégorie d'environ 90. Les deux sont verbeux, le 27B générant environ 200 M de jetons de sortie sur l'ensemble des exécutions de l'indice, contre une médiane de catégorie de 68 M. Aucun des deux n'est un modèle frontière de premier plan ; tous deux sont des bêtes de somme, et l'indice indique que le 2.4T est la bête de somme la plus performante, avec une marge nette.

A three-lane infographic titled 'Qwen3.8-27B — three ways to rent it': self-hosted lane on OrcaRouter at $0.33/$2.40 per 1M tokens with 262K context, vendor lane on Qwen Cloud at $0.50/$3.00 with 1M context and a 90% cache discount, and the fast lane on Cerebras PayGo at $0.99/$1.49 with rapid inference, plus the OrcaRouter logo in the bottom-right corner.

La tarification du côté indépendant raconte la même histoire en dollars. Artificial Analysis tarife le 27B à 0,50 $ par million de tokens d'entrée et à 3,00 $ par million de tokens de sortie sur la version hébergée de Qwen Cloud (remise de cache de 90 %), et le 2,4T à 2,00 $ / 6,00 $ (remise de cache de 88 %). Coût par tâche de l'Intelligence Index : 0,82 $ pour le 27B contre 2,16 $ pour le 2,4T. Le plus petit modèle est moins cher à exécuter par unité d'intelligence — et les deux sont chers par rapport à leur classe de vitesse, car tous deux sont des modèles de raisonnement qui consomment des tokens de sortie.

Tout le reste — SWE-bench Pro 61,7, DeepSWE 1.1 42,2, LiveCodeBench v6 90,3 pour le 27B ; les 86,6 de Terminal-Bench 2.1 et 67,7 de SWE-bench Pro du 2.4T — reste rapporté par le fournisseur, non reproduit, et signalé comme tel tout au long de cet article. Les indices AA ci-dessus constituent le plancher indépendant sous tout cela.

Ce que change l'introduction en bourse de Cerebras

Le 12 septembre 2026, le compte Qwen a annoncé que Qwen3.8-27B tourne désormais sur Cerebras, son entrée au catalogue étant en ligne sous la bannière « Qwen 3.8 27B est désormais disponible sur Cerebras PayGo ». Cerebras l'affiche à 0,99 $ par million de jetons en entrée et 1,49 $ par million de jetons en sortie sur le matériel de classe WSE qui a fait la réputation de l'entreprise en matière de vitesse. Cela donne au 27B quelque chose que le 2.4T core n'a jamais eu : une voie express.

A comparison scoreboard titled 'Qwen3.8-27B vs Qwen 3.8 — the matchup': the 27B shows 27B dense architecture, 262K native context, text/image/video input, Apache 2.0, AA Intelligence 34, and $0.33/$2.40 per 1M tokens; the 2.4T core shows 2.4T / 95B-active MoE, 984K measured context, text-only input, the Qwen3.8-Max custom license, AA Intelligence 40, and $2.00/$6.00 per 1M tokens, with a footer labeling the 27B price as the OrcaRouter self-hosted rate, the 2.4T price as the Qwen3.8-Max API rate, and the AA figures as of September 2026, plus the OrcaRouter logo in the bottom-right corner.

Cela compte parce que « lent et verbeux » était le seul vrai reproche adressé au 27B depuis le début. Sur le banc d'essai indépendant, il fait 39 t/s ; d'après notre propre télémétrie de service, il réalise ~154 jetons de sortie par seconde avec une latence p50 du premier jeton de 4,48 s — et désormais un second fournisseur rivalise sur ce même axe. Le 2.4T, en revanche, n'a aucune voie rapide : à 38 t/s, vous payez des prix de modèle de pointe pour une vitesse de milieu de tableau, et le seul moyen d'y échapper est un cluster GPU loué sur lequel vous faites tourner vous-même les poids ouverts.

Trois voies pour le 27B, une pour le 2.4T

À compter d’aujourd’hui, le dense 27B peut être loué de trois façons, et l’écart de prix vaut la peine d’être consulté avant de faire votre choix :

• Voie auto-hébergée — Qwen3.8-27B est disponible sur OrcaRouter à 0,33 $ / 2,40 $ par million, exécuté sur notre propre infrastructure. Entrée la moins chère du marché pour ce modèle, ~154 tok/s en sortie, contexte de 262K.

• Voie fournisseur — le build hébergé de Qwen Cloud, 0,50 $ / 3,00 $ par million avec le contexte de 1 M de jetons et une remise de 90 % sur le cache.

• Voie rapide — Cerebras PayGo, 0,99 $ / 1,49 $ par million, positionné sur la vitesse plutôt que sur le prix.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (captured September 12, 2026) showing the input price of $0.33 per 1M tokens, output price of $2.40 per 1M tokens, a 262K token context window, text/image/video input support, and a p50 first-token latency of 4.48 seconds.

L'open core 2,4T n'a pas de spread équivalent. L'API phare qui sert la même architecture — Qwen3.8-Max — est à 2,00 $ / 6,00 $ par million, et c'est le chiffre qui reste, que vous l'appeliez Max ou open core. Faites plutôt tourner les poids, et l'économie bascule vers le matériel : le 2,4T a besoin d'environ 2,4 To de poids BF16 et d'un nœud multi-GPU, une décision d'investissement que personne ne prend à la légère. Un GPU de 24 Go fait tourner la version Q4 du 27B à un coût marginal qui s'arrondit à zéro.

L'exemple concret qui décide pour la plupart des équipes : 100 M de tokens d'entrée et 20 M de tokens de sortie par jour. Au tarif de 2 $/6 $ du 2.4T, cela représente environ 320 $ par jour, ~117 000 $ par an. Avec le 27B à notre tarif de 0,33 $/2,40 $, c'est environ 81 $ par jour — et sur la copie auto-hébergée, c'est le prix de l'électricité. Le 2.4T vous offre un véritable avantage de qualité, AA 40 contre 34. Savoir si cet avantage vaut une facture mensuelle à cinq chiffres, c'est toute la question que pose ce duo.

Là où ils divergent véritablement

Au-delà de l’index, trois différences pratiques déterminent lequel convient à une charge de travail donnée.

L’entrée multimodale est le filtre le plus propre. Qwen3.8-27B lit le texte, les images et la vidéo — captures d’écran, graphiques, documents avec figures, images vidéo, tout entre dans la même fenêtre de 262K. Qwen3.8-2.4T-A95B est résolument texte uniquement. Si votre entrée comprend quoi que ce soit de visuel, le 2.4T est disqualifié, indépendamment de son indice plus élevé.

Le contrôle de la réflexion vient en second. Le mode de raisonnement du 27B peut être désactivé par requête, ce qui compte pour l’extraction sensible à la latence, où une chaîne de pensée est un pur surcoût ; il expose aussi reasoning_effort. Le cœur 2,4T ne peut pas désactiver la réflexion — chaque réponse commence par un think> bloc, et vous payez pour ces tokens, que vous les vouliez ou non. L’API phare corrige cela, mais le cœur ouvert ne le fait pas.

Les licences viennent en troisième position, et elles comptent discrètement à grande échelle. Apache 2.0 sur le 27B est le standard permissif : modifier, redistribuer, commercialiser, concession de brevet incluse. Le 2.4T est distribué sous une licence personnalisée Qwen3.8-Max — permissive dans l’esprit, mais ce sont les conditions d’Alibaba, pas un standard communautaire, et il vaut la peine de lire le fichier avant de bâtir un produit dessus.

Routage de la décision

Les deux côtés de cette confrontation sont accessibles via une seule clé OrcaRouter, ce qui permet de répondre empiriquement à peu de frais à la question « lequel choisir ». Qwen3.8-27B est en ligne en tant que qwen/qwen3.8-27b au prix catalogue du fournisseur, sans marge, et l’API phare bâtie sur le même cœur 2,4 T est en ligne en tant que qwen/qwen3.8-max à 2,00 $ / 6,00 $ par million — le tarif propre d’Aliba​ba, répercuté directement, si bien que toute modification de prix du fournisseur est effective ici le jour même.

Cette même architecture 2.4T sous forme de poids téléchargeables ne fait pas partie de ce que nous proposons — si vous voulez le cœur ouvert via une API aujourd'hui, la voie phare est le moyen pratique d'y accéder, et qwen/qwen3.8 est préconfiguré pour s'activer dès qu'un fournisseur propose les poids ouverts. Une règle de routage qui envoie le trafic visuel et sensible à la latence vers qwen/qwen3.8-27b et le trafic résiduel de raisonnement complexe vers qwen/qwen3.8-max ne coûte rien à mettre en place et bascule automatiquement entre les fournisseurs. Une seule clé, pas de second contrat, et la répartition est un changement de configuration plutôt qu'une réarchitecture — le moyen le moins cher de tester si les six points d'indice supplémentaires du 2.4T valent pour vous 5,67 $ par million de tokens de sortie.

Qui devrait choisir quoi

• Choisissez Qwen3.8-27B si votre entrée comprend des images ou de la vidéo, si vous voulez une réflexion que vous pouvez désactiver, si vous possédez un GPU de 24 Go ou prévoyez d’en acquérir un, ou si votre dépense par token est d’un volume suffisant pour que 0,33 $/2,40 $ contre 2,00 $/6,00 $ soit tout l’argument.

• Choisissez Qwen 3.8 (le cœur 2,4 T) si vous travaillez uniquement en texte, si vous voulez le meilleur score de raisonnement indépendant de la famille (AA 40), et si le tarif de 2 $/6 $ — ou le coût d'exploitation d'un nœud GPU — tient confortablement dans votre budget.

• Choisissez les deux si votre trafic couvre les deux profils : passez par la passerelle, laissez le routeur répartir selon la modalité et la difficulté, et changez d'avis dès que le prochain checkpoint ou le prix de l'un ou l'autre modèle est annoncé.

Le verdict

Le nom Qwen 3.8 a toujours désigné deux produits qui prétendaient former une seule famille, et désormais, tous deux ont des chiffres indépendants à défendre. Qwen3.8-2.4T-A95B est le cerveau le plus puissant, uniquement textuel, cher, et indéniablement rentable à $2/$6. Qwen3.8-27B est celui qui est déployable — multimodal, Apache 2.0, auto-hébergeable, et depuis cette semaine, il dispose enfin lui aussi d'une voie rapide. L'écart d'indice est bien réel : 40 contre 34. L'écart de prix aussi : environ cinq fois le coût par token lorsque vous utilisez le 2.4T via une API. Pour la plupart des équipes, la décision ne se joue pas sur les six points d'indice. Elle se joue sur le fait de savoir si vous achetez des tokens ou du matériel — et le 27B est le seul des deux qui vous permet d'acheter le matériel.