Une carte de titre hero affichant Qwen3.8-27B GGUF avec le sous-titre « le bon quant pour votre GPU », une icône de téléchargement et des puces de fichier pour Q4_K_M 17,1 Go et UD-IQ2 9,0 Go.
Guides & Insights

Qwen3.8-27B GGUF : Quelle Quantité télécharger pour votre GPU

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Téléchargez le pack unsloth/Qwen3.8-27B-GGUF, et faites correspondre le fichier à la carte que vous possédez réellement. C'est toute la réponse : une carte graphique de 24 Go (RTX 4090 ou 3090) devrait prendre Q4_K_M à 17,1 Go ; une carte de 16 Go devrait prendre IQ4_XS à 15,7 Go (ou Q3_K_M à 13,8 Go si vous voulez de la marge pour le contexte) ; une carte de 12 Go se limite aux fichiers 2 bits, UD-IQ2_XXS à 9,0 Go, et c'est un compromis à faire en connaissance de cause. Qwen3.8 27B — le modèle dense d'Alibaba à 27 milliards de paramètres, dont les poids sous licence Apache 2.0 ont été publiés les 13 et 14 août 2026 — est particulièrement économique à exécuter en local, car son attention hybride ne met en cache que 16 de ses 64 couches ; une quantification 4 bits sur 24 Go peut donc gérer confortablement un contexte de 32K à 64K jetons. Et le GGUF est la seule voie à coût marginal nul : pas de clé API, pas de facture par jeton, aucune donnée ne quitte votre machine.

Concernant les sources : l'architecture, la fenêtre de contexte et la licence sont officielles, issues de la fiche du modèle Qwen3.8 27B sur Hugging Face, vérifiée le 15 août 2026. Les tailles GGUF proviennent des dépôts GGUF unsloth et ggml-org, le même jour. L'indication de VRAM par GPU est la recommandation officielle d'unsloth. Les estimations en octets du cache KV et les débits en tokens par seconde sont des mesures communautaires effectuées dans les premiers jours suivant la sortie, et non des spécifications du fournisseur. Chaque benchmark cité ci-dessous est rapporté par Ali​baba et n'a pas été reproduit.

Le sélecteur de fichiers, une ligne par quant.

UD-IQ2_XXS — 9,0 Go — le seul format qui tient confortablement sur une carte de 12 Go ; attendez-vous à une perte de qualité visible.

UD-Q2_K_XL — 10,7 Go — cartes de 12 Go, avec presque plus aucun contexte restant.

Q3_K_M — 13,8 Go — cartes 16 Go qui veulent de la marge de contexte.

IQ4_XS — 15,7 Go — cartes de 16 Go : la plus grande quantification qui tient entièrement.

Q4_K_M — 17,1 Go — cartes de 24 Go : le juste milieu, et le fichier auquel cet article vous renvoie.

Q5_K_M — 19,8 Go — 24 Go, échangeant de la marge de contexte contre un léger gain de qualité.

Q6_K — 22,9 Go — tient dans 24 Go si on serre ; quasi sans perte.

Q8_0 — 29.0GB — 32GB, une répartition sur deux cartes ou un déchargement CPU.

BF16 — 54,7 Go — cartes serveur et configurations CPU à forte RAM ; précision de référence.

Deux packs, deux tailles de Q4_K_M : celui d'unsloth fait 17,1 Go ; celui de ggml-org fait 19,0 Go. Le pack unsloth utilise la quantification Dynamic V3.0 (preview) pour ses fichiers UD-* et est celui auquel la plupart des applications locales reviennent par défaut ; le pack ggml-org fournit les K-quants standard plus la tête de prédiction multi-tokens distincte utilisée pour le décodage spéculatif. Les deux Q4_K_M fonctionnent — la différence est de quelques centaines de mégaoctets et le fichier MTP.

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

Pourquoi ce 27B tient sur des cartes plus petites que la plupart

Qwen3.8 27B possède 64 couches, mais seulement 16 utilisent l’attention complète. Les 48 autres utilisent l’attention linéaire Gated DeltaNet, qui conserve un état récurrent de taille fixe au lieu d’un cache clé-valeur croissant. La disposition des blocs indiquée dans la fiche du modèle est de 3×(Gated DeltaNet → FFN) pour chaque 1×(Gated Attention → FFN) — soit un ratio hybride de 3:1. L’effet pratique : le cache KV représente environ un quart de ce dont un modèle dense classique de 27B a besoin pour le même contexte. Les mesures de la communauté cette semaine placent le cache à environ 0,5 Go pour un contexte de 8K, 2,0 Go pour 32K, et 16,4 Go pour la fenêtre native complète de 262K. Cela inverse les conseils habituels — l’essentiel de votre budget VRAM va aux poids, pas au contexte, et une carte de 24 Go peut exécuter Q4_K_M avec un contexte de 64K à 96K sans effort. Vous pouvez réduire encore le cache avec l’option --cache-type-k de llama.cpp, qui quantifie le cache lui-même.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

Trois pièges qui vous feront trébucher dès le premier jour

Les anciennes versions de llama.cpp rejettent le fichier. Le GGUF enregistre la nouvelle architecture qwen35, vous avez donc besoin d'une version récente — tout ce qui date d'avant la semaine de sortie refuse de le charger avec une erreur d'architecture. Mettez d'abord llama.cpp à jour, avant de télécharger.

Le piège du template.Le template officiel de chat de Jinja enveloppe chaque tour d'assistant dans un bloc think même lorsque la trace de raisonnement est vide, ce qui produit des blocs imbriqués et un historique tronqué dans les conversations multi-tours — on dirait que le modèle a oublié ce que vous avez dit. Lancez llama.cpp avec --jinja, et privilégiez un pack qui fournit un chat_template.jinja corrigé.

La vision nécessite un fichier séparé. Le texte fonctionne immédiatement ; les images et les vidéos sont silencieusement ignorées à moins que vous ne chargiez également le projecteur mmproj, environ 0,9 Go. Il n'est pas listé sur la page de dépôt GGUF d'unsloth — récupérez-le depuis le dépôt de base ou le pack ggml-org. Si vous prévoyez de fournir des documents ou des captures d'écran, ajoutez --mmproj à la commande du serveur.

Exécutez-le : les commandes

llama.cpp, une fois que vous avez un build à jour :

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...et ajoutez --mmproj Qwen3.8-27B-mmproj-bf16.gguf si vous avez besoin de la vision.

Ollama, si vous voulez l’entrée de bibliothèque : ollama pull qwen3.8:27b, puis ollama run qwen3.8:27b. LM Studio et Unsloth Desktop récupèrent automatiquement le template de chat et le déchargement de la RAM — c’est la voie la plus simple pour une première exécution.

Local vs API : l'économie honnête

Le GGUF est la voie gratuite : coût marginal nul, aucune limite de débit, rien ne quitte votre machine. Ce n'est pas la voie bon marché en termes absolus — vous fournissez le GPU de 24 Go (un RTX 3090 d'occasion ou un RTX 4090 neuf, plus l'électricité), et un fichier 2 bits sur une carte de 12 Go est une expérience compromise.

La route API existe parce que les poids sont sous licence Apache 2.0, donc le coût marginal de service est proche de zéro et n'importe qui peut héberger. Qwen3.8 27B est disponible sur OrcaRouter aujourd'hui à 0,33 $ par million de tokens d'entrée et 2,40 $ par million de tokens de sortie — le prix catalogue du fournisseur répercuté sans marge — et comme les poids sont ouverts, il existe aussi un palier gratuit avec limite de débit qui facture 0 $ par requête et renvoie HTTP 429 lorsque vous dépassez sa limite. Un mois représentatif de 10 millions de tokens avec 70 % de tokens d'entrée revient à environ 9,51 $ sur le palier payant. Si vous possédez déjà le GPU, l'option locale est plus économique ; sinon, louer les tokens est plus avantageux que d'acheter une carte pour un projet secondaire.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

Quand cette recommandation est erronée

Q4_K_M sur 24GB est la valeur par défaut, pas la réponse universelle. Choisissez autre chose lorsque :

Vous avez besoin d'une qualité maximale sur un serveur ou une station de travail — Q8_0 à 29 Go ou BF16 à 54,7 Go avec déchargement CPU et RAM, pas un fichier 4-bit.

Vous êtes sur une carte Blackwell RTX 50-series — la variante NVFP4 est environ 1,5× plus rapide dans les mêmes 24 Go de VRAM et utilise un cache KV FP8 pour un contexte plus long. Sur une 5090, NVFP4 bat n'importe quel GGUF sur ce modèle.

Vous avez besoin du contexte complet de 262K — prévoyez environ 16 Go de cache en plus des poids ; cela fait descendre une carte de 24 Go à Q3_K_M, ou force la quantification KV.

Vous vous fiez au décodage spéculatif — choisissez le pack ggml-org, qui conserve la tête de prédiction multi-tokens ; certains quants la suppriment pour économiser environ 0,5 Go.

Vous n'avez que 12 Go — une réponse honnête : un 27B en 2 bits est nettement moins bon que le même modèle servi correctement. Essayez l'offre gratuite de l'API avant de vous engager dans une configuration locale en 2 bits ; si cela vous suffit, le GGUF peut attendre que le matériel suive.

En résumé

Qwen3.8 27B est le rare 27B qui tient sur une carte de 24 Go sans compromis : un téléchargement Q4_K_M de 17,1 Go, une version actuelle de llama.cpp, et un cache KV assez économique pour que le contexte long ne coûte presque rien. Téléchargez ce fichier si vous possédez le matériel, souvenez-vous que la vision nécessite le mmproj séparé, et attendez-vous au piège du template la première fois qu'une conversation multi-tours semble avoir perdu la mémoire. Si vous ne possédez pas le matériel, le même modèle est une API à 0,33 $/2,40 $ avec un palier gratuit à débit limité, donc aucune raison d'exécuter un fichier 2 bits dont vous n'êtes pas satisfait. Le GGUF est la voie gratuite ; ce n'est tout simplement plus la seule.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube