Une carte titre pour l'article « Qwen3.8-27B VRAM Requirements » montrant une puce GPU avec une étiquette de mémoire d'environ 17 Go et des badges de quantification pour Q4_K_M, Q6_K et Q8_0.
Guides & Insights

Qwen3.8-27B : Exigences en VRAM : De combien de matériel vous aurez vraiment besoin

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Environ 17 Go de VRAM est le chiffre qui circule pour Qwen3.8-27B — Daniel Han d'Unsloth a déclaré qu'il « devrait tenir dans environ 17 Go de VRAM à sa sortie » — et il vaut la peine d'être précis sur ce que cela signifie et ne signifie pas. Il s'agit d'une projection basée sur le prédécesseur du 27B, et non d'une spécification d'Alibaba, car le modèle n'a pas encore été publié ; le dépôt officiel a été promis pour la semaine du 10 août 2026 et n'était pas apparu au moment de la rédaction. Cet article ventile la question de la VRAM entre ce sur quoi vous pouvez compter, ce qui est réellement incertain, et comment le chiffre évolue selon votre quantification, votre fenêtre de contexte et votre environnement d'exécution.

La réponse honnête d'abord

Il n'existe pas encore de spécification matérielle officielle pour Qwen3.8-27B. Tout ce qui suit est projeté à partir de Qwen3.6-27B, le modèle auquel le 27B succède — même nombre de paramètres, probablement la même architecture hybride, et ce qui se rapproche le plus d'une référence de dimensionnement. Considérez ces chiffres comme une enveloppe de planification, et non comme une fiche d'exigences. Les premières mesures réelles viendront des quantificateurs et des mainteneurs de frameworks d'inférence dans les jours suivant la publication des poids, et ce sont ces chiffres qui doivent verrouiller votre achat.

L'échelle des quants

La quantité de VRAM dont vous avez besoin dépend presque entièrement de la quantification que vous exécutez. En partant du tableau Qwen3.6-27B mesuré par la communauté :

• Q4_K_M — environ 16 Go de VRAM. Le point idéal pour les cartes de 24 Go, et probablement l'origine de ce chiffre de « 17 Go ». Le choix par défaut de la plupart des équipes.

• Q3_K_M / IQ3 — environ 13 Go de VRAM. Tient sur les cartes de 16 Go et même de 12 Go, avec une baisse de qualité visible.

• Q6_K — environ 21 Go de VRAM. Quasi sans perte, et un ajustement serré mais réel sur une carte de 24 Go.

• Q8_0 — environ 27–30 Go de VRAM. Pour les cartes de 48 Go où vous voulez la dernière goutte de qualité.

• Inférence FP8 — environ 27 Go de VRAM pour les poids, ce qui explique pourquoi un seul L40S est le choix courant de GPU d'inférence.

• Pleine précision (BF16) — environ 54 Go de VRAM. Concrètement, une carte de classe H100, et le territoire où les gens cessent de l'appeler « local ».

En bref : une GPU de 24 Go est l'achat sûr pour ce modèle, une carte de 16 Go ne peut le faire tourner que si vous acceptez les quants bas, et tout ce qui a 8 Go ou moins est exclu, à moins que le modèle ne s'avère nettement plus léger que son prédécesseur.

An infographic titled 'Qwen3.8-27B - the quant ladder' listing six quantization tiers with VRAM figures: Q3_K_M ~13 GB, Q4_K_M ~16 GB, Q6_K ~21 GB, Q8_0 ~27-30 GB, FP8 serving ~27 GB, BF16 full ~54 GB, with the Q4_K_M row highlighted as the sweet spot for 24 GB cards.

La variable que personne ne cite : la longueur de contexte.

Tous les nombres ci-dessus valent pour un contexte modeste. La VRAM augmente avec le contexte, car le cache KV doit coexister avec les poids. Sur Qwen3.6-27B, un contexte de 2K utilisait environ 11 Go, un contexte de 32K faisait passer la même quantification au-delà de 14 Go, et 128K faisait plus que doubler l'empreinte du cache. Si Qwen3.8-27B conserve une grande fenêtre de contexte native — et la génération Qwen tend dans ce sens — prévoyez quelques Go de marge au-delà de la taille de la quantification, ou plafonnez le contexte dans votre configuration d'exécution. Choisir une longueur de contexte que vous n'utilisez pas réellement est la façon la plus courante pour les équipes de finir par acheter une carte plus grande que nécessaire.

Le joker de l'architecture hybride

Qwen3.6-27B était un modèle hybride : seulement 16 de ses 65 couches utilisaient un cache KV traditionnel, tandis que 48 utilisaient un état récurrent fixe. Le résultat était environ quatre fois moins de mémoire KV qu'un modèle dense de même taille — ce qui explique en grande partie pourquoi un 27B semblait être un modèle pour carte de 24 Go plutôt que pour une de 48 Go. Si Qwen3.8-27B conserve la conception hybride (probable, mais non confirmé), le calcul de longueur de contexte ci-dessus devient plus favorable qu'il n'y paraît. Le hic, c'est le support d'exécution : une compilation de llama.cpp ou vLLM qui n'implémente pas les couches récurrentes indiquera une utilisation mémoire beaucoup plus élevée. Vérifiez quels environnements d'exécution ont intégré le support avant de supposer que les projections tiennent.

Quels GPU fonctionnent réellement

Concrètement, pour les cartes communes :

• RTX 4090 / 3090 / 5090 (24 Go) — Q4_K_M tourne confortablement, Q6_K si vous êtes prêt à serrer un peu. C'est le public visé.

• RTX 3060 / 4060 Ti 16 GB — uniquement des quantifications de niveau IQ4 ou Q3, avec un contexte modeste. Utilisable, mais pas agréable.

• Cartes de 12 Go — Q3_K_M en qualité réduite. Acceptable pour l'expérimentation, pas pour la mise en production.

• Apple Silicon — un Mac de 24 Go fait tourner les mêmes fichiers Q4 via MLX ou llama.cpp ; les modèles de base de 16 Go souffrent d'un échange incessant et sont de facto écartés, comme c'était le cas avec Qwen3.6-27B.

• 48 Go et plus (A6000, L40S, configurations à deux cartes) — inférence Q8_0 ou FP8 avec une vraie marge.

An infographic titled 'Context vs VRAM' comparing the same Q4 quant at 2K context (~11 GB) versus 32K context (~14 GB+), with a tip box advising to cap context at what you actually use.

Ou sautez complètement le GPU.

Si les chiffres du matériel ne vous conviennent pas, le modèle n'a pas à en dépendre. OrcaRouter est une API unique qui donne accès à plus de 200 modèles — y compris la famille Qwen — et elle répercute le prix catalogue du fournisseur sans aucune marge, de sorte que Qwen3.8-Max coûte actuellement 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, soit le même prix que sur la page tarifaire du fournisseur. Le modèle 27B lui-même sera un modèle local, mais lorsque ses poids seront publiés et qu'il aura gagné la confiance, la même clé redirigera vers le fournisseur qui l'héberge — vous pouvez dès maintenant développer en vous appuyant sur cette génération et ne jamais toucher au marché des revendeurs de GPU.

OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

En fin de compte pour la question du matériel : prévoyez 16 Go pour une exécution confortable en 4 bits, 24 Go pour être sûr et pour vous laisser de la marge pour le contexte et des quantifications supérieures, et considérez tous les chiffres ici comme provisoires jusqu'à ce que le dépôt soit publié et que les premières mesures réelles apparaissent. La projection de « 17 Go » est un chiffre de planification raisonnable — mais ce n'est pas encore un fait.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube