Un bandeau titre affichant Qwen3.8-27B avec Unsloth, avec le sous-titre « Exécutez-le, quantifiez-le ou affinez-le localement », une icône de fenêtre de terminal, et des puces indiquant « UD-Q4_K_XL 17.9GB » et « Studio no-config ».
Guides & Insights

Qwen3.8-27B avec Unsloth : exécutez-le, quantifiez-le ou affinez-le localement

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Oui — Unsloth fait tourner Qwen3.8 27B, et c'est le moyen le plus rapide d'obtenir le nouveau modèle Apache-2.0 d'Ali​baba sur votre propre GPU. La réponse complète en une ligne : ouvrez Unsloth Studio, recherchez « Qwen3.8 27B », choisissez UD-Q4_K_XL (17,9 Go) sur une carte de 24 Go, et discutez en moins d'une minute. Derrière ce clic, Unsloth a livré trois choses la même semaine où les poids sont sortis (13–14 août 2026) : le pack unsloth/Qwen3.8-27B-GGUF construit sur la quantification Unsloth Dynamic V3.0 (aperçu), la prise en charge complète dans Unsloth Studio et Desktop, et la version v0.1.800-beta avec export GGUF, détection imatrix et améliorations d'ajustement VRAM. Il permet également le fine-tuning du modèle — Unsloth revendique un entraînement 2× plus rapide avec 70 % de VRAM en moins. Qwen3.8 27B est un modèle dense vision-langage de 27 milliards de paramètres dont l'attention hybride ne conserve que 16 des 64 couches en attention complète, c'est pourquoi un fichier 4 bits tient sur des cartes qui ne peuvent pas accueillir la plupart des modèles 27B.

En ce qui concerne les sources : les informations sur le modèle sont officielles, provenant de la fiche du modèle Qwen3.8 27B sur Hugging Face, vérifiées le 15 août 2026. Le support Unsloth, les tailles de quantification, les exigences en matière de VRAM et les commandes d'installation proviennent des notes de version et de la documentation d'Unsloth, le même jour. Le prix de l'API provient en direct du catalogue d'OrcaRouter, le même jour. Les affirmations d'Unsloth « 2× plus rapide, 70 % de VRAM en moins » et « de loin le modèle le plus puissant de sa taille » sont des déclarations du fournisseur, non reproduites de manière indépendante.

Ce que "Qwen3.8 + Unsloth" signifie : quatre choses différentes

Unsloth est quatre choses distinctes, et les résultats de recherche par mots-clés les mélangent. Savoir lequel vous avez besoin est la moitié de la configuration :

unsloth/Qwen3.8-27B-GGUF — les fichiers de poids quantifiés sur Hugging Face, 21 quants plus un projecteur de vision. Construit avec Dynamic V3.0 (aperçu), et non l’ancien Dynamic 2.0 (qui a été annoncé le 24 avril 2025 et précède ce modèle). C’est la voie « télécharger un fichier », utilisable depuis n’importe quelle version de llama.cpp.

Unsloth Studio — l'application web que vous installez ou lancez depuis un Hugging Face Space. Recherchez le hub de modèles, cliquez sur une version quantifiée, discutez avec des outils. Aucune configuration manuelle de template ou de paramètres d'inférence.

Unsloth Desktop — l'application GUI locale pour macOS, Windows et Linux qui regroupe Studio et l'entraînement. C'est ici que réside le fine-tuning « 2× plus rapide avec 70 % de VRAM en moins ».

La bibliothèque Python unsloth — from unsloth import FastLanguageModel, l'API de fine-tuning QLoRA utilisée dans les notebooks et scripts.

Les notes de version d'Unsloth pour v0.1.800-beta, intitulées « Release Qwen3.8 27B », indiquent que Qwen3.8 27B et le modèle Qwen3.8-2.4T-A95B à 2,4 T de paramètres « peuvent désormais être exécutés localement dans Unsloth », que le modèle 27B « fonctionne avec 17 Go de RAM via les GGUF dynamiques d'Unsloth » et que « vous pouvez également affiner Qwen3.8 27B dans Unsloth ». Cette même version ajoute les quants NVFP4, vérifie l'espace disque avant les exports GGUF, détecte la prise en charge réelle de l'imatrix GGUF dans Studio, et rend l'inférence jusqu'à 10 % plus rapide sur GGUF avec une limite de VRAM réglable.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Choisissez votre quant en fonction de la VRAM, pas des vibes.

Le tableau de mémoire d'Unsloth est en RAM totale plus VRAM (ou mémoire unifiée), et c'est la directive officielle. Un Qwen3.8 27B en 4 bits nécessite 17 à 19 Go ; une RTX 4090 24 Go, une RTX 5080 24 Go, ou un Mac à mémoire unifiée de 24 Go est le minimum réaliste pour une configuration 4 bits confortable. Les trois choix qui couvrent presque tout le monde :

12GB → UD-IQ2_XXS à 9.0GB — le seul fichier qui tient en entier ; attendez-vous à une perte de qualité visible. Faites ce choix en toute connaissance de cause.

16GB → UD-Q3_K_XL à 13.4GB — le meilleur fichier 3 bits, selon le propre sélecteur d'Unsloth.

24GB → UD-Q4_K_XL à 17.9GB — le fichier 4 bits recommandé et la réponse par défaut de cet article.

48–64GB → UD-Q8_K_XL à 31.5GB — quasi sans perte sur une station de travail ou une configuration à double GPU.

L'échelle complète, issue de la liste des fichiers unsloth/Qwen3.8-27B-GGUF et de la documentation d'Unsloth, toutes deux vérifiées le 15 août 2026 : UD-Q8_K_XL 31,5 Go, UD-Q6_K_XL 25,9 Go, UD-Q5_K_XL 20,2 Go, UD-Q4_K_XL 17,9 Go, UD-Q3_K_XL 13,4 Go, UD-Q2_K_XL 10,7 Go, UD-IQ3_XXS 11,9 Go, UD-IQ2_M 10,3 Go, UD-IQ2_XXS 9,0 Go. Les K-quants standard (Q4_K_M 17,1 Go, Q8_0 29,0 Go) y figurent aussi, et le pack inclut un projecteur de vision (mmproj-BF16, 931 Mo) pour que les images et les vidéos fonctionnent si vous le chargez. Unsloth appelle toute cette échelle « Dynamic V3.0 (preview) » — plus récente que la Dynamic 2.0 que vous verrez dans les anciens articles, laquelle avait été conçue pour des modèles sortis plus d'un an auparavant.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Exécutez-le avec Unsloth en trois minutes.

La méthode en un clic : sur macOS ou Linux, curl -fsSL https://unsloth.ai/install.sh | sh, puis unsloth studio -p 8888 et ouvrez http://127.0.0.1:8888. Sur Windows, irm https://unsloth.ai/install.ps1 | iex. Si vous voulez une installation nulle, le Studio d'Unsloth est également publié en tant qu'espace Hugging Face — ouvrez-le dans un navigateur, recherchez « Qwen3.8 27B », et choisissez une quantification selon la mémoire dont vous disposez. Le Studio règle automatiquement les paramètres d'échantillonnage et le modèle de chat, décharge vers la RAM lorsque la VRAM vient à manquer, et détecte les configurations multi-GPU — la partie « sans configuration » est réelle, et c'est le moyen le plus rapide d'exécuter le modèle de cette semaine.

La voie des fichiers d'abord, si vous utilisez déjà llama.cpp : téléchargez un quant et exécutez-le directement. Ce sont les commandes d'Unsloth, vérifiées par rapport à leur documentation :

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Ces valeurs d'échantillonnage sont les paramètres du mode de raisonnement recommandés par la carte de modèle. Remplacez le glob --include par *UD-Q3_K_XL* sur une carte de 16 Go, et ajoutez --mmproj pointant vers le mmproj-BF16.gguf du pack si vous avez besoin de la vision. Un piège : llama.cpp doit être une version récente — le fichier enregistre la nouvelle architecture qwen35, et toute version antérieure à la semaine de sortie refuse de le charger.

Affinez-le avec Unsloth

C'est dans le fine-tuning qu'Unsloth gagne sa réputation : la bibliothèque revendique un entraînement 2× plus rapide avec 70 % de VRAM en moins par rapport aux Transformers + PEFT de base, ce qui rend le QLoRA sur un 27B réalisable sur une seule carte graphique grand public. Le point d'entrée du fine-tuning est le dépôt standard unsloth/Qwen3.8-27B (page de fichiers safetensors, 28B) plutôt que le pack GGUF. Le schéma QLoRA standard d'Unsloth, appliqué à ce modèle :

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

Ensuite, une boucle standard `trl.SFTTrainer` sur votre jeu de données. Cet extrait est le motif QLoRA standard tiré de la documentation d'Unsloth — les affirmations de benchmark d'entraînement sont celles d'Unsloth et non quelque chose que j'ai reproduit — et deux mises en garde s'appliquent : les kernels d'Unsloth patchtent les couches du transformateur de texte, donc prévoyez de traiter l'encodeur de vision séparément, et gardez le paquet `unsloth` à la version actuelle, car cette architecture ne date que de quelques jours et les écarts de version échouent bruyamment.

Ce qu'Unsloth Studio gère pour vous

Exécuter un GGUF à la main, c’est jouer les funambules entre taille de contexte, déchargement RAM et appel d’outils. Studio réduit tout cela à des réglages par défaut : il dimensionne le contexte en fonction de la mémoire réellement libre, décharge les modèles de vision inactifs pour libérer de la VRAM pour le chat ou l’entraînement, détecte les configurations multi-GPU, et branche la recherche web, l’exécution de code et les connexions d’agents (Claude Code, Codex, MCP) sans aucune configuration. La version v0.1.800-beta a aussi resserré les points qui posaient problème en pratique : les exports GGUF vérifient désormais l’espace disque avant de lancer une fusion longue au lieu d’échouer en cours de route, Studio détecte si le GGUF qu’il exporte prend réellement en charge imatrix (pour ne pas gaspiller une exécution), et les garde-fous mémoire ne sur-réservent plus la mémoire GPU. Pour un modèle vieux de trois jours, « no-config » fait un vrai travail.

Gratuit en local vs API payante : l’analyse économique honnête

La différence fondamentale entre Unsloth et une API ne tient pas à la qualité — mais à qui possède le matériel. Unsloth est la voie gratuite : coût marginal nul par jeton, rien ne quitte votre machine, aucune limite de débit et un contrôle total des poids. Ce n'est pas gratuit en termes absolus : vous fournissez le GPU et l'électricité, et un fichier 2 bits sur une carte de 12 Go est une expérience compromise. Qwen3.8 27B est dense et doté de capacités de vision, donc le 4 bits représente 17,9 Go de poids avant le contexte ; la machine est le prix d'entrée.

La route API existe parce que les poids sont sous licence Apache-2.0, donc n'importe qui peut les héberger à un coût marginal quasi nul. Qwen3.8 27B figure aujourd'hui dans le catalogue d'OrcaRouter à 0,33 $ par million de jetons en entrée et 2,40 $ par million en sortie, le modèle étant auto-hébergé sur notre propre infrastructure — aucun prix fournisseur à répercuter — avec une fenêtre de contexte de 262 000 jetons et une entrée texte, image et vidéo. Parce que les poids sont ouverts, il existe aussi un niveau gratuit avec limitation de débit qui facture 0 $ par requête. Un mois représentatif de 10 millions de jetons avec une part d'entrée de 70 % revient à environ 9,51 $ sur le niveau payant. Si vous possédez déjà une carte de 24 Go, le local l'emporte sur le plan du coût ; si ce n'est pas le cas, louer des jetons à ce tarif vaut mieux que d'acheter une carte pour un projet secondaire, et le niveau gratuit est le moyen honnête de tester le modèle avant de vous engager dans un quelconque matériel.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Quand Unsloth est la mauvaise réponse

Unsloth Studio et le pack GGUF sont le bon choix pour une seule machine. Ils sont le mauvais choix lorsque :

Vous possédez une carte Blackwell RTX série 50. Les quants unsloth/Qwen3.8-27B-NVFP4 sont environ 1,5× plus rapides que le BF16 dans la même VRAM et utilisent un cache KV FP8 pour un contexte plus long. Cette voie passe par vLLM ou SGLang, pas par un GGUF ni par Studio.

Vous avez besoin de la fenêtre native complète de 262K ou de l'extension YaRN 1M en production. Un modèle de vision dense avec un long contexte est lourd ; le dimensionnement du contexte d'Unsloth se fera un plaisir d'exécuter des contextes plus courts pour vous, mais une pile de service avec une gestion appropriée des KV bat une application locale.

Vous servez de nombreux utilisateurs. Unsloth est une application locale et une bibliothèque de fine-tuning, pas un serveur multi-tenant. Pour la concurrence, la mise à l’échelle automatique et les garanties de disponibilité, vous avez besoin d’un endpoint hébergé.

Vous n'avez pas de GPU du tout. Une réponse honnête : un 27B en 2 bits sur une carte de 12 Go est nettement moins bon que le même modèle servi correctement. Utilisez d'abord l'API gratuite ; si cela suffit, achetez du matériel une fois le cas d'usage prouvé.

Vous voulez affiner le côté vision. Les accélérations d'Unsloth ciblent les couches du transformateur de texte ; un réglage fin multimodal complet nécessite une pile différente.

En résumé

Qwen3.8 27B avec Unsloth est un problème résolu depuis cette semaine : installez Studio, choisissez UD-Q4_K_XL pour une carte de 24 Go (UD-Q3_K_XL pour 16 Go, UD-IQ2_XXS pour 12 Go), et le modèle tourne sans configuration ni facturation par jeton. La voie du fine-tuning est bien réelle, et les promesses de vitesse d'Unsloth expliquent pourquoi le QLoRA 27B est pratique sur une seule carte. Sachez que l'échelle de quantification est Dynamic V3.0 (préversion), et non la Dynamic 2.0 décrite par les articles plus anciens ; gardez llama.cpp à jour ; et si vous ne possédez pas le matériel, les mêmes poids sont disponibles via une API à $0.33/$2.40 avec un palier gratuit à débit limité — il n'y a donc aucune raison d'exécuter un fichier 2 bits qui ne vous satisfait pas. Le local est la voie gratuite, et pour la première fois dans cette catégorie de poids, c'est aussi la voie facile.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube