Carte titre hero pour l'article « Qwen 3.8 27B Uncensored GGUF » : une carte de recherche arrondie avec le titre « Qwen3.8-27B Uncensored GGUF », le sous-titre « Build local abliterated pour llama.cpp », des badges affichant « 12 QUANT TIERS », « 262K CONTEXT », « VISION + MTP », et une icône de bouclier avec le label RECHERCHE UNIQUEMENT. Logo OrcaRouter incrusté en bas à droite.
Guides & Insights

Qwen 3.8 27B Uncensored GGUF : la version locale abliterée, 12 quants, et la limite de recherche uniquement

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Qwen 3.8 27B uncensored GGUF est un véritable téléchargement, et la version à utiliser pour commencer est Qwen3.8-27B-Uncensored-GGUF — publié sur Hugging Face le 16 août 2026 en tant que version sœur native llama.cpp de notre version FP8 abliterated. Il s'agit des mêmes poids de 27 milliards de paramètres, sans refus, que Qwen3.8-27B-Uncensored-FP8, convertis en GGUF pour une inférence locale : F16 plus 12 niveaux de quantification de Q2_K à Q8_0 (y compris les quants imatrix IQ3_M et IQ4_XS), la fenêtre de contexte de 262K, un projecteur visuel séparé et la tête de décodage spéculatif MTP intacte. « Uncensored » signifie abliterated — la direction du refus a été orthogonalisée hors des poids — de sorte qu'il répondra là où la base alignée refuse, et c'est exactement pourquoi il est réservé à la recherche. Voici ce que contient réellement le dépôt, quelle quantification convient à votre GPU, comment l'exécuter dans llama.cpp, et la limite de sécurité que vous acceptez en le téléchargeant.

La version en 30 secondes : F16 plus 12 quants, Q4_K_M à 16,8 Go est le choix par défaut, vous avez besoin d'une version de llama.cpp datant de mai 2026 ou plus récente, et c'est un outil de recherche sans garde-fous — pas quelque chose à déployer auprès des utilisateurs finaux.

Ce que « GGUF non censuré » signifie réellement — et en quoi cette version diffère de la version FP8

GGUF est le format de modèle à fichier unique utilisé par llama.cpp ; FP8 est un schéma de quantification qui s'exécute sur les serveurs GPU vLLM. Nos deux versions non censurées sont les mêmes poids ablatés dans deux runtimes. Qwen3.8-27B-Uncensored-FP8 (15 août 2026) cible vLLM sur un serveur, re-quantifié selon le schéma officiel Qwen3.8-27B-FP8 afin d'être servi sur le même chemin de noyau. Qwen3.8-27B-Uncensored-GGUF (16 août 2026) cible llama.cpp sur une machine locale — le GPU de bureau ou la station de travail que vous contrôlez. Mêmes poids, modèle de déploiement différent : API cloud vs processus local.

Abliteration est une intervention au niveau des poids, pas un fine-tuning. La direction de refus est un vecteur dans le flux résiduel du modèle qui, lorsqu'elle est activée, produit « Je ne peux pas vous aider avec ça » ; le build trouve cette direction et l'orthogonalise hors des poids, suivant l'approche d'Arditi et al. 2024 (« Refusal in Language Models Is Mediated by a Single Direction »). Aucun nouveau poids n'est entraîné. La base est Qwen/Qwen3.8-27B — un modèle dense de 27B avec une architecture hybride (48 couches d'attention linéaire Gated DeltaNet et 16 couches d'attention complète), vision native et un contexte de 262 144 jetons. La licence est Apache 2.0, héritée de la base. À noter que le dépôt officiel de Qwen ne fournit que des safetensors BF16 — il n'existe aucun GGUF officiel de Qwen — donc tout GGUF non censuré de ce modèle, y compris celui-ci, est une conversion des poids ouverts.

L'échelle quant — F16 plus 12 paliers

Le dépôt fournit F16 (54,6 Go répartis sur deux fichiers) et 12 niveaux de quantification. Les tailles ci-dessous sont les tailles de fichiers propres au dépôt, lues le 16 août 2026 ; les tailles de fichiers GGUF varient légèrement d'une compilation à l'autre.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54.6 Go (2 fichiers) — précision de référence

Q8_0 — 29,0 Go — quasi sans perte, pour GPU haut de gamme

Q6_K — 22.4 GB — le juste équilibre qualité/gigaoctet

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — haute qualité sur les cartes plus grandes

Q4_K_M — 16.8 GB — la valeur par défaut recommandée

Q4_K_S — 15.8 Go

IQ4_XS — 15.3 GB — le meilleur choix low-bit (calibré imatrix)

Q3_K_L — 14,6 Go / Q3_K_M — 13,5 Go — pour cartes de 16 Go

IQ3_M — 12,8 Go — empreinte réduite (calibré imatrix)

Q3_K_S — 12,3 Go

Q2_K — 10,9 Go — le plus petit K-quant, un compromis visible sur la qualité

Recommandations matérielles : Q4_K_M sur une carte de 24 Go (RTX 4090 ou RTX 3090) ; IQ4_XS ou Q3_K_M si vous êtes sur 16 Go ; Q2_K uniquement si vous êtes serré à 12 Go. Comme la base utilise une attention hybride Gated DeltaNet, le cache KV est petit — environ 0,5 Go à 8K de contexte — vous pouvez donc pousser la fenêtre bien plus haut qu'avec un modèle dense conventionnel de 27B. La vision ajoute un fichier séparé : le projecteur F16 fait 931 Mo. Une série communautaire abliterated en 9 quants existe aussi pour la même base ; la nôtre est la conversion de l'abliteration FP8 documentée, avec les quants imatrix et les chiffres refusal-delta de la fiche du modèle repris.

Comment l'exécuter dans llama.cpp

Trois étapes. Une exigence non évidente : l'architecture qwen35 et la prise en charge de MTP ont été intégrées à llama.cpp en mai 2026, donc mettez à jour vers une version de 2026-05 ou plus récente — les versions plus anciennes ne chargeront pas ces fichiers (selon le README du dépôt).

1. Téléchargez le quant que vous avez choisi ainsi que le projecteur de vision.Le dépôt est à accès restreint, donc vous devez d'abord vous connecter à Hugging Face et accepter les conditions — lire le README fait partie de l'acceptation de ce qu'est ce modèle.

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. Démarrez llama-server. Cela sert un point de terminaison compatible OpenAI ; -ngl 99/ décharge toutes les couches sur le GPU.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (Facultatif) activer la tête de décodage spéculatif MTP. Ajouter --spec-type draft-mtp/ — la tête nextn est intégrée dans chaque quant, donc aucun modèle de draft séparé n'est nécessaire.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

Les exécutions de recherche en texte seul peuvent omettre --mmproj/; l'entrée d'image en a besoin, car il s'agit d'un modèle natif de vision-langage. Le point de terminaison est http://localhost:8080/v1/chat/completions, donc le code SDK OpenAI existant fonctionne en changeant simplement l'URL de base.

Pas de GPU ? La même ligne non censurée est hébergée.

Local GGUF ne coûte rien par jeton, mais nécessite environ 17 Go de VRAM pour le niveau Q4_K_M. Si vous ne possédez pas le matériel, la carte hébergée obsidian/Qwen3.8-27B sur OrcaRouter sert la même gamme non censurée de 27B — vision, raisonnement, contexte de 262K — à 0,40 $ par million de jetons en entrée et 4,21 $ par million en sortie, avec un accès réservé aux chercheurs en sécurité, aux red teams et aux chercheurs en sûreté de l'IA. Même famille de poids, deux environnements d'exécution : GGUF en local, FP8 dans le cloud. La décision de modération reste de votre côté dans les deux cas.

La limite de sécurité — lisez ceci avant de télécharger

Ce modèle a vu son alignement sécurité largement retiré. Il se conformera aux demandes nuisibles, contraires à l'éthique, offensantes ou illégales que le Qwen3.8-27B de base refuserait, et il ne dispose d'aucun garde-fou intégré digne de ce nom. Il est publié strictement à des fins de recherche légitime — interprétabilité, étude des mécanismes de refus, red-teaming, évaluation de la robustesse et test des garde-fous. Vous assumez l'entière responsabilité, juridique et morale, de votre utilisation et de tout ce qu'il génère, et vous ne devez pas le déployer auprès d'utilisateurs finaux ni en production sans ajouter vos propres couches de sécurité, de modération et de prévention des abus. Les auteurs déclinent toute responsabilité. La licence est Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

Le comportement mesuré vous indique ce que coûte « uncensored ». D'après la suite d'évaluations de sécurité de la fiche du modèle — exécutée sur la version FP8 et datée du 15 août 2026, laquelle correspond aux poids que ce GGUF convertit : le taux de refus des invites nuisibles chute de 64–99 % sur le modèle de base à 0–6 % sur les poids abliterés, le refus excessif des invites bénignes passe de 5,6 % à 0,4 %, et les scores de capacité restent à ±1,3 point de ceux du modèle de base. Ces chiffres expliquent pourquoi cette classe de modèles constitue un objet de recherche légitime — et ils sont aussi l'avertissement.

Cet article ne contient délibérément aucun prompt nuisible. Si vous évaluez le modèle, exécutez les benchmarks de refus standard — AdvBench, HarmBench, StrongREJECT, XSTest-safe — et lisez les chiffres vous-même. C'est la manière officielle d'étudier un modèle dont le refus a été retiré.

Quand cette version est la mauvaise réponse.

1. Vous voulez un assistant normal. Mauvais modèle. Il n'a pas de garde-fous et se conformera aux demandes nuisibles. Utilisez plutôt le Qwen3.8-27B aligné.

2. Tout ce que vous mettriez devant les utilisateurs finaux. Mauvais modèle, quelle que soit l'intention. Apache 2.0 ne transfère pas votre responsabilité, et livrer un modèle sans garde-fous aux utilisateurs n'est pas une stratégie de déploiement.

3. Vous êtes sur Apple Silicon. Le GGUF fonctionnera, mais la conversion MLX du modèle de base est plus adaptée — voir notre guide MLX séparé.

4. Vous ne voulez pas du tout l'exécuter. Utilisez la carte hébergée — mêmes poids, pas de 17 Go de VRAM, et la même restriction à la recherche.

En résumé

« Qwen 3.8 27B uncensored GGUF » a une réponse, et c'est un téléchargement concret : Qwen3.8-27B-Uncensored-GGUF — F16 plus 12 paliers de quantification pour llama.cpp, les poids abliterés de notre build FP8, contexte 262K, vision et MTP, sous Apache 2.0 et réservé à la recherche. Choisissez Q4_K_M sur une carte de 24 Go, mettez à jour llama.cpp après mai 2026 et lancez-le comme serveur local compatible OpenAI. C'est un instrument de recherche pour étudier les refus et tester les garde-fous — pas un chatbot, et pas quelque chose à mettre en production. Les poids sont gratuits ; la responsabilité de ce que vous en faites vous incombe entièrement.

Pour une recherche légitime, le F16 et les 12 paliers de quantification sont disponibles sur Hugging Face : Télécharger le GGUF depuis Hugging Face

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube