
Comment exécuter Qwen3.8-27B-Uncensored localement : GGUF Quants, llama.cpp et Ollama
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Pour exécuter Qwen3.8-27B-Uncensored localement, récupérez le dépôt GGUF restreint orcarouter/Qwen3.8-27B-Uncensored-GGUF depuis Hugging Face, choisissez une quantification selon votre VRAM — Q4_K_M (16,8 Go) pour un GPU de 24 Go, IQ4_XS (15,3 Go) pour un GPU de 16 Go, Q3_K_M (13,5 Go) si vous voulez de la marge de contexte — et servez-le avec une version récente de llama.cpp en utilisant l'option --jinja, en ajoutant --mmproj si vous avez besoin de la vision. Le même fichier s'importe dans Ollama en trois commandes. Il s'agit de la version GGUF de la build Qwen3.8 27B ablitérée, publiée le 16 août 2026, avec le contexte natif de 262K, le projecteur de vision et la tête de décodage spéculatif MTP préservés dans chaque quantification. C'est un outil de recherche, pas un assistant : son comportement de refus a été supprimé, il n'intègre aucune garde-fou, et la licence est Apache 2.0. Lisez la limite de sécurité en bas de cette page avant de télécharger — c'est tout l'intérêt du dépôt restreint.
Quel GGUF télécharger, selon la VRAM
Le dépôt fournit une paire en pleine précision et douze fichiers quantifiés, donc la décision de téléchargement relève vraiment de la VRAM. Les chiffres ci-dessous correspondent aux tailles de fichiers relevées sur le dépôt Hugging Face le 2026-08-16.

Que contient réellement le dépôt ?
orcarouter/Qwen3.8-27B-Uncensored-GGUF contient quinze fichiers de modèle : les poids F16 répartis en deux parties, douze GGUFs quantifiés — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M et IQ4_XS — et le projecteur de vision mmproj. Il s'agit de l'exportation GGUF de la même version abliterée que Qwen3.8-27B-Uncensored-FP8, reconditionné pour les environnements d'exécution locaux de la classe llama.cpp, et il hérite de la licence Apache 2.0 du modèle de base ainsi que de son contexte natif de 262 144 jetons.
Trois propriétés se retrouvent dans tous les quants. L'architecture est qwen35 — une attention hybride avec 48 couches linéaires Gated DeltaNet et 16 couches d'attention complète — c'est pourquoi le dépôt refuse de se charger dans les anciennes versions de llama.cpp et pourquoi le cache KV reste petit. La tête de décodage spéculatif MTP (nextn) est préservée dans tous les quants, K-quant comme IQ. Et le modèle de chat est le modèle Jinja de Qwen, que vous devez activer explicitement (voir ci-dessous) ou les conversations multi-tours échoueront.
Pourquoi le cache KV reste suffisamment petit pour compter
C'est ce détail qui fait fonctionner l'histoire locale. Sur les 64 couches, seules 16 utilisent l'attention complète ; les 48 autres utilisent l'attention linéaire Gated DeltaNet, qui ne conserve aucun cache KV conventionnel. L'effet pratique, mesuré sur le runbook d'origine pour cette architecture, est un cache KV d'environ 2 Go à 32K de contexte — environ un quart de ce dont un 27B conventionnel aurait besoin. C'est pourquoi un fichier Q4_K_M de 16,8 Go tient toujours sur une carte de 24 Go avec une fenêtre de contexte longue, et pourquoi la gamme GGUF non censurée est jouable sur du matériel qui ne pourrait pas du tout héberger le checkpoint BF16 de 55,6 Go.
Exécutez-le avec llama.cpp.
llama.cpp est la voie prévue. Vous avez besoin d'une version récente : le tronc enregistre l'architecture qwen35, et les versions plus anciennes refusent le fichier d'emblée. La forme de la commande, d'après les notes d'utilisation de la fiche du modèle et le runbook de cette architecture, est :

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Cela vous donne un endpoint compatible OpenAI sur localhost:8080. Pour l'entrée d'images, ajoutez --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Remplacez Q4_K_M par la quantification qui correspond à votre VRAM ; les options sont identiques.
Exécutez-le avec Ollama
Ollama exécute le même fichier en l'important depuis un Modelfile, ce qui est la méthode prise en charge pour ajouter un GGUF qui n'est pas dans la bibliothèque. Dans le répertoire contenant le quant que vous avez téléchargé :
FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Enregistrez cette ligne sous le nom de Modelfile, puis ollama create qwen3.8-27b-uncensored -f Modelfile et ollama run qwen3.8-27b-uncensored. Pour la vision, ajoutez la ligne mmproj au Modelfile (FROM ... Q4_K_M.gguf plus le chemin mmproj) et Ollama connecte le projecteur automatiquement. Les mêmes mises en garde concernant --ctx et le template s'appliquent : définissez la taille de contexte que vous pouvez réellement prendre en charge, et rappelez-vous qu'un modèle sans refus répond sans garde-fou entre vous et la sortie.
Ce que la suppression du refus a réellement changé
La fiche du modèle publie une suite d'évaluation de la sécurité pour cette version. Avec le raisonnement désactivé, le taux de refus sur les benchmarks standard de prompts nuisibles passe de 64–99 % sur le modèle de base à 0–6 % sur les poids abliterés ; avec le raisonnement activé, il ne refuse pratiquement jamais — 1,7 % ou moins. Les benchmarks de capacités restent à ±1,3 point de la base. C'est la forme de chaque version abliterée de cette lignée : refus supprimés, capacités intactes, et la réserve qu'une fraction non négligeable des réponses commence encore par un court avertissement avant de répondre — un artefact d'entraînement, pas un refus.
{{1}}Le revers de la médaille est précisément l'objet de la limite de sécurité ci-dessous : un modèle qui ne refuse jamais n'est pas un meilleur assistant, c'est un objet d'une nature différente. C'est un instrument de test pour mesurer les mécanismes de refus et pour vérifier si votre propre garde-fou fonctionne.{{/1}}
Qu'en faire concrètement dans la recherche
Trois projets légitimes qui représentent l'utilisation autorisée d'un modèle sans refus :
Quand cette version est la mauvaise réponse.
Si vous voulez un assistant normal, ou tout ce que vous placeriez devant des utilisateurs finaux, ce n'est pas le bon modèle — il n'a pas de garde-fous intégrés dignes de ce nom, il se conformera à des demandes que le modèle de base refuse, et Apache 2.0 ne transfère pas votre responsabilité. Utilisez le Qwen3.8-27B aligné d'origine pour cela. Si vous voulez contourner les refus d'un chatbot, un pack de prompt système obtient plus de résultats avec moins de risques qu'une modification de poids. Et si vous n'avez pas de GPU du tout mais que vous voulez quand même étudier le modèle, la carte hébergée obsidian/Qwen3.8-27B sur OrcaRouter propose la même lignée non censurée à 0,40 $ par million de jetons d'entrée et 4,21 $ par million de jetons de sortie, avec le même contexte de 262K; elle est réservée aux chercheurs en sécurité et en sûreté de l'IA au même titre que le dépôt, et la décision de modération reste de votre côté. La fiche du modèle contient les détails de prix et de référencement.
La limite de sécurité — lisez ceci avant de télécharger

Ce modèle a été largement dépouillé de son alignement de sécurité. Il répondra à des demandes nuisibles, contraires à l'éthique, offensantes ou illégales que le Qwen3.8-27B d'origine refuserait, et il ne dispose d'aucune garde-fou intégrée digne de ce nom. Il est publié strictement pour la recherche légitime — interprétabilité, étude de la sécurité de l'IA et des mécanismes de refus, red-teaming, évaluation de la robustesse et expériences contrôlées. Vous assumez l'entière responsabilité de son utilisation et de tout ce qu'il génère, et vous ne devez pas le déployer auprès d'utilisateurs finaux ni en production sans y ajouter vos propres couches de sécurité, de modération et de prévention des abus. Les auteurs déclinent toute responsabilité en cas d'utilisation abusive. Le téléchargement du référentiel implique l'acceptation de ces conditions ; la licence est Apache 2.0.
Cet article ne contient volontairement aucun prompt nuisible. Les chiffres de refus ci-dessus proviennent de la suite d'évaluation de la sécurité de la fiche modèle, ce qui est la bonne façon de mesurer un modèle de cette classe : exécutez les benchmarks de refus standard, lisez les chiffres, et concevez votre recherche en fonction de ce qu'ils montrent.
Sources et date
Tous les faits ci-dessus ont été vérifiés le 2026-08-16. La liste des fichiers et leurs tailles proviennent du dépôt Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (créé le 16 août 2026 ; architecture qwen35 ; Apache 2.0 ; accès restreint). Les chiffres de refus et de capacités proviennent de la suite d'évaluation de sécurité de la fiche du modèle. La mesure du cache KV (~2 Go pour un contexte de 32K) provient du runbook OrcaRouter pour cette architecture, How to Run Qwen 3.8 27B Locally. Les tarifs et le contrôle d'accès de l'hébergement proviennent de la page du modèle obsidian/Qwen3.8-27B, consultée le même jour. Les tailles des fichiers quantisés sont exprimées en Go décimaux, tels que stockés sur Hugging Face.
Pour une recherche légitime, les poids sont sur Hugging Face : Télécharger depuis Hugging Face — pas de carte bancaire, opérationnel en 60 secondes.
