
Qwen 3.8 27B Uncensored GGUF: de Abliterated lokale build, 12 quants, en de onderzoeksbeperking
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
Qwen 3.8 27B uncensored GGUF is een echte download, en de build om mee te beginnen is Qwen3.8-27B-Uncensored-GGUF — gepubliceerd op Hugging Face op 16 augustus 2026 als de llama.cpp-native tegenhanger van onze abliterated FP8-release. Het betreft dezelfde weigering-verwijderde 27-miljard-parametergewichten als Qwen3.8-27B-Uncensored-FP8, geconverteerd naar GGUF voor lokale inferentie: F16 plus 12 kwantisatieniveaus van Q2_K tot Q8_0 (inclusief de imatrix-quants IQ3_M en IQ4_XS), het 262K-contextvenster, een aparte vision-projector en de intacte MTP-speculatieve-decoderingkop. "Uncensored" betekent abliterated — de weigeringsrichting is uit de gewichten georthogonaliseerd — dus het zal antwoorden waar de gealigneerde basis weigert, en dat is precies waarom het uitsluitend voor onderzoek is. Hier is wat de repo daadwerkelijk bevat, welke quant op je GPU past, hoe je het in llama.cpp draait, en de veiligheidsgrens die je accepteert door het te downloaden.
De 30-secondenversie: F16 plus 12 quants, Q4_K_M van 16,8 GB is de standaardkeuze, je hebt een llama.cpp-build van mei 2026 of nieuwer nodig, en dit is een onderzoekstool zonder guardrails — niet iets om aan eindgebruikers uit te rollen.
Wat "uncensored GGUF" daadwerkelijk betekent — en hoe deze build verschilt van de FP8-versie
GGUF is het modelformaat in één bestand dat llama.cpp gebruikt; FP8 is een kwantisatieschema dat op vLLM-GPU-servers draait. Onze twee ongecensureerde releases zijn dezelfde abliterated gewichten in twee runtimes. Qwen3.8-27B-Uncensored-FP8 (15 augustus 2026) is bedoeld voor vLLM op een server, opnieuw gekwantiseerd volgens het officiële Qwen3.8-27B-FP8-schema, zodat het via hetzelfde kernelpad draait. Qwen3.8-27B-Uncensored-GGUF (16 augustus 2026) is bedoeld voor llama.cpp op een lokale machine — de desktop-GPU of workstation die jij beheert. Zelfde gewichten, ander implementatiemodel: cloud-API versus lokaal proces.
Abliteration is een interventie op gewichtsniveau, geen fine-tuning. De weigeringsrichting is een vector in de residustroom van het model die, wanneer geactiveerd, "I can't help with that" produceert; de build vindt die richting en orthogonaliseert deze uit de gewichten, volgens de aanpak van Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). Er worden geen nieuwe gewichten getraind. De basis is Qwen/Qwen3.8-27B — een dense 27B-model met een hybride architectuur (48 Gated DeltaNet linear-attention-lagen en 16 volledige attention-lagen), native vision en een context van 262.144 tokens. De licentie is Apache 2.0, overgenomen van de basis. Let op: de officiële Qwen-repository levert alleen BF16-safetensors — er is geen officiële Qwen-GGUF — dus elke ongecensureerde GGUF van dit model, inclusief deze, is een conversie van de open gewichten.
De quant-ladder — F16 plus 12 treden
De repo bevat F16 (54,6 GB verdeeld over twee bestanden) en 12 kwantiseringsniveaus. De onderstaande groottes zijn de eigen bestandsgroottes van de repo, gelezen op 16 augustus 2026; GGUF-bestandsgroottes variëren enigszins van build tot build.

• F16 — 54.6 GB (2 bestanden) — referentieprecisie
• Q8_0 — 29.0 GB — bijna verliesvrij, voor high-end GPU's
• Q6_K — 22.4 GB — de sweet spot voor kwaliteit per gigabyte
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — hoge kwaliteit op grotere kaarten
• Q4_K_M — 16.8 GB — de aanbevolen standaard
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — de beste low-bit keuze (imatrix-gekalibreerd)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — voor 16 GB-kaarten
• IQ3_M — 12.8 GB — kleine footprint (imatrix-gekalibreerd)
• Q3_K_S — 12,3 GB
• Q2_K — 10.9 GB — de kleinste K-quant, een zichtbaar kwaliteitscompromis
Hardware-richtlijnen: Q4_K_M op een 24 GB-kaart (RTX 4090 of RTX 3090); IQ4_XS of Q3_K_M als je 16 GB hebt; Q2_K alleen als je je tot 12 GB moet beperken. Omdat de basis gebruikmaakt van hybride Gated DeltaNet-attentie, is de KV-cache klein — ongeveer 0,5 GB bij 8K-context — dus kun je het venster veel verder oprekken dan bij een conventioneel dicht 27B-model. De visiecomponent voegt één apart bestand toe: de F16-projector is 931 MB. Er bestaat ook een door de community ge-abliteerde serie met 9 quants voor dezelfde basis; de onze is de conversie van de gedocumenteerde FP8-abliteratie, met de imatrix-quants en de refusal-delta-getallen van de modelkaart overgenomen.
Hoe voer je het uit in llama.cpp
Drie stappen. Eén niet voor de hand liggende vereiste: de qwen35-architectuur en MTP-ondersteuning werden in mei 2026 in llama.cpp opgenomen, dus update naar een build van 2026-05 of nieuwer — oudere builds zullen deze bestanden niet laden (volgens de repo-README).
1. Download de quant die je hebt gekozen plus de vision-projector.De repo is afgeschermd, dus je logt in op Hugging Face en accepteert eerst de voorwaarden — het lezen van de README is onderdeel van het accepteren van wat dit model is.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. Start llama-server. Dit biedt een OpenAI-compatibel eindpunt aan; -ngl 99/ verplaatst elke laag naar de GPU.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (Optioneel) schakel de MTP-speculatieve-decoderingkop in. Voeg --spec-type draft-mtp/ toe — de nextn-kop is in elke quant ingebed, dus er is geen apart draftmodel nodig.

Onderzoeksruns die alleen tekst gebruiken, kunnen --mmproj/ weglaten; beeldinvoer heeft dit nodig, omdat dit een native vision-language-model is. Het endpoint is http://localhost:8080/v1/chat/completions, dus bestaande OpenAI SDK-code werkt door alleen de base-URL te vervangen.
Geen GPU? Dezelfde ongecensureerde lijn is gehost.
Lokale GGUF kost niets per token, maar heeft ongeveer 17 GB VRAM nodig voor het Q4_K_M-niveau. Als je de hardware niet bezit, serveert de gehoste kaart obsidian/Qwen3.8-27B op OrcaRouter dezelfde ongecensureerde 27B-lijn — visie, redeneren, 262K-context — voor $0,40 per miljoen invoertokens en $4,21 per miljoen uitvoertokens, met toegang voorbehouden aan beveiligingsonderzoekers, red teams en AI-veiligheidsonderzoekers. Dezelfde familie van gewichten, twee runtimes: GGUF lokaal, FP8 in de cloud. De moderatiebeslissing blijft in beide gevallen aan jouw kant.
De veiligheidsgrens — lees dit voordat je downloadt
De safety alignment van dit model is {{1}}aanzienlijk verwijderd{{/1}}. Het zal voldoen aan {{2}}schadelijke, onethische, aanstootgevende of illegale{{/2}} verzoeken die het basismodel Qwen3.8-27B zou {{3}}weigeren{{/3}}, en het heeft geen {{4}}zinvolle ingebouwde guardrails{{/4}}. Het wordt uitsluitend vrijgegeven voor {{5}}legitiem onderzoek{{/5}} — {{6}}interpreteerbaarheid, onderzoek naar weigeringsmechanismen, red-teaming, robuustheidsevaluatie en guardrail-testing{{/6}}. U aanvaardt de {{7}}volledige verantwoordelijkheid en aansprakelijkheid{{/7}} voor hoe u het gebruikt en voor alles wat het genereert, en u mag het niet {{8}}naar eindgebruikers uitrollen of in productie nemen{{/8}} zonder {{9}}uw eigen veiligheids-, moderatie- en misbruikpreventielagen{{/9}} toe te voegen. De auteurs aanvaarden {{10}}geen enkele aansprakelijkheid{{/10}}. De licentie is {{11}}Apache 2.0{{/11}}.

{{1}}Het gemeten gedrag vertelt je wat "ongecensureerd" kost. Uit de veiligheidsevaluatiesuite van de modelkaart — uitgevoerd op de FP8-build en gedateerd 15 augustus 2026, wat de gewichten zijn die deze GGUF converteert: schadelijke-promptweigering daalt van 64–99% op de basis naar 0–6% op de geablateerde gewichten, onschuldige overmatige weigering daalt van 5,6% naar 0,4%, en capaciteitsscores blijven binnen ±1,3 punten van de basis. Die cijfers zijn de reden waarom dit type model een legitiem onderzoeksobject is — en ze zijn ook de waarschuwing.{{/1}}
Dit artikel bevat bewust geen schadelijke prompts. Als u het model evalueert, voer dan de standaard weigeringsbenchmarks uit — AdvBench, HarmBench, StrongREJECT, XSTest-safe — en lees de cijfers zelf. Dat is de geëigende manier om een weigeringsvrij model te bestuderen.
Wanneer deze build het verkeerde antwoord is
1. Je wilt een normale assistent.Verkeerd model. Het heeft geen guardrails en zal schadelijke verzoeken inwilligen. Gebruik in plaats daarvan het afgestemde Qwen3.8-27B.
2. Alles wat u voor eindgebruikers zou plaatsen. Verkeerd model, ongeacht de intentie. Apache 2.0 draagt uw aansprakelijkheid niet over, en het leveren van een model zonder beveiligingsmaatregelen aan gebruikers is geen implementatiestrategie.
3. Je gebruikt Apple Silicon.De GGUF zal draaien, maar de MLX-conversie van het basismodel is de natuurlijkere keuze — zie onze aparte MLX-gids.
4. Je wilt het helemaal niet draaien. Gebruik de gehoste kaart — dezelfde gewichten, geen 17 GB VRAM, en dezelfde beperking tot onderzoek.
Kortom
"Qwen 3.8 27B uncensored GGUF" heeft een antwoord, en het is een concrete download: Qwen3.8-27B-Uncensored-GGUF — F16 plus 12 kwantiseringsniveaus voor llama.cpp, de abliterated gewichten van onze FP8-build, 262K context, vision en MTP, onder Apache 2.0 en uitsluitend voor onderzoek. Kies Q4_K_M op een 24 GB-kaart, update llama.cpp naar een versie van na mei 2026, en draai het als een lokale OpenAI-compatibele server. Het is een onderzoeksinstrument voor het bestuderen van weigeringen en het testen van guardrails — geen chatbot, en niets om uit te brengen. De gewichten zijn gratis; de verantwoordelijkheid voor wat je ermee doet ligt geheel bij jou.
Voor legitiem onderzoek zijn de F16 en alle 12 quant-tiers te vinden op Hugging Face: Download de GGUF van Hugging Face
