
Hoe Qwen3.8-27B-Uncensored lokaal uit te voeren: GGUF Quants, llama.cpp en Ollama
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
Om Qwen3.8-27B-Uncensored lokaal te draaien, haal je de gated GGUF-repo orcarouter/Qwen3.8-27B-Uncensored-GGUF op van Hugging Face, kies een quant op basis van je VRAM — Q4_K_M (16,8 GB) voor een 24 GB GPU, IQ4_XS (15,3 GB) voor een 16 GB GPU, Q3_K_M (13,5 GB) voor meer contextruimte — en serveer het met een actuele llama.cpp-build met de --jinja-vlag; voeg --mmproj toe als je vision nodig hebt.Dezelfde file importeer je in Ollama met drie commando's. Dit is de GGUF-versie van de abliterated Qwen3.8 27B-build, uitgebracht op 16 augustus 2026, waarbij de native 262K-context, de vision-projector en de MTP-kop voor speculatieve decodering in elke quant behouden zijn. Het is een onderzoekstool, geen assistent: het weigeringsgedrag is verwijderd, het bevat geen ingebouwde guardrails, en de licentie is Apache 2.0. Lees de veiligheidsgrens onderaan deze pagina voordat je downloadt — dat is het doel van de gated repo.
Welke GGUF downloaden, op basis van VRAM
De repository wordt geleverd met één full-precision-paar en twaalf gekwantiseerde bestanden, dus de downloadkeuze is eigenlijk een VRAM-keuze. De onderstaande getallen zijn de bestandsgroottes zoals uitgelezen uit de Hugging Face-repository op 16-08-2026.

Wat zit er eigenlijk in de repo?
orcarouter/Qwen3.8-27B-Uncensored-GGUF bevat vijftien modelbestanden: de F16-gewichten opgesplitst in twee delen, twaalf gekwantiseerde GGUF's — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M en IQ4_XS — en de mmproj vision-projector. Het is de GGUF-export van dezelfde abliterated build als Qwen3.8-27B-Uncensored-FP8, opnieuw verpakt voor lokale runtimes van de llama.cpp-klasse, en het erft de Apache 2.0-licentie van het basismodel en de native context van 262.144 tokens.
Drie eigenschappen gelden voor elke quant. De architectuur is qwen35 — hybride aandacht met 48 Gated DeltaNet lineaire lagen en 16 volledige aandachtslagen — en daarom weigert de repo te laden in oudere llama.cpp-builds en blijft de KV-cache klein. De MTP (nextn) speculatieve decodeerkop wordt behouden in alle quants, zowel K-quant als IQ. En de chattemplate is de Qwen Jinja-template, die je expliciet moet inschakelen (zie hieronder), anders werken gesprekken met meerdere beurten niet.
Waarom de KV-cache klein genoeg blijft om relevant te zijn
Dit is het detail waardoor het lokale verhaal werkt. Van de 64 lagen gebruiken er slechts 16 volledige aandacht; de andere 48 gebruiken Gated DeltaNet-lineaire aandacht, die geen conventionele KV-cache bijhoudt. Het praktische effect, gemeten op het oorspronkelijke runbook voor deze architectuur, is een KV-cache van ongeveer 2 GB bij een context van 32K — ongeveer een kwart van wat een conventionele 27B nodig zou hebben. Daarom past een Q4_K_M-bestand van 16,8 GB nog steeds op een kaart van 24 GB met een lang contextvenster, en waarom de ongecensureerde GGUF-lijn speelbaar is op hardware die de BF16-checkpoint van 55,6 GB helemaal niet kon hosten.
Voer het uit met llama.cpp
llama.cpp is het beoogde pad. Je hebt een actuele build nodig: de trunk registreert de qwen35-architectuur en oudere builds weigeren het bestand botweg. De vorm van het commando, volgens de gebruiksnotities van de modelkaart en het runbook van deze architectuur, is:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Dat geeft je een OpenAI-compatibel endpoint op localhost:8080. Voeg voor beeldinvoer --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf toe. Vervang Q4_K_M door de quant die bij je VRAM past; de vlaggen zijn identiek.
Voer het uit met Ollama
Ollama draait hetzelfde bestand door het te importeren vanuit een Modelfile, de ondersteunde manier om een GGUF toe te voegen die niet in de bibliotheek staat. In de map met de quant die je hebt gedownload:
FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Sla die regel op als Modelfile, dan ollama create qwen3.8-27b-uncensored -f Modelfile en ollama run qwen3.8-27b-uncensored. Voor vision, voeg de mmproj-regel toe aan de Modelfile (FROM ... Q4_K_M.gguf plus mmproj-pad) en Ollama verbindt de projector. Dezelfde --ctx- en template-kanttekeningen zijn van toepassing: stel de contextgrootte in die je daadwerkelijk kunt gebruiken, en onthoud dat een model waaruit weigeringen zijn verwijderd antwoordt zonder beveiligingsmechanisme tussen jou en de output.
Wat het verwijderen van de weigering daadwerkelijk veranderde
De modelkaart publiceert een veiligheidsevaluatiesuite voor deze build. Met denken uitgeschakeld daalt de weigering op de standaard benchmarks voor schadelijke prompts van 64–99% op het basismodel naar 0–6% op de ge-ablitereerde gewichten; met denken ingeschakeld weigert het in wezen nooit — 1,7% of minder. Capability-benchmarks blijven binnen ±1,3 punten van het basismodel. Dat is het patroon van elke ge-ablitereerde release in deze lijn: weigeringen verwijderd, capaciteiten intact, en de kanttekening dat een flink deel van de antwoorden nog steeds begint met een korte disclaimer — een trainingsartefact, geen weigering.
De keerzijde is precies het doel van de onderstaande veiligheidsgrens: een model dat nooit weigert is geen betere assistent, het is een ander soort object. Het is een testinstrument om weigeringsmechanismen te meten en om te ontdekken of je eigen beveiliging werkt.
Wat je er in onderzoek daadwerkelijk mee kunt doen
Drie legitieme projecten die het toegestane gebruik van een model zonder weigeringen zijn:
Wanneer deze build het verkeerde antwoord is
Als je een normale assistent wilt, of iets wat je voor eindgebruikers zou plaatsen, is dit het verkeerde model — het heeft geen noemenswaardige ingebouwde waarborgen, het zal voldoen aan verzoeken die het basismodel weigert, en Apache 2.0 draagt je aansprakelijkheid niet over. Gebruik daarvoor de originele afgestemde Qwen3.8-27B. Als je weigeringen op een chatbot wilt ombuigen, bereikt een system-prompt-pakket meer met minder risico dan een gewichtsaanpassing. En als je helemaal geen GPU hebt maar het model toch wilt bestuderen, biedt de gehoste kaart obsidian/Qwen3.8-27B op OrcaRouter dezelfde ongecensureerde lijn voor $0,40 per miljoen invoertokens en $4,21 per miljoen uitvoer met dezelfde 262K-context; deze is op dezelfde manier beperkt tot beveiligings- en AI-veiligheidsonderzoekers als de repository, en de moderatiebeslissing blijft aan jouw kant. De modelkaart bevat de prijs- en benchmarkdetails.
De veiligheidsgrens — lees dit voordat je downloadt

Bij dit model is de safety-alignment grotendeels verwijderd. Het zal voldoen aan schadelijke, onethische, aanstootgevende of illegale verzoeken die de originele Qwen3.8-27B zou weigeren, en het heeft geen noemenswaardige ingebouwde waarborgen. Het wordt uitsluitend uitgebracht voor legitiem onderzoek — interpreteerbaarheid, AI-veiligheid en onderzoek naar weigeringsmechanismen, red-teaming, robuustheidsevaluatie en gecontroleerde experimenten. U aanvaardt de volledige verantwoordelijkheid en aansprakelijkheid voor hoe u het gebruikt en voor alles wat het genereert, en u mag het niet aan eindgebruikers of in productie inzetten zonder uw eigen veiligheids-, moderatie- en misbruikpreventielagen toe te voegen. De auteurs aanvaarden geen aansprakelijkheid voor misbruik. Het downloaden van de repository betekent dat u deze voorwaarden aanvaardt; de licentie is Apache 2.0.
Dit artikel bevat bewust geen schadelijke prompts. De weigeringscijfers hierboven komen uit de eigen veiligheidsevaluatiesuite van de modelkaart, wat de juiste manier is om een model van deze klasse te meten: voer de standaard weigeringsbenchmarks uit, lees de cijfers en ontwerp je onderzoek rond wat ze laten zien.
Bronnen en datum
Alle bovenstaande feiten zijn geverifieerd op 16 augustus 2026. De bestandslijst en -groottes zijn afkomstig uit de Hugging Face-repository orcarouter/Qwen3.8-27B-Uncensored-GGUF (gemaakt op 16 augustus 2026; architectuur qwen35; Apache 2.0; gated). De weigerings- en capaciteitscijfers zijn afkomstig uit de safety-evaluatiesuite van de modelkaart. De KV-cache-meting (~2 GB bij 32K context) is afkomstig uit het OrcaRouter-runbook voor deze architectuur, How to Run Qwen 3.8 27B Locally. De gehoste prijzen en gating zijn afkomstig van de obsidian/Qwen3.8-27B-modelpagina, gecontroleerd op dezelfde dag. De groottes van gekwantiseerde bestanden zijn decimale GB zoals opgeslagen op Hugging Face.
Voor legitiem onderzoek zijn de gewichten te vinden op Hugging Face: Download van Hugging Face — geen creditcard, binnen 60 seconden live.
