Redactionele flat-vectorillustratie voor een heroafbeelding van een technologieblog over het lokaal draaien van een ongecensureerd, geabliteerd groot taalmodel op je eigen hardware: een grote afgeronde modelchip in diepblauw met een zachte cyaan gloed zweeft links van het midden, waarvan het binnenste circuit overgaat van een gesloten slotvorm naar een open vorm. Rechts daarvan liggen een compacte GPU-kaart op een werkbank en een smal terminalvenster met abstracte horizontale opdrachtbalken, met ernaast een klein lamasilhouet. In de bovenhoek staan een klein microscooppictogram en een afgerond schild met een waarschuwingsdriehoek, wat duidt op onderzoeksgebruik en veiligheidsgrenzen. Een zachte lichtblauwe en witte achtergrond, met royale lege ruimte in het onderste derde deel. Geen leesbare tekst.
Guides & Insights

Hoe Qwen3.8-27B-Uncensored lokaal uit te voeren: GGUF Quants, llama.cpp en Ollama

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Om Qwen3.8-27B-Uncensored lokaal te draaien, haal je de gated GGUF-repo orcarouter/Qwen3.8-27B-Uncensored-GGUF op van Hugging Face, kies een quant op basis van je VRAM — Q4_K_M (16,8 GB) voor een 24 GB GPU, IQ4_XS (15,3 GB) voor een 16 GB GPU, Q3_K_M (13,5 GB) voor meer contextruimte — en serveer het met een actuele llama.cpp-build met de --jinja-vlag; voeg --mmproj toe als je vision nodig hebt.Dezelfde file importeer je in Ollama met drie commando's. Dit is de GGUF-versie van de abliterated Qwen3.8 27B-build, uitgebracht op 16 augustus 2026, waarbij de native 262K-context, de vision-projector en de MTP-kop voor speculatieve decodering in elke quant behouden zijn. Het is een onderzoekstool, geen assistent: het weigeringsgedrag is verwijderd, het bevat geen ingebouwde guardrails, en de licentie is Apache 2.0. Lees de veiligheidsgrens onderaan deze pagina voordat je downloadt — dat is het doel van de gated repo.

Welke GGUF downloaden, op basis van VRAM

De repository wordt geleverd met één full-precision-paar en twaalf gekwantiseerde bestanden, dus de downloadkeuze is eigenlijk een VRAM-keuze. De onderstaande getallen zijn de bestandsgroottes zoals uitgelezen uit de Hugging Face-repository op 16-08-2026.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

Wat zit er eigenlijk in de repo?

orcarouter/Qwen3.8-27B-Uncensored-GGUF bevat vijftien modelbestanden: de F16-gewichten opgesplitst in twee delen, twaalf gekwantiseerde GGUF's — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M en IQ4_XS — en de mmproj vision-projector. Het is de GGUF-export van dezelfde abliterated build als Qwen3.8-27B-Uncensored-FP8, opnieuw verpakt voor lokale runtimes van de llama.cpp-klasse, en het erft de Apache 2.0-licentie van het basismodel en de native context van 262.144 tokens.

Drie eigenschappen gelden voor elke quant. De architectuur is qwen35 — hybride aandacht met 48 Gated DeltaNet lineaire lagen en 16 volledige aandachtslagen — en daarom weigert de repo te laden in oudere llama.cpp-builds en blijft de KV-cache klein. De MTP (nextn) speculatieve decodeerkop wordt behouden in alle quants, zowel K-quant als IQ. En de chattemplate is de Qwen Jinja-template, die je expliciet moet inschakelen (zie hieronder), anders werken gesprekken met meerdere beurten niet.

Waarom de KV-cache klein genoeg blijft om relevant te zijn

Dit is het detail waardoor het lokale verhaal werkt. Van de 64 lagen gebruiken er slechts 16 volledige aandacht; de andere 48 gebruiken Gated DeltaNet-lineaire aandacht, die geen conventionele KV-cache bijhoudt. Het praktische effect, gemeten op het oorspronkelijke runbook voor deze architectuur, is een KV-cache van ongeveer 2 GB bij een context van 32K — ongeveer een kwart van wat een conventionele 27B nodig zou hebben. Daarom past een Q4_K_M-bestand van 16,8 GB nog steeds op een kaart van 24 GB met een lang contextvenster, en waarom de ongecensureerde GGUF-lijn speelbaar is op hardware die de BF16-checkpoint van 55,6 GB helemaal niet kon hosten.

Voer het uit met llama.cpp

llama.cpp is het beoogde pad. Je hebt een actuele build nodig: de trunk registreert de qwen35-architectuur en oudere builds weigeren het bestand botweg. De vorm van het commando, volgens de gebruiksnotities van de modelkaart en het runbook van deze architectuur, is:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

Dat geeft je een OpenAI-compatibel endpoint op localhost:8080. Voeg voor beeldinvoer --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf toe. Vervang Q4_K_M door de quant die bij je VRAM past; de vlaggen zijn identiek.

Voer het uit met Ollama

Ollama draait hetzelfde bestand door het te importeren vanuit een Modelfile, de ondersteunde manier om een GGUF toe te voegen die niet in de bibliotheek staat. In de map met de quant die je hebt gedownload:

FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Sla die regel op als Modelfile, dan ollama create qwen3.8-27b-uncensored -f Modelfile en ollama run qwen3.8-27b-uncensored. Voor vision, voeg de mmproj-regel toe aan de Modelfile (FROM ... Q4_K_M.gguf plus mmproj-pad) en Ollama verbindt de projector. Dezelfde --ctx- en template-kanttekeningen zijn van toepassing: stel de contextgrootte in die je daadwerkelijk kunt gebruiken, en onthoud dat een model waaruit weigeringen zijn verwijderd antwoordt zonder beveiligingsmechanisme tussen jou en de output.

Wat het verwijderen van de weigering daadwerkelijk veranderde

De modelkaart publiceert een veiligheidsevaluatiesuite voor deze build. Met denken uitgeschakeld daalt de weigering op de standaard benchmarks voor schadelijke prompts van 64–99% op het basismodel naar 0–6% op de ge-ablitereerde gewichten; met denken ingeschakeld weigert het in wezen nooit — 1,7% of minder. Capability-benchmarks blijven binnen ±1,3 punten van het basismodel. Dat is het patroon van elke ge-ablitereerde release in deze lijn: weigeringen verwijderd, capaciteiten intact, en de kanttekening dat een flink deel van de antwoorden nog steeds begint met een korte disclaimer — een trainingsartefact, geen weigering.

De keerzijde is precies het doel van de onderstaande veiligheidsgrens: een model dat nooit weigert is geen betere assistent, het is een ander soort object. Het is een testinstrument om weigeringsmechanismen te meten en om te ontdekken of je eigen beveiliging werkt.

Wat je er in onderzoek daadwerkelijk mee kunt doen

Drie legitieme projecten die het toegestane gebruik van een model zonder weigeringen zijn:

Wanneer deze build het verkeerde antwoord is

Als je een normale assistent wilt, of iets wat je voor eindgebruikers zou plaatsen, is dit het verkeerde model — het heeft geen noemenswaardige ingebouwde waarborgen, het zal voldoen aan verzoeken die het basismodel weigert, en Apache 2.0 draagt je aansprakelijkheid niet over. Gebruik daarvoor de originele afgestemde Qwen3.8-27B. Als je weigeringen op een chatbot wilt ombuigen, bereikt een system-prompt-pakket meer met minder risico dan een gewichtsaanpassing. En als je helemaal geen GPU hebt maar het model toch wilt bestuderen, biedt de gehoste kaart obsidian/Qwen3.8-27B op OrcaRouter dezelfde ongecensureerde lijn voor $0,40 per miljoen invoertokens en $4,21 per miljoen uitvoer met dezelfde 262K-context; deze is op dezelfde manier beperkt tot beveiligings- en AI-veiligheidsonderzoekers als de repository, en de moderatiebeslissing blijft aan jouw kant. De modelkaart bevat de prijs- en benchmarkdetails.

De veiligheidsgrens — lees dit voordat je downloadt

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Bij dit model is de safety-alignment grotendeels verwijderd. Het zal voldoen aan schadelijke, onethische, aanstootgevende of illegale verzoeken die de originele Qwen3.8-27B zou weigeren, en het heeft geen noemenswaardige ingebouwde waarborgen. Het wordt uitsluitend uitgebracht voor legitiem onderzoek — interpreteerbaarheid, AI-veiligheid en onderzoek naar weigeringsmechanismen, red-teaming, robuustheidsevaluatie en gecontroleerde experimenten. U aanvaardt de volledige verantwoordelijkheid en aansprakelijkheid voor hoe u het gebruikt en voor alles wat het genereert, en u mag het niet aan eindgebruikers of in productie inzetten zonder uw eigen veiligheids-, moderatie- en misbruikpreventielagen toe te voegen. De auteurs aanvaarden geen aansprakelijkheid voor misbruik. Het downloaden van de repository betekent dat u deze voorwaarden aanvaardt; de licentie is Apache 2.0.

Dit artikel bevat bewust geen schadelijke prompts. De weigeringscijfers hierboven komen uit de eigen veiligheidsevaluatiesuite van de modelkaart, wat de juiste manier is om een model van deze klasse te meten: voer de standaard weigeringsbenchmarks uit, lees de cijfers en ontwerp je onderzoek rond wat ze laten zien.

Bronnen en datum

Alle bovenstaande feiten zijn geverifieerd op 16 augustus 2026. De bestandslijst en -groottes zijn afkomstig uit de Hugging Face-repository orcarouter/Qwen3.8-27B-Uncensored-GGUF (gemaakt op 16 augustus 2026; architectuur qwen35; Apache 2.0; gated). De weigerings- en capaciteitscijfers zijn afkomstig uit de safety-evaluatiesuite van de modelkaart. De KV-cache-meting (~2 GB bij 32K context) is afkomstig uit het OrcaRouter-runbook voor deze architectuur, How to Run Qwen 3.8 27B Locally. De gehoste prijzen en gating zijn afkomstig van de obsidian/Qwen3.8-27B-modelpagina, gecontroleerd op dezelfde dag. De groottes van gekwantiseerde bestanden zijn decimale GB zoals opgeslagen op Hugging Face.

Voor legitiem onderzoek zijn de gewichten te vinden op Hugging Face: Download van Hugging Face — geen creditcard, binnen 60 seconden live.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube