
Så här kör du Qwen3.8-27B-Uncensored lokalt: GGUF-kvantiseringar, llama.cpp och Ollama
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
För att köra Qwen3.8-27B-Uncensored lokalt, hämta det gated GGUF-repot orcarouter/Qwen3.8-27B-Uncensored-GGUF från Hugging Face, välj en kvantisering efter ditt VRAM — Q4_K_M (16,8 GB) för en 24 GB GPU, IQ4_XS (15,3 GB) för en 16 GB GPU, Q3_K_M (13,5 GB) när du vill ha mer kontextutrymme — och servera den med en aktuell llama.cpp-build med --jinja-flaggan, plus --mmproj om du behöver vision. Samma fil importeras i Ollama med tre kommandon. Detta är GGUF-versionen av det abliterade Qwen3.8 27B-bygget, släppt den 16 augusti 2026, med den inbyggda 262K-kontexten, visionsprojektorn och MTP:s spekulativa avkodningshuvud bevarade i varje kvantisering. Det är ett forskningsverktyg, inte en assistent: dess vägransbeteende har tagits bort, det saknar inbyggda skyddsräcken, och licensen är Apache 2.0. Läs säkerhetsgränsen längst ner på denna sida innan du laddar ner — det är själva poängen med det gated-repot.
Vilken GGUF att ladda ner, beroende på VRAM
Repositoryt levererar ett fullprecisionspar och tolv kvantiserade filer, så nedladdningsbeslutet är egentligen ett VRAM-beslut. Siffrorna nedan är filstorlekarna som lästes från Hugging Face-repositoriet den 16 augusti 2026.

Vad finns egentligen i repot?
orcarouter/Qwen3.8-27B-Uncensored-GGUF innehåller femton modellfiler: F16-vikterna uppdelade i två delar, tolv kvantiserade GGUFs — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M och IQ4_XS — och mmproj-visionprojektorn. Det är GGUF-exporten av samma abliterade bygge som Qwen3.8-27B-Uncensored-FP8, ompaketerad för lokala körtider av llama.cpp-klass, och den ärver basmodellens Apache 2.0-licens och dess inbyggda kontext på 262 144 tokens.
Tre egenskaper gäller för varje kvant. Arkitekturen är qwen35 — hybrid attention med 48 Gated DeltaNet-linjära lager och 16 full-attention-lager — vilket är anledningen till att repot vägrar att ladda i äldre llama.cpp-byggen och att KV-cachen förblir liten. MTP-huvudet för spekulativ avkodning (nextn) bevaras i alla kvantiseringsnivåer, både K-quant och IQ. Och chattmallen är Qwen Jinja-mallen, som du måste aktivera explicit (se nedan) annars fungerar inte flervarssamtal.
Varför KV-cachen förblir tillräckligt liten för att spela roll
Detta är detaljen som får den lokala berättelsen att fungera. Av de 64 lagren använder endast 16 full attention; de övriga 48 använder Gated DeltaNet linjär attention, som inte håller någon konventionell KV-cache. Den praktiska effekten, mätt på den ursprungliga runbooken för denna arkitektur, är en KV-cache på ungefär 2 GB vid 32K kontext — omkring en fjärdedel av vad en konventionell 27B skulle behöva. Det är därför en 16,8 GB Q4_K_M-fil fortfarande ryms på ett 24 GB-kort med ett långt kontextfönster, och varför den ocensurerade GGUF-linjen är körbar på hårdvara som inte alls kunde hysa 55,6 GB BF16-checkpointen.
Kör det med llama.cpp
llama.cpp är den avsedda vägen. Du behöver en aktuell build: trunk registrerar qwen35-arkitekturen, och äldre buildar vägrar filen rakt av. Kommandoformen, från modellkortets användningsanteckningar och denna arkitekturs runbook, är:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Det ger dig en OpenAI-kompatibel slutpunkt på localhost:8080. För bildinmatning lägg till --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Byt ut Q4_K_M mot den kvantisering som matchar ditt VRAM; flaggorna är identiska.
Kör det med Ollama
Ollama kör samma fil genom att importera den från en Modelfile, vilket är det stödda sättet att lägga till en GGUF som inte finns i biblioteket. I katalogen som innehåller kvanten du laddade ner:
FRÅN ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Spara den raden som Modelfile, sedan ollama create qwen3.8-27b-uncensored -f Modelfile och ollama run qwen3.8-27b-uncensored. För vision, lägg till mmproj-raden i Modelfile (FROM ... Q4_K_M.gguf plus mmproj-sökväg) och Ollama kopplar in projektorn. Samma --ctx- och template-varningar gäller: ställ in kontextstorleken som du faktiskt kan hantera, och kom ihåg att en modell utan refusering svarar utan skyddsräcke mellan dig och utdata.
Vad borttagandet av vägran faktiskt förändrade
Modellkortet publicerar en säkerhetsutvärderingssvit för denna build. Med tänkande avstängt sjunker vägran på de standardiserade riktmärkena för skadliga prompts från 64–99 % på basmodellen till 0–6 % på de abliterade vikterna; med tänkande på vägrar den i praktiken aldrig — 1,7 % eller mindre. Förmågsriktmärken förblir inom ±1,3 poäng från basen. Det är formen på varje abliterad release i denna serie: vägran borttagen, förmågor intakta, och reservationen att en inte obetydlig andel av svaren fortfarande föregås av en kort ansvarsfriskrivning — en träningsartefakt, inte en vägran.
Baksidan är själva poängen med säkerhetsgränsen nedan: en modell som aldrig vägrar är inte en bättre assistent, det är en annan typ av objekt. Det är ett testinstrument för att mäta vägrarmekanismer och för att ta reda på om ditt eget skyddsräcke fungerar.
Vad man faktiskt ska göra med det i forskning
Tre legitima projekt som är den sanktionerade användningen av en vägransfri modell:
När den här builden är fel svar.
Om du vill ha en vanlig assistent, eller något du skulle sätta framför slutanvändare, är detta fel modell — den har inga meningsfulla inbyggda skyddsräcken, den kommer att tillmötesgå förfrågningar som basmodellen vägrar, och Apache 2.0 överför inte ditt ansvar. Använd den ursprungliga, anpassade Qwen3.8-27B för det. Om du vill avleda nekanden på en chatbot, uppnår ett systemprompt-paket mer med mindre risk än en viktredigering. Och om du inte har någon GPU alls men ändå vill studera modellen, tillhandahåller det hostade kortet obsidian/Qwen3.8-27B på OrcaRouter samma ocensurerade modellinje för 0,40 USD per miljon inmatningstokens och 4,21 USD per miljon utmatningstokens med samma 262K-kontext; det är åtkomstbegränsat till säkerhets- och AI-säkerhetsforskare på samma sätt som repot är, och modereringsbeslutet ligger fortfarande hos dig. Modellkortet har pris- och benchmarkdetaljerna.
Säkerhetsgränsen — läs detta innan du laddar ner

Den här modellen har fått sin säkerhetsanpassning väsentligen borttagen. Den kommer att efterkomma skadliga, oetiska, kränkande eller olagliga förfrågningar som den ursprungliga Qwen3.8-27B skulle vägra, och den har inga meningsfulla inbyggda säkerhetsmekanismer. Den släpps strikt för legitim forskning — tolkbarhet, AI-säkerhet och studier av vägrarmekanismer, red teaming, robusthetsutvärdering och kontrollerade experiment. Du tar fullt ansvar och ansvarsskyldighet för hur du använder den och för allt den genererar, och du får inte distribuera den till slutanvändare eller i produktion utan att lägga till egna säkerhets-, modererings- och missbruksförebyggande lager. Författarna accepterar inget ansvar för missbruk. Genom att ladda ner databasen accepterar du dessa villkor; licensen är Apache 2.0.
Denna artikel innehåller medvetet inga skadliga uppmaningar. Vägranssiffrorna ovan kommer från modellkortets egen säkerhetsutvärderingssvit, vilket är det korrekta sättet att mäta en modell av denna klass: kör de standardmässiga vägransbenchmarkarna, läs siffrorna och utforma din forskning utifrån vad de visar.
Källor och datum
Alla fakta ovan verifierades den 16 augusti 2026. Fillistan och filstorlekarna läses från Hugging Face-repositoriet orcarouter/Qwen3.8-27B-Uncensored-GGUF (skapat den 16 augusti 2026; arkitektur qwen35; Apache 2.0; gated). Siffrorna för refusering och kapacitet kommer från modellkortets säkerhetsutvärderingssvit. KV-cachemätningen (~2 GB vid 32K kontext) kommer från OrcaRouter-runbooken för denna arkitektur, How to Run Qwen 3.8 27B Locally. Prissättningen och åtkomstbegränsningen för den värdbaserade modellen kommer från obsidian/Qwen3.8-27B-modellsidan, kontrollerad samma dag. Kvantiserade filstorlekar anges i decimala GB såsom de lagras på Hugging Face.
För legitim forskning finns vikterna på Hugging Face: Ladda ner från Hugging Face — inget kreditkort, live på 60 sekunder.
