Hero-titelkort för artikeln 'Qwen 3.8 27B Uncensored GGUF': ett avrundat forskningskort med titeln 'Qwen3.8-27B Uncensored GGUF', underrubriken 'Abliterated local build for llama.cpp', chips med texten '12 QUANT TIERS', '262K CONTEXT', 'VISION + MTP' och en sköldikon med etiketten 'RESEARCH-ONLY'. OrcaRouter-logotypen placerad längst ner till höger.
Guides & Insights

Qwen 3.8 27B Uncensored GGUF: det ablitererade lokala bygget, 12 Quants och forskningsgränsen

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen 3.8 27B uncensored GGUF är en riktig nedladdning, och bygget du bör börja med är Qwen3.8-27B-Uncensored-GGUF — publicerad på Hugging Face den 16 augusti 2026 som det nativa llama.cpp-syskonet till vår abliterade FP8-utgåva. Det är samma vägransfria vikter med 27 miljarder parametrar som Qwen3.8-27B-Uncensored-FP8, konverterade till GGUF för lokal inferens: F16 plus 12 kvantiseringsnivåer från Q2_K till Q8_0 (inklusive imatrix-kvantiseringarna IQ3_M och IQ4_XS), 262K-kontextfönstret, en separat visionsprojektor och MTP:s spekulativa avkodningshuvud intakt. "Uncensored" betyder abliterad — vägransriktningen ortogonaliserades bort från vikterna — så den svarar där den justerade basen vägrar, och det är just därför den endast är för forskning. Här är vad repot faktiskt innehåller, vilken kvantisering som passar din GPU, hur du kör den i llama.cpp, och den säkerhetsgräns du accepterar genom att ladda ner den.

30-sekundersversionen: F16 plus 12 kvantiseringar, Q4_K_M på 16,8 GB är standardvalet, du behöver en llama.cpp-build från maj 2026 eller nyare, och detta är ett forskningsverktyg utan skyddsmekanismer — inte något att distribuera till slutanvändare.

Vad "ocensurerad GGUF" faktiskt betyder — och hur den här builden skiljer sig från FP8-versionen

GGUF är det modellformat i en enda fil som llama.cpp använder; FP8 är ett kvantiseringsschema som körs på vLLM GPU-servrar. Våra två ocensurerade utgåvor är samma abliterade vikter i två körningsmiljöer. Qwen3.8-27B-Uncensored-FP8 (15 augusti 2026) riktar sig till vLLM på en server och är omkvantiserad till det officiella Qwen3.8-27B-FP8-schemat så att den använder samma kernel-sökväg. Qwen3.8-27B-Uncensored-GGUF (16 augusti 2026) riktar sig till llama.cpp på en lokal maskin — den stationära GPU:n eller arbetsstationen du kontrollerar. Samma vikter, annan driftsmodell: moln-API vs lokal process.

Abliteration är en intervention på viktnivå, inte en finjustering. Vägransriktningen är en vektor i modellens residualström som, när den aktiveras, producerar "I can't help with that"; bygget hittar den riktningen och ortogonaliserar bort den ur vikterna, enligt metoden från Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). Inga nya vikter tränas. Basen är Qwen/Qwen3.8-27B — en tät 27B-modell med en hybridarkitektur (48 Gated DeltaNet-lager med linjär uppmärksamhet och 16 lager med full uppmärksamhet), inbyggd vision och en kontext på 262 144 token. Licensen är Apache 2.0, ärvd från basen. Observera att Qwens officiella repo endast levererar BF16-safetensors — det finns ingen officiell Qwen-GGUF — så alla ocensurerade GGUF-filer av denna modell, inklusive denna, är en konvertering av de öppna vikterna.

Quantstegen — F16 plus 12 nivåer

Repot levererar F16 (54,6 GB över två filer) och 12 kvantiseringsnivåer. Storlekarna nedan är repots egna filstorlekar, avlästa den 16 augusti 2026; GGUF-filstorlekar varierar något mellan byggen.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54.6 GB (2 filer) — referensprecision

Q8_0 — 29.0 GB — nästan förlustfri, för high-end-GPU:er

Q6_K — 22.4 GB — sweet spot för kvalitet per gigabyte

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — hög kvalitet på större grafikkort

Q4_K_M — 16.8 GB — den rekommenderade standarden

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — det bästa lågbit-valet (imatrix-kalibrerad)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — för 16 GB-kort

IQ3_M — 12.8 GB — litet fotavtryck (imatrix-kalibrerad)

Q3_K_S — 12,3 GB

Q2_K — 10.9 GB — den minsta K-kvantiseringen, en märkbar kvalitetskompromiss

Hårdvaruvägledning: Q4_K_M på ett 24 GB-kort (RTX 4090 eller RTX 3090); IQ4_XS eller Q3_K_M om du har 16 GB; Q2_K endast om du är pressad till 12 GB. Eftersom basen använder en hybrid Gated DeltaNet-attention är KV-cachen liten — ungefär 0,5 GB vid 8K-kontext — så du kan utöka fönstret betydligt mer än en konventionell 27B dense-modell. Vision lägger till en separat fil: F16-projektorn är 931 MB. En 9-quant community-ablitererad serie för samma bas finns också; vår är konverteringen av den dokumenterade FP8-abliterationen, med imatrix-quants och modellkortets refusal-delta-värden överförda.

Hur man kör det i llama.cpp

Tre steg. Ett icke-uppenbart krav: qwen35-arkitekturen och MTP-stödet lades till i llama.cpp i maj 2026, så uppdatera till en build från 2026-05 eller nyare — äldre builds kan inte läsa in dessa filer (enligt README i repot).

1. Ladda ner den kvantiserade modell du valde plus vision-projektorn. Repositoriet är spärrat, så du loggar in på Hugging Face och accepterar villkoren först — att läsa README är en del av att acceptera vad den här modellen är.

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. Starta llama-server. Detta tillhandahåller en OpenAI-kompatibel slutpunkt; -ngl 99/ flyttar varje lager till GPU:n.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (Valfritt) aktivera MTP-headen för spekulativ avkodning. Lägg till --spec-type draft-mtp/ — nextn-huvudet är inbäddat i varje quant, så ingen separat draftmodell behövs.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

Forskningskörningar med enbart text kan utelämna --mmproj/; bildinmatning kräver det, eftersom detta är en inbyggd vision-språkmodell. Endpunkten är http://localhost:8080/v1/chat/completions, så befintlig OpenAI SDK-kod fungerar genom att byta bas-URL.

{{1}}Ingen GPU?{{/1}} Samma ocensurerade linje körs {{2}}p\u00e5 en CPU, i din webbl\u00e4sare.{{/2}}

Lokal GGUF kostar ingenting per token men kräver cirka 17 GB VRAM för Q4_K_M-nivån. Om du inte äger hårdvaran, tillhandahåller det värdbaserade kortet obsidian/Qwen3.8-27B på OrcaRouter samma ocensurerade 27B-linje — vision, resonemang, 262K-kontext — för $0,40 per miljon inmatade token och $4,21 per miljon utmatade token, med åtkomst begränsad till säkerhetsforskare, red teams och AI-säkerhetsforskare. Samma viktfamilj, två körmiljöer: GGUF lokalt, FP8 i molnet. Moderationsbeslutet ligger kvar på din sida oavsett.

Säkerhetsgränsen — läs detta innan du laddar ner

Denna modell har fått sin säkerhetsanpassning i hög grad avlägsnad. Den kommer att följa skadliga, oetiska, kränkande eller olagliga förfrågningar som den grundläggande Qwen3.8-27B skulle vägra, och den har inga meningsfulla inbyggda skyddsräcken. Den släpps strikt för legitim forskning — tolkningsbarhet, studium av vägransmekanismer, red-teaming, robusthetsutvärdering och testning av skyddsräcken. Du har fullt ansvar och allt juridiskt ansvar för hur du använder den och för allt den genererar, och du får inte driftsätta den för slutanvändare eller i produktion utan att lägga till egna lager för säkerhet, moderering och missbruksförebyggande. Författarna tar inget ansvar. Licensen är Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

Den uppmätta ​​datan visar vad "ocensurerad" kostar. Från modellkortets säkerhetsutvärderingssvit — körs på FP8-bygget och daterad 15 augusti 2026, vilket är vikterna som denna GGUF konverterar: vägran av skadliga uppmaningar sjunker från 64–99 % på basmodellen till 0–6 % på de ablitererade vikterna, ofarlig övervägran sjunker från 5,6 % till 0,4 %, och kapacitetspoängen håller sig inom ±1,3 poäng från basmodellen. De siffrorna är varför denna typ av modell är ett legitimt forskningsobjekt — och de är också varningen.

Den här artikeln innehåller medvetet inga skadliga uppmaningar. Om du utvärderar modellen, kör de standardmässiga avvisningsriktmärkena — AdvBench, HarmBench, StrongREJECT, XSTest-safe — och läs siffrorna själv. Det är det godkända sättet att studera en avvisningsfri modell.

När den här builden är fel svar.

1. Du vill ha en vanlig assistent. Fel modell. Den har inga skyddsmekanismer och kommer att tillmötesgå skadliga förfrågningar. Använd den anpassade Qwen3.8-27B istället.

2. Allt du skulle sätta framför slutanvändare.Fel modell oavsett avsikt. Apache 2.0 överför inte ditt ansvar, och att lansera en modell utan skyddsräcken till användare är inte en driftsättningsstrategi.

3. Du är på Apple Silicon. GGUF:en kommer att fungera, men MLX-konverteringen av basmodellen är det mer naturliga valet — se vår separata MLX-guide.

4. Du vill inte köra den alls. Använd det värdbaserade kortet — samma vikter, inga 17 GB VRAM, och samma forskningsspärr.

Slutsats

"Qwen 3.8 27B uncensored GGUF" har ett svar, och det är en konkret nedladdning: Qwen3.8-27B-Uncensored-GGUF — F16 plus 12 kvantiseringsnivåer för llama.cpp, de abliterade vikterna från vårt FP8-bygge, 262K kontext, vision och MTP, under Apache 2.0 och endast för forskning. Välj Q4_K_M på ett 24 GB-kort, uppdatera llama.cpp till efter maj 2026 och kör den som en lokal OpenAI-kompatibel server. Det är ett forskningsinstrument för att studera avböjanden och testa skyddsmekanismer — inte en chattbot och inget att skicka ut. Vikterna är gratis; ansvaret för vad du gör med dem är helt ditt.

För legitim forskning finns F16 och alla 12 kvantnivåer på Hugging Face: Ladda ner GGUF från Hugging Face

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube