Titelkort för artikeln 'Qwen Uncensored, Explained', som visar ett avrundat forskningskort med en sköld som öppnas för att avslöja en kretshjärna, en mikroskopikon och en etikett som lyder RESEARCH-ONLY, med chips som lyder ABLITERATED, BLOCK-FP8 och 262K CONTEXT.
Guides & Insights

Qwen oCensurerad, förklarad: Hur man kör den ablitererade Qwen3.8-27B-FP8

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen ocensurerad på Hugging Face betyder nästan alltid abliteration — modellens vägransriktning borttagen från dess residualström — och bygget att börja med är Qwen3.8-27B-Uncensored-FP8, släppt på Hugging Face den 15 augusti 2026. Det är ett abliterat, block-FP8-bygge av Qwen3.8-27B som körs på exakt samma vLLM-kernelväg som den officiella FP8-utgåvan, med 262K-kontexten, visionstornet och MTP:s spekulativa avkodningshuvud intakta — och det fick 257 gillamarkeringar och 4 285 nedladdningar den första dagen. Det är ett forskningsverktyg, inte en chattbot: inga inbyggda skyddsräcken, Apache 2.0, och den kommer att tillmötesgå förfrågningar som basmodellen vägrar. Den här guiden täcker vad abliteration faktiskt ändrade, hur man hämtar de 30,9 GB vikterna från Hugging Face, hur man serverar modellen med vLLM, SGLang eller Transformers, och vad man ska köra på den för legitim forskning.

Vad 'qwen uncensored' faktiskt betyder

Abliteration är en intervention på viktnivå, inte en finjustering. Vägransriktningen är en vektor i modellens residualström som, när den aktiveras, producerar "I can't help with that"; abliteration hittar den riktningen och ortogonaliserar bort den ur vikterna. I denna build applicerades borttagningen på 131 residual-skrivande matriser (metoden från Arditi et al. 2024, "Refusal in Language Models Is Mediated by a Single Direction"), och resultatet omkvantiserades för att matcha det officiella Qwen3.8-27B-FP8-schemat byte-för-byte så att vLLM serverar det på den identiska FP8-kernelvägen. Inga nya vikter tränades.

Den skillnaden är viktig eftersom de främsta resultaten för "qwen uncensored" blandar tre olika saker: abliterade viktjusteringar som den här, systemprompt-"uncensored packs" som bara maskerar vägranar på promptnivå, och LoRA-finjusteringar tränade utan säkerhetsdata. De är inte likvärdiga, och de flesta sidor som rankar för sökfrågan berättar inte vilken familj de beskriver. Om du vill studera vägransmekanismen i sig är det bara ingreppet på viktnivå som är den äkta varan.

Vad borttagandet av vägran faktiskt gjorde — siffrorna

Modellkortet publicerar en säkerhetsutvärderingssvit, körs på den vLLM-serverade modellen och daterad 15 augusti 2026. Med tanke avstängt sjunker vägran på sju skadliga prompt-riktmärken från 64–99 % på basen till 0–6 % på denna version: AdvBench 99,0 % till 0,0 %, JailbreakBench 94,0 % till 0,0 %, StrongREJECT 97,3 % till 2,0 %, HarmBench 98,7 % till 2,7 %, MaliciousInstruct 99,0 % till 0,0 %, SimpleSafetyTests 64,0 % till 6,0 %, ForbiddenQuestions 73,3 % till 4,7 %. Med tanke på vägrar modellen i princip aldrig — 1,7 % eller mindre. En separat, anmärkningsvärd siffra är caveat-frekvensen: 30–50 % av "ocensurerade" svar inleder fortfarande med en kort ansvarsfriskrivning innan de svarar; det är en träningsartefakt, inte en vägran.

Baksidan är det som inte förändrades. Övervägran vid ofarliga uppmaningar sjunker från 5,6 % till 0,4 % på XSTest-safe, och varje kapacitetsriktmärke håller sig inom ±1,3 punkter från baslinjen: MMLU 84,3 % till 84,7 %, GSM8K 90,0 % till 88,7 %, MMLU-Pro 77,6 % till 76,8 %, CMMLU 81,4 % till 80,8 %. WikiText-2-perplexiteten är 6,96. Med andra ord tog interventionen bort vägransbeteendet utan att nämnvärt försämra modellen.

A before-and-after card for Qwen3.8-27B-Uncensored-FP8, with a Base column and an Abliterated column: refusal with thinking off 64-99% down to 0-6%, refusal with thinking on down to 1.7% or less, over-refusal on benign prompts 5.6% down to 0.4%, MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%, and WikiText-2 perplexity 6.96, with a footer reading Model-card evaluation, vLLM-served, August 15 2026.

Hur man hämtar den från Hugging Face

Repositoryt är orcarouter/Qwen3.8-27B-Uncensored-FP8, och det är gated: du loggar in med ett Hugging Face-konto och accepterar villkoren innan filerna laddas ner — grinden är i sig själv ansvarsfriskrivningen, eftersom att läsa README:n är en del av att acceptera vad den här modellen är. Det du laddar ner är 30,9 GB fördelat på sju safetensors-shards (1 606 tensorer) i block-FP8 (E4M3, 128×128-block, dynamiska aktiveringar), med vision-tornet, normerna, embeddings och lm_head behållna i BF16. Licensen är Apache 2.0, ärvd från basmodellen Qwen/Qwen3.8-27B. Ingen Hugging Face Inference Provider är värd för den — du kör den själv, eller använder ett hostat kort.

Så här kör du det

Vikterna är ungefär 31 GB — ungefär hälften av den ~56 GB stora BF16-checkpointen — och kortet rekommenderar en enda H100 80GB eller H200 143GB, med ~40 GB VRAM som praktiskt minimum för vikterna plus en liten KV-cache. Full 262K-kontext kräver mer, men en FP8 KV-cache halverar det. Den uppsättning som kortet verifierade var en H200 med --max-num-seqs 96, FP8 KV-cache och MTP aktiverat.

vLLM är den avsedda vägen, och det är ett enda kommando, eftersom FP8-schemat matchar den officiella bygget exakt:

vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"

Det ger dig en OpenAI-kompatibel slutpunkt på localhost:8000/v1/chat/completions. Docker-motsvarigheten är docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8. För den fullständiga konfigurationen föreslår modellkortet: --language-model-only för att endast servera text, --speculative-config '{"method":"mtp","num_speculative_tokens":3}' för att aktivera MTP-huvudet för spekulativ avkodning, --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3 samt --enable-auto-tool-choice --tool-call-parser qwen3_coder för verktygsanrop. Ange inte --quantization fp8 – schemat läses från config.json. Uteslut --kv-cache-dtype fp8 om du vill ha en BF16-KV-cache, och uteslut --language-model-only om du behöver visionstornet.

För SGLang: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. För Transformers dokumenterar modellkortet både pipeline-API:t — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") — och AutoProcessor.from_pretrained(...) plus AutoModelForMultimodalLM.from_pretrained(..., device_map="auto").

A how-to-run card for Qwen3.8-27B-Uncensored-FP8 listing the essentials: 30.9 GB of block-FP8 weights across 7 shards, roughly 40 GB of VRAM floor with H100 80GB or H200 143GB recommended, the vLLM one-liner vllm serve orcarouter/Qwen3.8-27B-Uncensored-FP8, serve flags MTP 3 speculative tokens, FP8 KV cache, max-model-len 262144, tool-call-parser qwen3_coder, and a footer reading From the Hugging Face model card, August 15 2026.

Vad man faktiskt ska göra med det i forskning

Poängen med en modell vars vägran har tagits bort är att vara ett föremål för studium, och denna version är ovanligt lätt att studera eftersom dess intervention är dokumenterad. Tre konkreta, legitima forskningsprojekt:

• Reproducera refusaldeltat. Kör AdvBench, HarmBench, StrongREJECT eller XSTest-safe mot både den ablitererade versionen och bas-FP8, och bekräfta kortets siffror: 64–99 % till 0–6 % på skadliga uppmaningar, 5,6 % till 0,4 % övervägran på ofarliga sådana. Detta före/efter-par är exakt den mätning som ett säkerhetsteam behöver för att veta om en metod för refusborttagning fungerar och vad den kostar.

• Studera var vägran lever. Eftersom bygget dokumenterar de 131 matriser som ortogonaliserades kan du jämföra residualströmmens riktningar mot basen och se vad interventionen flyttade. Resultatet med tänkande på är informativt här: vägran sjunker till 1,7 % eller mindre när tänkande är aktiverat, vilket är ett bevis på att resonemangsspåret är där riktningen betyder mest.

• Utvärdera ditt eget skyddsräcke. En baslinje utan skyddsräcke är rätt kontroll för att testa ett modereringslager. Kör ditt filter över denna modells utdata och mät vad det fångar — det är så du kvantifierar det säkerhetslager du lägger till ovanpå.

När denna modell är fel svar

Om du vill ha en vanlig assistent, eller något du skulle placera framför slutanvändare, är detta fel modell — den har inga meningsfulla inbyggda skyddsräcken, den kommer att följa förfrågningar som basmodellen vägrar, och Apache 2.0 överför inte ditt ansvar. Använd den ursprungliga alignade Qwen3.8-27B istället. Om du vill avleda vägran i en chatbot, uppnår ett systemprompt-paket mer med mindre risk än en viktredigering. Och om du inte har ett ~40 GB-kort men ändå vill studera modellen, serverar det hostade kortet obsidian/Qwen3.8-27B på OrcaRouter samma ocensurerade 27B-serie för 0,40 USD per miljon inmatningstokens och 4,21 USD per miljon utmatningstokens, med samma 262K-kontext — det är begränsat till säkerhets- och AI-säkerhetsforskare, och modereringsbeslutet ligger fortfarande hos dig.

A safety-boundary card for Qwen3.8-27B-Uncensored-FP8 with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services with a warning that the model has no built-in guardrails, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Säkerhetsgränsen — läs detta innan du laddar ner

Den här modellen har fått sin säkerhetsanpassning väsentligen borttagen. Den kommer att efterkomma skadliga, oetiska, kränkande eller olagliga förfrågningar som den ursprungliga Qwen3.8-27B skulle vägra, och den har inga meningsfulla inbyggda säkerhetsmekanismer. Den släpps strikt för legitim forskning — tolkbarhet, AI-säkerhet och studier av vägrarmekanismer, red teaming, robusthetsutvärdering och kontrollerade experiment. Du tar fullt ansvar och ansvarsskyldighet för hur du använder den och för allt den genererar, och du får inte distribuera den till slutanvändare eller i produktion utan att lägga till egna säkerhets-, modererings- och missbruksförebyggande lager. Författarna accepterar inget ansvar för missbruk. Genom att ladda ner databasen accepterar du dessa villkor; licensen är Apache 2.0.

Denna artikel innehåller medvetet inga skadliga uppmaningar. Vägranssiffrorna ovan kommer från modellkortets egen säkerhetsutvärderingssvit, vilket är det korrekta sättet att mäta en modell av denna klass: kör de standardmässiga vägransbenchmarkarna, läs siffrorna och utforma din forskning utifrån vad de visar.

Slutsats

"Qwen uncensored" är ett sökande efter en teknik, och den version du bör prova först är Qwen3.8-27B-Uncensored-FP8: det enda Qwen3.8-bygget med borttagen refuseringsmekanism som serveras på den officiella FP8-vLLM-kernelvägen med 262K-kontext, vision och MTP intakta, underbyggd av en publicerad före/efter-utvärdering. Ladda ner de gated 30,9 GB från Hugging Face, servera den med vLLM på en enda H100 eller H200 och använd den till det den är till för — att mäta refuseringar, studera refuseringsmekanismen och testa guardrails. Använd den inte som en chattbot och leverera den inte till slutanvändare. Vikterna är fria; ansvaret för vad du gör med dem är helt och hållet ditt.

För legitim forskning finns vikterna på Hugging Face: Ladda ner från Hugging Face

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube