
Abliteration, förklarat: Hur borttagning av vägran fungerar utan någon träning
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 1009 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Abliteration tar bort en LLM:s vägrarbeteende — reflexen "jag kan inte hjälpa till med det" — med en viktredigering och utan träningskörning. Det fungerar eftersom vägran förmedlas av en enda riktning i modellens residualström: hitta den riktningen, subtrahera den från matriserna som skriver till strömmen, så slutar modellen att vägra samtidigt som den behåller sina förmågor. Det tydligaste offentliga exemplet är Qwen3.8 27B Uncensored (Aggressive), vars modellkort visar att vägran vid skadliga uppmaningar kollapsar från 99,0 % till 0,0 % på AdvBench medan MMLU faktiskt ökar med en tiondels procentenhet. Det är så här mekanismen fungerar, vad de uppmätta siffrorna säger och var gränsen går.
Detta är inte fine-tuning, inte RLHF och inte en jailbreak-prompt. Abliteration är ett tolkningsbart resultat som förvandlats till linjär algebra: en artikel från 2024 visade att en riktning i den interna representationen styr ett beteende som säkerhetsträningen lade ner enorma ansträngningar på att installera, och att man kan stänga av det genom att redigera vikterna direkt. Eftersom redigeringen är en projektion är den billig, reproducerbar på en enda GPU och lämnar en vanlig, delbar checkpoint efter sig — vilket är anledningen till att abliterade byggen av öppna modeller, inklusive Qwen3.8-27B-familjen, har blivit standardmetoden för att producera ”ocensurerade” forskningscheckpoints.
Vägranriktningen: en vektor i en ström med flera tusen dimensioner
Inuti en transformer passerar varje token genom en residualström — den löpande representationen som lager läser från och skriver till. Varje lagers attention- och MLP-block tar strömmen som indata och lägger tillbaka sitt resultat till den. Strömmen är i praktiken modellens arbetsminne: en vektor per tokenposition, med dimension lika med modellens bredd.
Den artikel från 2024 som startade allt detta — Andy Arditi och kollegor, "Vägran i språkmodeller förmedlas av en enda riktning" (arXiv:2406.11717, NeurIPS 2024) — mätte hur dessa strömvektorer ser ut när en chattmodell är på väg att vägra jämfört med när den följer. Över 13 chattmodeller med öppna vikter från 1,8 miljarder till 72 miljarder parametrar, var svaret slående konsekvent: skillnaden är i huvudsak en enda riktning. Vid den sista token har den residuala strömmen en stor komponent längs en enda vägransriktning när modellen vägrar, och nästan ingen när den följer. Geometrin stämmer överens mellan skadekategorier, vilket är anledningen till att projektionen koncentreras på den första singularvektorn snarare än att spridas över ett helt delrum.
För att hitta den riktningen samlar du in aktiveringar från två uppsättningar prompts — skadliga och ofarliga — och tar medelvärdet av residualerna för den sista token i varje uppsättning. Vägransriktningen är ungefär mean(harmful) − mean(harmless), normaliserad till enhetslängd. Originalartikeln beskrev detta med linjär probing; produktionsbyggen som Qwen3.8-27B-Uncensored-FP8 uppskattar en enda riktning (k=1) som en massaktiveringsmaskerad medelskillnad mellan residualerna för den sista token hos skadliga respektive ofarliga prompts. Inga etiketter utöver uppdelningen skadliga/ofarliga, ingen gradient, ingen träning.
Redigeringen: subtrahera riktningen från varje matris som skriver till strömmen.
När du väl har vägransriktningen r — en enhetsvektor i residualströmmen — så är interventionen en rank-1-projektion. Varje viktmatris vars utdata läggs till residualströmmen kan "rensas" från r:
W' = W − r(rᵀW)
Med andra ord: {{1}}beräkna den utdatakomponent hos varje matris som pekar längs r, och ta bort den.{{/1}} Matriserna som skriver till strömmen är utprojektionerna — {{2}}attentionens utprojektion (o_proj), MLP:ns nedprojektion (down_proj) och token-inbäddningens radrum.{{/2}} Redigeringen {{3}}körs i float32, tar minuter på en GPU,{{/3}} och kräver {{4}}ingen optimerare och inga träningsdata utöver de aktiveringspar som du redan har samlat in.{{/4}}
Det finns två sätt att ta bort en riktning, och de är värda att hålla åtskilda:
• Aktiveringsablation — koppla in i forward-passet och subtrahera r-komponenten från de levande aktiveringarna. Reversibelt, inga vikter påverkas; idealiskt för experiment som jämför vägran och följsamhet på samma checkpoint.
• Viktortogonalisering — applicera projektionen på vikterna själva, vilket ger en permanent, delbar checkpoint. Detta är vad "abliteration" syftar på, och det är det som levereras i de ocensurerade modellförråden.

Ortogonaliseringen är medvetet trubbig. Den tar bort vägranskomponenten från vikterna och inget mer. Den kan inte tillföra kunskap, förbättra resonemanget eller göra modellen mer sanningsenlig — vilket är anledningen till att en ablitererad modell beter sig som sin grundmodell, minus vägransreflexen.
Så här ser 131 matriser ut på en riktig build: Qwen3.8-27B-Uncensored-FP8
För att konkretisera detta: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, publicerad 2026-08-15, Apache 2.0) är en ablitererad byggversion av Qwen3.8-27B. Qwen3.8-27B är en modell med hybrid uppmärksamhet — 16 lager med full uppmärksamhet plus 48 linjära Gated DeltaNet-lager, totalt 64 lager, plus ett multi-token-prediktionshuvud (MTP). Byggversionen ortogonaliserade bort vägransriktningen ur 131 residualskrivande matriser:
• self_attn.o_proj — 17 matriser (16 full-attention-lager + MTP)
• linear_attn.out_proj — 48 matriser (Gated DeltaNet-lagren)
• mlp.down_proj — 65 matriser (64 lager + MTP)
• embed_tokens (radrum) — 1 matris
Vägransriktningen uppskattades till lager 38 — round(0.6 × 64), lagret där riktningen är mest koncentrerad — och det maximala restläckaget efter redigeringen var 1.8e-2. Visionstornet lämnades orört, och MTP-huvudet ablitererades i överensstämmelse med kroppen så att spekulativ avkodning inte återinför vägran nedströms. Redigeringen beräknades i float32 och kvantiserades sedan om till block-FP8 med samma schema som den officiella Qwen3.8-27B-FP8-checkpointen; bygget rapporterar 99,9 % identiska FP8-koder mot den officiella checkpointen, vilket är hur du vet att omkvantiseringen inte rörde till redigeringen.
Uppmätt: vägran kollapsar, förmågorna håller.
Alla siffror nedan kommer från modellkortet för Qwen3.8-27B-Uncensored-FP8, publicerat 2026-08-15 och utvärderat med vLLM. De är leverantörsrapporterade — inte oberoende återskapade — och de är den mest kompletta offentliga före/efter-bilden av en abliterationsredigering som finns tillgänglig.
Vägran på benchmarks för skadliga uppmaningar, tänkande av (vägransfrekvens; lägre innebär mer ocensurerad):
• AdvBench (n=100): 99.0% → 0.0%
• StrongREJECT (n=150): 97.3% → 2.0%
• HarmBench standard (n=150): 98.7% → 2.7%
• MaliciousInstruct (n=100): 99,0 % → 0,0 %
• JailbreakBench skadlig (n=100): 94,0% → 0,0%
• SimpleSafetyTests (n=50): 64.0% → 6.0%
I hela sviten sjunker vägran på skadliga uppmaningar från 64–99 % på basmodellen till 0–6 % efter redigeringen. Med tänkande aktiverat (enable_thinking=true) är den återstående vägran ännu lägre — ≤1,7 % överallt, med de flesta riktmärken på exakt 0 %. Asymmetrin är informativ: vägransriktningen lever mestadels i den snabba, icke-tänkande vägen, så när den väl tas bort från utdatahuvudet finns det lite kvar för resonemangsspåret att snubbla på.
Överavvisning – ofarliga prompts som grundmodellen felaktigt avvisar – minskar också: XSTest-safe (n=250) går från 5.6% till 0.4%. Att ta bort riktningen förhindrar inte bara skadliga avvisningar; det hindrar också modellen från att avvisa ofarliga förfrågningar som bara såg riskabla ut. Den siffran är ett stillsamt argument för att en del av en grundmodells "säkerhet" är en falsklarmsskatt.
Förmågor, alla inom ±1,3 poäng från basen:
• MMLU (0-shot letter): 84.3% → 84.7% (+0.4)
• GSM8K (CoT): 90,0 % → 88,7 % (−1,3)
• MMLU-Pro (CoT): 77,6% → 76,8% (−0,8)
• CMMLU (0-shot): 81.4% → 80.8% (−0.6)
WikiText-2-perplexiteten är 6,96. Med andra ord är redigeringen kirurgiskt riktad: den tar bort ett beteende som installerats ovanpå kunskapen och lämnar kunskapen — mätt, åtminstone, på dessa utvärderingar — i huvudsak intakt.

De ärliga varningarna
Tre saker som rubriksiffrorna inte berättar för dig. För det första, abliteration är inte en ren på/av-omkopplare. Omkring 30–50 % av svaren på skadliga uppmaningar inleds fortfarande med en kort säkerhetsfriskrivning — modellen följer instruktionen, men en förbehållsmening överlever som en träningsartefakt. Den envägsredigeringen raderar inte alla spår av träningsbeteendet.
För det andra, vägran är redundant kodad. En riktning tar bort det mesta av den, men vissa kategorier är djupare inbäddade än andra, och alltför aggressiv ablering kan få modellen att börja babbla — över-abliteration är ett verkligt feltillstånd, inte ett teoretiskt sådant. Du vrider på en ratt, och ratten har ett golv.
För det tredje, kapacitetskostnaden är riktnings- och lagerberoende. Det här bygget landade inom ±1,3 poäng eftersom riktningen uppskattades på rätt lager och projektionen tillämpades konsekvent. Flytta uppskattningen till fel lager, eller pressa projektionen hårdare, och samma metod kan märkbart skada resonemanget. Resultatet garanteras inte av metoden — det är bygget som förtjänar det.
När abliteration är fel verktyg
{{1}}Om du vill ha en följsam assistent, ablitera inte — du vill ha den anpassade basmodellen, inte en vägranfri byggversion.{{/1}} {{2}}Om du vill utvärdera en vägranfri Qwen3.8-27B utan att ladda ner 30GB vikter, serveras familjen på OrcaRouter (obsidian/Qwen3.8-27B, $0,40 in / $4,21 ut per 1M tokens, 262K kontext, listad 2026-08-15), med den fullt upplåsta varianten åtkomstbegränsad för säkerhetsforskare och red teams.{{/2}}
Om du vill ha selektiv vägran — vägra vapen, svara på allt annat — ger en LoRA- eller DPO-fine-tuning, eller ett skyddsräcke i systemprompten, dig en kontrollmekanism. Abliteration är en trubbig, global redigering; den kan inte skära ut en enda kategori.
Om du vill experimentera reversibelt, börja med aktiveringsablation vid inferens istället för att ändra vikter. Du kan jämföra vägran och följsamhet på samma kontrollpunkt och sedan genomföra vikteredigeringen endast om beteendet är det du vill ha.
Säkerhetsgränsen — läs detta innan du använder den
En ablitererad modell har inga inbyggda skyddsräcken. För en justerad modell är vägransmekanismen skyddsräcket; om man tar bort den lämnar de råa vikterna svaren på allt som basmodellen vet hur man svarar på. Inget i projektionen tillför säkerhet, och inget nedströms fångar upp utdata.
De legitima användningsområdena är forskningsrelaterade: tolkningsbarhet (att studera var vägran ligger i vikterna och vad mer den riktningen styr), red-teaming och guardrail-utvärdering (testa dina egna säkerhetslager mot en modell som inte självcensurerar), och översäkerhetsmätning (minskningen från 5,6 % till 0,4 % i XSTest kvantifierar hur ofta anpassade modeller avvisar godartade indata). I varje fall är modellen föremålet för studien, inte leverabeln.
Gränsen är inte dekorativ:
• Enbart forskning — inte för produktion, slutanvändarprodukter eller interna verktyg.
• Inga skyddsräcken — utdata filtreras inte; du äger dem och konsekvenserna.
• En licens är inte ett säkerhetscertifikat — Apache 2.0 tillåter användning, men välsignar den inte.
Båda Hugging Face-repon — Qwen3.8-27B-Uncensored-FP8 och GGUF-ompaketeringen Qwen3.8-27B-Uncensored-GGUF (publicerad 2026-08-16) — är behörighetsbegränsade: du bekräftar begränsningen till forskningsändamål innan nedladdningen startar.

Slutsats
Abliteration är ett av de renaste resultaten inom LLM-tolkbarhet: en enda linjär riktning i residualströmmen förmedlar ett beteende som säkerhetsträning lade ner enorm beräkningskraft på att installera, och en rank-1-viktprojektion kan ta bort det utan en träningskörning. Det uppmätta fallet — Qwen3.8-27B-Uncensored-FP8 — visar att redigeringen är kirurgisk: vägran kollapsar från 64–99 % till 0–6 %, övervägran sjunker till en bråkdel av sig själv (5,6 % → 0,4 %) och förmågorna håller sig inom ±1,3 punkter. Det visar också exakt varför detta är ett forskningsverktyg och inte en produkt: inga skyddsräcken, kvarvarande friskrivningar och en gräns som lägger ansvaret på dig. Använd det för att förstå vägran, testa dina skyddsräcken och mäta överdriven säkerhet — inte för att placera det framför användare.
Qwen3.8-27B-Uncensored-FP8 är en forskningsartefakt under Apache 2.0 — åtkomstbegränsad, inte en värdbaserad tjänst här. Ladda ner vikterna på Hugging Face
