Hero-kaart voor een artikel getiteld 'Abliteration, uitgelegd', die weigeringsverwijdering toont als een bewerking op gewichtsniveau zonder training.
Guides & Insights

Abliteration, uitgelegd: hoe het verwijderen van weigeringen werkt zonder enige training

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Abliteration verwijdert het weigeringsgedrag van een LLM — de 'daar kan ik niet bij helpen'-reflex — met een gewichtswijziging en zonder trainingsrun. Het werkt omdat weigering wordt gemedieerd door een enkele richting in de residustroom van het model: vind die richting en trek deze af van de matrices die naar de stroom schrijven, en het model stopt met weigeren terwijl het zijn capaciteiten behoudt. Het duidelijkste publieke voorbeeld is Qwen3.8 27B Uncensored (Aggressive), waarvan de modelkaart laat zien dat weigering van schadelijke prompts instort van 99,0% naar 0,0% op AdvBench, terwijl MMLU zelfs een tiende punt omhooggaat. Dit is hoe het mechanisme werkt, wat de gemeten cijfers zeggen, en waar de grens ligt.

Dit is geen fine-tuning, geen RLHF en geen jailbreak-prompt. Abliteratie is een interpreteerbaarheidsresultaat dat is omgezet in lineaire algebra: een paper uit 2024 toonde aan dat één richting in de interne representatie een gedrag controleert waar veiligheidstraining enorm veel moeite in heeft gestoken, en dat dat uitgeschakeld kan worden door de gewichten direct te bewerken. Omdat de bewerking een projectie is, is het goedkoop, reproduceerbaar op één GPU, en laat het een normaal, deelbaar checkpoint achter — daarom zijn geabliteerde builds van open modellen, waaronder de Qwen3.8-27B-familie, de standaardmanier geworden om 'ongecensureerde' onderzoekscheckpoints te produceren.

De weigeringsrichting: één vector in een stroom van vele duizenden dimensies.

In een transformer gaat elke token door een residustroom — de doorlopende representatie waar lagen uit lezen en naar schrijven. De attention- en MLP-blokken van elke laag nemen de stroom als invoer en voegen hun uitvoer eraan toe. De stroom is in feite het werkgeheugen van het model: één vector per tokenpositie, met een dimensie gelijk aan de breedte van het model.

Het artikel uit 2024 dat dit allemaal is begonnen — Andy Arditi en collega's, "Weigering in taalmodellen wordt gemedieerd door één richting" (arXiv:2406.11717, NeurIPS 2024) — mat hoe die stroomvectoren eruitzien wanneer een chatmodel op het punt staat te weigeren versus wanneer het gehoorzaamt. Over 13 open-weight chatmodellen van 1,8B tot 72B parameters, was het antwoord opvallend consistent: het verschil is in wezen één richting. Bij het laatste token heeft de residustroom een grote component langs één enkele weigeringsrichting wanneer het model weigert, en bijna geen wanneer het gehoorzaamt. De geometrie komt overeen over schadecategorieën, daarom concentreert de projectie zich op de eerste singuliere vector in plaats van zich uit te spreiden over een hele deelruimte.

Om die richting te vinden, verzamel je activaties op twee sets prompts — schadelijk en onschadelijk — en neem je het gemiddelde van de last-token-residuen voor elke set. De weigeringsrichting is ongeveer gemiddelde(schadelijk) − gemiddelde(onschadelijk), genormaliseerd tot eenheidslengte. Het oorspronkelijke artikel gebruikte hiervoor lineaire probing; productieversies zoals Qwen3.8-27B-Uncensored-FP8 schatten een enkele richting (k=1) als een door massale activatie gemaskeerd gemiddeldeverschil van de schadelijke en onschadelijke last-token-residuen. Geen labels behalve de schadelijk/onschadelijk-splitsing, geen gradiënt, geen training.

De wijziging: trek de richting af van elke matrix die naar de stream schrijft.

Zodra je de weigeringsrichting hebt r — een eenheidsvector in de residustroom — is de interventie een rang-1-projectie. Elke gewichtsmatrix waarvan de uitvoer aan de residustroom wordt toegevoegd, kan van r worden "opgeschoond":

W' = W − r(rᵀW)

In woorden: bereken de outputcomponent van elke matrix die langs r wijst, en verwijder deze. De matrices die naar de stream schrijven zijn de outputprojecties — de aandachtsoutputprojectie (o_proj), de MLP-downprojectie (down_proj), en de rijruimte van de token-embedding. De bewerking draait in float32, duurt enkele minuten op één GPU, en heeft geen optimizer en geen trainingsdata nodig behalve de activatieparen die je al hebt verzameld.

Er zijn twee manieren om een richting te verwijderen, en het is de moeite waard om ze apart te houden:

• Activatie-ablatie — haak in op de forward pass en trek de r-component af van de live-activaties. Omkeerbaar, geen gewichten aangeraakt; ideaal voor experimenten die weigering en naleving op hetzelfde checkpoint vergelijken.

• Gewichtsorthogonalisatie — pas de projectie toe op de gewichten zelf, waardoor een permanent, deelbaar checkpoint ontstaat. Dit is waar "abliteration" naar verwijst, en het is wat er in de ongecensureerde modelrepositories wordt meegeleverd.

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

De orthogonalisatie is opzettelijk bot. Het verwijdert de weigeringscomponent uit de gewichten en niets meer. Het kan geen kennis toevoegen, de redenering verbeteren of het model waarheidsgetrouwer maken — daarom gedraagt een ge-abliteerd model zich als zijn basis, minus de weigeringsreflex.

Hoe 131 matrices eruitzien op een echte build: Qwen3.8-27B-Uncensored-FP8

Om dit concreet te maken: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, gepubliceerd op 2026-08-15, Apache 2.0) is een abliterated build van Qwen3.8-27B. Qwen3.8-27B is een hybrid attention-model — 16 full-attention-lagen plus 48 Gated DeltaNet-lineaire lagen, in totaal 64 lagen, plus een multi-token-predictie (MTP)-head. De build orthogonaliseerde de weigeringsrichting uit 131 residuele schrijfmatrices:

• self_attn.o_proj — 17 matrices (16 volledige attention-lagen + MTP)

• linear_attn.out_proj — 48 matrices (de Gated DeltaNet-lagen)

• mlp.down_proj — 65 matrices (64 lagen + MTP)

• embed_tokens (rijruimte) — 1 matrix

De weigeringsrichting werd geschat op laag 38 — round(0.6 × 64), de laag waar de richting het meest geconcentreerd is — en de maximale restlekkage na de bewerking was 1.8e-2. De vision-toren werd onaangetast gelaten en de MTP-head werd consistent met het lichaam geablitereerd, zodat speculatieve decodering stroomafwaarts geen weigeringen meer introduceert. De bewerking werd berekend in float32 en vervolgens opnieuw gekwantiseerd naar block-FP8 met hetzelfde schema als de officiële Qwen3.8-27B-FP8-checkpoint; de build rapporteert 99,9% identieke FP8-codes ten opzichte van de officiële checkpoint, waaraan je kunt zien dat de herkwantisering de bewerking niet door elkaar heeft gehaald.

Gemeten: weigering stort in, capaciteiten blijven overeind

Alle onderstaande cijfers zijn afkomstig van de modelkaart voor Qwen3.8-27B-Uncensored-FP8, gepubliceerd op 2026-08-15 en geëvalueerd met vLLM. Ze zijn door de leverancier gerapporteerd — niet onafhankelijk gereproduceerd — en ze vormen de meest complete openbare voor/na-vergelijking van een abliteratie-bewerking die beschikbaar is.

Weigering op benchmarks voor schadelijke prompts, denken uit (weigeringspercentage; lager betekent meer ongecensureerd):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150): 97.3% → 2.0%

• HarmBench standaard (n=150): 98,7% → 2,7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench schadelijk (n=100): 94,0% → 0,0%

• SimpleSafetyTests (n=50): 64.0% → 6.0%

In de hele suite daalt de weigering op schadelijke prompts van 64–99% op de basis naar 0–6% na de bewerking. Met denken ingeschakeld (enable_thinking=true) is de resterende weigering zelfs lager — ≤1.7% overal, met de meeste benchmarks op precies 0%. De asymmetrie is informatief: de weigeringsrichting bevindt zich voornamelijk in het snelle, niet-denkende pad, dus zodra het uit de output head is verwijderd, is er weinig over waar het redeneerspoor over kan struikelen.

Overmatige weigering — onschuldige prompts die het basismodel ten onrechte weigert — daalt ook: XSTest-safe (n=250) gaat van 5,6% naar 0,4%. Het verwijderen van de richting stopt niet alleen schadelijke weigeringen; het weerhoudt het model ervan onschuldige verzoeken te weigeren die er alleen maar riskant uitzagen. Dat getal is een stille aanwijzing dat een deel van de 'veiligheid' van een basismodel een valse-alarmbelasting is.

Mogelijkheden, allemaal binnen ±1,3 punten van de basis:

• MMLU (0-shot letter): 84,3% → 84,7% (+0,4)

• GSM8K (CoT): 90.0% → 88.7% (−1.3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU (0-shot): 81,4% → 80,8% (−0,6)

WikiText-2 perplexiteit is 6,96. Met andere woorden, de bewerking is chirurgisch gericht: het verwijdert een gedrag dat bovenop de kennis was geïnstalleerd en laat de kennis — gemeten, althans, op deze evals — in wezen intact.

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

De eerlijke kanttekeningen

Drie dingen die de cijfers in de kop je niet vertellen. Ten eerste, abliteratie is geen zuivere aan/uit-schakelaar. Ongeveer 30–50% van de reacties op schadelijke prompts begint nog steeds met een korte veiligheidsdisclaimer — het model gehoorzaamt, maar een zin met voorbehoud overleeft als een trainingsartefact. De eenrichtingsbewerking verwijdert niet elk spoor van het trainingsgedrag.

Ten tweede is weigering redundant gecodeerd. Eén richting verwijdert het grootste deel ervan, maar sommige categorieën zijn dieper ingebed dan andere, en te agressieve ablatie kan het model in wartaal doen vervallen — over-abliteratie is een reële faalmodus, geen theoretische. Je draait aan een knop, en de knop heeft een vloer.

Ten derde, de capability-kosten zijn richtings- en laagafhankelijk. Deze build kwam binnen ±1,3 punten omdat de richting op de juiste laag werd geschat en de projectie consequent werd toegepast. Verplaats de schatting naar de verkeerde laag, of drijf de projectie verder op, en dezelfde methode kan het redeneren meetbaar aantasten. Het resultaat wordt niet gegarandeerd door de methode — het wordt verdiend door de build.

Wanneer abliteration de verkeerde tool is

Als je een meegaande assistent wilt, pas dan geen abliteratie toe — je wilt de gealigneerde basis-checkpoint, niet een build waaruit weigeringen zijn verwijderd. Wil je een Qwen3.8-27B zonder weigeringen evalueren zonder 30GB aan gewichten te downloaden, dan wordt de modelfamilie gehost op OrcaRouter (obsidian/Qwen3.8-27B, $0,40 in / $4,21 uit per 1M tokens, 262K context, vermeld op 2026-08-15), waarbij de volledig ontgrendelde variant alleen toegankelijk is voor beveiligingsonderzoekers en red teams.

Als je selectieve weigering wilt — wapens weigeren, al het andere beantwoorden — geeft een LoRA- of DPO-finetune, of een system-prompt-guardrail, je een controlemiddel. Abliteration is een botte, globale bewerking; het kan niet één categorie uitsnijden.

Als je omkeerbaar wilt experimenteren, begin dan met {{1}}activatie-ablatie tijdens de inferentie{{/1}} in plaats van het bewerken van gewichten. Je kunt {{2}}weigering en naleving{{/2}} op dezelfde checkpoint vergelijken en pas overgaan tot de gewichtswijziging als het gedrag is wat je wilt.

De veiligheidsgrens — lees dit voordat u het gebruikt

Een abliterated model heeft geen ingebouwde beveiligingen. Voor een aligned model is het weigeringsmechanisme de beveiliging; het verwijderen ervan laat de ruwe gewichten alles beantwoorden wat het basismodel weet te beantwoorden. Niets in de projectie voegt veiligheid toe, en stroomafwaarts wordt er niets opgevangen.

De legitieme toepassingen zijn de onderzoeksgerichte: interpreteerbaarheid (bestuderen waar weigering zich in de gewichten bevindt en wat die richting nog meer controleert), red-teaming en evaluatie van vangrails (het testen van je eigen veiligheidslagen tegen een model dat zichzelf niet censureert), en meting van overmatige veiligheid (de daling van 5,6% → 0,4% op de XSTest kwantificeert hoe vaak afgestemde modellen goedaardige invoer weigeren). In elk geval is het model het object van studie, niet het eindproduct.

De grens is niet decoratief:

• Alleen voor onderzoek — niet voor productie, eindgebruikersproducten of interne tools.

• Geen beveiligingen — uitvoer wordt niet gefilterd; u bent verantwoordelijk voor de resultaten en de gevolgen.

• Een licentie is geen veiligheidscertificaat — Apache 2.0 staat gebruik toe; het keurt het niet goed.

Beide Hugging Face-repo's — Qwen3.8-27B-Uncensored-FP8 en de GGUF-herverpakking Qwen3.8-27B-Uncensored-GGUF (gepubliceerd op 2026-08-16) — zijn afgeschermd: je erkent de onderzoeksbeperking voordat de download begint.

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

Kortom

Abliteration is een van de meest heldere resultaten in LLM-interpretabiliteit: een enkele lineaire richting in de residustroom medieert een gedrag dat veiligheidstraining enorme rekenkracht kostte om te installeren, en een rang-1-gewichtsprojectie kan het verwijderen zonder een trainingsrun. Het gemeten geval — Qwen3.8-27B-Uncensored-FP8 — laat zien dat de bewerking chirurgisch is: weigering stort in van 64–99% naar 0–6%, overmatige weigering daalt tot een fractie van zichzelf (5,6% → 0,4%), en capaciteiten blijven binnen ±1,3 punten. Het laat ook precies zien waarom dit een onderzoekstool is en geen product: geen guardrails, resterende disclaimers, en een grens die de verantwoordelijkheid bij jou legt. Gebruik het om weigering te begrijpen, je guardrails te testen en overmatige veiligheid te meten — niet om voor gebruikers te plaatsen.

Qwen3.8-27B-Uncensored-FP8 is een onderzoeksartefact onder Apache 2.0 — gated, geen gehoste service hier. Download de gewichten op Hugging Face