Hero-Karte für einen Artikel mit dem Titel „Abliteration, erklärt“, die die Entfernung von Refusals als Bearbeitung auf Gewichtsebene ohne Training zeigt.
Guides & Insights

Abliteration, erklärt: Wie das Entfernen von Verweigerungen ohne jegliches Training funktioniert

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Abliteration entfernt das Verweigerungsverhalten eines LLM — den „Damit kann ich nicht helfen“-Reflex — durch einen Gewichtsedit und ohne Trainingslauf. Das funktioniert, weil Verweigerung durch eine einzelne Richtung im Residualstrom des Modells vermittelt wird: Finde diese Richtung, subtrahiere sie von den Matrizen, die in den Strom schreiben, und das Modell hört auf zu verweigern, während es seine Fähigkeiten behält. Das sauberste öffentliche Beispiel ist Qwen3.8 27B Uncensored (Aggressive), dessen Modellkarte zeigt, dass die Verweigerung bei schädlichen Aufforderungen auf AdvBench von 99.0% auf 0.0% fällt, während MMLU tatsächlich um einen Zehntelpunkt steigt. So funktioniert der Mechanismus, das sagen die gemessenen Zahlen, und hier verläuft die Grenze.

Das ist kein Feintuning, kein RLHF und kein Jailbreak-Prompt. Abliteration ist ein Interpretierbarkeits-Ergebnis, das in lineare Algebra übersetzt wurde: Ein Paper aus dem Jahr 2024 zeigte, dass eine Richtung in der internen Repräsentation ein Verhalten steuert, das das Sicherheitstraining unter enormem Aufwand etabliert hat, und dass man es abschalten kann, indem man die Gewichte direkt bearbeitet. Da die Bearbeitung eine Projektion ist, ist sie kostengünstig, auf einer einzigen GPU reproduzierbar und hinterlässt einen normalen, teilbaren Checkpoint – weshalb abliterierte Builds offener Modelle, einschließlich der Qwen3.8-27B-Familie, zum Standardweg geworden sind, um „unzensierte“ Forschungs-Checkpoints zu erzeugen.

Die Ablehnungsrichtung: ein Vektor in einem vieltausenddimensionalen Strom.

In einem Transformer durchläuft jedes Token einen Residualstrom — die laufende Repräsentation, aus der die Schichten lesen und in die sie schreiben. Die Aufmerksamkeits- und MLP-Blöcke jeder Schicht nehmen den Strom als Eingabe und fügen ihm ihre Ausgabe wieder hinzu. Der Strom ist praktisch das Arbeitsgedächtnis des Modells: ein Vektor pro Token-Position, dessen Dimension der Breite des Modells entspricht.

Die 2024 erschienene Arbeit, die all das ins Rollen brachte – Andy Arditi und Kollegen, „Ablehnung in Sprachmodellen wird durch eine einzelne Richtung vermittelt“ (arXiv:2406.11717, NeurIPS 2024) – untersuchte, wie diese Stream-Vektoren aussehen, wenn ein Chat-Modell im Begriff ist, abzulehnen, im Vergleich dazu, wenn es zustimmt. Bei 13 Open-Weight-Chat-Modellen mit 1,8 bis 72 Milliarden Parametern, war die Antwort erstaunlich konsistent: Der Unterschied besteht im Wesentlichen in einer einzigen Richtung. Beim letzten Token weist der Residualstrom eine große Komponente entlang einer einzigen Ablehnungsrichtung auf, wenn das Modell ablehnt, und fast keine, wenn es zustimmt. Die Geometrie ist über Schadenskategorien hinweg ausgerichtet, weshalb sich die Projektion auf den ersten Singulärvektor konzentriert, anstatt sich über einen ganzen Unterraum zu verteilen.

Um diese Richtung zu finden, sammelt man Aktivierungen auf zwei Gruppen von Prompts – schädlichen und harmlosen – und berechnet den Mittelwert der Last-Token-Residuen für jede Gruppe. Die Verweigerungsrichtung ist ungefähr mean(harmful) − mean(harmless), auf Einheitslänge normalisiert. Das ursprüngliche Paper verwendete dafür lineares Probing; Produktions-Builds wie Qwen3.8-27B-Uncensored-FP8 schätzen eine einzelne Richtung (k=1) als massiv-aktivierungsmaskierte Mittelwertdifferenz der schädlichen und harmlosen Last-Token-Residuen. Keine Labels über die schädlich/harmlos-Aufteilung hinaus, kein Gradient, kein Training.

Die Änderung: Subtrahiere die Richtung von jeder Matrix, die in den Stream schreibt.

Sobald die Verweigerungsrichtung r gegeben ist — ein Einheitsvektor im Residualstrom — ist der Eingriff eine Rang-1-Projektion. Jede Gewichtsmatrix, deren Ausgabe zum Residualstrom addiert wird, kann von r "gereinigt" werden:

W' = W − r(rᵀW)

In Worten: Man berechnet die Ausgangskomponente jeder Matrix, die entlang r zeigt, und entfernt sie. Die Matrizen, die in den Stream schreiben, sind die Ausgangsprojektionen — die Aufmerksamkeits-Ausgangsprojektion (o_proj), die MLP-Abwärtsprojektion (down_proj) und der Zeilenraum des Token-Embeddings. Die Bearbeitung läuft in float32, dauert Minuten auf einer GPU und benötigt weder einen Optimierer noch Trainingsdaten über die bereits gesammelten Aktivierungspaare hinaus.

Es gibt zwei Möglichkeiten, eine Richtung zu entfernen, und es lohnt sich, sie getrennt zu halten:

• Aktivierungsablation — den Forward-Pass abfangen und die r-Komponente von den Live-Aktivierungen subtrahieren. Reversibel, ohne Gewichte zu verändern; ideal für Experimente, die Ablehnung und Compliance auf demselben Checkpoint vergleichen.

• Gewichtsorthogonalisierung — wende die Projektion auf die Gewichte selbst an, was einen permanenten, teilbaren Checkpoint erzeugt. Das ist es, worauf sich „abliteration“ bezieht, und es ist das, was in den unzensierten Modell-Repos ausgeliefert wird.

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

Die Orthogonalisierung ist bewusst grob. Sie entfernt die Verweigerungskomponente aus den Gewichten und sonst nichts. Sie kann kein Wissen hinzufügen, das Denken verbessern oder das Modell wahrheitsgetreuer machen – weshalb sich ein abliteriertes Modell wie sein Basismodell verhält, nur ohne den Verweigerungsreflex.

Wie 131 Matrizen auf einem echten Build aussehen: Qwen3.8-27B-Uncensored-FP8

Um das konkret zu machen: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, veröffentlicht am 15.08.2026, Apache 2.0) ist ein abliterierter Build von Qwen3.8-27B. Qwen3.8-27B ist ein Hybrid-Attention-Modell — 16 Full-Attention-Layer plus 48 Gated-DeltaNet-Linear-Layer, insgesamt 64 Layer, plus ein Multi-Token-Prediction-Head (MTP-Head). Der Build hat die Refusal-Richtung aus den 131 Residual-Writing-Matrizen:

• self_attn.o_proj — 17 Matrizen (16 Full-Attention-Schichten + MTP)

• linear_attn.out_proj — 48 Matrizen (die Gated DeltaNet-Schichten)

• mlp.down_proj — 65 Matrizen (64 Layer + MTP)

• embed_tokens (Zeilenraum) — 1 Matrix

Die Refusal-Richtung wurde auf Schicht 38 — round(0.6 × 64), der Schicht, in der die Richtung am stärksten konzentriert ist — und das maximale Rest-Leakage nach der Bearbeitung betrug 1.8e-2. Der Vision Tower wurde unangetastet gelassen, und der MTP-Head wurde konsistent mit dem Körper abliteriert, sodass spekulatives Dekodieren nachgelagert keine Refusals wieder einführt. Die Bearbeitung wurde in float32 berechnet und dann mit demselben Schema wie der offizielle Qwen3.8-27B-FP8-Checkpoint in Block-FP8 re-quantisiert; der Build meldet 99,9 % identische FP8-Codes gegenüber dem offiziellen Checkpoint, und daran erkennt man, dass die Re-Quantisierung die Bearbeitung nicht durcheinandergebracht hat.

Gemessen: Verweigerung kollabiert, Fähigkeiten bleiben erhalten.

Alle untenstehenden Zahlen stammen aus der Modellkarte für Qwen3.8-27B-Uncensored-FP8, veröffentlicht am 15.08.2026 und mit vLLM evaluiert. Sie sind vom Anbieter gemeldet — nicht unabhängig reproduziert — und sind der vollständigste öffentliche Vorher/Nachher-Vergleich einer Abliteration-Bearbeitung, der verfügbar ist.

Verweigerung bei Benchmarks mit schädlichen Prompts, Denken aus (Verweigerungsrate; niedriger bedeutet unzensierter):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150): 97,3 % → 2,0 %

• HarmBench-Standard (n=150): 98,7 % → 2,7 %

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench schädlich (n=100): 94,0 % → 0,0 %

• SimpleSafetyTests (n=50): 64.0% → 6.0%

In der gesamten Suite sinkt die Verweigerung bei schädlichen Prompts von 64–99 % im Basismodell auf 0–6 % nach der Bearbeitung. Bei aktiviertem Denken (enable_thinking=true) ist die verbleibende Verweigerung sogar noch geringer — überall ≤1,7 %, bei den meisten Benchmarks exakt 0 %. Die Asymmetrie ist aufschlussreich: Die Verweigerungsrichtung liegt hauptsächlich im schnellen, nicht denkenden Pfad, sodass nach ihrer Entfernung aus dem Ausgabekopf für die Denkspur kaum noch etwas übrig bleibt, worüber sie stolpern könnte.

Übermäßige Verweigerung – gutartige Prompts, die das Basismodell zu Unrecht ablehnt – nimmt ebenfalls ab: XSTest-safe (n=250) geht von 5,6 % auf 0,4 %. Das Entfernen der Richtung stoppt nicht nur schädliche Ablehnungen; es hält das Modell davon ab, harmlose Anfragen abzulehnen, die lediglich riskant wirkten. Diese Zahl ist ein stilles Argument dafür, dass ein Teil der „Sicherheit“ eines Basismodells eine Fehlalarmsteuer ist.

Fähigkeiten, alle innerhalb von ±1,3 Punkten der Basis:

• MMLU (0-shot-Buchstabe): 84.3% → 84.7% (+0.4)

• GSM8K (CoT): 90,0 % → 88,7 % (−1,3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU (0-shot): 81,4 % → 80,8 % (−0,6)

Die WikiText-2-Perplexität beträgt 6,96. Mit anderen Worten, die Bearbeitung ist chirurgisch gezielt: Sie entfernt ein Verhalten, das der Wissensbasis aufgesetzt wurde, und lässt das Wissen – zumindest gemessen an diesen Evaluierungen – im Wesentlichen intakt.

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

Die ehrlichen Vorbehalte

Drei Dinge, die die Zahlen in der Überschrift nicht verraten. Erstens: Abliteration ist kein sauberer Ein-/Ausschalter. Bei etwa 30–50 % der Antworten auf schädliche Prompts wird weiterhin ein kurzer Sicherheitshinweis vorangestellt – das Modell kommt der Aufforderung nach, aber ein einschränkender Satz bleibt als Trainingsartefakt erhalten. Die unidirektionale Bearbeitung entfernt nicht jede Spur des Trainingsverhaltens.

Zweitens ist die Verweigerung redundant kodiert. Eine Richtung entfernt den Großteil davon, aber einige Kategorien sind tiefer eingebettet als andere, und zu aggressive Ablation kann das Modell ins Kauderwelsch kippen lassen — Über-Abliteration ist ein echter Fehlermodus, kein theoretischer. Du drehst an einem Regler, und der Regler hat einen Boden.

Drittens, sind die Fähigkeitskosten richtungs- und schichtabhängig. Dieser Build landete innerhalb von ±1,3 Punkten, weil die Richtung auf der richtigen Schicht geschätzt und die Projektion konsistent angewendet wurde. Verschiebt man die Schätzung auf die falsche Schicht oder verstärkt die Projektion, kann dieselbe Methode das Denken messbar beeinträchtigen. Das Ergebnis wird nicht durch die Methode garantiert — es wird durch den Build verdient.

Wenn Abliteration das falsche Werkzeug ist

Wenn Sie einen konformen Assistenten möchten, abliterieren Sie nicht — Sie wollen den alignierten Basis-Checkpoint, kein Build mit entfernten Refusals. Wenn Sie ein Qwen3.8-27B mit entfernten Refusals evaluieren möchten, ohne 30 GB Gewichte herunterzuladen, ist die Familie auf OrcaRouter verfügbar (obsidian/Qwen3.8-27B, 0,40 $ Input / 4,21 $ Output pro 1 M Token, 262K Kontext, gelistet am 15.08.2026), wobei die vollständig entsperrte Variante für Sicherheitsforscher und Red Teams zugangsbeschränkt ist.

Wenn Sie selektive Verweigerung möchten — Waffen ablehnen, alles andere beantworten — bieten Ihnen ein LoRA- oder DPO-Feintuning oder eine System-Prompt-Guardrail eine Kontrollfläche. Abliteration ist eine grobe, globale Änderung; sie kann keine einzelne Kategorie herauslösen.

Wenn Sie reversibel experimentieren möchten, beginnen Sie mit Aktivierungsablation zur Inferenzzeit, anstatt Gewichte zu bearbeiten. Sie können Ablehnung und Compliance am selben Checkpoint vergleichen und sich erst dann auf die Gewichtsänderung festlegen, wenn das Verhalten dem entspricht, was Sie möchten.

Die Sicherheitsgrenze — lesen Sie dies, bevor Sie es verwenden.

Ein abliteriertes Modell hat keine eingebauten Leitplanken. Bei einem alignierten Modell ist der Verweigerungsmechanismus die Leitplanke; entfernt man ihn, antworten die rohen Gewichte auf alles, was das Basismodell zu beantworten weiß. Nichts in der Projektion erhöht die Sicherheit, und nichts Nachgeschaltetes fängt die Ausgabe ab.

Die legitimen Verwendungszwecke sind die der Forschung: Interpretierbarkeit (die Untersuchung, wo die Verweigerung in den Gewichten verankert ist und was diese Richtung sonst noch steuert), Red-Teaming und Guardrail-Evaluierung (das Testen der eigenen Sicherheitsschichten gegen ein Modell, das sich nicht selbst zensiert) und Messung von Übersicherheit (der Rückgang von 5,6 % auf 0,4 % im XSTest quantifiziert, wie oft alignierte Modelle harmlose Eingaben ablehnen). In jedem Fall ist das Modell Gegenstand der Untersuchung, nicht das Endprodukt.

Die Grenze ist keine Dekoration:

• Nur für Forschungszwecke — nicht für Produktion, Endbenutzerprodukte oder interne Tools.

• Keine Schutzvorkehrungen — Ausgaben werden nicht gefiltert; Sie tragen die Verantwortung für sie und die Konsequenzen.

Eine Lizenz ist kein Sicherheitszertifikat — Apache 2.0 erlaubt die Nutzung; es empfiehlt sie nicht.

Beide Hugging-Face-Repos – Qwen3.8-27B-Uncensored-FP8 und die GGUF-Neuverpackung Qwen3.8-27B-Uncensored-GGUF (veröffentlicht am 16. August 2026) – sind zugriffsbeschränkt: Sie bestätigen die Beschränkung auf reine Forschungszwecke, bevor der Download beginnt.

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

Fazit

Abliteration ist eines der saubersten Ergebnisse in der LLM-Interpretierbarkeit: Eine einzelne lineare Richtung im Residual-Stream vermittelt ein Verhalten, dessen Etablierung das Safety-Training enorme Rechenleistung gekostet hat, und eine Rang-1-Gewichtsprojektion kann es ohne Trainingslauf entfernen. Der gemessene Fall — Qwen3.8-27B-Uncensored-FP8 — zeigt, dass der Eingriff chirurgisch ist: Die Verweigerung fällt von 64–99 % auf 0–6 %, Überverweigerung sinkt auf einen Bruchteil ihres bisherigen Werts (5,6 % → 0,4 %), und die Fähigkeiten bleiben innerhalb von ±1,3 Punkten erhalten. Er zeigt auch genau, warum dies ein Forschungsinstrument und kein Produkt ist: keine Guardrails, Resthinweise und eine Grenze, die die Verantwortung auf dich legt. Nutze es, um Verweigerung zu verstehen, deine Guardrails zu testen und Übersicherheit zu messen — nicht, um es vor Nutzern zu präsentieren.

Qwen3.8-27B-Uncensored-FP8 ist ein Forschungsartefakt unter Apache 2.0 — zugangsbeschränkt, kein hier gehosteter Dienst. Gewichte auf Hugging Face herunterladen