Titelkarte für den unzensierten LLM-Erklärer, die ein Schema eines Modells zeigt, bei dem eine einzelne hervorgehobene Richtung aus seinem internen Stream herausgehoben und durchgestrichen wird, mit Chips, auf denen REFUSAL REMOVED, RESEARCH-ONLY und APACHE 2.0 stehen, sowie Symbolen für Interpretierbarkeit, Red-Teaming und Guardrail-Evaluierung.
Guides & Insights

Das unzensierte LLM, erklärt: Die Abliteration-Technik, die Forschungsnutzung und die Grenze, die man nicht überschreitet

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ein unzensiertes LLM ist ein Sprachmodell, dessen Verweigerungsverhalten — der Teil des Modells, der eine Anfrage ablehnt, anstatt sie zu beantworten — absichtlich entfernt wurde.Die meisten werden durch Abliteration erstellt: Ein Forscher findet die einzelne interne Richtung, die Verweigerung vermittelt, und löscht sie aus den Gewichten, wobei der Rest des Modells weitgehend intakt bleibt. Das Ergebnis ist ein Modell, das antwortet, wo ein normales Modell Nein sagen würde — genau deshalb wird es untersucht und genau deshalb ist es nicht für die Produktion gedacht. Wir haben ein solches Build, Qwen3.8-27B-Uncensored-FP8, ein abliteriertes und FP8-quantisiertes Qwen3.8 27B, auf Hugging Face unter Apache 2.0 als reines Forschungsartefakt veröffentlicht. Diese Seite ist die Kategorie-Erläuterung: was diese Modelle sind, die Forschung, die sie rechtfertigt, wie man sicher mit ihnen arbeitet und wo die Grenze verläuft.

Eine bestimmte Rahmung hält die ganze Kategorie ehrlich, also sage ich es gleich vorweg: Ein unzensiertes Modell ist nicht klüger, wahrhaftiger oder leistungsfähiger als das Modell, aus dem es hervorgegangen ist. Es sind dieselben Gewichte, von denen ein Verhalten abgezogen wurde. Alles, was es noch weiß, wusste es schon immer – geändert hat sich nur, dass es sich nicht mehr weigert. Das macht es zu einem wirklich nützlichen Objekt für die Sicherheitsforschung und zu einer wirklich unsicheren Sache für den Einsatz. Beide Hälften dieses Satzes sind tragend, und der Rest dieser Seite erklärt beides.

Was „uncensored" eigentlich bedeutet

• Oder greifen Sie über unsere Modellkarte darauf zu, die die Preis- und Benchmark-Details enthält.

Die Technik stammt aus einem Interpretierbarkeits-Ergebnis von 2024. In „Refusal in Language Models Is Mediated by a Single Direction“ (Arditi et al., arXiv:2406.11717, NeurIPS 2024) zeigten die Autoren, dass bei 13 offenen Chat-Modellen mit einer Größe von 1,8B bis 72B Parametern die Verweigerung durch einen ungefähr eindimensionalen Unterraum des Residualstroms gesteuert wird – dem internen Zustand, der Informationen zwischen den Schichten überträgt. Entfernt man diese Richtung, hört das Modell auf zu verweigern; fügt man sie wieder hinzu, verweigert das Modell auch harmlose Anfragen.

Abliteration operationalisiert diese Erkenntnis: Man schätzt die Richtung und orthogonalisiert sie dann aus den Gewichtsmatrizen heraus, die in den Residualstrom schreiben. Bei unserem eigenen Build, Qwen3.8-27B-Uncensored-FP8, wurde die Refusal-Richtung auf einer einzelnen Ebene geschätzt und aus 131 Residual-Schreibmatrizen entfernt, während der Vision-Turm unberührt blieb. Was überlebt, ist dasselbe Wissen, dasselbe Reasoning und derselbe 262.144-Token-Kontext – ohne Refusal. Und um das Etikett präzise zu machen: „uncensored“ bedeutet nicht aligned oder sicher. Es bedeutet, dass der Schutz abgeschaltet ist. Wir werden darauf zurückkommen, was das von dir verlangt.

Die Forschung, die sie hervorgebracht hat

Das Ergebnis zur Verweigerungsrichtung bewirkte zwei Dinge gleichzeitig. Wissenschaftlich gesehen erklärte es ein Sicherheitsverhalten mechanistisch: Es gibt eine reale, auffindbare Schaltung, die ein Modell dazu bringt, Nein zu sagen. Praktisch zeigte es, wie zerbrechlich Alignment sein kann — eine einzige Rang-1-Änderung an den Gewichten kann das Verhalten abschalten, ganz ohne Feintuning. Das ist kein Fehler in einem einzelnen Labor-Modell; die Autoren reproduzierten es bei über einem Dutzend Chat-Modellen.

Bis 2026 ist die Technik zu einer Ein-Befehl-Pipeline geworden, was eine zweischneidige Tatsache ist. Heretic, eine Open-Source-Bibliothek, schätzt Refusal-Richtungen pro Schicht und orthogonalisiert sie aus Attention- und MLP-Projektionen heraus; ein Bericht vom Mai 2026 bezifferte die Entfernung der Guardrails bei Metas Llama 3.3 auf etwa 10 Minuten und bei Googles Gemma 4 auf etwa 90 Minuten, mit mehr als 3.500 abgeleiteten Modellen und über 13 Millionen kumulierten Downloads. Abliterix (Wu Wangzhang) schlägt einen vorsichtigeren Weg ein: Es extrahiert eine Refusal-Richtung aus 800 schädlichen und 800 harmlosen Prompts, wendet eine orthogonale Projektion an, liefert die Änderung als Rank-1-LoRA-Adapter aus, sodass die Basisgewichte unangetastet bleiben, und berichtet Refusal-Rate und KL-Divergenz, damit die Capability-Kosten sichtbar bleiben. Bei einem 0.8B-Qwen3.5-Modell meldete es 0 Verweigerungen bei 200 schädlichen Prompts.

Lesen Sie diesen Absatz so, wie es ein Sicherheitsforscher tun würde. Es geht beim Bau dieser Werkzeuge nicht darum, dass jemand die Schutzmechanismen eines Modells zum Spaß entfernt. Es geht darum, dass die Entfernung trivial und öffentlich ist – das Messen, das Untersuchen, wie sie funktioniert, und das Bauen von Schutzmechanismen, die ihr standhalten, ist selbst ein Forschungsprogramm. Das ist Red Teaming im White-Box-Sinn: Man kann ein System nicht verteidigen, bevor man weiß, wie leicht es zu brechen ist.

Warum unzensierte Modelle 2026 populär wurden

Drei Kräfte wirkten zusammen. Erstens die Welle offener Gewichte: Qwen3.8 27B und vergleichbare Modelle werden unter permissiven Lizenzen ausgeliefert, und Abliteration benötigt keinen Trainingslauf – man bearbeitet die Gewichte und quantisiert neu. Zweitens ist das Tooling von Forschungscode zu Ein-Kommando-Bibliotheken gereift, sodass ein kompetenter Ingenieur an einem Nachmittag einen Build erstellen kann. Drittens wurde Hugging Face zum Vertriebskanal, was bedeutet, dass Traction messbar ist.

Unser eigener Datenpunkt: Qwen3.8-27B-Uncensored-FP8, veröffentlicht am 15. August 2026, hatte innerhalb von etwa einem Tag 257 Likes und 4.285 Downloads (verifiziert am 16. August). Es ist nicht so, dass Zehntausende von Menschen ein ungeschütztes Modell einsetzen möchten. Es ist vielmehr so, dass viele Forscher und Ingenieure eines untersuchen möchten — und die Download-Zahlen sind die Nachfragekurve für diese Neugier.

Wofür es gedacht ist: die legitimen Forschungsanwendungen

Hier ist die vertretbare Liste, und es ist die vollständige Liste. Wenn eine Verwendung nicht darauf steht, nimm an, dass sie nicht legitim ist:

• Interpretability — untersuchen, was der Refusal Circuit tatsächlich ist, wo er sich befindet und warum das Entfernen einer Richtung das Verhalten verändert.

• Red-Teaming und Guardrail-Evaluierung – Aufbau einer Moderationsschicht und Testen, ob sie abfängt, was ein Modell ohne Verweigerungslogik produziert.

Übersicherheitsmessung — Quantifizierung, wie oft Basismodelle harmlose Anfragen ablehnen, und deren Abgrenzung von echter Sicherheit.

• Robustheitsforschung — Messung, wie leicht Alignment entfernt werden kann, was wesentliche Informationen für alle liefert, die Safety-Fine-Tuning entwickeln.

• Kontrollierte Sicherheitsexperimente — Benchmark-Suiten wie AdvBench und JailbreakBench existieren genau zu dem Zweck, dass Verweigerungsverhalten auf standardisierte, reproduzierbare Weise gemessen werden kann.

A card titled The research that justifies them, showing three flat icons with short labels: a magnifier over a model layer labeled interpretability, a shield with a crosshair labeled red-teaming, and a checklist over a moderation layer labeled guardrail evaluation.

Allen diesen ist eines gemeinsam: Das Modell ist Gegenstand der Untersuchung, nicht das Ergebnis. Der Output dieser Forschung ist ein Paper, ein Benchmark-Ergebnis oder ein besseres Guardrail — niemals ein Service.

Wie man einen verantwortungsvoll durchführt (wenn man tatsächlich forscht)

Wenn Sie einen legitimen Grund haben, mit einem abliterated model zu arbeiten, sind die Betriebsregeln unkompliziert:

• Führen Sie es lokal aus, in einer Sandbox und idealerweise vollständig vom Netz getrennt. Kein öffentlicher Endpunkt, kein Chat-Dienst, kein gemeinsam genutzter Server.

• Servieren Sie es mit Standard-Tooling — vLLM oder llama.cpp — genauso wie jedes Open-Weights-Modell. Unser Build ist eine Block-FP8-Quantisierung, die auf dem standardmäßigen vLLM-FP8-Kernelpfad läuft, mit intaktem 262K-Kontext, Denk-Umschalter und Tool-Calling.

• Messen, nicht nur reden. Quantifizieren Sie die Ablehnung anhand einer Benchmark-Suite für schädliche Aufforderungen und vergleichen Sie sie mit dem Basismodell; quantifizieren Sie Über-Ablehnung bei harmlosen Aufforderungen; berichten Sie die KL-Divergenz, damit die Fähigkeitsdrift sichtbar wird. Das ist der Unterschied zwischen einem Experiment und einer Anekdote.

A scoreboard card for Qwen3.8-27B-Uncensored-FP8, listing harmful-prompt refusal 0-6% with thinking off versus a 64-99% base, at most 1.7% with thinking on, benign over-refusal 0.4% versus a 5.6% base, MMLU 84.7 versus 84.3, GSM8K 88.7 versus 90.0, and 262,144-token context, with a footer reading orcarouter build card, Hugging Face, Aug 16 2026.

• Bewahren Sie Ausgaben in einer kontrollierten Umgebung auf. Protokollieren, überprüfen und vernichten Sie, anstatt sie zu verbreiten.

- Wenn Sie {{1}}Ihre eigenen Guardrails evaluieren{{/1}}, platzieren Sie Ihre Moderationsschicht vor das Modell und testen Sie sie — {{2}}genau darum geht es bei dieser Übung{{/2}}.

• Für das vollständige Datenblatt, die Benchmark-Tabelle und die Hosting-Details öffnen Sie unsere Modellkarte – das ist die kanonische Referenz für diesen Build.

Die Sicherheitsgrenze: Was „nur für Forschungszwecke“ bedeutet

Hier ist der Teil, der nicht oft genug betont werden kann. Ein abliteriertes Modell hat keine nennenswerten eingebauten Schutzmechanismen. Es wird Anfragen nachkommen, die ein normales Modell ablehnt. Das ist das Feature, und das ist auch das Risiko — weshalb jede ernsthafte Veröffentlichung eines solchen Modells, einschließlich unserer, dieselben Warnungen enthält.

• Keine eingebauten Schutzvorkehrungen. Das Ablehnungsverhalten ist verschwunden; verhalte dich nicht so, als wäre es noch da.

• Nicht für Endnutzer, nicht für die Produktion. Ein Produkt, ein Chatbot, eine API, die der Öffentlichkeit dient, ein internes Tool, auf das Ihre Kollegen angewiesen sind — keines davon ist der richtige Ort für ein unzensiertes Modell.

Die Verantwortung liegt bei Ihnen. Wir liefern Qwen3.8-27B-Uncensored-FP8 unter Apache 2.0 aus, einer Lizenz, die hinsichtlich der Weiterverbreitung freizügig ist. Eine Lizenz ist kein Sicherheitszertifikat: freizügiger Code ändert nichts daran, was das Modell tun wird, und überträgt nicht die Sorgfaltspflicht.

• Wenn Sie es verwenden, gehören Ihnen die Ergebnisse. Die kontrollierte Umgebung ist Ihre Aufgabe; ebenso zu entscheiden, was Sie hineingeben und was nicht, und was Sie mit dem tun, was dabei herauskommt.

A two-column boundary card titled The line you don't cross. The research side lists interpretability of refusal circuits, red-teaming and guardrail evaluation, oversafety measurement, robustness research and controlled safety experiments. The deployment side lists end-user chatbots, production APIs, unmoderated public service, internal tools for your team and anything with users on the other end, each marked with a cross. A footer reads No built-in guardrails, research only, and Apache 2.0 is not a safety certificate.

Wenn ein unzensiertes Modell die falsche Antwort ist

Der klarste Weg, es zu sagen: Wenn am anderen Ende des Modells ein Mensch sitzt, ist ein unzensiertes Modell die falsche Antwort. Jedes Produkt, das vertrauenswürdig sein muss, jeder Assistent, dessen Urteilsvermögen zählt, alles, bei dem eine Ablehnung das korrekte Verhalten ist – nutzen Sie stattdessen das Basismodell. Der Grund, warum Qwen3.8 27B in seiner normalen Form existiert, ist genau der, dass Ablehnung für fast jeden realen Anwendungsfall ein Feature und kein Bug ist. Der abliterated Build existiert ausschließlich für die oben genannten engen Forschungsfälle und für nichts anderes.

Unterm Strich. Ein zensurfreies LLM ist keine Produktkategorie und kein Hack. Es ist ein Forschungsartefakt mit einer echten wissenschaftlichen Abstammung – vom Refusal-Direction-Befund bis zu den automatisierten Werkzeugen von 2026 – und einer strikten Bereitstellungsgrenze. Die Modelle sind real, die Nachfrage ist messbar, und die legitimen Anwendungen sind ebenfalls real: Interpretierbarkeit, Red-Teaming, Guardrail-Evaluierung und kontrollierte Sicherheitsexperimente. Die Grenze zwischen dem Studium der Schutzmechanismen und ihrem Deaktivieren für jemand anderen ist der gesamte Zweck dieser Seite, und sie bewegt sich nicht.

Dieser exakte Build ist unter Apache 2.0 öffentlich — nur für Forschungszwecke. Du kannst die Gewichte auf Hugging Face herunterladen

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube