Titelkarte für den Artikel ‚Qwen Uncensored, Explained', die eine abgerundete Forschungskarte zeigt, auf der ein Schild geöffnet wird und ein Schaltkreis-Gehirn zum Vorschein kommt, mit einem Mikroskop-Symbol und einem Etikett mit der Aufschrift RESEARCH-ONLY sowie Chips mit der Aufschrift ABLITERATED, BLOCK-FP8 und 262K CONTEXT.
Guides & Insights

Qwen unzensiert, erklärt: So führen Sie das abliterierte Qwen3.8-27B-FP8 aus

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Qwen uncensored auf Hugging Face bedeutet fast immer Abliteration — bei der die Refusal-Richtung des Modells aus seinem Residualstrom entfernt wurde — und der Build, mit dem man beginnen sollte, ist Qwen3.8-27B-Uncensored-FP8, der am 15. August 2026 auf Hugging Face veröffentlicht wurde. Es ist ein abliterierter Block-FP8-Build von Qwen3.8-27B, der auf dem exakt gleichen vLLM-Kernel-Pfad läuft wie das offizielle FP8-Release, mit intaktem 262K-Kontext, Vision-Tower und MTP-Head für spekulatives Decoding — und er erzielte am ersten Tag 257 Likes und 4.285 Downloads. Es ist ein Forschungswerkzeug, kein Chatbot: keine eingebauten Guardrails, Apache 2.0, und es wird Anfragen erfüllen, die das Basismodell ablehnt. Dieser Leitfaden behandelt, was Abliteration tatsächlich verändert hat, wie man die 30,9 GB an Gewichten von Hugging Face herunterlädt, wie man das Modell mit vLLM, SGLang oder Transformers bereitstellt und wofür man es für legitime Forschung einsetzen kann.

Was "qwen uncensored" tatsächlich bedeutet

Abliteration ist ein Eingriff auf Gewichtsebene, kein Feintuning. Die Ablehnungsrichtung ist ein Vektor im Residualstrom des Modells, der bei Aktivierung „Ich kann dabei nicht helfen“ erzeugt; Abliteration findet diese Richtung und orthogonalisiert sie aus den Gewichten heraus. Bei diesem Build wurde die Entfernung auf 131 Matrizen angewendet, die in den Residualstrom schreiben (die Methode von Arditi et al. 2024, „Refusal in Language Models Is Mediated by a Single Direction“), und das Ergebnis wurde neu quantisiert, um byte-genau dem offiziellen Qwen3.8-27B-FP8-Schema zu entsprechen, sodass vLLM es über denselben FP8-Kernelpfad bereitstellt. Es wurden keine neuen Gewichte trainiert.

Diese Unterscheidung ist wichtig, denn die Top-Ergebnisse für „qwen uncensored“ vermischen drei verschiedene Dinge: abliterierte Gewichtsanpassungen wie diese hier, System-Prompt-„Uncensored-Pakete“, die Weigerungen nur auf Prompt-Ebene überdecken, und LoRA-Feintunings, die ohne Sicherheitsdaten trainiert wurden. Sie sind nicht gleichwertig, und die meisten Seiten, die für diese Suchanfrage ranken, geben nicht an, welche Familie sie beschreiben. Wenn man den Verweigerungsmechanismus selbst untersuchen möchte, ist nur der Eingriff auf Gewichtsebene das einzig Wahre.

Was die Beseitigung der Ablehnung tatsächlich bewirkte – die Zahlen.

Das Modellblatt veröffentlicht eine Sicherheitsbewertungssuite, die auf dem vLLM-betriebenen Modell ausgeführt wurde und vom 15. August 2026 datiert ist. Bei deaktiviertem Denken fällt die Verweigerungsrate bei sieben Benchmarks für schädliche Aufforderungen von 64–99 % beim Basismodell auf 0–6 % bei diesem Build: AdvBench 99.0% auf 0.0%, JailbreakBench 94.0% auf 0.0%, StrongREJECT 97.3% auf 2.0%, HarmBench 98.7% auf 2.7%, MaliciousInstruct 99.0% auf 0.0%, SimpleSafetyTests 64.0% auf 6.0%, ForbiddenQuestions 73.3% auf 4.7%. Bei aktiviertem Denken verweigert das Modell praktisch nie — 1,7 % oder weniger. Eine separate, bemerkenswerte Zahl ist die Vorbehaltsrate: 30–50 % der „ungefilterten“ Antworten stellen der Antwort noch immer einen kurzen Haftungsausschluss voran; das ist ein Trainingsartefakt, keine Verweigerung.

Die Kehrseite ist, was sich nicht geändert hat. Überverweigerung bei harmlosen Aufforderungen sinkt von 5.6% auf 0.4% bei XSTest-safe, und alle Fähigkeits-Benchmarks bleiben innerhalb von ±1.3 Punkten gegenüber der Basis: MMLU 84.3% auf 84.7%, GSM8K 90.0% auf 88.7%, MMLU-Pro 77.6% auf 76.8%, CMMLU 81.4% auf 80.8%. Die WikiText-2-Perplexität beträgt 6.96. Mit anderen Worten: Die Intervention hat das Verweigerungsverhalten beseitigt, ohne das Modell nennenswert zu beeinträchtigen.

A before-and-after card for Qwen3.8-27B-Uncensored-FP8, with a Base column and an Abliterated column: refusal with thinking off 64-99% down to 0-6%, refusal with thinking on down to 1.7% or less, over-refusal on benign prompts 5.6% down to 0.4%, MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%, and WikiText-2 perplexity 6.96, with a footer reading Model-card evaluation, vLLM-served, August 15 2026.

Wie man es von Hugging Face herunterlädt

Das Repository ist orcarouter/Qwen3.8-27B-Uncensored-FP8, und es ist zugangsbeschränkt: Sie melden sich mit einem Hugging-Face-Konto an und akzeptieren die Bedingungen, bevor die Dateien heruntergeladen werden – die Zugangsbeschränkung selbst ist der Haftungsausschluss, denn das Lesen der README ist Teil davon, zu akzeptieren, was dieses Modell ist. Was Sie herunterladen, sind 30,9 GB auf sieben Safetensors-Shards verteilt (1.606 Tensoren) in Block-FP8 (E4M3, 128×128-Blöcke, dynamische Aktivierungen), wobei der Vision-Tower, Normalisierungen, Embeddings und lm_head in BF16 belassen werden. Die Lizenz ist Apache 2.0, übernommen vom Basismodell Qwen/Qwen3.8-27B. Kein Hugging-Face-Inference-Provider hostet es – Sie führen es selbst aus oder nutzen eine gehostete Karte.

Wie man es ausführt

Die Gewichte umfassen ungefähr 31 GB – etwa die Hälfte des ~56 GB großen BF16-Checkpoints – und die Modellkarte empfiehlt eine einzelne H100 80GB oder H200 143GB, wobei ~40 GB VRAM als praktische Untergrenze für Gewichte plus einem kleinen KV-Cache dienen. Der volle 262K-Kontext erfordert mehr, aber ein FP8-KV-Cache halbiert das. Das von der Karte verifizierte Setup war eine H200 mit --max-num-seqs 96, FP8-KV-Cache und aktiviertem MTP.

vLLM ist der vorgesehene Weg, und es ist ein einziger Befehl, da das FP8-Schema exakt mit dem offiziellen Build übereinstimmt:

vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"

Das ergibt einen OpenAI-kompatiblen Endpunkt unter localhost:8000/v1/chat/completions. Das Docker-Äquivalent ist docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8. Für die vollständige Einrichtung schlägt die Modellkarte vor: --language-model-only für reine Textbereitstellung, --speculative-config '{"method":"mtp","num_speculative_tokens":3}', um den MTP-Kopf für spekulative Dekodierung zu aktivieren, --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3 und --enable-auto-tool-choice --tool-call-parser qwen3_coder für Tool-Aufrufe. Übergeben Sie nicht --quantization fp8 — das Schema wird aus config.json ausgelesen. Lassen Sie --kv-cache-dtype fp8 weg, wenn Sie einen BF16-KV-Cache wünschen, und lassen Sie --language-model-only weg, wenn Sie den Vision-Tower benötigen.

Für SGLang: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. Für Transformers dokumentiert die Modellkarte sowohl die Pipeline-API — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") — als auch AutoProcessor.from_pretrained(...) sowie AutoModelForMultimodalLM.from_pretrained(..., device_map="auto").

A how-to-run card for Qwen3.8-27B-Uncensored-FP8 listing the essentials: 30.9 GB of block-FP8 weights across 7 shards, roughly 40 GB of VRAM floor with H100 80GB or H200 143GB recommended, the vLLM one-liner vllm serve orcarouter/Qwen3.8-27B-Uncensored-FP8, serve flags MTP 3 speculative tokens, FP8 KV cache, max-model-len 262144, tool-call-parser qwen3_coder, and a footer reading From the Hugging Face model card, August 15 2026.

Was man in der Forschung tatsächlich damit anfangen kann

Der Zweck eines Modells, dessen Verweigerungen entfernt wurden, ist es, ein Untersuchungsgegenstand zu sein, und dieser Build ist ungewöhnlich leicht zu untersuchen, da sein Eingriff dokumentiert ist. Drei konkrete, legitime Forschungsprojekte:

• Reproduzieren Sie das Refusal-Delta. Führen Sie AdvBench, HarmBench, StrongREJECT oder XSTest-safe sowohl gegen den abliterierten Build als auch gegen das Basis-FP8 aus und bestätigen Sie die Zahlen auf der Karte: 64–99 % auf 0–6 % bei schädlichen Prompts, 5,6 % auf 0,4 % Over-Refusal bei harmlosen. Dieses Vorher/Nachher-Paar ist genau die Messgröße, die ein Sicherheitsteam benötigt, um zu wissen, ob eine Methode zur Refusal-Entfernung funktioniert und was sie kostet.

• Untersuchen Sie, wo die Verweigerung sitzt. Da der Build die 131 Matrizen dokumentiert, die orthogonalisiert wurden, können Sie die Richtungen des Residuenstroms mit der Basis vergleichen und sehen, was die Intervention verschoben hat. Das Ergebnis bei aktiviertem Denken ist hier aufschlussreich: Die Verweigerung sinkt auf 1,7 % oder weniger, wenn das Denken aktiviert ist, was ein Beleg dafür ist, dass die Denkspur der Ort ist, an dem die Richtung am wichtigsten ist.

• Bewerten Sie Ihr eigenes Guardrail. Eine Baseline ohne Guardrail ist die richtige Kontrolle zum Testen einer Moderationsschicht. Führen Sie Ihren Filter über die Ausgaben dieses Modells aus und messen Sie, was er erfasst – so quantifizieren Sie die Sicherheitsebene, die Sie zusätzlich hinzufügen.

Wenn dieses Modell die falsche Antwort ist.

Wenn du einen normalen Assistenten möchtest oder etwas, das du Endbenutzern präsentieren würdest, ist dies das falsche Modell — es hat keine nennenswerten eingebauten Schutzmechanismen, es wird Anfragen erfüllen, die das Basismodell ablehnt, und Apache 2.0 nimmt dir deine Haftung nicht ab. Verwende stattdessen das ursprünglich alignierte Qwen3.8-27B. Wenn du bei einem Chatbot Ablehnungen umgehen willst, erreicht ein System-Prompt-Paket mehr mit weniger Risiko als eine Gewichtsbearbeitung. Und wenn du keine ~40-GB-Karte hast, das Modell aber trotzdem studieren möchtest, bietet die gehostete Karte obsidian/Qwen3.8-27B auf OrcaRouter dieselbe unzensierte 27B-Linie für 0,40 $ pro Million Eingabe-Token und 4,21 $ pro Million Ausgabe-Token, mit demselben 262K-Kontext — die Karte ist Sicherheits- und KI-Sicherheitsforschern vorbehalten, und die Moderationsentscheidung bleibt auf deiner Seite.

A safety-boundary card for Qwen3.8-27B-Uncensored-FP8 with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services with a warning that the model has no built-in guardrails, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Die Sicherheitsgrenze — lesen Sie dies, bevor Sie herunterladen

Bei diesem Modell wurde die Sicherheitsausrichtung weitgehend entfernt. Es wird schädlichen, unethischen, anstößigen oder illegalen Anfragen nachkommen, die das ursprüngliche Qwen3.8-27B ablehnen würde, und es verfügt über keine nennenswerten integrierten Schutzmechanismen. Es wird ausschließlich für legitime Forschung veröffentlicht — Interpretierbarkeit, KI-Sicherheit und Erforschung von Ablehnungsmechanismen, Red-Teaming, Robustheitsbewertung und kontrollierte Experimente. Sie übernehmen die volle Verantwortung und Haftung für die Art und Weise, wie Sie es verwenden, und für alles, was es generiert. Sie dürfen es nicht an Endnutzer ausliefern oder in Produktion einsetzen, ohne eigene Ebenen für Sicherheit, Moderation und Missbrauchsverhinderung hinzuzufügen. Die Autoren übernehmen keine Haftung für Missbrauch. Das Herunterladen des Repositorys bedeutet, dass Sie diese Bedingungen akzeptieren; die Lizenz ist Apache 2.0.

Dieser Artikel enthält bewusst keine schädlichen Prompts. Die obigen Verweigerungszahlen stammen aus der eigenen Sicherheitsbewertungssuite der Modellkarte, was der richtige Weg ist, um ein Modell dieser Klasse zu messen: Führen Sie die standardmäßigen Verweigerungs-Benchmarks aus, lesen Sie die Zahlen und gestalten Sie Ihre Forschung auf der Grundlage dessen, was sie zeigen.

Fazit

„Qwen uncensored“ ist die Suche nach einer Technik, und die Version, die man zuerst ausprobieren sollte, ist Qwen3.8-27B-Uncensored-FP8: der einzige Qwen3.8-Build ohne Refusals, der auf dem offiziellen FP8-vLLM-Kernel-Pfad mit 262K Kontext, Vision und MTP intakt läuft, gestützt durch eine veröffentlichte Vorher/Nachher-Evaluierung. Lade die gated 30,9 GB von Hugging Face herunter, serviere sie mit vLLM auf einer einzelnen H100 oder H200, und nutze sie für das, wofür sie gedacht ist — Refusals messen, den Refusal-Mechanismus untersuchen und Guardrails testen. Verwende sie nicht als Chatbot und gib sie nicht an Endnutzer weiter. Die Gewichte sind kostenlos; die Verantwortung für das, was du damit tust, liegt vollständig bei dir.

Für legitime Forschung sind die Gewichte auf Hugging Face: Download von Hugging Face

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube