Hero-Titelkarte für den Artikel 'Qwen 3.8 27B Uncensored GGUF': eine abgerundete Forschungskarte mit dem Titel 'Qwen3.8-27B Uncensored GGUF', dem Untertitel 'Abliterated local build for llama.cpp', Chips mit der Aufschrift '12 QUANT TIERS', '262K CONTEXT' und 'VISION + MTP' sowie ein Schildsymbol mit einem 'RESEARCH-ONLY'-Label. OrcaRouter-Logo unten rechts eingefügt.
Guides & Insights

Qwen 3.8 27B Uncensored GGUF: der abliterierte lokale Build, 12 Quants und die Grenze reiner Forschungsnutzung

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Qwen 3.8 27B Uncensored GGUF ist ein echter Download, und der Build, mit dem man beginnen sollte, ist Qwen3.8-27B-Uncensored-GGUF — veröffentlicht auf Hugging Face am 16. August 2026 als llama.cpp-natives Pendant zu unserer abliterierten FP8-Veröffentlichung. Es handelt sich um dieselben 27-Milliarden-Parameter-Gewichte ohne Refusal wie bei Qwen3.8-27B-Uncensored-FP8, konvertiert in GGUF für lokale Inferenz: F16 plus 12 Quantisierungsstufen von Q2_K bis Q8_0 (einschließlich der imatrix-Quants IQ3_M und IQ4_XS), das 262K-Kontextfenster, ein separater Vision-Projektor und der intakte MTP-Head für spekulatives Decoding. „Uncensored“ bedeutet abliteriert — die Refusal-Richtung wurde aus den Gewichten herausorthogonalisiert —, sodass es dort antwortet, wo das alignierte Basismodell sich weigert, und genau deshalb ist es nur für Forschungszwecke gedacht. Hier erfahren Sie, was das Repo tatsächlich enthält, welches Quant zu Ihrer GPU passt, wie man es in llama.cpp ausführt, und welche Sicherheitsgrenze Sie durch das Herunterladen akzeptieren.

Die 30-Sekunden-Version: F16 plus 12 Quants, Q4_K_M bei 16,8 GB ist die Standardwahl, {{1}}du benötigst einen llama.cpp-Build vom Mai 2026 oder neuer{{/1}}, {{2}}und dies ist ein Forschungswerkzeug ohne Schutzmechanismen{{/2}} — {{3}}nichts, das man Endnutzern bereitstellen sollte{{/3}}.

Was „uncensored GGUF“ tatsächlich bedeutet — und wie sich dieser Build von der FP8-Version unterscheidet.

GGUF ist das Einzeldatei-Modellformat, das llama.cpp verwendet; FP8 ist ein Quantisierungsschema, das auf vLLM-GPU-Servern läuft. Unsere beiden unzensierten Veröffentlichungen sind dieselben abliterierten Gewichte in zwei Laufzeitumgebungen. Qwen3.8-27B-Uncensored-FP8 (15. August 2026) zielt auf vLLM auf einem Server ab, neu quantisiert nach dem offiziellen Qwen3.8-27B-FP8-Schema, sodass es über denselben Kernel-Pfad bedient wird. Qwen3.8-27B-Uncensored-GGUF (16. August 2026) zielt auf llama.cpp auf einem lokalen Rechner ab – die Desktop-GPU oder Workstation, die du kontrollierst. Gleiche Gewichte, anderes Bereitstellungsmodell: Cloud-API vs. lokaler Prozess.

Abliteration ist eine Intervention auf Gewichtsebene, kein Fine-Tuning. Die Refusal-Richtung ist ein Vektor im Residualstrom des Modells, der bei Aktivierung „I can't help with that“ erzeugt; das Build findet diese Richtung und orthogonalisiert sie aus den Gewichten, dem Ansatz von Arditi et al. 2024 folgend („Refusal in Language Models Is Mediated by a Single Direction“). Es werden keine neuen Gewichte trainiert. Die Basis ist Qwen/Qwen3.8-27B – ein dichtes 27B-Modell mit einer hybriden Architektur (48 Gated-DeltaNet-Linear-Attention-Schichten und 16 Voll-Attention-Schichten), nativer Bildverarbeitung und einem Kontext von 262.144 Token. Die Lizenz ist Apache 2.0, übernommen vom Basismodell. Beachten Sie, dass das offizielle Qwen-Repository nur BF16-Safetensors bereitstellt – es gibt kein offizielles Qwen-GGUF – daher ist jedes unzensierte GGUF dieses Modells, einschließlich dieses, eine Konvertierung der offenen Gewichte.

Die Quant-Leiter — F16 plus 12 Stufen

Das Repo enthält F16 (54,6 GB auf zwei Dateien verteilt) und 12 Quantisierungsstufen. Die unten aufgeführten Größen sind die eigenen Dateigrößen des Repos, abgerufen am 16. August 2026; GGUF-Dateigrößen variieren leicht von Build zu Build.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54,6 GB (2 Dateien) — Referenzpräzision

Q8_0 — 29.0 GB — nahezu verlustfrei, für High-End-GPUs

Q6_K — 22.4 GB — der Sweet Spot für Qualität pro Gigabyte

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — hohe Qualität auf größeren Karten

Q4_K_M — 16.8 GB — die empfohlene Standardeinstellung

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — die beste Low-Bit-Wahl (imatrix-kalibriert)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — für 16-GB-Karten

IQ3_M — 12,8 GB — kleiner Fußabdruck (imatrix-kalibriert)

Q3_K_S — 12,3 GB

Q2_K — 10.9 GB — der kleinste K-Quant, ein sichtbarer Qualitätskompromiss

Hardware-Empfehlungen: Q4_K_M auf einer 24-GB-Karte (RTX 4090 oder RTX 3090); IQ4_XS oder Q3_K_M, wenn Sie 16 GB haben; Q2_K nur, wenn Sie auf 12 GB begrenzt sind. Da die Basis hybride Gated-DeltaNet-Aufmerksamkeit verwendet, ist der KV-Cache klein – etwa 0,5 GB bei 8K-Kontext – sodass Sie das Fenster weit über ein herkömmliches dichtes 27B-Modell hinaus erweitern können. Vision fügt eine separate Datei hinzu: Der F16-Projektor hat 931 MB. Eine von der Community abliterierte Serie mit 9 Quants für dieselbe Basis existiert ebenfalls; unsere ist die Konvertierung der dokumentierten FP8-Abliteration, wobei die Imatrix-Quants und die Refusal-Delta-Zahlen der Modellkarte übernommen wurden.

Wie man es in llama.cpp ausführt

Drei Schritte. Eine nicht offensichtliche Anforderung: Die qwen35-Architektur und die MTP-Unterstützung wurden im Mai 2026 in llama.cpp integriert, also aktualisieren Sie auf einen Build von 2026-05 oder neuer — ältere Builds werden diese Dateien nicht laden können (laut README des Repos).

1. Laden Sie das von Ihnen gewählte Quant sowie den Vision-Projektor herunter. Das Repository ist gesperrt, also melden Sie sich zuerst bei Hugging Face an und akzeptieren Sie die Bedingungen — das Lesen der README ist Teil des Akzeptierens dessen, was dieses Modell ist.

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. Starten Sie llama-server. Dieser stellt einen OpenAI-kompatiblen Endpunkt bereit; -ngl 99/ lagert jede Schicht auf die GPU aus.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (Optional) Aktivieren Sie den MTP-Head für spekulative Dekodierung.Fügen Sie --spec-type draft-mtp/ hinzu — der nextn-Head ist in jedes Quant eingebettet, sodass kein separates Draft-Modell benötigt wird.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

Rein textbasierte Forschungsdurchläufe können --mmproj/ weglassen; die Bildeingabe benötigt es, da dies ein natives Vision-Language-Modell ist. Der Endpoint ist http://localhost:8080/v1/chat/completions, sodass vorhandener OpenAI-SDK-Code funktioniert, wenn man nur die Basis-URL austauscht.

Keine GPU? Dieselbe unzensierte Version wird gehostet.

Lokales GGUF kostet nichts pro Token, benötigt aber für die Q4_K_M-Stufe etwa 17 GB VRAM. Wenn Sie die Hardware nicht besitzen, bietet die gehostete Karte obsidian/Qwen3.8-27B auf OrcaRouter dieselbe unzensierte 27B-Linie — Vision, Reasoning, 262K-Kontext — für 0,40 $ pro Million Eingabe-Token und 4,21 $ pro Million Ausgabe-Token, wobei der Zugang auf Sicherheitsforscher, Red Teams und KI-Sicherheitsforscher beschränkt ist. Dieselbe Gewichtsfamilie, zwei Laufzeiten: GGUF lokal, FP8 in der Cloud. Die Moderationsentscheidung bleibt in jedem Fall auf Ihrer Seite.

Die Sicherheitsgrenze — lesen Sie dies, bevor Sie herunterladen

Dieses Modell wurde seiner Sicherheitsausrichtung weitgehend beraubt. Es wird schädlichen, unethischen, beleidigenden oder illegalen Anfragen nachkommen, die das Basis-Modell Qwen3.8-27B ablehnen würde, und es besitzt keine nennenswerten eingebauten Schutzvorrichtungen. Es wird ausschließlich für legitime Forschung veröffentlicht – Interpretierbarkeit, Untersuchung von Verweigerungsmechanismen, Red-Teaming, Robustheitsbewertung und Test von Schutzvorrichtungen. Sie übernehmen die volle Verantwortung und Haftung für Ihre Nutzung sowie für alles, was es generiert, und Sie dürfen es nicht an Endnutzer weitergeben oder in Produktion einsetzen, ohne eigene Sicherheits-, Moderations- und Missbrauchspräventionsschichten hinzuzufügen. Die Autoren übernehmen keine Haftung. Die Lizenz ist Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

Das gemessene Verhalten zeigt, was „ungezensenrt" kostet. Aus der Safety-Evaluationssuite der Model Card — ausgeführt auf dem FP8-Build und datiert auf den 15. August 2026, also die Gewichte, die dieses GGUF konvertiert: Die Ablehnung schädlicher Prompts fällt von 64–99 % beim Basismodell auf 0–6 % bei den abliterated Gewichten, die übermäßige Ablehnung harmloser Anfragen sinkt von 5,6 % auf 0,4 %, und die Leistungswerte bleiben innerhalb von ±1,3 Punkten des Basismodells. Diese Zahlen sind der Grund, warum diese Modellklasse ein legitimes Forschungsobjekt ist — und sie sind zugleich die Warnung.

Dieser Artikel enthält bewusst keine schädlichen Prompts. Wenn Sie das Modell evaluieren, führen Sie die Standard-Refusal-Benchmarks aus — AdvBench, HarmBench, StrongREJECT, XSTest-safe — und lesen Sie die Zahlen selbst. Das ist die anerkannte Methode, um ein Modell ohne Refusal-Verhalten zu untersuchen.

Wenn dieser Build die falsche Antwort ist

1. Du möchtest einen normalen Assistenten. Falsches Modell. Es hat keine Sicherheitsvorkehrungen und wird schädlichen Anfragen nachkommen. Verwende stattdessen das alignierte Qwen3.8-27B.

2. Alles, was Sie Endnutzern präsentieren würden. Falsches Modell, unabhängig von der Absicht. Apache 2.0 überträgt Ihre Haftung nicht, und die Auslieferung eines Modells ohne Schutzvorkehrungen an Nutzer ist keine Bereitstellungsstrategie.

3. Sie verwenden Apple Silicon.Der GGUF wird laufen, aber die MLX-Konvertierung des Basismodells ist die natürlichere Wahl — siehe unseren separaten MLX-Leitfaden.

4. Sie möchten es überhaupt nicht ausführen. Nutzen Sie die gehostete Karte — dieselben Gewichte, keine 17 GB VRAM und dieselbe Beschränkung auf Forschungszwecke.

Fazit

"Qwen 3.8 27B uncensored GGUF" hat eine Antwort, und es ist ein konkreter Download: Qwen3.8-27B-Uncensored-GGUF — F16 plus 12 Quantisierungsstufen für llama.cpp, die abliterierten Gewichte aus unserem FP8-Build, 262K Kontext, Vision und MTP, unter Apache 2.0 und nur für Forschungszwecke. Wählen Sie Q4_K_M auf einer 24-GB-Karte, aktualisieren Sie llama.cpp auf eine Version nach Mai 2026 und führen Sie es als lokalen OpenAI-kompatiblen Server aus. Es ist ein Forschungsinstrument zur Untersuchung von Refusals und zum Testen von Guardrails — kein Chatbot und nicht zum Ausliefern gedacht. Die Gewichte sind kostenlos; die Verantwortung für das, was Sie damit tun, liegt vollständig bei Ihnen.

Für legitime Forschung sind das F16 und alle 12 Quantisierungsstufen auf Hugging Face: Das GGUF von Hugging Face herunterladen

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

Kontaktiere uns

Community beitreten

DiscordEmailXGitHubYouTube