
Qwen 3.8 27B Uncensored GGUF: der abliterierte lokale Build, 12 Quants und die Grenze reiner Forschungsnutzung
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaNEUMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
- tencentTencent: Hy32026-07-0642Intelligenz59Coding
Qwen 3.8 27B Uncensored GGUF ist ein echter Download, und der Build, mit dem man beginnen sollte, ist Qwen3.8-27B-Uncensored-GGUF — veröffentlicht auf Hugging Face am 16. August 2026 als llama.cpp-natives Pendant zu unserer abliterierten FP8-Veröffentlichung. Es handelt sich um dieselben 27-Milliarden-Parameter-Gewichte ohne Refusal wie bei Qwen3.8-27B-Uncensored-FP8, konvertiert in GGUF für lokale Inferenz: F16 plus 12 Quantisierungsstufen von Q2_K bis Q8_0 (einschließlich der imatrix-Quants IQ3_M und IQ4_XS), das 262K-Kontextfenster, ein separater Vision-Projektor und der intakte MTP-Head für spekulatives Decoding. „Uncensored“ bedeutet abliteriert — die Refusal-Richtung wurde aus den Gewichten herausorthogonalisiert —, sodass es dort antwortet, wo das alignierte Basismodell sich weigert, und genau deshalb ist es nur für Forschungszwecke gedacht. Hier erfahren Sie, was das Repo tatsächlich enthält, welches Quant zu Ihrer GPU passt, wie man es in llama.cpp ausführt, und welche Sicherheitsgrenze Sie durch das Herunterladen akzeptieren.
Die 30-Sekunden-Version: F16 plus 12 Quants, Q4_K_M bei 16,8 GB ist die Standardwahl, {{1}}du benötigst einen llama.cpp-Build vom Mai 2026 oder neuer{{/1}}, {{2}}und dies ist ein Forschungswerkzeug ohne Schutzmechanismen{{/2}} — {{3}}nichts, das man Endnutzern bereitstellen sollte{{/3}}.
Was „uncensored GGUF“ tatsächlich bedeutet — und wie sich dieser Build von der FP8-Version unterscheidet.
GGUF ist das Einzeldatei-Modellformat, das llama.cpp verwendet; FP8 ist ein Quantisierungsschema, das auf vLLM-GPU-Servern läuft. Unsere beiden unzensierten Veröffentlichungen sind dieselben abliterierten Gewichte in zwei Laufzeitumgebungen. Qwen3.8-27B-Uncensored-FP8 (15. August 2026) zielt auf vLLM auf einem Server ab, neu quantisiert nach dem offiziellen Qwen3.8-27B-FP8-Schema, sodass es über denselben Kernel-Pfad bedient wird. Qwen3.8-27B-Uncensored-GGUF (16. August 2026) zielt auf llama.cpp auf einem lokalen Rechner ab – die Desktop-GPU oder Workstation, die du kontrollierst. Gleiche Gewichte, anderes Bereitstellungsmodell: Cloud-API vs. lokaler Prozess.
Abliteration ist eine Intervention auf Gewichtsebene, kein Fine-Tuning. Die Refusal-Richtung ist ein Vektor im Residualstrom des Modells, der bei Aktivierung „I can't help with that“ erzeugt; das Build findet diese Richtung und orthogonalisiert sie aus den Gewichten, dem Ansatz von Arditi et al. 2024 folgend („Refusal in Language Models Is Mediated by a Single Direction“). Es werden keine neuen Gewichte trainiert. Die Basis ist Qwen/Qwen3.8-27B – ein dichtes 27B-Modell mit einer hybriden Architektur (48 Gated-DeltaNet-Linear-Attention-Schichten und 16 Voll-Attention-Schichten), nativer Bildverarbeitung und einem Kontext von 262.144 Token. Die Lizenz ist Apache 2.0, übernommen vom Basismodell. Beachten Sie, dass das offizielle Qwen-Repository nur BF16-Safetensors bereitstellt – es gibt kein offizielles Qwen-GGUF – daher ist jedes unzensierte GGUF dieses Modells, einschließlich dieses, eine Konvertierung der offenen Gewichte.
Die Quant-Leiter — F16 plus 12 Stufen
Das Repo enthält F16 (54,6 GB auf zwei Dateien verteilt) und 12 Quantisierungsstufen. Die unten aufgeführten Größen sind die eigenen Dateigrößen des Repos, abgerufen am 16. August 2026; GGUF-Dateigrößen variieren leicht von Build zu Build.

• F16 — 54,6 GB (2 Dateien) — Referenzpräzision
• Q8_0 — 29.0 GB — nahezu verlustfrei, für High-End-GPUs
• Q6_K — 22.4 GB — der Sweet Spot für Qualität pro Gigabyte
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — hohe Qualität auf größeren Karten
• Q4_K_M — 16.8 GB — die empfohlene Standardeinstellung
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — die beste Low-Bit-Wahl (imatrix-kalibriert)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — für 16-GB-Karten
• IQ3_M — 12,8 GB — kleiner Fußabdruck (imatrix-kalibriert)
• Q3_K_S — 12,3 GB
• Q2_K — 10.9 GB — der kleinste K-Quant, ein sichtbarer Qualitätskompromiss
Hardware-Empfehlungen: Q4_K_M auf einer 24-GB-Karte (RTX 4090 oder RTX 3090); IQ4_XS oder Q3_K_M, wenn Sie 16 GB haben; Q2_K nur, wenn Sie auf 12 GB begrenzt sind. Da die Basis hybride Gated-DeltaNet-Aufmerksamkeit verwendet, ist der KV-Cache klein – etwa 0,5 GB bei 8K-Kontext – sodass Sie das Fenster weit über ein herkömmliches dichtes 27B-Modell hinaus erweitern können. Vision fügt eine separate Datei hinzu: Der F16-Projektor hat 931 MB. Eine von der Community abliterierte Serie mit 9 Quants für dieselbe Basis existiert ebenfalls; unsere ist die Konvertierung der dokumentierten FP8-Abliteration, wobei die Imatrix-Quants und die Refusal-Delta-Zahlen der Modellkarte übernommen wurden.
Wie man es in llama.cpp ausführt
Drei Schritte. Eine nicht offensichtliche Anforderung: Die qwen35-Architektur und die MTP-Unterstützung wurden im Mai 2026 in llama.cpp integriert, also aktualisieren Sie auf einen Build von 2026-05 oder neuer — ältere Builds werden diese Dateien nicht laden können (laut README des Repos).
1. Laden Sie das von Ihnen gewählte Quant sowie den Vision-Projektor herunter. Das Repository ist gesperrt, also melden Sie sich zuerst bei Hugging Face an und akzeptieren Sie die Bedingungen — das Lesen der README ist Teil des Akzeptierens dessen, was dieses Modell ist.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. Starten Sie llama-server. Dieser stellt einen OpenAI-kompatiblen Endpunkt bereit; -ngl 99/ lagert jede Schicht auf die GPU aus.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (Optional) Aktivieren Sie den MTP-Head für spekulative Dekodierung.Fügen Sie --spec-type draft-mtp/ hinzu — der nextn-Head ist in jedes Quant eingebettet, sodass kein separates Draft-Modell benötigt wird.

Rein textbasierte Forschungsdurchläufe können --mmproj/ weglassen; die Bildeingabe benötigt es, da dies ein natives Vision-Language-Modell ist. Der Endpoint ist http://localhost:8080/v1/chat/completions, sodass vorhandener OpenAI-SDK-Code funktioniert, wenn man nur die Basis-URL austauscht.
Keine GPU? Dieselbe unzensierte Version wird gehostet.
Lokales GGUF kostet nichts pro Token, benötigt aber für die Q4_K_M-Stufe etwa 17 GB VRAM. Wenn Sie die Hardware nicht besitzen, bietet die gehostete Karte obsidian/Qwen3.8-27B auf OrcaRouter dieselbe unzensierte 27B-Linie — Vision, Reasoning, 262K-Kontext — für 0,40 $ pro Million Eingabe-Token und 4,21 $ pro Million Ausgabe-Token, wobei der Zugang auf Sicherheitsforscher, Red Teams und KI-Sicherheitsforscher beschränkt ist. Dieselbe Gewichtsfamilie, zwei Laufzeiten: GGUF lokal, FP8 in der Cloud. Die Moderationsentscheidung bleibt in jedem Fall auf Ihrer Seite.
Die Sicherheitsgrenze — lesen Sie dies, bevor Sie herunterladen
Dieses Modell wurde seiner Sicherheitsausrichtung weitgehend beraubt. Es wird schädlichen, unethischen, beleidigenden oder illegalen Anfragen nachkommen, die das Basis-Modell Qwen3.8-27B ablehnen würde, und es besitzt keine nennenswerten eingebauten Schutzvorrichtungen. Es wird ausschließlich für legitime Forschung veröffentlicht – Interpretierbarkeit, Untersuchung von Verweigerungsmechanismen, Red-Teaming, Robustheitsbewertung und Test von Schutzvorrichtungen. Sie übernehmen die volle Verantwortung und Haftung für Ihre Nutzung sowie für alles, was es generiert, und Sie dürfen es nicht an Endnutzer weitergeben oder in Produktion einsetzen, ohne eigene Sicherheits-, Moderations- und Missbrauchspräventionsschichten hinzuzufügen. Die Autoren übernehmen keine Haftung. Die Lizenz ist Apache 2.0.

Das gemessene Verhalten zeigt, was „ungezensenrt" kostet. Aus der Safety-Evaluationssuite der Model Card — ausgeführt auf dem FP8-Build und datiert auf den 15. August 2026, also die Gewichte, die dieses GGUF konvertiert: Die Ablehnung schädlicher Prompts fällt von 64–99 % beim Basismodell auf 0–6 % bei den abliterated Gewichten, die übermäßige Ablehnung harmloser Anfragen sinkt von 5,6 % auf 0,4 %, und die Leistungswerte bleiben innerhalb von ±1,3 Punkten des Basismodells. Diese Zahlen sind der Grund, warum diese Modellklasse ein legitimes Forschungsobjekt ist — und sie sind zugleich die Warnung.
Dieser Artikel enthält bewusst keine schädlichen Prompts. Wenn Sie das Modell evaluieren, führen Sie die Standard-Refusal-Benchmarks aus — AdvBench, HarmBench, StrongREJECT, XSTest-safe — und lesen Sie die Zahlen selbst. Das ist die anerkannte Methode, um ein Modell ohne Refusal-Verhalten zu untersuchen.
Wenn dieser Build die falsche Antwort ist
1. Du möchtest einen normalen Assistenten. Falsches Modell. Es hat keine Sicherheitsvorkehrungen und wird schädlichen Anfragen nachkommen. Verwende stattdessen das alignierte Qwen3.8-27B.
2. Alles, was Sie Endnutzern präsentieren würden. Falsches Modell, unabhängig von der Absicht. Apache 2.0 überträgt Ihre Haftung nicht, und die Auslieferung eines Modells ohne Schutzvorkehrungen an Nutzer ist keine Bereitstellungsstrategie.
3. Sie verwenden Apple Silicon.Der GGUF wird laufen, aber die MLX-Konvertierung des Basismodells ist die natürlichere Wahl — siehe unseren separaten MLX-Leitfaden.
4. Sie möchten es überhaupt nicht ausführen. Nutzen Sie die gehostete Karte — dieselben Gewichte, keine 17 GB VRAM und dieselbe Beschränkung auf Forschungszwecke.
Fazit
"Qwen 3.8 27B uncensored GGUF" hat eine Antwort, und es ist ein konkreter Download: Qwen3.8-27B-Uncensored-GGUF — F16 plus 12 Quantisierungsstufen für llama.cpp, die abliterierten Gewichte aus unserem FP8-Build, 262K Kontext, Vision und MTP, unter Apache 2.0 und nur für Forschungszwecke. Wählen Sie Q4_K_M auf einer 24-GB-Karte, aktualisieren Sie llama.cpp auf eine Version nach Mai 2026 und führen Sie es als lokalen OpenAI-kompatiblen Server aus. Es ist ein Forschungsinstrument zur Untersuchung von Refusals und zum Testen von Guardrails — kein Chatbot und nicht zum Ausliefern gedacht. Die Gewichte sind kostenlos; die Verantwortung für das, was Sie damit tun, liegt vollständig bei Ihnen.
Für legitime Forschung sind das F16 und alle 12 Quantisierungsstufen auf Hugging Face: Das GGUF von Hugging Face herunterladen
