
So führen Sie Qwen3.8-27B-Uncensored lokal aus: GGUF-Quants, llama.cpp und Ollama
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
Um Qwen3.8-27B-Uncensored lokal auszuführen, laden Sie das gated GGUF-Repository orcarouter/Qwen3.8-27B-Uncensored-GGUF von Hugging Face herunter, wählen Sie eine Quantisierung passend zu Ihrem VRAM – Q4_K_M (16,8 GB) für eine GPU mit 24 GB, IQ4_XS (15,3 GB) für eine GPU mit 16 GB, Q3_K_M (13,5 GB), wenn Sie Kontextspielraum wünschen – und stellen Sie es mit einem aktuellen llama.cpp-Build mit dem --jinja-Flag bereit, wobei Sie --mmproj hinzufügen, falls Sie Vision benötigen. Dieselbe Datei lässt sich mit drei Befehlen in Ollama importieren. Dies ist die GGUF-Version des am 16. August 2026 veröffentlichten abliterierten Qwen3.8 27B-Builds mit dem nativen 262K-Kontext, dem Vision-Projektor und dem MTP-Head für spekulatives Decoding, die in jeder Quantisierung erhalten bleiben. Es ist ein Forschungswerkzeug, kein Assistent: Sein Verweigerungsverhalten wurde entfernt, es enthält keine eingebauten Schutzmechanismen, und die Lizenz ist Apache 2.0. Lesen Sie vor dem Download die Sicherheitsgrenze am Ende dieser Seite – sie ist der Zweck des gated Repositories.
Welches GGUF herunterladen, je nach VRAM
Das Repository enthält ein Paar in voller Präzision und zwölf quantisierte Dateien, die Download-Entscheidung ist also wirklich eine VRAM-Entscheidung. Die Zahlen unten sind die Dateigrößen, die am 2026-08-16 aus dem Hugging-Face-Repository ausgelesen wurden.

Was ist eigentlich im Repo?
orcarouter/Qwen3.8-27B-Uncensored-GGUF enthält fünfzehn Modelldateien: die F16-Gewichte, aufgeteilt in zwei Teile, zwölf quantisierte GGUFs – Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M und IQ4_XS – sowie den mmproj-Visionsprojektor. Es ist der GGUF-Export desselben abliterierten Builds wie Qwen3.8-27B-Uncensored-FP8, neu verpackt für lokale Laufzeitumgebungen der llama.cpp-Klasse, und es erbt die Apache-2.0-Lizenz des Basismodells sowie dessen nativen Kontext von 262.144 Token.
Drei Eigenschaften gelten für alle Quants. Die Architektur ist qwen35 — hybride Aufmerksamkeit mit 48 Gated-DeltaNet-Linearschichten und 16 Vollaufmerksamkeitsschichten — weshalb das Repository sich weigert, in älteren llama.cpp-Builds zu laden, und der KV-Cache klein bleibt. Der MTP (nextn)-Head für spekulative Dekodierung ist in allen Quants erhalten, bei K-quant und IQ gleichermaßen. Und die Chat-Vorlage ist die Qwen-Jinja-Vorlage, die Sie explizit aktivieren müssen (siehe unten), sonst brechen mehrteilige Gespräche.
Warum der KV-Cache klein genug bleibt, um relevant zu sein.
Das ist das Detail, das die lokale Geschichte funktionieren lässt. Von den 64 Schichten nutzen nur 16 volle Aufmerksamkeit; die anderen 48 verwenden die lineare Aufmerksamkeit von Gated DeltaNet, die keinen konventionellen KV-Cache speichert. Der praktische Effekt, gemessen am ursprünglichen Runbook für diese Architektur, ist ein KV-Cache von ungefähr 2 GB bei 32K Kontext — etwa ein Viertel dessen, was ein konventionelles 27B benötigen würde. Deshalb passt eine 16,8 GB große Q4_K_M-Datei weiterhin auf eine 24-GB-Karte mit einem langen Kontextfenster, und deshalb ist die unzensierte GGUF-Reihe auf Hardware lauffähig, die den 55,6 GB großen BF16-Checkpoint überhaupt nicht hosten könnte.
Führe es mit llama.cpp aus.
llama.cpp ist der vorgesehene Weg. Du benötigst einen aktuellen Build: Der Trunk registriert die qwen35-Architektur, und ältere Builds lehnen die Datei rundweg ab. Die Befehlsform, aus den Nutzungshinweisen der Modellkarte und dem Runbook dieser Architektur, lautet:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Damit erhalten Sie einen OpenAI-kompatiblen Endpunkt unter localhost:8080. Für die Bildeingabe fügen Sie --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf hinzu. Tauschen Sie Q4_K_M gegen die Quantisierung, die zu Ihrem VRAM passt; die Flags sind identisch.
Führe es mit Ollama aus.
Ollama führt dieselbe Datei aus, indem es sie aus einer Modelfile importiert, was die unterstützte Methode ist, um ein GGUF hinzuzufügen, das nicht in der Bibliothek ist. In dem Verzeichnis, das das von Ihnen heruntergeladene Quant enthält:
VON ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Speichere diese Zeile als Modelfile, dann ollama create qwen3.8-27b-uncensored -f Modelfile und ollama run qwen3.8-27b-uncensored. Für Vision füge die mmproj-Zeile zur Modelfile hinzu (FROM ... Q4_K_M.gguf plus mmproj-Pfad) und Ollama bindet den Projektor ein. Die gleichen --ctx- und Template-Hinweise gelten: Setze die Kontextgröße, die du tatsächlich unterbringen kannst, und denke daran, dass ein Modell ohne Verweigerungsmechanismus keine Schutzbarriere zwischen dir und der Ausgabe hat.
Was die Beseitigung der Ablehnung tatsächlich verändert hat
Die Modellkarte veröffentlicht eine Sicherheitsbewertungssuite für diesen Build. Bei deaktiviertem Denken sinkt die Verweigerungsrate bei den Standard-Benchmarks für schädliche Aufforderungen von 64–99 % beim Basismodell auf 0–6 % bei den abliterierten Gewichten; bei aktiviertem Denken verweigert es praktisch nie — 1,7 % oder weniger. Die Leistungsbenchmarks bleiben innerhalb von ±1,3 Punkten des Basismodells. Das ist das Muster jeder abliterierten Veröffentlichung dieser Reihe: Verweigerungen entfernt, Fähigkeiten intakt, und mit dem Vorbehalt, dass ein ehrlicher Anteil der Antworten vor der Beantwortung noch einen kurzen Haftungsausschluss voranstellt — ein Trainingsartefakt, keine Verweigerung.
Die Kehrseite ist genau der Sinn der Sicherheitsgrenze unten: Ein Modell, das niemals ablehnt, ist kein besserer Assistent, sondern eine andere Art von Objekt. Es ist ein Testinstrument, um Ablehnungsmechanismen zu messen und herauszufinden, ob die eigene Schutzvorrichtung funktioniert.
Was man in der Forschung tatsächlich damit anfangen kann
Drei legitime Projekte, die die zulässige Verwendung eines Modells ohne Ablehnungsverhalten darstellen:
Wenn dieser Build die falsche Antwort ist
Wenn Sie einen normalen Assistenten möchten oder etwas, das Sie vor Endnutzern einsetzen würden, ist dies das falsche Modell — es hat keine nennenswerten eingebauten Schutzmechanismen, es wird Anfragen nachkommen, die das Basismodell ablehnt, und Apache 2.0 überträgt Ihre Haftung nicht auf andere. Verwenden Sie dafür das ursprünglich alignierte Qwen3.8-27B. Wenn Sie bei einem Chatbot Ablehnungen umgehen möchten, erreicht ein System-Prompt-Paket mehr mit geringerem Risiko als eine Gewichtsänderung. Und wenn Sie überhaupt keine GPU haben, aber das Modell trotzdem untersuchen möchten, bietet die gehostete Karte obsidian/Qwen3.8-27B auf OrcaRouter dieselbe unzensierte Linie für 0,40 $ pro Million Eingabe-Tokens und 4,21 $ pro Million Ausgabe-Tokens mit demselben 262K-Kontext; der Zugang ist auf Sicherheits- und KI-Sicherheitsforscher beschränkt, genau wie beim Repo, und die Entscheidung über die Moderation liegt weiterhin bei Ihnen. Die Modellkarte hat die Preis- und Benchmarkdetails.
Die Sicherheitsgrenze — lesen Sie dies, bevor Sie herunterladen

Bei diesem Modell wurde die Sicherheitsausrichtung weitgehend entfernt. Es wird schädlichen, unethischen, anstößigen oder illegalen Anfragen nachkommen, die das ursprüngliche Qwen3.8-27B ablehnen würde, und es verfügt über keine nennenswerten integrierten Schutzmechanismen. Es wird ausschließlich für legitime Forschung veröffentlicht — Interpretierbarkeit, KI-Sicherheit und Erforschung von Ablehnungsmechanismen, Red-Teaming, Robustheitsbewertung und kontrollierte Experimente. Sie übernehmen die volle Verantwortung und Haftung für die Art und Weise, wie Sie es verwenden, und für alles, was es generiert. Sie dürfen es nicht an Endnutzer ausliefern oder in Produktion einsetzen, ohne eigene Ebenen für Sicherheit, Moderation und Missbrauchsverhinderung hinzuzufügen. Die Autoren übernehmen keine Haftung für Missbrauch. Das Herunterladen des Repositorys bedeutet, dass Sie diese Bedingungen akzeptieren; die Lizenz ist Apache 2.0.
Dieser Artikel enthält bewusst keine schädlichen Prompts. Die obigen Verweigerungszahlen stammen aus der eigenen Sicherheitsbewertungssuite der Modellkarte, was der richtige Weg ist, um ein Modell dieser Klasse zu messen: Führen Sie die standardmäßigen Verweigerungs-Benchmarks aus, lesen Sie die Zahlen und gestalten Sie Ihre Forschung auf der Grundlage dessen, was sie zeigen.
Quellen und Datum
Alle oben genannten Fakten wurden am 16.08.2026 verifiziert. Die Dateiliste und die Größen stammen aus dem Hugging-Face-Repository orcarouter/Qwen3.8-27B-Uncensored-GGUF (erstellt am 16. August 2026; Architektur qwen35; Apache 2.0; mit Zugriffsbeschränkung). Die Verweigerungs- und Fähigkeitswerte stammen aus der Sicherheitsbewertungssuite der Modellkarte. Die KV-Cache-Messung (~2 GB bei 32K Kontext) stammt aus dem OrcaRouter-Runbook für diese Architektur, How to Run Qwen 3.8 27B Locally. Die Preise und Zugriffsbeschränkungen für das gehostete Modell stammen von der Modellseite obsidian/Qwen3.8-27B, geprüft am selben Tag. Die Größen der quantisierten Dateien sind in Dezimal-GB angegeben, wie sie auf Hugging Face gespeichert sind.
Für legitime Forschung sind die Gewichte auf Hugging Face: Download von Hugging Face — keine Kreditkarte, in 60 Sekunden live.
