Editorial-Flachvektor-Illustration für einen Technologie-Blog-Hero über das lokale Ausführen eines unzensierten, abliterierten Large Language Models auf der eigenen Hardware: Ein großer, abgerundeter Modell-Chip in tiefem Blau mit einem sanften Cyan-Schimmer schwebt mittig links, seine innere Schaltung löst sich von einer geschlossenen Schlossform in eine offene auf. Rechts daneben eine kompakte GPU-Karte auf einer Werkbank und ein schlankes Terminalfenster mit abstrakten horizontalen Befehlsleisten und einer kleinen Lamasilhouette daneben. In der oberen Ecke ein kleines Mikroskop-Symbol und ein abgerundetes Schild mit einem Warndreieck, das auf Forschungsnutzung und Sicherheitsgrenzen hinweist. Weicher hellblauer und weißer Hintergrund, großzügiger leerer Raum über das untere Drittel. Kein lesbarer Text.
Guides & Insights

So führen Sie Qwen3.8-27B-Uncensored lokal aus: GGUF-Quants, llama.cpp und Ollama

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Um Qwen3.8-27B-Uncensored lokal auszuführen, laden Sie das gated GGUF-Repository orcarouter/Qwen3.8-27B-Uncensored-GGUF von Hugging Face herunter, wählen Sie eine Quantisierung passend zu Ihrem VRAM – Q4_K_M (16,8 GB) für eine GPU mit 24 GB, IQ4_XS (15,3 GB) für eine GPU mit 16 GB, Q3_K_M (13,5 GB), wenn Sie Kontextspielraum wünschen – und stellen Sie es mit einem aktuellen llama.cpp-Build mit dem --jinja-Flag bereit, wobei Sie --mmproj hinzufügen, falls Sie Vision benötigen. Dieselbe Datei lässt sich mit drei Befehlen in Ollama importieren. Dies ist die GGUF-Version des am 16. August 2026 veröffentlichten abliterierten Qwen3.8 27B-Builds mit dem nativen 262K-Kontext, dem Vision-Projektor und dem MTP-Head für spekulatives Decoding, die in jeder Quantisierung erhalten bleiben. Es ist ein Forschungswerkzeug, kein Assistent: Sein Verweigerungsverhalten wurde entfernt, es enthält keine eingebauten Schutzmechanismen, und die Lizenz ist Apache 2.0. Lesen Sie vor dem Download die Sicherheitsgrenze am Ende dieser Seite – sie ist der Zweck des gated Repositories.

Welches GGUF herunterladen, je nach VRAM

Das Repository enthält ein Paar in voller Präzision und zwölf quantisierte Dateien, die Download-Entscheidung ist also wirklich eine VRAM-Entscheidung. Die Zahlen unten sind die Dateigrößen, die am 2026-08-16 aus dem Hugging-Face-Repository ausgelesen wurden.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

Was ist eigentlich im Repo?

orcarouter/Qwen3.8-27B-Uncensored-GGUF enthält fünfzehn Modelldateien: die F16-Gewichte, aufgeteilt in zwei Teile, zwölf quantisierte GGUFs – Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M und IQ4_XS – sowie den mmproj-Visionsprojektor. Es ist der GGUF-Export desselben abliterierten Builds wie Qwen3.8-27B-Uncensored-FP8, neu verpackt für lokale Laufzeitumgebungen der llama.cpp-Klasse, und es erbt die Apache-2.0-Lizenz des Basismodells sowie dessen nativen Kontext von 262.144 Token.

Drei Eigenschaften gelten für alle Quants. Die Architektur ist qwen35 — hybride Aufmerksamkeit mit 48 Gated-DeltaNet-Linearschichten und 16 Vollaufmerksamkeitsschichten — weshalb das Repository sich weigert, in älteren llama.cpp-Builds zu laden, und der KV-Cache klein bleibt. Der MTP (nextn)-Head für spekulative Dekodierung ist in allen Quants erhalten, bei K-quant und IQ gleichermaßen. Und die Chat-Vorlage ist die Qwen-Jinja-Vorlage, die Sie explizit aktivieren müssen (siehe unten), sonst brechen mehrteilige Gespräche.

Warum der KV-Cache klein genug bleibt, um relevant zu sein.

Das ist das Detail, das die lokale Geschichte funktionieren lässt. Von den 64 Schichten nutzen nur 16 volle Aufmerksamkeit; die anderen 48 verwenden die lineare Aufmerksamkeit von Gated DeltaNet, die keinen konventionellen KV-Cache speichert. Der praktische Effekt, gemessen am ursprünglichen Runbook für diese Architektur, ist ein KV-Cache von ungefähr 2 GB bei 32K Kontext — etwa ein Viertel dessen, was ein konventionelles 27B benötigen würde. Deshalb passt eine 16,8 GB große Q4_K_M-Datei weiterhin auf eine 24-GB-Karte mit einem langen Kontextfenster, und deshalb ist die unzensierte GGUF-Reihe auf Hardware lauffähig, die den 55,6 GB großen BF16-Checkpoint überhaupt nicht hosten könnte.

Führe es mit llama.cpp aus.

llama.cpp ist der vorgesehene Weg. Du benötigst einen aktuellen Build: Der Trunk registriert die qwen35-Architektur, und ältere Builds lehnen die Datei rundweg ab. Die Befehlsform, aus den Nutzungshinweisen der Modellkarte und dem Runbook dieser Architektur, lautet:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

Damit erhalten Sie einen OpenAI-kompatiblen Endpunkt unter localhost:8080. Für die Bildeingabe fügen Sie --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf hinzu. Tauschen Sie Q4_K_M gegen die Quantisierung, die zu Ihrem VRAM passt; die Flags sind identisch.

Führe es mit Ollama aus.

Ollama führt dieselbe Datei aus, indem es sie aus einer Modelfile importiert, was die unterstützte Methode ist, um ein GGUF hinzuzufügen, das nicht in der Bibliothek ist. In dem Verzeichnis, das das von Ihnen heruntergeladene Quant enthält:

VON ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Speichere diese Zeile als Modelfile, dann ollama create qwen3.8-27b-uncensored -f Modelfile und ollama run qwen3.8-27b-uncensored. Für Vision füge die mmproj-Zeile zur Modelfile hinzu (FROM ... Q4_K_M.gguf plus mmproj-Pfad) und Ollama bindet den Projektor ein. Die gleichen --ctx- und Template-Hinweise gelten: Setze die Kontextgröße, die du tatsächlich unterbringen kannst, und denke daran, dass ein Modell ohne Verweigerungsmechanismus keine Schutzbarriere zwischen dir und der Ausgabe hat.

Was die Beseitigung der Ablehnung tatsächlich verändert hat

Die Modellkarte veröffentlicht eine Sicherheitsbewertungssuite für diesen Build. Bei deaktiviertem Denken sinkt die Verweigerungsrate bei den Standard-Benchmarks für schädliche Aufforderungen von 64–99 % beim Basismodell auf 0–6 % bei den abliterierten Gewichten; bei aktiviertem Denken verweigert es praktisch nie — 1,7 % oder weniger. Die Leistungsbenchmarks bleiben innerhalb von ±1,3 Punkten des Basismodells. Das ist das Muster jeder abliterierten Veröffentlichung dieser Reihe: Verweigerungen entfernt, Fähigkeiten intakt, und mit dem Vorbehalt, dass ein ehrlicher Anteil der Antworten vor der Beantwortung noch einen kurzen Haftungsausschluss voranstellt — ein Trainingsartefakt, keine Verweigerung.

Die Kehrseite ist genau der Sinn der Sicherheitsgrenze unten: Ein Modell, das niemals ablehnt, ist kein besserer Assistent, sondern eine andere Art von Objekt. Es ist ein Testinstrument, um Ablehnungsmechanismen zu messen und herauszufinden, ob die eigene Schutzvorrichtung funktioniert.

Was man in der Forschung tatsächlich damit anfangen kann

Drei legitime Projekte, die die zulässige Verwendung eines Modells ohne Ablehnungsverhalten darstellen:

Wenn dieser Build die falsche Antwort ist

Wenn Sie einen normalen Assistenten möchten oder etwas, das Sie vor Endnutzern einsetzen würden, ist dies das falsche Modell — es hat keine nennenswerten eingebauten Schutzmechanismen, es wird Anfragen nachkommen, die das Basismodell ablehnt, und Apache 2.0 überträgt Ihre Haftung nicht auf andere. Verwenden Sie dafür das ursprünglich alignierte Qwen3.8-27B. Wenn Sie bei einem Chatbot Ablehnungen umgehen möchten, erreicht ein System-Prompt-Paket mehr mit geringerem Risiko als eine Gewichtsänderung. Und wenn Sie überhaupt keine GPU haben, aber das Modell trotzdem untersuchen möchten, bietet die gehostete Karte obsidian/Qwen3.8-27B auf OrcaRouter dieselbe unzensierte Linie für 0,40 $ pro Million Eingabe-Tokens und 4,21 $ pro Million Ausgabe-Tokens mit demselben 262K-Kontext; der Zugang ist auf Sicherheits- und KI-Sicherheitsforscher beschränkt, genau wie beim Repo, und die Entscheidung über die Moderation liegt weiterhin bei Ihnen. Die Modellkarte hat die Preis- und Benchmarkdetails.

Die Sicherheitsgrenze — lesen Sie dies, bevor Sie herunterladen

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Bei diesem Modell wurde die Sicherheitsausrichtung weitgehend entfernt. Es wird schädlichen, unethischen, anstößigen oder illegalen Anfragen nachkommen, die das ursprüngliche Qwen3.8-27B ablehnen würde, und es verfügt über keine nennenswerten integrierten Schutzmechanismen. Es wird ausschließlich für legitime Forschung veröffentlicht — Interpretierbarkeit, KI-Sicherheit und Erforschung von Ablehnungsmechanismen, Red-Teaming, Robustheitsbewertung und kontrollierte Experimente. Sie übernehmen die volle Verantwortung und Haftung für die Art und Weise, wie Sie es verwenden, und für alles, was es generiert. Sie dürfen es nicht an Endnutzer ausliefern oder in Produktion einsetzen, ohne eigene Ebenen für Sicherheit, Moderation und Missbrauchsverhinderung hinzuzufügen. Die Autoren übernehmen keine Haftung für Missbrauch. Das Herunterladen des Repositorys bedeutet, dass Sie diese Bedingungen akzeptieren; die Lizenz ist Apache 2.0.

Dieser Artikel enthält bewusst keine schädlichen Prompts. Die obigen Verweigerungszahlen stammen aus der eigenen Sicherheitsbewertungssuite der Modellkarte, was der richtige Weg ist, um ein Modell dieser Klasse zu messen: Führen Sie die standardmäßigen Verweigerungs-Benchmarks aus, lesen Sie die Zahlen und gestalten Sie Ihre Forschung auf der Grundlage dessen, was sie zeigen.

Quellen und Datum

Alle oben genannten Fakten wurden am 16.08.2026 verifiziert. Die Dateiliste und die Größen stammen aus dem Hugging-Face-Repository orcarouter/Qwen3.8-27B-Uncensored-GGUF (erstellt am 16. August 2026; Architektur qwen35; Apache 2.0; mit Zugriffsbeschränkung). Die Verweigerungs- und Fähigkeitswerte stammen aus der Sicherheitsbewertungssuite der Modellkarte. Die KV-Cache-Messung (~2 GB bei 32K Kontext) stammt aus dem OrcaRouter-Runbook für diese Architektur, How to Run Qwen 3.8 27B Locally. Die Preise und Zugriffsbeschränkungen für das gehostete Modell stammen von der Modellseite obsidian/Qwen3.8-27B, geprüft am selben Tag. Die Größen der quantisierten Dateien sind in Dezimal-GB angegeben, wie sie auf Hugging Face gespeichert sind.

Für legitime Forschung sind die Gewichte auf Hugging Face: Download von Hugging Face — keine Kreditkarte, in 60 Sekunden live.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube