
Qwen3.8-Flash-Next-Uncensored: Abliteriertes MoE auf llama.cpp und Apple Silicon ausführen
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Bevor du etwas herunterlädst: Qwen3.8-Flash-Next-Uncensored ist nicht Qwen3.8-27B-Uncensored. Sie teilen sich einen Familiennamen und eine Abliterationstechnik, aber es sind verschiedene Modelle aus unterschiedlichen Weight-Drops, und jeder frühere „Qwen uncensored“-Beitrag in diesem Blog handelt von der 27B. Thema hier ist das Paar, das OrcaRouter am 26. August 2026 auf Hugging Face veröffentlicht hat — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF und orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — abliterierte Builds von Qwen3.8-Flash-Next, Alibabas geroutetes Mixture-of-Experts-Modell mit 176B gespeicherten und 6B aktiven Parametern, das einen Vorgeschmack auf die Qwen4-Architektur gibt. Wir haben das Release als „GGUF + natives MLX, bis zu 262K Kontext“ angekündigt, gerichtet an Sicherheitsforscher, Red Teams und Blue Teams. Dieses Runbook wurde aus unseren eigenen Model Cards erstellt: was Refusal-Entfernung in einem gerouteten MoE bewirkt, was die 262K-Kontext-Angabe tatsächlich an Speicher kostet, wie man beide Datei-Linien bereitstellt und wo die Forschungslinie steht. Wenn du eigentlich die Abliteration-Einführung oder die Quant-Mathe zur 27B suchst: Die früheren Beiträge dieser Serie behandeln genau das.

Zuerst das Tor
Beide Repos sind auf Hugging Face gated (gated: auto). Es werden keine Dateien heruntergeladen, bis du angemeldet bist und die Repository-Bedingungen für jedes Repo akzeptiert hast — die GGUF- und MLX-Repos haben jeweils ihr eigenes Gate. Das ist der praktischste Unterschied zu einer ungated GGUF-Linie: Der naive Einzeiler "just hf download" schlägt mit einem Authentifizierungsfehler fehl, bevor er auch nur ein Byte abruft. Der Ablauf ist:
• Melden Sie sich bei Hugging Face an (oder registrieren Sie sich) und installieren Sie huggingface_hub, führen Sie dann einmal hf auth login aus, damit Ihr Token auf der Festplatte gespeichert wird.
• Öffnen Sie {{1}}orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF{{/1}} im Browser, akzeptieren Sie die Bedingungen, und wiederholen Sie dies dann für {{2}}orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX{{/2}}.
Ab dann funktioniert hf download mit deinem authentifizierten Token wie jedes andere Repo. Jedes Quant, das du abrufst, und die MLX-Gewichte sind Forschungsartefakte unter Apache-2.0 – derselben Lizenz wie das Basismodell – und die Zugangsbeschränkung ist Teil des Deals: Die Bedingungen zu lesen ist der erste Schritt zur Nutzung des Modells.

Was Abliteration mit einem gerouteten MoE macht
Die Technik ist der Arditi-artige Gewichts-Edit, den wir anderswo auf diesem Blog behandelt haben; das Interessante ist, was er speziell mit dieser Architektur macht. Bei dem dichten 27B waren es 131 Residualmatrizen. Bei Qwen3.8-Flash-Next-Uncensored verzeichnet die MLX-Modellkarte, dass Abliteration auf 149 Residual-Writer-Tensoren angewendet wurde, und die Komponenten, die dieses Modell zu dem machen, was es ist – der MoE-Router, die 51B-n-gram-Einbettungstabelle, der Vision-Turm – wurden ausdrücklich nie angefasst.
Das „nie angefasst“ ist die ganze Geschichte für ein geroutetes Modell. Jedes Token aktiviert 10 von 512 Experten; kein einzelner Experte besitzt die Verweigerung. Das Verweigerungsverhalten lebt im Residualstrom, der die endgültige Ausgabe zusammensetzt – und genau in diese Richtung greift die Orthogonalisierung ein. Der Router routet also weiterhin dieselben Experten, die n-gram-Tabelle erzeugt weiterhin dieselben Einbettungen, und was sich ändert, ist das, was das Modell sagt, sobald die Ausgabeprojektion läuft. Die veröffentlichten Prüfungen auf der GGUF-Modellkarte beziffern die Form dieser Änderung so: Die Verweigerung bei schädlichen Aufforderungen sinkt von 64–100 % im Basismodell auf etwa 0–3,3 % in diesem Build, die gutartige Überverweigerung liegt bei nahe 0 %, und die Leistungsfähigkeit bleibt innerhalb von ±2 Punkten gegenüber dem Basismodell bei MMLU-Pro-, GSM8K- und CMMLU-artigen Prüfungen. Das sind die eigenen Zahlen der Modellkarte, selbst berichtet und nicht unabhängig nachvollzogen.
Der MTP-Head: in MLX vorhanden, in GGUF entfernt.
Qwen3.8-Flash-Next wird mit einem ~4B großen spekulativen Multi-Token-Prediction-Kopf ausgeliefert, und die beiden Builds gehen unterschiedlich damit um. Das GGUF-Repo schließt ihn aus — die Modellkarte sagt ausdrücklich, dass diese Dateien den spekulativen MTP-Entwurfskopf nicht enthalten —, weil llama.cpps qwen4exp-Unterstützung MTP noch nicht implementiert und der Kopf in der Datei nur Ballast wäre. Der MLX-Build behält ihn, sodass du auf Apple Silicon weiterhin spekulatives Decoding bekommst. Die praktische Konsequenz, von Praktikern bestätigt, die das Basismodell betreiben: Die llama.cpp-GGUF-Variante läuft heute ohne spekulatives Decoding, während ein MTP-fähiges SGLang-Setup den Decode auf derselben Hardwareklasse mehr als verdoppelt. Falls llama.cpp jemals MTP für qwen4exp implementiert, bekommt die GGUF-Linie einen kostenlosen Geschwindigkeitsschub — aber kauf keine Hardware in der Erwartung, dass es diese Woche passiert.
Die 262K-Kontextbehauptung und was der KV-Cache kostet
Der native Kontext beträgt 262.144 Token (per YaRN auf 1M erweiterbar), und die Einschränkung, die tatsächlich zwickt, ist der Speicher. Die gute Nachricht ist, dass die Architektur den KV-Cache klein hält: Von den 48 Schichten verwenden 36 lineare Gated-DeltaNet-Aufmerksamkeit, die die Historie in einen rekursiven Zustand fester Größe komprimiert, und nur die 12 Full-Attention-Schichten führen einen konventionellen KV-Cache, der mit der Sequenzlänge wächst.
Zwei von der Community gemessene Datenpunkte, beide auf dem Basismodell, übertragen sich direkt. Ein 4×-RTX-3090-GGUF-Deployment berichtete, dass es mit nur ~0,78 GB zusätzlichem KV pro Karte von 65K auf 131K Kontext ging, und ein einzelner DGX Spark lief mit einer Q4-Klasse-Datei auf volle 262K Kontext, während das Modell mit ~76,9 GB seines 128-GB-Pools im Speicher blieb, indem die n-gram-Tabelle auf die CPU gepinnt und per mmap von NVMe eingeblendet wurde. Die Budgetzeile der GGUF-Modellkarte selbst lautet: Gesamt = Dateigröße + KV-Cache + die ~0,9 GB mmproj. Das Fazit für die Quantisierungswahl: Bei 262K ist der KV-Cache ein echter Kostenpunkt, aber die Gewichte sind der dominierende Faktor, also gilt dieselbe VRAM-zuerst-Logik aus dem 27B-GGUF-Leitfaden — der Unterschied hier sind die Dateigrößen selbst, die von IQ2_XXS mit etwa 52 GB bis Q5_K_M mit etwa 125 GB reichen.
Die GGUF-Reihe: 13 Quantisierungen, Split-Dateien, mmproj und ein llama.cpp-Build
Das GGUF-Repository enthält 13 Quantisierungsstufen — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — wobei die IQ-Quantisierungen aus einer Wichtigkeitsmatrix erstellt wurden, die auf englischen, chinesischen und Code-Kalibrierungstexten basiert. Jede Quantisierung ist mehrteilig und wurde mit llama-gguf-split aufgeteilt. Lade daher den gesamten Satz für eine Quantisierung herunter und weise den Loader auf den Teil ...-00001-of-000NN.gguf hin. Es gibt keine Stufe Q6_K, Q8_0 oder F16, und der Grund ist struktureller Natur und nicht wirtschaftlich: Die n-gram (PLE) Embedding-Tabelle ist ein Tensor, der zu groß ist, um bei 6 Bit und darüber Hugging Faces 50-GB-Limit pro Datei einzuhalten, und ein einzelner GGUF-Tensor kann nicht auf mehrere Dateien aufgeteilt werden — daher endet die Reihe bei Q5_K_M.
Die andere Datei, die du nicht überspringen darfst, ist mmproj-...-F16.gguf, etwa 0,9 GB: Dies ist ein Vision-Language-Modell, und llama.cpp benötigt den Projektor für jede Bildeingabe. Qwen3.8-Flash-Next ist multimodal, und dieser Build ebenfalls – die Abliteration berührt den Vision-Turm nicht.
llama.cpp-Support ist noch nicht im Mainline enthalten. Die Architektur-ID lautet qwen4exp, und Standard-Builds schlagen mit „unknown architecture 'qwen4_exp'“ fehl; Sie benötigen einen Build von PR #27742 (Branch qwen4exp/qwen3.8-flash-next), der mit den Zielen llama-cli, llama-mtmd-cli, llama-server und llama-gguf-split kompiliert wurde. Danach ist die Serving-Form der übliche llama.cpp-Server mit Qwen-spezifischen Flags, wobei der Quantname aus den Part-Dateien verwendet wird:
llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
Setzen Sie -c auf den Kontext, den Sie unterbringen können; das Beispiel der Modellkarte beginnt bei 8192. Das Reasoning ist standardmäßig aktiviert und wird in reasoning_content zurückgegeben, und Tool-Aufrufe funktionieren über den OpenAI-kompatiblen Endpunkt. Die obigen Sampling-Werte sind die Empfehlung der Modellkarte; Praktiker verwenden beim Basismodell temp 0.7 / top-p 0.80 / top-k 20 mit einer Presence-Penalty von 1.5 im nicht denkenden Instruct-Modus und stimmen die Reasoning-Tiefe mit --chat-template-kwargs {"reasoning_effort":"medium"} ab.
Der MLX-Build auf Apple Silicon
Das MLX-Repo ist der native Apple-Silicon-Pfad: gleiche Gewichte, gleiches Refusal-Removal, eine Metal-native Laufzeitumgebung. Es bringt 4-Bit als Standard (~163 GB), den angekündigten 6-Bit-Build (~192 GB) und eine 8-Bit-Stufe (~221 GB) mit. Da die fused-3D-Experten und die n-Gramm-Tabelle mit höherer Präzision als die nominelle Kennzeichnung gehalten werden, liegt die effektive Präzision deutlich über einheitlichem 4-Bit — die Modellkarte listet ~7,85 effektive Bits pro Gewicht für das „4-Bit“-Etikett. Genau deshalb wirken die Repo-Größen groß: Die n-Gramm-Tabelle wird nicht so stark herunterkomprimiert, wie Community-Quants es tun.

Hardware ist der begrenzende Faktor. MLX läuft nur auf Apple Silicon (Metal), und man braucht Unified Memory für die Gewichte – die Modellkarte sagt: „ein Mac mit genügend Unified Memory für die 163-GB-Gewichte (z. B. M-Series Ultra)“. Behandle die 4-Bit-Stufe als Maschine der 192-GB-Klasse und den 6-Bit-Build als 256-GB-Klasse. Die Tags der Modellkarte erfassen das vollständige Feature-Set – qwen4_exp, MoE, MTP, Function Calling, Vision-Language – und sie wird über mlx-vlm für Bildeingaben betrieben. Der spekulative MTP-Head ist hier enthalten, was der stille Vorteil des MLX-Builds gegenüber der GGUF-Linie ist.
Der Vision-Pfad, für diejenigen, die ihn nutzen
Da dies ein Vision-Language-Modell ist, ist der multimodale Pfad Teil des Runbooks und kein Extra. Bei llama.cpp erfordert die Bildeingabe sowohl den mmproj-Projektor als auch einen Build, der llama-mtmd-cli / llama-server enthält. Bei MLX betreibst du es mit mlx-vlm anstelle des reinen Text-Treibers mlx-lm. Für Red Teams ist der Vision-Pfad der Ort, an dem die interessante Evaluierungsarbeit stattfindet: multimodale Guardrails, in einem Bild eingebettete Prompt-Injection, OCR gegen Screenshots der eigenen Systeme und adversariale Bilder, die auf die gesamte Pipeline abzielen. Da die Abliteration das gesamte Modell abdeckt und den Vision-Tower intakt lässt, landet ein Bild, das im Text-Head eine Verweigerung ausgelöst hätte, schlicht auf einem Modell ohne Verweigerungsverhalten. Die GGUF-Card besagt, dass Vision und Multi-Turn-Tool-Calling in diesem Build verifiziert wurden; es wird keine separate Vision-Eval-Suite veröffentlicht.
Wozu das dient und wo die Grenze liegt.
Dieser Build existiert für eine einzige Art von Arbeit: zu evaluieren, was ein Modell ohne Verweigerungsmechanismen leisten kann, um Systeme zu verstehen und zu verteidigen. Für ein Red Team bedeutet das, die eigenen Schutzmechanismen gegen ein Modell zu testen, das nicht höflich ablehnen wird – Prompt-Injection-Resistenz, Exfiltrationsszenarien, Missbrauch der Tool-Nutzung und die Kluft zwischen „das Basismodell lehnt ab“ und „das Modell kann das tatsächlich nicht“. Genau diese Kluft ist der gesamte Forschungswert eines abliterierten Builds: Sie zeigt, was die Verweigerungsschicht verborgen hat – nämlich den Unterschied zwischen Sicherheit durch Richtlinien und Sicherheit durch Fähigkeiten. Für ein Blue Team sind dieselben Gewichte die plausible Ausgangsbasis des Angreifers: Wenn ein feindlicher Akteur diesen Build herunterladen und ausführen kann, müssen Ihre Verteidigungsmaßnahmen gegen ein Modell standhalten, das antwortet, statt abzulehnen. Darauf aufbauende Evaluationen sind eine Untergrenze für das, was ein maßgeschneidertes, nie aligniertes Modell tun könnte – betrachten Sie sie so, nicht als Obergrenze.
Sei dir klar darüber, was das Entfernen von Refusals ändert und was nicht. Es verändert das Ausgabeverhalten – das Modell lehnt nicht mehr ab – und es verändert nicht die Fähigkeiten. Kein neues Wissen, keine neuen Fähigkeiten, keine neue Rechenleistung; dasselbe Training, dieselben Grenzen dessen, was das Modell tatsächlich erzeugen kann. Ein abliteriertes Modell kann keine Malware konstruieren, zu der es vorher nicht in der Lage war; es antwortet einfach, statt auszuweichen, und seine Ausgaben sind nicht wahrhaftiger, nur weil sie permissiver sind. Das ±2-Punkte-Fähigkeitsband der Karte und der Zusammenbruch der Refusal-Zahlen sind dieselbe Tatsache, aus zwei Perspektiven gesehen.
Wo die Grenze verläuft, legt die Gated-Repository-Vereinbarung fest, und sie ist kein Standardtext. Legitime Nutzung: Bewertung eigener Systeme, öffentliche Schwachstellenforschung an Modellen, Erstellung von Erkennungs- und Verteidigungsevaluierungen, {{1}}Untersuchung von Ablehnungsmechanismen{{/1}}. Nicht legitim: Bereitstellung als benutzerorientierter Assistent, Erzeugung funktionsfähiger Malware oder Exploits gegen Systeme, die Sie nicht besitzen oder für die Sie keine Testberechtigung haben, {{2}}Betrug, Waffenmaterial{{/2}}. Die Apache-2.0-Lizenz und das anwendbare Recht bilden die Untergrenze; das Tor ist die ausdrückliche Forschungszweck-Vereinbarung darüber. Wenn Ihr Anwendungsfall darin besteht, „einen Chatbot an Benutzer auszuliefern“, ist dies nicht Ihr Modell – und das ist Absicht, kein Versehen.
So erhalten Sie die ausgelieferte Baseline
Diese Gewichte sind bewusst nur lokal verfügbar: Die Test-Payloads eines Red Teams sollten niemals über eine Drittanbieter-API übertragen werden, und genau darum geht es beim Self-Hosting. Wenn Sie die zensierte, bereitgestellte Basislinie zum Vergleich möchten – Alibabas Qwen3.8-Flash für 0,16 $ pro Million Input und 0,47 $ pro Million Output – leitet OrcaRouter sie zum Listenpreis des Anbieters mit 0 % Aufschlag und automatischem Failover weiter, sodass eine Bewertungsumgebung zwischen der gehosteten Basis und Ihrem lokalen unzensierten Build mit einem einzigen Schlüssel und ohne zweiten Vertrag wechseln kann. Die offenen Qwen3.8-Flash-Next-Gewichte sind noch nicht in unserem Katalog; sobald eine von uns geroutete Laufzeit sie enthält, landen sie in demselben Setup mit einem Schlüssel und zum Listenpreis.
Hier beginnen
Entscheiden Sie, welche Zeile zu Ihrer Hardware passt, und lesen Sie dann das entsprechende Gate. Auf einem Mac mit 128 GB oder mehr einheitlichem Speicher vereint der MLX-Build MTP und Vision an einem Ort – akzeptieren Sie die Bedingungen des MLX-Repos, laden Sie die 4-Bit- oder 6-Bit-Gewichte und betreiben Sie sie mit mlx-vlm. Auf einem NVIDIA-, AMD- oder CPU-Rechner kompilieren Sie llama.cpp aus PR #27742, akzeptieren Sie die Bedingungen des GGUF-Repos, laden Sie eine passende Quantisierung und vergessen Sie nicht die mmproj-Datei. In beiden Fällen stammen die Ablehnungszahlen und das Fähigkeitsband aus dem Repo selbst, wurden auf der Karte veröffentlicht und sind bei Erstellung dieses Textes noch nicht reproduziert worden – die ehrliche Lesart ist, sie als Messung des Anbieters seiner eigenen Bearbeitung zu betrachten, nicht als unabhängiges Audit. Das Gate, die Lizenz und die oben genannte Sicherheitsgrenze sind derselbe Text aus drei Blickwinkeln: Dies ist ein Forschungsinstrument, und es wird unter dieser Bedingung veröffentlicht.
der Qwen3.8-Flash-Next-Uncensored-Sammlung auf Hugging Face.
Nicht zu verwechseln mit der 27B-Familie: Qwen3.8-27B-Uncensored ist ein anderes Modell, das aus einer anderen Basis abliteriert wurde, mit eigener Sammlung und eigenen Runbooks. Gleiche Technik, andere Gewichte.
Diese Gewichte sind bewusst nur lokal verfügbar. Für eine gehostete Baseline, gegen die der abliterierte Build gemessen werden kann, wird Qwen3.8-Flash auf OrcaRouter zum Listenpreis des Anbieters mit 0 % Aufschlag bereitgestellt — das unveränderte Modell mit intakter Sicherheitsausrichtung.
