Hero-Titelkarte für den Artikel 'Qwen3.8-27B-Uncensored-MLX on Apple Silicon', die die Überschrift 'Qwen3.8-27B-Uncensored-MLX', den Untertitel 'The Apple Silicon Runbook', eine Reihe von Quant-Chips mit den Bezeichnungen 2-bit, 4-bit, 6-bit und 8-bit (wobei 4-bit hervorgehoben ist), ein stilisiertes LM-Studio-Fenster mit der Anzeige '4-Bit-Build im Repo-Root' sowie ein 262K-Kontext-Motiv zeigt, wobei das OrcaRouter-Logo in der Ecke eingeblendet ist.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX auf Apple Silicon: So wählen Sie Ihren Build aus, laden ihn in LM Studio oder mlx-vlm und zähmen den 262K-Kontext

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Nützlichste, was man über orcarouter/Qwen3.8-27B-Uncensored-MLX wissen sollte, ist, dass man keinen Unterordner auswählen muss, um es auszuführen. OrcaRouters abliterierter Apple-Silicon-Build von Qw​en/Qwen3.8-27B – veröffentlicht auf Hugging Face am 17. August 2026, also nicht neu, nur unzureichend dokumentiert – hält eine Kopie des 4-Bit-Builds im Repository-Stammverzeichnis bereit, ausdrücklich damit Tools, die ein Repository als ein Modell behandeln, allen voran LM Studio, es ohne jegliche Konfiguration laden. Genau diese Entscheidung ist der Grund, warum diese Karte im letzten Monat etwa 83.000 Downloads verzeichnet hat, während vergleichbare MLX-Konvertierungen nur einen Bruchteil davon erreichen. Alles andere daran ist eine echte Entscheidung: welche der vier Präzisionen in den Unified Memory Ihres Mac passt, welchen Runner Sie verwenden, ob Vision und Tool-Calling bei Ihrer Bitbreite überleben und ob das 262.144-Token-Kontextfenster den Preis wert ist, den es auf Ihrer Hardware kostet. Dieses Runbook geht diese Entscheidungen der Reihe nach durch. Es ist eine Dokumentation aus erster Hand – die unten aufgeführten Größen-, Präzisions- und Fidelity-Werte stammen von OrcaRouter selbst, gemessen an genau diesem Build, und jede Zahl aus der Community ist als solche gekennzeichnet.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

Was genau ist in diesem Repo?

Dies ist ein abliterierter Build von Qw​en/Qwen3.8-27B — ein 27B dichtes Modell mit hybrider Aufmerksamkeit (Gated-DeltaNet-Linearaufmerksamkeit plus voller Aufmerksamkeit), nativ vision-language-fähig, mit Denksteuerung, Tool-Aufruf, einem Multi-Token-Prädiktions- (MTP-) Kopf und einem Kontextfenster von 262.144 Token. Abliteration entfernt das Verweigerungsverhalten des Modells, indem die Verweigerungsrichtung aus dem Residualstrom orthogonalisiert wird. Falls Ihnen das neu ist, ist unsere Einführung in die Technik der bessere Einstieg als diese Seite, die sich mit der Ausführung des Builds befasst, nicht mit der Methode. Die Gewichte stehen unter Apache-2.0 und wurden vom Basismodell übernommen.

Verwechseln Sie dieses Repo nicht mit qwen-3-8-27b-mlx, bei dem es sich um dasselbe Basismodell im MLX-Format ohne die Abliteration handelt. Leser laden regelmäßig das eine herunter, wenn sie eigentlich das andere meinen: Dieses hier ist der Research-Build ohne Refusals; jenes ist das einfache Qw​en/Qwen3.8-27B auf Apple Silicon. Prüfen Sie den Repo-Namen, bevor Sie die Download-Zeit aufwenden.

Ein strukturelles Detail ist wichtiger, als es aussieht: der Vision-Tower, alle Normalisierungen und die Linear-Attention-Conv1d bleiben in BF16, und nur die linearen Schichten des Sprachmodells – einschließlich embed_tokens und lm_head – werden quantisiert. Deshalb übersteht das Bildverständnis die Quantisierung, und deshalb sind die Dateigrößen unten auch etwas größer, als eine naive Schätzung von „27B bei N Bits“ erwarten ließe: Ein Teil des Modells wird nie komprimiert.

Die Entscheidung: welcher Build zu welchem Mac passt

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Vier Präzisionen werden als Unterordner geliefert — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — alle mit MLX-affiner Quantisierung bei Gruppengröße 64. Das 4-bit-Build ist zusätzlich im Repository-Stammverzeichnis gespiegelt. Wählen Sie zuerst nach dem einheitlichen Speicher Ihres Macs, dann nach Qualität:

8-bit — etwa 27,5 GB auf der Festplatte, benötigt einen 64-GB-Mac (eine Maschine mit 32 GB kann es zwar laden, lässt aber wenig Platz für anderes). Gemessene Kosinus-Ähnlichkeit gegenüber der BF16-Quelle: 0,9997, praktisch verlustfrei. Wählen Sie es, wenn Qualität das Wichtigste ist und reichlich Speicher vorhanden ist.

6-bit — ~22 GB, geeignet für 24–32 GB Macs. Genauigkeit 0,9996, ausgezeichnet. Das beste Verhältnis von Qualität pro Gigabyte für die meisten Besitzer eines 48-GB-Macs.

4-bit — ~15 GB, bequem auf einem 24 GB Mac. Fidelity 0.996, sehr gut. Dies ist unser empfohlener Standard, und aus diesem Grund ist es die Kopie im Repo-Stammverzeichnis.

2-bit — ~8,7 GB, passt in einen 16-GB-Mac. Fidelity 0,92 und bei 27B stark degradiert: Wiederholungsschleifen, verstümmelter Text, Code und Chinesisch, eingeschränktes Sehen. Die Karte sagt es deutlich: nur zur Archivierung, nicht für echte Arbeit. Ein 16-GB-Mac kann es technisch laden; das macht es nicht nutzbar.

Die Größe auf dem Datenträger entspricht nicht dem Speicherbedarf. Die Gewichte müssen zusammen mit macOS, dem KV-Cache und den Scratch-Puffern von Metal in den einheitlichen Speicher passen, also plane etwas Reserve ein. Ein Community-Lauf des 4-Bit-Builds auf einem M1-Pro-Mac mit 32 GB maß ~16 GB an Gewichten auf der Platte, aber einen Inferenz-Spitzenwert von 18,5–21,7 GB; Community-Läufe von 8-Bit-MLX-Builds berichten von Spitzenwerten um 34–36 GB, selbst wenn die Gewichte ~29,5 GB betragen. Die praktische Empfehlung aus demselben Community-Test lautet: 16 GB sind für ein 27B-Modell keine echte Option, mit 24 GB kann man 4-Bit mit kurzem Kontext versuchen, und 32 GB sind der komfortable Ausgangspunkt. Unser Artikel zur VRAM-Planung geht für die gesamte Familie dieselbe Rechnung durch.

Da die repository-weite Auflistung über alle Präzisionen insgesamt etwa 94 GB umfasst, lade nur den Unterordner herunter, den du benötigst, mit hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — setze deine gewählte Präzision ein. Die 4-Bit-Kopie im Wurzelverzeichnis ist ein Duplikat des 4-Bit-Unterordners, du musst also nie beide herunterladen.

Weg eins — LM Studio, ohne Konfiguration

Die 4-Bit-Root-Kopie existiert speziell, damit LM Studio das gesamte Repository als ein Modell behandeln kann. Suchen Sie die Modell-ID, wählen Sie die gewünschte Präzision (die Root-Kopie ist 4-Bit), und die App übernimmt den Rest. Drei Stolperfallen, alle von unserer Karte, und sie sind der gesamte Unterschied zwischen Funktionieren und Scheitern:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

Das Repository ist zugriffsbeschränkt. Anonyme Downloads erhalten HTTP 401. Akzeptiere die Bedingungen auf der Modellseite und füge dann einen Hugging-Face-Lesetoken in LM Studio unter Einstellungen → Integrationen → Hugging Face ein. Wenn du das überspringst, schlägt das Laden einfach fehl.

Deaktivieren Sie die KV-Cache-Quantisierung. MLX-Visionsmodelle unterstützen sie auf dieser Architektur nicht, und das Laden schlägt während der Initialisierung fehl, wenn sie aktiviert ist (verfolgt als mlx-engine#286). Dies ist das Gegenteil der Empfehlung für die GGUF-Builds, wo die Quantisierung des K/V-Caches eine legitime VRAM-Ersparnis darstellt — die beiden Formate sind hier nicht austauschbar.

Aktualisieren Sie die Laufzeitumgebung. qwen3_5 Architekturunterstützung wurde in mlx-vlm 0.6.x eingeführt; eine ältere gebündelte Laufzeitumgebung kann diese Gewichte überhaupt nicht laden. Das „Likely too large“-Abzeichen von LM Studio ist dagegen nur eine RAM-Warnung, kein Fehler — ignorieren Sie es, wenn Ihr Unified Memory die obigen Richtlinien erfüllt.

Welche Präzision in LM Studio: 8-Bit belegt ~29,5 GB auf der Festplatte und benötigt einen 64-GB-Mac; 6-Bit mit ~22 GB passt zu einem 48-GB-Rechner; 4-Bit mit ~16 GB ist auf einem 32-GB-Mac die richtige Wahl. Wenn du den Weg über llama.cpp / Ollama auf anderer Hardware gehen möchtest, behandelt unser Leitfaden für das lokale Ausführen des unzensierten Modells diesen Pfad separat.

Weg zwei — mlx-vlm und mlx-lm aus einem Unterordner

Der Kommandozeilenweg bietet Ihnen direkt die Präzision und einen Open​AI-kompatiblen Server für Agent-Tools. Voraussetzungen: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 und mlx ≥ 0.32; das Metal-Backend wird auf Apple Silicon automatisch ausgewählt). Nach dem obigen Herunterladen des Unterordners:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Erkläre die Quantenverschränkung in einem Satz." --max-tokens 256

Fügen Sie --image path/to/image.png für die Bildeingabe hinzu oder stellen Sie es bereit:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

Vision überlebt die Quantisierung

Da der Vision-Turm und die Conv1d-Schicht in BF16 bleiben, bleibt das Bildverständnis bei 4/6/8-Bit erhalten. Bei unserem Testbild — Formen, Farben, Position, Hintergrund und Text im Bild — haben die 4/6/8-Bit-Builds alles korrekt beschrieben; 2-Bit war nur unvollständig. Wenn Sie ein Build auswählen und Bildverständnis eine Rolle spielt, ist 4-Bit das Minimum, das Sie wählen sollten. Wir haben für diesen Build keinen Apple-Silicon-spezifischen Vision-Durchsatz veröffentlicht, also vertrauen Sie keiner tok/s-Zahl dafür, es sei denn, sie stammt aus einem benannten Lauf auf Ihrer eigenen Chipklasse.

Der erhaltene Vision-Turm ist ebenfalls Teil der Risikooberfläche, und es ist wichtig, das klar auszusprechen: Ein abliteriertes Modell, das auch Bilder lesen kann, ist kein reines Text-Sicherheitsproblem.

Tool-Aufrufe und Agentennutzung

Tool-Calling ist eine Basismodell-Fähigkeit und übersteht Abliteration, was diesen Build wirklich nützlich für das Red-Teaming agentischer Systeme macht — und wirklich gefährlich, wenn er auf echte Dienste gerichtet ist. Die Standardkonfiguration ist der mlx_lm.server-Endpunkt oben, den jeder Open​AI-kompatible Agent ansteuern kann. Wenn du es als Agent ausführst, verstehe, was du aktiviert hast: Ein verweigerungsfreies Modell mit Funktionsaufruf und 262K Kontext ist eine andere Sicherheitshaltung als ein Chat-Modell, und die auf reine Forschung beschränkte Einordnung der Karte existiert aus genau diesem Grund.

Der 262K-Kontext und was er wirklich kostet

Die Architektur verschafft diesem Modell einen ungewöhnlich günstigen langen Kontext. Hybrid-Attention bedeutet hier 48 Linear-Attention-Schichten (Gated DeltaNet), die mit 16 Full-Attention-Schichten verschachtelt sind, und nur die 16 Full-Attention-Schichten führen einen klassischen KV-Cache – die linearen Schichten behalten stattdessen einen kompakten rekurrenten Zustand. So kosten 262.144 Token wesentlich weniger als bei einem Full-Attention-27B. Das ist eine strukturelle Tatsache über das Basismodell, kein Versprechen bezüglich deines Mac.

In der Praxis ist das Kontextfenster eine Fähigkeit, keine kostenlose Stufe. Ein Community-Langkontext-Test auf einem M4 Max maß bei kurzem Kontext etwa 63 tok/s, die bei 31K Tokens auf etwa 11 tok/s abfielen — die Dekodierung verschlechtert sich stark, wenn sich der Cache füllt, und die First-Token-Latenz ist bei sehr langen Prompts meist die größere Hürde als der reine Durchsatz. Spekulatives und ANE-basiertes Prefill verbessert die Aufnahme, nicht die Dekodierung. Unsere eigenen Kostenzahlen für den Apple-Silicon-KV-Cache dieses Builds sind nicht veröffentlicht; wenn Sie belastbare Zahlen für Ihre Hardware benötigen, sind die Community-Läufe die ehrliche Quelle, und der Konsens der Community lautet, das volle 262K als etwas zu behandeln, das man bewusst anstrebt, nicht als Standard, den man eingeschaltet lässt.

Geschwindigkeit — was tatsächlich gemessen wird

Wir veröffentlichen genau eine Geschwindigkeitszahl für diesen Build, und sie bezieht sich nicht auf Apple Silicon: ~32–37 tok/s im Dauerbetrieb auf einer einzelnen H200 über das MLX-CUDA-Backend, was bestätigt, dass die Gewichte auch außerhalb von macOS laufen. Bei Macs veröffentlicht unsere Karte bewusst keine tok/s, weil es vom Chip, der Präzision und dem Runner abhängt. Praktikerzahlen, die es wert sind, bekannt zu sein, alle als solche gekennzeichnet:

• Dieser exakte Build, 4-bit, M1 Pro 32 GB: ~8,7 tok/s Generierung und ~41,7 tok/s Prefill bei einem kurzen Lauf (Community-Test, August 2026). Ein älterer Chip, aber eine realistische Untergrenze.

• oMLX mit nativem MTP auf einem M4 Max, Standard-Checkpoint ohne Abliteration: 53,3 tok/s Prosa und 72,1 tok/s Code, mit ~273,7 tok/s Prefill bei 4K; rohes Decoding ohne MTP ~24,6 tok/s. Von einem Praktiker an einem anderen Checkpoint und einer anderen Laufzeit gemessen, also als Obergrenze betrachten, der die abliterierten Gewichte nahekommen könnten, nicht als Versprechen.

oMLX-Dual-ANE-Prefill auf einem M3 Ultra, abliterated oQ4e-MTP: Prefill um ~17,7 % bei 16K und ~18,9 % bei 32K schneller, und Decode über Lightning MTP bis zu ~75 tok/s bei 16K. Die Einschränkungen sind real: Es verwendet private Apple-Laufzeitschnittstellen und approximierte INT8-Gewichte, erhöht den Spitzenspeicherbedarf um etwa 4 GB und verlängert die Modell-Ladezeit von ~3,4 s auf ~28 s. Das ist eine Optimierung der Prompt-Verarbeitung, kein Beschleuniger für die Generierung.

Der MTP-Kopf — eine kostenlose Beschleunigung, wenn Ihr Runner es unterstützt

Dieser Build enthält den Multi-Token-Prädiktions-Drafter des Basismodells im mtp/-Unterordner (Architektur qwen3_5_mtp), und er funktioniert mit jeder Hauptpräzision. Die Akzeptanz ist verlustfrei – bei gieriger Dekodierung ist die Ausgabe identisch mit dem Lauf ohne Drafter – also ist er ein echter Geschwindigkeitsgewinn ohne Qualitätsverlust, wenn er greift. Zwei Einrichtungshinweise aus unserer Karte: Es erfordert einen mlx-vlm-Build, der den qwen3_5_mtp-Drafter (den mainZweig) enthält, und du musst sowohl --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp als auch --draft-kind mtp übergeben. Das alleinige Setzen von mtp_enabled bewirkt nichts. Wenn dein Runner den Drafter nicht unterstützt, wird er ignoriert und das Modell läuft normal – nichts bricht.

Sicherheit — lesen Sie dies, bevor Sie es ausführen, nicht danach.

Der Disclaimer der Modellkarte selbst ist ungewöhnlich direkt, und diese Seite wird ihn nicht abschwächen. Die Sicherheitsausrichtung dieses Builds wurde weitgehend entfernt. Er wird schädlichen, unethischen, anstößigen oder illegalen Anfragen nachkommen, die das Basis-Modell Qw​en/Qwen3.8-27B ablehnen würde, und er verfügt über keine nennenswerten eingebauten Schutzvorkehrungen. Er wird ausschließlich für legitime Forschung veröffentlicht — Interpretierbarkeit, KI-Sicherheit und Untersuchung von Verweigerungsmechanismen, Red Teaming, Robustheitsbewertung und kontrollierte Experimente. Wenn Sie nicht genau das tun, ist dies das falsche Modell.

Zwei Warnungen aus der Modellkarte verdienen besondere Beachtung. Erstens: Jailbreak- und Sicherheits-Sonden „gelingen“ bei einem abliterierten Modell trivialerweise, und das ist keine bestandene Sicherheitsbewertung – es ist das erwartete Verhalten eines Modells, dessen Verweigerungsrichtung entfernt wurde. Das Ausbleiben von Verweigerungen ist kein Beleg für Sicherheit. Zweitens: Die erhaltenen Fähigkeiten für Bildverständnis, Tool-Aufrufe und der 262K-Kontext erweitern die Angriffsfläche auf Bildverständnis und agentische Nutzung: Ein unzensiertes Modell, das Screenshots lesen und Tools aufrufen kann, ist ein größeres Risiko als ein reiner Chat-Build ohne Verweigerung. Niedrige Bit-Quantisierung fügt eine dritte Ebene der Instabilität hinzu – bei 2 Bit kann verstümmelte Ausgabe sogar mit Verweigerung verwechselt werden, was eine eigene Art von verwirrendem Fehler ist.

{{1}} Sie übernehmen die volle Verantwortung und Haftung für Nutzung und Ergebnisse. {{/1}} {{2}} Die Apache-2.0-Lizenz wird vom Basismodell übernommen und ändert daran nichts: Sie erlaubt die Nutzung, macht Ihren Einsatz aber nicht sicher. {{/2}} {{3}} Jede Person, die dies Endnutzern, Minderjährigen oder einer Produktionsumgebung bereitstellt, muss zuerst eigene Ebenen für Moderation, Sicherheit und Missbrauchsprävention hinzufügen und geltendes Recht einhalten. {{/3}} {{4}} Für Forschende, die es tatsächlich ausführen, gelten folgende praktische Schutzmaßnahmen: eine isolierte, idealerweise offline Umgebung; Agent-Tools, die nicht auf echte Dienste ausgerichtet sind; keine Exposition gegenüber Endnutzern; und die Überprüfung von Ausgaben, bevor sie irgendwohin gelangen. {{/4}}

Wenn lokal nicht die Antwort ist

Lokal ist der Sinn dieses Builds – die Gewichte liegen auf deiner Festplatte, es gibt keine Kosten pro Token, und nichts verlässt die Maschine. Aber lokal ist auch eine Begrenzung: Es ist nur auf Apple Silicon verfügbar, man muss mit der Quantisierungsqualität leben, und es gibt keine Redundanz, wenn die Maschine ausgelastet ist. Wenn du ein nicht-abliteriertes Modell der 27B-Klasse über eine API für eine echte Workload benötigst oder dieses lokale Build gegen ein gehostetes Modell mit denselben Prompts A/B-testen möchtest, dann ist das die Lücke, die eine Routing-Schicht füllen soll. OrcaRouter stellt über 200 Modelle hinter einen einzigen API-Schlüssel zum Listenpreis des Anbieters, mit automatischem Failover und einer Routing-DSL – eine Preissenkung des Anbieters wird bei uns am selben Tag wirksam, an dem sie angekündigt wird, weil wir den Listenpreis unverändert weiterreichen. Eine API, eine Integration, und du kannst ein unerprobtes lokales Setup mit einem gehosteten Modell vergleichen, ohne ein zweites Konto einzurichten. Wir hosten dieses MLX-Build nicht – es ist per Design lokale Gewichte – daher ist die API der komplementäre Weg, kein Ersatz dafür.

Der schnelle Entscheidungsleitfaden

• 16-GB-Mac — ehrlich gesagt nicht dieses Modell. 2-Bit passt hinein und ist nur fürs Archiv; du wirst dich so oder so mit dem Speicher herumschlagen. Schau dir ein kleineres unzensiertes Modell an oder die von der Community gemischte 3/6-Bit-Konvertierung, die für Maschinen mit 18–24 GB gebaut wurde.

• 24 GB Mac — 4-Bit, und halten Sie den Kontext kurz; führen Sie Vision und langen Kontext nicht gleichzeitig aus.

• 32 GB Mac — 4-bit ist der Sweet Spot; 6-bit, wenn du den Kontext knapp hältst.

• 48-GB-Mac — 6-Bit mit Headroom; 8-Bit, wenn Sie das Fenster nicht ausreizen.

• 64 GB und mehr — 8-Bit, nahezu verlustfrei und 262K Kontext in Reichweite, mit den oben genannten Einschränkungen.

Das ist das gesamte Runbook. Das Modell stammt vom 17. August 2026, es ist keine Launch-Neuigkeit, und das muss es auch nicht sein: 83.000 Downloads kamen zustande, weil die Leute eine Anleitung wollten, und diese Seite ist genau diese Anleitung. Starte im Repository-Root, lade die 4-Bit-Variante in LM Studio, und weiche nur dann von der Standard-Build ab, wenn du weißt, was du für die Qualität eintauschst. Wenn du von der GGUF- oder FP8-Seite der Familie kommst, behandeln die zugehörigen Anleitungen diese Pfade — der Entscheidungsrahmen ist hier derselbe, die Quantisierungsmathematik nicht.

Nicht noch ein Build dieses Modells — Qwen3.8-Flash-Next-Uncensored ist eine eigenständige Veröffentlichung: abliteriert von Qwen3.8-Flash-Next, eine 176B-gespeicherte / 6B-aktive Mixture-of-Experts-Vorschau der Qwen4-Architektur. Gleiche Abliterationstechnik, andere Gewichte, eine eigene Sammlung.

Alle sechs 27B-Builds — BF16, GGUF, MLX, FP8, INT8 und NVFP4 — sind in der Qwen3.8-27B-Uncensored-Sammlung auf Hugging Face gesammelt.

Diese Gewichte sind bewusst nur lokal verfügbar. Für eine gehostete Baseline, an der der abliterierte Build gemessen werden kann, Qwen3.8-27B wird auf OrcaRouter zum Listenpreis des Anbieters mit 0 % Aufschlag bereitgestellt — das Standardmodell mit intakter Safety-Ausrichtung.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube