Eine Hero-Titelkarte für Qwen3.8-27B-Uncensored-NVFP4, den für Blackwell-Serving konzipierten NVFP4-Build des abliterierten Qwen3.8-27B, die den Titel 'Qwen3.8-27B-Uncensored-NVFP4' und den Untertitel 'Ein Serving-Runbook für Blackwell-GPUs' zeigt, neben einem GPU-Chip-Symbol mit FP4-Kennzeichnung, einem vLLM-Blitzsymbol, einer 262K-Kontextfenster-Anzeige und einem Schloss-Symbol mit Gatter, mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

Qwen3.8-27B-Uncensored-NVFP4: Ein Serving-Runbook für Blackwell-GPUs

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Qwen3.8-27B-Uncensored-NVFP4 ist seit dem 19. August 2026 auf Hugging Face und wurde in den zehn Tagen seither etwa 32.700 Mal heruntergeladen. Dies ist keine Launch-Berichterstattung – die Gewichte sind zehn Tage alt, es gibt keine Ankündigung zu vermelden, und die Schwester-Builds Qwen3.8-27B-Uncensored-FP8 und Qwen3.8-27B-Uncensored-GGUF sind auf diesem Blog bereits dokumentiert. Es ist ein Runbook für einen Build, den die Leute gerade aktiv herunterladen: was NVFP4 tatsächlich ist, warum dieser spezifische Build es mit FP8 mischt, welche GPUs davon profitieren und welche nicht, wie man ihn serviert, und wer ihn den FP8- oder GGUF-Builds vorziehen sollte – und wer nicht.

Zunächst eine Sache vorweg, weil sie jeden Erst-Downloader stolpern lässt: Das Repo ist gesperrt. Der naive hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 Einzeiler schlägt mit einem Authentifizierungsfehler fehl, bis du bei Hugging Face angemeldet bist und die Zugriffsbedingungen des Repos auf der Modellseite akzeptiert hast. Alles unten setzt voraus, dass du beides getan hast.

Auch vorweg: Die Modellkarte dieses Repos liegt hinter derselben Sperre, daher wird hier nichts davon paraphrasiert. Das Folgende basiert auf der öffentlichen Dateiliste und den Repository-Metadaten, auf NVIDIAs öffentlicher NVFP4-Dokumentation sowie auf Berichten aus der Praxis von Personen, die Qwen3.8-27B NVFP4-Builds auf Blackwell betreiben. Wo eine Zahl von einem Praktiker und nicht von einem Hersteller stammt, wird dies im Text vermerkt.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-27B-Uncensored-NVFP4 repo (captured August 29 2026), showing the access gate 'You need to agree to share your contact information to access this model', total downloads of 32,764, the apache-2.0 license, the BF16 / F8_E4M3 / U8 tensor types, and the abliterated, nvfp4, fp4, fp8, vllm and mixed-precision tags.

Was dieser Build ist

Qwen3.8-27B-Uncensored-NVFP4 ist die NVFP4-Quantisierung von Qwen3.8-27B-Uncensored, der abliterierten Version von Ali​baba Qw​en/Qwen3.8-27B, die von der orcarouter-Organisation am 2026-08-18 veröffentlicht wurde. Abliteration entfernt die Verweigerungsrichtung des Modells aus dem Residualstrom; diese Technik wird in unserem Erklärer zu unzensierten Modellen erklärt und hier nicht erneut erläutert. Die Basis ist das dichte 27B-Modell mit hybrider Aufmerksamkeit – 48 lineare Aufmerksamkeitsebenen plus 16 Vollaufmerksamkeitsebenen – natives Bild- und Videoverständnis, ein Kontext von 262.144 Token und ein eingebauter MTP-Spekulations-Dekodierungskopf. Apache 2.0 durchgängig.

Was diesen Build interessant macht, ist nicht die Abliteration, sondern das Quantisierungs-Layout, denn es handelt sich bewusst um einen quantisierten Build – wenn Sie nach NVFP4 gesucht haben, ist das Format der Punkt. Laut den öffentlichen Metadaten des Repos und der Quantisierungs-Konfiguration handelt es sich um einen Mixed-Precision-Compressed-Tensors-Build: Die Attention-Projektionen sind FP8 (E4M3), die MLPs sind NVFP4 (4-Bit, gepackt), und der Vision-Encoder, der MTP-Head, der lm_head sowie die Normen und Biases der linearen Attention bleiben in BF16. Die Safetensors-Metadaten der öffentlichen Dateiliste stimmen mit diesem Schema überein: ungefähr 3,5 Milliarden Parameter in BF16, 9,4 Milliarden in FP8-E4M3 und 15 Milliarden in den gepackten 4-Bit-Tensoren, etwa 24,7 GB auf der Festplatte über fünf Shards plus einen separaten Modell-Extra-Shard. Nichts davon ist eine Behauptung über das Serving-Verhalten – VRAM und Durchsatz zur Laufzeit sind für genau dieses Repo an keiner Stelle veröffentlicht, die ich heute zitieren kann. Die Größe auf der Festplatte stammt aus der Dateiliste, das Format aus der Konfiguration, und das unten beschriebene Serving-Verhalten ist von der Community an eng verwandten NVFP4-Builds verifiziert.

Was NVFP4 ist, und wie es sich von FP8 und von INT8/AWQ unterscheidet

NVFP4 ist NVIDIAs 4-Bit-Gleitkommaformat, eingeführt für die Tensor-Cores der fünften Generation auf Blackwell, und NVIDIAs eigener technischer Blog ist die richtige Primärquelle dafür. Es speichert Gewichte als E2M1 – ein Vorzeichenbit, zwei Exponentenbits, ein Mantissenbit – und skaliert sie in Blöcken: alle 16 Werte teilen sich eine E4M3-FP8-Skalierung, und der gesamte Tensor erhält einen Tensor-übergreifenden FP32-Skalar. Dieses zweistufige Schema ist der ganze Sinn des Formats: Es gewinnt den Dynamikbereich zurück, den ein naives 4-Bit-Gleitkomma verlieren würde, auf Kosten von ein paar Bits Overhead pro Block. Die praktischen Unterschiede in einer Zeile:

NVFP4 vs FP8 — beide sind Gleitkommazahlen, aber FP8 (E4M3, 8-Bit) läuft auf Hopper und Blackwell, während NVFP4 4-Bit ist und nur nativ auf Blackwell beschleunigt wird. NVIDIA gibt an, dass die Gewichte etwa 3,5× kleiner als FP16 und etwa 1,8× kleiner als FP8 sind, und auf Blackwell läuft die Matmul direkt auf den FP4-Tensor-Kernen.

NVFP4 vs. INT8/AWQ — INT8 (W8A8) und AWQ (W4A16) sind Integer-Formate, die ab Ampere verfügbar sind; AWQ ist 4-Bit, aber integer, und auf den meisten Hardware-Plattformen werden die Gewichte für die Matmul-Operation in einen breiteren Typ dequantisiert. NVFP4 ist ein 4-Bit-Float mit Block-Skalierung, wodurch in den niedrigen Bits mehr Präzision erhalten bleibt, und es verfügt über einen nativen FP4-GEMM-Pfad, den die Integer-Formate nicht haben.

NVFP4 gegenüber MXFP4 — die beiden werden ständig verwechselt. MXFP4 verwendet 32-Element-Blöcke und E8M0-Skalen (Zweierpotenzen); NVFP4 verwendet 16-Element-Blöcke und E4M3-Skalen. Die feineren Blöcke verleihen NVFP4 eine bessere Isolierung von Ausreißern, weshalb das Format der De-facto-Standard für 4-Bit auf Blackwell-Serving-Stacks ist.

A two-column scoreboard titled 'NVFP4 vs FP8 — the format scoreboard', comparing NVFP4 (4-bit float E2M1, native FP4 GEMM on Blackwell, not accelerated on Hopper, this uncensored build ~24.7 GB on disk, ~3.5x smaller than FP16, best pick on Blackwell for the smallest footprint) against FP8 (8-bit float E4M3, native FP8 GEMM, full Hopper support, this uncensored build ~30.9 GB on disk, ~1.8x smaller than FP16, best pick on Hopper for max fidelity), with a footer line 'Format facts per NVIDIA; build sizes from public file listings.' and the OrcaRouter logo bottom-right.

Welche Hardware profitiert — und welche nicht.

Die wichtigste Tatsache über diesen Build: NVFP4 ist ein Blackwell-Format. Es zahlt sich nur auf den GPUs aus, deren Tensor-Cores FP4-GEMM nativ implementieren, und auf allem anderen ist es das falsche Werkzeug, egal wie schnell die Maschine auf dem Papier ist.

Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — hier ist NVFP4 die richtige Wahl: native FP4-Tensor-Kerne, der kleinste Server-Footprint in der unzensierten Reihe und das Format, auf das der Build ausgelegt ist.

Hopper — H100/H200 — kein natives FP4-GEMM. NVFP4 fällt auf einen Weight-only-Dequantisierungspfad zurück, der langsamer ist und nichts bringt. Verwenden Sie hier Qwen3.8-27B-Uncensored-FP8; dieser Build ist auf genau dieser Hardware verifiziert.

Ampere/Ada — RTX 3090/4090 — NVFP4 beschleunigt diese ebenfalls nicht. Der GGUF-Build mit seiner Q4_K_M-Stufe bei 16,8 GB ist das richtige Werkzeug für eine 24-GB-Karte.

Apple Silicon — NVFP4 ist auf einem Mac irrelevant. Der MLX-Build (oder GGUF) ist der, der läuft.

Eine ehrliche Nuance: Community-Forks führen NVFP4 weight-only durchaus auf Pre-Blackwell-Hardware aus. Ein Community-NVFP4-Build desselben abliterierten Modells ist ausdrücklich über einen gepatchten vLLM-Fork für Karten der V100-Klasse ausgelegt, und die kürzlich erschienenen DGX-Spark-Rezepte rund um Qwen3.8-27B sind eine Sache für sich. Das sind Spezialpfade mit eigenen Einschränkungen, nicht das Ziel dieses Builds. Wenn du auf Blackwell unterwegs bist, spielt das alles keine Rolle; wenn nicht, ist der FP8- oder GGUF-Build der bessere Download.

Wie man es serviert

Das Repository ist für vLLM getaggt, und das compressed-tensors-Format wird automatisch aus config.json gelesen – man wählt kein Quantisierungsschema manuell aus. Der Stack, auf den sich Praktiker für Qwen3.8-27B-NVFP4-Builds einigen, besteht aus einem aktuellen vLLM auf einer Blackwell-Karte, einem FP8-KV-Cache und dem eigenen MTP-Head des Modells für spekulative Dekodierung. Unsloths NVFP4-Leitfaden, die am häufigsten zitierte Community-Referenz, empfiehlt vLLM 0.25.0 oder neuer mit FlashInfer und der CUTLASS-DSL-Kernel-Abhängigkeit für den schnellen FP4-Pfad.

Ein funktionierender Ausgangspunkt, zusammengestellt aus den verifizierten Flags unseres FP8-Builds und den Community-NVFP4-Rezepten, alles in einer Zeile:

vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'

FP8 KV cache — der am breitesten kompatible Weg, den Cache-Speicher zu halbieren; Praktiker berichten, dass er den verfügbaren Kontext ungefähr verdoppelt. NVFP4-KV-Cache-Unterstützung existiert, ist aber auf einige Attention-Backends beschränkt, daher ist FP8-KV die sicherere Standardoption.

Spekulative MTP-Dekodierung — das Modell bringt einen MTP-Entwurfskopf mit, und die Quantisierung belässt ihn in BF16. Praktiker berichten, dass zwei bis drei Entwurfs-Tokens mit NVFP4-Gewichten auf Blackwell gut funktionieren, mit den größten Vorteilen bei strukturierter Ausgabe wie JSON und Tool-Aufrufen.

Vision — der Vision-Encoder wird in diesem Build in BF16 beibehalten. Fügen Sie --language-model-only hinzu, um nur Text zu bedienen; lassen Sie es weg, wenn Sie Bild- oder Videoeingabe benötigen.

Auf einem DGX Spark — ein paar aus der Praxis gemeldete Stolperfallen: halten Sie --gpu-memory-utilization bei oder unter 0,90 (höhere Werte haben die Maschine beim Laden der Gewichte aufgehängt), und fügen Sie --safetensors-load-strategy lazy hinzu, wenn der Speicher knapp ist. Sie benötigen außerdem einen GB10-Build von vLLM für die sm_121a-Kernel.

Ehrliche Leistungsdaten: Für genau dieses Repository gibt es keine veröffentlichten, unabhängigen Durchsatzmessungen. Die vorhandenen Messungen beziehen sich auf eng verwandte NVFP4-Builds. Unsloth berichtet für seinen eigenen Qwen3.8-27B-NVFP4-Build auf einer B200 das 1,41- bis 1,49-Fache der Tokens pro Sekunde von BF16 (89,8 bis 133,7 tok/s bei Batch 1, 3.048 bis 4.407 bei Batch 64), und ein DGX-Spark-Nutzer in den NVIDIA-Foren berichtet von etwa 20–32 tok/s mit NVFP4-Gewichten, einem FP8-KV-Cache und MTP-Tiefe 3. Beides ist erwähnenswert; keines davon ist ein Benchmark dieses Repositories.

Nutzungsmuster, die tatsächlich funktionieren

Praktiker, die Modelle der Qwen3.8-27B-Familie auf Blackwell ausführen, einigen sich auf eine Handvoll Einstellungen. Behandeln Sie diese als Feldberichte, nicht als Herstellervorgaben — Qw​en dokumentiert das meiste davon nicht, und die eigene Karte dieses Repos ist zugriffsbeschränkt.

„reasoning_effort“ ist der entscheidende Regler.Der Standardwert xhigh lässt das Modell bei jeder Anfrage lange nachdenken. Wer Agent-Schleifen betreibt, setzt standardmäßig medium und wechselt auf low — oder deaktiviert das Denken ganz mit enable_thinking: false — für latenzempfindliche Einzelaufrufe. Auf einer einzelnen Blackwell-GPU führt xhigh-Reasoning bei einer Routineaufgabe dazu, dass man ein schnelles Modell, aber langsame Antworten erhält.

Sampler sind mit dem Denkmodus gekoppelt, nicht unabhängig.Konsens der Community: Denken aktiv läuft mit Temperatur 1.0 / top_p 0.95; Denken ausgeschaltet läuft mit Temperatur 0.7 / top_p 0.80 und presence_penalty 1.5. Das Vertauschen der beiden Sets verschlechtert die Ausgabequalität.

Verwenden Sie eine aktuelle Chat-Vorlage. Die qwen3_5-Vorlage umschließt jede Antwort des Assistenten mit einem Think-Block, und mehrere Anwender berichten bei veralteten Vorlagen von Endlosschleifen oder abgeschnittenen Antworten; die von der Community korrigierten Qw​en-Fixed-Chat-Templates- und Qw​en-Sharp-Varianten setzen preserve_thinking und stoppen die Endlosschleifen. Wenn Ihre Ausgabe über das Stopp-Token hinausschießt, ist dies das Erste, was Sie überprüfen sollten.

Budget für lange Reasoning-Traces in der Agentenarbeit. Praktiker berichten, dass das Modell der 3.8-Generation pro Aufgabe etwa doppelt so viele Tokens ausgibt wie sein Vorgänger 3.6 — der Qualitätssprung ist teilweise auf längeres Denken zurückzuführen. Bei langen xhigh-Antworten streamen Sie die Reasoning-Ausgabe, sonst stoßen Sie auf Gateway-Timeouts.

Die Tool-Aufrufe bleiben durch die Quantisierung intakt.Der Funktionsaufruf-Pfad übersteht sowohl die Abliteration als auch die 4-Bit-Konvertierung; aktivieren Sie ihn mit dem qwen3_coder-Tool-Call-Parser, und das Modell wählt Tools genauso aus wie das Basismodell.

A screenshot of the Artificial Analysis page for Qwen3.8 27B (medium) (captured August 29 2026), showing an Intelligence score of 44, a speed of 52.3 tokens per second, the comparison summary paragraph, $0.50 per 1M input and $3.00 per 1M output token pricing, and a 256k-token context window.

Wer sollte diesen Build wählen — und wer nicht

Die ehrliche Entscheidung, ohne die Quantauswahl-Mathematik zu wiederholen, die unsere FP8- und GGUF-Beiträge bereits im Detail behandeln:

Wählen Sie NVFP4, wenn Sie auf Blackwell bereitstellen und den kleinsten Server-Fußabdruck in der uncensored-Linie mit FP4-Tensor-Core-Geschwindigkeit möchten — und Sie Forschungs-, Red-Team- oder Interpretierbarkeitsarbeit durchführen, die legitimerweise ein abliterated Modell benötigt.

Wählen Sie Qwen3.8-27B-Uncensored-FP8, wenn Sie auf Hopper sind oder den am breitesten verifizierten vLLM-Pfad nutzen möchten — es handelt sich um dieselben Gewichte in 8-Bit, verifiziert auf einer H200, mit einer VRAM-Untergrenze von etwa 40 GB.

Wähle Qwen3.8-27B-Uncensored-GGUF, wenn du eine Consumer-GPU oder einen Mac hast oder llama.cpp statt vLLM verwenden möchtest — die Q4_K_M-Stufe ist der lokale Sweet Spot.

Wählen Sie keines von beiden, wenn Sie maximale Wiedergabetreue wünschen, etwas Benutzersichtbares entwickeln (siehe die Sicherheitsgrenze unten) oder überhaupt nicht selbst hosten möchten — dieselbe unzensierte Linie wird über OrcaRouter, der auf Forscher beschränkt ist, bereitgestellt, sodass keine GPU erforderlich ist.

Die Sicherheitsgrenze — nur für Forschungszwecke

Dies ist ein abliterated Modell, und die Quantisierung setzt die Leitplanken nicht wieder ein. Die Refusal-Richtung wurde aus dem Residualstrom von Qw​en/Qwen3.8-27B entfernt, und NVFP4 ist eine Präzisionsänderung, kein Sicherheitseingriff — das Modell wird Anfragen nachkommen, die das Basismodell ablehnt, und dieser Build hat keine eingebaute Moderation. Es wird für Interpretierbarkeits-, KI-Sicherheits- und Red-Team-Forschung unter Apache 2.0 veröffentlicht, und die Verantwortung liegt bei dir.

Zwei Evaluationshinweise, die im Bereich der unzensierten Modelle viel zu selten vorkommen. Erstens: Ein einzelner Jailbreak-Test, der trivial besteht, ist keine bestandene Sicherheitsevaluierung – abliterierte Modelle fallen bei solchen Tests absichtlich durch. Miss, was dir tatsächlich wichtig ist, mit den richtigen Testverfahren (AdvBench, HarmBench und StrongREJECT für Schädlichkeit; XSTest-safe für übermäßige Verweigerung) und vergleiche die Verweigerungsraten vor und nach dem Eingriff. Zweitens: Bewerte das Quant, nicht nur das Basismodell: Ein 4-Bit-Build kann das Verhalten in Randfällen verändern, selbst wenn die Gesamtwerte gut aussehen. Setze dies nicht ohne eigene Moderations- und Missbrauchsschutzschichten für Endnutzer ein.

Wo OrcaRouter passt

Ein zehn Tage altes quantisiertes Build ist der klassische Fall für Routing statt fester Verdrahtung. Sie können eine Route einrichten, die auf das NVFP4-Build zeigt, das Sie selbst betreiben, und auf ein gehostetes Modell ausweichen, wenn sich das Build unter Last fehlerhaft verhält — eine Schnittstelle, kein Neuverdrahten zwischen Anbietern beim Wechsel. OrcaRouter reicht den Listenpreis des Anbieters mit 0 % Aufschlag durch, sodass sich Ihr Endpoint bei Preisänderungen des zugrunde liegenden Modells noch am selben Tag daran anpasst, statt erst in Ihrem Abrechnungszyklus.

Und wenn es genau darum geht, überhaupt keine GPU betreiben zu müssen: Dieselbe unzensierte Linie ist über OrcaRouter verfügbar, beschränkt auf Sicherheitsforscher und Red Teams, mit automatischem Failover zwischen den Anbietern. Ob Sie dieses NVFP4-Build selbst hosten oder die gehostete Linie aufrufen – es ist in beiden Fällen nur ein API-Schlüssel.

Das Fazit

Qwen3.8-27B-Uncensored-NVFP4 ist der richtige Download, wenn Sie das abliterierte Modell auf Blackwell bereitstellen und den kleinsten Fußabdruck mit FP4-Tensor-Core-Geschwindigkeit wünschen. Es ist der falsche Download auf Hopper (verwenden Sie den FP8-Build), auf einer Consumer- oder Apple-GPU (verwenden Sie den GGUF- oder MLX-Build) oder wenn Sie maximale Wiedergabetreue benötigen. Es ist nicht neu — es ist seit dem 19. August 2026 herunterladbar — aber es wird in großen Mengen heruntergeladen, und jetzt wissen Sie, worauf Sie sich einlassen, bevor Sie das Gate akzeptieren.

Nicht noch ein Build dieses Modells — Qwen3.8-Flash-Next-Uncensored ist eine eigenständige Veröffentlichung: abliteriert von Qwen3.8-Flash-Next, eine 176B-gespeicherte / 6B-aktive Mixture-of-Experts-Vorschau der Qwen4-Architektur. Gleiche Abliterationstechnik, andere Gewichte, eine eigene Sammlung.

Alle sechs 27B-Builds — BF16, GGUF, MLX, FP8, INT8 und NVFP4 — sind in der Qwen3.8-27B-Uncensored-Sammlung auf Hugging Face gesammelt.

Diese Gewichte sind bewusst nur lokal verfügbar. Für eine gehostete Baseline, an der der abliterierte Build gemessen werden kann, Qwen3.8-27B wird auf OrcaRouter zum Listenpreis des Anbieters mit 0 % Aufschlag bereitgestellt — das Standardmodell mit intakter Safety-Ausrichtung.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube