Karta tytułowa hero dla modelu Qwen3.8-27B-Uncensored-NVFP4 – wersji NVFP4 przeznaczonej do serwowania na Blackwell, opartej na abliterowanym modelu Qwen3.8-27B – przedstawiająca tytuł „Qwen3.8-27B-Uncensored-NVFP4" i podtytuł „Podręcznik serwowania dla układów GPU Blackwell" obok ikony układu GPU oznaczonej FP4, ikony błyskawicy vLLM, wskaźnika okna kontekstowego 262K oraz ikony zamkniętej kłódki, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Qwen3.8-27B-Uncensored-NVFP4: Podręcznik serwowania dla GPU Blackwell

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen3.8-27B-Uncensored-NVFP4 jest na Hugging Face od 19 sierpnia 2026 roku i w ciągu dziesięciu dni od publikacji został pobrany około 32 700 razy. To nie jest relacja z premiery — wagi mają dziesięć dni, nie ma żadnego ogłoszenia do opisania, a warianty poboczne Qwen3.8-27B-Uncensored-FP8 i Qwen3.8-27B-Uncensored-GGUF są już udokumentowane na tym blogu. To instrukcja obsługi dla wersji, którą ludzie właśnie teraz aktywnie pobierają: czym naprawdę jest NVFP4, dlaczego ta konkretna wersja łączy go z FP8, które GPU zyskują, a które nie, jak ją serwować oraz kto powinien wybrać ją zamiast wersji FP8 lub GGUF — a kto nie.

Jedna rzecz na wstępie, która zaskakuje każdego, kto pobiera po raz pierwszy: repozytorium ma ograniczony dostęp. Naiwne hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 polecenie jednolinijkowe kończy się błędem uwierzytelniania, dopóki nie zalogujesz się do Hugging Face i nie zaakceptujesz warunków dostępu do repozytorium na stronie modelu. Wszystko poniżej zakłada, że zrobiłeś jedno i drugie.

Także na wstępie: karta modelu tego repozytorium znajduje się za tą samą bramą, więc nic tutaj jej nie parafrazuje. Poniższe opiera się na publicznym wykazie plików i metadanych repozytorium, na publicznej dokumentacji NVFP4 firmy NVIDIA oraz na raportach z praktyki osób wdrażających wersje Qwen3.8-27B NVFP4 na Blackwell. Jeśli jakaś liczba pochodzi od praktyka, a nie od producenta, tekst to zaznacza.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-27B-Uncensored-NVFP4 repo (captured August 29 2026), showing the access gate 'You need to agree to share your contact information to access this model', total downloads of 32,764, the apache-2.0 license, the BF16 / F8_E4M3 / U8 tensor types, and the abliterated, nvfp4, fp4, fp8, vllm and mixed-precision tags.

Czym jest ten build

Qwen3.8-27B-Uncensored-NVFP4 jest kwantyzacją NVFP4 modelu Qwen3.8-27B-Uncensored, abliterowanej wersji modelu Ali​baba o nazwie Qw​en/Qwen3.8-27B, którą organizacja orcarouter opublikowała 2026-08-18. Abliteracja usuwa kierunek odmowy modelu ze strumienia resztkowego; technika ta jest wyjaśniona w naszym objaśnieniu modeli bez cenzury i nie jest tu ponownie wyjaśniana. Bazą jest gęsty model 27B z hybrydową uwagą — 48 warstw z liniową uwagą plus 16 warstw z pełną uwagą — natywne rozumienie obrazów i wideo, kontekst 262 144 tokenów oraz wbudowana głowica do spekulatywnego dekodowania MTP. Apache 2.0 od początku do końca.

To, co czyni tę kompilację interesującą, to nie abliteracja, lecz układ kwantyzacji, ponieważ jest to celowo skwantowana kompilacja — jeśli szukałeś NVFP4, właśnie ten format jest sednem. Zgodnie z publicznymi metadanymi repozytorium i konfiguracją kwantyzacji jest to wersja mieszanej precyzji oparta na compressed-tensors: projekcje uwagi są w FP8 (E4M3), MLP w NVFP4 (4-bitowe, spakowane), a enkoder wizyjny, głowa MTP, lm_head oraz normy i biasy uwagi liniowej pozostają w BF16. Metadane safetensors z publicznego spisu plików zgadzają się z tym schematem: około 3,5 miliarda parametrów w BF16, 9,4 miliarda w FP8-E4M3 oraz 15 miliardów w spakowanych tensorach 4-bitowych, co daje około 24,7 GB na dysku w pięciu shardach plus osobny shard model-extra. Żadne z powyższych nie jest twierdzeniem o tym, jak model się serwuje — rzeczywiste zużycie VRAM i przepustowość dla dokładnie tego repozytorium nie są opublikowane w żadnym miejscu, które mógłbym dziś przytoczyć. Rozmiar na dysku pochodzi ze spisu plików, format z konfiguracji, a opisane poniżej zachowanie podczas serwowania jest zweryfikowane przez społeczność na ściśle powiązanych kompilacjach NVFP4.

Czym jest NVFP4 i czym różni się od FP8 oraz od INT8/AWQ

NVFP4 to 4-bitowy format zmiennoprzecinkowy firmy NVIDIA, wprowadzony dla piątej generacji rdzeni tensorowych w architekturze Blackwell, a oficjalny blog techniczny NVIDII jest właściwym źródłem pierwotnym na jego temat. Przechowuje wagi jako E2M1 — jeden bit znaku, dwa bity wykładnika, jeden bit mantysy — i skaluje je blokami: co 16 wartości ma wspólną skalę E4M3 FP8, a cały tensor jest skalowany pojedynczym skalarem FP32. Ten dwupoziomowy schemat to cały sens tego formatu: odzyskuje zakres dynamiczny, który straciłby naiwny 4-bitowy format zmiennoprzecinkowy, kosztem kilku bitów narzutu na blok. Praktyczne różnice w formie jednowierszowej:

NVFP4 a FP8 — oba są zmiennoprzecinkowe, ale FP8 (E4M3, 8-bitowy) działa na Hopper i Blackwell, podczas gdy NVFP4 jest 4-bitowy i jest natywnie przyspieszany tylko na Blackwell. NVIDIA podaje, że wagi są około 3,5× mniejsze niż FP16 i około 1,8× mniejsze niż FP8, a na Blackwell matmul działa bezpośrednio na rdzeniach tensorowych FP4.

NVFP4 vs INT8/AWQINT8 (W8A8) i AWQ (W4A16) to formaty całkowitoliczbowe, które są wspierane od architektury Ampere wzwyż; AWQ jest 4-bitowy, ale całkowitoliczbowy, a na większości sprzętu wagi są dekwantyzowane do szerszego typu na potrzeby mnożenia macierzy. NVFP4 to 4-bitowy format zmiennoprzecinkowy ze skalowaniem blokowym, dzięki czemu zachowuje większą precyzję w niskich bitach i ma natywną ścieżkę GEMM FP4, której nie mają formaty całkowitoliczbowe.

NVFP4 vs MXFP4 — te dwa formaty są ciągle mylone. MXFP4 wykorzystuje bloki 32-elementowe i skale E8M0 (potęgi dwójki); NVFP4 używa bloków 16-elementowych i skal E4M3. Drobniejsze bloki zapewniają NVFP4 lepszą izolację wartości odstających, dlatego ten format jest de facto standardem 4-bitowym w stosach serwujących Blackwell.

A two-column scoreboard titled 'NVFP4 vs FP8 — the format scoreboard', comparing NVFP4 (4-bit float E2M1, native FP4 GEMM on Blackwell, not accelerated on Hopper, this uncensored build ~24.7 GB on disk, ~3.5x smaller than FP16, best pick on Blackwell for the smallest footprint) against FP8 (8-bit float E4M3, native FP8 GEMM, full Hopper support, this uncensored build ~30.9 GB on disk, ~1.8x smaller than FP16, best pick on Hopper for max fidelity), with a footer line 'Format facts per NVIDIA; build sizes from public file listings.' and the OrcaRouter logo bottom-right.

Który sprzęt przynosi korzyści — a który nie

Najważniejszy fakt dotyczący tej kompilacji: NVFP4 to format Blackwell. Sprawdza się tylko na GPU, których rdzenie tensorowe natywnie implementują FP4 GEMM, a na wszystkim innym jest niewłaściwym narzędziem, nieważne jak szybka byłaby maszyna na papierze.

Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — to tutaj NVFP4 jest właściwym wyborem: natywne rdzenie tensorowe FP4, najmniejszy ślad serwerowy w nieocenzurowanej linii oraz format, dla którego ta konfiguracja została stworzona.

Hopper — H100/H200 — brak natywnego FP4 GEMM. NVFP4 degraduje do ścieżki dekwantyzacji tylko wag, która jest wolniejsza i nic nie daje. Użyj tutaj Qwen3.8-27B-Uncensored-FP8; ta kompilacja jest zweryfikowana dokładnie na tym sprzęcie.

Ampere/Ada — RTX 3090/4090 — NVFP4 również nie przyspiesza na tych kartach. Wersja GGUF, której wariant Q4_K_M zajmuje 16,8 GB, jest właściwym narzędziem dla karty z 24 GB.

Apple Silicon — NVFP4 nie ma znaczenia na Macu. Wersja MLX (lub GGUF) to ta, która działa.

Jedna uczciwa uwaga: forki społecznościowe faktycznie uruchamiają NVFP4 weight-only na sprzęcie sprzed Blackwell. Społecznościowa kompilacja NVFP4 tego samego modelu po ablacji jest wprost przygotowana pod karty z klasy V100 przez zmodyfikowany fork vLLM, a ostatnie przepisy DGX Spark wokół Qwen3.8-27B to osobna sprawa. To ścieżki specjalistyczne z własnymi zastrzeżeniami, a nie to, do czego celuje ta kompilacja. Jeśli masz Blackwell, to wszystko nie ma znaczenia; jeśli nie masz Blackwell, lepszym plikiem do pobrania jest wersja FP8 lub GGUF.

Jak to podawać

Repozytorium jest otagowane dla vLLM, a format compressed-tensors jest odczytywany automatycznie z pliku config.json — nie wybiera się ręcznie schematu kwantyzacji. Stos, na którym praktycy się skupiają przy budowach Qwen3.8-27B NVFP4, to najnowszy vLLM na karcie Blackwell, pamięć podręczna KV w formacie FP8 oraz własna głowa MTP modelu używana do spekulacyjnego dekodowania. Przewodnik Unsloth dotyczący NVFP4, który jest najczęściej cytowanym źródłem społeczności, zaleca vLLM 0.25.0 lub nowszy z FlashInfer i zależnością jądra CUTLASS-DSL dla szybkiej ścieżki FP4.

Działający punkt wyjścia, złożony ze zweryfikowanych flag naszego builda FP8 oraz społecznościowych przepisów NVFP4, wszystko w jednej linii:

vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'

FP8 KV cache — najszerzej kompatybilny sposób na zmniejszenie o połowę pamięci cache; praktycy zgłaszają, że pozwala pomieścić mniej więcej dwukrotnie większy kontekst. Obsługa NVFP4 KV-cache istnieje, ale jest ograniczona do niektórych backendów attention, więc FP8 KV jest bezpieczniejszą domyślną opcją.

Spekulatywne dekodowanie MTP — model jest wyposażony w głowicę wstępną MTP, a kwantyzacja zachowuje ją w BF16. Praktycy zgłaszają, że dwa lub trzy tokeny wstępne dobrze sprawdzają się z wagami NVFP4 na Blackwell, przy czym największe korzyści przynoszą strukturalne dane wyjściowe, takie jak JSON i wywołania narzędzi.

Wizja — enkoder wizyjny jest zachowany w BF16 w tej wersji. Dodaj --language-model-only, aby obsługiwać tryb tekstowy; usuń go, jeśli potrzebujesz wejścia obrazu lub wideo.

Na DGX Spark — kilka zgłoszonych przez użytkowników uwag: utrzymuj --gpu-memory-utilization na poziomie 0,90 lub niższym (wyższe wartości potrafią zawiesić maszynę podczas ładowania wag) oraz dodaj --safetensors-load-strategy lazy jeśli pamięci jest mało. Potrzebujesz również wersji vLLM zbudowanej dla procesora GB10, aby obsłużyć jądra sm_121a.

Uczciwie o wydajności: dla tego konkretnego repozytorium nie ma opublikowanych, niezależnych pomiarów przepustowości. Istniejące pomiary dotyczą blisko powiązanych buildów NVFP4. Unsloth podaje 1,41–1,49× tokenów na sekundę w porównaniu z BF16 na B200 dla swojego własnego builda Qwen3.8-27B-NVFP4 (89,8 do 133,7 tok/s przy batchu 1, 3048 do 4407 przy batchu 64), a jeden użytkownik DGX Spark na forach NVIDIA podaje mniej więcej 20–32 tok/s z wagami NVFP4, pamięcią podręczną KV w FP8 i głębokością MTP 3. Oba źródła warto przytoczyć; żadne z nich nie jest benchmarkiem tego repozytorium.

Wzorce użycia, które faktycznie działają

Praktycy uruchamiający modele z rodziny Qwen3.8-27B na Blackwell są zgodni co do kilku ustawień. Traktujcie je jako raporty terenowe, a nie wytyczne producenta — Qwen nie dokumentuje większości z tego, a karta tego repozytorium jest ograniczona.

reasoning_effort is the dial that matters most. The default xhigh makes the model think for a long time on every request. People running agent loops set medium by default and drop to low — or disable thinking entirely with enable_thinking: false — for latency-sensitive single calls. On a single Blackwell GPU, xhigh reasoning on a routine task is how you end up with a fast model and slow answers.

Samplery są sparowane z trybem myślenia, a nie niezależne. Konsensus społeczności: tryb myślenia włączony działa z temperaturą 1.0 / top_p 0.95; tryb myślenia wyłączony działa z temperaturą 0.7 / top_p 0.80 i presence_penalty 1.5. Zamiana tych dwóch zestawów pogarsza jakość odpowiedzi.

Użyj aktualnego szablonu czatu. Szablon qwen3_5 opakowuje każdą turę asystenta w blok think, a wielu praktyków zgłasza zapętlanie lub przycinane odpowiedzi przy nieaktualnych szablonach; warianty Qw​en-Fixed-Chat-Templates i Qw​en-Sharp naprawione przez społeczność ustawiają preserve_thinking i zatrzymują te pętle. Jeśli Twoje serwowane wyjście ciągnie się poza token stopu, to jest pierwsza rzecz do sprawdzenia.

Budżet na długie ślady rozumowania w pracy agentów. Praktycy raportują, że model generacji 3.8 generuje około dwa razy więcej tokenów na zadanie niż jego poprzednik 3.6 — wzrost jakości wynika częściowo z dłuższego myślenia. W przypadku długich odpowiedzi xhigh przesyłaj strumieniowo wynik rozumowania, w przeciwnym razie napotkasz przekroczenie limitu czasu bramy.

Wywoływanie narzędzi pozostaje nienaruszone przez kwantyzację.Ścieżka wywoływania funkcji pozostaje nienaruszona zarówno po abliteracji, jak i po konwersji 4-bitowej; włącz ją za pomocą parsera wywoływania narzędzi qwen3_coder, a model wybiera narzędzia tak samo jak bazowy.

A screenshot of the Artificial Analysis page for Qwen3.8 27B (medium) (captured August 29 2026), showing an Intelligence score of 44, a speed of 52.3 tokens per second, the comparison summary paragraph, $0.50 per 1M input and $3.00 per 1M output token pricing, and a 256k-token context window.

Kto powinien wybrać ten build — a kto nie

Uczciwa decyzja, bez powtarzania matematyki wyboru kwantyzacji, którą nasze posty o FP8 i GGUF już szczegółowo omawiają:

Wybierz NVFP4, jeśli serwujesz na Blackwellu i chcesz uzyskać najmniejszy ślad serwerowy w nieocenzurowanej linii, z szybkością rdzeni tensorowych FP4 — a przy tym prowadzisz badania red-team lub interpretowalnościowe, które w uzasadniony sposób wymagają modelu abliterowanego.

Wybierz Qwen3.8-27B-Uncensored-FP8, jeśli jesteś na Hopperze, albo chcesz najbardziej sprawdzonej ścieżki vLLM — to te same wagi w 8-bitach, zweryfikowane na H200, z minimalnym progiem około 40 GB VRAM.

Wybierz Qwen3.8-27B-Uncensored-GGUF, jeśli jesteś na konsumenckim GPU lub Macu, albo wolisz llama.cpp zamiast vLLM — poziom Q4_K_M to lokalny złoty środek.

Nie wybieraj żadnego z nich, jeśli chcesz maksymalnej wierności, tworzysz coś skierowanego do użytkowników (patrz granica bezpieczeństwa poniżej) lub nie chcesz w ogóle samodzielnie hostować — ta sama nieocenzurowana linia jest udostępniana przez OrcaRouter z ograniczeniem dostępu dla badaczy, więc nie jest wymagany GPU.

Granica bezpieczeństwa — tylko do badań

To jest model po abliteracji, a kwantyzacja nie przywraca zabezpieczeń. Kierunek odmowy został usunięty ze strumienia rezydualnego Qw​en/Qwen3.8-27B, a NVFP4 to zmiana precyzji, a nie interwencja w zakresie bezpieczeństwa — model będzie spełniał prośby, których model bazowy odmawia, a ta kompilacja nie ma wbudowanej moderacji. Został wydany do badań nad interpretowalnością, bezpieczeństwem AI i red teamingiem na licencji Apache 2.0, a odpowiedzialność spoczywa na Tobie.

Dwie uwagi dotyczące ewaluacji, które zbyt rzadko pojawiają się w przestrzeni modeli nieocenzurowanych. Po pierwsze, pojedynczy test jailbreaku, który przechodzi trywialnie, nie jest zaliczoną ewaluacją bezpieczeństwa — modele abliterowane celowo nie przechodzą takich testów. Mierz to, na czym naprawdę ci zależy, za pomocą odpowiednich zestawów testów (AdvBench, HarmBench i StrongREJECT do oceny szkodliwości; XSTest-safe do oceny nadmiernej odmowy) i porównuj wskaźniki odmów przed i po interwencji. Po drugie, oceniaj kwantyzację, a nie tylko bazowy model: wersja 4-bitowa może zmienić zachowanie w przypadkach brzegowych, nawet jeśli zagregowane wyniki wyglądają dobrze. Nie wdrażaj tego u użytkowników końcowych bez własnych warstw moderacji i zapobiegania nadużyciom.

Gdzie OrcaRouter znajduje zastosowanie

Dziesięciodniowy skwantowany build to podręcznikowy przykład routingu zamiast podpinania na sztywno. Możesz postawić trasę wskazującą na build NVFP4, który sam uruchamiasz, i przełączyć się awaryjnie na model hostowany, jeśli build zachowuje się niestabilnie pod obciążeniem — jeden interfejs, zero przepinania między dostawcami przy zmianie. OrcaRouter przepuszcza cenę katalogową dostawcy z zerową marżą, więc jeśli cena bazowego modelu się zmieni, Twój endpoint odzwierciedli to tego samego dnia, a nie w Twoim cyklu rozliczeniowym.

A jeśli cały sens polega na tym, aby w ogóle nie uruchamiać GPU: ta sama nieocenzurowana linia jest dostępna przez OrcaRouter, ograniczona do badaczy bezpieczeństwa i zespołów red team, z automatycznym przełączaniem awaryjnym między dostawcami. Niezależnie od tego, czy samodzielnie hostujesz tę kompilację NVFP4, czy korzystasz z linii hostowanej, w obu przypadkach wystarczy jeden klucz API.

Najważniejsze

Qwen3.8-27B-Uncensored-NVFP4 to właściwy plik do pobrania, jeśli serwujesz model po abliteracji na Blackwell i chcesz uzyskać najmniejszy ślad pamięciowy przy szybkości rdzeni tensorowych FP4. Jest to niewłaściwy plik do pobrania na Hopper (użyj wersji FP8), na konsumenckim GPU lub GPU Apple (użyj wersji GGUF lub MLX), albo jeśli potrzebujesz maksymalnej wierności. To nie jest nowość — jest dostępny do pobrania od 19 sierpnia 2026 roku — ale jest pobierany masowo, a teraz wiesz, w co się pakujesz, zanim zaakceptujesz bramę.

To nie jest kolejna wersja tego modelu — Qwen3.8-Flash-Next-Uncensored to osobne wydanie: wynik abliteracji Qwen3.8-Flash-Next, zapowiedzi architektury Qwen4 w wariancie mixture-of-experts o 176B zapisanych / 6B aktywnych parametrów. Ta sama technika abliteracji, inne wagi, własna kolekcja.

Wszystkie sześć kompilacji 27B — BF16, GGUF, MLX, FP8, INT8 i NVFP4 — są zebrane w kolekcji Qwen3.8-27B-Uncensored na Hugging Face.

Te wagi są z założenia tylko lokalne. Aby mieć hostowany punkt odniesienia do porównania builda abliterated, Qwen3.8-27B jest serwowany na OrcaRouter po cenie katalogowej dostawcy z 0% marżą — standardowy model, z zachowanymi zabezpieczeniami.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube