
Qwen3.8-27B-Uncensored-NVFP4: Podręcznik serwowania dla GPU Blackwell
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Qwen3.8-27B-Uncensored-NVFP4 jest na Hugging Face od 19 sierpnia 2026 roku i w ciągu dziesięciu dni od publikacji został pobrany około 32 700 razy. To nie jest relacja z premiery — wagi mają dziesięć dni, nie ma żadnego ogłoszenia do opisania, a warianty poboczne Qwen3.8-27B-Uncensored-FP8 i Qwen3.8-27B-Uncensored-GGUF są już udokumentowane na tym blogu. To instrukcja obsługi dla wersji, którą ludzie właśnie teraz aktywnie pobierają: czym naprawdę jest NVFP4, dlaczego ta konkretna wersja łączy go z FP8, które GPU zyskują, a które nie, jak ją serwować oraz kto powinien wybrać ją zamiast wersji FP8 lub GGUF — a kto nie.
Jedna rzecz na wstępie, która zaskakuje każdego, kto pobiera po raz pierwszy: repozytorium ma ograniczony dostęp. Naiwne hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 polecenie jednolinijkowe kończy się błędem uwierzytelniania, dopóki nie zalogujesz się do Hugging Face i nie zaakceptujesz warunków dostępu do repozytorium na stronie modelu. Wszystko poniżej zakłada, że zrobiłeś jedno i drugie.
Także na wstępie: karta modelu tego repozytorium znajduje się za tą samą bramą, więc nic tutaj jej nie parafrazuje. Poniższe opiera się na publicznym wykazie plików i metadanych repozytorium, na publicznej dokumentacji NVFP4 firmy NVIDIA oraz na raportach z praktyki osób wdrażających wersje Qwen3.8-27B NVFP4 na Blackwell. Jeśli jakaś liczba pochodzi od praktyka, a nie od producenta, tekst to zaznacza.

Czym jest ten build
Qwen3.8-27B-Uncensored-NVFP4 jest kwantyzacją NVFP4 modelu Qwen3.8-27B-Uncensored, abliterowanej wersji modelu Alibaba o nazwie Qwen/Qwen3.8-27B, którą organizacja orcarouter opublikowała 2026-08-18. Abliteracja usuwa kierunek odmowy modelu ze strumienia resztkowego; technika ta jest wyjaśniona w naszym objaśnieniu modeli bez cenzury i nie jest tu ponownie wyjaśniana. Bazą jest gęsty model 27B z hybrydową uwagą — 48 warstw z liniową uwagą plus 16 warstw z pełną uwagą — natywne rozumienie obrazów i wideo, kontekst 262 144 tokenów oraz wbudowana głowica do spekulatywnego dekodowania MTP. Apache 2.0 od początku do końca.
To, co czyni tę kompilację interesującą, to nie abliteracja, lecz układ kwantyzacji, ponieważ jest to celowo skwantowana kompilacja — jeśli szukałeś NVFP4, właśnie ten format jest sednem. Zgodnie z publicznymi metadanymi repozytorium i konfiguracją kwantyzacji jest to wersja mieszanej precyzji oparta na compressed-tensors: projekcje uwagi są w FP8 (E4M3), MLP w NVFP4 (4-bitowe, spakowane), a enkoder wizyjny, głowa MTP, lm_head oraz normy i biasy uwagi liniowej pozostają w BF16. Metadane safetensors z publicznego spisu plików zgadzają się z tym schematem: około 3,5 miliarda parametrów w BF16, 9,4 miliarda w FP8-E4M3 oraz 15 miliardów w spakowanych tensorach 4-bitowych, co daje około 24,7 GB na dysku w pięciu shardach plus osobny shard model-extra. Żadne z powyższych nie jest twierdzeniem o tym, jak model się serwuje — rzeczywiste zużycie VRAM i przepustowość dla dokładnie tego repozytorium nie są opublikowane w żadnym miejscu, które mógłbym dziś przytoczyć. Rozmiar na dysku pochodzi ze spisu plików, format z konfiguracji, a opisane poniżej zachowanie podczas serwowania jest zweryfikowane przez społeczność na ściśle powiązanych kompilacjach NVFP4.
Czym jest NVFP4 i czym różni się od FP8 oraz od INT8/AWQ
NVFP4 to 4-bitowy format zmiennoprzecinkowy firmy NVIDIA, wprowadzony dla piątej generacji rdzeni tensorowych w architekturze Blackwell, a oficjalny blog techniczny NVIDII jest właściwym źródłem pierwotnym na jego temat. Przechowuje wagi jako E2M1 — jeden bit znaku, dwa bity wykładnika, jeden bit mantysy — i skaluje je blokami: co 16 wartości ma wspólną skalę E4M3 FP8, a cały tensor jest skalowany pojedynczym skalarem FP32. Ten dwupoziomowy schemat to cały sens tego formatu: odzyskuje zakres dynamiczny, który straciłby naiwny 4-bitowy format zmiennoprzecinkowy, kosztem kilku bitów narzutu na blok. Praktyczne różnice w formie jednowierszowej:
• NVFP4 a FP8 — oba są zmiennoprzecinkowe, ale FP8 (E4M3, 8-bitowy) działa na Hopper i Blackwell, podczas gdy NVFP4 jest 4-bitowy i jest natywnie przyspieszany tylko na Blackwell. NVIDIA podaje, że wagi są około 3,5× mniejsze niż FP16 i około 1,8× mniejsze niż FP8, a na Blackwell matmul działa bezpośrednio na rdzeniach tensorowych FP4.
• NVFP4 vs INT8/AWQINT8 (W8A8) i AWQ (W4A16) to formaty całkowitoliczbowe, które są wspierane od architektury Ampere wzwyż; AWQ jest 4-bitowy, ale całkowitoliczbowy, a na większości sprzętu wagi są dekwantyzowane do szerszego typu na potrzeby mnożenia macierzy. NVFP4 to 4-bitowy format zmiennoprzecinkowy ze skalowaniem blokowym, dzięki czemu zachowuje większą precyzję w niskich bitach i ma natywną ścieżkę GEMM FP4, której nie mają formaty całkowitoliczbowe.
• NVFP4 vs MXFP4 — te dwa formaty są ciągle mylone. MXFP4 wykorzystuje bloki 32-elementowe i skale E8M0 (potęgi dwójki); NVFP4 używa bloków 16-elementowych i skal E4M3. Drobniejsze bloki zapewniają NVFP4 lepszą izolację wartości odstających, dlatego ten format jest de facto standardem 4-bitowym w stosach serwujących Blackwell.

Który sprzęt przynosi korzyści — a który nie
Najważniejszy fakt dotyczący tej kompilacji: NVFP4 to format Blackwell. Sprawdza się tylko na GPU, których rdzenie tensorowe natywnie implementują FP4 GEMM, a na wszystkim innym jest niewłaściwym narzędziem, nieważne jak szybka byłaby maszyna na papierze.
• Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — to tutaj NVFP4 jest właściwym wyborem: natywne rdzenie tensorowe FP4, najmniejszy ślad serwerowy w nieocenzurowanej linii oraz format, dla którego ta konfiguracja została stworzona.
• Hopper — H100/H200 — brak natywnego FP4 GEMM. NVFP4 degraduje do ścieżki dekwantyzacji tylko wag, która jest wolniejsza i nic nie daje. Użyj tutaj Qwen3.8-27B-Uncensored-FP8; ta kompilacja jest zweryfikowana dokładnie na tym sprzęcie.
• Ampere/Ada — RTX 3090/4090 — NVFP4 również nie przyspiesza na tych kartach. Wersja GGUF, której wariant Q4_K_M zajmuje 16,8 GB, jest właściwym narzędziem dla karty z 24 GB.
• Apple Silicon — NVFP4 nie ma znaczenia na Macu. Wersja MLX (lub GGUF) to ta, która działa.
Jedna uczciwa uwaga: forki społecznościowe faktycznie uruchamiają NVFP4 weight-only na sprzęcie sprzed Blackwell. Społecznościowa kompilacja NVFP4 tego samego modelu po ablacji jest wprost przygotowana pod karty z klasy V100 przez zmodyfikowany fork vLLM, a ostatnie przepisy DGX Spark wokół Qwen3.8-27B to osobna sprawa. To ścieżki specjalistyczne z własnymi zastrzeżeniami, a nie to, do czego celuje ta kompilacja. Jeśli masz Blackwell, to wszystko nie ma znaczenia; jeśli nie masz Blackwell, lepszym plikiem do pobrania jest wersja FP8 lub GGUF.
Jak to podawać
Repozytorium jest otagowane dla vLLM, a format compressed-tensors jest odczytywany automatycznie z pliku config.json — nie wybiera się ręcznie schematu kwantyzacji. Stos, na którym praktycy się skupiają przy budowach Qwen3.8-27B NVFP4, to najnowszy vLLM na karcie Blackwell, pamięć podręczna KV w formacie FP8 oraz własna głowa MTP modelu używana do spekulacyjnego dekodowania. Przewodnik Unsloth dotyczący NVFP4, który jest najczęściej cytowanym źródłem społeczności, zaleca vLLM 0.25.0 lub nowszy z FlashInfer i zależnością jądra CUTLASS-DSL dla szybkiej ścieżki FP4.
Działający punkt wyjścia, złożony ze zweryfikowanych flag naszego builda FP8 oraz społecznościowych przepisów NVFP4, wszystko w jednej linii:
vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'
• FP8 KV cache — najszerzej kompatybilny sposób na zmniejszenie o połowę pamięci cache; praktycy zgłaszają, że pozwala pomieścić mniej więcej dwukrotnie większy kontekst. Obsługa NVFP4 KV-cache istnieje, ale jest ograniczona do niektórych backendów attention, więc FP8 KV jest bezpieczniejszą domyślną opcją.
• Spekulatywne dekodowanie MTP — model jest wyposażony w głowicę wstępną MTP, a kwantyzacja zachowuje ją w BF16. Praktycy zgłaszają, że dwa lub trzy tokeny wstępne dobrze sprawdzają się z wagami NVFP4 na Blackwell, przy czym największe korzyści przynoszą strukturalne dane wyjściowe, takie jak JSON i wywołania narzędzi.
• Wizja — enkoder wizyjny jest zachowany w BF16 w tej wersji. Dodaj --language-model-only, aby obsługiwać tryb tekstowy; usuń go, jeśli potrzebujesz wejścia obrazu lub wideo.
• Na DGX Spark — kilka zgłoszonych przez użytkowników uwag: utrzymuj --gpu-memory-utilization na poziomie 0,90 lub niższym (wyższe wartości potrafią zawiesić maszynę podczas ładowania wag) oraz dodaj --safetensors-load-strategy lazy jeśli pamięci jest mało. Potrzebujesz również wersji vLLM zbudowanej dla procesora GB10, aby obsłużyć jądra sm_121a.
Uczciwie o wydajności: dla tego konkretnego repozytorium nie ma opublikowanych, niezależnych pomiarów przepustowości. Istniejące pomiary dotyczą blisko powiązanych buildów NVFP4. Unsloth podaje 1,41–1,49× tokenów na sekundę w porównaniu z BF16 na B200 dla swojego własnego builda Qwen3.8-27B-NVFP4 (89,8 do 133,7 tok/s przy batchu 1, 3048 do 4407 przy batchu 64), a jeden użytkownik DGX Spark na forach NVIDIA podaje mniej więcej 20–32 tok/s z wagami NVFP4, pamięcią podręczną KV w FP8 i głębokością MTP 3. Oba źródła warto przytoczyć; żadne z nich nie jest benchmarkiem tego repozytorium.
Wzorce użycia, które faktycznie działają
Praktycy uruchamiający modele z rodziny Qwen3.8-27B na Blackwell są zgodni co do kilku ustawień. Traktujcie je jako raporty terenowe, a nie wytyczne producenta — Qwen nie dokumentuje większości z tego, a karta tego repozytorium jest ograniczona.
• reasoning_effort is the dial that matters most. The default xhigh makes the model think for a long time on every request. People running agent loops set medium by default and drop to low — or disable thinking entirely with enable_thinking: false — for latency-sensitive single calls. On a single Blackwell GPU, xhigh reasoning on a routine task is how you end up with a fast model and slow answers.
• Samplery są sparowane z trybem myślenia, a nie niezależne. Konsensus społeczności: tryb myślenia włączony działa z temperaturą 1.0 / top_p 0.95; tryb myślenia wyłączony działa z temperaturą 0.7 / top_p 0.80 i presence_penalty 1.5. Zamiana tych dwóch zestawów pogarsza jakość odpowiedzi.
• Użyj aktualnego szablonu czatu. Szablon qwen3_5 opakowuje każdą turę asystenta w blok think, a wielu praktyków zgłasza zapętlanie lub przycinane odpowiedzi przy nieaktualnych szablonach; warianty Qwen-Fixed-Chat-Templates i Qwen-Sharp naprawione przez społeczność ustawiają preserve_thinking i zatrzymują te pętle. Jeśli Twoje serwowane wyjście ciągnie się poza token stopu, to jest pierwsza rzecz do sprawdzenia.
• Budżet na długie ślady rozumowania w pracy agentów. Praktycy raportują, że model generacji 3.8 generuje około dwa razy więcej tokenów na zadanie niż jego poprzednik 3.6 — wzrost jakości wynika częściowo z dłuższego myślenia. W przypadku długich odpowiedzi xhigh przesyłaj strumieniowo wynik rozumowania, w przeciwnym razie napotkasz przekroczenie limitu czasu bramy.
• Wywoływanie narzędzi pozostaje nienaruszone przez kwantyzację.Ścieżka wywoływania funkcji pozostaje nienaruszona zarówno po abliteracji, jak i po konwersji 4-bitowej; włącz ją za pomocą parsera wywoływania narzędzi qwen3_coder, a model wybiera narzędzia tak samo jak bazowy.

Kto powinien wybrać ten build — a kto nie
Uczciwa decyzja, bez powtarzania matematyki wyboru kwantyzacji, którą nasze posty o FP8 i GGUF już szczegółowo omawiają:
• Wybierz NVFP4, jeśli serwujesz na Blackwellu i chcesz uzyskać najmniejszy ślad serwerowy w nieocenzurowanej linii, z szybkością rdzeni tensorowych FP4 — a przy tym prowadzisz badania red-team lub interpretowalnościowe, które w uzasadniony sposób wymagają modelu abliterowanego.
• Wybierz Qwen3.8-27B-Uncensored-FP8, jeśli jesteś na Hopperze, albo chcesz najbardziej sprawdzonej ścieżki vLLM — to te same wagi w 8-bitach, zweryfikowane na H200, z minimalnym progiem około 40 GB VRAM.
• Wybierz Qwen3.8-27B-Uncensored-GGUF, jeśli jesteś na konsumenckim GPU lub Macu, albo wolisz llama.cpp zamiast vLLM — poziom Q4_K_M to lokalny złoty środek.
• Nie wybieraj żadnego z nich, jeśli chcesz maksymalnej wierności, tworzysz coś skierowanego do użytkowników (patrz granica bezpieczeństwa poniżej) lub nie chcesz w ogóle samodzielnie hostować — ta sama nieocenzurowana linia jest udostępniana przez OrcaRouter z ograniczeniem dostępu dla badaczy, więc nie jest wymagany GPU.
Granica bezpieczeństwa — tylko do badań
To jest model po abliteracji, a kwantyzacja nie przywraca zabezpieczeń. Kierunek odmowy został usunięty ze strumienia rezydualnego Qwen/Qwen3.8-27B, a NVFP4 to zmiana precyzji, a nie interwencja w zakresie bezpieczeństwa — model będzie spełniał prośby, których model bazowy odmawia, a ta kompilacja nie ma wbudowanej moderacji. Został wydany do badań nad interpretowalnością, bezpieczeństwem AI i red teamingiem na licencji Apache 2.0, a odpowiedzialność spoczywa na Tobie.
Dwie uwagi dotyczące ewaluacji, które zbyt rzadko pojawiają się w przestrzeni modeli nieocenzurowanych. Po pierwsze, pojedynczy test jailbreaku, który przechodzi trywialnie, nie jest zaliczoną ewaluacją bezpieczeństwa — modele abliterowane celowo nie przechodzą takich testów. Mierz to, na czym naprawdę ci zależy, za pomocą odpowiednich zestawów testów (AdvBench, HarmBench i StrongREJECT do oceny szkodliwości; XSTest-safe do oceny nadmiernej odmowy) i porównuj wskaźniki odmów przed i po interwencji. Po drugie, oceniaj kwantyzację, a nie tylko bazowy model: wersja 4-bitowa może zmienić zachowanie w przypadkach brzegowych, nawet jeśli zagregowane wyniki wyglądają dobrze. Nie wdrażaj tego u użytkowników końcowych bez własnych warstw moderacji i zapobiegania nadużyciom.
Gdzie OrcaRouter znajduje zastosowanie
Dziesięciodniowy skwantowany build to podręcznikowy przykład routingu zamiast podpinania na sztywno. Możesz postawić trasę wskazującą na build NVFP4, który sam uruchamiasz, i przełączyć się awaryjnie na model hostowany, jeśli build zachowuje się niestabilnie pod obciążeniem — jeden interfejs, zero przepinania między dostawcami przy zmianie. OrcaRouter przepuszcza cenę katalogową dostawcy z zerową marżą, więc jeśli cena bazowego modelu się zmieni, Twój endpoint odzwierciedli to tego samego dnia, a nie w Twoim cyklu rozliczeniowym.
A jeśli cały sens polega na tym, aby w ogóle nie uruchamiać GPU: ta sama nieocenzurowana linia jest dostępna przez OrcaRouter, ograniczona do badaczy bezpieczeństwa i zespołów red team, z automatycznym przełączaniem awaryjnym między dostawcami. Niezależnie od tego, czy samodzielnie hostujesz tę kompilację NVFP4, czy korzystasz z linii hostowanej, w obu przypadkach wystarczy jeden klucz API.
Najważniejsze
Qwen3.8-27B-Uncensored-NVFP4 to właściwy plik do pobrania, jeśli serwujesz model po abliteracji na Blackwell i chcesz uzyskać najmniejszy ślad pamięciowy przy szybkości rdzeni tensorowych FP4. Jest to niewłaściwy plik do pobrania na Hopper (użyj wersji FP8), na konsumenckim GPU lub GPU Apple (użyj wersji GGUF lub MLX), albo jeśli potrzebujesz maksymalnej wierności. To nie jest nowość — jest dostępny do pobrania od 19 sierpnia 2026 roku — ale jest pobierany masowo, a teraz wiesz, w co się pakujesz, zanim zaakceptujesz bramę.
To nie jest kolejna wersja tego modelu — Qwen3.8-Flash-Next-Uncensored to osobne wydanie: wynik abliteracji Qwen3.8-Flash-Next, zapowiedzi architektury Qwen4 w wariancie mixture-of-experts o 176B zapisanych / 6B aktywnych parametrów. Ta sama technika abliteracji, inne wagi, własna kolekcja.
Wszystkie sześć kompilacji 27B — BF16, GGUF, MLX, FP8, INT8 i NVFP4 — są zebrane w kolekcji Qwen3.8-27B-Uncensored na Hugging Face.
Te wagi są z założenia tylko lokalne. Aby mieć hostowany punkt odniesienia do porównania builda abliterated, Qwen3.8-27B jest serwowany na OrcaRouter po cenie katalogowej dostawcy z 0% marżą — standardowy model, z zachowanymi zabezpieczeniami.
