
Qwen3.8-Flash-Next-Uncensored-NVFP4: Runbook serwowania na Blackwell
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Qwen3.8-Flash-Next-Uncensored-NVFP4działa wyłącznie na jednej rodzinie GPU: Blackwell. NVFP4 działa na sprzętowych rdzeniach tensorowych FP4, a Hopper (H100/H200) i wszystko starsze po prostu ich nie mają. Jeśli używasz Hoppera, zatrzymaj się tutaj — Qwen3.8-Flash-Next-Uncensored-FP8to ta wersja, której chcesz. Wszystko poniżej zakłada Blackwell (B100, B200, GB200 lub kartę z serii RTX 50), aktualną kompilację vLLM z obsługą qwen4_exp oraz transformery ≥ 5.16.
To jest kwantyzacja NVFP4 abliterowanego (z usuniętymi mechanizmami odmowy) builda Qwena o nazwie Qwen/Qwen3.8-Flash-Next, zmniejszona z 330 GB w BF16 do 178 GB na dysku. OrcaRouter opublikował ją na Hugging Face 27 sierpnia 2026 jako orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. Dostęp do repozytorium jest ograniczony: musisz być zalogowany na Hugging Face i zaakceptować warunki repozytorium; w przeciwnym razie zarówno hf download, jak i vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 kończą się błędem uwierzytelnienia, zanim zostanie przesłany choć jeden bajt. Ta strona to runbook serwowania modelu, a nie relacja z premiery — build ma dwa dni, a pytania, na które ludzie faktycznie natrafiają, dotyczą sprzętu, flag i tego, który build wybrać.

A zanim przejdziemy do liczb: Qwen3.8-Flash-Next-Uncensored nie jest Qwen3.8-27B-Uncensored. To dwa różne modele, które mają wspólną nazwę rodziny i technikę abliteracji — różne wagi bazowe, różne architektury, różne kolekcje Hugging Face. Flash-Next to abliterowana wersja modelu Qwen/Qwen3.8-Flash-Next, czyli routowanej zapowiedzi architektury Qwen4 typu mixture-of-experts (qwen4_exp): 512 ekspertów, z których na raz aktywnych jest dziesięciu routowanych i jeden współdzielony, hybrydowa uwaga (liniowe warstwy Gated DeltaNet obok warstw pełnej uwagi), Hyper-Connections, n-gramowy embedding PLE, natywna wieża wizyjna i wideo oraz głowica spekulacyjnego dekodowania MTP. Model 27B to abliterowana wersja modelu Qwen/Qwen3.8-27B, czyli zupełnie innej gęstej bazy. Żadne metryki serwowania ze strony modelu 27B nie przenoszą się na ten model; tam, gdzie strona modelu 27B jest naprawdę przydatna — wprowadzenie do abliteracji, ogólne zasady doboru kwantyzacji — linkujemy ją poniżej wraz z informacją, co się przenosi, a co nie.

Czym jest ten build, precyzja po precyzji.
Qwen3.8-Flash-Next to routowany MoE: każdy token aktywuje 10 z 512 ekspertów plus jednego wspólnego eksperta, a tylko kilka miliardów parametrów jest aktywnych na token, mimo że przechowywany model jest znacznie większy. Wersja NVFP4 to mieszanoprecyzyjna kwantyzacja compressed-tensors tego stosu, a sednem sprawy jest podział:
• Wagi ekspertów MoE — NVFP4 (4-bitowy, NVIDIA FP4 E2M1, grupowanie po 16 z blokowymi skalami FP8).
• Attention (self_attn.{q,k,v,o}), projekcje linear_attn, wspólny ekspert oraz lm_head — FP8 (8-bit).
• Embedding n-gram PLE, embeddingi tokenów i wizyjne, Hyper-Connections, indekser QSA, Gated-DeltaNet conv/dt, wszystkie normalizacje oraz cała wieża wizyjna — BF16, utrzymane w pełnej precyzji.
Trzy właściwości konwersji liczą się bardziej niż sam podział precyzji. Po pierwsze, dotyczy ona wyłącznie wag: aktywacje są kwantyzowane dynamicznie w czasie działania, nie ma statycznej kalibracji, a wagi pochodzą bezpośrednio z checkpointu BF16 (karta modelu określa to wyprowadzenie jako niewymagające danych). Po drugie, modyfikacja abliteracyjna jest na stałe wbudowana w wagi, więc usunięcie odmowy przetrwa kwantyzację — konwersja 4-bitowa to zmiana precyzji, a nie interwencja w bezpieczeństwo. Po trzecie, pamięć podręczna KV nie jest kwantyzowana; w czasie działania pozostaje w formacie BF16. Tę ostatnią cechę łatwo przeoczyć, a ma ona znaczenie przy natywnym kontekście modelu wynoszącym 262 144 tokeny, gdzie pamięć podręczna KV jest realną pozycją w zestawieniu zużycia pamięci obok wag.
Rozmiar na dysku jest zdominowany przez jeden tensor. Karta opisuje embedding n-gramów PLE jako pojedynczy tensor o ~66 mld parametrów, celowo przechowywany w BF16; jest to największy shard i powód, dla którego build ma 178 GB zamiast mniejszej liczby. Należy wskazać jedną rozbieżność, a nie zamieść jej pod dywan: siostrzana karta FP8 nazywa tę samą tabelę n-gramem PLE o 51 mld parametrów, a notatka W4A4 na tej karcie odnosi się do niej jako ~100 GB. Obie karty podają różne liczby dla tej samej tabeli, więc traktuj każdą z nich jako liczbę właściwą dla danej karty — a podczas szacowania rozmiaru wdrożenia zakładaj, że tabela jest duża w BF16, i odpowiednio to uwzględnij.
Warunek wstępny sprzętu, dokładnie określony.
To najkrótsza i najważniejsza sekcja strony. NVFP4 to format Blackwella: szybka ścieżka to natywny GEMM FP4 na tensorowych rdzeniach piątej generacji, a bez tego sprzętu format nie ma na czym działać. Wiersz wymagań samej karty jest jednoznaczny — procesor graficzny Blackwell (B100 / B200 / GB200 / seria RTX 50), ponieważ NVFP4 korzysta ze sprzętowych rdzeni tensorowych FP4 i nie będzie działać na Hopper (H100/H200) ani starszych, które nie mają obliczeń FP4.
Przekierowania, w jednym miejscu:
• Na Hopperze (H100/H200) — serwuj zamiast tego Qwen3.8-Flash-Next-Uncensored-FP8. To te same wagi w 8-bitach, działa na Hopperze i Blackwellu, i to właśnie tę wersję opisuje runbook FP8 z tego bloga.
• Na konsumenckiej karcie graficznej NVIDIA lub na maszynie z CPU — build GGUF z 13 kwantyzacjami llama.cpp jest lokalną ścieżką.
• Na Apple Silicon — wersja MLX, w wariantach 4/6/8-bitowych, to natywna ścieżka Metal.
Wymóg dotyczący środowiska wykonawczego jest równie wiążący jak sam krzem. qwen4_exp to zupełnie nowa architektura, więc standardowe kompilacje vLLM, które powstały przed nią, odmówią załadowania punktu kontrolnego. Potrzebujesz najnowszego vLLM ze wsparciem qwen4_exp oraz czytnika NVFP4 compressed-tensors (format jest wykrywany z config.json, a nie wybierany ręcznie), a także transformers ≥ 5.16. Wejście multimodalne dodatkowo wymaga stosu wizyjnego Qwen w środowisku wykonawczym; serwowanie samego tekstu działa bez niego.
Polecenie serwowania karty, flaga po fladze.
Samo wywołanie z karty modelu to dobry punkt wyjścia, ale warto zrozumieć, do czego służy każda flaga, zamiast bezmyślnie kopiować i wklejać:
vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder
• --tensor-parallel-size 4 — wagi zajmują na dysku ~178 GB, więc karta rozdziela je na cztery GPU. Do takiej właśnie konfiguracji dopasowany jest build; nie traktuj tego jako sugestii.
• --trust-remote-code — wymagane dla niestandardowej architektury. Kod modelowania qwen4_exp nie jest jeszcze w standardowym rejestrze transformers, więc vLLM ładuje kod architektury z repozytorium. Ufasz temu kodowi, co jest normalną, ale realną decyzją w przypadku zupełnie nowej architektury.
• --enable-expert-parallel — dzieli ekspertów między rangami tensor-parallel zamiast ich replikować, co sprawia, że MoE z 512 ekspertami jest wykonalne przy TP4. Siostrzana karta FP8 podaje dokładniejszy powód dla tej konfiguracji: bez tego szerokość pośrednia MoE podzielona przez TP nie jest podzielna przez rozmiar bloku FP8. Traktuj to jako wymagane, a nie opcjonalne.
• --enable-auto-tool-choice i --tool-call-parser qwen3_coder — razem włączają wywoływanie funkcji. Flaga auto pozwala modelowi zdecydować, czy wywołać narzędzie, a parser qwen3_coder dekoduje format wywołania narzędzia — tę samą rodzinę parserów, z której korzystają Qwen3.8-27B i Qwen3.8-Flash-Next.
Gdy już działa, endpoint zgodny z OpenAI pod adresem /v1/chat/completions oferuje pełen zestaw funkcji dzięki stosowi Qwen4 środowiska uruchomieniowego: wywoływanie narzędzi jak wyżej, rozumowanie przez chat_template_kwargs.enable_thinking oraz wizję poprzez części zawartości image_url. Nie potrzebujesz osobnego serwera do obsługi multimodaliów; to ten sam endpoint.
Jedna uwaga strukturalna z karty: nie ma w pełni statycznego wariantu W4A4 tej kompilacji i nie powstanie tanio. Statyczna konwersja W4A4 wymaga przebiegu kalibracji aktywacji, a ten przebieg musi pomieścić ~100 GB embeddingu n-gramów na pojedynczym GPU. To ten sam powód, dla którego tabela PLE dominuje na liście plików, i dlatego ta kompilacja pozostaje typu weight-only z dynamicznymi aktywacjami.
Raporty terenowe społeczności — jak faktycznie wygląda służenie temu
Żadne liczby dotyczące przepustowości ani opóźnień nie zostały opublikowane dla tego konkretnego repozytorium i ta strona nie będzie ich zmyślać. To, co istnieje, to rosnący zbiór raportów z praktyki od osób obsługujących bazowe kompilacje Qwen3.8-Flash-Next NVFP4 — ta sama architektura, ten sam podział precyzji NVFP4/FP8/BF16, bez edycji abliteracyjnej — a zachowanie serwowania przenosi się bezpośrednio. Są to ustalenia społeczności, a nie wskazówki producenta, a osoby, które je zgłosiły, pracowały na sprzęcie Blackwell z tym samym schematem kwantyzacji.
• Spekulacyjne dekodowanie MTP to najważniejsza dźwignia wydajności. Model jest wyposażony w głowicę do przewidywania wielu tokenów, a na jednym RTX PRO 6000 (96 GB, SM120) moduł MTP ładuje się skwantowany do NVFP4, zajmując około 0,51 GB pamięci VRAM — w raporcie zmierzono długość akceptacji 2,3–3,9 z maksymalnych 4 oraz wskaźnik akceptacji 0,86–0,96. Ten sam raport odnotował medianę dekodowania pojedynczego strumienia 180–226 tok/s (216,9 dla kodowania, 225,8 dla obciążenia polegającego na wywoływaniu narzędzi przez agenta, 136,6 dla rozumowania) przy bazowym poziomie około 105 tok/s, a także odpowiedź na prompt złożony z 216 685 tokenów w 8,4 sekundy. Traktuj te liczby jako konfigurację sprzętową jednej osoby, a nie jako specyfikację.
• Przenieś embedding n-gramów PLE do pamięci RAM hosta. Ponieważ tabela jest ogromna i rzadko stanowi wąskie gardło przepustowości, przepisy społeczności na pojedynczych kartach Blackwell przypinają ją do hosta (~50 GiB wolnej pamięci RAM hosta w raporcie RTX PRO 6000) i mapują ją z NVMe przez mmap, poświęcając nieco opóźnienia, aby w ogóle dopasować model. Należy spodziewać się, że trzeba będzie zrobić coś podobnego, chyba że dysponujesz bardzo dużym budżetem VRAM.
• Przypnij jawnie okno kontekstu. Przy włączonym KV cache w BF16 i aktywnym MTP pula KV o automatycznym rozmiarze urosła ponad pojemność karty i przy długim prefillu doprowadziła do OOM; przypięcie max-model-len / max-total-tokens do 262144 przywróciło zapas pamięci. Przy długości kontekstu 262K KV cache to pozycja w budżecie pamięci, a nie domyślna wartość.
• Błąd autotune FlashInfer po cichu uszkadza wyniki. Najważniejszy tryb awarii w praktyce: autotune wybiera taktyki jądra fused-MoE wyłącznie na podstawie opóźnienia i nigdy nie sprawdza wyników numerycznych, więc przy niektórych kształtach dekodowanie zapada się do powtarzanego tokenu. Raport RTX PRO 6000 odtworzył to: 36 na 36 generacji zepsutych przy włączonym autotune i 0 na 36 przy wyłączonym — obejściem jest wyłączenie autotune FlashInfer (w vLLM: --no-enable-flashinfer-autotune; w SGLang: --disable-flashinfer-autotune). Jeśli Twoje serwowane wyniki nagle ulegają degeneracji, sprawdź to, zanim dotkniesz czegokolwiek innego.
• DGX Spark (GB10, SM121) wymaga własnych poprawek. Wagi NVFP4 (~126 GiB w wersji społecznościowej) nie mieszczą się w jednym Sparku 128 GB, więc przepisy SGLang uruchamiają tensor-parallel 2 na dwóch węzłach przez RoCE, a resolver QSA sparse-decode uzależnia szybkie jądro FlashInfer od sprawdzenia is_sm100_supported(), które nie przechodzi na SM121, co powoduje fallback do ścieżki, która pada podczas warmupu — rozwiązaniem jest mały patch plus odciążenie PLE. Oczekuj ~47–50 tok/s podczas dekodowania, ze szczytem blisko 70 przy MTP4 i grafach CUDA, i zweryfikuj, czy Twój kernel faktycznie działa na SM121, zanim obiecasz benchmark.
Rozumowanie, wywoływanie narzędzi i wizja dzięki stosowi Qwen4
Konsensus społeczności dotyczący generacji Qwen3.8 przenosi się na ten model, ze zwykłym zastrzeżeniem, że jest to praktyka terenowa, a nie zalecenia producenta.
• reasoning_effort to pokrętło, które ma największe znaczenie.Domyślną wartością szablonu czatu jest xhigh, co sprawia, że model długo myśli nad każdym żądaniem. Operatorzy pętli agentów domyślnie ustawiają medium i obniżają do low w przypadku wywołań wrażliwych na opóźnienia; enable_thinking false całkowicie wyłącza rozumowanie, gdy go nie potrzebujesz. Na jednej karcie Blackwell pozostawienie xhigh włączonego przy rutynowych wywołaniach to sposób, w jaki szybki model generuje wolne odpowiedzi.
• Dobieraj próbniki do trybu myślenia.Gdy myślenie jest włączone, praktycy stosują temperaturę 1.0 / top-p 0.95, a gdy wyłączone – temperaturę 0.7 / top-p 0.80 z karą obecności około 1.5. Mieszanie tych dwóch zestawów pogarsza jakość wyników.
• Wywoływanie narzędzi przetrwa zarówno abliterację, jak i konwersję 4-bitową. Ścieżka wywoływania funkcji jest nienaruszona — to właśnie do niej podłączają się parser qwen3_coder i flagi auto-tool-choice. Dla red teamu to obosieczny fakt, ponieważ oznacza, że agentowe nadużycia są w pełni operacyjne na modelu bez alignmentu — o czym poniżej.
• Wizja jest zachowana, co poszerza powierzchnię ataku. Wieża wizyjna nigdy nie została dotknięta abliteracją i pozostaje w BF16, więc wejście obrazu działa przez części treści typu image_url. Praktycy ewaluujący nieocenzurowaną linię traktują ścieżkę multimodalną jako pierwszorzędny cel ewaluacji: prompt injection przenoszony w obrazie trafia na model bez zachowań odmownych do przełamania.
Którą kompilację należy serwować?
Kolekcja Flash-Next ma pięć wariantów — BF16, GGUF, MLX, FP8 oraz ten NVFP4 — a uczciwa logika wyboru opiera się na sprzęcie i kompromisach, nie na rankingu.
• NVFP4 (ta kompilacja, ~178 GB na dysku) — wybór Blackwella. Rdzenie tensorowe FP4, eksperci 4-bitowi, najnowsza kompilacja w kolekcji i najmniejsza z wersji serwera vLLM, a także ta, o której mówi ta strona.
• FP8 (~186 GB na dysku) — wybór dla Hopper, i równie dobrze sprawdza się na Blackwell. Te same wagi w 8-bitach, co jest bardziej powszechnie zweryfikowaną ścieżką vLLM i tą z jaśniejszym wymogiem równoległości ekspertów.
• GGUF (13 quants, IQ2_XXS ~52 GB to Q5_K_M ~125 GB) — wybór llama.cpp dla konsumenckich komputerów z NVIDIA, AMD lub CPU. Nie potrzebujesz Blackwella, nie potrzebujesz vLLM.
• MLX (warianty 4/6/8-bitowe, ok. 163–221 GB) — wybór dla Apple Silicon, natywny Metal, głowica MTP w zestawie.
Dwie uczciwe uwagi, zanim wybierzesz. Po pierwsze, wersje NVFP4 i FP8 różnią się na dysku tylko o około osiem GB, ponieważ obie przechowują dużą tabelę n-gramów w BF16 — oszczędność 4-bitowa koncentruje się w wagach ekspertów, a nie w całkowitym rozmiarze. Prawdziwa przewaga NVFP4 na Blackwell to szybkość rdzeni tensorowych FP4 dla tych ekspertów, a nie drastycznie mniejszy plik. Po drugie, karta opisuje NVFP4 jako deterministyczne wyprowadzenie wag, które dziedziczy ocenę abliteracji z niewielkim dodatkowym kompromisem jakościowym wynikającym z 4-bitowych ekspertów, i nie określa ilościowo tego kompromisu. Jest on nieokreślony ilościowo — traktuj go jako realny, ale niesprecyzowany koszt mniejszych ekspertów, a nie jako pomijalny.
Ocena, przeczytana poprawnie.
Karta raportuje abliterację zmierzoną na buildzie BF16 serwowanym z vLLM względem oficjalnego Qwen/Qwen3.8-Flash-Next: odsetek odmów na szkodliwe prompty spada z 64–100% do około 0–3,3%, nadmierna odmowa na bezpieczne prompty utrzymuje się blisko zera, a zdolności pozostają w granicach ±2 punktów względem bazy. Trzy rzeczy, które trzeba właściwie zrozumieć w przypadku tych liczb. Są to pomiary na buildzie BF16, przeniesione na ten build 4-bitowy na zasadzie argumentacji, a nie zmierzone na nim. Są to dane samego dostawcy, uzyskane przy użyciu regułowego klasyfikatora fraz otwierających, który karty z tej kolekcji opisują jako orientacyjny, a nie klasy publikacyjnej — jest to wewnętrzny pomiar własnej modyfikacji, a nie niezależny audyt. I nie mówią nic o kompromisie jakościowym NVFP4 opisanym powyżej, którego karta nie kwantyfikuje.
Granica bezpieczeństwa — tylko do badań
Zastrzeżenie na karcie jest dosadne i to właśnie ta część strony nie może brzmieć jak standardowy szablon. W tym modelu w znacznym stopniu usunięto dostrojenie pod kątem bezpieczeństwa: kierunek odmowy został wyortogonalizowany ze strumienia rezydualnego, przez co model będzie spełniał szkodliwe, nieetyczne lub nielegalne prośby, których spełnienia oryginalny Qwen3.8-Flash-Next by odmówił. Model został udostępniony wyłącznie do dozwolonych celów badawczych — interpretowalności, bezpieczeństwa AI, badania mechanizmów odmowy, red-teamingu i oceny odporności — a autorzy nie ponoszą odpowiedzialności za niewłaściwe wykorzystanie. To Ty bierzesz na siebie pełną odpowiedzialność za to, co model generuje, i to Ty dodajesz własne warstwy bezpieczeństwa i moderacji, zanim cokolwiek trafi do użytkownika. Licencja Apache 2.0 to absolutne minimum; nad nią znajduje się brama ograniczająca użycie do celów badawczych.
Dyskurs o modelach uncensored myli się w dwóch kwestiach, a ta karta sprawia, że nie sposób ich przeoczyć. Po pierwsze, próba jailbreaku, która przeciwko temu modelowi kończy się sukcesem, to nie zdany test bezpieczeństwa — to reklamowane zachowanie. Abliterowany model celowo nie przechodzi takich prób; mierzenie go pojedynczym testem {{1}}"can you jailbreak it"{{/1}} to mierzenie tego, że edycja zadziałała, a nie tego, że guardrail jest silny. Po drugie, zachowana wieża wizyjna i nietknięta ścieżka wywoływania narzędzi poszerzają realną powierzchnię ataku poza tekst: prompt injection przez obraz i agentyczne nadużywanie narzędzi są w pełni operacyjne, co jest dokładnie powodem, dla którego podejście red teamingu traktuje to jako test możliwości, a nie kandydata na czatbota. Jeśli Twój przypadek użycia to wdrożenie asystenta dla użytkowników końcowych, to nie jest Twój model — i to jest zamierzone.
Gdzie OrcaRouter znajduje zastosowanie
Dwudniowy build z ograniczonym dostępem, wyłącznie do self-hostingu, to podręcznikowy przypadek zastosowania routingu zamiast sztywnego podłączenia. Gdy uruchomisz ten build NVFP4 u siebie, możesz postawić trasę, która wskazuje na niego i awaryjnie przełącza się na model hostowany, jeśli build zachowuje się nieprawidłowo pod obciążeniem — jeden interfejs, bez przepinania między dostawcami przy przełączaniu. W szczególności do prac ewaluacyjnych ocenzurowana, serwowana linia bazowa to pożądane porównanie, a dzieli cię od niego jedno naciśnięcie klawisza: katalog zawiera model Qwen3.8-Flash od Alibaba po 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych, przekazywany po cenie katalogowej dostawcy z 0% marżą, dzięki czemu narzędzie red-team może przełączać się między hostowaną ocenzurowaną bazą a twoim lokalnym nieocenzurowanym buildem bez drugiej umowy, a każda zmiana ceny u dostawcy trafia na twój endpoint tego samego dnia.

Kto powinien to pobrać — a kto nie
Pobierz orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4, jeśli używasz Blackwella, chcesz najmniejszy ślad serwerowy w kolekcji Flash-Next z szybkością rdzeni tensorowych FP4 i prowadzisz prace badawcze, {{1}}dla których ta linia istnieje{{/1}}. Pobierz Qwen3.8-Flash-Next-Uncensored-FP8, jeśli używasz Hoppera lub chcesz szerzej zweryfikowanej ścieżki. Pobierz wersję GGUF, jeśli masz konsumencką kartę GPU lub maszynę z CPU, wersję MLX, jeśli masz Apple Silicon, a niczego, jeśli celem jest wdrożenie skierowane do użytkowników. Przeczytaj bramkę i zastrzeżenie, zanim zaakceptujesz którykolwiek z nich — {{2}}to warunki modelu, a nie formalność{{/2}}.
Wszystkie pięć buildów Flash-Next — BF16, GGUF, MLX, FP8 i NVFP4 — znajduje się w kolekcji Qwen3.8-Flash-Next-Uncensored na Hugging Face.
Inny model, a nie kolejna wersja tego: Qwen3.8-27B-Uncensored jest abliterowany z innej bazy i ma własną kolekcję oraz własne runbooki.
Te wagi są z założenia dostępne wyłącznie lokalnie. Jako hostowany punkt odniesienia do porównania wersji abliterowanej, Qwen3.8-Flash jest serwowany na OrcaRouter po cenie katalogowej dostawcy z 0% narzutu — model bazowy z nienaruszonymi zabezpieczeniami.
