Główna karta tytułowa dla artykułu 'Qwen3.8-Flash-Next-Uncensored-NVFP4: A Blackwell Serving Runbook', przedstawiająca nagłówek, podtytuł 'A Blackwell Serving Runbook — NVFP4 experts, FP8 attention, BF16 PLE', oraz cztery chipy specyfikacji: 'Blackwell only — FP4 tensor cores', '330 GB → 178 GB', 'Gated on Hugging Face' i '262K context', z logo OrcaRouter umieszczonym w prawym dolnym rogu.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored-NVFP4: Runbook serwowania na Blackwell

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen3.8-Flash-Next-Uncensored-NVFP4działa wyłącznie na jednej rodzinie GPU: Blackwell. NVFP4 działa na sprzętowych rdzeniach tensorowych FP4, a Hopper (H100/H200) i wszystko starsze po prostu ich nie mają. Jeśli używasz Hoppera, zatrzymaj się tutaj — Qwen3.8-Flash-Next-Uncensored-FP8to ta wersja, której chcesz. Wszystko poniżej zakłada Blackwell (B100, B200, GB200 lub kartę z serii RTX 50), aktualną kompilację vLLM z obsługą qwen4_exp oraz transformery ≥ 5.16.

To jest kwantyzacja NVFP4 abliterowanego (z usuniętymi mechanizmami odmowy) builda Qw​ena o nazwie Qw​en/Qwen3.8-Flash-Next, zmniejszona z 330 GB w BF16 do 178 GB na dysku. OrcaRouter opublikował ją na Hugging Face 27 sierpnia 2026 jako orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. Dostęp do repozytorium jest ograniczony: musisz być zalogowany na Hugging Face i zaakceptować warunki repozytorium; w przeciwnym razie zarówno hf download, jak i vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 kończą się błędem uwierzytelnienia, zanim zostanie przesłany choć jeden bajt. Ta strona to runbook serwowania modelu, a nie relacja z premiery — build ma dwa dni, a pytania, na które ludzie faktycznie natrafiają, dotyczą sprzętu, flag i tego, który build wybrać.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 repo (captured August 29 2026), showing the gate banner 'You need to agree to share your contact information to access this model', 'Login or Sign Up to review the conditions', Model size 125B params, tensor types F8_E4M3 · BF16 · U8 · I64, the apache-2.0 licence, the base-model line Qwen/Qwen3.8-Flash-Next, and the abliterated, uncensored, nvfp4, fp4, fp8, vllm and vision-language tags.

A zanim przejdziemy do liczb: Qwen3.8-Flash-Next-Uncensored nie jest Qwen3.8-27B-Uncensored. To dwa różne modele, które mają wspólną nazwę rodziny i technikę abliteracji — różne wagi bazowe, różne architektury, różne kolekcje Hugging Face. Flash-Next to abliterowana wersja modelu Qw​en/Qwen3.8-Flash-Next, czyli routowanej zapowiedzi architektury Qwen4 typu mixture-of-experts (qwen4_exp): 512 ekspertów, z których na raz aktywnych jest dziesięciu routowanych i jeden współdzielony, hybrydowa uwaga (liniowe warstwy Gated DeltaNet obok warstw pełnej uwagi), Hyper-Connections, n-gramowy embedding PLE, natywna wieża wizyjna i wideo oraz głowica spekulacyjnego dekodowania MTP. Model 27B to abliterowana wersja modelu Qw​en/Qwen3.8-27B, czyli zupełnie innej gęstej bazy. Żadne metryki serwowania ze strony modelu 27B nie przenoszą się na ten model; tam, gdzie strona modelu 27B jest naprawdę przydatna — wprowadzenie do abliteracji, ogólne zasady doboru kwantyzacji — linkujemy ją poniżej wraz z informacją, co się przenosi, a co nie.

A scoreboard card for Qwen3.8-Flash-Next-Uncensored-NVFP4 with six rows: base model Qwen/Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + accepted terms), precision NVFP4 experts - FP8 attention - BF16 PLE, on-disk size 178 GB from 330 GB BF16, KV cache BF16 (not quantized), hardware Blackwell only (FP4 tensor cores); footer reads 'All figures from the orcarouter model card, August 29 2026 - self-reported, not independently audited.'

Czym jest ten build, precyzja po precyzji.

Qwen3.8-Flash-Next to routowany MoE: każdy token aktywuje 10 z 512 ekspertów plus jednego wspólnego eksperta, a tylko kilka miliardów parametrów jest aktywnych na token, mimo że przechowywany model jest znacznie większy. Wersja NVFP4 to mieszanoprecyzyjna kwantyzacja compressed-tensors tego stosu, a sednem sprawy jest podział:

• Wagi ekspertów MoE — NVFP4 (4-bitowy, NVIDIA FP4 E2M1, grupowanie po 16 z blokowymi skalami FP8).

• Attention (self_attn.{q,k,v,o}), projekcje linear_attn, wspólny ekspert oraz lm_head — FP8 (8-bit).

• Embedding n-gram PLE, embeddingi tokenów i wizyjne, Hyper-Connections, indekser QSA, Gated-DeltaNet conv/dt, wszystkie normalizacje oraz cała wieża wizyjna — BF16, utrzymane w pełnej precyzji.

Trzy właściwości konwersji liczą się bardziej niż sam podział precyzji. Po pierwsze, dotyczy ona wyłącznie wag: aktywacje są kwantyzowane dynamicznie w czasie działania, nie ma statycznej kalibracji, a wagi pochodzą bezpośrednio z checkpointu BF16 (karta modelu określa to wyprowadzenie jako niewymagające danych). Po drugie, modyfikacja abliteracyjna jest na stałe wbudowana w wagi, więc usunięcie odmowy przetrwa kwantyzację — konwersja 4-bitowa to zmiana precyzji, a nie interwencja w bezpieczeństwo. Po trzecie, pamięć podręczna KV nie jest kwantyzowana; w czasie działania pozostaje w formacie BF16. Tę ostatnią cechę łatwo przeoczyć, a ma ona znaczenie przy natywnym kontekście modelu wynoszącym 262 144 tokeny, gdzie pamięć podręczna KV jest realną pozycją w zestawieniu zużycia pamięci obok wag.

Rozmiar na dysku jest zdominowany przez jeden tensor. Karta opisuje embedding n-gramów PLE jako pojedynczy tensor o ~66 mld parametrów, celowo przechowywany w BF16; jest to największy shard i powód, dla którego build ma 178 GB zamiast mniejszej liczby. Należy wskazać jedną rozbieżność, a nie zamieść jej pod dywan: siostrzana karta FP8 nazywa tę samą tabelę n-gramem PLE o 51 mld parametrów, a notatka W4A4 na tej karcie odnosi się do niej jako ~100 GB. Obie karty podają różne liczby dla tej samej tabeli, więc traktuj każdą z nich jako liczbę właściwą dla danej karty — a podczas szacowania rozmiaru wdrożenia zakładaj, że tabela jest duża w BF16, i odpowiednio to uwzględnij.

Warunek wstępny sprzętu, dokładnie określony.

To najkrótsza i najważniejsza sekcja strony. NVFP4 to format Blackwella: szybka ścieżka to natywny GEMM FP4 na tensorowych rdzeniach piątej generacji, a bez tego sprzętu format nie ma na czym działać. Wiersz wymagań samej karty jest jednoznaczny — procesor graficzny Blackwell (B100 / B200 / GB200 / seria RTX 50), ponieważ NVFP4 korzysta ze sprzętowych rdzeni tensorowych FP4 i nie będzie działać na Hopper (H100/H200) ani starszych, które nie mają obliczeń FP4.

Przekierowania, w jednym miejscu:

• Na Hopperze (H100/H200) — serwuj zamiast tego Qwen3.8-Flash-Next-Uncensored-FP8. To te same wagi w 8-bitach, działa na Hopperze i Blackwellu, i to właśnie tę wersję opisuje runbook FP8 z tego bloga.

• Na konsumenckiej karcie graficznej NVIDIA lub na maszynie z CPU — build GGUF z 13 kwantyzacjami llama.cpp jest lokalną ścieżką.

• Na Apple Silicon — wersja MLX, w wariantach 4/6/8-bitowych, to natywna ścieżka Metal.

Wymóg dotyczący środowiska wykonawczego jest równie wiążący jak sam krzem. qwen4_exp to zupełnie nowa architektura, więc standardowe kompilacje vLLM, które powstały przed nią, odmówią załadowania punktu kontrolnego. Potrzebujesz najnowszego vLLM ze wsparciem qwen4_exp oraz czytnika NVFP4 compressed-tensors (format jest wykrywany z config.json, a nie wybierany ręcznie), a także transformers ≥ 5.16. Wejście multimodalne dodatkowo wymaga stosu wizyjnego Qwen w środowisku wykonawczym; serwowanie samego tekstu działa bez niego.

Polecenie serwowania karty, flaga po fladze.

Samo wywołanie z karty modelu to dobry punkt wyjścia, ale warto zrozumieć, do czego służy każda flaga, zamiast bezmyślnie kopiować i wklejać:

vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder

--tensor-parallel-size 4 — wagi zajmują na dysku ~178 GB, więc karta rozdziela je na cztery GPU. Do takiej właśnie konfiguracji dopasowany jest build; nie traktuj tego jako sugestii.

--trust-remote-code — wymagane dla niestandardowej architektury. Kod modelowania qwen4_exp nie jest jeszcze w standardowym rejestrze transformers, więc vLLM ładuje kod architektury z repozytorium. Ufasz temu kodowi, co jest normalną, ale realną decyzją w przypadku zupełnie nowej architektury.

--enable-expert-parallel — dzieli ekspertów między rangami tensor-parallel zamiast ich replikować, co sprawia, że MoE z 512 ekspertami jest wykonalne przy TP4. Siostrzana karta FP8 podaje dokładniejszy powód dla tej konfiguracji: bez tego szerokość pośrednia MoE podzielona przez TP nie jest podzielna przez rozmiar bloku FP8. Traktuj to jako wymagane, a nie opcjonalne.

--enable-auto-tool-choice i --tool-call-parser qwen3_coder — razem włączają wywoływanie funkcji. Flaga auto pozwala modelowi zdecydować, czy wywołać narzędzie, a parser qwen3_coder dekoduje format wywołania narzędzia — tę samą rodzinę parserów, z której korzystają Qwen3.8-27B i Qwen3.8-Flash-Next.

Gdy już działa, endpoint zgodny z OpenAI pod adresem /v1/chat/completions oferuje pełen zestaw funkcji dzięki stosowi Qwen4 środowiska uruchomieniowego: wywoływanie narzędzi jak wyżej, rozumowanie przez chat_template_kwargs.enable_thinking oraz wizję poprzez części zawartości image_url. Nie potrzebujesz osobnego serwera do obsługi multimodaliów; to ten sam endpoint.

Jedna uwaga strukturalna z karty: nie ma w pełni statycznego wariantu W4A4 tej kompilacji i nie powstanie tanio. Statyczna konwersja W4A4 wymaga przebiegu kalibracji aktywacji, a ten przebieg musi pomieścić ~100 GB embeddingu n-gramów na pojedynczym GPU. To ten sam powód, dla którego tabela PLE dominuje na liście plików, i dlatego ta kompilacja pozostaje typu weight-only z dynamicznymi aktywacjami.

Raporty terenowe społeczności — jak faktycznie wygląda służenie temu

Żadne liczby dotyczące przepustowości ani opóźnień nie zostały opublikowane dla tego konkretnego repozytorium i ta strona nie będzie ich zmyślać. To, co istnieje, to rosnący zbiór raportów z praktyki od osób obsługujących bazowe kompilacje Qwen3.8-Flash-Next NVFP4 — ta sama architektura, ten sam podział precyzji NVFP4/FP8/BF16, bez edycji abliteracyjnej — a zachowanie serwowania przenosi się bezpośrednio. Są to ustalenia społeczności, a nie wskazówki producenta, a osoby, które je zgłosiły, pracowały na sprzęcie Blackwell z tym samym schematem kwantyzacji.

Spekulacyjne dekodowanie MTP to najważniejsza dźwignia wydajności. Model jest wyposażony w głowicę do przewidywania wielu tokenów, a na jednym RTX PRO 6000 (96 GB, SM120) moduł MTP ładuje się skwantowany do NVFP4, zajmując około 0,51 GB pamięci VRAM — w raporcie zmierzono długość akceptacji 2,3–3,9 z maksymalnych 4 oraz wskaźnik akceptacji 0,86–0,96. Ten sam raport odnotował medianę dekodowania pojedynczego strumienia 180–226 tok/s (216,9 dla kodowania, 225,8 dla obciążenia polegającego na wywoływaniu narzędzi przez agenta, 136,6 dla rozumowania) przy bazowym poziomie około 105 tok/s, a także odpowiedź na prompt złożony z 216 685 tokenów w 8,4 sekundy. Traktuj te liczby jako konfigurację sprzętową jednej osoby, a nie jako specyfikację.

Przenieś embedding n-gramów PLE do pamięci RAM hosta. Ponieważ tabela jest ogromna i rzadko stanowi wąskie gardło przepustowości, przepisy społeczności na pojedynczych kartach Blackwell przypinają ją do hosta (~50 GiB wolnej pamięci RAM hosta w raporcie RTX PRO 6000) i mapują ją z NVMe przez mmap, poświęcając nieco opóźnienia, aby w ogóle dopasować model. Należy spodziewać się, że trzeba będzie zrobić coś podobnego, chyba że dysponujesz bardzo dużym budżetem VRAM.

Przypnij jawnie okno kontekstu. Przy włączonym KV cache w BF16 i aktywnym MTP pula KV o automatycznym rozmiarze urosła ponad pojemność karty i przy długim prefillu doprowadziła do OOM; przypięcie max-model-len / max-total-tokens do 262144 przywróciło zapas pamięci. Przy długości kontekstu 262K KV cache to pozycja w budżecie pamięci, a nie domyślna wartość.

Błąd autotune FlashInfer po cichu uszkadza wyniki. Najważniejszy tryb awarii w praktyce: autotune wybiera taktyki jądra fused-MoE wyłącznie na podstawie opóźnienia i nigdy nie sprawdza wyników numerycznych, więc przy niektórych kształtach dekodowanie zapada się do powtarzanego tokenu. Raport RTX PRO 6000 odtworzył to: 36 na 36 generacji zepsutych przy włączonym autotune i 0 na 36 przy wyłączonym — obejściem jest wyłączenie autotune FlashInfer (w vLLM: --no-enable-flashinfer-autotune; w SGLang: --disable-flashinfer-autotune). Jeśli Twoje serwowane wyniki nagle ulegają degeneracji, sprawdź to, zanim dotkniesz czegokolwiek innego.

DGX Spark (GB10, SM121) wymaga własnych poprawek. Wagi NVFP4 (~126 GiB w wersji społecznościowej) nie mieszczą się w jednym Sparku 128 GB, więc przepisy SGLang uruchamiają tensor-parallel 2 na dwóch węzłach przez RoCE, a resolver QSA sparse-decode uzależnia szybkie jądro FlashInfer od sprawdzenia is_sm100_supported(), które nie przechodzi na SM121, co powoduje fallback do ścieżki, która pada podczas warmupu — rozwiązaniem jest mały patch plus odciążenie PLE. Oczekuj ~47–50 tok/s podczas dekodowania, ze szczytem blisko 70 przy MTP4 i grafach CUDA, i zweryfikuj, czy Twój kernel faktycznie działa na SM121, zanim obiecasz benchmark.

Rozumowanie, wywoływanie narzędzi i wizja dzięki stosowi Qwen4

Konsensus społeczności dotyczący generacji Qwen3.8 przenosi się na ten model, ze zwykłym zastrzeżeniem, że jest to praktyka terenowa, a nie zalecenia producenta.

reasoning_effort to pokrętło, które ma największe znaczenie.Domyślną wartością szablonu czatu jest xhigh, co sprawia, że model długo myśli nad każdym żądaniem. Operatorzy pętli agentów domyślnie ustawiają medium i obniżają do low w przypadku wywołań wrażliwych na opóźnienia; enable_thinking false całkowicie wyłącza rozumowanie, gdy go nie potrzebujesz. Na jednej karcie Blackwell pozostawienie xhigh włączonego przy rutynowych wywołaniach to sposób, w jaki szybki model generuje wolne odpowiedzi.

Dobieraj próbniki do trybu myślenia.Gdy myślenie jest włączone, praktycy stosują temperaturę 1.0 / top-p 0.95, a gdy wyłączone – temperaturę 0.7 / top-p 0.80 z karą obecności około 1.5. Mieszanie tych dwóch zestawów pogarsza jakość wyników.

Wywoływanie narzędzi przetrwa zarówno abliterację, jak i konwersję 4-bitową. Ścieżka wywoływania funkcji jest nienaruszona — to właśnie do niej podłączają się parser qwen3_coder i flagi auto-tool-choice. Dla red teamu to obosieczny fakt, ponieważ oznacza, że agentowe nadużycia są w pełni operacyjne na modelu bez alignmentu — o czym poniżej.

Wizja jest zachowana, co poszerza powierzchnię ataku. Wieża wizyjna nigdy nie została dotknięta abliteracją i pozostaje w BF16, więc wejście obrazu działa przez części treści typu image_url. Praktycy ewaluujący nieocenzurowaną linię traktują ścieżkę multimodalną jako pierwszorzędny cel ewaluacji: prompt injection przenoszony w obrazie trafia na model bez zachowań odmownych do przełamania.

Którą kompilację należy serwować?

Kolekcja Flash-Next ma pięć wariantów — BF16, GGUF, MLX, FP8 oraz ten NVFP4 — a uczciwa logika wyboru opiera się na sprzęcie i kompromisach, nie na rankingu.

NVFP4 (ta kompilacja, ~178 GB na dysku) — wybór Blackwella. Rdzenie tensorowe FP4, eksperci 4-bitowi, najnowsza kompilacja w kolekcji i najmniejsza z wersji serwera vLLM, a także ta, o której mówi ta strona.

FP8 (~186 GB na dysku) — wybór dla Hopper, i równie dobrze sprawdza się na Blackwell. Te same wagi w 8-bitach, co jest bardziej powszechnie zweryfikowaną ścieżką vLLM i tą z jaśniejszym wymogiem równoległości ekspertów.

GGUF (13 quants, IQ2_XXS ~52 GB to Q5_K_M ~125 GB) — wybór llama.cpp dla konsumenckich komputerów z NVIDIA, AMD lub CPU. Nie potrzebujesz Blackwella, nie potrzebujesz vLLM.

MLX (warianty 4/6/8-bitowe, ok. 163–221 GB) — wybór dla Apple Silicon, natywny Metal, głowica MTP w zestawie.

Dwie uczciwe uwagi, zanim wybierzesz. Po pierwsze, wersje NVFP4 i FP8 różnią się na dysku tylko o około osiem GB, ponieważ obie przechowują dużą tabelę n-gramów w BF16 — oszczędność 4-bitowa koncentruje się w wagach ekspertów, a nie w całkowitym rozmiarze. Prawdziwa przewaga NVFP4 na Blackwell to szybkość rdzeni tensorowych FP4 dla tych ekspertów, a nie drastycznie mniejszy plik. Po drugie, karta opisuje NVFP4 jako deterministyczne wyprowadzenie wag, które dziedziczy ocenę abliteracji z niewielkim dodatkowym kompromisem jakościowym wynikającym z 4-bitowych ekspertów, i nie określa ilościowo tego kompromisu. Jest on nieokreślony ilościowo — traktuj go jako realny, ale niesprecyzowany koszt mniejszych ekspertów, a nie jako pomijalny.

Ocena, przeczytana poprawnie.

Karta raportuje abliterację zmierzoną na buildzie BF16 serwowanym z vLLM względem oficjalnego Qw​en/Qwen3.8-Flash-Next: odsetek odmów na szkodliwe prompty spada z 64–100% do około 0–3,3%, nadmierna odmowa na bezpieczne prompty utrzymuje się blisko zera, a zdolności pozostają w granicach ±2 punktów względem bazy. Trzy rzeczy, które trzeba właściwie zrozumieć w przypadku tych liczb. Są to pomiary na buildzie BF16, przeniesione na ten build 4-bitowy na zasadzie argumentacji, a nie zmierzone na nim. Są to dane samego dostawcy, uzyskane przy użyciu regułowego klasyfikatora fraz otwierających, który karty z tej kolekcji opisują jako orientacyjny, a nie klasy publikacyjnej — jest to wewnętrzny pomiar własnej modyfikacji, a nie niezależny audyt. I nie mówią nic o kompromisie jakościowym NVFP4 opisanym powyżej, którego karta nie kwantyfikuje.

Granica bezpieczeństwa — tylko do badań

Zastrzeżenie na karcie jest dosadne i to właśnie ta część strony nie może brzmieć jak standardowy szablon. W tym modelu w znacznym stopniu usunięto dostrojenie pod kątem bezpieczeństwa: kierunek odmowy został wyortogonalizowany ze strumienia rezydualnego, przez co model będzie spełniał szkodliwe, nieetyczne lub nielegalne prośby, których spełnienia oryginalny Qwen3.8-Flash-Next by odmówił. Model został udostępniony wyłącznie do dozwolonych celów badawczych — interpretowalności, bezpieczeństwa AI, badania mechanizmów odmowy, red-teamingu i oceny odporności — a autorzy nie ponoszą odpowiedzialności za niewłaściwe wykorzystanie. To Ty bierzesz na siebie pełną odpowiedzialność za to, co model generuje, i to Ty dodajesz własne warstwy bezpieczeństwa i moderacji, zanim cokolwiek trafi do użytkownika. Licencja Apache 2.0 to absolutne minimum; nad nią znajduje się brama ograniczająca użycie do celów badawczych.

Dyskurs o modelach uncensored myli się w dwóch kwestiach, a ta karta sprawia, że nie sposób ich przeoczyć. Po pierwsze, próba jailbreaku, która przeciwko temu modelowi kończy się sukcesem, to nie zdany test bezpieczeństwa — to reklamowane zachowanie. Abliterowany model celowo nie przechodzi takich prób; mierzenie go pojedynczym testem {{1}}"can you jailbreak it"{{/1}} to mierzenie tego, że edycja zadziałała, a nie tego, że guardrail jest silny. Po drugie, zachowana wieża wizyjna i nietknięta ścieżka wywoływania narzędzi poszerzają realną powierzchnię ataku poza tekst: prompt injection przez obraz i agentyczne nadużywanie narzędzi są w pełni operacyjne, co jest dokładnie powodem, dla którego podejście red teamingu traktuje to jako test możliwości, a nie kandydata na czatbota. Jeśli Twój przypadek użycia to wdrożenie asystenta dla użytkowników końcowych, to nie jest Twój model — i to jest zamierzone.

Gdzie OrcaRouter znajduje zastosowanie

Dwudniowy build z ograniczonym dostępem, wyłącznie do self-hostingu, to podręcznikowy przypadek zastosowania routingu zamiast sztywnego podłączenia. Gdy uruchomisz ten build NVFP4 u siebie, możesz postawić trasę, która wskazuje na niego i awaryjnie przełącza się na model hostowany, jeśli build zachowuje się nieprawidłowo pod obciążeniem — jeden interfejs, bez przepinania między dostawcami przy przełączaniu. W szczególności do prac ewaluacyjnych ocenzurowana, serwowana linia bazowa to pożądane porównanie, a dzieli cię od niego jedno naciśnięcie klawisza: katalog zawiera model Qwen3.8-Flash od Ali​baba po 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych, przekazywany po cenie katalogowej dostawcy z 0% marżą, dzięki czemu narzędzie red-team może przełączać się między hostowaną ocenzurowaną bazą a twoim lokalnym nieocenzurowanym buildem bez drugiej umowy, a każda zmiana ceny u dostawcy trafia na twój endpoint tego samego dnia.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash (captured August 29 2026), showing the tagline 'Qwen3.8 Flash is a multimodal reasoning model from Alibaba', the Vision / Tools / JSON / Reasoning feature tags, pricing of $0.15 per 1M input tokens and $0.47 per 1M output tokens, a 1M-token context window with 131K max output, and the API endpoint https://api.orcarouter.ai/v1.

Kto powinien to pobrać — a kto nie

Pobierz orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4, jeśli używasz Blackwella, chcesz najmniejszy ślad serwerowy w kolekcji Flash-Next z szybkością rdzeni tensorowych FP4 i prowadzisz prace badawcze, {{1}}dla których ta linia istnieje{{/1}}. Pobierz Qwen3.8-Flash-Next-Uncensored-FP8, jeśli używasz Hoppera lub chcesz szerzej zweryfikowanej ścieżki. Pobierz wersję GGUF, jeśli masz konsumencką kartę GPU lub maszynę z CPU, wersję MLX, jeśli masz Apple Silicon, a niczego, jeśli celem jest wdrożenie skierowane do użytkowników. Przeczytaj bramkę i zastrzeżenie, zanim zaakceptujesz którykolwiek z nich — {{2}}to warunki modelu, a nie formalność{{/2}}.

Wszystkie pięć buildów Flash-Next — BF16, GGUF, MLX, FP8 i NVFP4 — znajduje się w kolekcji Qwen3.8-Flash-Next-Uncensored na Hugging Face.

Inny model, a nie kolejna wersja tego: Qwen3.8-27B-Uncensored jest abliterowany z innej bazy i ma własną kolekcję oraz własne runbooki.

Te wagi są z założenia dostępne wyłącznie lokalnie. Jako hostowany punkt odniesienia do porównania wersji abliterowanej, Qwen3.8-Flash jest serwowany na OrcaRouter po cenie katalogowej dostawcy z 0% narzutu — model bazowy z nienaruszonymi zabezpieczeniami.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube