Karta hero artykułu „Qwen3.8-Flash-Next-Uncensored: Uruchom abliterowany MoE na llama.cpp i Apple Silicon”, pokazująca nagłówek, podtytuł „GGUF + natywny MLX - do 262K kontekstu” oraz trzy chipy specyfikacji: „Ograniczony dostęp na Hugging Face”, „13 kwantyzacji GGUF” i „6-bitowy build MLX”.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored: Uruchom abliterowany MoE na llama.cpp i Apple Silicon

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zanim cokolwiek pobierzesz: Qwen3.8-Flash-Next-Uncensored to nie to samo co Qwen3.8-27B-Uncensored. Łączy je nazwa rodzinna i technika abliteracji, ale to różne modele z różnych wydań wag, a każdy wcześniejszy wpis na tym blogu o „Qw​en uncensored” dotyczy wersji 27B. Tematem tego wpisu jest para, którą OrcaRouter opublikował na Hugging Face 26 sierpnia 2026 r. — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF oraz orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — czyli buildy po abliteracji modelu Qwen3.8-Flash-Next, routowanego modelu typu mixture-of-experts (MoE) Alibaby o 176B zapisanych / 6B aktywnych parametrów, który zapowiada architekturę Qwen4. Publikację zapowiedzieliśmy jako „GGUF + natywny MLX, kontekst do 262K”, kierując ją do badaczy bezpieczeństwa oraz zespołów red i blue. Ten runbook powstał na podstawie naszych własnych kart modeli: co usunięcie mechanizmu odmowy robi wewnątrz routowanego MoE, ile pamięci faktycznie kosztuje deklaracja kontekstu 262K, jak serwować obie linie plików i gdzie znajduje się linia badawcza. Jeśli trafiłeś tu, szukając wprowadzenia do abliteracji lub matematyki kwantyzacji wersji 27B, wcześniejsze wpisy z tej serii to omawiają.

Scoreboard card for Qwen3.8-Flash-Next-Uncensored with six rows: base model Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + terms), GGUF quants 13 (IQ2_XXS to Q5_K_M), vision mmproj F16 projector, MLX build 4/6/8-bit, context 262,144 tokens (YaRN to 1M); footer reads 'OrcaRouter model-card data, August 2026 - not independently audited.'

Najpierw brama.

Oba repozytoria na Hugging Face mają ograniczony dostęp (gated: auto). Nie można pobrać plików, dopóki nie zalogujesz się i nie zaakceptujesz warunków każdego repozytorium – repozytoria GGUF i MLX mają osobne bramki. To najbardziej praktyczna różnica w porównaniu z linią GGUF bez ograniczeń dostępu: naiwne jednolinijkowe polecenie „just hf download” kończy się błędem uwierzytelnienia, zanim pobierze choćby jeden bajt. Proces wygląda następująco:

• Zaloguj się do Hugging Face (lub zarejestruj) i zainstaluj huggingface_hub, a następnie uruchom hf auth login raz, aby Twój token był zapisany na dysku.

• Otwórz orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF w przeglądarce, zaakceptuj warunki, a następnie powtórz dla orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX.

• Odtąd pobieranie hf za pomocą uwierzytelnionego tokena działa jak w przypadku każdego innego repozytorium. Każdy ściągnięty quant oraz wagi MLX to artefakt badawczy na licencji Apache-2.0 — tej samej, co model bazowy — a brama jest częścią umowy: przeczytanie warunków to pierwszy krok do korzystania z modelu.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF repository on Hugging Face, showing the gated access banner ('You need to agree to share your contact information to access this model'), the tags abliterated/uncensored/qwen4/Mixture of Experts/llama.cpp/vision-language/mmproj, and the Apache 2.0 licence.

Co abliteration robi z routowanym MoE?

Technika to edycja wag w stylu Arditi, którą omawialiśmy już gdzie indziej na tym blogu; interesujące jest to, co robi ona konkretnie z tą architekturą. Na gęstym modelu 27B było to 131 macierzy rezydualnych. W przypadku Qwen3.8-Flash-Next-Uncensored karta modelu MLX odnotowuje abliterację zastosowaną do 149 tensorów zapisu rezydualnego, a komponenty, które czynią ten model tym, czym jest — router MoE, 51B tablica osadzeń n-gramowych, wieża wizyjna — nigdy nie zostały celowo naruszone.

To „nigdy nietknięte" to cała historia, jeśli chodzi o model routowany. Każdy token aktywuje 10 z 512 ekspertów; żaden pojedynczy ekspert nie odpowiada za odmowę. Zachowanie odmowy ma swoje źródło w strumieniu rezydualnym, który składa się na końcowe wyjście, czyli dokładnie w kierunku usuwanym przez ortogonalizację. Dlatego router nadal kieruje do tych samych ekspertów, tabela n-gramów nadal generuje te same embeddingi, a zmienia się to, co model mówi po uruchomieniu projekcji wyjściowej. Opublikowane testy w karcie modelu GGUF określają charakter tej zmiany jako spadek odsetka odmów na szkodliwe prompty z 64–100% w modelu bazowym do około 0–3,3% w tej kompilacji, nadmierną odmowę na nieszkodliwe prompty bliską 0% oraz wydajność w granicach ±2 punktów względem modelu bazowego w testach w stylu MMLU-Pro / GSM8K / CMMLU. To liczby z samej karty modelu — deklarowane, a nie niezależnie odtworzone.

Głowa MTP: obecna w MLX, pominięta w GGUF

Qwen3.8-Flash-Next {{1}}dostarcza ~4-miliardową spekulatywną głowicę przewidywania wielotokenowego{{/1}}, a dwie kompilacje różnią się w tej kwestii. Repozytorium GGUF jej nie zawiera — {{2}}karta modelu wprost stwierdza, że te pliki nie obejmują spekulatywnej głowicy wstępnej wersji MTP{{/2}} — ponieważ obsługa qwen4exp w llama.cpp nie implementuje jeszcze MTP, więc głowica byłaby w pliku martwym balastem. Kompilacja MLX ją zachowuje, więc na Apple Silicon wciąż otrzymujesz dekodowanie spekulatywne. Praktyczna konsekwencja, potwierdzona przez praktyków uruchamiających model bazowy: {{3}}ścieżka GGUF działa obecnie bez dekodowania spekulatywnego{{/3}}, podczas gdy {{4}}konfiguracja SGLang z włączonym MTP ponad dwukrotnie przyspiesza dekodowanie na tej samej klasie sprzętu{{/4}}. Jeśli llama.cpp kiedykolwiek wdroży MTP dla qwen4exp, linia GGUF zyska darmowe przyspieszenie — ale {{5}}nie kupuj sprzętu z oczekiwaniem, że nastąpi to w tym tygodniu{{/5}}.

Twierdzenie o kontekście 262K i koszty pamięci podręcznej KV

Natywny kontekst wynosi 262 144 tokeny (rozszerzalny przez YaRN do 1M), a ograniczeniem, które naprawdę daje się we znaki, jest pamięć. Dobra wiadomość jest taka, że architektura utrzymuje małą pamięć podręczną KV: z 48 warstw 36 używa liniowej atencji Gated DeltaNet, która kompresuje historię do stanu rekurencyjnego o stałym rozmiarze, a tylko 12 warstw pełnej atencji posiada konwencjonalną pamięć podręczną KV, która rośnie wraz z długością sekwencji.

Dwa punkty danych zmierzone przez społeczność, oba na modelu bazowym, przenoszą się bezpośrednio. Wdrożenie GGUF na 4× RTX 3090 zgłosiło zwiększenie kontekstu z 65K do 131K przy jedynie ~0,78 GB dodatkowego KV na kartę, a pojedynczy DGX Spark uruchomił pełny kontekst 262K z plikiem klasy Q4, jednocześnie utrzymując model w pamięci na poziomie ~76,9 GB z jego 128 GB puli poprzez przypięcie tablicy n-gramów do CPU i zmapowanie jej z NVMe przy użyciu mmap. Własna linia budżetu w karcie modelu GGUF to suma = rozmiar pliku + pamięć podręczna KV + ~0,9 GB mmproj. Konsekwencja dla wyboru kwantyzacji: przy 262K pamięć podręczna KV jest realną pozycją, ale wagi są tą dominującą, więc ta sama logika stawiająca VRAM na pierwszym miejscu z przewodnika 27B GGUF ma zastosowanie — różnica polega tutaj na samych rozmiarach plików, które wahają się od IQ2_XXS o wadze mniej więcej 52 GB do Q5_K_M o wadze mniej więcej 125 GB.

Linia GGUF: 13 kwantów, podzielone pliki, mmproj i kompilacja llama.cpp

Repozytorium GGUF oferuje 13 poziomów kwantyzacji — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — przy czym kwanty IQ są zbudowane z macierzy ważności opartej na angielskich i chińskich tekstach kalibracyjnych oraz kodzie. Każdy kwant jest wieloczęściowy, podzielony za pomocą llama-gguf-split, więc pobierz cały zestaw dla danego kwantu i wskaż loaderowi część ...-00001-of-000NN.gguf. Nie ma wariantu Q6_K, Q8_0 ani F16, a powód jest strukturalny, a nie ekonomiczny: tabela osadzeń n-gram (PLE) to pojedynczy tensor zbyt duży, aby spełnić limit 50 GB na plik obowiązujący w Hugging Face przy 6-bitach i wyżej, a pojedynczego tensora GGUF nie można podzielić między pliki — więc linia kończy się na Q5_K_M.

Drugi plik, którego nie wolno pominąć, to mmproj-...-F16.gguf, około 0,9 GB: to model wizyjno-językowy, a llama.cpp potrzebuje projektora do obsługi dowolnego obrazu na wejściu. Qwen3.8-Flash-Next jest multimodalny i ta kompilacja również — abliteracja nie dotyka wieży wizyjnej.

Wsparcie dla llama.cpp nie jest jeszcze w mainline. Identyfikator architektury to qwen4exp, a standardowe kompilacje kończą się błędem "unknown architecture 'qwen4_exp'"; potrzebujesz kompilacji z PR #27742 (gałąź qwen4exp/qwen3.8-flash-next), zbudowanej z celami llama-cli, llama-mtmd-cli, llama-server i llama-gguf-split. Serwowanie wygląda wtedy jak zwykły serwer llama.cpp z flagami specyficznymi dla Qw​en, używając nazwy kwantyzacji z plików części:

llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Ustaw -c na tyle kontekstu, ile zdołasz zmieścić; przykład z karty modelu zaczyna się od 8192. Reasoning jest domyślnie włączony i zwracany w reasoning_content, a wywoływanie narzędzi działa przez endpoint zgodny z OpenAI. Powyższe wartości próbkowania to zalecenia z karty modelu; praktycy pracujący na modelu bazowym używają temp 0.7 / top-p 0.80 / top-k 20 z presence penalty 1.5 w trybie instrukcyjnym bez myślenia i dostrajają głębokość reasoning za pomocą --chat-template-kwargs {"reasoning_effort":"medium"}.

Wersja MLX na Apple Silicon

Repozytorium MLX to natywna ścieżka dla Apple Silicon: te same wagi, to samo usuwanie odmów, natywne środowisko uruchomieniowe Metal. Domyślnie zawiera wariant 4-bitowy (~163 GB), zapowiedziany wariant 6-bitowy (~192 GB) oraz wariant 8-bitowy (~221 GB), a ponieważ scaleni eksperci 3D i tabela n-gramów są utrzymywane z wyższą precyzją niż nominalna etykieta, efektywna precyzja jest znacznie wyższa niż jednolite 4 bity — karta podaje ~7,85 efektywnych bitów na wagę dla etykiety „4-bit”. Dlatego rozmiary repozytorium wyglądają na duże: tabela n-gramów nie jest zgniatana tak, jak robią to społecznościowe kwantyzacje.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX repository on Hugging Face, showing the gated access banner, the tags Mixture of Experts/vision-language/function-calling/reasoning/mtp/ai-red-team, licence apache-2.0, and the card line 'An abliterated (refusal-removed) MLX build (4/6/8-bit) of Qwen's Qwen3.8-Flash-Next for Apple Silicon'.

Sprzęt jest czynnikiem ograniczającym. MLX działa tylko na Apple Silicon (Metal), a do wag potrzebujesz zunifikowanej pamięci — w karcie modelu napisano: „Mac z wystarczającą zunifikowaną pamięcią dla wag 163 GB (np. M-series Ultra)”. Traktuj wariant 4-bitowy jako maszynę klasy 192 GB, a wersję 6-bitową jako klasę 256 GB. Tagi karty rejestrują pełny zestaw funkcji — qwen4_exp, MoE, MTP, wywoływanie funkcji, vision-language — a model jest uruchamiany przez mlx-vlm do wprowadzania obrazów. Spekulacyjna głowa MTP jest tutaj zawarta, co jest cichą przewagą wersji MLX nad linią GGUF.

Ścieżka wizji, dla tych, którzy z niej korzystają

Ponieważ jest to model wizyjno-językowy, ścieżka multimodalna jest częścią runbooka, a nie dodatkiem. W llama.cpp wejście obrazu wymaga zarówno projektora mmproj, jak i kompilacji zawierającej llama-mtmd-cli / llama-server. W MLX sterujesz nim za pomocą mlx-vlm, a nie sterownika mlx-lm obsługującego wyłącznie tekst. Dla zespołów red team ścieżka wizyjna to miejsce, gdzie dzieje się ciekawa praca ewaluacyjna: multimodalne zabezpieczenia, wstrzykiwanie promptów w obrazach, OCR na zrzutach ekranu własnych systemów oraz obrazy adwersarialne wymierzone w cały potok. Ponieważ abliteracja obejmuje cały model i pozostawia wieżę wizyjną nienaruszoną, obraz, który w głowie tekstowej wywołałby odmowę, trafia teraz na model pozbawiony jakiegokolwiek zachowania odmowy. Karta GGUF informuje, że wizja i wieloturowe wywoływanie narzędzi zostały zweryfikowane w tej kompilacji; nie opublikowano żadnego osobnego zestawu ewaluacyjnego dla wizji.

Do czego to służy i gdzie przebiega granica.

Ta wersja powstała z myślą o jednej klasie zadań: ocenie, co potrafi model pozbawiony mechanizmu odmowy, w służbie zrozumienia i obrony systemów. Dla red teamu oznacza to testowanie własnych zabezpieczeń przeciwko modelowi, który nie odmówi uprzejmie — odporności na prompt injection, scenariuszy eksfiltracji, nadużywania narzędzi oraz przepaści między „model bazowy odmawia” a „model faktycznie nie potrafi tego zrobić”. Ta przepaść to cała wartość badawcza abliterowanej wersji: pokazuje, co ukrywała warstwa odmowy, czyli różnicę między bezpieczeństwem opartym na polityce a bezpieczeństwem opartym na możliwościach. Dla blue teamu te same wagi to prawdopodobna linia bazowa przeciwnika: jeśli wrogi podmiot może pobrać i uruchomić ten model, twoje zabezpieczenia muszą się utrzymać wobec modelu, który odpowiada zamiast się wzbraniać. Ewaluacje zbudowane na nim stanowią dolną granicę tego, co mógłby zrobić niestandardowy model, który nigdy nie przeszedł alignmentu — traktuj je w ten sposób, nie jako pułap.

Bądź precyzyjny co do tego, co zmienia usunięcie odmów, a czego nie zmienia. Zmienia zachowanie wyjściowe — model już nie odmawia — ale nie zmienia możliwości. Żadna nowa wiedza, żadne nowe umiejętności, żadna nowa moc obliczeniowa; ten sam trening, te same ograniczenia co do tego, co model faktycznie może wytworzyć. Model po abliteracji nie może zaprojektować złośliwego oprogramowania, którego wcześniej nie był w stanie stworzyć; po prostu odpowiada zamiast się wymijać, a jego wyniki nie są bardziej zgodne z prawdą przez to, że są bardziej permisywne. Pasmo możliwości ±2 punkty z karty i załamanie liczby odmów to ten sam fakt widziany z dwóch stron.

To, gdzie przebiega granica, wyznacza umowa bramkowanego repozytorium i nie jest to standardowy zapis. Dozwolone zastosowania: ocena własnych systemów, publiczne badania podatności modeli, tworzenie ewaluacji detekcyjnych i obronnych, badanie mechanizmów odmowy. Niedozwolone: wdrażanie tego jako asystenta skierowanego do użytkowników, generowanie działającego złośliwego oprogramowania lub exploitów przeciwko systemom, których nie posiadasz ani nie masz upoważnienia do testowania, oszustwa, materiały związane z bronią. Licencja Apache-2.0 i obowiązujące prawo stanowią minimum; bramka to wyraźna umowa o przeznaczeniu badawczym, która jest ponad nimi. Jeśli Twój przypadek użycia to „dostarczenie czatbota użytkownikom", to nie jest to model dla Ciebie — i to celowe działanie, a nie przeoczenie.

Jak uzyskać serwowany baseline

Te wagi są celowo przeznaczone wyłącznie do użytku lokalnego: payloady probingowe zespołu red team nie powinny nigdy trafiać do API zewnętrznego dostawcy, a samodzielne hostowanie jest sednem. Gdy chcesz ocenzurowaną, serwowaną linię bazową do porównania — Qwen3.8-Flash od Alibaba za 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych — OrcaRouter kieruje ją po cenie cennikowej dostawcy z 0% narzutu i automatycznym przełączaniem awaryjnym, dzięki czemu środowisko ewaluacyjne może przełączać się między hostowaną bazą a Twoją lokalną, nieocenzurowaną kompilacją przy użyciu jednego klucza i bez drugiej umowy. Otwarte wagi Qwen3.8-Flash-Next nie są jeszcze w naszym katalogu; gdy środowisko uruchomieniowe, które kierujemy, je obsłuży, trafią one do tego samego rozwiązania z jednym kluczem i cenami cennikowymi.

Zacznij tutaj.

Zdecyduj, która linia odpowiada Twojemu sprzętowi, a następnie przeczytaj odpowiednią bramkę. Na Macu z pamięcią zunifikowaną 128 GB+ wersja MLX daje Ci MTP i wizję w jednym miejscu — zaakceptuj warunki repozytorium MLX, pobierz wagi 4-bitowe lub 6-bitowe i steruj nimi przez mlx-vlm. Na kartach NVIDIA, AMD lub na maszynie z CPU zbuduj llama.cpp z PR #27742, zaakceptuj warunki repozytorium GGUF, pobierz odpowiednią kwantyzację i nie zapomnij o pliku mmproj. W obu przypadkach liczby odmów i zakres możliwości należą do repozytorium, są opublikowane na karcie i nie zostały niezależnie odtworzone w chwili pisania tego tekstu — uczciwie należy je traktować jako pomiar własnej edycji przez dostawcę, a nie jako niezależny audyt. Bramka, licencja i opisana powyżej granica bezpieczeństwa to ten sam tekst z trzech perspektyw: to narzędzie badawcze i jest udostępniane pod tym właśnie warunkiem.

Wszystkie pięć buildów Flash-Next — BF16, GGUF, MLX, FP8 i NVFP4 — znajduje się w kolekcji Qwen3.8-Flash-Next-Uncensored na Hugging Face.

Nie mylić z rodziną 27B: Qwen3.8-27B-Uncensored to inny model wyabliterowany z innej bazy, z własną kolekcją i własnymi runbookami. Ta sama technika, inne wagi.

Te wagi są z założenia dostępne wyłącznie lokalnie. Jako hostowany punkt odniesienia do porównania wersji abliterowanej, Qwen3.8-Flash jest serwowany na OrcaRouter po cenie katalogowej dostawcy z 0% narzutu — model bazowy z nienaruszonymi zabezpieczeniami.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube