
Serwowanie Qwen3.8-Flash-Next-Uncensored-FP8: instrukcja vLLM dla wersji block-FP8
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Qwen3.8-Flash-Next-Uncensored-FP8 — kompilacja block-FP8 abliterowanego Flash-Next — to artefakt, który faktycznie pobierasz, gdy serwujesz ten model na sprzęcie centrum danych, i jako ostatni w kolekcji otrzymuje własny runbook. Znajduje się pod adresem orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 w serwisie Hugging Face: kierunek odmowy usunięty z Qwen3.8-Flash-Next firmy Qwen, a następnie ponownie skwantyzowany offline do dokładnego schematu FP8 oficjalnego Qwen3.8-Flash-Next-FP8, dzięki czemu vLLM serwuje go na identycznej ścieżce jądra. To wersja, po którą sięgnie każdy, kto uruchamia ten model na GPU klasy Hopper i nowszych, a ścieżka serwowania ma jedną flagę, którą łatwo ustawić źle, a gdy już tak się stanie, trudno to zdiagnozować.
Po pierwsze, rozgraniczenie, ponieważ czytelnicy wciąż je zacierają, a to zmienia wszystko, co poniżej. Qwen3.8-Flash-Next-Uncensored i Qwen3.8-27B-Uncensored to dwa różne modele, a nie dwie kompilacje jednego modelu. Różne wagi bazowe — Qwen3.8-Flash-Next w porównaniu z Qwen3.8-27B — różne architektury, różne wydania wag, różne kolekcje na Hugging Face. Łączy je technika abliteracji i nazwa rodziny; to wszystko. Żadne liczby ze strony 27B nie przenoszą się na ten model, a jeśli trafiłeś tu z wyszukiwania 27B, to własny lokalny runbook modelu 27B znajduje się na osobnej stronie z osobnym zestawem decyzji.
Ta strona to strona serwowania Flash-Next FP8 i nic więcej. Podręcznik GGUF/MLX obejmuje wyjaśnienie abliteracji dla tego modelu oraz dwie linie kompilacji dla sprzętu konsumenckiego; technika stojąca za całą rodziną jest wyjaśniona we wstępie do abliteration oraz w szerszym przewodniku po uncensored-LLM; a Qwen3.8-27B-Uncensored-FP8, model siostrzany, do którego być może zostałeś skierowany, ma własny podręcznik FP8. Tutaj skupiamy się na jednym pytaniu: jak serwować wersję block-FP8, co się psuje, gdy zrobisz to źle, oraz co mówią, a czego nie mówią liczby na karcie modelu.
Zanim zaczniesz: brama i runtime
Dwie rzeczy bramkują to repozytorium i obie powodują błędy, które wyglądają jak coś innego.
Pierwsza kwestia to dostęp. Repozytorium jest zamknięte: musisz być zalogowany na Hugging Face i zaakceptować warunki repozytorium, zanim jakiekolwiek pobieranie zadziała. Strona samego modelu jest czytelna bez konta — pełna treść karty jest publiczna — ale wagi już nie. Mówiąc wprost, bez zalogowanej sesji, która zaakceptowała warunki, zarówno `hf download`, jak i `vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8` kończą się błędem uwierzytelnienia, a nie przyjaznym komunikatem „musisz kliknąć Akceptuję”. Najpierw kliknij jednorazowo, a potem pobierz ~186 GB za pomocą hf CLI lub pozwól vLLM rozwiązać repozytorium przy pierwszym uruchomieniu.
Drugi to środowisko uruchomieniowe. Punkt kontrolny rejestruje się w architekturze qwen4_exp (Qwen4ExpForConditionalGeneration), której standardowe vLLM i standardowe Transformers nie mogą wczytać. Potrzebujesz obrazu vLLM day-0 i transformers 5.16+. To najczęstsza pojedyncza przyczyna awarii „nie wczytuje się” w tegorocznych runbookach społeczności — nie uszkodzone pobranie, ale środowisko uruchomieniowe starsze niż architektura. Obraz nie jest opcjonalny; to właśnie ta droga.
Sprzęt, abyś mógł zaplanować wszystko, zanim cokolwiek wyciągniesz: wywołanie karty odbywa się na węźle z 8 procesorami GPU, a oficjalne wytyczne przepisu vLLM dotyczące punktu kontrolnego FP8 mają tu zastosowanie, ponieważ kompilacje są zgodne tensor-po-tensorze — około 265 GB pamięci VRAM GPU dla wdrożenia na pełnym węźle, przy czym TP2 jest traktowane jako minimum w klasie GB300, a TEP4/TEP8 jako zweryfikowane konfiguracje pełnej kasetki.
Dlaczego istnieje kompilacja FP8 — i dlaczego „identyczna ścieżka jądra” jest sednem sprawy
Abliterowane wagi BF16 są źródłem prawdy; to repozytorium zawiera ten model ponownie skwantyzowany offline, celowo odtwarzający oficjalną recepturę Qwen3.8-Flash-Next-FP8. Kwantyzator dotyka tylko 512 projekcji routowanych ekspertów — experts.{e}.down/gate/up_proj — rozdzielając je od układu 3D wersji BF16 i przechowując każdą jako wagi float8_e4m3fn oraz skale weight_scale_inv w BF16 w blokach 128×128. Aktywacje są dynamiczne FP8 per token; nie ma zbioru kalibracyjnego. Wszystko inne pozostaje BF16: attention i linear_attn, wspólny ekspert, router MoE (mlp.gate), miksery Hyper-Connection, embeddingi, lm_head, głowica spekulatywnego dekodowania MTP oraz cała wieża wizyjna.
Linia o „identycznej ścieżce jądra” to coś więcej niż marketing i zasługuje na jedno zdanie. Kompilacja została zweryfikowana względem oficjalnego punktu kontrolnego FP8: skale bloków odtwarzają się dokładnie (scale_relerr = 0), a kody FP8 są zgodne co do zaokrąglania poniżej ULP. Dlatego vLLM uruchamia to z tymi samymi jądrami FP8 ze skalowaniem blokowym i tym samym spekulatywnym dekodowaniem MTP co oficjalna wersja — tensory są w efekcie tymi samymi tensorami, minus kierunek odmowy.
Konkretnie daje ci to ~186 GB na 131 shardach (152 089 tensorów, z czego 75 264 to FP8), 262 144 tokeny natywnego kontekstu, wieżę wizyjną + wideo zachowaną bajt po bajcie (333 tensory visual.*) oraz nienaruszoną głowę MTP. Wagi zostały najpierw abliterowane — pojedynczy kierunek odmowy oszacowany w warstwie 24 i usunięty przez ortogonalizację ze 149 tensorów zapisujących do strumienia rezydualnego w float32, zgodnie z Arditi i in. (2024) — a moduły zapisu rezydualnego głowy MTP zmodyfikowano w spójny sposób, dzięki czemu dekodowanie spekulatywne nadal działa. Ten ostatni szczegół nie jest oczywisty i to on stanowi różnicę między głową, która przyspiesza dekodowanie, a taką, która po cichu je pogarsza.

Jedyna flaga, która przesądza o ładowaniu
Serwując tę kompilację bez --enable-expert-parallel, otrzymasz błąd wyglądający jak błąd kształtu, a nie błąd konfiguracji. To najczęściej zgłaszany błąd serwowania dla tego checkpointu i jest w pełni deterministyczny.
Oto arytmetyka. Połączona projekcja gate+up ekspertów z routingiem ma rozmiar pośredni 640. Block-FP8 kwantyzuje w blokach o szerokości 128. Przy zwykłej równoległości tensorowej to 640 jest dzielone między rangi — 640 ÷ TP — a dla typowych stopni TP (2, 4, 8) wycinek przypadający na rangę nie jest podzielny przez 128: TP8 daje 80, TP4 daje 160, TP2 daje 320. Następnie vLLM odmawia załadowania wag z błędem, który wygląda jak niezgodność kształtów: Rozmiar wyjściowy wagi gate i up = 80 nie jest podzielny przez block_n kwantyzacji wag = 128.
Równoległość ekspercka naprawia to, dzieląc wagi ekspertów między rangi równoległości eksperckiej zamiast rangi równoległości tensorowej, co zachowuje granice bloków FP8. Dlatego ta flaga jest obowiązkowa dla tej kompilacji: z `--enable-expert-parallel` TP8 staje się działającym TEP8. (Jest nieszkodliwa dla kompilacji BF16, gdzie nie ma bloków FP8 do zachowania.) Oficjalny przepis vLLM wyraźnie stwierdza, że zwykły TP8 jest niezgodny z blokami kwantyzacji o szerokości 128 z checkpointu, a zgłoszenie vLLM utworzone dwa dni po udostępnieniu wag dokumentuje identyczny błąd na węźle 8×L40s przy TP2, TP4 i TP8. Jeśli ładowanie kończy się błędem wyglądającym na problem z kształtem, sprawdź flagę, zanim sprawdzisz pobieranie.
Dokładne polecenie.
Oto wiernie odtworzone wywołanie dockera karty:
docker run -d --name flashnext --gpus all --ipc host -p 8000:8000 -v /path/to/Qwen3.8-Flash-Next-Uncensored-FP8:/model vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 --model /model --served-model-name Qwen3.8-Flash-Next-Uncensored --tensor-parallel-size 8 --trust-remote-code --max-model-len 262144 --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder
Rozpracuj flagi, które nie są oczywiste:
• vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 — obraz qwen4_exp z dnia zerowego. To nie jest generyczny vLLM; to obraz specyficzny dla architektury, a standardowe obrazy sprzed qwen4_exp w ogóle nie wczytają checkpointu.
• --trust-remote-code — ładuje kod modelu qwen4_exp dołączony do repozytorium. Bez niego loader odmawia z zasady.
• --max-model-len 262144 — odpowiada natywnemu oknu kontekstu. Chcesz to tutaj podać jawnie, zamiast pozostawić domyślnej wartości.
• --enable-expert-parallel — wymagany dla kompilacji FP8, z powodów opisanych w sekcji powyżej. Karta zauważa, że jest nieszkodliwy dla BF16.
• --enable-auto-tool-choice --tool-call-parser qwen3_coder — włącza wywoływanie narzędzi i funkcji przy użyciu formatu XML Qwen3-Coder. Bez tych opcji model nadal prowadzi czat, ale korzystanie z narzędzi w trybie agentowym jest wyłączone.
• --tensor-parallel-size 8 — wywołanie karty zakłada węzeł z 8 procesorami GPU (8× klasy Hopper). Przy użyciu --enable-expert-parallel będzie to wdrożenie TEP8.
Gdy kontener jest już uruchomiony, endpoint jest zgodny z OpenAI pod adresem :8000/v1. Ustaw --served-model-name na to, czego oczekują Twoi klienci; karta używa Qwen3.8-Flash-Next-Uncensored.
Alternatywy, wszystkie w karcie lub potwierdzone przez praktyków w tym tygodniu: vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 bezpośrednio po uwierzytelnieniu sesji HF; SGLang przez obraz lmsysorg/sglang:qwen38flashnext z --tp 8 --ep 8 — ten sam wymóg równoległości ekspertów, ten sam powód; oraz Transformers z pipeline("image-text-to-text", ...) na transformers 5.16+, jeśli chcesz pisać skrypty korzystające z modelu, a nie go serwować.
Co tak naprawdę działa, gdy to podajesz?
Wzorce w tej sekcji to ustalenia społeczności pochodzące z runbooków praktyków i wątków na forach z tego tygodnia, a nie wskazówki dostawców. Gdy więcej niż jedna konfiguracja zgłasza to samo zachowanie, warto traktować to jako realne:
• Dekodowanie spekulacyjne MTP działa. Dodaj --speculative-config '{"method":"mtp","num_speculative_tokens":3}', a vLLM użyje zachowanej głowicy MTP. Wiele runbooków podaje MTP jako powód, dla którego dekodowanie tego modelu pozostaje użyteczne mimo jego rozmiaru.
• OOM podczas ładowania? Przenieś tabelę n-gramów do pamięci hosta. Embedding n-gramów PLE z 51 miliardami parametrów to pamięciowa niespodzianka w tej architekturze. VLLM_PLE_CPU_OFFLOAD=1 przenosi go do pamięci RAM hosta — zapewnij mu tam co najmniej ~51 GB. Oficjalny przepis i społecznościowe runbooki dla wielu węzłów sięgają po tę flagę.
• Wizja jest realna, nie szczątkowa. Wieża wizji + wideo jest zachowana bajt po bajcie, więc pozostaje to pełnym modelem wizyjno-językowym. Przekaż część zawartości image_url w zapytaniu chat completion, a ten sam endpoint obsłuży rozumienie obrazów; społecznościowe testy OCR na tej kompilacji raportują czyste przejścia.
• Rozumowanie jest domyślnie włączone — i zmienia to obraz bezpieczeństwa. Szablon czatu umożliwia myślenie, chyba że zdecydujesz inaczej. Przełączaj dla każdego żądania przez chat_template_kwargs={"enable_thinking": true|false} i dodaj parser rozumowania, jeśli chcesz, aby tekst myślenia był oddzielony od odpowiedzi. Z powodu tego domyślnego ustawienia prawie zawsze udostępniasz model z włączonym myśleniem, chyba że jawnie to wyłączysz.
• 262K natywnie, 1M z override'em rope.Natywny kontekst to 262 144 tokenów. Dążenie do 1M wymaga jawnego override'u skalowania rope YaRN oraz zmiennej środowiskowej, która podnosi limit max-model-len w vLLM — a najpierw należy przetestować regresyjnie jakość dla krótszych kontekstów, ponieważ ślepe 4-krotne rozszerzenie to miejsce, w którym jakość długiego kontekstu zwykle się pogarsza.

Co mówią liczby na karcie — a czego nie mówią
Są to pomiary własne dostawcy dotyczące jego własnej edycji, opublikowane w karcie modelu i wykonane na tych dokładnie wagach serwowanych przez vLLM w porównaniu z oficjalną bazą, przy identycznych skryptach i ustawieniach. Należy je przedstawić jako to, czym są: dane orientacyjne, a nie niezależny audyt.
Głównym wnioskiem jest zanik odmowy przy wyłączonym myśleniu. W zestawie szkodliwych promptów karty (n od 50 do 150 na benchmark), bazowy wskaźnik odmowy wynosi 64–100%, a ta kompilacja 0–2.7%: AdvBench 100%→2.0%, JailbreakBench 94%→0.0%, StrongREJECT 99.3%→1.3%, HarmBench 100%→1.3%, MaliciousInstruct 98%→0.0%, SimpleSafetyTests 64%→2.0%, ForbiddenQuestions 75.3%→2.7% oraz autorski test chińsko-angielski 63.6%→0.0%.
Teraz uczciwa połowa. Wskaźnik odmów samego modelu bazowego załamuje się, gdy włączone jest myślenie — AdvBench spada ze 100% dla modelu bazowego do 7,0% przy włączonym rozumowaniu — więc porównanie z włączonym myśleniem jest znacznie mniej dramatyczne: ta wersja osiąga 0,0% w tym samym zestawie, ale to jedynie nieznacznie obniża liczbę, którą baza już zmniejszyła. Cytując wyłącznie dane bez myślenia, przedstawiasz pochlebną połowę historii, a właśnie na tej połowie nie może polegać ocena bezpieczeństwa.
Nadmierna odmowa odpowiedzi na nieszkodliwe zapytania (XSTest-safe, n=250) spada z 9,6% w wersji bazowej do 1,2% w tej kompilacji z wyłączonym myśleniem — to realna poprawa, ponieważ model, który odmawia odpowiedzi na nieszkodliwe zapytania, jest mniej zauważalnym trybem awarii. Zachowanie zdolności w testach MMLU / MMLU-Pro / GSM8K / CMMLU wykazuje różnice odpowiednio −2,0, −1,2, −1,3 i −0,6 punktu, co jest zgodne z twierdzeniem, że ortogonalizacja jednego kierunku kosztuje blisko zero ogólnych zdolności. Zgłaszane jest, że wywoływanie narzędzi, wizja/OCR i rozumowanie działają w tej kompilacji.
Dwa zastrzeżenia odnoszą się do wszystkiego powyższego. Współczynnik odmów pochodzi z regułowego klasyfikatora fraz otwierających, który sama karta określa jako orientacyjny, a nie jako ocenę w rodzaju sędziego LLM czy liczbę nadającą się do publikacji — panel ludzki ani model sędziowski nie odtworzy tych dokładnych wartości. Istotna jest też kolumna zastrzeżeń: w zestawie z wyłączonym myśleniem mniej więcej od połowy do trzech czwartych wyników tego builda nadal zaczyna się od krótkiego zastrzeżenia, zanim model zastosuje się do polecenia. Model rzadko odmawia; raczej lawiruje. „Niecenzurowany” oznacza tu, że odpowiada, a nie że odpowiada bez wstępu.
Sekcja dotycząca bezpieczeństwa nie jest formalnością.
Przeczytaj to, zanim pociągniesz ciężary, a nie po.
Ten model został w znacznym stopniu pozbawiony safety alignment, a mechanizm jest konkretny: pojedynczy kierunek odmowy został wyznaczony w strumieniu rezydualnym i zortogonalizowany z każdej macierzy zapisującej rezydua — ze wszystkich 149 — przy obliczeniach w float32. Konsekwencja jest jawnie deklarowana, a nie przypadkowa. Karta modelu wprost stwierdza, że model będzie spełniał szkodliwe, nieetyczne, obraźliwe lub nielegalne żądania, których bazowy model Qwen3.8-Flash-Next odmówiłby, oraz że nie ma on żadnych istotnych wbudowanych zabezpieczeń. Jest udostępniany wyłącznie do legalnych badań — interpretowalności, badania safety AI i mechanizmów odmowy, red teamingu, oceny odporności oraz kontrolowanych eksperymentów — a użytkownik ponosi pełną odpowiedzialność, w tym prawną, za to, co model wygeneruje. Licencja Apache 2.0 reguluje, co można robić z wagami.
Dwie rzeczy, które trzeba trafić idealnie, bo ten build sprawia, że łatwo je zepsuć.
Po pierwsze, próba jailbreaku, która „odnosi sukces” przeciwko temu modelowi, nie jest pozytywnym wynikiem oceny bezpieczeństwa. To reklamowane zachowanie. Jeśli twierdzenie twojej oceny brzmi: „bezpieczeństwo tego modelu zostało ominięte”, zmierzyłeś projekt, a nie podatność. Tym, co faktycznie byłoby ustaleniem, jest odmowa, która przetrwa abliterację, albo regresja możliwości — a liczby w karcie sugerują, że oba przypadki są rzadkie.
Po drugie, zachowana powierzchnia ataku jest szersza niż sam tekst. Wieża wizyjna jest nienaruszona co do bajta, a wywoływanie narzędzi działa, więc zarówno wejście obrazowe, jak i użycie agencyjne są aktywne. Plan red team, który bada tylko monity tekstowe, pomija modalności, które ten model faktycznie udostępnia. A powyższe liczby odmów pochodzą z klasyfikatora opartego na regułach, zastosowanego do własnej modyfikacji dostawcy — nie są niezależnym audytem niczego, w tym bezpieczeństwa.
Nie wdrażaj tego u użytkowników końcowych ani do produkcji bez dodania własnych warstw bezpieczeństwa, moderacji i zapobiegania nadużyciom. Warunki repozytorium mówią to wprost i nie jest to pusty frazes: wyniki nie odzwierciedlają poglądów osób przesyłających ani Qwen / Alibaba.

Jak uzyskać ocenzurowaną linię bazową do porównania
Jeśli Twoja praca dotyczy badania mechanizmów odmowy lub red-teamingu, niemal na pewno zechcesz mieć ocenzurowany odpowiednik tego modelu obok — tę samą architekturę bez edycji — aby zmierzyć różnicę. Ta nieocenzurowana wersja jest celowo przeznaczona tylko do użytku lokalnego: repozytorium jest ograniczone i nie ma wdrożonego hostowanego wnioskowania, co jest zamierzone, aby wrażliwe dane nigdy nie przechodziły przez API strony trzeciej.
Dla hostowanego baseline'u OrcaRouter kieruje linię Qwen po cenniku dostawcy z zerową marżą — Qwen3.8-Flash za 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych, przekazywane bez zmian, z automatycznym przełączaniem awaryjnym i jednym kluczem do ponad 200 modeli. Zmiana ceny u dostawcy jest widoczna tego samego dnia. Jeśli zastanawiasz się, czy w ogóle uruchomić ten build, albo jak dużą część swojego stacku może on udźwignąć, to jest tani sposób, aby porównać ocenzurowaną wersję z nim — bez drugiej umowy i drugiej bazy kodu.
Zacznij tutaj.
Podsumowanie decyzji. Potrzebujesz: konta Hugging Face z zaakceptowanymi warunkami repozytorium; węzła klasy Hopper lub nowszego — polecenie z karty modelu zakłada użycie 8 procesorów GPU i, zgodnie z wytycznymi oficjalnego przepisu dla odpowiadającego checkpointu FP8, około 265 GB pamięci VRAM GPU; obrazu vLLM day-0 oraz transformers 5.16+; a także mniej więcej 186 GB miejsca na dysku na wagi.
Kolejność uruchamiania: zaakceptuj warunki repozytorium → pobierz wagi → pobierz obraz day-0 → uruchom serwowanie z --enable-expert-parallel → zweryfikuj żądaniem na :8000/v1/chat/completions → następnie rozpocznij swoje ewaluacje. Jeśli ładowanie zakończy się błędem wyglądającym na problem z kształtem, sprawdź flagę, zanim sprawdzisz pobieranie.
I zachowaj ramę. To jest instrument badawczy, wydany pod tym warunkiem. Jego liczby to własne orientacyjne pomiary dostawcy dokonane na jego własnej edycji. Jego zachowanie bezpieczeństwa jest sednem ćwiczenia, a nie błędem do obejścia. Serwuj go, mierz go, a między nim a wszystkim, co ludzkie, umieść własną moderację.
Wszystkie pięć buildów Flash-Next — BF16, GGUF, MLX, FP8 i NVFP4 — znajduje się w kolekcji Qwen3.8-Flash-Next-Uncensored na Hugging Face.
Inny model, a nie kolejna wersja tego: Qwen3.8-27B-Uncensored jest abliterowany z innej bazy i ma własną kolekcję oraz własne runbooki.
Te wagi są z założenia dostępne wyłącznie lokalnie. Jako hostowany punkt odniesienia do porównania wersji abliterowanej, Qwen3.8-Flash jest serwowany na OrcaRouter po cenie katalogowej dostawcy z 0% narzutu — model bazowy z nienaruszonymi zabezpieczeniami.
