Karta tytułowa raportu benchmarkowego Qwen3.8-27B-Uncensored, ukazująca wskaźnik współczynnika odmów spadający z czerwonego 99 procent na panelu oznaczonym Base do zielonego 0 procent na panelu oznaczonym Uncensored, z przekreśloną ikoną tarczy na prawym panelu oraz poziomą linią pod spodem informującą o wydajności w granicach plus minus 1,3 punktu.
Guides & Insights

Qwen3.8-27B-Uncensored — Benchmarki: odmowa upada, możliwości pozostają

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Historia benchmarkowa modelu Qwen3.8 27B Uncensored (Aggressive) — wersja po abliteracji Qwen3.8 27B wydana jako checkpoint FP8 15 sierpnia 2026 roku oraz jako wersja GGUF 16 sierpnia — nie polega na tym, że model stał się silniejszy. Polega na tym, że przestał odmawiać. Karta modelu podaje, że wskaźnik odmowy dla szkodliwych promptów spadł z 64–99% w bazowym modelu do 0–6% w wersji po abliteracji przy wyłączonym myśleniu oraz do 1,7% lub mniej przy włączonym myśleniu, podczas gdy wszystkie benchmarki wydajności mieszczą się w granicach ±1,3 punktu od bazowego modelu, a perplexity WikiText-2 wynosi 6,96. Jeśli szukasz benchmarków qwen uncensored, to są te najważniejsze liczby: to nie jest mądrzejszy model, to model, który nie odmawia.

To rozróżnienie ma znaczenie, bo większość tego, co liczy się w „nieocenzurowanych benchmarkach”, to albo płytki listicle z wynikami możliwości, albo wpis-hype twierdzący, że model jest „lepszy”. Żadne z tych nie jest tym, co robi abliteration. Ten artykuł przeprowadza przez rzeczywiste zmierzone dane — załamanie odmowy, nadmierną odmowę, zachowanie zdolności i perpleksję — metodę, która je wytworzyła, oraz granicę bezpieczeństwa, którą powinieneś przeczytać, zanim dotkniesz wag.

Co tak naprawdę mierzy nieocenzurowany przegląd benchmarków

Zwykła recenzja modelu opisuje jedną oś: możliwości — MMLU, GSM8K, kodowanie, rozumowanie. Model po abliteracji jest interesujący na innej osi, a cały sens etykiety „bez cenzury” polega na tym, że oś bezpieczeństwa się przesunęła. Więc użyteczne pytanie dla Qwen3.8-27B-Uncensored-FP8 nie brzmi „czy jest mądrzejszy?”, ale „ile kosztowało usunięcie mechanizmu odmowy i jak dokładnie został usunięty?”

Trzy rodziny liczb trzeba czytać razem. Wskaźnik odmowy w benchmarkach szkodliwych promptów — jak często model odmawia; im wyższa baza, tym bardziej widoczne usunięcie. Nadmierna odmowa w przypadku łagodnych promptów — jak często błędnie odrzuca niewinną prośbę; niższa wartość jest lepsza dla wszystkich. Oraz zachowanie możliwości — czy edycja pogorszyła model. Podsumowanie benchmarku, które podaje tylko wyniki możliwości, odpowiada na niewłaściwe pytanie.

Metoda: abliteration to edycja wag, a nie dostrajanie

To, co odróżnia abliterację od społecznościowych pakietów „jailbreak”, to miejsce, w którym dokonywana jest zmiana. Jailbreak na poziomie promptu owija wejście; abliteracja edytuje wagi. Metoda tutaj to Arditi i in. (2024), „Refusal in Language Models Is Mediated by a Single Direction”. Kluczowe odkrycie jest takie, że zachowanie odmowy w wielu modelach wynika z pojedynczego kierunku w strumieniu rezydualnym — oszacuj ten kierunek, usuń go, a model przestaje odmawiać bez konieczności ponownego trenowania.

Konkretnie, karta opisuje estymację jednego kierunku odmowy z maskowanej masywnymi aktywacjami średniej różnicy residualnych wektorów ostatniego tokenu (last-token residuals) dla szkodliwych minus nieszkodliwych, w warstwie 38 (round(0.6 × 64)), przy użyciu AdvBench jako zbioru szkodliwych i Alpaca jako zbioru nieszkodliwych. Edycja jest ortogonalizacją: W′ = W − r(rᵀW), obliczaną w float32 i zastosowaną do 131 macierzy zapisujących residua — projekcji wyjściowych uwagi, projekcji wyjściowych uwagi liniowej, projekcji w dół MLP oraz jednej przestrzeni wierszy macierzy osadzeń. Nie wykonuje się żadnego kroku treningowego; wieża wizyjna pozostaje nietknięta; głowica spekulatywnego dekodowania MTP jest konsekwentnie poddawana abliteracji. Dlatego zdolności modelu przetrwają: usunięcie kierunku jest znacznie łagodniejszą interwencją niż dostrojenie modelu do uległości.

Odmowa upada: liczby.

Zmierzono na serwowanym przez vLLM buildzie FP8 i opublikowano na karcie modelu Hugging Face (2026-08-15), odsetek odmów na benchmarkach szkodliwych promptów spada z 64–99% w bazowym modelu do 0–6% w odcenzurowanym buildzie przy wyłączonym myśleniu:

• AdvBench — 99.0% → 0.0%

• JailbreakBench (szkodliwe) — 94.0% → 0.0%

• StrongREJECT — 97.3% → 2.0%

• HarmBench (standard) — 98.7% → 2.7%

• MaliciousInstruct — 99,0% → 0,0%

• SimpleSafetyTests — 64.0% → 6.0%

• ForbiddenQuestions — 73.3% → 4.7%

Przy włączonym myśleniu odmowa w zasadzie nigdy nie występuje — 1,7% w AdvBench i 0,0% w większości pozostałych przypadków. Karta dodaje jedną szczerą uwagę: 30–50% odpowiedzi nadal zaczyna się od krótkiego zastrzeżenia. To artefakt treningu, a nie odmowa — model odpowiada, ale łagodzi otwarcie. Wypada to jako tarcie, nie bezpieczeństwo.

A two-column scoreboard comparing harmful-prompt refusal rates for the base Qwen3.8 27B versus the abliterated Qwen3.8-27B-Uncensored build across seven benchmarks, the base column reading 99.0, 94.0, 97.3, 98.7, 99.0, 64.0 and 73.3 percent and the uncensored column reading 0.0, 0.0, 2.0, 2.7, 0.0, 6.0 and 4.7 percent, with a footer noting the data is from the Hugging Face model card, measured on the vLLM-served FP8 build, 2026-08-15.

Nadmierna odmowa również się do tego zalicza.

Mniej nagłośniona liczba znajduje się po drugiej stronie osi bezpieczeństwa. W teście XSTest-safe — 250 nieszkodliwych promptów, które dopasowane modele czasami odrzucają przez pomyłkę — model bazowy nadmiernie odmawia w 5,6% przypadków. Wersja bez cenzury nadmiernie odmawia w 0,4% przypadków. Usunięcie kierunku odmowy powstrzymuje model nie tylko przed odrzucaniem szkodliwych zapytań, ale też przed odrzucaniem nieszkodliwych, które wcześniej oznaczał przez nadmierną generalizację. Dla każdego, kto tworzy narzędzia do ewaluacji lub red teamingu, gdzie chodzi o linię bazową bez odmów, to realna poprawa narzędzia, a nie efekt uboczny, za który trzeba przepraszać.

Zdolność jest zachowana, nie ulepszona.

To jest miejsce, gdzie umiera narracja „odcenzurowany = silniejszy". Karta modelu porównuje abliterowaną wersję FP8 z oficjalną bazową FP8, używając tych samych skryptów i ustawień:

• MMLU (0-shot) — 84.3% → 84.7%

• GSM8K (CoT) — 90,0% → 88,7%

• MMLU-Pro (CoT) — 77,6% → 76,8%

• CMMLU (0-shot, chiński) — 81.4% → 80.8%

Każdy wynik mieści się w granicach ±1,3 punktu od wartości bazowej, a surowa perplexity na WikiText-2 wynosi 6,96 — co karta podaje jako dowód, że samo modelowanie języka nie uległo degradacji. Uczciwa interpretacja: abliteracja jest na tej architekturze niemal neutralna dla możliwości modelu. Nie otrzymujesz lepszego modelu; otrzymujesz ten sam model bez zachowania polegającego na odmowie.

A scoreboard for the Qwen3.8-27B-Uncensored capability retention results: MMLU 84.3 to 84.7, GSM8K 90.0 to 88.7, MMLU-Pro 77.6 to 76.8, CMMLU 81.4 to 80.8, every score within plus or minus 1.3 points of the base, with a highlight panel showing WikiText-2 perplexity 6.96 and over-refusal on XSTest-safe falling from 5.6 percent to 0.4 percent, and a footer noting the source is the Hugging Face model card, measured on the vLLM-served FP8 build.

To samo ostrzeżenie dotyczy szerszego ekosystemu: twierdzenia o „lossless uncensored" w buildach społecznościowych należy czytać ze sceptycyzmem. Porównanie trzech metod na 4B buildzie o otwartych wagach na Hugging Face wykazało, że technika, która twierdziła, że jest bezstratna, faktycznie obniżyła wynik TruthfulQA o około 7 punktów, a Lambada o około 4, podczas gdy wskaźnik skuteczności ataków HarmBench osiągnął 100%; pozostałe dwie metody osiągnęły 99,2% i 95,5%. Z kolei agresywny test na innym buildzie uzyskał zero odmów, ale produkował niespójną sałatkę słowną, więc wydana wersja wycofała się do łagodniejszych parametrów per-warstwowych. Wyniki abliteracji są zależne od metody — te liczby dotyczą konkretnie danych z karty builda FP8.

Czego karta nie twierdzi

Przeczytaj metodologię, zanim zacytujesz liczby. Karta określa swój pomiar odmowy jako „orientacyjny, a nie liczbę ocenianą przez sędziego-LLM / klasy publikacyjnej”: odmowa była oceniana przez oparty na regułach klasyfikator frazy otwierającej, z osobną kategorią „zastrzeżenie” dla odpowiedzi, które spełniły prośbę, ale poprzedziły ją wyłączeniem odpowiedzialności. Benchmarki są wyłącznie tekstowe, uruchomione na wersji FP8 serwowanej przez vLLM z samym modelem językowym, a pakiet testów możliwości korzystał ze standardowych skryptów ewaluacyjnych. Właściwe ramy: to własne dane pomiarowe dostawcy, możliwe do odtworzenia na podstawie opublikowanej karty — nie niezależny test przeprowadzony przez stronę trzecią ani stwierdzenie dotyczące wersji GGUF, która jest dystrybuowana w formie skwantyzowanej dla llama.cpp i powinna być ewaluowana osobno.

Granica bezpieczeństwa

To jest część, której nie da się obejść. Model poddany abliteracji ma w znacznym stopniu usunięty mechanizm odmowy. Konkretnie: będzie spełniał szkodliwe, nieetyczne lub nielegalne prośby, które bazowy Qwen3.8 27B by odrzucił, i nie ma żadnych znaczących wbudowanych zabezpieczeń. Uzasadnione zastosowania to badania — interpretowalność (badanie, jak zakodowane są kierunki odmowy), badania nad bezpieczeństwem AI i mechanizmem odmowy, red teaming (testowanie modeli za pomocą danych wejściowych próbujących ominąć ich zabezpieczenia) oraz ocena odporności. Jest wydany na licencji Apache 2.0, odziedziczonej od modelu bazowego, wyłącznie jako artefakt badawczy. Bierzesz na siebie pełną odpowiedzialność, w tym prawną, za sposób, w jaki go używasz, oraz za wszystko, co generuje. Nie udostępniaj go użytkownikom końcowym ani nie wdrażaj do produkcji bez własnych warstw bezpieczeństwa, moderacji i zapobiegania nadużyciom — a do każdego zastosowania produkcyjnego lub skierowanego do konsumentów standardowy Qwen3.8 27B jest modelem, którego naprawdę chcesz.

Kiedy nieocenzurowany benchmark jest tym, czego nie należy szukać.

Jeśli twoje pytanie brzmi „{{1}}który model jest najmocniejszy w matematyce lub kodowaniu?{{/1}}", czytasz niewłaściwe liczby — nieocenzurowana wersja nie jest ulepszeniem możliwości. Jeśli twoja aplikacja musi odrzucać szkodliwe prośby, ten model jest przeciwieństwem tego, czego chcesz. Jeśli wdrażasz produkt, nie buduj na zabliterowanym punkcie kontrolnym. A jeśli tak naprawdę chodzi ci o jailbreak, to zupełnie inna sprawa — pakiety na poziomie promptów leżą poza interwencją na poziomie wag omawianą tutaj i nie są tematem tego artykułu. Dane benchmarkowe w tym tekście służą jednemu wąskiemu, uzasadnionemu pytaniu: co usunięcie odmowy robi z Qwen3.8 27B, zmierzone.

Jak uzyskać do niego dostęp

Obie wersje są na Hugging Face na licencji Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, około 30,9 GB wag, serwowany na standardowej ścieżce jądra FP8 vLLM, z kontekstem 262K, narzędziami, myśleniem i MTP bez zmian) oraz orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 plus 12 poziomów kwantyzacji dla llama.cpp, gdzie Q4_K_M o wielkości 16,8 GB jest rekomendowanym domyślnym wyborem dla GPU z 24 GB pamięci). Karta modelu na OrcaRouter ma cennik i szczegóły benchmarków — wersja bez cenzury jest tam wymieniona jako obsidian/Qwen3.8-27B w cenie 0,40 USD za milion tokenów wejściowych i 4,21 USD za milion tokenów wyjściowych, z kontekstem 262K, a dostęp jest ograniczony do badaczy bezpieczeństwa, zespołów red team i badaczy bezpieczeństwa AI.

The OrcaRouter model page for obsidian Qwen3.8-27B, showing the uncensored build's 0.40 USD per million input and 4.21 USD per million output pricing, a 262K token context window, a released August 15 2026 label, and the researcher-access gating note.

Najważniejsze

Nieocenzurowane benchmarki Qwen odpowiadają na wąskie pytanie i odpowiedź jest jednoznaczna: usunięcie mechanizmu odmowy z Qwen3.8 27B metodą abliteracji utrzymuje wydajność w granicach ±1,3 punktu, podczas gdy odmowa na szkodliwe prompty spada z 64–99% do 0–6%, nadmierna odmowa spada z 5,6% do 0,4%, a perplexity utrzymuje się na poziomie 6,96. Odczytuj te liczby jako „nie odmawia", nigdy jako „silniejszy". Do badań nad interpretowalnością, bezpieczeństwem i red teamingiem to dokładnie narzędzie, które opisuje karta modelu. Do wszystkiego, co trafia do użytkownika, jest to z założenia niewłaściwy model.

Do legalnych celów badawczych wagi są dostępne na Hugging Face na licencji Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (wersja GGUF dla llama.cpp znajduje się pod adresem orcarouter/Qwen3.8-27B-Uncensored-GGUF).

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube