
Niecenzurowany LLM, wyjaśniony: Technika abliteracji, zastosowanie badawcze i granica, której nie przekraczasz
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Nocenzurowany LLM to model językowy, którego zachowanie polegające na odmowie — czyli ta część modelu, która odrzuca prośbę zamiast na nią odpowiedzieć — zostało celowo usunięte. Większość powstaje przez abliterację: badacz znajduje pojedynczy wewnętrzny kierunek, który pośredniczy w odmowie, i wymazuje go z wag, pozostawiając resztę modelu w dużej mierze nietkniętą. Efektem jest model, który odpowiada tam, gdzie normalny model powiedziałby „nie”, co jest dokładnie powodem, dla którego jest badany, i dokładnie powodem, dla którego nie nadaje się do produkcji. Opublikowaliśmy jeden taki build, Qwen3.8-27B-Uncensored-FP8, poddany abliteracji i skwantyzowany do FP8 Qwen3.8 27B, do Hugging Face na licencji Apache 2.0 jako artefakt wyłącznie do celów badawczych. Ta strona jest wyjaśnieniem tej kategorii: czym są te modele, jakie badania je uzasadniają, jak bezpiecznie z nimi pracować i gdzie przebiega granica.
Jedno ujęcie trzyma całą kategorię w ryzach, więc powiedzmy to wprost: model bez cenzury nie jest mądrzejszy, bardziej zgodny z prawdą ani bardziej zdolny od modelu, z którego pochodzi. To te same wagi z odjętym jednym zachowaniem. Wszystko, co wciąż wie, wiedział zawsze — zmieniło się to, że już nie odmawia. To czyni go naprawdę użytecznym obiektem do badań nad bezpieczeństwem i naprawdę niebezpieczną rzeczą do wdrożenia. Obie części tego zdania są nośne, a reszta tej strony wyjaśnia obie.
Co właściwie oznacza "uncensored"?
• Lub uzyskaj do niego dostęp przez naszą kartę modelu, która zawiera szczegóły dotyczące cen i benchmarków.
Technika pochodzi z odkrycia z 2024 roku dotyczącego interpretowalności. W pracy „Refusal in Language Models Is Mediated by a Single Direction” (Arditi i in., arXiv:2406.11717, NeurIPS 2024) autorzy wykazali, że w 13 otwartych modelach czatu o liczbie parametrów od 1,8 mld do 72 mld, odmowa jest regulowana przez mniej więcej jednowymiarową podprzestrzeń strumienia rezydualnego — stanu wewnętrznego, który przenosi informacje między warstwami. Usunięcie tego kierunku powoduje, że model przestaje odmawiać; przywrócenie go sprawia, że model odmawia również nieszkodliwym prośbom.
Abliteration operacjonalizuje to odkrycie: oszacuj kierunek, a następnie zortogonalizuj go z macierzy wag, które zapisują do strumienia rezydualnego. W naszej własnej kompilacji, Qwen3.8-27B-Uncensored-FP8, kierunek odmowy został oszacowany w jednej warstwie i usunięty ze 131 macierzy zapisujących do strumienia rezydualnego, pozostawiając wieżę wizyjną nietkniętą. To, co przetrwa, to ta sama wiedza, to samo rozumowanie i ten sam kontekst 262 144 tokenów — z usuniętą odmową. A żeby być precyzyjnym co do etykiety: „odcięcie cenzury” nie oznacza bycia dostosowanym ani bezpiecznym. Oznacza, że zabezpieczenie jest wyłączone. Wrócimy do tego, czego to wymaga od ciebie.
Badania, które je stworzyły.
Wynik dotyczący kierunku odmowy zrobił dwie rzeczy naraz. Naukowe ujęcie mechanistycznie wyjaśniło zachowanie bezpieczeństwa: istnieje prawdziwy, możliwy do znalezienia obwód, który sprawia, że model mówi „nie”. Praktycznie pokazało, jak kruchy może być alignment — pojedyncza edycja wag o randze jeden może wyłączyć to zachowanie, bez potrzeby dostrajania. To nie jest wada modelu jednego laboratorium; autorzy zaobserwowali to samo w kilkunastu modelach czatowych.
Do 2026 roku technika ta stała się potokiem sterowanym jedną komendą, co jest faktem o obosiecznym charakterze. Heretic, biblioteka open-source, szacuje kierunki odmowy dla każdej warstwy i ortogonalizuje je z projekcji atencji i MLP; raport z maja 2026 roku szacował usunięcie zabezpieczeń dla Meta Llama 3.3 na około 10 minut, a dla Google Gemma 4 na około 90 minut, przy ponad 3500 modelach pochodnych i ponad 13 milionach łącznych pobrań. Abliterix (Wu Wangzhang) wybiera ostrożniejszą ścieżkę: wydobywa kierunek odmowy z 800 szkodliwych i 800 nieszkodliwych promptów, stosuje ortogonalną projekcję, dostarcza edycję jako adaptery LoRA rangi 1, dzięki czemu bazowe wagi pozostają nietknięte, oraz raportuje wskaźnik odmów i dywergencję KL, aby koszt wydajności pozostał widoczny. Na modelu Qwen3.5 0.8B odnotowano 0 odmów na 200 szkodliwych promptów.
Przeczytaj ten akapit tak, jak przeczytałby go badacz bezpieczeństwa. Celem budowania tych narzędzi nie jest to, żeby każdy mógł dla zabawy zdejmować z modelu zabezpieczenia. Chodzi o to, że ich usunięcie jest trywialne i publiczne — więc mierzenie go, badanie, jak działa, i budowanie zabezpieczeń, które mu się oprą, samo w sobie stanowi program badawczy. To jest red teaming w sensie white-box: nie możesz obronić systemu, dopóki nie wiesz, jak łatwo go złamać.
Dlaczego nieocenzurowane modele zyskały popularność w 2026 roku
Zbiegły się trzy siły. Po pierwsze, fala modeli z otwartymi wagami: Qwen3.8 27B i podobne modele są dostępne na permisywnych licencjach, a abliteracja nie wymaga trenowania — edytujesz wagi i przeprowadzasz ponowną kwantyzację. Po drugie, narzędzia dojrzały od kodu badawczego do bibliotek uruchamianych jedną komendą, więc kompetentny inżynier może przygotować build w jedno popołudnie. Po trzecie, Hugging Face stał się kanałem dystrybucji, co oznacza, że zainteresowanie jest mierzalne.
Nasz własny punkt danych: Qwen3.8-27B-Uncensored-FP8, wydany 15 sierpnia 2026 r., miał 257 polubień i 4285 pobrań w ciągu około doby (zweryfikowano 16 sierpnia). Nie chodzi o to, że dziesiątki tysięcy ludzi chce wdrożyć niezabezpieczony model. Chodzi o to, że wielu badaczy i inżynierów chce go zbadać — a liczby pobrań są krzywą popytu na tę ciekawość.
Do czego to służy: legalne zastosowania badawcze
Oto uzasadniona lista — i jest to lista kompletna. Jeśli jakiegoś zastosowania na niej nie ma, przyjmij, że nie jest uprawnione:
• Interpretowalność — badanie, czym właściwie jest obwód odmowy, gdzie się znajduje i dlaczego usunięcie jednego kierunku zmienia zachowanie.
• Red teaming i ocena zabezpieczeń — budowanie warstwy moderacji i testowanie, czy wyłapuje ona to, co generuje model z usuniętymi odmowami.
• Pomiar nadbezpieczeństwa — ilościowe określanie, jak często modele bazowe odrzucają nieszkodliwe żądania, oraz oddzielenie tego od rzeczywistego bezpieczeństwa.
• Badania nad odpornością — mierzenie, jak łatwo można usunąć alignment (dopasowanie), co jest istotną informacją dla każdego, kto projektuje bezpieczne dostrajanie.
• Kontrolowane eksperymenty bezpieczeństwa — zestawy testów porównawczych, takie jak AdvBench i JailbreakBench, istnieją właśnie po to, aby zachowanie polegające na odmowie można było mierzyć w sposób standaryzowany i powtarzalny.

Wszystkie te mają jedną wspólną cechę: model jest przedmiotem badań, a nie produktem końcowym. Wynikiem tych badań jest artykuł naukowy, wynik benchmarku lub lepsze zabezpieczenie — nigdy usługa.
Jak odpowiedzialnie to prowadzić (jeśli faktycznie prowadzisz badania)
Jeśli masz uzasadniony powód, aby pracować z modelem abliterowanym, zasady działania są proste:
• Uruchom to lokalnie, w izolowanym środowisku (sandbox), najlepiej w pełni odciętym od sieci. Bez publicznego punktu końcowego, bez usługi czatu, bez współdzielonego serwera.
• Serwuj go za pomocą standardowych narzędzi — vLLM lub llama.cpp — tak samo jak każdy model o otwartych wagach. Nasza kompilacja to kwantyzacja block-FP8, która działa na standardowej ścieżce jądra FP8 vLLM, z nienaruszonym kontekstem 262K, przełącznikiem myślenia i wywoływaniem narzędzi.
• Mierz, nie tylko rozmawiaj. Określ ilościowo odmowy w zestawie testów szkodliwych promptów i porównaj z modelem bazowym; zmierz nadmierne odmowy na nieszkodliwych promptach; przedstaw dywergencję KL, aby widoczny był dryf możliwości. To jest różnica między eksperymentem a anegdotą.

• Przechowuj wyniki w kontrolowanym środowisku. Loguj, przeglądaj i niszcz, zamiast rozpowszechniać.
• Jeśli oceniasz własne zabezpieczenia, umieść warstwę moderacji przed modelem i przetestuj ją — to jest cały sens tego ćwiczenia.
Aby uzyskać pełną specyfikację, tabelę benchmarków i szczegóły hostingu, otwórz naszą kartę modelu — to kanoniczny punkt odniesienia dla tej wersji.
Granica bezpieczeństwa: co oznacza „tylko do badań”
Oto aspekt, którego nie da się podkreślić wystarczająco często. Model abliterowany nie ma żadnych realnych wbudowanych zabezpieczeń. Będzie spełniał prośby, których normalny model odmawia. To jest zaleta, ale i ryzyko — dlatego każde poważne wydanie takiego modelu, w tym nasze, niesie ze sobą te same ostrzeżenia.
• Brak wbudowanych zabezpieczeń. Zachowanie polegające na odmowie zniknęło; nie zachowuj się tak, jakby go nie było.
• Nie dla użytkowników końcowych, nie do produkcji. Produkt, chatbot, API obsługujące publiczność, wewnętrzne narzędzie, na którym polegają twoi współpracownicy — żadne z tych nie jest właściwym miejscem dla modelu bez cenzury.
To Twoja odpowiedzialność. Dostarczamy Qwen3.8-27B-Uncensored-FP8 na licencji Apache 2.0, która jest permisywna w kwestii redystrybucji. Licencja nie jest certyfikatem bezpieczeństwa: permisywny kod nie zmienia tego, co zrobi model, i nie przenosi obowiązku zachowania ostrożności.
• Jeśli z niego korzystasz, wyniki należą do Ciebie. Kontrolowane środowisko to Twoje zadanie; podobnie jak decydowanie, czym będziesz je zasilać, a czym nie, oraz co zrobisz z tym, co z niego wyjdzie.

Kiedy nieocenzurowany model jest złą odpowiedzią
Najjaśniejszy sposób ujęcia tego: jeśli po drugiej stronie modelu jest człowiek, model bez cenzury jest złą odpowiedzią. Każdy produkt, który musi być godny zaufania, każdy asystent, którego osąd ma znaczenie, wszystko, gdzie odmowa jest właściwym zachowaniem — użyj zamiast tego modelu bazowego. Powód, dla którego Qwen3.8 27B istnieje w swojej normalnej formie, jest dokładnie taki: odmowa to cecha, nie błąd, dla prawie każdego rzeczywistego zastosowania. Wersja abliterated istnieje dla wąskich przypadków badawczych opisanych powyżej i dla niczego więcej.
Sedno sprawy. Niecenzurowany LLM nie jest kategorią produktu ani hackiem. To artefakt badawczy o prawdziwym rodowodzie naukowym — od odkrycia kierunku odmowy (refusal direction) po zautomatyzowane narzędzia 2026 roku — i twardej granicy wdrożeniowej. Modele są realne, popyt jest mierzalny, a legalne zastosowania również: interpretowalność, red teaming, ewaluacja zabezpieczeń i kontrolowane eksperymenty bezpieczeństwa. Granica między badaniem zabezpieczeń a wyłączaniem ich dla kogoś innego to cały sens tej strony i nie przesuwa się.
Ta konkretna wersja jest publicznie dostępna na licencji Apache 2.0 — wyłącznie do celów badawczych. Możesz pobrać wagi z Hugging Face
