Karta hero artykułu zatytułowanego Abliteration, Explained, przedstawiająca usuwanie odmowy jako edycję na poziomie wag bez trenowania.
Guides & Insights

Abliteration — wyjaśnienie: jak działa usuwanie odmów bez żadnego treningu

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Abliterationusuwa zachowanie odmowy modelu LLM — odruch „nie mogę w tym pomóc" — poprzez edycję wag i bez przeprowadzania treningu. Działa to, ponieważ za odmowę odpowiada pojedynczy kierunek w strumieniu rezydualnym modelu: znajdź ten kierunek, odejmij go od macierzy zapisujących do strumienia, a model przestanie odmawiać, zachowując swoje możliwości. Najczystszym publicznie dostępnym przykładem jestQwen3.8 27B Uncensored (Aggressive), którego karta modelu pokazuje, że odsetek odmów odpowiedzi na szkodliwe prompty spada z 99,0% do 0,0% w AdvBench, podczas gdy wynik MMLU faktycznie wzrasta o jedną dziesiątą punktu. Oto jak działa ten mechanizm, co mówią zmierzone liczby i gdzie przebiega granica.

To nie jest fine-tuning, nie RLHF i nie prompt jailbreakowy. Abliteracja to wynik badań nad interpretowalnością zamieniony w algebrę liniową: artykuł z 2024 roku pokazał, że jeden kierunek w reprezentacji wewnętrznej kontroluje zachowanie, którego wdrożenie kosztowało trening bezpieczeństwa ogromny wysiłek, i że można je wyłączyć, bezpośrednio edytując wagi. Ponieważ edycja ta jest projekcją, jest tania, daje się powtórzyć na pojedynczym GPU i pozostawia normalny, łatwy do udostępnienia checkpoint — dlatego abliterowane wersje otwartych modeli, w tym rodzina Qwen3.8-27B, stały się standardowym sposobem tworzenia „nieocenzurowanych" checkpointów badawczych.

Kierunek odmowy: jeden wektor w strumieniu o wielu tysiącach wymiarów

W transformatorze każdy token przechodzi przez strumień rezydualny — bieżącą reprezentację, z której warstwy czytają i do której zapisują. Bloki uwagi i MLP każdej warstwy przyjmują ten strumień jako dane wejściowe i dodają do niego swoje wyjście. Strumień jest w istocie pamięcią roboczą modelu: jeden wektor na każdą pozycję tokena, o wymiarze równym szerokości modelu.

Artykuł z 2024 roku, który to wszystko zapoczątkował — Andy Arditi i współpracownicy, "Refusal in Language Models Is Mediated by a Single Direction" (arXiv:2406.11717, NeurIPS 2024) — mierzył, jak wyglądają te wektory strumienia, gdy model czatu ma odmówić, a jak, gdy ma się zgodzić. Dla 13 modeli czatu o otwartych wagach od 1,8B do 72B parametrów odpowiedź była uderzająco spójna: różnica to w zasadzie jeden kierunek. Przy końcowym tokenie strumień rezydualny ma dużą składową wzdłuż pojedynczego kierunku odmowy, gdy model odmawia, i prawie żadną, gdy się zgadza. Geometria jest spójna w różnych kategoriach szkodliwości, dlatego projekcja koncentruje się na pierwszym wektorze osobliwym, a nie rozprasza się po całej podprzestrzeni.

Aby znaleźć ten kierunek, zbiera się aktywacje na dwóch zestawach promptów — szkodliwych i nieszkodliwych — i oblicza średnią residuali ostatniego tokenu dla każdego zestawu. Kierunek odmowy jest w przybliżeniu mean(harmful) − mean(harmless), znormalizowany do długości jednostkowej. W oryginalnej pracy ujęto to za pomocą liniowego sondowania (linear probing); produkcyjne wersje, takie jak Qwen3.8-27B-Uncensored-FP8, szacują pojedynczy kierunek (k=1) jako średnią różnicę residuali ostatniego tokenu promptów szkodliwych i nieszkodliwych, maskowaną przez masywne aktywacje. Żadnych etykiet poza podziałem na szkodliwe/nieszkodliwe, żadnego gradientu, żadnego trenowania.

Edycja: odejmij kierunek od każdej macierzy, która zapisuje do strumienia.

Gdy już masz kierunek odmowy r — wektor jednostkowy w strumieniu rezydualnym — interwencja jest rzutem rzędu 1. Każda macierz wag, której wyjście jest dodawane do strumienia rezydualnego, może zostać „oczyszczona" z r:

W' = W − r(rᵀW)

Innymi słowy: oblicz składową wyjściową każdej macierzy, która wskazuje wzdłuż r, i usuń ją. Macierze, które zapisują do strumienia, to projekcje wyjściowe — projekcja wyjściowa uwagi (o_proj), projekcja w dół MLP (down_proj) oraz przestrzeń wierszy osadzania tokenów. Edycja działa w float32, zajmuje kilka minut na jednym GPU i nie wymaga optymalizatora ani danych treningowych poza parami aktywacji, które już zebrałeś.

Są dwa sposoby usunięcia kierunku i warto je trzymać osobno:

• Ablacja aktywacji — podpiąć się do forward pass i odjąć składową r od bieżących aktywacji. Odwracalna, bez dotykania wag; idealna do eksperymentów porównujących odmowę i zgodność na tym samym checkpointcie.

• Ortogonalizacja wag — zastosowanie projekcji do samych wag, co daje trwały, możliwy do udostępnienia checkpoint. To właśnie określa się mianem „abliteracji” i to trafia do nieocenzurowanych repozytoriów modeli.

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

Ortogonalizacja jest celowo bezceremonialna. Usuwa komponent odmowy z wag i nic więcej. Nie może dodać wiedzy, poprawić rozumowania ani uczynić modelu bardziej zgodnym z prawdą — dlatego model po abliteracji zachowuje się jak jego baza, minus odruch odmowy.

Jak wygląda 131 macierzy na prawdziwym buildzie: Qwen3.8-27B-Uncensored-FP8

Aby to ująć konkretnie: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, opublikowany 2026-08-15, Apache 2.0) to zabliterowana wersja modelu Qwen3.8-27B. Qwen3.8-27B to model z hybrydową uwagą — 16 pełnych warstw uwagi plus 48 liniowych warstw Gated DeltaNet, łącznie 64 warstwy, plus głowica przewidywania wielu tokenów (MTP). Kompilacja zortogonalizowała kierunek odmowy z 131 macierzy zapisu rezydualnego:

• self_attn.o_proj — 17 macierzy (16 warstw pełnej uwagi + MTP)

linear_attn.out_proj — 48 macierzy (warstwy Gated DeltaNet)

• mlp.down_proj — 65 macierzy (64 warstwy + MTP)

• embed_tokens (przestrzeń wierszy) — 1 macierz

Kierunek odmowy oszacowano w warstwie 38 — round(0.6 × 64), czyli warstwie, w której kierunek jest najbardziej skoncentrowany — a maksymalny przeciek resztkowy po edycji wyniósł 1.8e-2. Wieżę wizyjną pozostawiono nietkniętą, a głowicę MTP poddano abliteracji spójnie z korpusem modelu, aby dekodowanie spekulatywne nie przywracało odmów na dalszych etapach generacji. Edycję obliczono w float32, a następnie ponownie skwantowano do block-FP8, używając tego samego schematu co oficjalny checkpoint Qwen3.8-27B-FP8; build raportuje 99.9% identycznych kodów FP8 względem oficjalnego checkpointu, dzięki czemu wiadomo, że rekwantyzacja nie zaburzyła edycji.

Zmierzono: odmowa załamuje się, możliwości się utrzymują.

Wszystkie liczby poniżej pochodzą z karty modelu Qwen3.8-27B-Uncensored-FP8, opublikowanej 2026-08-15 i ocenionej za pomocą vLLM. Są one raportowane przez dostawcę — nie zostały niezależnie odtworzone — i stanowią najbardziej kompletne publiczne porównanie przed/po edycji abliteracyjnej, jakie jest dostępne.

Odmowa na benchmarkach szkodliwych promptów, myślenie wyłączone (wskaźnik odmowy; niższy oznacza bardziej nieocenzurowany):

• AdvBench (n=100): 99,0% → 0,0%

• StrongREJECT (n=150): 97,3% → 2,0%

• HarmBench standard (n=150): 98,7% → 2,7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench szkodliwe (n=100): 94,0% → 0,0%

• SimpleSafetyTests (n=50): 64.0% → 6.0%

W całym zestawie odsetek odmów na szkodliwe prompty spada z 64–99% w modelu bazowym do 0–6% po edycji. Przy włączonym myśleniu (enable_thinking=true) pozostały odsetek odmów jest jeszcze niższy — ≤1.7% wszędzie, przy czym większość benchmarków osiąga dokładnie 0%. Ta asymetria jest pouczająca: kierunek odmowy znajduje się głównie w szybkiej ścieżce bez myślenia, więc gdy zostanie usunięty z głowy wyjściowej, pozostaje niewiele, o co ślad rozumowania mógłby się potknąć.

Nadmierna odmowa — nieszkodliwe prompty, które bazowy model błędnie odrzuca — również spada: XSTest-safe (n=250) przechodzi z 5,6% do 0,4%. Usunięcie kierunku nie tylko powstrzymuje szkodliwe odmowy; powstrzymuje model przed odrzucaniem nieszkodliwych próśb, które jedynie wyglądały na ryzykowne. Ta liczba to subtelny argument, że pewna część „bezpieczeństwa” bazowego modelu jest podatkiem od fałszywych alarmów.

Możliwości, wszystkie w granicach ±1,3 punktu od wartości bazowej:

• MMLU (0-shot, litera): 84,3% → 84,7% (+0,4)

• GSM8K (CoT): 90.0% → 88.7% (−1.3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU (0-shot): 81.4% → 80.8% (−0.6)

Perplexity WikiText-2 wynosi 6,96. Innymi słowy, edycja jest chirurgicznie celowana: usuwa zachowanie, które zostało zainstalowane na wiedzy, i pozostawia wiedzę — mierzoną przynajmniej na tych ewaluacjach — zasadniczo nietkniętą.

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

Uczciwe zastrzeżenia

Trzy rzeczy, o których nie mówią ci liczby w nagłówku. Po pierwsze, abliteracja nie jest prostym przełącznikiem włącz/wyłącz. Około 30–50% odpowiedzi na szkodliwe prompty nadal zaczyna się od krótkiego zastrzeżenia o bezpieczeństwie — model wykonuje polecenie, ale zdanie z zastrzeżeniem pozostaje jako artefakt treningowy. Jednokierunkowa edycja nie usuwa wszystkich śladów zachowania z czasu treningu.

Po drugie, odmowa jest nadmiarowo zakodowana. Jeden kierunek usuwa większość tego, ale niektóre kategorie są głębiej osadzone niż inne, a zbyt agresywna ablacja może wpędzić model w bełkot — nadmierna abliteracja to realny tryb awarii, a nie teoretyczny. Kręcisz pokrętłem, a to pokrętło ma dno.

Po trzecie, koszt zdolności jest zależny od kierunku i warstwy. Ta wersja osiągnęła wynik w granicach ±1,3 punktu, ponieważ kierunek oszacowano na właściwej warstwie, a projekcję zastosowano konsekwentnie. Przenieś oszacowanie na niewłaściwą warstwę lub wzmocnij projekcję, a ta sama metoda może wymiernie osłabić rozumowanie. Wynik nie jest gwarantowany przez metodę — jest wypracowany przez tę wersję.

Kiedy abliteracja jest niewłaściwym narzędziem

Jeśli chcesz mieć zgodnego asystenta, nie stosuj abliteracji — potrzebujesz dopasowanego bazowego checkpointu, a nie wersji z usuniętą odmową. Jeśli chcesz przetestować model Qwen3.8-27B z usuniętą odmową bez pobierania 30 GB wag, rodzina modeli jest dostępna na OrcaRouter (obsidian/Qwen3.8-27B, $0,40 wejście / $4,21 wyjście za 1M tokenów, kontekst 262K, opublikowany 2026-08-15), a w pełni odblokowany wariant jest dostępny wyłącznie dla badaczy bezpieczeństwa i zespołów red team.

Jeśli chcesz selektywnej odmowy — odmawiać w kwestii broni, odpowiadać na wszystko inne — fine-tuning LoRA lub DPO albo zabezpieczenie w postaci promptu systemowego daje ci płaszczyznę kontroli. Abliteracja to toporna, globalna edycja; nie potrafi wyodrębnić jednej kategorii.

Jeśli chcesz eksperymentować w sposób odwracalny, zacznij od ablacji aktywacji podczas wnioskowania, zamiast edytować wagi. Możesz porównać odmowę i zgodność na tym samym checkpoincie, a następnie zdecydować się na edycję wag tylko wtedy, gdy zachowanie jest takie, jakiego oczekujesz.

Granica bezpieczeństwa — przeczytaj to przed użyciem

Model abliterowany nie ma wbudowanych zabezpieczeń. W przypadku modelu dostrojonego mechanizm odmowy jest zabezpieczeniem; jego usunięcie sprawia, że surowe wagi odpowiadają na wszystko, na co potrafi odpowiedzieć model bazowy. Nic w projekcji nie dodaje bezpieczeństwa i nic dalej nie przechwytuje wyniku.

Uzasadnione zastosowania to te badawcze: interpretowalność (badanie, gdzie w wagach mieszka odmowa i co jeszcze kontroluje ten kierunek), red-teaming i ocena zabezpieczeń (testowanie własnych warstw bezpieczeństwa przeciwko modelowi, który nie będzie się sam cenzurował), oraz pomiar nadmiernej bezpieczności (spadek XSTest z 5,6% do 0,4% mierzy, jak często dopasowane modele odmawiają odpowiedzi na nieszkodliwe dane wejściowe). W każdym przypadku model jest przedmiotem badania, a nie produktem.

Granica nie jest dekoracyjna:

• Wyłącznie do badań — nie do produkcji, produktów dla użytkowników końcowych ani narzędzi wewnętrznych.

• Brak ograniczeń — wyniki nie są filtrowane; ponosisz odpowiedzialność za nie i ich konsekwencje.

• Licencja nie jest certyfikatem bezpieczeństwa — Apache 2.0 zezwala na użycie; nie błogosławi go.

Oba repozytoria Hugging Face — Qwen3.8-27B-Uncensored-FP8 i przepakowana wersja GGUF Qwen3.8-27B-Uncensored-GGUF (opublikowana 2026-08-16) — są objęte kontrolą dostępu: potwierdzasz ograniczenie badawcze przed rozpoczęciem pobierania.

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

Konkluzja

Abliteracja to jeden z najczystszych wyników w interpretowalności modeli LLM: pojedynczy liniowy kierunek w strumieniu rezydualnym pośredniczy w zachowaniu, które trening bezpieczeństwa instalował przy ogromnych nakładach obliczeniowych, a projekcja wag rangi 1 może je usunąć bez przeprowadzania treningu. Zbadany przypadek — Qwen3.8-27B-Uncensored-FP8 — pokazuje, że edycja jest chirurgiczna: odmowa spada z 64–99% do 0–6%, nadmierna odmowa spada do ułamka samej siebie (5,6% → 0,4%), a zdolności utrzymują się w granicach ±1,3 punktu. Pokazuje też dokładnie, dlaczego jest to narzędzie badawcze, a nie produkt: brak zabezpieczeń, szczątkowe zastrzeżenia i granica, która nakłada odpowiedzialność na ciebie. Używaj go, aby zrozumieć odmowę, testować swoje zabezpieczenia i mierzyć nadmierną ostrożność — a nie po to, by udostępniać go użytkownikom.

Qwen3.8-27B-Uncensored-FP8 to artefakt badawczy na licencji Apache 2.0 — z ograniczonym dostępem, a nie świadczona tutaj usługa hostingowa. Pobierz wagi na Hugging Face