
Abliteration — wyjaśnienie: jak działa usuwanie odmów bez żadnego treningu
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 1009 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Abliterationusuwa zachowanie odmowy modelu LLM — odruch „nie mogę w tym pomóc" — poprzez edycję wag i bez przeprowadzania treningu. Działa to, ponieważ za odmowę odpowiada pojedynczy kierunek w strumieniu rezydualnym modelu: znajdź ten kierunek, odejmij go od macierzy zapisujących do strumienia, a model przestanie odmawiać, zachowując swoje możliwości. Najczystszym publicznie dostępnym przykładem jestQwen3.8 27B Uncensored (Aggressive), którego karta modelu pokazuje, że odsetek odmów odpowiedzi na szkodliwe prompty spada z 99,0% do 0,0% w AdvBench, podczas gdy wynik MMLU faktycznie wzrasta o jedną dziesiątą punktu. Oto jak działa ten mechanizm, co mówią zmierzone liczby i gdzie przebiega granica.
To nie jest fine-tuning, nie RLHF i nie prompt jailbreakowy. Abliteracja to wynik badań nad interpretowalnością zamieniony w algebrę liniową: artykuł z 2024 roku pokazał, że jeden kierunek w reprezentacji wewnętrznej kontroluje zachowanie, którego wdrożenie kosztowało trening bezpieczeństwa ogromny wysiłek, i że można je wyłączyć, bezpośrednio edytując wagi. Ponieważ edycja ta jest projekcją, jest tania, daje się powtórzyć na pojedynczym GPU i pozostawia normalny, łatwy do udostępnienia checkpoint — dlatego abliterowane wersje otwartych modeli, w tym rodzina Qwen3.8-27B, stały się standardowym sposobem tworzenia „nieocenzurowanych" checkpointów badawczych.
Kierunek odmowy: jeden wektor w strumieniu o wielu tysiącach wymiarów
W transformatorze każdy token przechodzi przez strumień rezydualny — bieżącą reprezentację, z której warstwy czytają i do której zapisują. Bloki uwagi i MLP każdej warstwy przyjmują ten strumień jako dane wejściowe i dodają do niego swoje wyjście. Strumień jest w istocie pamięcią roboczą modelu: jeden wektor na każdą pozycję tokena, o wymiarze równym szerokości modelu.
Artykuł z 2024 roku, który to wszystko zapoczątkował — Andy Arditi i współpracownicy, "Refusal in Language Models Is Mediated by a Single Direction" (arXiv:2406.11717, NeurIPS 2024) — mierzył, jak wyglądają te wektory strumienia, gdy model czatu ma odmówić, a jak, gdy ma się zgodzić. Dla 13 modeli czatu o otwartych wagach od 1,8B do 72B parametrów odpowiedź była uderzająco spójna: różnica to w zasadzie jeden kierunek. Przy końcowym tokenie strumień rezydualny ma dużą składową wzdłuż pojedynczego kierunku odmowy, gdy model odmawia, i prawie żadną, gdy się zgadza. Geometria jest spójna w różnych kategoriach szkodliwości, dlatego projekcja koncentruje się na pierwszym wektorze osobliwym, a nie rozprasza się po całej podprzestrzeni.
Aby znaleźć ten kierunek, zbiera się aktywacje na dwóch zestawach promptów — szkodliwych i nieszkodliwych — i oblicza średnią residuali ostatniego tokenu dla każdego zestawu. Kierunek odmowy jest w przybliżeniu mean(harmful) − mean(harmless), znormalizowany do długości jednostkowej. W oryginalnej pracy ujęto to za pomocą liniowego sondowania (linear probing); produkcyjne wersje, takie jak Qwen3.8-27B-Uncensored-FP8, szacują pojedynczy kierunek (k=1) jako średnią różnicę residuali ostatniego tokenu promptów szkodliwych i nieszkodliwych, maskowaną przez masywne aktywacje. Żadnych etykiet poza podziałem na szkodliwe/nieszkodliwe, żadnego gradientu, żadnego trenowania.
Edycja: odejmij kierunek od każdej macierzy, która zapisuje do strumienia.
Gdy już masz kierunek odmowy r — wektor jednostkowy w strumieniu rezydualnym — interwencja jest rzutem rzędu 1. Każda macierz wag, której wyjście jest dodawane do strumienia rezydualnego, może zostać „oczyszczona" z r:
W' = W − r(rᵀW)
Innymi słowy: oblicz składową wyjściową każdej macierzy, która wskazuje wzdłuż r, i usuń ją. Macierze, które zapisują do strumienia, to projekcje wyjściowe — projekcja wyjściowa uwagi (o_proj), projekcja w dół MLP (down_proj) oraz przestrzeń wierszy osadzania tokenów. Edycja działa w float32, zajmuje kilka minut na jednym GPU i nie wymaga optymalizatora ani danych treningowych poza parami aktywacji, które już zebrałeś.
Są dwa sposoby usunięcia kierunku i warto je trzymać osobno:
• Ablacja aktywacji — podpiąć się do forward pass i odjąć składową r od bieżących aktywacji. Odwracalna, bez dotykania wag; idealna do eksperymentów porównujących odmowę i zgodność na tym samym checkpointcie.
• Ortogonalizacja wag — zastosowanie projekcji do samych wag, co daje trwały, możliwy do udostępnienia checkpoint. To właśnie określa się mianem „abliteracji” i to trafia do nieocenzurowanych repozytoriów modeli.

Ortogonalizacja jest celowo bezceremonialna. Usuwa komponent odmowy z wag i nic więcej. Nie może dodać wiedzy, poprawić rozumowania ani uczynić modelu bardziej zgodnym z prawdą — dlatego model po abliteracji zachowuje się jak jego baza, minus odruch odmowy.
Jak wygląda 131 macierzy na prawdziwym buildzie: Qwen3.8-27B-Uncensored-FP8
Aby to ująć konkretnie: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, opublikowany 2026-08-15, Apache 2.0) to zabliterowana wersja modelu Qwen3.8-27B. Qwen3.8-27B to model z hybrydową uwagą — 16 pełnych warstw uwagi plus 48 liniowych warstw Gated DeltaNet, łącznie 64 warstwy, plus głowica przewidywania wielu tokenów (MTP). Kompilacja zortogonalizowała kierunek odmowy z 131 macierzy zapisu rezydualnego:
• self_attn.o_proj — 17 macierzy (16 warstw pełnej uwagi + MTP)
linear_attn.out_proj — 48 macierzy (warstwy Gated DeltaNet)
• mlp.down_proj — 65 macierzy (64 warstwy + MTP)
• embed_tokens (przestrzeń wierszy) — 1 macierz
Kierunek odmowy oszacowano w warstwie 38 — round(0.6 × 64), czyli warstwie, w której kierunek jest najbardziej skoncentrowany — a maksymalny przeciek resztkowy po edycji wyniósł 1.8e-2. Wieżę wizyjną pozostawiono nietkniętą, a głowicę MTP poddano abliteracji spójnie z korpusem modelu, aby dekodowanie spekulatywne nie przywracało odmów na dalszych etapach generacji. Edycję obliczono w float32, a następnie ponownie skwantowano do block-FP8, używając tego samego schematu co oficjalny checkpoint Qwen3.8-27B-FP8; build raportuje 99.9% identycznych kodów FP8 względem oficjalnego checkpointu, dzięki czemu wiadomo, że rekwantyzacja nie zaburzyła edycji.
Zmierzono: odmowa załamuje się, możliwości się utrzymują.
Wszystkie liczby poniżej pochodzą z karty modelu Qwen3.8-27B-Uncensored-FP8, opublikowanej 2026-08-15 i ocenionej za pomocą vLLM. Są one raportowane przez dostawcę — nie zostały niezależnie odtworzone — i stanowią najbardziej kompletne publiczne porównanie przed/po edycji abliteracyjnej, jakie jest dostępne.
Odmowa na benchmarkach szkodliwych promptów, myślenie wyłączone (wskaźnik odmowy; niższy oznacza bardziej nieocenzurowany):
• AdvBench (n=100): 99,0% → 0,0%
• StrongREJECT (n=150): 97,3% → 2,0%
• HarmBench standard (n=150): 98,7% → 2,7%
• MaliciousInstruct (n=100): 99.0% → 0.0%
• JailbreakBench szkodliwe (n=100): 94,0% → 0,0%
• SimpleSafetyTests (n=50): 64.0% → 6.0%
W całym zestawie odsetek odmów na szkodliwe prompty spada z 64–99% w modelu bazowym do 0–6% po edycji. Przy włączonym myśleniu (enable_thinking=true) pozostały odsetek odmów jest jeszcze niższy — ≤1.7% wszędzie, przy czym większość benchmarków osiąga dokładnie 0%. Ta asymetria jest pouczająca: kierunek odmowy znajduje się głównie w szybkiej ścieżce bez myślenia, więc gdy zostanie usunięty z głowy wyjściowej, pozostaje niewiele, o co ślad rozumowania mógłby się potknąć.
Nadmierna odmowa — nieszkodliwe prompty, które bazowy model błędnie odrzuca — również spada: XSTest-safe (n=250) przechodzi z 5,6% do 0,4%. Usunięcie kierunku nie tylko powstrzymuje szkodliwe odmowy; powstrzymuje model przed odrzucaniem nieszkodliwych próśb, które jedynie wyglądały na ryzykowne. Ta liczba to subtelny argument, że pewna część „bezpieczeństwa” bazowego modelu jest podatkiem od fałszywych alarmów.
Możliwości, wszystkie w granicach ±1,3 punktu od wartości bazowej:
• MMLU (0-shot, litera): 84,3% → 84,7% (+0,4)
• GSM8K (CoT): 90.0% → 88.7% (−1.3)
• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)
• CMMLU (0-shot): 81.4% → 80.8% (−0.6)
Perplexity WikiText-2 wynosi 6,96. Innymi słowy, edycja jest chirurgicznie celowana: usuwa zachowanie, które zostało zainstalowane na wiedzy, i pozostawia wiedzę — mierzoną przynajmniej na tych ewaluacjach — zasadniczo nietkniętą.

Uczciwe zastrzeżenia
Trzy rzeczy, o których nie mówią ci liczby w nagłówku. Po pierwsze, abliteracja nie jest prostym przełącznikiem włącz/wyłącz. Około 30–50% odpowiedzi na szkodliwe prompty nadal zaczyna się od krótkiego zastrzeżenia o bezpieczeństwie — model wykonuje polecenie, ale zdanie z zastrzeżeniem pozostaje jako artefakt treningowy. Jednokierunkowa edycja nie usuwa wszystkich śladów zachowania z czasu treningu.
Po drugie, odmowa jest nadmiarowo zakodowana. Jeden kierunek usuwa większość tego, ale niektóre kategorie są głębiej osadzone niż inne, a zbyt agresywna ablacja może wpędzić model w bełkot — nadmierna abliteracja to realny tryb awarii, a nie teoretyczny. Kręcisz pokrętłem, a to pokrętło ma dno.
Po trzecie, koszt zdolności jest zależny od kierunku i warstwy. Ta wersja osiągnęła wynik w granicach ±1,3 punktu, ponieważ kierunek oszacowano na właściwej warstwie, a projekcję zastosowano konsekwentnie. Przenieś oszacowanie na niewłaściwą warstwę lub wzmocnij projekcję, a ta sama metoda może wymiernie osłabić rozumowanie. Wynik nie jest gwarantowany przez metodę — jest wypracowany przez tę wersję.
Kiedy abliteracja jest niewłaściwym narzędziem
Jeśli chcesz mieć zgodnego asystenta, nie stosuj abliteracji — potrzebujesz dopasowanego bazowego checkpointu, a nie wersji z usuniętą odmową. Jeśli chcesz przetestować model Qwen3.8-27B z usuniętą odmową bez pobierania 30 GB wag, rodzina modeli jest dostępna na OrcaRouter (obsidian/Qwen3.8-27B, $0,40 wejście / $4,21 wyjście za 1M tokenów, kontekst 262K, opublikowany 2026-08-15), a w pełni odblokowany wariant jest dostępny wyłącznie dla badaczy bezpieczeństwa i zespołów red team.
Jeśli chcesz selektywnej odmowy — odmawiać w kwestii broni, odpowiadać na wszystko inne — fine-tuning LoRA lub DPO albo zabezpieczenie w postaci promptu systemowego daje ci płaszczyznę kontroli. Abliteracja to toporna, globalna edycja; nie potrafi wyodrębnić jednej kategorii.
Jeśli chcesz eksperymentować w sposób odwracalny, zacznij od ablacji aktywacji podczas wnioskowania, zamiast edytować wagi. Możesz porównać odmowę i zgodność na tym samym checkpoincie, a następnie zdecydować się na edycję wag tylko wtedy, gdy zachowanie jest takie, jakiego oczekujesz.
Granica bezpieczeństwa — przeczytaj to przed użyciem
Model abliterowany nie ma wbudowanych zabezpieczeń. W przypadku modelu dostrojonego mechanizm odmowy jest zabezpieczeniem; jego usunięcie sprawia, że surowe wagi odpowiadają na wszystko, na co potrafi odpowiedzieć model bazowy. Nic w projekcji nie dodaje bezpieczeństwa i nic dalej nie przechwytuje wyniku.
Uzasadnione zastosowania to te badawcze: interpretowalność (badanie, gdzie w wagach mieszka odmowa i co jeszcze kontroluje ten kierunek), red-teaming i ocena zabezpieczeń (testowanie własnych warstw bezpieczeństwa przeciwko modelowi, który nie będzie się sam cenzurował), oraz pomiar nadmiernej bezpieczności (spadek XSTest z 5,6% do 0,4% mierzy, jak często dopasowane modele odmawiają odpowiedzi na nieszkodliwe dane wejściowe). W każdym przypadku model jest przedmiotem badania, a nie produktem.
Granica nie jest dekoracyjna:
• Wyłącznie do badań — nie do produkcji, produktów dla użytkowników końcowych ani narzędzi wewnętrznych.
• Brak ograniczeń — wyniki nie są filtrowane; ponosisz odpowiedzialność za nie i ich konsekwencje.
• Licencja nie jest certyfikatem bezpieczeństwa — Apache 2.0 zezwala na użycie; nie błogosławi go.
Oba repozytoria Hugging Face — Qwen3.8-27B-Uncensored-FP8 i przepakowana wersja GGUF Qwen3.8-27B-Uncensored-GGUF (opublikowana 2026-08-16) — są objęte kontrolą dostępu: potwierdzasz ograniczenie badawcze przed rozpoczęciem pobierania.

Konkluzja
Abliteracja to jeden z najczystszych wyników w interpretowalności modeli LLM: pojedynczy liniowy kierunek w strumieniu rezydualnym pośredniczy w zachowaniu, które trening bezpieczeństwa instalował przy ogromnych nakładach obliczeniowych, a projekcja wag rangi 1 może je usunąć bez przeprowadzania treningu. Zbadany przypadek — Qwen3.8-27B-Uncensored-FP8 — pokazuje, że edycja jest chirurgiczna: odmowa spada z 64–99% do 0–6%, nadmierna odmowa spada do ułamka samej siebie (5,6% → 0,4%), a zdolności utrzymują się w granicach ±1,3 punktu. Pokazuje też dokładnie, dlaczego jest to narzędzie badawcze, a nie produkt: brak zabezpieczeń, szczątkowe zastrzeżenia i granica, która nakłada odpowiedzialność na ciebie. Używaj go, aby zrozumieć odmowę, testować swoje zabezpieczenia i mierzyć nadmierną ostrożność — a nie po to, by udostępniać go użytkownikom.
Qwen3.8-27B-Uncensored-FP8 to artefakt badawczy na licencji Apache 2.0 — z ograniczonym dostępem, a nie świadczona tutaj usługa hostingowa. Pobierz wagi na Hugging Face
