文章《Abliteration,Explained》的主視覺卡片,將拒絕移除描繪為一種無需訓練的權重層級編輯。
Guides & Insights

Abliteration,詳解:如何在無需任何訓練的情況下實現拒絕移除

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Abliteration透過權重編輯移除 LLM 的拒絕行為——即「我無法協助處理此事」的反射反應——而且不需要訓練流程。其運作原理在於,拒絕行為是由模型殘差流(residual stream)中的單一方向所調節:找出該方向,將其從寫入殘差流的矩陣中減去,模型便會在保留既有能力的同時停止拒絕。最乾淨的公開範例是 Qwen3.8 27B Uncensored (Aggressive),其模型卡片顯示,有害提示的拒絕率在 AdvBench 上從 99.0% 驟降至 0.0%,而 MMLU 分數實際上還上升了十分之一個百分點。本文說明此機制的運作方式、量測數字的意涵,以及界線所在。

這不是微調、不是 RLHF,也不是越獄提示詞。Abliteration 是一項將可解釋性研究成果化為線性代數的技術:2024 年一篇論文指出,內部表徵中的某一個方向控制著某種安全訓練耗費極大心力才建立的行為,而你可以直接編輯權重來關閉它。由於這種編輯本質上是投影運算,因此成本低廉、可在單張 GPU 上重現,還會留下一個正常且可分享的檢查點——這正是為什麼開放模型中經 abliteration 處理的版本(包括 Qwen3.8-27B 系列)已成為產出「無審查」研究檢查點的標準做法。

拒絕方向:數千維流中的一個向量

在 Transformer 中,每個 token 都會經過一個 殘差流——這是各層讀取和寫入的持續表徵。每一層的注意力區塊和 MLP 區塊都以該流作為輸入,並將其輸出加回流中。該流實際上就是模型的運作記憶體:每個 token 位置對應一個向量,其維度等於模型的寬度。

這一切的起點是 2024 年的一篇論文——Andy Arditi 及同事,"Refusal in Language Models Is Mediated by a Single Direction"(arXiv:2406.11717,NeurIPS 2024)——衡量了聊天模型在即將拒絕與服從時,這些流向量看起來是什麼樣子。橫跨從 1.8B 到 72B 參數的 13 個開放權重聊天模型,答案驚人地一致:差異基本上只是一個方向。在最終 token 處,當模型拒絕時,殘差流沿著單一拒絕方向有較大的分量;而當模型服從時,幾乎沒有分量。這種幾何結構在不同的危害類別之間是一致的,因此投影集中在第一個奇異向量上,而不是分散在整個子空間中。

要找到那個方向,你會在兩組提示(有害與無害)上收集激活值,並對每組的最後一個 token 的殘差取平均。拒絕方向大約是 mean(harmful) − mean(harmless),正規化為單位長度。原始論文以線性探測(linear probing)來表述此方法;像 Qwen3.8-27B-Uncensored-FP8 這樣的生產版本則將單一方向(k=1)估計為以大規模激活遮蔽的有害與無害最後一個 token 殘差的平均差。除了有害/無害的區分之外,沒有標籤、沒有梯度、也沒有訓練。

編輯內容:從每個寫入串流的矩陣中減去方向。

一旦你有了拒答方向 r——即殘差流中的一個單位向量——這個干預就是一個秩-1 投影。任何其輸出被加到殘差流中的權重矩陣,都可以將 r 從中「清理」掉:

W' = W − r(rᵀW)

換言之:計算每個矩陣輸出中沿著 r 的分量,並將其移除。負責寫入串流的矩陣是輸出投影——注意力輸出投影(o_proj)、MLP 下投影(down_proj),以及 token 嵌入的行空間。此編輯以 float32 執行,在單張 GPU 上只需數分鐘,且除了你已收集的激活配對外,不需要優化器,也不需要其他訓練資料。

有兩種方式可以移除方向,而且值得將它們分開討論:

• 激活消融 — 攔截前向傳播,並從實際激活值中減去 r 分量。可逆,不觸動任何權重;非常適合在同一檢查點上比較拒絕與順從行為的實驗。

• 權重正交化——將投影應用於權重本身,產生一個永久且可共享的檢查點。這就是「abliteration」所指的意思,也是未審查模型儲存庫中所發布的內容。

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

正交化是刻意直白的做法。它只從權重中移除拒絕成分,僅此而已。它無法增加知識、改善推理,或讓模型變得更真實——這就是為何經過去拒絕化(abliteration)處理的模型表現得如同其基礎模型,只是少了拒絕反射。

131 個矩陣在真實構建中看起來是什麼樣子:Qwen3.8-27B-Uncensored-FP8

具體來說:Qwen3.8-27B-Uncensored-FP8(Hugging Face,發布於 2026-08-15,Apache 2.0)是 Qwen3.8-27B 的 abliterated 版本。Qwen3.8-27B 是混合注意力模型——16 個全注意力層加上 48 個 Gated DeltaNet 線性層,共 64 層,並配備多 token 預測(MTP)頭。該版本已將拒絕方向從131 個殘差寫入矩陣:

• self_attn.o_proj — 17 個矩陣(16 個完整注意力層 + MTP)

• linear_attn.out_proj — 48 個矩陣(Gated DeltaNet 層)

• mlp.down_proj — 65 個矩陣(64 層 + MTP)

• embed_tokens (行空間) — 1 個矩陣

拒絕方向估計在第38層——即 round(0.6 × 64),也就是該方向最集中的那一層——編輯後的最大殘餘洩漏為 1.8e-2。視覺塔維持原樣未動,MTP 頭部則與主體一致地進行了 abliteration 處理,因此推測性解碼不會在下游重新引入拒絕行為。該編輯以 float32 計算,接著使用與官方 Qwen3.8-27B-FP8 checkpoint 相同的方案重新量化為 block-FP8;建置報告顯示 FP8 碼與官方 checkpoint 有 99.9% 相同,這正是確認重新量化並未擾亂該編輯的依據。

實測:拒絕機制崩潰,能力維持

以下所有数字均来自 Qwen3.8-27B-Uncensored-FP8 的模型卡,该卡发布于 2026-08-15,并使用 vLLM 进行评估。这些数字由供应商报告——并非独立复现——它们是公开可用的、关于 abliteration 编辑前后对比的最完整数据。

有害提示詞基準測試中的拒絕率,關閉思考(拒絕率;數值越低表示越少審查):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150):97.3% → 2.0%

• HarmBench 標準 (n=150):98.7% → 2.7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench 有害 (n=100): 94.0% → 0.0%

• SimpleSafetyTests(n=50):64.0% → 6.0%

在整個套件中,有害提示的拒答率從基準模型的 64–99% 降至編輯後的 0–6%。在啟用思考功能(enable_thinking=true)時,剩餘的拒答率甚至更低——各處皆 ≤1.7%,且多數基準測試正好為 0%。這種不對稱性頗具啟發性:拒答方向主要存在於快速、非思考的路徑中,因此一旦將其從輸出層移除,推理軌跡就幾乎沒有什麼會誤觸發拒答了。

過度拒絕——基礎模型錯誤拒絕良性提示詞的現象——也有所下降:XSTest-safe(n=250)從5.6% 降至 0.4%。移除該方向不僅能阻止有害的拒絕,還能阻止模型拒絕那些只是看起來有風險的無害請求。這個數字無聲地論證了:基礎模型「安全性」的某一部分,其實是誤報稅。

能力,全部在基準值的±1.3個百分點以內:

• MMLU(0-shot 字母):84.3% → 84.7%(+0.4)

• GSM8K (CoT):90.0% → 88.7%(−1.3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU(0-shot):81.4% → 80.8%(−0.6)

WikiText-2 困惑度為 6.96。換言之,這項編輯是外科手術式地精準鎖定:它移除了疊加在知識之上的行為,而使知識本身——至少以這些評估來衡量——基本上保持完好無損。

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

誠實的告誡

標題數字不會告訴你的三件事。首先,abliteration並非一個乾淨俐落的開關。在有害提示詞中,約有30–50%的回應仍會在開頭附上一句簡短的安全免責聲明——模型確實照做了,但一句警示語以訓練痕跡的形式殘留下來。單向編輯無法抹去訓練時行為的每一絲痕跡。

第二,拒絕被冗餘編碼。其中一個方向能移除大部分冗餘,但有些類別比其他類別嵌入得更深,過度激進地消融可能會讓模型陷入胡言亂語——過度消融(over-abliteration)是真實的失敗模式,而非理論上的。你正在轉動一個旋鈕,而這個旋鈕是有下限的。

第三,能力成本取決於方向與層級。這次建置落在 ±1.3 點以內,是因為方向在正確的層級被估算,且投影被一致地套用。若把估算移到錯誤的層級,或加大投影力度,同一種方法就會明顯削弱推理能力。這個結果並非由方法所保證——而是由建置本身贏來的。

當 abliteration 是錯誤的工具時

如果你想要一個合規的助手,請不要進行 abliterate——你應該使用對齊後的基礎檢查點,而非移除了拒絕機制的建置版本。如果你想評估一個移除了拒絕機制的 Qwen3.8-27B,又不想下載 30GB 的權重,這個系列已託管於 OrcaRouter 上提供服務(obsidian/Qwen3.8-27B,每 100 萬 token 輸入 $0.40 / 輸出 $4.21,262K 上下文,2026-08-15 上架),其中完全解鎖的變體設有存取門控,僅供安全研究人員和紅隊成員使用。

如果你想要選擇性拒絕——拒絕武器、回答其他一切——LoRA 或 DPO 微調,或是系統提示詞的護欄,能為你提供一個控制面。Abliteration 是種粗糙的全局編輯;它無法精細地劃分出單一類別。

如果你想進行可逆的實驗,請先從推論階段的激活消除(activation ablation)開始,而不是直接編輯權重。你可以在同一個檢查點上比較拒絕與順從的行為,然後只有在行為符合你的預期時,才進一步進行權重編輯。

安全界限 — 使用前請先閱讀

一個 abliterated 模型沒有內建的防護機制。對於已對齊的模型,拒絕機制就是防護機制;移除它之後,原始權重會回答基礎模型知道如何回答的一切。這個投影不會增加任何安全性,後續也沒有任何環節會攔截輸出。

正當的用途在於研究:可解釋性(研究拒答行為在權重中的位置,以及該方向還控制哪些其他行為)、紅隊測試與防護機制評估(用一個不會自我審查的模型來測試你自己的安全層),以及過度安全衡量(5.6% → 0.4% 的 XSTest 降幅,量化了對齊模型拒絕良性輸入的頻率)。在所有情況下,模型都是研究的對象,而非交付物。

邊界並非裝飾:

• 僅供研究使用 — 非用於生產、終端使用者產品或內部工具。

• 無護欄 — 輸出不會被過濾;您需自行承擔這些輸出及其後果。

• 授權條款並非安全認證 — Apache 2.0 允許使用,但並不為其背書。

Hugging Face 上的這兩個儲存庫——Qwen3.8-27B-Uncensored-FP8 和 GGUF 重新封裝版 Qwen3.8-27B-Uncensored-GGUF(發布於 2026-08-16)——均設有存取門禁:你必須在開始下載前確認其僅限研究用途的界線。

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

底線

Abliteration 是 LLM 可解釋性中最乾淨俐落的成果之一:{{1}}殘差流中的單一線性方向調控了安全訓練耗費大量算力所安裝的行為,而秩一權重投影無需訓練即可將其移除{{/1}}。實測案例——Qwen3.8-27B-Uncensored-FP8——顯示此修改具有手術級的精準度:{{2}}拒答率從 64–99% 降至 0–6%,過度拒答降至原本的一小部分(5.6% → 0.4%),能力維持在 ±1.3 個百分點以內{{/2}}。它也正好說明了為何這是研究工具而非產品:沒有安全護欄、殘留的免責聲明,以及一條將責任放在你身上的界線。用它來理解拒答、測試你的安全護欄,並衡量過度安全——而非將其放在使用者面前。

Qwen3.8-27B-Uncensored-FP8 是依據 Apache 2.0 授權的研究產物——設有存取限制,並非此處提供的託管服務。前往 Hugging Face 下載權重