文章《Abliteration, Explained》的Hero卡片,展示了在不进行训练的情况下,以权重级编辑方式移除拒绝行为。
Guides & Insights

Abliteration 解析:如何无需任何训练即可消除拒绝

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Abliteration通过权重编辑消除LLM的拒绝行为——即“我无法帮你处理这个”的反射——无需训练运行。其原理在于,拒绝行为由模型残差流中的单一方向介导:找到该方向,将其从写入残差流的矩阵中减去,模型便会停止拒绝,同时保留自身能力。最简洁的公开示例是Qwen3.8 27B Uncensored (Aggressive),其模型卡显示,在AdvBench上,有害提示的拒绝率从99.0%骤降至0.0%,而MMLU实际还微升了0.1个百分点。这就是该机制的运作方式、测量数据所揭示的内容,以及界限所在。

这不是微调,不是 RLHF,也不是越狱提示词。Abliteration 是将可解释性结果转化为线性代数:2024 年的一篇论文表明,内部表示中的一个方向控制着安全训练耗费巨大精力才植入的行为,而你可以通过直接编辑权重将其关闭。因为这种编辑本质上是一个投影,所以它成本低廉、可在单张 GPU 上复现,并且会留下一个正常、可共享的 checkpoint——这就是为什么包括 Qwen3.8-27B 系列在内的开源模型的 abliterated 版本,已成为生成“无审查”研究 checkpoint 的标准方式。

拒绝方向:数千维流中的一个向量

在Transformer中,每个token都会经过一个残差流——各层读取并写入的运行表示。每一层的注意力模块和MLP模块以该流为输入,并将其输出加回该流。该流实际上是模型的工作记忆:每个token位置一个向量,维度等于模型的宽度。

开启这一切的2024年论文——Andy Arditi及其同事,《语言模型中的拒绝由单一方向介导》(arXiv:2406.11717,NeurIPS 2024)——测量了聊天模型在即将拒绝与顺从时那些流向量是什么样的。在13个参数量从1.8B到72B的开放权重聊天模型中,答案惊人地一致:差异本质上就是一个方向。在最终词元处,残差流在模型拒绝时沿单一拒绝方向有较大的分量,而在顺从时几乎没有。这种几何结构在不同危害类别间保持一致,这就是为什么投影集中在第一个奇异向量上,而不是散布在整个子空间中。

为了找到该方向,你收集两组提示——有害和无害——的激活值,并分别计算每组最后一个 token 的残差的均值。拒绝方向大约为 均值(有害) − 均值(无害),归一化为单位长度。原始论文用线性探测来表述这一做法;像 Qwen3.8-27B-Uncensored-FP8 这样的生产构建则通过大规模激活掩蔽的均值差,从有害和无害的最后 token 残差中估计单一方向(k=1)。除了有害/无害划分之外,无需标签,无需梯度,无需训练。

编辑:从每个写入流的矩阵中减去方向

一旦你有了拒绝方向 r——即残差流中的一个单位向量——这种干预就是一次秩一投影。每个输出被添加到残差流中的权重矩阵都可以被“清除”掉 r:

W' = W − r(rᵀW)

用语言描述:{{1}}计算每个矩阵输出中沿 r 方向的分量,并将其移除{{/1}}。写入该流的矩阵是输出投影——{{2}}注意力输出投影(o_proj)、MLP 下投影(down_proj)以及 token 嵌入的行空间{{/2}}。该编辑{{3}}在 float32 下运行,在一张 GPU 上只需几分钟,且不需要优化器,也不需要除你已收集的激活对之外的任何训练数据{{/3}}。

有两种方法可以移除方向,它们值得分开讨论:

• 激活消融 — 在前向传播中挂接钩子,并从实时激活中减去 r 分量。可逆,不触及任何权重;非常适合在同一检查点上比较拒绝与顺从的实验。

• 权重正交化——将投影应用于权重本身,产生一个永久、可共享的检查点。这就是“abliteration”所指的操作,也是未审查模型仓库中附带的内容。

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

正交化是有意为之的简单粗暴。它从权重中移除拒绝成分,仅此而已。它不能增加知识、改进推理,也不能让模型更加诚实——这就是为什么经过abliteration处理的模型表现得像其基础模型,只是少了拒绝反射。

在实际构建中,131矩阵看起来是什么样子:Qwen3.8-27B-Uncensored-FP8

具体来说:Qwen3.8-27B-Uncensored-FP8(Hugging Face,发布于 2026-08-15,Apache 2.0)是 Qwen3.8-27B 的 abliterated 版本。Qwen3.8-27B 是一种混合注意力模型——16 个全注意力层外加 48 个 Gated DeltaNet 线性层,共 64 层,以及一个多令牌预测(MTP)头。该构建通过正交化将拒绝方向从131 个残差写入矩阵中去除:

• self_attn.o_proj — 17个矩阵(16个全注意力层 + MTP)

• linear_attn.out_proj — 48个矩阵(Gated DeltaNet 层)

• mlp.down_proj — 65个矩阵(64层 + MTP)

• embed_tokens(行空间)— 1 矩阵

拒绝方向估计在第38层——即 round(0.6 × 64),该层方向最为集中——编辑后的最大残差泄漏为 1.8e-2。视觉塔保持未动,MTP 头与主体一致地进行了消融,从而投机解码不会在下游重新引入拒绝行为。该编辑以 float32 计算,随后使用与官方 Qwen3.8-27B-FP8 checkpoint 相同的方案重新量化为 block-FP8;构建报告称 FP8 编码与官方 checkpoint 有 99.9% 完全一致,由此即可确认重新量化并未打乱该编辑。

实测:拒绝机制崩溃,能力保持不变

以下所有数字均来自Qwen3.8-27B-Uncensored-FP8的模型卡,该模型卡发布于2026-08-15,并使用vLLM进行评估。这些数字由供应商报告,并非独立复现,它们是公开可用的关于abliteration编辑的最完整前后对比数据。

有害提示基准上的拒绝率,关闭思考(拒绝率;越低表示越不受审查):

• AdvBench (n=100):99.0% → 0.0%

• StrongREJECT (n=150): 97.3% → 2.0%

• HarmBench 标准 (n=150):98.7% → 2.7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench 有害 (n=100):94.0% → 0.0%

• SimpleSafetyTests (n=50): 64.0% → 6.0%

在整个基准测试套件中,有害提示词的拒答率从基线的64–99%降至编辑后的0–6%。启用思考(enable_thinking=true)后,剩余拒答率更低——所有地方均≤1.7%,多数基准测试恰好为0%。这种不对称性很有信息量:拒答方向主要存在于快速非思考路径中,因此一旦将其从输出头中移除,推理轨迹就几乎没有可触发拒答的内容了。

过度拒答——基础模型错误拒绝的无害提示——也有所下降:XSTest-safe(n=250)从5.6%降至0.4%。移除该方向不仅阻止了有害拒答,还阻止了模型拒绝那些仅仅看起来有风险的无害请求。这个数字无声地表明,基础模型的"安全性"中有一部分是误报警的代价。

能力,全部在基准的±1.3点范围内:

• MMLU(0-shot letter):84.3% → 84.7%(+0.4)

• GSM8K (CoT): 90.0% → 88.7% (−1.3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU (0-shot): 81.4% → 80.8% (−0.6)

WikiText-2 困惑度为 6.96。换言之,这次编辑具有外科手术般的精准性:它移除了叠加在知识之上的一种行为,而知识本身——至少在这些评测中——基本保持完好。

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

诚实的告诫

标题中的数字无法告诉你三件事。首先,abliteration 并非一个干净利落的开关。在有害提示词上,仍有 30–50% 的响应会前置一段简短的安全免责声明——模型确实遵从了指令,但一句警示语作为训练残留物保留了下来。单向编辑无法清除训练时行为的全部痕迹。

其次,拒绝行为被冗余编码。单一方向能移除大部分,但某些类别比其他类别嵌入得更深,过于激进地消融可能让模型陷入胡言乱语——过度消融是真实的失败模式,而非理论上的。你在转动一个旋钮,而这个旋钮有下限。

第三,能力代价因方向与层级而异。该构建的得分落在±1.3分以内,因为方向是在正确的层级上估算的,且投影被一致地应用。若把估算移到错误的层级,或加大投影力度,同一方法就会对推理能力造成明显损伤。这一结果并非由方法所保证,而是构建本身赢得的。

当 abliteration 不是合适的工具时

如果你想要一个合规的助手,不要进行abliterate——你应选择对齐的基础检查点,而不是移除拒绝的构建。如果你想在不下载30GB权重的情况下评估一个移除拒绝的Qwen3.8-27B,该系列模型托管在OrcaRouter上(obsidian/Qwen3.8-27B,输入$0.40/输出$4.21每100万token,262K上下文,2026-08-15上架),完全解锁的变体仅限安全研究人员和红队访问。

If you want selective refusal — refuse weapons, answer everything else — a LoRA or DPO fine-tune, or a system-prompt guardrail, gives you a control surface. Abliteration is a blunt, global edit; it cannot carve out one category.

如果你想进行可逆的实验,先从推理时的激活消融开始,而不是修改权重。你可以在同一个检查点上比较拒答与顺从行为,然后只有当行为符合你的预期时,才进行权重修改。

安全边界 — 使用前请阅读

一个abliterated模型没有内置护栏。对于对齐模型来说,拒绝机制就是护栏;移除它之后,原始权重就会回答基础模型知道如何回答的一切。投影过程本身不会增加任何安全性,下游也没有任何环节拦截输出。

合法的用途在于研究方面:可解释性(研究拒答行为在权重中的位置,以及该方向还控制着什么),红队测试与护栏评估(用不会自我审查的模型来检验自身的安全层),以及过度安全测量(5.6% → 0.4% 的 XSTest 下降量化了对齐模型拒绝良性输入的频率)。在所有情况下,模型都是研究的对象,而非交付成果。

边界不是装饰性的:

• 仅限研究 — 不用于生产、终端用户产品或内部工具。

• 无护栏 — 输出不会被过滤;您对输出及其后果负责。

• 许可证不是安全证书 — Apache 2.0 允许使用,但并不为其安全性背书。

Hugging Face 上的两个仓库——Qwen3.8-27B-Uncensored-FP8 和 GGUF 重新打包版 Qwen3.8-27B-Uncensored-GGUF(发布于 2026-08-16)——都设有门禁:下载开始前,你需要确认仅限研究用途的边界。

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

最重要的一点

Abliteration 是大语言模型可解释性中最干净的结果之一:残差流中一个单一的线性方向介导了一种行为,安全训练为此耗费了巨大的算力,而一个秩为1的权重投影就能在无需训练的情况下将其移除。实测案例——Qwen3.8-27B-Uncensored-FP8——表明这一修改是精准的外科手术:拒答率从64–99%骤降至0–6%,过度拒答降至其自身的一小部分(5.6%→0.4%),能力表现保持在±1.3个百分点以内。它也恰恰说明了为什么这是研究工具而非产品:没有护栏、残留的免责声明,以及一条将责任归于你的边界。用它来理解拒答、测试你的护栏、衡量过度安全——而不是把它摆在用户面前。

Qwen3.8-27B-Uncensored-FP8 是 Apache 2.0 许可下的研究产物——需申请访问,而非此处托管的服务。在 Hugging Face 上下载权重