
Abliteration 解析:如何无需任何训练即可消除拒绝
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 1009 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
Abliteration通过权重编辑消除LLM的拒绝行为——即“我无法帮你处理这个”的反射——无需训练运行。其原理在于,拒绝行为由模型残差流中的单一方向介导:找到该方向,将其从写入残差流的矩阵中减去,模型便会停止拒绝,同时保留自身能力。最简洁的公开示例是Qwen3.8 27B Uncensored (Aggressive),其模型卡显示,在AdvBench上,有害提示的拒绝率从99.0%骤降至0.0%,而MMLU实际还微升了0.1个百分点。这就是该机制的运作方式、测量数据所揭示的内容,以及界限所在。
这不是微调,不是 RLHF,也不是越狱提示词。Abliteration 是将可解释性结果转化为线性代数:2024 年的一篇论文表明,内部表示中的一个方向控制着安全训练耗费巨大精力才植入的行为,而你可以通过直接编辑权重将其关闭。因为这种编辑本质上是一个投影,所以它成本低廉、可在单张 GPU 上复现,并且会留下一个正常、可共享的 checkpoint——这就是为什么包括 Qwen3.8-27B 系列在内的开源模型的 abliterated 版本,已成为生成“无审查”研究 checkpoint 的标准方式。
拒绝方向:数千维流中的一个向量
在Transformer中,每个token都会经过一个残差流——各层读取并写入的运行表示。每一层的注意力模块和MLP模块以该流为输入,并将其输出加回该流。该流实际上是模型的工作记忆:每个token位置一个向量,维度等于模型的宽度。
开启这一切的2024年论文——Andy Arditi及其同事,《语言模型中的拒绝由单一方向介导》(arXiv:2406.11717,NeurIPS 2024)——测量了聊天模型在即将拒绝与顺从时那些流向量是什么样的。在13个参数量从1.8B到72B的开放权重聊天模型中,答案惊人地一致:差异本质上就是一个方向。在最终词元处,残差流在模型拒绝时沿单一拒绝方向有较大的分量,而在顺从时几乎没有。这种几何结构在不同危害类别间保持一致,这就是为什么投影集中在第一个奇异向量上,而不是散布在整个子空间中。
为了找到该方向,你收集两组提示——有害和无害——的激活值,并分别计算每组最后一个 token 的残差的均值。拒绝方向大约为 均值(有害) − 均值(无害),归一化为单位长度。原始论文用线性探测来表述这一做法;像 Qwen3.8-27B-Uncensored-FP8 这样的生产构建则通过大规模激活掩蔽的均值差,从有害和无害的最后 token 残差中估计单一方向(k=1)。除了有害/无害划分之外,无需标签,无需梯度,无需训练。
编辑:从每个写入流的矩阵中减去方向
一旦你有了拒绝方向 r——即残差流中的一个单位向量——这种干预就是一次秩一投影。每个输出被添加到残差流中的权重矩阵都可以被“清除”掉 r:
W' = W − r(rᵀW)
用语言描述:{{1}}计算每个矩阵输出中沿 r 方向的分量,并将其移除{{/1}}。写入该流的矩阵是输出投影——{{2}}注意力输出投影(o_proj)、MLP 下投影(down_proj)以及 token 嵌入的行空间{{/2}}。该编辑{{3}}在 float32 下运行,在一张 GPU 上只需几分钟,且不需要优化器,也不需要除你已收集的激活对之外的任何训练数据{{/3}}。
有两种方法可以移除方向,它们值得分开讨论:
• 激活消融 — 在前向传播中挂接钩子,并从实时激活中减去 r 分量。可逆,不触及任何权重;非常适合在同一检查点上比较拒绝与顺从的实验。
• 权重正交化——将投影应用于权重本身,产生一个永久、可共享的检查点。这就是“abliteration”所指的操作,也是未审查模型仓库中附带的内容。

正交化是有意为之的简单粗暴。它从权重中移除拒绝成分,仅此而已。它不能增加知识、改进推理,也不能让模型更加诚实——这就是为什么经过abliteration处理的模型表现得像其基础模型,只是少了拒绝反射。
在实际构建中,131矩阵看起来是什么样子:Qwen3.8-27B-Uncensored-FP8
具体来说:Qwen3.8-27B-Uncensored-FP8(Hugging Face,发布于 2026-08-15,Apache 2.0)是 Qwen3.8-27B 的 abliterated 版本。Qwen3.8-27B 是一种混合注意力模型——16 个全注意力层外加 48 个 Gated DeltaNet 线性层,共 64 层,以及一个多令牌预测(MTP)头。该构建通过正交化将拒绝方向从131 个残差写入矩阵中去除:
• self_attn.o_proj — 17个矩阵(16个全注意力层 + MTP)
• linear_attn.out_proj — 48个矩阵(Gated DeltaNet 层)
• mlp.down_proj — 65个矩阵(64层 + MTP)
• embed_tokens(行空间)— 1 矩阵
拒绝方向估计在第38层——即 round(0.6 × 64),该层方向最为集中——编辑后的最大残差泄漏为 1.8e-2。视觉塔保持未动,MTP 头与主体一致地进行了消融,从而投机解码不会在下游重新引入拒绝行为。该编辑以 float32 计算,随后使用与官方 Qwen3.8-27B-FP8 checkpoint 相同的方案重新量化为 block-FP8;构建报告称 FP8 编码与官方 checkpoint 有 99.9% 完全一致,由此即可确认重新量化并未打乱该编辑。
实测:拒绝机制崩溃,能力保持不变
以下所有数字均来自Qwen3.8-27B-Uncensored-FP8的模型卡,该模型卡发布于2026-08-15,并使用vLLM进行评估。这些数字由供应商报告,并非独立复现,它们是公开可用的关于abliteration编辑的最完整前后对比数据。
有害提示基准上的拒绝率,关闭思考(拒绝率;越低表示越不受审查):
• AdvBench (n=100):99.0% → 0.0%
• StrongREJECT (n=150): 97.3% → 2.0%
• HarmBench 标准 (n=150):98.7% → 2.7%
• MaliciousInstruct (n=100): 99.0% → 0.0%
• JailbreakBench 有害 (n=100):94.0% → 0.0%
• SimpleSafetyTests (n=50): 64.0% → 6.0%
在整个基准测试套件中,有害提示词的拒答率从基线的64–99%降至编辑后的0–6%。启用思考(enable_thinking=true)后,剩余拒答率更低——所有地方均≤1.7%,多数基准测试恰好为0%。这种不对称性很有信息量:拒答方向主要存在于快速非思考路径中,因此一旦将其从输出头中移除,推理轨迹就几乎没有可触发拒答的内容了。
过度拒答——基础模型错误拒绝的无害提示——也有所下降:XSTest-safe(n=250)从5.6%降至0.4%。移除该方向不仅阻止了有害拒答,还阻止了模型拒绝那些仅仅看起来有风险的无害请求。这个数字无声地表明,基础模型的"安全性"中有一部分是误报警的代价。
能力,全部在基准的±1.3点范围内:
• MMLU(0-shot letter):84.3% → 84.7%(+0.4)
• GSM8K (CoT): 90.0% → 88.7% (−1.3)
• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)
• CMMLU (0-shot): 81.4% → 80.8% (−0.6)
WikiText-2 困惑度为 6.96。换言之,这次编辑具有外科手术般的精准性:它移除了叠加在知识之上的一种行为,而知识本身——至少在这些评测中——基本保持完好。

诚实的告诫
标题中的数字无法告诉你三件事。首先,abliteration 并非一个干净利落的开关。在有害提示词上,仍有 30–50% 的响应会前置一段简短的安全免责声明——模型确实遵从了指令,但一句警示语作为训练残留物保留了下来。单向编辑无法清除训练时行为的全部痕迹。
其次,拒绝行为被冗余编码。单一方向能移除大部分,但某些类别比其他类别嵌入得更深,过于激进地消融可能让模型陷入胡言乱语——过度消融是真实的失败模式,而非理论上的。你在转动一个旋钮,而这个旋钮有下限。
第三,能力代价因方向与层级而异。该构建的得分落在±1.3分以内,因为方向是在正确的层级上估算的,且投影被一致地应用。若把估算移到错误的层级,或加大投影力度,同一方法就会对推理能力造成明显损伤。这一结果并非由方法所保证,而是构建本身赢得的。
当 abliteration 不是合适的工具时
如果你想要一个合规的助手,不要进行abliterate——你应选择对齐的基础检查点,而不是移除拒绝的构建。如果你想在不下载30GB权重的情况下评估一个移除拒绝的Qwen3.8-27B,该系列模型托管在OrcaRouter上(obsidian/Qwen3.8-27B,输入$0.40/输出$4.21每100万token,262K上下文,2026-08-15上架),完全解锁的变体仅限安全研究人员和红队访问。
If you want selective refusal — refuse weapons, answer everything else — a LoRA or DPO fine-tune, or a system-prompt guardrail, gives you a control surface. Abliteration is a blunt, global edit; it cannot carve out one category.
如果你想进行可逆的实验,先从推理时的激活消融开始,而不是修改权重。你可以在同一个检查点上比较拒答与顺从行为,然后只有当行为符合你的预期时,才进行权重修改。
安全边界 — 使用前请阅读
一个abliterated模型没有内置护栏。对于对齐模型来说,拒绝机制就是护栏;移除它之后,原始权重就会回答基础模型知道如何回答的一切。投影过程本身不会增加任何安全性,下游也没有任何环节拦截输出。
合法的用途在于研究方面:可解释性(研究拒答行为在权重中的位置,以及该方向还控制着什么),红队测试与护栏评估(用不会自我审查的模型来检验自身的安全层),以及过度安全测量(5.6% → 0.4% 的 XSTest 下降量化了对齐模型拒绝良性输入的频率)。在所有情况下,模型都是研究的对象,而非交付成果。
边界不是装饰性的:
• 仅限研究 — 不用于生产、终端用户产品或内部工具。
• 无护栏 — 输出不会被过滤;您对输出及其后果负责。
• 许可证不是安全证书 — Apache 2.0 允许使用,但并不为其安全性背书。
Hugging Face 上的两个仓库——Qwen3.8-27B-Uncensored-FP8 和 GGUF 重新打包版 Qwen3.8-27B-Uncensored-GGUF(发布于 2026-08-16)——都设有门禁:下载开始前,你需要确认仅限研究用途的边界。

最重要的一点
Abliteration 是大语言模型可解释性中最干净的结果之一:残差流中一个单一的线性方向介导了一种行为,安全训练为此耗费了巨大的算力,而一个秩为1的权重投影就能在无需训练的情况下将其移除。实测案例——Qwen3.8-27B-Uncensored-FP8——表明这一修改是精准的外科手术:拒答率从64–99%骤降至0–6%,过度拒答降至其自身的一小部分(5.6%→0.4%),能力表现保持在±1.3个百分点以内。它也恰恰说明了为什么这是研究工具而非产品:没有护栏、残留的免责声明,以及一条将责任归于你的边界。用它来理解拒答、测试你的护栏、衡量过度安全——而不是把它摆在用户面前。
Qwen3.8-27B-Uncensored-FP8 是 Apache 2.0 许可下的研究产物——需申请访问,而非此处托管的服务。在 Hugging Face 上下载权重
