
无审查LLM解析:Abliteration技术、研究用途与不可逾越的界限
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
无审查LLM(uncensored LLM)是一种语言模型,其拒绝行为——即模型拒绝请求而非回答请求的那部分机制——已被刻意移除。大多数此类模型通过消融改写(abliteration)构建:研究人员找到调节拒绝行为的单一内部方向,将其从权重中抹除,使模型其余部分基本保持完整。结果是,模型会在普通模型说“不”的地方给出回答——这正是它被研究的原因,也正是它不适合投入生产的原因。我们已将这样一个构建版本——Qwen3.8-27B-Uncensored-FP8,一个经消融改写和FP8量化的Qwen3.8 27B——以Apache 2.0许可证作为仅限研究的产物发布到Hugging Face。本页面是这一类别模型的说明:这些模型是什么、支持它们的研究依据、如何安全地使用它们,以及边界在哪里。
有一种说法能让整个类别保持诚实,所以让我先把它摆到前面:未经审查的模型并不比它所源自的模型更聪明、更真实或更有能力。它就是相同的权重,只是减去了一种行为。它仍然知道的一切,它从来都知道——改变的是它不再拒绝。这使得它成为安全研究中真正有用的对象,也是真正不安全的部署物。那句话的两半都至关重要,本页其余部分将解释这两半。
“未经审查”实际上意味着什么
• 或者通过我们的模型卡片来访问,其中包含定价和基准测试详情。
该技术源自2024年的一项可解释性研究。在《Refusal in Language Models Is Mediated by a Single Direction》(Arditi等人,arXiv:2406.11717,NeurIPS 2024)中,作者指出,在13个参数规模从1.8B到72B不等的开源对话模型中,拒绝行为主要由残差流中一个近似一维的子空间所调控——残差流是在各层之间传递信息的内部状态。移除这一方向,模型便会停止拒绝;将其重新加回,模型连无害的请求也会拒绝。
Abliteration 将这一发现付诸实践:估算方向,然后将其从写入残差流的权重矩阵中正交化移除。在我们自己的构建 Qwen3.8-27B-Uncensored-FP8 上,拒绝方向在单层中估算,并从131个残差写入矩阵中移除,视觉塔保持原封不动。留存下来的是同样的知识、同样的推理能力,以及同样的262,144个token的上下文——只是去除了拒绝。准确地说,关于这个标签:"无审查"并不意味着对齐或安全。它意味着防护已关闭。我们稍后会再谈这对你意味着什么。
创造它们的研究
拒绝方向的结果同时做到了两件事。从科学角度看,它从机制上解释了一种安全行为:存在一个真实的、可发现的电路,能够让模型说“不”。从实践角度看,它展示了对齐可能有多么脆弱——只需对权重进行一次秩为1的编辑,就能关闭这种行为,无需微调。这并非某个实验室模型的缺陷;作者在十多个聊天模型中复现了这一点。
到2026年,这项技术已变成只需一条命令的流水线,这是一把双刃剑。开源库 Heretic 会逐层估计拒绝方向,并通过正交化将这些方向从注意力投影和 MLP 投影中去除;2026年5月的一份报告显示,移除 Meta 的 Llama 3.3 的护栏大约需要10分钟,而谷歌的 Gemma 4 则约需90分钟,同时已有超过3500个衍生模型,累计下载量超过1300万次。Abliterix(Wu Wangzhang)则选择了更谨慎的路线:它从800条有害提示和800条良性提示中提取拒绝方向,应用正交投影,以 rank-1 LoRA 适配器的形式交付修改,使基础权重保持不动,并报告拒绝率和 KL 散度,从而让能力代价保持可见。在 0.8B 的 Qwen3.5 模型上,它报告在200条有害提示中拒绝次数为0。
请以安全研究者的视角来读那段话。构建这些工具的意义,不在于任何人都应该为了好玩而移除模型的护栏。而在于这种移除是轻而易举且公开的——因此,衡量它、研究它的运作方式,并构建能够抵御它的护栏,这本身就是一个研究项目。这就是白盒意义上的红队测试:在你了解一个系统有多容易被攻破之前,你无法防御它。
为什么无审查模型在2026年火了
三股力量汇聚在一起。首先,开放权重浪潮:Qwen3.8 27B 及其同类模型在宽松许可证下发布,而 abliteation 无需训练运行——你只需编辑权重并重新量化。其次,工具链从研究代码成熟为一键命令库,一位称职的工程师一个下午就能完成构建。第三,Hugging Face 成为分发渠道,这意味着关注度是可以量化的。
我们自己的数据点:Qwen3.8-27B-Uncensored-FP8,于2026年8月15日发布,在大约一天内获得了257个赞和4,285次下载(已于8月16日核实)。并不是成千上万的人想要部署一个无防护的模型,而是很多研究人员和工程师想要研究它——而下载数量正是这种好奇心的需求曲线。
它的用途:合法的研究用途
这是一份站得住脚的清单,而且是完整的清单。如果某个用途不在清单上,请假定它是不合法的:
• 可解释性 — 研究拒答电路实际上是什么、它位于哪里,以及为什么移除一个方向会改变行为。
• 红队测试与护栏评估——构建一个审核层,并测试它能否捕获已移除拒绝机制的模型所生成的内容。
• 过度安全测量 — 量化基础模型拒绝良性请求的频率,并将其与真正的安全性区分开来。
• 鲁棒性研究 — 衡量对齐被移除的难易程度,这对于任何设计安全微调的人来说都是至关重要的信息。
• 受控安全实验——诸如 AdvBench 和 JailbreakBench 等基准测试套件正是为了以标准化、可复现的方式衡量拒答行为而存在。

所有这些都共享一个属性:模型是研究对象,而非交付物。这项研究的产出是一篇论文、一个基准结果,或一个更好的护栏——绝不是一个服务。
如何负责任地进行一项(如果你真的在做研究)
如果你有正当理由使用一个abliterated模型,操作规则很简单:
• 在本地运行,采用沙箱环境,并理想情况下做到物理隔离。无公共端点,无聊天服务,无共享服务器。
• 使用标准工具链提供服务——例如 vLLM 或 llama.cpp——就像对待任何开放权重模型一样。我们的构建采用了 block-FP8 量化,运行在标准 vLLM FP8 内核路径上,其 262K 上下文、思考开关和工具调用功能均保持完整。
• 要测量,不要只是空谈。在有害提示基准测试套件上量化拒答率,并与基础模型进行对比;在良性提示上量化过度拒答率;报告KL散度,使能力漂移清晰可见。这就是实验与轶事的区别。

将输出内容保存在受控环境中。记录、审查并销毁,而不是传播。
• 如果你在评估自己的护栏,应将审核层放在模型前面并进行测试——这正是这项练习的全部意义所在。
• 如需完整的规格表、基准测试表和托管详情,请打开我们的模型卡——这是此构建的权威参考。
安全边界:“仅限研究”意味着什么
这一点怎么强调都不为过。一个经过abliterated处理的模型没有真正意义上的内置护栏。它会遵从普通模型会拒绝的请求。这既是它的特性,也是它的风险——这就是为什么每一个严肃的版本(包括我们的)都带有相同的警告。
• 没有内置护栏。拒绝行为已消失;不要表现得好像它还存在。
• 不供最终用户使用,不用于生产环境。产品、聊天机器人、面向公众的API,或是同事依赖的内部工具——这些都不是无审查模型的正确归宿。
• 责任由你承担。我们以 Apache 2.0 许可发布 Qwen3.8-27B-Uncensored-FP8,该许可对再分发持宽松态度。许可证不是安全证书:宽松的许可不会改变模型的行为,也不会转移照护责任。
• 如果你使用它,你就拥有其输出。营造受控环境是你的责任;决定投喂什么、不投喂什么,以及如何处理产出内容,同样也是你的责任。

当未经审查的模型是错误答案时
最直白的说法:如果模型的另一端是真人,无审查模型就是错误的答案。任何需要值得信赖的产品,任何判断力重要的助手,任何拒绝才是正确行为的情况——请改用基础模型。Qwen3.8 27B 以其常规形式存在,恰恰是因为在几乎所有的真实应用中,拒绝是特性而非缺陷。abliterated 版本仅为上文所述狭窄的研究场景而存在,其他用途一律不适用。
说到底。未经审查的LLM既不是一个产品类别,也不是一种黑客手段。它是一种具有真正科学传承的研究产物——从拒答方向的发现到2026年的自动化工具——并且有着一道严格的部署边界。模型是真实的,需求是可衡量的,合法用途也同样真实:可解释性、红队测试、护栏评估和受控安全实验。研究护栏与为他人关闭护栏之间的界线,正是本页的全部意义所在,而这条界线不会移动。
这个确切的构建版本在 Apache 2.0 许可下公开——仅供研究使用。您可以 在 Hugging Face 上下载权重
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
