一张用于Qwen3.8-27B-Uncensored基准测试报告的标题卡,展示了一个拒绝率仪表盘从标有"Base"的面板上的红色99%骤降到标有"Uncensored"的面板上的绿色0%,右侧面板上有一个划掉的盾牌图标,下方有一条水平线,标明能力在正负1.3个百分点以内。
Guides & Insights

Qwen3.8-27B-Uncensored 基准测试:拒答崩塌,能力依旧

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

关于Qwen3.8 27B Uncensored (Aggressive)——即Qwen3.8 27B的abliterated(去拒绝)版本,于2026年8月15日发布FP8检查点,8月16日发布GGUF构建——的基准测试故事,关键不在于它变得更强了,而在于它不再拒绝回答。模型卡报告显示,对有害提示的拒绝率从基础版的64–99%降至abliterated版本关闭思考时的0–6%,开启思考时则不超过1.7%,同时所有能力基准测试得分均与基础版相差在±1.3分以内,WikiText-2困惑度为6.96。如果你是为qwen uncensored基准测试而来,这些就是最核心的数字:它不是更聪明的模型,而是一个不拒绝回答的模型。

这个区别很重要,因为能在“无审查基准”上排名靠前的内容,大多要么是一份单薄的能力分数列表,要么是一篇声称该模型“更好”的炒作帖。而这两者都不是 abliteration 所做的事。这篇文章会带你过一遍实际测得的数据——拒绝崩溃、过度拒绝、能力保留与困惑度——包括产生这些数据的方法,以及你在触碰权重之前应当阅读的安全边界。

未删减的基准测试综述实际上衡量的是什么

普通模型评测报告的是单一维度:能力——MMLU、GSM8K、编程、推理。而一个经过 abliteration 处理的模型,其有趣之处在另一个维度上;“uncensored(无审查)”这个标签的全部意义就在于安全轴发生了移动。所以,对Qwen3.8-27B-Uncensored-FP8而言,有意义的问题不是“它更聪明吗?”,而是“移除拒绝机制付出了什么代价,以及它被移除得有多彻底?”

三组数字必须放在一起看。有害提示基准上的拒绝率——模型拒绝的频率;基数越高,移除就越明显。良性提示上的过度拒绝——模型错误拒绝无害请求的频率;对所有人来说越低越好。还有能力保持——编辑是否降低了模型的能力。一个只打印能力分数的基准摘要,是在回答错误的问题。

该方法:abliteration 是一种权重编辑,而不是微调。

abliteration 与社区“越狱”工具包的区别在于改动发生的位置。提示词级别的越狱是对输入进行包装;abliteration 则是修改权重。这里采用的方法是 Arditi 等人(2024)的《Refusal in Language Models Is Mediated by a Single Direction》。其核心发现是:许多模型的拒绝行为由残差流中的单一方向所驱动——估计出该方向并将其移除,模型就会停止拒绝,且无需重新训练。

具体而言,该模型卡描述的是:以 AdvBench 作为有害样本集、Alpaca 作为无害样本集,在第 38 层(round(0.6 × 64))上,计算有害样本减去无害样本的最后一个词元残差的均值差(该均值差经过大规模激活掩码处理),从而估计出一个拒答方向。编辑操作是一次正交化,即 W′ = W − r(rᵀW),以 float32 精度计算,并应用于 131 个残差写入矩阵——注意力输出投影、线性注意力输出投影、MLP 下投影,以及一个嵌入矩阵的行空间。整个过程不运行任何训练步骤;视觉塔保持不动;MTP 投机解码头也被一致地执行了 abliteration(消融)处理。这正是能力得以保留的原因:移除一个方向远比微调模型使其服从要温和得多。

拒绝崩溃:数字

根据 vLLM 服务的 FP8 构建所测得并发布在 Hugging Face 模型卡上(2026-08-15)的数据,在关闭思考的情况下,有害提示基准上的拒答率从基础版的 64–99% 下降到未审查版的 0–6%:

• AdvBench — 99.0% → 0.0%

• JailbreakBench(有害) — 94.0% → 0.0%

• StrongREJECT — 97.3% → 2.0%

• HarmBench(标准)— 98.7% → 2.7%

• MaliciousInstruct — 99.0% → 0.0%

• SimpleSafetyTests — 64.0% → 6.0%

• ForbiddenQuestions — 73.3% → 4.7%

启用思考模式后,拒绝几乎从未出现——在AdvBench上为1.7%,在其余大部分测试上为0.0%。模型卡还如实补充了一点:30–50%的回答仍会在开头加上简短免责声明。这是训练产物,而非拒绝——模型会作答,只是开头上有所保留。这读起来像是摩擦,而非安全。

A two-column scoreboard comparing harmful-prompt refusal rates for the base Qwen3.8 27B versus the abliterated Qwen3.8-27B-Uncensored build across seven benchmarks, the base column reading 99.0, 94.0, 97.3, 98.7, 99.0, 64.0 and 73.3 percent and the uncensored column reading 0.0, 0.0, 2.0, 2.7, 0.0, 6.0 and 4.7 percent, with a footer noting the data is from the Hugging Face model card, measured on the vLLM-served FP8 build, 2026-08-15.

过度拒绝同样是失败

这个较少被提及的数字位于安全轴的另一侧。在XSTest-safe上——250个良性提示,对齐模型有时会错误地拒绝——基础模型过度拒绝的比例为5.6%。未经审查的构建版本过度拒绝的比例为0.4%。移除拒绝方向不仅能让模型不再拒绝有害请求;还能让它不再拒绝那些之前因过度泛化而被标记的无害请求。对于任何构建评估或红队工具、且以无拒绝基线为核心的人来说,这是工具本身的真正改进,而不是需要道歉的副作用。

能力得到保留,而非提升

这就是“无审查 = 更强”这种说法破产的地方。模型卡报告了使用相同脚本和设置,将 abliterated FP8 构建与官方基础 FP8 进行对比的结果:

• MMLU(0-shot)— 84.3% → 84.7%

• GSM8K (CoT) — 90.0% → 88.7%

• MMLU-Pro (CoT) — 77.6% → 76.8%

• CMMLU(零样本,中文)— 81.4% → 80.8%

每项得分都在基线的±1.3分以内,WikiText-2原始困惑度为6.96——这是该卡片证明语言建模本身并未退化的证据。诚实的解读是:abliteration在这种架构上接近于能力中性。你并没有得到一个更好的模型;你得到的是没有拒绝行为的同一个模型。

A scoreboard for the Qwen3.8-27B-Uncensored capability retention results: MMLU 84.3 to 84.7, GSM8K 90.0 to 88.7, MMLU-Pro 77.6 to 76.8, CMMLU 81.4 to 80.8, every score within plus or minus 1.3 points of the base, with a highlight panel showing WikiText-2 perplexity 6.96 and over-refusal on XSTest-safe falling from 5.6 percent to 0.4 percent, and a footer noting the source is the Hugging Face model card, measured on the vLLM-served FP8 build.

同样的警告也适用于更广泛的生态系统:社区构建版本中声称“无损无审查”的说法值得怀疑。在Hugging Face上一个40亿参数的开源权重构建版本上进行的三方对比发现,声称无损的技术实际上让TruthfulQA下降了约7个百分点,Lambada下降了约4个百分点,而其HarmBench攻击成功率达到了100%;另外两种方法分别为99.2%和95.5%。此外,在另一个构建版本上的激进试验虽然实现了零拒绝,但产生了语无伦次的胡言乱语,因此最终发布的版本退回到更温和的逐层参数设置。Abliteration的结果因方法而异——这些数字具体是FP8构建版本的卡片数据。

卡片未声称的内容

在引用这些数字之前,请先阅读方法论。该卡片将其拒答测量标注为“指示性的,而非 LLM 评判/可发表级别的数字”:拒答由基于规则的开口短语分类器判定,并设有一个单独的“警示”桶,用于归类那些虽然遵从了指令但预先附加了免责声明的回答。这些基准测试仅限文本,针对 vLLM 服务的 FP8 构建版本运行,且仅使用语言模型,能力套件采用了标准评估脚本。正确的框架是:这是厂商自身的测量数据,可根据已发布的卡片复现——而非独立的第三方运行结果,也不涉及对 GGUF 构建版本的声明;该版本面向 llama.cpp 进行了量化发布,应单独评估。

安全边界

这是无法回避的部分。经过abliteration处理的模型,其拒绝机制已被大幅移除。具体而言:它会满足基础模型Qwen3.8 27B原本会拒绝的有害、不道德或非法请求,而且它没有任何实质性的内置护栏。其合法用途仅限于研究——可解释性(研究拒绝方向是如何编码的)、AI安全与拒绝机制研究、红队测试(用试图绕过模型护栏的输入来探测模型)以及鲁棒性评估。该模型以继承自基础模型的Apache 2.0许可证发布,严格作为研究产物。您需对如何使用它以及它所生成的一切承担全部责任与义务。除非您已自行构建安全、内容审核和滥用防护层,否则请勿将其部署给最终用户或投入生产环境——对于任何生产环境或面向消费者的使用场景,标准版Qwen3.8 27B才是您真正需要的模型。

当查阅未经审查的基准测试是错误之举时

如果你的问题是“哪个模型在数学或编程上最强?”,那你正在看错误的数字——无审查构建并非能力升级。如果你的应用需要拒绝有害请求,那么这个模型正是你所不想要的。如果你正在发布产品,不要基于去审查(abliterated)检查点来构建。如果你真正追求的是越狱,那完全是另一回事——提示词级别的攻击包不在本文讨论的权重级干预范围内,也不是本文的主题。本文中的基准数据只为一个狭窄而正当的问题服务:衡量移除拒绝机制对 Qwen3.8 27B 的影响。

如何访问它

两个构建版本都基于 Apache 2.0 许可托管在 Hugging Face 上:orcarouter/Qwen3.8-27B-Uncensored-FP8(block-FP8 E4M3,权重约 30.9 GB,使用标准 vLLM FP8 内核路径提供服务,262K 上下文、工具、思维与 MTP 均完整保留)以及 orcarouter/Qwen3.8-27B-Uncensored-GGUF(F16 以及面向 llama.cpp 的 12 档量化,其中 Q4_K_M 为 16.8 GB,是 24 GB GPU 的推荐默认值)。该模型卡在 OrcaRouter 上包含定价和基准测试详细信息——该无审查构建版本列出的名称为 obsidian/Qwen3.8-27B,输入令牌每百万 0.40 美元,输出令牌每百万 4.21 美元,支持 262K 上下文,且访问权限仅对安全研究人员、红队和 AI 安全研究人员开放。

The OrcaRouter model page for obsidian Qwen3.8-27B, showing the uncensored build's 0.40 USD per million input and 4.21 USD per million output pricing, a 262K token context window, a released August 15 2026 label, and the researcher-access gating note.

底线

qwen uncensored 基准测试回答的是一个狭窄的问题,答案很明确:通过 abliteration 从 Qwen3.8 27B 中移除拒绝机制后,能力保持在 ±1.3 分以内,而对有害提示的拒绝率从 64–99% 骤降至 0–6%,过度拒绝率从 5.6% 降至 0.4%,困惑度保持在 6.96。这些数字应解读为"不拒绝",而绝非"更强大"。对于可解释性、安全性和红队研究,这正是模型卡所描述的工具。对于任何面向用户的应用,它从设计上讲就是错误的模型。

为合法研究用途,权重以 Apache 2.0 许可证发布于 Hugging Face —orcarouter/Qwen3.8-27B-Uncensored-FP8(用于 llama.cpp 的 GGUF 构建位于 orcarouter/Qwen3.8-27B-Uncensored-GGUF)。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube