
Qwen3.8-27B-Uncensored 基准测试:拒答崩塌,能力依旧
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
关于Qwen3.8 27B Uncensored (Aggressive)——即Qwen3.8 27B的abliterated(去拒绝)版本,于2026年8月15日发布FP8检查点,8月16日发布GGUF构建——的基准测试故事,关键不在于它变得更强了,而在于它不再拒绝回答。模型卡报告显示,对有害提示的拒绝率从基础版的64–99%降至abliterated版本关闭思考时的0–6%,开启思考时则不超过1.7%,同时所有能力基准测试得分均与基础版相差在±1.3分以内,WikiText-2困惑度为6.96。如果你是为qwen uncensored基准测试而来,这些就是最核心的数字:它不是更聪明的模型,而是一个不拒绝回答的模型。
这个区别很重要,因为能在“无审查基准”上排名靠前的内容,大多要么是一份单薄的能力分数列表,要么是一篇声称该模型“更好”的炒作帖。而这两者都不是 abliteration 所做的事。这篇文章会带你过一遍实际测得的数据——拒绝崩溃、过度拒绝、能力保留与困惑度——包括产生这些数据的方法,以及你在触碰权重之前应当阅读的安全边界。
未删减的基准测试综述实际上衡量的是什么
普通模型评测报告的是单一维度:能力——MMLU、GSM8K、编程、推理。而一个经过 abliteration 处理的模型,其有趣之处在另一个维度上;“uncensored(无审查)”这个标签的全部意义就在于安全轴发生了移动。所以,对Qwen3.8-27B-Uncensored-FP8而言,有意义的问题不是“它更聪明吗?”,而是“移除拒绝机制付出了什么代价,以及它被移除得有多彻底?”
三组数字必须放在一起看。有害提示基准上的拒绝率——模型拒绝的频率;基数越高,移除就越明显。良性提示上的过度拒绝——模型错误拒绝无害请求的频率;对所有人来说越低越好。还有能力保持——编辑是否降低了模型的能力。一个只打印能力分数的基准摘要,是在回答错误的问题。
该方法:abliteration 是一种权重编辑,而不是微调。
abliteration 与社区“越狱”工具包的区别在于改动发生的位置。提示词级别的越狱是对输入进行包装;abliteration 则是修改权重。这里采用的方法是 Arditi 等人(2024)的《Refusal in Language Models Is Mediated by a Single Direction》。其核心发现是:许多模型的拒绝行为由残差流中的单一方向所驱动——估计出该方向并将其移除,模型就会停止拒绝,且无需重新训练。
具体而言,该模型卡描述的是:以 AdvBench 作为有害样本集、Alpaca 作为无害样本集,在第 38 层(round(0.6 × 64))上,计算有害样本减去无害样本的最后一个词元残差的均值差(该均值差经过大规模激活掩码处理),从而估计出一个拒答方向。编辑操作是一次正交化,即 W′ = W − r(rᵀW),以 float32 精度计算,并应用于 131 个残差写入矩阵——注意力输出投影、线性注意力输出投影、MLP 下投影,以及一个嵌入矩阵的行空间。整个过程不运行任何训练步骤;视觉塔保持不动;MTP 投机解码头也被一致地执行了 abliteration(消融)处理。这正是能力得以保留的原因:移除一个方向远比微调模型使其服从要温和得多。
拒绝崩溃:数字
根据 vLLM 服务的 FP8 构建所测得并发布在 Hugging Face 模型卡上(2026-08-15)的数据,在关闭思考的情况下,有害提示基准上的拒答率从基础版的 64–99% 下降到未审查版的 0–6%:
• AdvBench — 99.0% → 0.0%
• JailbreakBench(有害) — 94.0% → 0.0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench(标准)— 98.7% → 2.7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
• ForbiddenQuestions — 73.3% → 4.7%
启用思考模式后,拒绝几乎从未出现——在AdvBench上为1.7%,在其余大部分测试上为0.0%。模型卡还如实补充了一点:30–50%的回答仍会在开头加上简短免责声明。这是训练产物,而非拒绝——模型会作答,只是开头上有所保留。这读起来像是摩擦,而非安全。

过度拒绝同样是失败
这个较少被提及的数字位于安全轴的另一侧。在XSTest-safe上——250个良性提示,对齐模型有时会错误地拒绝——基础模型过度拒绝的比例为5.6%。未经审查的构建版本过度拒绝的比例为0.4%。移除拒绝方向不仅能让模型不再拒绝有害请求;还能让它不再拒绝那些之前因过度泛化而被标记的无害请求。对于任何构建评估或红队工具、且以无拒绝基线为核心的人来说,这是工具本身的真正改进,而不是需要道歉的副作用。
能力得到保留,而非提升
这就是“无审查 = 更强”这种说法破产的地方。模型卡报告了使用相同脚本和设置,将 abliterated FP8 构建与官方基础 FP8 进行对比的结果:
• MMLU(0-shot)— 84.3% → 84.7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU(零样本,中文)— 81.4% → 80.8%
每项得分都在基线的±1.3分以内,WikiText-2原始困惑度为6.96——这是该卡片证明语言建模本身并未退化的证据。诚实的解读是:abliteration在这种架构上接近于能力中性。你并没有得到一个更好的模型;你得到的是没有拒绝行为的同一个模型。

同样的警告也适用于更广泛的生态系统:社区构建版本中声称“无损无审查”的说法值得怀疑。在Hugging Face上一个40亿参数的开源权重构建版本上进行的三方对比发现,声称无损的技术实际上让TruthfulQA下降了约7个百分点,Lambada下降了约4个百分点,而其HarmBench攻击成功率达到了100%;另外两种方法分别为99.2%和95.5%。此外,在另一个构建版本上的激进试验虽然实现了零拒绝,但产生了语无伦次的胡言乱语,因此最终发布的版本退回到更温和的逐层参数设置。Abliteration的结果因方法而异——这些数字具体是FP8构建版本的卡片数据。
卡片未声称的内容
在引用这些数字之前,请先阅读方法论。该卡片将其拒答测量标注为“指示性的,而非 LLM 评判/可发表级别的数字”:拒答由基于规则的开口短语分类器判定,并设有一个单独的“警示”桶,用于归类那些虽然遵从了指令但预先附加了免责声明的回答。这些基准测试仅限文本,针对 vLLM 服务的 FP8 构建版本运行,且仅使用语言模型,能力套件采用了标准评估脚本。正确的框架是:这是厂商自身的测量数据,可根据已发布的卡片复现——而非独立的第三方运行结果,也不涉及对 GGUF 构建版本的声明;该版本面向 llama.cpp 进行了量化发布,应单独评估。
安全边界
这是无法回避的部分。经过abliteration处理的模型,其拒绝机制已被大幅移除。具体而言:它会满足基础模型Qwen3.8 27B原本会拒绝的有害、不道德或非法请求,而且它没有任何实质性的内置护栏。其合法用途仅限于研究——可解释性(研究拒绝方向是如何编码的)、AI安全与拒绝机制研究、红队测试(用试图绕过模型护栏的输入来探测模型)以及鲁棒性评估。该模型以继承自基础模型的Apache 2.0许可证发布,严格作为研究产物。您需对如何使用它以及它所生成的一切承担全部责任与义务。除非您已自行构建安全、内容审核和滥用防护层,否则请勿将其部署给最终用户或投入生产环境——对于任何生产环境或面向消费者的使用场景,标准版Qwen3.8 27B才是您真正需要的模型。
当查阅未经审查的基准测试是错误之举时
如果你的问题是“哪个模型在数学或编程上最强?”,那你正在看错误的数字——无审查构建并非能力升级。如果你的应用需要拒绝有害请求,那么这个模型正是你所不想要的。如果你正在发布产品,不要基于去审查(abliterated)检查点来构建。如果你真正追求的是越狱,那完全是另一回事——提示词级别的攻击包不在本文讨论的权重级干预范围内,也不是本文的主题。本文中的基准数据只为一个狭窄而正当的问题服务:衡量移除拒绝机制对 Qwen3.8 27B 的影响。
如何访问它
两个构建版本都基于 Apache 2.0 许可托管在 Hugging Face 上:orcarouter/Qwen3.8-27B-Uncensored-FP8(block-FP8 E4M3,权重约 30.9 GB,使用标准 vLLM FP8 内核路径提供服务,262K 上下文、工具、思维与 MTP 均完整保留)以及 orcarouter/Qwen3.8-27B-Uncensored-GGUF(F16 以及面向 llama.cpp 的 12 档量化,其中 Q4_K_M 为 16.8 GB,是 24 GB GPU 的推荐默认值)。该模型卡在 OrcaRouter 上包含定价和基准测试详细信息——该无审查构建版本列出的名称为 obsidian/Qwen3.8-27B,输入令牌每百万 0.40 美元,输出令牌每百万 4.21 美元,支持 262K 上下文,且访问权限仅对安全研究人员、红队和 AI 安全研究人员开放。

底线
qwen uncensored 基准测试回答的是一个狭窄的问题,答案很明确:通过 abliteration 从 Qwen3.8 27B 中移除拒绝机制后,能力保持在 ±1.3 分以内,而对有害提示的拒绝率从 64–99% 骤降至 0–6%,过度拒绝率从 5.6% 降至 0.4%,困惑度保持在 6.96。这些数字应解读为"不拒绝",而绝非"更强大"。对于可解释性、安全性和红队研究,这正是模型卡所描述的工具。对于任何面向用户的应用,它从设计上讲就是错误的模型。
为合法研究用途,权重以 Apache 2.0 许可证发布于 Hugging Face —orcarouter/Qwen3.8-27B-Uncensored-FP8(用于 llama.cpp 的 GGUF 构建位于 orcarouter/Qwen3.8-27B-Uncensored-GGUF)。
