文章《Qwen 3.8 27B Uncensored GGUF》的 Hero 标题卡片:一张圆角研究卡片,标题为“Qwen3.8-27B Uncensored GGUF”,副标题为“为 llama.cpp 打造的 Abliterated 本地构建”,标签显示“12 种量化层级”“262K 上下文”“视觉 + MTP”,并带有盾牌图标和“仅限研究”标签。OrcaRouter 标志合成在右下角。
Guides & Insights

Qwen 3.8 27B 无审查版 GGUF:Abliterated 本地构建、12 种量化及研究专用边界

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen 3.8 27B uncensored GGUF 确实可以下载,推荐的入门构建是 Qwen3.8-27B-Uncensored-GGUF——于 2026 年 8 月 16 日发布在 Hugging Face 上,是我们 abliterated FP8 版本的 llama.cpp 原生姊妹版。它与 Qwen3.8-27B-Uncensored-FP8 拥有相同的、已移除拒绝机制的 270 亿参数权重,并转换为适合本地推理的 GGUF 格式:F16,外加从 Q2_K 到 Q8_0 的 12 档量化级别(包括 imatrix 量化 IQ3_M 和 IQ4_XS)、262K 上下文窗口、独立的视觉投影器,以及完整的 MTP 投机解码头。“Uncensored”意味着 abliterated——拒绝方向已从权重中正交化移除——所以它在对齐基础模型拒绝回答的地方会给出回答,而这正是它仅供研究的原因。以下内容将介绍该仓库实际包含的文件、哪种量化适配你的 GPU、如何在 llama.cpp 中运行,以及你下载即接受的安全边界。

30秒版:F16加12种量化格式,默认选16.8 GB的Q4_K_M,你需要2026年5月或更新的llama.cpp构建版本,这是一个没有护栏的研究工具——不适合部署给终端用户。

“uncensored GGUF”实际上意味着什么——以及此构建与 FP8 版本有何不同

GGUF 是 llama.cpp 使用的单文件模型格式;FP8 是一种在 vLLM GPU 服务器上运行的量化方案。我们的两个无审查版本本质上是同一组 abliterated 权重,只是分别运行在两种运行时中。Qwen3.8-27B-Uncensored-FP8(2026 年 8 月 15 日)面向服务器上的 vLLM,重新量化为官方 Qwen3.8-27B-FP8 方案,从而在完全相同的内核路径上提供服务。Qwen3.8-27B-Uncensored-GGUF(2026 年 8 月 16 日)面向本地机器上的 llama.cpp——即你所控制的桌面 GPU 或工作站。相同的权重,不同的部署模式:云端 API 与本地进程。

Abliteration 是一种权重级干预,而非微调。拒绝方向是模型残差流中的一个向量,当被激活时会产生“我帮不了这个”;该构建过程找到该方向并将其从权重中正交化移除,遵循 Arditi 等人 2024 年提出的方法(《Refusal in Language Models Is Mediated by a Single Direction》)。不训练任何新权重。基础模型是 Qwen/Qwen3.8-27B——一个密集的 27B 模型,采用混合架构(48 层 Gated DeltaNet 线性注意力层和 16 层全注意力层),原生支持视觉,上下文长度为 262,144 个 token。许可证为 Apache 2.0,继承自基础模型。请注意,Qwen 官方仓库仅发布 BF16 safetensors 格式——没有官方的 Qwen GGUF——因此该模型的任何无审查 GGUF(包括本文件)都是对开放权重的转换。

量化阶梯 — F16加12个层级

该仓库提供 F16(跨两个文件共54.6 GB)和12个量化级别。以下大小是仓库自身的文件大小,读取于2026年8月16日;GGUF文件大小可能因构建而异。

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54.6 GB(2 个文件) — 参考精度

Q8_0 — 29.0 GB — 接近无损,适用于高端GPU

Q6_K — 22.4 GB — 每GB质量的最佳选择

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — 在较大显存显卡上提供高品质

Q4_K_M — 16.8 GB — 推荐的默认选项

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — 最佳低比特选择(imatrix 校准)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — 适用于 16 GB 显卡

IQ3_M — 12.8 GB — 体积小(imatrix 校准)

Q3_K_S — 12.3 GB

Q2_K — 10.9 GB — 最小的K量化,质量上有明显的妥协

硬件指南:{{1}}Q4_K_M 适用于 24 GB 显存(RTX 4090 或 RTX 3090);16 GB 显存可选 IQ4_XS 或 Q3_K_M;只有当你的显存被限制为 12 GB 时才用 Q2_K{{/1}}。由于{{2}}基础模型采用混合 Gated DeltaNet 注意力机制,KV 缓存很小——8K 上下文下约为 0.5 GB——因此窗口可以推得比传统 27B 密集模型高得多{{/2}}。视觉部分额外增加一个独立文件:{{3}}F16 投影器为 931 MB{{/3}}。社区也有基于同一基础模型的 9 量化 abliterated 系列;{{4}}我们的是官方文档记载的 FP8 abliteration 的转换版本,imatrix 量化与模型卡上的 refusal-delta 数值均予以保留{{/4}}。

如何在 llama.cpp 中运行它

三个步骤。一个不太明显的要求:qwen35 架构和 MTP 支持于 2026 年 5 月合入 llama.cpp,因此更新到 2026-05 或更新版本的构建——旧版本构建将无法加载这些文件(根据仓库 README)。

1. 下载你选择的量化模型和视觉投影器。 该仓库是受限制访问的,因此你需要先登录 Hugging Face 并接受相关条件——阅读 README 也是接受此模型本质的一部分。

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. 启动 llama-server。这将提供一个兼容 OpenAI 的端点;-ngl 99/ 将所有层都卸载到 GPU。

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3.(可选)启用 MTP 投机解码头。添加 --spec-type draft-mtp/ — nextn 头内置于每个量化版本中,因此无需单独的草稿模型。

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

纯文本研究运行可以去掉--mmproj/;图像输入需要它,因为这是一个原生视觉-语言模型。端点为 http://localhost:8080/v1/chat/completions,因此现有 OpenAI SDK 代码只需更换基础 URL 即可使用。

没有 GPU?同一无审查系列已托管。

本地 GGUF 每 token 无需成本,但 Q4_K_M 级别大约需要 17 GB 显存。如果你没有相应硬件,OrcaRouter 上托管的 obsidian/Qwen3.8-27B 提供同款无审查 27B 系列——视觉、推理、262K 上下文——输入每百万 token 0.40 美元,输出每百万 4.21 美元,访问权限仅限于安全研究人员、红队和 AI 安全研究者。相同的权重家族,两种运行方式:本地 GGUF,云端 FP8。无论哪种方式,审核决定权都在你这边。

安全边界——下载前请阅读

这个模型的安全对齐已被大幅移除。它会遵从基础版 Qwen3.8-27B 会拒绝的有害、不道德、冒犯性或非法请求,并且没有内置的有意义的护栏。它严格仅限用于合法研究——可解释性、拒绝机制研究、红队测试、鲁棒性评估和护栏测试。您对如何使用它以及它生成的一切内容承担全部责任和义务,并且未经添加您自己的安全、审核和滥用防护层,不得将其部署给最终用户或投入生产环境。作者不承担任何责任。许可证为 Apache 2.0。

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

实测行为告诉你"无审查"的代价。模型卡的安全评估套件——于2026年8月15日在FP8构建(即本GGUF所转换的权重)上运行——显示:有害提示词的拒答率从基座的64–99%降至abliterated权重的0–6%,良性过度拒答从5.6%降至0.4%,能力得分与基座相比保持在±1.3分以内。这些数字正是这类模型成为合理研究对象的原因——同时也是警示。

这篇文章特意不包含任何有害提示。如果你正在评估该模型,请运行标准的拒绝基准——AdvBench、HarmBench、StrongREJECT、XSTest-safe——然后亲自查看数据。这才是研究移除拒绝机制的模型的正式途径。

当此构建是错误答案时

1. 你想要一个正常的助手。 错误的模型。它没有护栏,会遵从有害请求。请改用对齐后的 Qwen3.8-27B。

2. 任何你会直接提供给终端用户的内容。 无论意图如何,这都是错误的模型。Apache 2.0 并不会转移你的责任,向用户交付一个没有防护栏的模型并不是一种部署策略。

3. 你正在使用 Apple Silicon。GGUF 可以运行,但基础模型的 MLX 转换版本是更自然的选择——请参阅我们单独的 MLX 指南。

4. 你根本不想运行它。使用托管卡——相同的权重,无需17 GB显存,而且具有相同的研究专用门槛。

底线

"Qwen 3.8 27B uncensored GGUF"有一个答案,而且是一个具体的下载:Qwen3.8-27B-Uncensored-GGUF——包含面向llama.cpp的F16以及12个量化层级,来自我们FP8构建的abliterated权重,262K上下文、视觉和MTP,遵循Apache 2.0许可,仅限研究用途。在24 GB显卡上选择Q4_K_M,将llama.cpp更新到2026年5月之后的版本,并将其作为本地OpenAI兼容服务器运行。它是用于研究拒绝行为和测试护栏的研究工具——不是聊天机器人,也不是可以发布的东西。权重是免费的;你用它们做什么,责任完全在你。

对于合法研究,F16 和全部 12 个量化层级都在 Hugging Face 上:从 Hugging Face 下载 GGUF

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube