
Qwen 3.8 27B 无审查版 GGUF:Abliterated 本地构建、12 种量化及研究专用边界
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
Qwen 3.8 27B uncensored GGUF 确实可以下载,推荐的入门构建是 Qwen3.8-27B-Uncensored-GGUF——于 2026 年 8 月 16 日发布在 Hugging Face 上,是我们 abliterated FP8 版本的 llama.cpp 原生姊妹版。它与 Qwen3.8-27B-Uncensored-FP8 拥有相同的、已移除拒绝机制的 270 亿参数权重,并转换为适合本地推理的 GGUF 格式:F16,外加从 Q2_K 到 Q8_0 的 12 档量化级别(包括 imatrix 量化 IQ3_M 和 IQ4_XS)、262K 上下文窗口、独立的视觉投影器,以及完整的 MTP 投机解码头。“Uncensored”意味着 abliterated——拒绝方向已从权重中正交化移除——所以它在对齐基础模型拒绝回答的地方会给出回答,而这正是它仅供研究的原因。以下内容将介绍该仓库实际包含的文件、哪种量化适配你的 GPU、如何在 llama.cpp 中运行,以及你下载即接受的安全边界。
30秒版:F16加12种量化格式,默认选16.8 GB的Q4_K_M,你需要2026年5月或更新的llama.cpp构建版本,这是一个没有护栏的研究工具——不适合部署给终端用户。
“uncensored GGUF”实际上意味着什么——以及此构建与 FP8 版本有何不同
GGUF 是 llama.cpp 使用的单文件模型格式;FP8 是一种在 vLLM GPU 服务器上运行的量化方案。我们的两个无审查版本本质上是同一组 abliterated 权重,只是分别运行在两种运行时中。Qwen3.8-27B-Uncensored-FP8(2026 年 8 月 15 日)面向服务器上的 vLLM,重新量化为官方 Qwen3.8-27B-FP8 方案,从而在完全相同的内核路径上提供服务。Qwen3.8-27B-Uncensored-GGUF(2026 年 8 月 16 日)面向本地机器上的 llama.cpp——即你所控制的桌面 GPU 或工作站。相同的权重,不同的部署模式:云端 API 与本地进程。
Abliteration 是一种权重级干预,而非微调。拒绝方向是模型残差流中的一个向量,当被激活时会产生“我帮不了这个”;该构建过程找到该方向并将其从权重中正交化移除,遵循 Arditi 等人 2024 年提出的方法(《Refusal in Language Models Is Mediated by a Single Direction》)。不训练任何新权重。基础模型是 Qwen/Qwen3.8-27B——一个密集的 27B 模型,采用混合架构(48 层 Gated DeltaNet 线性注意力层和 16 层全注意力层),原生支持视觉,上下文长度为 262,144 个 token。许可证为 Apache 2.0,继承自基础模型。请注意,Qwen 官方仓库仅发布 BF16 safetensors 格式——没有官方的 Qwen GGUF——因此该模型的任何无审查 GGUF(包括本文件)都是对开放权重的转换。
量化阶梯 — F16加12个层级
该仓库提供 F16(跨两个文件共54.6 GB)和12个量化级别。以下大小是仓库自身的文件大小,读取于2026年8月16日;GGUF文件大小可能因构建而异。

• F16 — 54.6 GB(2 个文件) — 参考精度
• Q8_0 — 29.0 GB — 接近无损,适用于高端GPU
• Q6_K — 22.4 GB — 每GB质量的最佳选择
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — 在较大显存显卡上提供高品质
• Q4_K_M — 16.8 GB — 推荐的默认选项
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — 最佳低比特选择(imatrix 校准)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — 适用于 16 GB 显卡
• IQ3_M — 12.8 GB — 体积小(imatrix 校准)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — 最小的K量化,质量上有明显的妥协
硬件指南:{{1}}Q4_K_M 适用于 24 GB 显存(RTX 4090 或 RTX 3090);16 GB 显存可选 IQ4_XS 或 Q3_K_M;只有当你的显存被限制为 12 GB 时才用 Q2_K{{/1}}。由于{{2}}基础模型采用混合 Gated DeltaNet 注意力机制,KV 缓存很小——8K 上下文下约为 0.5 GB——因此窗口可以推得比传统 27B 密集模型高得多{{/2}}。视觉部分额外增加一个独立文件:{{3}}F16 投影器为 931 MB{{/3}}。社区也有基于同一基础模型的 9 量化 abliterated 系列;{{4}}我们的是官方文档记载的 FP8 abliteration 的转换版本,imatrix 量化与模型卡上的 refusal-delta 数值均予以保留{{/4}}。
如何在 llama.cpp 中运行它
三个步骤。一个不太明显的要求:qwen35 架构和 MTP 支持于 2026 年 5 月合入 llama.cpp,因此更新到 2026-05 或更新版本的构建——旧版本构建将无法加载这些文件(根据仓库 README)。
1. 下载你选择的量化模型和视觉投影器。 该仓库是受限制访问的,因此你需要先登录 Hugging Face 并接受相关条件——阅读 README 也是接受此模型本质的一部分。
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. 启动 llama-server。这将提供一个兼容 OpenAI 的端点;-ngl 99/ 将所有层都卸载到 GPU。
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3.(可选)启用 MTP 投机解码头。添加 --spec-type draft-mtp/ — nextn 头内置于每个量化版本中,因此无需单独的草稿模型。

纯文本研究运行可以去掉--mmproj/;图像输入需要它,因为这是一个原生视觉-语言模型。端点为 http://localhost:8080/v1/chat/completions,因此现有 OpenAI SDK 代码只需更换基础 URL 即可使用。
没有 GPU?同一无审查系列已托管。
本地 GGUF 每 token 无需成本,但 Q4_K_M 级别大约需要 17 GB 显存。如果你没有相应硬件,OrcaRouter 上托管的 obsidian/Qwen3.8-27B 提供同款无审查 27B 系列——视觉、推理、262K 上下文——输入每百万 token 0.40 美元,输出每百万 4.21 美元,访问权限仅限于安全研究人员、红队和 AI 安全研究者。相同的权重家族,两种运行方式:本地 GGUF,云端 FP8。无论哪种方式,审核决定权都在你这边。
安全边界——下载前请阅读
这个模型的安全对齐已被大幅移除。它会遵从基础版 Qwen3.8-27B 会拒绝的有害、不道德、冒犯性或非法请求,并且没有内置的有意义的护栏。它严格仅限用于合法研究——可解释性、拒绝机制研究、红队测试、鲁棒性评估和护栏测试。您对如何使用它以及它生成的一切内容承担全部责任和义务,并且未经添加您自己的安全、审核和滥用防护层,不得将其部署给最终用户或投入生产环境。作者不承担任何责任。许可证为 Apache 2.0。

实测行为告诉你"无审查"的代价。模型卡的安全评估套件——于2026年8月15日在FP8构建(即本GGUF所转换的权重)上运行——显示:有害提示词的拒答率从基座的64–99%降至abliterated权重的0–6%,良性过度拒答从5.6%降至0.4%,能力得分与基座相比保持在±1.3分以内。这些数字正是这类模型成为合理研究对象的原因——同时也是警示。
这篇文章特意不包含任何有害提示。如果你正在评估该模型,请运行标准的拒绝基准——AdvBench、HarmBench、StrongREJECT、XSTest-safe——然后亲自查看数据。这才是研究移除拒绝机制的模型的正式途径。
当此构建是错误答案时
1. 你想要一个正常的助手。 错误的模型。它没有护栏,会遵从有害请求。请改用对齐后的 Qwen3.8-27B。
2. 任何你会直接提供给终端用户的内容。 无论意图如何,这都是错误的模型。Apache 2.0 并不会转移你的责任,向用户交付一个没有防护栏的模型并不是一种部署策略。
3. 你正在使用 Apple Silicon。GGUF 可以运行,但基础模型的 MLX 转换版本是更自然的选择——请参阅我们单独的 MLX 指南。
4. 你根本不想运行它。使用托管卡——相同的权重,无需17 GB显存,而且具有相同的研究专用门槛。
底线
"Qwen 3.8 27B uncensored GGUF"有一个答案,而且是一个具体的下载:Qwen3.8-27B-Uncensored-GGUF——包含面向llama.cpp的F16以及12个量化层级,来自我们FP8构建的abliterated权重,262K上下文、视觉和MTP,遵循Apache 2.0许可,仅限研究用途。在24 GB显卡上选择Q4_K_M,将llama.cpp更新到2026年5月之后的版本,并将其作为本地OpenAI兼容服务器运行。它是用于研究拒绝行为和测试护栏的研究工具——不是聊天机器人,也不是可以发布的东西。权重是免费的;你用它们做什么,责任完全在你。
对于合法研究,F16 和全部 12 个量化层级都在 Hugging Face 上:从 Hugging Face 下载 GGUF
