
如何在本地运行 Qwen3.8-27B-Uncensored:GGUF 量化、llama.cpp 和 Ollama
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
要在本地运行 Qwen3.8-27B-Uncensored,请从 Hugging Face 拉取受限(gated)GGUF 仓库 orcarouter/Qwen3.8-27B-Uncensored-GGUF,根据你的显存选择量化版本——24 GB 显卡选 Q4_K_M(16.8 GB),16 GB 显卡选 IQ4_XS(15.3 GB),想要更多上下文余量时选 Q3_K_M(13.5 GB)——然后用当前版本的 llama.cpp 构建来运行它,并加上 --jinja 标志,如果需要视觉能力再加 --mmproj。同一个文件只需三条命令即可导入 Ollama。这是 abliterated Qwen3.8 27B 构建的 GGUF 版本,发布于 2026 年 8 月 16 日,每个量化版本都保留了原生 262K 上下文、视觉投影器和 MTP 推测解码头。它是一个研究工具,而不是助手:它的拒绝行为已被移除,不内置任何护栏,许可证为 Apache 2.0。下载前请先阅读本页底部的安全边界说明——这正是该受限仓库存在的意义。
哪个GGUF要下载,按VRAM分
该仓库附带一对全精度文件和十二个量化文件,因此下载决策实际上取决于显存(VRAM)容量。以下数字是2026年8月16日从Hugging Face仓库读取的文件大小。

仓库里到底有什么?
orcarouter/Qwen3.8-27B-Uncensored-GGUF 包含十五个模型文件:F16 权重分为两部分,十二个量化 GGUF——Q2_K、Q3_K_S、Q3_K_M、Q3_K_L、Q4_K_S、Q4_K_M、Q5_K_S、Q5_K_M、Q6_K、Q8_0、IQ3_M 和 IQ4_XS——以及 mmproj 视觉投影器。它是与 Qwen3.8-27B-Uncensored-FP8 相同的 abliterated 构建的 GGUF 导出,为 llama.cpp 类本地运行时重新打包,并继承了基础模型的 Apache 2.0 许可证及其原生 262,144 token 上下文。
三个属性在所有量化版本中保持一致。架构是qwen35——混合注意力架构,包含48个Gated DeltaNet线性层和16个全注意力层——这就是为什么该仓库在旧版llama.cpp构建中无法加载,也是KV缓存保持较小的原因。MTP(nextn)投机解码头在所有量化版本中都保留,无论是K-quant还是IQ。此外,聊天模板是Qwen Jinja模板,你必须显式启用(见下文),否则多轮对话会中断。
为什么 KV 缓存能保持小到足以发挥作用
这就是让本地部署方案可行的关键细节。在64层中,只有16层使用完全注意力机制;其余48层使用Gated DeltaNet线性注意力,不保留传统的KV缓存。根据该架构原始运行手册的测量结果,实际效果是KV缓存大约为2 GB(32K上下文)——大约是传统27B模型所需缓存量的四分之一。这就是为什么16.8 GB的Q4_K_M文件在长上下文窗口下仍能装进24 GB显卡,也是为什么无审查GGUF系列可以在根本无法承载55.6 GB BF16检查点的硬件上运行。
使用 llama.cpp 运行它。
llama.cpp 是预期路径。你需要当前版本:主干已注册 qwen35 架构,旧版本会直接拒绝该文件。命令形式,根据模型卡的用法说明和该架构的运行手册,如下:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
这样您就能在 localhost:8080 获得一个 OpenAI 兼容端点。如需图像输入,请添加 --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf。将 Q4_K_M 替换为与您的 VRAM 匹配的量化版本;这些选项完全相同。
使用 Ollama 运行它
Ollama 通过从 Modelfile 导入同一文件来运行它,这是添加库中不存在的 GGUF 所支持的方式。在存放您下载的量化文件的目录中:
FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
将那行保存为 Modelfile,然后ollama create qwen3.8-27b-uncensored -f Modelfile 以及ollama run qwen3.8-27b-uncensored。对于视觉功能,请在 Modelfile 中添加 mmproj 行(FROM ... Q4_K_M.gguf 加上 mmproj 路径),Ollama 会自动接入投影器。同样的 --ctx 和模板注意事项也适用:设置你实际能容纳的上下文大小,并记住,移除了拒绝机制的模型在回答时,你和输出之间没有任何防护栏。
拒绝移除实际改变了什么
该模型卡发布了此构建的安全评估套件。关闭思考时,标准有害提示基准上的拒答率从基础模型的64–99%降至0–6%(abliterated权重);开启思考时,它几乎从不拒答——不超过1.7%。能力基准与基础模型保持在±1.3分以内。这就是该系列所有abliterated版本的模式:拒答被移除,能力保持不变,同时还要注意,相当一部分回答在回应前仍会附加一段简短免责声明——这是训练产物,而非拒答。
另一面正是下方安全边界的全部意义所在:一个从不拒绝的模型并不是更好的助手,它是一种不同的客体。它是用来测量拒绝机制、并查明你自己的护栏是否有效的测试仪器。
在研究中实际该拿它做什么
被认可使用去除拒答能力模型的三个合法项目:
当此构建是错误答案时
如果您想要一个普通的助手,或任何会放在最终用户面前的东西,那么这个模型就是错误的选择——它没有有意义的內建护栏,会遵从基础模型拒绝的请求,而且Apache 2.0并不会转移您的责任。要实现那些用途,请使用原始对齐的Qwen3.8-27B。如果您想在聊天机器人上规避拒答,系统提示词包比权重修改效果更好、风险更低。如果您完全没有GPU但仍想研究该模型,OrcaRouter上托管的obsidian/Qwen3.8-27B卡片提供相同的无审查版本,输入每百万token收费$0.40,输出每百万token收费$4.21,同样支持262K上下文;它与仓库一样仅对安全与AI安全研究人员开放,审核决定权仍掌握在您手中。模型卡中有定价和基准测试的详细信息。
安全边界——下载前请阅读

该模型的安全对齐已被{{1}}大幅移除{{/1}}。对于原始 Qwen3.8-27B 会拒绝的有害、不道德、冒犯性或非法请求,该模型会予以遵从,并且没有{{2}}有意义的固有护栏{{/2}}。它仅被严格地用于合法研究——{{3}}可解释性、AI 安全与拒答机制研究、红队测试、鲁棒性评估和受控实验{{/3}}。{{4}}您须对如何使用它以及它生成的一切内容承担全部责任{{/4}},并且除非自行添加安全、审核和滥用防护层,否则不得将其部署给最终用户或投入生产。作者对任何滥用行为不承担责任。下载本仓库即表示您接受上述条件;许可证为 Apache 2.0。
本文特意不包含任何有害提示。上述拒答数字来自模型卡自带的安全评估套件,而这是衡量此类模型的正确方法:运行标准的拒答基准测试,读取这些数字,并围绕它们所显示的结果来设计你的研究。
来源和日期
以上所有事实已于2026-08-16核实。文件列表和大小来自Hugging Face仓库orcarouter/Qwen3.8-27B-Uncensored-GGUF(创建于2026年8月16日;架构qwen35;Apache 2.0;受限访问)。拒绝回答和能力数值来自模型卡的安全评估套件。KV缓存测量结果(32K上下文下约2 GB)来自OrcaRouter针对该架构的操作手册《How to Run Qwen 3.8 27B Locally》。托管定价和访问限制来自obsidian/Qwen3.8-27B模型页面,已于同一天核查。量化文件大小按Hugging Face上存储的十进制GB计。
对于合法研究,权重可在 Hugging Face 上获取:从 Hugging Face 下载——无需信用卡,60 秒内即可使用。
