编辑风格的扁平矢量插画,用作科技博客头图,主题是在自有硬件上本地运行未经审查、去除安全对齐的大语言模型:一个深蓝色的大型圆角模型芯片带有柔和的青色辉光,漂浮在画面中左位置,其内部电路从闭合的锁形逐渐溶解为打开的锁形。在其右侧,工作台上放着一张紧凑的GPU显卡,旁边是一个细长的终端窗口,内有抽象的横向命令条,旁边还有一个小小的羊驼剪影。画面右上角有一个小型显微镜图标和一个带警告三角形的圆角盾牌,暗示研究用途与安全边界。背景为柔和的浅蓝色和白色,下方三分之一处留有充足的空白空间。画面中没有任何可读文字。
Guides & Insights

如何在本地运行 Qwen3.8-27B-Uncensored:GGUF 量化、llama.cpp 和 Ollama

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

要在本地运行 Qwen3.8-27B-Uncensored,请从 Hugging Face 拉取受限(gated)GGUF 仓库 orcarouter/Qwen3.8-27B-Uncensored-GGUF,根据你的显存选择量化版本——24 GB 显卡选 Q4_K_M(16.8 GB),16 GB 显卡选 IQ4_XS(15.3 GB),想要更多上下文余量时选 Q3_K_M(13.5 GB)——然后用当前版本的 llama.cpp 构建来运行它,并加上 --jinja 标志,如果需要视觉能力再加 --mmproj。同一个文件只需三条命令即可导入 Ollama。这是 abliterated Qwen3.8 27B 构建的 GGUF 版本,发布于 2026 年 8 月 16 日,每个量化版本都保留了原生 262K 上下文、视觉投影器和 MTP 推测解码头。它是一个研究工具,而不是助手:它的拒绝行为已被移除,不内置任何护栏,许可证为 Apache 2.0。下载前请先阅读本页底部的安全边界说明——这正是该受限仓库存在的意义。

哪个GGUF要下载,按VRAM分

该仓库附带一对全精度文件和十二个量化文件,因此下载决策实际上取决于显存(VRAM)容量。以下数字是2026年8月16日从Hugging Face仓库读取的文件大小。

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

仓库里到底有什么?

orcarouter/Qwen3.8-27B-Uncensored-GGUF 包含十五个模型文件:F16 权重分为两部分,十二个量化 GGUF——Q2_K、Q3_K_S、Q3_K_M、Q3_K_L、Q4_K_S、Q4_K_M、Q5_K_S、Q5_K_M、Q6_K、Q8_0、IQ3_M 和 IQ4_XS——以及 mmproj 视觉投影器。它是与 Qwen3.8-27B-Uncensored-FP8 相同的 abliterated 构建的 GGUF 导出,为 llama.cpp 类本地运行时重新打包,并继承了基础模型的 Apache 2.0 许可证及其原生 262,144 token 上下文。

三个属性在所有量化版本中保持一致。架构是qwen35——混合注意力架构,包含48个Gated DeltaNet线性层和16个全注意力层——这就是为什么该仓库在旧版llama.cpp构建中无法加载,也是KV缓存保持较小的原因。MTP(nextn)投机解码头在所有量化版本中都保留,无论是K-quant还是IQ。此外,聊天模板是Qwen Jinja模板,你必须显式启用(见下文),否则多轮对话会中断。

为什么 KV 缓存能保持小到足以发挥作用

这就是让本地部署方案可行的关键细节。在64层中,只有16层使用完全注意力机制;其余48层使用Gated DeltaNet线性注意力,不保留传统的KV缓存。根据该架构原始运行手册的测量结果,实际效果是KV缓存大约为2 GB(32K上下文)——大约是传统27B模型所需缓存量的四分之一。这就是为什么16.8 GB的Q4_K_M文件在长上下文窗口下仍能装进24 GB显卡,也是为什么无审查GGUF系列可以在根本无法承载55.6 GB BF16检查点的硬件上运行。

使用 llama.cpp 运行它。

llama.cpp 是预期路径。你需要当前版本:主干已注册 qwen35 架构,旧版本会直接拒绝该文件。命令形式,根据模型卡的用法说明和该架构的运行手册,如下:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

这样您就能在 localhost:8080 获得一个 OpenAI 兼容端点。如需图像输入,请添加 --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf。将 Q4_K_M 替换为与您的 VRAM 匹配的量化版本;这些选项完全相同。

使用 Ollama 运行它

Ollama 通过从 Modelfile 导入同一文件来运行它,这是添加库中不存在的 GGUF 所支持的方式。在存放您下载的量化文件的目录中:

FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

将那行保存为 Modelfile,然后ollama create qwen3.8-27b-uncensored -f Modelfile 以及ollama run qwen3.8-27b-uncensored。对于视觉功能,请在 Modelfile 中添加 mmproj 行(FROM ... Q4_K_M.gguf 加上 mmproj 路径),Ollama 会自动接入投影器。同样的 --ctx 和模板注意事项也适用:设置你实际能容纳的上下文大小,并记住,移除了拒绝机制的模型在回答时,你和输出之间没有任何防护栏。

拒绝移除实际改变了什么

该模型卡发布了此构建的安全评估套件。关闭思考时,标准有害提示基准上的拒答率从基础模型的64–99%降至0–6%(abliterated权重);开启思考时,它几乎从不拒答——不超过1.7%。能力基准与基础模型保持在±1.3分以内。这就是该系列所有abliterated版本的模式:拒答被移除,能力保持不变,同时还要注意,相当一部分回答在回应前仍会附加一段简短免责声明——这是训练产物,而非拒答。

另一面正是下方安全边界的全部意义所在:一个从不拒绝的模型并不是更好的助手,它是一种不同的客体。它是用来测量拒绝机制、并查明你自己的护栏是否有效的测试仪器。

在研究中实际该拿它做什么

被认可使用去除拒答能力模型的三个合法项目:

当此构建是错误答案时

如果您想要一个普通的助手,或任何会放在最终用户面前的东西,那么这个模型就是错误的选择——它没有有意义的內建护栏,会遵从基础模型拒绝的请求,而且Apache 2.0并不会转移您的责任。要实现那些用途,请使用原始对齐的Qwen3.8-27B。如果您想在聊天机器人上规避拒答,系统提示词包比权重修改效果更好、风险更低。如果您完全没有GPU但仍想研究该模型,OrcaRouter上托管的obsidian/Qwen3.8-27B卡片提供相同的无审查版本,输入每百万token收费$0.40,输出每百万token收费$4.21,同样支持262K上下文;它与仓库一样仅对安全与AI安全研究人员开放,审核决定权仍掌握在您手中。模型卡中有定价和基准测试的详细信息。

安全边界——下载前请阅读

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

该模型的安全对齐已被{{1}}大幅移除{{/1}}。对于原始 Qwen3.8-27B 会拒绝的有害、不道德、冒犯性或非法请求,该模型会予以遵从,并且没有{{2}}有意义的固有护栏{{/2}}。它仅被严格地用于合法研究——{{3}}可解释性、AI 安全与拒答机制研究、红队测试、鲁棒性评估和受控实验{{/3}}。{{4}}您须对如何使用它以及它生成的一切内容承担全部责任{{/4}},并且除非自行添加安全、审核和滥用防护层,否则不得将其部署给最终用户或投入生产。作者对任何滥用行为不承担责任。下载本仓库即表示您接受上述条件;许可证为 Apache 2.0。

本文特意不包含任何有害提示。上述拒答数字来自模型卡自带的安全评估套件,而这是衡量此类模型的正确方法:运行标准的拒答基准测试,读取这些数字,并围绕它们所显示的结果来设计你的研究。

来源和日期

以上所有事实已于2026-08-16核实。文件列表和大小来自Hugging Face仓库orcarouter/Qwen3.8-27B-Uncensored-GGUF(创建于2026年8月16日;架构qwen35;Apache 2.0;受限访问)。拒绝回答和能力数值来自模型卡的安全评估套件。KV缓存测量结果(32K上下文下约2 GB)来自OrcaRouter针对该架构的操作手册《How to Run Qwen 3.8 27B Locally》。托管定价和访问限制来自obsidian/Qwen3.8-27B模型页面,已于同一天核查。量化文件大小按Hugging Face上存储的十进制GB计。

对于合法研究,权重可在 Hugging Face 上获取:从 Hugging Face 下载——无需信用卡,60 秒内即可使用。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube