
Qwen3.8-Flash-Next-Uncensored:在 llama.cpp 和 Apple Silicon 上运行 Abliterated MoE 模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
在您下载任何内容之前:Qwen3.8-Flash-Next-Uncensored并不是Qwen3.8-27B-Uncensored。它们共享同一个家族名称和同一种去拒绝(abliteration)技术,但来自不同的权重版本;本博客早先每一篇“Qwen uncensored”帖子说的都是27B。这里要讲的是OrcaRouter于2026年8月26日发布到Hugging Face上的两个模型——orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF和orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX——它们是Qwen3.8-Flash-Next的去拒绝构建。Qwen3.8-Flash-Next是阿里巴巴的176B存储/6B激活的路由式混合专家(MoE)模型,是Qwen4架构的预览。我们发布这批权重时的说明是“GGUF + 原生MLX,上下文最高262K”,面向安全研究人员、红队和蓝队。这本操作手册是根据我们自己的模型卡写成的:在路由MoE内部,拒绝移除做了什么;262K上下文这一说法实际要消耗多少内存;如何同时服务两个文件系列;以及研究路线的位置。如果你是想来看去拒绝入门或27B量化数学,本系列较早的帖子已经覆盖了这些内容。

首先,大门。
两个仓库都在 Hugging Face 上设有访问门控(gated: auto)。在您登录并接受每个仓库的条款之前,无法下载任何文件——GGUF 和 MLX 仓库各自有独立的门控。这是与未设门控的 GGUF 版本线最实际的区别:天真的“直接 hf download”单行命令在获取任何字节之前就会因认证错误而失败。流程是:
• 登录 Hugging Face(或注册),安装 huggingface_hub,然后运行一次 hf auth login,以便将你的令牌保存到磁盘上。
• 在浏览器中打开 orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF,接受条款,然后对 orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX 重复此操作。
• 从那以后,使用你已认证的令牌进行 hf download,就跟任何其他仓库一样。你拉取的每个量化版本以及 MLX 权重,都是 Apache-2.0 许可下的研究工件——与基础模型相同的许可证——而这扇门本身就是协议的一部分:阅读条款是使用模型的第一步。

abliteration 对路由 MoE 模型会产生什么影响
这项技术就是我们在本博客其他地方介绍过的 Arditi 式权重编辑;有趣的是它对这一特定架构的具体作用。在稠密 27B 上,涉及的是 131 个残差矩阵。在 Qwen3.8-Flash-Next-Uncensored 上,MLX 模型卡记录了应用于 149 个残差写入张量的 abliteration,而构成该模型本质的组件——MoE 路由器、51B n-gram 嵌入表、视觉塔——则明确从未被改动过。
对于路由模型而言,“从未被触及”就是全部事实。每个 token 会激活 512 个专家中的 10 个;拒绝行为并非由某个单一专家负责。拒绝行为存在于构成最终输出的残差流中,而正交化移除的正是这一方向。因此,路由器继续路由相同的专家,n-gram 表继续产生相同的嵌入,变化的只是输出投影运行后模型所说出的内容。GGUF 模型卡上发布的检查结果将这种变化的形态描述为:有害提示词的拒绝率从基础模型的 64%–100% 降至此版本的约 0%–3.3%,良性过度拒绝接近 0%,在 MMLU-Pro / GSM8K / CMMLU 类检查上的能力与基础模型相差在 ±2 个百分点以内。这些是模型卡自己的数字,属自我报告,而非独立复现的结果。
MTP 头:MLX 中存在,GGUF 中已移除
Qwen3.8-Flash-Next 附带一个约 4B 参数的多 token 预测(MTP)投机解码头,而两个构建对此处理不同。GGUF 仓库将其排除——模型卡明确说明这些文件不包含 mtp 投机草稿头——因为 llama.cpp 的 qwen4exp 支持尚未实现 MTP,该头放在文件里只会成为无用负担。MLX 构建保留了它,所以在 Apple Silicon 上你依然能获得投机解码。实际后果(运行基础模型的从业者也印证了这一点):llama.cpp 的 GGUF 路径目前运行时没有投机解码,而启用 MTP 的 SGLang 设置在同类硬件上的解码速度提升超过一倍。如果 llama.cpp 未来为 qwen4exp 落地 MTP,GGUF 这条线就能免费获得加速——但别指望这周就为此买硬件。
关于262K上下文的说法,以及KV缓存的开销
原生上下文为 262,144 个 token(可通过 YaRN 扩展至接近 1M),而真正构成限制的是内存。好消息是,该架构将 KV 缓存保持在较小规模:在 48 层中,36 层使用 Gated DeltaNet 线性注意力,将历史信息压缩为固定大小的循环状态,只有 12 个全注意力层携带随序列长度增长的常规 KV 缓存。
两个社区实测的数据点都基于基础模型,可直接套用。一个4× RTX 3090的GGUF部署报告称,将上下文从65K扩展到131K,每张卡仅额外增加了约0.78 GB的KV缓存;而单个DGX Spark在运行完整262K上下文时,使用Q4类文件,通过将n-gram表固定到CPU并从NVMe进行mmap映射,使模型常驻内存保持在128 GB池中的约76.9 GB。GGUF模型卡自身的预算公式为:总量 = 文件大小 + KV缓存 + 约0.9 GB的mmproj。对量化选择而言,结论是:在262K上下文下,KV缓存确实是一项实际开销,但权重才是主导因素,因此27B GGUF指南中同样的“显存优先”逻辑依然适用——区别在于文件大小本身,从大约52 GB的IQ2_XXS到大约125 GB的Q5_K_M。
GGUF 系列:13 种量化版本、分片文件、mmproj 和 llama.cpp 构建
GGUF 仓库提供 13 个量化级别——IQ2_XXS、IQ2_M、IQ3_XXS、IQ3_M、IQ4_XS、Q2_K、Q3_K_S、Q3_K_M、Q3_K_L、Q4_K_S、Q4_K_M、Q5_K_S、Q5_K_M——其中 IQ 量化基于英语、中文和代码校准文本的重要性矩阵构建。每个量化都是多部分的,使用 llama-gguf-split 拆分,因此请为某个量化级别下载整套文件,并将加载器指向 ...-00001-of-000NN.gguf 部分。没有 Q6_K、Q8_0 或 F16 级别,原因是结构性的而非经济性的:n-gram (PLE) 嵌入表是一个张量,在 6 位及以上精度下,其大小超出了 Hugging Face 单个文件 50 GB 的限制,而单个 GGUF 张量无法跨文件拆分——因此该系列最高只能到 Q5_K_M。
另一个你不能跳过的文件是 mmproj-...-F16.gguf,约 0.9 GB:这是一个视觉语言模型,llama.cpp 需要投影器来处理任何图像输入。Qwen3.8-Flash-Next 是多模态的,这个构建版本也是如此——去抑制(abliteration)不会触及视觉塔(vision tower)。
llama.cpp 支持尚未进入主线。架构 id 是 qwen4exp,而官方构建会失败,报错 "unknown architecture 'qwen4_exp'";你需要使用 PR #27742(分支 qwen4exp/qwen3.8-flash-next)的构建,编译时包含 llama-cli、llama-mtmd-cli、llama-server 和 llama-gguf-split 目标。之后的服务形态就是通常的 llama.cpp 服务器,带上 Qwen 特有的标志,使用来自分片文件的量化名称:
llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
设置 -c 为你所能容纳的任何上下文长度;该卡片的示例从 8192 开始。推理默认开启并通过 reasoning_content 返回,工具调用可通过兼容 OpenAI 的端点工作。上述采样值是模型卡片的推荐;在基础模型上,实践者在非思考指令模式下使用 temp 0.7 / top-p 0.80 / top-k 20,并将存在惩罚(presence penalty)设为 1.5,同时通过 --chat-template-kwargs {"reasoning_effort":"medium"} 调整推理深度。
在 Apple Silicon 上的 MLX 构建
MLX 仓库是 Apple Silicon 原生路径:相同的权重、相同的拒绝移除、Metal 原生运行时。默认提供 4-bit 版本(约 163 GB),另有已公布的 6-bit 构建(约 192 GB)和 8-bit 层级(约 221 GB)。由于融合 3D 专家和 n-gram 表以高于标称标签的精度保留,有效精度远高于均匀 4-bit——卡片上"4-bit"标签的每权重有效位数约为 7.85。这就是仓库大小看起来很大的原因:n-gram 表没有像社区量化那样被压缩。

硬件是硬性约束。MLX 仅能在 Apple Silicon(Metal)上运行,而且你需要统一内存来容纳权重——模型卡上的说明是“一台内存足以容纳 163 GB 权重的 Mac(例如 M 系列 Ultra)”。将 4-bit 档视为 192 GB 级机器,将 6-bit 构建视为 256 GB 级。模型卡的标签记录了完整的功能集——qwen4_exp、MoE、MTP、函数调用、视觉语言——并通过 mlx-vlm 来处理图像输入。这里包含了 MTP 推测头,这是 MLX 构建相对于 GGUF 系列的一个隐性优势。
视觉路径,适用于使用它的人
由于这是一个视觉语言模型,多模态路径本身就是操作流程的一部分,而不是额外功能。在 llama.cpp 上,图像输入既需要 mmproj 投影器,也需要包含 llama-mtmd-cli / llama-server 的构建版本。在 MLX 上,应使用 mlx-vlm 来驱动,而不是仅支持文本的 mlx-lm 驱动。对于红队而言,视觉路径才是评估工作真正有趣的地方:多模态护栏、藏在图像中的提示注入、对自有系统截图进行 OCR,以及针对整个流水线的对抗性图像。由于 abliteration 覆盖整个模型且让视觉塔保持完整,一张原本会在文本端触发拒答的图像,最终只会落在一个没有任何拒答行为可触发的模型上。GGUF 模型卡显示,视觉与多轮工具调用已在此构建上验证通过;目前未发布单独的视觉评估套件。
这是做什么用的,以及界限在哪里
这个构建只服务于一类工作:评估一个移除拒绝机制的模型能做什么,以帮助理解和防御系统。对于红队来说,这意味着要用一个不会礼貌拒绝的模型来测试你自己的护栏——提示注入防御、数据窃取场景、工具滥用,以及“基础模型会拒绝”和“该模型实际上做不到”之间的差距。这个差距正是 abliterated 版本的全部研究价值:它告诉你拒绝层之前隐藏了什么,也就是“基于策略的安全”与“基于能力的安全”之间的区别。对于蓝队来说,同样的权重就是攻击者可能的基线:如果敌对行为者能下载并运行它,那么你的防御必须能抵御一个会回答而不是推脱的模型。基于它构建的评估是一个自定义、从未对齐的模型可能做到的事情的下限——请这样看待,而不是上限。
要明确移除拒绝行为改变什么、不改变什么。它改变的是输出行为——模型不再拒绝回答——而不改变能力。没有新知识、没有新技能、没有新增算力;训练不变,模型实际能产出的极限也不变。一个经消融(abliteration)处理过的模型,无法设计出它原先没有能力设计的恶意软件;它只是直接回答而不再兜圈子,而且它的输出并不会因为更放任就更加真实。模型卡上±2分的能力区间与拒绝数字的崩塌,是同一事实的两面。
这条界限由门控仓库协议划定,且并非套话。合法用途:评估你自己的系统、对模型进行公开漏洞研究、构建检测与防御性评估、研究拒答机制。不合法用途:将其部署为面向用户的助手、生成针对你不拥有或未经授权测试的系统的可用恶意软件或漏洞利用程序、欺诈、武器材料。Apache-2.0 许可证和适用法律是底线;门控机制是高于其上的明确研究用途协议。如果你的用例是“向用户提供聊天机器人”,那这不是你的模型——这是有意设计,而非疏忽。
如何获取已上线的基线
这些权重有意仅限本地使用:红队的探测载荷绝不应经过第三方API,而自托管正是关键所在。当您需要受审查的托管基线进行比较时——Alibaba的Qwen3.8-Flash,每百万输入0.16美元、每百万输出0.47美元——OrcaRouter按供应商标价路由,0%加价并自动故障转移,因此评测工具只需一个密钥即可在托管基线与本地未审查版本之间切换,无需第二份合同。开放的Qwen3.8-Flash-Next权重尚未收录在我们的目录中;当我们路由的某个运行时提供这些权重时,它们会进入同样的单密钥、标价配置。
从这里开始
先确认哪一行与你的硬件匹配,然后阅读对应的门槛说明。在配备 128 GB 或以上统一内存的 Mac 上,MLX 版本让你在同一个环境中同时获得 MTP 和视觉功能——接受 MLX 仓库的条款,下载 4-bit 或 6-bit 权重,然后用 mlx-vlm 驱动它们。在 NVIDIA、AMD 或 CPU 机器上,从 PR #27742 构建 llama.cpp,接受 GGUF 仓库的条款,拉取合适的量化版本,并且别忘了 mmproj 文件。两种情况下,拒答率数字和能力区间都出自仓库自身,发布在模型卡片上,截至本文写作时尚未被独立复现——诚实的解读方式是把它们视为厂商对自己修改的测量结果,而非独立审计。上面的门槛、许可证和安全边界是同一段文字从三个角度展开:这是一个研究工具,并且它正是在这一条件下发布的。
所有五种 Flash-Next 构建 — BF16、GGUF、MLX、FP8 和 NVFP4 — 都收录于Qwen3.8-Flash-Next-Uncensored 集合Hugging Face 上的
不要与27B系列混淆:Qwen3.8-27B-Uncensored是一个从不同基础模型经abliterated处理得到的独立模型,拥有自己的集合和运行手册。技术相同,权重不同。
这些权重在设计上仅限本地使用。如需一个托管基线来对照衡量abliterated构建,Qwen3.8-Flash在OrcaRouter上以提供商列表价格提供服务,零加价——即原版模型,安全对齐保持不变。
