
Qwen3.8-27B-Uncensored-NVFP4:面向Blackwell GPU的服务运行手册
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
Qwen3.8-27B-Uncensored-NVFP4自2026年8月19日起已在Hugging Face上架,此后十天里已被下载约32,700次。这不是发布报道——权重已发布十天,没有公告可报,而且姊妹构建Qwen3.8-27B-Uncensored-FP8和Qwen3.8-27B-Uncensored-GGUF已在本博客中有过记录。这是一份针对人们目前正在积极下载的构建的操作手册:NVFP4究竟是什么,为什么这个特定构建要将其与FP8混用,哪些GPU能受益而哪些不能,如何部署它,以及哪些人应该选择它而不是FP8或GGUF构建——以及哪些人不应该。
先说一点,因为每个第一次下载的人都会在这里栽跟头:该仓库是受限的。直接使用hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4这一行命令会报认证错误,除非你已登录 Hugging Face 并在模型页面上接受了该仓库的访问条款。以下所有内容都假定你已完成这两步。
另外先说清楚:这个仓库的模型卡也在同一道门禁之后,因此这里没有任何内容是对它的转述。下文依据的是公开的文件列表与仓库元数据、NVIDIA 公开的 NVFP4 文档,以及人们在 Blackwell 上服务 Qwen3.8-27B NVFP4 构建的一线报告。凡是由实践者而非厂商提供的数字,文中都会注明。

这个构建是什么
Qwen3.8-27B-Uncensored-NVFP4 是 Qwen3.8-27B-Uncensored 的 NVFP4 量化版本,即 Alibaba 的 Qwen/Qwen3.8-27B 的 abliterated 版本,由 orcarouter 组织于 2026-08-18 发布。Abliteration 会从残差流中移除模型的拒绝方向;该技术在我们的 uncensored-model 说明文章中已有解释,此处不再赘述。基础模型是密集 27B,采用混合注意力机制——48 层线性注意力层加 16 层全注意力层——原生支持图像和视频理解,上下文窗口达 262,144 token,并内置 MTP 推测解码头。全链路采用 Apache 2.0 许可。
这个构建的有趣之处不在于abliteration,而在于量化布局,因为它刻意是一个量化构建——如果你搜索过NVFP4,格式就是重点。根据仓库的公开元数据和量化配置,这是一个混合精度的compressed-tensors构建:注意力投影使用FP8(E4M3),MLP使用NVFP4(4位,打包),而视觉编码器、MTP头、lm_head以及线性注意力的归一化和偏置保留为BF16。公开文件列表的safetensors元数据与该方案一致:大约35亿个参数为BF16,94亿个为FP8-E4M3,150亿个为打包的4位张量,分布在五个分片加上一个单独的model-extra分片中,磁盘上约24.7 GB。这些都不是关于它如何服务的说法——这个确切仓库的运行时VRAM和吞吐量目前没有任何我可以引用的公开来源。磁盘大小来自文件列表,格式来自配置,下面的服务行为是社区在密切相关的NVFP4构建上验证的。
NVFP4 是什么,以及它与 FP8 和 INT8/AWQ 的区别
NVFP4 是 NVIDIA 的 4 位浮点格式,专为 Blackwell 上的第五代张量核心引入,NVIDIA 自家的技术博客正是了解它的权威一手来源。它以 E2M1 存储权重——1 个符号位、2 个指数位、1 个尾数位——并按块缩放:每 16 个值共享一个 E4M3 FP8 缩放系数,整个张量则配有一个逐张量的 FP32 标量。这种两级方案正是该格式的核心要义:它恢复了朴素 4 位浮点会丢失的动态范围,代价是每块要多花几个比特的开销。实际差异,用一句话概括:
• NVFP4 vs FP8两者都是浮点格式,但 FP8(E4M3,8 位)可在 Hopper 和 Blackwell 上运行,而 NVFP4 是 4 位格式,仅在 Blackwell 上原生加速。NVIDIA 称其权重比 FP16 小约 3.5 倍,比 FP8 小约 1.8 倍;在 Blackwell 上,矩阵乘法直接运行于 FP4 张量核心。
• NVFP4 与 INT8/AWQ — INT8(W8A8)和 AWQ(W4A16)是从 Ampere 架构起支持的整数格式;AWQ 虽为 4 位,但仍属整数,在大多数硬件上,权重会被反量化为更宽的类型以进行矩阵乘法(matmul)。NVFP4 是带块缩放的 4 位浮点格式,因此在低位能保留更多精度,并且它拥有整数格式所不具备的原生 FP4 GEMM 路径。
• NVFP4 vs MXFP4——这两者经常被混淆。MXFP4 使用 32 元素块和 E8M0(2 的幂)缩放因子;NVFP4 使用 16 元素块和 E4M3 缩放因子。更细粒度的块让 NVFP4 具有更好的离群值隔离能力,这也是该格式成为 Blackwell 服务栈上事实上的 4 位标准的原因。

哪些硬件受益——哪些不受益
关于此构建版本最重要的一点:NVFP4 是 Blackwell 格式。它只有在张量核心原生实现 FP4 GEMM 的 GPU 上才能发挥价值;在其他任何硬件上,无论纸面速度多快,它都是错误的工具。
• Blackwell — RTX 50 系列、B200/B300、RTX PRO 6000、DGX Spark (GB10)——这正是 NVFP4 的用武之地:原生 FP4 张量核心、无审查产品线中最小的服务器级占用空间,以及这套构建为之而生的格式。
• Hopper — H100/H200 — 没有原生 FP4 GEMM。NVFP4 会退化为仅权重的反量化路径,速度更慢且毫无收益。此处请使用 Qwen3.8-27B-Uncensored-FP8;该构建已在此硬件上验证。
• Ampere/Ada — RTX 3090/4090 — NVFP4 在这些显卡上同样无法加速。GGUF 版本(Q4_K_M 档位,16.8 GB)才是 24 GB 显卡的正确选择。
• Apple Silicon — NVFP4 在 Mac 上无关紧要。MLX 版本(或 GGUF)才是实际运行的。
坦诚说明一点:社区分支确实在Blackwell之前的硬件上运行NVFP4仅权重量化。同一abliterated模型的社区NVFP4构建,通过打过补丁的vLLM分支明确支持V100级别显卡;而最近围绕Qwen3.8-27B的DGX Spark方案则另当别论。这些是各有注意事项的专业路径,并非本构建的目标。如果你用的是Blackwell,这些都无关紧要;如果不是Blackwell,FP8或GGUF构建是更合适的下载选择。
如何盛盘
该仓库已标记为 {{1}}vLLM{{/1}} 版本,压缩张量格式会自动从 {{2}}config.json{{/2}} 中读取——你无需手动选择量化方案。从业者为 {{3}}Qwen3.8-27B NVFP4{{/3}} 构建所采用的通用技术栈是:Blackwell 显卡上的最新版 {{4}}vLLM{{/4}}、{{5}}FP8 KV 缓存{{/5}},以及模型自带的 {{6}}MTP{{/6}} 头用于投机解码。{{7}}Unsloth 的 NVFP4 指南{{/7}}(被引用最广泛的社区参考资料)建议使用 {{8}}vLLM 0.25.0{{/8}} 或更新版本,并安装 {{9}}FlashInfer{{/9}} 和 {{10}}CUTLASS-DSL 内核{{/10}} 依赖以启用快速 FP4 路径。
一个可用的起点,由我们 FP8 构建中已验证的标志和社区的 NVFP4 配方组合而成,全部放在同一行上:
vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'
• FP8 KV cache — 这是最广泛兼容的将缓存内存减半的方式;实践者报告说它大致能让可容纳的上下文翻倍。NVFP4 KV-cache 支持存在,但仅限于某些注意力后端,因此 FP8 KV 是更安全的默认选择。
• MTP 投机解码——模型自带 MTP 草稿头,量化时将其保持为 BF16。实践者报告称,在 Blackwell 上使用 NVFP4 权重时,两到三个草稿 token 效果良好,最大的收益体现在 JSON 和工具调用等结构化输出上。
• 视觉 —— 此版本中视觉编码器保留为 BF16。添加 --language-model-only 以仅提供文本服务;如果需要图像或视频输入,则去掉该参数。
• 在 DGX Spark 上——一些来自现场报告的注意事项:将 --gpu-memory-utilization 保持在不高于 0.90(更高的值在权重加载期间曾导致机器卡死),并添加 --safetensors-load-strategy lazy(如果内存紧张)。你还需要一个用于 sm_121a 内核的 GB10 版 vLLM 构建。
诚实的性能说明:这个仓库本身没有已发表的独立吞吐量数字。现有的测量数据来自密切相关的 NVFP4 构建。Unsloth 报告其自有的 Qwen3.8-27B-NVFP4 构建在 B200 上每秒 token 数是 BF16 的 1.41–1.49 倍(batch 1 时从 89.8 到 133.7 tok/s,batch 64 时从 3,048 到 4,407),还有一位 NVIDIA 论坛上的 DGX Spark 用户报告称,使用 NVFP4 权重、FP8 KV 缓存和 MTP 深度 3 时大约为 20–32 tok/s。两者都值得引用;但都不是本仓库的基准测试。
真正有效的使用模式
在 Blackwell 上运行 Qwen3.8-27B 系列模型的从业者,最终都会采用少数几项设置。请将这些视为实地报告,而非厂商指南——Qwen 官方并未记录其中大部分内容,并且该仓库自身的模型卡片也受到访问限制。
• reasoning_effort 是最重要的调节旋钮。默认的 xhigh 会让模型在每次请求上思考很长时间。运行 agent 循环的人默认设置为 medium,并降至 low——或者完全禁用思考,通过enable_thinking: false——用于对延迟敏感的单次调用。在单个 Blackwell GPU 上,对常规任务使用 xhigh 推理,最终就会得到一个模型很快但回答很慢的结果。
• 采样器与思考模式配对使用,并非独立。社区共识:思考开启时使用 temperature 1.0 / top_p 0.95;思考关闭时使用 temperature 0.7 / top_p 0.80,presence_penalty 为 1.5。互换这两组设置会降低输出质量。
• 使用当前的聊天模板。 qwen3_5 模板会将每条助手回复都包裹在思考块中,多位实践者反映使用过时模板会导致回答循环或截断;社区修复的 Qwen-Fixed-Chat-Templates 和 Qwen-Sharp 变体设置了 preserve_thinking,从而停止循环。如果你的服务输出越过停止符仍在漫无边际地生成,这是首先要检查的问题。
• 为智能体工作中的长推理轨迹预留预算。从业者报告称,3.8 代模型每个任务生成的 token 数量约为其 3.6 前代的两倍——质量提升部分源于更长的思考。对于长 xhigh 答案,请流式输出推理结果,否则将遭遇网关超时。
• 工具调用在量化过程中保持完整。函数调用路径在abliteration和4位转换后依然有效;使用qwen3_coder工具调用解析器启用它,模型选择工具的方式与基础模型相同。

谁应该选择这个构建——以及谁不应该
坦诚的决定,不再重复我们在FP8和GGUF文章中已经详细讨论过的量化选择计算:
• 那么请选择 NVFP4。如果你在 Blackwell 上提供服务,希望在无审查系列中获得最小的服务器级占用空间,并具备 FP4 张量核心速度——并且你正在进行研究、红队或可解释性工作,这些工作确实需要一个 abliterated 模型,
• 选择 Qwen3.8-27B-Uncensored-FP8,如果你正在使用 Hopper,或者你希望使用最广泛验证的 vLLM 路径——它是相同权重的 8 位版本,已在 H200 上验证,VRAM 下限约为 40 GB。
• 那就选 Qwen3.8-27B-Uncensored-GGUF。如果你使用的是消费级 GPU 或 Mac,或者你想要 llama.cpp 而不是 vLLM(Q4_K_M 级别是本地的最佳选择),
• 两者都不要选,如果你想要最大保真度、正在构建任何面向用户的东西(参见下文的安全边界),或者完全不想自行托管——同样的未审查版本通过OrcaRouter提供,仅限研究人员访问,因此无需GPU。
安全边界 — 仅限研究
这是一个abliterated模型,量化过程并未将安全护栏重新加回。拒绝方向已从{{1}}Qwen/Qwen3.8-27B{{/1}}的残差流中移除,而NVFP4只是精度格式的变更,并非安全干预措施——该模型会遵从基础模型所拒绝的请求,且此构建版本不包含内置的审查机制。它依据{{2}}Apache 2.0{{/2}}许可发布,用于可解释性、AI安全与红队研究,相关责任由你自行承担。
在无审查模型领域中,有两项评估注意事项很少被提及。首先,一个能轻松通过的越狱探测并不等于通过安全评估——abliterated 模型是故意在这些探测上失败的。请用合适的测试套件来衡量你真正关心的指标(有害性用 AdvBench、HarmBench 和 StrongREJECT;过度拒答用 XSTest-safe),并对比干预前后的拒答率。其次,要评估量化模型,而不只是基础模型:即使总体分数看起来没问题,4-bit 版本也可能在边缘情况下改变行为。在没有自行构建内容审核与滥用防护层之前,切勿将该模型部署给终端用户。
OrcaRouter 的适用场景
一个十天前的量化构建正是采用路由而非硬连接的教科书式案例。你可以建立一个路由,指向你自己运行的 NVFP4 构建,如果该构建在负载下表现异常,则故障转移到托管模型——只需一个接口,切换时无需在提供商之间重新接线。OrcaRouter 以 0% 加价传递提供商的标价,因此如果底层模型的价格变动,你的端点在当天就会反映出来,而不是等到你的计费周期。
而如果重点完全在于避免运行GPU:同样的无审查线路可通过OrcaRouter获得,仅限安全研究人员和红队使用,并在各提供商之间自动故障转移。无论你是自行托管此NVFP4版本,还是调用托管线路,两种方式都只需一个API密钥。
底线
如果你在 Blackwell 上部署 abliterated 模型,并且想要以 FP4 张量核心速度获得最小的占用空间,那么 Qwen3.8-27B-Uncensored-NVFP4 是正确的下载选择。但在 Hopper 上(应使用 FP8 版本)、在消费级或 Apple GPU 上(应使用 GGUF 或 MLX 版本),或者当你需要最高保真度时,它就是错误的下载选择。它并不是新东西——自 2026 年 8 月 19 日起就可以下载——但它正被大量下载,现在你在接受门控之前就知道自己将要面对什么了。
并非这个模型的又一个构建版本——Qwen3.8-Flash-Next-Uncensored是一个独立的发布版本:由Qwen3.8-Flash-Next经abliteration处理而来,后者是Qwen4架构的176B存储/6B激活混合专家(MoE)预览版。相同的abliteration技术,不同的权重,拥有自己独立的模型合集。
所有六种 27B 构建——BF16、GGUF、MLX、FP8、INT8 和 NVFP4——均收录于Qwen3.8-27B-Uncensored 合集,该合集托管于 Hugging Face。
这些权重按设计仅限本地使用。如需一个托管基线来衡量 abliterated 构建版本,Qwen3.8-27B 通过 OrcaRouter 以提供商列表价提供服务,0% 加价——即原版模型,安全对齐完好。
