一张为 Qwen3.8-27B-Uncensored-NVFP4 制作的主视觉标题卡片,它是去审查(abliterated)版 Qwen3.8-27B 的 Blackwell 服务用 NVFP4 构建版本。卡片显示标题“Qwen3.8-27B-Uncensored-NVFP4”和副标题“面向 Blackwell GPU 的服务运行手册”,旁边配有标记为 FP4 的 GPU 芯片图标、一个 vLLM 闪电图标、一个 262K 上下文窗口仪表和一个门控锁图标,右下角带有 OrcaRouter 标志。
Guides & Insights

Qwen3.8-27B-Uncensored-NVFP4:面向Blackwell GPU的服务运行手册

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8-27B-Uncensored-NVFP4自2026年8月19日起已在Hugging Face上架,此后十天里已被下载约32,700次。这不是发布报道——权重已发布十天,没有公告可报,而且姊妹构建Qwen3.8-27B-Uncensored-FP8Qwen3.8-27B-Uncensored-GGUF已在本博客中有过记录。这是一份针对人们目前正在积极下载的构建的操作手册:NVFP4究竟是什么,为什么这个特定构建要将其与FP8混用,哪些GPU能受益而哪些不能,如何部署它,以及哪些人应该选择它而不是FP8或GGUF构建——以及哪些人不应该。

先说一点,因为每个第一次下载的人都会在这里栽跟头:该仓库是受限的。直接使用hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4这一行命令会报认证错误,除非你已登录 Hugging Face 并在模型页面上接受了该仓库的访问条款。以下所有内容都假定你已完成这两步。

另外先说清楚:这个仓库的模型卡也在同一道门禁之后,因此这里没有任何内容是对它的转述。下文依据的是公开的文件列表与仓库元数据、NVIDIA 公开的 NVFP4 文档,以及人们在 Blackwell 上服务 Qwen3.8-27B NVFP4 构建的一线报告。凡是由实践者而非厂商提供的数字,文中都会注明。

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-27B-Uncensored-NVFP4 repo (captured August 29 2026), showing the access gate 'You need to agree to share your contact information to access this model', total downloads of 32,764, the apache-2.0 license, the BF16 / F8_E4M3 / U8 tensor types, and the abliterated, nvfp4, fp4, fp8, vllm and mixed-precision tags.

这个构建是什么

Qwen3.8-27B-Uncensored-NVFP4Qwen3.8-27B-Uncensored 的 NVFP4 量化版本,即 Ali​baba 的 Qw​en/Qwen3.8-27B 的 abliterated 版本,由 orcarouter 组织于 2026-08-18 发布。Abliteration 会从残差流中移除模型的拒绝方向;该技术在我们的 uncensored-model 说明文章中已有解释,此处不再赘述。基础模型是密集 27B,采用混合注意力机制——48 层线性注意力层加 16 层全注意力层——原生支持图像和视频理解,上下文窗口达 262,144 token,并内置 MTP 推测解码头。全链路采用 Apache 2.0 许可。

这个构建的有趣之处不在于abliteration,而在于量化布局,因为它刻意是一个量化构建——如果你搜索过NVFP4,格式就是重点。根据仓库的公开元数据和量化配置,这是一个混合精度的compressed-tensors构建:注意力投影使用FP8(E4M3),MLP使用NVFP4(4位,打包),而视觉编码器、MTP头、lm_head以及线性注意力的归一化和偏置保留为BF16。公开文件列表的safetensors元数据与该方案一致:大约35亿个参数为BF16,94亿个为FP8-E4M3,150亿个为打包的4位张量,分布在五个分片加上一个单独的model-extra分片中,磁盘上约24.7 GB。这些都不是关于它如何服务的说法——这个确切仓库的运行时VRAM和吞吐量目前没有任何我可以引用的公开来源。磁盘大小来自文件列表,格式来自配置,下面的服务行为是社区在密切相关的NVFP4构建上验证的。

NVFP4 是什么,以及它与 FP8 和 INT8/AWQ 的区别

NVFP4 是 NVIDIA 的 4 位浮点格式,专为 Blackwell 上的第五代张量核心引入,NVIDIA 自家的技术博客正是了解它的权威一手来源。它以 E2M1 存储权重——1 个符号位、2 个指数位、1 个尾数位——并按块缩放:每 16 个值共享一个 E4M3 FP8 缩放系数,整个张量则配有一个逐张量的 FP32 标量。这种两级方案正是该格式的核心要义:它恢复了朴素 4 位浮点会丢失的动态范围,代价是每块要多花几个比特的开销。实际差异,用一句话概括:

NVFP4 vs FP8两者都是浮点格式,但 FP8(E4M3,8 位)可在 Hopper 和 Blackwell 上运行,而 NVFP4 是 4 位格式,仅在 Blackwell 上原生加速。NVIDIA 称其权重比 FP16 小约 3.5 倍,比 FP8 小约 1.8 倍;在 Blackwell 上,矩阵乘法直接运行于 FP4 张量核心。

NVFP4 与 INT8/AWQ — INT8(W8A8)和 AWQ(W4A16)是从 Ampere 架构起支持的整数格式;AWQ 虽为 4 位,但仍属整数,在大多数硬件上,权重会被反量化为更宽的类型以进行矩阵乘法(matmul)。NVFP4 是带块缩放的 4 位浮点格式,因此在低位能保留更多精度,并且它拥有整数格式所不具备的原生 FP4 GEMM 路径。

NVFP4 vs MXFP4——这两者经常被混淆。MXFP4 使用 32 元素块和 E8M0(2 的幂)缩放因子;NVFP4 使用 16 元素块和 E4M3 缩放因子。更细粒度的块让 NVFP4 具有更好的离群值隔离能力,这也是该格式成为 Blackwell 服务栈上事实上的 4 位标准的原因。

A two-column scoreboard titled 'NVFP4 vs FP8 — the format scoreboard', comparing NVFP4 (4-bit float E2M1, native FP4 GEMM on Blackwell, not accelerated on Hopper, this uncensored build ~24.7 GB on disk, ~3.5x smaller than FP16, best pick on Blackwell for the smallest footprint) against FP8 (8-bit float E4M3, native FP8 GEMM, full Hopper support, this uncensored build ~30.9 GB on disk, ~1.8x smaller than FP16, best pick on Hopper for max fidelity), with a footer line 'Format facts per NVIDIA; build sizes from public file listings.' and the OrcaRouter logo bottom-right.

哪些硬件受益——哪些不受益

关于此构建版本最重要的一点:NVFP4 是 Blackwell 格式。它只有在张量核心原生实现 FP4 GEMM 的 GPU 上才能发挥价值;在其他任何硬件上,无论纸面速度多快,它都是错误的工具。

Blackwell — RTX 50 系列、B200/B300、RTX PRO 6000、DGX Spark (GB10)——这正是 NVFP4 的用武之地:原生 FP4 张量核心、无审查产品线中最小的服务器级占用空间,以及这套构建为之而生的格式。

Hopper — H100/H200 — 没有原生 FP4 GEMM。NVFP4 会退化为仅权重的反量化路径,速度更慢且毫无收益。此处请使用 Qwen3.8-27B-Uncensored-FP8;该构建已在此硬件上验证。

Ampere/Ada — RTX 3090/4090 — NVFP4 在这些显卡上同样无法加速。GGUF 版本(Q4_K_M 档位,16.8 GB)才是 24 GB 显卡的正确选择。

Apple Silicon — NVFP4 在 Mac 上无关紧要。MLX 版本(或 GGUF)才是实际运行的。

坦诚说明一点:社区分支确实在Blackwell之前的硬件上运行NVFP4仅权重量化。同一abliterated模型的社区NVFP4构建,通过打过补丁的vLLM分支明确支持V100级别显卡;而最近围绕Qwen3.8-27B的DGX Spark方案则另当别论。这些是各有注意事项的专业路径,并非本构建的目标。如果你用的是Blackwell,这些都无关紧要;如果不是Blackwell,FP8或GGUF构建是更合适的下载选择。

如何盛盘

该仓库已标记为 {{1}}vLLM{{/1}} 版本,压缩张量格式会自动从 {{2}}config.json{{/2}} 中读取——你无需手动选择量化方案。从业者为 {{3}}Qwen3.8-27B NVFP4{{/3}} 构建所采用的通用技术栈是:Blackwell 显卡上的最新版 {{4}}vLLM{{/4}}、{{5}}FP8 KV 缓存{{/5}},以及模型自带的 {{6}}MTP{{/6}} 头用于投机解码。{{7}}Unsloth 的 NVFP4 指南{{/7}}(被引用最广泛的社区参考资料)建议使用 {{8}}vLLM 0.25.0{{/8}} 或更新版本,并安装 {{9}}FlashInfer{{/9}} 和 {{10}}CUTLASS-DSL 内核{{/10}} 依赖以启用快速 FP4 路径。

一个可用的起点,由我们 FP8 构建中已验证的标志和社区的 NVFP4 配方组合而成,全部放在同一行上:

vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'

FP8 KV cache — 这是最广泛兼容的将缓存内存减半的方式;实践者报告说它大致能让可容纳的上下文翻倍。NVFP4 KV-cache 支持存在,但仅限于某些注意力后端,因此 FP8 KV 是更安全的默认选择。

MTP 投机解码——模型自带 MTP 草稿头,量化时将其保持为 BF16。实践者报告称,在 Blackwell 上使用 NVFP4 权重时,两到三个草稿 token 效果良好,最大的收益体现在 JSON 和工具调用等结构化输出上。

视觉 —— 此版本中视觉编码器保留为 BF16。添加 --language-model-only 以仅提供文本服务;如果需要图像或视频输入,则去掉该参数。

在 DGX Spark 上——一些来自现场报告的注意事项:将 --gpu-memory-utilization 保持在不高于 0.90(更高的值在权重加载期间曾导致机器卡死),并添加 --safetensors-load-strategy lazy(如果内存紧张)。你还需要一个用于 sm_121a 内核的 GB10 版 vLLM 构建。

诚实的性能说明:这个仓库本身没有已发表的独立吞吐量数字。现有的测量数据来自密切相关的 NVFP4 构建。Unsloth 报告其自有的 Qwen3.8-27B-NVFP4 构建在 B200 上每秒 token 数是 BF16 的 1.41–1.49 倍(batch 1 时从 89.8 到 133.7 tok/s,batch 64 时从 3,048 到 4,407),还有一位 NVIDIA 论坛上的 DGX Spark 用户报告称,使用 NVFP4 权重、FP8 KV 缓存和 MTP 深度 3 时大约为 20–32 tok/s。两者都值得引用;但都不是本仓库的基准测试。

真正有效的使用模式

在 Blackwell 上运行 Qwen3.8-27B 系列模型的从业者,最终都会采用少数几项设置。请将这些视为实地报告,而非厂商指南——Qwen 官方并未记录其中大部分内容,并且该仓库自身的模型卡片也受到访问限制。

reasoning_effort 是最重要的调节旋钮。默认的 xhigh 会让模型在每次请求上思考很长时间。运行 agent 循环的人默认设置为 medium,并降至 low——或者完全禁用思考,通过enable_thinking: false——用于对延迟敏感的单次调用。在单个 Blackwell GPU 上,对常规任务使用 xhigh 推理,最终就会得到一个模型很快但回答很慢的结果。

采样器与思考模式配对使用,并非独立。社区共识:思考开启时使用 temperature 1.0 / top_p 0.95;思考关闭时使用 temperature 0.7 / top_p 0.80,presence_penalty 为 1.5。互换这两组设置会降低输出质量。

使用当前的聊天模板。 qwen3_5 模板会将每条助手回复都包裹在思考块中,多位实践者反映使用过时模板会导致回答循环或截断;社区修复的 Qwen-Fixed-Chat-Templates 和 Qwen-Sharp 变体设置了 preserve_thinking,从而停止循环。如果你的服务输出越过停止符仍在漫无边际地生成,这是首先要检查的问题。

为智能体工作中的长推理轨迹预留预算。从业者报告称,3.8 代模型每个任务生成的 token 数量约为其 3.6 前代的两倍——质量提升部分源于更长的思考。对于长 xhigh 答案,请流式输出推理结果,否则将遭遇网关超时。

工具调用在量化过程中保持完整。函数调用路径在abliteration和4位转换后依然有效;使用qwen3_coder工具调用解析器启用它,模型选择工具的方式与基础模型相同。

A screenshot of the Artificial Analysis page for Qwen3.8 27B (medium) (captured August 29 2026), showing an Intelligence score of 44, a speed of 52.3 tokens per second, the comparison summary paragraph, $0.50 per 1M input and $3.00 per 1M output token pricing, and a 256k-token context window.

谁应该选择这个构建——以及谁不应该

坦诚的决定,不再重复我们在FP8和GGUF文章中已经详细讨论过的量化选择计算:

那么请选择 NVFP4。如果你在 Blackwell 上提供服务,希望在无审查系列中获得最小的服务器级占用空间,并具备 FP4 张量核心速度——并且你正在进行研究、红队或可解释性工作,这些工作确实需要一个 abliterated 模型,

选择 Qwen3.8-27B-Uncensored-FP8,如果你正在使用 Hopper,或者你希望使用最广泛验证的 vLLM 路径——它是相同权重的 8 位版本,已在 H200 上验证,VRAM 下限约为 40 GB。

那就选 Qwen3.8-27B-Uncensored-GGUF。如果你使用的是消费级 GPU 或 Mac,或者你想要 llama.cpp 而不是 vLLM(Q4_K_M 级别是本地的最佳选择),

两者都不要选,如果你想要最大保真度、正在构建任何面向用户的东西(参见下文的安全边界),或者完全不想自行托管——同样的未审查版本通过OrcaRouter提供,仅限研究人员访问,因此无需GPU。

安全边界 — 仅限研究

这是一个abliterated模型,量化过程并未将安全护栏重新加回。拒绝方向已从{{1}}Qw​en/Qwen3.8-27B{{/1}}的残差流中移除,而NVFP4只是精度格式的变更,并非安全干预措施——该模型会遵从基础模型所拒绝的请求,且此构建版本不包含内置的审查机制。它依据{{2}}Apache 2.0{{/2}}许可发布,用于可解释性、AI安全与红队研究,相关责任由你自行承担。

在无审查模型领域中,有两项评估注意事项很少被提及。首先,一个能轻松通过的越狱探测并不等于通过安全评估——abliterated 模型是故意在这些探测上失败的。请用合适的测试套件来衡量你真正关心的指标(有害性用 AdvBench、HarmBench 和 StrongREJECT;过度拒答用 XSTest-safe),并对比干预前后的拒答率。其次,要评估量化模型,而不只是基础模型:即使总体分数看起来没问题,4-bit 版本也可能在边缘情况下改变行为。在没有自行构建内容审核与滥用防护层之前,切勿将该模型部署给终端用户。

OrcaRouter 的适用场景

一个十天前的量化构建正是采用路由而非硬连接的教科书式案例。你可以建立一个路由,指向你自己运行的 NVFP4 构建,如果该构建在负载下表现异常,则故障转移到托管模型——只需一个接口,切换时无需在提供商之间重新接线。OrcaRouter 以 0% 加价传递提供商的标价,因此如果底层模型的价格变动,你的端点在当天就会反映出来,而不是等到你的计费周期。

而如果重点完全在于避免运行GPU:同样的无审查线路可通过OrcaRouter获得,仅限安全研究人员和红队使用,并在各提供商之间自动故障转移。无论你是自行托管此NVFP4版本,还是调用托管线路,两种方式都只需一个API密钥。

底线

如果你在 Blackwell 上部署 abliterated 模型,并且想要以 FP4 张量核心速度获得最小的占用空间,那么 Qwen3.8-27B-Uncensored-NVFP4 是正确的下载选择。但在 Hopper 上(应使用 FP8 版本)、在消费级或 Apple GPU 上(应使用 GGUF 或 MLX 版本),或者当你需要最高保真度时,它就是错误的下载选择。它并不是新东西——自 2026 年 8 月 19 日起就可以下载——但它正被大量下载,现在你在接受门控之前就知道自己将要面对什么了。

并非这个模型的又一个构建版本——Qwen3.8-Flash-Next-Uncensored是一个独立的发布版本:由Qwen3.8-Flash-Next经abliteration处理而来,后者是Qwen4架构的176B存储/6B激活混合专家(MoE)预览版。相同的abliteration技术,不同的权重,拥有自己独立的模型合集。

所有六种 27B 构建——BF16、GGUF、MLX、FP8、INT8 和 NVFP4——均收录于Qwen3.8-27B-Uncensored 合集,该合集托管于 Hugging Face。

这些权重按设计仅限本地使用。如需一个托管基线来衡量 abliterated 构建版本,Qwen3.8-27B 通过 OrcaRouter 以提供商列表价提供服务,0% 加价——即原版模型,安全对齐完好。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube