一張為 Qwen3.8-27B-Uncensored-NVFP4 設計的英雄標題卡,它是去抑制化的 Qwen3.8-27B 之 Blackwell 服務用 NVFP4 版本,展示標題「Qwen3.8-27B-Uncensored-NVFP4」及副標題「A Serving Runbook for Blackwell GPUs」,旁邊有標示 FP4 的 GPU 晶片圖示、vLLM 閃電圖示、262K 上下文視窗儀表,以及一個帶鎖的圖示,右下角有 OrcaRouter 標誌。
Guides & Insights

Qwen3.8-27B-Uncensored-NVFP4:Blackwell GPU 的服務運行手冊

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8-27B-Uncensored-NVFP4自 2026 年 8 月 19 日起便已在 Hugging Face 上,此後十天內大約被下載了 32,700 次。這不是發布報導——權重已存在十天,沒有公告要報導,而姊妹版本 Qwen3.8-27B-Uncensored-FP8Qwen3.8-27B-Uncensored-GGUF 已在此部落格中介紹過。這份文件是為目前正在積極下載該建置的人所寫的操作手冊:NVFP4 究竟是什麼、為何這個特定建置將它與 FP8 混合、哪些 GPU 受益、哪些不受益、如何部署它,以及哪些人應該選擇它而非 FP8 或 GGUF 建置——以及哪些人不應該。

先說清楚一件事,因為這會讓每個初次下載者都卡關:此儲存庫設有存取門檻。直接執行 hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 這一行指令會出現驗證錯誤,除非你已經登入 Hugging Face,並在模型頁面上接受了此儲存庫的存取條款。以下內容都假設你已完成以上兩個步驟。

另外先說明:這個 repo 的模型卡同樣位於那道門禁之後,所以這裡不會有任何對它的轉述。以下內容所依據的,是公開的檔案清單與 repo 後設資料、NVIDIA 公開的 NVFP4 文件,以及實際在 Blackwell 上服務 Qwen3.8-27B NVFP4 版本的人員回報。凡數字來自實務工作者而非廠商,內文都會標明。

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-27B-Uncensored-NVFP4 repo (captured August 29 2026), showing the access gate 'You need to agree to share your contact information to access this model', total downloads of 32,764, the apache-2.0 license, the BF16 / F8_E4M3 / U8 tensor types, and the abliterated, nvfp4, fp4, fp8, vllm and mixed-precision tags.

這個建置是什麼

Qwen3.8-27B-Uncensored-NVFP4Qwen3.8-27B-Uncensored 的 NVFP4 量化版本;後者為 Ali​baba 旗下 Qw​en/Qwen3.8-27B 的 abliterated 版本,由 orcarouter 組織於 2026-08-18 發布。Abliteration 會從殘差流中移除模型的拒答方向;該技術在我們的 uncensored-model 解說文章中已有說明,此處不再贅述。基礎模型是 dense 27B,採用混合注意力(48 個線性注意力層加上 16 個全注意力層),原生支援影像與影片理解,具備 262,144 個 token 的上下文長度,以及內建的 MTP 推測解碼頭。全程皆為 Apache 2.0 授權。

這個建置有趣的地方不在於消融(abliteration),而在於量化佈局,因為它刻意採用量化建置——如果你搜尋的是 NVFP4,重點就在於這個格式。根據該 repo 的公開中繼資料與量化設定,這是一個混合精度的 compressed-tensors 建置:注意力投影使用 FP8(E4M3),多層感知器使用 NVFP4(4 位元、打包),而視覺編碼器、MTP 頭、lm_head 以及線性注意力的正規化層與偏置則保留在 BF16。公開檔案清單中的 safetensors 中繼資料與此配置吻合:約 35 億個參數以 BF16 儲存、94 億個以 FP8-E4M3 儲存、150 億個以打包的 4 位元張量儲存,跨五個分片加一個獨立的模型額外分片,磁碟上約 24.7 GB。以上都不是對其伺服效能的宣稱——這個確切 repo 的執行期 VRAM 與吞吐量目前沒有公開資料可供我引用。磁碟大小來自檔案清單,格式來自設定檔,而下面的伺服行為則是社群在密切相關的 NVFP4 建置上驗證過的。

NVFP4 是什麼,以及它與 FP8 和 INT8/AWQ 有何不同

NVFP4 是 NVIDIA 的 4 位元浮點格式,專為 Blackwell 上的第五代張量核心所推出,而 NVIDIA 自家的技術部落格正是此格式最合適的主要來源。它以 E2M1 儲存權重——一個符號位元、兩個指數位元、一個尾數位元——並以區塊方式進行縮放:每 16 個數值共用一個 E4M3 FP8 縮放值,整個張量則使用一個 per-tensor FP32 純量。這種兩層結構正是此格式的核心重點:它恢復了單純 4 位元浮點數會損失的動態範圍,代價是每個區塊多出幾個位元的額外開銷。實際差異,以一行形式呈現:

NVFP4 vs FP8兩者都是浮點格式,但 FP8(E4M3,8位元)可在 Hopper 和 Blackwell 上運行,而 NVFP4 是 4 位元格式,僅在 Blackwell 上獲得原生加速。NVIDIA 指出其權重約比 FP16 小 3.5 倍,比 FP8 小約 1.8 倍,而且在 Blackwell 上,矩陣乘法直接在 FP4 張量核心上執行。

NVFP4 vs INT8/AWQ— INT8 (W8A8) 和 AWQ (W4A16) 是從 Ampere 世代開始支援的整數格式;AWQ 是 4 位元但屬於整數,在大部分硬體上,權重會反量化成較寬的型別來做矩陣乘法。NVFP4 是帶有區塊縮放的 4 位元浮點格式,因此在低位元保留了更多精確度,而且具備整數格式沒有的原生 FP4 GEMM 路徑。

NVFP4 vs MXFP4——這兩個常被搞混。MXFP4 使用 32 元素區塊和 E8M0(二的冪)縮放;NVFP4 使用 16 元素區塊和 E4M3 縮放。較細的區塊讓 NVFP4 有更好的異常值隔離,因此該格式在 Blackwell 伺服器堆疊上成為事實上的 4 位元標準。

A two-column scoreboard titled 'NVFP4 vs FP8 — the format scoreboard', comparing NVFP4 (4-bit float E2M1, native FP4 GEMM on Blackwell, not accelerated on Hopper, this uncensored build ~24.7 GB on disk, ~3.5x smaller than FP16, best pick on Blackwell for the smallest footprint) against FP8 (8-bit float E4M3, native FP8 GEMM, full Hopper support, this uncensored build ~30.9 GB on disk, ~1.8x smaller than FP16, best pick on Hopper for max fidelity), with a footer line 'Format facts per NVIDIA; build sizes from public file listings.' and the OrcaRouter logo bottom-right.

哪些硬體受益——哪些不受益

關於此版本最重要的一點:NVFP4 是 Blackwell 格式。它只有在張量核心原生支援 FP4 GEMM 的 GPU 上才物有所值;而在其他任何硬體上,無論紙面規格多快,它都是錯誤的工具。

Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — 這正是選用 NVFP4 的場合:原生 FP4 張量核心、無閹割系列中最小的伺服器級佔用空間,以及此配置為之而生的格式。

Hopper — H100/H200 — 沒有原生的 FP4 GEMM。NVFP4 會退化為僅對權重進行反量化的路徑,速度更慢且毫無增益。請在此處使用 Qwen3.8-27B-Uncensored-FP8;該建置版本已在與此完全相同的硬體上驗證。

Ampere/Ada — RTX 3090/4090 — NVFP4 在這些卡上也無法加速。GGUF 版本,其 Q4_K_M 層級為 16.8 GB,是 24 GB 顯示卡的正確工具。

Apple Silicon — NVFP4 在 Mac 上毫無意義。真正會執行的是 MLX 版本(或 GGUF)。

一個誠實的細微差別:社群分支確實能在 Blackwell 之前的硬體上執行 NVFP4 僅權重模式。同一個 abliterated 模型的社群 NVFP4 建置,是透過修補過的 vLLM 分支明確針對 V100 級顯示卡設定的,而最近圍繞 Qwen3.8-27B 的 DGX Spark recipes 則又是另一回事。那些是各有其注意事項的專業路徑,並非此建置的目標。如果你使用的是 Blackwell,那些都不重要;如果你不是用 Blackwell,FP8 或 GGUF 建置是更適合的下載選擇。

如何上菜

此儲存庫已標記為 vLLM 使用,而 compressed-tensors 格式會自動從 config.json 讀取,您不需要手動選擇量化方案。實務人員針對 Qwen3.8-27B NVFP4 建置所採用的技術棧趨於一致:包括在 Blackwell 顯示卡上使用最新版 vLLM、FP8 KV 快取,以及使用模型自身的 MTP 頭進行推測解碼。Unsloth 的 NVFP4 指南是最廣為引用的社群參考資料,建議使用 vLLM 0.25.0 或更新版本,搭配 FlashInfer 與 CUTLASS-DSL 核心相依性,以實現快速的 FP4 路徑。

一個可運作的起點,由我們 FP8 建置的已驗證旗標以及社群 NVFP4 配方組合而成,全部放在一行:

vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'

FP8 KV cache — 將快取記憶體減半的最普遍相容方式;實務使用者回報它大約能讓你可容納的上下文加倍。NVFP4 KV-cache 支援雖然存在,但僅限於某些 attention 後端,因此 FP8 KV 是更安全的預設選擇。

MTP 推測解碼——模型配備 MTP 草稿頭,量化版本將其保持在 BF16。從業人員回報,在 Blackwell 上搭配 NVFP4 權重時,兩到三個草稿 token 表現良好,其中在 JSON 與工具呼叫等結構化輸出上獲益最大。

視覺 — 在此版本中,視覺編碼器以 BF16 保留。加上 --language-model-only 以僅提供文字服務;如果您需要影像或視訊輸入,請移除它。

在 DGX Spark 上 — 一些現場回報的注意事項:將 --gpu-memory-utilization 設定在 0.90 或以下(更高的值曾在載入權重時導致機器死當),並加上 --safetensors-load-strategy lazy(如果記憶體不足)。您還需要配備 sm_121a 核心的 vLLM GB10 版本。

誠實的效能數據:針對此儲存庫本身,目前沒有任何已發表且獨立測得的吞吐量數字。現有的測量結果都是針對密切相關的 NVFP4 建置。Unsloth 報告其自家的 Qwen3.8-27B-NVFP4 建置在 B200 上的每秒 token 數為 BF16 的 1.41–1.49 倍(batch 1 時為 89.8 至 133.7 tok/s,batch 64 時為 3,048 至 4,407 tok/s);另外,NVIDIA 論壇上有一位 DGX Spark 使用者回報,在 NVFP4 權重、FP8 KV cache 與 MTP 深度 3 的配置下約為 20–32 tok/s。兩者都值得引用,但都不是針對此儲存庫的基準測試。

實際有效的使用模式

在Blackwell上運行Qwen3.8-27B系列模型的從業者,最終會收斂到少數幾項設定。請將這些視為實地報告,而非廠商指南——Qw​en並未記錄大部分內容,而且此repo自身的卡片是設有存取限制的。

reasoning_effort 是最重要的調節項。預設的 xhigh 會讓模型在每次請求時思考很久。執行 agent 迴圈的人會以 medium 為預設,並降到 low——或者完全停用思考,使用 enable_thinking: false——用於對延遲敏感的單次呼叫。在單張 Blackwell GPU 上,對常規任務使用 xhigh 推理,正是讓你擁有快速模型卻得到緩慢答案的原因。

採樣器與思考模式配對使用,而非獨立運作。社群共識:思考模式開啟時,使用 temperature 1.0 / top_p 0.95 執行;思考模式關閉時,使用 temperature 0.7 / top_p 0.80 並搭配 presence_penalty 1.5 執行。互換這兩組設定會降低輸出品質。

使用最新的聊天模板。 qwen3_5 模板會將每次助理回覆包裝在思考區塊中,多位實作者回報使用過時模板會導致迴圈或截斷的回答;社群修正版的 Qw​en-Fixed-Chat-Templates 和 Qw​en-Sharp 變體設定了 preserve_thinking,可停止迴圈。如果您伺服後的輸出在停止符號之後仍在漫談,這是最需要檢查的第一件事。

為代理工作中的長推理軌跡預留預算。從業者報告,3.8 代模型每個任務產生的 token 數大約是其 3.6 前代模型的兩倍——品質的提升部分來自於更長的思考。對於較長的 xhigh 答案,請串流推理輸出,否則你會遇到閘道逾時。

工具呼叫在量化後依然完好。函式呼叫路徑在經過 abliteration 與 4-bit 轉換後依然保留;透過 qwen3_coder 工具呼叫解析器啟用後,模型選擇工具的方式與基礎模型相同。

A screenshot of the Artificial Analysis page for Qwen3.8 27B (medium) (captured August 29 2026), showing an Intelligence score of 44, a speed of 52.3 tokens per second, the comparison summary paragraph, $0.50 per 1M input and $3.00 per 1M output token pricing, and a 256k-token context window.

誰應該選擇這個構建——誰不應該

誠實的決定是,不重複我們 FP8 和 GGUF 文章中已詳細討論的量化選擇數學:

請選擇 NVFP4。如果您在 Blackwell 上提供服務,希望在未審查系列中獲得最小的伺服器級佔用空間,並具備 FP4 張量核心速度——且正在進行確實需要 abliterated 模型的研究、紅隊或可解釋性工作,

請選擇 Qwen3.8-27B-Uncensored-FP8,如果你使用的是 Hopper,或想要最廣為驗證的 vLLM 路徑——這是相同權重的 8-bit 版本,已在 H200 上驗證,最低約需 40 GB VRAM。

請選擇 Qwen3.8-27B-Uncensored-GGUF,若您使用的是消費級 GPU 或 Mac,或想要使用 llama.cpp 而非 vLLM——Q4_K_M 等級正是本地端的甜蜜點。

兩者都不要選,如果你想要最高的保真度、正在建置任何面向使用者的東西(參閱下方的安全界限),或者你完全不想自行託管——同一未經審查的版本可透過 OrcaRouter 取得,僅限研究人員使用,因此無需 GPU。

安全邊界 — 僅供研究

這是一個 abliterated 模型,{{1}}量化版本並不會把防護欄加回來。{{/1}}拒絕方向已從 {{KEEP}}Qw​en/Qwen3.8-27B{{/KEEP}} 的殘差流中移除,{{2}}而 NVFP4 只是精度變更,並非安全干預{{/2}}——{{3}}該模型會遵從基礎模型拒絕的請求,且此建置沒有內建審查機制。{{/3}}此版本以 Apache 2.0 授權釋出,用於可解釋性、AI 安全與紅隊研究,{{4}}責任由使用者自負。{{/4}}

在未審查模型(uncensored model)領域中,有兩項評估要點太少被提及。第一,單一越獄探測(jailbreak probe)能輕鬆通過,並不代表安全評估及格——abliterated 模型本來就會刻意在那些測試上失敗。請用適當的測試組合來衡量你真正關心的指標(有害性用 AdvBench、HarmBench 與 StrongREJECT;過度拒答用 XSTest-safe),並比較介入前後的拒答率。第二,要評估量化後的模型,而不只是基礎模型:即使是 4-bit 版本,也可能在邊緣案例上改變行為,即使整體分數看起來正常。在沒有自行建置審核與濫用防範機制的情況下,請勿將此部署給終端使用者。

OrcaRouter 的定位

一個十天前的量化建置,正是應該用路由而非固接的典型範例。你可以建立一個路由,指向你自己執行的 NVFP4 建置,並在該建置於負載下出問題時,故障切換到代管的模型——僅需一個介面,切換供應商時無須重新接線。OrcaRouter 以 0% 加價率直接轉傳供應商的目錄價格,因此如果底層模型價格變動,你的端點會在當天反映,而不是等到你的計費週期。

而如果重點是完全避免運行 GPU:同一條未經審查的線路可透過 OrcaRouter 取得,僅限安全研究人員和紅隊使用,並在供應商之間自動故障轉移。無論是自行託管此 NVFP4 版本,還是呼叫託管線路,兩者都只需一個 API 金鑰。

底線

如果你在Blackwell上部署這個abliterated模型,並希望在獲得FP4張量核心速度的同時將佔用空間降到最小,那麼Qwen3.8-27B-Uncensored-NVFP4就是正確的下載選擇。在Hopper上(請使用FP8版本)、在消費級或Apple GPU上(請使用GGUF或MLX版本),或者如果你需要最高保真度,那麼它就是錯誤的選擇。它並不是新東西——自2026年8月19日起就可以下載了——但它的下載量很大,現在你在接受閘門之前,就知道自己即將面對的是什麼了。

這不是此模型的另一個建置——Qwen3.8-Flash-Next-Uncensored 是獨立發行版:由 Qwen3.8-Flash-Next(Qwen4 架構的 176B 儲存 / 6B 活躍混合專家(MoE)預覽版)去審查化(abliterated)而來。相同的去審查技術,不同的權重,自有其集合。

所有六種 27B 版本 — BF16、GGUF、MLX、FP8、INT8 和 NVFP4 — 皆收錄於Qwen3.8-27B-Uncensored 合集(Hugging Face 上)。

這些權重設計上僅限本機使用。為了有個可供 abliterated 版本對照的託管基準,Qwen3.8-27B以提供者列表價格(0% 加價)在 OrcaRouter 上提供——即原始模型,安全對齊保持完整。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube