「Qwen Uncensored, Explained」文章的標題卡片,顯示一張圓角研究卡片:一個盾牌被打開,露出電路大腦,並有顯微鏡圖示與標示 RESEARCH-ONLY 的標籤,另有標著 ABLITERATED、BLOCK-FP8 和 262K CONTEXT 的標籤。
Guides & Insights

Qwen 無審查版解說:如何運行 Abliterated Qwen3.8-27B-FP8

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen 未審查版在 Hugging Face 上幾乎總是指「abliteration」——即從模型的殘差流中移除其拒絕方向——而最適合入門的建置是Qwen3.8-27B-Uncensored-FP8,該模型於 2026 年 8 月 15 日發布在 Hugging Face 上。它是 Qwen3.8-27B 的 abliterated、block-FP8 建置,與官方 FP8 版本運行在完全相同的 vLLM 核心路徑上,並保留了 262K 上下文、視覺塔和 MTP 推測解碼頭——發布首日即獲得 257 個讚和 4,285 次下載。這是一個研究工具,而非聊天機器人:沒有內建防護措施,採用 Apache 2.0 授權,且會遵從基礎模型所拒絕的請求。本指南涵蓋 abliteration 實際上改變了什麼、如何從 Hugging Face 拉取 30.9 GB 的權重、如何使用 vLLM、SGLang 或 Transformers 伺服模型,以及為了合法研究可以在其上執行什麼任務。

「qwen uncensored」實際上是什麼意思

Abliteration 是一種權重層級的干預,而非微調。拒絕方向是模型殘差流中的一個向量,當它被激活時,會產生「我無法幫你處理這件事」;abliteration 會找出該方向,並將其正交化、從權重中去除。在此建置中,移除操作套用於 131 個殘差寫入矩陣(方法來自 Arditi 等人於 2024 年發表的「Refusal in Language Models Is Mediated by a Single Direction」),並重新量化以逐位元組匹配官方 Qwen3.8-27B-FP8 方案,使 vLLM 能在完全相同的 FP8 內核路徑上提供服務。沒有訓練任何新權重。

這個區別之所以重要,是因為「qwen uncensored」的頂部搜尋結果混合了三種不同的東西:像這個一樣的 abliterated 權重修改、只在提示詞層級掩蓋拒絕的系統提示詞「uncensored packs」,以及沒有使用安全資料訓練的 LoRA 微調。它們並不等價,而且大多數在該查詢中排名靠前的頁面並不會告訴你它們描述的是哪一個類別。如果你想研究拒絕機制本身,只有權重層級的干預才是貨真價實的。

拒絕移除實際上做了什麼——數字

模型卡發布了一套安全性評估套件,該套件在由 vLLM 提供服務的模型上執行,日期為 2026 年 8 月 15 日。在關閉思考模式的情況下,七個有害提示詞基準的拒絕率從基礎模型的 64–99% 驟降至此版本的 0–6%:AdvBench 從 99.0% 降至 0.0%,JailbreakBench 從 94.0% 降至 0.0%,StrongREJECT 從 97.3% 降至 2.0%,HarmBench 從 98.7% 降至 2.7%,MaliciousInstruct 從 99.0% 降至 0.0%,SimpleSafetyTests 從 64.0% 降至 6.0%,ForbiddenQuestions 從 73.3% 降至 4.7%。在開啟思考模式時,模型基本上從不拒絕——拒絕率為 1.7% 或更低。另一個值得注意的獨立數字是警示率:30–50% 的「未審查」回覆在回答前仍會加上簡短免責聲明;這是訓練造成的現象,而非拒絕。

另一面是沒有改變的部分。在 XSTest-safe 上,對良性提示的過度拒絕從 5.6% 降至 0.4%,而每個能力基準測試與基礎模型相比都維持在 ±1.3 個百分點以內:MMLU 從 84.3% 到 84.7%、GSM8K 從 90.0% 到 88.7%、MMLU-Pro 從 77.6% 到 76.8%、CMMLU 從 81.4% 到 80.8%。WikiText-2 的困惑度為 6.96。換句話說,這項干預移除了拒絕行為,但並未實質性地降低模型效能。

A before-and-after card for Qwen3.8-27B-Uncensored-FP8, with a Base column and an Abliterated column: refusal with thinking off 64-99% down to 0-6%, refusal with thinking on down to 1.7% or less, over-refusal on benign prompts 5.6% down to 0.4%, MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%, and WikiText-2 perplexity 6.96, with a footer reading Model-card evaluation, vLLM-served, August 15 2026.

如何從 Hugging Face 拉取它

該儲存庫是 orcarouter/Qwen3.8-27B-Uncensored-FP8,並且設有門檻:你必須用 Hugging Face 帳號登入並接受條款後,檔案才會開始下載——這道門檻本身就是免責聲明,因為閱讀 README 也是接受這個模型本質的一部分。你下載的內容是 30.9 GB,分散在七個 safetensors 分片(共 1,606 個張量)中,採用 block-FP8(E4M3、128×128 區塊、動態活化)格式,而視覺塔(vision tower)、正規化層(norms)、嵌入層(embeddings)與 lm_head 則保留為 BF16。授權條款為 Apache 2.0,繼承自基礎的 Qwen/Qwen3.8-27B。沒有任何 Hugging Face Inference Provider 託管此模型——你必須自行執行,或使用託管方案。

如何執行它

權重大約 31 GB——約為 ~56 GB BF16 檢查點的一半——而該模型卡建議使用單張 H100 80GB 或 H200 143GB,權重加上小型 KV 快取的實際 VRAM 下限約為 ~40 GB。完整的 262K 上下文需要更多記憶體,但 FP8 KV 快取可將此需求減半。該模型卡驗證的設定是單張 H200,搭配 --max-num-seqs 96、FP8 KV 快取並啟用 MTP。

vLLM 是預期的路徑,而且只需要一個指令,因為 FP8 方案與官方建置完全相符:

vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"

這會為你提供一個 OpenAI 相容的端點,位於 localhost:8000/v1/chat/completions。Docker 對應指令為 docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8。完整設定的部分,模型卡建議:--language-model-only 用於純文字服務,--speculative-config '{"method":"mtp","num_speculative_tokens":3}' 以啟用 MTP 投機解碼頭,--kv-cache-dtype fp8,--max-model-len 262144,--reasoning-parser qwen3,以及 --enable-auto-tool-choice --tool-call-parser qwen3_coder 用於工具呼叫。請勿傳遞 --quantization fp8——該方案會從 config.json 讀取。如果你想要 BF16 KV cache,請移除 --kv-cache-dtype fp8;如果你需要視覺塔(vision tower),請移除 --language-model-only。

對於 SGLang:python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000。對於 Transformers,該卡片同時記載了 pipeline API — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") — 以及 AutoProcessor.from_pretrained(...) 和 AutoModelForMultimodalLM.from_pretrained(..., device_map="auto")。

A how-to-run card for Qwen3.8-27B-Uncensored-FP8 listing the essentials: 30.9 GB of block-FP8 weights across 7 shards, roughly 40 GB of VRAM floor with H100 80GB or H200 143GB recommended, the vLLM one-liner vllm serve orcarouter/Qwen3.8-27B-Uncensored-FP8, serve flags MTP 3 speculative tokens, FP8 KV cache, max-model-len 262144, tool-call-parser qwen3_coder, and a footer reading From the Hugging Face model card, August 15 2026.

在研究中實際該如何使用它

去除拒絕機制的模型重點在於作為研究對象,而這個建置因其干預措施已記錄在案,特別容易研究。三個具體且合理的研究項目:

• 重現拒絕差異(refusal delta)。請同時對 abliterated 版本與基礎 FP8 版本執行 AdvBench、HarmBench、StrongREJECT 或 XSTest-safe,並核對模型卡上的數字:有害提示的拒絕率從 64–99% 降至 0–6%,良性提示的過度拒絕率則從 5.6% 降至 0.4%。這組前後對照的數據,正是安全團隊判斷拒絕移除方法是否有效、以及其代價為何時所亟需的量測結果。

• 研究拒絕行為所在之處。由於建置文件記錄了經過正交化的 131 個矩陣,你可以將殘差流方向與基準進行比對,觀察介入措施改變了什麼。這裡的「開啟思考」結果具有參考價值:當思考功能啟用時,拒絕率降至 1.7% 或更低,這證明推理軌跡才是該方向最具影響力的地方。

• 評估你自己的護欄。無護欄的基線是測試審核層的正確對照組。對這個模型的輸出執行你的篩選器,並衡量它攔截到了什麼——這就是你量化所添加的安全層的方式。

當這個模型是錯誤答案時

如果你要的是一般助手,或是任何你會放在終端使用者面前的東西,那這個模型就選錯了——它沒有實質的內建護欄,會服從基礎模型拒絕的請求,而且 Apache 2.0 並不會轉移你的法律責任。請改用原始對齊版 Qwen3.8-27B。如果你想在聊天機器人上規避拒絕,系統提示詞包的風險比修改權重更低、效果也更好。如果你沒有約 40 GB 的顯示卡,但仍想研究這個模型,OrcaRouter 上的託管卡片 obsidian/Qwen3.8-27B 提供相同的未經審查 27B 系列,每百萬輸入 token 0.40 美元、每百萬輸出 token 4.21 美元,同樣具備 262K 上下文——它僅限資安與 AI 安全研究人員存取,而審核決定權仍然在你這邊。

A safety-boundary card for Qwen3.8-27B-Uncensored-FP8 with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services with a warning that the model has no built-in guardrails, and a footer reading Apache 2.0, research-only, you assume full responsibility.

安全界限 — 下載前請先閱讀

此模型的安全對齊已被大幅移除。它會順從原始 Qwen3.8-27B 會拒絕的有害、不道德、冒犯性或非法請求,而且沒有任何具實質意義的內建護欄。它僅為合法的研究目的而發布:可解釋性、AI 安全與拒答機制研究、紅隊測試、穩健性評估及受控實驗。您需對自己的使用方式以及它所產生的所有內容承擔全部責任與法律責任;除非您自行加入安全、內容審核與濫用防護層,否則不得將其部署給終端使用者或投入生產環境。作者對任何濫用行為概不承擔責任。下載此儲存庫即表示您接受上述條件;授權條款為 Apache 2.0。

這篇文章刻意不含任何有害提示。上述的拒絕數字來自模型卡自身的安全評估套件,這是衡量此類模型的正確方式:執行標準的拒絕基準測試,閱讀數據,並根據數據所顯示的結果來設計你的研究。

底線

「Qwen uncensored」是對一種技術的探索,而首先值得嘗試的版本是 Qwen3.8-27B-Uncensored-FP8:這是唯一一個去除拒答機制的 Qwen3.8 版本,能在官方 FP8 vLLM 內核路徑上運行,具備 262K 上下文、視覺與 MTP 功能完整保留,並有公開的前後對比評測作為依據。從 Hugging Face 下載這個受控的 30.9 GB 模型,用 vLLM 在單張 H100 或 H200 上部署,並將其用於它本該服務的目的——測量拒答行為、研究拒答機制、以及測試防護措施。請勿將其用作聊天機器人,也不要將其交付給終端使用者。權重是免費的;但如何使用它們,責任完全在於你自己。

若為合法研究用途,權重可在 Hugging Face 上取得:從 Hugging Face 下載

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube