
「無審查LLM,解析:Abliteration技術、研究用途與不可跨越的界線」
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
無審查的大型語言模型(LLM)是指拒絕行為——也就是模型拒絕請求而非回答請求的部分——已被刻意移除的語言模型。這類模型大多是透過 abliteration(權重消除法)建構而成:研究人員找出調節拒絕行為的單一內部方向,並將其從權重中抹除,使其餘部分大致保持完整。結果就是,一個在一般模型會拒絕時反而給出回答的模型——這正是它受到研究的原因,也正是它不適用於生產環境的原因。我們發布了這樣一個建構,Qwen3.8-27B-Uncensored-FP8,一個經 abliteration 處理並以 FP8 量化的Qwen3.8 27B,以 Apache 2.0 授權發布至 Hugging Face,作為僅供研究的產物。本頁面是此類別的說明文章:這些模型是什麼、支持它們的研究依據、如何安全地使用它們,以及界線所在。
有一種框架能讓整個類別保持誠實,所以讓我先說清楚:未經審查的模型並不比它源自的模型更聰明、更真實或更能幹。它是相同的權重,只是減去了一種行為。它仍然知道的一切,它一直都曉得——改變的是它不再拒絕。這使它成為一個對安全研究真正有用的對象,同時也是一個真正不安全的部署物。那句話的兩半都具有關鍵分量,本頁其餘部分將說明這兩者。
「uncensored」的真正含義
• 或者,您可以透過我們的模型卡來查看,其中包含定價和基準測試的詳細資訊。
此技術源自 2024 年的一項可解釋性研究。在《Refusal in Language Models Is Mediated by a Single Direction》(Arditi 等人,arXiv:2406.11717,NeurIPS 2024)一文中,作者表明,在 13 個參數量從 1.8B 到 72B 不等的開源聊天模型中,拒絕行為主要由殘差流(residual stream)中一個近似一維的子空間所控制——殘差流是在層之間傳遞資訊的內部狀態。移除該方向,模型便不再拒絕;加回該方向,模型甚至會拒絕無害的請求。
{{1}}Abliteration 將那項發現操作化:估算方向,然後從寫入殘差流的權重矩陣中將其正交化去除。{{/1}} {{2}}在我們自己的建置 Qwen3.8-27B-Uncensored-FP8 中,拒絕方向是在單一層級估算的,並從 131 個殘差寫入矩陣中移除,視覺塔則保持原樣。{{/2}} {{3}}存留下來的是相同的知識、相同的推理能力,以及相同的 262,144 token 上下文——只是拒絕機制被移除了。{{/3}} {{4}}而且關於這個標籤,要精確地說:「uncensored」並不代表經過對齊(aligned)或安全(safe)。它代表的是防護已解除。{{/4}} {{5}}我們稍後會再回來談這對你提出了什麼要求。{{/5}}
創造它們的研究
拒絕方向結果同時做到了兩件事。在科學上,它從機制上解釋了一種安全行為:存在一個真實、可找到的電路,使模型說不。在實務上,它顯示了對齊是多麼脆弱——只需對權重進行一次秩一編輯,就能關閉這項行為,無需微調。這不是某個實驗室模型的缺陷;作者已在十多種以上的聊天模型中重現了此結果。
到2026年,這項技術已成為一條單指令管線,這是個雙面刃的事實。Heretic 是一個開源函式庫,會逐層估計拒答方向,並透過正交化將其從注意力(attention)與 MLP 投影中移除;2026年5月的一份報告指出,移除Meta的Llama 3.3護欄約需10分鐘,Google的Gemma 4約需90分鐘,相關衍生模型超過3,500個,累計下載量超過1,300萬次。Abliterix(吳望張)則採取更謹慎的做法:它從800個有害提示與800個良性提示中提取拒答方向,套用正交投影,並將編輯以rank-1 LoRA適配器形式發布,讓基礎權重保持不變;同時回報拒答率與KL散度,使能力成本保持可見。在0.8B Qwen3.5模型上,它回報200個有害提示中拒答數為0。
以安全研究人員的方式閱讀那段文字。打造這些工具的重點,不在於任何人應該為了好玩而剝除模型的防護措施。重點在於,移除防護是輕而易舉且公開的——因此,衡量它、研究它的運作方式,以及建構能夠在移除後存活的防護措施,本身就是一套研究計畫。這就是白箱意義上的紅隊演練:在你明白一套系統有多麼容易被攻破之前,你無法防禦它。
為什麼無審查模型在2026年爆紅
三股力量匯聚成形。首先是開放權重浪潮:Qwen3.8 27B 及其同類模型以寬鬆授權發布,而「abliteration」不需要訓練過程——你只需編輯權重並重新量化。其次是工具鏈從研究級程式碼成熟為單行指令的函式庫,因此一位稱職的工程師可以在一個下午內產出建置版本。第三是 Hugging Face 成為發行通路,這意味著採用動能是可以量測的。
我們自己的數據點:Qwen3.8-27B-Uncensored-FP8,於2026年8月15日發布,在大約一天內獲得了257個讚和4,285次下載(8月16日核實)。這並不是說有數以萬計的人想要部署一個無防護的模型。而是有很多研究人員和工程師想要研究它——而下載數字正是這種好奇心的需求曲線。
用途:合法的研究用途
以下是合理可辯護的清單,而且是完整的清單。如果某種用途不在清單上,請假定它是不合法的:
• 可解釋性 — 研究拒絕迴路實際上是什麼、它位於何處,以及為什麼移除某個方向會改變行為。
• 紅隊測試與護欄評估 — 建立審核層,並測試其能否攔截已移除拒絕機制之模型所產生的內容。
• 過度安全衡量 — 量化基礎模型拒絕良性請求的頻率,並將其與真正的安全性區分開來。
• 穩健性研究 — 衡量對齊容易被移除的程度,這對任何設計安全微調的人而言都是不可或缺的資訊。
• 受控安全實驗 — 基準套件(如 AdvBench 和 JailbreakBench)的存在,正是為了能以標準化、可重現的方式衡量拒答行為。

所有這些都有一個共同點:模型是研究對象,而非交付成果。這項研究的產出是一篇論文、一項基準結果,或一道更好的護欄——絕不是一種服務。
如何負責任地運行一個(如果你真的有做研究)
如果您有正當理由使用 abliterated 模型,操作規則很直接:
• 在本地端運行,使用沙盒隔離,理想狀況下並應與外部網路完全隔離(air-gapped)。不得有公開端點、聊天服務或共享伺服器。
• 使用標準工具(vLLM 或 llama.cpp)提供服務,就像對待任何開放權重模型一樣。我們的建置是 block-FP8 量化,可在標準 vLLM FP8 核心路徑上運行,並保留其 262K 上下文、思考切換和工具呼叫功能。
• 要測量,不要只是空談。在有害提示詞基準測試套件上量化拒答率,並與基礎模型進行比較;在良性提示詞上量化過度拒答率;報告 KL 散度,使能力漂移顯而易見。這就是實驗與軼事之間的區別。

• 將輸出內容保存在受控環境中。記錄、審查並銷毀,而非傳播。
如果您正在評估自己的護欄,請將審核層放在模型前面並進行測試——這正是此項工作的重點所在。
• 如需完整的規格表、基準測試表與託管詳細資訊,請開啟我們的模型卡——這是此版本的標準參考依據。
安全界線:「僅供研究」的意義
這部分再怎麼強調都不為過。一個 abliterated 模型沒有真正有效的內建護欄。它會順從一般模型會拒絕的請求。這既是其特性,也是其風險——正因如此,每個認真發布此類模型的人,包括我們在內,都會附上相同的警告。
• 沒有內建的護欄。拒絕行為已經消失;不要表現得好像它還在。
• 不供终端用户使用,不用于生产环境。无论是面向公众的产品、聊天机器人、API,还是同事依赖的内部工具——这些都不是未审查模型的合适归宿。
• 責任由你承擔。我們以 Apache 2.0 授權發布 Qwen3.8-27B-Uncensored-FP8,該授權對再分發持寬鬆態度。授權並非安全證書:寬鬆的程式碼不會改變模型的行為,也不會轉移注意義務。
• 如果你使用它,你就擁有輸出內容。控制環境是你的責任;決定你要餵給它什麼、不餵什麼,以及你如何處理產出的東西,同樣是你的責任。

當未經審查的模型是錯誤答案時
最清楚的說法:如果模型另一端有人存在,無審查模型就是錯誤的答案。任何需要值得信賴的產品、任何判斷力至關重要的助手、任何拒絕才是正確行為的情境——都應該使用基礎模型。Qwen3.8 27B 之所以以正常形式存在,正是因為對幾乎所有真實用途來說,拒絕是功能,而非缺陷。abliterated 版本的存在,僅限於上述狹隘的研究用途,除此之外別無其他。
Bottom line.{{1}} An uncensored LLM is not a product category and it is not a hack. It is a research artifact with a genuine scientific lineage — {{2}}from the refusal-direction finding to the automated tools of 2026{{/2}} — and a hard deployment boundary. The models are real, the demand is measurable, and the legitimate uses are real too: {{3}}interpretability, red-teaming, guardrail evaluation, and controlled safety experiments{{/3}}. The line between studying the guard and turning the guard off for someone else is {{4}}the entire point of this page, and it does not move{{/4}}.{{/1}}
此確切建置版本以 Apache 2.0 授權公開,僅供研究使用。您可以 在 Hugging Face 下載權重
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
