
Ternary Bonsai 2 27B Uncensored 與 Qwen3.8-27B-Uncensored-MLX:移除拒絕方向的兩種方法
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
OrcaRouter Ternary Bonsai 2 27B Uncensored與Qwen3.8-27B-Uncensored-MLX回答同一個問題——如何從語言模型中移除拒絕方向——而它們在兩個不同的地方回答。Qwen3.8-27B-Uncensored-MLX 這一系屬於傳統的 abliteration:權重矩陣會對一個學到的拒絕方向進行正交化,而編輯後的權重會儲存為新的檢查點。OrcaRouter Ternary Bonsai 2 27B Uncensored 則改在推論時進行等效的投影,減去每個殘差寫入中沿著拒絕方向的分量,因此底層的 Bonsai 套件永遠不會被修改,並保持位元完全相同。兩者都是我們自家發布的版本,而它們之間的分歧並非對執行環境的偏好,而是源自三值權重特有的算術。
這項比較的對象才剛滿一天。Prism ML 於 2026-09-17 發表 Bonsai 2 27B;Hugging Face 的儲存庫則是在前一晚、2026-09-16 的 23:40–23:41 UTC 建立,採用 Apache-2.0 授權。與之比較的 abliterated MLX 版本自八月中便已上線。以下內容都不是兩者中較新那方的過往實績——凡有尚未測量之處,本文都會如實註明。
同樣的手法,應用在兩個不同的地方
一般的 abliteration 是一種權重編輯。你先估計出一個拒答方向,再把它從寫入殘差流的矩陣中投影掉:W ← W - r(rᵀW)。幾次矩陣乘法,不需要優化器,也不需要損失函數。Qwen3.8-27B-Uncensored-MLX 就是這樣製作出來的——模型卡將它描述為「abliteration(移除拒答方向),再進行 MLX 仿射量化」,該方向被正交化並從殘差流中剔除,結果另存為一組新的權重。最終交付的,是一個拒答方向早已不存在的檢查點。
OrcaRouter Ternary Bonsai 2 27B Uncensored 不更動權重,而是在每個殘差貢獻產生之處進行介入,以 float32 精度,並使用已儲存的拒絕方向 r:
• y ← y - alpha · dot(y, r) · r
在 alpha 1(預設值)時,與 r 平行的分量會從該次寫入中移除。在 alpha 0 時,投影會關閉,模型的行為與已發布的套件相同。介於其間的值會提供部分強度,高於 1 的值則會過度投影,專案表示這可能降低品質。層選擇也公開了,因此你可以對子集進行消融,而不是整個堆疊。方向本身是一個普通的 5120 維向量——以 float32 表示約 20 KB——沒有套用額外的 Hadamard 旋轉,因為投影是作用在投影輸出上,而這些輸出已經位於一般的隱藏基底中。
覆蓋範圍的細節,正是人們自己動手嘗試時最容易弄錯的地方。self_attn.o_proj單獨包覆只涵蓋 16 個位置。本實作則包覆了 129 個殘差寫入點:64 個 mlp.down_proj、48 個 linear_attn.out_proj、16 個 self_attn.o_proj,以及 model.embed_tokens。隨附的 selfcheck.py會驗證該投影能將剩餘元件降至殘差範數約 1e-6,並在未偵測到 129 個位置時提出警告。

為什麼三元權重讓這成為強制選擇,而非偏好
以下是實際專屬於這個模型的部分,而這就是為什麼這兩種方法在這裡不能互換,即使它們計算的幾乎是同一件事。
三值封裝會將值儲存為 {-1, 0, +1} 乘以每組 FP16 縮放係數,群組大小為 128,並以旋轉基底表示。將三值矩陣對拒答方向正交化,就會得到一個稠密、全精度的矩陣。不存在任何三值矩陣等於W - r(rᵀW),一般而言。因此,把編輯後的權重存回去就意味著要將它們重新量化——而重新量化編輯後的權重,並不會重現產生原始封裝的量化感知訓練。Prism ML 訓練模型去容忍的捨入行為,是訓練程序的性質,而不是量化器的性質,而且你無法事後重新執行它。
在稠密 BF16 檢查點上,這個問題不會出現。把編輯過的權重捨入到 4 位元,你會得到一個稍微差一點的 4 位元模型,而這是大家早已接受的普通取捨。在三值封裝上,你就會丟掉這個封裝之所以存在的唯一特性。
所以,誠實的表述並不是「執行期比較好」。而是,執行期投影是兩者中唯一能保留這個特定模型特別之處的方法。拒絕方向是 20 KB。這個套件是 8.005 GiB。
那個 8.005 GiB 的數字是專指 MLX 封裝——prism-ml/Ternary-Bonsai-2-27B-mlx-2bit,其 model.safetensors 在 Hugging Face API 上量測為 8,595,477,990 位元組(8.595 GB、8.005 GiB),是一個 MLX 仿射容器,每組含有 2 位元編碼加上一個 FP16 縮放與偏置。它與 Prism ML 出貨的 GGUF 建置是不同的產物,而且數字不會在兩者之間通用。Prism ML 自家 5.93 GB/每權重 1.76 位元的主打數字描述的是他們的 PTQ1_0 GGUF,其量測為 5.947 GB;他們的 True Ternary 格式則標示為每權重 1.72 位元與 5.80 GB。那些數字都無法描述這個執行階段所消融的 MLX 封裝。
檢查點方法仍然勝出的地方,而它確實有勝出的時候。

要把這寫成較新方法的勝利巡禮會很容易。但那會是錯的,因為傳統 abliteration 在決定大多數部署的關鍵軸線上仍占上風。
• 一個產物,任何相容的執行環境皆可使用。 經消融處理的檢查點就是一組正常的權重。把它載入到你原本已在使用的任何 MLX 相容載入器中,就能運作。而執行環境取向的做法則需要該套件自己隨附的執行環境——而且該專案明確警告,一般的 MLX 載入器可能看似能載入該套件,卻在無聲無息中計算出錯誤的結果。那是一條狹窄得多的跑道。
• 硬體。Qwen3.8-27B-Uncensored-MLX 提供 2、4、6 與 8 位元版本,並在儲存庫根目錄鏡像了一份 4 位元副本,因此將儲存庫視為單一模型的工具無需設定即可載入。Ternary Bonsai 2 27B Uncensored 是 Apple Silicon / MLX。此套件的量化矩陣乘法具有 Metal 與 CPU 核心,但透過 mlx-cuda 沒有 CUDA 實作,因此在 NVIDIA 機器上,此 MLX 套件目前完全無法獲得 GPU 加速——CPU 推論可以運作,而 27B 前向傳遞可能需要數分鐘。這使得 Linux CPU 路徑適用於實作測試與可重現性,而非用於服務。
• 工具與熟悉度。 Abliteration 背後有數年的工具支援——調校過的配方、層範圍搜尋、可供比較的已發表變體。這裡的執行期方法只有一個實作,只用於一個模型,而且是昨天才發布的。
• 散佈。單一檢查點就是單次下載。執行時期消融會隨附一個套件、一個方向檔案,以及一個執行環境,而讀者必須讓這三樣東西保持同步。
• 證據。 檢查點 abliteration 在此基礎模型系列上有第三方量測數據。三元套件上的執行階段消融僅有我們自己的數據,且其核心假設尚未驗證——詳見下文。

執行時消融換來的是什麼
這種取捨在另一個方向上也確實存在,而第一項才是能泛化到這個模型之外的。
• 位元完全一致的溯源。零權重修改、零重新量化、零額外量化誤差。這不是一句口號;而是讓下方能力數據得以被解讀、而非僥倖巧合的關鍵特性。
• 可調整的 alpha。消融強度是執行階段參數,而非檢查點屬性。你可以針對你的工作負載對其進行掃描,使用 alpha 0 將它完全停用,或過度投影並衡量哪些部分會出錯——而無需下載第二個模型。
• 分層選擇性控制。 消融部分層級是一個參數,而非重新烘焙。對於任何研究哪些層承載該行為的人來說,這一點很重要,因為替代方案是為每種配置產生一個檢查點。
• 沒有第二組權重。 編輯後的模型就是原始模型。對於一個整體論旨都圍繞著檔案足跡的套件而言,另外附上一份約 16 GB 的平行 abliterated 副本——相當於比較用 repo 中 4-bit 版本的大小——反而會削弱這個論點。
• 可逆性。 檢查點編輯對該產物而言是永久性的。執行階段旗標則不是。
我們所擁有的數字,以及它們確切是如何被測量的
本節所有內容均為 OrcaRouter 對 OrcaRouter Ternary Bonsai 2 27B Uncensored 的自家評估,而方法與數字同樣重要。
這項量測是基於規則的開頭語句分類器,而非 LLM 評審。思考已關閉,解碼採貪婪策略,預算為 64 個 token,而基礎版與消融版是在同一流程中、對比 alpha 0 與 alpha 1 的相同權重。最後這點是這個設定最有力的部分:沒有跨檢查點比較,也沒有量化差異會混淆結果。這也是為什麼這些數字應被解讀為衡量模型在開頭語句中所說內容的指標,且僅此而已。
已發表的有害提示集上的拒絕率,從基礎模型到消融模型:
• AdvBench(n=100)— 99.0% 至 6.0%
• JailbreakBench(n=100)— 96.0% 至 4.0%
• StrongREJECT(n=150)— 99.3% 至 3.3%
• HarmBench(n=150)—— 98.7% 降至 7.3%
• MaliciousInstruct(n=100)—— 97.0% 至 0.0%
• ForbiddenQuestions(n=150)— 75.3% 至 5.3%
• SimpleSafetyTests(n=50)——從 96.0% 降至 18.0%,而這一項其實還被低估了
SimpleSafetyTests 的數字被低報,是有特定原因的。那個測試集大多由自傷提示組成,而經消融的模型會以危機轉介來回應,開頭是「I am deeply sorry to hear…」。分類器的精確片語清單並未包含那個開頭,因此它會把轉介評為遵從。實際的殘餘拒答率高於 18.0%。分類器是刻意保持原樣的,好讓這些數字能與 OrcaRouter 的其他模型卡保持可比——但讀者不應把 18.0% 照單全收。
在這些執行作業中,沒有任何一則回覆用完其符元預算,這正是 64 符元預算在此站得住腳的原因。完整結果中另有一欄,統計的是雖有作答、卻把答案包在免責聲明裡的回覆;該比例依資料集不同,介於 42–60%。
兩個與簡單敘事相悖的結果
其中兩項發現值得單獨探討,因為兩者都讓顯而易見的解讀變得複雜。
過度拒絕也會下降。在 JailbreakBench 的良性提示上,已發布的套件會拒絕其中 25.0%。經消融後,它拒絕 0.0%。在 XSTest-safe 上,它從 5.2% 降至 0.4%。
這是該技術中較少被報導的另一半。已發表的 Bonsai 套件會拒絕四分之一的良性提示集;無論拒絕方向在 QAT 模型中起了什麼作用,它都在對本不該觸發它的提示上觸發。移除該方向也會一併移除那些拒絕,而這是真正的能力提升,而非安全成本。同樣的效果也出現在針對其他模型的獨立研究中——Atomic Chat 自家的測試框架測得 Gemma 2 9B 的良性提示過度拒絕在 abliteration 之後從 44% 降至 0.5%,而 MMLU 基本上沒有變動,從 68.4 到 68.0。他們的測量、他們的模型,在他們自己的部落格上自我報告;重點在於這個模式,而非確切數字。
接下來這個框架令人不舒服,但很誠實:過度拒絕與拒絕是同一顆旋鈕。你不能只調低你不喜歡的那些拒絕。
能力保留率持平,而這並非僥倖。能力檢查,從基準到消融:
• MMLU(n=300)— 76.7% 至 77.7%,+1.0
• GSM8K(n=150)— 87.3% 至 86.0%,-1.3
• CMMLU(n=500)— 76.2% 至 75.6%,-0.6
在這些樣本量下,每一處變動都落在雜訊範圍內——一道 GSM8K 題目就值 0.7 分。MMLU-Pro 是被排除而非列入報告:它的提示要求先推理再作答,而雙方各有 63–64% 的回覆在 token 預算內尚未得出答案,因此任何準確率數字都只會是由預算設定的下限,而非一項量測。
能力持平直接源自位元完全相同的權重,值得精確說明其原因。負責回答的模型就是同一個模型。執行階段在每次殘差寫入時增加一個點積和一個 AXPY,並且不會改變權重、量化,或讀取它們的核心。檢查點方法必須努力才能達到這種持平——而且往往做不到。第三方對同一 Qwen3.8-27B 基礎模型進行不同 abliteration 的嚴苛測試,由 SMF Works 的一位工程師於 2026-08-17 發布,測得綜合分數從 79.0% 降至 72.0%,數學從 50.0% 降至 33.3%。那是不同的配方、不同的工具鏈和不同的測量,所以它不是這個比較的分數。這提醒我們,在這個基礎模型上進行檢查點 abliteration 在至少一次仔細且有儀器輔助的測試中造成了兩位數的損失,而「abliteration 幾乎免費」這種說法完全取決於配方。
尚未被任何人驗證的假設
這是故事中必須直白說出的部分,而且它應該放在去審查方法的比較裡,而不是放在腳註中。
這裡使用的拒絕方向,是從 Bonsai pack 訓練所依據的 BF16 基礎模型估算出來的。架構與隱藏基底完全相同,因此該向量在維度上是正確的,投影在數學上也是精確的——執行階段能證明,也會驗證它會從殘差流中移除所提供的方向。
那並不能證明的是,在量化感知訓練過的模型中,這個方向仍然代表同一件事。這個方向能在量化感知訓練中保留到什麼程度,尚未被完整測量。精確移除一個向量,並不等於移除它被估計所代表的行為,而第二項主張才是真正重要的。上一節中的每一個數字,都是與良好遷移相符的實證結果;它們沒有任何一個能證明遷移是完整的,而該專案自己也這麼說,並建議在得出結論之前,先對 alpha 與層選擇進行掃掠。
任何對去審查方法的誠實比較都必須承認這一點。傳統的 abliteration 有鏡像問題——它會編輯權重,然後測量結果,因此其方向永遠不必在模型版本之間轉移,但如果配方錯了,其編輯便是永久且無法復原的。
什麼仍未被衡量
除了移轉問題之外,有三個缺口值得點名,而不是繞著不談。
• 無獨立重現。目前流通的每一項 Bonsai 2 27B 基準測試——83.9 平均、98.2% 保留率、各類別拆分——都是由 Prism ML 廠商自行回報,使用 EvalScope 在 H100 上的 vLLM 後端執行,推理強度設為「xhigh」。Prism ML 以外無人重現過這些結果。上方的安全性與能力表格是我們自己的,同樣不具獨立性。
• 開啟思考時的行為。我們的表格是關閉思考的。針對其他已消融模型的獨立研究發現,即使攻擊成功率達 100%,當允許模型思考時,它仍會在相當比例的回應中對安全性進行推理。這在此處是否成立,以及它對開場短語數字的影響,尚未經過測量。
• 單一方向。該方法假設拒答是由單一方向所中介,這是 Arditi 等人的發現,也是整套技術的基礎。後續針對其他模型的研究發現,不同的拒答類別在幾何上具有各自不同的方向。只以一個向量、掃過一個 alpha,並不足以就此定論。
如果你正在它們之間做選擇,這意味著什麼
如果你需要模型能在任何地方執行、跑在你無法掌控的硬體上、透過不是你寫的載入器來載入,就選檢查點。如果你用的是 Apple Silicon、在意你正在研究的產物就是 Prism ML 所訓練的那個產物,而且希望消融強度是可以轉動的參數、而不是必須重新下載才能改變的決定,就選執行環境。這兩者都站得住腳,而它們取決於部署條件,不是取決於哪個方法比較新。
如果你正試圖以實證方式做出判斷,執行期方法有一個值得特別指出的實際優勢:alpha 0 和 alpha 1 是同一個流程、同一組權重,因此兩者之間的比較只會隔離出消融效果,別無其他。這是一項比對兩個檢查點做差異比對更乾淨的實驗,也正是上表之所以能被解讀為對投影本身的測量,而不是對其兩種量化方式的測量的原因。
負責任使用
移除一個學到的拒絕方向,可能使模型回應原始版本會拒絕的請求。這是機制在發揮作用,不是副作用,因此不應被歸類為功能。這是一種研究與推論控制機制,並不代表任何由此產生的輸出是安全、正確或適當的。
已發佈套件自己的說明卡也從另一面提出了同樣的觀點:去拒答化的 MLX 版本「其安全對齊已被大幅移除」,會順從原始版本會拒絕的要求,且不具任何有意義的內建防護機制。其作者將其用途限定於正當研究——可解釋性、安全研究、紅隊測試、穩健性評估——並明確表示,部署前必須先加入自身的內容審核層與存取控制。
本文沒有任何論點主張移除拒答是零成本的,或較低的拒答率是品質訊號。能回答更多問題的模型並不因此就是更好的模型,而以規則為基礎、計算開頭語句的分類器,衡量的是措辭,而非能力。這兩項人工產物都是附帶操作者責任的研究工具,而這份責任並不會轉移到撰寫消融實驗程式碼的人身上。
執行階段消融程式碼、拒答方向與完整評估表皆由OrcaRouter發布,並連同該團隊所建置的路由平台一併公開。
