OrcaRouter Ternary Bonsai 2 27B UncensoredとQwen3.8-27B-Uncensored-MLXの比較用タイトルカード。サブタイトルは「拒否方向を除去する2つの方法」、3つの統計チップは「実行時射影」「ビット単位で同一のパック」「alphaは実行時フラグ」、フッターは「両パックともOrcaRouterが公開、安全性の数値はOrcaRouterが実行、ルールベース分類器」。
Engineering & Research

Ternary Bonsai 2 27B Uncensored 対 Qwen3.8-27B-Uncensored-MLX:拒否方向を除去する2つの方法

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

OrcaRouter Ternary Bonsai 2 27B UncensoredQwen3.8-27B-Uncensored-MLXは同じ問い — 言語モデルから拒否方向をどう取り除くか — に、2つの異なる場所で答えています。Qwen3.8-27B-Uncensored-MLX の系譜は従来型の abliteration です。重み行列は学習された拒否方向に対して直交化され、編集後の重みは新しいチェックポイントとして保存されます。一方、OrcaRouter Ternary Bonsai 2 27B Uncensored は代わりに推論時に等価な射影を行い、各残差書き込みのうち拒否方向に沿う成分を差し引きます。そのため、基盤となる Bonsai パックは一切変更されず、ビット単位で同一のままです。どちらも私たち自身のリリースであり、両者の分岐はランタイムに関する好みではありません。それは三値重みに固有の算術から帰結するものです。

この比較の対象は、まだ1日しか経っていません。Prism ML は 2026年9月17日に Bonsai 2 27B を発表しました。Hugging Face のリポジトリはその前夜、2026年9月16日 23:40~23:41 UTC に Apache-2.0 の下で作成されました。これと比較されている abliteration 済みの MLX ビルドは、8月中旬から公開されています。以下に示すものは、この2つのうち新しい方の実績では一切ありません。測定されていない箇所については、本記事でその旨を明記しています。

同じトリックを、2つの異なる場所で応用した

通常のアブリテレーションは重みの編集である。拒否方向を推定し、それを残差ストリームに書き込む行列から射影して取り除く:W ← W - r(rᵀW)。数回の行列積だけで、オプティマイザーも損失もない。これが Qwen3.8-27B-Uncensored-MLX の作られ方だ — モデルカードでは「abliteration(拒否方向の除去)、次に MLX アフィン量子化」と説明されており、その方向は残差ストリームから直交化して取り除かれ、結果は新しい重みのセットとして保存された。出荷されるのは、すでにその方向が取り除かれたチェックポイントである。

OrcaRouter Ternary Bonsai 2 27B Uncensored は重みには一切手を加えず、各残差寄与が生成されるその箇所に、float32 で、保存された拒否方向 r:

y ← y - alpha · dot(y, r) · r

アルファ1(デフォルト)では、rに平行な成分がその書き込みから除去されます。アルファ0では投影はオフになり、モデルは公開パックと同じように動作します。中間の値は部分的な強度を与え、1を超える値は過剰投影となり、プロジェクトによれば品質を低下させる可能性があります。層の選択も公開されているため、スタック全体ではなくサブセットをアブレーションできます。方向自体は通常の5120次元ベクトルで、float32で約20 KBであり、追加のアダマール回転は適用されていません。なぜなら、投影は投影の出力に対して作用し、それらはすでに通常の隠れ基底にあるからです。

カバレッジの詳細は、これを自分で試すときに人が間違える部分です。ラップする場合、self_attn.o_projだけでは16箇所しか捕捉できません。この実装では129個の残差ライターをラップします: 64mlp.down_proj、48linear_attn.out_proj、16self_attn.o_proj、およびmodel.embed_tokensです。同梱のselfcheck.pyは、投影が残りのコンポーネントを残差ノルムのおよそ1e-6まで低下させることを検証し、129箇所が検出されない場合は警告します。

The OrcaBonsai-27B-Uncensored repository on GitHub, showing the About text 'Runtime behavioral ablation for compressed LLMs. First target: Ternary Bonsai 2 27B — no weight modification or re-quantization. by OrcaRouter team', the repo file tree including bonsai_abliterate, directions, swift and run.py, and the README opening 'This repository applies refusal-direction ablation to prism-ml/Ternary-Bonsai-2-27B-mlx-2bit entirely at runtime. The original Bonsai pack remains bit-identical.'

なぜ三値重みがこれを選好ではなく強制的な選択にするのか

ここが実際にこのモデルに固有の部分であり、両者がほぼ同じものを計算するにもかかわらず、ここで2つのアプローチが互換でない理由です。

三値パックは、グループサイズ128で、グループごとのFP16スケールに{-1, 0, +1}を掛けた値を、回転された基底で格納する。三値行列を拒否方向に対して直交化すると、密なフル精度行列が得られる。一般にW - r(rᵀW)に等しい三値行列は存在しない。したがって、編集済みの重みを保存し直すということは、それらを再量子化することを意味する。そして、編集済みの重みを再量子化しても、元のパックを生成した量子化対応トレーニングは再現されない。Prism MLがモデルに許容するよう訓練した丸め挙動は、量子化器の性質ではなく訓練手順の性質であり、後から再実行することはできない。

密な BF16 チェックポイントでは、その問題は生じない。編集済みの重みを 4-bit に丸めれば、少し劣る 4-bit モデルが得られるが、これは誰もがすでに受け入れている当たり前のトレードオフだ。三値パックでは、そのパックの存在意義である唯一の特性を捨て去ることになる。

なので、正直な捉え方としては「ランタイムのほうが優れている」ということではない。二つのうち、この特定のモデルに固有の特別さを保つのはランタイム射影だけだ、ということだ。拒否方向は20 KB。パックは8.005 GiB。

その8.005 GiBという数値は、MLXパック固有のものです — prism-ml/Ternary-Bonsai-2-27B-mlx-2bit。そのmodel.safetensorsは、Hugging Face API上で8,595,477,990バイト(8.595 GB、8.005 GiB)であり、グループごとに2ビットコードとFP16のスケールおよびバイアスを持つMLXアフィンコンテナです。これはPrism MLが提供するGGUFビルドとは別の成果物であり、数値が両者の間でそのまま当てはまることはありません。Prism ML自身が掲げる5.93 GB/重みあたり1.76ビットという見出しは、同社のPTQ1_0 GGUFを指しており、その実測値は5.947 GBです。同社のTrue Ternary形式は、重みあたり1.72ビット、5.80 GBとされています。これらの数値はいずれも、このランタイムがアブレーション対象とするMLXパックを表すものではありません。

チェックポイント方式が依然として優位に立つ場面、そして実際にいくつかの場面では優位に立つ

Two-column scoreboard for OrcaRouter Ternary Bonsai 2 27B Uncensored and Qwen3.8-27B-Uncensored-MLX across six shared dimensions: mechanism runtime projection vs checkpoint edit, original weights bit-identical vs rewritten and re-quantised, strength control alpha at runtime vs fixed at bake time, layer selection runtime flag vs recipe-time, runtime support the pack's own MLX runtime vs any MLX-compatible loader, and shipped alongside a 20 KB direction vector vs a second full checkpoint. Footer: 'Method per OrcaRouter project docs; both models OrcaRouter-released.'

これをより新しい手法の勝利の締めくくりとして書くのは簡単だろう。だがそれは間違いだ。従来のアブリタレーションの方が、ほとんどのデプロイを左右する軸で先行しているからだ。

1つの成果物、互換性のある任意のランタイム。 abliterated チェックポイントは通常の重みのセットです。すでに使っている MLX 互換ローダーならどれに読み込んでも動作します。ランタイム方式では、そのパック独自の同梱ランタイムが必要です。しかもこのプロジェクトは、通常の MLX ローダーがパックを読み込めたように見えても、気付かれないまま誤った計算をしている可能性があると明示的に警告しています。これははるかに狭い滑走路です。

ハードウェア。Qwen3.8-27B-Uncensored-MLX は 2、4、6、8 ビットのビルドで提供されており、4 ビット版のコピーがリポジトリのルートにミラーされているため、リポジトリを単一のモデルとして扱うツールでも設定なしで読み込めます。Ternary Bonsai 2 27B Uncensored は Apple Silicon / MLX 向けです。このパックの量子化 matmul には Metal カーネルと CPU カーネルがありますが、mlx-cuda を通じた CUDA 実装は存在しないため、NVIDIA マシンではこの MLX パックは現時点で GPU アクセラレーションをまったく得られません — CPU 推論は動作しますが、27B のフォワードパスには数分かかることがあります。そのため、Linux の CPU パスは実装テストと再現性の確認には役立ちますが、サービング用途には向きません。

ツールと馴染み深さ。アブリテーションには何年分ものツールの蓄積がある — 調整済みのレシピ、層範囲の探索、比較できる公開されたバリアント。ここで扱うランタイム手法には、1つのモデル上の1つの実装しかなく、昨日リリースされたばかりだ。

配布。単一のチェックポイントならダウンロードも1回で済む。ランタイムアブレーションでは、パックと方向ファイルとランタイムを同梱して出荷するため、読み手は3つを歩調を合わせて維持しなければならない。

根拠.チェックポイントのアブリテーションには、このベースモデルファミリーに関する第三者による測定値があります。三値パックに対するランタイムアブレーションは自社の数値しかなく、その中心的な前提は検証されていません——詳細は以下で述べます。

The Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX, showing the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2 / 4 / 6 / 8-bit for Apple Silicon', the tags abliterated, uncensored, red-teaming, apple-silicon and quantized, the apache-2.0 licence, a monthly download count of 179,590, and the base model Qwen/Qwen3.8-27B.

ランタイムアブレーションが引き換えに何をもたらすか

そのトレードオフは逆方向にも実際に存在し、このモデルを超えて一般化するのは最初の項目だ。

ビット単位で完全に同一のプロベナンス。変更された重みはゼロ、再量子化はゼロ、追加の量子化誤差もゼロ。これはスローガンではない。以下の能力値が単なる幸運な偶然ではなく解釈可能なものとなるのは、この特性があるからこそである。

調整可能なalpha。 アブレーション強度は実行時パラメータであり、チェックポイントの特性ではありません。ワークロードに合わせてスイープしたり、alpha 0 で完全に無効化したり、あえて過剰に投影して何が壊れるかを測定したりできます — 2つ目のモデルをダウンロードする必要はありません。

層選択的な制御。 層のサブセットをアブレーションすることは引数であり、再ベイクではありません。これは、どの層がその振る舞いを担っているかを研究する人にとって重要です。なぜなら、そうしなければ構成ごとにチェックポイントを生成することになるからです。

2つ目の重みセットは存在しない。編集済みモデルが元のモデルそのものである。その存在意義のすべてがフットプリントにあるパックにとって、約16GB——比較リポジトリの4ビットビルドと同じサイズ——の並行abliteratedコピーを出荷することは、その主張を損なうことになるだろう。

可逆性。 チェックポイントの編集は、その成果物に対して永続的です。ランタイムフラグはそうではありません。

私たちが持っている数値と、それらが正確にどのように測定されたか

このセクションの内容はすべて、OrcaRouter による OrcaRouter Ternary Bonsai 2 27B Uncensored の独自評価であり、その手法は数値と同じくらい重要です。

この測定は、ルールベースの冒頭フレーズ分類器であり、LLM ジャッジではない。思考はオフ、デコーディングは貪欲法、予算は64トークンで、base と ablated は alpha 0 対 alpha 1 において同一プロセス内の同じ重みである。その最後の点がこの設定の最も強い部分だ。チェックポイント間の比較はなく、結果を交絡させる量子化の違いもない。また、それが、数値をモデルが冒頭フレーズで述べる内容の尺度として読むべきであり、それ以上ではない理由でもある。

公開されている有害プロンプトセットにおける拒否率、ベースからアブレーション後まで:

• AdvBench (n=100) — 99.0%から6.0%へ

• JailbreakBench(n=100) — 96.0%から4.0%へ

• StrongREJECT(n=150)— 99.3% → 3.3%

• HarmBench(n=150)— 98.7%から7.3%へ

• MaliciousInstruct (n=100) — 97.0% → 0.0%

• ForbiddenQuestions(n=150) — 75.3%から5.3%へ

• SimpleSafetyTests(n=50)— 96.0%から18.0%、しかもこれは過小評価されている

SimpleSafetyTests が控えめに評価されているのには、特定の理由がある。このデータセットは主に自傷を促すプロンプトで構成されており、アブレーションしたモデルはそれらに対して「I am deeply sorry to hear…」で始まる危機対応のリダイレクトで応答する。分類器の完全一致フレーズリストにはその冒頭文が含まれていないため、リダイレクトをコンプライアンスとしてスコア付けしてしまう。実際の残存拒否率は 18.0% より高い。分類器は意図的にそのままにされている。それにより数値が OrcaRouter の他のモデルカードと比較可能に保たれるからだ — ただし読者は 18.0% を額面どおりに受け取るべきではない。

これらの実行はいずれも、返答がトークン予算を使い果たすことはなかった。だからこそ、ここでは64トークンの予算が正当化できる。完全な結果の別の列では、回答はしているものの、その回答を免責事項で包んでいた返答を数えている。それはセットに応じて42~60%だった。

単純な説明に反する2つの結果

二つの知見は、それ自体として扱うに値する。どちらも明白な解釈を複雑にするからである。

過剰拒否も低下します。 JailbreakBenchの良性プロンプトでは、公開されたパックはその25.0%を拒否します。アブレーションすると、拒否率は0.0%になります。XSTest-safeでは5.2%から0.4%になります。

これはこの手法の、あまり報じられていない半分である。公開されているBonsaiパックは、良性プロンプトセットの4分の1を拒否する。QATモデル内で拒否方向が何をしているにせよ、本来それを引き起こすはずのないプロンプトに対して発火している。その方向を取り除けば、それらの拒否もまた取り除かれる。それは安全性の犠牲ではなく、真の能力向上である。同じ効果は、他のモデルに関する独立した研究にも現れている。Atomic Chat自身の評価ハーネスは、アブリタレーション後のGemma 2 9Bの良性プロンプトに対する過剰拒否が44%から0.5%へと崩壊し、MMLUは68.4から68.0とほぼ動かなかったと測定した。彼らの測定であり、彼らのモデルであり、彼らのブログで自己申告されたものだ。重要なのは正確な数値ではなく、そのパターンである。

以下に述べる枠組みは居心地が悪いが正直だ。過剰拒否と拒否は同じつまみである。自分が嫌いな拒否だけを下げることはできない。

能力の保持は横ばいであり、それは偶然ではない。 能力チェック、ベースからアブレーションまで:

• MMLU(n=300) — 76.7%から77.7%、+1.0

• GSM8K(n=150) — 87.3%から86.0%、-1.3

• CMMLU(n=500) — 76.2% から 75.6%、-0.6

このサンプルサイズでは、あらゆる変動はノイズの内側にある——GSM8K の1問は0.7ポイント分の重みを持つ。MMLU-Pro は報告せず、除外した。そのプロンプトは回答の前に推論を求めるもので、どちら側でも回答の63~64%がトークン予算内で答えに到達しておらず、したがって精度の数値は測定値ではなく、予算によって決まる下限値にしかならないからだ。

能力がフラットに保たれるのは、重みがビット単位で同一であることから直接導かれる。そして、その理由を正確に述べておく価値がある。回答を行っているモデルは同じモデルである。ランタイムは残差の書き込みごとに1回のドット積と1回のAXPYを追加するだけで、重み、量子化、それらを読み取るカーネルについては何も変更しない。チェックポイント方式はそのフラットさを勝ち取らなければならない——そして多くの場合、そうなっていない。同じQwen3.8-27Bベースに対する別のアブリタレーションについて、SMF Worksのエンジニアが2026-08-17に公開した第三者のガントレットでは、複合スコアが79.0%から72.0%へ低下し、数学が50.0%から33.3%へ低下した。それは異なるレシピ、異なるツールチェーン、異なる測定であり、この比較のスコアではない。これは、このベースでのチェックポイント型アブリタレーションが、少なくとも1回の注意深く計測されたテストで二桁台の損失を招いたこと、そして「アブリタレーションはほぼ無料である」という主張が完全にレシピ次第であることを思い出させる。

まだ誰も検証していない前提

これは物語の中で率直に語られなければならない部分であり、脚注ではなく検閲解除方法の比較の中にこそ属するものである。

ここで用いられている拒否方向は、Bonsai パックの学習元である BF16 ベースモデルから推定されました。アーキテクチャと隠れ基底は同一であるため、このベクトルは次元的に正しく、射影は数学的に厳密です — ランタイムは、与えられた方向を残差ストリームから除去することを証明でき、実際に検証も行います。

それが証明しないのは、量子化認識トレーニング済みモデルにおいてもその方向が依然として同じ意味を持つということだ。その方向が量子化認識トレーニングを経てもどの程度保たれるかは、十分に測定されていない。ベクトルを正確に除去することは、それが表すと推定された振る舞いを除去することと同じではなく、重要なのは後者の主張だ。前節のあらゆる数値は、良好な転移と整合する実証結果である。それらのいずれも、転移が完全であることを実証するものではなく、プロジェクト自体もそう述べており、結論を下す前に alpha と層の選択をスイープすることを推奨している。

どんな誠実な無検閲化手法の比較も、これを認めざるを得ない。従来のアブリテレーションには裏返しの問題がある——重みを編集してから結果を測定するため、その方向性はモデルのバージョン間で転移する必要がないが、レシピが間違っていれば編集は恒久的で回復不能である。

まだ測定されていないものは何ですか?

移転の問題はさておき、三つのギャップについては、迂回して書くよりも、はっきり名指しする価値がある。

独立した再現はありません。出回っている Bonsai 2 27B のベンチマークはすべて——83.9 という平均値、98.2% という保持率、カテゴリ別の内訳——Prism ML によるベンダー報告であり、H100 上で vLLM バックエンドの EvalScope を使い、推論エフォート「xhigh」で実行されたものです。Prism ML 以外にこれらを再現した者はいません。上記の安全性と能力の表は私たち自身のものであり、これもまた独立したものではありません。

思考オン時の挙動。 私たちの表は思考オフです。他の abliterated モデルに関する独立した研究では、思考を許可した場合、攻撃成功率が 100% であっても、モデルが依然として相当な割合の応答で安全性について推論していることが分かっています。これがここでも当てはまるかどうか、またそれが冒頭フレーズの数値にどのような影響を与えるかは、測定されていません。

単一の方向。 この手法は、拒否が単一の方向によって媒介されると仮定している。これはArditi et al.の発見であり、この手法全体の基盤でもある。他のモデルに関する後続研究では、拒否カテゴリごとに幾何学的に異なる方向が見つかっている。1つのベクトルを単一のαで掃引しても、それだけでは決着しない。

それらのどちらかを選ぶ場合に、これが意味するもの

モデルを、自分が管理していないハードウェア上で、自分が書いていないローダーを通して、どこでも実行する必要があるなら、チェックポイントを選んでください。Apple Silicon 上にいて、自分が研究している成果物が Prism ML がトレーニングした成果物であることを重視し、アブレーション強度を、再ダウンロードしなければならない決定ではなく、切り替えられるパラメータにしたいなら、ランタイムを選んでください。どちらも正当化できる選択であり、どちらを選ぶかは、どちらの方法がより新しいかではなく、デプロイの制約によって決まります。

実証的に決めようとしているのなら、ランタイム方式には特筆に値する実用的な利点が一つある。alpha 0 と alpha 1 は同じプロセスと同じ重みなので、両者を比較するとアブレーションだけが切り出され、それ以外は何も混ざらない。これは2つのチェックポイントを差分比較するよりもクリーンな実験であり、上の表が、その射影の2つの量子化を測ったものではなく、射影そのものを測ったものとして読めるのは、そのためだ。

責任ある使用

学習された拒否方向を除去すると、元のモデルなら拒否する要求にモデルが応答する可能性がある。これは副作用ではなく、機構が機能しているということであり、機能として分類されるべきではない。これは研究および推論制御のための機構であり、結果として得られる出力が安全、正確、適切であることを示す証拠ではない。

公開されたパック自体のカードは、逆の側から同じ点を指摘している。アブリテレートされた MLX ビルドは「安全性アラインメントが大幅に除去されており」、元のモデルなら拒否する要求にも応じ、意味のある組み込みのガードレールを備えていない。その作者たちは、解釈可能性、安全性研究、レッドチーミング、ロバスト性評価といった正当な研究に用途を限定し、デプロイにはまず独自のモデレーション層とアクセス制御を追加しなければならないと明確に述べている。

この記事には、拒否の除去がコストを伴わないという主張も、拒否率が低いことが品質のシグナルであるという主張も一切ない。より多くの質問に答えるモデルが、それによってより良いモデルになるわけではない。また、冒頭のフレーズを数えるルールベースの分類器は、能力ではなく言い回しを測定しているものである。これらの成果物はいずれも、運用者に義務が付随する研究ツールであり、その義務はアブレーションコードを書いた者に移るものではない。

ランタイムアブレーションのコード、拒否方向、および完全な評価テーブルは、OrcaRouterによって、チームが構築するルーティングプラットフォームとともに公開されています。