「Abliteration, Explained」という記事のヒーローカード。拒否応答の除去を、トレーニングを伴わない重みレベルの編集として示しています。
Guides & Insights

Abliterationの解説:トレーニングを一切行わずに拒否応答の除去が機能する仕組み

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Abliterationは、LLMの拒否行動(「それにはお手伝いできません」という反射)を、重みの編集だけで、トレーニングランなしで除去します。これは、拒否がモデルの残差ストリーム内の単一の方向によって媒介されるために機能します。その方向を見つけて、ストリームに書き込む行列からそれを差し引くと、モデルは能力を維持したまま拒否をやめます。最も明確な公開例はQwen3.8 27B Uncensored (Aggressive)、そのモデルカードによると、AdvBenchにおける有害プロンプトへの拒否率は99.0%から0.0%に低下し、一方MMLUは実際に0.1ポイント上昇しています。これが、このメカニズムの仕組み、測定された数値が示すこと、そしてその境界線がどこにあるかです。

これはファインチューニングでも、RLHFでも、脱獄プロンプトでもありません。アブリテレーションは、解釈可能性の研究成果を線形代数に落とし込んだものです。2024年の論文は、内部表現のある1方向が、安全性トレーニングが多大な労力をかけて組み込んだ行動を制御しており、その方向を重みを直接編集することでオフにできることを示しました。この編集は射影であるため、低コストで、単一GPUで再現可能で、通常の共有可能なチェックポイントを残します。そのため、Qwen3.8-27Bファミリーを含むオープンモデルのアブリテレーション版は、「検閲なし」の研究用チェックポイントを生成する標準的な方法となっています。

拒否方向: 数千次元のストリームの中の一つのベクトル

トランスフォーマー内部では、すべてのトークンが通過するのは残差ストリームです — これは、各層が読み書きする動的な表現です。各層のアテンションブロックとMLPブロックは、このストリームを入力として受け取り、出力をそれに加算します。このストリームは事実上モデルの作業記憶であり、トークン位置ごとに1つのベクトル(次元はモデルの幅に等しい)を持ちます。

このすべての発端となった2024年の論文 — アンディ・アルディティと同僚たちによる、「言語モデルにおける拒否は単一の方向によって媒介される」 (arXiv:2406.11717, NeurIPS 2024) — チャットモデルが拒否しようとしているときと従うときのそれらのストリームベクトルがどのように見えるかを測定した。全体として、1.8Bから72Bパラメータまでの13のオープンウェイトチャットモデルにおいて、答えは驚くほど一貫していた。その差は本質的に一つの方向である。最終トークンでは、残差ストリームは、モデルが拒否しているときには単一の拒否方向に沿った大きな成分を持ち、従うときにはほとんど持たない。この幾何学的構造は危害カテゴリ間で整合しており、そのため射影は部分空間全体に広がるのではなく、最初の特異ベクトルに集中する。

その方向を見つけるには、有害(harmful)と無害(harmless)の2つのプロンプト集合に対してアクティベーションを収集し、各集合の最後のトークンの残差の平均を取ります。拒否方向はおおよそ mean(harmful) − mean(harmless)を単位長に正規化したものです。元の論文ではこれを線形プロービングとして位置づけていました。Qwen3.8-27B-Uncensored-FP8のような本番ビルドでは、有害と無害の最後のトークンの残差の、巨大アクティベーションでマスクされた平均差分として単一の方向(k=1)を推定します。有害/無害の分割以外のラベルは不要で、勾配もトレーニングも不要です。

編集: ストリームに書き込むすべての行列から方向を減算します。

拒否方向r — これは残留ストリーム中の単位ベクトル — が得られたら、介入はランク1射影です。出力が残留ストリームに加えられるすべての重み行列は、r を「除去」できます:

W' = W − r(rᵀW)

言葉で言えば、各行列の出力成分のうちr方向を向く成分を計算し、それを除去します。ストリームに書き込む行列は出力射影です——アテンション出力射影(o_proj)、MLPダウン射影(down_proj)、そしてトークン埋め込みの行空間です。この編集はfloat32で実行され、1つのGPUで数分かかり、オプティマイザは不要で、すでに収集した活性化ペア以外の学習データも必要ありません。

方向を削除する方法は2つあり、それらは区別して扱う価値があります:

• アクティベーションアブレーション — フォワードパスにフックし、実行中のアクティベーションから r 成分を差し引きます。可逆的で、重みには一切触れません。同じチェックポイント上で拒否と遵守を比較する実験に最適です。

• 重みの直交化 — 重み自体に射影を適用し、永続的で共有可能なチェックポイントを生成します。これが「abliteration」が指すものであり、検閲なしモデルリポジトリに含まれるものです。

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

直交化は意図的に乱暴です。重みから拒否成分を取り除くだけで、それ以外のことは何もしません。知識を追加することも、推論を改善することも、モデルをより正直にすることもできません。だからこそ、アブリテーションされたモデルは、拒否反射を除けばベースモデルと同様に振る舞うのです。

実際のビルドで131個のマトリックスがどのように見えるか: Qwen3.8-27B-Uncensored-FP8

具体的に言うと、Qwen3.8-27B-Uncensored-FP8(Hugging Face、2026年8月15日公開、Apache 2.0)は、Qwen3.8-27Bのアブリテーション版ビルドです。Qwen3.8-27Bはハイブリッドアテンションモデルであり、16個のフルアテンション層と48個のGated DeltaNet線形層(合計64層)に加えて、マルチトークン予測(MTP)ヘッドを備えています。このビルドは、131個の残差書き込み行列:

self_attn.o_proj — 17行列(16フルアテンション層 + MTP)

• linear_attn.out_proj — 48個の行列(Gated DeltaNetレイヤー)

• mlp.down_proj — 65個の行列(64層 + MTP)

• embed_tokens (行空間) — 1つの行列

拒否方向の推定はレイヤー38(round(0.6 × 64)、方向が最も集中する層)で行われ、編集後の最大残留漏れは1.8e-2でした。ビジョンタワーはそのまま変更されず、MTPヘッドは本体と一貫してアブリテートされたため、投機的デコードによって下流で拒否が再導入されることはありません。編集はfloat32で計算され、その後、公式のQwen3.8-27B-FP8チェックポイントと同じ方式でブロックFP8に再量子化されました。ビルドレポートでは、公式チェックポイントと99.9%同一のFP8コードが報告されており、これにより再量子化が編集を乱していないことがわかります。

測定結果: 拒否は崩壊し、能力は維持される

以下の数値はすべて、2026-08-15に公開されvLLMで評価されたQwen3.8-27B-Uncensored-FP8のモデルカードからのものです。これらはベンダー報告であり、独立に再現されたものではありません。また、abliteration編集の前後比較として公開されている中で最も完全なものです。

有害プロンプトベンチマークでの拒否、思考オフ(拒否率。低いほど無検閲):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150): 97.3% → 2.0%

• HarmBench standard (n=150): 98.7% → 2.7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench 有害 (n=100): 94.0% → 0.0%

• SimpleSafetyTests (n=50): 64.0% → 6.0%

スイート全体で、有害なプロンプトに対する拒否率は、ベースモデルの64~99%から、編集後は0~6%に低下します。思考を有効にした場合(enable_thinking=true)、残りの拒否率はさらに低く、どこでも≤1.7%で、ほとんどのベンチマークでは正確に0%です。この非対称性は示唆に富んでいます。拒否の方向性は主に高速な非思考経路に存在するため、出力ヘッドからそれを取り除けば、推論トレースがつまずく要素はほとんど残りません。

過剰拒否(ベースモデルが誤って拒否する無害なプロンプト)も低下する。XSTest-safe(n=250)では、5.6%から0.4%へと変わる。方向を除去すると、有害な拒否を止めるだけでなく、単にリスクがあるように見えた無害なリクエストを拒否することも止まる。その数字は、ベースモデルの「安全性」の一部が誤警報による負担であることを静かに示している。

能力、すべてベースから±1.3ポイント以内:

• MMLU(0-shot letter):84.3% → 84.7%(+0.4)

• GSM8K(CoT):90.0% → 88.7%(−1.3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU(0-shot):81.4% → 80.8%(−0.6)

WikiText-2 の perplexity は 6.96 です。言い換えると、この編集は外科手術的に的を絞ったものです。知識の上に組み込まれていた挙動を取り除き、知識そのものは——少なくともこれらの評価で測定される限り——本質的に無傷のまま残ります。

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

正直な注意点

見出しの数字からはわからない3つのこと。第一に、アブリテレーションは明確なオン/オフスイッチではない。有害なプロンプトへの応答の約30〜50%には、依然として短い安全免責事項が前置きされている——モデルは従っているものの、警告の一文が訓練の痕跡として残っている。単一方向の編集では、訓練時の行動の痕跡をすべて拭い去ることはできない。

第二に、拒否は冗長にコード化されている。一つの方向を除去すればその大部分は取り除けるが、一部のカテゴリーは他よりも深く埋め込まれており、あまりに積極的にアブレーションすれば、モデルは支離滅裂に陥る——過剰アブリテレーションは理論上の話ではなく現実の失敗モードである。あなたはダイヤルを回しているが、そのダイヤルには下限がある。

第三に、 能力コストは方向と層に依存します。このビルドは、方向が正しい層で推定され、射影が一貫して適用されたため、±1.3ポイント以内に収まりました。推定を誤った層に移したり、射影をより強く押し込んだりすると、同じ方法でも推論能力を測定可能な程度に低下させ得ます。結果は方法によって保証されるものではなく、ビルドによって獲得されるものです。

アブリタレーションが適切なツールではない場合

コンプライアントなアシスタントが欲しいなら、abliterate(アブリテレーション)は実行しないでください。必要なのは、拒否応答を除去したビルドではなく、アライメント済みのベースチェックポイントです。拒否応答を除去したQwen3.8-27Bを30GBのウェイトをダウンロードせずに評価したい場合、このファミリーはOrcaRouterで提供されています(obsidian/Qwen3.8-27B、100万トークンあたり入力$0.40/出力$4.21、262Kコンテキスト、2026-08-15掲載)。完全にロック解除されたバリアントは、セキュリティ研究者とレッドチーム向けにアクセスが制限されています。

選択的拒否を行いたい場合——武器を拒否し、それ以外には答える——LoRAやDPOのファインチューニング、あるいはシステムプロンプトのガードレールが、制御手段を提供します。Abliterationは大雑把で全体的な編集であり、特定のカテゴリだけを切り出すことはできません。

可逆的に実験したい場合は、重みを編集するのではなく、推論時のアクティベーションアブレーションから始めてください。同じチェックポイント上で拒否と追従を比較し、その挙動が望みどおりの場合にのみ、重みの編集に踏み切ることができます。

安全上の境界 — ご使用前にお読みください

アブリレイテッドモデルには組み込みのガードレールがありません。アライメントされたモデルにとって、拒否メカニズムこそがガードレールです。それを取り除くと、生の重みは、ベースモデルが答え方を知っているすべてのことに対して答えるようになります。射影(projection)には安全性を加えるものが何もなく、後段で出力を捕捉するものもありません。

正当な用途は研究用のものです:解釈可能性(拒否がウェイトのどこに宿っているのか、そしてその方向が他に何を制御しているのかを研究する)、レッドチーミングとガードレール評価(自己検閲を行わないモデルに対して自身の安全性レイヤーをテストする)、および過剰安全性の測定(XSTestにおける5.6%→0.4%という低下は、アライメントされたモデルが良性の入力を拒否する頻度を定量化しています)。いずれの場合も、モデルは研究対象であり、成果物ではありません。

境界線は装飾的なものではない:

• 研究専用 — 本番環境、エンドユーザー向け製品、または内部ツール向けではありません。

• ガードレールなし — 出力はフィルタリングされません。出力とその結果に対する責任はあなたにあります。

• ライセンスは安全証明書ではない — Apache 2.0は使用を許可するだけで、安全性を保証するものではない。

Hugging Face の両リポジトリ——Qwen3.8-27B-Uncensored-FP8 と、GGUF 再パッケージ版の Qwen3.8-27B-Uncensored-GGUF(2026-08-16 公開)——はゲート付きです:ダウンロードを開始する前に、研究専用の制限事項を了承する必要があります。

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

結論

Abliterationは、LLMの解釈可能性において最もクリーンな成果のひとつです。残差ストリーム内の単一の線形方向が、安全性トレーニングが莫大な計算リソースを投じて組み込んだ行動を媒介しており、ランク1の重み射影によって、トレーニングを実行することなくそれを除去できます。測定されたケース — Qwen3.8-27B-Uncensored-FP8 — は、この編集が外科的であることを示しています。拒否率は64〜99%から0〜6%へと激減し、過剰拒否は元のごく一部(5.6% → 0.4%)に低下し、能力は±1.3ポイント以内に維持されます。また、これがなぜ研究ツールであって製品ではないのかを正確に示しています。ガードレールはなく、免責事項は残存し、責任はあなたに負わされるという境界線です。拒否行動の理解、ガードレールのテスト、過剰安全性の測定に使用してください。ユーザーの前に置くためのものではありません。

Qwen3.8-27B-Uncensored-FP8はApache 2.0のもとでの研究用成果物であり、アクセス制限付きです。ここではホスト型サービスとして提供されていません。Hugging Faceでウェイトをダウンロード