記事『Qwen3.8-Flash-Next-Uncensored: llama.cppとApple SiliconでAbliterated MoEを実行』のヒーローカード。見出し、サブタイトル『GGUF + ネイティブMLX - 最大262Kコンテキスト』、および3つのスペックチップ(『Hugging Faceでゲート付き』、『GGUF量子化13種』、『6ビットMLXビルド』)を表示している。
Guides & Insights

Qwen3.8-Flash-Next-Uncensored: Abliterated MoEをllama.cppとApple Siliconで実行する

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

何かをダウンロードする前に: Qwen3.8-Flash-Next-UncensoredQwen3.8-27B-Uncensored。これらはファミリー名とアブリテーション技法を共有していますが、異なる重みドロップからの別モデルであり、このブログの以前の「Qw​en uncensored」投稿はすべて27Bに関するものです。ここで取り上げるのは、OrcaRouterが2026年8月26日にHugging Faceへ公開したペア — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUForcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — アブリテーション済みビルド Qwen3.8-Flash-NextAlibabaの176B保存/6B活性ルーテッド混合専門家(MoE)モデルであり、Qwen4アーキテクチャをプレビューします。私たちはこのドロップを「GGUF + ネイティブMLX、最大262Kコンテキスト」として発表し、セキュリティ研究者、レッドチーム、ブルーチームを対象にしました。このランブックは私たち自身のモデルカードに基づいて書かれています: ルーテッドMoE内で拒否除去が何を行うか、262Kコンテキストの主張が実際にどれだけのメモリを消費するか、両方のファイルラインをどうサーブするか、そして研究ラインがどこにあるか。もしアブリテーションの入門や27Bの量子化数学を求めていたなら、このシリーズの以前の投稿でそれらを扱っています。

Scoreboard card for Qwen3.8-Flash-Next-Uncensored with six rows: base model Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + terms), GGUF quants 13 (IQ2_XXS to Q5_K_M), vision mmproj F16 projector, MLX build 4/6/8-bit, context 262,144 tokens (YaRN to 1M); footer reads 'OrcaRouter model-card data, August 2026 - not independently audited.'

まず、門

両方のリポジトリはHugging Face上でゲートされています(gated: auto)。各リポジトリでログインし、利用規約に同意するまで、ファイルのダウンロードはできません。GGUFリポジトリとMLXリポジトリには、それぞれ独自のゲートがあります。これが、ゲートされていないGGUFラインとの最も実用的な違いです:単純な"just hf download"ワンライナーは、1バイトも取得する前に認証エラーで失敗します。流れは次のとおりです:

• Hugging Face にログイン(またはサインアップ)して huggingface_hub をインストールし、その後 hf auth login を一度実行して、トークンがディスクに保存されるようにしてください。

• ブラウザで orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF を開き、利用規約に同意し、orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX でも同じ手順を繰り返してください。

それ以降、認証済みトークンを使った hf download は、他のリポジトリと同じように機能します。取得する各量子化モデルと MLX ウェイトは、Apache-2.0 のもとにある研究用成果物です。これはベースモデルと同じライセンスであり、そのゲートも契約の一部です。つまり、利用規約を読むことが、モデルを使うための第一歩なのです。

The orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF repository on Hugging Face, showing the gated access banner ('You need to agree to share your contact information to access this model'), the tags abliterated/uncensored/qwen4/Mixture of Experts/llama.cpp/vision-language/mmproj, and the Apache 2.0 licence.

アブリタレーションがルーティング型MoEに何をするのか

この手法は、このブログの他の記事で取り上げた{{1}}Arditiスタイルの重み編集{{/1}}です;興味深いのは、それがこのアーキテクチャに具体的に何をもたらすかという点です。{{2}}密度の高い27Bモデルでは、それが131個の残差行列でした。{{/2}}{{3}}Qwen3.8-Flash-Next-Uncensoredでは、MLXモデルカードに149個の残差ライターテンソルに対するアブリテレーションが適用されたと記録されており、{{/3}}{{4}}このモデルを特徴づけるコンポーネント — MoEルーター、51Bのn-gram埋め込みテーブル、ビジョンタワー — は、{{/4}}{{5}}明示的に一切触れられていませんでした。{{/5}}

その「一度も触れられていない」というのが、ルーティングモデルにとっては全体像です。各トークンは512個のエキスパートのうち10個を活性化し、単一のエキスパートが拒否を担っているわけではありません。拒否行動は、最終出力を構成する残差ストリームに存在しており、それはまさに直交化が除去する方向です。したがって、ルーターは同じエキスパートをルーティングし続け、n-gramテーブルは同じ埋め込みを生成し続けます。変わるのは、出力射影が実行された後にモデルが何を言うかです。GGUFモデルカードの公表された評価では、その変化の形として、有害なプロンプトへの拒否がベースモデルの64〜100%からこのビルドではおよそ0〜3.3%に低下し、無害なプロンプトへの過剰拒否はほぼ0%、性能はMMLU-Pro / GSM8K / CMMLU形式の評価でベースと±2ポイント以内となっています。これらはモデルカード自身の数値であり、独立に再現されたものではなく自己申告です。

MTPヘッド:MLXには存在するが、GGUFでは削除されている

Qwen3.8-Flash-Nextには{{1}}約4Bのマルチトークン予測投機ヘッド{{/1}}が搭載されていますが、2つのビルドでその扱いが異なります。GGUFリポジトリはそれを除外しています — モデルカードは、これらのファイルにmtp投機的ドラフトヘッドが含まれていないことを明示しています — {{2}}なぜなら{{/2}}、llama.cppのqwen4expサポートはまだMTPを実装しておらず、ヘッドがファイル内で無駄な重荷になるからです。MLXビルドはそれを保持しているため、Appleシリコンでは引き続き投機的デコーディングを利用できます。ベースモデルを実行している実務者たちによって裏付けられている実際の結果は次の通りです: llama.cppのGGUF系は現在、投機的デコーディングなしで動作しています。{{3}}一方{{/3}}、MTP対応のSGLangセットアップは、同じクラスのハードウェア上でデコード速度を2倍以上にします。llama.cppがいつかqwen4exp向けにMTPを実装すれば、GGUF系は無料の高速化を得られます — {{4}}ただし{{/4}}、今週中にそれが実装されることを期待してハードウェアを購入しないでください。

262Kコンテキストという主張と、KVキャッシュのコスト

ネイティブコンテキストは262,144トークン(YaRNにより100万トークンまで拡張可能)で、実際に制約となるのはメモリです。良いニュースは、このアーキテクチャがKVキャッシュを小さく抑えていることです。48レイヤーのうち36レイヤーはGated DeltaNet線形アテンションを使用しており、履歴を固定サイズのリカレント状態に圧縮します。従来のKVキャッシュを持つのは、シーケンス長に応じて増大するフルアテンションの12レイヤーだけです。

コミュニティで測定された2つのデータポイントは、いずれもベースモデルに関するもので、そのまま直接当てはまります。4× RTX 3090 GGUF構成では、コンテキストを65Kから131Kに拡張した際、1カードあたりわずか約0.78 GBの追加KVで済んだと報告されています。また、単一のDGX Sparkでは、Q4クラスのファイルでフル262Kコンテキストを実行し、n-gramテーブルをCPUに固定してNVMeからmmapすることで、128 GBプールのうち約76.9 GBにモデルを常駐させたまま維持できました。GGUFモデルカード自身の予算の内訳は、合計 = ファイルサイズ + KVキャッシュ + 約0.9 GBのmmproj です。量子化選択への影響としては、262KではKVキャッシュも確かに項目として載りますが、支配的なのは重みです。そのため、27B GGUFガイドのVRAM優先ロジックがそのまま当てはまります。ここでの違いはファイルサイズ自体で、IQ2_XXSの約52 GBからQ5_K_Mの約125 GBまであります。

GGUFのラインナップ: 13種類の量子化、分割ファイル、mmproj、そしてllama.cppビルド

GGUFリポジトリには13の量子化レベルが用意されています — IQ2_XXS、IQ2_M、IQ3_XXS、IQ3_M、IQ4_XS、Q2_K、Q3_K_S、Q3_K_M、Q3_K_L、Q4_K_S、Q4_K_M、Q5_K_S、Q5_K_M — そしてIQ量子化は英語・中国語・コードのキャリブレーションテキストに対する重要度行列から構築されています。各量子化はマルチパートで、llama-gguf-splitで分割されているため、量子化のセット全体をダウンロードし、ローダーに...-00001-of-000NN.ggufパーツを指定してください。Q6_K、Q8_0、F16のティアはありません。その理由は経済的ではなく構造的なものです。n-gram(PLE)埋め込みテーブルが1つのテンソルとして大きすぎて、6ビット以上ではHugging Faceのファイルあたり50 GBの制限を満たせず、GGUFの単一テンソルはファイル間で分割できないからです。そのため、ラインはQ5_K_Mで上限となっています。

スキップしてはいけないもう一つのファイルは、mmproj-...-F16.gguf(およそ0.9 GB)です。これは視覚言語モデルであり、llama.cpp は画像入力にプロジェクタを必要とします。Qwen3.8-Flash-Next はマルチモーダルであり、このビルドも同様です。アブリテレーションは視覚タワーには影響しません。

llama.cpp のサポートはまだメインラインには含まれていません。アーキテクチャ ID は qwen4exp で、標準ビルドは "unknown architecture 'qwen4_exp'" で失敗します。PR #27742(ブランチ qwen4exp/qwen3.8-flash-next)のビルドが必要で、llama-cli、llama-mtmd-cli、llama-server、llama-gguf-split ターゲットでコンパイルされます。そこから、サービングの構成は通常の llama.cpp サーバーで、Qw​en 固有のフラグを使用し、パートファイルの量子化名を使います:

llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

-cには、収まる範囲のコンテキストを設定してください。カードの例では8192から始まります。推論はデフォルトで有効で、reasoning_contentで返されます。ツール呼び出しはOpenAI互換エンドポイントを通じて機能します。上記のサンプリング値はモデルカードの推奨値です。ベースモデルを使用する実務者は、非思考インストラクトモードでtemp 0.7 / top-p 0.80 / top-k 20、presence penalty 1.5を使用し、--chat-template-kwargs {"reasoning_effort":"medium"}で推論の深さを調整しています。

Apple Silicon向けのMLXビルド

MLXリポジトリはAppleシリコン向けのネイティブパスです。同じ重み、同じ拒否応答の除去、Metalネイティブランタイムを備えています。デフォルトの4ビット版(約163 GB)、発表済みの6ビット版(約192 GB)、8ビット版(約221 GB)を提供しており、fused-3Dエキスパートとn-gramテーブルは名目上のタグよりも高い精度で保持されているため、実効精度は均一な4ビットをはるかに上回ります。カードには「4ビット」タグについて、重みあたり約7.85実効ビットと記載されています。これがリポジトリサイズが大きく見える理由です。n-gramテーブルは、コミュニティの量子化が圧縮するように圧縮されていないのです。

The orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX repository on Hugging Face, showing the gated access banner, the tags Mixture of Experts/vision-language/function-calling/reasoning/mtp/ai-red-team, licence apache-2.0, and the card line 'An abliterated (refusal-removed) MLX build (4/6/8-bit) of Qwen's Qwen3.8-Flash-Next for Apple Silicon'.

ハードウェアが律速要因です。MLXはApple Silicon(Metal)でのみ動作し、重みにはユニファイドメモリが必要です。モデルカードには「163 GBの重みを収容できる十分なユニファイドメモリを備えたMac(例:MシリーズUltra)」と記載されています。4ビット版は192 GBクラスのマシンとして扱い、6ビット版は256 GBクラスと見なしてください。カードのタグには完全な機能セット(qwen4_exp、MoE、MTP、関数呼び出し、ビジョン言語)が記録されており、画像入力はmlx-vlmを介して駆動されます。ここにはMTP投機的ヘッドも含まれており、これがGGUF系に対するMLXビルドのひそかな強みです。

ビジョンパス、使用している方のために

これは視覚言語モデルであるため、マルチモーダル経路は付加機能ではなくランブックの一部です。llama.cppでは、画像入力にはmmprojプロジェクタと、llama-mtmd-cli / llama-serverを含むビルドの両方が必要です。MLXでは、テキスト専用のmlx-lmドライバではなくmlx-vlmで実行します。レッドチームにとって、ビジョン経路は興味深い評価作業が存在する場所です。マルチモーダルガードレール、画像に仕込まれたプロンプトインジェクション、自社システムのスクリーンショットに対するOCR、そしてパイプライン全体を狙った敵対的画像などです。アブリテレーションはモデル全体を対象とし、ビジョンタワーは無傷のまま残すため、テキストヘッドで拒否を引き起こしていたであろう画像は、拒否行動が存在しないモデルにそのまま到達します。GGUFカードには、このビルドでビジョンとマルチターンツール呼び出しが検証されたと記載されています。独立したビジョン評価スイートは公開されていません。

これが何のためのものか、そしてその線がどこにあるのか

このビルドには、ただひとつの作業があります。拒否応答を除去したモデルが何をできるのかを評価し、システムの理解と防御に役立てることです。レッドチームにとって、それは丁寧に断ることのないモデルに対して自社のガードレールをテストすることを意味します。プロンプトインジェクション耐性、データ外部持ち出しシナリオ、ツール使用の悪用、そして「ベースモデルは拒否する」と「モデルは実際にはできない」の間のギャップ。そのギャップこそが、abliteratedビルドの研究価値のすべてです。拒否レイヤーが何を隠していたかを示し、ポリシーによるセキュリティと能力によるセキュリティの違いを浮き彫りにします。ブルーチームにとって、同じ重みは敵対者の妥当なベースラインです。敵対的アクターがこれをダウンロードして実行できるなら、防御は、拒否する代わりに回答するモデルにも耐えなければなりません。このビルドに基づく評価は、カスタムで一度もアライメントされていないモデルが実現しうることの下限です。上限としてではなく、そのように扱ってください。

拒否応答の除去が何を変え、何を変えないのかを明確にすべきです。それは出力の振る舞いを変えます。つまりモデルは拒否しなくなりますが、能力は変わりません。新しい知識も、新しいスキルも、新しい計算資源もありません。同じトレーニング、同じ限界が、モデルが実際に生成できる範囲に存在します。拒否応答を除去されたモデルは、以前はできなかったマルウェアを作り出すことはできません。単に、婉曲な言い回しをする代わりに回答するだけであり、出力がより寛容になったからといって、より真実になるわけではありません。このカードの±2ポイントの能力帯と拒否数(拒否件数)の減少は、同じ事実を二つの側面から見たものです。

{{1}}線引きが位置するのはゲート付きリポジトリの同意事項であり、それは定型文ではありません。{{/1}}{{2}}正当な用途:自社システムの評価、モデルに対する公開の脆弱性調査、検出および防御的評価の構築、拒否メカニズムの研究。{{/2}}{{3}}非正当な用途:これをユーザー向けアシスタントとして展開すること、所有しておらずテストの権限がないシステムに対する動作するマルウェアやエクスプロイトの生成、詐欺、兵器材料。{{/3}}{{4}}Apache-2.0ライセンスおよび適用される法律が最低基準であり、{{/4}}{{5}}ゲートはその上に重なる明示的な研究目的の同意事項です。{{/5}}{{6}}あなたのユースケースが「チャットボットをユーザーに提供すること」であるなら、これはあなたのモデルではありません{{/6}}{{7}}—そしてそれは見落としではなく、意図的な設計によるものです。{{/7}}

提供されたベースラインを取得する方法

これらのウェイトは意図的にローカル限定にしています。レッドチームのプローブペイロードがサードパーティAPIを経由するべきではなく、セルフホスティングこそが本質です。比較用に検閲済みのホスト提供ベースライン(アリババのQwen3.8-Flash、入力100万トークンあたり0.16ドル、出力100万トークンあたり0.47ドル)が必要な場合、OrcaRouterはプロバイダーの定価で、マークアップ0%・自動フェイルオーバー付きでルーティングします。そのため、評価ハーネスは1つのキーだけで、追加契約なしにホスト型ベースとローカルの検閲なしビルドを切り替えられます。オープンのQwen3.8-Flash-Nextウェイトはまだ当カタログに掲載されていませんが、ルーティング対象のランタイムがそれらを扱うようになれば、同じ1キー・定価の構成で利用できるようになります。

ここから始める

自分のハードウェアに該当する項目を選び、該当するゲートを読んでください。128GB以上のユニファイドメモリを搭載したMacでは、MLXビルドを使えばMTPとビジョンが1箇所にまとまっています。MLXリポジトリの利用規約に同意し、4ビットまたは6ビットの重みを取得して、mlx-vlmで駆動してください。NVIDIA、AMD、またはCPUマシンの場合は、PR #27742からllama.cppをビルドし、GGUFリポジトリの利用規約に同意して、メモリに収まる量子化モデルを取得し、mmprojファイルを忘れないでください。どちらの場合も、拒否数と性能帯はリポジトリ自身が公表したもので、モデルカードに掲載されており、本稿執筆時点では再現検証されていません。これらを正直に解釈するなら、独立した監査の結果ではなく、ベンダーが自らの編集物を測定した値と見なすべきです。上記のゲート、ライセンス、安全境界は、同じ文面を3つの角度から示したものです。これは研究用ツールであり、その条件のもとで公開されています。

5つのFlash-Nextビルド(BF16、GGUF、MLX、FP8、およびNVFP4)がすべて収集されているのはQwen3.8-Flash-Next-Uncensoredコレクション(Hugging Face上)です。

27Bファミリーと混同しないでください: Qwen3.8-27B-Uncensoredは、異なるベースからアブリテートされた別のモデルで、独自のコレクションと独自のランブックを持っています。同じテクニック、異なる重み。

これらのウェイトは設計上ローカルのみです。アブリテーション済みビルドを比較評価するためのホスト型ベースラインとして、Qwen3.8-Flash は OrcaRouter 上でプロバイダー定価・マークアップ0%で提供されています——安全アライメントを維持した標準モデルです。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube