
Apple Silicon 上の Qwen3.8-27B-Uncensored-MLX: ビルドの選び方、LM Studio または mlx-vlm でのロード、そして 262K コンテキストを使いこなす方法
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
について最も知っておくべきことは、orcarouter/Qwen3.8-27B-Uncensored-MLXを実行するためにサブフォルダを選択する必要がないということです。OrcaRouterの、アブリテーション済みでAppleシリコン向けのQwen/Qwen3.8-27Bビルド(2026年8月17日にHugging Faceで公開されたので、新しいわけではなく、単にドキュメントが不十分なだけです)は、リポジトリのルートに4ビット版のコピーを保持しています。これは、1つのリポジトリを1つのモデルとして扱うツール(最も重要なのはLM Studio)が設定を一切せずにロードできるようにするためです。その1つの決定が、このカードが先月に約83,000回のダウンロードを集め、同等のMLX変換版がそのごく一部しか得ていない理由です。それ以外のすべては実際の選択です。4つの精度のうちどれがあなたのMacのユニファイドメモリに合うか、どのランナーを使うか、ビジョンとツール呼び出しがあなたのビット幅で機能するか、そして262,144トークンのコンテキストウィンドウがあなたのハードウェア上でのコストに見合うかどうか、ということです。この手順書では、これらの決定を順に説明します。これはファーストパーティのドキュメントです。以下のサイズ、精度、忠実度の数値はOrcaRouter自身がこの正確なビルドで測定したものであり、コミュニティ由来の数値はすべてそのように明記されています。

このリポジトリには正確に何が含まれているのですか?
これは、Qwen/Qwen3.8-27Bのアブリテーション版ビルドです。27Bの高密度ハイブリッド注意モデル(Gated Delta Net線形注意と完全注意)であり、ネイティブの視覚言語対応、思考制御、ツール呼び出し、マルチトークン予測(MTP)ヘッド、262,144トークンのコンテキストウィンドウを備えています。アブリテーションは、残差ストリームから拒否方向を直交化することで、モデルの拒否行動を除去します。これが初めての方は、このページ(ビルドの実行方法についてであり、手法そのものではない)よりも、当社の技法入門書の方が適しています。重みはベースモデルから引き継がれたApache-2.0です。
このリポジトリをqwen-3-8-27b-mlxと混同しないでください。qwen-3-8-27b-mlxは、MLX形式の同じベースモデルで、ノーアブリテーションです。読者はしばしば、意図したのとは別の方を取得してしまいます。こちらは拒否反応を除去した研究用ビルドで、あちらはApple Silicon上の素のQwen/Qwen3.8-27Bです。ダウンロードに時間をかける前に、リポジトリ名を確認してください。
見た目以上に重要な構造上の詳細が一つあります。ビジョンタワー、すべてのノルム、および線形アテンションのconv1dはBF16のままであり、言語モデルの線形層(embed_tokensとlm_headを含む)のみが量子化されます。それが画像理解が量子化後も維持される理由であり、以下のディスク上のサイズが単純な「27B at N bits」の見積もりより少し大きい理由でもあります。モデルの一部は決して圧縮されないからです。
決定:どのビルドがどのMacに適合するか

4つの精度はサブフォルダとして同梱されています — 8-bit/、6-bit/、4-bit/、2-bit/ — すべてMLXアフィン量子化で、グループサイズ64です。4-bitビルドはさらにリポジトリのルートにもミラーされています。まずお使いのMacのユニファイドメモリで選び、次に品質で選んでください:
• 8ビット — ディスク上で約27.5 GB。64 GB Mac を推奨(32 GB 機でもロードは可能だが、他の用途に使える余裕はほとんどない)。BF16 ソースに対するコサイン忠実度は 0.9997 で、実質ほぼロスレス。品質が最優先でメモリが潤沢な場合はこちらを選択。
• 6ビット — 約22GB、24〜32GBのMacに適しています。忠実度0.9996、非常に優れています。48GBマシンのほとんどの所有者にとって、ギガバイトあたりの品質バランスが最良です。
• 4-bit — 約15 GB、24 GBのMacで快適に動作します。忠実度0.996、非常に良好です。これは推奨デフォルトであり、そのためリポジトリのルートに置かれているコピーです。
• 2ビット—— 約8.7 GBで、16 GB Macに収まります。忠実度0.92、そして27Bでは著しく劣化します:繰り返しループ、文字化けしたテキスト、コードと中国語、部分的な視覚認識。カードにははっきりと書かれています——アーカイブ専用であり、実際の作業用ではありません。16 GB Macは技術的にロードできますが、それで使えるようになるわけではありません。
ディスク上のサイズはメモリ使用量を意味しません。重みはユニファイドメモリに、macOS、KVキャッシュ、Metalのスクラッチバッファとともに収まる必要があるため、余裕を残してください。M1 Pro搭載32GB Macでの4ビット版のコミュニティ実行では、ディスク上の重みは約16GBでしたが、推論時のピークは18.5〜21.7GBに達しました。また、8ビットMLXビルドのコミュニティ実行では、重みが約29.5GBの場合でもピークは約34〜36GBと報告されています。同じコミュニティテストから得られた実用的な指針は次のとおりです。27Bモデルでは16GBは現実的な選択肢ではなく、24GBなら短いコンテキストで4ビットを試すことができ、32GBが快適な出発点です。当社のVRAM計画に関する記事では、シリーズ全体について同じ計算を詳しく説明しています。
リポジトリ全体のリストは全精度を合わせると約94GBになるため、必要なサブフォルダのみを次のコマンドでダウンロードしてください:hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — 選択した精度に置き換えてください。ルートの4-bitコピーは4-bitサブフォルダの複製なので、両方を取得する必要はありません。
方法1 — LM Studio、設定不要
ルートの4ビットコピーが存在するのは、LM Studioがリポジトリ全体を1つのモデルとして扱えるようにするためです。モデルIDを検索し、希望の精度を選択してください(ルートのコピーは4ビットです)。アプリが残りを処理します。3つの落とし穴がありますが、すべて当社のカードに記載されており、これが成功と失敗のすべての分かれ目です。

• このリポジトリはアクセス制限されています。匿名でのダウンロードはHTTP 401を返します。モデルページで利用規約に同意し、Hugging Faceの読み取りトークンをLM Studioの設定 → 統合 → Hugging Faceに貼り付けてください。この手順を省略すると、読み込みは単に失敗します。
• KVキャッシュ量子化をオフにします。MLXビジョンモデルは、このアーキテクチャではKVキャッシュ量子化をサポートしておらず、有効にすると初期化中に読み込みが失敗します(mlx-engine#286として追跡中)。これはGGUFビルドに対するアドバイスとは逆です。GGUFではK/Vキャッシュの量子化は正当なVRAM節約になりますが、この2つのフォーマットはここでは互換性がありません。
• ランタイムを更新してください。 qwen3_5アーキテクチャのサポートは mlx-vlm 0.6.x で追加されました。古いバンドル済みランタイムでは、これらの重みをまったく読み込むことができません。一方、LM Studio の「Likely too large」バッジは、RAM に関する警告にすぎず、エラーではありません。上記のガイドラインをユニファイドメモリが満たしている場合は、無視してください。
LM Studioで選ぶべき精度:8ビットはディスク容量が約29.5 GBで、64 GBのMacが必要です。6ビットは約22 GBで、48 GBのマシンに適しています。4ビットは約16 GBで、32 GBのMacに最適な選択です。他のハードウェアでllama.cpp / Ollamaの方法を使いたい場合は、無検閲モデルのローカル実行ガイドがその道筋を別途カバーしています。
パス 2 — サブフォルダからの mlx-vlm と mlx-lm
コマンドラインルートでは、精度を直接得られ、エージェントツール用のOpenAI互換サーバーも利用できます。必要条件:pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 および mlx ≥ 0.32; MetalバックエンドはApple Silicon上で自動的に選択されます)。上記のサブフォルダのダウンロード後:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "量子もつれを一文で説明してください。" --max-tokens 256
追加:--image path/to/image.png(ビジョン入力用)、またはそれを提供します:
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080
For agent frameworks that speak OpenAI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.
視覚は量子化を生き残る
ビジョンタワーとconv1dはBF16のままなので、画像理解は4/6/8ビットで維持されます。私たちのプローブ画像(形状、色、位置、背景、画像内テキスト)では、4/6/8ビットのビルドはすべて正しく説明しましたが、2ビットは部分的にしかできませんでした。ビルドを選択する際にビジョンが重要なのであれば、4ビットが下限です。このビルドについてはAppleシリコン固有のビジョンスループットを公開していないため、自分のチップクラスでの名前付き実行に基づくものでない限り、そのtok/sの数値を信頼しないでください。
保持された視覚タワーもまたリスク面の一部であり、そのことを率直に言う価値は十分にある。画像も読み取れるアブリテレーション済みモデルは、テキストのみの安全性問題ではない。
ツール呼び出しとエージェントの使用
ツール呼び出しはベースモデルの能力であり、アブリテレーション後も維持されます。これにより、このビルドはエージェントシステムのレッドチーミングに真に有用であり、実際のサービスに向けられると真に危険です。標準的な設定は、前述のmlx_lm.serverエンドポイントであり、任意のOpenAI互換エージェントがアクセスできます。エージェントとして実行する場合、有効にしているものを理解してください。関数呼び出しと262Kコンテキストを備えた拒否レスモデルは、チャットモデルとは異なる安全性の態勢を意味し、カードが研究専用とされているのはそのためです。
262Kコンテキストと、その本当のコスト
このアーキテクチャにより、このモデルは{{1}}異常に安価な長いコンテキスト{{/1}}を実現しています。ここでのハイブリッド・アテンションとは、{{2}}48層の線形アテンション(Gated DeltaNet)層と16層のフルアテンション層が交互に配置された構成{{/2}}を意味し、従来のKVキャッシュを持つのは16層のフルアテンション層のみです。線形層はその代わりにコンパクトなリカレント状態を保持します。したがって、{{3}}262,144トークン{{/3}}のコストは、フルアテンションの27Bモデルと比較して{{4}}大幅に低く{{/4}}なります。これはベースモデルの構造的な事実であり、お使いのMacに関する約束ではありません。
{{1}}実際のところ、このウィンドウは無料枠ではなく、ひとつの性能(ケイパビリティ)です。{{/1}} {{2}}M4 Maxでのコミュニティによる長文コンテキストテストでは、短いコンテキストでおよそ63トークン/秒だったのが、31Kトークンでは約11トークン/秒にまで低下しました。キャッシュが埋まるにつれてデコードは急激に劣化し、非常に長いプロンプトでは、生のスループットよりも通常、最初のトークンが返るまでのレイテンシの方が大きな壁になります。{{/2}} {{3}}投機的およびANEベースのプリフィルは、インジェスト(入力処理)を改善しますが、デコードは改善しません。{{/3}} {{4}}このビルドにおける当社独自のApple-Silicon KVキャッシュのコスト数値は公表されていません。{{/4}} {{5}}お使いのハードウェアの確かな数値が必要なら、コミュニティのベンチマーク実行が信頼できる情報源です。{{/5}} {{6}}そしてコミュニティの一致した見解は、フル262Kは意図的に手を伸ばして使うものであり、常時オンにしたままのデフォルトとして扱うものではない、というものです。{{/6}}
速度 — 実際に測定されるもの
このビルドについて公開する速度指標は正確に1つだけであり、それはApple Siliconのものではありません。MLX CUDAバックエンド経由の単一H200上で、定常状態で約32〜37 tok/sです。これにより、ウェイトがmacOS以外でも動作することが確認されます。Macでは、当カードは意図的にtok/sを公開していません。なぜなら、それはチップ、精度、ランナーに依存するからです。知っておく価値のある実務者の数値は、すべてそのようにラベル付けされています:
• この正確なビルド、4ビット、M1 Pro 32 GB:短時間の実行で、生成は約8.7 tok/s、プリフィルは約41.7 tok/s(コミュニティテスト、2026年8月)。古いチップだが、現実的な下限値だ。
• M4 Max上のネイティブMTPを備えたoMLX、標準の非アブリテレーション済みチェックポイント: 散文53.3 tok/s、コード72.1 tok/s、4Kでのプリフィル約273.7 tok/s。MTPなしの生デコードは約24.6 tok/s。これは別のチェックポイントとランタイムで実務者が測定したものであり、アブリテレーション済み重みが近づくかもしれない上限値として扱ってください。約束ではありません。
• M3 Ultra上のoMLXデュアルANEプリフィル、アブリテレート済みoQ4e-MTP:プリフィルは16Kで約17.7%高速化、32Kで約18.9%高速化、デコードはLightning MTPで16K時に最大約75 tok/s。ただし注意点は現実的です:プライベートなAppleランタイムインターフェースと近似INT8ウェイトを使用し、ピークメモリを約4GB増加させ、モデルのロード時間を約3.4秒から約28秒に延ばします。これはプロンプト取り込みの最適化であり、生成アクセラレータではありません。
MTPヘッド — ランナーが対応していれば無料で得られる高速化
このビルドには、ベースモデルのマルチトークン予測ドラフターが mtp/ サブフォルダー(アーキテクチャ: qwen3_5_mtp)に同梱されており、任意のメイン精度で動作します。受理はロスレスです — グリーディーデコードでは、ドラフターなしで実行した場合と出力が同一になるため、有効時には品質コストなしで真の高速化が得られます。カードからのセットアップ上の注意が2つあります: このドラフターを含む mlx-vlm ビルドが必要です — つまり、qwen3_5_mtp ドラフター(main ブランチ)— そして、両方を渡す必要があります: --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp と --draft-kind mtp。設定 mtp_enabled だけでは何も起きません。ランナーがドラフターをサポートしていない場合、それは無視され、モデルは通常どおり実行されます — 何も壊れません。
安全 — これは実行する前に読んでください。実行後ではなく
モデルカード自体の免責事項は異常なほど率直であり、このページはそれを和らげるつもりはない。このビルドの安全性アライメントは大幅に除去されている。ベースのQwen/Qwen3.8-27Bが拒否するような、有害・非倫理的・攻撃的・違法な要求にも従ってしまい、意味のある組み込みのガードレールは存在しない。これは厳密に正当な研究——解釈可能性、AI安全性、拒否メカニズムの研究、レッドチーミング、堅牢性評価、統制された実験——のためにのみ公開されている。それがあなたの目的でないなら、このモデルは不適切である。
このカードの2つの警告は強調に値する。第一に、ジェイルブレイクと安全性プローブは、アブリテレーションされたモデルでは簡単に「成功」する。これは安全性評価の合格ではない——拒否方向を除去されたモデルの予想通りの挙動である。拒否の不在は安全性の証拠にはならない。第二に、維持された視覚機能、ツール呼び出し、262Kコンテキストは、攻撃面を画像理解とエージェント的利用へと拡大する。スクリーンショットを読んでツールを呼び出せる無検閲モデルは、チャット専用の拒否除去ビルドよりも広範なリスクである。低ビット量子化はその上に第三の不安定性をもたらす——2ビットでは、文字化けした出力が拒否と誤認されることさえあり、それ自体が紛らわしい失敗の一種である。
使用と出力に対する全責任および法的責任は利用者が負います。Apache-2.0ライセンスはベースモデルから引き継がれたものであり、この点を変更するものではありません。つまり、使用を許可するだけであって、デプロイの安全性を保証するものではありません。これをエンドユーザー、未成年者、または本番環境にデプロイする場合には、事前に独自のモデレーション、安全性、不正使用防止の各レイヤーを追加し、適用される法律を遵守しなければなりません。実際に実行する研究者にとっての実践的な安全策は、隔離された(理想的にはオフラインの)環境、実際のサービスに向けられていないエージェントツール、エンドユーザーへの露出を避けること、そして出力をどこかに送信する前にレビューすることです。
ローカルが答えではないとき
ローカルであること、それがこのビルドの要点です。ウェイトは手元のディスクに置かれ、トークンごとのコストはかからず、マシンの外へ何かが出ていくこともありません。しかしローカルには天井もあります。Appleシリコン専用であり、量子化品質を受け入れるしかなく、マシンがビジーなときの冗長性もありません。実用的なワークロードのために、アブリタレーション未処理の27BクラスのモデルをAPI経由で必要としている場合、あるいはこのローカルビルドを同じプロンプトでホスト型モデルとA/B比較したい場合、そのギャップを埋めるために存在するのがルーティングレイヤーです。OrcaRouterは、200以上のモデルをプロバイダーのリスト価格のまま1つのAPIキーで利用できるようにし、自動フェイルオーバーとルーティングDSLを備えています。ベンダーの値下げは発表当日に当社側でも反映されます。リスト価格をそのまま通しているからです。APIは1つ、統合も1つで、アカウントをもう1つ用意することなく、実証されていないローカル構成をホスト型モデルと比較できます。当社はこのMLXビルドをホストしません。設計上ローカルウェイトだからです。したがってAPIは補完的な経路であり、代替ではありません。
クイック意思決定ガイド
• 16 GB Mac — 正直なところ、このモデルは対象外です。2ビットなら収まりますが、アーカイブ専用です。どちらにせよメモリとの戦いになります。より小さな無検閲モデルか、18〜24 GBのマシン向けに作られたコミュニティ製の3/6ビット変換版を検討してください。
• 24 GB Mac — 4ビット、コンテキストを短く保つこと。ビジョンと長いコンテキストを同時に実行しないこと。
• 32GB Mac — 4ビットが最適解。コンテキストを短く保つなら6ビット。
• 48 GB Mac — ヘッドルーム付き6ビット。ウィンドウを押し上げなければ8ビット。
• 64 GB以上 — 上記の注意点を考慮すれば、8ビット、ほぼロスレス、262Kコンテキストが達成可能です。
以上がランクブックの全体です。このモデルは2026年8月17日時点のものであり、ローンチニュースではありませんし、その必要もありません。83,000件のダウンロードが発生したのは、人々がハウツーを求めていたからであり、このページがまさにそのハウツーです。リポジトリのルートから始め、LM Studioで4ビットを読み込み、品質と引き換えに何を失うのかを理解した場合にのみ、デフォルトビルドから離れてください。GGUFまたはFP8系から来た場合は、関連ガイドがそれらのパスをカバーしています。ここでの意思決定のフレームワークは同じですが、量子化の計算は異なります。
このモデルの別ビルドではありません — Qwen3.8-Flash-Next-Uncensoredは別リリースです:Qwen3.8-Flash-Next(Qwen4アーキテクチャの176B格納/6Bアクティブな混合エキスパート(MoE)プレビュー版)からアブリテーションされたものです。同じアブリテーション技術、異なる重み、独自のコレクションです。
6つの27Bビルド(BF16、GGUF、MLX、FP8、INT8およびNVFP4)はすべて、次に挙げるコレクションに収められています:Qwen3.8-27B-Uncensoredコレクション(Hugging Face上)。
これらの重みは設計上ローカルのみです。アブリテレイト版ビルドを比較するためのホステッドベースラインとして、Qwen3.8-27BはOrcaRouter上でプロバイダー定価の0%マークアップにて提供されています—安全アライメントがそのままの標準モデルです。
