記事「MacBook ProでGLM-5.3-Flashを実行する方法」のヒーロータイトルカード(サブタイトル「The 2bit-Lite MLX Playbook」)。キーボードの上方に柔らかなニューラルネットワークのモチーフをあしらった様式化されたMacBook Proと、「2bit-lite」「~102 GB」「128 GB Mac」とラベル付けされた3つのチップが描かれている。
Guides & Insights

MacBook ProでGLM-5.3-Flashを実行する方法:2bit-Lite MLXプレイブック

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

実行するGLM-5.3-Flashというのは、MacBook Pro 上では正確には1台のマシン、すなわち128 GB M4/M5 Max MacBook Pro実行している2bit-liteビルド当社のMLX変換、macOS の wired-memory 制限を引き上げたものである。お使いの MacBook Pro が 128 GB 未満(36 GB M4 Pro、48 GB M4 Max)の場合、このプレイブックはあなた向けではありません。最後のセクションに進んで、ホストされている z-ai/glm-5.3-flash API を利用してください。GLM-5.3-Flash(重みは zai-org/GLM-5.3-Flash)は、Z.ai の 3200億パラメータの Mixture-of-Experts モデルで、トークンあたり 18B のアクティブパラメータを持ち、2026年8月26日にリリースされた、初のネイティブなマルチモーダル GLM-​5 です。また、当社の MLX 移植版の最小ビルドでも、約 102 GB の重みと約 112 GB のメモリが必要です。それが市場のすべてであり、私たちはそれを和らげるつもりはありません。

これはファーストパーティのドキュメントであり、発表記事ではありません。以下のウェイトはOrcaRouter自身のビルド(orcarouter/GLM-5.3-Flash-MLX、MITライセンス)、当社の較正不要のOrcaSAQ量子化手法で生成したものです。8月26日にこれを出荷し、翌日には公開で方針を修正しました。元の量子化レンジでは、ほとんどの人にとってMacBook Proでの利用が現実的ではなかったためです。通常の2ビットビルドは依然として約160 GBを必要とし、それはどのラップトップにも搭載されていません。8月27日、最小のバリアントを次の名前で再構築しました:2bit-lite。これは特に128 GB MacBook Proに収まるようにするためのものです。また、この記事は、それがもたらす利点とコストを正直に説明したものです。すべての数字(field noteとマークされたもの)は、以下に示すとおり、当社の単一H200検証ランで測定されました。ここにはベンダーのベンチマークはありません。コミュニティの慣行(wired-memoryコマンド、mlx-vlmのバージョン管理)に従う場合には、その旨を明記します。

どのビルドがどのMacに適合するか(何かをダウンロードする前にこれを読んでください)

リポジトリ内の5つのビルドは、それぞれ最小RAM容量に対応しています。MacBook Proでは、「どのビルドか」の答えは1つだけです — 2bit-liteより上位のものはすべてMac Studioの話です:

6-bit — 約296GBのウェイト / 約320GBのRAM / ほぼロスレス。Mac Studioは512GBのみ。

4ビット — ~204GB / ~224GB / 推奨デフォルト。Mac Studio 256GB。これがリポジトリルートがミラーリングするものです。

3-bit — 約184 GB / 約200 GB。Mac Studio 256 GB。

2-bit — ~145 GB / ~160 GB。Mac Studio 192 GB。これは初日に出荷した最小のビルドであり、それが失敗だった。

2bit-lite — ~102 GB / ~112 GB。128 GBマシンに収まる唯一のビルド — 128 GBのM4/M5 Max MacBook Pro、または128 GBのMac Studio / Mac mini。128 GBのApple Silicon搭載ノートパソコン(M3 Max以降)も同様だが、ただ遅いだけだ。

そのはしごに隠された罠:READMEのデフォルトのダウンロードコマンドは4ビットビルド(約204GB)を取得します。これは256GBマシンには適切なデフォルトですが、ラップトップでは役に立ちません。MacBook Proでデフォルトのコマンドに従うと、メモリに割り当てられないモデルになってしまいます。2bit-liteパスには明示的な--includeが必要です。詳細は後述します。

さらに、上記の計算が適用される前に、あなたが直面するハードな上限があります。macOSは、プロセスが128GBのMacのユニファイドメモリをすべて確保することを許可しません。デフォルトのGPU使用可能上限はおよそ91〜96GBです(コミュニティによるリバースエンジニアリングで判明し、大規模モデルのMLXセットアップに関する複数の記事でも裏付けられています)。これは、重みだけで約102GBあることを下回るため、2bit-liteでも、ワイヤードメモリ制限を引き上げるまでロードできません。その手順は必須であり、セクション4です。

mlx-vlm をインストールしてください — そして mlx-vlm のみを。

GLM-5.3-Flashは視覚言語モデルなので、mlx-vlmではなくmlx-lmで実行されます。これが人々が最もよくつまずく点なので、最初に言っておきます: mlx-lmはテキスト専用モデル向けです。これを使ってマルチモーダルモデルを実行すると、混乱を招く読み込みエラーが発生します。VLMパッケージをバージョン0.6.17以上でインストールしてください:

pip install -U "mlx-vlm>=0.6.17"

The version pin is not decoration. glm5_next — the hybrid sparse-plus-linear-attention architecture behind GLM-5.3-Flash — only landed in mlx-vlm the same day the model shipped (August 26, 2026), and anything older will not recognize the config. The architecture matters for a second reason: this is a brand-new topology, and the first-wave ports had real correctness bugs that fluent output would not reveal. A community runtime audit of the early glm5_next MLX path found and fixed four of them — an unapplied SwiGLU clamp on every FFN block, manifold-constrained hyper-connection tensors cast to the wrong dtype (which silently corrupted the attention mixing matrix), two epsilon mismatches in the attention norms, and bf16 router logits where the reference uses float32. After the fixes, numerics matched the reference to roughly 1e-7. The takeaway for you: keep mlx-vlm current, and treat the very first release of any new-architecture port with suspicion.

重みをダウンロードしてください:除外フラグと、実際に必要なインクルード

リポジトリのルートは4ビットビルドをミラーリングしており、5つのバリアントはすべてサブフォルダとして提供されます。デフォルトのコマンドはルートをダウンロードし、--excludeを使用するため、5つのバリアントフォルダ(合わせて約800GB)はダウンロードされません:

hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"

MacBook Pro では、そのコマンドは正しくありません。4ビットのルートが返されてしまいます。128 GB のノートパソコンでは、2bit-lite サブフォルダのみを取得してください:

hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX

それは約102GBのダウンロードであり、自己完結型です — その2bit-lite/フォルダーには独自のconfig.jsonが含まれているので、ジェネレーターをそのままそこに向けてください。もしhfがPATHにない場合は、インストールしてください: pip install -U huggingface_hub。開始する前に、約110GBの空きディスクがあることと、Macのストレージが最後の空き100GBではないことを確認してください。— MLXは重みをメモリマップするため、SSDがほぼ満杯だと、これらのセットアップはダウンロード中に失敗します。

Screenshot of the Hugging Face repository card for orcarouter/GLM-5.3-Flash-MLX showing the title, the tagline 'An MLX build of the official GLM-5.3-Flash — 2bit-lite / 2 / 3 / 4 / 6-bit OrcaSAQ quant for Apple Silicon & MLX', and the model tags glm5_next, Apple Silicon, quantized 2-8bit, Mixture of Experts, vision-language and MIT

ワイヤードメモリの上限を引き上げる — 皆が忘れるステップ

これは128GB MacBook Proにおける成否を分けるステップであり、READMEのカードはそのコマンドを明示せず、知っている前提で書かれています。128GB MacのデフォルトのMetalワーキングセット上限はおよそ91〜96GBで、2bit-liteのウェイト約102GBを下回るため、このステップを行わないとモデルの割り当てに失敗し、ロードが途中で終了します。コミュニティ標準の対策は、GPUのワイヤードメモリ上限をメガバイト単位で引き上げるsysctlです。

sudo sysctl iogpu.wired_limit_mb=114688

これにより上限は約112 GBとなり、OS用に約14 GBが確保されます。128 GBマシンでは、コミュニティで実際に使われている値は約114688(112 GB)から約122880(120 GB)の範囲です。最大値にはしないでください。macOSにはヘッドルームが必要で、ないとメモリプレッシャー下でウィンドウサーバーのカクつきやシステムのひっかかりが発生します。設定後、モデルを読み込んでアクティビティモニタを確認してください。メモリプレッシャーが黄色になったら、数値を減らしてください。

実用的な注意点が2つあります。どちらも私たちのフィールドノートではなく、コミュニティの実践によるものです。第一に、sysctl は再起動時にリセットされ、設定したターミナルセッションにのみ適用されます。そのため、再実行するか(LaunchAgent 経由でスクリプト化するか)を計画しておいてください。再起動後に忘れると、よくある「昨日は動いたのに」という失敗になります。第二に、MLX はプロセス内の調整用設定も公開しています。mlx.core.metal.set_wired_limit(bytes)は macOS 15.0 以降で利用可能で、sysctl の上限値以下に抑える必要があります。ノートブックでスクリプトを書く場合、こちらがより移植性の高い選択肢です。どちらを使っても効果は同じで、これがないと、ここにあるものは何も実行されません。

実行: テキスト、画像、およびPython API

ウェイトが配置され、制限が引き上げられた状態では、生成は1つのコマンドで完了します。テキスト:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "量子もつれを一文で説明してください。" --max-tokens 256

画像入力も--imageフラグで同じように機能します。ここが、マルチモーダルモデルがノートパソコン上で真価を発揮する点です。OrcaSAQレイアウトではビジョンタワーがより高い精度を維持するためです:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "この画像を説明してください。" --max-tokens 256

スクリプトについては、Python APIはmlx-vlmユーザーが知っているのと同じ形です:

from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "この画像を説明してください。", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))

保ってください--max-tokens控えめに。H200 のフィールドノート実行では、2bit-lite はおよそ 10 tok/s を維持するため、1,024 トークンの回答はすでに 2 分の待ち時間になります。そして、長い出力こそ、KV キャッシュの予算と品質の崩壊が効いてくるところです(下記参照)。ラップトップでは、測定値が得られるまでは、速く感じるどころか遅く感じると予想すべきです。

実際に得られる品質(測定されたラダー)

これがプレイブックの正直な部分であり、私たちはそれをごまかすつもりはありません。OrcaSAQは3ビットまで優雅に劣化し、その後コストが急上昇します。FP8リファレンス(パープレキシティ2.7797)に対して:

6-bit — パープレキシティ 2.7864(+0.24%)、top-1 トークン一致率 97.76%。ほぼロスレス、宣伝どおり。

4-bit — perplexity 2.8620 (+2.96%), top-1 96.13%。推奨デフォルト。

3-bit — パープレキシティ 3.0566(+9.96%)、top-1 92.06%。過激だが実用可能。

2ビット — パープレキシティ 4.3622 (+56.9%)、top-1 86.56%。実際のコストだ。

2bit-lite — perplexity 6.7018(+141%)、top-1 77.19%。最小のビルドで、MacBook Proに収まる唯一のものです。

これらは、当社独自の変換パイプラインで測定された数値です。2bit-liteは、パープレキシティが141%悪化し、top-1トークン一致率が78%を下回っています。つまり、明らかに精度が低下したモデルを実行していることになります。以下の障害モードは、その精度低下が実際にどのように現れるかを示したものです。これは見事なデモであり、短いやり取りには合理的なアシスタントですが、フル精度モデルの代わりにはなりません。

速度についても、同じように正直にお伝えします。公開されているフィールドノートはH200で、約10 tok/s、安定したマルチターン対応、日常的なQ&Aや短いテキストの処理に問題ありません。2bit-liteのMacBook Proでの実測値はまだ出ていませんし、でっち上げるつもりもありません。Apple Siliconのスループットは、メモリ帯域幅、熱特性、ハイブリッド注意機構に対するMLXカーネルのカバレッジに依存しますが、このノートパソコンでのこのビルドについては、いずれも測定していません。参考にしていただける最も近い公開データポイントは、512GB Mac上で異なるMLXランタイムを使用した4ビットGLM-5.3-Flashビルドの独立した約450 tok/sですが、これは異なるビルド、異なる精度、デスクトップマシンでの結果ですので、あなたの数値として読み替えないでください。遅いことを想定しておき、もし遅くなければ嬉しい驚きとして受け取ってください。

KVキャッシュとロングコンテキスト:ヘッドルームに注意

GLM-5.3-Flashは、1Mトークンのコンテキストウィンドウを宣伝しています。その数値はこのハードウェアでは無関係であり、そうでないと見せかけるハウツーはあなたの不利益になるだけです。フィールドノートは一行です:ターゲットの長さに十分なKVバジェットをランタイムに与えてください。単一のH200では、2bit-liteは、ウェイトをロードした後、KVキャッシュ用に約39GBの余裕を残します。128GBのMacBook Proでは、計算はより厳しくなります:約112GBの上限に対して約102GBのウェイトでは、macOS自身のワーキングセットを考慮する前に約26GBが残ります。そして、ハイブリッド線形アテンション層により、このモデルのKVフットプリントは同じサイズの高密度モデルに比べて小さいですが、それでもコンテキストに応じて線形に増加します。

より広いコミュニティのサーバーサイドに関する指摘もこの点を裏付けています。8Kコンテキストでは問題なく読み込める設定でも、128Kではメモリが尽きる可能性があります。ラップトップではコンテキストを短く保ちましょう。数千トークンのQ&Aか、1枚の画像程度です。本を丸ごと読み込ませようとしないでください。ワークロードが本当に長いコンテキストを必要とする場合、それはこの記事の最後のセクションの話になります。

長いコード生成は2bit-liteでは信頼できません(この文を二度読んでください)

これは、失敗モードを隠すハウツーには欠かせないセクションなので、専用の見出しを設けています。H200 のフィールドノートは明確です。日常的な Q&A や短文は問題なく出力されますが、長いコード生成はこの精度では信頼できません。私たちの検証実行で再現された失敗モードは次の3つです。

繰り返しループ — モデルが進展せず、同じ行やブロックを繰り返し始める状態。通常は数百トークンほど生成した時点で発生する。

グルーコードの欠落 — インポート、配線、エラー処理が暗黙に省略されている。生成された関数は単独では正しく見えるが、周囲の足場が単に存在しないため実行されない。

書き換えチャーン — 最小限の編集ではなく、モデルがファイルの大部分を書き換え、連続するターンの出力が互いに食い違う。

これらは2bit-liteでも再現可能であり、77%のtop-1一致率が予測するものと正確に一致しています。ラップトップビルドを使い続ける実務者が実際に行うこと:

• 使用するのは説明、要約、Q&A、画像理解 — 真に優れた短編形式の作業です。

• コードを頼む必要があるなら、頼むのは 一度に一つの小さな関数を明示的なシグネチャ付きで、それぞれを検証してから次に進んでください。ファイル全体を渡して機能を要求してはいけません。

• 長いもの — モジュール全体、リファクタリング、長いエージェントセッション — は、フル精度APIにルーティングしてください。それは回避策ではなく、正しいアーキテクチャであり、最後のセクションです。

これを一切行わない場合: 代わりにz-ai/glm-5.3-flashを呼び出してください

Comparison scoreboard titled 'GLM-5.3-Flash on a Mac — the scoreboard' contrasting the 2bit-lite MLX local build (102 GB weights on disk, 112 GB minimum RAM, +141% perplexity vs FP8, 77.19% top-1 agreement, unreliable long code generation, ~10 tok/s per H200 field note) against the hosted z-ai/glm-5.3-flash API (0 GB on disk, no RAM, FP8 reference quality, reliable long code, datacenter speed), with a footer noting quality is measured by OrcaRouter, speed is an H200 field note, and the API is at Z.ai launch pricing

正直な判断基準:128GB M4/M5 Max MacBook Proで2bit-liteを実行するのは、特に320Bマルチモーダルモデルが必要な場合だけです、持ち運べるノートパソコン上で — オフラインQ&A、プライベート文書、画像理解を、何もマシンの外に出さずに実現できます。それ以外の用途にはAPIを選んでください:

128 GB未満のMacBook Pro — 対応するビルドはありません。読み込もうとしないでください。APIを使用してください。

長いコード生成または長文脈の推論 — 2bit-liteはまさにこの点で確実に失敗します。APIを使用してください。

品質重視の作業 — 77.19%のtop-1一致率と+141%のパープレキシティは、丸め誤差ではなく実際の低下です。APIを使用してください。

スループット保証または予測可能なレイテンシ — ノートパソコンの実測値はまだ存在せず、フィールドノートは10 tok/sです。APIを使用してください。

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash showing the model ID, 'by Z.ai - 2026-08-26', a 1M-token context window, text plus image plus video in / text out, 320B total / 18B active parameters, and the input/output price of $0.07 / $0.25 per million tokens

ホスト型モデルはz-ai/glm-5.3-flashで、OrcaRouter上でフル精度で提供され、価格はZ.aiの現在の料金(本稿執筆時点では入力100万トークンあたり0.07ドル、出力100万トークンあたり0.25ドル)です。これはローンチ期間中の価格であり、Z.aiの公開リスト価格は0.15ドル/0.50ドルです。これはベンダー報告価格であり、0%のマークアップでパススルーされるため、Z.aiの値下げは同じ日に当社側にも反映されます。1つのAPIキーで、当社がルーティングする他の200以上のモデルにもアクセスできます。また、自動フェイルオーバーにより、この新モデルを使った実験で本番パスを単一プロバイダーに賭けることはありません。102 GBのダウンロードと最初のコールド生成を待つのと同じ時間で、APIはすでに1週間分の質問に答えており、しかもフル精度で回答します。

ローカル推論に価値があるのは、理由がローカルな場合だ——プライバシー、オフライン作業、レート制限なし、バッテリーで動くデモ。それ以外の理由ではコストや品質の計算上、価値はなく、128GB未満のマシンではまったく価値がない。

よくある質問

64 GBまたは96 GBのMacでGLM-5.3-Flashをローカル実行できますか?いいえ。最小構成の2bit-liteでも、macOSのオーバーヘッド後におよそ112 GBの最小容量が必要です。128 GBのマシンでも、ワイヤードメモリの上限を引き上げてロードする必要があります。Macが128 GB未満の場合、ローカルでの実行経路は存在しません。z-ai/glm-5.3-flashはAPI経由で利用してください。

mlx-vlmをインストールしましたが、モデルが読み込めません。何が問題なのでしょうか?よくある原因は、順に次の2つです。0.6.17より前のバージョンはglm5_next対応前で、このアーキテクチャを認識できません。もう1つは、ワイヤードメモリの上限が引き上げられていないことです。128GB Macでは、デフォルトのMetal上限が約91〜96GBのため、約102GBのビルドを割り当てられません。両方(パッケージのアップグレードとsysctlの実行)を修正すれば読み込めます。

ローカルの2bit-liteビルドは、z-ai/glm-5.3-flash APIと同じモデルですか?基盤となるGLM-5.3-Flashの重みは同じですが、品質は同じではありません。2bit-liteは2ビット量子化であり、FP8リファレンスに対するトップ1トークンの一致率は77.19%で、長いコード生成は信頼できません。APIはフル精度を提供します。それらが互換性を持つのは、短い形式で品質に寛容な作業のみです。

30秒版

マシン1台、ビルド1つ、必須のsysctl 1つ。128 GBのM4/M5 Max MacBook Proをお持ちなら: mlx-vlm>=0.6.17をインストールし、2bit-lite/(約102 GB)のみをダウンロードし、sudo sysctl iogpu.wired_limit_mb=114688でワイヤードメモリ上限を引き上げ、mlx_vlm.generateを実行します — Q&A、短いテキスト、画像向け。この精度では長いコード生成が信頼できないこと、ラップトップでのスループットがまだ測定されていないこと、128 GB Macが最低条件であり標準ではないことを受け入れてください。これらの注意点のいずれかが受け入れがたい場合 — またはMacが128 GB未満の場合 — 同じモデルのフル精度版はz-ai/glm-5.3-flashでAPIコール1回で利用できます。

128 GB Macをお使いではありませんか?z-ai/glm-5.3-flashはOrcaRouter上で同じモデルをフル精度で提供します — APIキー1つで、プロバイダー価格を0%マークアップでそのまま適用、102 GBのダウンロードも不要です。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube