「GLM-5.3-Flash VRAM 要件」という記事のヒーロータイトルカード。サブタイトルは「320B MoE を実行するために必要なメモリ量」。ピルバッジは「合計 320B · アクティブ 18B」、「1Mトークンのコンテキスト」、「コミュニティ製 MLX ビルド」。サマリーカードには「2bit-lite: 重み ~102 GB / RAM 112 GB — 128 GB Mac に収まるビルド」と表示され、右下隅に OrcaRouter ロゴが配置されている。
Guides & Insights

GLM-5.3-Flash VRAM要件:320B MoEの実行に必要なメモリ量

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GLM-5.3-Flashは、どのコンシューマー向けGPUにも収まりません。最小の実用的なビルドである2bit-liteでも、約102GBのウェイトと112GBのRAMが必要です。128GBのMacが最低ラインであり、H200なら1台で2bit-liteを約39GBの余裕を持って収められます。それ以外の方はホスト型API(z-ai/glm-5.3-flash)をご利用ください。

それがすべての答えを一息に述べたものです。そして、ここで明確に言っておく価値があります:このモデルを実行できる一般消費者向けハードウェア構成は存在しません。Z.aiの320Bパラメータの視覚言語混合エキスパートモデル(2026年8月26日リリース)は、あらゆる量子化形式においてサーバークラスのメモリを必要とします。「18Bアクティブ」という数値はトークンあたりの計算量を表しており、常駐メモリのことではありません。320Bすべての重みがロードされたままになります。現実的なローカル実行の対象は、大容量ユニファイドメモリを備えたMac、マルチGPUサーバー、そして141GBの単一H200です。これらのいずれも所有していない場合、以下の数値は買い物リストではなく、代わりにAPI経由でモデルを呼び出すべき理由です。

図表の前にひとつ注記しておきます。本記事のメモリ数値はコミュニティによる調査結果であり、ベンダーによる公式ガイダンスではありません。Z.aiは重みとAPI仕様を公開していますが、ローカル推論のメモリ要件は公開していません。量子化ごとの表は、Hugging Face上のorcarouter/GLM-5.3-Flash-MLXモデルカード(コミュニティグループが管理するオープンウェイトのMLX量子化)に基づくものであり、デプロイ数値は実際にモデルをロードした実務者からの情報です。ベンダー報告による数値(価格、およびアーキテクチャのKVキャッシュ効率に関する主張)については、その旨を明記しています。

短い答え:自分が持っているものに何が合うか

実際に持っているものから始めなさい。量子化ラダーはターゲットマシンに対してのみ意味を持つからです。

• コンシューマーGPU(RTX 4090、RTX 5090、およびそれ以下のすべて)— いいえ。十分なVRAMを備えたコンシューマーカードは1枚もありません。最小の構成でも重みだけで約102GB、およそRTX 5090 5枚分に相当します。システムRAMはこれを変えません。重みはデバイス上に常駐していなければならないからです。

• 128 GB Mac(M4またはM5 Max)— 2bit-liteビルド(約102 GBの重み / 最小112 GB RAM)で、ワイヤードメモリ制限を引き上げた後にのみ動作します。詳細は後述します。これは、このモデルが動作する唯一のコンシューマークラスのマシンです。

• 192GBおよび256GBのMac Studioでは、3ビット(約184 / 200 GB)と2ビット(約145 / 160 GB)が利用可能になります。4ビットには約224 GBが必要で、これは256 GBモデルのみがほぼ満たします。

• シングルH200(141GB VRAM)— 2bit-liteが収まり、KVキャッシュ用に約39GB残るため、ショートコンテキストのみ対応。

• マルチGPUサーバー — 4ビット、6ビット、および約328 GBのFP8リファレンスビルドを含むすべて

• その他の全員 — ホスト型API、z-ai/glm-5.3-flash。これは慰めの賞ではありません。モデルが実際に高速で安価に使用できる場所であり、このページの下部で説明しています。

2つの数字、1つではない:重みと総メモリ

モデルカード上の各量子化には、重みサイズと最小RAMの2つの列があり、その間の差は、ほとんどの解説記事が省略している部分です。重みの列はモデルファイル、つまり、その精度におけるすべてのパラメータをメモリ上に保持することを示します。最小RAMの列は、実行時にマシンが保持しなければならないもの、つまり、重みに加えてKVキャッシュ、アクティベーション、そしてコンテキスト長に応じて増加するバッファを示します。

18Bアクティブという数字は、人々が誤解しやすい点です。GLM-5.3-Flashは320B総数 / 18BアクティブのMoEであり、トークンごとに計算されるのは約18Bのパラメータのみです。これは計算量の節約であって、メモリの節約ではありません。ルーターはトークンを確認するまでどのエキスパートが必要かを知らないため、どのエキスパートが動作するかにかかわらず、全320Bの重みがメモリに常駐します。MoEがもたらすのは速度であって、フットプリントの削減ではありません。これは、モデル自身のカードが320B総数を18Bアクティブと並べて表示することで例証している点です。

ビルドが「約204GBのウェイト / 最小RAM 224GB」と示す場合、追加の約20GBはランタイムオーバーヘッド — KVキャッシュ、アクティベーション、コンテキストバッファ — です。コンテキスト長を延ばすと、その差分は大きくなります。マシンを選定する際に基準となるのは、ウェイトの列ではなく最小RAMの列です。

A screenshot of the official Hugging Face model card for zai-org/GLM-5.3-Flash (captured August 29, 2026), showing the MIT license, the image-text-to-text and glm5_next tags, and the card's introduction describing GLM-5.3-Flash as the first natively multimodal model in the GLM-5 series with 320B total parameters and 18B active, introducing a hybrid sparse-and-linear attention architecture.

モデル自体(アーキテクチャ、ライセンス、Z.ai自身の位置づけ)は、上に示したベンダーの公式カードに記載されています。ローカルメモリについてはそこでは扱われていないため、このページが存在します。以下の数値は、オープンウェイトのコミュニティ製MLX移植版に基づいています。

量子化ラダー

orcarouter/GLM-5.3-Flash-MLXカード上の表は、現在実務者が実際に読み込んでいるものです。この表には、5つの量子化ビルドとFP8リファレンスが、それぞれの重みサイズと最小RAMとともにリストされています:

• FP8 リファレンス — 約 328 GB の重み。オープンウェイトが配布される未量子化のリファレンスポイント。

• 6ビット — 重み ~296 GB / 最小RAM 320 GB。ほぼロスレス。最高品質のビルド。

• 4-bit — ~204 GB / 224 GB。日常的に推奨されるデフォルト設定です。

• 3-bit — ~184 GB / 200 GB。積極的だが使用可能。

• 2ビット — ~145 GB / 160 GB。ベストエフォート。

• 2bit-lite — 約102 GB / 112 GB。最小のビルドであり、128 GB Macまたは単一のH200に収まる唯一のものです。

ビット数が減るにつれて品質は低下し、モデルカードがそれを定量化している。FP8参照と比較すると、パープレキシティは6ビットで+0.24%、4ビットで+2.96%、3ビットで+9.96%、2ビットで+56.9%、2bit-liteで+141%悪化する(パープレキシティの数値は同じモデルカードによるもの)。カード自身のフィールドガイダンスは次の通り:6ビットはほぼロスレス用、4ビットは日常的なデフォルト、3ビットと2ビットはメモリ制約時、2bit-liteは他に何も収まらない場合のみ——そして、長いコード生成は2bit-liteでは信頼できない。この最後の警告は320B推論モデルにとって重要だ。2bit-liteは128 GB Macを手に入れるための手段であり、品質という代償は、まさにコーディング作業が最も痛手を受ける部分にのしかかる。

A single-column scoreboard titled 'GLM-5.3-Flash — the memory ladder' listing six rows: 'FP8 reference: 328 GB weights', '6-bit: 296 GB / 320 GB RAM', '4-bit: 204 GB / 224 GB RAM', '3-bit: 184 GB / 200 GB RAM', '2-bit: 145 GB / 160 GB RAM', '2bit-lite: 102 GB / 112 GB RAM', with a footer reading 'Community MLX builds (orcarouter/GLM-5.3-Flash-MLX) — not vendor guidance.' and the OrcaRouter logo in the bottom-right corner.

そのラダーの中の2つの数字は、ハードウェア全体の課題を左右するため、もっと詳しく調べる価値がある。

なぜ2bit-liteが存在するのか

2bit-liteは品質の追加グレードではなく、単一の理由のために作られたサイズ階層です。通常の2-bitでは収まらないからです。約102 GBのウェイトで、128 GB Macの約112 GBの使用可能メモリに収まる唯一のビルドであり、単一のH200の141 GBにKVキャッシュ用の余裕を残して収まる唯一のビルドでもあります。モデルカードにもその旨が記載されています。通常の2-bitは128 GB Macに収まらないが、2bit-liteはワイヤードメモリ上限を引き上げて収まる、と。H200上では「KVキャッシュ用に約39 GBの余裕を残して」収まる(カードの文言)。その39 GBが、モデルがロード後に実行するすべての作業予算の全体であり、ここからコンテキストの話になります。

長いコンテキストにおけるKVキャッシュのコスト

GLM-5.3-Flashは1Mトークンのコンテキストウィンドウを備えており、長いコンテキストはローカルメモリ計画が頓挫する場です。このモデルのハイブリッドなスパース+線形アテンション — インデックスプール機構を備えたNoPE-MLA — は実に効率的です:Z.aiは、自社のGLM-5.3と比較して、アテンション計算を3.01倍、KVキャッシュサイズを4.44倍削減すると報告しています(ベンダー報告値)。しかし「GLM-5.3より4.44倍小さい」という場合でも、完全な1Mコンテキストを目指すと、キャッシュは数十GiB単位で残ります。

私たちが持つ最良の公開数値は、4つのDGX Sparkノードでモデルを実行したコミュニティデプロイメントによるものです。完全な100万トークンのコンテキストを保持するため、ランクあたり16 GiB、4つ全体で約64 GiBのKVキャッシュを使用し、少数の同時フルコンテキストリクエストをサポートできるようサイズ設定されています。これは、ウェイトを1つも考慮する前に、ほとんどの単一マシンのメモリ予算全体を超えています。単一のH200では、このページの要点はその計算です。2bit-liteでは、ウェイトを除いたすべてに約39 GBが残り、短いチャットには快適ですが、コンテキストが10万トークンに近づくにつれて数分で消えてしまいます。

実用的なルール:min-RAM 列は妥当なコンテキストを前提としています。ワークロードが長文ドキュメント、エージェントループ、またはリポジトリ規模のコードを実行する場合は、KVキャッシュメモリを追加で予算化してください。そして、1Mトークンに近い処理では、計算をやめてAPIを使用してください。これらのサイズ見積もりはコミュニティの知見であり、KVキャッシュの予算設定に関するベンダーのガイダンスは存在しません。

macOSのワイヤードメモリ制限:128GBのMacでもロードに失敗する理由

実務者たちが報告する最も一般的な障害は「RAMが足りない」ではありません。それは、約102GBのモデルを搭載した128GB Macが読み込みを拒否するというものです。原因はmacOSのワイヤードメモリ制限です。Apple Siliconでは、GPUはユニファイドメモリのすべてにアクセスできるわけではありません。Metalは、物理RAMの約3分の2に相当する「推奨最大ワーキングセット」を公開しており、それを超える割り当ては、マシンに空きメモリがある場合でも失敗します。

つまり、128GB MacのデフォルトのMetalバジェットは80〜90GBの範囲にあり、2bit-liteビルドが必要とする量(約102GBの常駐モデルで最低RAM約112GB)を下回ります。読み込みはRAM容量ではなくMetalバジェットで失敗します。私たちが見つけた実践者の報告はすべて同じ修正方法です。sudo sysctl iogpu.wired_limit_mb=… でワイヤードリミットを引き上げ、モデルの総フットプリント(MB単位)より大きい値を設定するというものです。再起動するとリセットされることを想定してください。一部のコミュニティガイドでは、Pythonから mlx.metal.set_wired_limit() を使ってワイヤードリミットを設定し、モデルの重みを固定して、macOSがアイドル状態のMetalページを圧縮しないようにしています。

もう1つ厄介な点があります。ランタイムによって動作が異なります。MLX は Metal のメモリ予算を強制し、超過すると明確に失敗します。一方、llama.cpp ベースのランタイム(GGUF パス)は一般にこれを強制せず、代わりに macOS にスワップさせます。そのため、同じモデルでも、あるランタイムでは読み込みが拒否され、別のランタイムでは「読み込まれる」ことがあります。また、スワップされたモデルは、使い物にならないほど遅くなることもあります。これらは macOS の動作に関するコミュニティの知見であり、Apple の公式な指針ではありません。

ホスト型の代替: z-ai/glm-5.3-flash

{{1}}上記の数字に当てはまらない人々——つまり大多数の人々——にとって、{{/1}}Z.aiはモデル自体をz-ai/glm-5.3-flashとして提供しており、ここが名前の「Flash」が実際に現れる場所です。{{2}}Z.aiの定価は、入力トークン100万件あたり0.15ドル、キャッシュ済み入力トークン100万件あたり0.03ドル、出力トークン100万件あたり0.50ドルです。{{/2}}ローンチプロモーションは2026年9月9日まで、0.075ドル / 0.015ドル / 0.25ドルで実施されています(ベンダー報告価格、執筆時点のもの)。{{3}}キャッシュ入力が新規入力の5分の1という価格は、最大のコスト削減レバーです。{{/3}}再利用可能なプレフィックスを持つワークロード——システムプロンプト、ツール定義、長い共有ドキュメント——は、キャッシュ読み取り価格を利用できるはずです。

メモリ計算は判断に含めるべきです。320Bモデルを自前でサーブするということは、アイドル状態でも飽和状態でも、112〜320GBのメモリをそれに専有させることを意味します。ホステッドエンドポイントなら、そのすべてを自社のマシンからオフロードでき、しかもローンチプロモ価格なら、このモデルはトークンあたりのコストが、サイズが10分の1の多くのモデルよりも低くなります——これこそが18BアクティブMoEの狙いそのものです。

これは、ルーティングポイントを置く自然な場所でもあります。OrcaRouterを通じて、z-ai/glm-5.3-flashは単一のAPIの背後にある200以上のモデルの1つであり、プロバイダーのリスト価格で0%のマークアップで提供されます。そのため、ローンチプロモーションや将来の値下げも、発表された当日に反映されます。自動フェイルオーバーにより、3日前のモデルでサーバーパスが不安定でも、本番スタックに賭ける必要はありません。プロバイダーがエラーを起こしたり飽和したりした場合、リクエストは失敗する代わりに健全なプロバイダーにロールオーバーされます。未検証のモデルを安全に試すことは、まさにルーターの役割です。

A screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash (captured August 29, 2026), showing the model description 'native multimodal model... 320B total / 18B active parameters, 1M-token context, text + image + video in, text out', release date 2026-08-26, endpoint /v1/chat/completions, and prices of $0.07 per million input tokens and $0.25 per million output.

よくある質問

RTX 5090でGLM-5.3-Flashを実行できますか?

いいえ。最小構成でも重みだけで約102GBあり、RTX 5090のVRAMは32GBです。コンシューマー向けGPUでは到底足りず、ユニファイドメモリのMac、単体のH200、またはマルチGPUサーバーが必要です。

18Bアクティブとは、GLM-5.3-Flashがコンシューマーハードウェアで動作することを意味しますか?

いいえ。18Bというアクティブな数値は、トークンごとの計算量のことです。320Bすべてのパラメータはメモリ上に常駐し続けます。なぜなら、ルーターはトークンを確認するまで、そのトークンがどのエキスパートを必要とするかを知ることができないからです。MoEが節約するのは計算量であり、メモリではありません。

GLM-5.3-Flashを試す一番安い方法は何ですか?

ホスト型API、z-ai/glm-5.3-flash。ローンチプロモーション価格では、入力トークン100万個あたり$0.075、キャッシュ済み入力トークンは$0.015です。最小ビルドをセルフホストするには約112GBのRAMを割り当てる必要があり、既にハードウェアを所有している場合にのみ意味があります。

正直な要約:{{1}}GLM-5.3-Flash{{/1}}は、あらゆるビルドにおいて{{2}}サーバークラス{{/2}}のモデルです。128 GBのMacは、適合する唯一のビルド、すなわち{{3}}2bit-lite{{/3}}を利用できます。これは{{4}}ワイヤードメモリ上限の引き上げ{{/4}}、{{5}}短いコンテキスト{{/5}}、そして{{7}}長いコード{{/7}}に対する{{6}}文書化された品質低下{{/6}}を伴います。単一の{{8}}H200{{/8}}は、約39 GBの{{9}}KVヘッドルーム{{/9}}を備えた同じビルドを利用できます。{{10}}サーバーハードウェア{{/10}}では、デフォルトの{{11}}4ビット{{/11}}からほぼロスレスの{{12}}6ビット{{/12}}まで、真の段階的選択肢が得られます。そして他のすべての人、つまりほとんどの読者にとっては、ホスト型の{{13}}z-ai/glm-5.3-flash{{/13}}エンドポイントが正解です。上記の数字はその理由であり、{{14}}買い物リスト{{/14}}ではありません。{{15}}MacBook Pro{{/15}}へのステップバイステップのインストールについては、当社の{{16}}MacBookインストールウォークスルー{{/16}}が全体の流れを最初から最後までカバーしています。量子化ビルドの品質比較と各ビルドの選び方については、{{17}}MLXビルドガイド{{/17}}に詳細があります。そして{{18}}リリース記事{{/18}}には、ローンチの背景とベンチマークの主張が掲載されています。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新