GLM 5.3 Prime vs GLM-5.3-Flash のヒーロータイトルカード。タイトルは「GLM 5.3 Prime vs GLM-5.3-Flash: 18倍の差」、サブ見出しは「一方はテキスト専用のサービングレーン、もう一方はマルチモーダルモデル」、3つのチップは「価格 / 100万トークン: $2.80 / $8.80 vs $0.15 / $0.50」「モダリティ: テキストのみ vs テキスト、画像、動画」「ライセンス: ビスポーク vs MIT」、フッター行は「GLM-5.3 は2026年8月14日発表、GLM-5.3-Flash は2026年8月26日リリース。」
Guides & Insights

GLM 5.3 Prime 対 GLM-5.3-Flash:異なる2つのモデル間に18倍の価格差

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

購入判断をすでに半分ほど固めた状態でここに来た人向けに、一行で比較を述べると次のとおりです:GLM 5.3 Primeは、GLM-5.3のフラッグシップ重みを高速提供ティアで販売するもので、100万トークンあたり2.80ドルおよび8.80ドルです。そして、GLM-5.3-Flashは、独自のオープン重みを持つ別個のネイティブマルチモーダルモデルで、0.15ドルおよび0.50ドルです。両者の差は入力・出力の両方でおよそ18倍です。これはティアの違いではなく、ファミリー内の異なる位置にある別のモデルであり、この2つの名前がモデル一覧で隣り合っている唯一の理由は、どちらも6週間以内に登場したからです。

これを間違えると、どちらの方向にも高くつく。FlashをPrimeの安価版として扱うと、それにできないことに驚かされるだろう。Primeをより高速なFlashとして扱うと、画像を見ることすらできないモデルに18倍の費用を払うことになる。

それぞれが実際に何なのか、そこから始めましょう

GLM-5.3-Flashは、2026年8月26日にMITライセンスのもとで公開された、3200億パラメータ・180億アクティブのマルチモーダルMixture-of-Expertsであり、重みはHugging FaceとModelScopeで公開されている。同一リクエスト内でテキスト、画像、動画、ファイルをネイティブに受け付け、100万トークンのコンテキストウィンドウと12万8000トークンの出力上限を備え、フラッグシップからの蒸留ではなく個別に事前学習された。そのハイブリッドな線形+スパースアテンション設計は、GLM-5.3と比較してアテンション計算量をおよそ3分の1に削減し、KVキャッシュを4倍以上縮小する。コスト上の優位性が生まれるのはこの点であり、割引によるものではなくアーキテクチャレベルによるものである。

GLM 5.3 Prime は GLM-5.3 です — 2026年8月14日に発表され、8月18日から API で提供、8月25日に重みが公開された、アクティブパラメータ400億のスパース混合エキスパート(MoE)であり、高速レーンを通じて配信されます。コンテキストは同じ1,000,000トークン、出力上限も同じ131,072トークン、入力も出力もテキスト、推論はlowhighまたはmaxのエフォートでmaxがデフォルトです。Z.ai 自身のドキュメントには Prime SKU は一切記載されていません。このティアは、その背後にある単一のアップストリームプロバイダーを名指しするサードパーティのプラットフォーム上に存在します。

スコアボード

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-Flash - the scoreboard'. The GLM 5.3 Prime column reads 'Price / 1M: $2.80 / $8.80', 'Cached input: $0.56', 'Modality: text only', 'Weights: none', 'Intelligence Index: 45, same as GLM-5.3', 'Speed: 1.5-2x, vendor-reported'; the GLM-5.3-Flash column reads 'Price / 1M: $0.15 / $0.50', 'Cached input: $0.03', 'Modality: text, image, video, file', 'Weights: open, MIT', 'Intelligence Index: 42', 'Speed: 46 tokens/sec, independently measured'; the footer reads 'Flash figures per Artificial Analysis v4.3.2; Prime speed is vendor-reported with no independent measurement.'

• 価格 — GLM 5.3 Prime は100万あたり $2.80 / $8.80、GLM-5.3-Flash は100万あたり $0.15 / $0.50
• キャッシュ入力 — 100万あたり $0.56 対 $0.03
• 乗数 — 入力と出力で約18倍、キャッシュ適用前
• モダリティ — テキストのみ 対 テキスト、画像、動画、ファイル入力
• パラメータ — フラッグシップMoEで40Bアクティブ 対 合計320B / 18Bアクティブ
• 重み — 収益閾値付きの独自ライセンスの下で公開 対 MIT、本日ダウンロード可能
• 最大出力 — 131,072トークン 対 128,000トークン
• コンテキスト — 両方とも1,000,000トークン
• インテリジェンス指数 — GLM-5.3 は v4.3.2 指数で45、GLM-5.3-Flash は42
• インデックスタスクあたりのコスト — フラッグシップは $2.01、Flash は $0.25
• 速度 — 1秒あたり約61出力トークン 対 約46、いずれも独立して測定された中央値
• サブスクリプションでの利用 — Prime は Z.ai の Coding Plan に対応していない。Flash は対応しており、3倍のクォータ付き

そのリストの2行は、単なる箇条書き以上の扱いを受けるべきだ。1つ目は知能ギャップである。Artificial Analysis Intelligence Index の v4.3.2 リビジョンでは、45対42で3ポイント差となる。同じインデックスの以前のリビジョンでは、それらのモデルは60と57であり、その古い数値のペアはいまもローンチ報道で広く出回っている。両者を混同してはならない。数値はリビジョン間で比較できないからである。3ポイントは狭い差であり、非常に長いエージェント連鎖におけるわずかなドリフト増加や、曖昧な指示に対する感度の高まりとして現れるのであって、モデルの異なるクラスとして現れるのではない。

二つ目は速度であり、それは名前が生み出す直感を覆す。独立した測定では、Flashは二つのうち遅い方だ——このクラスの平均が67であるなか、1秒あたり約46出力トークンで、フラッグシップの61トークンに対して劣る。Flashがその名に値するのは価格とマルチモーダル性によってであり、レイテンシーによってではない。これは比較にとって重要だ。というのも、小さなモデルに手を伸ばす通常の理由は、より速く答えてくれることにあるからだが、ここではそうではない。

実際にあなた自身が下す決断

2つのモデルは、モダリティ・ライセンス・価格という3つの軸で同時に異なっているため、選択は通常、最初の軸の時点で決着し、算術の出番まで至りません。Flashは画像と動画を読み取れますが、Primeはテキスト以外を一切読み取れません。スクリーンショット、スキャンしたページ、UIのキャプチャ、あるいは動画の1フレームでも扱うワークロードであれば、価格が話題に上がる前に比較は終わっており、あなたが買うのはFlashです。

ワークロードが純粋にテキストで、問題が本当に品質に関するものであるなら、正直な答えは、3ポイントの指標差こそが、18×の対価で買っているもののすべてだということです。それが価値に見合うかどうかは、出力を検証できるかどうかに完全にかかっています。答えを確認できる場合——コンパイルが通るコード、行を返すクエリ、スキーマに対して検証できる構造化抽出——には、Flash が時折外しても見つけるのは安上がりで、再試行するのも安上がりですし、価格が18分の1なら何度でも再試行できます。出力が、人が判断しなければならない文章である場合、または中間チェックのない長い多段階の計画である場合、その差は埋めがたく、割増料金は正当化しやすいです。

オープンウェイトが計算を変えるとき

FlashはMITライセンスの下で提供されており、その最小の使用可能な量子化には約93 GBのアクセラレータメモリが必要です — 多くのチームにとっては単一の大容量メモリノードであり、一部にとっては請求書の端数誤差にすぎません。GLM-5.3は、収益閾値を超える大規模なモデル・アズ・ア・サービス事業者にセキュリティ審査の通過を義務付ける特注のライセンスを採用しており、その最小の実用的な量子化は約217 GBで、ほとんどの場合マルチノード展開となります。

その非対称性は、大量処理チームにとって本当の比較が、Primeの$8.80対Flashの$0.50ではないことを意味する。それは、Primeの$8.80対、すでに所有しているハードウェア上で、ライセンス交渉なしに今日ダウンロードできる重みを実行する場合の、100万出力トークンあたりの自社の償却コストとの比較である。ハードウェアと処理量を備えたチームにとって、その数値は3つの中で最小であることが多く、そしてそれはこの比較のFlash側でのみ利用可能である。

両方買うことと、一緒に買うこと

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input with text output, a 2026-08-26 date beside 'Public benchmarks by Z.ai', a 320B total / 18B active parameter line, a p50 time to first token of 6.86 seconds, and a stat strip reading $0.07 input, $0.25 output, 6.86 s p50 TTFT, 10.00 s p95 TTFT and 22,120.9M tokens.

ほとんどの本番システムは選ぶ必要がない。このペアに合うパターンはルーターだ。テキストおよびマルチモーダル作業のデフォルトパスでは Flash を、タスクが長期にわたる場合、または最初の試行がチェックに失敗した場合のエスカレーションではフラッグシップを使う。つまり、2つのモデルIDと1つの判断関数であり、振り分けを少し間違えた場合のコストは、アーキテクチャの問題ではなく、1000リクエストあたり数セントで済む。

当社はGLM-5.3-Flashを100万トークンあたり$0.07と$0.25でホストしています — ベンダー自身の定価$0.15と$0.50を下回る価格です — またGLM-5.3をプロバイダーの定価$1.40と$4.40で提供しています、いずれも当社からの上乗せはゼロです — プロバイダーの定価は再設定されるのではなくそのまま通過するため、ベンダーの料金改定は先方に反映されたその日に当社側にも反映されます。両方のIDは1つのキーの背後にあり、200以上の他のモデルと並んでいますつまり、Flashからフラッグシップへのエスカレーションは、2つ目の統合ではなく、1つの呼び出しパス内でのモデル名の変更で済みます。自動フェイルオーバーは、高速ティアの背後にある単一の上流プロバイダーが劣化した場合に対応しますそして、サプライヤーをちょうど1社しか挙げていないPrimeのようなティアにとって、それは仮定の話ではありません。

率直に言うと、その限界についてはっきりさせておくべきです。OrcaRouterはGLM 5.3 Primeをホストしていませんし、GLM-5.3-FlashXもホストしていません。どちらのモデルページもここでは404を返します。Primeの高速化が必要なら、それを販売しているプラットフォームから購入することになります。

私たちが実際にあなたに伝えること

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 24, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, a 1M-token context window, $0.15 per 1M input and $0.50 per 1M output tokens with an 83% cache discount, and the comparison line 'At 46 tokens per second, GLM 5.3 Flash is notably slow (67).'

ここまで読んで勝者を探しているのなら、答えは、この2つはそもそも勝負にならなかったということだ。Flashはコスト、モダリティ、ライセンス、デプロイ性のすべてで勝っており、しかもその4つすべてで大差をつけている。旗艦モデルが主張できるのは、インデックス3ポイントと、毎秒約15多い出力トークンだけであり、それらのために18倍の価格を請求している。テキストワークロードの大多数にとって、Flashが正しいデフォルトであり、証明責任は高価な選択肢の側にある。

注意すべきなのは中間です。テキストでフラッグシップ級の推論品質を求めながら、画像も読み取る必要があるチームは、結局どちらのモデルも動かすことになります。そして、評判があるのはフラッグシップのほうなので、すべてをそこにルーティングしたくなる誘惑があります。まさにそこで、18×が静かに現実の費用項目になります。マルチモーダルの作業はFlashにルーティングし、失敗時にはエスカレーションし、実際のエスカレーション率が高いと決めつける前に、それがどれくらいなのかを確認してください。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新