
GLM 5.3 Prime:同じGLM-5.3の重みを、料金表のちょうど2倍で
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
GLM 5.3 Primeのコストは入力トークン100万あたり2.80ドル、出力トークン100万あたり8.80ドルです。その基盤となるモデル、GLM-5.3は1.40ドルと4.40ドルです。これは端数処理の違いでも販促的な価格差でもありません。両方の行でちょうど2.0倍であり、二つの製品が唯一食い違っている点です。GLM 5.3 Primeは新しいモデルではありません。Z.aiが2026年8月25日に公開したGLM-5.3自身の重みを、より高速な配信スタックの背後に搭載しています。GLM-5.3自体は2026年8月14日に発表され、8月18日にAPIで利用可能になりました。Prime IDが9月下旬に現れたとき、基盤モデルについては何も変わりませんでした。変わったのは、誰かがそれに二つ目の値札を付けたことです。
モデル一覧で、よく知っている名前の隣に見慣れない名前が表示されたからこれを読んでいるのなら、短く言えば、あなたが見ているのはリリースではなくサービング層です。長い方の答えには2分かける価値があります。なぜなら、その計算は異例なほど明快で、出所は異例なほど不透明だからです。
「プライム」ティアとは何か、1段落で
サービングティアとは、同じ重みを指す2つ目のプロダクトIDであり、コストではなくスループットに合わせて調整されたものである。より大きなモデル、より長いコンテキスト、より優れた推論モード、より広いツールサーフェスが手に入るわけではない。手に入るのはトークンがより速く外に出ていくことであり、その特権の対価は、節約した実時間ではなくトークンごとに支払うことになる。このトレードオフは実在するし、時に正しい——逐次的に10回の呼び出しを行うマルチステップのエージェントループは、各呼び出しがより早く戻ることから確かに恩恵を受ける——しかしそれはレイテンシの購入であって能力の購入ではなく、そうしたものとして価格設定されるべきである。
ベンダーによる GLM 5.3 Prime の説明は、暗黙の部分をずばり口にしている。「Z.ai の GLM-5.3 の高速版であり、その全機能を受け継ぎながら、推論アクセラレーションによって 1.5~2 倍の出力スループットを実現する」というものだ。全機能。コンテキストウィンドウは同じ 1,000,000 トークン。出力上限も同じ 131,072 トークン。テキスト入力、テキスト出力。推論は必須で、low、high、max のエフォートレベルがあり、max がデフォルト — ベースモデルとまったく同じだ。
料金表を並べて表示
• 入力 — GLM 5.3 Prime 1Mあたり$2.80 対 GLM-5.3 1Mあたり$1.40
• 出力 — GLM 5.3 Prime 1Mあたり$8.80 対 GLM-5.3 1Mあたり$4.40
• キャッシュ入力 — GLM 5.3 Prime 1Mあたり$0.56 対 GLM-5.3 1Mあたり$0.26
• 乗数 — 3行すべてで2.0×、双方向とも
• コンテキスト — 両方とも1,000,000トークン
• 最大出力 — 両方とも131,072トークン
• 推論 — 両方とも必須、同じ3つのエフォートレベル、同じデフォルト
キャッシュの項目は、人々が見落としがちなものだ。キャッシュ読み込みは、フロンティアモデルから購入するトークンの中で最も安価なものであり、エージェントワークロードが実際に予算を使う場所である — システムプロンプト、ツール定義、そして増え続けるトランスクリプトは毎ターン再読み込みされる。キャッシュレートを2倍にすると、長いエージェントセッションにおける最大の項目が2倍になる。つまり、実際のワークロードにおける実効プレミアムは、新規入力トークンの表向きの差が示唆するよりも2倍に近い。積極的にキャッシュするからといって、ファストレーンが実際には安くなると期待していたなら、そうはならない。
実際にそれを売っているのは誰ですか
ここからがこのリストの面白いところであり、注意深い読者ならここで少しペースを落とすべき箇所だ。Z.ai 自身のドキュメント、モデル概要、公開されている価格ページのいずれにも Prime SKU は記載されていない。ベンダーのモデル ID を glm-5.3-prime で検索しても、何も出てこない。Z.ai 自身のスピードティアは、まったく別系統の別製品だ——より安価な Flash ファミリーに属する GLM-5.3-FlashX で、2026年9月18日に登場し、100万トークンあたり0.37ドルと1.25ドルという価格が付けられている。
つまりPrimeは、Z.aiの重みを基盤に構築されたプラットフォーム側の製品だ。どちらのプラットフォームのものかを示す細部が2つある。1つ目は「1.5~2×の出力スループット」という言い回しで、これは大手クラウドプロバイダーが自社の高速化されたサービングモードに使うのと同じ文言だ——そのモードはモデルIDを切り替えることで有効化され、機能と利用上限は明示的に変更されない。2つ目は、そのリスティングがエンドポイントの背後にある上流プロバイダーをちょうど1社だけ挙げていることだ。高速ティアSKUの背後に単一のプロバイダーがいるというのは、オープンウェイトモデルが提供される形ではない。それは、プラットフォーム自身の高速化されたデプロイが外からどう見えるか、ということだ。
それらのどれも、GLM 5.3 Prime を悪い製品にしているわけではない。それは、サプライヤーが1つしかない製品にしているということであり、本番トラフィックをそこ経由で流す前に問うべきレジリエンス上の問題だ。
スピードの主張にはどれほどの価値があるのか

1.5~2倍という数字は、ベンダー自身の条件下で測定されたスループットの主張であり、スループットはそうした条件に最も敏感な指標です。短いプロンプトとアイドル状態のクラスタでウォームキャッシュ上で測った毎秒出力トークン数は、長いコンテキストを扱うエージェントが目にする数値ではありません。ベースモデルに対する独立した測定では、GLM-5.3は毎秒およそ61出力トークン、GLM-5.3-Flashは約46で、そのセットのクラス平均は67です。つまり、より安価なレーンはより低速でもあり、これは名称から連想されるイメージとは正反対です。これらは標準化された評価セットにおける中央値であり、ピーク値ではありません。
さらに、より微妙なコストもあります。両方のIDにおける推論エフォートのデフォルトはmaxであり、これは最も長い思考の連鎖を生成する設定です。ここでは速度と冗長性が相反する方向に作用します。最大長で推論する高速ティアであっても、難しい問題ではエンドツーエンドで遅いままである可能性があります。ボトルネックは、モデルが生成を決めるトークンの数であり、その生成速度ではないからです。ワークロードが推論中心であれば、高速化のために2×のコストを払う前にhighまたはlowに下げてください。エフォートレベルは、サービングティアよりもレイテンシーに大きく影響します。
同じモデルを購入する3つの方法

GLM-5.3は現在、購入可能な3つの形態で存在しており、それらは3つのモデルではありません:
• GLM-5.3は$1.40 / $4.40 — 基本料金表、フル機能、公開されたオープンウェイトを自分でホストできるバージョン
• GLM 5.3 Primeは$2.80 / $8.80 — 同じウェイトを高速化スタック経由で、上流サプライヤーは1社、ウェイトは関与しない
• GLM-5.3-FlashXは$0.37 / $1.25 — GLM-5.3ではなく、より安価なFlashファミリーのスピードティアであり、レイテンシを買うには断然最も安い方法
その3行目こそ、じっと見つめる価値がある。本当に求めているのがより高速なトークンで、どのGLMからそれらを得るかにこだわらないなら、FlashXは、すでにフラッグシップのおよそ10分の1のコストであるモデルで、フラッグシップを高速化なしで使う場合の半分未満の費用で高速化を提供します。Primeが意味を持つのは、GLM-5.3の推論品質を特に必要とし、かつそれをより早く必要とする場合だけです。
これが私たちの側でどこに位置するか

一つはっきりさせておくべきことがあります。OrcaRouterはGLM 5.3 Primeをホストしておらず、GLM-5.3-FlashXもホストしていません。どちらのモデルページも当社のサイトでは404を返します。高速化されたティアが必要な場合は、それを販売しているプラットフォームから購入するか、ベースモデルについてはベンダー自身のAPIから購入する必要があります。
当社がホストしているのはGLM-5.3とGLM-5.3-Flashで、プロバイダーの定価そのまま、当社による上乗せは一切ありません——Z.ai自身の料金表に載っているのと同じ$1.40と$4.40を、再設定するのではなくそのまま通過させています。これは、6週間で2度も価格が動いたモデルにとっては、言葉の響き以上に重要なことです。当社はスプレッドを上乗せしないため、ベンダーの価格変更は、先方で反映されたその日に当社側でも反映され、移行作業もサポートチケットも不要です。両方のIDは、200以上の他のモデルと並んで1つのAPIキーの背後にあり、つまりGLM-5.3とGLM-5.3-FlashのA/Bテストは、2つ目の契約ではなく1行のモデル名変更で済みます。そして単一の上流プロバイダーが劣化した場合も自動フェイルオーバーがカバーします——これは、単一サプライヤーの高速ティアが抱える特有のリスクです。
2×を支払うべきか
人間または上流サービスが応答待ちでブロックされており、ワークロードがスループット律速ではなくレイテンシ律速で、レイテンシの真の要因が reasoning effort であるとすでに確認済みなら、それを支払ってください。夜通しバッチ生成を回している場合、2× のトークン割増が節約できる実時間を上回るほど処理量が多い場合、またはそのティアが密かに優れたモデルであってほしいと期待していた場合は、支払わないでください。そうではありません。それはストップウォッチを動かしている GLM-5.3 であり、そのストップウォッチはトークン単位で課金します。
今のGLM-5.3ファミリー全体について正直に言えば、Z.aiが8月に1つのモデルをリリースし、市場は9月いっぱいをかけてそれを4つの異なる価格で再パッケージ化してきた、ということだ。GLM 5.3 Primeはそれらパッケージの中で最も高価なものだ。また、最も裏付け資料が薄いものでもある。なぜなら、重みにその名を冠している企業がそれを一覧に載せていないからだ。それは避ける理由にはならない。本番導入の道に乗せる前に、自分が何を買っているのかを正確に知る理由にはなる。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
