
GLM 5.3 Prime vs GLM-5.3:同じ重みとストップウォッチで2倍の価格
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
この比較に品質面の疑問はなく、それこそが異例な点だ。GLM 5.3 PrimeとGLM-5.3は同じモデルだ — 同じ重み、同じ1,000,000トークンのコンテキスト、同じ131,072トークンの出力上限、同じ3つのエフォートレベルを伴う同じ必須推論、公開されているすべてのベンチマークで同じスコア。GLM-5.3は2026年8月14日に発表され、8月18日にAPIで利用可能になり、8月25日に重みが公開された。Prime IDは9月下旬に、同一のものを購入する第2の手段として登場した。比較で唯一異なる行は、あなたの請求書に関わる行であり、しかも正確に2.0倍異なる。
つまり、問題はどのモデルを使うかではない。出力スループットが1.5–2×だと主張するサービングレーンが、価格2倍に見合うかどうかであり、それは1段落で計算できる算数だ。この2つに関する記事のほとんどは、その算数を飛ばし、構造上同一であるベンチマークについて論じている。これがその計算だ。
異なる行のみ

• 価格 — GLM 5.3 Prime は 100万トークンあたり $2.80 / $8.80、GLM-5.3 は $1.40 / $4.40
• キャッシュ入力 — 100万トークンあたり $0.56 対 $0.26
• 乗数 — すべてのラインで、双方向とも、例外なく 2.0×
• スループット — ベンダー報告では、高速レーンは標準レーン比で 1.5~2×。Prime ID の独立した測定値は存在しない
• インテリジェンス指数 — どちらも 45。同一モデルを一度スコアリングしたものだから
• コンテキスト — 両方とも 1,000,000 トークン
• 最大出力 — 両方とも 131,072 トークン
• 推論 — 両方とも必須で、低 / 高 / 最大、デフォルトは 最大、両方とも
• モダリティ — 両方ともテキスト入力、テキスト出力
• 重み — GLM-5.3 の重みは独自ライセンスの下でダウンロード可能。Prime には重みが一切ない
• 可用性 — GLM-5.3 は Z.ai 自身の API と、それを提供するすべてのプラットフォームで利用可能。Prime は 1 つのプラットフォームで、名前の挙がった上流プロバイダー 1 社の背後にある
同一の行が通常の比較記事に与える影響に注目してください。ここには推論の深さの議論も、長いコンテキストの議論も、ツール呼び出しの議論も、サービス提供のライセンスの議論もなく、これらの2つの製品を分けるものは何もありません。なぜなら、サービングレーンはモデルの挙動を変えないからです。もしあなたが、このペアの一対一比較を読んで、Primeが何らかのタスクで「より高性能」だと結論づけたのなら、その発見はノイズです — 同じ重みが異なる分布を生み出すことはありませんし、両者が異なる唯一の点は、トークンがどれだけ速く到着するかと、デフォルトの推論エフォートがモデルにどれだけのトークンを出力させるかです。
損益分岐点、正しく行う
2つのレーンを作業単位あたりの価格で見ると、全体は1つの比率に収束する。Primeが2.0倍の価格で2.0倍のスループットを出すなら、同じコストで同じアウトプットを買っていることになり、単にお金を実時間と交換しているだけだ——割増も割引もない、純粋なレイテンシの購入である。Primeが2.0倍の価格で1.5倍のスループットを出すなら、トークン毎秒あたり約1.33倍を支払っていることになり、待ち時間を短くする特権に対して3分の1の割増を払うことになる。これらはベンダー自身が主張する範囲の両端であり、しかもどちらの端も最良のケースだ。なぜなら、1.5~2倍がベンダーのベンチマーク条件ではなく、あなたのワークロード上でも成り立つと仮定しているからである。
実際には、その割増はある理由でそれより悪い。スループットはウォームで短く、競合のないリクエストで測定され、他のあらゆる要因に最も敏感な指標だからだ。長コンテキストのエージェントセッションでは、毎ターン、増え続けるトランスクリプトを再読み込みするため、負荷は定常状態のデコードではなく、プリフィルとキャッシュ読み取りにかかる——しかもPrimeはキャッシュ読み取りにも2倍の料金を課す。ベースモデルの独立測定では、GLM-5.3は毎秒およそ61出力トークンで、クラス平均の67に対して低いが、その数値は標準化された評価セット全体の中央値であり、負荷時に遭遇するテールではない。正直にまとめれば、Primeのスループット1単位あたりのコストはベースレーンの1.0×から1.33×の間に位置し、1.0×側になるにはベンダーの最良ケースが正確に成り立つことが必要だ。
同じ重みが意味するものは、響き以上に大きい

共有ウェイトセットの実用的な利点は、GLM-5.3 に対して構築したものすべてが、双方向の切り替えを経てもそのまま生き残ることです。プロンプトの形は引き継がれ、ツールスキーマは引き継がれ、キャッシュキーは引き継がれ、そもそもフラッグシップを正当化するために実行した評価も、両方の ID で有効なままです。再チューニングも、再ベースライン化も、障害モードにおける予想外もありません。なぜなら、障害モードはそれを提供するレーンではなく、モデルに属するからです。
これは諸刃の剣であり、内面化すべきは2つ目の方向です。GLM-5.3の推論デフォルトであるmaxがあなたのタスクで冗長な出力を生むなら、Primeは他のすべてと同様にその冗長さも受け継ぎます。必要以上のトークンを生成する高速レーンは、エンドツーエンドでは速くありません。加速のために2倍のコストを払う前に、エフォートレベルをhighまたはlowに下げて計測してください — エフォート設定は通常、サービングレーンよりもエンドツーエンドのレイテンシを大きく左右し、しかもコストはかかりません。
価格表が示さない唯一の非対称性
GLM-5.3の重みはオープンです。必要なハードウェアを持つ人なら誰でも、それらをダウンロードし、モデルを原価で提供できます。トークン単位の課金はなく、選ぶべきサービングレーンもありません。実用的な最小の量子化は、アクセラレータメモリで約217GBの領域に収まり、これはほとんどのチームにとってマルチノード展開であり、一部にとってはごくわずかな誤差にすぎません。また、ライセンスには収益しきい値があり、それを超える大規模なモデル・アズ・ア・サービス事業者は、商用提供の前にセキュリティ審査を通過しなければなりません。
Primeには重みがない。それは他人のデプロイ上に置かれたホスト型のレーンであり、そのリスティングには、エンドポイントの背後にある上流プロバイダーがちょうど1つだけ記載されている。ここで名指しする価値がある非対称性はこれだ。ベースモデルでは、トークンあたりの価格と自前の償却コストの間で選ぶことになるが、Primeでは、トークンあたりの価格と、それ以外に何もないものの間で選ぶことになる。すでに自社ハードウェアでGLM-5.3を動かしているチームには、この比較において価格表には決して出てこない第3の選択肢があり、それは通常、三つの中で最も安い。
ストップウォッチが真に勝る場面
トークンあたり1.33倍の割増が明らかに正しいワークロードが存在し、それらには共通する性質が1つある。ボトルネックがトークン予算以外の何かだということだ。チャット画面で応答を待つ人間。モデルが応答を返すまで次の段階を開始できないパイプラインの同期ステップ。10回の逐次呼び出しを行うエージェントループ。そこでは各呼び出しのレイテンシがチェーンの長さで乗算され、ユーザーが実際に体感するのは合計のウォールクロック時間だ。そうした場合、あなたはトークンを買っているのではなく、トークンが費やすはずだった時間を買い戻しているのだ。そして請求書の2倍という数字は、その機能が成立するかどうかを決める数字ではない。
その形の外では、計算はすぐにPrimeに不利に転じる。夜間のバッチ生成は、個々のリクエストがどれだけ速く返るかを気にしない。大量分類も同様で、大規模になるとキャッシュ読み取りの2倍の割増が積み重なって、実際の費用項目になる。そして、モデル自身の推論長が支配項となるワークロード——難しい数学の問題や長い計画の連鎖——では、リクエストの中で決して遅い部分ではなかった箇所の高速化に対して金を払っていることになる。
両方のレーン、1つのキー、2つ目の統合は不要

ほとんどのチームが最終的にこれを解決する方法は、どちらか一方のレーンを選ぶことではなく、両者の間でルーティングすることであり、それが意味を持つのは、両方の ID に同じ方法で到達できる場合だけです。OrcaRouter は GLM-5.3 を プロバイダーのリスト料金である 100 万トークンあたり $1.40 と $4.40 で提供しており、当社からのマークアップは一切ありません — プロバイダーのリスト価格は再価格設定されるのではなくそのまま渡されるため、ベンダーの料金変更は先方に反映された同じ日に当社側でも有効になります。GLM-5.3-Flash もここにあり、$0.07 と $0.25 です。これは重要です。安価なモデルからフラッグシップへとエスカレートするルートこそ、ほとんどの本番トラフィックが実際に求める形だからです。
両方のIDは、他の200以上ものモデルと並んで1つのAPIキーの背後に収まっており、これによりレーン選択は、2つ目の契約と2つ目の統合ではなく、1つの呼び出しパス内でのモデル名の変更に変わります。この特定の組み合わせでそれが役立つのはルーティングDSLです。レイテンシに敏感な呼び出しは高速化レーンへ、それ以外はすべて標準レーンへ送る、あるいは推測ではなくチェック失敗時にエスカレーションする、といったことができます。自動フェイルオーバーは、単一の上流プロバイダーが劣化するケースをカバーします。これは、単一サプライヤーの高速ティアが抱える具体的なエクスポージャーです。
一つだけ、ほのめかすことはしません。OrcaRouter は GLM 5.3 Prime をホストしておらず、そのモデルページはここでは 404 を返します。アクセラレーテッド・レーンをご希望なら、それを販売しているプラットフォームから購入することになります。私たちにできるのは、ベース・レーンと Flash モデルを提供し、それらの間をルーティングする一つの場所を用意することです。
30秒で決める方法
応答を待っている何かがあるかどうかを問いかけよ。人または下流サービスがブロックされており、ワークロードがスループット律速ではなくレイテンシ律速であり、レイテンシの真の要因が reasoning effort ではないとすでに確認済みなら、Prime のプレミアムはその機能の対価であり、支払うべきだ。何も待っていない場合——バッチジョブ、オフライン評価、一括抽出、キューが遅延を吸収するあらゆるもの——は、誰も見ることのない数値のためにスループット1単位あたり3分の1の割増を支払っているのであり、ベースレーンが正解だ。
より広い論点は、このファミリーがどのように販売されてきたかにある。GLM-5.3は8月に一度出荷され、9月には、どのレーン、どのプラットフォーム、どの兄弟モデルに当たるかによって、少なくとも4つの異なる価格が生じている。Primeはそれらの中で最も高価で、最も文書化が少ない。なぜなら、重みにその名を冠している会社がそれを一覧に載せていないからだ。それは、それを買うなという主張ではない。本番トラフィックをそこに流す前に、ベースモデルに対して買っている唯一のものはストップウォッチであり、そのストップウォッチはトークン単位で課金される、ということを知っておくべきだという主張である。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
