GLM-5.2 vs Kimi K3 のヒーロータイトルカード。サブタイトルは「より安く、より速く、それともより大きく、より良い」、3つの角丸ピル型バッジには「それぞれ1Mトークンのコンテキスト」「AA Index 34 対 44」「$1.40 / $4.40 対 $3.00 / $15.00」と表示され、フッター行には「ベンダー料金表とArtificial Analysis、2026-09-23」、右下隅にはOrcaRouterロゴ。
Guides & Insights

GLM-5.2 vs Kimi K3:安くて速いか、それとも大きくて優れているか

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GLM-5.2Kimi K3は2026年半ばに1か月違いで登場し、ほぼ完全に互いを反転させる。Kimi K3は2026-07-16にリリースされ、2026-07-27にオープンウェイトが続いた。より大きく、紙の上ではより優れたモデルである:2.8兆パラメータ、そのうち1040億がアクティブ、そして両者が対戦した事実上すべてのベンチマークでより高いスコア。GLM-5.2は2026-06-16から出ており、2つの中で小さい方で7530億パラメータ、400億がアクティブ、出力トークンあたりのコストは約3分の1、中央値でより速く応答し、収益トリガー付きの特注ライセンスではなくMITの下で提供される。

それが、一段落でまとめた結論です。続くのは、その背後にある根拠です — 実際に実行するかもしれないジョブでの価格計算、両者が十分に近くて差がノイズと言える測定結果、そして、その隣に印字された数値とは比較できない、よく使われる数字が1つです。

二人がどういう立場にあるか

どちらも一般に各ベンダー独自のAPIを通じて利用でき、どちらもOrcaRouter上でルーティング可能で、どちらもダウンロード可能な重みを備えています。ベンチマークに近づく前に重要な違いは次のとおりです:

• リリース — 2026-06-16のGLM-5.2 対 2026-07-16のKimi K3(Artificial Analysisのモデルページ;OrcaRouter自身のKimi K3のモデルページでは1日前の2026-07-15と記載)

• 重み — MITの下でオープンなGLM-5.2 対 Kimi K3 Licenseの下でオープンなKimi K3。同ライセンスでは、年間のモデル・アズ・ア・サービス収益が2,000万ドルを超える場合は別途契約が必要で、月間ユーザー数が1億人を超える場合は目立つ帰属表示が求められる(社内研究開発は免除)

• サイズ — GLM-5.2 は総パラメータ数 753B/アクティブ 40B、Kimi K3 は総パラメータ数 2.8T/アクティブ 104B

• コンテキスト — GLM-5.2 の 1,000,000 トークン 対 Kimi K3 の 1,048,576 トークン

• 入力 — GLM-5.2 はテキスト入力・テキスト出力、Kimi K3 はテキストと画像入力・テキスト出力

• 公開されている最大出力 — GLM-5.2 は 128,000 トークン、一方 Kimi K3 の OrcaRouter ページでは非公開

OrcaRouterでは、両方とも https://api.orcarouter.ai/v1 の単一のOpenAI互換エンドポイント上で1つのキーの背後にあり、プロバイダーの定価をマークアップを一切加えずにそのまま反映しています。したがって、以下のすべての数値はベンダーの数値であり、当社のものではありません。

実際にコストがかかる仕事で、100万トークンにはいくらかかるのか

まずはベンダーの料金表です。2026年9月23日に各ベンダー自身の価格ページから読み取りました。Z.aiはGLM-5.2を入力トークン100万あたり$1.40で掲載しています、キャッシュ済み入力トークン100万あたり$0.26、出力トークン100万あたり$4.40です。MoonshotはKimi K3を入力$3.00、キャッシュ読み取り$0.30、出力$15.00で掲載しています— さらに、キャッシュ書き込みには、5分キャッシュで100万トークンあたり$3.00、1時間キャッシュで100万トークンあたり$6.00の料金がかかります。これらは公表価格であり、独立して監査されたものではなく、いずれのベンダーもこれらを変更する可能性があります。

それらを、ほとんどが読む作業である仕事に就かせよう。60万トークンのコードベースレビューで、8,000トークンの記述式回答を伴うものだ。GLM-5.2では、入力が0.6×$1.40=$0.84、出力が0.008×$4.40=$0.035、つまり約$0.88になる。Kimi K3では、0.6×$3.00=$1.80に0.008×$15.00=$0.12を加えて、約$1.92だ。同じ仕事でおよそ2.2倍のコストになる。

プロバイダーのキャッシュにコードベースがすでに入っている状態で、もう一度実行してください。すると入力行はキャッシュ読み取りレートまで下がり、2.1倍離れていた2つの価格は100万トークンあたり$0.26対$0.30 — 15%の差になります。これは比較のなかで最も議論されていない数字であり、毎ターン同じコンテキストを読み直すエージェントにとって最も重要な数字です。また、これにはアスタリスクが付きます。Kimi K3はキャッシュの書き込みに別途課金し、GLM-5.2のページには書き込み料金が一切記載されていません。そのため、コールドスタートではKimi K3のコストが$3.00という見出し価格が示すよりも無視できないほど高くなります。

• 600kトークンの読み込みと8kの回答 — {{1}}GLM-5.2{{/1}}は約0.88ドル、{{2}}Kimi K3{{/2}}は約1.92ドル

• 同じキャッシュ済み入力行 — GLM-5.2 $0.16 vs Kimi K3 $0.18(60万トークンあたり)

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

独立系モデルの見解は方向性では一致しているが、規模では一致していない。Artificial Analysis はキャッシュヒット、入力、出力のトークンを7:2:1の比率で混合し、モデルが実際に消費する推論トークンを加算している。同社の v4.3.2 インデックスで2026-09-23に読み取ったこれら2つに関する数値では、GLM-5.2 が100万混合トークンあたり $0.902 であるのに対し Kimi K3 は $2.31、また同社の評価タスクを1つ完了するコストは $0.96 対 $2.00 とされている。Intelligence Index を1回フルで実行するコストは、GLM-5.2 では $1,559、Kimi K3 では $3,658 かかる。

そのコストモデルには、直感に反する細部が埋もれている。Kimi K3 はタスクあたりの出力トークンがより少なく、GLM-5.2 の 64,000 に対して 48,000 であり、推論トークンも 51,000 に対して 32,000 と少ない。作業単位あたりではより経済的なモデルでありながら、タスクあたりのコストは依然として約 2 倍かかる。トークン単価が入力で 2.1 倍、出力で 3.4 倍だからだ。タスクあたりの安さとトークンあたりの安さは別の性質であり、これはその両者が逆方向を指す組み合わせなのだ。

コンテキストウィンドウ、そして実際にそこに収まるもの

紙の上では両者の差は5%以内だ。1,000,000トークン対1,048,576。それをKimi K3の勝利として報じるのはばかげている。どちらも100万トークンモデルであり、コンテキストウィンドウは差別化要因ではない。正直な問いは、その中間に埋もれたテキストに対して、それぞれがまだ何をできるかだ。

それがArtificial Analysisの長文脈推論評価が測定しているものであり、データセット内でも特に大きな差のひとつです。Kimi K3は89%を記録し、GLM-5.2の78%を上回っています。大量のコーパスを読み込み、その両端から事実を結びつける必要のある質問を投げかけるのが仕事なら、Kimi K3を選ぶ理由は追加の48,576トークンではありません。11ポイントの長文脈における優位性です。

ウィンドウの下の下限も異なります。GLM-5.2は128,000トークンの最大出力を公表していますが、Kimi K3のページは同等の数値を公表していないため、こちらではその数値を提示しません。長い文書を読むのではなく生成するのであれば、どちらを購入する前でも、その非対称性をご自身のワークロードと照らし合わせて確認する価値があります。

スピード:GLM-5.2が完全に掌握する唯一の軸

二つの独立した測定結果はここでは同じ方向を示しており、それらがすべてにおいて一致しているわけではないからこそ、このことはあえて言う価値がある。

当社独自のルーティングデータでは、2026-09-23までの7日間で、GLM-5.2は初回トークンまでの中央値が3.28秒で、Kimi K3の8.09秒に対する結果となり、また毎秒68.1トークンでストリーミングし、Kimi K3の43.4トークンに対します。両モデルの初回トークンまでのp95はいずれもちょうど10.00秒です。別途計測を行ったArtificial Analysisでは、GLM-5.2は出力毎秒68.2トークンでKimi K3の36.7トークンに対し、エンドツーエンドでは41.29秒対72.13秒、最初の回答まででは33.95秒対58.52秒となっています。

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

二つの情報源は一点で食い違いを見せており、それはならしてしまうよりも指摘しておく価値がある。Artificial Analysisは、生の初回トークン時間でKimi K3をわずかに上回るとしている。4.08秒対4.62秒だ。一方、私たち自身のルーティングでは、GLM-5.2がp50でほぼ2.5倍高速となる。異なるエンドポイント、異なる上流プロバイダー、異なる計測期間である。スループットの方向性——GLM-5.2が明らかに高速——は確実なものとして扱い、単一の初回トークン時間の数値は、私たちのものであれ彼らのものであれ、特定の一週間の性質を示すものとして扱うこと。

また、私たちのGLM-5.2ページにある数字も、こっそり省略するつもりはありません。同じ7日間で、エラー率9.2%を示しており、Kimi K3の0.26%と対照的です。その規模の差は、GLM-5.2を提供するアップストリームプロバイダにとっての不調な一週間である可能性と、モデルの特性である可能性がほぼ同程度であり、7日間は違いを見分けるのに十分な長さの期間ではありません。これはルーティングが解決するために存在する類の問題です — プロバイダが11リクエストに1回失敗しているとき、自動フェイルオーバーがオンコールを呼び出すことなくトラフィックを移動させます。

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

ベンチマーク:実際の圧勝だが、見出しほどではない

Kimi K3は、両モデルが実行されたほぼすべての項目で勝利しています。これらはインデックス改訂 v4.3.2 に基づく Artificial Analysis の数値で、両モデルとも最大推論構成、2026-09-23 時点の読み取りです:

• インテリジェンス指数 — Kimi K3 44 対 GLM-5.2 34

• AA-Briefcase v1.1 — 1510 対 1233

• GDPval-AA v2.1 — 1524 vs 1358

• AutomationBench-AA — 58% 対 28%

• Terminal-Bench 4.0 — 13% 対 1%

• SciCode — 59% 対 51%

• Humanity's Last Exam — 47% 対 41%

• GDP.pdf — 22% 対 10%

• AA-LCR v1.1 — 89% 対 78%

• CritPt — 23% 対 21%

そのリストを誰かがスクリーンショットする前に、2つ注意点があります。

まず、インデックスの改訂についてです。Kimi K3の7月のローンチ時の報道では、Intelligence Indexで57、GLM-5.2は51とされていました。今日のライブページでは44と34と表示されています。これらは同じ測定値ではありません——Artificial Analysisはインデックスを改訂し、それに基づいてモデルを再スコアリングするため、7月の数値と9月の数値を並べるのは、この組み合わせで最も犯しやすい間違いです。方向性はどのスナップショットでも安定していますが、絶対値は改訂をまたぐと比較できません。

次に、水準の話です。Terminal-Bench 4.0 の13%と1%は厳しい評価であり、その高みでは、比率のほうがどちらの数値よりも多くのことを語ってくれます。モデルが自身の知識の限界を把握しているかを探る AA-Omniscience では、GLM-5.2 が4、Kimi K3 が20 —— どちらかを無監督で走らせるつもりなら、知っておく価値のある下限です。

Artificial Analysis が GLM-5.2 の掲載情報について記録しているもう 1 つの点は、最大推論構成を、より新しい GLM-5.3 を優先する形で非推奨として示していることです。これは上記の数値を一切変えません。それらは測定時点の GLM-5.2 のスナップショットだからです。ただし、Z.ai のロードマップがこのモデルをすでに通り過ぎていることは意味します。ルーティングされたエンドポイントでは、それに要するのは移行ではなくモデル文字列です。これが、これらの名前のどちらもアプリケーションにハードコードしないための主な論拠です。

エージェントとツール使用:格差が最も大きいのはどこか

あの表の中で購入の決め手となる項目が一つあるとすれば、これだ。長期的なエージェント作業こそ、Kimi K3の優位性が最も大きく、最も安定している領域である:

• AutomationBench-AA — 58% 対 28%、30ポイントの差

• GDPval-AA v2.1 — 1524 vs 1358

• AA-Briefcase v1.1 — 1510 対 1233

• Terminal-Bench 4.0 — 13% 対 1%

Moonshot自身のリリース資料も同じ話に依拠している——K3の重みの公開は、ベンダーのエキスパート並列トレーニングスタックとエージェント環境ハーネスを扱う技術レポートとともに出荷された——しかし、ベンダー資料はベンダー資料であり、上記の数値は独立したものだ。

第三者のアグリゲーターであるLLM Statsは、共有ベンチマークセット上で独自の複合スコアを算出しており、別の方向から同じ結論に達している。両モデルについて採点した11のベンチマークのうち、Kimi K3がその11すべてを制しており、カテゴリ別スコアではツール使用(30.8対19.6)、エージェント(38.3対29.6)、コーディング(42.3対34.8)でKimi K3が上回っている。これらはLLM Stats自身の重み付けによる独自の複合スコアであり、規模が大きくない共有セットに基づくものなので、ラボの結果ではなく裏付けとして扱うべきだ。11のうち11という結果は、依然として僅差とは言えない。

コーディング

同じ方向だが、差はより小さい。両者についてArtificial Analysisが算出するコーディング評価では、Kimi K3がSciCodeで59%対51%とリードしており、LLM Statsの共通セットではDeepSWE、DeepSWE 1.1、FrontierSWE、SWE-Marathon、Program Bench、Terminal-Bench 2.1を制している。GLM-5.2の見栄えのよい数字——第三者のアグリゲーターが伝えるAIME 2026で99.2%、HMMT 2025で94.4%、GPQAで91.2%——はベンダー報告によるもので再現されておらず、しかもその大半はソフトウェアエンジニアリングではなく競技数学を測ったものだ。

実用的な見方としては、長時間稼働し、多数のファイルを編集し、自らの誤りから復帰しなければならないコーディングエージェントにとっては、Kimi K3のエージェント性能上の優位は、どちらのモデルの数学スコアよりも関連性の高いシグナルだ。高速で安価な、主に単発のコードアシスタントにとっては、GLM-5.2のスループット上の優位は、ベンチマークの差がもたらすコストよりも価値がある。

それらが問題にならないほど十分に近い場合

• キャッシュ済み入力の価格 — 100万トークンあたり$0.26 対 $0.30、出力の3.4倍の差に対して15%の差

• コンテキストウィンドウ — 1,000,000 対 1,048,576 トークン

• p95 最初のトークンまでの時間 — 10.00秒 対 10.00秒(自社ルーティング)

• CritPt — 23% 対 21%

• 数学 — LLM Stats は数学の総合指標で GLM-5.2 をわずかに先行させている(41.4 対 40.9)一方、Kimi K3 は画像付き数学でリードしている。入手可能な証拠を見る限り、どちらのモデルも算数を完全に制しているわけではない

これらのモデルのどちらかが全般的に他方の2倍だと言う人は、表のたった1行を見ているだけだ。

GLM-5.2を選ぶなら…

支払うのはあなたで、制約になるのはその請求額だ。GLM-5.2 の出力価格はおよそ3分の1で、キャッシュ行でも安く、MITライセンスで確認すべき収益トリガーもなく、中央値でより速く、ストリーミングではさらにずっと速く、100万トークンのウィンドウは Kimi K3 のものと十分近いので、その差が何かを決めることは決してない。あなたのワークロードがテキスト入力・テキスト出力で、長いツール呼び出しの連鎖ではなく主に読むことなら、Kimi K3 の余分なベンチマーク点は、あなたのアプリケーションが決して獲得しない点だ。

Kimi K3なら…

その作業はエージェント的で長い。AutomationBenchの30ポイント差、GDPvalとAA-Briefcaseでのリード、長文脈推論における11ポイントの優位、そしてLLM Statsの共有セットの独占は、すべて同じ方向を指している。つまり、Kimi K3の方が多段階タスクを任せてその場を離れるのに適したモデルである。また、2つのうち画像を受け付けるのはこれだけだ。そのためにタスクあたりおよそ2倍の費用を払うことになるし、ワーキングセットが大部分キャッシュされているなら2倍未満で済む——しかし、それを選ぶ理由は価格ではなく、速度でもない。

どちらも OrcaRouter 上で、1つのキーから1つの OpenAI 互換エンドポイントに対してルーティングでき、プロバイダーの定価のままで、上乗せは一切ありません。さらに、どちらも同じ自動フェイルオーバーの背後にあります。どちらが実際にあなたのワークロードに合うのかを見極める最も安価な方法です。両者の切り替えは契約ではなくモデル文字列だからです。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新