「LongCat-2.5-Preview vs GLM-5.2」と表示された生成済みのヒーロータイトルカード。上部には「同じ1Mウィンドウ、測定されたのは片方だけ」というオーバーライン、そして2つのパネル:「LongCat-2.5-Preview:1Mコンテキスト、100万あたり$0.30 / $1.20、ベンチマークは未公開」と「GLM-5.2:1Mコンテキスト、AA Long-Context Recall 78.33」。右下にOrcaRouterのロゴ。
Guides & Insights

LongCat-2.5-Preview vs GLM-5.2:2つの100万トークンウィンドウ、実測されたのは片方だけ

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

LongCat-2.5-PreviewとGLM-5.2は、同じ見出しの数字を掲げている。コンテキストウィンドウは100万トークン。この一点の偶然が、今週書かれている比較記事のほぼすべてで大役を担っており、しかしそれだけでは2つのモデルを比較するには足りない。GLM-5.2は2026年6月16日以降、公開ベンチマークプロファイル、公表された料金表、そして独立系評価機関による長文脈リコールスコアを備えて正式に記録されている。LongCat-2.5-Previewは2026年9月25日に美団のLongCat APIプラットフォームに登場し、割引料金表と、中国の業界報道によって伝えられたパラメータ数があるだけで、いかなる種類の公開ベンチマークも存在しない。一方のウィンドウは測定されている。もう一方は主張されているにすぎない。以下のすべてはこの2つのカテゴリーを切り離したまま進める。仕様書とテスト結果は、同じ種類の事実ではないからだ。

これはその対戦の正直な見方であり、お世辞のものより役に立つ。

各側が実際に公表した内容

Meituanの変更履歴には日付入りの項目がある — 「バージョン: 2026-09-25、LongCat-2.5-Preview 利用可能に」 — と、3つの主張された機能を挙げている:画像理解、コーディング、そして「Claude Codeや他の主要な開発環境」との互換性で、Hermes、OpenClaw、OpenCode、Kilo Codeを名指ししている。ベンダーの価格ページには、従量課金制で100万未キャッシュ入力トークンあたり$0.30、100万キャッシュ入力トークンあたり$0.006、100万出力トークンあたり$1.20と記載されており、ページ自体に期間限定割引と表示されている。コンテキストウィンドウは100万トークン、最大出力は131,072。約1.6兆の総パラメータ数とトークンあたり約480億のアクティブパラメータ数で、専門家混合(MoE)バックボーン上にあるという情報は、Meituan自身のサイトメタデータと、この発表に関する中国の業界報道から来ており、APIドキュメントからではない。技術レポートもモデルカードもベンチマーク表も、そのいずれにも添付されていない。HuggingFaceにLongCat-2.5-Previewリポジトリはなく、MeituanのGitHub組織にもその名前のリポジトリはない。OpenCodeに同梱されているモデルカタログメタデータは、オープンウェイトをfalseと記録している。

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Z.aiのGLM-5.2は正反対の立場にある。これは6月のリリースで、当社が定価で提供する料金表を備えている。当社のカタログでは、入力トークン100万個あたり1.40ドル、キャッシュ済み入力トークン100万個あたり0.26ドル、出力トークン100万個あたり4.40ドルで、コンテキストウィンドウは1,000,000トークン、最大出力は128,000トークンである。公表されているスコアは2つの異なる出所から来ており、その区別は重要だ。AIME 2026、HMMT February 2026、GPQA-Diamond、FrontierSWEスイートに関するZ.ai自身の数値はベンダー報告である。一方、当社のカタログが掲載するCoding IndexとIntelligence Indexの数値は、独自の評価を実施しているArtificial Analysisに由来する。

彼らが真に平等である唯一の側面

どちらのモデルも、コンテキストとしてちょうど1,000,000トークンをうたっている。しかし、そこに入っている内容をモデルが依然として利用できるかどうかを試す、公開されたスコアを持っているのは、そのうち片方だけだ。Artificial Analysisは、GLM-5.2について長文コンテキスト想起(Long-Context Recall)の数値78.33を記録している。LongCat-2.5-Previewには、誰からも、同等の数値が存在しない。この非対称性こそが、この対決のすべてを一行にしたものだ。100万トークンのウィンドウは、アーキテクチャの容量についての表明であり、モデルがトークン900,000の時点で正しく検索できるかどうかについての表明ではない。容量は記載するのは安く、検証するのは高くつく。だからこそ、どのベンダーもそれを記載し、ほとんどどのベンダーも想起テストを公開しないのだ。

つまり、この2つを長文脈の作業のために選ぶのであれば、公表されたリコールスコアがある選択肢と、そうでない選択肢の間で選んでいることになる——そして、そうでないほうは、ベンチマークプロファイルが未測定のほうでもある。それは、その選択肢に反対する論拠ではない。一致する整数を根拠に、この2つを互換可能なものとして扱うことに反対する論拠なのだ。

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

実際の案件で価格差がどのようなものか

料金表は決して僅差ではなく、その方向性も、西洋のフロンティアラボに挑む中国のオープンウェイトの挑戦者に人々が期待するものとは違う。LongCat-2.5-Preview は GLM-5.2 より、非キャッシュ入力で約4.7倍安く、出力で約3.7倍安い——この比率は、公表された2つの料金表に基づく算術であり、実測値ではない。50万トークンの文書処理パスで2万トークンを書き戻す場合、約17セント対約79セントになる。どちらのモデルも同じ文書を読まなければならない。その最後まで注意を払い続けるかどうかについて、公表されたスコアがあるのは片方だけだ。

同じ文脈で触れておくべき2つ目の注意点がある。Meituanは自社の料金表を期間限定割引と位置づけている。$0.30という数字はプロモーション価格であり、ベンダーはその後に何が続くのかを明言していない。プロモーション価格に基づいて構築されたコストモデルには、読み取れない有効期限がある。それは、このモデルを避ける理由ではなく、プロバイダー間の移行を安価に保つ理由である。

OrcaRouterでは、当社が提供するルートは1つのキーでプロバイダーの定価のまま利用でき、マークアップはゼロです。そのため、ベンダーの価格変更は次回の更新時ではなくその日のうちに請求へ反映されます。また、自動フェイルオーバーが、劣化したリクエストをアプリケーション側に気付かれることなく正常なプロバイダーへ移動させます。GLM-5.2は当社が提供するルートの一つです。LongCat-2.5-Previewはそうではありません。当社は同モデルを提供しておらず、ここでの記述をそう主張していると解釈すべきではありません。Z.aiもまた6月以来、先へ進んでいます。GLM-5.3は2026年8月18日時点で当社のカタログに掲載されているため、「新しいモデル対現行モデル」という枠組みの比較は、すでにGLM-5.2を最先端ではなく既存のモデルとして位置づけてしまっています。

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

これを解決するものは何か、そして解決しないものは何か

• Meituan によるものであれ、独立した評価者によるものであれ、LongCat-2.5-Preview の Long-Context Recall スコア。それが存在するまでは、その 1M ウィンドウはテストが付随しない主張にすぎず、この比較で同じ問いに答える唯一の数値は GLM-5.2 の 78.33 である。

• 期間限定フラグのないベンダーの料金表。割引価格はプロモーション中のモデルの価格を示しているだけで、通常の価格を示しているわけではない。

• あらゆる種類のベンチマーク表。リーダーボードの順位ではなく — 単に公開された評価実行であり、それによって比較は仕様表と結果ページの突き合わせではなくなる。

• 画像入力の確認。変更履歴では画像理解が見出し級の追加機能として打ち出されていますが、Meituan 自身の「Retrieve Model」ドキュメントにあるレスポンス例では、依然として input_modalities を ["text"] と表示し、モダリティ文字列は text->text となっています。このサンプルは単に古いだけかもしれません。とはいえこれはベンダーが公開している仕様ですので、画像入力は「利用可能」ではなく「主張されている」ものとして扱ってください。これに対して GLM-5.2 は、当社のカタログ上ではテキスト入力・テキスト出力であり、画像モダリティはまったくありません。つまりこの側面では、どちらのモデルも検証済みの答えを与えてはくれず、うち一方は主張を与えてくるのです。

• あなた自身の数値。公開されている値と必要な値のギャップは、両方のモデルをあなたのタスクで実行することで埋められます。そして LongCat-2.5-Preview の無料ウィンドウが、今ならそれを安価にします。インターリーブされた reasoning_contentフィールドで届く推論トレースは、最初に確認すべきハーネスの詳細です。なぜなら、それを黙って捨てるツールは、エラーを出さずにモデルの有用性の大部分を失うからです。

これで比較はどうなるのか

今日中に決断が必要で、しかも長いコンテキストが関わるなら、実際に評価できるのはGLM-5.2だ。公開された再現率があり、Artificial Analysisによる独立系のコーディングスコア68.8とIntelligence Index 33.7を持ち、予算を立てられる価格が提示されている。これらの数値が示すのは、最先端というよりは実用的に有能なモデルだ——Z.ai自身の後継であるGLM-5.3のほうがスコアは上だ——しかし、何かを示してはいる。LongCat-2.5-Previewは、より安価で、より大きなコンテキストを扱い、完全に未測定の提案であり、その最も魅力的な特徴である価格は、明示的に一時的なものだ。これに対して取るべき姿勢は、懐疑ではない。プロモーション料金が消える前に、自前のスコアリングハーネスを組み込んで実施する2週間の評価だ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新