
LongCat-2.5-Preview vs GLM-5.2:2つの100万トークンウィンドウ、実測されたのは片方だけ
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
LongCat-2.5-PreviewとGLM-5.2は、同じ見出しの数字を掲げている。コンテキストウィンドウは100万トークン。この一点の偶然が、今週書かれている比較記事のほぼすべてで大役を担っており、しかしそれだけでは2つのモデルを比較するには足りない。GLM-5.2は2026年6月16日以降、公開ベンチマークプロファイル、公表された料金表、そして独立系評価機関による長文脈リコールスコアを備えて正式に記録されている。LongCat-2.5-Previewは2026年9月25日に美団のLongCat APIプラットフォームに登場し、割引料金表と、中国の業界報道によって伝えられたパラメータ数があるだけで、いかなる種類の公開ベンチマークも存在しない。一方のウィンドウは測定されている。もう一方は主張されているにすぎない。以下のすべてはこの2つのカテゴリーを切り離したまま進める。仕様書とテスト結果は、同じ種類の事実ではないからだ。
これはその対戦の正直な見方であり、お世辞のものより役に立つ。
各側が実際に公表した内容
Meituanの変更履歴には日付入りの項目がある — 「バージョン: 2026-09-25、LongCat-2.5-Preview 利用可能に」 — と、3つの主張された機能を挙げている:画像理解、コーディング、そして「Claude Codeや他の主要な開発環境」との互換性で、Hermes、OpenClaw、OpenCode、Kilo Codeを名指ししている。ベンダーの価格ページには、従量課金制で100万未キャッシュ入力トークンあたり$0.30、100万キャッシュ入力トークンあたり$0.006、100万出力トークンあたり$1.20と記載されており、ページ自体に期間限定割引と表示されている。コンテキストウィンドウは100万トークン、最大出力は131,072。約1.6兆の総パラメータ数とトークンあたり約480億のアクティブパラメータ数で、専門家混合(MoE)バックボーン上にあるという情報は、Meituan自身のサイトメタデータと、この発表に関する中国の業界報道から来ており、APIドキュメントからではない。技術レポートもモデルカードもベンチマーク表も、そのいずれにも添付されていない。HuggingFaceにLongCat-2.5-Previewリポジトリはなく、MeituanのGitHub組織にもその名前のリポジトリはない。OpenCodeに同梱されているモデルカタログメタデータは、オープンウェイトをfalseと記録している。

Z.aiのGLM-5.2は正反対の立場にある。これは6月のリリースで、当社が定価で提供する料金表を備えている。当社のカタログでは、入力トークン100万個あたり1.40ドル、キャッシュ済み入力トークン100万個あたり0.26ドル、出力トークン100万個あたり4.40ドルで、コンテキストウィンドウは1,000,000トークン、最大出力は128,000トークンである。公表されているスコアは2つの異なる出所から来ており、その区別は重要だ。AIME 2026、HMMT February 2026、GPQA-Diamond、FrontierSWEスイートに関するZ.ai自身の数値はベンダー報告である。一方、当社のカタログが掲載するCoding IndexとIntelligence Indexの数値は、独自の評価を実施しているArtificial Analysisに由来する。
彼らが真に平等である唯一の側面
どちらのモデルも、コンテキストとしてちょうど1,000,000トークンをうたっている。しかし、そこに入っている内容をモデルが依然として利用できるかどうかを試す、公開されたスコアを持っているのは、そのうち片方だけだ。Artificial Analysisは、GLM-5.2について長文コンテキスト想起(Long-Context Recall)の数値78.33を記録している。LongCat-2.5-Previewには、誰からも、同等の数値が存在しない。この非対称性こそが、この対決のすべてを一行にしたものだ。100万トークンのウィンドウは、アーキテクチャの容量についての表明であり、モデルがトークン900,000の時点で正しく検索できるかどうかについての表明ではない。容量は記載するのは安く、検証するのは高くつく。だからこそ、どのベンダーもそれを記載し、ほとんどどのベンダーも想起テストを公開しないのだ。
つまり、この2つを長文脈の作業のために選ぶのであれば、公表されたリコールスコアがある選択肢と、そうでない選択肢の間で選んでいることになる——そして、そうでないほうは、ベンチマークプロファイルが未測定のほうでもある。それは、その選択肢に反対する論拠ではない。一致する整数を根拠に、この2つを互換可能なものとして扱うことに反対する論拠なのだ。

実際の案件で価格差がどのようなものか
料金表は決して僅差ではなく、その方向性も、西洋のフロンティアラボに挑む中国のオープンウェイトの挑戦者に人々が期待するものとは違う。LongCat-2.5-Preview は GLM-5.2 より、非キャッシュ入力で約4.7倍安く、出力で約3.7倍安い——この比率は、公表された2つの料金表に基づく算術であり、実測値ではない。50万トークンの文書処理パスで2万トークンを書き戻す場合、約17セント対約79セントになる。どちらのモデルも同じ文書を読まなければならない。その最後まで注意を払い続けるかどうかについて、公表されたスコアがあるのは片方だけだ。
同じ文脈で触れておくべき2つ目の注意点がある。Meituanは自社の料金表を期間限定割引と位置づけている。$0.30という数字はプロモーション価格であり、ベンダーはその後に何が続くのかを明言していない。プロモーション価格に基づいて構築されたコストモデルには、読み取れない有効期限がある。それは、このモデルを避ける理由ではなく、プロバイダー間の移行を安価に保つ理由である。
OrcaRouterでは、当社が提供するルートは1つのキーでプロバイダーの定価のまま利用でき、マークアップはゼロです。そのため、ベンダーの価格変更は次回の更新時ではなくその日のうちに請求へ反映されます。また、自動フェイルオーバーが、劣化したリクエストをアプリケーション側に気付かれることなく正常なプロバイダーへ移動させます。GLM-5.2は当社が提供するルートの一つです。LongCat-2.5-Previewはそうではありません。当社は同モデルを提供しておらず、ここでの記述をそう主張していると解釈すべきではありません。Z.aiもまた6月以来、先へ進んでいます。GLM-5.3は2026年8月18日時点で当社のカタログに掲載されているため、「新しいモデル対現行モデル」という枠組みの比較は、すでにGLM-5.2を最先端ではなく既存のモデルとして位置づけてしまっています。

これを解決するものは何か、そして解決しないものは何か
• Meituan によるものであれ、独立した評価者によるものであれ、LongCat-2.5-Preview の Long-Context Recall スコア。それが存在するまでは、その 1M ウィンドウはテストが付随しない主張にすぎず、この比較で同じ問いに答える唯一の数値は GLM-5.2 の 78.33 である。
• 期間限定フラグのないベンダーの料金表。割引価格はプロモーション中のモデルの価格を示しているだけで、通常の価格を示しているわけではない。
• あらゆる種類のベンチマーク表。リーダーボードの順位ではなく — 単に公開された評価実行であり、それによって比較は仕様表と結果ページの突き合わせではなくなる。
• 画像入力の確認。変更履歴では画像理解が見出し級の追加機能として打ち出されていますが、Meituan 自身の「Retrieve Model」ドキュメントにあるレスポンス例では、依然として input_modalities を ["text"] と表示し、モダリティ文字列は text->text となっています。このサンプルは単に古いだけかもしれません。とはいえこれはベンダーが公開している仕様ですので、画像入力は「利用可能」ではなく「主張されている」ものとして扱ってください。これに対して GLM-5.2 は、当社のカタログ上ではテキスト入力・テキスト出力であり、画像モダリティはまったくありません。つまりこの側面では、どちらのモデルも検証済みの答えを与えてはくれず、うち一方は主張を与えてくるのです。
• あなた自身の数値。公開されている値と必要な値のギャップは、両方のモデルをあなたのタスクで実行することで埋められます。そして LongCat-2.5-Preview の無料ウィンドウが、今ならそれを安価にします。インターリーブされた reasoning_contentフィールドで届く推論トレースは、最初に確認すべきハーネスの詳細です。なぜなら、それを黙って捨てるツールは、エラーを出さずにモデルの有用性の大部分を失うからです。
これで比較はどうなるのか
今日中に決断が必要で、しかも長いコンテキストが関わるなら、実際に評価できるのはGLM-5.2だ。公開された再現率があり、Artificial Analysisによる独立系のコーディングスコア68.8とIntelligence Index 33.7を持ち、予算を立てられる価格が提示されている。これらの数値が示すのは、最先端というよりは実用的に有能なモデルだ——Z.ai自身の後継であるGLM-5.3のほうがスコアは上だ——しかし、何かを示してはいる。LongCat-2.5-Previewは、より安価で、より大きなコンテキストを扱い、完全に未測定の提案であり、その最も魅力的な特徴である価格は、明示的に一時的なものだ。これに対して取るべき姿勢は、懐疑ではない。プロモーション料金が消える前に、自前のスコアリングハーネスを組み込んで実施する2週間の評価だ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
