生成されたヒーロータイトルカードは「LongCat-2.5-Preview vs Grok 4.6」、オーバーラインは「一方にはベンチマークカードがあり、もう一方には後継機がある」、2つのパネルは「LongCat-2.5-Preview: 1Mコンテキスト、OpenCode経由でゼロ保持」「Grok 4.6: AA Coding 76.8、Grok 4.7はすでにリリース済み」。右下にOrcaRouterのロゴ。
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6:一方にはベンチマークカードがあり、もう一方には後継モデルがいる

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

を比較するLongCat-2.5-PreviewとGrok 4.6のは、どちらのモデルの品質とも無関係な理由で厄介だ。この問いには賞味期限がある。Grok 4.6 は 2026年8月12日にリリースされ、Grok 4.7 は 2026年9月21日 — これを書いている6日前 — に、同じ $2.00 / $6.00(100万トークンあたり)の料金と、同じ 500,000トークンのコンテキストウィンドウでリリースされた。一方、LongCat-2.5-Preview は 2026年9月25日に Meituan の LongCat API Platform に登場し、後継の発表はどこにも見当たらず、公開ベンチマークも一切ない。したがって、本当の選択は「どちらのモデルが優れているか」ではない。実測された能力と、すでにその後ろに控える実測済みの後継が欲しいのか、それとも、少なくとも現行であることは確かな、実測されていないものが欲しいのか、ということだ。

その捉え方はスコアボードほど刺激的ではないが、はるかに役に立つ。

Grok 4.6が実際に記録として保有しているものから始めてください

Grok 4.6は十分に文書化されたモデルです。当社のカタログでは、500,000トークンのコンテキストウィンドウ、テキスト・画像・ファイル入力に対応し、料金表は入力トークン100万あたり$2.00、出力トークン100万あたり$6.00、キャッシュ済み入力トークン100万あたり$0.50で、入力トークンが200,000を超えると$4.00と$12.00に段階的に上がります。Artificial Analysisによる独立したプロファイルには、コーディング指数76.8(同指数が追跡するモデルの中で5位)、インテリジェンス指数44.3で18位、GPQA Diamond 94.9%、Humanity's Last Exam 42.9%、SciCode 56.5%、Terminal-Bench v2.1 88.4、銀行向けτ²-Bench 50.7が含まれます。Long-Context Recallは80.3です。

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Previewにはそうしたものは一切ない。Meituanの2026年9月25日の変更履歴エントリは、日付入りの提供開始通知であり、主張されている3つの機能 — 画像理解、コーディング、そして「Claude Codeや他の主要な開発環境」(Hermes、OpenClaw、OpenCode、Kilo Codeを含む)との互換性 — を列挙しているだけで、結果らしきものは何もない。ベンダーの価格ページでは、未キャッシュ入力100万トークンあたり0.30ドル、キャッシュ済み入力100万トークンあたり0.006ドル、出力100万トークンあたり1.20ドルが示されており、期間限定割引であることが明記されている。コンテキストウィンドウは1,000,000トークン、最大出力は131,072。約1.6兆総パラメータ/480億アクティブというパラメータ数は、ドキュメントではなくMeituanのサイトメタデータと中国の業界報道に由来する。HuggingFaceにもMeituanのGitHub組織にもそのリポジトリは存在せず、OpenCodeが同梱するカタログメタデータではオープンウェイトがfalseと記録されている。

スコアボードが完全に見落とす次元

これら2つのモデルは、どのベンチマークも測定しない点で異なっており、多くのチームにとっては、それだけでこの問いの答えが決まります。それは、送信したプロンプトがどう扱われるかです。

OpenCode 自身のドキュメントには、LongCat 2.5 Preview Free はゼロ保持ポリシーに従い、あなたのデータをトレーニングに使用しないプロバイダーによって提供されていると記載されています。Zen のプライバシー表はそれを数値で示しており、モデルトレーニングは「未使用」、データ保持は「0日」です。同じプライバシー表には、Grok 4.6 と Grok 4.7 について30日間の保持が記載されています。これらの記述はどちらも OpenCode のもので、OpenCode のページに公開されており、無料掲載と比較掲載について具体的に述べたものです。しかし、エージェントをプライベートリポジトリに向けているなら、それは法務と交わさなくてよい会話と、交わさなければならない会話の違いです。そしてそれは、SciCode でどちらのモデルがより良いスコアを出すかとは何の関係もありません。

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

「measured」がもたらすものともたらさないもの

Grok 4.6の数値は、ここで重要な唯一の意味においてLongCat-2.5-Previewのものより優れている。つまり、存在するのだ。それはGrok 4.6がより優れたモデルだと言うことと同じではない。そのコーディング指数76.8はGrok 4.7世代を下回っており、それが比較対象とされたモデルはもはや自身のファミリーの最先端ではない。公表されているその後継モデルは、Grok 4.6の44.3に対してインテリジェンス指数46.4、長文脈リコールはGrok 4.6の80.33に対して76.67だ——つまり後継モデルはすべての軸で優れているわけではなく、これはまさに世代番号が隠してしまう類の細部なのだ。

また、率直に述べておく価値のある本番配信上の注意点もあります。それは両モデルにとって好都合な解釈に反するからです。私たち自身の7日間のプレイグラウンドサンプルでは、Grok 4.6 は測定されたスループットもトークントラフィックも記録しませんでした。これは、その列におけるデータ欠如の見え方であり、性能評価ではありません。LongCat-2.5-Preview には、私たちの配信サンプルがまったくありません。私たちがそれをルーティングしていないからです。したがって、これら2つの間のレイテンシ比較は、通常の文章が覆い隠してしまうような一方的なものになります。トラフィックを送っていないモデルをベンチマークすることはできないのです。

ここでルーティング層が実際に役立つところ

上記の事実のうち3つは、ルーターが単に互換性があるというだけでなく、まさにそのために作られている類のものだ。Grok 4.6の料金表は入力トークンが200,000を超えると段階的に上がるため、同じ論理的なタスクでも、アプリケーションが何かを送信する前にすでに把握している数値次第で、2つの異なる料金で請求され得る。Grok 4.6には同一料金の公表された後継があり、つまり一方から他方への切り替えは1行の変更であるべきで、決して再統合であってはならない。そしてLongCat-2.5-Previewの最も魅力的な特性——その価格——は、ベンダーによって明示的に一時的と表示されている。

OrcaRouter ではGrok 4.6 をxAI の定価でマークアップゼロで提供しています。そのため、ベンダーの料金改定は次回の更新時ではなく当日に請求へ反映され、自動フェイルオーバーは、どのプロバイダーが応答したかをコードが知らなくても、劣化したリクエストを正常なプロバイダーへ回します。ルーティング DSL は段階的料金体系のケースを直接カバーし、モデルフュージョンは、長文の読み込みに使いたいモデルと最終的な統合に使いたいモデルが同じでないケースをカバーします。LongCat-2.5-Preview は当社のルートのひとつではありません。当社は同モデルを提供しておらず、ここでそう主張する記述もありません。これを名指しするのは、あなたを別のサービスへ回すためではありません。評価中でまだ運用していないモデルも、運用中のモデルと同じキーの背後に置くべきだ、という点です。そうすれば、その評価に要するのはプロジェクトひとつではなく、設定エントリひとつで済みます。

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

どうやって決めるか

• 防御可能な回答が必要なら、Grok 4.6 を選びましょう。独立したカード、文書化された入力プロファイル、失効しない価格を備えています。主なリスクは品質ではなく関連性です。Grok 4.7 が同じ料金で存在しており、惰性で 4.6 に留まるコストは、支払う必要のなかった Intelligence Index 44.3 と 46.4 の差なのです。

• 保持かリーチが決め手なら、LongCat-2.5-Previewを選べ。OpenCode経由のゼロ保持アクセス、100万トークンのコンテキストウィンドウ、131,072トークンの出力上限、そして料金表はGrok 4.6のおおよそ7分の1だ——これらは実際の利点であり、そのうち最初のものは第三者のプライバシーポリシーによって検証されているが、残りはベンダー自身が主張しているだけだ。

• ベンチマーク表を根拠に両者のどちらを選ぶべきか判断してはいけません。というのも、その表は1つしか存在しないからです。Grok 4.6のコーディングスコア76.8と長コンテキスト想起80.3は、Grok 4.6について述べたものです。LongCat-2.5-Previewについては、まだ何も述べられていません。今週、Grok 4.6のスコアの横にLongCat-2.5-Previewのスコアを並べて出している人は、別のLongCatモデルから引用しているか、その数値をでっち上げているかのどちらかです。

• その上に構築する前に、入力側を検証してください。Meituan の変更履歴は画像理解を先頭に掲げていますが、同社自身の「Retrieve Model」ドキュメントに載っている応答例では、依然としてinput_modalitiesが["text"]となっており、text->text というモダリティ文字列が示されています——ベンダーの主張は、そうではないと述べている公開契約と矛盾しています。Grok 4.6 はテキスト、画像、ファイルを受け取り、そのような曖昧さはありません。そして、LongCat-2.5-Preview の推論品質について何かを結論づける前に、ハーネスがインターリーブされた reasoning_content フィールドを表出していることを確認してください。そのフィールドを落とすクライアントは、静かに失敗します。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新