
LongCat-2.5-Preview vs Grok 4.6:一方にはベンチマークカードがあり、もう一方には後継モデルがいる
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
を比較するLongCat-2.5-PreviewとGrok 4.6のは、どちらのモデルの品質とも無関係な理由で厄介だ。この問いには賞味期限がある。Grok 4.6 は 2026年8月12日にリリースされ、Grok 4.7 は 2026年9月21日 — これを書いている6日前 — に、同じ $2.00 / $6.00(100万トークンあたり)の料金と、同じ 500,000トークンのコンテキストウィンドウでリリースされた。一方、LongCat-2.5-Preview は 2026年9月25日に Meituan の LongCat API Platform に登場し、後継の発表はどこにも見当たらず、公開ベンチマークも一切ない。したがって、本当の選択は「どちらのモデルが優れているか」ではない。実測された能力と、すでにその後ろに控える実測済みの後継が欲しいのか、それとも、少なくとも現行であることは確かな、実測されていないものが欲しいのか、ということだ。
その捉え方はスコアボードほど刺激的ではないが、はるかに役に立つ。
Grok 4.6が実際に記録として保有しているものから始めてください
Grok 4.6は十分に文書化されたモデルです。当社のカタログでは、500,000トークンのコンテキストウィンドウ、テキスト・画像・ファイル入力に対応し、料金表は入力トークン100万あたり$2.00、出力トークン100万あたり$6.00、キャッシュ済み入力トークン100万あたり$0.50で、入力トークンが200,000を超えると$4.00と$12.00に段階的に上がります。Artificial Analysisによる独立したプロファイルには、コーディング指数76.8(同指数が追跡するモデルの中で5位)、インテリジェンス指数44.3で18位、GPQA Diamond 94.9%、Humanity's Last Exam 42.9%、SciCode 56.5%、Terminal-Bench v2.1 88.4、銀行向けτ²-Bench 50.7が含まれます。Long-Context Recallは80.3です。

LongCat-2.5-Previewにはそうしたものは一切ない。Meituanの2026年9月25日の変更履歴エントリは、日付入りの提供開始通知であり、主張されている3つの機能 — 画像理解、コーディング、そして「Claude Codeや他の主要な開発環境」(Hermes、OpenClaw、OpenCode、Kilo Codeを含む)との互換性 — を列挙しているだけで、結果らしきものは何もない。ベンダーの価格ページでは、未キャッシュ入力100万トークンあたり0.30ドル、キャッシュ済み入力100万トークンあたり0.006ドル、出力100万トークンあたり1.20ドルが示されており、期間限定割引であることが明記されている。コンテキストウィンドウは1,000,000トークン、最大出力は131,072。約1.6兆総パラメータ/480億アクティブというパラメータ数は、ドキュメントではなくMeituanのサイトメタデータと中国の業界報道に由来する。HuggingFaceにもMeituanのGitHub組織にもそのリポジトリは存在せず、OpenCodeが同梱するカタログメタデータではオープンウェイトがfalseと記録されている。
スコアボードが完全に見落とす次元
これら2つのモデルは、どのベンチマークも測定しない点で異なっており、多くのチームにとっては、それだけでこの問いの答えが決まります。それは、送信したプロンプトがどう扱われるかです。
OpenCode 自身のドキュメントには、LongCat 2.5 Preview Free はゼロ保持ポリシーに従い、あなたのデータをトレーニングに使用しないプロバイダーによって提供されていると記載されています。Zen のプライバシー表はそれを数値で示しており、モデルトレーニングは「未使用」、データ保持は「0日」です。同じプライバシー表には、Grok 4.6 と Grok 4.7 について30日間の保持が記載されています。これらの記述はどちらも OpenCode のもので、OpenCode のページに公開されており、無料掲載と比較掲載について具体的に述べたものです。しかし、エージェントをプライベートリポジトリに向けているなら、それは法務と交わさなくてよい会話と、交わさなければならない会話の違いです。そしてそれは、SciCode でどちらのモデルがより良いスコアを出すかとは何の関係もありません。

「measured」がもたらすものともたらさないもの
Grok 4.6の数値は、ここで重要な唯一の意味においてLongCat-2.5-Previewのものより優れている。つまり、存在するのだ。それはGrok 4.6がより優れたモデルだと言うことと同じではない。そのコーディング指数76.8はGrok 4.7世代を下回っており、それが比較対象とされたモデルはもはや自身のファミリーの最先端ではない。公表されているその後継モデルは、Grok 4.6の44.3に対してインテリジェンス指数46.4、長文脈リコールはGrok 4.6の80.33に対して76.67だ——つまり後継モデルはすべての軸で優れているわけではなく、これはまさに世代番号が隠してしまう類の細部なのだ。
また、率直に述べておく価値のある本番配信上の注意点もあります。それは両モデルにとって好都合な解釈に反するからです。私たち自身の7日間のプレイグラウンドサンプルでは、Grok 4.6 は測定されたスループットもトークントラフィックも記録しませんでした。これは、その列におけるデータ欠如の見え方であり、性能評価ではありません。LongCat-2.5-Preview には、私たちの配信サンプルがまったくありません。私たちがそれをルーティングしていないからです。したがって、これら2つの間のレイテンシ比較は、通常の文章が覆い隠してしまうような一方的なものになります。トラフィックを送っていないモデルをベンチマークすることはできないのです。
ここでルーティング層が実際に役立つところ
上記の事実のうち3つは、ルーターが単に互換性があるというだけでなく、まさにそのために作られている類のものだ。Grok 4.6の料金表は入力トークンが200,000を超えると段階的に上がるため、同じ論理的なタスクでも、アプリケーションが何かを送信する前にすでに把握している数値次第で、2つの異なる料金で請求され得る。Grok 4.6には同一料金の公表された後継があり、つまり一方から他方への切り替えは1行の変更であるべきで、決して再統合であってはならない。そしてLongCat-2.5-Previewの最も魅力的な特性——その価格——は、ベンダーによって明示的に一時的と表示されている。
OrcaRouter ではGrok 4.6 をxAI の定価でマークアップゼロで提供しています。そのため、ベンダーの料金改定は次回の更新時ではなく当日に請求へ反映され、自動フェイルオーバーは、どのプロバイダーが応答したかをコードが知らなくても、劣化したリクエストを正常なプロバイダーへ回します。ルーティング DSL は段階的料金体系のケースを直接カバーし、モデルフュージョンは、長文の読み込みに使いたいモデルと最終的な統合に使いたいモデルが同じでないケースをカバーします。LongCat-2.5-Preview は当社のルートのひとつではありません。当社は同モデルを提供しておらず、ここでそう主張する記述もありません。これを名指しするのは、あなたを別のサービスへ回すためではありません。評価中でまだ運用していないモデルも、運用中のモデルと同じキーの背後に置くべきだ、という点です。そうすれば、その評価に要するのはプロジェクトひとつではなく、設定エントリひとつで済みます。

どうやって決めるか
• 防御可能な回答が必要なら、Grok 4.6 を選びましょう。独立したカード、文書化された入力プロファイル、失効しない価格を備えています。主なリスクは品質ではなく関連性です。Grok 4.7 が同じ料金で存在しており、惰性で 4.6 に留まるコストは、支払う必要のなかった Intelligence Index 44.3 と 46.4 の差なのです。
• 保持かリーチが決め手なら、LongCat-2.5-Previewを選べ。OpenCode経由のゼロ保持アクセス、100万トークンのコンテキストウィンドウ、131,072トークンの出力上限、そして料金表はGrok 4.6のおおよそ7分の1だ——これらは実際の利点であり、そのうち最初のものは第三者のプライバシーポリシーによって検証されているが、残りはベンダー自身が主張しているだけだ。
• ベンチマーク表を根拠に両者のどちらを選ぶべきか判断してはいけません。というのも、その表は1つしか存在しないからです。Grok 4.6のコーディングスコア76.8と長コンテキスト想起80.3は、Grok 4.6について述べたものです。LongCat-2.5-Previewについては、まだ何も述べられていません。今週、Grok 4.6のスコアの横にLongCat-2.5-Previewのスコアを並べて出している人は、別のLongCatモデルから引用しているか、その数値をでっち上げているかのどちらかです。
• その上に構築する前に、入力側を検証してください。Meituan の変更履歴は画像理解を先頭に掲げていますが、同社自身の「Retrieve Model」ドキュメントに載っている応答例では、依然としてinput_modalitiesが["text"]となっており、text->text というモダリティ文字列が示されています——ベンダーの主張は、そうではないと述べている公開契約と矛盾しています。Grok 4.6 はテキスト、画像、ファイルを受け取り、そのような曖昧さはありません。そして、LongCat-2.5-Preview の推論品質について何かを結論づける前に、ハーネスがインターリーブされた reasoning_content フィールドを表出していることを確認してください。そのフィールドを落とすクライアントは、静かに失敗します。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
