
LongCat-2.5-Preview 対 Kimi K3:まだ誰も答えられないロングコンテキスト・リコールの問い
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
Kimi K3は長文コンテキスト想起で88.67を記録している。これは、モデルが長い入力の奥深くに埋もれた情報を依然として活用できるかという特定の問いにおいて、当社のカタログ内のどのモデルよりも高い数値である。LongCat-2.5-Previewには長文コンテキスト想起のスコアが一切存在しない — Artificial Analysisにも、Meituanにも、どこにも。しかもLongCat-2.5-Previewは、100万トークンのウィンドウを目玉機能として宣伝しているモデルだ。この不一致、すなわち長文コンテキストを中心的訴求点とするモデルに長文コンテキストの測定結果が存在しないという事実こそが、この比較の本質的な中身のすべてである。それ以外は二次的なものにすぎない。
欠けている数値が何を意味し、何を意味しないのかについては、正確を期す価値がある。というのも、「測定されていない」から「おそらく悪い」へと滑り込んでしまうのはたやすいが、どちらの方向も裏づけられてはいないからだ。
2つのモデルがそれぞれ記録に残したこと
MoonshotAIのKimi K3は2026年7月15日にリリースされました。当社のカタログでは、1,048,576トークンのコンテキストウィンドウ、テキストおよび画像入力に対応し、料金表は入力トークン100万あたり$3.00、キャッシュ入力100万あたり$0.30、出力100万あたり$15.00です。Artificial Analysisによる独立したプロファイルの結果は以下のとおりです:Coding Index 76.2で9位、Intelligence Index 43.6で19位、GPQA Diamond 93.5%、Humanity's Last Exam 46.9%、SciCode 59.5%、Terminal-Bench v2.1 85.0、τ²-Benchバンキング46.0。そしてLong-Context Recall 88.67は、当社が扱う中で最高です。

MeituanのLongCat-2.5-Previewは、2026年9月25日にLongCat API Platform上に登場した。その変更履歴の項目では、主張されている3つの能力 — 画像理解、コーディング、および「Claude Codeやその他の主流開発環境」との互換性 — が挙げられており、Hermes、OpenClaw、OpenCode、Kilo Codeが列記されている。料金ページには、非キャッシュ入力100万あたり$0.30、キャッシュ入力100万あたり$0.006、出力100万あたり$1.20が記載され、期間限定割引として示されている。コンテキストウィンドウは1,000,000、最大出力は131,072。約1.6Tの総パラメータ数/約48Bのアクティブパラメータという数値は、Meituanのサイトメタデータと中国の業界報道に由来し、ドキュメントに由来するものではない。ベンチマーク表も、モデルカードも、技術レポートも、HuggingFace上またはMeituanのGitHub組織内のリポジトリもなく、カタログメタデータはオープンウェイトをfalseと記録している。
なぜここでは他のどの対戦よりも欠けた番号が重要になるのか
Long-Context Recallは、この2つのモデルにとって、数あるスコアのうちの1つではない。両者がそろって売りにしているものを試す、まさにそのスコアだ。100万トークンのウィンドウはアーキテクチャ容量についての言明であり、リコールは、モデルがトークン900ではなくトークン900,000に置かれた事実をなお取得して利用できるかどうかを測定する。ベンダーが前者を公表するのは、それが仕様だからだ。独立した評価者が後者を公表するのは、それがテストだからであり、大半のモデルは、自らのウィンドウサイズが示唆するほどには後者で好成績を収めていない。
だから正直に言える立場は、聞こえよりもずっと狭い。Kimi K3の88.67は、Kimi K3がLongCat-2.5-Previewよりも優れた長文コンテキストモデルだという意味ではない。それは、その問いが立てられ、答えられたのがKimi K3だという意味にすぎない。LongCat-2.5-Previewのほうが優れている可能性はある。かなり劣っている可能性もある。要は、今のところMeituanの外部でそれを知っている者はいないということであり、料金ページに印字された1Mウィンドウはどちらの方向の証拠にもならない。

コスト概観、同じ算術上の注意付き
公開されている料金では、LongCat-2.5-Preview はキャッシュ未使用の入力で Kimi K3 より10倍安く、出力では12.5倍安い。500,000トークンを読み取り、20,000トークンを書き戻す場合、Kimi K3 ではおよそ1.80ドル、LongCat-2.5-Preview ではおよそ17セントになる。どちらも実測ではなく、料金表の価格に基づく計算であり、LongCat の数字には Kimi の数字にはない追加の注意点がある。Meituan は自社の料金を期間限定割引と表示しているため、プロモーション終了後も残る数字は不明だ。
それをカバレッジの問題と照らし合わせてみましょう。50万トークンの入力を処理していて、その深さでのモデルの再現率が測定されていない場合、コスト差は節約ではなく、未知の失敗率の代償です。関連するセクションを黙って見逃す17セントのリクエストは、それを見つける1.80ドルのリクエストよりも高くつきます。どちらの場合も再実行とデバッグの費用を払うことになるからです。これがリスクの具体的な形であり、ベンチマークの欠如が単なるマーケティング上の問題ではなくコスト問題である理由です。
番号が存在しない間は何をすべきか
自分で生成してみてほしい。無料枠がこのギャップに本当に適しているまれなケースだ。LongCat-2.5-Preview は OpenCode 経由で、明示されていない期間、無料で呼び出せる。しかも OpenCode が文書化しているゼロ保持ポリシー——モデルトレーニングは「Not used」、データ保持は「0 days」——があるため、事前にデータ処理の協議をせずにプライベートリポジトリに向けることができる。実際に使っている深さで干し草の山の針を探すテストを構築し、両方のモデルで実行すれば、どちらのベンダーも公表していない数値が手に入る。結果を信頼する前に確認すべきことは 2 つある。ハーネスが、モデルが返すインターリーブされた reasoning_content フィールドを確実に拾い出すこと、そして画像入力がそもそも機能することだ。Meituan の変更履歴は機能すると謳っている一方で、同社自身の「Retrieve Model」の例では今なお input_modalities が ["text"]、つまり text->text 文字列として示されているからだ。

これにおけるOrcaRouterの役割
当社はKimi K3をMoonshotAIの定価で、マークアップなしで提供しています。LongCat-2.5-Previewは当社の提供ルートの一つではありません — 当社はこれを提供しておらず、本記事中のいかなる記述も、当社が提供していると主張するものとして読まれるべきではありません。
この特定の比較で言えば、ルーターの有用な部分は価格ではない。評価中のモデルと依存しているモデルを同じキーの背後に置けることだ。Kimi K3の88.67という再現率は、今日長文コンテキストの処理を流すならこのモデルだということを意味する。LongCat-2.5-Previewは、それと比較テストしたいモデルだ。出力価格の12分の1で再現率が維持されるなら、長文ドキュメント作業の経済性が変わるからだ。モデル融合は、それを理論ではなく具体化する仕組みであり、長文コンテキストの検索パスと最終統合ステップを1つのリクエストで別々のモデルにできる。だから、安価で未測定のモデルと、高価で測定済みのモデルは二者択一でなくてよい。次に自動フェイルオーバーが、どちらかが劣化したケースをカバーする。これは、2つの候補の一方に検査できる提供履歴がない場合、通常以上に重要だ。
その評決は、自らの不確実性を伴って述べられた。
今週、ロングコンテキストの作業に信頼性を求めるなら、Kimi K3が妥当な選択だ。再現率88.67は、まさに問題となっている能力について入手できる最良の数値であり、そのより広範なプロファイル——コーディング76.2、インテリジェンス43.6、GPQA Diamond 93.5%——は目覚ましいというより堅実で、しかもそのすべてが独立した情報源に基づいている。自分で評価を生成するために午後を費やすことをいとわないなら、LongCat-2.5-Previewはより興味深い賭けだ。100万トークンのウィンドウ、131,072トークンの出力上限、ゼロ保持アクセス、そしてKimi K3より一桁低い料金表——だがそのすべては、まだ誰も公開の場で検証していないベンダーの主張に依拠している。
擁護できないのは、どちらも100万トークンと記載しているという理由で、両者を同等とみなすことだ。一方にはそのウィンドウに付随する数値があり、もう一方には価格がある。それらは異なる種類の根拠であり、両者の隔たりこそが、この比較が実際に扱っている唯一のものだ。
