「LongCat-2.5-Preview vs Qwen3.8-Max」の生成タイトルカード。その上にサブヘッド「価格は7分の1、そしてスコアボードは皆無」、さらにその下に4枚のカードが並び、「未キャッシュ入力:1Mあたり$0.30 vs $2.00」「キャッシュ済み入力:1Mあたり$0.006 vs $0.25」「出力:1Mあたり$1.20 vs $6.00」「独立系スコア:なし vs AA Intelligence 45.4」と表示される。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

LongCat-2.5-Preview 対 Qwen3.8-Max:価格は7分の1、スコアボードではゼロ

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MeituanはLongCat-2.5-Previewを2026年9月25日に自社のAPIプラットフォーム上に公開した。変更履歴の項目と料金表が添えられていたが、あらゆる種類のベンチマークは一切なく、その後、同じ呼び出しに対してQwen3.8-Maxが請求する額のおよそ7分の1という価格を付けた。これは小さな差ではなく、安全な差でもない。ベンダーのフラッグシップであるQwen3.8-Maxは2026年8月3日から一般提供されており、独立系のArtificial Analysisの順位を持ち、名前で固定できる日付付きのスナップショットを公開し、入力で6.7倍、出力で5倍の料金を請求する。この比較が答えなければならない問いは、どちらのモデルが優れているかではない——Meituanの外部にいる者で、それにまだ答えられる立場の者はいない。問いは、その差額で何を買っているのか、そしてその差額は買う価値があるのか、である。

各側が実際に公表した内容

まず来歴から始めよう。なぜならそれは、いかなるベンチマークよりも鮮明に、この二つを分かつものだからだ。

LongCat-2.5-Previewは、美団自身の変更履歴に日付入りの項目として登場した——ベンダー自身の言葉を借りれば「Version: 2026-09-25 — LongCat-2.5-Preview Now Available」——そして、これをプラットフォームの現行の従量課金モデルとして記載する料金ページと、両方のワイヤフォーマットを扱うクイックスタートガイドも存在する。美団自身のXアカウントはこれを「1.6T parameters. ~48B active. A 1M-token context window. Natively multimodal.」と説明している。それ以外に読むべきものは何もない。meituan-longcatのHugging Face組織にあるどのリポジトリもこのモデルを対象にしていない——同組織の最新リポジトリは7月31日のLongCat-Flash-Lite-Sparseであり——これを提供するOpenCodeモデルカタログはクローズドウェイトとして記録している。モデルカードも、技術レポートも、ライセンスも、ベンダーが公開したパラメータ表もなく、どこにも独立した評価は存在しない。9月27日時点で、Artificial AnalysisにLongCat-2.5-Previewのページはない。

Qwen3.8-Maxは、ほぼあらゆる点で正反対のケースだ。2026年8月3日に料金表を公開して一般提供を開始し、Alibabaは9月2日に名前付きのリフレッシュ版であるQwen3.8-Max-0902をリリースした。Artificial Analysisが測定しており、Intelligence Indexは45.4で145モデル中15位、Coding Indexは76.2で138モデル中9位。GPQA Diamondは92.8%、Humanity's Last Examは43.1%、SciCodeは52.1%、Long-Context Recallは80.3%、Terminal-Bench 2.1は88.8%、τ-bench bankingは47.8%を記録している。これは、すべての数値に裏付けのある、実測されたモデルである。

つまり、証拠の列を正直に要約すると、能力とは何の関係もない形で偏っている。これらのモデルの一方は、コミットする前に評価できる。もう一方は、試すことしかできない。

料金表を、1行ずつ

どちらも100万トークンのモデルで、出力上限も同じだから、スペックシートが最も役に立たないまさにその点で、両者のスペックシートは一致してしまう:

• キャッシュなし入力 — LongCat-2.5-Preview 1Mあたり$0.30 対 Qwen3.8-Max 1Mあたり$2.00、6.7倍の差。

• キャッシュ入力 — 1Mあたり$0.006 対 1Mあたり$0.25、41.7倍の差。

• 出力 — 100万あたり $1.20 対 $6.00、5倍の差。

• コンテキストウィンドウ — 1,048,576トークン 対 1,000,000トークン。機能的には互角。

• 最大出力 — 両方とも131,072トークン。同一。

• 独立スコア — 公開なし 対 AA Intelligence 45.4、AA Coding 76.2

そこにあるLongCatの数値はすべてMeituan自身の料金ページから来ており、そのページでは列全体が「割引価格(期間限定)」と表示されています。Qwen3.8-Maxの数値はAlibabaの定価で、当社自身のモデルカードから読み取ったもので、キャッシュ読み取りが100万あたり$0.25、キャッシュ書き込みが100万あたり$2.50です。Artificial Analysisのスナップショットは2026年9月2日付です。

キャッシュ入力の行こそ、じっと見つめるべきものだ。キャッシュ読み取りにおける42倍の差は、この比較で最大の単一数値であり、それはエージェントのワークロードが実際に依拠している次元に該当する。毎ターン100,000トークンのシステムプロンプトとツールスキーマを再送するエージェントループは、そのトークンの大半でキャッシュ料金を支払っているのであって、見出しの入力料金を支払っているのではない。

150,000トークンの呼び出しを、両方の方法で価格設定

もっともらしいエージェント型リクエストを例に取る:入力トークン150,000、うち50,000がキャッシュから提供され、回答は4,000トークン。Meituanの割引レートでは、その呼び出しのコストは$0.0501。Qwen3.8-Maxの定価レートでは、同一の呼び出しのコストは$0.3365 — 6.7倍、つまり1日1,000回の呼び出しで$50 対 $337。この構成を完全にキャッシュ済みにすると(繰り返しプロンプトの定常状態だが)、比率は12.3倍に広がる:1回あたり$0.006 対 $0.074。

その計算のどこも、LongCat-2.5-Previewが優れているかどうかに依存していない。まさにそこが問題だ。提示されている倍率は本物で、ベンダー自身のページでそれに添えられている言葉は「期間限定」であり、終了日も、後継価格の記載もない。公表された期限のない6.7倍の割引は、計画に組み込めない予算項目だ。それは注視すべき予算項目である。

また、率直に述べておく価値のあるルーティングの非対称性があります。Qwen3.8-Max は当社が提供するルート — qwen/qwen3.8-maxおよびピン留めされたqwen/qwen3.8-max-0902 — を Alibaba の定価のまま、マークアップゼロで提供しています。そのため、ベンダーの価格改定は数週間後ではなく当日に当社側へ反映されます。LongCat-2.5-Preview は当社が提供するルートではなく、そうでないふりをするつもりもありません。この比較の安価な側では、Meituan 自身の API と、そこへアクセスするために利用するプラットフォームを相手にすることになります。

Meituan自身のAPIが矛盾する唯一の主張

これは、ワークロードが純粋なテキストではない人にとって、勝敗を決めるべき発見です。

Meituanの変更履歴では、画像理解が2.5世代の目玉として追加された機能に挙げられている。「マルチモーダル理解:新たな画像理解機能。画像の内容を解析でき、クロスモーダルなQ&A、コンテンツ要約、複雑な視覚推論をサポートする」。Xの投稿には「ネイティブにマルチモーダル」とある。これらはベンダーの主張であり、それ自体だけなら意思決定に持ち込んでも妥当だろう。

すると、同じドキュメントサイトが、そのモデル自身のメタデータを取得する際のレスポンス例を公開しており、そこで返されるモデルはテキスト専用である。id「LongCat-2.5-Preview」に対して、ペイロードにはcontext_length: 1048576、input_modalities: ["text"]、output_modalities: ["text"]、そしてモダリティ文字列はtext->textと示されている。画像の項目はない。古いスナップショットではなく、そのエンドポイントを説明するページ上の実例の中での話だ。

A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.

それはモデルが見えないことを証明するものではない。それは、ベンダーが自社の説明文と自身のAPIスキーマを整合させていないことを証明しており、誰かが決着をつけるまで、購入者がその変更履歴の一文に対してビジョンワークロードを請求できないことを意味する。それを反対側と並べてみよう:私たちのカタログには、Qwen3.8-Maxがテキスト、画像、動画入力を受け付け、宣言された機能の中にビジョンが含まれており、モデルの背後には独立したベンチマーク表が存在する。あなたのタスクがドキュメント理解、スクリーンショットのトリアージ、またはビデオフレーム分析であるなら、高価な列は検証済みの入力モダリティを持つものであり、安価な列は未解決のものを持つものである。その単一の行が、6.7×全体を消し去る可能性がある。

プレビューをピン留めできない対象

Alibabaは日付付きのスナップショットを提供しています。qwen/qwen3.8-max-0902は、ベースモデルと同じ$2/$6で提供される名前付きの固定ビルドです。つまり、これを指定するルーティングルールは来月も同じ重みを返し続けます。動作の変更は新しいIDとして登場し、ご自身のタイミングで採用できます。

LongCat-2.5-Preview にはそのようなハンドルはありません。モデルIDはプレビューIDで、スナップショットの接尾辞も、プラットフォーム上のバージョン履歴も、重みが変わったことを教えてくれる変更ログの項目もありません。あるのは、割引が「期間限定」だということだけです。これは通常の意味でのプレビューです。その名前の下にあるものは変わり得ますし、あなたはリリースノートではなく、自分の出力からそれに気づくことになるのです。

不足している証拠を手に入れる最も安い方法は、この反対側でMeituanが開いた窓だ。OpenCodeはLongCat-2.5-Previewを期間限定で無料として掲載しており、プロバイダーはゼロ保持ポリシーに従い、あなたのデータで学習しない。そして9月26日、その窓は2週間続くと述べた。入力は無料、出力も無料、キャッシュ読み取りも無料。これは、誰も公表していないベンチマーク表を作るための正当な方法だ。自分の評価コーパスをそれに対して実行すれば、ベンダーが一文しか示さなかったところに数値が得られる。ただし、これは計画を立てられる価格ではない。2週間は終わり、その先の数値はMeituanが決めるものだ。

誰がどれを選ぶべきか

そもそもモデルを購入する理由がそのワークロードにあるのなら、Qwen3.8-Max に手を伸ばすべきだ。入力が画像や動画である場合、回答がビルドごとに再現可能でなければならない場合、独立したインデックスが調達要件である場合、あるいは Terminal-Bench や Coding Index が代理指標となっているようなエージェント型コーディングのタスクである場合、6.7× というのは自分の作業を検証できるようにするための対価だ。あるキーでは、それはフォールバックチェーンの背後にも位置しているため、2つの統合を運用することなく、スコア付きのモデルがスコアなしのモデルの不調を吸収できる。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, headed 'Qwen3.8 Max', listing input modalities 'text + Image + video' with Vision, Tools, JSON and Reasoning capability chips, a price of $2.00 per 1M input and $6.00 per 1M output, open weights 'No', a p50 time-to-first-token of 2.73s, and a public benchmark panel sourced to Qwen dated 2026-08-03.

ワークロードが大量・短コンテキスト・テキストのみ・社内向けで、分類、抽出、要約、一括書き換えであり、間違う代償が顧客ではなくリトライであるときには、LongCat-2.5-Preview に手を伸ばせ。その形では、キャッシュ入力の明細行は割引ではなく、その作業の経済性そのものであり、42× は測定する手間に値する数だ。無料枠を使って、存在しないベンチマークを作り出せ。ただし、クリティカルパスをそれに移行してはならない。

この判定を変えるものは、重みの大きい順に次のとおりだ。LongCat-2.5-Preview の独立評価、割引の終了日と後継価格の公表、日付付きスナップショットを伴うバージョン履歴、そしてモダリティ一覧がテキスト専用なのかどうかの決着。これらのいずれか一つでもあれば、安い方の列は単なる割引以上のものになる。少なくとも一つが実現するまでは、この比較は二つのモデル同士の対戦ではない——検証できる価格と、検証できない能力との対戦である。

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Qwen3.8-Max - the scoreboard'. The left column, LongCat-2.5-Preview, reads 'Uncached input $0.30 / 1M', 'Cached input $0.006 / 1M', 'Output $1.20 / 1M', 'Context 1,048,576', 'Max output 131,072' and 'AA Intelligence none'; the right column, Qwen3.8-Max, reads 'Uncached input $2.00 / 1M', 'Cached input $0.25 / 1M', 'Output $6.00 / 1M', 'Context 1,000,000', 'Max output 131,072' and 'AA Intelligence 45.4'. A footer credits LongCat prices to Meituan as limited-time, Qwen prices to Alibaba, and the AA index to Artificial Analysis dated 2 Sept 2026. The OrcaRouter logo is composited in the bottom-right corner.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新