一張生成的主視覺標題卡,寫著「LongCat-2.5-Preview vs Grok 4.6」,上方引題為「一個有基準測試卡,另一個已有接班人」,並有兩個面板:「LongCat-2.5-Preview:1M 上下文,透過 OpenCode 零留存」與「Grok 4.6:AA Coding 76.8,Grok 4.7 已經推出」。OrcaRouter 標誌位於右下角。
Guides & Insights

LongCat-2.5-Preview 與 Grok 4.6:一個有基準測試卡,一個有後繼者

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

將LongCat-2.5-Preview與Grok 4.6相互比較會顯得尷尬,原因與這兩個模型的品質毫無關係:這個問題是有保存期限的。Grok 4.6 於 2026 年 8 月 12 日推出,Grok 4.7 則於 2026 年 9 月 21 日推出——就在撰寫本文的六天前——兩者價格同為每百萬 2.00 美元 / 6.00 美元,上下文視窗也同樣是 500,000 個 token。與此同時,LongCat-2.5-Preview 於 2026 年 9 月 25 日在美團的 LongCat API 平台上線,不僅完全看不到任何已宣布的後繼模型,也完全沒有公布任何基準測試數據。因此,真正的選擇並非「哪個模型更好」,而是:你想要一個已經過實測、且背後已有同樣經過實測的後繼者撐腰的能力,還是一個未經實測、但至少是當前最新版本的能力。

這種框架不如計分板那麼令人興奮,但卻實用得多。

先從 Grok 4.6 實際上已存有的資料開始

Grok 4.6 是個文獻記載詳盡的模型。在我們的型錄中,它具備 500,000 個詞元(token)的上下文視窗,支援文字、圖像與檔案輸入,價目表為每百萬輸入詞元 2.00 美元、每百萬輸出詞元 6.00 美元,以及每百萬快取輸入詞元 0.50 美元;當輸入詞元超過 200,000 時,分別調升至 4.00 美元與 12.00 美元。Artificial Analysis 為其製作的獨立評測概況包含:Coding Index 76.8——在該指數追蹤的模型中排名第五——Intelligence Index 44.3,排名第十八;GPQA Diamond 為 94.9%,Humanity's Last Exam 為 42.9%,SciCode 為 56.5%,Terminal-Bench v2.1 為 88.4,銀行業 τ²-Bench 為 50.7。其長上下文召回率(Long-Context Recall)為 80.3。

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview 完全沒有這些。美團 2026 年 9 月 25 日的更新日誌條目是一則註明日期的可用性公告,列出三項宣稱的能力——圖像理解、程式編寫,以及與「Claude Code 及其他主流開發環境」(包括 Hermes、OpenClaw、OpenCode 與 Kilo Code)的相容性——完全沒有任何類似成果的內容。該供應商的定價頁面列出每百萬未快取輸入 $0.30、每百萬快取輸入 $0.006,以及每百萬輸出 $1.20,並明確標示為限時折扣。上下文視窗為 1,000,000 個詞元;最大輸出為 131,072。約 1.6 兆總參數/480 億啟用參數的數量,來自美團的網站中介資料與中國行業報導,而非官方文件。HuggingFace 上或美團的 GitHub 組織中都沒有它的儲存庫,而 OpenCode 隨附的目錄中介資料將開放權重記錄為 false。

計分板會完全忽略的那個面向

這兩個模型在一件沒有任何基準測試能衡量的事情上有所不同,而對許多團隊來說,這件事本身就足以決定選擇:你送出的提示會發生什麼事。

OpenCode 自己的文件指出,LongCat 2.5 Preview Free 是由遵循零留存政策、且不會將你的資料用於訓練的供應商所提供;Zen 隱私表則以數字具體呈現:模型訓練「未使用」、資料留存「0 天」。同一份隱私表列出 Grok 4.6 與 Grok 4.7 有三十天的留存期。這兩項陳述都出自 OpenCode,發佈於 OpenCode 的頁面上,而且具體說明的正是免費項目與比較項目。但如果你是要把代理程式指向私人儲存庫,那就是你不需要與法務進行的對話,和必須進行的對話之間的差別——而這與哪個模型在 SciCode 上得分更高完全無關。

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

「有分寸」能帶來什麼、不能帶來什麼

Grok 4.6 的數字比 LongCat-2.5-Preview 的更好,而這只在這裡唯一要緊的意義上成立:它們存在。這不等於說 Grok 4.6 是更好的模型。其 Coding Index 76.8 低於 Grok 4.7 世代的表現,而且它被拿來比較的模型,已不再是其自身家族中的前沿。其已發表的後繼者 Intelligence Index 為 46.4,而 Grok 4.6 為 44.3;Long-Context Recall 為 76.67,而 Grok 4.6 為 80.33——所以後繼者並非在每個軸線上都更好,而這正是世代數字所掩蓋的那種細節。

還有一項關於實際上線服務的但書值得直說,因為它與兩個模型那種討喜的解讀相牴觸。在我們自己的七天 playground 樣本中,Grok 4.6 沒有記錄到任何測得的吞吐量,也沒有任何 token 流量;在那個欄位裡,這看起來就是資料從缺,而不是效能判定。LongCat-2.5-Preview 完全沒有我們的服務樣本,因為我們沒有將它納入路由。因此,這兩者之間任何延遲比較都是片面的,而行文通常會把這一點粉飾過去:你無法對一個你沒有送流量過去的模型進行基準測試。

路由層在這裡實際上有幫助的地方

上述事實中有三項,正是路由器天生就為之而設計、而不只是勉強相容的類型。Grok 4.6 的費率表在輸入 token 超過 200,000 後會往上跳一級,因此同一個邏輯任務可能依某個數字而被以兩種不同費率計費——而這個數字,你的應用程式在送出任何內容之前就已經知道了。Grok 4.6 有一個已公佈的後繼版本,且費率完全相同,這意味著從一個切換到另一個應該只是改一行程式的變更,而絕不是重新整合。而 LongCat-2.5-Preview 最吸引人的特性——它的價格——已被供應商明確標示為臨時性。

在 OrcaRouter 上我們以 xAI 的定價提供 Grok 4.6,零加成,因此供應商的價格變動會在當天就反映到你的帳單,而不是等到下次續約;而且自動容錯移轉會把狀況不佳的請求轉到健康的供應商,你的程式碼完全不必知道是哪一家回應的。路由 DSL 直接涵蓋分層定價的情境,而模型融合則涵蓋這樣的情況:你想用於長篇閱讀的模型,未必是你想用於最終綜整的模型。LongCat-2.5-Preview 不在我們的路由之中——我們不提供它,本文也沒有任何說法暗示相反。點出這點並不是要把你導向別處;而是說,一個你正在評估而非實際執行的模型,應該和你實際執行的模型放在同一把金鑰之後,這樣評估它的成本就只是一筆設定項目,而不是一整個專案。

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

如何決定

• 如果你需要一個經得起檢驗的答案,就選擇 Grok 4.6。它有一張獨立的卡片、一份有文件記錄的輸入設定檔,以及一個不會到期的價格。它的主要風險不在於品質,而在於相關性:Grok 4.7 以相同費率存在,而出於慣性繼續使用 4.6 的代價,就是 Intelligence Index 44.3 與 46.4 之間的差距,而這個差距你原本不必為此付出。

• 若決定因素是資料保留或涵蓋範圍,就選擇 LongCat-2.5-Preview。透過 OpenCode 的零保留存取、一百萬個 token 的視窗、131,072 個 token 的輸出上限,以及大約是 Grok 4.6 七分之一的價目表,都是實質優勢——其中第一項已由第三方的隱私政策驗證,其餘則僅由供應商自行宣稱。

• 不要憑藉基準測試表在它們之間做選擇,因為只有一個存在。Grok 4.6 的 76.8 程式設計分數與 80.3 長上下文召回率所描述的是 Grok 4.6。目前還沒有任何東西描述 LongCat-2.5-Preview。這週任何把 LongCat-2.5-Preview 的分數印在 Grok 4.6 分數旁邊的人,不是在引用另一個 LongCat 模型,就是在編造那個數字。

• 在建構於其上之前,先驗證輸入端。Meituan 的更新日誌以圖像理解為開頭,但其自家「Retrieve Model」文件中的範例回應仍顯示input_modalities為["text"],並帶有text->text 模態字串——這是廠商聲稱,但已公布的合約卻顯示並非如此。Grok 4.6 可接受文字、圖像與檔案,沒有這種模稜兩可。並且,在你對 LongCat-2.5-Preview 的推理品質下任何結論之前,先確認你的測試框架會呈現交錯的reasoning_content 欄位;丟棄該欄位的用戶端會無聲地失敗。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新