
LongCat-2.5-Preview 與 Grok 4.6:一個有基準測試卡,一個有後繼者
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
將LongCat-2.5-Preview與Grok 4.6相互比較會顯得尷尬,原因與這兩個模型的品質毫無關係:這個問題是有保存期限的。Grok 4.6 於 2026 年 8 月 12 日推出,Grok 4.7 則於 2026 年 9 月 21 日推出——就在撰寫本文的六天前——兩者價格同為每百萬 2.00 美元 / 6.00 美元,上下文視窗也同樣是 500,000 個 token。與此同時,LongCat-2.5-Preview 於 2026 年 9 月 25 日在美團的 LongCat API 平台上線,不僅完全看不到任何已宣布的後繼模型,也完全沒有公布任何基準測試數據。因此,真正的選擇並非「哪個模型更好」,而是:你想要一個已經過實測、且背後已有同樣經過實測的後繼者撐腰的能力,還是一個未經實測、但至少是當前最新版本的能力。
這種框架不如計分板那麼令人興奮,但卻實用得多。
先從 Grok 4.6 實際上已存有的資料開始
Grok 4.6 是個文獻記載詳盡的模型。在我們的型錄中,它具備 500,000 個詞元(token)的上下文視窗,支援文字、圖像與檔案輸入,價目表為每百萬輸入詞元 2.00 美元、每百萬輸出詞元 6.00 美元,以及每百萬快取輸入詞元 0.50 美元;當輸入詞元超過 200,000 時,分別調升至 4.00 美元與 12.00 美元。Artificial Analysis 為其製作的獨立評測概況包含:Coding Index 76.8——在該指數追蹤的模型中排名第五——Intelligence Index 44.3,排名第十八;GPQA Diamond 為 94.9%,Humanity's Last Exam 為 42.9%,SciCode 為 56.5%,Terminal-Bench v2.1 為 88.4,銀行業 τ²-Bench 為 50.7。其長上下文召回率(Long-Context Recall)為 80.3。

LongCat-2.5-Preview 完全沒有這些。美團 2026 年 9 月 25 日的更新日誌條目是一則註明日期的可用性公告,列出三項宣稱的能力——圖像理解、程式編寫,以及與「Claude Code 及其他主流開發環境」(包括 Hermes、OpenClaw、OpenCode 與 Kilo Code)的相容性——完全沒有任何類似成果的內容。該供應商的定價頁面列出每百萬未快取輸入 $0.30、每百萬快取輸入 $0.006,以及每百萬輸出 $1.20,並明確標示為限時折扣。上下文視窗為 1,000,000 個詞元;最大輸出為 131,072。約 1.6 兆總參數/480 億啟用參數的數量,來自美團的網站中介資料與中國行業報導,而非官方文件。HuggingFace 上或美團的 GitHub 組織中都沒有它的儲存庫,而 OpenCode 隨附的目錄中介資料將開放權重記錄為 false。
計分板會完全忽略的那個面向
這兩個模型在一件沒有任何基準測試能衡量的事情上有所不同,而對許多團隊來說,這件事本身就足以決定選擇:你送出的提示會發生什麼事。
OpenCode 自己的文件指出,LongCat 2.5 Preview Free 是由遵循零留存政策、且不會將你的資料用於訓練的供應商所提供;Zen 隱私表則以數字具體呈現:模型訓練「未使用」、資料留存「0 天」。同一份隱私表列出 Grok 4.6 與 Grok 4.7 有三十天的留存期。這兩項陳述都出自 OpenCode,發佈於 OpenCode 的頁面上,而且具體說明的正是免費項目與比較項目。但如果你是要把代理程式指向私人儲存庫,那就是你不需要與法務進行的對話,和必須進行的對話之間的差別——而這與哪個模型在 SciCode 上得分更高完全無關。

「有分寸」能帶來什麼、不能帶來什麼
Grok 4.6 的數字比 LongCat-2.5-Preview 的更好,而這只在這裡唯一要緊的意義上成立:它們存在。這不等於說 Grok 4.6 是更好的模型。其 Coding Index 76.8 低於 Grok 4.7 世代的表現,而且它被拿來比較的模型,已不再是其自身家族中的前沿。其已發表的後繼者 Intelligence Index 為 46.4,而 Grok 4.6 為 44.3;Long-Context Recall 為 76.67,而 Grok 4.6 為 80.33——所以後繼者並非在每個軸線上都更好,而這正是世代數字所掩蓋的那種細節。
還有一項關於實際上線服務的但書值得直說,因為它與兩個模型那種討喜的解讀相牴觸。在我們自己的七天 playground 樣本中,Grok 4.6 沒有記錄到任何測得的吞吐量,也沒有任何 token 流量;在那個欄位裡,這看起來就是資料從缺,而不是效能判定。LongCat-2.5-Preview 完全沒有我們的服務樣本,因為我們沒有將它納入路由。因此,這兩者之間任何延遲比較都是片面的,而行文通常會把這一點粉飾過去:你無法對一個你沒有送流量過去的模型進行基準測試。
路由層在這裡實際上有幫助的地方
上述事實中有三項,正是路由器天生就為之而設計、而不只是勉強相容的類型。Grok 4.6 的費率表在輸入 token 超過 200,000 後會往上跳一級,因此同一個邏輯任務可能依某個數字而被以兩種不同費率計費——而這個數字,你的應用程式在送出任何內容之前就已經知道了。Grok 4.6 有一個已公佈的後繼版本,且費率完全相同,這意味著從一個切換到另一個應該只是改一行程式的變更,而絕不是重新整合。而 LongCat-2.5-Preview 最吸引人的特性——它的價格——已被供應商明確標示為臨時性。
在 OrcaRouter 上我們以 xAI 的定價提供 Grok 4.6,零加成,因此供應商的價格變動會在當天就反映到你的帳單,而不是等到下次續約;而且自動容錯移轉會把狀況不佳的請求轉到健康的供應商,你的程式碼完全不必知道是哪一家回應的。路由 DSL 直接涵蓋分層定價的情境,而模型融合則涵蓋這樣的情況:你想用於長篇閱讀的模型,未必是你想用於最終綜整的模型。LongCat-2.5-Preview 不在我們的路由之中——我們不提供它,本文也沒有任何說法暗示相反。點出這點並不是要把你導向別處;而是說,一個你正在評估而非實際執行的模型,應該和你實際執行的模型放在同一把金鑰之後,這樣評估它的成本就只是一筆設定項目,而不是一整個專案。

如何決定
• 如果你需要一個經得起檢驗的答案,就選擇 Grok 4.6。它有一張獨立的卡片、一份有文件記錄的輸入設定檔,以及一個不會到期的價格。它的主要風險不在於品質,而在於相關性:Grok 4.7 以相同費率存在,而出於慣性繼續使用 4.6 的代價,就是 Intelligence Index 44.3 與 46.4 之間的差距,而這個差距你原本不必為此付出。
• 若決定因素是資料保留或涵蓋範圍,就選擇 LongCat-2.5-Preview。透過 OpenCode 的零保留存取、一百萬個 token 的視窗、131,072 個 token 的輸出上限,以及大約是 Grok 4.6 七分之一的價目表,都是實質優勢——其中第一項已由第三方的隱私政策驗證,其餘則僅由供應商自行宣稱。
• 不要憑藉基準測試表在它們之間做選擇,因為只有一個存在。Grok 4.6 的 76.8 程式設計分數與 80.3 長上下文召回率所描述的是 Grok 4.6。目前還沒有任何東西描述 LongCat-2.5-Preview。這週任何把 LongCat-2.5-Preview 的分數印在 Grok 4.6 分數旁邊的人,不是在引用另一個 LongCat 模型,就是在編造那個數字。
• 在建構於其上之前,先驗證輸入端。Meituan 的更新日誌以圖像理解為開頭,但其自家「Retrieve Model」文件中的範例回應仍顯示input_modalities為["text"],並帶有text->text 模態字串——這是廠商聲稱,但已公布的合約卻顯示並非如此。Grok 4.6 可接受文字、圖像與檔案,沒有這種模稜兩可。並且,在你對 LongCat-2.5-Preview 的推理品質下任何結論之前,先確認你的測試框架會呈現交錯的reasoning_content 欄位;丟棄該欄位的用戶端會無聲地失敗。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
