一張生成的主視覺標題卡,寫著「LongCat-2.5-Preview vs Kimi K3」,上方眉標為「長上下文召回的問題」,並有兩個面板:「LongCat-2.5-Preview:1M 上下文,召回分數未公布」與「Kimi K3:AA Long-Context Recall 88.67,是我們收錄中最高的」。OrcaRouter 標誌位於右下角。
Engineering & Research

LongCat-2.5-Preview 對比 Kimi K3:至今無人能解的長上下文召回難題

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Kimi K3在長上下文召回(Long-Context Recall)項目拿下 88.67 分。針對「模型是否仍會運用到深埋在長輸入之中的資訊」這個特定問題,這是我們清單上所有模型中最高的數字。LongCat-2.5-Preview則完全沒有長上下文召回分數——不論是 Artificial Analysis、美團,還是任何人,都拿不出來。而 LongCat-2.5-Preview 正是那個把一百萬 token 視窗當作主打特色來宣傳的模型。這種落差——一個模型的核心主張是長上下文,卻根本不存在針對長上下文的量測——就是這項比較的全部實質內容。其餘一切都不過是次要的。

值得精確釐清這個缺失的數字代表什麼、又不代表什麼,因為人很容易從「未經測量」滑向「大概很糟」,而這兩個方向都沒有依據。

這兩個模型各自公開發表了什麼

MoonshotAI 的 Kimi K3 已於 2026 年 7 月 15 日推出。我們的型錄收錄了它,具備 1,048,576 token 的上下文視窗、文字與圖像輸入,以及每百萬輸入 token 3.00 美元、每百萬快取輸入 0.30 美元和每百萬輸出 15.00 美元的價目表。其來自 Artificial Analysis 的獨立評測概況為:Coding Index 76.2,排名第九;Intelligence Index 43.6,排名第十九;GPQA Diamond 93.5%;Humanity's Last Exam 46.9%;SciCode 59.5%;Terminal-Bench v2.1 85.0;τ²-Bench banking 46.0。而 Long-Context Recall 88.67,是我們收錄中最佳的。

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

美團的 LongCat-2.5-Preview 於 2026 年 9 月 25 日現身 LongCat API 平台。其更新日誌條目點名了三項聲稱具備的能力——圖像理解、程式編寫,以及與「Claude Code 及其他主流開發環境」的相容性,並列出 Hermes、OpenClaw、OpenCode 與 Kilo Code。定價頁面標示每百萬未快取輸入 0.30 美元、每百萬快取輸入 0.006 美元、每百萬輸出 1.20 美元,並標註為限時優惠。上下文視窗 1,000,000;最大輸出 131,072。約 1.6 兆總參數/約 480 億活躍參數的數字來自美團的網站中介資料與中國業界報導,而非官方文件。沒有基準測試表、沒有模型卡、沒有技術報告,在 HuggingFace 或美團的 GitHub 組織中也沒有儲存庫,而目錄中介資料則將開放權重記錄為否。

為什麼這個缺失的數字在這裡比在其他任何對戰中都更重要?

Long-Context Recall 對這兩個模型來說,並不是眾多分數中的其中一項。它是專門測試這兩者都在販售之事物的那個分數。一百萬 token 的視窗是關於架構容量的一項聲明;召回衡量的是模型是否仍能檢索並使用一個放在第 900,000 個 token、而非第 900 個 token 的事實。廠商公布前者,因為那是一項規格。獨立評測者公布後者,因為那是一項測試,而大多數模型在這項測試上的表現,並不如其視窗大小所暗示的那麼好。

所以,誠實的立場比聽起來更狹隘。Kimi K3 的 88.67 並不代表 Kimi K3 是比 LongCat-2.5-Preview 更好的長上下文模型。它代表的是,Kimi K3 是那個問題已被提出並已回答的模型。LongCat-2.5-Preview 可能更好,也可能差得多。重點是,目前在 Meituan 以外沒有人知道,而印在定價頁面上的 1M 視窗,無論朝哪個方向都不構成證據。

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

成本概況,並附有相同的算術警告

就公佈的費率而言,LongCat-2.5-Preview 在未快取的輸入上比 Kimi K3 便宜 10 倍,在輸出上則便宜 12.5 倍。一次讀取 500,000 個詞元、並寫回 20,000 個詞元的作業,在 Kimi K3 上約為 1.80 美元,在 LongCat-2.5-Preview 上則約為 17 美分。兩者都是依牌價所做的算術,而非實測結果,而且 LongCat 的數字還多了一個 Kimi 數字沒有的但書:Meituan 將自家費率標示為限時折扣,因此促銷結束後還留著的數字是多少,無從得知。

把這一點對照覆蓋率問題來看。如果你正在處理 500,000 個 token 的輸入,而你的模型在那個深度下的召回率未經測量,那麼成本差異就不是節省——而是未知失敗率的代價。一個 17 美分、卻悄無聲息錯過相關區段的請求,比一個 1.80 美元、但能找到它的請求更昂貴,因為無論如何,你都得為重跑和除錯付出代價。這正是該風險的具體樣貌,也是為什麼缺少基準測試是成本問題,而不只是行銷問題。

號碼不存在時該怎麼辦

自己生成一組吧。這是免費使用期間真正適合填補這個缺口的罕見情況:LongCat-2.5-Preview 透過 OpenCode 呼叫不需任何費用,期間長度未說明,並有 OpenCode 記載的零保留政策——模型訓練「未使用」,資料保留「0 天」——這表示你可以先將它指向私人儲存庫,而無須先進行資料處理對話。建立一個符合你實際使用深度的大海撈針測試,在兩個模型上執行,你就會得到兩家廠商都未公布的數字。在信任結果之前,有兩件事要檢查:你的測試框架能呈現模型回傳的交錯 reasoning_content 欄位,以及圖像輸入是否真的可用,因為 Meituan 的變更記錄聲稱支援,但它自家的「Retrieve Model」範例仍顯示 input_modalities 為 ["text"],並帶有 text->text 字串。

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

OrcaRouter 在這一個當中的角色

我們提供 Kimi K3,價格為 MoonshotAI 的定價,零加成。LongCat-2.5-Preview 並非我們提供的路線——我們不提供它,本文任何內容都不應被解讀為我們聲稱提供該模型。

就這個特定的比較而言,路由器有用的部分並不是價格,而是你所評估的模型與你所依賴的模型可以共用同一把金鑰。Kimi K3 的 88.67 召回率讓它成為你今天會用來跑長上下文傳遞的模型;LongCat-2.5-Preview 則是你會想拿來與它對測的模型,因為如果它的召回率在輸出價格僅十二分之一的情況下依然站得住腳,長文件工作的經濟效益就會徹底改變。模型融合正是那套機制,讓這件事從理論變成具體可行:一次長上下文檢索傳遞與最後的綜合步驟可以是同一個請求上的兩個不同模型,因此那個便宜但未經實測的模型與昂貴但已實測的模型不必二選一。自動容錯移轉接著涵蓋了其中一個模型效能退化的情況;當你兩個候選模型其中之一沒有任何可供檢視的服務紀錄時,這一點比平時更為重要。

那項裁決,在陳述時附帶著自身的不確定性

如果你本週需要長上下文工作穩定可靠,Kimi K3 是站得住腳的選擇:88.67 的召回率是針對這項特定能力目前可得的最佳數字,而它更全面的表現概況——Coding 76.2、Intelligence 43.6、GPQA Diamond 93.5%——堪稱穩健而非亮眼,且全都來自獨立來源。如果你願意花一個下午自行產生評測,LongCat-2.5-Preview 是更有意思的賭注:百萬 token 視窗、131,072 token 的輸出上限、零保留存取,以及比 Kimi K3 低一個數量級的價目表,但這一切都建立在尚未有人公開測試過的廠商說法上。

站不住腳的,是因為兩者都列出百萬個詞元,就把它們當成等價。其中一個在那個視窗上附有一個數字,另一個則附有一個價格。那些是不同種類的證據,而它們之間的落差,才是這個比較真正要談的唯一重點。