一張生成的主視覺標題卡,寫著「LongCat-2.5-Preview vs GLM-5.2」,上方標語為「同樣的 1M 視窗,只有其中一個經過實測」,並有兩個面板:「LongCat-2.5-Preview:1M 上下文,每 1M $0.30 / $1.20,未公布基準測試」以及「GLM-5.2:1M 上下文,AA Long-Context Recall 78.33」。OrcaRouter 標誌位於右下角。
Guides & Insights

LongCat-2.5-Preview 對比 GLM-5.2:兩個 1M Token 視窗,其中一個經過實測

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

LongCat-2.5-Preview與GLM-5.2打著同樣的頭號數字:一百萬個 token 的上下文視窗。本週所寫的大多數比較文章,全靠這一個巧合撐起全場,而單憑這點並不足以比較兩個模型。GLM-5.2 自 2026 年 6 月 16 日起便有公開紀錄可查,具備公開的基準測試概況、已發布的價目表,以及獨立評測機構給出的長上下文召回分數。LongCat-2.5-Preview 則於 2026 年 9 月 25 日登上美團的 LongCat API 平台,附有折扣價目表、中國業界報導披露的參數量,卻沒有任何形式的公開基準測試。一個視窗是實測出來的,另一個只是宣稱而已。以下內容一律將這兩類區分開來,因為規格表與測試結果並非同一種事實。

這是這場對決的誠實版本,而它比美化的版本更有用。

各方實際發布了什麼

美團的變更記錄中有一則附日期的條目——「版本:2026-09-25,LongCat-2.5-Preview 現已推出」——列出三項宣稱的能力:圖像理解、程式編寫,以及與「Claude Code 及其他主流開發環境」的相容性,並點名 Hermes、OpenClaw、OpenCode 與 Kilo Code。廠商的定價頁面標示按用量計費的費率:每百萬個未快取輸入權杖 $0.30、每百萬個快取輸入權杖 $0.006,以及每百萬個輸出權杖 $1.20,並在該頁面本身標示為限時折扣。上下文視窗為一百萬個權杖,最大輸出為 131,072。約 1.6 兆總參數量、每個權杖約 480 億個活躍參數,採用專家混合(mixture-of-experts)主幹,這些資訊來自美團自家網站的中繼資料,以及中國業界對該上架項目的報導——並非來自 API 文件。沒有技術報告、沒有模型卡,也沒有基準測試表隨附其中任何一項。HuggingFace 上沒有 LongCat-2.5-Preview 的儲存庫,美團的 GitHub 組織中也沒有同名儲存庫;OpenCode 隨附的模型目錄中繼資料將開放權重記錄為 false。

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Z.ai 的 GLM-5.2 處於相反的位置。它是六月發布的模型,價目表我們以原價提供:在我們的目錄上,每百萬輸入 token 為 1.40 美元、每百萬快取輸入 token 為 0.26 美元、每百萬輸出 token 為 4.40 美元,並具備 1,000,000 token 的上下文視窗與 128,000 token 的最大輸出。它公布的成績來自兩個不同來源,而這項區別很重要:Z.ai 針對 AIME 2026、HMMT February 2026、GPQA-Diamond 與 FrontierSWE 套件所提供的數字屬於廠商自行回報;我們目錄所載的 Coding Index 與 Intelligence Index 數據則來自 Artificial Analysis,該機構自行執行評測。

他們真正平等的那一個維度

兩款模型都宣稱恰好有 1,000,000 個 token 的上下文。其中只有一款有公開分數,用來測試模型是否仍能運用裡面的內容。Artificial Analysis 記錄到 GLM-5.2 的長上下文召回數字為 78.33。LongCat-2.5-Preview 則沒有任何來自任何人的同類數字。這種不對稱就是整場對決的一句話總結:一百萬 token 的視窗是對架構容量的宣稱,而不是對模型能否在第 900,000 個 token 正確檢索的保證。容量這種東西,標出來很便宜,驗證起來很昂貴,這就是為什麼每家廠商都會標,卻幾乎沒有廠商公開召回測試。

所以,如果你是在這兩者之間做選擇,為的是長上下文工作,那你就是在一個有已公布召回分數的選項,和一個沒有公布召回分數的選項之間做選擇——而那個沒有公布召回分數的,也正是基準測試概況未經測量的那一個。這不是在反對它。這是在反對只因一個相符的整數,就把兩者視為可互換。

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

價格差距在實際工作上會是什麼樣子

兩者的價目表差距並不小,而且方向並不是人們對一個中國開放權重挑戰者對上西方前沿實驗室時所預期的。LongCat-2.5-Preview 在未快取輸入上比 GLM-5.2 便宜約 4.7 倍,在輸出上便宜約 3.7 倍——這個比率是根據兩份已公布的價目表算出來的算術結果,並非實測。若進行一次 500,000 個詞元的文件處理流程,並寫回 20,000 個詞元,那大約是 17 美分對上約 79 美分。兩個模型都必須讀取同一份文件。但只有其中一個有公布分數,說明它在讀到最後時是否仍會保持專注。

還有第二個但書,必須一併提出:美團把自家的費率表標示為限時折扣。0.30 美元這個數字是促銷價,而該供應商並未說明之後會是什麼價。以促銷價建立的成本模型,有一個你讀不出來的到期日。這是讓供應商之間的遷移保持低廉的理由,而不是避開這個模型的理由。

在 OrcaRouter 上,我們提供的路由全都位於一把金鑰之後,以供應商定價提供且零加成,因此供應商調價當天就會反映到你的帳單,而不必等到下一次續約;而自動容錯移轉會把效能退化的請求轉到健康的供應商,你的應用程式渾然不覺。GLM-5.2 是我們提供的路由之一。LongCat-2.5-Preview 則不是——我們並未提供它,本文任何內容都不應被解讀為有相反的主張。Z.ai 自六月以來也已有進展:截至 2026 年 8 月 18 日,GLM-5.3 已在我們的型錄上線,因此以「新模型對比現行模型」為框架的比較,本身就已把 GLM-5.2 定位為現任者,而非前沿。

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

什麼能解決這件事,什麼不能。

• LongCat-2.5-Preview 的長上下文召回分數,由 Meituan 或獨立評估者提供。在那出現之前,它的 1M 視窗只是個沒有附上測試的宣稱,而 GLM-5.2 的 78.33 是這項比較中唯一能回應同一個問題的數字。

• 一份沒有標示限時優惠的供應商費率卡。折扣價告訴你的是該模型在促銷期間的費用,而不是它實際的費用。

• 任何形式的基準測試表。不是排行榜名次——而只是一次已公開的評估執行,讓比較不再只是規格表對上一張結果頁。

• 一項圖像輸入的確認。更新日誌將圖像理解列為頭條新增功能,但美團自家「Retrieve Model」文件中的範例回應仍顯示 input_modalities 為 ["text"],並帶有 text->text 模態字串。該範例可能只是過時資料。儘管如此,它仍是廠商公布的合約,因此請將圖像輸入視為「宣稱」而非「可用」。相較之下,GLM-5.2 在我們的目錄中是純文字輸入、文字輸出,完全沒有圖像模態——因此在此面向,兩款模型都無法給你經驗證的答案,而其中一款只給你一項宣稱。

• 你自己的數據。已發布的內容與你實際所需之間的落差,可以靠在你自己的任務上同時跑這兩個模型來弭平,而 LongCat-2.5-Preview 目前的免費開放期,讓這件事現在做起來很划算。以交錯方式出現在 reasoning_content 欄位中的推理軌跡,是你該優先檢查的測試框架細節,因為會默默把它丟掉的工具鏈,會在不出錯的情況下讓模型喪失大部分的實用價值。

這對比較而言意味著什麼

如果你今天就需要做決定,而這個決定涉及長上下文,那麼 GLM-5.2 才是你真正能評估的選擇:它有公開的召回率、Artificial Analysis 給出的獨立程式碼評分 68.8 與 Intelligence Index 33.7,還有一個你可以據以編列預算的價格。這些數字所描述的,是一個稱職而非前沿的模型——Z.ai 自家的後繼者 GLM-5.3 分數還更高——但它們至少描述了某些東西。LongCat-2.5-Preview 則是一個更便宜、上下文更大、完全未經實測的選項,而它最吸引人的特質——價格——明確是暫時的。對它正確的態度不是懷疑,而是在促銷費率消失之前,帶著你自己的評分工具跑一場為期兩週的評估。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新