
LongCat-2.5-Preview 對比 MiniMax M3:廉價席位早已被佔據
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
大多數 LongCat-2.5-Preview 報導的前提,都是美團已經削價壓低了業界。與MiniMax M3相較,這個前提一碰上就煙消雲散。在我們的目錄中,MiniMax M3 標價為每百萬輸入 token 0.30 美元、每百萬輸出 token 1.20 美元。LongCat-2.5-Preview 公布的價目表則是每百萬未快取輸入 token 0.30 美元、每百萬輸出 token 1.20 美元。這些並非相近的數字,而是完全相同的數字。唯一出現分歧的地方是快取輸入:美團報價每百萬 0.006 美元,對比現有供應商的 0.06 美元——在帳單中最便宜的一項上出現十倍差距。所以,有趣的問題不是 LongCat-2.5-Preview 便不便宜,而是當一個新模型以與現有供應商完全相同的價格問世時,你究竟買到了什麼、又放棄了什麼。
簡答:大得多的輸出上限、薄弱得多的證據基礎,以及快取折扣。
同樣的宣傳價格,公布上限卻截然不同
MiniMax M3 自 2026 年 5 月 31 日起已正式推出。我們的型錄收錄了它,具備 1,048,576 個詞元的上下文視窗,以及最高 512,000 個詞元的輸出上限——超過大多數模型所允許的規模,更是 LongCat-2.5-Preview 的 131,072 的四倍。它接受文字、圖像與影片作為輸入並回傳文字,同時提供工具呼叫、JSON 模式與推理功能。

LongCat-2.5-Preview 於 2026 年 9 月 25 日在美團的 LongCat API 平台上架,其在 1,000,000 個 token 的上下文方面相符,但在 131,072 的輸出方面嚴重不足。其輸入概況才是真正的問題所在:變更記錄將圖像理解列為其頭號新增功能,但美團自家「Retrieve Model」文件中的範例回應仍顯示 input_modalities/ 為 ["text"]/,並帶有 text->text 模態字串。MiniMax M3 也接受影片,而 LongCat-2.5-Preview 則完全未宣稱支援。若你的管線會輸入螢幕錄影或影格序列,這個比較到此為止。
快取不對稱性的方向恰好相反,而且值得以對 Meituan 有利的方式說明,因為這是新模型真正展現出差異化的唯一面向。每百萬快取輸入 $0.006 對比 $0.06,對於每一輪都重新傳送相同長前綴的代理工作負載來說是實實在在的優勢——而大多數工作負載都是如此。這也是最有可能在未經通知的情況下變動的細項,因為 Meituan 將整張卡都標示為限時折扣。
證據缺口,誠實地雙向衡量
MiniMax M3 的基準測試表現並不突出,而如實說出這一點,正是妥善進行這項比較的一部分。Artificial Analysis 為它記錄的 Coding Index 為 58.6——在追蹤的模型中排名第四十六——Intelligence Index 則為 29.2,排名第六十。GPQA Diamond 92.9%、Humanity's Last Exam 39%、SciCode 47.1%、Long-Context Recall 83、τ²-Bench 銀行 15.3、Terminal-Bench v2.1 65.2。MiniMax 自己公布的数据则涵盖不同範圍:BrowseComp 83.5、GDPval rubrics 76.7、MCP Atlas 74.2、BankerToolBench 76.1。那些是廠商自行報告的數字,理當與獨立數據分列不同欄位,但它們確實存在,而這正是關鍵所在。

LongCat-2.5-Preview 完全沒有欄位。沒有發表的基準測試表、沒有模型卡、沒有技術報告、在 HuggingFace 或美團的 GitHub 組織中沒有儲存庫,目錄中介資料也將開放權重記錄為 false。約 1.6 兆總參數/480 億活躍參數的數字,是取自美團的網站中介資料與中國貿易報導,而非來自官方文件。因此準確的說法是:M3 的分數平庸且有獨立來源;LongCat-2.5-Preview 的則付之闕如。在程式編碼指數中得分落在四十幾分的模型,是你可以據以規劃的已知量。沒有分數的模型則是另一種風險,而價格相同更移除了通常能正當化採用它的補償。
同樣的價格,在哪些情況下會改變你該做的事
當一個新模型以低價切入市場時,理性的做法是去評估它——好處是實實在在的折扣。當一個新模型以與自五月起便已出貨的既有產品完全相同的價格登場時,好處就不是價格,而是能力,而能力正是 LongCat-2.5-Preview 唯一沒有公布的一項。這徹底改變了評估的框架:你要測的不是它是否更便宜,而是它是否更好——在你的任務上,從零開始,沒有任何證據可供依託。
有一個二階細節,讓那項測試看起來比實際上更便宜。LongCat-2.5-Preview 透過 OpenCode 可免費且無限量使用,為期一段未言明長度的窗口,並附有 OpenCode 明確記載的零留存政策——模型訓練「未使用」,資料留存「0 天」,而對照清單則為三十天。因此,生成你自己的評估的成本幾乎為零,而留存政策則意味著你可以拿它來對私有程式碼執行。首先要釐清的一項測試框架細節是,該模型會以交錯的reasoning_content欄位回傳其推理軌跡;若用戶端在解析聊天補全時並未預期到這個欄位,就會默默丟棄思考內容,使模型看起來比實際更差。

路由論證,專門針對同價比較
我們提供 MiniMax M3,價格為MiniMax 的定價,零加成。LongCat-2.5-Preview 並非我們的服務路線之一——我們不提供該模型,且本文任何內容都不應被解讀為宣稱相反的情況。
同價位對決正是路由能真正發揮價值、而非只是圖個方便的情境。若兩個模型價格相同,兩者之間的取捨就是逐請求、逐任務來決定:M3 適合 512,000 token 輸出上限與影片輸入,LongCat-2.5-Preview 則適合長時間代理迴圈中的快取前綴折扣——前提是你已對其品質感到滿意。模型融合正是讓這件事成真的機制:檢索階段與綜整步驟可以在同一個請求中由不同模型執行,因此你不必在取得證據之前就強迫選出贏家。而且由於我們以無加價的方式直接傳遞供應商的定價表,廠商的費率變動當天就會反映在你的帳單上,而不是等到下一次合約續約——當這兩張牌其中一張明確是促銷方案時,這一點比平時更為重要。自動容錯轉移則涵蓋了某一供應商服務品質下降的情況,而對於那個沒有可檢視服務紀錄的模型來說,這一點最為重要。
常見的提問
• LongCat-2.5-Preview 比 MiniMax M3 便宜嗎?不。在公開的價目表上,輸入與輸出費率完全相同,分別是每百萬 $0.30 和 $1.20。唯一的價格優勢在於快取輸入,$0.006 對 $0.06,而 Meituan 將整份價目表標示為限時折扣,卻未說明之後會如何。
• 哪個的可使用輸出更大?MiniMax M3 大幅勝出:512,000 個 token,對比 131,072 個。對於長篇生成、大型文件上的結構化擷取,或任何會寫超過一章的內容,那個上限就是決定性的規格。
• 我能驗證哪一個?MiniMax M3,而這項驗證對它並不客氣——Coding 58.6,排名第四十六,以及 Artificial Analysis 的 Intelligence Index 29.2,排名第六十。LongCat-2.5-Preview 沒有任何由任何人發表的評估。如果這週出現 LongCat-2.5-Preview 的基準測試,請將其視為無法驗證,直到你能追溯到具名的評估者為止。
• 我該把哪一個放上正式環境?在你自己實測之前,兩個都不該。兩者相較,M3 是變異較小的選擇,因為它的弱點已有文件記載,輸入模態也已確認;LongCat-2.5-Preview 則是變異較大的一個,它宣稱的上下文更大、輸出上限卻小得多,還有快取折扣,且完全沒有公開證據。趁免費窗口還開著時先免費跑看看,把兩者都放在同一組金鑰後面,再讓你自己的數據來決定。
