
LongCat-2.5-Preview 對上 Qwen3.8-Max:價格只要七分之一,排行榜上卻毫無蹤影
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
Meituan 於 2026 年 9 月 25 日將 LongCat-2.5-Preview 放上其 API 平台,附帶一則更新日誌、一份價目表,卻沒有任何形式的基準測試——接著定價約為 Qwen3.8-Max 對相同呼叫所收費用的七分之一。這不是個小差距,也不是個安全的差距。Qwen3.8-Max,該廠商的旗艦模型,自 2026 年 8 月 3 日起全面可用,擁有獨立的 Artificial Analysis 排名,發布可依名稱鎖定的有日期快照,且輸入計費為 6.7 倍、輸出為 5 倍。這項比較必須回答的問題,不是哪個模型更好——Meituan 以外的任何人都還沒有立場回答這點。而是你用價差買到了什麼,以及這個價差是否值得買。
各方實際發布了什麼
先從來源出處談起,因為它比任何基準測試都更能清楚區分這兩者。
LongCat-2.5-Preview 伴隨著美團自家更新日誌上一則標註日期的條目問世——用廠商自己的話來說:「版本:2026-09-25——LongCat-2.5-Preview 現已推出」——一份定價頁面將它列為該平台目前的按用量付費模型,還有一份涵蓋兩種傳輸格式的快速入門指南。美團在 X 上的官方帳號如此描述它:「1.6T 參數。約 48B 活躍參數。100 萬 token 的上下文視窗。原生多模態。」除此之外,無處可讀。在 meituan-longcat Hugging Face 組織中,沒有任何儲存庫涵蓋這個模型——該組織最新的儲存庫是 7 月 31 日的 LongCat-Flash-Lite-Sparse——而提供該模型的 OpenCode 模型目錄則將其記錄為封閉權重。沒有模型卡、沒有技術報告、沒有授權條款、沒有廠商公布的參數表,也沒有任何獨立評測:截至 9 月 27 日,Artificial Analysis 上沒有 LongCat-2.5-Preview 的頁面。
Qwen3.8-Max 幾乎在每個方面都是相反的例子。它於 2026 年 8 月 3 日正式全面推出,並附有公開的價目表,而阿里巴巴則於 9 月 2 日發布了具名的更新版本 Qwen3.8-Max-0902。Artificial Analysis 對它進行了實測:智慧指數 45.4,在 145 個模型中排名第 15,程式設計指數 76.2,在 138 個模型中排名第 9。它繳出的成績為 GPQA Diamond 92.8%、Humanity's Last Exam 43.1%、SciCode 52.1%、Long-Context Recall 80.3%、Terminal-Bench 2.1 達 88.8%,以及 τ-bench banking 為 47.8%。這是一個經過實測的模型,每一個數字都有憑據。
所以,對證據欄位所做的誠實總結呈現出一種失衡,而這與能力毫無關係。這些模型當中,有一個能在你投入之前先受到評估。另一個則只能靠實際試用。
費率卡,逐行說明
兩者都是百萬 token 模型,且輸出上限相同,因此規格表恰好會在最不需要規格表的地方趨於一致:
• 未快取輸入 — LongCat-2.5-Preview 每 1M $0.30,對比 Qwen3.8-Max 每 1M $2.00,相差 6.7 倍。
• 快取輸入 — 每 1M $0.006,對比每 1M $0.25,差距達 41.7 倍。
• 輸出 — 每 1M $1.20 對比每 1M $6.00,相差 5 倍。
• 上下文視窗 — 1,048,576 個 token 對上 1,000,000 個 token。功能上算是平分秋色。
• 最大輸出 — 兩者皆為 131,072 個 token。完全相同。
• 獨立評分——無公開評分 vs AA Intelligence 45.4 與 AA Coding 76.2。
那裡的每一項 LongCat 數據都來自 Meituan 自家的定價頁面,而該頁面將整個欄位標示為「折扣價(限時)」。Qwen3.8-Max 的數據則是 Alibaba 的標準定價,讀自我們自家的模型卡,其中快取讀取為每百萬 $0.25,快取寫入為每百萬 $2.50。Artificial Analysis 的快照日期為 2026 年 9 月 2 日。
快取輸入那一列是最該緊盯的。快取讀取出現 42 倍差距,是這項比較中最大的單一數字,而且它正落在代理工作負載實際所處的維度上。一個每回合都重新傳送 100,000 token 系統提示與工具結構描述的代理迴圈,其大多數 token 支付的是快取費率,而不是公告的輸入費率。
一次 150,000 個 token 的呼叫,兩種計價方式
以一個合理的代理型請求為例:150,000 個輸入 token,其中 50,000 個由快取提供,以及 4,000 個 token 的回答。以美團的折扣費率計算,該次呼叫費用為 $0.0501。以 Qwen3.8-Max 的定價表費率計算,完全相同的一次呼叫費用為 $0.3365——高出 6.7 倍,也就是每天一千次呼叫時,$50 對上 $337。若將組合推向全快取,也就是重複提示詞的穩態,比例則擴大至 12.3 倍:每次呼叫 $0.006 對上 $0.074。
那套算術裡沒有任何一點取決於 LongCat-2.5-Preview 好不好。這正是問題所在。對方提供給你的倍數是真實的,而供應商自家頁面上緊接著它的字眼是「限時」,既沒有結束日期,也沒有標示後續價格。一個未公布截止日的 6.7× 折扣,是你無法放進計畫裡的預算項目;它是一個你得盯著的預算項目。
還有一個路由上的不對稱值得直說。Qwen3.8-Max 是我們有提供的一條路由——qwen/qwen3.8-max以及鎖定版本的qwen/qwen3.8-max-0902——採用阿里定價、零加成,所以供應商一調價,當天就會落到我們這邊,而不是拖上好幾週。LongCat-2.5-Preview 並不是我們提供的路由,我們也不會假裝它是;在這項比較的便宜那一端,你面對的是美團自家的 API,以及你用來存取它的任何平台。
Meituan 自家 API 所反駁的那一項主張
對於任何工作負載不全是純文字的人來說,這項發現應該足以決定這場對決的結果。
美團的更新日誌將圖像理解列為 2.5 代的重點新增功能:「多模態理解:全新的圖像理解能力,能夠解析圖像內容,支援跨模態問答、內容摘要,以及複雜視覺推理。」X 貼文則說「原生多模態」。這些都是廠商說法,而單就這些說法本身而言,將它們納入決策考量也屬合理。
接著,同一個文件網站發布了取得該模型自身中介資料的範例回應,而它傳回的模型是純文字的。針對 id「LongCat-2.5-Preview」,其酬載顯示context_length: 1048576,input_modalities: ["text"],output_modalities: ["text"],以及模態字串text->text。沒有圖像項目。這不是在舊快照裡——而是在記錄該端點的那個頁面上的實作範例中。
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
那並不能證明這個模型看不見。它證明的是:供應商尚未讓自家的文字敘述與自家 API schema 相互一致;而這也意味著,在有人把這件事講清楚之前,買方無法拿那句 changelog 的敘述來核銷一筆視覺工作負載。把它和另一邊並列來看:我們的目錄列出 Qwen3.8-Max 可接受文字、圖像與視訊輸入,視覺能力也列在其宣告的能力之中,而且這個模型背後還有一份獨立的基準測試表。如果你的任務是文件理解、螢幕截圖分流,或視訊影格分析,那麼昂貴的那一欄是輸入模態已經過驗證的,便宜的那一欄則是輸入模態尚未釐清的。僅僅那一列,就可能把整個 6.7× 抹平。
什麼無法釘選到 Preview
阿里巴巴發布帶日期的快照版本。qwen/qwen3.8-max-0902是一個具名、凍結的建置版本,價格與基礎模型同為 $2/$6,這意味著指名它的路由規則在下個月仍會回傳相同的權重。行為變更會以全新的 id 推出,你可以依自己的時程採用。
LongCat-2.5-Preview 並沒有這種代稱。模型 ID 就是預覽版 ID,沒有快照後綴,平台上沒有版本歷程,也沒有更新日誌條目能告訴你權重已經變動——只會說折扣是「限時」的。它是普通意義上的預覽版:掛在這個名稱下的東西允許變更,而你會從自己的輸出發現,而不是從發行說明得知。
購買那份缺失證據最便宜的方法,是 Meituan 在這件事另一面打開的窗口:OpenCode 將 LongCat-2.5-Preview 列為限時免費,供應商遵循零保留政策,也不會用你的資料進行訓練,並於 9 月 26 日表示這個窗口為期兩週。免費輸入、免費輸出、免費快取讀取。這是建立那份沒有人發表過的基準表的正當方法——拿你自己的評估語料庫對它跑一遍,你就能得到一個數字,而供應商只給了你一句話。但它不是一個你能據以規劃的價格:兩週會結束,而它另一面的數字由 Meituan 決定。
誰應該選哪個
當工作負載本身就是你一開始要買這個模型的理由時,就該選用 Qwen3.8-Max。如果輸入是圖像或影片,如果答案必須在每次建置之間都可重現,如果獨立索引是採購上的必要條件,或者任務正是 Terminal-Bench 與 Coding Index 所代表的那類代理式編碼,那麼 6.7× 就是讓你能夠查核自身工作的代價。在其中一個金鑰上,它還排在一條備援鏈之後,因此已評分的模型可以替未評分的模型吸收不順的一天,而你不需要維護兩套整合。

當工作負載是高流量、短上下文、純文字且屬於內部用途——分類、擷取、摘要、大量改寫——而且出錯的代價只是重試而非流失客戶時,就選用 LongCat-2.5-Preview。在這種情況下,快取輸入這一項不是折扣,而是整項工作的全部經濟效益所在,而 42× 這個數字值得你花力氣去測量。利用免費窗口來產出那份目前不存在的基準測試。不要把關鍵路徑遷移到它上面。
什麼會改變這項判定,按權重排序:對 LongCat-2.5-Preview 的獨立評測;折扣的公布結束日期與後續價格;附有日期快照的版本歷史;以及釐清模態清單是否僅限文字。其中任何一項,都會讓便宜的那一欄不只是折扣。在至少有一項落實之前,這項比較並不是兩個模型之間的對決——而是你能驗證的價格與你無法驗證的能力之間的對決。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
