
Mercury 2.5 對比 Mercury 2.5 Preview:一個擴散模型,兩個發布日期
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
這是一場正面交鋒,而兩個競爭者共享同一張模型卡。Inception 的 Mercury 2.5 Preview 於 2026 年 8 月 31 日發布,Mercury 2.5 於 2026 年 9 月 8 日發布,兩者是相隔八天的同一個擴散語言模型:一個是 Inception 向開發者開放的預覽頻道,另一個則是一週後推出的「企業級」生產版本。Inception 並未公布 Mercury 2.5 有不同 checkpoint、不同速度數據或不同價格——而兩次公告之間確實有變動的數字,看起來像是整理修正,而非新模型。上下文長度從預覽頁的 256K 在發布時修正為 260K,而相較於 Mercury 2 的智慧提升,也從「超過 10 個百分點」(預覽資料)改寫為「40%」(發布資料)。引擎、每秒 1,107 個 token 的宣稱,以及價目表都完全相同。所以這不是一般的規格表對決,硬要灌水一方是不誠實的。這兩個名字之間真正重要的比較在於包裝與時機:正式發布實際改變了什麼、Preview 標籤真正想告訴你什麼,以及你的 API 呼叫現在應該使用哪一個名字。
為什麼模型要與自身進行比較
廠商通常會先推出模型的預覽版,然後悄悄將其併入主名稱;預覽版的獨立條目就此消失,也沒有人記錄這場對比。Inception 反而讓兩個名稱並行了一整個星期,而預覽版的身分直到現在才正式退役——這正是這場比較有內容可寫的原因。Preview 是 Inception 用來將其擴散模型押注快速推到開發者面前的捷徑。它於 8 月 31 日上線,所附的規格表正是如今 Mercury 2.5 的規格表:一種擴散式 LLM(dLLM),能以並行方式生成並精煉多個 token 區塊,而非一次只輸出一個 token;號稱在標準 GPU 上可達每秒 1,107 個 token;號稱首次輸出時間(time-to-first-token)低於 300 毫秒;具有 260K token 的上下文視窗與 65,536 token 的輸出長度;可調的推理等級;原生工具使用、平行工具呼叫與結構化輸出。上述每一項數據都是 Inception 自己提出的,而在 Preview 推出之際,尚無任何獨立實驗室實際量測過該模型。
9月8日,Inception推出了Mercury 2.5,稱其為「擴散式大型語言模型的下一代智慧等級」,也是其迄今生產環境中速度最快的推理模型——具備企業就緒能力,瞄准語音代理、程式設計子代理、企業搜尋與支援工作負載。規格相同、定位相同、價格表也相同。此次發表還預覽了兩個兄弟產品,清楚揭示Inception的未來方向:Mercury Voice是一款針對語音代理調整至低於170毫秒首個token的dLLM;Mercury Router則依品質、速度與成本,在各種模型間路由提示。Mercury 2.5是此家族的旗艦,專為延遲敏感、代理式工作負載而打造,而非追求前沿品質等級。
9月8日的發布實際上改變了什麼
逐行比較這兩個名稱,差異不在於引擎本身——而在於引擎外圍的一切:
• 狀態 — Mercury 2.5 預覽版:一種封閉式預覽版,可能「變更行為或可用性」。Mercury 2.5:正式發布的生產版本,以企業級就緒承諾推出,並提供銷售通路及標註日期的生產資訊。
• 身分:Inception 的模型頁面現在列出 Mercury 2.5、Mercury Voice 與 Mercury Router,Preview 已不復見;其支援頁面的註腳則點名 Mercury 1、Mercury 2 與 Mercury Edit 2 是仍會為現有客戶提供支援的模型。Preview 並未出現在任何一份清單中。就供應商而言,preview 標籤已被併入 Mercury 2.5。
• 端點 — Inception 的開發者平台以 mercury-2.5 提供此模型;9 月 8 日上線的正式項目才是新流量所服務的對象。在 8 月底最初刊登 Preview 的型錄中,Preview 名稱現在已不再解析到任何線上服務端點,而 9 月 8 日新增的 Mercury 2.5 項目則負責回應。任何以 Preview 名稱進行串接的人,都應改指向 Mercury 2.5,並確認自家供應商實際的計費方式——你第一週整合所用的 id 正是即將退役的那一個。
• 價格——相同清單、相同折扣。兩者皆為每百萬輸入代幣 $0.20、每百萬輸出代幣 $0.75,快取輸入為 $0.02;而且兩者上線時均約為原價的二折:$0.04 / $0.15,快取 $0.004。Preview 的折扣明確限制至 9 月 8 日為止;Mercury 2.5 上線時也提供相同的 80% 折扣方案,而截至本文撰寫時,其正式版頁面顯示的仍是折扣後的價格。這就是陷阱,詳見下文解析。
• 新手引導——正式版上線為新的開發者帳戶新增了免費 Token 額度——發布資料列明 1 億個 Token——並開放了預覽版從未提供的企業聯絡管道。
• 證據 — 沒有變化。兩個名稱都沒有獨立的基準測試成績,而廠商的宣稱也只是同一套說法配上略為不同的措辭:預覽資料中「領先 Mercury 2 超過 10 分」的智慧躍升,在發布資料裡變成「40%」的提升,同時仍是同樣宣稱與成本最佳化的前沿等級持平(低強度模式的 GPT-5.6 Luna、Gemini 3.5 Flash-Lite、Claude Haiku 4.5),並同樣給出廠商自行回報的 GPQA Diamond 79% 與 IFBench 77%。重述的宣稱不等於經過驗證的宣稱。

配對核心的定價陷阱
由於這兩個名稱的牌價相同,也都同樣以 80% 的折扣作為促銷誘因,一般人很容易就以為它們的收費永遠一樣。其實不一定。Preview 的折扣在 9 月 8 日硬性截止;Mercury 2.5 的上市折扣則另起新的時鐘計時。整整一週內,你完全可能每次呼叫 Preview 都要付 $0.20 / $0.75,而同一引擎掛上正式名稱回應時,卻只收 $0.04 / $0.15——或者更可能的是,你用的是某個早已悄悄停止服務的 preview id,帳單卻照樣寄來。這種按 endpoint 到期失效的上市折扣,正是那種把「同一個模型、同一個價格」的說法變成實際成本差異的小字條款。
真正持久的數字是牌價,真正持久的建議是以它來編列預算:每百萬 $0.20 / $0.75,快取輸入 $0.02——對於擁有 260K 上下文的推理模型而言算是便宜,而且明顯低於旗艦級,但並非發佈橫幅所宣傳的 $0.04 / $0.15。請把折扣價視為有期限的試駕價格;務必確認你的供應商是依程式碼中的確切模型 ID 計費,而不是依行銷頁面上的名稱計費。如果你是在 Preview 階段導入,請在到期或已退役的端點替你作主之前,遷移到 Mercury 2.5。
這也正是路由層存在所要消除的問題類型。一個模型路由器在轉傳供應商牌價時採用0%加成,因此顯示的價格就是廠商實際收取的費用;此價格會在上市折扣生效或到期當天更新,且當底層端點退役時,自動容錯移轉能讓呼叫持續不中斷。截至撰寫本文,Mercury 2.5 尚未在 OrcaRouter 上架——Inception 正透過自家 API 與數個第三方平台提供此模型——因此目前該費率的權威來源是廠商的模型頁面。一旦供應商上架該模型,那些轉傳機制就能以單一金鑰取得;降價或折扣到期也會在宣布當天同步顯示在我們這端。
這兩個名稱共有的證據問題
這對組合的誠實成績單很短,因為兩欄是同一個模型,同樣缺乏實證。截至2026年9月9日,Mercury 2.5和Mercury 2.5 Preview都沒有獨立的指數分數、可重現的運行結果,或競技場排名。Inception自身的宣稱——相較於Mercury 2的智慧躍升、與Haiku 4.5層級的對等、79%的GPQA Diamond、每秒1,107個token——都只是該公司的片面之詞,而且由於模型完全相同,這兩個名稱下的說詞也完全一致。
此模型系列中唯一一項獨立證據,指出了該如何解讀這個速度宣稱。Artificial Analysis 在正式環境端點上量測前代 Mercury 2,結果為每秒 684 個 token,在 Intelligence Index 上得分 22——確實很快,也證明了擴散式方法並非海市蜃樓,但距離 Inception 對該模型在 Blackwell 硬體上宣稱的每秒約 1,000 個 token 仍相去甚遠。預期 Mercury 2.5 的 1,107 這個數字,與共享、多租戶端點在真實負載下實際提供的速度之間,也存在類似差距。同樣的謹慎也適用於品質方面:一個全新的擴散模型若僅由製造商自行量測,就不應輕信其宣稱可媲美 Claude Haiku 4.5,除非有第三方實際跑過。

開始追蹤這次發佈的指標平台,恰好反映了目前的現況。9月8日發布的 BenchLM 記錄中,Mercury 2.5 沒有公開分數,也沒有公開排名;該記錄載明了 Inception 的 79% GPQA Diamond 與 77% IFBench 數據,並明確標示為供應商自行回報,同時指出尚未測量其獨立執行速度。第一個 Artificial Analysis 指數條目、一個 LMArena 排名,或一次重現的 GPQA 測試,都會讓 Mercury 2.5 從一項宣稱轉變為可比較的對象——而這將同時適用於兩個名稱,因為只有一個模型需要被測量。

你應該稱呼哪個名字?
• 全新整合,沒有舊版包袱:請呼叫 Mercury 2.5,並忽略 Preview。正式名稱具備相同的引擎、目前相同的折扣、企業條款,並保證它就是供應商實際提供的 id。Preview 只會增加不穩定性的風險,別無其他。
• 若你已整合 Preview,今天就檢查你的供應商以該名稱提供的是什麼,以及它為此收取多少費用。將你的用戶端重新指向 Mercury 2.5 的 id,並確認費率。在正式環境的程式碼中保留 Preview 這個名稱,如今等於是在賭一個明確設定時限的預覽通道,能撐過自己的退役時間。
• 企業級或生產關鍵流量:透過 Inception 的企業路徑使用 Mercury 2.5,而非採用背後無任何承諾的預覽標籤。語音與路由需求則分別指向 Mercury Voice 與 Mercury Router,而這兩者本身目前仍為預覽版。
• 任何要評估擴散層級的人:這兩個名稱其實是相同的評估目標,因此只要針對 Mercury 2.5 執行一次評測,結果便可視為適用於整個模型系列。請以定價編列預算,並在獨立評測分數出爐前,把廠商的宣稱當作假設看待。
看什麼
接下來幾週,有三件事將決定這組配對的走向。第一,第一個獨立基準測試——例如某個指數排名,或是重現的 GPQA 或 AIME 測試——這會檢驗那個構成整個商業賭注的「效能等同」宣稱。第二,Preview 這個身分是否會像 Inception 自家模型頁面已暗示的那樣,從模型生態系統中完全消失。第三,在 Preview 所繫的那個 9 月 8 日時間點已過之後,80% 的上市折扣會如何發展:若延長,Mercury 2.5 在價格結構上就會顯得便宜;若回彈到 $0.20 / $0.75,則只是具競爭力而已。在那之前,「Mercury 2.5 還是 Mercury 2.5 Preview?」的正確答案是:它們是同一個模型,而你應該呼叫仍屬正式產品的那一個。
