「Mercury 2.5 vs Mercury 2.5 Preview」的主視覺標題卡,副標題為「同一個擴散模型,兩個發佈日期——正式版升級實際改變了什麼」。其下有三個標籤:標示「相同引擎」的分欄圖示、標示「宣稱 1,107 tok/s」的閃電圖示,以及標示「8月31日 vs 9月8日」的時鐘圖示。OrcaRouter 標誌位於右下角。
Guides & Insights

Mercury 2.5 對比 Mercury 2.5 Preview:一個擴散模型,兩個發布日期

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這是一場正面交鋒,而兩個競爭者共享同一張模型卡。Inception 的 Mercury 2.5 Preview 於 2026 年 8 月 31 日發布,Mercury 2.5 於 2026 年 9 月 8 日發布,兩者是相隔八天的同一個擴散語言模型:一個是 Inception 向開發者開放的預覽頻道,另一個則是一週後推出的「企業級」生產版本。Inception 並未公布 Mercury 2.5 有不同 checkpoint、不同速度數據或不同價格——而兩次公告之間確實有變動的數字,看起來像是整理修正,而非新模型。上下文長度從預覽頁的 256K 在發布時修正為 260K,而相較於 Mercury 2 的智慧提升,也從「超過 10 個百分點」(預覽資料)改寫為「40%」(發布資料)。引擎、每秒 1,107 個 token 的宣稱,以及價目表都完全相同。所以這不是一般的規格表對決,硬要灌水一方是不誠實的。這兩個名字之間真正重要的比較在於包裝與時機:正式發布實際改變了什麼、Preview 標籤真正想告訴你什麼,以及你的 API 呼叫現在應該使用哪一個名字。

為什麼模型要與自身進行比較

廠商通常會先推出模型的預覽版,然後悄悄將其併入主名稱;預覽版的獨立條目就此消失,也沒有人記錄這場對比。Inception 反而讓兩個名稱並行了一整個星期,而預覽版的身分直到現在才正式退役——這正是這場比較有內容可寫的原因。Preview 是 Inception 用來將其擴散模型押注快速推到開發者面前的捷徑。它於 8 月 31 日上線,所附的規格表正是如今 Mercury 2.5 的規格表:一種擴散式 LLM(dLLM),能以並行方式生成並精煉多個 token 區塊,而非一次只輸出一個 token;號稱在標準 GPU 上可達每秒 1,107 個 token;號稱首次輸出時間(time-to-first-token)低於 300 毫秒;具有 260K token 的上下文視窗與 65,536 token 的輸出長度;可調的推理等級;原生工具使用、平行工具呼叫與結構化輸出。上述每一項數據都是 Inception 自己提出的,而在 Preview 推出之際,尚無任何獨立實驗室實際量測過該模型。

9月8日,Inception推出了Mercury 2.5,稱其為「擴散式大型語言模型的下一代智慧等級」,也是其迄今生產環境中速度最快的推理模型——具備企業就緒能力,瞄准語音代理、程式設計子代理、企業搜尋與支援工作負載。規格相同、定位相同、價格表也相同。此次發表還預覽了兩個兄弟產品,清楚揭示Inception的未來方向:Mercury Voice是一款針對語音代理調整至低於170毫秒首個token的dLLM;Mercury Router則依品質、速度與成本,在各種模型間路由提示。Mercury 2.5是此家族的旗艦,專為延遲敏感、代理式工作負載而打造,而非追求前沿品質等級。

9月8日的發布實際上改變了什麼

逐行比較這兩個名稱,差異不在於引擎本身——而在於引擎外圍的一切:

狀態 — Mercury 2.5 預覽版:一種封閉式預覽版,可能「變更行為或可用性」。Mercury 2.5:正式發布的生產版本,以企業級就緒承諾推出,並提供銷售通路及標註日期的生產資訊。

身分:Inception 的模型頁面現在列出 Mercury 2.5、Mercury Voice 與 Mercury Router,Preview 已不復見;其支援頁面的註腳則點名 Mercury 1、Mercury 2 與 Mercury Edit 2 是仍會為現有客戶提供支援的模型。Preview 並未出現在任何一份清單中。就供應商而言,preview 標籤已被併入 Mercury 2.5。

端點 — Inception 的開發者平台以 mercury-2.5 提供此模型;9 月 8 日上線的正式項目才是新流量所服務的對象。在 8 月底最初刊登 Preview 的型錄中,Preview 名稱現在已不再解析到任何線上服務端點,而 9 月 8 日新增的 Mercury 2.5 項目則負責回應。任何以 Preview 名稱進行串接的人,都應改指向 Mercury 2.5,並確認自家供應商實際的計費方式——你第一週整合所用的 id 正是即將退役的那一個。

價格——相同清單、相同折扣。兩者皆為每百萬輸入代幣 $0.20、每百萬輸出代幣 $0.75,快取輸入為 $0.02;而且兩者上線時均約為原價的二折:$0.04 / $0.15,快取 $0.004。Preview 的折扣明確限制至 9 月 8 日為止;Mercury 2.5 上線時也提供相同的 80% 折扣方案,而截至本文撰寫時,其正式版頁面顯示的仍是折扣後的價格。這就是陷阱,詳見下文解析。

新手引導——正式版上線為新的開發者帳戶新增了免費 Token 額度——發布資料列明 1 億個 Token——並開放了預覽版從未提供的企業聯絡管道。

證據 — 沒有變化。兩個名稱都沒有獨立的基準測試成績,而廠商的宣稱也只是同一套說法配上略為不同的措辭:預覽資料中「領先 Mercury 2 超過 10 分」的智慧躍升,在發布資料裡變成「40%」的提升,同時仍是同樣宣稱與成本最佳化的前沿等級持平(低強度模式的 GPT-5.6 LunaGemini 3.5 Flash-LiteClaude Haiku 4.5),並同樣給出廠商自行回報的 GPQA Diamond 79% 與 IFBench 77%。重述的宣稱不等於經過驗證的宣稱。

A two-column comparison card titled 'Mercury 2.5 Preview vs Mercury 2.5 — what actually changed'. Left column 'Mercury 2.5 Preview, released Aug 31, 2026': Release Aug 31, 2026; Status closed preview; Engine diffusion dLLM, 260K ctx; Serving preview id retired from the catalog; Price $0.20/$0.75 list, 80% off intro; Evidence none independent. Right column 'Mercury 2.5, released Sep 8, 2026': Release Sep 8, 2026; Status production, enterprise-ready; Engine same, no new checkpoint disclosed; Serving mercury-2.5 id live, serving traffic; Price $0.20/$0.75 list, 80% off launch; Evidence none independent. Footer reads 'Same engine under two labels — the delta is lifecycle, not spec. All figures vendor-reported.' The OrcaRouter logo is in the bottom-right corner.

配對核心的定價陷阱

由於這兩個名稱的牌價相同,也都同樣以 80% 的折扣作為促銷誘因,一般人很容易就以為它們的收費永遠一樣。其實不一定。Preview 的折扣在 9 月 8 日硬性截止;Mercury 2.5 的上市折扣則另起新的時鐘計時。整整一週內,你完全可能每次呼叫 Preview 都要付 $0.20 / $0.75,而同一引擎掛上正式名稱回應時,卻只收 $0.04 / $0.15——或者更可能的是,你用的是某個早已悄悄停止服務的 preview id,帳單卻照樣寄來。這種按 endpoint 到期失效的上市折扣,正是那種把「同一個模型、同一個價格」的說法變成實際成本差異的小字條款。

真正持久的數字是牌價,真正持久的建議是以它來編列預算:每百萬 $0.20 / $0.75,快取輸入 $0.02——對於擁有 260K 上下文的推理模型而言算是便宜,而且明顯低於旗艦級,但並非發佈橫幅所宣傳的 $0.04 / $0.15。請把折扣價視為有期限的試駕價格;務必確認你的供應商是依程式碼中的確切模型 ID 計費,而不是依行銷頁面上的名稱計費。如果你是在 Preview 階段導入,請在到期或已退役的端點替你作主之前,遷移到 Mercury 2.5。

這也正是路由層存在所要消除的問題類型。一個模型路由器在轉傳供應商牌價時採用0%加成,因此顯示的價格就是廠商實際收取的費用;此價格會在上市折扣生效或到期當天更新,且當底層端點退役時,自動容錯移轉能讓呼叫持續不中斷。截至撰寫本文,Mercury 2.5 尚未在 OrcaRouter 上架——Inception 正透過自家 API 與數個第三方平台提供此模型——因此目前該費率的權威來源是廠商的模型頁面。一旦供應商上架該模型,那些轉傳機制就能以單一金鑰取得;降價或折扣到期也會在宣布當天同步顯示在我們這端。

這兩個名稱共有的證據問題

這對組合的誠實成績單很短,因為兩欄是同一個模型,同樣缺乏實證。截至2026年9月9日,Mercury 2.5和Mercury 2.5 Preview都沒有獨立的指數分數、可重現的運行結果,或競技場排名。Inception自身的宣稱——相較於Mercury 2的智慧躍升、與Haiku 4.5層級的對等、79%的GPQA Diamond、每秒1,107個token——都只是該公司的片面之詞,而且由於模型完全相同,這兩個名稱下的說詞也完全一致。

此模型系列中唯一一項獨立證據,指出了該如何解讀這個速度宣稱。Artificial Analysis 在正式環境端點上量測前代 Mercury 2,結果為每秒 684 個 token,在 Intelligence Index 上得分 22——確實很快,也證明了擴散式方法並非海市蜃樓,但距離 Inception 對該模型在 Blackwell 硬體上宣稱的每秒約 1,000 個 token 仍相去甚遠。預期 Mercury 2.5 的 1,107 這個數字,與共享、多租戶端點在真實負載下實際提供的速度之間,也存在類似差距。同樣的謹慎也適用於品質方面:一個全新的擴散模型若僅由製造商自行量測,就不應輕信其宣稱可媲美 Claude Haiku 4.5,除非有第三方實際跑過。

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the predecessor Mercury 2.5 builds on, showing its Intelligence Index score of 22, its independently measured output speed of 684 tokens per second, its $0.25 input / $0.75 output pricing, and its 128K context window.

開始追蹤這次發佈的指標平台,恰好反映了目前的現況。9月8日發布的 BenchLM 記錄中,Mercury 2.5 沒有公開分數,也沒有公開排名;該記錄載明了 Inception 的 79% GPQA Diamond 與 77% IFBench 數據,並明確標示為供應商自行回報,同時指出尚未測量其獨立執行速度。第一個 Artificial Analysis 指數條目、一個 LMArena 排名,或一次重現的 GPQA 測試,都會讓 Mercury 2.5 從一項宣稱轉變為可比較的對象——而這將同時適用於兩個名稱,因為只有一個模型需要被測量。

A screenshot of the BenchLM model record for Mercury 2.5 (captured September 9, 2026), showing 'No public score yet' and 'No public rank', the model noted as released September 8, 2026 with a 260K context window, and the decision note that Inception reports 79% on GPQA Diamond and 77% on IFBench as provider-reported results with independent runtime speed not yet measured.

你應該稱呼哪個名字?

全新整合,沒有舊版包袱:請呼叫 Mercury 2.5,並忽略 Preview。正式名稱具備相同的引擎、目前相同的折扣、企業條款,並保證它就是供應商實際提供的 id。Preview 只會增加不穩定性的風險,別無其他。

若你已整合 Preview,今天就檢查你的供應商以該名稱提供的是什麼,以及它為此收取多少費用。將你的用戶端重新指向 Mercury 2.5 的 id,並確認費率。在正式環境的程式碼中保留 Preview 這個名稱,如今等於是在賭一個明確設定時限的預覽通道,能撐過自己的退役時間。

企業級或生產關鍵流量:透過 Inception 的企業路徑使用 Mercury 2.5,而非採用背後無任何承諾的預覽標籤。語音與路由需求則分別指向 Mercury Voice 與 Mercury Router,而這兩者本身目前仍為預覽版。

任何要評估擴散層級的人:這兩個名稱其實是相同的評估目標,因此只要針對 Mercury 2.5 執行一次評測,結果便可視為適用於整個模型系列。請以定價編列預算,並在獨立評測分數出爐前,把廠商的宣稱當作假設看待。

看什麼

接下來幾週,有三件事將決定這組配對的走向。第一,第一個獨立基準測試——例如某個指數排名,或是重現的 GPQA 或 AIME 測試——這會檢驗那個構成整個商業賭注的「效能等同」宣稱。第二,Preview 這個身分是否會像 Inception 自家模型頁面已暗示的那樣,從模型生態系統中完全消失。第三,在 Preview 所繫的那個 9 月 8 日時間點已過之後,80% 的上市折扣會如何發展:若延長,Mercury 2.5 在價格結構上就會顯得便宜;若回彈到 $0.20 / $0.75,則只是具競爭力而已。在那之前,「Mercury 2.5 還是 Mercury 2.5 Preview?」的正確答案是:它們是同一個模型,而你應該呼叫仍屬正式產品的那一個。