「Mercury 2.5 Preview 對比 Gemini 3.1 Pro」的英雄標題卡,副標題為「兩個預覽版,相隔六個月」。左側面板標示「Mercury 2.5 Preview」,顯示一個閃電圖示、一個「256K 上下文」膠囊標籤、一個「僅限文字」標籤,以及一個「$0.04 入門價」膠囊標籤;右側面板標示「Gemini 3.1 Pro」,顯示一組多模態圖示(圖片、音訊、影片)、一個「1M 上下文」膠囊標籤、一個「AA Index 57(上市時)」徽章,以及一個「$2.00 / $12.00」膠囊標籤。兩者之間有一個細長的「vs」徽章。OrcaRouter 標誌合成於右下角。
Guides & Insights

Mercury 2.5 Preview 對比 Gemini 3.1 Pro:相隔六個月的兩款預覽版

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這場對決中的兩個模型名稱都帶有「preview」這個字,而相似之處僅止於此。Mercury 2.5 Preview 和 Gemini 3.1 Pro 都是目前可透過 API 呼叫的推理模型,但它們分別處於預覽生命週期的兩端。Gemini 3.1 Pro 是旗艦推理模型,自 2026 年 2 月 19 日起就處於預覽階段——背後累積了六個月的獨立評測、公開排行榜名次與正式環境流量,推出時的 Artificial Analysis 智能指數為 57,支援文字、影像、音訊和影片的多模態輸入,具備 100 萬 token 的上下文長度,每百萬 token 定價 2.00 / 12.00 美元。Mercury 2.5 Preview 是 Inception 推出的擴散式 LLM,於 2026 年 8 月 31 日發布,目前才兩天大:僅支援文字的模型,上下文長度 256K,宣稱每秒可處理 1,107 個 token,標價為每百萬 token 0.20 / 0.75 美元(在 9 月 8 日前的折扣方案下約為 0.04 / 0.15 美元),而且沒有任何一項獨立基準測試。將兩者都稱為「preview」掩蓋了真正的問題:與一種本質上更快的文字生成方式相比,六個月的實證領先優勢究竟值多少。

每個模型實際上是什麼

Gemini 3.1 Pro 是一款封閉式、多模態、通用推理的旗艦模型。它能讀取文字、圖像、音訊和影片,支援 1M token 的上下文視窗,輸出上限為 64K,並動態調整推理深度——供應商描述了一種隨任務複雜度擴展的四層推理強度。其發布數據——ARC-AGI-2 77.1%、GPQA Diamond 94.3%、SWE-bench Verified 80.6%、Terminal-Bench 2.0 68.5%——皆為供應商自行報告,但這些數據建立在六個月的獨立審視之上,包括 Artificial Analysis 在更嚴格的指標量表上進行的重新測量,該模型得分約為 46.5。這種重新測量正是一個成熟模型應得的:它已受到足夠嚴格的測試,以至於指標也隨之變得更嚴格。Mercury 2.5 Preview 是一款擴散模型——它並行生成與精煉 token,而非逐一生成——具備可調推理、平行工具呼叫和符合 schema 的 JSON,專為 Inception 所指名的延遲疊加型工作負載而打造:搜尋代理、語音管線、編碼子代理。關於它的每一項品質聲明,包括比 Mercury 2 高出 10 分以上的躍升,均為供應商自己的說法,尚無第三方對其進行過測量。

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the diffusion model Mercury 2.5 Preview builds on, showing its independently measured output speed of 684 tokens per second, its $0.25 / $0.75 per-1M pricing, its 128K context window, and its Intelligence Index score of 22.

規格對比

價格 — Mercury 2.5 預覽版:每 1M 輸入/輸出 $0.20 / $0.75,9 月 8 日前優惠價約 $0.04 / $0.15。Gemini 3.1 Pro:每 1M $2.00 / $12.00,超過 200K 輸入後調漲為 $4.00 / $18.00。

上下文 / 輸出 — Mercury 2.5 Preview:256K 上下文。Gemini 3.1 Pro:1M 上下文,64K 最大輸出。

輸入 — Mercury 2.5 Preview:僅文字。Gemini 3.1 Pro:文字、影像、音訊、影片、檔案。

架構 — Mercury 2.5 預覽版:擴散 LLM,並行 token 生成。Gemini 3.1 Pro:自迴歸,動態推理深度。

速度 — Mercury 2.5 預覽版:宣稱每秒 1,107 個 token。Gemini 3.1 Pro:沒有可相比的公開宣稱。

證據 — Mercury 2.5 Preview:僅供應商報告。Gemini 3.1 Pro:發布時 AA 指數 57(新制 46.5),加上長期的獨立評測記錄。

A two-column scoreboard titled 'Mercury 2.5 Preview vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mercury 2.5 Preview': 'Price: $0.20 / $0.75 (intro $0.04 / $0.15)', 'Inputs: text only', 'Context: 256K', 'Speed: 1,107 tok/s (claimed)', 'Independent score: none yet', 'Preview since: Aug 31, 2026'. Right column 'Gemini 3.1 Pro': 'Price: $2.00 / $12.00', 'Inputs: text, image, audio, video', 'Context: 1M', 'Speed: autoregressive', 'Independent score: AA Index 57 at launch', 'Preview since: Feb 19, 2026'. A footer reads 'Gemini index per Artificial Analysis; Mercury figures vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

多模態差距是決定性的差異。

對大多數應用來說,這項比較在價格或基準測試進入考量之前就已見分曉,因為 Mercury 2.5 Preview 看不見。Gemini 3.1 Pro 能讀取螢幕截圖、圖表、音訊和影片——當你想針對尚未文字化的內容尋求解答時,你可以把 PDF、圖表、會議錄音或 UI 交給它。Mercury 2.5 Preview 在設計上僅限文字;作為一種並行產生文字的擴散語言模型,它根本沒有影像或音訊輸入路徑。對於文件密集型應用、視覺代理或任何多模態產品,Gemini 3.1 Pro 是這裡唯一的候選者,就此定案。Mercury 2.5 Preview 的僅限文字限制並非小字附註的但書;它正是決定該模型究竟有資格勝任哪些工作負載的界線。

六個月的測試對比兩天

就證據而言,這不是一場勢均力敵的較量,而且有必要直白說明原因。Gemini 3.1 Pro 已在過去六個月被獨立實驗室反覆檢視;它的分數被確認、重新量測、反覆辯論,這正是模型「可信賴」該有的樣貌。Mercury 2.5 Preview 只有一個資訊來源——也就是其製造商——而該來源宣稱其智慧表現比 Mercury 2 高出十個百分點以上,並與前沿模型成本優化等級相當。這兩項陳述可能都屬實。但除了 Inception 以外,沒有任何外部人士證實過,而這個模型太新了,所以這本就符合預期。兩者之間的不對稱不在於誰比較好,而在於一個是可以被認識的,另一個則還不行。

水星速度真正勝出的地方

關於 Mercury 2.5 Preview 的誠實論點範圍狹窄、純文字,而且真實。並行 token 生成改變了延遲的計算方式,這是任何自迴歸模型——包括 Gemini 3.1 Pro——都無法跟上的,因為自迴歸模型在本質上就是序列化的。對於語音管道來說,諷刺的是輸入和輸出都是音訊,但兩者之間的思考卻是文字:一個快速的文字推理層正是讓語音代理感覺反應靈敏的關鍵。對於一個反覆進行工具呼叫的搜尋代理,以及一個在每個任務中觸發多次小型完成的編碼子代理來說,每次呼叫的延遲會累積成感知速度。以首發價格——輸入 $0.04、輸出 $0.15——Mercury 2.5 Preview 大約比 Gemini 3.1 Pro 的標準輸出費率便宜 80 倍,這使它不僅更快,而且在大量文字推理方面屬於不同的成本等級。這些句子每一句都必須伴隨的警語是:速度是宣稱的,品質對等也是宣稱的,而且不存在任何獨立測量。

定價:Gemini 的長上下文高級方案對比 Mercury 的試探方案

Gemini 3.1 Pro 的價目表上有一個值得在比較主要數字之前先了解的細節:超過 200K 輸入 token 的請求,價格會從每百萬個 $2.00 / $12.00 跳到 $4.00 / $18.00。在 1M 上下文模型上,這種長上下文溢價並非邊緣案例——而是實際使用該模型聞名的視窗所需付出的代價。Mercury 2.5 Preview 沒有這種級距,而且其 256K 上下文通常不太會進入長上下文範圍。但 Mercury 的低價只是個將於 9 月 8 日到期的誘餌,而 Gemini 的價格則是穩定的公開定價。比較時,應以 Mercury 的牌價 $0.20 / $0.75 對比 Gemini 的標準方案,而非折價後的數字——折扣是激勵你試用的誘因,而不是規劃時應依據的價格。

路由決策

這兩種型號目前都已可路由,這改變了你應如何對待每一種。Gemini 3.1 Pro 在 OrcaRouter 上的名稱為 google/gemini-3.1-pro-preview,以供應商的列表價格轉售,加價幅度為 0% 加價,因此標準與長上下文等級的成本與供應商公布的完全相同,並與 200 多種其他模型共用一個 API 金鑰。預覽徽章正是那種應該繞過而非押注的東西——模型頁面上的錯誤率面板存在自有其道理,而且自動故障轉移意味著,效能降級的預覽回應會無需更改程式碼就路由到第二家供應商。Mercury 2.5 Preview 尚未登上 OrcaRouter;Inception 透過自己的 API 和數個第三方平台提供它。一個推出才兩天、還無法納入故障轉移的模型,是測試候選,不是生產依賴。當供應商將其列出當天,同樣的轉售規則便適用,首發折扣也會當天在此生效——屆時這場對決就會變成路由規則,而不是一項決策。

誠實的結論是,這兩個預覽版回答的是不同的問題。Gemini 3.1 Pro 回答的是「我今天應該把產品建在哪個模型上」——它具備多模態、長上下文、經獨立測試且穩定,而其價格也反映了這一切。Mercury 2.5 預覽版回答的是「文字推理在物理上能快到什麼程度」——而其速度架構正是這個模型中最引人注目的部分,有待獨立實驗室確認隨之而來的品質是否屬實。如果你的工作負載是多模態或長上下文,選擇早已明朗。如果是純文字、延遲會疊加、且對價格敏感的場景,Mercury 2.5 預覽版就是值得關注的賭注——而 9 月 8 日就是拿來對照檢驗的日子。

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the model header, the Home > Models > Google breadcrumb, the February 19, 2026 preview start date, and the description of Google's frontier reasoning model.
© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube