
Mercury 2.5 Preview 對比 Gemini 3.1 Pro:相隔六個月的兩款預覽版
- google新Google: Gemini 3.8 Flash2026-09-0259智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
這場對決中的兩個模型名稱都帶有「preview」這個字,而相似之處僅止於此。Mercury 2.5 Preview 和 Gemini 3.1 Pro 都是目前可透過 API 呼叫的推理模型,但它們分別處於預覽生命週期的兩端。Gemini 3.1 Pro 是旗艦推理模型,自 2026 年 2 月 19 日起就處於預覽階段——背後累積了六個月的獨立評測、公開排行榜名次與正式環境流量,推出時的 Artificial Analysis 智能指數為 57,支援文字、影像、音訊和影片的多模態輸入,具備 100 萬 token 的上下文長度,每百萬 token 定價 2.00 / 12.00 美元。Mercury 2.5 Preview 是 Inception 推出的擴散式 LLM,於 2026 年 8 月 31 日發布,目前才兩天大:僅支援文字的模型,上下文長度 256K,宣稱每秒可處理 1,107 個 token,標價為每百萬 token 0.20 / 0.75 美元(在 9 月 8 日前的折扣方案下約為 0.04 / 0.15 美元),而且沒有任何一項獨立基準測試。將兩者都稱為「preview」掩蓋了真正的問題:與一種本質上更快的文字生成方式相比,六個月的實證領先優勢究竟值多少。
每個模型實際上是什麼
Gemini 3.1 Pro 是一款封閉式、多模態、通用推理的旗艦模型。它能讀取文字、圖像、音訊和影片,支援 1M token 的上下文視窗,輸出上限為 64K,並動態調整推理深度——供應商描述了一種隨任務複雜度擴展的四層推理強度。其發布數據——ARC-AGI-2 77.1%、GPQA Diamond 94.3%、SWE-bench Verified 80.6%、Terminal-Bench 2.0 68.5%——皆為供應商自行報告,但這些數據建立在六個月的獨立審視之上,包括 Artificial Analysis 在更嚴格的指標量表上進行的重新測量,該模型得分約為 46.5。這種重新測量正是一個成熟模型應得的:它已受到足夠嚴格的測試,以至於指標也隨之變得更嚴格。Mercury 2.5 Preview 是一款擴散模型——它並行生成與精煉 token,而非逐一生成——具備可調推理、平行工具呼叫和符合 schema 的 JSON,專為 Inception 所指名的延遲疊加型工作負載而打造:搜尋代理、語音管線、編碼子代理。關於它的每一項品質聲明,包括比 Mercury 2 高出 10 分以上的躍升,均為供應商自己的說法,尚無第三方對其進行過測量。

規格對比
• 價格 — Mercury 2.5 預覽版:每 1M 輸入/輸出 $0.20 / $0.75,9 月 8 日前優惠價約 $0.04 / $0.15。Gemini 3.1 Pro:每 1M $2.00 / $12.00,超過 200K 輸入後調漲為 $4.00 / $18.00。
• 上下文 / 輸出 — Mercury 2.5 Preview:256K 上下文。Gemini 3.1 Pro:1M 上下文,64K 最大輸出。
• 輸入 — Mercury 2.5 Preview:僅文字。Gemini 3.1 Pro:文字、影像、音訊、影片、檔案。
• 架構 — Mercury 2.5 預覽版:擴散 LLM,並行 token 生成。Gemini 3.1 Pro:自迴歸,動態推理深度。
• 速度 — Mercury 2.5 預覽版:宣稱每秒 1,107 個 token。Gemini 3.1 Pro:沒有可相比的公開宣稱。
• 證據 — Mercury 2.5 Preview:僅供應商報告。Gemini 3.1 Pro:發布時 AA 指數 57(新制 46.5),加上長期的獨立評測記錄。

多模態差距是決定性的差異。
對大多數應用來說,這項比較在價格或基準測試進入考量之前就已見分曉,因為 Mercury 2.5 Preview 看不見。Gemini 3.1 Pro 能讀取螢幕截圖、圖表、音訊和影片——當你想針對尚未文字化的內容尋求解答時,你可以把 PDF、圖表、會議錄音或 UI 交給它。Mercury 2.5 Preview 在設計上僅限文字;作為一種並行產生文字的擴散語言模型,它根本沒有影像或音訊輸入路徑。對於文件密集型應用、視覺代理或任何多模態產品,Gemini 3.1 Pro 是這裡唯一的候選者,就此定案。Mercury 2.5 Preview 的僅限文字限制並非小字附註的但書;它正是決定該模型究竟有資格勝任哪些工作負載的界線。
六個月的測試對比兩天
就證據而言,這不是一場勢均力敵的較量,而且有必要直白說明原因。Gemini 3.1 Pro 已在過去六個月被獨立實驗室反覆檢視;它的分數被確認、重新量測、反覆辯論,這正是模型「可信賴」該有的樣貌。Mercury 2.5 Preview 只有一個資訊來源——也就是其製造商——而該來源宣稱其智慧表現比 Mercury 2 高出十個百分點以上,並與前沿模型成本優化等級相當。這兩項陳述可能都屬實。但除了 Inception 以外,沒有任何外部人士證實過,而這個模型太新了,所以這本就符合預期。兩者之間的不對稱不在於誰比較好,而在於一個是可以被認識的,另一個則還不行。
水星速度真正勝出的地方
關於 Mercury 2.5 Preview 的誠實論點範圍狹窄、純文字,而且真實。並行 token 生成改變了延遲的計算方式,這是任何自迴歸模型——包括 Gemini 3.1 Pro——都無法跟上的,因為自迴歸模型在本質上就是序列化的。對於語音管道來說,諷刺的是輸入和輸出都是音訊,但兩者之間的思考卻是文字:一個快速的文字推理層正是讓語音代理感覺反應靈敏的關鍵。對於一個反覆進行工具呼叫的搜尋代理,以及一個在每個任務中觸發多次小型完成的編碼子代理來說,每次呼叫的延遲會累積成感知速度。以首發價格——輸入 $0.04、輸出 $0.15——Mercury 2.5 Preview 大約比 Gemini 3.1 Pro 的標準輸出費率便宜 80 倍,這使它不僅更快,而且在大量文字推理方面屬於不同的成本等級。這些句子每一句都必須伴隨的警語是:速度是宣稱的,品質對等也是宣稱的,而且不存在任何獨立測量。
定價:Gemini 的長上下文高級方案對比 Mercury 的試探方案
Gemini 3.1 Pro 的價目表上有一個值得在比較主要數字之前先了解的細節:超過 200K 輸入 token 的請求,價格會從每百萬個 $2.00 / $12.00 跳到 $4.00 / $18.00。在 1M 上下文模型上,這種長上下文溢價並非邊緣案例——而是實際使用該模型聞名的視窗所需付出的代價。Mercury 2.5 Preview 沒有這種級距,而且其 256K 上下文通常不太會進入長上下文範圍。但 Mercury 的低價只是個將於 9 月 8 日到期的誘餌,而 Gemini 的價格則是穩定的公開定價。比較時,應以 Mercury 的牌價 $0.20 / $0.75 對比 Gemini 的標準方案,而非折價後的數字——折扣是激勵你試用的誘因,而不是規劃時應依據的價格。
路由決策
這兩種型號目前都已可路由,這改變了你應如何對待每一種。Gemini 3.1 Pro 在 OrcaRouter 上的名稱為 google/gemini-3.1-pro-preview,以供應商的列表價格轉售,加價幅度為 0% 加價,因此標準與長上下文等級的成本與供應商公布的完全相同,並與 200 多種其他模型共用一個 API 金鑰。預覽徽章正是那種應該繞過而非押注的東西——模型頁面上的錯誤率面板存在自有其道理,而且自動故障轉移意味著,效能降級的預覽回應會無需更改程式碼就路由到第二家供應商。Mercury 2.5 Preview 尚未登上 OrcaRouter;Inception 透過自己的 API 和數個第三方平台提供它。一個推出才兩天、還無法納入故障轉移的模型,是測試候選,不是生產依賴。當供應商將其列出當天,同樣的轉售規則便適用,首發折扣也會當天在此生效——屆時這場對決就會變成路由規則,而不是一項決策。
誠實的結論是,這兩個預覽版回答的是不同的問題。Gemini 3.1 Pro 回答的是「我今天應該把產品建在哪個模型上」——它具備多模態、長上下文、經獨立測試且穩定,而其價格也反映了這一切。Mercury 2.5 預覽版回答的是「文字推理在物理上能快到什麼程度」——而其速度架構正是這個模型中最引人注目的部分,有待獨立實驗室確認隨之而來的品質是否屬實。如果你的工作負載是多模態或長上下文,選擇早已明朗。如果是純文字、延遲會疊加、且對價格敏感的場景,Mercury 2.5 預覽版就是值得關注的賭注——而 9 月 8 日就是拿來對照檢驗的日子。

