
Grok 4.7 對決 Gemini 3.1 Pro:排行榜變了,模型沒變
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年2月19日,Artificial Analysis 發布了一篇標題為「Gemini 3.1 Pro Preview:AI 的新領導者」的文章。它在十項評估中領先了六項,並以四分領先 Claude Opus 4.6。今天閱讀同一模型的頁面,數字是 30,在 200 個模型中排名第六十九。供應商沒有改變任何東西。改變的是尺子:Artificial Analysis 在 2026年9月19日將其 Intelligence Index 修訂為 v4.3.2,根據不同的評估集對目錄中的每個模型重新評分,而二月的領導者在九月變成了中游選手,模型本身則在預覽中保持不變。這就是與 Grok 4.7 進行比較的背景——該模型由供應商於 2026年9月21日發布——這也是為什麼這場對決的重點不在於哪個模型更聰明,而在於這兩者中哪一個你還能指望它下個月還是同樣的東西。
這些各自實際上是什麼
Gemini 3.1 Pro 是 Google 最新的 Pro 等級模型,而且從未進入正式發行(general availability)階段。它以 gemini-3.1-pro-preview 的名稱於 2026 年 2 月 19 日推出,而 Google 的淘汰表中仍將它列為「未宣布關閉日期」——這個預覽版如今已在預覽狀態待了七個月,期間 Google 在其下推出了一整條 Flash 產品線:5 月的 3.5 Flash、7 月的 3.6、8 月的 3.7、9 月的 3.8。沒有任何比 Gemini 3 Pro 更新的 GA Pro 模型。它具備 1,048,576 個 token 的輸入視窗與 65,536 個 token 的輸出上限,可接受文字、圖像、影片、音訊與 PDF 輸入並輸出文字,並提供低、中、高三段思考層級控制,沒有預算參數,也沒有 minimal 設定。權重為封閉式。
Grok 4.7 問世僅一天,同樣屬於封閉權重模型。它支援 50 萬個 token 的上下文——是 Gemini 的一半——且僅接受文字與圖像輸入,因此完全無法處理影片或音訊,這也是本次比較中最鮮明的一項能力差異。其定價為:提示 token 數低於 20 萬時,每百萬輸入 token 收費 2.00 美元、每百萬輸出 token 收費 6.00 美元;超過這條線則調升至 4.00 美元與 12.00 美元;快取讀取則為 0.50 美元與 1.00 美元。xAI 另外還列出一款更快的版本,輸出速度約為兩倍,價格也約為兩倍。在此查閱的說明文件中,並未公布它的最大輸出量數字。
尺子移動了。故事就是這樣。
兩個模型目前都依據 Artificial Analysis Intelligence Index v4.3.2 進行評分;該指數以 Terminal-Bench 4.0 取代 Terminal-Bench 2.1,並以 AutomationBench-AA 取代 tau3-Banking,同時重新錨定 GDPval-AA Elo 量表。每個模型納入時,其數值都出現變動。Gemini 3.1 Pro 的變動幅度比大多數模型更大,因為它在二月的強項集中在這個新指數不是已淘汰、就是已重新加權的評測上。今天將這兩欄並排來看:
• 綜合 — Grok 4.7 (xhigh):在 Artificial Analysis Intelligence Index v4.3.2 上獲得 46 分。Gemini 3.1 Pro Preview:在同一版本上獲得 30 分,在 200 個中排名 #69。
• 長上下文 — Grok 4.7:500k 視窗,AA-LCR v1.1 77%。Gemini 3.1 Pro:1M 視窗 —— 足足大上兩倍 —— 以及 65K 的輸出上限,大約只有長上下文代理式工作階段通常所需的一半。
• 輸入模態 — Grok 4.7:文字與圖像。Gemini 3.1 Pro:文字、圖像、影片、音訊與 PDF。差距不小,而且不是跑分上的差距——而是能力上的差距。
• 速度 — Grok 4.7:尚無已公布的測量數據。Gemini 3.1 Pro:每秒輸出 124.4 個 token,在 200 個模型中排名第 39,透過 Google AI Studio 的首個 token 時間為 63.62 秒。
• 價格,標準方案 — Grok 4.7:每 1M 輸入 $2.00/輸出 $6.00。Gemini 3.1 Pro:輸入 $2.00/輸出 $12.00。輸入相同,輸出卻是兩倍。
• 價格,長上下文級距 — Grok 4.7:在 200k 提示詞 token 時倍增至 $4.00 / $12.00。Gemini 3.1 Pro:在同一 200k 界線調升至 $4.00 / $18.00。相同輸入,輸出多 50%。
• 成熟度 — Grok 4.7:問世僅一天,廠商公布的基準測試大多未經重現。Gemini 3.1 Pro:上市已七個月,但仍屬預覽版,既無正式推出(GA)的承諾,也沒有停用日期。

預覽問題現在是個真正的問題了
七個月的預覽期若沒出任何差錯,會是件怪事而非風險。但確實出事了。自 2026 年 9 月 18 日起,使用者開始回報 Gemini 3.1 Pro 已從 AI Studio 模型選擇器中消失;截至本文撰寫時,Google 員工未做出任何回應,沒有棄用通知,也沒有說明原因——這是尚未解決的可用性事件,而非已確認的退役。把這對照公告歷史來看:Google 在 2026 年 5 月的 I/O 大會上表示,Gemini 3.5 Pro「將於下個月推出」,而 8 月下旬的媒體報導指出,該模型已被取消,因為內部候選版本「相較於 Flash 系列並沒有好到足以推出」。Google 自家的 Pro 頁面仍宣傳「3.5 Pro 即將推出」,這在一頁畫面上就是矛盾所在。無論最終結果為何,實際解讀是:Gemini 3.1 Pro 是預覽端點,沒有 GA 日期,沒有指名後繼者,且目前可用性仍是個問號。
Grok 4.7 的風險則是鏡像般相反,且性質上較小。它才問世一天,因此數據資料稀少——Artificial Analysis 尚未公布任何速度或延遲的測量數據,而 xAI 自家針對它所做的一套基準測試也尚未被獨立重現。無庸置疑的是,這個模型已正式對外提供、有定價、有文件說明,且身份定位穩定。一個身份穩定、數據尚未經證實的模型,遠比一個數據已公布、但可用性不明的模型更容易在其上進行建構。
實際上,分裂的代價是什麼
假設你正在為文件處理流程做選擇。以 10 萬個輸入 token 和 8 千個輸出 token 計算,Grok 4.7 的輸入費用為 $0.20,輸出為 $0.048——大約 25 美分。Gemini 3.1 Pro 的輸入費用為 $0.20,輸出為 $0.096——大約 30 美分。兩者差距在百分之二十以內,而且如果你的文件是掃描檔、PDF、音訊或視訊,Gemini 是兩者中唯一能讀取它們的。這不是基準測試的論點;對這類工作負載而言,比較到此結束。
現在假設你是在為一個長上下文代理做選擇。在 300k 輸入與 8k 輸出的情況下,Grok 4.7 的輸入成本為 $1.20、輸出為 $0.096,總計約 $1.30。Gemini 3.1 Pro 的輸入成本為 $1.20、輸出為 $0.144,總計約 $1.35。實際上兩者幾乎完全相同——而在這裡,Gemini 的 1M 視窗與 65K 輸出上限就成了決定勝負的關鍵限制,因為 65K 的上限正是長時間代理執行會崩潰的地方。在這場對決中,兩個模型都不是便宜選項,但以前沿標準來看,兩者也都不算昂貴。

繞行移動目標
OrcaRouter 提供 Gemini 3.1 Pro,並在其專屬模型頁面上以供應商的價格列出——輸入 $2.00、輸出 $12.00,具備 1M 視窗與 65k 最大輸出——因為我們以 0% 加成直接傳遞供應商的定價。在這種情況下,這可不是行銷話術:Google 有一個未定價期間的預覽版本,其可用性在九月時曾搖擺不定,而路由器發揮作用之處,就在於當背後的东西改變時,仍能讓整合保持穩定。自動容錯移轉意味著,停止回應的預覽端點會變成一次路由事件,而不是一次服務中斷,而路由 DSL 讓你可以在單一次呼叫中,把多模態模型與純文字模型組合起來——這正是這組合所暗示的形態:Gemini 閱讀影片,Grok 則對其逐字稿進行推理。截至本文撰寫時,Grok 4.7 尚未收錄於 OrcaRouter 目錄中;今天要呼叫它,就得透過 xAI 自家的 API 以及有提供它的第三方平台。
值得建立的模式是:凡是必須處理影片、音訊或 PDF 的工作,就繼續採用 Gemini 3.1 Pro,並將其預覽狀態視為可繞道處理的營運風險,而不是避開它的理由。把 Grok 4.7 用於文字與圖像工作,因為它較低的輸出價格與較高的綜合評分正適用於這類工作,而且你今天整合的模型,六個月後仍會是你持續呼叫的模型。唯一不該做的事,就是把第六十九名的排名解讀為對該模型的評價——那是對基準測試修訂的評價,而同一項修訂在使 Gemini 3.1 Pro 降級的同時,也讓數十個 Google 從未碰過的模型一併降級。
那通電話
在目前的指數上,Grok 4.7 領先 Gemini 3.1 Pro 十六分,而在輸出價格方面,它在標準層級的成本只要一半,在長上下文層級則便宜三分之一。如果你的工作負載是文字與圖像,這樣就足以決定選它。如果你的工作負載是影片、音訊或掃描文件,Gemini 3.1 Pro 是兩者中唯一的候選,比較也就到此為止——你買的是能力,不是分數。兩者都該附上的但書,與其說是關於效能,不如說是關於來源出處:一個是七個月大的預覽版,沒有正式發布(GA)日期,背後還有一場九月的可用性事故;另一個才剛推出一日,只有一個亮眼數字,其餘任何內容都沒有獨立重現。兩者都不是已成定局的選擇。兩者都值得納入路由,而非直接押注。

本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
