主視覺標題卡寫著「GPT-6 vs Gemini 3.1 Pro」,晶片標籤寫著「Gemini 3.1 Pro:自 2026-02-19 起開放預覽」,兩行價格文字分別寫著「GPT-6 Sol $2 / $10」與「Gemini 3.1 Pro $2 / $12」,頁尾寫著「指數數據依據 Artificial Analysis v4.3.2;GPT-6 廠商自報項目已於文中標示。」OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-6 與 Gemini 3.1 Pro:Google 的 Pro 層級自二月以來尚未推出新模型

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.1 Pro 已在 Google 的價目表上待了七個半月,卻從未離開預覽階段。它於 2026 年 2 月 19 日宣布推出,至今仍以名為 Gemini 3.1 Pro Preview 的端點提供服務,而截至今日,既沒有正式推出(GA)承諾,也沒有關閉日期——這兩個日期本可告訴你,該模型在其自家廠商的計畫中處於什麼位置。相較之下,GPT-6 Sol 於 2026 年 9 月 22 日推出,並於 2026 年 10 月 7 日成為 ChatGPT 向超過 12 億名每週使用者全球推行的付費方案背後的模型。

所以,頭條比較並非發生在兩個旗艦級別之間。它是在一個已出貨的產品與一個開放式預覽版之間,而這個差異到頭來比基準測試的差距更有價值。將它們並列在 Artificial Analysis 的 Intelligence Index v4.3.2 上,Goo​gle 已推出七個月的預覽版得分為 29.7,而 GPT-6 Sol 為 47.6,同時每完成一項索引任務的收費高出 1.25 倍——$1.30 對上 $1.04。這兩個數字都是真實的,而且在你要為它們花錢之前,兩者都需要附上但書。

這值得一讀而非逕予否定,原因在於這個預覽版確實能贏下一些項目。它在 GPQA Diamond、τ²-Bench 的代理工具使用,以及一項長脈絡評測上擊敗 GPT-6 Sol——而且它能接受音訊與影片輸入,這點 GPT-6 Sol 做不到。一個已有七個月之久、卻仍能在四場對決中拿下兩場的預覽版,不是可以輕易放棄的模型。這個模型的問題在於它的生命週期,而非它的能力。

這些數字,以及必須隨之呈現的修正但書

Artificial Analysis 會重新執行其測試套件,並在目前的指數修訂版下重新發布分數,這意味著同一個模型可能因為你查看的時間不同,而帶有兩個不同的數字。對 Gemini 3.1 Pro 而言,這種變異異常地大:較早對這個模型的報導在較舊修訂版上報告的是 57,而今日頁面在 v4.3.2 上報告的則是 29.7。這兩個數字都是真實的,而且都位於同一個網站上。

這點很重要,因為只有同一修訂版本的數字才能相減。這裡該用的配對是 29.7 和 47.6,因為兩者都來自 v4.3.2——也就是讓 Claude Opus 5.5 得分 57.6、GPT-6 Astra 得分 52.7 的同一次執行。同一輪執行的讀數,每個維度一行:

• 智慧指數,v4.3.2 — GPT-6 Sol 47.6 對上 Gemini 3.1 Pro 29.7
• 每項完成索引任務的成本 — Gemini 3.1 Pro $1.30 對上 GPT-6 Sol $1.04;較舊的模型每完成一個答案貴 25%
• 輸入價格 — 兩者皆為每 1M $2.00,在標題價格上持平
• 輸出價格 — GPT-6 Sol $10.00 對上 Gemini 3.1 Pro $12.00;Sol 便宜 17%
• 長上下文條款 — GPT-6 Sol 在輸入超過 272,000 個 token 時,將整個請求重新計價為 $4.00/$15.00;Gemini 3.1 Pro 在超過 200,000 時調整為 $4.00/$18.00
• 上下文視窗 — GPT-6 Sol 1,050,000 個 token 對上 Gemini 3.1 Pro 1,048,576,實際上持平
• 最大輸出 — GPT-6 Sol 128,000 個 token 對上 Gemini 3.1 Pro 65,536;Sol 幾乎是兩倍
• 輸入模態 — GPT-6 Sol 文字、圖像、檔案 對上 Gemini 3.1 Pro 文字、圖像、音訊、影片、PDF

A two-column comparison scoreboard for GPT-6 Sol and Gemini 3.1 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against Gemini 3.1 Pro at 29.7, $1.30 and 65,536 tokens, with input and output prices of $2.00/$10.00 against $2.00/$12.00 and a preview-since-2026-02-19 chip. A footer reads "Index figures per Artificial Analysis v4.3.2; Gemini 3.1 Pro is a preview product."

其中有兩行值得進一步說明,因為它們顛覆了顯而易見的解讀。每項任務成本那一行指出,看似較便宜的費率表,其實屬於每完成一項工作成本更高的模型——Gemini 3.1 Pro 的 12 美元輸出費率,加上其推理量,實際完成的工作量比其 2 美元招牌輸入價所暗示的更多。而長脈絡的級距在雙方都值得重新細讀:Gemini 3.1 Pro 的級距從 200,000 個詞元起跳,低於 GPT-6 Sol 的 272,000,但輸出重新定價為 18.00 美元,而 Sol 則重新定價為 15.00 美元。兩者都不是單一費率的費率表,而且交叉點並不一致。

在預覽仍勝出的地方

Google 的模型並非過時遺物。提取兩張卡片所帶的評估:

• GPQA Diamond — Gemini 3.1 Pro 94.1% 對 GPT-6 Sol,此修訂版本未公布可比較的數據
• τ²-Bench 代理工具使用 — Gemini 3.1 Pro 95.6% 對 GPT-6 Sol,未公布於同一排行榜
• 長上下文回憶 — Gemini 3.1 Pro 82.0% 對 GPT-6 Sol 83.7%,差距 1.7 個百分點
• SciCode — Gemini 3.1 Pro 58.7% 對 GPT-6 Sol 57.6%,實際上旗鼓相當
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4.0% 對 GPT-6 Sol 43.9%;這是預覽版唯一不具競爭力的類別

A screenshot of the Artificial Analysis leaderboard: the top of the table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings - Claude Opus 5.5 (max with fallback) at 58, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and GPT-6.1 Sol (max) at 52 and $0.72 - with the Gemini 3.1 Pro Preview row set below it, showing an index of 30 at $1.30 per index task, 67M tokens generated and 22M output tokens at 23.40 tokens per second.

94.1% 的 GPQA Diamond 與 95.6% 的代理式工具使用分數是前沿等級的數字,而非舊世代的水準,而這正是為什麼 17.9 分的指數差距誇大了實際上的距離。該指數是十項評估的綜合結果,而 Gemini 3.1 Pro 的失分集中在這套評測大幅偏重軟體工程的地方——Terminal-Bench 4.0 的 4.0% 是災難性的離群值,對比其 58.7% 的 SciCode 與 73.8% 的 Terminal-Bench 2.1。一個在某個代理式基準測試中接近頂端、卻在其後繼版本中接近墊底的模型,透露的是它的訓練日期,而不是它的上限。

音訊與視訊輸入是另一項具體優勢,而且它是一道門檻,而非程度上的漸變。如果你的流程以會議錄音或螢幕擷取作為輸入,Gemini 3.1 Pro 能進入,GPT-6 Sol 則不能。再多的索引領先地位都無法取代這一點。

「仍在預覽階段」具體會讓你付出什麼代價

預覽狀態不是裝飾性的標籤,而這類代價往往只會在你在某個東西上建構之後才浮現。

預覽端點不帶任何正式可用性承諾,這意味著供應商並未保證該模型會按照你能據以規劃的時程繼續存在。它也沒有下線日期,這聽起來像是前述情況的好的一面——沒有東西被退役——但也可以從另一個方向解讀:Goo​gle 尚未公布一個自二月以來就處於這種狀態的模型的生命週期,而同一期間卻持續推出 Flash 層級的模型。Gemini 3.8 Flash、Gemini 3.5 Flash-Lite、3.6 與 3.8 Flash 系列:Pro 層級維持原狀,而後繼者反倒以 Gemini 4 Argon 之姿登場,Goo​gle 於 2026 年 9 月 30 日宣布,以分階段方式向一群具名的安全合作夥伴推出,同樣沒有附上正式可用日期。

這正是這個比較真正要探討的模式。如果你在 Gemini 3.1 Pro Preview 上打造可長可久的管線,你就是在一個其自家廠商尚未說明何時會讓它畢業、取代或淘汰的模型上進行建構。GPT-6 Sol 的處境則相反:它是一項正式推出的 API 產品,有公開的價目表,而且自 2026 年 10 月 7 日起,它也是大多數同事所用應用程式中的預設選項。根據廠商報告且尚未被重現,OpenAI 表示在 ChatGPT 中,GPT-6 透過一項名為 Intelligent UI 的能力,使用文字、圖形、圖表和互動式控制項來組成答案;需要網路搜尋的答案比 GPT-5.6 Instant 早 44% 開始;而 Extra High 努力等級開始回應的速度與 GPT-5.6 在 Medium 時一樣快。這些都不會改變 API 整合。所有這些都是為什麼 GPT-6 現在是無所不在的預設,而預覽版則不是。

還有一個更直白的說法。你每完成一項任務要多付 25%,換來的能力分數卻更低,而且是為了一個生命週期未公開的模型。反向論點確實成立——你能得到 94.1% 的 GPQA Diamond 與音訊輸入——但這是針對特定工作負載的具體論點,不是偏好較舊模型的普遍理由。

測試預覽而不下注

面對像 Gemini 3.1 Pro 這類模型時,要避免的陷阱,就是把「我們該不該用它」當成單一的二元決策。但它並不是。Gemini 3.1 Pro 與 GPT-6 Sol 都架在 OrcaRouter 上,位於同一個相容於 OpenAI 的端點與同一把金鑰之後,且相較於供應商定價維持 0% 加成——因此這個預覽版本是你可以放進實際請求路徑、用自家工作負載來衡量,並在不需第二份供應商合約、也不需修改程式碼的情況下保留或捨棄的東西。

自動容錯移轉正是讓處於預覽生命週期的模型得以安全運作的關鍵。將音訊與視訊流量路由到 Gemini 3.1 Pro,因為它是這兩者中唯一能接收該輸入的模型;將軟體工程與長輸出流量路由到 GPT-6 Sol;並設定備援機制,讓預覽端點若遭棄用、受到速率限制或悄悄調整價格時,請求會改由正式推出的模型承接,而不是失敗。這就是一個問世七個月的預覽版所應得的架構——不是迴避,而是一條不依賴它的路徑。

如果你想再進一步,路由 DSL 會把多個模型組合成單一次邏輯呼叫,因此同一個請求可以分別向 Gemini 3.1 Pro 與 GPT-6 Sol 嘗試,再由你自己的標準、而非單一供應商的標準來挑選答案。模型融合則是從反方向做同一件事——由一組模型共同回答同一個問題——這是在把某條正式生產路徑交付給某個預覽版之前,判斷該預覽版的特定強項是否值得付費的合理做法。

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the Google vendor label, a 2026-02-19 release date, a 1M-token context window, a 65K-token maximum output, text, image, audio, video and file input, and pricing of $2.00 per million input tokens and $12.00 per million output tokens.

裁決,以及值得關注的數字

對於新工作,GPT-6 Sol 在決定部署的六個維度中有四個是更安全的選擇,而且每完成一項任務的成本更低,同時在相同修訂版本下還高出 17.9 個指數點。對於需要音訊或視訊輸入的工作負載,或者你真正要買的就是 94.1% GPQA Diamond 的場合,Gemini 3.1 Pro Preview 仍然勝出,而 preview 標籤是需要管理的風險,而不是卻步的理由。

值得關注的數字不是指數。而是 Gemini 3.1 Pro 端點名稱上的日期。當 preview 後綴拿掉時——或當 Argon 以真正的 API 識別碼正式推出時——這項比較會徹底改觀,而 Pro 層級上次發布與今天之間那七個月的差距,就會成為這篇文章真正要談的事情。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新