一張生成的英雄卡片,標題為「GPT-6 Sol vs Gemini 3.1 Pro」,主標題為「相同的 $2.00 輸入價格」,兩張模型卡片分別顯示 AA 指數 48($10.00 輸出)對比 30($12.00 輸出),OrcaRouter 標誌位於右下角。
Guides & Insights

GPT-6 Sol 對上 Gemini 3.1 Pro:價格差距比任一篇發布貼文所承認的還小

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個模型的輸入 token 價格均為每百萬 2.00 美元。GPT-6 Sol 每百萬輸出 token 收費 10.00 美元;Gemini 3.1 Pro 收費 12.00 美元。以表面費率來看,GPT-6 Sol 與問世六個月的 Gemini 3.1 Pro 之間的差距在 20% 以內,這使其成為當前產品陣容中最不戲劇性的價格比較——也是最容易誤導人的,因為這兩個模型在長上下文工作負載上,實際上都不會按表面費率計費,而且兩者的分級界線位於不同位置,重新定價的方向也不同。

那才是值得好好做的比較。GPT-6 Sol 於 2026 年 9 月 22 日推出,價格為 $2/$10,較 GPT-5.6 Sol 調降 50%,並有超過 272,000 個輸入 token 的長上下文級距,該級距大致讓輸入價格加倍、輸出價格提高一半。Gemini 3.1 Pro 自 2026 年 2 月 19 日起提供,價格為 $2/$12,級距界線在 200,000 個 token,超過後價格變成 $4/$18,批次費率則為 $1/$6。相同的標價,不同的費率表結構,而下面的計算才能決定哪一個對你的流量更便宜。

兩張費率卡,按比例繪製

• 基礎輸入 — GPT-6 Sol 每 1M $2.00 對比 Gemini 3.1 Pro 每 1M $2.00

• 基礎輸出 — GPT-6 Sol 每 1M 為 $10.00,相較於 Gemini 3.1 Pro 每 1M 為 $12.00

• 長上下文門檻 — GPT-6 Sol 高於 272K 輸入 vs Gemini 3.1 Pro 高於 200K 輸入

• 長上下文費率 — GPT-6 Sol 約 $4.00 / $15.00,對比 Gemini 3.1 Pro $4.00 / $18.00

• 重新計價範圍 — GPT-6 Sol 會對整個請求重新計價,而 Gemini 3.1 Pro 則會對整個請求重新計價

• 快取——GPT-6 Sol 的快取輸入約可享 90% 折扣,而 Gemini 3.1 Pro 的快取定價於推出時並未重新公布

• 批次 — GPT-6 Sol 批次費率未公布,對比 Gemini 3.1 Pro $1.00 / $6.00

• 上下文視窗 — 根據 Artificial Analysis,GPT-6 Sol 為 872K,聲稱 1.05M,對比 Gemini 3.1 Pro 的 1M 輸入

• 最大輸出 — GPT-6 Sol 128K 對比 Gemini 3.1 Pro 約 64K 至 66K

• AA 智能指數(v4.3.2)— GPT-6 Sol 48 對 Gemini 3.1 Pro 30

A generated two-column scoreboard titled 'GPT-6 Sol vs Gemini 3.1 Pro — the scoreboard'. Left column GPT-6 Sol: Input $2.00/1M, Output $10.00/1M, AA Index 48, Max output 128K, Long ctx 'past 272K reprices', Released 2026-09-22. Right column Gemini 3.1 Pro: Input $2.00/1M, Output $12.00/1M, AA Index 30, Max output 64K, Long ctx 'past 200K reprices', Released 2026-02-19. Footer: 'Gemini per Google and Artificial Analysis.'

由此得出兩個結構性要點。第一,長上下文邊界彼此接近但並不相同——272K 對上 200K——而且兩者都對整個請求套用較高費率,而非只對超出部分。一次攜帶 210K token 的呼叫,在 Gemini 3.1 Pro 上要付較高費率,在 GPT-6 Sol 上則付基本費率。那個 72,000 token 的區間,正是這兩款模型在價格上差異最大的地方。

其次,輸出空間無法相提並論。GPT-6 Sol 允許 128K 的輸出 token;Gemini 3.1 Pro 則在約 64K 至 66K 就停止。如果你的工作負載會產生冗長的成品——完整檔案重寫、長篇草稿、你實際保留的延伸思維鏈軌跡——那個上限比輸出定價上 2 美元的差距更重要。

一個完整示範,因為表面利率掩蓋了答案

以一個實際的每月工作量為例:1,000 萬個輸入 token 和 200 萬個輸出 token,且全都屬於短上下文。

GPT-6 Sol — 10M 輸入,每單位 $2.00,共 $20.00;2M 輸出,每單位 $10.00,共 $20.00。總計:$40.00

• Gemini 3.1 Pro — 10M 輸入以 $2.00 計為 $20.00,2M 輸出以 $12.00 計為 $24.00。總計:$44.00

GPT-6 Sol 便宜了 9%。這就是全部的差距,而這個差距小到,堆疊中其他環節的一個工程決策就能將它抹除。

現在把同樣的工作負載改成長脈絡——一個每次呼叫都攜帶 30 萬個 token 工作狀態的代理。兩個模型都跨越了各自的閾值。

• GPT-6 Sol — 輸入約 $4.00 可得到 $40.00,輸出約 $15.00 可得到 $30.00。總計:$70.00

• Gemini 3.1 Pro — 輸入以 $4.00 計,為 $40.00;輸出以 $18.00 計,為 $36.00。總計:$76.00

兩份帳單幾乎都翻倍,而 GPT-6 Sol 仍保持領先,但差距依然不到 10%。長上下文並不會打破這場對決;它只會讓兩個選項都變得昂貴。

有趣的情況是快取與批次處理,兩家廠商在此做出了不同的押注。如果你的輸入有 80% 是穩定的前綴,GPT-6 Sol 大約 90% 的快取折扣會大幅改變這筆帳——800 萬個快取 token 以每百萬約 $0.20 計算為 $1.60,加上 200 萬個全新 token 以每百萬 $2.00 計算為 $4.00,再加上 $20.00 的輸出,總計接近 $25.60。Gemini 3.1 Pro 的批次費率則從另一個方向達到類似的效果:以每百萬 $1.00 的輸入和 $6.00 的輸出計算,同樣的 1000 萬/200 萬工作量落在 $10.00 加 $12.00,也就是 $22.00。

所以,誠實的總結是:GPT-6 Sol 在互動式流量與快取前綴工作負載上勝出,Gemini 3.1 Pro 則在你能批次處理的任何事情上勝出,而兩者最佳情境之間的差距,是每千萬個 token 幾美元。這不是價格決策,而是工作負載形態的決策。

能力差距就是真正的決策。

在同一份榜單上,這些模型之間相差 51 個 Index 分:GPT-6 Sol 為 48,Gemini 3.1 Pro 為 30。這差距一點也不接近,而這正是為什麼價格持平只是件奇事,而非競爭威脅。

Artificial Analysis 的 Intelligence Index 是一項綜合指標,而綜合指標可能會美化結果。但這麼大的差距,在每家廠商各自公布的組成基準測試中依然站得住腳:

• AA Intelligence Index — GPT-6 Sol 48,在 212 個中排名第 18,相較於 Gemini 3.1 Pro 30,在 212 個中排名第 81

• 輸出速度 — GPT-6 Sol 每秒 104.4 個 token,對比 Gemini 3.1 Pro 每秒 115.0 個 token

• 首個 Token 時間 —— GPT-6 Sol 107.18 秒 對上 Gemini 3.1 Pro 32.96 秒,相較於排行榜中位數的 3.87 秒

• GPQA Diamond — Gemini 3.1 Pro 94.3%(Google 回報)

• ARC-AGI-2 — Gemini 3.1 Pro 77.1%(Google 回報)

• HLE — Gemini 3.1 Pro 44.4%(Google 公布)

• SWE-bench Verified — Gemini 3.1 Pro 80.6%(Google 回報)

• Terminal-Bench 2.0 — Gemini 3.1 Pro 68.5%(Google 公布)

• LiveCodeBench Pro — Gemini 3.1 Pro 2887 Elo(Google 公布數據)

仔細看看那些 Google 的數字,因為它們並不弱。在 GPQA Diamond 上達到 94.3%,在 ARC-AGI-2 上達到 77.1%,都是很強的結果,而且它們是在二月發表的。Index 仍然把 Gemini 3.1 Pro 排在低三十分的位置,原因是 Index 高度看重代理式與長時程任務,而這正是這兩個版本相隔六個月所顯現差距的地方。Gemini 3.1 Pro 是強大的推理模型。GPT-6 Sol 是強大的代理。

延遲這條線上,Gemini 3.1 Pro 是徹底勝出,而且這不是小幅領先。33 秒才吐出第一個 token,就絕對值而言確實很慢——整體的中位數是 3.87 秒——但它只是 GPT-6 Sol 的 107 秒的三分之一。對於任何會讓人等待的用途來說,這兩者之中只有 Gemini 3.1 Pro 堪用。GPT-6 Sol 那 107 秒的首個 token,將會淘汰最多試用者,而值得留意的是,它一旦開始輸出,吞吐量極為出色:每秒 104.4 個 token,與 Gemini 的 115.0 相比並沒有實質落後。這個模型並不慢,它只是起步慢。

Gemini 3.1 Pro 尚未擺脫的事物

Gemini 3.1 Pro 自二月起便一直處於預覽階段。帶著預覽標籤長達六個月,時間實在不短,而 Google 在此期間已推出 3.5、3.6 與 3.8 Flash 模型,卻未將 3.1 Pro 提升至正式版本。在 OrcaRouter 上,可路由的代稱仍是gemini-3.1-pro-preview,且旁邊還有一個獨立的gemini-3.1-pro-preview-customtools變體並存。

這對採購來說很重要,而基準測試無法反映這點。預覽端點可能會在你使用期間變更、在短時間內遭棄用,而且速率限制也與 GA 模型不同。如果你今天是在 Gemini 3.1 Pro 上開發,你就是在預覽版上開發,應該據此將遷移風險納入考量——尤其當 Google 自家較新的 Flash 模型已在多個面向上超越它時。

GPT-6 Sol 沒有那個問題,但有另一個問題:推出時的可取得範圍比公告所暗示的還要窄。它已納入 API、ChatGPT Work,以及付費方案中的 Codex——而 Enterprise 管理員必須先啟用它,他們的使用者才能看到。它不在 ChatGPT Chat 中。一款跳過消費者端介面的旗艦產品,就是一款鎖定開發者的旗艦產品。

把便宜的那個和好的那個一起跑

這是少見的比較,答案顯然是「兩者都要」,而價格也支持這一點。Gemini 3.1 Pro 是你會擺在人前面的模型:首個 token 速度快、批次費率讓大量工作變得便宜、公開的推理分數強勁。GPT-6 Sol 是你會擺在佇列後面的模型:啟動慢、輸出入吞吐量極佳、Index 分數高出 51 分,而且就互動式工作而言,其定價與它所取代的模型相差在 20% 以內。

Gemini 3.1 Pro 已在 OrcaRouter 上架,價格為 Google 的定價,在直通模式下,這意味著 Google 的價格一有變動,當天就會在我們這邊生效,而不必等待經銷商重新議價。截至本文撰寫時,GPT-6 Sol 尚未收錄於我們的目錄中——它可透過 OpenAI 自家的 API 存取——因此若要建立涵蓋兩者的路由,等於需要一個 Gemini 的金鑰,旁邊再加一個直接的 OpenAI 整合。在快速預覽模型與較慢的前沿模型之間進行路由,正是自動容錯移轉所設計的典型情境:當預覽端點效能下降或被淘汰時,路由會隨之轉移,而你是從日誌紀錄得知,而不是從使用者那裡得知。

A screenshot of the Artificial Analysis page for GPT-6 Sol (max), showing an Intelligence rank of 18th of 212 models, a Cost rank of 49th and a Verbosity rank of 43rd, input pricing of $2.00 and output of $10.00 per 1M tokens with a 90% cache discount, a cost per Intelligence Index task of $1.06, an 872k-token context window, 77M tokens generated during the index run, and a total of $1,550.08 spent evaluating the model on the Intelligence Index.

決策規則

當有人在等待時、當工作可批次處理時,或當輸出保持簡短時,選擇 Gemini 3.1 Pro。33 秒的首個 token 並不好,但比 GPT-6 Sol 的快三倍,而 $1/$6 的批次費率是將大型語料庫送進強大推理模型的最便宜方式。接受你正在使用預覽端點,並為遷移做好規劃。

當工作是代理式的、長時程且無人看管時,以及當你的上下文保持在 272K 權杖以下時,選擇 GPT-6 Sol。它得分 48 對 30,產生 128K 的輸出,相較約 64K,而其快取前綴定價提供 90% 折扣,讓重複的代理式迴圈變得異常便宜。它 107 秒的首個權杖是它推理方式的特色,不是錯誤,而且只有當你把它放在某人面前時,才會成為問題。

不要根據價格來選擇。兩者在短上下文工作負載上相差在 9% 以內,在長上下文工作負載上則相差在 10% 以內。一本一千萬個 token 的書每月九美元的價差,不是選擇其中一款模型的理由,而五十一點的 Index 差距才是。

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the Vision, Audio, Tools, JSON and Reasoning badges, a 1M-token context with 65K maximum output and audio + file + image + text + video input at text output, list pricing of $2.00 input and $12.00 output per 1M tokens, and the description of Gemini 3.1 Pro Preview as Google's frontier reasoning model offered in preview form.

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新