為 GPT-6.1 Sol 對上 Gemini 3.1 Pro 所生成的主視覺卡片,標題為「預覽七個月,出貨八天」,附有兩張資訊卡,分別寫著「Gemini 3.1 Pro:2026 年 2 月 19 日發表,至今仍是預覽端點,智慧指數 29.7」與「GPT-6.1 Sol:2026 年 9 月 29 日發布,已正式出貨的產品,智慧指數 51.8」,頁尾寫著「指數數據依據 Artificial Analysis 的 Intelligence Index v4.3.2;價格依據 Google 與 OpenAI。」,以及位於右下角的 OrcaRouter 標誌。
Guides & Insights

GPT-6.1 Sol 對決 Gemini 3.1 Pro:七個月的預覽期,對上八天的出貨期

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.1 Pro已在供應商的價目表上待了七個半月,卻始終沒有離開預覽階段。它於 2026 年 2 月 19 日發布,如今記錄在一個結尾為 -preview的端點上,既沒有全面推出的承諾,而且更能說明問題的是——也沒有下線日期。GPT-6.1 Sol則只有八天大,於 2026 年 9 月 29 日推出,每百萬輸入 token 收費 2.00 美元、每百萬輸出 token 收費 10.00 美元。把兩者並列在 Artificial Analysis Intelligence Index 上,這個七個月大的預覽版不僅僅是有競爭力而已,在最新一版的指數修訂中,它與較新的模型只差 22 分——v4.3.2 上是 29.7 對 51.8——但每個指數任務的成本卻高出 1.8 倍,為 1.30 美元對 0.72 美元。這樣的組合,正是這項比較之所以有趣、而非徒具形式的原因:在這張榜上,較舊的模型能力落後、成本卻超前,而對於一個本該畢業的預覽版來說,這方向正好相反。不過,指數修訂這項但書在這裡比在本系列其他任何地方都更要緊,因為 29.7 和 53 都會被同一個網站引用,而它們並不是同一種測量。

兩者都是具備百萬級上下文視窗的大型多模態模型。Gemini 3.1 Pro 接受文字、圖像、影片、音訊與 PDF,輸出上限為 65,536 個 token,並設有 200,000 個 token 的價格分級,超過此門檻後費率即翻倍。GPT-6.1 Sol 接受文字、圖像與檔案,視窗達 1,050,000 個 token,輸出上限為 128,000 個 token,具備五個推理強度等級,並設有超過 272,000 個提示 token 的長上下文分級。一個是附帶支援承諾的正式出貨產品。另一個是生命週期未定的預覽版,而這項差異最終證明比指數差距更有價值。

索引編號需要附上其修訂版本

Artificial Analysis 會重新執行其測試套件,並在目前的索引修訂版下重新發布分數,這表示同一個模型可能因為你閱讀的時間不同,而帶有兩個不同的數字。對 Gemini 3.1 Pro 而言,這個差距異常地大:本刊先前對這個模型的報導在較舊的修訂版上報導了 57,而今日現行的頁面則在 v4.3.2 上顯示 29.7;這個十項評估版本也收錄了 GPT-6.1 Sol 的 51.8。這兩個數字都是真實的,而且都位於同一個網站上。

這對比較的意義既狹窄又重要。只有來自同一修訂版本的數字才能相減。v4.3.2 的 29.7 和 51.8 會產生 22 點的差距;57 和 51.8 則會在相反方向上產生五點的差距。這裡應該採用 22 點這個數字,因為這是在同一套測試套件、同一尺度上測量這兩個模型所得的結果——也因為每項任務成本數字,$1.30 對 $0.72,來自同一次執行。

• 智慧指數,v4.3.2 — GPT-6.1 Sol 51.8 對 Gemini 3.1 Pro 29.7

• 每項索引任務成本 — GPT-6.1 Sol $0.72 對比 Gemini 3.1 Pro $1.30

• 執行整套測試的成本 — GPT-6.1 Sol $1,082 對比 Gemini 3.1 Pro $1,935

• 上下文視窗 — GPT-6.1 Sol 1,050,000 個詞元 vs Gemini 3.1 Pro 1,000,000 個詞元

• 最大輸出量 — GPT-6.1 Sol 128,000 tokens 對比 Gemini 3.1 Pro 65,536 tokens

• 輸入模態 — 兩者皆支援文字、圖像與檔案,Gemini 3.1 Pro 另支援影片、音訊與 PDF

其中兩點對預覽版有利,值得直白說明。Gemini 3.1 Pro 接受影片與音訊,而 GPT-6.1 Sol 則否;若你的流程需要接收螢幕錄影或通話內容,那是任何分數都無法彌補的能力差距。而它 65,536 個 token 的輸出上限,只有 GPT-6.1 Sol 的一半,這對長篇生成很重要,但在代理式工作中很少成為限制,因為那裡的輸出簡短、回合數多。

為什麼較新的數字才是應該影響你決策的那個

價格問題比指數問題更有趣。

Gemini 3.1 Pro 的費率表為每百萬 token 輸入 $2.00、輸出 $12.00,快取輸入為 $0.20,快取寫入為 $0.375,並在提示 token 達 200,000 時出現級距界線,超過後費率變為 $4.00 與 $18.00。GPT-6.1 Sol 為輸入 $2.00、輸出 $10.00,快取輸入為 $0.10,快取寫入為 $2.50,並在 272,000 token 時出現界線,超過後費率變為 $4.00 與 $15.00。標準輸入價格相同。GPT-6.1 Sol 的輸出價格低 20%,長上下文級距在兩個軸向都較低。兩張價目表分歧之處在於快取:每百萬快取輸入 token 為 $0.10 對 $0.20,而預覽模型寫入快取較便宜,為 $0.375 對 $2.50。

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, credited to Google and dated 2026-02-19, showing the -preview model identifier, text, image, video, audio and file input with text output, a 1M-token context window with a 65K maximum output, and a rate row reading $2.00 input and $12.00 output per million tokens alongside a 10.60-second median time to first token and an 11.3M seven-day traffic figure.

最後那一對反轉了直覺上的解讀。如果你的工作負載以快取為主——每一輪都重新送出的冗長固定系統提示,或是在整個工作階段中反覆重讀的文件——Gemini 3.1 Pro 的快取寫入收費項目便宜得多,而它的快取讀取收費項目則是兩倍。哪個模型勝出,取決於你重讀自己所寫入內容的次數,而這個數字只有你自己的日誌握有,沒有任何基準測試會公布。沒有模糊空間的是索引成本:在相同的評估工作上,八天前推出的模型完成時便宜了 33%,而七個月前的預覽版整體而言比更新的模型貴了 79%。

預覽徽章是運作上的事實

這是比較中評分表無法承載的部分,而對於生產環境部署而言,它比上述一切都更重要。

Gemini 3.1 Pro 自二月以來一直處於預覽階段,既沒有正式推出(GA)公告,也沒有關閉日期。這兩項缺席都很重要,而且影響方向相反。沒有 GA 就代表沒有生命週期承諾:預覽端點不受與正式推出端點相同的棄用通知條款保障,且可能在未提升版本號的情況下,於呼叫端底下逕行修訂——這正是生產環境應鎖定精確模型識別碼,而非別名的標準理由。沒有關閉日期也代表你無法規劃遷移窗口——這個模型已經撐過大家預期它正式推出的那一季,而這個系列以前就曾關閉過一款 Pro 模型。

GPT-6.1 Sol 的處境恰好相反。它才問世八天,這表示其獨立評估紀錄僅止於一種配置的深度,失效模式也未有紀錄;當它出錯時,沒有實務工作者語料庫可供查閱。它的發布本身即為新聞,而且它是在預覽版所沒有的支援架構下推出。

那些是不同的風險,不是風險程度的高低。選擇預覽版,你就是在賭供應商會繼續提供某個端點,而他們並無合約義務這麼做。選擇那個推出才八天的模型,你就是在賭一次基準測試的結果加上八天的可用性,就足以作為你工作負載的依據。這個指數對這兩者都幫不上忙。

能讓這件事變簡單的唯一一件事

若 Gemini 3.1 Pro 發布正式可用性(GA)公告,並採用不屬於 -preview 命名空間的模型識別碼,同時公布生命週期承諾,就能解決其中大部分問題。這無法縮小 22 點的指數落差,也無法彌補每項任務 1.8 倍的成本差距,但能消除目前讓這項比較嚴重失衡的淘汰風險,並讓團隊得以採用該模型,而不必緊綁某個預覽版識別碼、只能暗自祈禱。

那則公告遲未出現,經過七個半月,這件事本身就是資訊。這個預覽在廠商二月的措辭中,原本是要在「即將」GA 之前驗證更新;而它已經有整整兩個季度可以這麼做。要不是驗證仍在進行,就是這個預覽本身就是產品——而從外部來看,呼叫方無從分辨是哪一種。呼叫方能做的,就是為這份不確定性定價,並據此選擇路由。

兩者都在同一個鍵上,因此答案可以依工作負載而異

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Gemini 3.1 Pro 已在 OrcaRouter 上,以自身表定費率提供 —— $2.00 / $12.00,當提示詞超過 200,000 個 token 時調升至 $4.00 / $18.00,快取讀取為 $0.20。GPT-6.1 Sol 已在 OrcaRouter 上,價格為 $2.00 / $10.00,當提示詞超過 272,000 個 token 時調升至 $4.00 / $15.00,快取讀取為 $0.10。兩者皆為供應商定價,不另加價,一組金鑰、一張帳單。

這讓這項比較中棘手的部分得以低成本解決。視訊與音訊輸入仍留在預覽版上,因為這對組合中沒有其他選擇能接受它;高量的文字與程式碼工作則交給較新的模型,因為它每項任務更便宜,而且在相同評估工作上的成本低了 33%。如果預覽端點遭到修訂或撤下,自動容錯移轉會將那些呼叫導向另一條路徑,而不是讓它們失敗——這正是預覽版生命週期風險所需的特定避險措施。而且由於兩者都位於同一個 OpenAI 相容端點之後,真正重要的價格比較可以在一個下午內用你自己的流量來進行,而不是拿著價目表來爭論。

A generated scoreboard titled 'GPT-6.1 Sol vs Gemini 3.1 Pro — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 29.7 on v4.3.2; cost per index task $0.72 against $1.30; input price $2.00 against $2.00; output price $10.00 against $12.00; maximum output 128,000 against 65,536 tokens; lifecycle released September 29, 2026 against a preview running since February 19, 2026. A footer reads 'Index and cost figures per Artificial Analysis v4.3.2; prices per OpenAI and Google as listed on OrcaRouter.'

那麼,站得住腳的解讀並不是哪個模型更好。而是:這兩者定價近乎相當,但在生命週期成熟度上相差七個月,在當前獨立排行榜上相差 22 分,而且預覽模型的真正優勢——影片與音訊輸入、便宜的快取寫入——既狹窄又特定。如果你的工作負載需要這些模態,Gemini 3.1 Pro 是兩者中唯一的選擇,而指數差距就是入場代價。如果不需要,你面對的是一個未來走向未定的預覽端點,每項任務成本比上週才推出的模型高出 80%,而舉證責任則落在另一方。