
GPT-6.1 Sol 對決 Gemini 3.1 Pro:七個月的預覽期,對上八天的出貨期
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Gemini 3.1 Pro已在供應商的價目表上待了七個半月,卻始終沒有離開預覽階段。它於 2026 年 2 月 19 日發布,如今記錄在一個結尾為 -preview的端點上,既沒有全面推出的承諾,而且更能說明問題的是——也沒有下線日期。GPT-6.1 Sol則只有八天大,於 2026 年 9 月 29 日推出,每百萬輸入 token 收費 2.00 美元、每百萬輸出 token 收費 10.00 美元。把兩者並列在 Artificial Analysis Intelligence Index 上,這個七個月大的預覽版不僅僅是有競爭力而已,在最新一版的指數修訂中,它與較新的模型只差 22 分——v4.3.2 上是 29.7 對 51.8——但每個指數任務的成本卻高出 1.8 倍,為 1.30 美元對 0.72 美元。這樣的組合,正是這項比較之所以有趣、而非徒具形式的原因:在這張榜上,較舊的模型能力落後、成本卻超前,而對於一個本該畢業的預覽版來說,這方向正好相反。不過,指數修訂這項但書在這裡比在本系列其他任何地方都更要緊,因為 29.7 和 53 都會被同一個網站引用,而它們並不是同一種測量。
兩者都是具備百萬級上下文視窗的大型多模態模型。Gemini 3.1 Pro 接受文字、圖像、影片、音訊與 PDF,輸出上限為 65,536 個 token,並設有 200,000 個 token 的價格分級,超過此門檻後費率即翻倍。GPT-6.1 Sol 接受文字、圖像與檔案,視窗達 1,050,000 個 token,輸出上限為 128,000 個 token,具備五個推理強度等級,並設有超過 272,000 個提示 token 的長上下文分級。一個是附帶支援承諾的正式出貨產品。另一個是生命週期未定的預覽版,而這項差異最終證明比指數差距更有價值。
索引編號需要附上其修訂版本
Artificial Analysis 會重新執行其測試套件,並在目前的索引修訂版下重新發布分數,這表示同一個模型可能因為你閱讀的時間不同,而帶有兩個不同的數字。對 Gemini 3.1 Pro 而言,這個差距異常地大:本刊先前對這個模型的報導在較舊的修訂版上報導了 57,而今日現行的頁面則在 v4.3.2 上顯示 29.7;這個十項評估版本也收錄了 GPT-6.1 Sol 的 51.8。這兩個數字都是真實的,而且都位於同一個網站上。
這對比較的意義既狹窄又重要。只有來自同一修訂版本的數字才能相減。v4.3.2 的 29.7 和 51.8 會產生 22 點的差距;57 和 51.8 則會在相反方向上產生五點的差距。這裡應該採用 22 點這個數字,因為這是在同一套測試套件、同一尺度上測量這兩個模型所得的結果——也因為每項任務成本數字,$1.30 對 $0.72,來自同一次執行。
• 智慧指數,v4.3.2 — GPT-6.1 Sol 51.8 對 Gemini 3.1 Pro 29.7
• 每項索引任務成本 — GPT-6.1 Sol $0.72 對比 Gemini 3.1 Pro $1.30
• 執行整套測試的成本 — GPT-6.1 Sol $1,082 對比 Gemini 3.1 Pro $1,935
• 上下文視窗 — GPT-6.1 Sol 1,050,000 個詞元 vs Gemini 3.1 Pro 1,000,000 個詞元
• 最大輸出量 — GPT-6.1 Sol 128,000 tokens 對比 Gemini 3.1 Pro 65,536 tokens
• 輸入模態 — 兩者皆支援文字、圖像與檔案,Gemini 3.1 Pro 另支援影片、音訊與 PDF
其中兩點對預覽版有利,值得直白說明。Gemini 3.1 Pro 接受影片與音訊,而 GPT-6.1 Sol 則否;若你的流程需要接收螢幕錄影或通話內容,那是任何分數都無法彌補的能力差距。而它 65,536 個 token 的輸出上限,只有 GPT-6.1 Sol 的一半,這對長篇生成很重要,但在代理式工作中很少成為限制,因為那裡的輸出簡短、回合數多。
為什麼較新的數字才是應該影響你決策的那個
價格問題比指數問題更有趣。
Gemini 3.1 Pro 的費率表為每百萬 token 輸入 $2.00、輸出 $12.00,快取輸入為 $0.20,快取寫入為 $0.375,並在提示 token 達 200,000 時出現級距界線,超過後費率變為 $4.00 與 $18.00。GPT-6.1 Sol 為輸入 $2.00、輸出 $10.00,快取輸入為 $0.10,快取寫入為 $2.50,並在 272,000 token 時出現界線,超過後費率變為 $4.00 與 $15.00。標準輸入價格相同。GPT-6.1 Sol 的輸出價格低 20%,長上下文級距在兩個軸向都較低。兩張價目表分歧之處在於快取:每百萬快取輸入 token 為 $0.10 對 $0.20,而預覽模型寫入快取較便宜,為 $0.375 對 $2.50。

最後那一對反轉了直覺上的解讀。如果你的工作負載以快取為主——每一輪都重新送出的冗長固定系統提示,或是在整個工作階段中反覆重讀的文件——Gemini 3.1 Pro 的快取寫入收費項目便宜得多,而它的快取讀取收費項目則是兩倍。哪個模型勝出,取決於你重讀自己所寫入內容的次數,而這個數字只有你自己的日誌握有,沒有任何基準測試會公布。沒有模糊空間的是索引成本:在相同的評估工作上,八天前推出的模型完成時便宜了 33%,而七個月前的預覽版整體而言比更新的模型貴了 79%。
預覽徽章是運作上的事實
這是比較中評分表無法承載的部分,而對於生產環境部署而言,它比上述一切都更重要。
Gemini 3.1 Pro 自二月以來一直處於預覽階段,既沒有正式推出(GA)公告,也沒有關閉日期。這兩項缺席都很重要,而且影響方向相反。沒有 GA 就代表沒有生命週期承諾:預覽端點不受與正式推出端點相同的棄用通知條款保障,且可能在未提升版本號的情況下,於呼叫端底下逕行修訂——這正是生產環境應鎖定精確模型識別碼,而非別名的標準理由。沒有關閉日期也代表你無法規劃遷移窗口——這個模型已經撐過大家預期它正式推出的那一季,而這個系列以前就曾關閉過一款 Pro 模型。
GPT-6.1 Sol 的處境恰好相反。它才問世八天,這表示其獨立評估紀錄僅止於一種配置的深度,失效模式也未有紀錄;當它出錯時,沒有實務工作者語料庫可供查閱。它的發布本身即為新聞,而且它是在預覽版所沒有的支援架構下推出。
那些是不同的風險,不是風險程度的高低。選擇預覽版,你就是在賭供應商會繼續提供某個端點,而他們並無合約義務這麼做。選擇那個推出才八天的模型,你就是在賭一次基準測試的結果加上八天的可用性,就足以作為你工作負載的依據。這個指數對這兩者都幫不上忙。
能讓這件事變簡單的唯一一件事
若 Gemini 3.1 Pro 發布正式可用性(GA)公告,並採用不屬於 -preview 命名空間的模型識別碼,同時公布生命週期承諾,就能解決其中大部分問題。這無法縮小 22 點的指數落差,也無法彌補每項任務 1.8 倍的成本差距,但能消除目前讓這項比較嚴重失衡的淘汰風險,並讓團隊得以採用該模型,而不必緊綁某個預覽版識別碼、只能暗自祈禱。
那則公告遲未出現,經過七個半月,這件事本身就是資訊。這個預覽在廠商二月的措辭中,原本是要在「即將」GA 之前驗證更新;而它已經有整整兩個季度可以這麼做。要不是驗證仍在進行,就是這個預覽本身就是產品——而從外部來看,呼叫方無從分辨是哪一種。呼叫方能做的,就是為這份不確定性定價,並據此選擇路由。
兩者都在同一個鍵上,因此答案可以依工作負載而異

Gemini 3.1 Pro 已在 OrcaRouter 上,以自身表定費率提供 —— $2.00 / $12.00,當提示詞超過 200,000 個 token 時調升至 $4.00 / $18.00,快取讀取為 $0.20。GPT-6.1 Sol 已在 OrcaRouter 上,價格為 $2.00 / $10.00,當提示詞超過 272,000 個 token 時調升至 $4.00 / $15.00,快取讀取為 $0.10。兩者皆為供應商定價,不另加價,一組金鑰、一張帳單。
這讓這項比較中棘手的部分得以低成本解決。視訊與音訊輸入仍留在預覽版上,因為這對組合中沒有其他選擇能接受它;高量的文字與程式碼工作則交給較新的模型,因為它每項任務更便宜,而且在相同評估工作上的成本低了 33%。如果預覽端點遭到修訂或撤下,自動容錯移轉會將那些呼叫導向另一條路徑,而不是讓它們失敗——這正是預覽版生命週期風險所需的特定避險措施。而且由於兩者都位於同一個 OpenAI 相容端點之後,真正重要的價格比較可以在一個下午內用你自己的流量來進行,而不是拿著價目表來爭論。

那麼,站得住腳的解讀並不是哪個模型更好。而是:這兩者定價近乎相當,但在生命週期成熟度上相差七個月,在當前獨立排行榜上相差 22 分,而且預覽模型的真正優勢——影片與音訊輸入、便宜的快取寫入——既狹窄又特定。如果你的工作負載需要這些模態,Gemini 3.1 Pro 是兩者中唯一的選擇,而指數差距就是入場代價。如果不需要,你面對的是一個未來走向未定的預覽端點,每項任務成本比上週才推出的模型高出 80%,而舉證責任則落在另一方。
