
GPT-6 Sol Pro 與 Gemini 3.1 Pro Preview:七個月的預覽,以及這要你付出什麼代價
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
Gemini 3.1 Pro Preview 已經預覽了七個月。供應商於 2026 年 2 月 19 日發布該模型,價格為每百萬輸入詞元 2.00 美元、每百萬輸出詞元 12.00 美元,而截至本週,其模型卡仍將其描述為「以預覽形式提供」,警告它「與穩定版本相比,在穩定性或可用性上可能有所限制」,並表示它「可能未經通知即發生變更或遭到淘汰」。折舊表上既沒有正式上市日期,也沒有停用日期。GPT-6 Sol Pro——即 GPT-6 Sol 的一種配置,而 GPT-6 Sol 是已於 2026 年 9 月 22 日正式上市、輸入 2.00 美元與輸出 10.00 美元的模型——則是相反的情況:一個有公布定價的正式環境 API、一個有明文記載的 effort 調整機制,以及一家已承諾維持該價格數字的供應商。
這兩款模型之間有趣的比較,不在於基準測試表,而在於兩家廠商各自對下一季向你承諾了什麼。
兩條價格線,其中一條是預覽
兩者都是供應商清單。Google 和 OpenAI 自家的數字,由託管這些清單的平台原樣傳遞。
• 輸入 — GPT-6 Sol 每百萬個 token $2.00 對比 Gemini 3.1 Pro Preview 每百萬個 token $2.00
• 輸出 — GPT-6 Sol 每百萬個 token 10.00 美元 vs Gemini 3.1 Pro Preview 每百萬個 token 12.00 美元
• 長上下文 — Gemini 3.1 Pro Preview 在超過 200,000 個 token 的門檻後,將輸入重新定價為每百萬 token 4.00 美元、輸出為每百萬 token 18.00 美元;GPT-6 Sol 則在更高的輸入門檻之上套用其自身的長上下文重新定價
• 快取讀取 — GPT-6 Sol 每百萬個 token $0.20,相較於 Gemini 3.1 Pro Preview 每百萬個 token $0.20
• 上下文視窗 — GPT-6 Sol 1,050,000 個詞元,對比 Gemini 3.1 Pro Preview 的 1,000,000 個詞元
• 最大輸出 — GPT-6 Sol 128,000 個 token,對比 Gemini 3.1 Pro Preview 65,000 個 token
• 輸入模態 — GPT-6 Sol 文字與圖像 vs Gemini 3.1 Pro Preview 文字、圖像、音訊、視訊與檔案
• 可用性狀態 — GPT-6 Sol 自 2026 年 9 月 22 日起正式推出,而 Gemini 3.1 Pro Preview 自 2026 年 2 月 19 日起仍處於預覽階段,且尚未宣布正式推出日期
表面上公布的費率夠接近,因此不是決策關鍵。輸入完全相同。輸出則相差 20%。真正的差異在最後兩行:Gemini 多支援四種輸入模態,而輸出上限則在反方向相差一倍——65,000 個 token 對上 128,000 個——而且已經以預覽版形式推出大半年。

預覽狀態是一項真實的運作屬性
Google 自家的產品目錄文字要開發者預先規劃預覽版功能下線。那句話承載了許多意涵,值得當成一項工程限制來解讀,而非免責聲明。
預覽模型是一種你能在其上開發、卻不能圍繞它來規劃的模型。隨之而來有三個後果,而它們都不會出現在價格表上。
• 無穩定性承諾。卡片明確指出,與穩定版本相比,該模型在穩定性方面可能有所限制,且OrcaRouter不會為這個預覽模型提供特定的延遲保證。我們自己在模型頁面上的遙測資料顯示,過去一週的 p50 與 p95 首個 token 時間皆為 10.00 秒,這已是顯示範圍的上限,而非實測的中位數。
• 沒有棄用日期。有關閉日期的模型可以從產品藍圖中排程移除。既沒有 GA 日期也沒有關閉日期的模型,則完全無法排程,無論往哪個方向都一樣——你不知道何時才能安全地依賴它,也不知道它何時會停止運作。
• 沒有產品藍圖上的定位。Google 已在同一系列中推出更新的 Flash 模型,如今在獨立綜合評測中得分超越 Gemini 3.1 Pro,包括 2026 年 9 月 2 日的 Gemini 3.8 Flash。3.5 Pro 世代遭到延宕,據報已被擱置。並不存在 Gemini 3.8 Pro。掛著 Pro 之名的這款模型,已不再是其開發商得分最高的模型,而且至今仍只是預覽版。
對任何在這兩者之間做選擇的人來說,這是最誠實的說法。GPT-6 Sol 問世才六天,價格是固定、公開且永久的。Gemini 3.1 Pro Preview 已推出七個月,卻只有一行狀態說明,而不是發展藍圖。
獨立紀錄顯示了什麼,以及為何版本標籤就是整個論點所在
Artificial Analysis 在當前指數上針對這組確切組合發布了直接比較頁面,這讓它成為這批比較中少數幾個中立數據真正可對等比較的對戰組合之一。GPT-6 Sol 在最高 effort 設定下得分 48,每項指數任務成本為 $1.06。Gemini 3.1 Pro Preview 得分 30,每項指數任務成本為 $0.67。
十八分的差距很大,而且這並不是該模型在二月時的差距。在推出時,Artificial Analysis 將 Gemini 3.1 Pro Preview 以 Intelligence Index 57 分排在第一位。該模型自那時起未曾改變。這個指數則變了——它在 2026 年 9 月 19 日重新評分,而同一個未改變的模型現在讀數為 30。這兩個數字都來自 Artificial Analysis;兩者都沒有錯;將它們並列而不註明版本,是關於這個模型的報導中最常見的單一錯誤,而這正是為什麼這麼多比較頁面把二月的領先者描述成九月的同級者。
每項任務成本說出另一個值得實際算一算的故事。Gemini 每項任務較便宜——0.67 美元對上 1.06 美元——但得分較低。每指數點成本算下來,GPT-6 Sol 是 0.022 美元,Gemini 也是 0.022 美元。以這項指標衡量,兩者打成平手,而這正是說明這裡實際情況最乾淨俐落的方式:Gemini 並不是用更便宜的方式買到同樣的智慧,而是用更便宜的方式買到更少的智慧。
另外兩個獨立數字應該與那些並列,兩者皆附有標註。在 OSWorld-Verified 這項電腦使用基準測試上,Google 自家的評估頁面回報 Gemini 3.1 Pro 為 76.2%。該數字出現在 Google 的資料以及第三方對其的摘要中,卻未出現在經獨立驗證的 OSWorld 看板上;該看板列出其他 Gemini 模型——3.6 Flash 為 83%、3.5 Flash 為 78.4%——而完全沒有 3.1 Pro 的列。在更艱難的 OSWorld 2.0 看板上,該模型得分 30.6%。而在 GDPval-AA 上,該模型約為 1,316 Elo,落後於 Claude Sonnet 4.6 與 Claude Opus 4.6。
這並非指控惡意;自行回報的數字很平常,而且兩家供應商都會公布這類數字。這是在說明一個已推出七個月的預覽版實際上能帶來什麼:足夠讓供應商回報的數字廣泛流傳,卻不足以讓該數字獲得獨立重現與查核。相較之下,GPT-6 Sol 的中立紀錄簡短、明確,而且只有六天大。
無人提及的十五個月知識斷層
Gemini 3.1 Pro Preview 的知識截止日期為 2025 年 1 月。GPT-6 Sol 的則是 2026 年 4 月 20 日——晚了十五個月。
這個落差在每一頁關於這個對戰組合的比較頁面上都付之闕如,而對某一類特定的工作而言,它比輸出價格的差異更重要:任何涉及近期 API、近期函式庫版本、近期事件或近期組織事實的工作。一個知識截止點為 2025 年 1 月的模型,會自信地回答一個已經向前推進了十五個月的世界,而它的失效模式並不是錯誤訊息——而是一個看似合理的錯誤答案。對檢索增強的工作而言,截止點幾乎無關緊要,因為事實是由上下文所承載的。對任何倚重參數式知識的工作而言,它是最該優先檢查的限制條件,卻也是所有人最後才會檢查的一項。

模態差距是支持 Gemini 的最強論點,而這確實存在
要把這場對決寫成較新模型的輕鬆勝利,會很容易。但事實並非如此,原因就在輸入行。
Gemini 3.1 Pro Preview 原生支援在同一端點上接受文字、圖像、音訊、影片和檔案輸入。GPT-6 Sol 則接受文字和圖像。對於圍繞影片理解、會議轉錄,或跨格式文件處理所打造的工作負載而言,這不是功能上的差異——而是單一次 API 呼叫與三個步驟管線之間的差異,中間步驟還得另外計費,失敗模式也會倍增。
附帶的誠實但書是:一個在其託管模型頁面上顯示 77.6% 錯誤率的預覽版模型,就是一個其多模態優勢必須與「它究竟會不會回答」一併權衡的預覽版模型。那個數字就是頁面上所顯示的數字,而且高得足以讓任何人在以其為基礎繼續開發之前先進行驗證——而這正是重點所在。時隔七個月,關於這個模型的誠實建議依然是「自己測」,而這句話沒有人會用來形容一個 GA 正式發行版。
路由層改變運算方式之處
Gemini 3.1 Pro Preview 已在 OrcaRouter 的目錄中,每百萬個 token 的價格為輸入 $2.00、輸出 $12.00,快取讀取 $0.20,具備 1,000,000 個 token 的上下文視窗、65,000 個 token 的輸出上限,支援 /v1/chat/completions 與 /v1beta/models/{model}:generateContent 端點,且根據我們自家模型頁面在過去一週的測量,p50 首個 token 時間為 10.00 秒。供應商定價表原樣傳遞,且不額外加價。
GPT-6 Sol 並非我們的供應路線之一,因此此處並無任何內容是關於透過我們取得其價格的聲明。

預覽模型是「以路由取代承諾」的教科書案例。想試用 Gemini 3.1 Pro Preview 的理由,以及不該在其上建立正式環境路徑的理由,都是同一項特性——它可能未經通知就變更——而單一端點搭配 自動容錯移轉,正是讓你取得前者,而不必接受後者的做法。後端模型改變時,請求結構並不會改變,因此 備援路徑是設定項目,而不是一次移轉。這點在這裡比在大多數比較情境中更重要,因為在備援鏈中最可能取代這個模型的,是同一供應商推出的較新 Flash,使用同一把金鑰,且輸出費率僅為其一小部分。
決策規則
• 單次呼叫就能輸入影片、音訊或混合格式 — Gemini 3.1 Pro Preview。GPT-6 Sol 欄位裡沒有任何一項能接受影片檔案,而再大的價差也彌補不了你得自己打造的那套資料匯入流程。
• 任何附帶可用性承諾的東西——GPT-6 Sol。問世才六天、已正式推出、公布的價格號稱永久,還有一個有文件記載的投入程度調節旋鈕。這就是可排程的樣子。
• 長篇生成 —— GPT-6 Sol,重點在輸出上限,而非費率。128,000 個 token 對上 65,000,這是在綜整類工作上最先卡住你的限制,而且早在 20% 輸出價差之前就先卡住你。
• 評估 Gemini 3.1 Pro Preview —— 請在容錯移轉路徑後方進行,並在決定工作負載規模之前自行測量錯誤率。預覽了七個月,託管頁面上顯示的錯誤率達 77.6%,這並不是一個已穩定的工具。
• 如果你的計畫取決於這個模型下一季會很便宜——兩者都不是。Gemini 的預覽版可能未經通知就調價或下架,而 GPT-6 Sol 的價格之所以算永久,也只是就 OpenAI 本週這麼說這層意義而言。固定費率是一項承諾,不是保證;它只是比預覽卡所能做出的承諾更強而已。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
