
Gemini 4 Argon 對決 GPT-6 Sol:五分之一的價格,四倍的帳單
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
在 Gemini 4 Argon 上執行 Artificial Analysis 指數套件,帳單金額為 $2,407。在 GPT-6 Sol 上執行同一套件,帳單金額為 $1,546。相同的指數、相同的任務、相同的一週。這兩個模型有著完全相同的標價——每百萬輸入詞元 $2.00、每百萬輸出詞元 $10.00,Argon 是 Google 明示的導入優惠價,Sol 則是 OpenAI 的現行標準價——然而完成相同工作的最終成本卻相差 56%,而且有利於得分低五分的模型。這個差距正是這篇比較值得寫的全部理由,而它與價目表毫無關係。
Google 於 2026-09-30 宣布推出 Gemini 4 Argon,稱其為前沿智能的新時代,定價為輸入 2 美元、輸出 10 美元,快取輸入享 95% 折扣,並透過 Fairwind Program 向受信任的網路防禦人員推出。GPT-6 Sol 自 2026-09-22 起正式全面開放,當時 OpenAI 推出 GPT-6 系列的中階產品,定價為輸入 2 美元、輸出 10 美元,並提供 90% 快取折扣。其中一個如今可透過 OpenAI 相容端點購買,另一個則無法讓具名群體以外的任何人購買,這就是本文的實務分岔點。但即使完全把可用性擺在一邊,前述成本倒掛依然成立,而理解背後原因才是有用之處。
反轉,直白地說
Artificial Analysis 同時發布 Intelligence Index,以及運行該指數所需成本的核算。兩者合讀,傳達出這樣的訊息:
• 智慧指數 — Gemini 4 Argon 52.6 對上 GPT-6 Sol 47.5。五分的差距,是在 Argon 以其高投入設定、Sol 以最大設定進行評測時測得,因此這項比較對 Sol 較為寬容,而非對 Argon。
• 每百萬個 Token 的標價 — 相同。兩者皆為 $2.00 輸入 / $10.00 輸出。快取讀取是唯一差異:Argon 為 $0.10,Sol 為 $0.20。
• 每個索引任務的成本——Gemini 4 Argon 為 $1.99,對比 GPT-6 Sol 的 $1.05。儘管每 token 成本相同,Argon 每個任務的成本大約是兩倍。
• 執行完整套件的成本 — Gemini 4 Argon 為 $2,407,相較於 GPT-6 Sol 的 $1,546。
• 實測輸出速度——GPT-6 Sol 為每秒 77.0 個 token,Gemini 4 Argon 則為 48.9,1.6 倍的差距同時反映在延遲與支出上。
在那份清單中,有一行能解釋其餘所有項目,而那不是價格。那是 token 數量。在該指數自身的任務上,Gemini 4 Argon 每項任務大約產生 561,000 個輸出 token;GPT-6 Sol 則大約產生 282,000 個。Argon 為了回答同一個問題,思考時間是兩倍,而在每 token 費率相同的情況下,帳單金額正好是兩倍。

為什麼代幣就是價格
這是在任何人為遷移編列預算之前,值得內化的修正,因為直覺往往正好相反。當一個模型的定價與競爭對手相同,卻要消耗兩倍的輸出 token 才能完成任務時,每 token 的價格並不是真正的價格。真正的價格是每 token 價格乘以模型決定花費的 token 數量,而第二個因子是模型本身的特性,不是費率表。
每個任務的利潤率差異極大,這讓情況更糟——你不能套用一個固定乘數就了事:
• Terminal-Bench 4.0 — Argon 每項任務輸出 165,330 個 token,Sol 則為 97,372 個。在這裡,Argon 每項任務花費 $6.78,Sol 為 $4.00,儘管 Argon 得分 57.1%,而 Sol 為 43.9%。
• CritPt — Argon 109,533 tokens,相較於 Sol 的 31,848。token 比例為 3.4 倍,在一項 Sol 實際上得分更高的任務中,30.9% 對 27.1%。
• GDPval — Argon 為 74,571 個 token,Sol 則為 41,567 個;每項任務 1.82 美元,對比 1.32 美元。
• Omniscience — 938 對 2,662 的 token 比率,對 Argon 有利,每項任務 $0.010,相較於 Sol 的 $0.027。唯一一個方向翻轉的任務家族。
• 長上下文推理——Argon 2,197 個 token 對比 Sol 的 954,也是這套測試套件中唯一一項 Sol 在分數上明顯勝出的任務,83.7% 對 79.7%。
CritPt 是更具啟發性的那個。一個模型在同一道問題上消耗三倍半的 token,卻產出稍微更差的答案,這不是能力問題,而是花錢習慣的問題。Argon 的推理很長,而在某些任務形態中,這種長度會轉化為分數,在另一些任務形態中,它只會轉化為金錢。該指數的 52.6 與 Sol 的 47.5 是總體數據,而總體數據正好掩蓋了這一點。
這五點實際上從何而來
由於指標差距與成本差距的方向相反,因此值得了解是哪些任務分別驅動了這兩者。
• Terminal-Bench 4.0 — Gemini 4 Argon 57.1% 對上 GPT-6 Sol 43.9%。這是 Argon 最大的單一勝差,也是與長時程代理式編碼最為接近的任務系列。
• 全知性 — Gemini 4 Argon 42.4 對上 GPT-6 Sol 27.1。在事實覆蓋率上相差十五分,是整套測試中比例最大的差距。
• AutomationBench-AA — Gemini 4 Argon 77.5% 對比 GPT-6 Sol 61.6%。
• SciCode — Gemini 4 Argon 61.8% 對比 GPT-6 Sol 57.6%。
• 人類最終考試 — Gemini 4 Argon 57.1% 對比 GPT-6 Sol 47.9%。
• GDPval — Gemini 4 Argon 1,611 對 GPT-6 Sol 1,487。
• ApexAgents / AA-Briefcase —— GPT-6 Sol 的 1,482.78 Elo 對上 Argon 的 1,493.84,這 11 分的差距落在已公布的信賴區間之內,應判定為平手。
• 長上下文推理 — GPT-6 Sol 83.7%,相較於 Gemini 4 Argon 79.7%。這是 Sol 唯一明顯的勝利。
• CritPt — GPT-6 Sol 30.9% 對上 Gemini 4 Argon 27.1%。Sol 再次以些微差距勝出。
所以重點並不是「Argon 比較好」。而是 Argon 在它發布資料一開始強調的兩件事上更強——端到端的商業任務執行,以及長時程的軟體工程——而 Sol 在偏學術風格的推理階梯上,以及長時間維持上下文連貫性方面,則是持平或領先。對於工作量是帶有 400K token 提示的檢索管線的讀者來說,Sol 同時是更好的模型,也是更便宜的模型,這是個不尋常卻很舒服的處境。
比基準討論更歷久不衰的規格差異
• 最大輸出 — Gemini 4 Argon 單一軌跡可達 1,000,000 個 token,Google 稱其為業界最大,並較前一代的 64K 上限有所提升。GPT-6 Sol 為 128,000 個 token。
• 上下文視窗 — GPT-6 Sol 的廠商規格卡標示約 1,050,000 個 token;Argon 則為 1,000,000。Artificial Analysis 透過其測試框架測得 Sol 為 872,000 個 token,這是測試框架的測量值,而非規格卡上的數字——請將規格卡視為規格本身,並把測試框架的數字視為評估者實際檢驗的結果。
• 輸入模態——兩者都接受文字、圖像和檔案。Argon 的發布資料也著重於長影片理解,其中 Google 聲稱在 LVBench 上達到 91.7%,並稱其為最先進水準;那是廠商自行報告的數字,目前尚無獨立評測榜單重現該結果。
• 視訊輸入 — 偏軟。Artificial Analysis 的圖表將 Argon 標示為停用視訊輸入,並在推出時明確提及視訊;而 Sol 的規格卡則完全未列出視訊。如果視訊是你工作流程中的關鍵環節,這兩張卡都無法給你定論,你應該先測試再進行架構設計。
• 推理強度 — Sol 在 API 上提供可設定的強度(從 none 到 max,預設為 medium),且其評測設定為 max。Argon 的評測設定為 high;尚未有人在其最高設定下發表過同一套測試套件。
100 萬 token 的輸出上限,是真正可能改變架構、而不只是改變預算的那一項。你目前為了維持在 128K 上限以下,而拆成十幾個串接呼叫的任何工作——多檔案修補集、完整稽核報告、一次處理的長文件——都會變成一次呼叫,讓代理迴圈能遺失狀態的地方更少。這是否值得付出兩倍的每任務成本,完全取決於你是否真的有那類工作負載。如果有,那大概就值得。如果你的呼叫只是分類後回傳,那就是把錢花在沒人會用到的餘裕上。
無人能及的努力設定,以及它為何重要
有一個但書值得獨立成段,因為這關乎把這五點的指數差距解讀為能力差異。Artificial Analysis 將 Gemini 4 Argon 列在其 {{2}}high{{/2}}{{3}} 推理強度設定,而 GPT-6 Sol 則列在 {{/3}}{{4}}max{{/4}}{{5}} 設定。這兩者並不是兩把梯子上的同一級,而這種不匹配的方向很有意思:Sol 是在其最昂貴的設定下運行,而 Argon 則是在中等設定下運行。{{/5}}high 推理強度設定,而 GPT-6 Sol 則列在 max 設定。這兩者並不是兩把梯子上的同一級,而這種不匹配的方向很有意思:Sol 是在其最昂貴的設定下運行,而 Argon 則是在中等設定下運行。
接下來有兩種解讀,而數據無法分辨何者為真。要嘛 Argon 在 max之下會拿下高於 52.6 的分數——但每項任務也會消耗超過 561,000 個 token,成本超過 $1.99——要嘛它拿到的分數大致相同,而這就意味著在這套測試套件上,努力程度旋鈕並沒有發揮太大作用。目前沒有任何已發表的執行結果能給出定論。任何把 52.6 當成 Argon 上限來引用的人,引用的是某個配置,而非模型本身,而且那個配置還是其廠商選擇優先發表的那一個。
同樣的邏輯也適用於 Sol 的 47.5,只是方向相反:max 是其階梯的頂端,因此這個數字更接近上限而非下限。在相同努力下的一場公平對決,可能縮小差距,也可能翻轉成本比較,因為 max 所消耗的 token,正是每百萬個要價 10 美元的 token。
可用性分支,它決定實際答案
Gemini 4 Argon 尚未正式全面推出。Google 的公告表示,它正透過 Fairwind Program 向一群受信任的網路防禦人員逐步推出;該公司正在參與美國政府自願性的發布前模型存取流程;而對開發者、企業與消費者的一般開放將「儘快」到來,並先從付費 API 客戶與 Google AI Ultra 訂閱者開始。沒有模型識別碼、沒有端點、沒有配額,也沒有日期。它不在任何公開 API 上,包括我們自己的 API 在內——查看 API 目錄會出現 404,因為它在那裡還不存在。
GPT-6 Sol 是一款可直接呼叫的產品。在 OrcaRouter 上,它是openai/gpt-6-sol,與目錄中其他200 多款模型使用同一個 OpenAI 相容端點,並以 OpenAI 的定價原樣轉售、零加成,因此上方所述的 $2/$10,以及 272,000 詞元長上下文的 $4/$15 級距,才是你實際支付的價格,而非價目表上的說法。跨供應商的自動容錯移轉可涵蓋路由在執行途中退化的情況,而路由 DSL 能讓單一應用程式把便宜的分類流量送往較小的模型,並把困難的推理流量送往 Sol,無須第二個 SDK。

最後那個安排,對大多數團隊來說,是這個比較中誠實的答案。支持 Argon 的成本論點確實成立,但有條件:僅限於長時間跨度代理工作主導的工作負載;反對它的成本論點在其他每一種工作負載上都成立;而且這個月你无论如何也買不到它。便宜的做法是現在就建立評估測試框架——你自己的提示、你自己的評分,在幾種投入程度設定下對 Sol 跑測試——這樣當 Argon 觸及付費 API 客戶時,你對一個其他人屆時都會根據排行榜來回答的問題,已經有了有實測依據的答案。
什麼能讓它塵埃落定
有三件事,依它們能多大程度左右最終判斷來排序。Argon 以真正、非導入推廣價的價格正式全面上市——「導入」這個詞意味著 $2/$10 可能變動,而 Google 自己的順序把付費 API 客戶放在最前面,所以推出後首次公布的費率才是觀察重點。一份已公開的 Artificial Analysis 對 Argon 在最高 effort 設定下的測試結果,這將說明 52.6 是天花板,還是只差毫釐。還有一項對 DeepSWE v1.1 分數的獨立重現——Google 聲稱 77.9%,並稱其為新的最佳水準;截至今日,這是由廠商自行報告,且尚未在 Google 之外被重現。
在那之前,這種區分乾淨俐落,還略帶諷刺。GPT-6 Sol 是驗證得更充分的模型、速度更快的那個、每完成一項任務成本更低的那個,也是你今天下午就能呼叫的那個。Gemini 4 Argon 則是在自家廠商選擇公布的排行榜上得分更高的模型,實際使用的成本大約是兩倍,而且尚未開賣。在兩者之間做選擇,並不是對能力的判斷。這是在判斷,那兩句話之中,哪一句更符合你這個月的情況。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
