主視覺標題卡寫著「Gemini 4 Argon vs GPT-6 Sol — 價格只要五分之一,帳單卻是四倍」,標籤寫著「Argon $2 / $10」、「Sol $2 / $10」以及「每項索引任務成本 $1.99 vs $1.05」,頁尾一行寫著「Argon 數據由供應商提供;索引數據依據 Artificial Analysis,讀取於 2026-10-01。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 4 Argon 對決 GPT-6 Sol:五分之一的價格,四倍的帳單

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 Gemini 4 Argon 上執行 Artificial Analysis 指數套件,帳單金額為 $2,407。在 GPT-6 Sol 上執行同一套件,帳單金額為 $1,546。相同的指數、相同的任務、相同的一週。這兩個模型有著完全相同的標價——每百萬輸入詞元 $2.00、每百萬輸出詞元 $10.00,Argon 是 Go​ogle 明示的導入優惠價,Sol 則是 Open​AI 的現行標準價——然而完成相同工作的最終成本卻相差 56%,而且有利於得分低五分的模型。這個差距正是這篇比較值得寫的全部理由,而它與價目表毫無關係。

Google 於 2026-09-30 宣布推出 Gemini 4 Argon,稱其為前沿智能的新時代,定價為輸入 2 美元、輸出 10 美元,快取輸入享 95% 折扣,並透過 Fairwind Program 向受信任的網路防禦人員推出。GPT-6 Sol 自 2026-09-22 起正式全面開放,當時 OpenAI 推出 GPT-6 系列的中階產品,定價為輸入 2 美元、輸出 10 美元,並提供 90% 快取折扣。其中一個如今可透過 OpenAI 相容端點購買,另一個則無法讓具名群體以外的任何人購買,這就是本文的實務分岔點。但即使完全把可用性擺在一邊,前述成本倒掛依然成立,而理解背後原因才是有用之處。

反轉,直白地說

Artificial Analysis 同時發布 Intelligence Index,以及運行該指數所需成本的核算。兩者合讀,傳達出這樣的訊息:

• 智慧指數 — Gemini 4 Argon 52.6 對上 GPT-6 Sol 47.5。五分的差距,是在 Argon 以其高投入設定、Sol 以最大設定進行評測時測得,因此這項比較對 Sol 較為寬容,而非對 Argon。

• 每百萬個 Token 的標價 — 相同。兩者皆為 $2.00 輸入 / $10.00 輸出。快取讀取是唯一差異:Argon 為 $0.10,Sol 為 $0.20。

• 每個索引任務的成本——Gemini 4 Argon 為 $1.99,對比 GPT-6 Sol 的 $1.05。儘管每 token 成本相同,Argon 每個任務的成本大約是兩倍。

• 執行完整套件的成本 — Gemini 4 Argon 為 $2,407,相較於 GPT-6 Sol 的 $1,546。

• 實測輸出速度——GPT-6 Sol 為每秒 77.0 個 token,Gemini 4 Argon 則為 48.9,1.6 倍的差距同時反映在延遲與支出上。

在那份清單中,有一行能解釋其餘所有項目,而那不是價格。那是 token 數量。在該指數自身的任務上,Gemini 4 Argon 每項任務大約產生 561,000 個輸出 token;GPT-6 Sol 則大約產生 282,000 個。Argon 為了回答同一個問題,思考時間是兩倍,而在每 token 費率相同的情況下,帳單金額正好是兩倍。

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

為什麼代幣就是價格

這是在任何人為遷移編列預算之前,值得內化的修正,因為直覺往往正好相反。當一個模型的定價與競爭對手相同,卻要消耗兩倍的輸出 token 才能完成任務時,每 token 的價格並不是真正的價格。真正的價格是每 token 價格乘以模型決定花費的 token 數量,而第二個因子是模型本身的特性,不是費率表。

每個任務的利潤率差異極大,這讓情況更糟——你不能套用一個固定乘數就了事:

• Terminal-Bench 4.0 — Argon 每項任務輸出 165,330 個 token,Sol 則為 97,372 個。在這裡,Argon 每項任務花費 $6.78,Sol 為 $4.00,儘管 Argon 得分 57.1%,而 Sol 為 43.9%。

• CritPt — Argon 109,533 tokens,相較於 Sol 的 31,848。token 比例為 3.4 倍,在一項 Sol 實際上得分更高的任務中,30.9% 對 27.1%。

• GDPval — Argon 為 74,571 個 token,Sol 則為 41,567 個;每項任務 1.82 美元,對比 1.32 美元。

• Omniscience — 938 對 2,662 的 token 比率,對 Argon 有利,每項任務 $0.010,相較於 Sol 的 $0.027。唯一一個方向翻轉的任務家族。

• 長上下文推理——Argon 2,197 個 token 對比 Sol 的 954,也是這套測試套件中唯一一項 Sol 在分數上明顯勝出的任務,83.7% 對 79.7%。

CritPt 是更具啟發性的那個。一個模型在同一道問題上消耗三倍半的 token,卻產出稍微更差的答案,這不是能力問題,而是花錢習慣的問題。Argon 的推理很長,而在某些任務形態中,這種長度會轉化為分數,在另一些任務形態中,它只會轉化為金錢。該指數的 52.6 與 Sol 的 47.5 是總體數據,而總體數據正好掩蓋了這一點。

這五點實際上從何而來

由於指標差距與成本差距的方向相反,因此值得了解是哪些任務分別驅動了這兩者。

• Terminal-Bench 4.0 — Gemini 4 Argon 57.1% 對上 GPT-6 Sol 43.9%。這是 Argon 最大的單一勝差,也是與長時程代理式編碼最為接近的任務系列。

• 全知性 — Gemini 4 Argon 42.4 對上 GPT-6 Sol 27.1。在事實覆蓋率上相差十五分,是整套測試中比例最大的差距。

• AutomationBench-AA — Gemini 4 Argon 77.5% 對比 GPT-6 Sol 61.6%。

• SciCode — Gemini 4 Argon 61.8% 對比 GPT-6 Sol 57.6%。

• 人類最終考試 — Gemini 4 Argon 57.1% 對比 GPT-6 Sol 47.9%。

• GDPval — Gemini 4 Argon 1,611 對 GPT-6 Sol 1,487。

• ApexAgents / AA-Briefcase —— GPT-6 Sol 的 1,482.78 Elo 對上 Argon 的 1,493.84,這 11 分的差距落在已公布的信賴區間之內,應判定為平手。

• 長上下文推理 — GPT-6 Sol 83.7%,相較於 Gemini 4 Argon 79.7%。這是 Sol 唯一明顯的勝利。

• CritPt — GPT-6 Sol 30.9% 對上 Gemini 4 Argon 27.1%。Sol 再次以些微差距勝出。

所以重點並不是「Argon 比較好」。而是 Argon 在它發布資料一開始強調的兩件事上更強——端到端的商業任務執行,以及長時程的軟體工程——而 Sol 在偏學術風格的推理階梯上,以及長時間維持上下文連貫性方面,則是持平或領先。對於工作量是帶有 400K token 提示的檢索管線的讀者來說,Sol 同時是更好的模型,也是更便宜的模型,這是個不尋常卻很舒服的處境。

比基準討論更歷久不衰的規格差異

• 最大輸出 — Gemini 4 Argon 單一軌跡可達 1,000,000 個 token,Google 稱其為業界最大,並較前一代的 64K 上限有所提升。GPT-6 Sol 為 128,000 個 token。

• 上下文視窗 — GPT-6 Sol 的廠商規格卡標示約 1,050,000 個 token;Argon 則為 1,000,000。Artificial Analysis 透過其測試框架測得 Sol 為 872,000 個 token,這是測試框架的測量值,而非規格卡上的數字——請將規格卡視為規格本身,並把測試框架的數字視為評估者實際檢驗的結果。

• 輸入模態——兩者都接受文字、圖像和檔案。Argon 的發布資料也著重於長影片理解,其中 Google 聲稱在 LVBench 上達到 91.7%,並稱其為最先進水準;那是廠商自行報告的數字,目前尚無獨立評測榜單重現該結果。

• 視訊輸入 — 偏軟。Artificial Analysis 的圖表將 Argon 標示為停用視訊輸入,並在推出時明確提及視訊;而 Sol 的規格卡則完全未列出視訊。如果視訊是你工作流程中的關鍵環節,這兩張卡都無法給你定論,你應該先測試再進行架構設計。

• 推理強度 — Sol 在 API 上提供可設定的強度(從 none 到 max,預設為 medium),且其評測設定為 max。Argon 的評測設定為 high;尚未有人在其最高設定下發表過同一套測試套件。

100 萬 token 的輸出上限,是真正可能改變架構、而不只是改變預算的那一項。你目前為了維持在 128K 上限以下,而拆成十幾個串接呼叫的任何工作——多檔案修補集、完整稽核報告、一次處理的長文件——都會變成一次呼叫,讓代理迴圈能遺失狀態的地方更少。這是否值得付出兩倍的每任務成本,完全取決於你是否真的有那類工作負載。如果有,那大概就值得。如果你的呼叫只是分類後回傳,那就是把錢花在沒人會用到的餘裕上。

無人能及的努力設定,以及它為何重要

有一個但書值得獨立成段,因為這關乎把這五點的指數差距解讀為能力差異。Artificial Analysis 將 Gemini 4 Argon 列在其 {{2}}high{{/2}}{{3}} 推理強度設定,而 GPT-6 Sol 則列在 {{/3}}{{4}}max{{/4}}{{5}} 設定。這兩者並不是兩把梯子上的同一級,而這種不匹配的方向很有意思:Sol 是在其最昂貴的設定下運行,而 Argon 則是在中等設定下運行。{{/5}}high 推理強度設定,而 GPT-6 Sol 則列在 max 設定。這兩者並不是兩把梯子上的同一級,而這種不匹配的方向很有意思:Sol 是在其最昂貴的設定下運行,而 Argon 則是在中等設定下運行。

接下來有兩種解讀,而數據無法分辨何者為真。要嘛 Argon 在 max之下會拿下高於 52.6 的分數——但每項任務也會消耗超過 561,000 個 token,成本超過 $1.99——要嘛它拿到的分數大致相同,而這就意味著在這套測試套件上,努力程度旋鈕並沒有發揮太大作用。目前沒有任何已發表的執行結果能給出定論。任何把 52.6 當成 Argon 上限來引用的人,引用的是某個配置,而非模型本身,而且那個配置還是其廠商選擇優先發表的那一個。

同樣的邏輯也適用於 Sol 的 47.5,只是方向相反:max 是其階梯的頂端,因此這個數字更接近上限而非下限。在相同努力下的一場公平對決,可能縮小差距,也可能翻轉成本比較,因為 max 所消耗的 token,正是每百萬個要價 10 美元的 token。

可用性分支,它決定實際答案

Gemini 4 Argon 尚未正式全面推出。Google 的公告表示,它正透過 Fairwind Program 向一群受信任的網路防禦人員逐步推出;該公司正在參與美國政府自願性的發布前模型存取流程;而對開發者、企業與消費者的一般開放將「儘快」到來,並先從付費 API 客戶與 Google AI Ultra 訂閱者開始。沒有模型識別碼、沒有端點、沒有配額,也沒有日期。它不在任何公開 API 上,包括我們自己的 API 在內——查看 API 目錄會出現 404,因為它在那裡還不存在。

GPT-6 Sol 是一款可直接呼叫的產品。在 OrcaRouter 上,它是openai/gpt-6-sol,與目錄中其他200 多款模型使用同一個 OpenAI 相容端點,並以 OpenAI 的定價原樣轉售、零加成,因此上方所述的 $2/$10,以及 272,000 詞元長上下文的 $4/$15 級距,才是你實際支付的價格,而非價目表上的說法。跨供應商的自動容錯移轉可涵蓋路由在執行途中退化的情況,而路由 DSL 能讓單一應用程式把便宜的分類流量送往較小的模型,並把困難的推理流量送往 Sol,無須第二個 SDK。

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

最後那個安排,對大多數團隊來說,是這個比較中誠實的答案。支持 Argon 的成本論點確實成立,但有條件:僅限於長時間跨度代理工作主導的工作負載;反對它的成本論點在其他每一種工作負載上都成立;而且這個月你无论如何也買不到它。便宜的做法是現在就建立評估測試框架——你自己的提示、你自己的評分,在幾種投入程度設定下對 Sol 跑測試——這樣當 Argon 觸及付費 API 客戶時,你對一個其他人屆時都會根據排行榜來回答的問題,已經有了有實測依據的答案。

什麼能讓它塵埃落定

有三件事,依它們能多大程度左右最終判斷來排序。Argon 以真正、非導入推廣價的價格正式全面上市——「導入」這個詞意味著 $2/$10 可能變動,而 Google 自己的順序把付費 API 客戶放在最前面,所以推出後首次公布的費率才是觀察重點。一份已公開的 Artificial Analysis 對 Argon 在最高 effort 設定下的測試結果,這將說明 52.6 是天花板,還是只差毫釐。還有一項對 DeepSWE v1.1 分數的獨立重現——Google 聲稱 77.9%,並稱其為新的最佳水準;截至今日,這是由廠商自行報告,且尚未在 Google 之外被重現。

在那之前,這種區分乾淨俐落,還略帶諷刺。GPT-6 Sol 是驗證得更充分的模型、速度更快的那個、每完成一項任務成本更低的那個,也是你今天下午就能呼叫的那個。Gemini 4 Argon 則是在自家廠商選擇公布的排行榜上得分更高的模型,實際使用的成本大約是兩倍,而且尚未開賣。在兩者之間做選擇,並不是對能力的判斷。這是在判斷,那兩句話之中,哪一句更符合你這個月的情況。

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新