主視覺標題卡寫著「GPT-6 對比 Gemini 4 Argon」,其中一枚標籤寫著「Argon:自 2026-09-30 起分階段向安全合作夥伴推出」,兩個指數標籤分別寫著「GPT-6 Astra 52.7」與「Gemini 4 Argon 52.6」,頁尾則寫著「指數數據依據 Artificial Analysis v4.3.2;Argon 規格由廠商提供,且尚未開放購買。」OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-6 對決 Gemini 4 Argon:價目表上的模型與等候名單上的模型幾乎旗鼓相當

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

目前前沿排行榜上最接近的一對模型,並不是你買得到的一對。Gemini 4 Argon 在 Artificial Analysis 的 Intelligence Index v4.3.2 上得分 52.6。OpenAI 的旗艦模型 GPT-6 Astra 得分 52.7。這是在十項評估中僅十分之一分的差距,而這兩個數字都來自同一套測試的同一修訂版本。這是整組中榜首位置最緊咬的一對。

那個數字帶有某種對稱性,但在可用性上完全沒有。Google 於 2026 年 9 月 30 日宣布 Gemini 4 Argon,公布的導入價格為每百萬個輸入 token 2.00 美元、每百萬個輸出 token 10.00 美元,並將先透過 Google 稱為 Fairwind 的計畫,向一群具名的網路防禦人員推出。它沒有公開的 API 模型識別碼、沒有正式開放使用的日期,也沒有客戶今天能呼叫的端點。GPT-6 Astra 自 2026 年 9 月 3 日起即可購買,而截至 2026 年 10 月 7 日,ChatGPT 每週超過 12 億名使用者所導向的也是 GPT-6 系列——且驅動該波部署付費層級的是 GPT-6 Sol,不是 Astra。

所以這個比較是真實的,但它不對稱的方式會改變它應該被解讀的方式。Argon 的數字描述的是一個受控推行中的模型。GPT-6 的數字描述的則是一個有價目表的產品。以下所有內容都成立於「如果你買得到的話」這個前提,而以下沒有任何內容能回答「你該不該轉換」,因為目前根本還沒有東西可以轉換過去。

對於存在的對應者,實際上已知什麼?

先從實際存在的那一方開始,因為這項比較只有一半具有可操作性。GPT-6 推出時分為三個層級,而這裡只有其中兩個要緊:

• GPT-6 Astra — 旗艦款,模型 id gpt-6-astra,2026 年 9 月 3 日發布,1,050,000 token 上下文,128,000 token 輸出,支援文字/圖像/檔案輸入,effort 從 low 到 max,每百萬輸入 token $10.00、輸出 $50.00,當輸入超過 272,000 token 時,整筆請求改以 $20.00/$75.00 計價
• GPT-6 Sol — 中階款,2026 年 9 月 22 日發布,上下文與輸出上限相同,$2.00/$10.00,長上下文級距為 $4.00/$15.00,OpenAI 於 2026 年 10 月 7 日將其納入 ChatGPT Plus、Pro、Business 與 Enterprise
• GPT-6 Luna — 入門款,$0.10/$0.50,供應 ChatGPT Free 與 Go

Argon 在那份清單上的部分只有一行。Google 的公告給了首發價格、一個能力定位——真實世界的程式開發、企業知識工作與網路防禦——以及一份推出計畫。它沒有給出模型字串、脈絡視窗、最大輸出、快取輸入費率、淘汰時程,也沒有給出更廣泛開放使用的日期。缺少模型識別碼是最實際的問題:你在網路上看到任何引用 Gemini 4 Argon 模型字串的程式碼範例,都是在猜的,因為根本沒有字串可引用。

唯一完全可比的衡量標準,以及它隱藏了什麼

一個衡量指標就能讓你拿 Argon 與 GPT-6 模型相比,而且完全不帶任何「如果」但書,因為 Artificial Analysis 兩者都跑過:在評估套件上產出一個完整答案的成本。

• 每完成一項索引任務的成本 — Gemini 4 Argon $1.99 vs GPT-6 Astra $3.26,差距達 1.6 倍,由 Argon 勝出
• 整套測試所產生的輸出 token 數 — Gemini 4 Argon 112.8M vs GPT-6 Astra 108.8M,實際上平分秋色
• 智慧指數 v4.3.2 — Gemini 4 Argon 52.6 vs GPT-6 Astra 52.7,可謂勢均力敵
• 標示價格 — Argon 每 1M 為輸入 $2.00、輸出 $10.00,屬導入期優惠價,而 Astra 則為 $10.00/$50.00 的標準價
• 上下文視窗 — GPT-6 Astra 1,050,000 tokens vs Argon 未公布

再讀一次第一行,因為它是這頁上唯一的驚喜。Argon 的牌價是 Astra 的五分之一,而它在同一套測試集上的每項任務成本低了 39%。一個得分與旗艦模型相同、輸入費率卻只有五分之一的模型,如果能這麼說的話,會是本季的頭條大事。

A two-column comparison scoreboard for GPT-6 Astra and Gemini 4 Argon, showing GPT-6 Astra at an Intelligence Index of 52.7, $3.26 per index task and a 1,050,000-token context window, against Gemini 4 Argon at 52.6, $1.99 and dimensions marked not published, with prices of $10.00/$50.00 against a stated introductory $2.00/$10.00 and an availability row reading phased rollout only. A footer reads "Index figures per Artificial Analysis v4.3.2; Argon figures vendor-stated, no purchase path."

第二行說明了為何第一行不像表面上那麼誇張,而且它與常見的冗長度論點方向相反。Argon 與 Astra 為了產生幾乎完全相同的分數,寫出的 token 數量也幾乎完全相同。並沒有冗長度差距可以解釋成本落差——$1.27 的差額來自費率表,而不是來自某個模型在長篇大論。這使它成為這批之中比大多數都更乾淨的比較,也讓缺乏可用性成為唯一阻擋 Argon 獲得直接推薦的因素。

Google 自家的表格並非獨立的那一份

Google 發布了一份 Argon 的發表對照表,將它與 GPT-6 Astra 在十九項基準測試上互相比較。若單看那張表,Argon 贏了十四項,Astra 贏了四項,一項平手。這是個很驚人的結果,應該謹慎看待:表裡的每一個數字都出自 Google,由 Google 挑選並排序,而且沒有任何一項經過獨立重現。這是 Google 為 Argon 提出的論述——發表對照表本來就是為此而存在——在比較中,它應該被當成一項標明來源的廠商主張,而不是證據。

把它和獨立測試結果對照,整體情況就變了樣。在 Artificial Analysis 的測試套件上,兩者分別以 52.6 和 52.7 打成平手——這遠比 14 比 4 的橫掃所暗示的優勢小得多,而且還是在一個兩家廠商都沒有參與編製的套件上。誠實的總結是:Argon 很可能與 Astra 旗鼓相當,在軟體工程方面甚至可能更勝一籌;廠商自家的表格所想像的差距,比獨立測試發現的更大;而在 Goo​gle 以外的人用 Goo​gle 任務以外的東西來跑之前,這一切都不會有定論。

A screenshot of the top of the Artificial Analysis leaderboard table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings, showing Claude Opus 5.5 (max with fallback) at 58 and $5.98, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, then GPT-6 Astra (max) at 53 and $3.26 on the row immediately above Gemini 4 Argon (high) at 53 and $1.99, with GPT-6 Astra (xhigh) and GPT-6.1 Sol (max) at 52 below them - the near-tie rendered as adjacent rows at the same index.

為什麼一個尚未發布的模型無論如何都值得單獨用一節來介紹

因為 Google 的發布節奏本身就是一種資訊,也指出了下一代 Pro 級產品的走向。Google 在 2026 年全力推出 Flash 級模型——3.5、3.6 與 3.8 Flash 系列、Lite 版本,以及一款針對資安調校的 3.8 Flash——而 Pro 層級則停留在 Gemini 3.1 Pro Preview,這款模型自 2026 年 2 月起就一直處於預覽階段,既沒有正式推出的承諾,也沒有下線日期。Argon 是七個月來最高階產品線的首次動作,而且它優先提供給防禦方,而非開發者。

那樣的排序是一項連貫一致的選擇——網路安全是這樣一種工作負載:具備代理式工具使用與長時程自主性的前沿模型,在其中能展現最清楚、最可衡量的價值;同時也是供應商希望在全面發布前先建立受控群體的工作負載。這並不是模型尚未就緒的證據。這是 Google 把一般可用性視為一般可用性、而非發布日當天就要發生的事的證據,而這正是缺少的模型識別碼與缺少的日期以不同方式所表達的意思。

對開發者而言,後果很簡單:你無法把 Argon 納入規劃。你可以把 GPT-6 Astra 或 GPT-6 Sol 納入規劃,因為兩者都有識別碼、端點、費率表,以及一個已針對該產品線發布退役政策的供應商。一個沒有識別碼的模型,就是一個你無法為其撰寫轉接器的模型。

什麼會改變這個比較?

三件事,只要有任何一件,上述說法便成定論。第一項是模型識別碼——一個確實由 Google 的 API 提供的字串;有了它,應用程式才寫得出來,整合估算也才有意義。第二項是正式推出(GA)日期,這個日期區分了預覽版與正式產品,也正是 Argon 的發布消息完全沒有提及的那個日期。第三項是在並非由 Google 設定的任務上所做的獨立基準測試;由廠商自己編排的測試套件只是一種宣稱,由他人編排的測試套件才是實測。

直到三者全部存在之前,Argon 在比較中的角色是作為上限,而不是作為選項。它的數字告訴你 Gemini Pro 層級正朝哪裡發展,並讓你了解 Google 在最高階產品線有多少價格空間。它們不會告訴你該以什麼作為建置基礎。

Argon 等待時該做什麼

如果你來這裡的原因是 Argon 的數字看起來不錯,那麼有用的做法,是針對你目前實際能呼叫的模型,測試同一類工作負載;而對軟體工程與長時程代理式工作而言,那意味著 GPT-6 Astra。它位於 OrcaRouter 的目錄中,採用 Google 自家的直通定價模式——供應商的 $10.00/$50.00,以及 $20.00/$75.00 的長上下文級距,皆為 0% 加成,因此供應商費率變更會在同一天反映給你,而不是等到下一個帳單週期。GPT-6 Sol 以 $2.00/$10.00 的價格也在其中,而對大多數工作負載來說,它是更划算的選擇:它得分 47.6,Astra 則是 52.7,而且每完成一項任務的成本大約只有三分之一。

路由層正是讓廠商的推出時程得以存續的關鍵。當 Argon 真的取得識別碼時,它不必變成一個遷移專案:一條路由規則可以把一部分流量導向它,或使用模型融合來跑一組評測並比較答案,而 GPT-6 Astra 或 Sol 仍留在它背後作為預設。自動容錯移轉涵蓋了這裡最要緊的情況——處於受控推出階段的模型,正是那種可能被限流或無預警撤下的途徑,而有了備援路徑,這就只會變成一次緩慢的請求,而不是服務中斷。

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the OpenAI vendor label, a 2026-09-04 release date, a 1,050,000-token context window, a 128K-token maximum output, text, image and file input, and pricing of $10.00 per million input tokens and $50.00 per million output tokens.

不該做的是:為了一個沒有端點的模型,圍繞著它的發布表來啟動遷移計畫。與 GPT-6 Astra 的差距只有 0.1 分,價差也確實存在,但兩者都不值得讓你為一個無法向其發送請求的東西重建整合。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新