主視覺標題卡寫著「Gemini 4 Argon vs GPT-6 Astra」,搭配一個標籤寫著「指數 52.6 vs 52.7」,以及一個標籤寫著「每項指數任務成本 $1.99 vs $3.26」,頁尾一行寫著「Argon 數據由廠商提供;指數與成本數據依據 Artificial Analysis,2026-09-30。」
Guides & Insights

Gemini 4 Argon 對上 GPT-6 Astra:在指數上難分軒輊,價格則下調三分之二

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個前沿模型,在 Artificial Analysis 的 Intelligence Index 上僅相差 0.11 分。Gemini 4 Argon 得分 52.56。GPT-6 Astra 得分 52.67。如果你必須根據可量測的通用能力在兩者之間做選擇,你可以擲硬幣決定,而且這兩個分數之間的差距比任一方信賴區間都還小。這在一個前十名模型總共只橫跨約十五分的市場裡,是確實罕見的情況;也讓這成為 Gemini 4 Argon 所有對決中最容易推論的一場,因為能力論點還沒開始就已經結束,剩下的只有經濟性與可及性。

不過,這兩者並非雙胞胎。Argon 由 Google DeepMind 於 2026-09-30 發表,並分階段推出,率先開放給 Fairwind 計畫中受信任的網路防禦人員。GPT-6 Astra 已於九月初推出——我們的目錄卡標註日期為 2026-09-04,Artificial Analysis 則列為 2026-09-03——而且它是現在就能使用的上線路徑,你今天下午就能呼叫,輸入每百萬詞元 $10、輸出每百萬詞元 $50,具備 1,050,000 詞元上下文窗口與 128,000 詞元輸出上限。這兩款模型中,只有一款的價格是你今天就能實際被計費的。

0.11 分的差距在哪裡是真實的,在哪裡只是雜訊

指數是一項複合指標,因此兩個在綜合指標上打成平手的模型,可能在組成部分上有明顯差異。這裡,各組成部分大多一致,只有三個值得點名的例外。

• Terminal-Bench 4.0 — GPT-6 Astra 59.1% 對上 Gemini 4 Argon 57.1%。Astra 微幅領先。

• 長上下文推理 — GPT-6 Astra 80.7% 對比 Gemini 4 Argon 79.7%。

• GPQA Diamond — GPT-6 Astra 96.1%。Argon 未在此排行榜公布任何數據。

• CritPt — GPT-6 Astra 31.7%,對比 Gemini 4 Argon 27.1%。

• SciCode — Gemini 4 Argon 61.8% 對上 GPT-6 Astra 56.5%。

• 人類最後的考試 — Gemini 4 Argon 57.1% 對上 GPT-6 Astra 54.7%。

• AutomationBench-AA — Gemini 4 Argon 77.5% 對比 GPT-6 Astra 68.5%。

• GDPval — Gemini 4 Argon 1,611 對比 GPT-6 Astra 1,542。

• 全知 — GPT-6 Astra 43.4 對上 Gemini 4 Argon 42.4。

• ITBench-SRE — GPT-6 Astra 48.6%,相較於未公布的 Argon 數據。

• 輸出速度 — GPT-6 Astra 每秒 51.2 個 token,相較於 Gemini 4 Argon 的 48.9。實際上持平。

• 索引測試框架上的首字元延遲——Gemini 4 Argon 為 2.8 秒,GPT-6 Astra 則為 320.2 秒。

Astra 在科學選擇題推理、臨界點物理問題以及 SRE 基準測試上具有優勢。Argon 在科學程式編寫、較困難的端到端任務集,以及具 GDP 價值的工作上具有優勢。兩者的領先幅度都不足以單獨作為遷移的依據。

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

延遲那一行則是另一回事。首個 token 要 320 秒,代表在產出任何內容之前有五分鐘半的沉默,相較之下 Argon 不到三秒。兩者衡量的是同一件事——在 Artificial Analysis 的索引測試執行中,首個 chunk 的時間——因此可以互相比較。Astra 的推理始終開啟,並可從低到最大努力程度進行設定;在困難任務上以最大努力程度執行時,確實會在開口前思考數分鐘。這算不算是缺陷,完全取決於你的介面。對批次工作來說,這毫無成本。但對任何有使用者盯著載入轉圈圖示的場景而言,這是這兩個模型之間最容易被使用者看見的差異,比頁面上任何基準測試差距都來得大。

價格步驟,這才是真正的主題

這就是勝負分曉的地方,而它分曉的方式很容易被錯誤建模,因為 Astra 的費率表有三個看起來很相似的等級。

• 標準,最高 272,000 個輸入 token — GPT-6 Astra 輸入 $10.00 / 輸出 $50.00,快取讀取 $1.00,快取寫入 $12.50。

• 長上下文,超過 272,000 個輸入 token — GPT-6 Astra 輸入 $20.00 / 輸出 $75.00,快取讀取 $2.00。整個請求都會按較高費率重新計價,而不只是超出的部分:輸入 2 倍、輸出 1.5 倍。

• 快速模式 — 適用標準費率的 2 倍,因此輸入 $20.00/輸出 $100.00。這個 $100 數字常被引用得彷彿它是長上下文費率;但其實不是。

• Gemini 4 Argon — 以優惠推廣價計算,輸入 $2.00/輸出 $10.00 為均一價,快取輸入為 $0.10,且未公布分段價格,也未公布快速層級。

所以 Argon 在輸入方面比 Astra 的標準層級便宜五倍,在輸出方面也便宜五倍,而在超過 272K 的輸入上則便宜十倍。兩項獨立的成本測量從不同方向得出相同結論:Artificial Analysis 將 Argon 的每項索引任務成本定為 1.99 美元,而 Astra 為 3.26 美元;運行整個索引需 2,407 美元,而 Astra 為 5,324 美元。每任務比率小於每詞元比率,原因與對比 DeepSeek 時相同——Argon 完成任務所用的詞元較少——但這個比率仍然達到 1.6 倍。

Vals 的 GDP 加權排行榜講述了同一則故事的第三個版本:Argon 以 68.90%、每次執行 $15.68 位居第一,Astra 以 63.13%、$18.46 排名第六。Astra 在那裡價格更高,得分卻更低。Google 的資料明確指出,該定價是 introductory rate( introductory 費率),而這個詞意味著它可能變動;誠實的解讀是,Argon 的價格優勢確實存在,但其能否永久維持並無保證。

兩個比基準測試更具決定性的架構事實

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

先談輸出上限。Gemini 4 Argon 在單一軌跡中最多可生成 1,000,000 個 token——Google 的公告特別指出,這是相較前一代 64K 的擴展。GPT-6 Astra 的上限則是 128,000。兩者的上下文視窗都維持在約一百萬個 token,所以這純粹是模型一次能寫多少的問題。對於長篇生成、完整修補檔的程式碼變更,或一次完成的文件起草而言,這代表單次呼叫可產出的內容有八倍差距。至於聊天、擷取與簡短的代理步驟,兩者的上限實際上都是無限,這項差異對你毫無成本。

其次是模態,而在這一點上,優勢在某方面正好反了過來。GPT-6 Astra 接受文字、圖像和檔案。Gemini 4 Argon 接受文字、圖像、影片和檔案,而 Google 的發布資料特別主打長影片理解——一項廠商自行報告的 LVBench 數字 91.7%。如果你的管線會輸入影片,Astra 並不是替代方案。Argon 公布的模態清單中也沒有列出音訊,所以不要假設這次升級會涵蓋它。

實際該怎麼做

Astra 已推出,而 Argon 則否,這就決定了接下來一個月的大部分決策。不浪費任何功夫的具體做法是:如果你的工作負載需要一個全天候運作、具備強大科學準確度與經過驗證的代理式實績的推理模型,那就建構在 GPT-6 Astra 之上,把模型名稱留在設定中,並依據 Astra 的實測行為、而非樂觀預期來設定你的用戶端逾時——一次五分鐘的首個 token 執行會觸發預設的 60 秒逾時,而一個在 300 秒時中斷的串流看起來就像服務中斷。如果你在輸入 token 超過 272K 時對成本敏感,請在承諾前明確地對重新定價進行建模,因為這個級距會讓輸入翻倍,並在一個邊界上將輸出提高一半。

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

有趣的中間路線是,你不必只挑選單一預設值。Astra 與 Argon——當 Argon 正式推出時——是同一種形態的模型,針對同一類工作,這讓它們成為自然的容錯移轉夥伴,而非競逐同一位置的競爭者。在 OrcaRouter 上,openai/gpt-6-astra 已以供應商定價上線,零加價,與其他 200 多個模型使用相同的 OpenAI 相容端點,並具備跨供應商的自動容錯移轉,以及一套路由 DSL,可在單一金鑰上表達主要與備援的配置。當 Argon 以 Google 公布的任何 id 加入目錄時,切換只需要改一個字串——不必第二份合約、不必整合工作,也不必重建你在這段期間圍繞 Astra 所打造的任何東西。

什麼能永久打破平局?

一份在優惠期結束後公布的 Argon 價格,以及對 Google 代理式能力宣稱的獨立重現——77.9% 的 DeepSWE v1.1 數字與 68% 的 CWE-bench v1 結果皆為廠商自行報告,兩者背後都沒有外部實測支撐。任一項都可能讓 Argon 大幅上漲或下跌,因為若成本優勢最終只是暫時的,0.11 點的指數領先根本不足以緩衝 1.6 倍的成本劣勢;而若 Google 維持優惠費率,且 Astra 的長上下文層級在實際生產環境中造成的衝擊比預期更猛烈,那這也算不上什麼劣勢。

目前來說:就實測的通用能力而言,這兩者只是同一個模型裝在兩個外殼裡。Astra 是有著實際可用路徑、已知價格級距,以及五分鐘思考停頓的那個。Argon 則是有較便宜方案卡、但沒有端點的那個。這個平手是真的,而且其中一邊買得到。