
Gemini 4 Argon 對上 GPT-6 Astra:在指數上難分軒輊,價格則下調三分之二
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 144 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
兩個前沿模型,在 Artificial Analysis 的 Intelligence Index 上僅相差 0.11 分。Gemini 4 Argon 得分 52.56。GPT-6 Astra 得分 52.67。如果你必須根據可量測的通用能力在兩者之間做選擇,你可以擲硬幣決定,而且這兩個分數之間的差距比任一方信賴區間都還小。這在一個前十名模型總共只橫跨約十五分的市場裡,是確實罕見的情況;也讓這成為 Gemini 4 Argon 所有對決中最容易推論的一場,因為能力論點還沒開始就已經結束,剩下的只有經濟性與可及性。
不過,這兩者並非雙胞胎。Argon 由 Google DeepMind 於 2026-09-30 發表,並分階段推出,率先開放給 Fairwind 計畫中受信任的網路防禦人員。GPT-6 Astra 已於九月初推出——我們的目錄卡標註日期為 2026-09-04,Artificial Analysis 則列為 2026-09-03——而且它是現在就能使用的上線路徑,你今天下午就能呼叫,輸入每百萬詞元 $10、輸出每百萬詞元 $50,具備 1,050,000 詞元上下文窗口與 128,000 詞元輸出上限。這兩款模型中,只有一款的價格是你今天就能實際被計費的。
0.11 分的差距在哪裡是真實的,在哪裡只是雜訊
指數是一項複合指標,因此兩個在綜合指標上打成平手的模型,可能在組成部分上有明顯差異。這裡,各組成部分大多一致,只有三個值得點名的例外。
• Terminal-Bench 4.0 — GPT-6 Astra 59.1% 對上 Gemini 4 Argon 57.1%。Astra 微幅領先。
• 長上下文推理 — GPT-6 Astra 80.7% 對比 Gemini 4 Argon 79.7%。
• GPQA Diamond — GPT-6 Astra 96.1%。Argon 未在此排行榜公布任何數據。
• CritPt — GPT-6 Astra 31.7%,對比 Gemini 4 Argon 27.1%。
• SciCode — Gemini 4 Argon 61.8% 對上 GPT-6 Astra 56.5%。
• 人類最後的考試 — Gemini 4 Argon 57.1% 對上 GPT-6 Astra 54.7%。
• AutomationBench-AA — Gemini 4 Argon 77.5% 對比 GPT-6 Astra 68.5%。
• GDPval — Gemini 4 Argon 1,611 對比 GPT-6 Astra 1,542。
• 全知 — GPT-6 Astra 43.4 對上 Gemini 4 Argon 42.4。
• ITBench-SRE — GPT-6 Astra 48.6%,相較於未公布的 Argon 數據。
• 輸出速度 — GPT-6 Astra 每秒 51.2 個 token,相較於 Gemini 4 Argon 的 48.9。實際上持平。
• 索引測試框架上的首字元延遲——Gemini 4 Argon 為 2.8 秒,GPT-6 Astra 則為 320.2 秒。
Astra 在科學選擇題推理、臨界點物理問題以及 SRE 基準測試上具有優勢。Argon 在科學程式編寫、較困難的端到端任務集,以及具 GDP 價值的工作上具有優勢。兩者的領先幅度都不足以單獨作為遷移的依據。

延遲那一行則是另一回事。首個 token 要 320 秒,代表在產出任何內容之前有五分鐘半的沉默,相較之下 Argon 不到三秒。兩者衡量的是同一件事——在 Artificial Analysis 的索引測試執行中,首個 chunk 的時間——因此可以互相比較。Astra 的推理始終開啟,並可從低到最大努力程度進行設定;在困難任務上以最大努力程度執行時,確實會在開口前思考數分鐘。這算不算是缺陷,完全取決於你的介面。對批次工作來說,這毫無成本。但對任何有使用者盯著載入轉圈圖示的場景而言,這是這兩個模型之間最容易被使用者看見的差異,比頁面上任何基準測試差距都來得大。
價格步驟,這才是真正的主題
這就是勝負分曉的地方,而它分曉的方式很容易被錯誤建模,因為 Astra 的費率表有三個看起來很相似的等級。
• 標準,最高 272,000 個輸入 token — GPT-6 Astra 輸入 $10.00 / 輸出 $50.00,快取讀取 $1.00,快取寫入 $12.50。
• 長上下文,超過 272,000 個輸入 token — GPT-6 Astra 輸入 $20.00 / 輸出 $75.00,快取讀取 $2.00。整個請求都會按較高費率重新計價,而不只是超出的部分:輸入 2 倍、輸出 1.5 倍。
• 快速模式 — 適用標準費率的 2 倍,因此輸入 $20.00/輸出 $100.00。這個 $100 數字常被引用得彷彿它是長上下文費率;但其實不是。
• Gemini 4 Argon — 以優惠推廣價計算,輸入 $2.00/輸出 $10.00 為均一價,快取輸入為 $0.10,且未公布分段價格,也未公布快速層級。
所以 Argon 在輸入方面比 Astra 的標準層級便宜五倍,在輸出方面也便宜五倍,而在超過 272K 的輸入上則便宜十倍。兩項獨立的成本測量從不同方向得出相同結論:Artificial Analysis 將 Argon 的每項索引任務成本定為 1.99 美元,而 Astra 為 3.26 美元;運行整個索引需 2,407 美元,而 Astra 為 5,324 美元。每任務比率小於每詞元比率,原因與對比 DeepSeek 時相同——Argon 完成任務所用的詞元較少——但這個比率仍然達到 1.6 倍。
Vals 的 GDP 加權排行榜講述了同一則故事的第三個版本:Argon 以 68.90%、每次執行 $15.68 位居第一,Astra 以 63.13%、$18.46 排名第六。Astra 在那裡價格更高,得分卻更低。Google 的資料明確指出,該定價是 introductory rate( introductory 費率),而這個詞意味著它可能變動;誠實的解讀是,Argon 的價格優勢確實存在,但其能否永久維持並無保證。
兩個比基準測試更具決定性的架構事實

先談輸出上限。Gemini 4 Argon 在單一軌跡中最多可生成 1,000,000 個 token——Google 的公告特別指出,這是相較前一代 64K 的擴展。GPT-6 Astra 的上限則是 128,000。兩者的上下文視窗都維持在約一百萬個 token,所以這純粹是模型一次能寫多少的問題。對於長篇生成、完整修補檔的程式碼變更,或一次完成的文件起草而言,這代表單次呼叫可產出的內容有八倍差距。至於聊天、擷取與簡短的代理步驟,兩者的上限實際上都是無限,這項差異對你毫無成本。
其次是模態,而在這一點上,優勢在某方面正好反了過來。GPT-6 Astra 接受文字、圖像和檔案。Gemini 4 Argon 接受文字、圖像、影片和檔案,而 Google 的發布資料特別主打長影片理解——一項廠商自行報告的 LVBench 數字 91.7%。如果你的管線會輸入影片,Astra 並不是替代方案。Argon 公布的模態清單中也沒有列出音訊,所以不要假設這次升級會涵蓋它。
實際該怎麼做
Astra 已推出,而 Argon 則否,這就決定了接下來一個月的大部分決策。不浪費任何功夫的具體做法是:如果你的工作負載需要一個全天候運作、具備強大科學準確度與經過驗證的代理式實績的推理模型,那就建構在 GPT-6 Astra 之上,把模型名稱留在設定中,並依據 Astra 的實測行為、而非樂觀預期來設定你的用戶端逾時——一次五分鐘的首個 token 執行會觸發預設的 60 秒逾時,而一個在 300 秒時中斷的串流看起來就像服務中斷。如果你在輸入 token 超過 272K 時對成本敏感,請在承諾前明確地對重新定價進行建模,因為這個級距會讓輸入翻倍,並在一個邊界上將輸出提高一半。

有趣的中間路線是,你不必只挑選單一預設值。Astra 與 Argon——當 Argon 正式推出時——是同一種形態的模型,針對同一類工作,這讓它們成為自然的容錯移轉夥伴,而非競逐同一位置的競爭者。在 OrcaRouter 上,openai/gpt-6-astra 已以供應商定價上線,零加價,與其他 200 多個模型使用相同的 OpenAI 相容端點,並具備跨供應商的自動容錯移轉,以及一套路由 DSL,可在單一金鑰上表達主要與備援的配置。當 Argon 以 Google 公布的任何 id 加入目錄時,切換只需要改一個字串——不必第二份合約、不必整合工作,也不必重建你在這段期間圍繞 Astra 所打造的任何東西。
什麼能永久打破平局?
一份在優惠期結束後公布的 Argon 價格,以及對 Google 代理式能力宣稱的獨立重現——77.9% 的 DeepSWE v1.1 數字與 68% 的 CWE-bench v1 結果皆為廠商自行報告,兩者背後都沒有外部實測支撐。任一項都可能讓 Argon 大幅上漲或下跌,因為若成本優勢最終只是暫時的,0.11 點的指數領先根本不足以緩衝 1.6 倍的成本劣勢;而若 Google 維持優惠費率,且 Astra 的長上下文層級在實際生產環境中造成的衝擊比預期更猛烈,那這也算不上什麼劣勢。
目前來說:就實測的通用能力而言,這兩者只是同一個模型裝在兩個外殼裡。Astra 是有著實際可用路徑、已知價格級距,以及五分鐘思考停頓的那個。Argon 則是有較便宜方案卡、但沒有端點的那個。這個平手是真的,而且其中一邊買得到。
