主視覺標題卡寫著 Gemini 4 Argon 在 FrontierSWE 上:它高喊 Eureka,然後替自己的作業打分,搭配一個寫著 FrontierSWE v2 平均@5 為 55.0% 的標籤、一個寫著「十款模型中排名第三」的標籤,以及一個寫著「每次試驗 129.36 美元」的標籤,頁尾一行寫著 FrontierSWE 數據依據 Proximal Labs 的公開排行榜,2026-09-30。
Guides & Insights

Gemini 4 Argon 在 FrontierSWE 上:它大喊「我發現了!」,然後為自己的作業評分

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 4 Argon 有個個性問題,而這是自 Google 於 2026-09-30 宣布該模型以來,任何人對它說過最有趣的一句話。在超長時程的 FrontierSWE 基準測試中,拿下第三名——落後於 GPT-6 Astra 與 Claude Opus 5.5——的這個模型,讓評測人員留下難忘的印象:它最愛用的詞是「Eureka!」,而且它會花掉二十小時任務預算中的很大一部分,對自己極其嚴苛。那是來自一位基準測試操作者的、近乎洩密性質的單一來源觀察,既不是廠商的主張,也不是發布說明,因此值得精確釐清:它告訴了你什麼,又沒告訴你什麼。上述三個模型,沒有任何一個附有 Argon 的 GA 日期;這項觀察談的是模型在測試框架內的行為,而隨之而來的數字,則是 Argon 在一項 Google 並未自行運行的基準測試上,首度有獨立測量結果。

「Eureka!」這句感嘆實際上到底是什麼

來源是 @nrehiew_ 的貼文,他是一名從事模型評估的工程師,貼文於 2026-09-30 發佈,引用了 Sundar Pichai 的 Gemini 4 Argon 公告。內容重點是三項說法:Argon 是他們在 FrontierSWE 上評估過最有趣的模型;它最喜歡的詞是「Eureka!」;而且它極度自我批判。發文者形容它是相較於先前 Gemini 的一大進步,同時仍保留那種個性,並稱其令人印象深刻。

仔細讀那句話,因為它很容易被過度解讀。那只是某位評估者觀看 agent 軌跡後的印象,不是評分結果,不是已發布的指標,也不是 Proximal Labs——FrontierSWE 的開發與營運者——具名背書的研究發現。排行榜上並沒有「自我批評」這一欄。這番話值得一寫,並不是因為它具權威性,而是因為它是 Google 以外任何人對 Argon 提出的唯一質性解讀;也因為這款模型並未全面開放,這類軌跡目前是唯一能看見它實際行為的方式。

這也正好觸及任何打算把 Argon 當作代理來運行的人所面對的一個真正問題。長時程的程式編寫執行,大多本質上是預算管理問題:一個會打斷自己以重新思考、會為自己的中間成果評分,並且會宣告突破的模型,就是把詞元花在流程上的模型。那究竟是優勢還是負擔,完全取決於自我批判會收斂,還是會陷入迴圈。單一評估者說一句「令人印象深刻」,只是一個資料點,不是答案。

FrontierSWE v2,以及為何第三名的結果才是真正的重點

FrontierSWE 不是那種可以只看標題數字就理解的基準測試。它由 Proximal Labs 打造,並在其儲存庫中描述為一個超長時程的程式設計代理基準,用來測試實作、效能工程與 ML 研究。第 2 版於 2026 年 9 月發布,在原始任務集之外新增了 21 項任務,總計 34 項,並預期代理能持續工作長達二十小時。所有內容都透過 Proximal 自家的測試框架 proximus 執行,該框架建構於 mini-swe-agent 之上,並加入了上下文壓縮、視覺與明確的提交工具。評分方式為 mean@5——每項任務五次嘗試的平均值——而所回報的不確定性範圍,涵蓋每項任務最差執行表現的平均值到最佳執行表現的平均值。

那套方法論對於誠實解讀 Argon 的那一列來說很重要:

• 分數 — Gemini 4 Argon 55.0% mean@5,±9.9,相較之下 GPT-6 Astra 為 65.5%、Claude Opus 5.5 為 62.3%

• 分佈範圍 — Argon 的多次執行區間從 44.5%(worst@5)到 64.3%(best@5),此範圍在高標端與 Opus 5.5 的 52.0%–71.5% 重疊,但與 Astra 的 55.1%–73.0% 則完全不重疊

• 每次試驗成本 — Argon $129.36,Opus 5.5 $98.87,Astra $1,029.65

• 每次試驗的實際耗時——Argon 10.6 小時,Opus 5.5 14.2 小時,Astra 12.1 小時

你首先注意到的是,Argon 排在第三,而且在分數上跟第二名差很遠。第二件事——這件事才該決定你在不在意——就是:在這項基準測試上,Argon 被 Claude Opus 5.5 嚴格支配。Opus 5.5 得分更高(62.3% 對 55.0%),而且每次試驗成本更低($98.87 對 $129.36)。在這裡,Argon 沒有任何一個面向能勝出。它唯一的優勢是時間:10.6 小時對上 Opus 5.5 的 14.2 小時;如果你是按實際耗時(wall-clock)而非按 token 付費,這優勢是真的,但如果你是按每次試驗的預算付費,那就無關緊要。

Proximal 自家的排行榜在 Argon 那一列旁附了一則註腳,所有引用這個數字的人都應該照樣引述:「Gemini 4 Argon:由於採用非正式生產環境的設定,快取命中率低上許多。」這是評估者在點明,他們執行 Argon 時所用的組態並非正式生產部署會採用的組態,這會灌大其成本,也很可能灌大其延遲。這是專門針對成本數字所加的但書,也正是 $129.36 應被解讀為上限值、而非價目表的原因。

Google 自家圖表並未顯示的數字

這裡正是消息來源變得真正有意思的地方,也是大多數關於這個結果的報導會出錯的地方。Google 的公告文章包含一張基準測試圖表,其中有一列 FrontierSWE v2。那一列顯示 GPT-6 Astra 65.5%、Claude Fable 5.1 56.3%、Claude Opus 5.5 62.3%。Gemini 4 Argon 不在其中。Proximal 的即時排行榜顯示 Astra 為 65.5%、Opus 5.5 為 62.3%——數字相同——但把 Claude Fable 5.1 列為 56.5%,而非 56.3%,並列出 Gemini 4 Argon 為 55.0%。

遺漏的原因並不神祕,Google 自己也這麼說:伴隨其評估套件的方法論註記指出,FrontierSWE 的結果是取自 Proximal 官方公開的排行榜。Google 並未自行計算這項基準。他們引用的第三方與我們所引用的是同一個,而該第三方所公布的唯一 Argon 數據就是 55.0%。因此,誠實的解讀是:Argon 的 FrontierSWE 分數是一項真正獨立的量測——由 Proximal 在其測試框架、在其任務上執行——而結果是 Argon 落後於兩家競爭對手。

谷歌圖表中的其他所有內容都是供應商自行報告的,你心裡應該這樣標記:在 Vals Index 上,Argon 的 63.1% 對上 Opus 5.5 的 67.0%;AutomationBench 的 41.4% 對上 Opus 5.5 的 42.5%;Vibe Code Bench 的 89.6% 對上 Astra 與 Opus 5.5 皆為 90.3%;LVBench 的 87.5% 對上 83.7%;CWE-bench v1 的 68.0% 對上 Opus 5.5 的 67.0%。那些都是谷歌用自己挑選的評估項目所做的測試結果。在那張圖裡,FrontierSWE 那一列是讀者唯一能獨立查核的項目,這正是為什麼第三名的結果,比它周圍那種打平或小幅勝出的模式更有分量。

Artificial Analysis 獨立說了些什麼

FrontierSWE 是一個視角。Artificial Analysis 則是另一個,而且它與這個故事的整體輪廓相符。在他們的 Intelligence Index v4.3.2 中,Gemini 4 Argon 在其高推理組態下得分 52.56——這是在他們自己的硬體上獨立測量所得,並非由 Google 回報——其定價為每百萬輸入詞元 2.00 美元、每百萬輸出詞元 10.00 美元,並享有 95% 的快取輸入折扣。他們的儀器量測顯示,單一索引任務的成本為 1.99 美元。

真正要緊的那項比較,正是 FrontierSWE 所產出的那一項。Claude Opus 5.5 在其高配置下,於該指數上得分更高,為 53.58,且每項任務成本更低,為 1.82 美元。兩個獨立評估者使用不同的任務與不同的測試框架,在品質與成本兩方面都把 Argon 排在 Opus 5.5 之後。這是一致而連貫的訊號,而非單一基準測試所造成的假象,而這也是目前關於 Gemini 4 Argon 經濟效益所能說的最有力的一點。

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

已宣布,未發布——以及為何這種說法不是吹毛求疵

沒有 Gemini 4 Argon 這個模型 ID。存取權正透過 Fairwind Program 逐步開放給經過審核的網路防禦人員,同時分階段開放給付費 API 客戶與 Google AI Ultra 訂閱者,且尚未公布一般可用日期。Google 的貼文是宣布一個模型和一組評估,而不是推出一個可供呼叫的端點。如果你讀過將此描述為正式發布的報導,那些報導跑在事實前面。

這個區別對任何閱讀 FrontierSWE 數字的人都有實際影響。這項評估是針對 Proximal 在某種安排下所能取用的模型進行的;它告訴你的是該模型能做到什麼,而不是你能擁有什麼。這也意味著這些效能數據的半衰期比平常更短。一個尚未正式推出(GA)的模型仍可能改變——解碼設定、系統提示、工具使用預設值與安全防護框架全都還在調校中,而據稱 Argon 快取命中率偏低的原因,正是評估者當時跑的不是正式生產環境配置。預期 55.0% 與 $129.36 這兩個數字還會變動。

什麼會改變這個局面:一個已公布的模型 ID 加上價目表、一個 GA 日期、在生產環境設定下重跑的 FrontierSWE,以及第二位獨立評估者重現第三名的結果。至少在這些條件中的前兩項出現之前,要把每一個 Argon 數字——包括 Google 自家圖表中那些好看的數字——都視為暫定。

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

性格解讀是最經得起時間考驗的部分

一個 pre-GA 模型的基準測試分數,其保鮮期以週計。但行為觀察則不然。長程代理工作才是模型性格真正顯現的地方,因為二十小時的預算搭配 34 項任務,已足夠讓模型的傾向逐步累積:它如何從失敗的做法中恢復、是否會停下來重新規劃、能不能分辨一個難題和一次走錯方向。一位看過大量這類軌跡的評估者,若把某個模型描述為自我批判、而且事情奏效時容易驚呼,其實是在描述一個會將自身進展的推理外顯化的模型。那是一個假設,用來解釋為什麼 Argon 的各次運行結果會分布在 44.5% 到 64.3% 之間——比 Opus 5.5 的區間更寬——而且一旦該模型可供呼叫,這個假設就可以被檢驗。

那段評論的另一半才是該懷疑的部分。「比先前的 Gemini 有大幅進步」是與從未在此測試框架下、以此基準測試評分的模型所作的比較,因此根本無法對照排行榜查核。這是一種印象,無論提出這句話的人多麼可信,都應該被當作印象來看待。

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

如果你今天確實需要一個能處理長時間任務的代理,這會讓你處於什麼樣的位置

你無法把 Gemini 4 叫做 Argon,所以實務上的問題不是 Argon 跟什麼相比——而是針對 Argon 當初接受基準測試的那類工作,你該跑哪個模型。FrontierSWE 自己的排名就回答了這個問題:GPT-6 Astra 以 65.5% 站上榜首,但每次試驗要價 $1,029.65,大約是排名在它下面那兩個模型成本的十倍,而 Claude Opus 5.5 以 $98.87 交出 62.3%。在這項基準測試上,最超值的選擇是 Opus 5.5,而它也是在 Artificial Analysis 上以更低每項任務成本擊敗 Argon 的模型。

那兩款模型,以及排行榜前十名中的大多數——其中包括 GLM-5.3、Grok 4.7、Kimi K3、Qwen3.8-Max、DeepSeek V4 Flash Vision Exp 與 Muse Spark 1.2——都可透過 OrcaRouter 的單一 API 進行路由,與 200 多款其他模型並列——一組金鑰、0% 加成,因此供應商的定價就是您實際支付的價格,而廠商降價也會在同一天反映到我們這邊。最後這項特性在尚未正式發布(pre-GA)的模型上格外有價值:如果 Argon 的定價在正式發布之前有所變動——從非生產環境快取的附註來看,這是有可能的——那麼屆時您的整合方式完全不會有任何改變。自動容錯移轉則是另一個契合這個特定情境的部分——一個失敗模式還沒有人摸清的全新模型,正是您最不該放在單一硬編碼生產路徑上的東西。

有一點要說清楚:Gemini 4 Argon 並不在我們的目錄中。用我們的公開模型 API 查詢 google/gemini-4-argon,會回傳「找不到模型」,而且也沒有其他人託管它——它被 Google 的 Fairwind Program 限制使用,並未公布模型 ID。當它可以被呼叫時,我們會將其路由;上面那些 FrontierSWE 數字,正是要留意那一天到來、而不是空等它的理由。它敗給的那些模型已經在那裡了。

看什麼

能讓這件事從「目前已知」轉為決策的訊號很具體。已發布的模型 ID 及其價目表。正式全面可用日期。在生產設定下重新執行 FrontierSWE——這將釐清每次試驗 129.36 美元的成本究竟是真實費率,還是 Proximal 所標記的快取組態造成的假象。而且,理想情況下,還要有第二位評估者發布 Argon 軌跡,讓「Eureka!」這個觀察不再只是單一樣本。

在那之前,誠實的總結很狹窄,卻值得保留:Gemini 4 Argon 已經發表;根據一位評估者的說法,它在長時程代理軌跡中表達力異常豐富;而在我們唯一能查核的獨立基準測試上,它排名第三,落後於兩個模型——其中一個同時在分數與成本上勝過它。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新