主视觉标题卡上写着 Gemini 4 Argon 在 FrontierSWE 上的表现:它高喊尤里卡,然后给自己的作业打分,另有一个标签写着 FrontierSWE v2 均值 55.0%(5 次),一个标签写着十款模型中的第三名,还有一个标签写着每次试验 129.36 美元,页脚一行写着 FrontierSWE 数据来自 Proximal Labs 的公开排行榜,2026-09-30。
Guides & Insights

Gemini 4 Argon 在 FrontierSWE 上:它高喊"Eureka!",然后给自己的作业打分

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 4 Argon 存在人格问题,而这是自 Go​ogle 于 2026-09-30 宣布该模型以来,人们对其最有趣的评价。在超长时程 FrontierSWE 基准测试中,排名第三的模型——落后于 GPT-6 Astra 和 Claude Opus 5.5——给其评测者留下了难忘的印象:它最喜欢的词是 "Eureka!",而且它会把二十小时任务预算中的大量时间花在对自己极其苛刻上。这是一条来自基准测试运营方、接近泄密性质的单一信源观察,既不是厂商的说法,也不是发布说明;至于它能告诉你什么、不能告诉你什么,值得精确界定。上述三款模型都没有附带 Argon 的 GA 日期;这一观察关乎模型在测试框架内的行为,而与之相伴的数字,则是 Argon 在并非由 Go​ogle 自行运营的基准测试上的首次独立测量。

“Eureka!”这句话究竟是什么

这条内容来自@nrehiew_于2026-09-30发布的帖子。@nrehiew_是一名从事模型评估工作的工程师,帖子引用了桑达尔·皮查伊关于Gemini 4 Argon的发布公告。其核心是三项说法:Argon是他们在FrontierSWE上评估过的最有趣的模型;它最喜欢的词是“Eureka!”;而且它极其自我批判。发帖人将其描述为相较此前几代Gemini的一次巨大进步,同时又保留了这种个性,并称其令人印象深刻。

仔细读一读那句话,因为很容易过度解读。它只是一位评估者观看智能体轨迹后得出的印象,不是评分结果,不是已发布的指标,也不是 Proximal Labs——FrontierSWE 的构建者和运营方——作为一项发现署名认可的东西。排行榜上并没有“自我批评”这一栏。这句话值得一写,并不是因为它有多权威,而是因为它是 Google 以外的人对 Argon 提出的唯一一种定性解读,而且由于该模型并未普遍开放,这类轨迹目前是观察它实际表现的唯一途径。

这也触及了一个真正的问题,对任何打算把 Argon 作为智能体来运行的人来说都是如此。长周期的编码任务在很大程度上是一个预算管理问题:一个会打断自己以重新思考、会给自己的中间成果打分、还会宣告突破的模型,就是一个把 token 花在流程上的模型。这究竟是一种优势还是一种代价,完全取决于自我批判是会收敛还是会陷入循环。单个评估者说一句“令人印象深刻”,只是一个数据点,而不是答案。

FrontierSWE v2,以及为什么第三名才是真正的看点

FrontierSWE 并不是那种看一眼头条数字就能读懂的基准测试。它由 Proximal Labs 构建,其仓库将其描述为一个超长视界的编程智能体基准测试,用于检验实现、性能工程和机器学习研究。版本 2 于 2026 年 9 月发布,在原有任务集之上新增了 21 个任务,总计 34 个,并且它期望智能体能持续工作长达二十个小时。一切都通过 Proximal 自己的测试框架 {{2}}proximus{{/2}} 运行,该框架基于 mini-swe-agent 构建,并增加了上下文压缩、视觉能力以及一个显式的提交工具。proximus评分采用 mean@5——即每个任务五次尝试的平均值——所报告的不确定性区间从各任务最差一次运行的平均值延伸到最佳一次运行的平均值。

该方法论对于如实解读 Argon 的行很重要:

• 得分 — Gemini 4 Argon 55.0% mean@5,±9.9,相较于 GPT-6 Astra 的 65.5% 和 Claude Opus 5.5 的 62.3%

• 跨度 — Argon 的各次运行区间从 44.5%(最差@5)到 64.3%(最佳@5),这一范围在高端与 Opus 5.5 的 52.0%–71.5% 重叠,却与 Astra 的 55.1%–73.0% 毫无重叠

• 每次试验成本 — Argon $129.36,Opus 5.5 $98.87,Astra $1,029.65

• 每次试验的挂钟时间 — Argon 10.6 小时,Opus 5.5 14.2 小时,Astra 12.1 小时

你首先注意到的是,Argon 排在第三,而且在得分上跟第二名差距不小。第二件事——真正该决定你是否在意的那件——是:在这个基准测试上,Argon 被 Claude Opus 5.5 完全压制。Opus 5.5 得分更高(62.3% 对 55.0%),每次试验的成本还更低($98.87 对 $129.36)。这里没有任何一个维度是 Argon 能赢的。它唯一的优势是时间:10.6 小时对 Opus 5.5 的 14.2 小时;如果你付的是挂钟时间而不是 token,这个优势是实打实的;如果你付的是每次试验的预算,那它就无关紧要。

Proximal 自己的排行榜在 Argon 那一行旁附了一条脚注,所有引用这个数字的人都应照搬:“Gemini 4 Argon:缓存命中率低得多,原因是使用了非生产设置。”这是评估方在指出,他们运行 Argon 时所用的配置并非生产部署会使用的配置,这抬高了它的成本,也很可能抬高了它的延迟。具体而言,这是对成本数字的警示说明,也正是为什么 $129.36 应被解读为上限,而不是价目表。

Google 自己的图表没有显示的那个数字

这正是信息来源变得真正有趣的地方,也是大多数关于这一结果的报道会出错之处。谷歌的公告帖子中有一张基准测试图表,其中有一行是 FrontierSWE v2。那一行显示 GPT-6 Astra 65.5%、Claude Fable 5.1 56.3%、Claude Opus 5.5 62.3%。Gemini 4 Argon 不在其中。Proximal 的实时排行榜显示 Astra 为 65.5%、Opus 5.5 为 62.3%——数字相同——但把 Claude Fable 5.1 列为 56.5%,而非 56.3%,并且列出 Gemini 4 Argon 为 55.0%。

这一遗漏的原因并不神秘,Google 自己也这么说:其评估套件随附的方法说明指出,FrontierSWE 的结果来自 Proximal 的官方公开排行榜。Google 并未自行计算这一基准测试。他们引用的正是我们所引用的同一个第三方,而该第三方公布的唯一 Argon 数字就是 55.0%。因此,诚实的解读是:Argon 的 FrontierSWE 分数是一项真正独立的测量——Proximal 在他们的测试框架上、在他们的任务上运行了它——并且它使 Argon 落后于两个竞争对手。

谷歌图表中的其他所有内容都是厂商自行报告的,你在心里也应该这样标注:Argon 在 Vals Index 上为 63.1%,而 Opus 5.5 为 67.0%;AutomationBench 上为 41.4%,而 Opus 5.5 为 42.5%;Vibe Code Bench 上为 89.6%,而 Astra 和 Opus 5.5 均为 90.3%;LVBench 上为 87.5%,对比 83.7%;CWE-bench v1 上为 68.0%,而 Opus 5.5 为 67.0%。这些是谷歌在其自行选择的评估上进行的运行结果。FrontierSWE 这一行是那张图中唯一读者可以独立核验的一项,这正是为什么第三名的成绩比其周围那些打平或略胜的模式更有分量。

Artificial Analysis 独立给出的说法

FrontierSWE 是一种视角。Artificial Analysis 是另一种,并且它与这个故事的轮廓相符。在他们的 Intelligence Index v4.3.2 上,Gemini 4 Argon 在其高推理配置下得分为 52.56——由他们自己的硬件独立测得,并非由 Google 报告——标价为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元,并享有 95% 的缓存输入折扣。他们的测量工具显示,单个索引任务的成本为 1.99 美元。

真正重要的比较,正是 FrontierSWE 所做的那项比较。Claude Opus 5.5 在其高配置下于该指数上得分更高,达到 53.58,同时每任务成本更低,为 $1.82。两个独立评估方使用不同的任务和不同的评测框架,在质量和成本两方面都把 Argon 排在 Opus 5.5 之后。这是一个一致的信号,而不是单一基准测试造成的假象,也是目前关于 Gemini 4 Argon 的经济性所能给出的最有力结论。

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

已宣布,但未发布——以及为什么这种区分并非咬文嚼字

不存在 Gemini 4 Argon 模型 ID。访问权限正通过 Fairwind Program 向经过审核的网络防御人员逐步开放,同时分阶段向付费 API 客户和 Google AI Ultra 订阅者开放,且未公布正式可用日期。Google 的帖子是对一个模型和一组评估的公告,而不是推出一个可供调用的端点。如果你读到过将其描述为发布的报道,那篇报道走在了事实前面。

这种区别对任何解读 FrontierSWE 数字的人来说都有实际影响。该评估是在 Proximal 通过某种安排得以访问的模型上运行的;它说明的是该模型能做什么,而不是你能拥有什么。这也意味着这些性能数据的半衰期比通常更短。一个尚未 GA 的模型仍可能发生变化——解码设置、系统提示、工具使用默认设置和安全防护机制都还在调优,而 Argon 缓存命中率偏低所给出的原因恰恰是评估者当时运行的不是生产配置。预计 55.0% 和 $129.36 都会变动。

什么会改变这一局面:一个已发布的模型 ID 及配套价目表、一个 GA 日期、一次在生产设置下重新运行的 FrontierSWE,以及第二个独立评估者复现第三名的结果。在这其中的前两项至少出现之前,请把每一个 Argon 数字——包括 Google 自己图表中那些好看的数字——都视为暂定。

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

性格解读是最经得起时间考验的部分。

对于一个尚未正式发布(pre-GA)的模型,其基准测试分数的保质期以周计。而行为观察则不然。长时程的智能体工作才是模型性格真正显露的地方,因为 20 小时的预算、34 项任务,这条绳子已经足够长,足以让模型的种种倾向不断累积:它如何从失败的路子中恢复,是否会停下来重新规划,能否分辨一个难题和一个错误方向。一位看过大量这类轨迹的评估者,若把某个模型描述为善于自我批判、且遇到奏效之处容易发出惊叹,那他描述的其实是一个把关于自身进展的推理外化出来的模型。这正是一个假设,用来解释 Argon 的各次运行为何从 44.5% 分布到 64.3%——区间比 Opus 5.5 更宽——而一旦该模型可以调用,这个假设便是可检验的。

这个说法的另一半才是应当怀疑的部分。“较之前的 Gemini 有大幅提升”是将此与那些从未在这个基准测试中、在这套测试框架下被打过分的模型作比较,因此根本不能对照排行榜核实。这是一种印象,无论提出它的人多么可信,都应当被当作印象来看待。

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

如果你今天确实需要一个长时程智能体,这会让你处于什么境地

你无法调用 Gemini 4 Argon,所以实际问题并不是 Argon 与什么别的模型相比——而是针对 Argon 被基准测试所衡量的那些工作,你应该运行哪个模型。FrontierSWE 自己的排序回答了这个问题:GPT-6 Astra 以 65.5% 位居榜首,但每次试验成本为 1,029.65 美元,大约是排在它下面两个模型成本的十倍,而 Claude Opus 5.5 以 98.87 美元达到 62.3%。在这项基准测试中最具性价比的选择是 Opus 5.5,而且它也是在 Artificial Analysis 上以更低的单任务成本击败 Argon 的模型。

这两款模型,以及榜单前十中的大多数——其中包括 GLM-5.3、Grok 4.7、Kimi K3、Qwen3.8-Max、DeepSeek V4 Flash Vision Exp 和 Muse Spark 1.2——都可以通过 OrcaRouter 的单一 API 路由调用,与 200 多个其他模型并列——一个密钥,0% 加价,所以提供商标价多少你就付多少,厂商降价当天就会落到我们这边。最后这一特性用在预 GA 模型上,价值比平时更大:如果 Argon 的定价在现在到 GA 之间发生变化——那条关于非生产缓存的脚注暗示有可能——你的集成本身不会有任何改动。自动故障转移则是契合这一具体场景的另一块拼图——一个失败模式尚无人摸清的陌生模型,正是你最不希望放在单条硬编码生产路径上的东西。

要明确一点:Gemini 4 Argon 不在我们的目录中。通过我们的公共模型 API 查询 google/gemini-4-argon 会返回“model not found”,而且也没有其他方托管它——它受 Google 的 Fairwind Program 限制访问,且没有公布模型 ID。当它变得可调用时,我们会将其接入路由,而上面的 FrontierSWE 数据正是让我们关注那一天的到来、而不是坐等它的原因。它输给的那些模型已经在那里了。

看什么

能把这件事从“目前已知情况”转化为决策的信号非常具体。一个已发布的模型 ID 及其价目表。一个全面可用日期。在生产设置下重新运行 FrontierSWE——这将确定每次试验 129.36 美元的成本是真实费率,还是 Proximal 标记出的缓存配置造成的假象。而且,理想情况下,还需要第二位评估者发布 Argon 轨迹,这样“Eureka!”这一观察结果就不再是孤例。

在那之前,诚实的总结虽然有限,却值得记住:Gemini 4 Argon 已发布,据一位评估者称,它在长时程智能体轨迹上表现出异常丰富的表现力;而在我们唯一能核查的独立基准测试中,它位列第三,排在两个模型之后——其中一个同时在得分和成本上胜过它。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新