主视觉标题卡上写着"Gemini 4 Argon 对决 Claude Opus 5.5——基准测试的分野",日期条上写着"Argon 于 2026-09-30 公布"和"Opus 5.5 于 2026-09-22 发布",徽标上写着"Argon:已明确的试点,尚未正式发布",页脚一行写着"Argon 数据由厂商提供;两款模型的指数数据均来自 Artificial Analysis。"
Guides & Insights

Gemini 4 Argon 与 Claude Opus 5.5:没人预料到的基准测试分化

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 4 Argon 和 Claude Opus 5.5 就谁更胜一筹各执一词,而这种分歧并非噪声。在 Artificial Analysis 的 Intelligence Index 上,两者相差五分,Opus 5.5 占优。而在 Vals Index——那个按 GDP 加权的经济影响排行榜——上,Gemini 4 Argon 位居第一,Claude Opus 5.5 排在第三,落后于 Argon 和 Claude Sonnet 5.5。这两个榜单在同一周测评了同样这两个模型。整篇文章要说就是:你该选哪一个,取决于你的工作更像一道考试题,还是更像律师事务所里一个普普通通的周二,也取决于你到底有没有 Argon 的 API 访问权限——而截至今天,几乎没有人有。

Google 于 2026-09-30 在 DeepMind 的一篇博文中宣布了 Gemini 4 Argon,署名作者为 Koray Kavukcuoglu——Google DeepMind 高级副总裁兼首席 AI 架构师。Anthropic 则在八天前,也就是 2026-09-22,发布了 Claude Opus 5.5。其中一个是你能在今天下午就调用的正式版(GA)。另一个则是面向一批指定的网络防御人员以及 Google 自家工程师的分阶段推送,并声明打算在护栏就绪后尽快覆盖“付费 API 客户和 Google AI Ultra 订阅用户”,但未给出任何日期。

先给出一句话答案,再展开细节。

如果你现在需要当前实测最强的通用推理能力,而且需要它在生产密钥上可用,那么 Claude Opus 5.5 现在已在 OrcaRouter 上线,而 Gemini 4 Argon 尚未登陆任何公开 API。如果你正在为金融、法律、税务或编程智能体做开发,而这些智能体的评分标准是每美元经济产出,那么 Argon 的数据更漂亮,而且在唯一一个专门衡量这一指标的榜单上,它的每任务价格只有 Opus 5.5 的五分之一。如果你从事关键基础设施的网络安全防御工作,Argon 有一个你可以申请的项目,而答复可能是肯定的。

每个数字究竟来自哪里

两个指数榜单,两套方法论,值得把哪个是哪个说得清清楚楚,因为未来几个月里,这两个阵营会不停地各引各的、自说自话。

• Artificial Analysis 智能指数 v4.3 —— Claude Opus 5.5 得分 57.6,Gemini 4 Argon 得分 52.6,两项数据均于 2026-09-30 取自 Artificial Analysis。这是十项评估的综合结果,刻意保持任务通用性,也是大多数人奉为“那个”排行榜的榜单。

• Vals Index,更新于 2026-09-29 —— Gemini 4 Argon 以 68.90%(±0.97)位列第一,Claude Sonnet 5.5 以 67.04%(±0.92)位列第二,Claude Opus 5.5 以 66.97%(±0.89)位列第三。Vals 按各行业占美国 GDP 的比重,对金融、编程、法律和税务任务进行加权,因此,一个在谜题上表现平平、但在合同审查和电子表格工作上表现出色的模型,能在这里获得高分。

五个点的 AA 差距是真实存在的,而且并不小。两个点的 Vals 差距同样真实;鉴于排行榜上印出了置信区间,Argon 的 68.90 ±0.97 对比 Opus 5.5 的 66.97 ±0.89,大约相差 1.5 个标准误——比抛硬币更有把握,但还称不上压倒性。两块榜都没有错。它们衡量的是不同的任务。

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

有一个配置上的注意事项,它不利于把 AA 的差距解读为纯粹的模型对比。Artificial Analysis 将 Gemini 4 Argon 标注在其 high 努力档位,而将 Claude Opus 5.5 标注为"Adaptive Reasoning, Max Effort, Default Fallback"。这两者并不处于两个努力阶梯上的同一位置,因此 57.6 对 52.6 这个头条数字并非在推理预算匹配条件下的同类比较。它是两个页面都发布的数字,如果你想对 Anthropic 公平,就该引用这个数字,但它并不是一项受控实验。

每任务成本正是差距令人不安之处

Artificial Analysis 还发布了一份关于运行其指数套件所需成本的核算,而在这方面,这两款模型相差悬殊。

• 每个索引任务的成本 — Gemini 4 Argon 为 1.99 美元,而 Claude Opus 5.5 为 5.98 美元。

• 运行整套索引套件的成本 —— Gemini 4 Argon 2,407 美元,而 Claude Opus 5.5 为 8,708 美元。

{{1}}• {{/1}}{{2}}每百万 token 的标价{{/2}}{{3}}——{{/3}}{{4}}Gemini 4 Argon{{/4}}{{5}}输入 $2 / 输出 $10(Google 公布的首发价格,缓存输入可享 95% 折扣,即 $0.10){{/5}}{{6}},而{{/6}}{{7}}Claude Opus 5.5{{/7}}{{8}}则为输入 $4 / 输出 $20{{/8}}

• 吞吐量——Gemini 4 Argon 每秒输出 48.9 个 token,首个 token 在 2.79 秒后出现;Claude Opus 5.5 每秒输出 92.2 个 token,但在同一测试框架下首 token 延迟高达 702 秒,这正是扩展思考的代价在公开场合的体现。

• Vals 每次运行成本 — 在相同的 GDP 加权任务集上,Gemini 4 Argon 为 $15.68,而 Claude Opus 5.5 为 $32.14。

有一个值得点出而非粉饰过去的细节:Vals 的排行榜将 Argon 的费率列为输入 $4 / 输出 $20,而 Google 的公告则称在推广期内为输入 $2 / 输出 $10。最合理的解读是,Vals 展示的是标准标价,而 Google 展示的是促销价,但这只是推断,并非任何一方发布的声明。如果你的预算取决于这个数字,去问 Google。

Argon 声称什么,以及已经核查了什么

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

谷歌的帖子充斥着数字,而每一个都是厂商自行报告的。我找不到任何一个被独立复现过,而且上面那些独立榜单衡量的东西,与谷歌选择拿来当头条宣传的那些并不相同。以下是谷歌自己宣称的说法:

• DeepSWE v1.1 — 77.9%,被称为真实世界长时程软件工程领域的最新最高水平。

• LVBench 长视频理解 — 91.7%,被誉为业界领先水平。

• AutomationBench(Zapier 的端到端业务任务基准测试)——以 51.3% 的成绩位列第 1。

• CWE-bench v1 漏洞修复 —— 以 68% 的成绩并列第一,基于 Gemini 3.8 Flash Cyber 在 v0 榜单上的结果。

• Gray Swan 间接提示注入——被描述为领先,但帖文中未发布具体数据。

• Vals Finance Agent v2 和 Harvey 的 Legal Agent Benchmark——被描述为领先,同样没有在公告中印出数字。

确实拥有独立支持的两类说法,才最值得信任:Vals 用数值和区间确认了指数位置,Artificial Analysis 则确认了 52.6 的指数和价格。内部生产力方面的那几则轶事——某个量子子程序相较已发表基线提升 40%、Argon 智能体在 Google 整个机群中释放了超过 300 TiB 内存——属于公司内部结果,没有外部测试,也应照此看待。

如果你一直与世隔绝,Opus 5.5 到底是什么

Claude Opus 5.5 是 Anthropic 的旗舰模型:100 万 token 上下文、128K 最大输出、覆盖文本、图像与文件的多模态输入、扩展思考、工具调用与结构化输出。它于 2026-09-22 接替 Claude Opus 5,而其发布时最引人瞩目的亮点可以说是价格下调——这一档位不升反降,定价为 $4/$20,缓存读取为 $0.20。如今它已可在 OrcaRouter 上按完全相同的费率进行路由,供应商标价原样透传、零加价,且供应商的价格变动会在其生效的同一天同步到我们这边。

在两个模型都具备的任务级分数上,情况并非一边倒,而是真正的此消彼长:

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6%,对比 Gemini 4 Argon 57.1%。

• SciCode — Claude Opus 5.5 66.9% 对比 Gemini 4 Argon 61.8%。

• 人类的最后考试——Claude Opus 5.5 61.4%,对比 Gemini 4 Argon 57.1%。

• 长上下文推理 — Claude Opus 5.5 84.7%,对比 Gemini 4 Argon 79.7%。

• CritPt — Claude Opus 5.5 为 31.7%,Gemini 4 Argon 为 27.1%。

• 全知 — Claude Opus 5.5 46.4 对比 Gemini 4 Argon 42.4。

• GDPval — Claude Opus 5.5 1,846 对比 Gemini 4 Argon 1,611。

• AutomationBench-AA — Gemini 4 Argon 77.5% 对比 Claude Opus 5.5 69.5%。这是 Argon 明显胜出的唯一一项正面交锋任务得分,同时也是与 Vals Index 所奖励内容最接近的任务族。

所以这个规律是一致的:Opus 5.5 在偏学术风格的推理阶梯上领先,而 Argon 在端到端任务执行上领先。这不再是两个榜单之间的矛盾。这是同一个发现被表达了两次。

没人拿来比较的能力

Gemini 4 Argon 的输出上限为单次轨迹 1,000,000 个 token,较上一代的 64K 大幅提升。Claude Opus 5.5 的输出上限为 128K。两者都拥有 100 万 token 的上下文窗口,但上下文与输出是两笔不同的预算,而这是本次发布中幅度最大的一项单项规格跃升。

这是否重要,完全取决于你运行的是什么。128K 的输出上限对于聊天、代码审查、结构化提取和智能体步骤来说很宽裕。但对于一次性生成整套迁移补丁集、完整审计报告或长篇文档来说,它是一堵硬墙——这正是 Google 选择用来展示此次发布的工作流。如果你的流水线要串联二十次调用来控制在某个上限之下,Argon 的上限将为你节省延迟和编排代码。如果并非如此,那你就是在为用不到的余量付费。

可用性是决定性变量,而不是质量

这是比较中没有附带基准、却比所有基准都更重要的一部分。

Gemini 4 Argon 尚未全面开放。Google 的帖子称,它正通过 Fairwind Program 向受信任的网络防御者逐步推出,公司正在参与美国政府的自愿预发布模型访问流程,而面向开发者、企业和消费者的更广泛访问将“尽快”到来,首先从付费 API 客户和 Google AI Ultra 订阅者开始。没有模型标识符,没有端点,没有公布的配额,也没有日期。它不在我们的目录中,也不在其他任何人的公共 API 中,因此 Argon 的定价页面尚不存在。

Claude Opus 5.5 今日发布。在 OrcaRouter 上,它是 anthropic/claude-opus-5.5,可通过与目录中其他 200 多个模型相同的 OpenAI 兼容端点访问,并具备 跨提供商自动故障转移,当某条路由性能下降时,以及一个路由 DSL,用于希望将部分流量发送到 Opus 5.5、其余流量通过同一密钥发送到别处的情况。无需第二份合同,无需第二个 SDK。

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

下个月务实的建议并不光鲜:基于 Opus 5.5 构建,把模型名称放在配置值里而不是字符串字面量中,并在重试路径后面接一个廉价模型,这样一次 702 秒的首 token 运行出现延迟飙升时,就不会把你的产品一起拖垮。最后一点并非理论空谈——Opus 5.5 在 AA 测试框架上的首 token 延迟是 11 分钟,无论这是测试框架的假象,还是该模型确实比以往任何模型思考得更久,你的超时预算都应当依据这个数字来定,而不是依据营销说辞。

什么会改变这一裁决?

三件事,按可能性排序。Argon 正式全面可用并公布定价,这会让成本论证立刻具备可操作性,也能检验每百万 token 2 美元/10 美元的价格能否扛住真实流量的考验。在 Google 之外对 DeepSWE v1.1 和 CWE-bench v1 进行一次独立、可复现的运行,这要么能证实厂商的说法,要么将其戳穿。或者由 Artificial Analysis 对 Argon 在其最高 effort 设置下进行配置测评,这将厘清那五个点的指数差距究竟是能力差异,还是 effort 设置造成的假象。

在其中任何一项落地之前,诚实的总结是:Opus 5.5 是验证更充分的模型,而 Argon 是价格更有优势的说法。至于你今天实际能用上哪一个,答案毫无悬念。

Claude Opus 5.5 已在 OrcaRouter 上线,按厂商标价提供、无任何加价,与目录中其他模型并列——如果你想拿它对照自己的实际工作负载做基准测试,而不是对着排行榜比,anthropic/claude-opus-5.5就是调用时要用的 id,之后想换成别的模型,也只需在同一个密钥上改一行即可。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新