
Gemini 4 Argon 与 Claude Opus 5.5:没人预料到的基准测试分化
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Gemini 4 Argon 和 Claude Opus 5.5 就谁更胜一筹各执一词,而这种分歧并非噪声。在 Artificial Analysis 的 Intelligence Index 上,两者相差五分,Opus 5.5 占优。而在 Vals Index——那个按 GDP 加权的经济影响排行榜——上,Gemini 4 Argon 位居第一,Claude Opus 5.5 排在第三,落后于 Argon 和 Claude Sonnet 5.5。这两个榜单在同一周测评了同样这两个模型。整篇文章要说就是:你该选哪一个,取决于你的工作更像一道考试题,还是更像律师事务所里一个普普通通的周二,也取决于你到底有没有 Argon 的 API 访问权限——而截至今天,几乎没有人有。
Google 于 2026-09-30 在 DeepMind 的一篇博文中宣布了 Gemini 4 Argon,署名作者为 Koray Kavukcuoglu——Google DeepMind 高级副总裁兼首席 AI 架构师。Anthropic 则在八天前,也就是 2026-09-22,发布了 Claude Opus 5.5。其中一个是你能在今天下午就调用的正式版(GA)。另一个则是面向一批指定的网络防御人员以及 Google 自家工程师的分阶段推送,并声明打算在护栏就绪后尽快覆盖“付费 API 客户和 Google AI Ultra 订阅用户”,但未给出任何日期。
先给出一句话答案,再展开细节。
如果你现在需要当前实测最强的通用推理能力,而且需要它在生产密钥上可用,那么 Claude Opus 5.5 现在已在 OrcaRouter 上线,而 Gemini 4 Argon 尚未登陆任何公开 API。如果你正在为金融、法律、税务或编程智能体做开发,而这些智能体的评分标准是每美元经济产出,那么 Argon 的数据更漂亮,而且在唯一一个专门衡量这一指标的榜单上,它的每任务价格只有 Opus 5.5 的五分之一。如果你从事关键基础设施的网络安全防御工作,Argon 有一个你可以申请的项目,而答复可能是肯定的。
每个数字究竟来自哪里
两个指数榜单,两套方法论,值得把哪个是哪个说得清清楚楚,因为未来几个月里,这两个阵营会不停地各引各的、自说自话。
• Artificial Analysis 智能指数 v4.3 —— Claude Opus 5.5 得分 57.6,Gemini 4 Argon 得分 52.6,两项数据均于 2026-09-30 取自 Artificial Analysis。这是十项评估的综合结果,刻意保持任务通用性,也是大多数人奉为“那个”排行榜的榜单。
• Vals Index,更新于 2026-09-29 —— Gemini 4 Argon 以 68.90%(±0.97)位列第一,Claude Sonnet 5.5 以 67.04%(±0.92)位列第二,Claude Opus 5.5 以 66.97%(±0.89)位列第三。Vals 按各行业占美国 GDP 的比重,对金融、编程、法律和税务任务进行加权,因此,一个在谜题上表现平平、但在合同审查和电子表格工作上表现出色的模型,能在这里获得高分。
五个点的 AA 差距是真实存在的,而且并不小。两个点的 Vals 差距同样真实;鉴于排行榜上印出了置信区间,Argon 的 68.90 ±0.97 对比 Opus 5.5 的 66.97 ±0.89,大约相差 1.5 个标准误——比抛硬币更有把握,但还称不上压倒性。两块榜都没有错。它们衡量的是不同的任务。

有一个配置上的注意事项,它不利于把 AA 的差距解读为纯粹的模型对比。Artificial Analysis 将 Gemini 4 Argon 标注在其 high 努力档位,而将 Claude Opus 5.5 标注为"Adaptive Reasoning, Max Effort, Default Fallback"。这两者并不处于两个努力阶梯上的同一位置,因此 57.6 对 52.6 这个头条数字并非在推理预算匹配条件下的同类比较。它是两个页面都发布的数字,如果你想对 Anthropic 公平,就该引用这个数字,但它并不是一项受控实验。
每任务成本正是差距令人不安之处
Artificial Analysis 还发布了一份关于运行其指数套件所需成本的核算,而在这方面,这两款模型相差悬殊。
• 每个索引任务的成本 — Gemini 4 Argon 为 1.99 美元,而 Claude Opus 5.5 为 5.98 美元。
• 运行整套索引套件的成本 —— Gemini 4 Argon 2,407 美元,而 Claude Opus 5.5 为 8,708 美元。
{{1}}• {{/1}}{{2}}每百万 token 的标价{{/2}}{{3}}——{{/3}}{{4}}Gemini 4 Argon{{/4}}{{5}}输入 $2 / 输出 $10(Google 公布的首发价格,缓存输入可享 95% 折扣,即 $0.10){{/5}}{{6}},而{{/6}}{{7}}Claude Opus 5.5{{/7}}{{8}}则为输入 $4 / 输出 $20{{/8}}
• 吞吐量——Gemini 4 Argon 每秒输出 48.9 个 token,首个 token 在 2.79 秒后出现;Claude Opus 5.5 每秒输出 92.2 个 token,但在同一测试框架下首 token 延迟高达 702 秒,这正是扩展思考的代价在公开场合的体现。
• Vals 每次运行成本 — 在相同的 GDP 加权任务集上,Gemini 4 Argon 为 $15.68,而 Claude Opus 5.5 为 $32.14。
有一个值得点出而非粉饰过去的细节:Vals 的排行榜将 Argon 的费率列为输入 $4 / 输出 $20,而 Google 的公告则称在推广期内为输入 $2 / 输出 $10。最合理的解读是,Vals 展示的是标准标价,而 Google 展示的是促销价,但这只是推断,并非任何一方发布的声明。如果你的预算取决于这个数字,去问 Google。
Argon 声称什么,以及已经核查了什么

谷歌的帖子充斥着数字,而每一个都是厂商自行报告的。我找不到任何一个被独立复现过,而且上面那些独立榜单衡量的东西,与谷歌选择拿来当头条宣传的那些并不相同。以下是谷歌自己宣称的说法:
• DeepSWE v1.1 — 77.9%,被称为真实世界长时程软件工程领域的最新最高水平。
• LVBench 长视频理解 — 91.7%,被誉为业界领先水平。
• AutomationBench(Zapier 的端到端业务任务基准测试)——以 51.3% 的成绩位列第 1。
• CWE-bench v1 漏洞修复 —— 以 68% 的成绩并列第一,基于 Gemini 3.8 Flash Cyber 在 v0 榜单上的结果。
• Gray Swan 间接提示注入——被描述为领先,但帖文中未发布具体数据。
• Vals Finance Agent v2 和 Harvey 的 Legal Agent Benchmark——被描述为领先,同样没有在公告中印出数字。
确实拥有独立支持的两类说法,才最值得信任:Vals 用数值和区间确认了指数位置,Artificial Analysis 则确认了 52.6 的指数和价格。内部生产力方面的那几则轶事——某个量子子程序相较已发表基线提升 40%、Argon 智能体在 Google 整个机群中释放了超过 300 TiB 内存——属于公司内部结果,没有外部测试,也应照此看待。
如果你一直与世隔绝,Opus 5.5 到底是什么
Claude Opus 5.5 是 Anthropic 的旗舰模型:100 万 token 上下文、128K 最大输出、覆盖文本、图像与文件的多模态输入、扩展思考、工具调用与结构化输出。它于 2026-09-22 接替 Claude Opus 5,而其发布时最引人瞩目的亮点可以说是价格下调——这一档位不升反降,定价为 $4/$20,缓存读取为 $0.20。如今它已可在 OrcaRouter 上按完全相同的费率进行路由,供应商标价原样透传、零加价,且供应商的价格变动会在其生效的同一天同步到我们这边。
在两个模型都具备的任务级分数上,情况并非一边倒,而是真正的此消彼长:
• Terminal-Bench 4.0 — Claude Opus 5.5 59.6%,对比 Gemini 4 Argon 57.1%。
• SciCode — Claude Opus 5.5 66.9% 对比 Gemini 4 Argon 61.8%。
• 人类的最后考试——Claude Opus 5.5 61.4%,对比 Gemini 4 Argon 57.1%。
• 长上下文推理 — Claude Opus 5.5 84.7%,对比 Gemini 4 Argon 79.7%。
• CritPt — Claude Opus 5.5 为 31.7%,Gemini 4 Argon 为 27.1%。
• 全知 — Claude Opus 5.5 46.4 对比 Gemini 4 Argon 42.4。
• GDPval — Claude Opus 5.5 1,846 对比 Gemini 4 Argon 1,611。
• AutomationBench-AA — Gemini 4 Argon 77.5% 对比 Claude Opus 5.5 69.5%。这是 Argon 明显胜出的唯一一项正面交锋任务得分,同时也是与 Vals Index 所奖励内容最接近的任务族。
所以这个规律是一致的:Opus 5.5 在偏学术风格的推理阶梯上领先,而 Argon 在端到端任务执行上领先。这不再是两个榜单之间的矛盾。这是同一个发现被表达了两次。
没人拿来比较的能力
Gemini 4 Argon 的输出上限为单次轨迹 1,000,000 个 token,较上一代的 64K 大幅提升。Claude Opus 5.5 的输出上限为 128K。两者都拥有 100 万 token 的上下文窗口,但上下文与输出是两笔不同的预算,而这是本次发布中幅度最大的一项单项规格跃升。
这是否重要,完全取决于你运行的是什么。128K 的输出上限对于聊天、代码审查、结构化提取和智能体步骤来说很宽裕。但对于一次性生成整套迁移补丁集、完整审计报告或长篇文档来说,它是一堵硬墙——这正是 Google 选择用来展示此次发布的工作流。如果你的流水线要串联二十次调用来控制在某个上限之下,Argon 的上限将为你节省延迟和编排代码。如果并非如此,那你就是在为用不到的余量付费。
可用性是决定性变量,而不是质量
这是比较中没有附带基准、却比所有基准都更重要的一部分。
Gemini 4 Argon 尚未全面开放。Google 的帖子称,它正通过 Fairwind Program 向受信任的网络防御者逐步推出,公司正在参与美国政府的自愿预发布模型访问流程,而面向开发者、企业和消费者的更广泛访问将“尽快”到来,首先从付费 API 客户和 Google AI Ultra 订阅者开始。没有模型标识符,没有端点,没有公布的配额,也没有日期。它不在我们的目录中,也不在其他任何人的公共 API 中,因此 Argon 的定价页面尚不存在。
Claude Opus 5.5 今日发布。在 OrcaRouter 上,它是 anthropic/claude-opus-5.5,可通过与目录中其他 200 多个模型相同的 OpenAI 兼容端点访问,并具备 跨提供商自动故障转移,当某条路由性能下降时,以及一个路由 DSL,用于希望将部分流量发送到 Opus 5.5、其余流量通过同一密钥发送到别处的情况。无需第二份合同,无需第二个 SDK。

下个月务实的建议并不光鲜:基于 Opus 5.5 构建,把模型名称放在配置值里而不是字符串字面量中,并在重试路径后面接一个廉价模型,这样一次 702 秒的首 token 运行出现延迟飙升时,就不会把你的产品一起拖垮。最后一点并非理论空谈——Opus 5.5 在 AA 测试框架上的首 token 延迟是 11 分钟,无论这是测试框架的假象,还是该模型确实比以往任何模型思考得更久,你的超时预算都应当依据这个数字来定,而不是依据营销说辞。
什么会改变这一裁决?
三件事,按可能性排序。Argon 正式全面可用并公布定价,这会让成本论证立刻具备可操作性,也能检验每百万 token 2 美元/10 美元的价格能否扛住真实流量的考验。在 Google 之外对 DeepSWE v1.1 和 CWE-bench v1 进行一次独立、可复现的运行,这要么能证实厂商的说法,要么将其戳穿。或者由 Artificial Analysis 对 Argon 在其最高 effort 设置下进行配置测评,这将厘清那五个点的指数差距究竟是能力差异,还是 effort 设置造成的假象。
在其中任何一项落地之前,诚实的总结是:Opus 5.5 是验证更充分的模型,而 Argon 是价格更有优势的说法。至于你今天实际能用上哪一个,答案毫无悬念。
Claude Opus 5.5 已在 OrcaRouter 上线,按厂商标价提供、无任何加价,与目录中其他模型并列——如果你想拿它对照自己的实际工作负载做基准测试,而不是对着排行榜比,anthropic/claude-opus-5.5就是调用时要用的 id,之后想换成别的模型,也只需在同一个密钥上改一行即可。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
