
Gemini 4 Argon 在 Gemini 4 阶梯中的位置——以及为什么没有 G4 Ultra
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
引发本文的那个问题,简短的回答是:Gemini 4 Argon 是 Google 的顶级模型,而非其顶级档位,因为比它更高的档位尚不存在——而且很可能不是任何人所预期的那种形态。Google 只发布了一个 Gemini 4 模型,即 Argon,而其自有域名下路径 /models/gemini/ultra/ 下唯一的官方页面根本不是模型页面:它会重定向到 Google AI 订阅方案。这个重定向是本文中最有用的一个事实,而且只需在终端里一行命令即可验证。其余内容讲的都是:一旦你不再把 Argon 的价格当作档位标签来读,而是把它当作一个数字来读,它实际上处于什么位置。
有两件事同时成立,而它们很容易被混为一谈。Argon 是现存能力最强的 Gemini,而 Argon 并不是前沿级别的模型。它领先于所有已发布的 Google 模型,而且领先幅度之大,使这种比较根本算不上比较;同时,它在 Artificial Analysis 的 Intelligence Index 上的得分,与两款相互竞争的旗舰模型相差不到一分,而这两款旗舰本身又落后当前榜首整整五分。Google 给它的定价,就好像它比前沿低一个档位,而独立测评也认同这一点。所以这一定价并不是一种低估该模型的营销手段。它是对该模型的准确陈述。
这是一篇截至目前我们所知内容的文章。Gemini 4 Argon 于 2026-09-30 在 Google DeepMind 的一篇署名 Koray Kavukcuoglu 的文章中宣布,并且正通过 Google 的 Fairwind Program 率先向一组具名的网络防御者推出——不是面向开发者,不是面向企业,不是面向消费者,也不是面向任何有信用卡的人。它在 Gemini API 中没有模型 ID,没有端点,也没有可供你据以计费的已公布每 token 价格。针对它的模型标识符、在真实流量上实测的吞吐量和可靠性数据都不存在,这意味着下文的测量结果只是某一家实验室的一次基准测试,仅此而已。凡数据来自 Google 的,均标注为 Google 的;凡来自 Artificial Analysis 的,均标注为其数据。本文任何内容都不应被解读为声称 Argon 是一款可购买的产品。
Google 实际发布的阶梯,直接摘自其自家页面
要回答“Argon 在 Gemini 4 阵容中处于什么位置”,最快的方法是不要再问阵容,而是开始列出 Google 为其发布页面的模型。阵容是营销概念;页面才是事实。以下是截至 2026 年 10 月 1 日,第一方路径所解析到的内容。
• deepmind.google/models/gemini/pro/返回 200,其标题为“Gemini 3.1 Pro — Google DeepMind”。Google 自家网站上的 Pro 位置仍然是 3.1 代模型。
• deepmind.google/models/gemini/flash/ 返回 200,其标题为“Gemini 3.8 Flash — Google DeepMind”。Flash 的位置已经变动过三次——3.5、3.6、3.7、3.8——而 Pro 的位置却始终未动。
• deepmind.google/models/gemini/argon/ 返回 404。Argon 没有单独的模型路径。它的归属是位于 deepmind.google/models/gemini/ 的系列页面,Google 会在这里放置当前主推的模型。
• deepmind.google/models/gemini/ultra/ 会返回 302,并跳转到 one.google.com/about/google-ai-plans/,即消费者订阅页面。较旧的路径也同样如此:deepmind.google/technologies/gemini/ultra/。Google 模型路径中的“Ultra”是计费层级,而不是检查点。
• deepmind.google/models/gemini/nano/会返回 301 重定向至 Gemini 系列页面。也不存在作为独立模型页面的 Nano 条目。
• deepmind.google/models/gemini/model-cards/ —— 这是 Google 为其发布的每一份模型卡所维护的索引 —— 其中没有 Argon 的条目,也没有任何名称含“Gemini 4”的条目。其中最新的 Gemini 条目是 3.8 Flash、3.8 Audio、3.7 Flash、3.6 Flash、3.5 Flash、3.5 Flash-Lite 和 3.1 Pro。模型卡索引是这一组文档中更新最慢的,因此它的沉默并不能证明 Argon 永远不会有模型卡;它只证明相关文书工作尚未跟上发布公告的步伐。
• deepmind.google/models/作为模型索引,将“Gemini 4 Argon”列为旗舰卡片,标语为“我们前沿智能的下一个时代”,其正下方则是“Gemini 3.8 Flash——最适合大规模应对复杂智能体任务”。两张 Gemini 卡片,相隔一代,依此顺序排列。
把这些放在一起看,梯子的形状就毫无歧义了。Google 公开的模型产品面上,目前在 Gemini 4 这一级有一个条目,在 Gemini 3.8 这一级有一个条目,还有一个已过时、落后了三代半的 Pro 层级,而在这些之上空无一物。Google 域名上的“Ultra”一词指向一项订阅。没有 Gemini 4 Pro 页面,没有 Gemini 4 Flash 页面,没有 Gemini 4 Ultra 页面,也没有 Gemini 4 模型卡。Google 发布的是一个模型,而不是一个系列。
有 Gemini 4 Ultra 吗?证据是什么,以及什么情况会证伪它
这值得单独设一节,因为它是这个问题中最可能在一周后得到不同回答的部分,也因为诚实的答案有保质期。
反面证据是具体而非模糊的。Ultra 路径上指向订阅套餐页面的 302 并不是软信号;它是 Google 自家网站团队配置的重定向。针对 Gemini 4 Ultra 文章的多个 blog.google URL 模式都返回 404——产品路径、innovation-and-ai 的 models-and-research 路径,以及普通公告路径。Ultra 这一命名在这里有先例,而先例对 Gemini 4 Ultra 不利。Google 最初的 Gemini 公告推出了 Gemini 1.0,“针对三种不同规模进行优化:Ultra、Pro 和 Nano”,并将 Gemini Ultra 描述为“我们最大、能力最强的模型”。一篇列出三种规模的发布文章,才像是一个家族公告的样子。Argon 的文章只提到一个模型,完全没有同级型号。Google 后来弃用了 Ultra 这一模型名称,转而采用数字层级,并将这个词移到业务的订阅侧,如今它用来命名最高端的消费者套餐。一个重定向到套餐页面的模型页面,正是当营销网站围绕已弃用的模型名称清理干净时,它所呈现的样子。
公告中也没有任何内容承诺会有一款更大的兄弟型号。Argon 的发布文章将 Argon 描述为“我们的新前沿模型”,并描述了分阶段推出、安全保障工作和内部部署,然后就戛然而止。它没有说“Gemini 4 家族中的首款”,没有预告 Pro 或 Ultra,也没有点名继任者。Google 自己的表述把 Argon 当作正主,而不是当作小号的那一个。
什么会证伪这一结论,很容易说明,也值得关注,因为其中任何一项都可能在一天之内将其推翻。
• 在 deepmind.google/models/gemini/ultra/ 上返回 200,且渲染的是模型页面而非方案页面,或出现一个新的 models/gemini/ 子路径,与 pro 和 flash 并列。
• 模型卡片索引中出现了 Gemini 4 Ultra 这一条目,而 Google 历来正是以此确认某个模型作为文档化产物的存在。
• Gemini API 中 gemini-4-*命名空间下的第二个模型 ID。Argon 目前还没有任何此类 ID,因此一个 Pro 或 Ultra 的 ID 将成为该系列真实存在的首个证据。
• Artificial Analysis 模型列表中的一项,或家族页面上带有第四列的基准测试表。这两者都能足够紧密地跟踪 Google 的发布,从而做到及早获知。
• 一篇 Google I/O、Cloud Next 或 DeepMind 的公告文章,用“家族”一词来谈 Gemini 4。Argon 的文章则没有。
在至少其中一件事发生之前,任何声称 Gemini 4 Ultra 即将到来的文章,都只是披着报道外衣的预测。请相应地看待它,包括来自我们的内容也是如此。

将价格阶梯解读为层级声明
定价是整件事中谷歌有意公开的那一部分,还附了一条脚注,也是整个发布过程中关于分层意图最明确的表述。Argon 的入门价格是每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入享受 95% 折扣,而谷歌自己的脚注一称,在一个它无法界定的入门期结束后,"每 100 万输入 token 4 美元、每 100 万输出 token 20 美元的价格将适用"。
把那两对和整个领域对照着看,梯队结论自然不言自明。
• $4 / $20 是 Claude Opus 5.5 的标价。Google 对 Argon 的推广期后定价,恰好落在当前前沿领跑者的价目表上,而该模型的测评成绩却落后它五个点。
• $2 / $10 是 GPT-6 Sol 与 Claude Sonnet 5.5 共同所处的促销价格档位。Argon 的首发费率同样是 $2 / $10,这使得 Argon 的发布定价与中端的 Sol 处于同一档位,而非前沿档位。
• $10 / $50 正是 Claude Fable 5.1 和 GPT-6 Astra 所处的位置。Argon 的输入价格是 Fable 5.1 的五分之一,输出价格同样是它的五分之一,而得分与它的差距不到 0.8。
• $0.75 / $3.75 是 Gemini 3.8 Flash 的价格。Argon 的输入价格是它的 2.7 倍,输出价格也是 2.7 倍——是一次干脆的提升,而非断崖式跃升。
所以,谷歌将 Argon 定价为一款属于低于 $10/$50、高于 $0.75/$3.75 的模型,最终会落在 $4/$20。这条定价阶梯上没有任何东西表明它是“前沿”。它表明的是“中端区间的顶部,其主打价格最终会稳定在领军者今天收取的同等水平,但能力更弱”。这是一个站得住脚的商业选择。这不是一款被定位为领先任何东西两个层级的模型所会有的定价。
有一个结构性要点值得记住:Argon 的价格阶梯是货真价实的阶梯,在脚注中定义,且未标注日期。Sonnet 5.5 和 GPT-6 系列在长上下文档位上做了类似的事,而 Sol 在超过 272K 后阶梯式升至 $4/$15。Argon 的阶梯是按时间划分,而非按上下文长度——同样的 $2/$10 适用于整个 1M 窗口,只有日历会改变费率。这是一种不寻常的形态,使得任何与 Argon 的成本比较都成了两栏式的功课:哪一时期,以及哪种用量。
基于现有数据,Argon 与竞争对手相比处于什么位置
Artificial Analysis 很快就发布了对 Gemini 4 Argon 的测量结果,使其成为唯一可用的独立读数。在 10 月 1 日当前的修订版——v4.3.2——上,Argon 在配置为高推理强度时,Intelligence Index 得分为 52.56。排在其周围的模型并不是该领域的随机样本。
• Claude Opus 5.5 在最高推理强度并启用回退的情况下测得 57.62 分。这比 Argon 高出五分多一点,是目前排行榜上的第一名。
• Claude Fable 5.1 的成绩为 53.35,这是在启用回退并以最大努力运行时测得的。Argon 落后它 0.79。
• GPT-6 Astra 为 52.67,这是在最大设置下测得的。Argon 落后它 0.11。
• Claude Sonnet 5.5 得分为 55.98,同样是在带 fallback 情况下的最高分。这是一个中端模型以 3.4 分的优势超过了 Argon,而这个数字应该让任何想搬出“Gemini 4 Argon 是全球第二好的模型”这一说法的人感到不安。
• GPT-6 Sol 在 872K 上下文窗口下以最高档位测得 47.63。Argon 领先它 4.9。
• Gemini 3.8 Flash 在高努力程度下得分为 40.93。Argon 领先它 11.6。
• Gemini 3.1 Pro Preview 的得分为 29.72。Argon 领先它 22.8,这一差距最清楚地说明,谷歌已推出的 Pro 层级已经落后自家研究多远。
从那份清单中可以得出三点。第一,Argon 与两个挑战者 Fable 5.1 和 Astra 持平,并且明显落后于两个 Anthropic 模型——Opus 5.5,以及更尴尬的 Sonnet 5.5。第二,Argon 与 Google 自家已发布的最佳模型之间的差距,远远是当前阵容中最大的代际跃升。第三,该信号称“前沿至少领先两个层级”,这一说法实质上没错,但从几何上看略有偏差:有一个模型层级明显领先于 Argon(Opus 5.5,57.6),另有一个处于更便宜层级的模型也同样领先于它(Sonnet 5.5,56.0);比起在 Argon 实际所处的那架梯子上低两个梯级,这才是更尖锐的问题。
原问题中那种“比价”的框架——“价格表明这是他们的 Sol/Sonnet 对等型号”——结果在首发价格上大致正确,在最终价格上却错了。Argon 以 Sol 和 Sonnet 5.5 的价位起步,最终稳定在 Opus 5.5 的价位。它的定价像一款意图跻身前沿价位的中端型号,但按衡量结果,两者都不沾边。
每任务成本这一视角正是 Argon 最强的地方,也是分层叙事获得第二个维度之处。在 Index 任务上,Argon 花费 1.99 美元,输出 142,374 个 token。Opus 5.5 花费 5.98 美元,输出 338,099 个。Sonnet 5.5 花费 7.62 美元,输出 599,849 个。Fable 5.1 花费 7.63 美元,输出 187,455 个。Astra 花费 3.26 美元,输出 68,691 个。Gemini 3.8 Flash 花费 1.24 美元,输出 154,230 个。Argon 是购买接近前沿水平得分的最便宜方式,而且它比在得分上高于它的 Flash 模型每任务便宜不到一美元。
努力程度设置是上述所有内容的那颗星号,而业界并未统一报告它们。Argon 是在 high 下测量的;Opus 5.5、Fable 5.1 和 Sonnet 5.5 是在 max 下并带回退测量的;Astra 和 Sol 是在 max 下测量的。一次 high 努力程度的运行和一次 max 努力程度的运行不是同一种测量,而 Anthropic 自己的努力程度阶梯会让模型在不同设置之间相差好几个点。如果 Argon 在 max 努力程度下测得的分数显著高于 52.6,那么关于层级的论点就会改变。还没有人公布过那次运行。
Google 自己的表格声称了什么,以及它与独立表格有何不同
Gemini 家族页面包含一张由 Google 编写的性能表,共四列——Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5——以及十九行基准测试数据。这是 Google 针对该模型发布的最详尽的一组主张,且通篇均为厂商自报数据。将其与独立的 Index 对照阅读颇具启发意义,正是因为二者对该领域格局的认知并不一致。
• 在谷歌的表格中,Argon 在十九行里有十三行直接胜出或并列第一,包括 Vals Index Knowledge work 的 68.9、AutomationBench 的 51.3、Harvey’s Legal Agent Benchmark 的 19.6、DeepSWE v1.1 的 77.9、LABBench 2 的 88.8、GraphWalks 在 ≤128K 区间的 99.7 以及 256K–1M 区间的 84.2、Agent’s Last Exam 的 39.5、LVBench 的 91.7 和 Chartography 的 71.6。
• Claude Opus 5.5 在那些看起来需要持续工程投入的项目上胜出:FrontierSWE v2 为 62.3,对手 Argon 为 55.0;Terminal-bench 4.0 为 66.4,对手为 57.4;Terminal-Bench Science 0.1 为 63.3,对手为 57.6;PostTrainBench 为 49.3,对手为 45.3。
• GPT-4o 在 Terminal-Bench Science 0.1 上取得 68.1 分,在 OS-2.0 离线子集上取得 72.6 分,并在 CWE-bench v1 上的 Argon 上取得 68.0 分。Claude Fable 5.1 在所有行上均告负,只有在 Vibe Code Bench 上的一项并列除外。
• 在独立的 Index 上,排序是 Opus 5.5 居首,其次是 Sonnet 5.5,再次是 Fable 5.1,而 Argon 和 Astra 实际上处于同一水平。Google 的表格中完全没有 Sonnet 5.5 这一列,这是该表中影响最大的遗漏:表格的四列是经过挑选的,而在 Index 上以更低价格排名高于 Argon 的模型却不在其中。
这一切都不能说明谷歌的表格不诚实。厂商的基准测试表是挑选出来的,而不是抽样得到的,每个实验室的都是如此。这使它成为一种主张,而非一种测量,也意味着层级问题无法从中得到解决。对于这篇文章来说,这张表格真正起到承重作用的唯一地方在于其否定性:十九行、四列,而且没有为 Ultra 准备的第五列。

关于Argon的那件完全不属于层级问题的事
以上每一层级的论证都假定 Argon 是一个你最终可以调用的模型。把这个与定位问题分开来看是值得的,因为两者的答案不同,而其中只有一个关乎能力。
Argon 的输出 token 上限为 100 万 token,较 64K 有所提升,Google 直接说明了这一点。那是输出上限,不是上下文窗口。这个区别很重要,因为在此次发布的报道中,这两者经常被混为一谈,而且 100 万输出上限与 100 万上下文窗口是两种不同的工程声明——前者关乎单次轨迹能运行多久,后者关乎一次能交给模型多少内容。Google 对输出上限说得很明确,却对上下文窗口保持沉默。Artificial Analysis 也把 Argon 的上下文记录为 1,000,000 token,但那是该追踪器的字段,而不是 Google 的声明,所以要把这两个数字视为来自不同的房间,尽管它们读起来一样。
毫无疑问无法获得的是访问权限。Argon 并未普遍开放,它没有以任何标识符出现在 Gemini API 中,也没有出现在任何第三方名录里。它通过 Fairwind Program 提供给经过审查的网络防御人员,也提供给 Google 自己的工程师;而 Google 所提到的下一阶段——"从付费 API 客户和 Google AI Ultra 订阅者开始"——并未附上任何日期。你无法在自己的工作负载上对它进行基准测试。因此,本文中的每一个数字都是别人对一个你无法使用的模型所做的测量。
怎样才能让 Argon 更上一层楼?
层级判定只是一张快照,而大约有五件事会改变这一判定,大致按它们的影响程度排列。
• 一次独立测量的最高努力(max-effort)运行结果。Argon 目前是一项高强度(high-effort)测量,得分为 52.56。Anthropic 自己的努力程度阶梯在不同设置下就能让模型分数浮动好几分;如果 Google 的模型在最高设置下表现类似,那么 Argon 相对 Fable 5.1 和 Astra 的真实位置就比本文所说的更好。这是最有可能出现的一处变动。
• 第二个测量来源。一个追踪器只是一次测量。一个独立实验室用自己的测试框架给 Argon 打分,对 tier 主张的帮助会比 Google 提供的任何额外基准测试行都更大。
• 一款 Gemini 4 Pro。如果 Google 在 4 代产品线中、于 Argon 之下开启 Pro 档位,那么这条产品线就会成为一个有完整形态的家族,Argon 的位置就不再是“唯一的那一个”,而开始变成“三款中的顶端”,本文中关于缺少一个产品家族的每一个论点都需要重写。值得关注,而且比 Ultra 的问题更近。
• 一个不会阶梯式上涨的价格。如果这个引入期根本不会结束——谷歌尚未明确它何时结束——那么 Argon 的实际常驻价格就是 2 美元/10 美元,而非 4 美元/20 美元,其相对于 Opus 5.5 的单任务成本优势也将从约 3 倍扩大到约 6 倍。这是一次商业层面的事件,而非能力层面的事件,但它会改变采购决策的面貌。
• 一份 Argon 模型卡、系统卡或评估方法论页面。性能表链接到 Google 域名下的一个方法论页面;一份完整的模型卡会将上下文窗口、部署配置和安全包络记录在案,并且会成为首个让 Fairwind 队列之外的人能够核实 Google 的数字、而不是仅仅阅读这些数字的产物。
反过来,最有可能让 Argon 下滑的,根本不是某个基准测试。而是 9 月 30 日彭博社的报道,该报道援引能够接触该模型的谷歌员工的话称,它在实际工作上的表现不如其分数所暗示的那么好。这一说法未经谷歌以外的任何人证实,也不是一种测量结果,但它是那种会被第二个独立基准测试要么证实、要么推翻的说法。在那之前,它作为一项有具名媒体和匿名信源的指控留在记录中,并且理应纳入分档讨论,因为一个基准测试与实地表现之间的差距存在争议的模型,不能仅凭基准测试就被提升。
如果你这个月要选择一款模型,这意味着什么
抛开定位方面的说辞,实际情况足够简单,一段话就能说清。Gemini 4 Argon 是 Google 打造的最好的 Gemini,但你无法使用它,所以如今你实际可以选择的 Google 模型,只有已经发布的这些:Gemini 3.8 Flash,在 Index 上测得 40.93,价格为 $0.75/$3.75;以及 Gemini 3.1 Pro Preview,测得 29.72,价格为 $2/$12。如果你现在就需要一个 Gemini,那才是真正的选择,而 Argon 不在其中。
如果你是在不同厂商之间做选择,而不是只在 Google 内部挑选,那么 Argon 的发布公告丝毫不会改变今天的决定。Index 榜首是 Claude Opus 5.5,得分 57.62;Claude Sonnet 5.5 以 55.98 紧随其后,输入价格只有它的五分之一,输出价格也只有一半。Gemini 4 Argon 得分 52.56,却无法接入你的应用,因此无论它最终的分数有多好,都不是候选对象。

OrcaRouter 是一个单一 API,面向200 多个模型,供应商标价零加价透传,并且跨供应商自动故障转移,这意味着模型切换决策无需重新铺设任何管线:请求体中的 id 就是全部变更。我们目录中当前的 Google 模型,都是 Google 实际已发布的那些——google/gemini-3.8-flash、google/gemini-3.6-flash、google/gemini-3.5-flash以及google/gemini-3.1-pro-preview。Gemini 4 Argon 不在其中,而且在它既没有公开的模型标识符、也没有已公布的费率表的情况下,也不会成为其中之一,所以任何人都不应把上述任何内容解读为路由声明。当 Google 将 Argon 以带有 ID 的 API 形式推出时,它才会成为一个路由问题。在那之前,OrcaRouter 的诚实答案是:它尚不适用;而目录对这个特定决策的有用之处,就是让你能够把实际可调用的模型并排比价,而无需开通四个账户就能查明。
底线
Gemini 4 Argon 是谷歌的旗舰型号,而非其前沿之作。在 Artificial Analysis 的 v4.3.2 指数中,高努力模式下测得 52.56 分——与 Claude Fable 5.1 和 GPT-6 Astra 持平,落后 Claude Opus 5.5 五分,也落后于竞争对手实验室更便宜的模型 Claude Sonnet 5.5。谷歌将其定价为入门价 $2/$10,随后升至 $4/$20,这使其最终费率与 Claude Opus 5.5 完全一致,而能力却明显更弱。它领先 Gemini 3.8 Flash 11.6 分,是谷歌自家产品线中最大的代际差距,也是 Gemini 4 这一代是真正的升级而非换皮的最有力证据。
关于引发这一切的那个问题:并不存在 Gemini 4 Ultra。Google 在其自有域名上的 Ultra 路径会重定向到一个订阅套餐页面,模型卡片索引中完全没有 Gemini 4 条目,每一种用于 Gemini 4 Ultra 公告帖的 URL 模式都会返回 404,而发布帖只宣布了一款模型,并未承诺一个系列。这是一个真实的发现,而且是第一方证据,而非推断,但它也是一个半衰期很短的事实——只要某条路径返回一次 200,就能推翻它,而 Gemini 4 一代中的 Pro 层级是最有可能最先出现的那个。
从这篇文章里要带走两点提醒。这里出现的每一个 Argon 数字,都是别人对某个模型的测量结果,而那个模型,除了经过审核的网络防御者群体之外,没有人能够调用;而谷歌自己那张十九行的表格,是一份说法,而非一次测量——它有它自己的用处,却不能替代独立的 Index。至于档位问题,公正的结论也只能是暂时性的:Argon 是在高投入强度下测量的,而不是最高强度;而一次最高强度的运行,正是让这篇文章出错的最省事的办法。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
