
Gemini 4 Argon:谷歌公布了什么,这个名字又与什么相关联
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 64 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Gemini 4 Argon 是唯一存在的 Gemini 4。这句话听上去平淡无奇,直到你把它换算成价格,而换算价格正是本页的目的。Google 于 2026-09-30 在一篇署名 Koray Kavukcuoglu 的 DeepMind 文章中发布了 Gemini 4 Argon;它是真实第一方页面上真实存在的模型名称,Artificial Analysis 在 v4.3.2 修订版上测得它的智能指数为 52.56,与 GPT-6 Astra 的 52.67 和 Claude Fable 5.1 的 53.35 相差不到半分——同时比 Claude Opus 5.5 的 57.62 和 Claude Sonnet 5.5 的 56.00 低五分,与 GPT-6.1 Sol 的 51.83 相差在一分之内。它没有的,正是它的每一个竞争对手都有的那样东西:一个你能放进请求里的模型标识符。
所以,对于“什么是 Gemini 4 Argon”这个问题,诚实的一行回答是:它是一个 Google 已宣布并做过基准测试、但尚未开放调用的模型;这个名字所关联的是一次受限推出,而不是一款产品;而单独的“Gemini 4”则完全没有关联任何东西。这句话的两半都可以从终端核验,所以这个页面是在核验它们,而不是断言它们。
名字不是真的。名字不是真的。
先看实体核查实际返回了什么。截至 2026 年 10 月 8 日,谷歌的家族页面deepmind.google/models/gemini/上,以 Gemini 4 Argon 作为头号条目,标语为“我们前沿智能的下一个时代”,能力说明文案中列举了软件工程、法律与金融领域的企业知识工作,以及防御性网络安全。公告博文位于 blog.google/innovation-and-ai/models-and-research/gemini-models/ 路径。有一个模型家族页面。有一张十九行的厂商基准测试表。有一份五页的评估方法论 PDF。这是一条相当可观的书面痕迹,远非一次泄密所能留下。
现在列出它遗漏了什么,因为这份遗漏清单本身就是这篇文章。
• 一个 模型 ID——Gemini API 的模型列表中“argon”出现次数为零,“gemini-4”出现次数也为零。Google 文档认可的最新标识符是 3.8 系列。
• 一个可以据以计费的端点或价格——公告中每百万 tokens 输入 2 美元 / 输出 10 美元的价格,是针对尚未触达付费客户的推出阶段所定的尝鲜价。
• 一个模型卡或系统卡 —— DeepMind 的模型卡索引中没有 Argon 条目,且该系列的模型卡路径会返回 404。
• 一个上下文窗口——Google 公布的输出上限为 100 万 token,较此前 64K 的上限有所提升,但并未公布这一对中的输入侧。Artificial Analysis 对其所测量的模型记录为 1M。
• 一个正式发布(GA)日期——公告描述的是分阶段推出,除第一阶段外,其余任何阶段均未给出日期。
• 一个参数数量,Google 尚未为任何 Gemini 公布过。
Google 所描述的推出分为三个阶段,但都未说明时长。第一阶段是通过 Fairwind Program 的一批具名网络防御人员。第二阶段是付费 API 客户和 Google AI Ultra 订阅用户。第三阶段是开发者、企业和消费者。只有第一阶段在读者能够核实的任何意义上已经上线,而 Google 没有为第二和第三阶段给出任何日期。这不是一条脚注。这是模型与倒计时之间的区别。

Google 自己的表格声称了什么,以及实际测量它的究竟是谁
Google 的模型家族页面载有一张四栏基准测试表,其中包含 Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。这张表值得一读,而且值得在了解其数据来源的前提下阅读,因为 Google 在方法论 PDF 中披露了这些来源,而这一披露改变了这张表所能承载的分量。
这些被标注为谷歌的声明:Argon 在 Vals Index 上以 68.9 领先,而 Opus 5.5 为 67.0,Fable 5.1 为 65.8;在 AutomationBench 上为 51.3,对比 42.5、31.4 和 41.4;在 Vals Finance Agent v2 上为 65.4;在 Harvey’s Legal Agent Benchmark 上为 19.6,对比 3.8、6.7 和 5.4——差距达四到五倍;在 DeepSWE v1.1 上为 77.9,对比 74.2、67.4 和 74.1;在 Vibe Code Bench 上为 91.9,领先 1.6 个百分点;在 LABBench 2 上为 88.8,对比 73.1、68.6 和 85.4;在 RiemannBench 上为 76.0;在 GraphWalks 的两行上,≤128k 为 99.7,256k–1M 为 84.2;在 Agent’s Last Exam 上为 39.5;在 Terminal-Bench Science 0.1 上为 57.6;在 Chartography 上为 71.6;并在 LVBench 上以 91.7 达到最先进水平。
而且在谷歌自己的页面上,它还输了:FrontierSWE v2 为 55.0,不敌 Astra 的 65.5 和 Opus 5.5 的 62.3;Terminal-bench 4.0 为 57.4,不敌 Opus 5.5 的 66.4;PostTrainBench 为 45.3,不敌 Opus 5.5 的 49.3;OSWorld-2.0 为 69.2,不敌 Astra 的 72.6。CWE-bench v1 以 68.0 与 Astra 打平。
溯源说明比任何单行数据都更重要。Google 的方法论指出,结果是 pass@1、单次尝试、采用最高思考设置,而且——关键在于——该表中非 Gemini 的数字是各提供商自行上报的数字,其中 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5 在可用的情况下采用最大思考设置。一张竞争对手列填的是竞争对手新闻稿的厂商表格是一份有用的文档,但它并非受控对比。这些行中的每一行都是 Google 报告的,其中一些还是 Google 在转述别人报告的内容。因此,要看的是差距,而不仅仅是数值。
一个模型,三个指数数字,以及它们为何都是正确的
Argon 的独立地位比单一数字更有意思,因为这个数字会随着你读取它的位置而变动,而这种变动并非错误。
Artificial Analysis 在其 Intelligence Index 的 v4.3.2 修订版上,测得 Gemini 4 Argon(High)为 52.56。同一指数显示,Claude Opus 5.5 为 57.62,Claude Sonnet 5.5 为 56.00,Claude Fable 5.1 为 53.35,GPT-6 Astra 为 52.67,GPT-6.1 Sol 为 51.83,Gemini 3.8 Flash 为 40.93。在排行榜所展示的排序中,排名前十左右的模型被压缩在大约六个指数点的区间内,而 Argon 正是落在这场混战之中,而非其之下。
接着,读者会在排行榜的四舍五入显示中看到第二个数字——53;如果再拿它跟同系列模型的另一种配置作比较,还会看到第三个数字,于是断定其中一个来源出了错。其实哪个都没错。四舍五入后的 53 与 52.56 是同一次测量。配置之间的差别在于思考强度:Artificial Analysis 会在多个强度级别上分别测量每个模型,而同一模型在更高强度级别下,分数可能相差好几分。正因如此,排行榜把 Opus 5.5 分四次单列,分别为 58、56、54 和 51。Argon 只出现一次,且为高强度版本,因为这是 Google 唯一提供出来可供测量的配置。如果 Google 推出最高思考强度级别的 Argon 档位,那一行就会变动;而就今天而言,诚实的说法是:它还没有变动。
Argon 还有三项独立数据值得一并记住,它们全部来自 Artificial Analysis,且全部是在 (High) 配置下测得的。输出速度的中位数为每秒 60.69 个 token。首个答案 token 的延迟中位数为 2.92 秒。每个 Intelligence Index 任务的成本——即用赚取该指数得分所耗费的 token 支出进行归一化后的指数得分——为 1.99 美元。最后这个数字才是要牢牢记住的,因为正是在这里,Argon 的处境变得令人不安:Opus 5.5 的得分高出五分,每个 Index 任务的成本为 5.98 美元,因此按单位实测能力计算,Argon 便宜三倍。但 GPT-6.1 Sol 的得分低半分,成本为 0.72 美元,约为 Argon 这一数字的三分之一。在自身所处的指数区间内,Argon 并非性价比之选。它只是处在中间位置。
还有两项独立的读数,细心的读者不应将它们彼此混淆。Artificial Analysis 将 Argon 的 AutomationBench 数值记录为 部分得分:在 0–1 量表上为 0.7751,而 Google 的表格在 AutomationBench 榜单上报告的是 51.3/100。它们并非同一指标,把它们并排放在一起,正是那种会凭空造出一个数字的比较。同样的谨慎也适用于厂商表格中的知识工作分组:“在知识工作方面领先”是 Google 对 Google 自己表格的总结。
您实际在寻找哪个“Gemini 4”页面
这是这个名字造成的混淆,值得在一个地方把它说清楚,因为这个博客现在已经写了五种不同的“4”相关的东西,而它们并不是同一篇文章的不同版本。
• 如果您想了解发布日期和推出时间线——Argon 是什么时候公布的、分阶段推出是怎样的,以及竞技场榜单对此有何反应——那就是发布日期专题文章,它是掌握时间线以及 Text Arena 和 Code Arena 解读数据的文章。
• 如果你想了解 “Gemini 4 Argon 是一个层级还是一个模型”,以及是否存在 Gemini 4 Ultra——这部分关于层级定位的内容,会从 Google 自身的路径中解读出层级阶梯,并解释为什么 Ultra 路径会指向订阅页面。
• 如果你想要命名问题本身,即“Gemini 4”和“Gemini 4 Argon”中恰好有一个是模型、另一个是没有模型 ID、没有端点也没有价格的代际前缀这一论点——那就是这两个 Google 名称之间的正面交锋。
• 如果你想要排名第三的 FrontierSWE v2 结果以及随之而来的自我批判性观察,那就是 FrontierSWE 评估那部分。
• 如果你想在数据上将Argon与特定对手进行对比,网站上共有十三个对比页面,涵盖前沿产品线,它们是进行双机型对比的理想选择。
它们都不是、而本页却是的那个东西,就是支柱:唯一一处说明该实体是什么、附于其上的每个数字分别意味着什么、又不意味着什么,以及你今天实际能用它做什么的地方。相关页面“Gemini 4 vs Gemini 4 Argon”已完整提出命名论证,本页不会重复。以下全部内容都是新的。

至今尚未告诉我们任何信息的压力
Argon 的故事中两个最强烈的信号都指向开发者版本即将发布,而它们都不能证明开发者版本已经发布。
第一点是,Google 自家的 API 层面已经在没有 Argon 的情况下继续向前推进了。Gemini API 更新日志中最新的一条是2026 年 10 月 6 日——Gemini Nano Banana 2.1 正式可用,标识符为gemini-nano-banana-2.1。换句话说,在 Argon 发布后的这八天里,Google 已经为生产环境中的一个 Gemini 模型确定了命名规范,并为另一个模型发布了正式可用标识符,而gemini-4命名空间仍然空空如也。一个真正在推进落地的模型会在更新日志上留下痕迹。而这个模型没有留下任何痕迹。
第二个是国家安全叙事。Google 表示,它“正积极参与美国政府为模型发布前访问所设的自愿流程”,而首个推出阶段是一个具名的网络防御者群体。这与分阶段发布相符:前沿能力受众会先于公共 API 拿到该模型;这也同样符合该模型只是尚未准备好面向一般流量的情况。这种叙事本身无法告诉你到底是哪一种。任何声称它能说明问题的人都是在看茶叶占卜,而 Google 也没有为 API 阶段设定日期来给出定论。
今天你可以调用什么,以及不能调用什么
这是页面上最快过时的那部分内容,因此它自带日期。截至 2026 年 10 月 8 日,OrcaRouter 模型 API 会对google/gemini-4-argon返回 HTTP 404。它不在我们的路由中。以下这些同样不在:google/gemini-4,也不包括 google/gemini-4-argon-high,也不包括 google/gemini-4-pro——这些标识符全都无法解析,因为它们在哪儿都不作为可调用的模型存在。
今天我们的路线上有什么,来自同一家供应商,以及每一个在提供商标价上分别是多少钱:
• google/gemini-3.8-flash — 于 2026-09-02 发布,上下文窗口为 1,048,576 token,最大输出为 65,536 token,价格为每百万 token 输入 $0.75、输出 $3.75。这就是那些手里有信用卡的人最终会拿来与 Argon 对比的模型,也是你今天下午就能运行的、最接近 Argon 相关负载的东西。
• google/gemini-3.6-flash — 于 2026-07-21 发布,价格为 $0.75 和 $3.75。
• google/gemini-3.5-flash — 于 2026-05-23 发布,定价 $1.50 和 $9.00。
• google/gemini-3.5-flash-lite — 于 2026-07-21 发布,价格为 $0.30 和 $2.50。
• google/gemini-3.1-flash-lite — 价格为 $0.25 和 $1.50。
• google/gemini-3.1-pro-preview —— 发布于 2026-02-19,价格为 $2.00 和 $12.00。这是你唯一能调用的 Pro 档 Gemini,而它比 Flash 系列的最新款落后了三个半代。
所有这些都跑在与同一指数档位中 Claude 和 OpenAI 前沿模型相同的密钥上——Claude Opus 5.5、Claude Sonnet 5.5、Claude Fable 5.1、GPT-6 Astra 和 GPT-6.1 Sol 全都走相同的路由——这意味着 Argon 定位中有意思的地方,无需 Argon 也能验证。如果你想知道约 52 个指数点的知识工作以五分之一的价格是什么感觉,你今天就能拿google/gemini-3.8-flash的 40.93 来实测;而如果你想要这一档位的顶端,你可以在同一天、同一个账户里测 Claude Opus 5.5 的 57.62,不用再签第二份合同,也不用改一行代码。这就是整篇文章的实际轮廓:一个 API 接入 200+ 个模型,0% 加价,按提供商标价原样透传,所以供应商一降价,当天就能传导到你这里;还有 跨提供商自动故障转移,以应对你依赖的某个模型哪天不再响应。我们在这里说这些,是因为你所能调用的 Gemini 3.8 Flash 确实如此,而不是因为它说明了 Argon 的什么。Argon 并不在其中。
如果你想要 Argon 本身,如今你的选择只有 Fairwind 网络防御者群组和等待。谷歌自己的 API 没有提供它,我们也没有,而且没有任何第三方途径能够提供一种没有标识符可供寻址的模型。
悬而未决的问题,以及究竟怎样才算了结它们
有四件事尚未解决,每一件都有具体、可核查的触发条件。让这份清单保持简短才是关键——像这样的页面,只有在可被证伪时才有用。
• Argon 会拿到 Gemini API 标识符吗?留意 API 模型列表中任何以 gemini-4 为前缀的 ID。它一旦出现,定价问题就会变成现实,$2 / $10 的入门价也将成为一个真正能向你计费的金额,而不只是博客文章里的一个数字。同时也要留意,这个入门价究竟是否会延续到 API 阶段,以及它是否会上调至 $ / $20 或别的价位
• 所测量的配置会发生变化吗?Argon 在一个思考级别下被测得,得分为 52.56。如果 Google 公开一个更高投入量的配置,那么这一行就会变动;它所追赶的同行全都列出了两到四个投入级别,因此 Argon 只被列出一次,这是关于可用性的事实,而非关于该模型上限的事实。
• 法律和金融领域的说法能否经得起独立复跑?Harvey 的 Legal Agent Benchmark 以 19.6 对竞争对手的 3.8,以及 Vals Finance Agent v2 以 65.4 领先全场,是 Google 表格中最大的两个相对领先幅度。它们也是最有可能被不在 Google 工作的人复跑的两行。在一个领域基准上出现四到五倍的领先幅度,要么是公告中最重要的一句话,要么是评测框架差异,而弄清真相的办法,就是留意第二次复跑。
• 是否有同级模型?Argon 的公告文章没有点名任何系列,没有预告 Pro,也没有预告 Ultra。第二条gemini-4-*路径、第二列内容或一条模型卡条目,其中任何一项都会在一天之内推翻这一解读。分级定位那篇文章完整列出了这些可证伪项。
底线
Gemini 4 Argon 是一款货真价实的前沿模型,有着货真价实的基准测试表,以及 Artificial Analysis 给出的货真价实的 52.56 指数得分——但它并不是一款产品,具体而言就是:它没有模型标识符、端点、模型卡、上下文窗口,也没有正式发布日期,而 Google 自己的文档与第三方测评服务都一致认为,托管它的提供商有且只有一家。其名称中的“Gemini 4”是一个代际标签;“Argon”才是真正挂着模型的那一部分。如果你本月要挑一个东西来构建,这个决定与 Argon 无关:它关乎的是你今天就能以 $0.75 / $3.75 调用的 Gemini 3.8 Flash,以及同一指数区间内、共用同一密钥的那些前沿模型。当 API 列表中出现gemini-4标识符时,请重读此页。在那之前,关于 Argon 的一切都只是 Google 对一个首批用户之外无人能够调用的模型所作的宣称。

本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
