标题卡标题为“MODEL COMPARISON”,内容为“Gemini 4 vs Gemini 4 Argon”,副标题为“其中一款于 9 月 30 日发布。另一款则是一个系列前缀。”,四个标签分别写着“Gemini 4 · 无模型 ID”“Gemini 4 Argon · 发布于 2026-09-30”“$2 / $10 推广价”和“AA Index 53 · Vals 第 1 名”,底部脚注为“Google 数据由厂商提供且未经复现;指数数据来自 Artificial Analysis;排名来自 Vals。”OrcaRouter 标志合成于右下角。
Guides & Insights

Gemini 4 与 Gemini 4 Argon:这两款模型中有一款并不存在

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Google 于 2026 年 9 月 30 日发布了一款前沿模型。它不是大多数人想象中的那一个。Gemini 4 Argon 是一个真实存在的名称,对应着一则真实的发布公告、一份真实的价目表和一套已公布的基准测试。Gemini 4 是这个名称所属的系列前缀——而就目前可查的公开记录而言,它并不是一款产品。它没有模型 ID,没有端点,没有模型卡,也没有每百万 tokens 的价格。所以这并不是两个系统之间的比较。它是把一个已发布的模型,与一个许多人——包括本博客——数月来一直当作模型来看待的名称放在一起比较。

这一区别背后是真金白银。G​emini 4 Argon 的入门价为每百万输入 token 2 美元、每百万输出 token 10 美元,在 G​oogle 尚未定义的入门期结束后将升至 4 美元和 20 美元。这些都是 G​oogle 自己公告文章中给出的厂商数据。如果你正在为 2026 年的专业级迁移做预算,$2/$10 才是你可以据以规划的数字,而“G​emini 4 要花多少钱”根本算不上一个数字——关于它还没有任何已发布的信息,因为目前尚无可发布的内容。

“Gemini 4”在正式记录中究竟是什么

搜索 Gemini 4 的产品页面,你只会找到一份文档:谷歌自己发布的一篇帖子,标题为Gemini 4 Argon:我们前沿智能的下一个时代,发布于 2026 年 9 月 30 日 20:00 UTC,署名 Koray Kavukcuoglu。仔细读下来,“Gemini 4”从未作为一个独立模型出现。文中每一项能力声明、每一个价格和每一项基准测试结果,都挂在全名之下。光秃秃的形式只出现在名称被当作前缀使用的地方——“Gemini 4 Argon 的能力”——而这正是 Gemini 3 在 Gemini 3 Pro、Gemini 3.1 Pro 以及四个 Flash 变体各自成为独立个体之前所占据的同一个语法位置。

从代际演进史来看,这种解读是成立的。Alphabet 7月23日的财报电话会议将这一表述记录在案:Sundar Pichai 表示,下一代前沿模型“需要大得多的基础模型”,并指出编程和智能体编程是需要改进的领域。9月23日,在 The Information 主办的一场活动上,Kavukcuoglu 表示预训练已经完成,模型正处于后训练的早期阶段,团队已经看到了结果,并希望远在年底之前就发布一个早期后训练版本。Business Insider 将9月30日的公告描述为 4 系列的首个模型——是一个系列,而这就是线索。这三条都是厂商关于自身工作的说法,且由第三方转述。

这在实际中意味着什么:“Gemini 4”是这一代,而这一代只有一个具名成员。谷歌已经推行了两年的层级结构——顶部是 Pro,其下是 Flash,还有一个被同一计划限定开放的 Cyber 变体——尚未为第 4 代填充。所谓“Gemini 4 Pro”或“Gemini 4 Ultra”只是根据谷歌自身命名模式作出的推断,既不是泄露,也不是路线图项目。任何把 Gemini 4 Argon 与“Gemini 4”相比较的文章,都应当被视为在把一个模型同它自己的姓氏作比较。

Gemini 4 Argon到底是什么

Gemini 4 Argon 于 2026 年 9 月 30 日在 Google 的博客上发布,当晚 Demis Hassabis 也在 X 上用自己的话宣布了同一款模型。此次推出是分阶段进行的,只有第一阶段有具体日期:Argon 首先通过 Fairwind 计划面向经过审查的网络防御人员开放,这是 Google 为政府和国家网络主管机构、关键基础设施运营商及核心技术平台打造的唯一申请制层级。Hassabis 本人的帖子称,公司正在推出它,“今天先从政府和可信的网络防御人员开始,通过我们的 Fairwind 计划”。在那之后,Google 的措辞将付费 API 客户和 Google AI Ultra 订阅用户列为下一批,然后是开发者、企业和消费者。这些后续阶段均未附带日期。

真正重要、也是任何规划工作的人都需要知道的内容,恰恰不在那份清单里:正式可用日期、模型 ID、上下文窗口、参数数量、模型卡或系统卡。谷歌公布的是输出上限,而不是上下文窗口。这个上限是 100 万 token,高于此前 Gemini 系列所使用的 64K 上限,谷歌称其行业领先。单次调用可返回的内容提升一个数量级,对长 agent 轨迹和单次渲染来说是实打实的变化,而且这也是公告中唯一一个没有任何歧义的技术数字。

A capture of Google's own blog post announcing Gemini 4 Argon, carrying a Published Time of 2026-09-30T20:00:00+00:00 and the headline "Gemini 4 Argon: our next era of frontier intelligence" credited to Koray Kavukcuoglu, followed by the Fairwind Program rollout and the vendor-reported benchmark set: DeepSWE v1.1 77.9%, AutomationBench 51.3%, LVBench 91.7%, CWE-bench v1 68%, an output limit of 1 million tokens up from 64K, and pricing of $2 / $10 stepping to $4 / $20.

该基准测试集范围广泛,且完全未被复现。谷歌报告 DeepSWE v1.1 为 77.9%,在 AutomationBench 上以 51.3% 位列第一,LVBench 为 91.7%,在 CWE-bench v1 上以 68% 并列第一,在 Vals Index、其 Vals Finance Agent v2、Harvey 的 Legal Agent Benchmark 上取得领先结果,并在 Gray Swan 的 Indirect Prompt Injection 基准测试中表现最强。其中每一个都是厂商自己的数字,由厂商发布,且没有一个被独立复现。9月流传的另一组数字,被呈现为预测的 Gemini 4 基准测试结果,AutomationBench 得分为 48.7%,结果证明是从一次无关发布中回收而来的,并非谷歌发布。谷歌实际报告的 AutomationBench 数字是 51.3%,这是一个来自不同来源的不同数字。

这两个名字产生的记分牌

把两者在这组配对实际起决定作用的六个维度上并排比较,问题的形态就显而易见了:

• 作为具名产品存在——Gemini 4:否。Gemini 4 Argon:是,于 2026-09-30 公布。

• 今日即可调用 — Gemini 4:不存在任何模型 ID 或端点。Gemini 4 Argon:同样不存在模型 ID 或端点;其访问由 Fairwind 管控,且仅限申请。

• 价格——Gemini 4:未公布。Gemini 4 Argon:每百万 token 2 美元/10 美元(入门价),之后为 4 美元/20 美元。厂商声明。

• 最大输出 — Gemini 4:未公布。Gemini 4 Argon:100 万个 token,而上一代仅为 64K。厂商声明。

• 智能指数 — Gemini 4:未评估。Gemini 4 Argon:在高推理强度下,Artificial Analysis 的 Intelligence Index 得分为 53,每项指数任务成本为 1.99 美元。据 Artificial Analysis。

• 独立排行榜排名——Gemini 4:未上榜。Gemini 4 Argon:以 68.90% 位居 Vals 指数第一,每次测试成本为 15.68 美元,输入 13.40B、输出 142.01M tokens。据 Vals。

A two-column scoreboard card headed "Gemini 4 vs Gemini 4 Argon — the scoreboard", with the subtitle "One announced model against a name with nothing behind it". The left column, headed Gemini 4, reads: exists as a named product, no; callable today, no model ID or endpoint; published price, none; maximum output, none published; intelligence index, not evaluated; independent rank, not ranked. The right column, headed Gemini 4 Argon, reads: exists as a named product, yes, announced 2026-09-30; callable today, no, Fairwind-gated; published price, $2 / $10, then $4 / $20; maximum output, 1M tokens, up from 64K; intelligence index, 53, $1.99 per task; independent rank, 1st, Vals 68.90%. A footer reads that the Argon price and output limit are per Google's own announcement, the index and per-task cost per Artificial Analysis, the rank and score per Vals, and that no figure on the left has a published source because Gemini 4 has no product page. The OrcaRouter logo is composited in the bottom-right corner.

把最后两行放在一起看,你就会发现这场对比中唯一真正有意思的分歧。Artificial Analysis 把 Gemini 4 Argon 排在 53 分,与 Claude Fable 5.1 和 GPT-6 Astra 持平,落后于 58 分的 Claude Opus 5.5 五分。Vals 则直接把它排在第一位。两者都是独立的,都在衡量真实存在的东西,只是衡量的东西不同——AA 的指数对编程、推理和知识工作领域的十项固定评测赋予权重,而 Vals 指数则按四个行业在美国经济增加值中所占的份额来赋予权重。一个模型可以在一张榜上领先而在另一张榜上不领先,而这并不意味着哪张榜是错的。

Vals 那一行还有第二点值得注意,而这正是企业买家应该关心的。Vals 将 Argon 的价目表记为 $4/$20——即优惠期后的价格——而 Google 自己的公告则写的是 $2/$10。如果每次测试 15.68 美元的成本是按 $4/$20 计算的,那么接受优惠价的买家在同样的工作上会看到一个显著更低的数字,而错过优惠窗口期的买家则不会。Google 尚未说明该窗口期持续多久。这一个未定义的变量,左右着整个发布中最与决策相关的数字。

你今天可以呼叫的对象

Gemini 4 名下什么都没有,我们也不例外。我们查了目录:google/gemini-4、google/gemini-4-argon、google/gemini-4-pro 和 google/gemini-3.8-flash-cyber 全都返回“未找到模型”,其他所有路由平台也是如此,因为它们都没有可供路由的模型 ID。Gemini API 自己的模型列表——Gemini 3.8 Flash、Gemini 3.8 Live、Gemini 3.1 Pro、Gemini 3 Flash——根本不存在任何形式的 Gemini 4 条目。在 Argon 通过 Fairwind 队列并获得标识符之前,任何地方都没有计费价格,也没有端点。

Google 已上线的专业版则是另一回事。Gemini 3.1 Pro Preview 自 2026 年 2 月 19 日起就出现在我们的目录中,价格为每百万 token 输入 $2.00、输出 $12.00,上下文窗口为 1,048,576 token,最大输出为 65,536 token,并支持文本、图像、音频、视频和文件的多模态输入。八个月过去了,它在 Gemini API 自己的模型列表中仍被标记为 Preview,这本身就是 Argon 之所以存在的理由。一旦输入 token 超过 200,000,价格就会翻倍,输入和输出分别达到 $4 和 $18。

A capture of the OrcaRouter model page for Gemini 3.1 Pro Preview, showing the Google provider, a release date of 2026-02-19, a 1,048,576-token context window, a 65,536-token maximum output, pricing of $2.00 input and $12.00 output per million tokens with $4.00 and $18.00 over the 200,000-token threshold, multimodal input icons for text, image, video, audio and file, and capability chips for reasoning, tool calling, structured outputs, prompt caching, assistant prefill, computer use and web search.

这正是本次比较中唯一能给出可操作答案的地方。Gemini 3.1 Pro Preview 已经上线运行,与其他 200 多个模型一样,都由我们路由,共用同一个兼容 OpenAI 的端点,按供应商目录价提供,不加任何加价——因此,当 Google 最终为 Gemini 4 Argon 公布标识符和计费费率,随后在命名规律不变的情况下再公布一个 Pro 层级的同门型号时,这种透传意味着那些费率在 Google 那边出现的当天,就会出现在我们这边。与此同时,如果你想实测 pro 层级,而不是只看文字介绍,那要测的就是这个模型。如果你想试用一个行为特征仍在被刻画之中的模型,自动故障转移(跨供应商)就是你的做法——无需把一条生产路径押注在一个 Google 自己都称之为逐步引入的预览版上。

有一个注意事项,应当与价格一并提及

Bloomberg 9月30日报道称,一些可直接访问 Argon 的 Google 员工表示,它在实际工作中的表现不如基准测试分数所暗示的那样好,其中前端设计被特别提及,两名员工使用了“benchmaxxing”一词。Google 对该描述提出异议。值得将其与基准测试列表并列,正是因为基准测试列表是该模型全部的公开证据基础。当只有一家供应商的数字且无法复现时,一份指出这些数字并未说明全部情况的报告就不是脚注。它是一半的证据。

谁应该选哪个

如果你正在这两个名字之间做选择,那你实际上还谈不上在选择什么,而诚实的建议是围绕这一点来做规划,而不是围绕比较。

• 如果你本季度需要在生产环境中使用 Google 的专业级模型,答案是 Gemini 3.1 Pro Preview。它可调用,已有定价,而且它正是 Argon 被定位为要取代的那个层级。等待 Argon,就是在等待一个你无法加入的队列。

• 如果你是 Argon 设限所面向的对象——政府网络主管机构、关键基础设施运营方、软件维护者——那么 Fairwind Program 就是唯一的途径,而这一门槛的具体性关乎模型能力的事实,而非营销说辞。Google 训练它是为了漏洞发现与修补,并未将其面向大众发布。

• 如果你正在为 2026 年迁移做预算,引入期请使用 $2/$10,之后的所有时段请使用 $4/$20。不要使用单一的混合数字,也不要在未核实 Vals 的 $15.68 每次测试成本是按哪张费率卡计算出来之前,就使用这个数字。

• 如果你在等“Gemini 4”,那你要等的是一个模型 ID。这个名字终将对应上一个 ID——谷歌横跨三代产品的命名规律表明,Pro 档和 Flash 档各有自己的标识符——但规律不等于官方公告,关于一个光秃秃的 Gemini 4 会是什么样、成本多少、能做什么,目前没有任何已发布的信息。

更广泛的要点是,这个博客以前不得不说明,以后想必还不得不再次说明:一个代际名称并不等于一个模型。Gemini 4 Argon 是 Google 唯一为之落实了名称、价格、基准测试集和访问计划的东西。该系列其余部分只是一种模式,而模式是一种你可以预测、却无法指名道姓的东西。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新