
Gemini 4 与 Gemini 4 Argon:这两款模型中有一款并不存在
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Google 于 2026 年 9 月 30 日发布了一款前沿模型。它不是大多数人想象中的那一个。Gemini 4 Argon 是一个真实存在的名称,对应着一则真实的发布公告、一份真实的价目表和一套已公布的基准测试。Gemini 4 是这个名称所属的系列前缀——而就目前可查的公开记录而言,它并不是一款产品。它没有模型 ID,没有端点,没有模型卡,也没有每百万 tokens 的价格。所以这并不是两个系统之间的比较。它是把一个已发布的模型,与一个许多人——包括本博客——数月来一直当作模型来看待的名称放在一起比较。
这一区别背后是真金白银。Gemini 4 Argon 的入门价为每百万输入 token 2 美元、每百万输出 token 10 美元,在 Google 尚未定义的入门期结束后将升至 4 美元和 20 美元。这些都是 Google 自己公告文章中给出的厂商数据。如果你正在为 2026 年的专业级迁移做预算,$2/$10 才是你可以据以规划的数字,而“Gemini 4 要花多少钱”根本算不上一个数字——关于它还没有任何已发布的信息,因为目前尚无可发布的内容。
“Gemini 4”在正式记录中究竟是什么
搜索 Gemini 4 的产品页面,你只会找到一份文档:谷歌自己发布的一篇帖子,标题为Gemini 4 Argon:我们前沿智能的下一个时代,发布于 2026 年 9 月 30 日 20:00 UTC,署名 Koray Kavukcuoglu。仔细读下来,“Gemini 4”从未作为一个独立模型出现。文中每一项能力声明、每一个价格和每一项基准测试结果,都挂在全名之下。光秃秃的形式只出现在名称被当作前缀使用的地方——“Gemini 4 Argon 的能力”——而这正是 Gemini 3 在 Gemini 3 Pro、Gemini 3.1 Pro 以及四个 Flash 变体各自成为独立个体之前所占据的同一个语法位置。
从代际演进史来看,这种解读是成立的。Alphabet 7月23日的财报电话会议将这一表述记录在案:Sundar Pichai 表示,下一代前沿模型“需要大得多的基础模型”,并指出编程和智能体编程是需要改进的领域。9月23日,在 The Information 主办的一场活动上,Kavukcuoglu 表示预训练已经完成,模型正处于后训练的早期阶段,团队已经看到了结果,并希望远在年底之前就发布一个早期后训练版本。Business Insider 将9月30日的公告描述为 4 系列的首个模型——是一个系列,而这就是线索。这三条都是厂商关于自身工作的说法,且由第三方转述。
这在实际中意味着什么:“Gemini 4”是这一代,而这一代只有一个具名成员。谷歌已经推行了两年的层级结构——顶部是 Pro,其下是 Flash,还有一个被同一计划限定开放的 Cyber 变体——尚未为第 4 代填充。所谓“Gemini 4 Pro”或“Gemini 4 Ultra”只是根据谷歌自身命名模式作出的推断,既不是泄露,也不是路线图项目。任何把 Gemini 4 Argon 与“Gemini 4”相比较的文章,都应当被视为在把一个模型同它自己的姓氏作比较。
Gemini 4 Argon到底是什么
Gemini 4 Argon 于 2026 年 9 月 30 日在 Google 的博客上发布,当晚 Demis Hassabis 也在 X 上用自己的话宣布了同一款模型。此次推出是分阶段进行的,只有第一阶段有具体日期:Argon 首先通过 Fairwind 计划面向经过审查的网络防御人员开放,这是 Google 为政府和国家网络主管机构、关键基础设施运营商及核心技术平台打造的唯一申请制层级。Hassabis 本人的帖子称,公司正在推出它,“今天先从政府和可信的网络防御人员开始,通过我们的 Fairwind 计划”。在那之后,Google 的措辞将付费 API 客户和 Google AI Ultra 订阅用户列为下一批,然后是开发者、企业和消费者。这些后续阶段均未附带日期。
真正重要、也是任何规划工作的人都需要知道的内容,恰恰不在那份清单里:正式可用日期、模型 ID、上下文窗口、参数数量、模型卡或系统卡。谷歌公布的是输出上限,而不是上下文窗口。这个上限是 100 万 token,高于此前 Gemini 系列所使用的 64K 上限,谷歌称其行业领先。单次调用可返回的内容提升一个数量级,对长 agent 轨迹和单次渲染来说是实打实的变化,而且这也是公告中唯一一个没有任何歧义的技术数字。

该基准测试集范围广泛,且完全未被复现。谷歌报告 DeepSWE v1.1 为 77.9%,在 AutomationBench 上以 51.3% 位列第一,LVBench 为 91.7%,在 CWE-bench v1 上以 68% 并列第一,在 Vals Index、其 Vals Finance Agent v2、Harvey 的 Legal Agent Benchmark 上取得领先结果,并在 Gray Swan 的 Indirect Prompt Injection 基准测试中表现最强。其中每一个都是厂商自己的数字,由厂商发布,且没有一个被独立复现。9月流传的另一组数字,被呈现为预测的 Gemini 4 基准测试结果,AutomationBench 得分为 48.7%,结果证明是从一次无关发布中回收而来的,并非谷歌发布。谷歌实际报告的 AutomationBench 数字是 51.3%,这是一个来自不同来源的不同数字。
这两个名字产生的记分牌
把两者在这组配对实际起决定作用的六个维度上并排比较,问题的形态就显而易见了:
• 作为具名产品存在——Gemini 4:否。Gemini 4 Argon:是,于 2026-09-30 公布。
• 今日即可调用 — Gemini 4:不存在任何模型 ID 或端点。Gemini 4 Argon:同样不存在模型 ID 或端点;其访问由 Fairwind 管控,且仅限申请。
• 价格——Gemini 4:未公布。Gemini 4 Argon:每百万 token 2 美元/10 美元(入门价),之后为 4 美元/20 美元。厂商声明。
• 最大输出 — Gemini 4:未公布。Gemini 4 Argon:100 万个 token,而上一代仅为 64K。厂商声明。
• 智能指数 — Gemini 4:未评估。Gemini 4 Argon:在高推理强度下,Artificial Analysis 的 Intelligence Index 得分为 53,每项指数任务成本为 1.99 美元。据 Artificial Analysis。
• 独立排行榜排名——Gemini 4:未上榜。Gemini 4 Argon:以 68.90% 位居 Vals 指数第一,每次测试成本为 15.68 美元,输入 13.40B、输出 142.01M tokens。据 Vals。

把最后两行放在一起看,你就会发现这场对比中唯一真正有意思的分歧。Artificial Analysis 把 Gemini 4 Argon 排在 53 分,与 Claude Fable 5.1 和 GPT-6 Astra 持平,落后于 58 分的 Claude Opus 5.5 五分。Vals 则直接把它排在第一位。两者都是独立的,都在衡量真实存在的东西,只是衡量的东西不同——AA 的指数对编程、推理和知识工作领域的十项固定评测赋予权重,而 Vals 指数则按四个行业在美国经济增加值中所占的份额来赋予权重。一个模型可以在一张榜上领先而在另一张榜上不领先,而这并不意味着哪张榜是错的。
Vals 那一行还有第二点值得注意,而这正是企业买家应该关心的。Vals 将 Argon 的价目表记为 $4/$20——即优惠期后的价格——而 Google 自己的公告则写的是 $2/$10。如果每次测试 15.68 美元的成本是按 $4/$20 计算的,那么接受优惠价的买家在同样的工作上会看到一个显著更低的数字,而错过优惠窗口期的买家则不会。Google 尚未说明该窗口期持续多久。这一个未定义的变量,左右着整个发布中最与决策相关的数字。
你今天可以呼叫的对象
Gemini 4 名下什么都没有,我们也不例外。我们查了目录:google/gemini-4、google/gemini-4-argon、google/gemini-4-pro 和 google/gemini-3.8-flash-cyber 全都返回“未找到模型”,其他所有路由平台也是如此,因为它们都没有可供路由的模型 ID。Gemini API 自己的模型列表——Gemini 3.8 Flash、Gemini 3.8 Live、Gemini 3.1 Pro、Gemini 3 Flash——根本不存在任何形式的 Gemini 4 条目。在 Argon 通过 Fairwind 队列并获得标识符之前,任何地方都没有计费价格,也没有端点。
Google 已上线的专业版则是另一回事。Gemini 3.1 Pro Preview 自 2026 年 2 月 19 日起就出现在我们的目录中,价格为每百万 token 输入 $2.00、输出 $12.00,上下文窗口为 1,048,576 token,最大输出为 65,536 token,并支持文本、图像、音频、视频和文件的多模态输入。八个月过去了,它在 Gemini API 自己的模型列表中仍被标记为 Preview,这本身就是 Argon 之所以存在的理由。一旦输入 token 超过 200,000,价格就会翻倍,输入和输出分别达到 $4 和 $18。

这正是本次比较中唯一能给出可操作答案的地方。Gemini 3.1 Pro Preview 已经上线运行,与其他 200 多个模型一样,都由我们路由,共用同一个兼容 OpenAI 的端点,按供应商目录价提供,不加任何加价——因此,当 Google 最终为 Gemini 4 Argon 公布标识符和计费费率,随后在命名规律不变的情况下再公布一个 Pro 层级的同门型号时,这种透传意味着那些费率在 Google 那边出现的当天,就会出现在我们这边。与此同时,如果你想实测 pro 层级,而不是只看文字介绍,那要测的就是这个模型。如果你想试用一个行为特征仍在被刻画之中的模型,自动故障转移(跨供应商)就是你的做法——无需把一条生产路径押注在一个 Google 自己都称之为逐步引入的预览版上。
有一个注意事项,应当与价格一并提及
Bloomberg 9月30日报道称,一些可直接访问 Argon 的 Google 员工表示,它在实际工作中的表现不如基准测试分数所暗示的那样好,其中前端设计被特别提及,两名员工使用了“benchmaxxing”一词。Google 对该描述提出异议。值得将其与基准测试列表并列,正是因为基准测试列表是该模型全部的公开证据基础。当只有一家供应商的数字且无法复现时,一份指出这些数字并未说明全部情况的报告就不是脚注。它是一半的证据。
谁应该选哪个
如果你正在这两个名字之间做选择,那你实际上还谈不上在选择什么,而诚实的建议是围绕这一点来做规划,而不是围绕比较。
• 如果你本季度需要在生产环境中使用 Google 的专业级模型,答案是 Gemini 3.1 Pro Preview。它可调用,已有定价,而且它正是 Argon 被定位为要取代的那个层级。等待 Argon,就是在等待一个你无法加入的队列。
• 如果你是 Argon 设限所面向的对象——政府网络主管机构、关键基础设施运营方、软件维护者——那么 Fairwind Program 就是唯一的途径,而这一门槛的具体性关乎模型能力的事实,而非营销说辞。Google 训练它是为了漏洞发现与修补,并未将其面向大众发布。
• 如果你正在为 2026 年迁移做预算,引入期请使用 $2/$10,之后的所有时段请使用 $4/$20。不要使用单一的混合数字,也不要在未核实 Vals 的 $15.68 每次测试成本是按哪张费率卡计算出来之前,就使用这个数字。
• 如果你在等“Gemini 4”,那你要等的是一个模型 ID。这个名字终将对应上一个 ID——谷歌横跨三代产品的命名规律表明,Pro 档和 Flash 档各有自己的标识符——但规律不等于官方公告,关于一个光秃秃的 Gemini 4 会是什么样、成本多少、能做什么,目前没有任何已发布的信息。
更广泛的要点是,这个博客以前不得不说明,以后想必还不得不再次说明:一个代际名称并不等于一个模型。Gemini 4 Argon 是 Google 唯一为之落实了名称、价格、基准测试集和访问计划的东西。该系列其余部分只是一种模式,而模式是一种你可以预测、却无法指名道姓的东西。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
