文章《Gemini 4 Carbon — LEAK REPORT》的主视觉标题卡,带有“UNVERIFIED”徽章,副标题为“一个公众无法调用的 Google 内部检查点——报告怎么说”,三枚标签分别写着“来源:Business Insider,经由 TestingCatalog”“2026 年 10 月 9–10 日”以及“在 Jetski(Google 的内部平台)上测试”,左侧卡片写着“说法:早期内部反馈认为 Carbon 在编程方面可与 Claude Opus 5.5 相媲美”,右侧卡片写着“背景:Barium-B 是公众版 Gemini 4 Argon 发布所选的检查点”。OrcaRouter 标志合成在右下角。
Guides & Insights

Gemini 4 Carbon 泄露:谷歌内部检查点,员工称其编码水平堪比 Claude Opus 5.5

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这个故事有一个版本是新闻,有一个版本是噪音,区别完全在于那些名字附着在什么上。2026年10月9日和10日,Business Insider 报道——追踪泄密的媒体 TestingCatalog 转述——这家搜索巨头的员工正在内部测试一个额外的 Gemini 4 检查点,名为Carbon;早期内部反馈认为Carbon在编程方面感觉与Claude Opus 5.5相当,Barium-B是被选中用于公开Gemini 4 Argon发布的检查点,而Carbon——通过公司内部Jetski平台测试——则是一个独立且可能更强的迭代版本。让这段内容值得细读而非略读的是最后一句:Carbon是作为Gemini 4 Argon的更新发布,还是作为独立版本发布,用报道自己的话说,尚未确认。而这就是证据的全部状态——没有公告,没有模型标识符,没有端点,没有价格,没有模型卡,也没有来自供应商的评论。本页上所有具体内容要么是泄密,要么是从泄密中得出的推断,要么是关于另一个可发布模型的事实,而泄密正是对照它来衡量的。

报告实际声称的内容

信号很微弱,但它足够具体,因而可以被证伪,而这也是它唯一有理由出现在像这样的页面上的原因。剥离掉框架后,这些主张如下:

• Google 员工正在内部测试一个名为 Carbon 的 Gemini 4 检查点。它不是公开模型,无法通过任何 API 调用。

• 据报道,早期内部反馈认为 Carbon 在编程方面的手感可与 Claude Opus 5.5 相媲美——这仅是员工测试得出的主观印象,并非基准测试结果,也不是 Google 外部任何人能够复现的数字。

• 公众真正听说过的那个模型——Gemini 4 Argon——背后的检查点名为 Barium-B,而 Carbon 被描述为一个独立且可能更强大的迭代版本,而非同一构建的两个名称。

• 据报道,Carbon 正通过 Jetski 得到实际运用,同一报道称,Jetski 是 Google 内部与 Antigravity 相关联的名称,而 Antigravity 是 Google 的智能体编码环境。

• Carbon 究竟会成为未来的 Gemini 4 Argon 更新,还是一个独立的 Gemini 4 版本,目前尚不清楚。Google 尚未对此发表任何评论。

那就是泄露内容。它包含一处对比、一处代号关系和一个真正悬而未决的问题,其中没有任何部分是发布内容。

A two-column infographic titled 'Gemini 4 Carbon — what the report says / what it does not'. Left column 'What the report says': '9–10 Oct 2026 — Business Insider, relayed by TestingCatalog', 'Google staff testing a Gemini 4 checkpoint named Carbon', 'Early internal feedback: feels comparable to Claude Opus 5.5 for coding', 'Barium-B is the checkpoint chosen for the public Gemini 4 Argon release', 'Tested via Jetski, tied to Antigravity'. Right column 'What it does not say': 'Whether Carbon ships as an Argon update or a separate Gemini 4 release', 'No model ID, endpoint or price of any kind', 'No model card, context window or parameter count', 'No benchmark number behind the Opus 5.5 comparison', 'No date, and no comment from Google'. Footer: 'All leak claims unverified; Google has not commented.'

代号阶梯,以及哪一级才重要

这份报告之所以需要一枚解码环,是因为 Google 那种元素周期表式的习惯会把三个看似并列、实则并不并列的名称塞进同一段里。按读者实际上能用每个名称做什么来排序:

• Gemini 4 Argon——已正式发布。这是一个真实的模型名称,有第一方发布公告和家族页面,公布了每百万输入 token 2 美元、每百万输出 token 10 美元的尝鲜价,公布了 100 万 token 的输出上限,并采用分阶段开放的方式,最初面向经过审核的网络防御人员,据称接下来将扩大到付费 API 客户。但它仍然没有可用于请求中的模型标识符,而这正是已发布模型与可调用模型之间的分界线。

• Barium-B——一个检查点名称,而非产品。根据同一份报道,它是被选中用于 Argon 公开发布的那个构建。这个标签的有用之处就在于此:它告诉你,Argon 这个名字,是一项围绕内部构建做出的发布决策,而不是构建本身。

Carbon——一个内部检查点,附带着员工的印象,除此之外什么都没有:没有编号、没有价格、没有时间窗口、没有日期。它只是一个带着代号的传闻,而代号是廉价的。

这样看,这件事并不是“新的 Gemini 泄露了”。而是,谷歌似乎在并行运行不止一个前沿检查点;它对外冠以公开名称的那个,并不是其工程师最热衷的那个;而公司之外没有人知道,这两个事实中哪一个最终会变得重要。

为什么“感觉像 Claude Opus 5.5”才是那句承重之言

在报告的诸多内容中,这项比较承担的作用最大,却最难核实,因此有必要明确它究竟是在与什么作比较。Claude Opus 5.5 是 Anthropic 的旗舰型号,并且根据独立测评,是当前一代中可广泛调用的最强编码模型——当谷歌工程师想不点名某个基准就说“这就是那个好的”时,会拿它作为参照。按其公布的表价,每百万输入 token 收费 4.00 美元,每百万输出 token 收费 20.00 美元,缓存读取为每百万 0.20 美元;它支持 100 万 token 输入窗口和 12.8 万 token 最大输出。

与之对照,这个比较同时说明了两件事,而第二件正是人们会略过的那件。第一件关乎竞争力:一个谷歌内部检查点,被拿来与领先对手的旗舰模型相提并论,这种赞誉谷歌不会写进博客文章里。第二件关乎定位:这个比较只是员工对编码手感的主观印象,而这类说法恰恰经得起聊天窗口的检验,却会在排行榜面前不堪一击。没有人发布过 Carbon 的基准测试。没有 Artificial Analysis 的收录条目,没有厂商的基准测试表,也没有评测方法 PDF——这些东西 Gemini 4 Argon 有,而它没有。感觉不等于分数,而这一页不会把前者包装成后者。

还有一个定价后果值得点明,但不必假装知道答案。如果 Google 内部有一个在编程方面“感觉像 Claude Opus 5.5”的检查点,而 Google 实际发布的模型在独立指数上比它低五分,那么有意思的问题就不是 Carbon 好不好——而是 Google 会把它定在什么价位,以及它是否会被以 Gemini 其余产品线发布时的那种主力价位出售。

缺了什么,以及为什么这份清单比新闻还长

对不存在之物的诚实盘点,便是整篇文章,所以它来了:

• 模型标识符——Carbon 没有,Gemini 4 Argon 也没有。这两个名称都没有出现在任何可以向其发送请求的地方。

• 价格——Carbon 无论哪个档位都没有公布任何价格,甚至连入门价都没有。

• 模型卡或系统卡——没有,背后也没有已发布的评估方法。

• 上下文窗口、输出限制或参数数量——均未公布,而且 Google 从未公布过任何 Gemini 的参数数量。

• 一项基准测试结果——与 Opus 5.5 的对比只是员工的印象,这意味着没有具体数字、没有测试,也没有可复现性。

• 一个日期——没有公告,没有分阶段推出,没有时间窗口,Google 对是否计划发布 Carbon 也完全不置一词。

• 一种关系——即 Carbon 究竟是下一次 Argon 更新,还是一个单独的 Gemini 4 模型。这是报告中影响最大的单一未知项,而且报告本身明确未予确认。

任何不在那份清单上的内容都是推断,包括未来两周内就此写出的绝大部分内容。

开发者今天能用这个做什么

有用的答案是,几乎什么都不会改变,而精确说明原因很有必要。Gemini 4 Argon 和 Carbon 都不在 OrcaRouter 上——在我们的自有目录中查询其中任何一个都得不到任何结果,而且在 Google 让其中之一变得可调用之前,它会一直得不到任何结果。Gemini 4 这个名字不是你可以路由过去的东西;它是一个附属于受限发布的名称。任何声称提供“Gemini 4 Carbon”访问权限的账号,卖的只是一个标签。

真正确凿存在的,是泄露所参照的那个模型。 Claude Opus 5.5 已按 Anthropic 的标价在 OrcaRouter 上线——每百万 token 输入 $4.00、输出 $20.00,缓存读取每百万 $0.20,零加价原样透传——所以那个被描述为与 Carbon 相当的特定模型,你今天就能调用,而且与其他所有模型共用同一个 API key。这比泄露本身更有用,因为它是这项对比中可以被验证的那一半。

能经受住传闻的姿态,是不需要传闻成真的那种姿态。把你最棘手的编码工作负载交给 Claude Opus 5.5,并为不需要它的流量保留一条降级到更便宜档位的故障转移规则;当真正的 Gemini 4 标识符出现在某家提供商的目录中时,我们的价目表价格会在 Google 定价的同一天更新,因为从供应商公布价格到我们将其传递出去之间,没有重新谈判的步骤。一个 API 覆盖 200+ 模型把“我们该迁移吗?”变成一次路由 DSL 编辑和线上流量的 A/B 测试,而不是一次重写。为你能衡量的结果做路由,而不是为你读到过的名字做路由。

A screenshot of Google's own Gemini API models documentation page, listing the Gemini 3.8 family and earlier models with their model codes and pricing, and containing no entry for Gemini 4 Argon or Gemini 4 Carbon.A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, showing the model id, its capability chips, a 1M-token context window, a 128K maximum output, and pricing of .00 per 1M input tokens and 0.00 per 1M output tokens with cache reads at /bin/bash.20 per 1M.

我们正在观看

• Google 究竟会不会说点什么。一条评论、一次家庭页面的改动,或发布文章里的一句话,都会立刻把这一切从泄密栏中移出去。沉默则让它留在原处。

• Argon 推广的第二阶段。公告将付费 API 客户和 Ultra 订阅者描述为继经过审查的防御者之后的下一批对象,而 Gemini 4 标识符的出现,正是将“已宣布”变成“可调用”的事件。如果可运行的端点落地,那么其检查点究竟是 Barium-B 还是更新的东西,就会成为一个具体问题。

• 任何对 Carbon 的独立测量。一旦这样一个检查点出现在中立的排行榜上,而非员工的印象里,Opus 5.5 的那句话就不再是一种感觉,而开始成为一个数据点——或者不再成立。

• 价格表。Google 为自家工程师所偏爱的前沿检查点定出什么价位,正是判断 Carbon 究竟是 Argon 的一次更新,还是自成一档的关键信号。

• 代号之间的关系能否经受住与发布会的接触。Barium-B 排在 Argon 之后、与 Carbon 并列,今天看来是个干净利落的故事;而发布帖往往习惯把干净利落的故事压缩成单一型号、单一 ID。

不对此过度吹嘘的总结很短。据报道,Google 员工正在测试一个名为 Carbon 的内部 Gemini 4 检查点,他们的早期印象是,它写代码像 Claude Opus 5.5;公开版 Gemini 4 Argon 发布背后的检查点是另一个,名为 Barium-B;而 Carbon 最终是否会成为产品——一次更新、一个独立模型,还是什么都不是——尚未得到确认。那句话中你能据以行动的那一半,就是点名 Claude Opus 5.5 的那一半,因为它是整段中唯一一个带有模型标识符、价格和端点的模型。继续调用你能调用的,并保留一条故障转移规则,以备另一个名字也成为这样一个模型的那一天。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新