
Gemini 4 Carbon 泄露:谷歌内部检查点,员工称其编码水平堪比 Claude Opus 5.5
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 84 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
这个故事有一个版本是新闻,有一个版本是噪音,区别完全在于那些名字附着在什么上。2026年10月9日和10日,Business Insider 报道——追踪泄密的媒体 TestingCatalog 转述——这家搜索巨头的员工正在内部测试一个额外的 Gemini 4 检查点,名为Carbon;早期内部反馈认为Carbon在编程方面感觉与Claude Opus 5.5相当,Barium-B是被选中用于公开Gemini 4 Argon发布的检查点,而Carbon——通过公司内部Jetski平台测试——则是一个独立且可能更强的迭代版本。让这段内容值得细读而非略读的是最后一句:Carbon是作为Gemini 4 Argon的更新发布,还是作为独立版本发布,用报道自己的话说,尚未确认。而这就是证据的全部状态——没有公告,没有模型标识符,没有端点,没有价格,没有模型卡,也没有来自供应商的评论。本页上所有具体内容要么是泄密,要么是从泄密中得出的推断,要么是关于另一个可发布模型的事实,而泄密正是对照它来衡量的。
报告实际声称的内容
信号很微弱,但它足够具体,因而可以被证伪,而这也是它唯一有理由出现在像这样的页面上的原因。剥离掉框架后,这些主张如下:
• Google 员工正在内部测试一个名为 Carbon 的 Gemini 4 检查点。它不是公开模型,无法通过任何 API 调用。
• 据报道,早期内部反馈认为 Carbon 在编程方面的手感可与 Claude Opus 5.5 相媲美——这仅是员工测试得出的主观印象,并非基准测试结果,也不是 Google 外部任何人能够复现的数字。
• 公众真正听说过的那个模型——Gemini 4 Argon——背后的检查点名为 Barium-B,而 Carbon 被描述为一个独立且可能更强大的迭代版本,而非同一构建的两个名称。
• 据报道,Carbon 正通过 Jetski 得到实际运用,同一报道称,Jetski 是 Google 内部与 Antigravity 相关联的名称,而 Antigravity 是 Google 的智能体编码环境。
• Carbon 究竟会成为未来的 Gemini 4 Argon 更新,还是一个独立的 Gemini 4 版本,目前尚不清楚。Google 尚未对此发表任何评论。
那就是泄露内容。它包含一处对比、一处代号关系和一个真正悬而未决的问题,其中没有任何部分是发布内容。

代号阶梯,以及哪一级才重要
这份报告之所以需要一枚解码环,是因为 Google 那种元素周期表式的习惯会把三个看似并列、实则并不并列的名称塞进同一段里。按读者实际上能用每个名称做什么来排序:
• Gemini 4 Argon——已正式发布。这是一个真实的模型名称,有第一方发布公告和家族页面,公布了每百万输入 token 2 美元、每百万输出 token 10 美元的尝鲜价,公布了 100 万 token 的输出上限,并采用分阶段开放的方式,最初面向经过审核的网络防御人员,据称接下来将扩大到付费 API 客户。但它仍然没有可用于请求中的模型标识符,而这正是已发布模型与可调用模型之间的分界线。
• Barium-B——一个检查点名称,而非产品。根据同一份报道,它是被选中用于 Argon 公开发布的那个构建。这个标签的有用之处就在于此:它告诉你,Argon 这个名字,是一项围绕内部构建做出的发布决策,而不是构建本身。
Carbon——一个内部检查点,附带着员工的印象,除此之外什么都没有:没有编号、没有价格、没有时间窗口、没有日期。它只是一个带着代号的传闻,而代号是廉价的。
这样看,这件事并不是“新的 Gemini 泄露了”。而是,谷歌似乎在并行运行不止一个前沿检查点;它对外冠以公开名称的那个,并不是其工程师最热衷的那个;而公司之外没有人知道,这两个事实中哪一个最终会变得重要。
为什么“感觉像 Claude Opus 5.5”才是那句承重之言
在报告的诸多内容中,这项比较承担的作用最大,却最难核实,因此有必要明确它究竟是在与什么作比较。Claude Opus 5.5 是 Anthropic 的旗舰型号,并且根据独立测评,是当前一代中可广泛调用的最强编码模型——当谷歌工程师想不点名某个基准就说“这就是那个好的”时,会拿它作为参照。按其公布的表价,每百万输入 token 收费 4.00 美元,每百万输出 token 收费 20.00 美元,缓存读取为每百万 0.20 美元;它支持 100 万 token 输入窗口和 12.8 万 token 最大输出。
与之对照,这个比较同时说明了两件事,而第二件正是人们会略过的那件。第一件关乎竞争力:一个谷歌内部检查点,被拿来与领先对手的旗舰模型相提并论,这种赞誉谷歌不会写进博客文章里。第二件关乎定位:这个比较只是员工对编码手感的主观印象,而这类说法恰恰经得起聊天窗口的检验,却会在排行榜面前不堪一击。没有人发布过 Carbon 的基准测试。没有 Artificial Analysis 的收录条目,没有厂商的基准测试表,也没有评测方法 PDF——这些东西 Gemini 4 Argon 有,而它没有。感觉不等于分数,而这一页不会把前者包装成后者。
还有一个定价后果值得点明,但不必假装知道答案。如果 Google 内部有一个在编程方面“感觉像 Claude Opus 5.5”的检查点,而 Google 实际发布的模型在独立指数上比它低五分,那么有意思的问题就不是 Carbon 好不好——而是 Google 会把它定在什么价位,以及它是否会被以 Gemini 其余产品线发布时的那种主力价位出售。
缺了什么,以及为什么这份清单比新闻还长
对不存在之物的诚实盘点,便是整篇文章,所以它来了:
• 模型标识符——Carbon 没有,Gemini 4 Argon 也没有。这两个名称都没有出现在任何可以向其发送请求的地方。
• 价格——Carbon 无论哪个档位都没有公布任何价格,甚至连入门价都没有。
• 模型卡或系统卡——没有,背后也没有已发布的评估方法。
• 上下文窗口、输出限制或参数数量——均未公布,而且 Google 从未公布过任何 Gemini 的参数数量。
• 一项基准测试结果——与 Opus 5.5 的对比只是员工的印象,这意味着没有具体数字、没有测试,也没有可复现性。
• 一个日期——没有公告,没有分阶段推出,没有时间窗口,Google 对是否计划发布 Carbon 也完全不置一词。
• 一种关系——即 Carbon 究竟是下一次 Argon 更新,还是一个单独的 Gemini 4 模型。这是报告中影响最大的单一未知项,而且报告本身明确未予确认。
任何不在那份清单上的内容都是推断,包括未来两周内就此写出的绝大部分内容。
开发者今天能用这个做什么
有用的答案是,几乎什么都不会改变,而精确说明原因很有必要。Gemini 4 Argon 和 Carbon 都不在 OrcaRouter 上——在我们的自有目录中查询其中任何一个都得不到任何结果,而且在 Google 让其中之一变得可调用之前,它会一直得不到任何结果。Gemini 4 这个名字不是你可以路由过去的东西;它是一个附属于受限发布的名称。任何声称提供“Gemini 4 Carbon”访问权限的账号,卖的只是一个标签。
真正确凿存在的,是泄露所参照的那个模型。 Claude Opus 5.5 已按 Anthropic 的标价在 OrcaRouter 上线——每百万 token 输入 $4.00、输出 $20.00,缓存读取每百万 $0.20,零加价原样透传——所以那个被描述为与 Carbon 相当的特定模型,你今天就能调用,而且与其他所有模型共用同一个 API key。这比泄露本身更有用,因为它是这项对比中可以被验证的那一半。
能经受住传闻的姿态,是不需要传闻成真的那种姿态。把你最棘手的编码工作负载交给 Claude Opus 5.5,并为不需要它的流量保留一条降级到更便宜档位的故障转移规则;当真正的 Gemini 4 标识符出现在某家提供商的目录中时,我们的价目表价格会在 Google 定价的同一天更新,因为从供应商公布价格到我们将其传递出去之间,没有重新谈判的步骤。一个 API 覆盖 200+ 模型把“我们该迁移吗?”变成一次路由 DSL 编辑和线上流量的 A/B 测试,而不是一次重写。为你能衡量的结果做路由,而不是为你读到过的名字做路由。


我们正在观看
• Google 究竟会不会说点什么。一条评论、一次家庭页面的改动,或发布文章里的一句话,都会立刻把这一切从泄密栏中移出去。沉默则让它留在原处。
• Argon 推广的第二阶段。公告将付费 API 客户和 Ultra 订阅者描述为继经过审查的防御者之后的下一批对象,而 Gemini 4 标识符的出现,正是将“已宣布”变成“可调用”的事件。如果可运行的端点落地,那么其检查点究竟是 Barium-B 还是更新的东西,就会成为一个具体问题。
• 任何对 Carbon 的独立测量。一旦这样一个检查点出现在中立的排行榜上,而非员工的印象里,Opus 5.5 的那句话就不再是一种感觉,而开始成为一个数据点——或者不再成立。
• 价格表。Google 为自家工程师所偏爱的前沿检查点定出什么价位,正是判断 Carbon 究竟是 Argon 的一次更新,还是自成一档的关键信号。
• 代号之间的关系能否经受住与发布会的接触。Barium-B 排在 Argon 之后、与 Carbon 并列,今天看来是个干净利落的故事;而发布帖往往习惯把干净利落的故事压缩成单一型号、单一 ID。
不对此过度吹嘘的总结很短。据报道,Google 员工正在测试一个名为 Carbon 的内部 Gemini 4 检查点,他们的早期印象是,它写代码像 Claude Opus 5.5;公开版 Gemini 4 Argon 发布背后的检查点是另一个,名为 Barium-B;而 Carbon 最终是否会成为产品——一次更新、一个独立模型,还是什么都不是——尚未得到确认。那句话中你能据以行动的那一半,就是点名 Claude Opus 5.5 的那一半,因为它是整段中唯一一个带有模型标识符、价格和端点的模型。继续调用你能调用的,并保留一条故障转移规则,以备另一个名字也成为这样一个模型的那一天。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
