
Claude Fable 5的“Kettle”泄露:隐藏在签名思考中的内部模型ID——我们目前所知
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
8月16日太平洋夏令时间(PDT)晚上11:29:45,一位研究人员在X平台上发布了一条说法,把Anthropic API中一个不起眼的角落变成了一则“就目前所知”的报道:他们说,解码随每个Claude思维块(thinking block)携带的服务器签名“signature”,就能找出实际回答你的模型的名称。按照他们的解读,公开标记为claude-fable-5的响应——即Anthropic自2026年6月9日起以每百万token 10美元/50美元广泛推出的Mythos级Claude Fable 5——开始携带一个在Anthropic公开文档中任何地方都找不到的内部标识符:claude-kettle-e2c95a10-v2-prod。响应标签没有任何变化。计费、API的顶层model字段或Anthropic的固定快照(pinned-snapshot)保证也没有被证明有变化。真正变化的,是一个埋在文档明确告诉开发者不要解析的字段中的字符串。
这是一份泄露报告,不是裁决结果。这项发现已经过去四天,它基于单个研究者的解码,尚未被独立复现,而且Anthropic尚未对“Kettle”——或其伴随标签MYCRO_MODEL_MANATEE——具体指什么作出评论。有用的问题不是“Anthropic是否调换了Fable 5?”证据并不能证明这一点。有用的问题是,如果一个内部模型ID出现在公开模型ID之下,若它是真实的,那将意味着什么,又不意味着什么。以下是我们目前所知的信息。
泄漏实际上发现了什么
该信号是一条来自 @chetaslua 的单一 X 帖子(状态 ID 2089783170896179632,发布于 2026 年 8 月 16 日),以该账号惯常的“先给证据”风格写成。简而言之,其主张是:
Claude 的思考块在签名字段中携带一个由服务器签名的 protobuf。
• 那位研究员说,该 protobuf 的第六个字段保存的是实际生成该响应的模型的标识符。
• 从8月16日太平洋夏令时间晚上11:29:45起,2,582个抽样签名中的2,582个携带相同的值:claude-kettle-e2c95a10-v2-prod。
第二个内部标签 MYCRO_MODEL_MANATEE 也出现在同一元数据中。
“2,582分之2,582”这个数字承载着修辞作用:它是研究者的证据,表明这不是一次性事件,也不是A/B测试中的某一片段,而是标识符所指内容的全面切换。帖子中没有包含解码背后的方法——没有原始签名、没有解码脚本、没有推断出的protobuf模式、没有完整的响应元数据。公开的证据仅是一张汇总图表。这使得该发现在看似可信的同时,目前也无法验证。

为什么签名甚至还有一个“字段六”?
Claude 返回的每个思考块都带有一个签名字段。按照 Anthropic 的思考文档,该签名是“完整推理的加密副本”,在多轮和工具调用对话中,您应将其原样传回,API 使用它来“验证思考块是由 Claude 生成的”。在 Claude Fable 5 上,默认行为使签名成为唯一可见的痕迹:当 display 设置为“omitted”(Fable 5、Mythos 5、Opus 5 和 Sonnet 5 上的默认设置)时,思考块返回时 thinking 字段为空,仅填充了签名。
文档随后补充了一句对任何基于该字段的泄漏都至关重要的话:“签名字段是不透明的:不要解释或解析它。”而 Kettle 的说法恰恰就是在解析它。这并不能证明该说法是错的——签名必须是机器可读的,Anthropic 自身的服务栈才能使用——但这意味着,解码是在违背供应商明确指示的情况下进行的,针对的是一个未公开的协议,而且该研究者对该协议的重构并未发表。所有建立在“第六个字段表示服务模型”之上的推断都继承了这种不确定性。
它所不能证明的
首先,证据实际上是什么:一个公开标记为 claude-fable-5 的响应带有一个此前未报告的内部标识符。仅此而已。单凭该标识符并不能证明 Anthropic 替换了 Fable 5 的权重,也不能证明存在能力更强的后继版本,不能证明响应变得更好或更差,也不能证明任何请求被路由到了更小的模型。“Kettle”可能是同一个 Fable 5 快照的内部服务部署名称;可能是某个路由器组件的名称;也可能是安全栈中的某个分类器。该代号无法区分这些可能性。
Anthropic 自己的版本控制策略解释了为什么这次泄露与没有发生任何变化并不矛盾。在“Model IDs and versioning”文档中,两句话并排出现:
Anthropic 不会更新现有模型 ID 的权重或配置。当更新版本可用时,它会以新的模型 ID 发布。
对于给定的ID,模型权重是固定的,但模型周围的服务基础设施可能会随时间变化。这些基础设施包括请求路由器、安全分类器和采样逻辑等组件。

那第二句话就是“Kettle 是个丑闻”和“Kettle 是个寻常的周一”之间的全部概念鸿沟。文档甚至预见到了行为漂移:“偶尔,即使模型 ID 和权重未变,基础设施更新也会在可观察行为上产生微小差异。”一个名为 Kettle 的新路由器或服务部署,恰好符合那句话的描述。要让这次泄露真正具有杀伤力,它需要证明要么该 ID 背后是一个违反政策的新模型,要么存在一种违反了以下可见性规则的机制。
Fable 5 已有的文档化回退路由
Claude Fable 5 已经内置了一种真实存在、有据可查且有意保持可见的模型切换机制。安全分类器会检查请求,并可将一部分请求 — {{1}}{{KEEP}}Anthropic{{/KEEP}} 列举了攻击性网络安全、双重用途生物学、模型蒸馏以及一些前沿芯片开发工作{{/1}} — 路由到 Claude Opus 5 模型。在面向消费者的界面上,这种回退应当是显而易见的:显示一条通知、在答案中标明服务模型的名称,并且模型选择器切换到 Opus。在 API 中,响应通过顶层 model 字段和专门的回退内容块暴露服务模型。
关于 Kettle 的说法所描述的是另一回事,而关键在于这一差异:一个内部标识符出现在某个响应之下,而该响应仍保留着公开的 Fable 5 标签。研究者的帖子既没有展示回退通知,也没有展示被更改的 API 模型字段或回退块——如果展示了这些,报道就会是“文档所述的回退机制被触发”,而不是“Anthropic 在静默路由”。既然如此,这次泄露并未证明任何可见性保证遭到违反,因为它没有说明 Kettle 是什么。
为什么即使什么都没有改变,这依然很重要
固定模型 ID 是一种信任机制。Anthropic 的文档承诺“当你在 API 请求中使用某个模型 ID 时,底层模型在该 ID 的整个生命周期内保持不变”——这正是团队能够针对 claude-fable-5 进行基准测试,并期望结果在下个季度仍有意义的原因。隐藏在该 ID 之下的一个标识符,无论它是什么,都在提醒人们:这一保证涵盖的是权重和配置,而非从请求到 token 的整条路径。如果某个真正不同的模型在未披露的情况下以公开 ID 运行,那么每一个以此为 ID 的评估、每一项成本预测,以及每一次质量回归测试,都将被悄然作废。
计费的角度让问题更加尖锐。Claude Fable 5 每百万输入 token 收费 $10,每百万输出 token 收费 $50——这是 Anthropic 公布的最高收费标准。如果实际服务的模型与计费 ID 不同,问题就变成:该适用哪个费率、由谁来决定。泄露的内容没有证据显示发生过这种情况;重点只在于,签名字段是你首先会寻找迹象的地方。
时间点也值得注意。这是九天之内Anthropic发出的第三个信号:8月7日,公司宣布重新训练了Fable 5的生物分类器,在内部测试中把与生物学相关的回退减少了约85%;8月14日,其《负责任扩展政策风险报告》承认存在一个未发布的内部“Model 2”,Anthropic称其相比Claude Mythos 5是“显著的改进”,且无意发布。两者都是厂商声明,但合在一起表明Anthropic正在主动改变围绕Claude Fable 5的系统——7日调整分类器,14日承认内部继任者——同时保持claude-fable-5这一ID不变。Kettle将是同样的故事形态,只是少了披露部分。
该怎么办
对 API 调用者来说,务实的立场枯燥但正确:一个标识符并不能证明发生了模型替换,而且这次泄露目前还没有任何可操作的内容。你能做的是自己收集证据。记录你实际收到的响应中的顶层 model 字段和任何回退块,并观察固定工作负载下的 token 与成本增量。如果某个有文档记录的回退被触发,它恰恰会在这些地方显现出来。这才是对你的工作负载唯一重要的测试,而且它不依赖任何人去解码 Anthropic 的签名格式。
如果您通过 OrcaRouter 路由到 Claude Fable 5,返回的响应形状与 Anthropic 返回的相同,而且由于我们以零加价传递提供商列表价格,因此没有第二套价格需要核对——如果 Anthropic 将来更改 Fable 5 的费率,新数字当天就会在我们这边生效。对于像这样未经证实的情况,低风险的做法是:继续使用该模型,而不把生产路径押在谣言上,即把一部分真实流量路由到 Claude Fable 5,并自动故障转移到经过验证的后备——Claude Opus 5(每百万 $5/$25),或更便宜的编码层模型——这样质量回退就变成路由决策,而不是事故。同一密钥,无需第二份合同,故障转移只是路由DSL的更改,而非重写。

我们正在观看的内容
• 无论Anthropic是否置评。最干净的解决方式是简单一句话说明Kettle和Manatee是什么。沉默本身也是一种信息。
• 独立的复现。如果有人公布原始签名、解码方法和推断出的 protobuf schema,就能把这件事从一个人的图形变成可核查的说法。在那之前,它只是“目前已知的信息”,而非一项发现。
可见性表面。如果 claude-fable-5 的响应开始显示回退通知、更改的 API 模型字段或回退块,那么“已记录的回退”解读会更有力;如果没有,则“未记录的路径”解读更有力。
一个新的模型 ID。Anthropic 的版本策略规定,真正的新版本会以新的 ID 发布。因此,要最确凿地确认 Kettle 是真正的继任者,就得看 Anthropic 发布新东西——而不是原地路由。留意 claude-fable-5.1 或类似名称。
• “Manatee”是否会被解释。第二个标签是一条还没有人拉过的线。
常见问题
Anthropic 真的在将 Claude Fable 5 路由到另一个模型吗?
未经证实。泄露信息显示,标记为 claude-fable-5 的响应在一个带签名的思维签名中携带了内部标识符 claude-kettle-e2c95a10-v2-prod。这并不能证明权重被修改、有后继版本被部署,或有任何请求被降级处理。“Kettle” 同样可能是同一 Fable 5 快照的内部服务部署名称。
Kettle 标识符是如何找到的?
研究员 @chetaslua 声称他们解码了 Claude 思考块签名(signature)字段中的 protobuf,并从第六个字段读取了模型标识符。Anthropic 的文档称该签名是“不透明的”(opaque),并告诉开发者不要解析它,而该研究者的解码方法尚未公布,因此该说法目前无法独立复现。
这是否违反了Anthropic的固定模型保证?
Unknown。Anthropic 的版本说明文档指出,它从不更新现有模型 ID 的权重或配置,新版本会以新 ID 发布——但文档明确允许模型周边的服务基础设施(请求路由器、安全分类器、采样逻辑)发生变化。Kettle 标识符可能正是这类变化,因此并不违反该保证。
我如何知道为我服务的模型是否发生了变化?
在 API 响应的顶层 model 字段中查看回退内容块,并在固定工作负载上跟踪 token 和成本变化量。Anthropic 文档中记载的回退应能在这些位置看到。没有任何公开 API 字段会暴露 Kettle 标识符。
实事求是地说,这次泄露只是给某个东西安上了一个名字,并未证明它究竟是什么。Kettle 这个标识符是真实的,但其真实性仅限于泄露字符串所能达到的程度:一位研究人员称它确实存在——从 8 月 16 日夜间开始出现,2,582 次检测中 2,582 次都能找到它。它所指代的东西——一个新模型、一次更名后的部署、一个路由器组件、一个分类器——仍未得到验证,而 Anthropic 自己的文档为整件事提供了一个极为平常的解释。这就是这篇文章的价值,也是它的局限所在。在原始签名被公开或 Anthropic 说明 Kettle 到底是什么之前,正确的态度是将其视为"目前已知的全部":值得关注,值得记录自己的流量,但不值得因此改变你的模型选择——尤其是当路由层让你无论选哪一边都能保留选择余地的时候。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
