Claude Sonnet 5.2 泄露主卡片:一个“我们目前所知”面板,列出状态为未发布,仅有一条列表条目且无标识符,一个未经证实的观察者标签,证据仅限于一篇汇总帖和一条标题,没有已发布的标识符,没有基准测试,以及 Claude Sonnet 5 作为实际发布的模型,自 6 月 30 日起全面可用
Guides & Insights

Claude Sonnet 5.2:一条列表条目,零个标识符——实际已知的是什么

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Sonnet 5.2 在互联网上登场时,只是某个列表里的第一项。9 月 20 日,X 账号 @kimmonismus 发布了一则汇总帖,开头是它声称"已经开始测试"的几款模型——Claude Sonnet 5.2、Claude Opus 5.2、Claude Fable 5.2 和 Gemini 4 Pro——随后才转向它预计接下来会发布的版本。第一个名字之后的每一个名字,背后都有点东西。Claude Opus 5.2 有一整周的报道,讲的是 Claude Code 内部的一条静默路由通道。Claude Fable 5.2 有自己的泄露帖串。Gemini 4 Pro 有各自独立的目击记录。Claude Sonnet 5.2 则只有一个列表中的位置。这就是截至今天上午的全部公开记录:一条推文,一个低核实度聚合网站上的一个标题,此外在任何地方都找不到标识符、价格、上下文窗口或基准测试数据。Claude Sonnet 5——5.2 将要取代的那款模型——自 6 月 30 日起全面开放,价格为每百万输入 token 2 美元、每百万输出 token 10 美元,并且是所有 Claude 订阅档位的默认模型。

这种不对称才是值得写下来的故事,因为当一条汇总推文被当作新闻事件来读时,丢失的正是这一点。一个模型名称出现在列表里,与一个模型名称出现在模型 ID 旁边,并不是同一种断言;而这种差别,正是“Sonnet 即将更新”与“有人把 Sonnet 这个词和数字 5.2 放在了一起”之间的全部差别。

9月20日的帖子实际说了什么

仔细阅读那篇帖子就会发现,Sonnet 的说法比标题所暗示的还要站不住脚。这份名单分为两半,而 Sonnet 5.2 位于第一半——即“已经看到测试”的那一半——这是两种说法中较强的一个。后半部分则明确留有余地:“即将发布的确认或暗示”,涵盖 Grok 4.7、GPT-6-Sol 和 Kimi K3.1,其中 GPT-6-Sol 这一条甚至还自带一个附加说明:周二预告的一个大发布“可能就是它”。

所以,作者在文章的一半里措辞谨慎,在另一半里却不加限定,而 Sonnet 5.2 正处在不加限定的那一半里。没有截图,没有 API 响应,没有模型字符串,没有测试者报告,没有时间数据。想核实这一说法的读者,没有任何可供对照核查的依据。

这个名字公开露面的唯一另一处,是9月19日的一篇聚合类帖子,其标题写着"{{1}}Fable 5.2、Opus 5.2、Sonnet 5.2 泄露{{/1}}"。点开之后,Sonnet 5.2 出现在标题里,此后在正文中再未现身——正文只是把这三个 Claude 名称一并塞进一句话里,说整个平台取得了"{{2}}显著进展{{/2}}"。那篇帖子对这三个名字都没有给出任何证据,还明确警告说,对虚假的基准测试结果应保持谨慎。两次露面,形态如出一辙:名字混在一组名称之中,自身却没有任何单独附着的信息。

缺少的是具体的、可核查的产物——2026 年每一次真正的 Anthropic 泄露都产生过这样的东西。8 月,Marshmallow 和 Melon 的故事在名为 claude-marshmallow-ht-eap 的字符串以及之后更干净的变体上,出现了可观察的 API 流量。这个月的 Opus 5.2 故事中,开发者报告称“Opus 5”标签背后的后端 slug 指向了某个新位置。Sonnet 5.2 则两者皆无。如果某个 Sonnet 级别的检查点正在开发者能触及的任何地方被提供服务,那么标识符会是最先泄露的东西,因为它是最难隐藏的——它必须存在于请求中。

九月的故事中得到证实的那部分并不是 Sonnet

阅读那篇汇总时的陷阱就在这里。贯穿整个九月、得到多方佐证的 Anthropic 灰度测试事件,是一个 Opus 层级的故事。多家中英文媒体曾报道,Anthropic 正悄悄将一小部分请求路由到一个未发布的检查点,它藏在 Opus 5 标签背后——这是一场静默的灰度测试,开发者是通过行为变化而非名称变化才注意到的。9 月 17 日晚间的报道称,该通道在未通知的情况下被切断,约一天后恢复,之后据说已从 Claude Code 扩展到了聊天和 cowork 界面。报道中与该检查点相关联的名称是 Claude Opus 5.2。

Sonnet 5.2 继承了那篇报道的可信度,却没有继承其任何证据。这是泄露报道中一种特定且常见的失败模式:一个层级有据可查,第二个层级在同一句话里被点名,随后第二个名字便流传开来,仿佛它也曾被报道过。但它并没有。如果你去寻找一份 Sonnet 层级的线路报道,你会找到 Opus 的那份以及一份列表。

在这一切之下,还有一条独立且信源更可靠的报道线索在展开——商业报道称,Anthropic 已将其上市时间推迟至 11 月,并且据路透社援引三名消息人士的说法,正在权衡是否在上市前推出一款新模型,以回应 GPT-6 Astra。这则报道是真实的,也确实相关。但值得注意的是,它并未说明这款模型会属于哪一个层级。在 IPO 前,更新主力机型与发布旗舰机型是截然不同的举措,而迄今公开的信息都没有表明正在考虑的是哪一种。

上个月,社区命名了一个从未发布的 Sonnet

对“Sonnet 5.2”持怀疑态度的最有力论据,并不在于这一说法缺乏依据。而在于这种一模一样的命名模式一个月前就曾在公开场合失败过,并且这次失败是有记录可查的。

8月下旬,两个抢先体验标识符流传开来:claude-marshmallow-eapclaude-melon-eap。这两个字符串都不包含 Opus、Sonnet 或任何版本号。8月24日,社交帖子与谣言博客从外部给它们安上了产品名称——Marshmallow 变成了“Opus 5.1”,Melon 变成了“Sonnet 5.1”——依据是测试者的印象,即 Marshmallow 感觉比 Melon 更强,也比当时的 Opus 5 更强。据称,一名展开调查的开发者发现,这些普通字符串没有产生任何可验证的第一方输出,使得更早的流量成为唯一可观察到的证据。

这两个名字最终都没有发布。在该时间窗口内,Anthropic 的下一次发布是 9 月 1 日的 Claude Fable 5.1——那完全属于另一个层级,所用的名字也与这两个标识符都毫无关联。“Sonnet 5.1”这一标签源于社区的推测,逐渐固化成传闻,随后又烟消云散。

这段历史在这里之所以重要,原因不止于一般的谨慎。这意味着 Sonnet 层级如今已在两个月内两次在泄露中被提及,而两次都没有任何该层级特有的实证。这也意味着最强的先验——Anthropic 实际的 2026 年节奏——指向另一种形态:7 月下旬的 Opus 5、9 月上旬的 Fable 5.1,以及 9 月中旬的 Opus 5.2 灰度测试。Sonnet 层级自 6 月 30 日以来没有动静,这正是 Sonnet 传闻可信的原因,也正是它未经验证的原因。长时间的空白是期待某事发生的理由,而不是某个具体事物存在的证据。

你今天可以实际运行的内容

Claude Sonnet 5 并不是让你在等待期间暂时顶替的角色。它已经是大多数 Claude 流量实际运行的模型,而它的各项数据具体确凿,远非 5.2 传闻中的任何内容所能比拟。

Artificial Analysis model page for Claude Sonnet 5 showing an Intelligence Index of 32 at rank 8, 165 tokens per second output speed, 31.20 second time to first token, $2.00 input and $10.00 output per million tokens, a 1M token context window, 128k maximum output, a Coding Index of 51 and an Agentic Index of 36

• 模型 ID — claude-sonnet-5,现已可调用;Claude Sonnet 5.2 没有任何已发布的标识符

• 价格——每百万输入 token 2 美元,每百万输出 token 10 美元,已于8月10日永久生效;原计划的 3 美元 / 15 美元标准费率不再适用。关于 5.2 的定价一无所知,因为本就没什么可知道的。

• 上下文 — 100 万 token 窗口,最大输出 128K。Anthropic 自己的文章并未在发布页说明该窗口;它确实明确指出的细节是修订后的分词器,而这一点比听起来更重要:相同输入根据内容类型,可能映射到大约 1.0–1.35 倍的 token 数量。

• 厂商报告的基准测试成绩——SWE-bench Pro 63.2%,Terminal-Bench 2.1 为 80.4–80.5%,Humanity's Last Exam 无工具时 43.2%,使用工具时 57.4%,OSWorld-Verified 81.2%,GDPval-AA v2 为 1,618。这些是 Anthropic 的数据,此处未复现

• 独立 — Artificial Analysis 在其自适应推理、最大努力配置中将 Claude Sonnet 5 的智能指数评为 32,远高于其价格档位 24 的中位数,并在非推理高努力配置中评为 29

• 比任何版本号都更持久的成本警告——Anthropic 的 token 价格没有变动,但对 Intelligence Index 的独立分析发现,Sonnet 5 每项任务消耗的输出 token 比其前代多出约 30–40%,因为自适应思考默认开启。标价不等于账单。

最后这一点,值得带入任何关于 5.2 的讨论。如果 Sonnet 迎来一次更新,真正值得关注的数字不是每百万 token 的费率,而是每项任务消耗的 token 数,以及新的默认 effort 级别是否会悄悄把它再次推高。

Sonnet 5.2 必须改变什么才能变得重要

先撇开它是否存在不谈。更有用的问题是:什么才值得切换到它,因为这决定了该关注什么——而其中没有一条是"Sonnet 刷新版发布了"。

Comparison scoreboard for Claude Sonnet 5.2 and Claude Sonnet 5: the rumoured model's unconfirmed status, missing model ID, unknown price, absent benchmarks and single list entry against the live model's GA date of June 30, claude-sonnet-5 model ID, $2 / $10 per million tokens, and Artificial Analysis Intelligence Index of 32

一个有意义的 Sonnet 5.2 必须至少改变四件事中的一件。第一是每任务 token 数:一个保持 $2 / $10 费率、却能止住 30–40% 输出 token 膨胀的版本,会比一次上头条的降价更能削减实际账单。第二是与更高一档之间的智能体能力差距——Sonnet 5 被定位为在智能体工作上大约达到前代旗舰九成水平,而成本仅为其一小部分,正是这个比例让它成为默认选择。第三是修订后的分词器使其更难推断的长上下文行为。第四,也是最不可能被宣布的一点,是 5.2 究竟是否还会以 Sonnet 的身份出现——上一次社区自信地指认 Sonnet 继任者时,最终发布的模型是 Fable。

算不上新闻的:评测工具链里冒出一个检查点、某个框架仓库里出现一个代号,或者又一条汇总推文。这些都不会改变你能调用什么、成本多少,或者得分几何。

如何在不押注它的情况下进行布局

未经验证的层级刷新,其实际问题不在于你可能会错过它。而在于,为它做准备通常意味着你要做那些你讨厌做两遍的工作——第二份供应商合同、第二次 SDK 集成、第二套密钥、限制和账单。

这是值得现在处理、而不是拖到以后再去掉的部分。Claude Sonnet 5 自六月起就已上线 OrcaRouter,采用 Anthropic 自己的 $2 / $10按供应商标价原样透传、不加价,因此 Sonnet 产品线的供应商价格若有变动,会当天就在这里生效,而不必等到下一个计费周期。

OrcaRouter model page for anthropic/claude-sonnet-5, showing Claude Sonnet 5 listed at Anthropic's prices of $2.00 input and $10.00 output per million tokens with a 1M token context window, 128K maximum output, and an Artificial Analysis Intelligence Index of 32 at rank 8

同一把密钥已经可以访问当前 Claude 系列的其他模型,以及平台上的其他 200 多个模型,这意味着 5.2 发布时并不需要启动一个集成项目——它会直接出现在模型目录中,你只需把一部分流量路由到它上面,并设置回退到 Claude Sonnet 5,同时验证每任务 token 数的计算结果在你的工作负载中是否真的成立。自动故障转移正是让这一切变得安全的原因:即便面对一个还没有人独立基准测试过的模型,你也可以放心尝试。

对于那些技术栈已经基于claude-sonnet-5的人来说,“我该不该等 Claude Sonnet 5.2”这个问题的诚实答案是:不该——没有什么可等的,没有日期,也没有任何理由相信当前模型即将不再是合适的默认选择。该做的是让切换变得成本低廉,而不是提前切换。

什么能解决这个问题?

三件事,按它们能说明问题的程度从高到低排列。一个 API 标识符将是决定性的,因为一个正在被提供服务的模型必须在请求中有一个名字,而 Marshmallow 和 Melon 的故事正是因此变得可核查,Opus 5.2 的路由报告也正是因此变得可核查。供应商的确认——模型卡、文档页面、更新日志中的一行——将直接终结争论。一份针对特定层级的测试者报告,描述行为而非名称,会是三者中最弱的,但仍比今天存在的要多。

在其中任何一项出现之前,Claude Sonnet 5.2 都只是名单上的一个名字。把它当作一个提醒,去检查你的技术栈能否以低成本承受一次 Sonnet 刷新,而不是把它当作据此做规划的理由。