
Claude Sonnet 5.5:由四个已然存在的数字拼凑而成的隐秘测试泄露
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
9月24日,X 上贴出了四个数字,作为 Claude Sonnet 5.5“已经开始秘密测试”的证据:100万 token 的上下文窗口、12.8万 token 的最大输出、每百万输入 token 2 美元、每百万输出 token 10 美元。这四个数字目前都挂在 Anthropic 自己的价目表上,对应的是 Claude Sonnet 5——也就是 5.5 将会取代的那款模型,该模型自 2026 年 6 月 30 日起全面可用。同样的 2 美元 / 10 美元标价也属于 GPT-6 Sol,OpenAI 于 9 月 22 日发布了它,而正是这种重合,让这条帖子读起来像是在回应 OpenAI,而非一次常规的档位更新:“在我看来,这是对 GPT-6-Sol 的直接回应。定价相同,性能想必也相似。”
这一切都不能说明该说法是错的。它只是让该说法变得不可证伪,而这是一个不同且更值得记录下来的问题。一次隐蔽测试的目击,其价值只取决于它背后的实物证据,而这一次背后的实物证据,是一份与 Anthropic 已连续十二周对外提供的模型无法区分的规格表。
实际发布的是什么
来源是账号 @kimmonismus 于 2026 年 9 月 24 日发布的一条 X 帖子。它写明了上下文窗口、输出上限和两个价格,将定价与 GPT-6 Sol 进行对比,并得出结论:Sonnet 5.5 正在测试中。其中没有截图,没有模型字符串,没有 API 响应,没有控制台列表,没有测试人员对行为的描述,也没有任何第二观察者与其中任何内容相关联。这条帖子是一则包含数字的说法,而这些数字是该层级的公开上限。
这值得与 Anthropic 另一类发布前消息区分开来,因为 2026 年两者都出现了,而且它们看起来毫不相像。8 月的早期访问标识符 claude-marshmallow-eap 和 claude-melon-eap 是请求中存在的字符串——丑陋、不起眼,而且可核查。贯穿 9 月的 Opus 5.2 消息则是一份路由报告:开发者注意到“Opus 5”标签背后的后端给出了不同的应答,并描述了其行为。两者都是实物证据。“已经在被秘密测试”却没有附上任何实物证据,这不过是对 Sonnet 层级已经在售内容的概括。
来源本身还有一个值得注意的模式。同一账号在9月20日发布了一篇汇总,开头提到了四款据称“已经开始接受测试”的模型——Claude Sonnet 5.2、Claude Opus 5.2、Claude Fable 5.2 和 Gemini 4 Pro。在这四个名字中,Opus 和 Fable 这两个条目背后有独立且可相互印证的报道,而 Gemini 这个条目也有自己的踪迹。Sonnet 这个条目原本只是列表中的一个位置。四天后,关于 Sonnet 的说法已经长出了一份规格表,而这份规格表所描述的,正是那个已经存在的模型。
这四个数字是 Claude Sonnet 5 的数值。
这部分检查起来只需三十秒,却几乎没有人做过。今天查看 Anthropic 的模型概览页面,上面列出 Claude Sonnet 5:1M token 上下文窗口、128K 最大输出,以及每百万 token 2 美元 / 10 美元。把泄露的信息与它对照一下:
• 上下文窗口 — Claude Sonnet 5.5 声称支持 100 万 tokens;Claude Sonnet 5 公布支持 100 万 tokens
• 最大输出——声称 128K tokens;已发布 128K tokens
• 输入价格 — 每百万次调用 2 美元(已领取);每百万次调用 2 美元(已发布)
输出价格——每百万条认领 $10;每百万条发布 $10
• 模型 ID — Claude Sonnet 5.5 尚未发布任何内容;Claude Sonnet 5 对应 claude-sonnet-5
• 独立评分——所声称的模型没有任何评分;Artificial Analysis 在自适应推理、最大努力配置下,将 Claude Sonnet 5 的 Intelligence Index 定为 38,在其测量的 210 个模型中排名第 54。

这个定价点还有第二层,而爆料把它弄反了。Claude Sonnet 5 发布时,$2 / $10 被宣布为导入期定价,持续到 2026 年 8 月 31 日,并计划于 9 月 1 日上调至 $3 / $15。那次上调并未发生。Anthropic 的定价页面如今带有一条脚注,称 $2 / $10“现在已是标准价格”,并且“原定于 2026 年 9 月 1 日将每百万输入/输出 token 上调至 $3 / $15 的涨价将不会发生”。因此,爆料所呈现为新模型竞争武器的那个价格,其实是现有模型的永久费率——这意味着,以 $2 / $10 推出的 Sonnet 5.5 根本没有任何折扣,而是要进入一个已经对标 GPT-6 Sol 定价的档位。
唯一一件 Anthropic 真正说过的事
剥离掉所有来自匿名泄密者的内容后,只剩下一句第一方的话。当 Anthropic 于 2026 年 9 月 22 日发布 Claude Opus 5.5 时,它表示 Claude Sonnet 5.5 和 Claude Haiku 5.5 将"在未来几周内"跟进,带来在性能、效率与安全性方面相当的增长。这句话就是全部已获确认的记录。它没有型号 ID、没有上下文窗口、没有价格、没有基准测试、也没有日期——尤其是,它完全没有提到任何暗中测试、灰色渠道,或任何形式的测试。
Anthropic 其余公开信息也与这一解读相符。模型总览页仍然只列出四款模型——Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5 和 Claude Haiku 4.5——没有第五行,没有对应的定价条目,也没有为 Sonnet 的后继型号标注"即将推出"。如果某个 Sonnet 级别的检查点正在开发者能够访问的某处提供服务,那么这个标识符一定会最先浮现出来,因为一个正在对外提供服务的模型必须在请求中拥有一个名称。但什么都没有出现。
九月的公告确实澄清了一件事:它推翻了早先的爆料,该爆料称 Haiku 产品线将被淘汰,并且 5.5 代将重组产品阵容。据 Anthropic 称,Haiku 5.5 即将推出,这意味着重组传闻错在了爆料者很少会出错的方向上——低价档将继续保留。
八月的泄露消息说是200万个token。这次说的是100万个。
在9月24日那篇帖子发布六周前,也就是8月9日,另一个 X 账号发布了一份“SONNET 5.5 LEAK”规格表,其中提出了一个大胆得多的说法:200 万 token 的上下文窗口,是 Sonnet 5 的两倍;推理速度更快;浏览器和终端工具使用能力更强;性能接近 Claude Fable 5;并且将在“下个月”发布。那份泄露信息还附带了一张仿照 Anthropic 预览卡样式制作的图片。它还带有一个致命细节,批评者立刻抓住了这一点:它给出的代号“Fennec”,正是 6 月 30 日随 Claude Sonnet 5 一同发布的代号。一个代号不可能成为使用过它的模型后继者的新证据。
所以,两波爆料在唯一被引用最多的那个数字上相互矛盾。八月说的是 2M 上下文。九月说的是 1M。两者不可能是在描述同一个构建版本。最可能的解读正是那个最无趣的:九月那篇帖子描述的是 Sonnet 档位已公布的限制,因为从外部看,Sonnet 档位的模型就是这样;而八月那篇帖子则是在猜测一次刷新可能会合理地翻倍到什么程度。注意这个数字移动的方向——向下,朝着已经存在的东西。
那么 GPT-6 Sol 的对比是正确的吗?
大体如此——而它出问题的地方才是有意思的部分。GPT-6 Sol 于 2026 年 9 月 22 日发布,与 Claude Opus 5.5 在同一天,其标价起价为每百万输入 2 美元、每百万输出 10 美元——恰好是 Sonnet 5 的价格,也恰好与泄露信息中对 Sonnet 5.5 的说法一致。它提供 1,050,000 token 的上下文窗口,输出上限为 128K,两者都与 Claude Sonnet 5 的数字仅有些微差别。更便宜的兄弟型号 GPT-6 Luna 的定价为 0.10 美元 / 0.50 美元。
长上下文的计费存在断层。GPT-6 Sol 采用两档定价:在 272,000 个输入 token 以内为 $2 / $10,超出后为 $4 / $15。Anthropic 在 Sonnet 系列上并不这么做——Claude Sonnet 5 对完整的 1M 上下文窗口一律按标准费率计费,因此一个 900K token 的请求与一个 9K token 的请求单位 token 成本相同。所以,真正的 Sonnet 5.5 与真正的 GPT-6 Sol 对比:对于普通提示词,两者价格持平;而对于这两款模型都在主推的长文档和大代码库工作负载,则存在两倍的差距。“定价相同”这句话在标题层面成立,但在决定选用哪一档的工作负载上并不成立。
第二个需要提醒的地方,潜藏在整场对比之下。Claude Sonnet 5 使用的是 Anthropic 更新的分词器,同样的文本会因此比上一代多产生约 30% 的 token。标价不等于账单;账单是每项任务消耗的 token,而那个数字从未出现在任何一份泄露信息里。
什么会让 Sonnet 5.5 变得重要
先放下它是否存在这个问题,问问对于付费购买token的人来说会有什么改变。四点,而且没有一个是参数表。
第一条是低于 $2 / $10 的价格。随着 9 月 1 日的涨价被取消,现有厂商的费率如今已是永久性的——因此,继任者若维持相同费率,只是横向平移,而在 Sonnet 档,唯一能撬动资金的消息就是降价。
第二个是超过 100 万的上下文。那正是八月那次泄露的实际主张,也是那次泄露所能点名的唯一一个在位者尚未覆盖的能力缺口。
第三点是每任务 token 数。Claude Sonnet 5 的自适应思考默认开启,独立分析已测得它每任务生成的输出 token 数量显著多于前代。如果有一个版本能保持 $2 / $10 的费率并阻止这种膨胀,那么它削减实际账单的幅度将超过名义上的降价。
第四项是一个标识符。一个 API 模型字符串、一行文档记录、一条定价条目、一张模型卡——其中任何一样都能终结这场争论;而在一场如此直白的泄露之后,这四样东西竟全部缺席,这本身就是这个故事里最能说明问题的事实。
你今天可以呼叫的对象
Claude Sonnet 5 并非等待档位理清之前的临时占位。它已经是大多数 Claude API 流量实际运行的模型,具备 100 万 token 上下文窗口、128K 输出,以及 $2 / $10 的费率——如今这已是标准定价,而非促销价。

它自六月起就已上线 OrcaRouter,采用 Anthropic 自家的 $2 / $10,按供应商列表价原样传递,不加价,因此 Sonnet 产品线若发生厂商调价,这里当天就会生效,而不会等到下一个计费周期。同一个密钥已经可以按 $2 / $10 访问 GPT-6 Sol,这在像本文这样的内容里比平常更重要:泄漏所依赖的比较,是你用一份凭证而不是两份合同就能自行进行的比较。

这也是回答此次泄露所引发的问题的最廉价方式。如果 Sonnet 5.5 真的出现,它会像其他任何东西一样出现在目录中,你只需将一部分流量导向它,置于向 Claude Sonnet 5 自动故障转移的兜底之下——无需第二次集成,无需重新协商,也不会有任何生产路径依赖于一个无人独立做过基准测试的模型。试用一个未经证实的层级是一个路由决策,而不是一个迁移项目。
与其关注下一个泄密帖,不如关注什么
三种信号,按它们能告诉你的信息量从高到低排列。一个标识符是决定性的,因为一个已提供服务的模型必须在请求中有名字,而 2026 年每一个可核查的 Anthropic 发布前消息正是借此变得可核查。厂商确认——模型卡、文档中的一行、定价条目,或者该模型直接出现在 Anthropic 自己的列表中——会彻底终结此事;“未来几周”这句话意味着其中确实有一项是欠着的。测试者报告描述的是行为而非规格,是三者中最弱的,但仍比今天已有的要多。
在其中任何一个落地之前,诚实的总结是:Anthropic 已承诺在未来几周内推出 Sonnet 更新,而一位观察者用它将取代的模型的数字来描述它。如果你的技术栈已经在运行 claude-sonnet-5,那就没有什么可等待的,也没有什么可围绕它规划的。如果你正在将 Claude Sonnet 5 与 GPT-6 Sol 进行权衡,那么你能据以行动的数字是已经公布的那些——而这些数字,正是这则泄露消息试图当作新闻卖给你的同一批数字。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
