
Claude Next 泄露:据报道,Anthropic 尚未发布的模型正在 Claude Code 中运行
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 71 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
2026 年 10 月 11 日,一个在 X 上以 @chetaslua 为名发帖的账号声称,一个名为Claude Next的模型正在 Claude Code 内部接受测试,而且它让Claude Opus 5.5“显得很原始”。同一篇帖子还称,它将“用一个月时间让图像和视频生成模型变得过时”,声称该模型是“SOTA”,并承诺之后会做更多测试。截至本文撰写时,这就是全部的公开记录。没有模型 ID,没有费率卡,没有文档条目,没有模型卡,没有竞技场列表,也没有 Anthropic 的任何声明。在这篇帖子发布当天,Anthropic 已发布的阵容仍然恰好是四个模型——Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5和Claude Haiku 5.5——而Claude Next并不在其中。
所以这不是一篇发布报道。它是一篇关于某个说法的“目前我们所知”的文章,而这个说法异常容易拆分成几个部分,因为其中一部分是 Anthropic 确实会做的事情,另一部分则与 Anthropic 自己的文档所声称其模型能做的事情相冲突,而且这个名称本身也不符合该厂商的命名规则。这三项观察今天就能在你自己的机器上核实,无需等待发布。
这篇文章实际主张了什么——以及它没有主张什么
抛开热情不谈,这篇帖子断言了四件截然不同的事情,而它们具有非常不同的证据分量:
• 存在一个名为 Claude Next 的模型。未经证实。Anthropic 的公开信息中没有任何地方出现过该字符串。
• 它正在 Claude Code 内部进行测试。尚未验证,但在结构上说得通——见下一节。
• 它把 Claude Opus 5.5 碾压得如此彻底,令其显得原始简陋。 未经证实,且目前无法证伪,因为未附上任何数字、任务、测试框架或输出。
• 它威胁着图像与视频生成模型。未经证实,且与Anthropic迄今为止发布的每一款Claude模型都存在矛盾。
注意哪些内容没有被声称。帖子没有说该模型已发布,没有给出日期,没有指定版本号,也没有提供模型标识符。作者明确表示还会有更多测试。按字面理解,这是一份关于早期访问的报告,而不是关于发布的报告——而这正是泄密文章应当处理、发布文章不应处理的声明形态。
消息源只是一个 X 账号:既没有第二位测试者的佐证帖,也没有模型选择器的截图,更没有任何可供查证的实物。Anthropic 尚未置评。上文每一处关于性能的表述,都只能视为传闻,而非实测结果。

其中不荒谬的那部分
Anthropic确实会与特定用户一起运行未发布的前沿模型。这是有据可查的,而非传闻,这使得“某个地方正在测试一个新模型”这种说法比听起来要弱得多。
最清晰的先例是 Claude Mythos Preview,在 Anthropic 自家的 Project Glasswing 页面上被描述为"一个通用型、尚未发布的前沿模型",仅与有限的一组合作伙伴进行了测试。同一页面直言不讳地写道:"我们不打算让 Claude Mythos Preview 面向公众开放。"一个模型可以同时是真实存在的、能力出众的、被少数人积极使用的,却永远不会以那个名称正式发布。
还有一个更晚近的先例。Anthropic 于 2026 年 10 月 6 日宣布扩大其 Cyber Verification Program,其中描述的访问层级涵盖“Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1,以及今后推出的新模型”。最后这一从句是一项供应商承诺:未来的模型——包括尚未公开存在的模型——将被纳入一个受限访问计划,而不是一次性向所有人发布。
而这一说法中的具体场合——Claude Code——恰恰是最可能泄露内部别名的地方。Claude Code 的模型选择并不是固化在二进制文件里的固定列表。它会读取别名、环境变量以及网关自身的模型列表——在任何正式公布之前,一个名称可能出现的暴露面实在太多了。
为什么名称本身是最薄弱的部分
Anthropic 的模型名称来自一个规模很小且封闭、由引人联想的词组成的词汇表:Mythos、Fable、Opus、Sonnet、Haiku。版本号遵循一套有文档记载的方案:claude-{name}-{major}[-{minor}]——claude-opus-5-5、claude-sonnet-5-5、claude-fable-5-1。“Next”与该模式的两半都不相符。它既不是命名词集中的词,也不带版本段,因此没有可供它递增的基础。
在任何人兴奋起来之前,还有一个平淡无奇的解释值得记住。Claude Code 以两个 dist-tag 发布在 npm 上,stable和next;next是预发布渠道。任何查看 Claude Code 自身工具元数据的人都会遇到“next”这个词,它附在 Anthropic 正在测试、尚未提升为stable的东西上——而被测试的对象是客户端,而不是模型。这并不能说明该说法是假的。但它确实意味着,“next”是一个已经存在于这个生态系统中的词,而这正是那种会被当作产品名称拾取并反复传播的词。
内部开发代号则是另一回事——Claude Marshmallow和Claude Melon于 2026 年 8 月作为 EAP 标识符浮出水面,显然都是内部名称,而非正式发布名称。如果说“Claude Next”算得上什么,它更可能是那类占位符,而不是一款产品。但老实说,目前 Anthropic 之外的任何人都无法分辨它究竟是占位符、误读还是凭空捏造,因为唯一的证据只有那一句热情洋溢的话。
“让图像和视频生成过时”碰壁之处
这是文章中最有可能误导读者的部分,它理应得到一个直接的回答。
Anthropic 目前推出的每一款 Claude 模型——Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5、Claude Haiku 5.5——都以文本和图像作为输入,并以文本作为输出。该产品线中没有任何图像生成能力,也没有任何视频生成能力。Claude Opus 5.5 支持视觉、工具调用、JSON 输出、推理,以及 100 万 token 的上下文窗口,输出最多可达 128K token;它所谓“以像素形式渲染”图表,仅仅体现在它能编写绘制图表的代码这一点上。
这让该主张在某种值得点明的意义上变得含糊:
• 如果这条帖子指的是 Claude 模型现在生成图像和视频已是原生能力,那对 Anthropic 来说将是一个全新的能力类别,也是一个远比“更好的编程模型”大得多的说法;而且它几乎肯定会作为一项独立公告发布、配有独立的定价,而不是在 Claude Code 的讨论帖里被悄悄提起。
• 如果这意味着该模型编写的代码能生成足够好的图像和视频,从而减少对专用生成器的需求,那么这是一个关于编排质量的论断——这是真实且可衡量的,而且已有多款已发布的模型在这一方面展开竞争。这并不是同一个论断,也不是“过时”一词所暗示的意思。
这篇帖子没有区分这两者。在它做出区分之前,诚实的解读是:一个无人对其进行过基准测试的模型,其被报道的定性印象正被用来做出类别层面的预测。
今天下午如何自己检查
这里是有用的部分。该主张所依赖的一切都可以在你自己的机器上测试,而且其中没有任何一项需要你相信任何人。
1. 查看模型选择器。在 Claude Code 中,运行 /model,不带任何参数。这会打开选择器,而它反映的是你的账户实际能访问到的内容。如果某个模型确实正在你拥有访问权限的渠道上向测试者提供,它就会出现在这里。在不同日期运行两次——选择器会不定时更新。
2. 试着用它来解决。Claude Code 会从四个地方接受模型字符串,优先级顺序如下:会话中的 /model、启动时的 --model 标志、ANTHROPIC_MODEL 环境变量,以及设置文件中的 model 字段。把 ANTHROPIC_MODEL 设置为你的提供商不提供的字符串,会在第一次请求时产生错误——而重要的细节在于,当该字符串来自标志、环境变量或设置时,Claude Code 并不会事先验证它。它会直接发送,让请求自行失败。这恰恰是一个泄露的名称在名称真实但访问权不属于你时的表现:它看起来会像是拼写错误,而不是权限被拒。
3. 向选择器添加自定义条目。 ANTHROPIC_CUSTOM_MODEL_OPTION会向选择器中插入一个额外的模型,而不会干扰内置别名,并可选用 ANTHROPIC_CUSTOM_MODEL_OPTION_NAME 和 ANTHROPIC_CUSTOM_MODEL_OPTION_DESCRIPTION作为标签。Anthropic 的文档明确指出,Claude Code 会跳过对该 ID 的验证。如果你的账户被授予了一个名称,但你并未获得相应的列表,这就是让客户端指向它的方法。
4. 询问一个端点,看看存在哪些内容。这是决定性的检查,因为模型列表是服务器端的事实。Anthropic 的 Models API 会返回你的密钥可用的每个模型,并附带 max_input_tokens、max_tokens、一个 capabilities 对象,以及一个 line 字段——该字段指明模型所属的系列。如果某个模型可由你调用,它就会出现在该响应中。如果它不在该响应中,也不在文档的对比表里,那么任何应用代码都无法访问它——无论某篇文章如何评价它的质量。
5. 留意真正 Anthropic 模型发布时总会出现的两处痕迹。每一款已发布的 Claude 模型都在模型概览表中占有一行,并在添加它的那次发布的 Claude Code 变更日志中占有一条记录——Claude Opus 5.5 是在 2.1.280 版本中加入的,Claude Haiku 5.5 则是在 2.1.293 版本中,两者的模型 ID 和价格都直接写在变更日志的那一行里。这两处就是需要盯住的地方。目前两者都不包含任何名为“Claude Next”的内容。
什么能让这件事从传闻变成事实?

五件神器就能解决此事,而且它们会以相当可预测的顺序到来:
• 一个模型 ID。某种形如 claude-{name}-{major} 形式的 ID,或一种能在 Anthropic API 上解析的变体。没有它,就没有任何可调用的东西。
• 模型概览表中的一行。Anthropic 自家的对比表目前有四个列。第五列则由厂商确认其存在。
• 一份价目表。每百万 token 的价格、缓存读取费率,以及任何长上下文分级。Anthropic 的定价与模型一同发布,而不是在其之后。
• 模型卡或系统卡。这里划定了能力声明的边界——包括是否提供图像或视频输出。
• Claude Code 中的一条更新日志记录。客户端会在添加模型的条目中同时标明 ID 和价格,这使其成为编码会话所能触及的任何内容最可靠的早期确认界面。
在这些信号之上,LMArena 或 Artificial Analysis 的收录会是一个有用的独立信号——而且更重要的是,它提供的是与固定评测框架的对比,而非测试者的主观印象。请注意,在撰写本文时,这两个竞技场都没有以该名称收录 Anthropic 的条目——文本排行榜上的 23 个 Anthropic 条目最高的是claude-opus-5.5-high,位列第 2 名,且其中没有任何一个被标记为初步结果。
在此期间该怎么办
什么都不做,如果目标是本周就交付点什么的话。对待一个未经基准测试的模型的正确态度,就是你对待任何其他未经证实的依赖项时会采取的态度:不要把它放进关键路径,也不要基于一句话来制定路线图。
如果这样一个模型真的出现,实际问题会迅速改变形态,而它们正是每一次新的 Claude 版本发布都会引发的同样三个问题:每百万 token 的价格是多少,它在哪些方面更差比它所取代的模型,以及当提供商出问题时你的请求会怎样。Claude Opus 5 是当前的基准,每百万输入 token 4 美元、每百万输出 token 20 美元,缓存读取为每百万 0.20 美元;Claude Fable 5.1 位居其之上,面向高要求与长周期智能体工作为 10/50 美元,缓存读取为输入价格的 2.5%。这两者中任何一个的后续版本都将对照这些数字来评估,而不是对照某种感觉。
另一件很早就重要的事,在还没有任何基准测试之前,就是不要把生产路径押在一个没人测过的模型上。把新模型放在路由器后面运行,可以让你把一部分真实流量分给它,并让自动故障转移在它报错、卡住或被限流时回落到 Claude Opus 5.5 或 Claude Fable 5.1——这样这次实验只消耗你一小部分请求,而不是全部。在 OrcaRouter 上,这就是一个兼容 OpenAI 的端点,位于 200+ 个模型之前,故障转移路径上无需第二份合同,也无需改代码,而且提供商标价原样透传,因此供应商降价一旦落地,当天就会在我们这边生效。我们不提供 Claude Next——没人提供,因为就任何公开渠道所显示的情况来看,它都不是一个已发布的模型。Claude Opus 5.5 以及当前 Claude 系列的其他模型今天即可调用,并按标价计费。
img src="4.png" alt="OrcaRouter 上 anthropic/claude-opus-5.5 模型页面的截图,标题为“Claude Opus 5.5”,位于“首页 > 模型 > Anthropic”面包屑导航下方,标识符为 anthropic/claude-opus-5.5,“由 Anthropic 提供 — 2026-09-22”,支持文本、图像和文件输入,具备视觉、工具、JSON 和推理能力,最大输出 128K,上下文窗口 100 万 token,每百万 token 输入 $4.00、输出 $20.00,首 token p50 时间为 3.88 秒,流量 126.3M token,并排展示两个 SDK 针对同一 base URL 的代码示例。" />

悬而未决的问题
最有可能的结果,按可能性从高到低排列:这篇帖子描述的是一个内部或仅限 EAP 的构建版本,它永远不会以那个名字发布,在这种情况下,任何读者都永远无法验证它,整件事也就烟消云散了;或者,某个 Anthropic 模型带着正式名称和 ID 出现,并附上通常的那些产物,到那时,这一说法就会变成一则关于泄密的脚注:方向说对了,名字说错了。
无论如何,测试都一样,而且用你自己的密钥大约十分钟就能完成:打开选择器,查询 Models API,再看看厂商自家的表格里是否出现了第五列。在这三者之一发生变化之前,“Claude Next”只是帖子里的一个名字——而 Anthropic 实际发布的四个模型,才值得你投入工程时间。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
