主视觉标题卡,标题为“Claude Voice:一个隐藏的 Preview 标签页”,副标题为“哪些已确认,哪些是报道,哪些仍属推测”,还有三张卡片,内容分别是“已发现:Claude 网页导航中有一个单独的 Voice 项,标注为 Preview,报道于 2026 年 10 月 4 日”、“未发布:没有语音模型、没有模型卡、没有 API 入口、没有价格”以及“可确定日期:消费者选择加入共享语音数据用于模型训练,报道于 2026 年 10 月 5 日”,页脚引用了关于该可见导航项的报道,以及查阅于 2026 年 10 月 11 日的 Anthropic 帮助文档,右下角还有 OrcaRouter 标志。
Guides & Insights

Claude 语音泄露:Claude 应用中隐藏的“预览”标签页,以及随之出现的语音数据选择加入项

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在2026年10月4日之前的某个时间点,一个本不该已经可见的导航项出现在了 Claude 网页界面中:一个独立的Voice标签页,带有内部的Preview标签。它没有任何公告,没有模型卡,没有定价条目,没有 API 入口,也没有日期。大约在同一时间窗口——据10月5日的报道——该厂商又悄悄添加了另一项它并未公开宣传的东西:一项面向消费者的选择加入,允许用户交出自己的语音录音和语音聊天数据,“用于改进我们的 AI 模型”,而这与它此前针对文本对话所征求的同意是分开的。目前在售的产品线仍然是四个文本输出模型——Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Haiku 5.5——而它从未推出过自己的语音模型。所以,这次泄露所引出的那个有用问题并不是“这家公司是否要推出语音模型”。问题更窄:这个标签页证明界面正在被搭建,而选择加入则是目前任何人所掌握的、表明该公司想要语音训练数据的第一个硬证据。这是两个不同的主张,而且只有第二个可以标定日期。

以下所有内容分为已确认的信息、有报道但未经证实的信息,以及推断。Anthropic 对这个标签页只字未提,这意味着核心事实的依据是一张截图,而不是一份新闻稿。

实际发现的是什么,以及它没有告诉我们什么

这一发现来自 X 上的 @testingcatalog,发布于 2026 年 10 月 4 日,并于 10 月 10 日在同一媒体上撰文说明。按该文章的说法,“一个单独的 Voice 条目已出现在 Claude 的网页导航中,并带有内部 Preview 标签”,且“其能力与公开可用性仍属未知”。这就是全部的直接证据。该报道明确将该标签描述为指向内部预览环境,而不是一次正式推出。

从这件工件可以得出三点,而它们中没有一个是规范:

• 范围——一个内部预览标签表明,Anthropic 内部某处存在一个构建。它并未说明该构建包含一个新模型。导航标签页属于 UI。

• 该提供商——报告指出,Anthropic“尚未确认其底层语音提供商”,尚未通过其 API 发布专门的文本转语音模型,也未推出原生的端到端实时音频模型。后两点是可以核实且属实的。Anthropic 的公开模型文档列出了四款当前模型,并以相同方式描述了这四款模型:文本和图像输入,文本输出。

• 时间安排——没有任何日期被报道或暗示。据该报道称,"关于公开发布的时间安排,尚无任何消息。"

有一个值得了解的先例,因为它有两面性。Anthropic 以前就曾在预览横幅下发布过东西——Mythos 系列在全面开放前就是作为预览版推出的——所以内部的 Preview 标签并不自动就是障眼法。但 Anthropic 也曾让语音模式的功能标志在生产代码中搁置数月未发布:2026 年 4 月一次 Claude Code 源码包泄露,曝光了一组未发布的功能标志,其中包括语音模式,以及桥接和后台智能体相关的工作。语音功能在 Anthropic 明显已推进了一年多,却始终没有语音模型出现。这个标签页与那段历史相符,并不构成新的进展。

选择加入是带着日期的信号

泄露的后半部分更可靠,因为它是一项隐私变更,而不是一张截图。据多家媒体于2026年10月5日报道,Anthropic 增加了一项可选设置,允许用户贡献语音录音和语音聊天数据以改进模型。据报道,提示文本是“允许我们使用你的语音数据来改进我们的 AI 模型”,并附有说明称,音频和语音聊天数据有助于改进模型处理语音的方式。报道的具体细节均来自同一批报道:

• 所在位置——在 Claude 的“设置”中,位于“隐私”项下,以一个显式的同意开关形式呈现。

• 其默认状态——关闭。用户会被询问,而不会被自动加入。

• 其范围——独立于现有的文本对话同意机制,而这一点才是最关键之处。

• 可逆性——根据相关报道,之后可以将其关闭,并可从设置中删除语音数据。

为什么单独征得同意很重要:如果整个语音管线都只是供应商集成,其中不涉及 Anthropic 模型,那么整合同意的自然位置本来就已经存在。单独划出一条语音数据通道,正是你打算用语音进行训练时才会做的事——无论是为了一个新模型,还是为了在现有模型内部加入专门的语音层。这是从激励出发的论证,而不是从证据出发的论证,也应当按这种方式来理解。诚实的反向解读是:一家大规模运营语音功能的公司,无论音频由谁提供,都需要自己的评估语料库和自己的失败分析;而一个被设计成日后可以关闭的选择加入机制,也是在你还需作决定时最廉价的合规方式。

还有一点背景信息,因为它会让这一变化显得比实际上更尖锐。Anthropic 自己面向商业产品的隐私文档在一篇日期为 2026 年 3 月 16 日的文章中直截了当地写道:“我们不会使用你的语音来训练我们的模型”,并且语音转写完成后,录音会被删除。那篇文章的适用范围是 Claude for Work、Anthropic API 以及类似的商业场景。新的选择加入(opt-in)则是消费者端的设置。这两种说法可以同时成立——而这恰恰是一家公司一边在业务的一侧搭建训练数据管道,一边在另一侧守住合同承诺的样子。

A single-column scoreboard titled 'Claude Voice - what is actually established' with six rows reading 'First-party speech model: none shipped', 'Underlying voice provider: not disclosed', 'Voice mode status: beta, all plans', 'Models in voice mode: same as text chat, Claude Fable excluded', 'Voice data for training: new consumer opt-in, off by default' and 'Speech-to-speech leaderboards: Anthropic absent', with a footer noting the provider is unconfirmed.

Anthropic 的语音产品已经推出一整年,但在这段时间里它始终没有语音模型。

这是泄密报道往往跳过的部分,而它正是你正确解读这个标签页所需的背景。

Claude 语音模式于 2025 年 5 月作为移动应用中的语音对话功能推出。从一开始,它就是一个封装层:推理由 Anthropic 的语言模型处理,而语音本身则来自别处。该技术栈从未被披露。当 TechCrunch 报道 2026 年 7 月 23 日的语音模式升级时,它既指出“Anthropic 并未在此次发布中对语音模型做出任何更改”,又指出该公司“尚未详细说明其使用何种语音技术栈”。自 2025 年以来的报道一直指向 ElevenLabs 是语音供应商,这主要是根据 Anthropic 的子处理者披露推断出来的,而非来自 Anthropic 确认的任何信息。应将该供应商视为未经证实。

2026年7月的这次升级很说明问题,因为它没有包含什么。它增加了模型选择——你可以在 Claude Opus、Claude Sonnet 和 Claude Haiku 之间选择,而不只是 Haiku——还增加了与 Gmail、Calendar、Slack、Canva 和 Notion 的连接器、更长的对话,以及以 beta 形式发布的多语言支持。所有这些变化都位于音频的上游。音频没有动。

在 Anthropic 自己的帮助文档上,如今的语音模式是什么样的:

• 模型方面——“语音模式可以调用你在文本聊天中使用的同款 Claude 模型”,并且“会以你上次在文本聊天中使用的模型作为起点”。文中说明了一项例外:Claude Fable 在语音模式下不可用。

• 可用性——所有套餐(从免费版到企业版)均可使用的测试版功能,支持 Claude 移动端、桌面端和网页版,但专为在手机上获得最佳体验而设计。

• 语音——"预设的、有限的选择",明确是为了防止语音克隆或身份冒充。

• 计费——语音对话计入你常规套餐的限额。没有单独的语音计量。

• 局限之处——Claude Cowork 和 Claude Code 提供听写功能,但没有语音模式。

• 语言 — 英语及其他语言,其中非英语语言仍标记为测试版。

那些说法中的每一条,描述的都是一个围绕他人语音包装出来的产品。它们没有一条描述的是语音模型。

语音标签页可能是什么:三种可能,而其中只有一种是模型

这个泄密之所以容易被过度解读,是因为三种可能的未来在导航栏里看起来一模一样。

• 界面变更——一个专属的语音界面、提示栏中的语音按钮、设置里的语音选择器。早在 2026 年 2 月,就有报道称 Anthropic 正在筹备类似的东西。如果仅此而已,那么这个标签页只是一次重新设计,底层的音频技术栈并未改动。

• 一次供应商替换——相同的级联架构,背后却是不同的语音供应商。从外部无法察觉。仅这一点本身就能解释为何要选择加入训练数据,因为若没有获准保留的音频,你就无法评估一次供应商替换。

• 一种原生语音到语音模型——Anthropic 训练自己的音频模型,并放弃级联方案。这是成本高昂的一种解读,也是任何基于 Claude 构建的人都会在意的那种解读,而且是唯一需要经同意的语音语料库的解读。它也是一种目前证据尚不支持的解读。

标签页无法区分二者。接下来两项可核查的事项将能区分:Anthropic 的模型列表中出现音频模型 ID,或其子处理者页面上出现新的语音条目。目前这两者都尚未发生。

Anthropic不在的地方

要最清楚地看出 Anthropic 距离掌控这一层还有多远,只需看它没有出现在哪里,再看它实际发布了什么。独立的语音到语音对比——Artificial Analysis 维护着一个覆盖约四十个模型的榜单,评估维度包括推理、对话动态和智能体表现——上榜的是来自 Gemini 3.8 Live、GPT-Realtime-2 和 GPT-Live-1、Qwen Audio 3.0 Realtime、Grok Voice Think Fast 2.0、StepAudio 3 Realtime、Nova 2.0 Sonic、NVIDIA、Kyutai 以及少数开源成果的原生音频模型。在那类榜单上,Anthropic 哪儿都找不到。另一组条目则涵盖级联式语音智能体流水线——把语音转文本模型、一个 LLM 和一个文本转语音模型串接在一起——而这恰恰是 Anthropic 自家语音模式最接近的架构。与之相对,Anthropic 自己的模型文档说得毫不含糊:四个当前模型,每一个的描述都如出一辙——文本和图像输入,文本输出,整页文档里找不到任何一个音频模型 ID。

Screenshot of the OrcaRouter model catalogue, showing the Models listing with 208 models across 16 providers on one API key, the Text / Image / Embeddings / Video / TTS modality filters, an OpenAI-compatible code sample for calling a model, and model cards including Anthropic Claude Sonnet 5.5.

这不是对产品的批评。它是在说明如今价值正在哪里被获取,也解释了为什么一个 Voice 标签页竟然会值得关注:语音是唯一一种其他所有前沿实验室都有第一方模型、而 Anthropic 没有的模态。

这个月该做什么,没什么不同

所有这些的实际含义是:对构建者而言,10 月 4 日没有任何变化。语音模式还是 7 月时的那个产品。没有新增或停用任何模型 ID。没有价格变动。如果你今天在 Claude 上交付语音,你交付的是一条级联链路:一个 Claude 模型负责思考,一个单独的模型负责说话,中间再加上胶水层。这次泄露并没有改变这一点,而围绕一个写着 Preview 的标签页来做构建,正是团队最终让路线图依赖上某个人内部分支的方式。

它真正主张的是让技术栈中的语音那一半保持可替换,因为真正的锁定其实发生在级联环节——不在 Claude 模型里(你从任何地方都能调用它),而在你为语音供应商写的那层胶水代码里。具体来说,Claude 这一侧已经可路由:Claude Opus 5.5、Claude Sonnet 5.5、Claude Fable 5.1 和 Claude Haiku 4.5 都列在 OrcaRouter 目录中,按 Anthropic 的标价、0% 加价——供应商标价直接透传,因此 Anthropic 一旦降价,我们这边当天就会生效——而你会与它们搭配使用的文本转语音模型(Gemini 的 TTS 预览版、tts-1-hd 等)都位于同一个密钥之后。语音管线的两半共用一个端点,意味着更换供应商只是改一个模型字符串,而不是再签一份合同,而自动故障转移意味着你管线中尚未验证的那一半会降级到一个可用的后备方案,而不是让通话失败。

什么才能真正证实它?

别再猜测了,盯住四个具体、可核实的地方。每一个都是可确定日期的事件,其中任何一个都能让这件事从泄密变成新闻:

• Anthropic 的模型文档或 Models API 列表中新增一条带音频输入或音频输出的条目。这是唯一能证明第一方语音模型确实存在的凭证。

• Anthropic 子处理者页面上新增的一项与语音相关的条目。这恰恰证明了相反的情况——是一个新的外部供应商,而非内部模型。

• Voice 标签页在面向消费者的应用中不再带有 Preview 标签。那便是正式推送,也正是该功能从可观察转变为可评审的时刻。

• 一场关于定价的争吵。Anthropic 给自己卖的东西定价;而一个按分钟计的语音价格,会比任何基准测试都更快地敲定架构问题。

在那些事情中的任何一件落地之前,对2026年10月的准确总结是这样的:Anthropic正在构建语音界面,正在首次收集经同意的语音数据,而且至今仍未发布过任何语音模型。在这三件事中,那个标签页是信息量最少的,却是传播得最远的。

Screenshot of Anthropic's Claude Platform models overview page listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with their model IDs and pricing, alongside the line 'All current models support text and image input, text output, multilingual capabilities, vision, and tool use.'

悬而未决的问题不是 Anthropic 是否想要更好的语音体验——选择加入这一点已经回答了。问题在于,在 Anthropic,“更好的语音”意味着一个它自有的模型,还是一个它更谨慎管理的供应商。这两条路径从外部看会在一段时间内显得一模一样,然后就会变得截然不同。