主視覺標題卡,標題為「Claude Voice:隱藏的 Preview 分頁」,副標題為「哪些已確認、哪些有報導、哪些仍屬推論」,以及三張卡片寫著「已發現:Claude 網頁導覽中有一個獨立的 Voice 項目,標示為 Preview,報導於 2026 年 10 月 4 日」、「尚未推出:沒有語音模型、沒有模型卡、沒有 API 條目、沒有價格」以及「可標定日期:消費者選擇加入分享語音資料以進行模型訓練,報導於 2026 年 10 月 5 日」,頁腳引用關於可見導覽項目的報導以及 Anthropic 的說明文件,查閱日期為 2026 年 10 月 11 日,右下角有 OrcaRouter 標誌。
Guides & Insights

Claude 語音外洩:Claude 應用程式中的一個隱藏「預覽」分頁,以及隨之而來的語音資料選擇加入機制

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 2026 年 10 月 4 日之前的某個時間點,Claude 網頁介面出現了一個本不該已經可見的導覽項目:一個獨立的 語音 分頁,帶有內部的 預覽 標籤。它沒有公告、沒有模型卡、沒有定價列、沒有 API 項目,也沒有日期。大約在同一段時間——據 10 月 5 日報導——該供應商悄悄新增了另一項尚未公開的東西:一項消費者選擇加入機制,讓使用者交出語音錄音與語音聊天資料「以改善我們的 AI 模型」,這與它針對文字對話既有的同意要求是分開的。目前出貨陣容仍是四款文字輸出模型——Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5與Claude Haiku 5.5——而且它從未推出過自家的語音模型。所以這起外洩事件所帶出的有用問題,並不是「該公司是否要推出語音模型」。問題更狹窄:這個分頁證明某個介面正在建置中,而這個選擇加入機制是外界所掌握的第一個確鑿證據,顯示該公司想要語音訓練資料。這是兩項不同的主張,而只有第二項有日期可考。

以下所有內容都分類為已確認、已報導但未經證實,以及推論。Anthropic 對這個分頁完全隻字未提,這表示核心事實的消息來源是一張截圖,而不是新聞稿。

實際上被發現的是什麼,以及它沒有告訴我們什麼

這項發現來自 X 上的 @testingcatalog,於 2026 年 10 月 4 日發布,並於 10 月 10 日在同一媒體上撰文報導。用該報導的話來說,「Claude 的網頁導覽中出現了一個獨立的 Voice 項目,帶有內部的 Preview 標籤」,而且「其功能與公開可用性仍不明」。這就是直接證據的全部。該報導明確將這個標籤描述為指向內部預覽環境,而非正式推出。

從這件產出物可以推出三件事,而它們全都不是規格:

• 範圍——一個內部預覽標籤顯示 Anthropic 內部某處存在某個組建。這並不表示該組建包含新模型。導覽分頁屬於使用者介面。

• 供應商——報告指出,Anthropic「尚未確認其底層語音供應商」,尚未透過其 API 推出專用的文字轉語音模型,也尚未推出原生端到端即時音訊模型。後兩項可查證且屬實。Anthropic 的公開模型文件列出四個現行模型,並以相同方式描述全部四個:文字與圖像輸入、文字輸出。

• 時程方面——尚未有任何日期被報導或暗示。根據該篇報導,「公開發布的時間點沒有任何消息」。

有一個值得了解的先例,因為它是一把雙面刃。Anthropic 過去確實曾在預覽標籤下推出東西——Mythos 系列就是先在正式開放前以預覽形式推出——所以內部的 Preview 標籤並不自動就是誤導線索。但 Anthropic 也曾讓語音模式旗標在正式環境程式碼中閒置數月而未發布:2026 年 4 月 Claude Code 原始碼套件外洩,揭露了一組未發布的功能旗標,其中包括語音模式,以及橋接與背景代理相關工作。Anthropic 的語音開發明顯已進行超過一年,卻始終未見語音模型問世。這個分頁與那段歷史相符,並未使情況有所進展。

選擇加入是帶有日期的訊號

這次外洩的後半部分更為可靠,因為它是一項隱私權變更,而不是螢幕截圖。根據多家媒體於 2026 年 10 月 5 日報導,Anthropic 新增了一項可選設定,讓使用者能提供語音錄音與語音聊天資料,以供改善模型。報導中的提示文字為「允許我們使用您的語音資料來改善我們的 AI 模型」,並附有說明文字,表示音訊與語音聊天資料有助於改善模型處理語音的方式。所報導的具體細節,全都出自同一組相關報導:

• 所在位置 — 位於 Claude 的「設定」中,在「隱私」底下,以明確的同意切換開關呈現。

• 其預設狀態——關閉。使用者會被詢問;他們不會被自動加入。

• 其範圍——與現有的文字對話同意機制分開,這是最重要的細節。

• 可逆性 — 之後可以關閉,並可依報導所述從設定中刪除語音資料。

為什麼單獨同意很重要:如果整條語音管線只是供應商整合、完全不涉及 Anthropic 模型,那麼集中處理同意的自然位置早就已經存在。特別切分出獨立的語音資料通道,是你打算用語音進行訓練時才會做的事——無論是為了新模型,還是為了既有模型內部的專門語音層。這是從誘因出發的論點,而非從證據出發;也應該這樣解讀。誠實的反面解讀是:一家大規模運行語音功能的公司,無論音訊由誰提供,都需要自己的評估語料庫與自己的失敗分析;而一個設計成日後可以關閉的選擇加入機制,也是在你們還在決定的同時,最便宜的合規方式。

再多提供一個背景脈絡,因為這會讓這項變革看起來比實際上更劇烈。Anthropic 自家針對商用產品所發布的隱私文件,在一篇日期為 2026 年 3 月 16 日的文章中直截了當地指出:「我們不會使用你的語音來訓練我們的模型」,並表示語音轉錄完成後,錄音檔就會被刪除。那篇文章的適用範圍是 Claude for Work、Anthropic API 及類似的商用介面。新的選擇加入(opt-in)則是消費端設定。這兩項陳述可以同時為真——而這正是某家公司一方面在業務的一端建立訓練資料管道,另一方面卻在另一端維持合約承諾的樣貌。

A single-column scoreboard titled 'Claude Voice - what is actually established' with six rows reading 'First-party speech model: none shipped', 'Underlying voice provider: not disclosed', 'Voice mode status: beta, all plans', 'Models in voice mode: same as text chat, Claude Fable excluded', 'Voice data for training: new consumer opt-in, off by default' and 'Speech-to-speech leaderboards: Anthropic absent', with a footer noting the provider is unconfirmed.

Anthropic 的語音產品問世已滿一年,但這一年來完全沒有語音模型。

這是洩密報導往往略過的部分,而這正是你正確解讀那個分頁所需的脈絡。

Claude 語音模式於 2025 年 5 月推出,是行動應用程式中的口語對話功能。從一開始,它就是一個外殼:Anthropic 的語言模型負責推理,而語音本身則來自其他地方。其技術堆疊從未公開。當 TechCrunch 報導 2026 年 7 月 23 日的語音模式升級時,指出兩件事:一是「Anthropic 並未在這次發布中對語音模型做任何變更」,二是該公司「尚未詳細說明其使用何種語音堆疊」。自 2025 年以來的報導指向 ElevenLabs 是語音供應商,這主要是從 Anthropic 的子處理者揭露資訊推斷而來,而非出自 Anthropic 證實的任何說法。請將該供應商視為未經證實。

2026 年 7 月的升級之所以發人深省,在於它未納入的內容。它新增了模型選擇——你可以從 Claude Opus、Claude Sonnet 和 Claude Haiku 中挑選,而不只是 Haiku——以及 Gmail、Calendar、Slack、Canva 和 Notion 的連接器、更長的對話,還有以 Beta 版形式推出的多語言支援。這些變更全都位於音訊的上游。音訊並沒有變動。

在 Anthropic 自家的說明文件中,現今的語音模式是什麼:

• 模型——「語音模式可以使用你在文字對話中使用的相同 Claude 模型」,而且它「會從你上次在文字對話中使用的模型開始」。文中提到了一項例外:Claude Fable 不支援語音模式。

• 可用性——這是所有方案(從 Free 到 Enterprise)皆提供的 Beta 功能,適用於 Claude Mobile、Desktop 與 web,不過它的設計是為了在手機上達到最佳效果。

• 語音——「預設、有限的選擇」,明確是為了防止語音複製或身分冒充。

• 計費 — 語音對話會計入您一般方案的用量限制。沒有另外的語音用量計。

• 限制——聽寫功能在 Claude Cowork 和 Claude Code 中可用,但語音模式則不支援。

• 語言 —— 英文加上其他語言,其中非英文的部分仍標示為 beta。

那些句子每一句描述的都是包裝在他人語音周圍的產品。它們沒有一句描述的是語音模型。

Voice 分頁可能代表的三種事物,而其中只有一種是模型

這起外洩之所以容易被過度解讀,是因為三種可能的未來在導覽列上看起來一模一樣。

• 一項介面變更——專屬的語音畫面、提示列中的語音按鈕、設定中的語音選擇器。早在 2026 年 2 月,就有報導指出 Anthropic 已在準備類似功能。如果這就是全部,那麼這個頁籤只是重新設計,底層音訊堆疊則原封未動。

• 供應商替換——相同的串聯式架構,背後卻是不同的語音供應商。從外部完全看不出來。這本身就能解釋為何要加入訓練資料,因為若不被允許保留音訊,就無法評估供應商替換。

• 原生語音轉語音模型——Anthropic 訓練自家的音訊模型,並捨棄串接式架構。這是代價高昂的解讀,也是任何在 Claude 上開發的人會在意的那一種,更是唯一需要經同意語音語料庫的解讀。這同時也是目前證據尚未支持的解讀。

這個分頁無法分辨兩者。接下來兩件可查證的事就能:一個音訊模型 ID 出現在 Anthropic 的模型清單中,或是其子處理器頁面上出現新的語音項目。這兩件事都還沒發生。

Anthropic 不在的地方

要看 Anthropic 距離掌控這一層還有多遠,最清楚的方式就是看它沒有出現在哪些地方,接著再看它實際發布了什麼。獨立的語音轉語音比較——Artificial Analysis 維護了一份涵蓋約四十個模型的比較,橫跨推理、對話動態與代理效能——其中列出的都是原生音訊模型,來自 Gemini 3.8 Live、GPT-Realtime-2 與 GPT-Live-1、Qwen Audio 3.0 Realtime、Grok Voice Think Fast 2.0、StepAudio 3 Realtime、Nova 2.0 Sonic、NVIDIA、Kyutai,以及少數幾項開源成果。在那類清單上,Anthropic 完全不見蹤影。另一組項目則涵蓋串接式語音代理管線——也就是把語音轉文字模型、LLM 與文字轉語音模型串接在一起——而這正是 Anthropic 自家語音模式最相似的架構。相較之下,Anthropic 自家的模型說明文件說得毫不含糊:四款現行模型,每一款都以相同方式描述——文字與圖像輸入、文字輸出,頁面上完全沒有任何音訊模型 ID。

Screenshot of the OrcaRouter model catalogue, showing the Models listing with 208 models across 16 providers on one API key, the Text / Image / Embeddings / Video / TTS modality filters, an OpenAI-compatible code sample for calling a model, and model cards including Anthropic Claude Sonnet 5.5.

那並不是對這項產品的批評。這是在說明價值如今正在何處被獲取,也解釋了為什麼一個 Voice 分頁究竟為何會有意思:語音是唯一一種模態,其他每一家前沿實驗室都有第一方模型,而 Anthropic 沒有。

這個月該怎麼處理,其實沒什麼不同

從實務上來說,這一切的意義是:對開發者而言,10 月 4 日什麼都沒變。語音模式還是七月時的那個產品。沒有新增或淘汰任何模型 ID。價格沒有任何變動。如果你今天在 Claude 上推出語音功能,你推出的是一套串接流程:用一個 Claude 模型負責思考,另一個獨立模型負責說話,中間再以黏合層串起來。這次外洩並未改變這一點,而圍繞一個標示為 Preview 的分頁來開發,正是團隊最終會讓產品藍圖依賴某個人內部分支的原因。

它真正主張的是,讓堆疊中語音那一半保持可替換,因為鎖定效應其實存在於級聯流程裡——不在 Claude 模型(你從任何地方都能呼叫它),而在你為語音供應商所寫的黏合層。具體來說,Claude 這一側已經可以路由:Claude Opus 5.5、Claude Sonnet 5.5、Claude Fable 5.1 與 Claude Haiku 4.5 都列在 OrcaRouter 的目錄中,以 Anthropic 的定價提供,0% 加價——供應商定價直接轉嫁,所以只要 Anthropic 降價,我們這邊當天就同步生效——而你會搭配它們使用的文字轉語音模型(Gemini 的 TTS 預覽版、tts-1-hd 等等)都位於同一組金鑰之後。整條語音管線的兩半共用一個端點,意味著替換供應商只是改動一個模型字串,而不是再簽一份合約;而自動容錯移轉則意味著你管線中尚未驗證的那一半會降級到可用的備援,而不是讓通話失敗。

什麼實際上能證實它呢?

別再臆測了,盯緊四個具體、可查證的地方。每一個都是有日期可考的事件,而其中任何一個都能讓這件事從外洩消息變成新聞:

• Anthropic 模型文件或 Models API 清單中出現支援音訊輸入或音訊輸出的新條目。那是唯一能證明第一方語音模型存在的產物。

• Anthropic 子處理者頁面上與語音相關的新增項目。這反而證明了相反的情況——是新的外部供應商,而非內部模型。

• 「語音」分頁在消費端應用程式中不再帶有「預覽」標籤。那就是正式推出,而這一刻正是該功能從僅供觀察,變成可供檢視的時刻。

• 一條定價列。Anthropic 為它所販售的東西定價;若能標出每分鐘的語音價格,會比任何基準測試都更快敲定架構問題。

在那些消息有任何一項成真之前,對 2026 年 10 月的精確總結是這樣的:Anthropic 正在打造語音介面,首次蒐集經使用者同意的語音資料,而且至今仍未推出過任何語音模型。那個分頁是這三項事實中資訊量最少的,卻也是流傳得最遠的。

Screenshot of Anthropic's Claude Platform models overview page listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with their model IDs and pricing, alongside the line 'All current models support text and image input, text output, multilingual capabilities, vision, and tool use.'

未解的問題不是 Anthropic 是否想要更好的語音體驗——選擇加入已經回答了這點。問題在於,對 Anthropic 而言,「更好的語音」是指一個它自己擁有的模型,還是一個它更謹慎管理的供應商。這兩條路徑從外部看有一段時間會顯得一模一樣,然後就變得截然不同。