Thẻ tiêu đề chính với tiêu đề 'Claude Voice: một tab Preview ẩn', phụ đề 'Điều gì đã được xác nhận, điều gì được báo cáo, điều gì vẫn chỉ là suy luận', và ba thẻ ghi 'Phát hiện: một mục Voice riêng trong điều hướng web của Claude, được dán nhãn Preview, báo cáo ngày 4 tháng 10 năm 2026', 'Chưa phát hành: không có mô hình giọng nói, không có model card, không có mục API, không có giá' và 'Có thể xác định ngày: người tiêu dùng đồng ý chia sẻ dữ liệu giọng nói để huấn luyện mô hình, báo cáo ngày 5 tháng 10 năm 2026', với chân trang trích dẫn báo cáo về mục điều hướng hiển thị và tài liệu trợ giúp của Anthropic đọc ngày 11 tháng 10 năm 2026, cùng logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Rò rỉ Giọng nói Claude: Một tab "Xem trước" ẩn trong ứng dụng Claude, và việc Chọn tham gia Dữ liệu Giọng nói xuất hiện bên cạnh nó

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào một thời điểm nào đó trước ngày 4 tháng 10 năm 2026, một mục điều hướng lẽ ra chưa nên xuất hiện đã hiện ra trong giao diện web Claude: một Voice tab riêng biệt mang nhãn Preview nội bộ. Không có thông báo nào cho nó, không có thẻ mô hình, không có dòng giá, không có mục API, và không có ngày tháng. Cũng trong khoảng thời gian đó — được báo cáo vào ngày 5 tháng 10 — nhà cung cấp đã âm thầm thêm một thứ khác mà họ chưa công bố: một tùy chọn đăng ký dành cho người dùng cho phép người dùng trao lại các bản ghi âm giọng nói và dữ liệu trò chuyện thoại "để cải thiện các mô hình AI của chúng tôi", tách biệt với sự đồng ý mà họ vốn đã yêu cầu cho các cuộc trò chuyện bằng văn bản. Danh sách sản phẩm đang phát hành vẫn là bốn mô hình đầu ra văn bản — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 và Claude Haiku 5.5 — và công ty chưa từng phát hành một mô hình giọng nói nào của riêng mình. Vậy nên câu hỏi hữu ích mà vụ rò rỉ này đặt ra không phải là "liệu công ty có đang ra mắt một mô hình giọng nói hay không". Nó hẹp hơn: tab đó chứng minh rằng một giao diện đang được xây dựng, và tùy chọn đăng ký là bằng chứng xác thực đầu tiên mà bất kỳ ai có rằng công ty muốn có dữ liệu huấn luyện giọng nói. Đó là hai khẳng định khác nhau, và chỉ khẳng định thứ hai mới có thể xác định được ngày tháng.

Mọi thứ bên dưới được phân loại thành những gì đã được xác nhận, những gì được báo cáo và chưa được xác minh, và những gì là suy luận. Anthropic hoàn toàn không nói gì về tab này, nghĩa là nguồn cho sự thật cốt lõi chỉ là một ảnh chụp màn hình chứ không phải một thông cáo báo chí.

Điều gì thực sự đã được phát hiện, và điều nó không cho chúng ta biết

Phát hiện này đến từ @testingcatalog trên X, được đăng ngày 4 tháng 10 năm 2026 và được viết thành bài trên cùng kênh đó vào ngày 10 tháng 10. Theo lời bài viết, “một mục Voice riêng biệt đã xuất hiện trong điều hướng web của Claude với nhãn Preview nội bộ,” và “các khả năng cũng như việc có sẵn cho công chúng của nó vẫn chưa được biết.” Đó là toàn bộ bằng chứng trực tiếp. Báo cáo nêu rõ rằng nhãn này ám chỉ một môi trường xem trước nội bộ chứ không phải một đợt triển khai.

Ba điều suy ra từ hiện vật, và không điều nào trong số đó là một đặc tả:

• Phạm vi — một nhãn xem trước nội bộ cho biết có một bản dựng tồn tại ở đâu đó bên trong Anthropic. Nó không nói rằng bản dựng đó chứa một mô hình mới. Một tab điều hướng chỉ là UI.

• Nhà cung cấp — báo cáo lưu ý Anthropic "chưa xác nhận nhà cung cấp giọng nói cơ sở", chưa phát hành các mô hình chuyển văn bản thành giọng nói chuyên dụng thông qua API của mình và chưa ra mắt mô hình âm thanh thời gian thực đầu-cuối gốc. Hai điều cuối có thể kiểm chứng và đúng. Tài liệu mô hình công khai của Anthropic liệt kê bốn mô hình hiện tại và mô tả cả bốn theo cùng một cách: đầu vào văn bản và hình ảnh, đầu ra văn bản.

• Thời điểm — chưa có ngày nào được báo cáo hoặc ám chỉ. "Không có thông tin về thời điểm phát hành ra công chúng," theo bài viết.

Có một tiền lệ đáng để biết, vì nó có thể được diễn giải theo cả hai chiều. Anthropic từng phát hành sản phẩm dưới biểu ngữ xem trước — dòng Mythos đã ra mắt dưới dạng bản xem trước trước khi được truy cập chung — nên một nhãn Preview nội bộ không đương nhiên là thông tin gây nhiễu. Nhưng Anthropic cũng từng có các cờ chế độ thoại nằm chưa phát hành trong mã sản xuất suốt nhiều tháng: một vụ rò rỉ tháng 4 năm 2026 về gói mã nguồn của Claude Code đã làm lộ ra một loạt cờ tính năng chưa phát hành, bao gồm cả chế độ thoại, cùng với công việc về bridge và background-agent. Chế độ thoại đã được thấy rõ là đang được phát triển tại Anthropic trong hơn một năm mà không có mô hình thoại nào xuất hiện. Tab này nhất quán với lịch sử đó và không đẩy nó tiến thêm.

Opt-in chính là tín hiệu có gắn ngày.

Nửa sau của vụ rò rỉ đáng tin cậy hơn, vì đó là một thay đổi về quyền riêng tư chứ không phải ảnh chụp màn hình. Được nhiều cơ quan truyền thông đưa tin vào ngày 5 tháng 10 năm 2026, Anthropic đã bổ sung một cài đặt tùy chọn cho phép người dùng đóng góp bản ghi âm giọng nói và dữ liệu trò chuyện thoại để cải thiện mô hình. Văn bản lời nhắc như được đưa tin là “Cho phép chúng tôi sử dụng dữ liệu giọng nói của bạn để cải thiện các mô hình AI của chúng tôi”, cùng với phần ngôn từ đi kèm nói rằng dữ liệu âm thanh và trò chuyện thoại giúp cải thiện cách các mô hình xử lý giọng nói. Các chi tiết cụ thể được đưa tin, tất cả đều đến từ cùng một cụm bài đưa tin:

• Nơi nó nằm — trong Cài đặt của Claude, ở mục Quyền riêng tư, được hiển thị dưới dạng một nút bật/tắt đồng ý rõ ràng.

• Mặc định của tính năng này — tắt. Người dùng được hỏi ý kiến; họ không bị tự động ghi danh.

• Phạm vi của nó — tách biệt với cơ chế đồng ý hiện có dành cho các cuộc trò chuyện bằng văn bản, và đây chính là chi tiết quan trọng nhất.

• Khả năng đảo ngược — có thể tắt sau đó và dữ liệu giọng nói được xóa khỏi cài đặt, theo nội dung đưa tin.

Tại sao sự đồng ý riêng biệt lại quan trọng: nếu toàn bộ quy trình thoại là một tích hợp nhà cung cấp không có mô hình Anthropic nào tham gia, thì nơi tự nhiên để hợp nhất sự đồng ý hẳn đã tồn tại. Việc tách ra một kênh dữ liệu thoại riêng biệt là điều bạn làm khi bạn có ý định huấn luyện trên giọng nói — cho một mô hình mới, hoặc cho một lớp giọng nói chuyên biệt bên trong một mô hình hiện có. Đó là một lập luận từ động cơ, không phải từ bằng chứng, và nên được đọc theo cách đó. Cách đọc ngược lại trung thực là một công ty vận hành tính năng thoại ở quy mô lớn cần có kho ngữ liệu đánh giá riêng và phân tích thất bại riêng bất kể ai cung cấp âm thanh, và một cơ chế chọn tham gia được thiết kế để tắt đi sau này cũng là cách rẻ nhất để tuân thủ trong khi bạn quyết định.

Thêm một mẩu bối cảnh nữa, vì nó khiến thay đổi này trông sắc nét hơn thực tế. Tài liệu quyền riêng tư của chính Anthropic dành cho các sản phẩm thương mại tuyên bố thẳng thừng, trong một bài viết ngày 16 tháng 3 năm 2026, rằng "chúng tôi không sử dụng giọng nói của bạn để huấn luyện các mô hình của chúng tôi", và rằng sau khi lời nói được chuyển thành văn bản, bản ghi âm sẽ bị xóa. Bài viết đó chỉ giới hạn trong phạm vi Claude for Work, Anthropic API và các nền tảng thương mại tương tự. Còn tùy chọn tham gia mới là một cài đặt phía người tiêu dùng. Cả hai tuyên bố đều có thể đúng cùng lúc — và đó chính xác là hình thái của một công ty đang dựng lên một quy trình dữ liệu huấn luyện ở một mảng kinh doanh trong khi vẫn giữ lời hứa theo hợp đồng ở mảng còn lại.

A single-column scoreboard titled 'Claude Voice - what is actually established' with six rows reading 'First-party speech model: none shipped', 'Underlying voice provider: not disclosed', 'Voice mode status: beta, all plans', 'Models in voice mode: same as text chat, Claude Fable excluded', 'Voice data for training: new consumer opt-in, off by default' and 'Speech-to-speech leaderboards: Anthropic absent', with a footer noting the provider is unconfirmed.

Anthropic đã có một sản phẩm giọng nói được một năm, nhưng chưa từng có mô hình giọng nói nào trong suốt khoảng thời gian đó

Đây là phần mà các bài đưa tin về vụ rò rỉ thường bỏ qua, và đó chính là bối cảnh bạn cần để đọc đúng tab đó.

Chế độ giọng nói của Claude ra mắt vào tháng 5 năm 2025 dưới dạng tính năng trò chuyện bằng giọng nói trong các ứng dụng di động. Ngay từ đầu, nó đã là một lớp bọc: các mô hình ngôn ngữ của Anthropic đảm nhiệm phần suy luận, còn bản thân giọng nói thì đến từ một nơi khác. Ngăn xếp công nghệ này chưa bao giờ được tiết lộ. Khi TechCrunch đưa tin về bản nâng cấp chế độ giọng nói ngày 23 tháng 7 năm 2026, bài báo lưu ý cả rằng "Anthropic đã không thực hiện bất kỳ thay đổi nào đối với mô hình giọng nói trong bản phát hành này" và rằng công ty "chưa nêu chi tiết loại ngăn xếp giọng nói mà họ sử dụng". Các bài báo từ năm 2025 đã chỉ ra ElevenLabs là nhà cung cấp giọng nói, phần lớn được suy ra từ các tiết lộ về bên xử lý phụ của Anthropic chứ không phải từ bất cứ điều gì Anthropic đã xác nhận. Hãy coi nhà cung cấp này là chưa được xác minh.

Bản nâng cấp tháng 7 năm 2026 rất đáng để rút ra bài học vì những gì nó không bao gồm. Nó bổ sung khả năng chọn mô hình — bạn có thể chọn giữa Claude Opus, Claude Sonnet và Claude Haiku thay vì chỉ có Haiku — cùng các trình kết nối tới Gmail, Calendar, Slack, Canva và Notion, các cuộc trò chuyện dài hơn, và hỗ trợ đa ngôn ngữ được phát hành dưới dạng beta. Mọi thay đổi đó đều nằm ở phía thượng nguồn so với âm thanh. Phần âm thanh không hề thay đổi.

Chế độ giọng nói hiện nay là gì, trên tài liệu trợ giúp của chính Anthropic:

• Các mô hình — “Chế độ thoại có thể sử dụng cùng các mô hình Claude mà bạn dùng trong trò chuyện văn bản,” và nó “bắt đầu với mô hình bạn đã dùng gần nhất trong trò chuyện văn bản.” Một ngoại lệ được nêu: Claude Fable không khả dụng trong chế độ thoại.

• Tính khả dụng — một tính năng beta trên tất cả các gói, từ Free đến Enterprise, trên Claude Mobile, Desktop và web, mặc dù nó được thiết kế để hoạt động tốt nhất từ điện thoại.

• Các giọng nói — “một lựa chọn hạn chế, được đặt sẵn,” nhằm mục đích rõ ràng là ngăn chặn việc sao chép hoặc mạo danh giọng nói.

• Cách tính phí — các cuộc trò chuyện thoại được tính vào giới hạn gói thông thường của bạn. Không có đồng hồ đo thoại riêng.

• Các giới hạn — tính năng đọc chính tả có trong Claude Cowork và Claude Code, nhưng chế độ giọng nói thì không.

• Các ngôn ngữ — tiếng Anh cùng những ngôn ngữ khác, trong đó nhóm không phải tiếng Anh vẫn được dán nhãn beta.

Mỗi dòng trong số đó đều mô tả một sản phẩm được bao bọc quanh lời nói của người khác. Không dòng nào mô tả một mô hình giọng nói.

Ba thứ mà một tab Voice có thể là, và chỉ một trong số đó là một mô hình

Lý do khiến rò rỉ này dễ bị suy diễn quá mức là cả ba tương lai khả dĩ đều trông y hệt nhau trên thanh điều hướng.

• Thay đổi giao diện — một màn hình giọng nói riêng, một nút giọng nói trong thanh nhập lệnh, một bộ chọn giọng nói trong cài đặt. Anthropic từng được báo cáo là đang chuẩn bị một thứ gì đó như thế này vào tháng 2 năm 2026. Nếu chỉ có vậy, tab này là một bản thiết kế lại và ngăn xếp âm thanh bên dưới vẫn không bị thay đổi.

• Việc thay nhà cung cấp — vẫn kiến trúc xếp tầng như cũ, nhưng nhà cung cấp giải pháp giọng nói đằng sau thì khác. Không thể thấy được từ bên ngoài. Điều này tự nó có thể giải thích cho việc chọn tham gia dữ liệu huấn luyện, vì bạn không thể đánh giá một cuộc thay nhà cung cấp nếu không có âm thanh mà bạn được phép giữ lại.

• Một mô hình chuyển giọng nói thành giọng nói gốc — Anthropic tự huấn luyện mô hình âm thanh của riêng mình và loại bỏ chuỗi xử lý trung gian. Đây là cách diễn giải tốn kém, là cách sẽ quan trọng với bất kỳ ai xây dựng trên Claude, và là cách duy nhất cần một kho ngữ liệu giọng nói đã được đồng thuận. Đây cũng là cách diễn giải mà bằng chứng vẫn chưa ủng hộ.

Tab không thể phân biệt được giữa chúng. Hai điều có thể kiểm chứng tiếp theo sẽ làm được điều đó: một ID mô hình âm thanh xuất hiện trong danh sách mô hình của Anthropic, hoặc một mục giọng nói mới trên trang subprocessor của hãng. Cả hai đều chưa xảy ra.

Nơi Anthropic không hiện diện

Cách rõ ràng nhất để thấy Anthropic còn cách việc sở hữu lớp này bao xa là nhìn vào nơi nó không xuất hiện, rồi sau đó nhìn vào những gì nó thực sự công bố. Các so sánh độc lập giữa giọng nói với giọng nói — Artificial Analysis duy trì một bảng bao quát khoảng bốn mươi mô hình trên các khía cạnh suy luận, động lực hội thoại và hiệu suất tác tử — được điền đầy bởi các mô hình âm thanh gốc đến từ Gemini 3.8 Live, GPT-Realtime-2 và GPT-Live-1, Qwen Audio 3.0 Realtime, Grok Voice Think Fast 2.0, StepAudio 3 Realtime, Nova 2.0 Sonic, NVIDIA, Kyutai và một số dự án mở. Anthropic không xuất hiện ở bất kỳ đâu trong loại danh sách đó. Một nhóm mục riêng bao gồm các pipeline tác tử giọng nói xếp tầng — một mô hình chuyển giọng nói thành văn bản, một LLM và một mô hình chuyển văn bản thành giọng nói được nối với nhau — đây là kiến trúc mà chế độ giọng nói của chính Anthropic giống nhất. Đối chiếu với điều đó, tài liệu về mô hình của chính Anthropic lại rõ ràng không mập mờ: bốn mô hình hiện hành, mỗi mô hình đều được mô tả theo cùng một cách — đầu vào văn bản và hình ảnh, đầu ra văn bản, không có bất kỳ ID mô hình âm thanh nào trên trang.

Screenshot of the OrcaRouter model catalogue, showing the Models listing with 208 models across 16 providers on one API key, the Text / Image / Embeddings / Video / TTS modality filters, an OpenAI-compatible code sample for calling a model, and model cards including Anthropic Claude Sonnet 5.5.

Đó không phải là lời chỉ trích sản phẩm. Đó là một nhận định về nơi giá trị đang được nắm bắt hiện nay, và nó giải thích tại sao một tab Voice lại đáng chú ý đến vậy: giọng nói là phương thức duy nhất mà mọi phòng thí nghiệm tiên phong khác đều có mô hình first-party của riêng mình, còn Anthropic thì không.

Cần làm gì với chuyện đó trong tháng này, vốn chẳng có gì khác

Cách hiểu thực tế của tất cả những điều này là không có gì thay đổi đối với một người xây dựng sản phẩm vào ngày 4 tháng 10. Chế độ thoại vẫn là sản phẩm y như hồi tháng 7. Không có ID mô hình nào được thêm vào hay ngừng hỗ trợ. Không có mức giá nào thay đổi. Nếu hôm nay bạn đang triển khai thoại trên Claude, bạn đang triển khai một chuỗi cascade: một mô hình Claude cho phần suy nghĩ, một mô hình riêng cho phần nói, và lớp keo kết nối ở giữa. Vụ rò rỉ không thay đổi điều đó, và việc xây dựng quanh một tab ghi là Preview chính là cách các đội ngũ rốt cuộc phải phụ thuộc lộ trình vào nhánh nội bộ của ai đó.

Điều mà nó thực sự lập luận là nên giữ nửa phần giọng nói của stack ở trạng thái có thể hoán đổi, bởi vì chính chuỗi cascade mới là nơi sự ràng buộc thực sự nằm — không phải ở mô hình Claude, thứ bạn có thể gọi từ bất cứ đâu, mà ở lớp keo nối bạn viết cho nhà cung cấp giọng nói. Cụ thể, phía Claude vốn đã có thể định tuyến: Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1 và Claude Haiku 4.5 nằm trong danh mục OrcaRouter ở mức giá niêm yết của Anthropic với 0% markup — giá niêm yết của nhà cung cấp được chuyển thẳng qua, nên nếu Anthropic cắt giá thì bên chúng tôi cập nhật ngay trong cùng ngày — và các mô hình chuyển văn bản thành giọng nói mà bạn sẽ ghép cặp với chúng (các bản xem trước TTS của Gemini, tts-1-hd, cùng nhiều mô hình khác) đều nằm sau cùng một key. Một endpoint duy nhất cho cả hai nửa của pipeline giọng nói nghĩa là việc đổi nhà cung cấp chỉ là thay đổi chuỗi mô hình thay vì phải ký thêm hợp đồng thứ hai, và tự động chuyển đổi dự phòng nghĩa là nửa chưa được kiểm chứng của pipeline sẽ hạ cấp xuống một phương án dự phòng vẫn hoạt động được thay vì làm hỏng cuộc gọi.

Điều gì thực sự sẽ xác nhận điều đó?

Bỏ qua suy đoán và theo dõi bốn điểm cụ thể, có thể kiểm chứng. Mỗi điểm là một sự kiện có thể định ngày, và bất kỳ điểm nào trong số đó cũng đưa điều này từ suy đoán thành tin tức:

• Một mục mới trong tài liệu về các mô hình của Anthropic hoặc trong danh sách Models API với đầu vào âm thanh hoặc đầu ra âm thanh. Đó là bằng chứng duy nhất cho thấy tồn tại một mô hình giọng nói first-party.

• Một bổ sung liên quan đến giọng nói trên trang nhà xử lý phụ của Anthropic. Điều đó chứng minh điều ngược lại — một nhà cung cấp bên ngoài mới thay vì một mô hình nội bộ.

• Tab Voice mất nhãn Preview trong các ứng dụng dành cho người tiêu dùng. Đó là đợt triển khai, và đó là thời điểm tính năng này trở nên có thể đánh giá thay vì chỉ có thể quan sát.

• Một dòng trong bảng giá. Anthropic định giá thứ mình bán; một mức giá cho mỗi phút giọng nói sẽ giải quyết câu hỏi về kiến trúc nhanh hơn bất kỳ phép đo chuẩn nào.

Cho đến khi một trong những điều đó thành hiện thực, tóm tắt chính xác về tháng 10 năm 2026 là thế này: Anthropic đang xây dựng giao diện giọng nói, đang thu thập dữ liệu giọng nói có sự đồng thuận lần đầu tiên, và vẫn chưa từng phát hành một mô hình giọng nói nào. Tab ấy là thông tin ít bổ ích nhất trong ba sự thật đó và lại là thứ lan truyền xa nhất.

Screenshot of Anthropic's Claude Platform models overview page listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with their model IDs and pricing, alongside the line 'All current models support text and image input, text output, multilingual capabilities, vision, and tool use.'

Câu hỏi mở không phải là liệu Anthropic có muốn một trải nghiệm giọng nói tốt hơn hay không — việc chọn tham gia đã trả lời điều đó. Mà là liệu “giọng nói tốt hơn” tại Anthropic có nghĩa là một mô hình do chính họ sở hữu hay một nhà cung cấp mà họ quản lý cẩn thận hơn. Hai con đường đó trông giống nhau từ bên ngoài trong một thời gian, rồi sau đó chúng chẳng còn giống nhau chút nào.