Thẻ tiêu đề hero cho Muse Voice Transcribe, mô hình cảm nhận âm thanh thời gian thực đầu tiên của Meta Superintelligence Labs, hiển thị dạng sóng phát trực tiếp có gắn nhãn ASR, phân tách 20+ người nói và endpointing, cùng chip giá ghi $0,18 mỗi giờ âm thanh.
Guides & Insights

Muse Voice Transcribe đã ra mắt: Mô hình nhận thức âm thanh thời gian thực đầu tiên của Meta

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Muse Voice Transcribe, mô hình nhận thức âm thanh thời gian thực đầu tiên của Meta Superintelligence Labs, được phát hành vào ngày 1 tháng 9 năm 2026, và có mức giá gây bất ngờ: 3,00 đô la cho mỗi 1.000 phút âm thanh — khoảng 0,18 đô la một giờ — trên Meta Model API. Trong một lần truyền phát duy nhất, nó làm được những gì mà hầu hết các bộ xử lý phiên âm phải tách thành ba hệ thống: nhận dạng giọng nói tự động, phân đoạn người nói với hơn 20 giọng nói, và xác định điểm kết thúc — công việc quyết định khi nào người nói thực sự nói xong thay vì tạm dừng giữa chừng. Meta cho biết mô hình này đứng đầu bảng xếp hạng chuyển giọng nói thành văn bản theo luồng của Artificial Analysis với tỷ lệ lỗi từ 3,1% trên các bản phiên âm cuối cùng, được trả về trong 0,16 giây sau khi người nói ngừng nói.

Con số cuối cùng đó cần được gắn nhãn trung thực trước khi nó phát huy tác dụng: đó là tuyên bố ngày ra mắt của Meta, chỉ vào một bảng xếp hạng độc lập, cho một mô hình mới có thể được gọi chưa đầy một ngày khi thông báo được đưa ra. Không ai bên ngoài phòng thí nghiệm đã tái tạo được con số 3.1% đó, và tuyên bố về độ chính xác chỉ là một phần, trong khi phần còn lại của lời chào hàng — 70+ ngôn ngữ được huấn luyện, chuyển mã bản địa, "độ trễ thích ứng" học bằng reinforcement — là một loạt các tuyên bố của nhà cung cấp cùng chung số phận. Mọi thứ trong bài viết này là trạng thái của mô hình vào ngày đầu tiên, với các con số của nhà cung cấp được dán nhãn đúng là của nhà cung cấp.

Những con số quan trọng trong ngày đầu tiên

• Giá — $3.00 mỗi 1.000 phút âm thanh (khoảng $0.18 mỗi giờ âm thanh) trên Meta Model API, rẻ hơn mọi API phiên âm phát trực tuyến lớn mà chúng tôi theo dõi.

• {{1}}Tuyên bố về độ chính xác{{/1}} — {{2}}WER 3,1% trên bản ghi cuối cùng sau 0,16 giây kể từ khi kết thúc lời nói{{/2}}; {{3}}WER 3,6% trên bản ghi từng phần đầu tiên sau 0,13 giây{{/3}}. {{4}}Do nhà cung cấp báo cáo, trích dẫn bảng xếp hạng phát trực tuyến Artificial Analysis{{/4}}.

• Diarization — hơn 20 người nói, xuất ra theo luồng mà không cần bước hậu xử lý riêng biệt (Meta báo cáo tỷ lệ lỗi diarization trung bình là 17,5%).

• Ngôn ngữ — được huấn luyện trên 70+; 25 được "xác minh toàn diện" khi ra mắt; chuyển đổi ngôn ngữ liền mạch trong và giữa các câu.

• Ngữ cảnh — xử lý âm thanh dài hơn một giờ; điều chỉnh ngôn ngữ, từ khóa và ngữ cảnh cho các lĩnh vực nặng về thuật ngữ chuyên ngành.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

'Mô hình nhận thức âm thanh' có nghĩa là gì ở đây

Kiến trúc chính là câu chuyện. Muse Voice Transcribe tiêu thụ âm thanh theo từng khối 80 mili-giây và phát trực tiếp các từ ngay khi chúng ổn định — đó chính là ý nghĩa thực tế của "thời gian thực". Điều thú vị nằm ở cách nó quyết định thời điểm chốt một từ. Thay vì dùng ngân sách độ trễ cố định — sự đánh đổi chuẩn khi bộ nhận dạng hoặc chốt sớm và đoán, hoặc chờ lâu hơn và né tránh — mô hình sử dụng thứ mà Meta gọi là "độ trễ thích ứng": nó xử lý nhanh những phần nói dễ và giữ lại nhiều ngữ cảnh âm thanh hơn cho những từ mà nó kém chắc chắn. Bản thân chính sách độ trễ này được học thông qua học tăng cường, nên mô hình thực chất cân bằng tốc độ và độ chính xác theo từng từ thay vì áp dụng một cài đặt toàn cục duy nhất.

Sự khác biệt đó chính là lý do Meta gọi Muse Voice Transcribe là một "mô hình nhận thức âm thanh" thay vì mô hình ASR. Luồng đầu ra là một bản chép lời trực tiếp duy nhất, đồng thời mang theo thông tin về người đang nói và thời điểm phát ngôn hoàn tất — ba nhãn mà các hệ thống phát trực tiếp thường phải lắp ghép bằng cách kết nối một bộ nhận dạng với một bộ phát hiện hoạt động giọng nói và một mô hình phân đoạn người nói, mỗi thành phần lại bổ sung thêm độ trễ và các kiểu lỗi riêng của mình.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

Phân đoạn người nói và phát hiện điểm kết thúc, được tích hợp sẵn

Phân đoạn người nói (speaker diarization) là phần đáng soi xét kỹ nhất, vì đây là tính năng mà các sản phẩm streaming thường phóng đại nhất. Meta cho biết mô hình tách được hơn 20 người nói trong một bản ghi âm và báo cáo tỷ lệ lỗi phân đoạn trung bình là 17,5%, con số mà họ so sánh với dải 21,1–28,6% mà họ quy cho các hệ thống đối thủ. Cả hai con số đều do nhà cung cấp công bố vào ngày ra mắt, và chưa có đánh giá độc lập nào xác nhận mức 17,5% này. Điều đúng về mặt cấu trúc là quá trình phân đoạn người nói chạy trong cùng một lượt xử lý streaming với quá trình nhận dạng — không có bước thứ hai kiểu "tải âm thanh lên, chờ đợi rồi nhận lại người nói", và chính lựa chọn thiết kế đó khiến việc theo dõi hơn 20 người nói trong bối cảnh trực tiếp trở nên hợp lý.

Endpointing là khả năng thầm lặng và có thể nói là hữu ích nhất. Các API phiên âm cung cấp luồng ASR thô buộc người gọi phải tự triển khai tính năng phát hiện cuối lượt nói, đó là lý do vì sao các trợ lý giọng nói thường xuyên ngắt lời người dùng hoặc để lại khoảng im lặng khó chịu. Muse Voice Transcribe quyết định khi nào một lượt nói hoàn tất và phát ra ranh giới đó như một phần của luồng dữ liệu, nhờ đó ứng dụng nhận được tín hiệu rõ ràng rằng "người nói này đã nói xong" mà không cần xây dựng lớp VAD.

Tuyên bố đa ngôn ngữ, hãy đọc kỹ

Meta đã huấn luyện mô hình trên 70+ ngôn ngữ nhưng chỉ xác thực 25 ngôn ngữ khi ra mắt. Đây là hai việc khác nhau: "{{1}}được huấn luyện trên{{/1}}" nghĩa là dữ liệu có bao gồm các ngôn ngữ đó; còn "{{2}}được xác thực toàn diện{{/2}}" là tập con mà Meta thực sự đứng sau bằng kiểm thử nội bộ. Đối với sử dụng trong sản xuất, danh sách 25 ngôn ngữ được xác thực mới là phạm vi bao phủ thực tế, và khoảng cách giữa 70 và 25 là điều đáng biết trước khi bạn đưa 40 ngôn ngữ qua mô hình này. Điều thực sự khác biệt là câu chuyện {{3}}chuyển mã ngôn ngữ{{/3}} — mô hình được thiết kế để chuyển đổi ngôn ngữ giữa câu và giữa phát ngôn mà không cần được yêu cầu, đây là điểm đau thực sự ở các khu vực đa ngôn ngữ và là điều mà hầu hết các sản phẩm ASR đơn ngôn ngữ không thể làm được. {{4}}Điều chỉnh ngôn ngữ, từ khóa và ngữ cảnh{{/4}} hoàn thiện câu chuyện tùy chỉnh hóa: bạn có thể định hướng nhận dạng theo từ vựng của một lĩnh vực cụ thể, đây chính là tính năng làm cho ASR phát trực tiếp trở nên khả dụng trong các quy trình y tế, pháp lý và hỗ trợ khách hàng.

Ba bề mặt, một mẫu

Muse Voice Transcribe được cung cấp trên ba nền tảng cùng lúc. Phiên bản trả phí là Meta Model API với giá $3.00 cho mỗi 1.000 phút âm thanh. Phiên bản tiêu dùng là Meta AI cho Mac, nơi giữ phím Fn để đọc chính tả vào bất kỳ ứng dụng nào — câu trả lời của Meta cho tính năng đọc chính tả tích hợp của Apple, và là triển khai thực tế rõ ràng nhất của mô hình ngay trong ngày đầu ra mắt. Phiên bản dành cho nhà phát triển là Muse Code, trợ lý mã hóa của Meta, nơi các lệnh thoại điều khiển các phiên đa tác tử và luồng tái cấu trúc mã. Một mô hình duy nhất hỗ trợ tính năng đọc chính tả và một trợ lý mã hóa chính là phiên bản sản phẩm hóa của ý tưởng "một mô hình phát trực tuyến, nhiều nền tảng".

Cái mà mức giá làm giảm xuống

Với mức 0,18 đô la mỗi giờ âm thanh, Muse Voice Transcribe phá giá toàn bộ lĩnh vực phiên âm phát trực tiếp (streaming transcription) ở giá niêm yết. Tập hợp so sánh theo cách chúng tôi theo dõi: Google Gemini 3.5 Transcribe Live có giá khoảng 9 đô la mỗi 1.000 phút, ElevenLabs Scribe v2 Realtime được niêm yết ở mức 6,50 đô la mỗi 1.000 phút, Cartesia Ink-2 ở mức 4,00 đô la, và OpenAI GPT Live Transcribe ở mức 17,00 đô la. Đó là những con số được các nhà cung cấp công bố, và một số mô hình trong số đó có bằng chứng về độ chính xác độc lập mà Muse chưa có — dẫn đầu về giá ngay ngày đầu không giống như một bảng xếp hạng đã ổn định. Nhưng một mô hình phát trực tiếp tích hợp sẵn tính năng tách người nói (diarization) và xác định điểm dừng (endpointing), tham gia ở mức khoảng một phần năm đến một phần mười giá của các API phát trực tiếp hiện tại, là kiểu con số tái lập kỳ vọng bất kể điều gì.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

Những lời cảnh báo trung thực

Muse Voice Transcribe là phần mềm độc quyền và trọng số không được công bố — tùy chọn "tự vận hành" không tồn tại, cũng không có lộ trình trọng số mở nào để kiểm toán hay tinh chỉnh. Tuyên bố về độ chính xác chỉ là con số ngày ra mắt và chưa được tái lập. 25 ngôn ngữ đã xác minh có thể không khớp với con số 70+ ngôn ngữ "được huấn luyện" về mức độ bao phủ ngôn ngữ tài nguyên thấp. Và điểm chuẩn diarization, dù có hứa hẹn đến đâu, vẫn chỉ là phép đo từ nhà cung cấp cho đến khi một lần chạy độc lập xác nhận nó. Đối với những nhóm có yêu cầu duy nhất là phiên âm hàng loạt chính xác cho âm thanh đã ghi sẵn, vẫn tồn tại những lựa chọn rẻ hơn và được kiểm toán tốt hơn — điểm nhấn phát trực tuyến là về tương tác thời gian thực, chứ không phải về việc đánh bại thế giới phiên âm hàng loạt về chi phí mỗi giờ âm thanh.

Xem gì tiếp theo

{{1}}Bốn yếu tố sẽ quyết định liệu lần ra mắt này là một khoảnh khắc hay một xu hướng.{{/1}} {{2}}Thứ nhất, liệu bảng xếp hạng streaming của Artificial Analysis có thực sự xếp Muse Voice Transcribe ở vị trí #1 sau khi được xác minh độc lập hay không — tuyên bố trong ngày ra mắt cần một mục được chốt trên bảng xếp hạng.{{/2}} {{3}}Thứ hai, liệu tính năng diarization (tách giọng người nói) cho hơn 20 người nói có trụ vững khi đối mặt với các cuộc họp thực tế nhiều tiếng ồn hay không.{{/3}} {{4}}Thứ ba, liệu bề mặt đọc chính tả trên Mac của Meta có chuyển hóa thành việc các nhà phát triển áp dụng API hay không.{{/4}} {{5}}Thứ tư, cách các đối thủ hiện hữu phản ứng về giá, vì một mô hình streaming có diarization và endpointing ở mức $0,18 một giờ sẽ tạo áp lực rõ rệt lên tất cả các mô hình có giá cao hơn.{{/5}} {{6}}Khi Meta mở mô hình cho các đối tác phục vụ bổ sung, một cổng chuyển tiếp (pass-through gateway) như {{KEEP}}OrcaRouter{{/KEEP}} — vốn chuyển tiếp giá niêm yết của nhà cung cấp với mức tăng giá 0% — sẽ hiển thị cùng con số $3,00 cho mỗi 1.000 phút mà không có sự đội giá từ bên bán lại, ngay ngày nó ra mắt.{{/6}} {{7}}Cho đến lúc đó, nơi duy nhất để gọi Muse Voice Transcribe là API của chính Meta.{{/7}}

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube