Thẻ hero của bài viết hiển thị 'MAI-Transcribe-2 vs Muse Voice Transcribe', với nhãn 'SO SÁNH MÔ HÌNH' và phụ đề 'Cùng một tuần, hai canh bạc trái ngược về âm thanh', cùng các chip so sánh batch 2.0% AA-WER so với streaming 3.1%, $1.67 so với $3.00 mỗi 1.000 phút và 60 ngôn ngữ/batch so với 20+ người nói/thời gian thực, trên nền gradient từ trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

MAI-Transcribe-2 vs Muse Voice Transcribe: Cùng một tuần, hai canh bạc trái ngược về âm thanh

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tuần lễ ngày 1 tháng 9 năm 2026 chứng kiến sự ra đời của hai mô hình giọng nói đến từ hai phòng thí nghiệm tiên phong, và MAI-Transcribe-2 cùng Muse Voice Transcribe được hiểu đúng nhất là những câu trả lời trái ngược cho câu hỏi trí tuệ âm thanh nên nằm ở đâu. Muse Voice Transcribe, được Meta Superintelligence Labs phát hành vào ngày 1 tháng 9, là một mô hình nhận thức âm thanh thời gian thực: nó phiên âm, tách hơn hai mươi người nói, và phát hiện khi một người nói đã nói xong, tất cả trong một lần xử lý theo luồng trên các khối âm thanh trực tiếp dài 80 mili-giây, đồng thời dẫn đầu bảng xếp hạng phiên âm giọng nói thành văn bản theo luồng mà nó được đánh giá. MAI-Transcribe-2, được Microsoft phát hành hai ngày sau đó, vào ngày 3 tháng 9, là một ván cược ngược lại: một công cụ xử lý theo lô hoàn toàn không theo đuổi độ trễ trực tiếp, mà thay vào đó dồn mọi thứ vào việc phiên âm các tệp ghi âm sẵn với tỷ lệ lỗi từ tốt nhất trên bảng xếp hạng phiên âm không theo luồng độc lập, nhanh gấp khoảng 411 lần thời gian thực, với chi phí khoảng 1,67 đô la cho mỗi 1.000 phút. So sánh trực diện chúng như những "mô hình phiên âm" sẽ che giấu quyết định thực sự, vốn xoay quanh thời điểm trong vòng đời của âm thanh mà bạn cần lời chữ: khi nó đang diễn ra, hay sau khi nó đã kết thúc.

Hai sản phẩm được trỏ tới tại các thời điểm khác nhau

Muse Voice Transcribe được xây dựng cho khoảnh khắc âm thanh vẫn đang diễn ra. Đây là mô hình đa phương thức tự hồi quy trong gia đình Muse của Meta, gộp ba tác vụ vào một lần xử lý — nhận dạng giọng nói tự động, phân tách người nói cho hơn hai mươi người, và endpointing, tức phát hiện người nói đã ngừng nói để hệ thống có thể phản hồi. Meta cho biết bản phiên âm cuối cùng được hoàn tất khoảng 0,16 giây sau khi người nói dừng lại, với tỷ lệ lỗi từ là 3,1% trên các bản phiên âm cuối cùng và 3,6% trên các bản phiên âm một phần đầu tiên — những con số Meta công bố vào ngày ra mắt, trích dẫn từ bảng xếp hạng phát trực tuyến Artificial Analysis và vẫn chưa được tái xác nhận độc lập tính đến thời điểm bài viết này được đăng tải. Mô hình xử lý được âm thanh dài hơn một giờ trong một luồng duy nhất, chuyển đổi ngôn ngữ giữa câu, và được huấn luyện trên 70+ ngôn ngữ, trong đó 25 ngôn ngữ được xác minh kỹ lưỡng khi ra mắt. Giá là 3 USD cho mỗi 1.000 phút âm thanh, tức khoảng 0,18 USD mỗi giờ, thông qua Meta Model API. Meta đã xác nhận rằng các trọng số sẽ không được mở.

MAI-Transcribe-2 được xây dựng cho thời điểm audio đã là một tệp có sẵn. Mô hình của Microsoft đạt 2,0% AA-WER trên bảng xếp hạng non-streaming của Artificial Analysis — vị trí thứ hai và là thông số tốt nhất trong nhóm các API batch được quản lý — đồng thời xử lý nhanh gấp khoảng 411 lần thời gian thực, một con số về thông lượng chứ không phải lời hứa về độ trễ. Mô hình phiên âm 60 ngôn ngữ với khả năng tự động nhận dạng ngôn ngữ, đi kèm tính năng tách người nói (speaker diarization), mốc thời gian cấp độ từ, định hướng từ khóa (keyword biasing), các chế độ nguyên văn (verbatim) so với làm sạch (clean), và xử lý được sự xen lẫn ngôn ngữ (code-switching) như Hinglish và Spanglish. Mô hình có sẵn thông qua Microsoft Foundry trong giai đoạn public preview và MAI Playground với mức giá 0,10 USD mỗi giờ audio, theo ưu đãi ra mắt giới hạn đến hết năm nay; chưa có sản phẩm streaming nào được công bố. Bài đăng ra mắt của Microsoft định vị mô hình này một cách rõ ràng cho audio dài hơi (long-form) và audio batch — những khối lượng công việc mà độ trễ thấp của mô hình streaming chẳng đáng giá bao nhiêu, nhưng chi phí tính theo phút của nó thì lại rất đáng quan tâm.

A two-column scoreboard titled 'MAI-Transcribe-2 vs Muse Voice Transcribe — the scoreboard': left column MAI-Transcribe-2 lists batch pre-recorded type, 2.0% AA-WER (non-streaming), ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages and bundled diarization with unpublished rate; right column Muse Voice Transcribe lists streaming real-time type, 3.1% streaming WER (Meta-reported), final latency ~0.16s, $3.00 per 1,000 minutes, 25 verified of 70+ languages and 20+ speaker in-stream diarization; footer notes the WER figures are not comparable and Muse figures are Meta-reported.

Tại sao hai con số độ chính xác không mâu thuẫn với nhau

Bản năng tự nhiên là so sánh 2.0% với 3.1% và tuyên bố một bên chiến thắng, nhưng điều đó sẽ sai theo hai cách. Thứ nhất, các con số đo lường những tác vụ khác nhau: mức 2.0% của MAI-Transcribe-2 là độ chính xác non-streaming trên âm thanh ghi sẵn, khi mô hình có thể xem toàn bộ tệp; mức 3.1% của Muse Voice Transcribe là độ chính xác streaming trên các bản ghi cuối cùng, được tạo ra dưới ràng buộc phải phiên âm khi âm thanh đến. Streaming là bài toán khó hơn, đó là lý do bảng xếp hạng streaming và bảng xếp hạng non-streaming là các bảng riêng biệt với các số điểm riêng biệt. Thứ hai, các con số này có độ tin cậy khác nhau: số liệu của MAI-Transcribe-2 là phép đo từ Artificial Analysis đối với mô hình, còn số liệu của Muse Voice Transcribe là báo cáo ngày ra mắt của Meta về kết quả do Artificial Analysis đo — do nhà cung cấp báo cáo và chưa được kiểm chứng độc lập. Nói một cách trung thực, cả hai mô hình đều đưa ra các tuyên bố đáng tin cậy về việc đứng đầu bảng xếp hạng tương ứng, và không con số nào cho bạn biết điều gì về bảng còn lại.

Diarization chính là nơi diễn ra sự so sánh thực sự, vì đây là tính năng duy nhất mà cả hai sản phẩm đều có và cũng là nơi tham vọng của họ khác biệt rõ rệt. Muse Voice Transcribe tách được hơn hai mươi người nói như một khả năng xử lý luồng dữ liệu cốt lõi, với Meta báo cáo tỷ lệ lỗi diarization người nói trung bình là 17,5% so với khoảng đối thủ mà họ trích dẫn từ 21,1% đến 28,6% — một lần nữa do Meta báo cáo và chưa được xác minh. MAI-Transcribe-2 cũng đi kèm tính năng diarization, nhưng Microsoft không công bố giới hạn số người nói tối đa và cũng không công bố tỷ lệ lỗi diarization nào cả. Với cuộc gọi giữa hai bên, cả hai sản phẩm đều hoạt động tốt và sự khác biệt là không đáng kể. Với một nhóm tập trung mười hai người hoặc bản ghi âm hội thảo, Muse Voice Transcribe là sản phẩm duy nhất trong hai sản phẩm có giới hạn số người nói tối đa được công bố rõ ràng, và tính năng diarization chưa được đo lường của MAI-Transcribe-2 là lý do lớn nhất để bạn cần thử nghiệm nó trước khi tin tưởng giao phó những bản âm thanh khó hơn của mình.

So sánh giá hợp lý

Về giá cả, hai sản phẩm này gần nhau hơn so với cách đặt vấn đề “batch so với streaming” gợi ý, bởi 1,67 USD mỗi 1.000 phút (MAI-Transcribe-2, giá đăng ký sớm) và 3,00 USD mỗi 1.000 phút (Muse Voice Transcribe) đều nằm ở mức rẻ trong phân khúc dịch vụ nhận dạng giọng nói được quản lý. So sánh chỉ thực sự có ý nghĩa trong cùng một làn. Đối với phiên âm batch các tệp đã ghi âm sẵn, MAI-Transcribe-2 có giá dưới một nửa mô hình vốn được thiết kế cho streaming, đồng thời có WER phi-streaming tốt hơn — nhưng bạn sẽ chỉ định tuyến tệp ghi âm sang Muse Voice Transcribe nếu bạn đặc biệt muốn dùng pipeline streaming của nó, và đó không phải cách hiệu quả để xử lý một kho lưu trữ. Với âm thanh cuộc họp trực tiếp, Muse Voice Transcribe là sản phẩm duy nhất trong bài viết này hoạt động được, và mức giá 3,00 USD của nó rẻ hơn hẳn các API phiên âm thời gian thực khác mà nó cạnh tranh khi ra mắt — Gemini 3.5 Transcribe Live khoảng 9 USD mỗi 1.000 phút, GPT Live Transcribe 17 USD — trong khi bổ sung khả năng diarization hơn hai mươi người nói mà các sản phẩm đó không sánh được. Nhận định trung thực nhất về giá là Meta định giá streaming thấp, Microsoft định giá batch còn thấp hơn, và cả hai con số này đều là mức giá thời khuyến mãi, sẽ biến động khi mỗi hãng công bố mức giá tiêu chuẩn.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Cái nào cho âm thanh nào?

Nếu audio của bạn là dạng trực tiếp — các cuộc họp được phiên âm theo thời gian thực, voice agent, phụ đề trực tiếp, bất cứ thứ gì cần lời nói ngay khi chúng đang được nói ra — thì Muse Voice Transcribe là lựa chọn, và không có đối thủ nào bám sát. Nó là mô hình streaming duy nhất ở đây, phân tách được hơn hai mươi người nói trong cùng một lần xử lý, và ngay từ ngày đầu đã được định giá để thắng cuộc chơi này. Còn những điểm yếu thì nên mang theo khi dùng thử: số liệu về độ chính xác và diarization là do Meta công bố, và một mô hình streaming mới chỉ một tuần tuổi vẫn chưa cho thấy nó sẽ xử lý ra sao với audio nhiễu ngoài thực tế — thứ nằm bên ngoài các benchmark lúc ra mắt.

Nếu audio của bạn vốn đã là các tệp — kho lưu trữ, bản ghi cuộc gọi, thư viện phương tiện, bất kỳ nội dung nào được xử lý hàng loạt — thì MAI-Transcribe-2 là lựa chọn tốt hơn trên mọi phương diện quan trọng: WER đo được thấp hơn, thông lượng cao hơn khoảng một bậc độ lớn, và giá mỗi 1.000 phút thấp hơn so với mô hình streaming. Rủi ro của nó chính là hình ảnh phản chiếu của Muse: mới ra mắt được bốn ngày, không có SKU streaming, chất lượng diarization chưa được đo lường, và một mức giá ưu đãi đăng ký sớm mà mức giá tiêu chuẩn đằng sau vẫn chưa được công bố.

Trang giới thiệu của Microsoft về MAI-Transcribe-2 liệt kê các tính năng mà Microsoft gộp chung trong gói sản phẩm mà đối thủ phát trực tuyến không cung cấp ở cùng một giai đoạn, và đây là tài liệu bạn cần xem khi quyết định xem tuyên bố nào phản ánh đúng bề mặt sản phẩm và tuyên bố nào vẫn chỉ là lời hứa trên điểm chuẩn.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

Và nếu bản ghi chép chỉ là nửa đầu của đường ống xử lý, thì lựa chọn giữa hai mô hình này kém quan trọng hơn lựa chọn bạn đưa ra ở tầng phía trên chúng. Bản ghi âm cuộc họp trực tiếp được phiên chép bằng Muse Voice Transcribe vẫn cần được tóm tắt, trích xuất action item và soạn nháp follow-up trước khi hữu dụng; các cuộc gọi đã lưu trữ được phiên chép bằng MAI-Transcribe-2 vẫn cần được tìm kiếm, che bớt thông tin nhạy cảm hoặc định tuyến tới đúng hệ thống hạ nguồn. Đó chính là tầng mà một nền tảng đa mô hình chứng tỏ giá trị của mình — OrcaRouter với một API duy nhất kết nối hơn 200 mô hình, giữ nguyên giá niêm yết của nhà cung cấp với mức markup 0%, cho phép các tác vụ hạ nguồn đó gọi một mô hình khác nhau cho từng loại khối lượng công việc chỉ qua một tích hợp duy nhất, nên dù mô hình phiên chép nào thắng trong vòng pilot của bạn, ngăn xếp phía trên bản ghi chép cũng không cần xây dựng lại chỉ để chuyển đổi. Muse Voice Transcribe và MAI-Transcribe-2 hiện đều không nằm trong danh sách này; cả hai đều chỉ hoạt động trên các API riêng của nhà cung cấp. Ván cược tuần này thực sự ngã ngũ trong một phạm vi hẹp hơn và hữu ích hơn: phiên chép thời gian thực và phiên chép hàng loạt đều vừa trở nên đủ rẻ đến mức yếu tố khác biệt không còn là những con chữ — mà là cách bạn dùng chúng.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube