Thẻ hero của bài viết ghi MAI-Transcribe-2-Streaming đã ra mắt với nhãn MÔ HÌNH MỚI · MICROSOFT AI và phụ đề Microsoft giành ngôi vương bản ghi trực tuyến với WER 2,5%, cùng dải số liệu hiển thị tỷ lệ lỗi từ trực tuyến 2,5% ở 0,13 giây sau khi kết thúc lời nói, được ghi trên thẻ là tuyên bố của Microsoft và là lần đầu tiên cho cả bản ghi cuối cùng lẫn bản ghi một phần; 60 ngôn ngữ với khả năng tự động phát hiện ngôn ngữ liên tục; và 9,00 USD mỗi 1.000 phút, được mô tả là 0,54 USD mỗi giờ âm thanh với giá giới thiệu đến hết năm 2026; trên nền gradient từ trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

MAI-Transcribe-2-Streaming đã ra mắt: Microsoft giành ngôi vương phiên âm trực tuyến với WER 2,5%

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MAI-Transcribe-2-Streaming là câu trả lời của Microsoft AI cho một câu hỏi mà bản phát hành hồi tháng 9 của họ còn để ngỏ, và họ đã trả lời câu hỏi đó trong vòng 28 ngày. Ra mắt ngày 1 tháng 10 năm 2026, MAI-Transcribe-2-Streaming là một mô hình chuyển giọng nói thành văn bản theo thời gian thực, phiên âm ngay khi từng từ xuất hiện thay vì đợi đến khi tệp kết thúc. Microsoft cho biết mô hình này đứng đầu về độ chính xác ở cả bản phiên âm cuối cùng lẫn bản phiên âm từng phần trong đánh giá AA-WER Streaming của Artificial Analysis, với tỷ lệ lỗi từ là 2,5% và bản phiên âm cuối cùng sẵn sàng 0,13 giây sau khi kết thúc lời nói. Đó là tuyên bố của nhà cung cấp dựa trên phương pháp luận của một bảng theo dõi, chứ không phải một dòng mà bảng theo dõi đó công bố — tính đến thời điểm soạn thảo, 37 mô hình trên bảng xếp hạng không bao gồm mô hình này, và mô hình mà nó sẽ thay thế là Gro​k Voice Transcribe 2.0 (Streaming) với 2,73% và 0,49 giây. Mô hình nền tảng của nó, MAI-Transcribe-2, ra mắt ngày 3 tháng 9 dưới dạng mô hình xử lý theo lô với WER 2,0% và không có phiên bản SKU thời gian thực; biến thể streaming lấp đầy khoảng trống đó mà không đánh mất nhiều độ chính xác vốn làm nên sự nổi bật của bản theo lô. Thứ mà nó phải đánh đổi là giá: streaming có mức giá gấp 5,4 lần mức theo lô khi ra mắt.

Cách dựng câu chuyện mà Microsoft muốn là một màn quét sạch bảng xếp hạng streaming. Cách dựng câu chuyện mà các con số ủng hộ thì hẹp hơn và thú vị hơn — một mô hình tuyên bố dẫn đầu đồng thời về độ chính xác lẫn độ trễ, trên một vùng biên nơi mục chính xác nhất của bảng chậm hơn bốn lần để chốt so với những mục nhanh nhất, và không mục nhanh nào trong số đó có tỷ lệ lỗi từ dưới 3%, được định giá ngang bằng với sản phẩm hiện hành thay vì thấp hơn. Đây là buổi ra mắt đúng như nó đã diễn ra, với các tuyên bố của nhà cung cấp được dán nhãn.

Microsoft đã phát hành những gì vào ngày 1 tháng 10

MAI-Transcribe-2-Streaming được cung cấp thông qua ngăn xếp giọng nói của Microsoft trong dịch vụ Azure AI Speech, với tài liệu nằm dưới chính tên của mô hình và cùng mô hình phân phối chỉ qua API, không có trọng số như bản phát hành theo lô. Mô hình phiên âm 60 ngôn ngữ với tính năng tự động phát hiện ngôn ngữ liên tục, nên một phiên có chuyển đổi ngôn ngữ giữa dòng không cần phải khai báo trước. Microsoft định vị nó trên biên giới Pareto giữa độ chính xác và độ trễ trong biểu đồ phát trực tuyến của Artificial Analysis — cách diễn giải của chính nhà cung cấp về dữ liệu của công cụ theo dõi, và cũng là cách diễn giải mà biểu đồ của chính công cụ theo dõi ủng hộ.

Mô hình streaming không phải là toàn bộ bản phát hành. Microsoft đã phát hành thêm hai mô hình giọng nói đi kèm: MAI-Voice-2.1, hỗ trợ 23 ngôn ngữ trên 26 vùng ngôn ngữ, và MAI-Voice-2.1-Flash, có thể xử lý tối đa 45 giây âm thanh với độ trễ khoảng 150 ms. Xét như một tổng thể, đợt phát hành ngày 1 tháng 10 là một ngăn xếp hội thoại thời gian thực hoàn chỉnh — nghe, hiểu, nói — chứ không phải là một lần ra mắt mô hình đơn lẻ.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Đọc bảng xếp hạng phát trực tuyến

AA-WER Streaming đo lường hai thứ cho mỗi mô hình: mức độ sai của bản chép lời hoàn chỉnh và thời gian hoàn thành sau khi người nói dừng lại. Tuyên bố của Microsoft là MAI-Transcribe-2-Streaming dẫn đầu ở cả hai: tỷ lệ lỗi từ 2,5% trên bản chép lời cuối cùng tại 0,13 giây sau khi kết thúc giọng nói và 2,5% tương tự trên bản chép lời từng phần đầu tiên tại 0,12 giây, mà Microsoft nói là đầu tiên về độ chính xác ở cả hai. Hãy đọc đó như một con số từ nhà cung cấp — tính đến thời điểm soạn thảo, bảng streaming của chính tracker vẫn chưa vẽ biểu đồ mô hình, nên không có hàng MAI-Transcribe-2-Streaming độc lập nào để đọc. Những gì bảng hiển thị là đối thủ mà nó tuyên bố sẽ đánh bại, và đối thủ gần hơn so với cách diễn đạt "vương miện":

• Grok Voice Transcribe 2.0 — WER của bản chép lời cuối cùng là 2,73% tại thời điểm 0,49 giây sau khi kết thúc lời nói, theo Artificial Analysis, và hiện đang dẫn đầu trên bảng xếp hạng. Con số đó kém 0,23 điểm phần trăm so với mức 2,5% mà Microsoft tuyên bố, và chậm hơn khoảng bốn lần để chốt kết quả — sự khác biệt giữa một phụ đề theo kịp và một phụ đề bị tụt lại.

• Muse Voice Transcribe — 3,06% ở 0,16 giây, theo Artificial Analysis. Đối thủ gần nhất về độ trễ: chậm hơn khoảng 30 mili giây, và kém hơn 0,5 điểm về độ chính xác so với tuyên bố của Microsoft.

• ElevenLabs Scribe v2 Realtime — 3,59% trong 0,14 giây, theo Artificial Analysis. Gần như ngang bằng về tốc độ, nhưng kém hơn một điểm về độ chính xác.

• Gemini 3.5 Transcribe Live — WER trực tuyến 4,00% ở 0,40 giây, con số mà Artificial Analysis công bố và Google trích dẫn cho mô hình Live API của chính mình. Đó là khoảng cách 1,5 điểm, và đây chính là phép so sánh mà bản phát hành này nhắm tới.

Cột first-partial là chỗ tuyên bố ít giống phần còn lại của bảng nhất. Trên cùng tracker đó, các first partial của Grok Voice Transcribe 2.0 ở mức 3,36% và của Gemini 3.5 Transcribe Live ở mức 5,77% — lẽ ra partial phải tệ hơn bản ghi cuối cùng, thường kém hơn một điểm hoặc hơn, vì mô hình đang chốt trước khi câu kết thúc. Một first partial khớp với con số cuối cùng mới là điểm thực sự bất thường trong màn ra mắt của Microsoft, và đó là phần mà dữ liệu của chính tracker chưa thể xác nhận. Hãy trích dẫn nó như một tuyên bố cho đến khi có một hàng dữ liệu.

Điều cần nói thẳng là 0,13 giây và 0,16 giây là cùng một trải nghiệm sản phẩm đối với một người đọc phụ đề, và mức 2,5% so với 2,73% hiện đang dẫn đầu bảng xếp hạng chỉ là khoảng 2 lỗi trên 1.000 từ. Một lợi thế cỡ đó là thật nhưng nhỏ, và liệu đó có phải là lợi thế mà bất kỳ ai cũng cảm nhận được hay không còn phụ thuộc vào khối lượng công việc. Nơi nó thực sự gây hại là phần đuôi: một luồng tổng đài chạy tám giờ mỗi ngày ở mức 2,73% so với 2,5% là hàng chục nghìn từ sai tăng thêm mỗi năm, và các lỗi từ trong bản chép lời không phân bố đều — chúng tập trung đúng vào những danh từ riêng và con số khiến bản chép lời trở nên hữu ích.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

$9.00 cho 1.000 phút mua được gì

Truyền phát tốn kém hơn xử lý theo lô, và Microsoft đã định giá nó ở mức cao nhất của phân khúc thời gian thực thay vì thấp hơn. MAI-Transcribe-2-Streaming có giá niêm yết $0,54 mỗi giờ âm thanh, tương đương $9,00 cho mỗi 1.000 phút âm thanh truyền phát, được mô tả là mức giá giới thiệu áp dụng đến hết năm nay. Để so sánh, MAI-Transcribe-2 xử lý theo lô có giá $0,10 mỗi giờ âm thanh — $1,67 cho mỗi 1.000 phút — như vậy phiên âm thời gian thực tốn khoảng 5,4 lần mức giá dựa trên tệp tin cho cùng một dòng sản phẩm nền tảng và cao hơn 0,5 điểm về tỷ lệ lỗi từ. Đó không phải là mức tăng giá mà Microsoft đang che giấu; đó là cái giá trung thực của một kết nối liên tục và một bản phiên âm từng phần phải chính xác trước khi câu kết thúc.

So với phần còn lại của phân khúc streaming, bức tranh khá trái chiều. MAI-Transcribe-2-Streaming ngang bằng với Gemini 3.5 Transcribe Live ở mức khoảng 9 USD/1.000 phút — chính xác hơn, cùng mức giá. Nó cao hơn ElevenLabs Scribe v2 Realtime và Deepgram Flux ở khoảng 6,50 USD/1.000 phút, cao hơn Cartesia Ink-2 ở khoảng 4 USD, và cao gấp khoảng ba lần Muse Voice Transcribe ở khoảng 3 USD. Vậy màn ra mắt là một nước đi về độ chính xác và độ trễ với mức giá ngang bằng, chứ không phải cuộc chiến giá; các đội vốn đã chạy mô hình streaming rẻ hơn sẽ phải đánh đổi tiền để lấy điểm WER.

Sự đánh đổi đó đáng được gọi tên cho thật chính xác, bởi vì đó chính là sự đánh đổi mà bản phát hành theo lô đã đảo ngược. Vào tháng 9, Microsoft đã khiến độ chính xác trở nên rẻ. Đến tháng 10, họ khiến độ chính xác theo thời gian thực có mức giá ngang bằng với mức giá của tất cả những nhà cung cấp khác. Nếu pipeline của bạn chỉ cần bản ghi văn bản vào một lúc nào đó sau cùng, thì ngày 1 tháng 10 không thay đổi gì trong hóa đơn của bạn. Còn nếu bạn cần chúng ngay trong lúc cuộc gọi vẫn đang diễn ra, thì phép tính vừa chuyển hẳn sang chất lượng.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Xây dựng dựa trên một bản chép lời là nửa còn lại của quyết định đó, và đó là nơi một lớp đa mô hình chứng minh được giá trị của mình. Một bản chép lời thời gian thực hiếm khi là điểm cuối của pipeline — nó được tóm tắt, chấm điểm, tìm kiếm, định tuyến và chuyển cấp, và những bước đó cần các mô hình khác nhau với chi phí khác nhau. OrcaRouter tồn tại cho lớp đó: một API xuyên suốt hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, chuyển đổi dự phòng tự động, và một DSL định tuyến có thể gửi bản chép lời trực tiếp đến một mô hình để sàng lọc tuân thủ và một mô hình khác để ghi chú cuộc họp mà không cần tích hợp thứ hai. Bản thân MAI-Transcribe-2-Streaming không nằm trong danh sách đó — nó được cung cấp qua ngăn xếp giọng nói của chính Microsoft — nhưng bản chép lời dạng luồng mà nó tạo ra lại đúng là loại đầu vào khối lượng lớn, nhạy cảm với độ trễ, thứ lập luận cho việc giữ lớp phía trên nó không phụ thuộc mô hình.

Điều gì chưa được chứng minh

Ba điều thực sự vẫn còn bỏ ngỏ. Thứ nhất, phân tách người nói (diarization): mô hình batch gộp việc gán người nói mà không công bố tỷ lệ lỗi phân tách người nói, còn tài liệu streaming của Microsoft hoàn toàn không đưa ra tuyên bố nào về phân tách người nói — với một mô hình thời gian thực phục vụ hỗ trợ tác nhân trực tiếp hoặc phụ đề, việc ai nói gì thường là tính năng quan trọng hơn WER thô. Thứ hai, phần phân tách đa ngôn ngữ: 60 ngôn ngữ với tự động phát hiện ngôn ngữ liên tục là một tuyên bố rộng, và độ trễ theo từng ngôn ngữ của mô hình streaming có thể biến động lớn hơn nhiều so với mô hình batch tương ứng, vì chất lượng bản ghi từng phần phụ thuộc vào tốc độ mô hình chốt ngôn ngữ. Microsoft chưa công bố bảng streaming theo từng ngôn ngữ nào. Thứ ba, WER streaming được đo trên âm thanh chuẩn sạch; chế độ lỗi gây hại cho triển khai thực tế là luồng trường xa nhiễu, và không có so sánh streaming trường xa độc lập nào vào ngày ra mắt.

Nơi nó rời khỏi ngăn xếp của bạn

Điều thú vị về lần ra mắt này không phải là việc Microsoft có bản chép lời streaming chính xác nhất. Mà là nhịp độ: batch vào tháng 9, streaming vào tháng 10, trong cùng một dòng sản phẩm, trên cùng một bề mặt tài liệu, với cấu trúc giá hiện trải từ $1,67 đến $9,00 cho mỗi 1.000 phút cho cùng một năng lực nền tảng. Điều đó lần đầu tiên mang lại cho các đội một lựa chọn thực sự — chỉ trả tiền cho thời gian thực ở nơi thời gian thực thực sự quan trọng, và batch mọi thứ khác — nhưng nó cũng có nghĩa là lớp chép lời giờ đây là thứ bạn tinh chỉnh theo từng workload thay vì chuẩn hóa một lần.

Đọc tuyên bố trên tiêu đề theo nghĩa đen, nó vẫn đứng vững như một tuyên bố của nhà cung cấp: Microsoft nói rằng MAI-Transcribe-2-Streaming đứng đầu ở cả độ chính xác bản ghi cuối cùng lẫn bản ghi một phần đầu tiên, và rằng nó nằm trên đường biên Pareto. Những dấu hoa thị nằm ở chỗ: bảng theo dõi vẫn chưa vẽ mô hình lên, khoảng cách dẫn đầu mà nó tuyên bố so với mô hình đang dẫn đầu hiện tại nhỏ đến mức có thể biến mất khi chạy lại, lợi thế về giá bằng không, và câu chuyện về diarization vẫn chưa được kể. Đó mới là những điều cần để mắt tới, chứ không phải vương miện.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày