Thẻ hero của bài viết hiển thị ‘MAI-Transcribe-2-Streaming so với MAI-Transcribe-2’ với huy hiệu ‘CÙNG DÒNG SẢN PHẨM · HAI BẬC GIÁ’ và phụ đề ‘Trả gấp 5,4 lần để có mốc thời gian theo từng từ’, được dựng thành hai thẻ tên mô hình ngăn cách bởi huy hiệu VS, với dải chip hiển thị $9.00 so với $1.67 mỗi 1.000 phút, tỷ lệ lỗi từ được công bố là 2,5% so với 2,0% đã được kiểm toán, 0,13 giây để có bản ghi cuối cùng so với khoảng 411 lần thời gian thực, và mốc thời gian cùng phân tách người nói chỉ có ở bậc batch, trên nền gradient từ trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

MAI-Transcribe-2-Streaming so với MAI-Transcribe-2: Trả gấp 5,4 lần để có định thời theo từng từ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MAI-Transcribe-2-Streaming và MAI-Transcribe-2 là cùng một họ mô hình được chia thành hai bậc giá, và sự phân chia này đủ rõ ràng để lên kế hoạch dựa trên đó. MAI-Transcribe-2 ra mắt ngày 3 tháng 9 năm 2026 dưới dạng mô hình batch: tỷ lệ lỗi từ 2,0% trên bảng không streaming của Artificial Analysis, nhanh gấp khoảng 411 lần so với thời gian thực, và 0,10 đô la mỗi giờ âm thanh — khoảng 1,67 đô la cho mỗi 1.000 phút. MAI-Transcribe-2-Streaming ra mắt ngày 1 tháng 10 năm 2026 dưới dạng biến thể thời gian thực: tỷ lệ lỗi từ streaming được công bố là 2,5% với 0,13 giây để có bản chép lời cuối cùng, điều mà Microsoft mô tả là lần đầu tiên về độ chính xác trên cả bản chép lời cuối cùng lẫn bản chép lời một phần, được đo theo phương pháp streaming của Artificial Analysis thay vì chưa được vẽ thành một dòng trên bảng của công cụ theo dõi. 0,54 đô la mỗi giờ âm thanh — khoảng 9,00 đô la cho mỗi 1.000 phút. Vẫn 60 ngôn ngữ, vẫn phân phối chỉ qua API, không công bố trọng số. Streaming có chi phí gấp 5,4 lần mức giá batch và, theo chính số liệu của Microsoft, phải trả giá bằng 0,5 điểm độ chính xác. Đó là một món hời hay một khoản thuế phụ thuộc hoàn toàn vào một câu hỏi: có thứ gì trong pipeline của bạn cần bản chép lời trước khi câu kết thúc không?

Vì hai mô hình đến từ cùng một nhà cung cấp và cùng một bề mặt tài liệu, nên việc so sánh sạch sẽ đến bất thường — không phải đoán xem tính năng có tương đương không, không có tình trạng lệch phiên bản benchmark, không có kiểu “số liệu của họ so với số liệu của chúng ta”. Đó là một nhà cung cấp duy nhất định giá hai tốc độ của cùng một năng lực, và phần việc thú vị là tìm ra gói rẻ thực sự bao phủ những khối lượng công việc nào.

Gia đình, xếp thành hai hàng.

• MAI-Transcribe-2 — theo lô, âm thanh ghi sẵn, phát hành ngày 3 tháng 9 năm 2026. AA-WER 2,0%, đứng thứ hai trên bảng xếp hạng không truyền trực tuyến của Artificial Analysis. Nhanh khoảng 411 lần so với thời gian thực, cũng đứng thứ hai. 0,10 USD mỗi giờ âm thanh, khoảng 1,67 USD mỗi 1.000 phút, là ưu đãi có thời hạn đến cuối năm và chưa công bố giá tiêu chuẩn. Đi kèm tính năng phân tách người nói và trả về dấu thời gian ở cấp độ từ. 60 ngôn ngữ với nhận dạng ngôn ngữ tự động.

• MAI-Transcribe-2-Streaming — phiên âm liên tục kiểu WebSocket, thời gian thực, phát hành ngày 1 tháng 10 năm 2026. Microsoft báo cáo WER của bản ghi cuối cùng là 2,5% ở 0,13 giây sau khi kết thúc nói, và cũng 2,5% ở partial đầu tiên tại 0,12 giây, điều mà hãng mô tả là đầu tiên về độ chính xác trên cả hai — một tuyên bố của nhà cung cấp được đo theo phương pháp streaming của Artificial Analysis, mặc dù tính đến thời điểm soạn thảo, bảng xếp hạng của chính tracker (37 mô hình) vẫn chưa đưa mô hình này lên, và mô hình dẫn đầu hiện tại của nó là Grok Voice Transcribe 2.0 với 2,73% và 0,49 giây. 0,54 đô la mỗi giờ âm thanh, khoảng 9,00 đô la mỗi 1.000 phút, giá giới thiệu đến hết năm. 60 ngôn ngữ với khả năng tự động phát hiện ngôn ngữ liên tục. Không có tuyên bố diarization nào được công bố, không có tuyên bố dấu thời gian theo từ nào được công bố.

Sự bất đối xứng duy nhất không liên quan đến tốc độ hay giá cả là năng lực: tính năng tách người nói và mốc thời gian từng từ của mô hình batch là những tính năng đã được ghi trong tài liệu, còn của mô hình streaming thì không. Điều đó quan trọng hơn khoảng cách độ chính xác 0,5 điểm, và đó là lý do nhiều đội ngũ rốt cuộc sẽ chạy cả hai.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

5,4× thực sự mang lại những gì

Ở mức 1,67 USD cho 1.000 phút, chuyển lời nói thành văn bản theo lô ở bậc độ chính xác này gần như miễn phí xét ở mức cận biên. Ở mức 9,00 USD cho 1.000 phút, truyền phát trực tuyến là một khoản chi phí thực sự — đại khái bằng chi phí chuyển cùng đoạn âm thanh đó năm lần, cộng thêm nửa điểm độ chính xác. Vậy nên câu hỏi không phải là liệu thời gian thực có đáng giá hơn hay không; mà là những phút cụ thể nào cần đến nó.

Những khối lượng công việc mà ở đó điều này rõ ràng đúng là: phụ đề trực tiếp mà một người đọc trong khi diễn giả đang nói, nơi 0,13 giây so với kết thúc tệp chính là toàn bộ sản phẩm; hỗ trợ nhân viên tổng đài theo thời gian thực và chấm điểm tuân thủ, nơi một can thiệp đến sau khi cuộc gọi đã kết thúc là vô giá trị; và các ứng dụng thoại tương tác, nơi một lượt không thể hoàn tất cho đến khi bản phiên âm hoàn tất. Trong cả ba trường hợp, mô hình theo lô không phải là một lựa chọn rẻ hơn, mà là một lựa chọn không thể dùng — không có mức giá nào mà ở đó phiên âm sau khi sự việc đã xảy ra lại trở thành thời gian thực.

Các workload mà nó rõ ràng không phù hợp: ghi âm cuộc họp và cuộc gọi được xử lý sau khi kết thúc, kho lưu trữ media, QA hàng loạt của contact-center, rà soát tuân thủ các cuộc gọi đã hoàn tất, tạo phụ đề cho podcast và video. Đây chính xác là những pipeline mà mô hình batch với tốc độ 411× thời gian thực và mức giá $1.67 được xây dựng để thắng, và việc trả gấp 5.4× chỉ để cắt bớt vài trăm mili-giây khỏi một bản ghi mà không ai đọc cho đến tận ngày mai là một sự lãng phí rõ ràng. Thêm các tính năng diarization và word-timestamp — mô hình batch có chúng được ghi trong tài liệu, mô hình streaming thì không — và trường hợp xử lý post-hoc càng mạnh hơn, chứ không hề yếu đi.

Điểm trung gian thú vị là nơi hai cách tiếp cận thực sự bổ trợ cho nhau: chạy streaming cho bề mặt trực tiếp và batch cho bản ghi. Một cuộc gọi hỗ trợ được phiên âm theo thời gian thực để điều khiển bảng hỗ trợ tổng đài viên, rồi được phiên âm lại theo lô qua đêm để tạo bản phiên âm lưu trữ có phân tách người nói và dấu thời gian, sẽ tốn thêm một khoản phụ phí nhỏ so với chỉ dùng batch và đạt được cả hai hành vi. Mô hình đó chỉ trở nên khả thi vào tháng 9, và bản phát hành tháng 10 chính là thứ hoàn thiện nó.

Nơi cấu trúc hai bộ phận thể hiện

Có hai điều về họ này đáng để lưu ý, vì chúng mang tính cấu trúc chứ không phải là ngẫu nhiên.

Đầu tiên, thứ bậc độ chính xác bị đảo ngược so với kiểu thông thường. Các mô hình streaming thường phải chịu một khoản đánh đổi độ chính xác đáng kể để có đầu ra thời gian thực; ở đây khoản đánh đổi chỉ là 0,5 điểm, từ 2,0% trên bảng batch xuống mức 2,5% được tuyên bố trên bảng streaming. Microsoft đã có một mô hình thời gian thực chỉ cách mô hình chủ lực batch của mình nửa điểm theo chính các con số của họ, và nếu điều đó đứng vững thì đây mới là thành tựu kỹ thuật thực sự của bản phát hành tháng Mười — không phải vị trí dẫn đầu bảng xếp hạng, thứ mà một lần chạy lại tốt có thể làm thay đổi và thứ mà công cụ theo dõi vẫn chưa xác nhận.

Thứ hai, cách định giá cũng đi ngược mô hình thông thường. Các nhà cung cấp thường giảm giá cho bậc có khối lượng cao hơn; Microsoft định giá streaming cao gấp 5,4 lần batch và để cả hai ở mức giá giới thiệu cùng hết hạn tại một thời điểm. Điều đó ít giống một mức phí streaming có chủ đích mà giống hai lần ra mắt riêng biệt, mỗi lần đều mang ưu đãi ra mắt, không có mức giá chuẩn nào được công bố cho cả hai. Các nhóm đang lập ngân sách cho năm 2027 nên coi cả hai con số là tạm thời — mức 1,67 đô la và 9,00 đô la đều được ghi là giá có thời hạn, và không mức nào trong hai mức đó có giá kế nhiệm được công bố.

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

Điều gì chưa được chứng minh

Các câu hỏi mở về mô hình batch từ tháng Chín vẫn chưa có lời giải đáp: không có tỷ lệ lỗi phân tách người nói (diarization error rate) nào được công bố, không có phân tích theo từng ngôn ngữ đứng sau tuyên bố 60 ngôn ngữ, và một mức giá khuyến mãi mà không hề nêu tên sản phẩm kế nhiệm. Mô hình streaming bổ sung thêm một câu hỏi nữa, đặc thù cho công việc thời gian thực — WER của streaming được đo trên âm thanh sạch, còn chất lượng bản ghi từng phần trong một luồng far-field nhiều nhiễu lại chính là kiểu thất bại quan trọng nhất khi triển khai và cũng ít được tài liệu ra mắt đề cập đến nhất. Nó cũng thừa hưởng sự sát nút của bảng xếp hạng streaming: ba vị trí dẫn đầu trên bảng 37 mô hình của tracker chỉ cách nhau trong khoảng một phần nhỏ của một điểm, nên "thứ nhất" là một trạng thái mà chỉ một lần chạy lại là có thể thay đổi — và vị trí thứ nhất của Microsoft là một tuyên bố chứ không phải một dòng trên bảng.

Tuy nhiên, câu hỏi ở cấp độ dòng sản phẩm mới là điều đáng để mắt tới. Microsoft hiện bán cùng một năng lực ở hai mức giá chênh nhau năm lần, trong đó hạng đắt tiền thiếu hai tính năng mà hạng rẻ tiền có ghi trong tài liệu. Nếu tính năng phân tách người nói và mốc thời gian theo từ xuất hiện trên SKU truyền phát, khoảng cách sẽ thu hẹp thành đánh đổi thuần túy giữa độ trễ và giá, một quyết định đơn giản hơn nhiều. Nếu không, cấu trúc hai phân khúc sẽ tồn tại vĩnh viễn và các kiến trúc nên được xây dựng xoay quanh nó.

Điều này đặt ngăn xếp phiên âm ở đâu

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

Kết quả thực tế là đến tháng 9, việc phiên âm đã không còn là một hạng mục đơn lẻ, và đến tháng 10, nó đã trở thành một quyết định định tuyến. Một pipeline từng chuẩn hóa trên một API giờ đây muốn streaming cho bề mặt trực tiếp, batch cho bản ghi, và một quy tắc để xác định âm thanh nào đi theo đường nào — và bản thân quy tắc đó lại là một bài toán định tuyến, một mức độ phức tạp kỳ lạ để rơi vào chu kỳ phát hành của một nhà cung cấp.

Nó giáng tác động mạnh nhất xuống phần nằm phía trên bản chép lời. Dù tầng nào tạo ra văn bản, văn bản đó sau đó cũng được tóm tắt, phân loại, che lọc thông tin và định tuyến, và những bước này chạy trên các mô hình ngôn ngữ với hồ sơ độ trễ và chi phí riêng — một bản chép lời trực tiếp cần một mô hình nhanh, rẻ; một bản lưu trữ có thể dùng một mô hình mạnh hơn. OrcaRouter bao trùm đúng lớp đó: một API xuyên suốt hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, tự động chuyển đổi dự phòng, và một DSL định tuyến chọn mô hình theo từng workload thay vì theo từng pipeline. Cả MAI-Transcribe-2-Streaming lẫn MAI-Transcribe-2 đều không có trong danh sách đó — cả hai đều được phục vụ thông qua ngăn xếp giọng nói của chính Microsoft — nhưng một lớp phiên âm hai nhánh là lập luận mạnh mẽ nhất từ trước đến nay cho việc giữ mọi thứ ở hạ nguồn của nó luôn khả chuyển.

Tóm tắt trung thực: streaming không phải là một MAI-Transcribe-2 tốt hơn, mà là một sản phẩm thứ hai với mức giá thứ hai. Hãy mua nó cho những phút thực sự cần thời gian thực, để phần còn lại ở gói rẻ, và dự trù cho việc cả hai mức giá sẽ được định giá lại khi giai đoạn giới thiệu kết thúc.