
MAI-Transcribe-2-Streaming so với MAI-Transcribe-2: Trả gấp 5,4 lần để có định thời theo từng từ
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 221 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
MAI-Transcribe-2-Streaming và MAI-Transcribe-2 là cùng một họ mô hình được chia thành hai bậc giá, và sự phân chia này đủ rõ ràng để lên kế hoạch dựa trên đó. MAI-Transcribe-2 ra mắt ngày 3 tháng 9 năm 2026 dưới dạng mô hình batch: tỷ lệ lỗi từ 2,0% trên bảng không streaming của Artificial Analysis, nhanh gấp khoảng 411 lần so với thời gian thực, và 0,10 đô la mỗi giờ âm thanh — khoảng 1,67 đô la cho mỗi 1.000 phút. MAI-Transcribe-2-Streaming ra mắt ngày 1 tháng 10 năm 2026 dưới dạng biến thể thời gian thực: tỷ lệ lỗi từ streaming được công bố là 2,5% với 0,13 giây để có bản chép lời cuối cùng, điều mà Microsoft mô tả là lần đầu tiên về độ chính xác trên cả bản chép lời cuối cùng lẫn bản chép lời một phần, được đo theo phương pháp streaming của Artificial Analysis thay vì chưa được vẽ thành một dòng trên bảng của công cụ theo dõi. 0,54 đô la mỗi giờ âm thanh — khoảng 9,00 đô la cho mỗi 1.000 phút. Vẫn 60 ngôn ngữ, vẫn phân phối chỉ qua API, không công bố trọng số. Streaming có chi phí gấp 5,4 lần mức giá batch và, theo chính số liệu của Microsoft, phải trả giá bằng 0,5 điểm độ chính xác. Đó là một món hời hay một khoản thuế phụ thuộc hoàn toàn vào một câu hỏi: có thứ gì trong pipeline của bạn cần bản chép lời trước khi câu kết thúc không?
Vì hai mô hình đến từ cùng một nhà cung cấp và cùng một bề mặt tài liệu, nên việc so sánh sạch sẽ đến bất thường — không phải đoán xem tính năng có tương đương không, không có tình trạng lệch phiên bản benchmark, không có kiểu “số liệu của họ so với số liệu của chúng ta”. Đó là một nhà cung cấp duy nhất định giá hai tốc độ của cùng một năng lực, và phần việc thú vị là tìm ra gói rẻ thực sự bao phủ những khối lượng công việc nào.
Gia đình, xếp thành hai hàng.
• MAI-Transcribe-2 — theo lô, âm thanh ghi sẵn, phát hành ngày 3 tháng 9 năm 2026. AA-WER 2,0%, đứng thứ hai trên bảng xếp hạng không truyền trực tuyến của Artificial Analysis. Nhanh khoảng 411 lần so với thời gian thực, cũng đứng thứ hai. 0,10 USD mỗi giờ âm thanh, khoảng 1,67 USD mỗi 1.000 phút, là ưu đãi có thời hạn đến cuối năm và chưa công bố giá tiêu chuẩn. Đi kèm tính năng phân tách người nói và trả về dấu thời gian ở cấp độ từ. 60 ngôn ngữ với nhận dạng ngôn ngữ tự động.
• MAI-Transcribe-2-Streaming — phiên âm liên tục kiểu WebSocket, thời gian thực, phát hành ngày 1 tháng 10 năm 2026. Microsoft báo cáo WER của bản ghi cuối cùng là 2,5% ở 0,13 giây sau khi kết thúc nói, và cũng 2,5% ở partial đầu tiên tại 0,12 giây, điều mà hãng mô tả là đầu tiên về độ chính xác trên cả hai — một tuyên bố của nhà cung cấp được đo theo phương pháp streaming của Artificial Analysis, mặc dù tính đến thời điểm soạn thảo, bảng xếp hạng của chính tracker (37 mô hình) vẫn chưa đưa mô hình này lên, và mô hình dẫn đầu hiện tại của nó là Grok Voice Transcribe 2.0 với 2,73% và 0,49 giây. 0,54 đô la mỗi giờ âm thanh, khoảng 9,00 đô la mỗi 1.000 phút, giá giới thiệu đến hết năm. 60 ngôn ngữ với khả năng tự động phát hiện ngôn ngữ liên tục. Không có tuyên bố diarization nào được công bố, không có tuyên bố dấu thời gian theo từ nào được công bố.
Sự bất đối xứng duy nhất không liên quan đến tốc độ hay giá cả là năng lực: tính năng tách người nói và mốc thời gian từng từ của mô hình batch là những tính năng đã được ghi trong tài liệu, còn của mô hình streaming thì không. Điều đó quan trọng hơn khoảng cách độ chính xác 0,5 điểm, và đó là lý do nhiều đội ngũ rốt cuộc sẽ chạy cả hai.

5,4× thực sự mang lại những gì
Ở mức 1,67 USD cho 1.000 phút, chuyển lời nói thành văn bản theo lô ở bậc độ chính xác này gần như miễn phí xét ở mức cận biên. Ở mức 9,00 USD cho 1.000 phút, truyền phát trực tuyến là một khoản chi phí thực sự — đại khái bằng chi phí chuyển cùng đoạn âm thanh đó năm lần, cộng thêm nửa điểm độ chính xác. Vậy nên câu hỏi không phải là liệu thời gian thực có đáng giá hơn hay không; mà là những phút cụ thể nào cần đến nó.
Những khối lượng công việc mà ở đó điều này rõ ràng đúng là: phụ đề trực tiếp mà một người đọc trong khi diễn giả đang nói, nơi 0,13 giây so với kết thúc tệp chính là toàn bộ sản phẩm; hỗ trợ nhân viên tổng đài theo thời gian thực và chấm điểm tuân thủ, nơi một can thiệp đến sau khi cuộc gọi đã kết thúc là vô giá trị; và các ứng dụng thoại tương tác, nơi một lượt không thể hoàn tất cho đến khi bản phiên âm hoàn tất. Trong cả ba trường hợp, mô hình theo lô không phải là một lựa chọn rẻ hơn, mà là một lựa chọn không thể dùng — không có mức giá nào mà ở đó phiên âm sau khi sự việc đã xảy ra lại trở thành thời gian thực.
Các workload mà nó rõ ràng không phù hợp: ghi âm cuộc họp và cuộc gọi được xử lý sau khi kết thúc, kho lưu trữ media, QA hàng loạt của contact-center, rà soát tuân thủ các cuộc gọi đã hoàn tất, tạo phụ đề cho podcast và video. Đây chính xác là những pipeline mà mô hình batch với tốc độ 411× thời gian thực và mức giá $1.67 được xây dựng để thắng, và việc trả gấp 5.4× chỉ để cắt bớt vài trăm mili-giây khỏi một bản ghi mà không ai đọc cho đến tận ngày mai là một sự lãng phí rõ ràng. Thêm các tính năng diarization và word-timestamp — mô hình batch có chúng được ghi trong tài liệu, mô hình streaming thì không — và trường hợp xử lý post-hoc càng mạnh hơn, chứ không hề yếu đi.
Điểm trung gian thú vị là nơi hai cách tiếp cận thực sự bổ trợ cho nhau: chạy streaming cho bề mặt trực tiếp và batch cho bản ghi. Một cuộc gọi hỗ trợ được phiên âm theo thời gian thực để điều khiển bảng hỗ trợ tổng đài viên, rồi được phiên âm lại theo lô qua đêm để tạo bản phiên âm lưu trữ có phân tách người nói và dấu thời gian, sẽ tốn thêm một khoản phụ phí nhỏ so với chỉ dùng batch và đạt được cả hai hành vi. Mô hình đó chỉ trở nên khả thi vào tháng 9, và bản phát hành tháng 10 chính là thứ hoàn thiện nó.
Nơi cấu trúc hai bộ phận thể hiện
Có hai điều về họ này đáng để lưu ý, vì chúng mang tính cấu trúc chứ không phải là ngẫu nhiên.
Đầu tiên, thứ bậc độ chính xác bị đảo ngược so với kiểu thông thường. Các mô hình streaming thường phải chịu một khoản đánh đổi độ chính xác đáng kể để có đầu ra thời gian thực; ở đây khoản đánh đổi chỉ là 0,5 điểm, từ 2,0% trên bảng batch xuống mức 2,5% được tuyên bố trên bảng streaming. Microsoft đã có một mô hình thời gian thực chỉ cách mô hình chủ lực batch của mình nửa điểm theo chính các con số của họ, và nếu điều đó đứng vững thì đây mới là thành tựu kỹ thuật thực sự của bản phát hành tháng Mười — không phải vị trí dẫn đầu bảng xếp hạng, thứ mà một lần chạy lại tốt có thể làm thay đổi và thứ mà công cụ theo dõi vẫn chưa xác nhận.
Thứ hai, cách định giá cũng đi ngược mô hình thông thường. Các nhà cung cấp thường giảm giá cho bậc có khối lượng cao hơn; Microsoft định giá streaming cao gấp 5,4 lần batch và để cả hai ở mức giá giới thiệu cùng hết hạn tại một thời điểm. Điều đó ít giống một mức phí streaming có chủ đích mà giống hai lần ra mắt riêng biệt, mỗi lần đều mang ưu đãi ra mắt, không có mức giá chuẩn nào được công bố cho cả hai. Các nhóm đang lập ngân sách cho năm 2027 nên coi cả hai con số là tạm thời — mức 1,67 đô la và 9,00 đô la đều được ghi là giá có thời hạn, và không mức nào trong hai mức đó có giá kế nhiệm được công bố.

Điều gì chưa được chứng minh
Các câu hỏi mở về mô hình batch từ tháng Chín vẫn chưa có lời giải đáp: không có tỷ lệ lỗi phân tách người nói (diarization error rate) nào được công bố, không có phân tích theo từng ngôn ngữ đứng sau tuyên bố 60 ngôn ngữ, và một mức giá khuyến mãi mà không hề nêu tên sản phẩm kế nhiệm. Mô hình streaming bổ sung thêm một câu hỏi nữa, đặc thù cho công việc thời gian thực — WER của streaming được đo trên âm thanh sạch, còn chất lượng bản ghi từng phần trong một luồng far-field nhiều nhiễu lại chính là kiểu thất bại quan trọng nhất khi triển khai và cũng ít được tài liệu ra mắt đề cập đến nhất. Nó cũng thừa hưởng sự sát nút của bảng xếp hạng streaming: ba vị trí dẫn đầu trên bảng 37 mô hình của tracker chỉ cách nhau trong khoảng một phần nhỏ của một điểm, nên "thứ nhất" là một trạng thái mà chỉ một lần chạy lại là có thể thay đổi — và vị trí thứ nhất của Microsoft là một tuyên bố chứ không phải một dòng trên bảng.
Tuy nhiên, câu hỏi ở cấp độ dòng sản phẩm mới là điều đáng để mắt tới. Microsoft hiện bán cùng một năng lực ở hai mức giá chênh nhau năm lần, trong đó hạng đắt tiền thiếu hai tính năng mà hạng rẻ tiền có ghi trong tài liệu. Nếu tính năng phân tách người nói và mốc thời gian theo từ xuất hiện trên SKU truyền phát, khoảng cách sẽ thu hẹp thành đánh đổi thuần túy giữa độ trễ và giá, một quyết định đơn giản hơn nhiều. Nếu không, cấu trúc hai phân khúc sẽ tồn tại vĩnh viễn và các kiến trúc nên được xây dựng xoay quanh nó.
Điều này đặt ngăn xếp phiên âm ở đâu

Kết quả thực tế là đến tháng 9, việc phiên âm đã không còn là một hạng mục đơn lẻ, và đến tháng 10, nó đã trở thành một quyết định định tuyến. Một pipeline từng chuẩn hóa trên một API giờ đây muốn streaming cho bề mặt trực tiếp, batch cho bản ghi, và một quy tắc để xác định âm thanh nào đi theo đường nào — và bản thân quy tắc đó lại là một bài toán định tuyến, một mức độ phức tạp kỳ lạ để rơi vào chu kỳ phát hành của một nhà cung cấp.
Nó giáng tác động mạnh nhất xuống phần nằm phía trên bản chép lời. Dù tầng nào tạo ra văn bản, văn bản đó sau đó cũng được tóm tắt, phân loại, che lọc thông tin và định tuyến, và những bước này chạy trên các mô hình ngôn ngữ với hồ sơ độ trễ và chi phí riêng — một bản chép lời trực tiếp cần một mô hình nhanh, rẻ; một bản lưu trữ có thể dùng một mô hình mạnh hơn. OrcaRouter bao trùm đúng lớp đó: một API xuyên suốt hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, tự động chuyển đổi dự phòng, và một DSL định tuyến chọn mô hình theo từng workload thay vì theo từng pipeline. Cả MAI-Transcribe-2-Streaming lẫn MAI-Transcribe-2 đều không có trong danh sách đó — cả hai đều được phục vụ thông qua ngăn xếp giọng nói của chính Microsoft — nhưng một lớp phiên âm hai nhánh là lập luận mạnh mẽ nhất từ trước đến nay cho việc giữ mọi thứ ở hạ nguồn của nó luôn khả chuyển.
Tóm tắt trung thực: streaming không phải là một MAI-Transcribe-2 tốt hơn, mà là một sản phẩm thứ hai với mức giá thứ hai. Hãy mua nó cho những phút thực sự cần thời gian thực, để phần còn lại ở gói rẻ, và dự trù cho việc cả hai mức giá sẽ được định giá lại khi giai đoạn giới thiệu kết thúc.
