Thẻ nổi bật của bài viết có dòng chữ 'MAI-Transcribe-2 Is Live' với huy hiệu 'NEWS · MICROSOFT AI' và phụ đề 'Nỗ lực của Microsoft với mức giá 0,10 đô la mỗi giờ nhằm chiếm lĩnh lĩnh vực chuyển giọng nói thành văn bản', kèm dải số liệu hiển thị AA-WER 2.0% (#2 theo Artificial Analysis), tốc độ ~411x thời gian thực (#2) và giá ra mắt 0,10 đô la mỗi giờ, trên nền gradient trắng-xanh với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

MAI-Transcribe-2 Ra Mắt: Microsoft Chào Giá 0,10 USD/giờ để Thống Trị Mảng Chuyển Giọng Nói Thành Văn Bản

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MAI-Transcribe-2 là mô hình mà Microsoft AI đặt cược sẽ đưa công nghệ chuyển giọng nói thành văn bản (speech-to-text) từ một tính năng cao cấp trở thành một hàng hóa phổ thông, và những con số được công bố kèm theo nó cũng được thiết kế để chứng minh cho luận điểm đó. Được phát hành dưới dạng bản xem trước công khai (public preview) vào ngày 3 tháng 9 năm 2026 trên Microsoft Foundry, MAI Playground và các API của chính Microsoft, MAI-Transcribe-2 là mô hình speech-to-text thứ ba của Microsoft trong vòng năm tháng — sau MAI-Transcribe-1 ra mắt hồi tháng 4 với giá $0.36 mỗi giờ âm thanh và MAI-Transcribe-1.5 hồi tháng 6 — đồng thời là mô hình đầu tiên vượt qua mọi đối thủ dịch vụ được quản lý (managed) mà nó nêu tên trên hai chỉ số mà các đội ngũ thực sự dựa vào khi chọn mua. Trên bảng xếp hạng tỷ lệ lỗi từ (word error rate) phiên bản non-streaming của Artificial Analysis, mô hình đứng thứ hai với AA-WER 2.0%, đồng thời đạt tốc độ xấp xỉ 411× real time — cũng đứng thứ hai. Hai kết quả này cùng đưa nó vào đường biên Pareto về độ chính xác và tốc độ: trên bảng xếp hạng đó, không mô hình nào vừa chính xác hơn lại vừa nhanh hơn. Giá ra mắt của nó thấp hơn khoảng 72% so với giá của phiên bản tiền nhiệm.

Tiêu đề “mô hình nhận dạng giọng nói nhanh nhất, chính xác nhất và rẻ nhất thế giới” là của chính Microsoft cho bản phát hành này, và nó cần được đọc kèm với các dấu hoa thị chú thích của tài liệu gốc. Đây là câu chuyện ra mắt như thực tế đã diễn ra, trong đó các tuyên bố của nhà cung cấp được gắn nhãn rõ ràng và những phần vẫn còn cần được kiểm chứng được tách riêng ra.

Những gì Microsoft thực sự đã phát hành

MAI-Transcribe-2 là mô hình phiên âm dạng hàng loạt, xử lý bản ghi có sẵn, được thiết kế chuyên cho nội dung âm thanh dài — cuộc họp, cuộc gọi, kho lưu trữ truyền thông, bản ghi trung tâm liên hệ. Microsoft định vị sản phẩm này cho chính xác những khối lượng công việc mà thông lượng và chi phí mỗi phút là yếu tố quyết định. Mô hình phiên âm 60 ngôn ngữ với khả năng tự động nhận dạng ngôn ngữ, bao gồm tính năng tách người nói giúp gán từ ngữ cho đúng người, trả về dấu thời gian ở cấp độ từ, và hỗ trợ điều chỉnh từ khóa cho tên riêng, từ viết tắt và thuật ngữ chuyên ngành. Hai kiểu phiên âm có thể cấu hình bao phủ phân chia thông thường: "nguyên văn" — giữ lại từ đệm và khởi đầu sai để phục vụ bản ghi đạt chuẩn tuân thủ, và "sạch" — loại bỏ các yếu tố trôi chảy để phục vụ phụ đề và ghi chú. Microsoft cũng nêu bật khả năng chuyển mã trong lời nói đa ngôn ngữ pha trộn như tiếng Hin-dị-Anh (Hinglish) và tiếng Tây Ban Nha-Anh (Spanglish), cùng độ ổn định với âm thanh thực tế nhiều tạp âm.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

Câu chuyện về khả năng tiếp cận cũng quan trọng không kém danh sách tính năng. Microsoft không giới hạn sản phẩm này sau ngăn xếp xử lý giọng nói doanh nghiệp của mình: mô hình có thể dùng thử ngay hôm nay từ MAI Playground và được phục vụ qua Microsoft Foundry trong bản xem trước công khai, với tài liệu Foundry nằm trong dịch vụ Azure AI Speech. Đây là một lựa chọn phân phối có chủ đích — đặt mô hình tiên tiến ở nơi nhà phát triển có thể truy cập chỉ bằng một khóa API, thay vì nơi phải chờ chu kỳ bán hàng doanh nghiệp phê duyệt trước. Microsoft chưa công bố trọng số mô hình và không có gì trong tài liệu ra mắt cho thấy họ sẽ làm vậy.

Đọc tiêu đề theo nghĩa đen

"Nhanh nhất, chính xác nhất và rẻ nhất thế giới" là ba tuyên bố có mức độ mạnh yếu khác nhau, và chính bài đăng ra mắt đã âm thầm hạ cấp hai trong số đó. Phiên bản trung thực của mỗi tuyên bố:

• Độ chính xác — Trên bảng xếp hạng của Artificial Analysis, MAI-Transcribe-2 đứng thứ hai với AA-WER 2.0%, chứ không phải thứ nhất; bản thân nội dung bài viết của Microsoft cũng nói là thứ hai. Cách diễn đạt "chính xác nhất" chỉ còn đúng nếu bạn hiểu nó là "trong số các managed batch API được theo dõi ở mức này," và ngay cả khi đó thì đây cũng chỉ là tuyên bố về một mô hình mới ra mắt bốn ngày, chứ chưa phải một ngôi vị đã được xác lập. Microsoft còn báo cáo riêng rằng mô hình này đứng đầu trên benchmark đa ngôn ngữ FLEURS với WER trung bình 5.2% trên 60 ngôn ngữ — con số này đến từ bài đăng ra mắt của Microsoft, chưa được kiểm chứng độc lập lại theo từng ngôn ngữ.

• Tốc độ — Theo Artificial Analysis, MAI-Transcribe-2 chạy nhanh gấp khoảng 411 lần thời gian thực, đứng thứ hai trên bảng xếp hạng đó. Điều gây tò mò là thông cáo của chính Microsoft không bao giờ công bố con số tuyệt đối; thay vào đó, họ mở đầu bằng các tỷ lệ tương đối dễ hiểu hơn — "xử lý nhanh hơn tới 10 lần so với các đối thủ hàng đầu, đặc biệt là với âm thanh dài," và cụ thể là nhanh hơn 10 lần so với GPT-Transcribe của OpenAI, {{1}}nhanh hơn 7 lần so với Scribe v2 của ElevenLabs và nhanh hơn 5 lần so với Gemini 3.5 Transcribe{{/1}}. Những tỷ lệ này là cách Microsoft trình bày cùng một bộ dữ liệu của Artificial Analysis, và các con số nền tảng mới thực sự quan trọng: {{2}}"Nhanh hơn 5 lần so với Gemini 3.5 Transcribe" nghe có vẻ là một khoảng cách khiêm tốn{{/2}} cho đến khi bạn quy đổi nó thành số phút tính toán trên mỗi giờ âm thanh.

• Rẻ nhất — Chỉ đúng trong hai phạm vi mà Microsoft nêu rõ. Mức giá $0,10 là một "ưu đãi có thời hạn đến cuối năm", và không có mức giá tiêu chuẩn sau khuyến mãi nào được công bố ở bất cứ đâu trong tài liệu ra mắt. Và nó là rẻ nhất trong số các API được quản lý có độ chính xác cao; một mô hình mã nguồn mở tự lưu trữ như Whisper Large v3 Turbo vẫn phiên âm với chi phí thực chất chỉ tương đương tiền điện. Lập luận hàng hóa là có thật — chỉ là hẹp hơn so với tiêu đề.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Những gì $1,67 cho mỗi 1.000 phút mua được

Được định giá 0,10 USD mỗi giờ âm thanh, MAI-Transcribe-2 tương đương khoảng 1,67 USD cho mỗi 1.000 phút âm thanh. Con số này thực sự có sức nặng khi đặt cạnh các API phiên âm được quản lý khác vốn cạnh tranh về độ chính xác. GPT-Transcribe niêm yết 4,50 USD mỗi 1.000 phút; gói bản ghi trước của Gemini 3.5 Transcribe quy ra khoảng 5 USD mỗi 1.000 phút theo mức định giá dựa trên token của Google; Scribe v2 của ElevenLabs niêm yết cao hơn nữa. Với 1.000 giờ âm thanh mỗi tháng — một khối lượng công việc đáng kể dù chưa phải quá lớn đối với trung tâm chăm sóc khách hàng hay lĩnh vực truyền thông — mức chênh lệch giữa MAI-Transcribe-2 ở giá ưu đãi sớm và GPT-Transcribe ở mức niêm yết vào khoảng 170 USD mỗi tháng, lặp lại đều đặn hàng tháng, trước khi tính đến bất kỳ khác biệt nào về độ chính xác. Đó chính là khoảng cách giá giúp phiên âm không còn là một khoản mục mà các đội ngũ phải tối ưu hóa, mà trở thành một khoản mục họ có thể bỏ qua.

Hai lưu ý cần được nhắc đến cùng lúc. Thứ nhất, giá khuyến mãi chỉ là một cuộc thử nghiệm định giá cho đến khi nó không còn là thử nghiệm nữa: những đội ngũ xây dựng sản phẩm dựa trên mức giá $0,10 nên hiểu rằng mức giá tiêu chuẩn không được công bố, và con số trung thực để lập ngân sách năm 2027 sẽ nằm đâu đó giữa mức ưu đãi ra mắt và bất kỳ mức giá nào Microsoft ấn định khi ưu đãi kết thúc. Thứ hai, “rẻ nhất ở phân khúc độ chính xác này” không nói lên điều gì về tổng chi phí sở hữu — mô hình này chỉ khả dụng qua API, nên phép so sánh thực sự có ý nghĩa với các đội ngũ có khối lượng sử dụng lớn là giữa $1,67 mỗi 1.000 phút và chi phí trọn gói để tự vận hành ngăn xếp open-weights của họ, chứ không chỉ so với các API khác.

Được nén gọn thành một bảng điểm, vị trí ra mắt trông như thế này — mọi con số bên dưới đều mang nhãn nguồn gốc được gắn kèm với nó trong phần thân bài phía trên.

A single-column scoreboard titled 'MAI-Transcribe-2 — the scoreboard' listing AA-WER 2.0% (#2 per Artificial Analysis), speed ~411x real time (#2), price $1.67 per 1,000 minutes early-bird through 2026, 60 languages with automatic language ID, bundled diarization with unpublished error rate, and no streaming SKU announced, with the OrcaRouter logo bottom right.

Điều gì chưa được chứng minh

Đối với tất cả tính cụ thể của các tuyên bố ra mắt, có ba điều thực sự còn bỏ ngỏ. Điều đầu tiên là phát trực tuyến: MAI-Transcribe-2 là mô hình xử lý theo lô, câu chuyện về tốc độ của Microsoft liên quan đến thông lượng tệp, và chưa có SKU thời gian thực nào được công bố hoặc trình diễn — con số "411×" không phải là số liệu độ trễ cho phiên âm trực tiếp. Điều thứ hai là chất lượng phân tách người nói: gán nhận diện người nói được gộp chung, nhưng Microsoft không công bố tỷ lệ lỗi phân tách người nói, và đó là tính năng có khả năng cao nhất sẽ trông tệ hơn trong các bài kiểm tra độc lập so với WER. Điều thứ ba là phân tích chi tiết đa ngôn ngữ: một giá trị trung bình FLEURS cho 60 ngôn ngữ duy nhất có thể che giấu sự chênh lệch lớn giữa từng ngôn ngữ, và Microsoft chưa công bố bảng số liệu theo từng ngôn ngữ. Mỗi điều là một lý do khiến câu chuyện vẫn chưa kết thúc vào ngày thứ tư.

Nơi nó rời khỏi ngăn xếp phiên âm của bạn

Không điều nào trong số này đòi hỏi phải chọn MAI-Transcribe-2 ngay hôm nay, và đó chính là lý do vì sao mức giá này xứng đáng được các nhóm chưa có nhu cầu tìm nhà cung cấp mới quan tâm. Chuyển giọng nói thành văn bản hiếm khi là điểm cuối của một quy trình — các bản ghi âm được tóm tắt, xử lý hành động, tìm kiếm và định tuyến, và tầng hạ nguồn đó chính là nơi một thiết lập đa mô hình chứng tỏ giá trị của nó. Một nền tảng như OrcaRouter tồn tại cho nửa sau của hệ thống: một API dùng chung cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được áp dụng thẳng với mức phụ phí 0%, tự động chuyển đổi dự phòng và một DSL định tuyến cho phép một bản ghi âm đưa vào các mô hình khác nhau theo từng tác vụ — biên bản cuộc họp đến một bộ tóm tắt, rà soát tuân thủ đến một bộ khác — mà không cần đến lần tích hợp thứ hai. Bản thân MAI-Transcribe-2 hiện không nằm trong danh sách đó; nó hiện diện trên API của chính Microsoft và các nền tảng bên thứ ba mà Microsoft liệt kê. Nhưng mức giá phổ cập mà nó vừa thiết lập chính là luận điểm thuyết phục nhất cho đến nay để xây dựng phần phía trên bản ghi âm theo hướng không phụ thuộc vào mô hình.

Giá ra mắt chính là manh mối tiết lộ. Microsoft không chỉ cố gắng thắng mảng nhận dạng giọng nói thành văn bản bằng tính năng — họ đang cố làm cho độ chính xác cao trở nên rẻ đến mức danh mục này không còn là một hạng mục chi phí riêng. MAI-Transcribe-2 xứng đáng với sự chú ý mà nó đang nhận được; chỉ cần đọc cụm từ "nhanh nhất, chính xác nhất và rẻ nhất thế giới" cùng với ba dấu hoa thị đính kèm: đứng thứ hai trên AA-WER, giá khuyến mãi đến hết năm, và một câu chuyện về streaming vẫn chưa được hé lộ.