Thẻ hero của bài viết hiển thị 'Grok Voice Transcribe 2.0 so với MAI Transcribe 2' với nhãn 'SO SÁNH MÔ HÌNH' và phụ đề 'Hai làn đường, không phải hai đối thủ', cùng các chip ghi 3,4% so với không có SKU phát trực tuyến, 2,29% so với 2,04% WER theo lô, 162x so với 333x thời gian thực và $1,67 cho mỗi 1.000 phút mỗi bên, trên nền chuyển sắc từ trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Grok Voice Transcribe 2.0 vs MAI Transcribe 2: Hai làn đường, không phải hai đối thủ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình này được phát hành cách nhau mười lăm ngày và có giá giống hệt nhau đến từng xu, và gần như chúng sẽ không bao giờ nằm trong cùng một quyết định thu mua. Grok Voice Transcribe 2.0, do SpaceXAI phát hành ngày 18 tháng 9 năm 2026, là mô hình bạn gọi khi âm thanh vẫn đang đến — nó truyền trực tuyến qua WebSocket, phát ra kết quả tạm thời khoảng mỗi 500 ms, và đứng đầu bảng AA-WER Streaming của Artificial Analysis với tỷ lệ lỗi từ 2,7% đối với bản chép lời cuối cùng và 3,4% đối với các kết quả từng phần đầu tiên. MAI-Transcribe-2, do Microsoft AI phát hành ngày 3 tháng 9 năm 2026, là mô hình bạn gọi khi âm thanh đã là một tệp — nó chỉ chạy theo lô, và trên bảng không truyền trực tuyến của Artificial Analysis, đây là mô hình được quản lý chính xác nhất được đo ở mức 2,04% AA-WER, vượt qua mức 2,29% của Grok Voice Transcribe 2.0 và nhanh hơn khoảng 2× về thông lượng. Cả hai đều niêm yết ở mức $0,10 mỗi giờ âm thanh, khoảng $1,67 mỗi 1.000 phút. Nếu yêu cầu của bạn là thời gian thực, không có gì để so sánh. Nếu yêu cầu của bạn là một tệp, thì có.

Ranh giới mà không nhà cung cấp nào sẽ vạch ra cho bạn.

Hỗ trợ streaming không phải là một tính năng bật/tắt. Grok Voice Transcribe 2.0 phục vụ cùng một mô hình qua REST cho các tệp đã ghi âm và qua `wss://api.x.ai/v1/stt` cho âm thanh trực tiếp, vì vậy độ chính xác bạn đo trên kho lưu trữ của mình cũng chính là độ chính xác bạn nhận được trong một cuộc gọi trực tiếp. MAI-Transcribe-2 hoàn toàn không có SKU streaming nào: các tài liệu ra mắt của Microsoft định vị rõ ràng mô hình này cho âm thanh dạng dài và theo lô, và mặc dù thẻ mô hình có liệt kê phụ đề thời gian thực trong số các tình huống ứng dụng của nó, con đường để đạt được điều đó là chia nhỏ âm thanh rồi đưa từng đoạn qua API theo lô — đó là một pipeline do bạn tự xây dựng và vận hành, chứ không phải một bảo đảm về độ trễ mà bạn mua được. Thông lượng được Microsoft nhấn mạnh, khoảng 411× thời gian thực, là một con số về tốc độ xử lý, không phải về thời gian phản hồi, và hai điều này liên tục bị nhầm lẫn trong các bài đưa tin về bản phát hành này.

Hệ quả thực tế: nếu bạn đang xây dựng các tác nhân thoại có khả năng luân phiên lượt nói, phụ đề trực tiếp, hoặc bất cứ thứ gì mà con người hay mô hình phản ứng với lời nói đang diễn ra, thì MAI-Transcribe-2 không phải là lựa chọn phù hợp, bất kể độ chính xác của nó tốt đến đâu. Nếu bạn đang phiên âm các cuộc họp sau khi đã diễn ra, bản ghi trung tâm liên hệ được xử lý qua đêm, kho lưu trữ phương tiện, hoặc hồ sơ tồn đọng về tuân thủ, thì truyền phát trực tiếp chỉ là gánh nặng vô ích và số liệu xử lý theo lô mới là toàn bộ câu chuyện.

Nơi MAI-Transcribe-2 thực sự dẫn đầu

Độ chính xác trên các tệp, trước tiên. Khoảng cách 2,04% so với 2,29% được đo trên cùng một bộ kiểm thử độc lập — AA-WER v2 của Artificial Analysis, với 50% AA-AgentTalk và 25% mỗi bộ VoxPopuli và Earnings22 — điều này khiến nó trở thành dữ kiện rõ ràng nhất trong so sánh này. Đó là mức chênh lệch 0,25 điểm, tức khoảng ít hơn hai lỗi rưỡi trên mỗi nghìn từ. Việc điều đó có quan trọng hay không phụ thuộc vào việc bạn dùng bản ghi để làm gì; với một kho lưu trữ có thể tìm kiếm thì không, còn với hồ sơ pháp lý hoặc y tế thì có thể.

Về thông lượng, điểm thứ hai, và vượt xa hơn cả khoảng cách về độ chính xác: 333× thời gian thực so với 162× của Grok Voice Transcribe 2.0. Cả hai con số đều là kết quả đo của Artificial Analysis về số giây âm thanh đầu vào được chuyển thành văn bản mỗi giây, chứ không phải tuyên bố của nhà cung cấp. Với tốc độ đó, một kho lưu trữ nghìn giờ sẽ hoàn tất trong khoảng ba giờ tính toán trên mô hình Microsoft và khoảng sáu giờ trên mô hình SpaceXAI. Đối với một lần di chuyển dữ liệu chỉ diễn ra một lần thì điều đó không đáng kể; nhưng với một pipeline nạp dữ liệu liên tục, việc giảm một nửa thời gian thực thi là một khác biệt thực sự về năng lực.

Thứ ba là độ phủ ngôn ngữ. Microsoft nêu cụ thể 60 ngôn ngữ với khả năng nhận diện tự động, chuyển mã trong cùng một bản ghi, và tỷ lệ lỗi từ trung bình 5,2% trên các ngôn ngữ đó theo FLEURS — một con số do nhà cung cấp báo cáo, chưa được tái lập độc lập, nhưng ít nhất nó mô tả trường hợp đa ngôn ngữ trên một danh sách ngôn ngữ được nêu rõ. SpaceXAI ghi nhận hàng chục ngôn ngữ với khả năng chuyển đổi ngay giữa bản ghi và định dạng dạng viết trên 25 ngôn ngữ. Nếu âm thanh của bạn nằm ngoài nhóm tiếng Anh và các tiếng châu Âu chính vốn được bao phủ tốt, thì con số FLEURS cung cấp nhiều thông tin hơn một bảng xếp hạng vốn nghiêng về tiếng Anh và nặng về hội thoại tổng đài viên.

Hai điểm khác biệt nữa có ý nghĩa về mặt vận hành. MAI-Transcribe-2 cung cấp các kiểu phiên âm có thể cấu hình — nguyên văn, giữ lại những từ ngập ngừng, so với sạch, loại bỏ chúng — trong khi Grok Voice Transcribe 2.0 xử lý cùng vấn đề bằng cờ loại bỏ từ đệm. Và mô hình của Microsoft đang ở bản xem trước công khai trên Microsoft Foundry, nghĩa là không có SLA và vẫn có khuyến nghị thường trực chống lại việc sử dụng trong sản xuất cho đến khi nó chuyển sang GA; mô hình của SpaceXAI đã có sẵn rộng rãi với giới hạn tốc độ được công bố là 10 yêu cầu mỗi giây và 100 phiên truyền trực tuyến đồng thời mỗi nhóm.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

Nơi Grok Voice Transcribe 2.0 thực sự vượt trội

• Truyền phát theo thời gian thực — một điểm cuối WebSocket với kết quả tạm thời cứ mỗi ~500 ms, so với chỉ chạy theo lô không có SKU thời gian thực nào được công bố

• Độ chính xác của bản chép lời từng phần đầu tiên — 3,4% WER ở 0,49 giây trên AA-WER Streaming, một hạng mục mà MAI-Transcribe-2 không tham gia cạnh tranh

• Độ chính xác theo lô trên âm thanh agent-talk — tổng thể là 2,29%, nhưng trên tập con AA-AgentTalk của bảng không streaming, thứ tự xếp hạng sít sao hơn so với những gì tiêu đề gợi ý, và trên tổ hợp nặng về agent của bảng streaming, Grok dẫn đầu hoàn toàn

• Hạ tầng kết nối cho voice agent — tính năng phát hiện kết thúc lượt nói của Smart Turn và loại bỏ từ đệm được đóng gói sẵn trong model, trong khi MAI-Transcribe-2 giao logic lượt nói cho bên gọi tự xử lý

• Âm thanh đa kênh — tối đa 8 kênh độc lập được phiên âm trong một lượt, điều này rất quan trọng với bản ghi âm stereo hoặc cuộc gọi nhiều nhánh

• Độ tin cậy ở cấp độ từ — dấu thời gian mang điểm tin cậy cho từng từ, nhờ đó các đoạn có độ tin cậy thấp có thể được đánh dấu thay vì được tin cậy như nhau

• Điều khoản về tính khả dụng — được cung cấp rộng rãi với các giới hạn đồng thời được công bố, so với bản xem trước công khai không có SLA

• Độ bền vững của giá — $0.10 mỗi giờ là mức giá thường trực cho cả batch và mức cơ sở cho gói streaming $0.20, trong khi mức $0.10 giống hệt của Microsoft là ưu đãi ra mắt có thời hạn, không có mức giá tiêu chuẩn nào được công bố cho năm 2027

Điểm cuối cùng đó là điểm mà hầu hết các so sánh bỏ qua. Hai mô hình có cùng chi phí ngày hôm nay, và một trong những mức giá đó có ngày hết hạn mà mức kia không có. Microsoft chưa công bố mức giá sau khuyến mãi, và các nguồn đưa tin không thống nhất về việc ưu đãi kéo dài đến hết năm 2026 hay hoàn toàn không có ngày kết thúc được nêu. Nếu bạn đang lập mô hình ngân sách phiên âm ba năm dựa trên 1,67 đô la cho mỗi 1.000 phút từ Microsoft, thì bạn đang lập mô hình một con số mà nhà cung cấp chưa cam kết.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

Sự trùng lặp là có thật, và nó chiếm phần lớn danh sách tính năng.

Gác câu hỏi về streaming sang một bên, hai sản phẩm hội tụ mạnh mẽ. Cả hai đều phân tách người nói. Cả hai đều trả về dấu thời gian ở cấp độ từ. Cả hai đều xử lý chuẩn hóa văn bản nghịch — số, ngày tháng, đơn vị tiền tệ, thông tin liên hệ được biểu diễn ở dạng viết. Cả hai đều chấp nhận thuật ngữ chuyên ngành: Grok Voice Transcribe 2.0 với tối đa 100 thuật ngữ chính mỗi yêu cầu, còn MAI-Transcribe-2 với danh sách thuật ngữ chuyên ngành và từ viết tắt. Cả hai đều tự động phát hiện ngôn ngữ và theo dõi người nói khi họ chuyển ngôn ngữ giữa bản ghi. Cả hai đều xử lý âm thanh thoại 8 kHz, trường hợp mà hầu hết mô hình phiên âm lặng lẽ thất bại và cũng là trường hợp SpaceXAI tinh chỉnh gay gắt nhất để chống lại — bộ dữ liệu thoại nội bộ của hãng đã giảm từ 10,6% xuống 7,1% WER giữa các phiên bản, một con số do công ty báo cáo trên âm thanh của công ty.

Cả hai cũng đều có các giới hạn đầu vào định hình kiến trúc chứ không chỉ ngân sách. Grok Voice Transcribe 2.0 chấp nhận tệp lên tới 500 MB ở 12 định dạng âm thanh với tốc độ lấy mẫu từ 8 kHz đến 48 kHz. Các giới hạn của MAI-Transcribe-2 được đặt bởi luồng Foundry chứ không phải bởi mô hình, và các nhóm nên đọc tài liệu của chính Microsoft để biết mức trần hiện tại thay vì giả định có sự tương đương với một dịch vụ STT chuyên dụng.

Điều mà sự hội tụ đó có nghĩa là quyết định rút gọn thành ba câu hỏi theo thứ tự: nó có cần chạy trực tiếp không, bạn thực sự có bao nhiêu ngôn ngữ, và khoảng cách độ chính xác khiến bạn tốn bao nhiêu. Câu hỏi đầu tiên mang tính nhị phân và loại thẳng một lựa chọn. Câu hỏi thứ hai thường có thể trả lời từ một mẫu âm thanh của chính bạn. Câu hỏi thứ ba đủ nhỏ đến mức với hầu hết khối lượng công việc dựa trên tệp, nó sẽ không quyết định điều gì — khoảng cách 0,25 điểm là có thật, nhưng việc cả hai mô hình đều nằm trong khoảng nửa điểm so với con số tốt nhất mà bất kỳ ai đã đo được cũng là sự thật.

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

Làm gì với cái này

Hãy coi chúng như một ngăn xếp hai làn thay vì đối đầu trực diện. Một trung tâm liên hệ vận hành hỗ trợ tác nhân trực tiếp và lưu trữ tuân thủ qua đêm không phải đang chọn giữa Grok Voice Transcribe 2.0 và MAI-Transcribe-2 — nó đang chạy cả hai, và câu hỏi duy nhất là liệu điều đó có khiến nó tốn hai mối quan hệ nhà cung cấp, hai bộ thông tin xác thực, hai hóa đơn và hai giới hạn tốc độ hay không. Cả hai mô hình đều chưa có trong danh mục của OrcaRouter hiện nay, nên bản thân các lệnh gọi chuyển lời nói thành văn bản sẽ đi đến API riêng của từng nhà cung cấp. Điều mà một khóa OrcaRouter bao phủ là mọi thứ ở hạ nguồn: bộ tóm tắt, bộ phân loại, tác nhân suy luận trên bản ghi và tác vụ đánh giá so sánh đầu ra của hai nhà cung cấp trên cùng một bản ghi âm. Điều cuối cùng đó chính là lý do cần quan tâm — bạn không thể quyết định giữa các mô hình này từ một bảng xếp hạng, vì bảng xếp hạng là tám giờ nói chuyện của tác nhân tiếng Anh còn âm thanh của bạn thì không phải.

Hãy để mắt tới hai điều. Thứ nhất, liệu Microsoft có gắn một mức giá tiêu chuẩn cho MAI-Transcribe-2 khi ưu đãi ra mắt kết thúc hay không; mức 1,67 USD cố định cho mỗi 1.000 phút sẽ khiến nó trở thành lựa chọn batch mặc định chỉ dựa trên chi phí, còn việc quay trở lại mức 0,36 USD mỗi giờ của MAI-Transcribe-1 sẽ khiến cuộc trao đổi này ngắn hơn nhiều. Thứ hai, liệu Microsoft có tung ra một SKU streaming hay không. Thẻ mô hình đã nêu phụ đề thời gian thực là một kịch bản mục tiêu, và thứ duy nhất đứng giữa MAI-Transcribe-2 và làn streaming là một endpoint — nếu điều đó thành hiện thực, hai thứ này sẽ không còn là những làn riêng nữa mà bắt đầu trở thành đối thủ của nhau.