Thẻ hero của bài viết có nội dung 'MAI-Transcribe-2-Streaming so với Gemini 3.5 Transcribe Live' với huy hiệu 'ĐỐI ĐẦU · CHUYỂN GIỌNG NÓI THÀNH VĂN BẢN TRỰC TUYẾN' và phụ đề 'Cùng $9, những đánh đổi khác nhau', cùng các chip hiển thị 2.5% được công bố so với 4.00% được kiểm toán, 0.13s so với 0.40s để có kết quả cuối cùng, 60 ngôn ngữ so với 85+, và không có tính năng phân tách người nói nào được công bố trên cả hai, trên nền gradient từ trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

MAI-Transcribe-2-Streaming so với Gemini 3.5 Transcribe Live: Cùng $9, đánh đổi khác nhau

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MAI-Transcribe-2-Streaming và Gemini 3.5 Transcribe Live có cùng chi phí và được xây dựng trên những lý thuyết trái ngược về mục đích của một công cụ phiên âm streaming. Cả hai đều ở mức khoảng 9,00 USD cho mỗi 1.000 phút âm thanh được stream. Mô hình của Microsoft, phát hành ngày 1 tháng 10 năm 2026, là một công cụ chính xác: tỷ lệ lỗi từ khi streaming được công bố là 2,5% với 0,13 giây để có bản phiên âm cuối cùng, theo chính Microsoft là đứng đầu về độ chính xác trên cả bản phiên âm cuối cùng và bản phiên âm từng phần, được đo theo phương pháp streaming của Artificial Analysis nhưng chưa được vẽ thành một hàng trên bảng đó. Mô hình còn lại, ở chế độ xem trước công khai từ ngày 26 tháng 8 năm 2026 và được cung cấp qua Live API, là một công cụ bao phủ: hơn 85 ngôn ngữ với khả năng chuyển đổi giữa luồng, một gói miễn phí, và tỷ lệ lỗi từ khi streaming là 4,00% với 0,40 giây, con số mà Artificial Analysis đo được cho nó. Không mô hình nào là lựa chọn hiển nhiên, và lý do là chúng không thực sự cạnh tranh cho cùng một khối lượng công việc.

Đây là so sánh đối đầu đúng như các con số thực tế thể hiện — số liệu do nhà cung cấp báo cáo được ghi nhãn, số liệu của đơn vị theo dõi được ghi rõ nguồn, và những phần mà một mẫu giành chiến thắng ở một phương diện mà mẫu kia hoàn toàn không tranh chấp.

Phiên bản một dòng

• Độ chính xác và độ trễ — MAI-Transcribe-2-Streaming, dựa trên các con số đã công bố. Microsoft tuyên bố WER streaming 2,5% với 0,13 giây để có bản ghi hoàn chỉnh, đứng đầu về độ chính xác ở cả bản ghi cuối cùng lẫn bản ghi từng phần, và 2,5% ở bản ghi từng phần đầu tiên tại 0,12 giây. Đối chiếu lại, Artificial Analysis xếp Gemini 3.5 Transcribe Live ở mức 4,00% tại 0,40 giây. Lợi thế mà Microsoft tuyên bố là 1,5 điểm và nhanh hơn khoảng ba lần để chốt kết quả. Điều đáng lưu ý là bảng theo dõi vẫn chưa tự vẽ đồ thị cho chính MAI-Transcribe-2-Streaming — đơn vị dẫn đầu hiện tại của bảng là Grok Voice Transcribe 2.0 với 2,73% và 0,49 giây, cùng với Muse Voice Transcribe ở mức 3,06% và 0,16 giây — vậy nên con số 2,5% là số liệu do nhà cung cấp đưa ra, đọc đối chiếu với một nhóm mà bảng theo dõi có đo lường. Đây không phải là chuyện sát nút trên trục mà cả hai mô hình đều công bố, nhưng chỉ một phía của trục đó được công bố độc lập.

• Độ bao phủ ngôn ngữ — Gemini 3.5 Transcribe Live. Hơn 85 ngôn ngữ với khả năng tự động phát hiện và có thể chuyển ngôn ngữ giữa luồng mà không cần khởi động lại phiên, đây là tuyên bố nổi bật của Google dành cho Live API. MAI-Transcribe-2-Streaming hỗ trợ 60 ngôn ngữ với khả năng phát hiện ngôn ngữ liên tục tự động. Mức sàn của Microsoft cao hơn; mức trần của Google rộng hơn, và khoảng cách 25 ngôn ngữ chủ yếu nằm ở những ngôn ngữ mà mô hình truyền phát đơn ngôn ngữ hoàn toàn không thể dùng được.

• Hình thái phiên — Gemini 3.5 Transcribe Live, và điều này có cả hai mặt. API Live là một phiên WebSocket bị giới hạn trong 10 phút, điều này phù hợp cho một lượt tác nhân thoại và bất tiện cho một cuộc họp kéo dài một giờ; Microsoft không có giới hạn phiên tương đương cho dịch vụ streaming của mình, điều này quan trọng nếu đơn vị công việc của bạn là một cuộc gọi, chứ không phải một lượt hội thoại.

• Chi phí tham gia — Gemini 3.5 Transcribe Live. Có một bậc miễn phí, và mức giá kết hợp của Google tính ra khoảng 0,009 đô la mỗi phút theo cách tính giá dựa trên token. Mức 0,54 đô la mỗi giờ âm thanh của Microsoft là giá giới thiệu mà Microsoft nói kéo dài đến cuối năm, không tiết lộ giá tiêu chuẩn — cùng cấu trúc như đợt ra mắt hàng loạt hồi tháng 9 của họ.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard page showing the AA-WER Streaming Index chart, which plots final-transcript word error rate against time to final transcription after end of speech across the streaming field; MAI-Transcribe-2-Streaming does not appear on the chart.

Vì sao khoảng cách về độ chính xác lớn hơn vẻ ngoài của nó

Khoảng cách 1,5 điểm về tỷ lệ lỗi từ nghe như một khác biệt do làm tròn, cho đến khi bạn quy nó ra chi phí. Với WER truyền trực tiếp 4,00%, Gemini 3.5 Transcribe Live sai khoảng 40 từ trên 1.000; ở mức 2,5% mà Microsoft tuyên bố, MAI-Transcribe-2-Streaming sai 25 từ. Với khối lượng mà một pipeline thời gian thực tạo ra — một tổ chức hỗ trợ vận hành 5.000 giờ cuộc gọi mỗi tháng tức 300.000 phút, hơn 45 triệu từ ở tốc độ đàm thoại — khoảng chênh lệch đó là hàng triệu từ sai mỗi năm, tập trung vào các thực thể mà hệ thống hạ nguồn phụ thuộc vào: tên tài khoản, số ticket, liều lượng, địa chỉ.

Sự khác biệt về độ trễ là thứ khó bán hơn. 0,13 giây so với 0,40 giây sau khi kết thúc lời nói là mức có thể nhận thấy trong một luồng phụ đề trực tiếp — dưới khoảng 0,2 giây được cảm nhận là đồng thời, và một phần ba giây được cảm nhận như bản ghi đang đuổi theo người nói — nhưng nó không thể nhận thấy trong một bảng hỗ trợ nhân viên vốn làm mới theo thang thời gian của con người. Nếu người dùng của bạn là một người đang đọc theo, lợi thế về độ trễ của Microsoft chính là sản phẩm. Nếu người dùng của bạn là một mô hình nhận bản ghi cuối cùng khi lượt kết thúc, thì đó chỉ là một con số.

Cả hai con số đều mang cùng một lưu ý, và đáng nói một lần: đây là các số liệu từ một lần chạy duy nhất trên một bảng theo dõi gồm 37 mô hình, và khoảng cách giữa vị trí thứ nhất và thứ ba trên bảng đó chưa đến một điểm. Một lần chạy lại có thể xáo trộn thứ hạng đầu của bảng xếp hạng streaming theo cách mà khoảng cách hai điểm trên bảng batch không thể làm được. Microsoft với 2,5% cũng còn chưa có mặt trên bảng — đó là tuyên bố của nhà cung cấp được đo theo phương pháp của đơn vị theo dõi, vốn là một chuyện khác với một dòng mà đơn vị theo dõi công bố.

Các giới hạn chính là nơi quyết định thực sự nằm ở đó.

Giới hạn về tính năng phân tách hai thứ này nhanh hơn cả các bài đo hiệu năng, và chúng đi theo hai hướng ngược nhau.

Gemini 3.5 Transcribe Live có ba hạn chế đã được ghi nhận: giới hạn phiên 10 phút trên Live API, không có phân tách người nói, và không có mốc thời gian theo từng từ. Hạn chế thứ nhất mang tính kiến trúc — truyền phát qua một phiên WebSocket vốn có giới hạn ngay từ khâu thiết kế — và điều đó nghĩa là phiên âm trực tiếp dạng dài phải được nối ghép qua nhiều phiên, với phần xử lý mối nối do bạn tự lo. Hai hạn chế còn lại là tuyệt đối: nếu sản phẩm của bạn cần gán lời nói cho một người nói, hoặc đặt một từ vào một mốc thời gian để tìm kiếm hay đồng bộ phụ đề, thì Gemini 3.5 Transcribe Live không làm được điều đó dù với bất kỳ mức giá nào.

Các hạn chế của MAI-Transcribe-2-Streaming được tài liệu hóa ít hơn, và bản thân điều đó đã là thông tin. Microsoft không đưa ra tuyên bố nào về diarization cho mô hình streaming và cũng không đưa ra tuyên bố nào về dấu thời gian từ; MAI-Transcribe-2 bản batch đi kèm diarization và trả về dấu thời gian ở cấp độ từ, nhưng đó là sản phẩm batch, và giả định rằng SKU streaming thừa hưởng những tính năng đó chính xác là kiểu suy luận mà tài liệu ra mắt tồn tại để ngăn chặn. Điều Microsoft thực sự tuyên bố là 60 ngôn ngữ với khả năng phát hiện ngôn ngữ liên tục và vị trí trên biên Pareto về độ chính xác so với độ trễ — cả hai đều là những tuyên bố của nhà cung cấp mà dữ liệu của trình theo dõi nhất quán với.

Vậy nên, cách đọc tính năng một cách trung thực là: cả hai mô hình streaming đều không công bố tính năng tách người nói hay dấu thời gian theo từng từ. Gemini 3.5 Transcribe Live có giới hạn phiên được công bố và một gói miễn phí; MAI-Transcribe-2-Streaming có số lượng ngôn ngữ được công bố và không có giới hạn được công bố. Nếu yêu cầu của bạn bao gồm tách người nói, thì cả hai đều không phải là câu trả lời, và bạn đang xét đến phiên âm theo lô với một lớp streaming được gắn thêm vào phía trước.

Giá ngang bằng thực sự đang nói với bạn điều gì

Hai nhà cung cấp cùng đạt mức 9 USD cho mỗi 1.000 phút từ hai hướng ngược nhau là chi tiết thú vị nhất trong so sánh này. Google đạt được điều đó thông qua định giá theo token trên một phiên Live API: âm thanh đầu vào ở mức 3,50 USD mỗi triệu token, văn bản đầu ra ở mức 21 USD mỗi triệu token, và mức tiêu thụ ước chừng 175 token văn bản mỗi phút, kết hợp lại thành khoảng 0,009 USD mỗi phút. Microsoft đạt được điều đó bằng cách niêm yết mức cố định 0,54 USD mỗi giờ âm thanh cho một mô hình trong nhóm mà phiên bản batch cùng dòng có giá 0,10 USD. Một bên là phiên thời gian thực tính theo mức sử dụng; bên kia là mức giá cố định theo phút với ưu đãi giới thiệu.

Những cấu trúc đó hoạt động khác nhau khi bạn mở rộng quy mô. Mức phí cố định thì dễ dự đoán và dễ lập ngân sách; một phiên tính theo token lại thay đổi tùy theo mức độ mô hình phản hồi và thời gian phiên mở không hoạt động. Đối với một pipeline khối lượng lớn, mức phí cố định là hóa đơn thân thiện hơn; đối với một bản nguyên mẫu hoặc một tính năng khối lượng thấp, gói miễn phí và thanh toán theo token là điểm vào thân thiện hơn.

A generated bar-comparison card titled 'Two routes to $9.00 per 1,000 minutes' showing MAI-Transcribe-2-Streaming at a flat $0.54 per audio-hour introductory rate and Gemini 3.5 Transcribe Live at roughly $0.009 per minute blended from token pricing, both at $9.00, with MAI-Transcribe-2 (batch sibling) at $1.67, and a note that neither streaming rate has an announced post-promotional successor and that Gemini's blended figure uses $3.50 per million audio-in and $21 per million text-out at about 175 text tokens per minute, with the OrcaRouter logo bottom right.

Điều mà cả hai cấu trúc đều không thay đổi là lớp nằm phía trên bản chép lời. Dù mô hình nào tạo ra nó, một bản chép lời trực tiếp vẫn là đầu vào cho việc tóm tắt, phân loại, che/xóa thông tin nhạy cảm và định tuyến, và những bước đó có đường cong chi phí và chất lượng riêng — thường được chạy trên nhiều mô hình chứ không chỉ một. Đó là lớp mà OrcaRouter bao phủ: một API xuyên suốt hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển thẳng với mức tăng giá 0%, tự động chuyển đổi dự phòng, và một DSL định tuyến có thể gửi một bản chép lời qua các mô hình khác nhau tùy theo khối lượng công việc. Cả MAI-Transcribe-2-Streaming lẫn Gemini 3.5 Transcribe Live đều không nằm trong danh sách đó — chúng lần lượt được phục vụ thông qua các ngăn xếp giọng nói của chính Microsoft và Google — và mục tiêu không phải là định tuyến chúng, mà là giữ cho mọi thứ ở hạ nguồn của chúng luôn khả chuyển.

A generated three-axis comparison card titled 'Streaming speech-to-text, on three axes' contrasting MAI-Transcribe-2-Streaming (2.5% streaming WER as a claim, 0.13s to final, 60 languages with automatic detection, no published session cap, diarization not published, word timestamps not published, $9.00 per 1,000 minutes introductory) with Gemini 3.5 Transcribe Live (4.00% streaming WER per Artificial Analysis, 0.40s to final, 85+ languages with mid-stream switching, a 10-minute session cap on the Live API, no diarization, no word timestamps, no session cap published), with the OrcaRouter logo bottom right.

Chọn cái nào?

Chọn MAI-Transcribe-2-Streaming khi độ chính xác và thời gian chốt là sản phẩm: phụ đề trực tiếp để con người đọc, chấm điểm tuân thủ hoặc chất lượng theo thời gian thực nơi một thực thể bị nghe nhầm gây tốn kém, hoặc các phiên dài mà mức trần 10 phút của Gemini sẽ buộc bạn phải ghép nối. Chọn Gemini 3.5 Transcribe Live khi độ bao phủ là sản phẩm: triển khai toàn cầu trên khắp các ngôn ngữ mà bạn không thể liệt kê trước, chuyển đổi ngôn ngữ giữa luồng, hoặc một nguyên mẫu nơi gói miễn phí và tính phí theo token loại bỏ cam kết. Các nhóm cần cả hai không hề bị mắc kẹt — hai cái là những API khác nhau với những mô hình phiên khác nhau, và kiến trúc trung thực là định tuyến theo khối lượng công việc thay vì chuẩn hóa trên một lựa chọn duy nhất.

Điều đáng rút ra từ so sánh này không phải là Microsoft đã thắng. Mà là phiên âm dạng luồng giờ đây có hai lựa chọn tiên phong đáng tin cậy với mức giá giống hệt nhau, nghĩa là quyết định đã chuyển từ "cái gì có sẵn" sang "khối lượng công việc cụ thể này cần gì". Đó là một vấn đề tốt hơn để gặp phải.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày