
Voxtral Mini 4B Realtime Arabic so với MAI-Transcribe-2-Streaming: Hai bản ra mắt trong tháng Mười, hai vấn đề về bằng chứng
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Bảy ngày cách biệt hai mô hình giọng nói thời gian thực này, và chúng đã ra đời theo hai cách trái ngược. {{1}}MAI-Transcribe-2-Streaming{{/1}} là mô hình phiên âm streaming đầu tiên của {{2}}Microsoft AI{{/2}}, được công bố vào ngày 1 tháng 10 năm 2026 với một bài đăng ra mắt, một danh mục xem trước trên Azure, mức giá giới thiệu 0,54 đô la mỗi giờ âm thanh đến hết năm, và tuyên bố đứng đầu bảng xếp hạng streaming của {{3}}Artificial Analysis{{/3}} về độ chính xác của cả bản ghi cuối cùng lẫn bản ghi từng phần ở tỷ lệ lỗi từ 2,5% với văn bản cuối cùng sẵn sàng 0,13 giây sau khi kết thúc lời nói. {{4}}Voxtral Mini 4B Realtime Arabic{{/4}} là mô hình streaming phương ngữ Ả Rập của {{5}}Mistral AI{{/5}}, được phát hành trên Hugging Face vào ngày 8 tháng 10 năm 2026 mà không hề có thông báo nào — không bài viết blog, không giá, không dịch vụ, chỉ có trọng số Apache 2.0 và một thẻ mô hình báo cáo Tỷ lệ lỗi ký tự trung bình 8,82% trên bảy bộ đánh giá tiếng Ả Rập ở độ trễ 480 mili giây. Mô hình của Microsoft là một sản phẩm hoàn chỉnh với một tiêu đề không thể xác minh. Mô hình của Mistral là một hiện vật có thể xác minh mà không có sản phẩm nào xung quanh. Cả hai đều đáng để hiểu chính vì cả hai đều để câu hỏi trọng tâm — nó xử lý tiếng Ả Rập tốt đến mức nào — chỉ được trả lời bởi nhà cung cấp.
Dù sao thì việc so sánh vẫn đáng làm, bởi vì hai mô hình tiếp cận cùng một quyết định kỹ thuật từ hai đầu đối lập. Microsoft đang bán sự rộng khắp và một dịch vụ được quản lý: 60 ngôn ngữ với khả năng phát hiện ngôn ngữ liên tục tự động, chạy bên trong Azure AI Speech, tính giá theo giờ, ở dạng bản xem trước. Mistral đang cho đi chiều sâu: mười sáu biến thể tiếng Ả Rập được đặt tên, đủ nhỏ để chạy trên một bộ tăng tốc, kèm một script chuẩn hóa để bạn có thể tự kiểm toán việc chấm điểm. Nếu bạn đang dựng một pipeline phiên âm tiếng Ả Rập trong tháng này, bạn đang chọn giữa hai lập trường đó, và lựa chọn ấy phụ thuộc vào bằng chứng mà bạn chưa có trong cả hai trường hợp.
Những gì mỗi nhà cung cấp thực sự nói, và những gì các diễn đàn nói
Khoảng trống bằng chứng là đặc điểm quan trọng nhất của cuộc đối đầu này, nên nó được đưa lên đầu tiên.
• MAI-Transcribe-2-Streaming — tỷ lệ lỗi từ của bản chép lời cuối cùng là 2,5% ở 0,13 giây sau khi kết thúc lời nói, và cũng 2,5% đó trên các kết quả từng phần đầu tiên ở 0,12 giây, cả hai đều được trình bày là đứng nhất về độ chính xác theo phương pháp luận AA-WER Streaming của Artificial Analysis. Đây là cách diễn đạt của chính Microsoft. Tính đến thời điểm viết bài này, bảng streaming của tracker vẫn chưa vẽ một dòng cho mô hình, nên tuyên bố này dựa trên phương pháp luận của tracker mà không có con số nào do tracker công bố đứng sau.
• Voxtral Mini 4B Realtime Arabic — Tỷ lệ lỗi ký tự trung bình 8,82% trên bảy bộ đánh giá tiếng Ả Rập ở độ trễ được cấu hình 480 mili giây. Thẻ do chính Mistral công bố, kèm mã đánh giá được cung cấp. Chưa có bên thứ ba nào tái lập được kết quả này, và mô hình mới chỉ mới ra đời được hai ngày.
Vậy nên hai con số nổi bật trong bài viết này lần lượt là: một tuyên bố của nhà cung cấp dựa trên thước đo của người khác, và một tuyên bố của nhà cung cấp có gắn thước đo của chính mình. Cả hai đều không phải là một phép đo độc lập. Điều khác biệt là con số của Mistral đi kèm với script chuẩn hóa mà bạn cần để tái tạo lại nó, còn con số của Microsoft đi kèm với một bảng xếp hạng vẫn chưa đưa nó lên biểu đồ. Nếu bạn đang đưa ra quyết định mua sắm, sự khác biệt đó quan trọng hơn khoảng cách 2,5 so với 8,82, vốn dĩ đã vô nghĩa — tỷ lệ lỗi từ và tỷ lệ lỗi ký tự không thể quy đổi cho nhau, và chính tả tiếng Ả Rập làm khoảng cách giữa chúng nới rộng đáng kể.
Phép so sánh duy nhất bên trong thẻ của Mistral thực sự có khả năng chuyển đổi là phép so sánh với người anh em ngoại tuyến của chính nó: Voxtral Transcribe Arabic đạt 7,91% CER trên cùng bảy benchmark với cùng cách chuẩn hoá, vì vậy streaming khiến mô hình này tốn thêm 0,91 điểm phần trăm. Microsoft đã công bố một con số tương đương cho dòng của mình khi phát hành MAI-Transcribe-2 dạng theo lô vào ngày 3 tháng 9 năm 2026 với tỷ lệ lỗi từ là 2,0% — biến thể streaming đánh mất nửa điểm so với mô hình theo lô trong khi bổ sung khả năng cung cấp theo thời gian thực. Đặt hai mức chênh lệch nội bộ nhà cung cấp đó cạnh nhau, bạn có phát biểu so sánh táo với táo duy nhất trong bài viết này: trên benchmark của chính họ, SKU streaming của mỗi phòng thí nghiệm đều kém hơn người anh em theo lô, khoảng một điểm trong một trường hợp và nửa điểm trong trường hợp kia, và cả hai đang đo các ngôn ngữ khác nhau.

Độ phủ ngôn ngữ: 60 so với 16, và cùng một khoảng trống không tên ở cả hai phía
• MAI-Transcribe-2-Streaming — 60 ngôn ngữ với khả năng tự động phát hiện ngôn ngữ liên tục, nên một phiên làm việc chuyển đổi ngôn ngữ giữa chừng không cần khai báo ngôn ngữ trước. Tài liệu ra mắt của Microsoft chỉ đưa ra con số chứ không đưa danh sách; tài liệu hỗ trợ ngôn ngữ của Azure dành cho dòng MAI-Transcribe chính là nơi liệt kê chi tiết phạm vi bao phủ, và tài liệu này ghi tiếng Ả Rập nằm trong số các ngôn ngữ được dòng sản phẩm hỗ trợ.
• Voxtral Mini 4B Realtime Arabic — mười sáu biến thể tiếng Ả Rập, được nêu tên riêng: tiếng Ả Rập chuẩn hiện đại, tiếng Ả Rập Maroc, Libya, Tunisia, Algeria và Hassaniya, tiếng Ả Rập vùng Vịnh, Najd, Oman và Sanaa, tiếng Ả Rập Ai Cập và Sudan, tiếng Ả Rập Lưỡng Hà cùng cả tiếng Ả Rập Levant Nam và Bắc, và tiếng Ả Rập Chad. Ngoài tập hợp đó, mô hình được ghi nhận là nằm ngoài phạm vi, kèm theo chỉ dẫn đến Voxtral Mini 4B Realtime thông dụng.
Không con số nào trong hai con số này cho bạn biết điều bạn cần. Con số 60 của Microsoft là con số thể hiện độ phủ rộng, bao gồm tiếng Ả Rập nhưng không mô tả hiệu năng đối với tiếng Ả Rập; bài đăng ra mắt chỉ nêu tổng số ngôn ngữ một lần rồi thôi. Con số 16 của Mistral là bản liệt kê các mục tiêu huấn luyện với một tỷ lệ lỗi tổng hợp duy nhất trên bảy bộ đánh giá, nghĩa là phân tích chi tiết theo phương ngữ — thứ thực sự quyết định liệu âm thanh cuộc gọi tiếng Maroc của bạn có được chuyển thành văn bản hay không — cũng không được công bố. Hai mô hình, hai nhà cung cấp, và trong cả hai trường hợp, câu trả lời trung thực cho câu hỏi “nó giỏi đến mức nào khi cụ thể là tiếng Ả Rập vùng Vịnh” là: không được nêu rõ.
Điều mà việc liệt kê mang lại cho bạn chính là một prior. Một mô hình với tiếng Ả Rập Chad và tiếng Ả Rập Hassaniya là các mục tiêu được nêu tên đã được tinh chỉnh theo phân bố Bắc Phi; Mistral đã đồng phát triển nó với Bộ Chuyển đổi Số và Cải cách Hành chính của Maroc và xây dựng hai trong số bảy benchmark với bộ này — ISMA và Darija in the Wild — cụ thể để đo các ca khó. Một mô hình tổng quát 60 ngôn ngữ cải thiện ở tiếng Ả Rập Chuẩn hiện đại trước tiên, vì đó là nơi tập trung khối lượng tín hiệu huấn luyện. Nếu âm thanh của bạn là tiếng Darija hoặc tiếng Ả Rập vùng Vịnh, thì đó là những vấn đề khác, và chỉ một trong hai nhà cung cấp này đã đưa ra con số cho một trong hai.
Độ trễ và hình dạng của độ trễ
• MAI-Transcribe-2-Streaming — 0,13 giây từ khi kết thúc lời nói đến bản chép lời cuối cùng, và các kết quả từng phần đầu tiên ở 0,12 giây, nhanh đến mức kết quả từng phần và kết quả cuối cùng thực chất có cùng độ trễ. Tuyên bố của Microsoft, được đo theo phương pháp luận của tracker.
• Voxtral Mini 4B Realtime Arabic — 480 mili giây độ trễ được cấu hình tại điểm đã công bố, với độ trễ có thể điều chỉnh. Con số đó gần gấp ba lần rưỡi con số của Microsoft, và đây là tham số mà người vận hành chọn chứ không phải một thuộc tính cố định.
Ba phần mười giây là một khác biệt thực sự đối với một tác nhân thoại cần phản hồi ngay giữa lúc đang nói và gần như vô hình đối với con người đọc phụ đề. Đó cũng là sự khác biệt giữa một núm vặn và một con số. Tham số độ trễ của Mistral nghĩa là bạn có thể chạy chặt hơn và chấp nhận nhiều lỗi hơn, hoặc lỏng hơn và lấy lại độ chính xác — mô hình cơ sở mà checkpoint này được tinh chỉnh từ đó công bố một khoảng từ 240 mili giây đến 2,4 giây — trong khi điểm vận hành của Microsoft là thứ mà Azure phát hành. Điều đó khiến con số của Microsoft dễ lý giải hơn và con số của Mistral dễ tinh chỉnh hơn, đồng thời có nghĩa là mọi so sánh giữa hai con số độ chính xác thực chất là so sánh hai điểm được chọn trên một đường cong và một điểm cố định trên một đường cong khác.
Bề mặt tính năng cũng sắc nét không kém, và đáng để đối chiếu với các yêu cầu pipeline của bạn trước khi phần thảo luận về độ chính xác trở nên thú vị.
MAI-Transcribe-2-Streaming — được cung cấp thông qua Azure AI Speech với bộ tính năng đã được tài liệu hóa của dòng sản phẩm này: phân tách người nói, dấu thời gian ở cấp độ từ, thiên lệch từ khóa và cụm từ, kiểu đầu ra nguyên văn so với kiểu đầu ra sạch, cùng khả năng nhận dạng ngôn ngữ tự động. Tài liệu riêng của SKU streaming về phân tách người nói và dấu thời gian còn mỏng hơn so với mô hình batch, vì vậy hãy xác nhận những điểm đó theo từng endpoint thay vì mặc định rằng chúng tương đương.

• Voxtral Mini 4B Realtime Arabic — thẻ mô tả tính năng phiên âm với bộ mã hóa âm thanh nhân quả, vLLM phục vụ qua WebSocket tại /v1/realtime, hỗ trợ Transformers gốc từ phiên bản 5.2.0 và một mô-đun chuẩn hoá. Thẻ không mô tả tính năng phân tách người nói hoặc dấu thời gian theo từng từ cho checkpoint này.
Mô hình phân phối: dịch vụ xem trước so với trọng số có thể tải xuống
• MAI-Transcribe-2-Streaming — bản xem trước của Azure, nghĩa là không có SLA và nhà cung cấp khuyến nghị không nên phụ thuộc vào môi trường sản xuất. Được định giá ở mức 0,54 USD mỗi giờ âm thanh như một mức giá giới thiệu kéo dài đến hết năm 2026, với mức giá tiêu chuẩn không được công bố; MAI-Transcribe-2 dạng lô đã ra mắt ở mức 0,10 USD mỗi giờ âm thanh theo cùng hình thức giới hạn thời gian. Dịch vụ streaming có chi phí gấp 5,4 lần mức giá dạng lô.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, khoảng 4,4 tỷ tham số ở BF16, có thể tải xuống, tinh chỉnh và phục vụ trên một bộ tăng tốc duy nhất. Không có giá, không có SLA và không có cam kết hỗ trợ, vì không có dịch vụ nào đằng sau nó.
Hai câu đó chứa đựng quyết định. Một dịch vụ xem trước với mức giá giới thiệu và mức giá tiêu chuẩn không được tiết lộ là một cam kết sẽ hết hạn; mức phụ trội streaming 5,4× và khung thời gian đến hết năm 2026 đều do Microsoft toàn quyền thay đổi, và tỷ lệ batch so với streaming là con số cần theo dõi khi mức giá tiêu chuẩn chính thức được áp dụng. Trọng số Apache 2.0 không kèm thông báo nào là điều ngược lại: một tạo tác không ai có thể thu hồi, gắn với một mối quan hệ nhà cung cấp mà chưa ai mô tả. Việc checkpoint có được duy trì hay không là điều không thể biết được, nhưng tệp bạn có hôm nay vẫn tiếp tục hoạt động dù thế nào đi nữa.
Ràng buộc đặc thù theo ngành thường là yếu tố quyết định những câu hỏi này trên thực tế. Một triển khai tổng đài chăm sóc khách hàng bằng tiếng Ả Rập bên trong một tổ chức được quản lý chặt có thể hoàn toàn không thể gửi âm thanh đến một điểm cuối đám mây dạng xem trước; một nhóm đã chuẩn hóa trên Azure AI Speech có thể không muốn thêm một hệ thống tại chỗ thứ hai chỉ cho một nhóm ngôn ngữ. Cả hai ràng buộc đều chính đáng, và cả hai đều không liên quan gì đến các con số 2,5% và 8,82% được nêu bật trong hai buổi ra mắt.
Phía trên lớp phiên âm, điểm tương tự cũng đúng cho cả hai. OrcaRouter không định tuyến cả hai mô hình giọng nói này — đây là so sánh hai hệ thống mà chúng tôi không phục vụ — nhưng bộ tóm tắt, bộ phân loại hoặc agent tiêu thụ bản phiên âm thì có thể định tuyến: hơn 200 mô hình trên một API key theo giá niêm yết của nhà cung cấp với 0% markup, nên thay đổi giá từ nhà cung cấp sẽ đến phía chúng tôi trong cùng ngày, và tự động chuyển đổi dự phòng nếu một nhà cung cấp bị suy giảm. Điều đó đặc biệt hữu ích ở đây là giai đoạn dùng thử: hướng cả hai ứng viên phiên âm vào một pipeline hạ nguồn, đằng sau một key, là cách bạn chạy so sánh đối đầu mà không cần dựng hai tích hợp.
Bài kiểm tra sẽ giải quyết được chuyện này
Không nhà cung cấp nào công bố hiệu suất dành riêng cho tiếng Ả Rập và cả hai đều chưa được đánh giá độc lập trên âm thanh phương ngữ. Do đó, việc so sánh chỉ còn lại ba dữ kiện và một khuyến nghị.
Các dữ kiện: mô hình streaming của Microsoft nhanh hơn ở 0,13 giây và tuyên bố độ chính xác tổng hợp tốt hơn trên một bảng vẫn chưa vẽ nó; mô hình của Mistral công bố danh sách phương ngữ, tỷ lệ lỗi tiếng Ả Rập và mã chuẩn hoá để tính lại nó, ở 480 mili giây; và không thể so sánh hai con số độ chính xác vì một cái là tỷ lệ lỗi từ còn cái kia là tỷ lệ lỗi ký tự trên một kho ngữ liệu khác.
Khuyến nghị: bất kỳ ai đang đưa ra quyết định này nên chạy thử cả hai trên chính âm thanh của họ, vì đó là phép đo duy nhất mà cả hai nhà cung cấp vẫn còn để ngỏ. Hãy xây dựng tập đánh giá từ các bản ghi thực — tổ hợp phương ngữ mà bạn thực sự nhận được, codec mà bạn thực sự dùng, từ vựng chuyên ngành mà bạn thực sự cần — và chấm điểm cả hai bằng chuẩn hóa của Mistral so với một tham chiếu mà bạn tin cậy. Một bài kiểm tra hai giờ trên chính các bản ghi của bạn sẽ cho bạn biết nhiều hơn cả hai bài đăng ra mắt cộng lại, và đó là cách duy nhất để tìm ra liệu lợi thế 0,13 giây có đáng để phụ thuộc vào bản xem trước và mức phụ phí streaming 5,4× hay không, hay liệu một mô hình 4.4B có thể tải xuống ở 480 mili giây đã đủ tốt cho công việc hay chưa.

OrcaRouter không cung cấp cả hai mô hình giọng nói này, và bài viết này không hàm ý điều ngược lại - điều mà bài đề cập là lớp ngôn ngữ đọc bản ghi: hơn 200 mô hình đằng sau một khóa theo giá niêm yết của nhà cung cấp với 0% phụ trội, vì vậy khi nhà cung cấp thay đổi giá đối với mô hình hạ nguồn, bạn sẽ nhận được thông tin ngay trong ngày công bố.
Chuyển đổi dự phòng tự động cho phép cả hai phương án phiên âm cùng đưa dữ liệu vào một pipeline hạ nguồn thay vì phải dùng hai tích hợp riêng biệt, đây cũng là cách tiết kiệm nhất để chạy so sánh đối đầu.
