Đã tạo thẻ tiêu đề hero cho so sánh giữa Voxtral Mini 4B Realtime Arabic và Grok Voice Transcribe 2.0, phụ đề 'một người dẫn đầu bảng xếp hạng nhãn gặp một chuyên gia tiếng Ả Rập 16 phương ngữ', gắn huy hiệu 'kho Mistral, 8 tháng 10 năm 2026', với ba chip số liệu hiển thị tỷ lệ lỗi ký tự tiếng Ả Rập 8,82% ở 480ms so với tỷ lệ lỗi từ 2,7% ở 0,49s, 16 phương ngữ có tên so với 38+ ngôn ngữ không được ghi nhận, và trọng số Apache 2.0 so với $0,20 mỗi giờ âm thanh, cùng logo OrcaRouter được ghép trong một dải trắng ở góc dưới cùng bên phải.
Guides & Insights

Voxtral Mini 4B Realtime Arabic so với Grok Voice Transcribe 2.0: Một người dẫn đầu bảng xếp hạng gặp một chuyên gia phương ngữ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điểm khởi đầu trung thực cho so sánh này là Voxtral Mini 4B Realtime Arabic và Grok Voice Transcribe 2.0 không cạnh tranh cho cùng một công việc, và cách nhanh nhất để thấy điều đó là nhìn vào những gì mỗi nhà cung cấp sẵn sàng công bố. Mistral AI đã đưa Voxtral Mini 4B Realtime Arabic lên Hugging Face vào ngày 8 tháng 10 năm 2026 mà không có thông báo — trọng số Apache 2.0, một thẻ mô hình nêu tên mười sáu biến thể tiếng Ả Rập, và một con số độ chính xác duy nhất là 8,82% Tỷ lệ lỗi ký tự trung bình trên bảy bộ đánh giá tiếng Ả Rập ở độ trễ 480 mili giây. Grok Voice Transcribe 2.0 của xAI ra mắt vào ngày 18 tháng 9 năm 2026 với một bài đăng ra mắt, một mức giá và kết quả bảng xếp hạng của bên thứ ba: tỷ lệ lỗi từ 2,7% trên bản ghi cuối cùng với văn bản được chốt 0,49 giây sau khi người nói dừng lại, đứng đầu bảng chuyển giọng nói thành văn bản trực tuyến của Artificial Analysis khi nó ra mắt. Một mô hình cho bạn biết chính xác nó xử lý những phương ngữ nào và từ chối đoán ngoài chúng. Mô hình còn lại cho bạn biết nó bao quát hơn 38 ngôn ngữ và không liệt kê chi tiết một ngôn ngữ nào.

Sự bất đối xứng đó chính là toàn bộ phép so sánh. Nếu bạn đang mua năng lực phiên âm với khối lượng lớn cho âm thanh đa ngôn ngữ, mô hình xAI là sản phẩm hoàn chỉnh hơn hẳn. Nếu âm thanh của bạn là tiếng Ả Rập — và cụ thể là tiếng Ả Rập phương ngữ, không phải tiếng Ả Rập chuẩn hiện đại dùng để phát sóng — thì checkpoint Mistral nhắm vào một vấn đề mà bảng xếp hạng nơi mô hình xAI đứng đầu không đo lường, và việc nó đứng thứ hai trên bảng đó thay vì thứ nhất sẽ là một sai lầm nếu đọc đó như một phán quyết.

Phép tính giá, bởi vì ở đây nó rõ ràng một cách bất thường.

xAI công bố một mức giá. Mistral công bố một bản tải xuống. Sự khác biệt đó chi phối mọi thứ về sau, vì vậy hãy bắt đầu bằng con số đang tồn tại.

• Grok Voice Transcribe 2.0 — 0,10 USD mỗi giờ âm thanh qua REST cho các tệp đã ghi, 0,20 USD mỗi giờ âm thanh qua WebSocket truyền trực tuyến. Con số đó tương đương khoảng 1,67 USD mỗi nghìn phút đối với xử lý theo lô và 3,33 USD mỗi nghìn phút đối với truyền trực tuyến, không thay đổi so với Grok Voice Transcribe 1.0 ở cùng các mức giá.

• Voxtral Mini 4B Realtime Arabic — không có giá được công bố, vì không có dịch vụ nào được công bố. Các trọng số là Apache 2.0 và có khoảng 4,4 tỷ tham số ở BF16, nghĩa là chi phí nằm ở GPU mà bạn gắn vào nó và mức độ tận dụng mà bạn thu được từ nó. Ở lưu lượng duy trì đều thì nó rẻ; ở lưu lượng bằng không thì nó là lựa chọn đắt đỏ nhất trong bài viết này, vì bạn đang trả tiền cho phần cứng nhàn rỗi.

Điểm hòa vốn không hề khó thấy. Mức giá streaming 0,20 USD mỗi giờ chỉ khoảng một phần ba xu mỗi phút. Bất kỳ accelerator nào mà bạn dùng để chạy mô hình 4,4B cũng đều tốn hơn mức đó mỗi giờ, trừ khi bạn đang đẩy lưu lượng liên tục qua nó, nghĩa là hướng open-weights chỉ thắng về chi phí sau khi bạn có đủ lượng tiếng Ả Rập để giữ một cỗ máy luôn bận — và thua trên mọi trục khác trong lúc bạn đang tiến tới mức đó, vì API không có capex, không cần hoạch định năng lực và không có gánh nặng vận hành.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Điểm duy nhất mà phép tính đảo chiều sớm chính là tuân thủ. Mistral checkpoint xử lý âm thanh trên phần cứng do bạn kiểm soát, nên không có gì rời khỏi mạng của bạn, và thẻ này đi kèm một mô-đun chuẩn hóa để pipeline chấm điểm tiếng Ả Rập thuộc quyền bạn kiểm toán. Grok Voice Transcribe 2.0 chạy trong các khu vực của xAI và, theo tài liệu của nó, xử lý âm thanh theo thời gian thực mà không lưu giữ hoặc sử dụng để huấn luyện, được hỗ trợ bởi SOC 2 Type II và đủ điều kiện HIPAA. Cả hai câu chuyện đều có thể biện hộ được; chỉ một trong số đó cho phép cơ quan quản lý kiểm tra đường dẫn mã.

0,20 đô la một giờ thực sự mua được gì, và mô hình Mistral không được phát hành

Khoảng cách về tính năng ở đây lớn hơn khoảng cách về độ chính xác và được thảo luận ít hơn nhiều. Grok Voice Transcribe 2.0 là một sản phẩm có giao diện; Voxtral Mini 4B Realtime Arabic là một checkpoint chỉ phát ra văn bản.

• Phân tách người nói — có trên Grok Voice Transcribe 2.0, cùng với tính năng phiên âm đa kênh lên đến tám kênh độc lập. Thẻ Mistral không liệt kê khả năng phân tách người nói; mô hình tạo ra bản phiên âm, không phải bản phiên âm có gán nhãn người nói.

• Dấu thời gian ở cấp độ từ — Grok mang chúng kèm theo điểm số tin cậy, nên bạn có thể đặt ngưỡng cho các đoạn có độ tin cậy thấp thay vì tin tưởng toàn bộ bản chép lời như nhau. Thẻ của Mistral không tuyên bố có dấu thời gian cho checkpoint này.

• Ưu tiên theo thuật ngữ khóa — tối đa 100 thuật ngữ chuyên ngành mỗi yêu cầu trên endpoint Grok, đây là cách bạn giúp mô hình nắm đúng tên sản phẩm, mã tài khoản và địa danh mà không cần tinh chỉnh. Cách Mistral đạt cùng kết quả là tinh chỉnh trên dữ liệu của riêng bạn, điều mà Apache 2.0 cho phép còn endpoint được host thì không.

• Chuẩn hóa văn bản nghịch — Grok định dạng số, ngày tháng, tiền tệ, số điện thoại và địa chỉ email thành dạng viết trên 25 ngôn ngữ. Thẻ Mistral bao gồm một script chuẩn hóa, nhưng mục đích được nêu của nó là chấm điểm các benchmark tiếng Ả Rập, không phải định dạng đầu ra để hiển thị.

• Bề mặt giao diện — REST cho các tệp tối đa 500 MB, truyền phát WebSocket tại wss://api.x.ai/v1/stt với kết quả tạm thời khoảng 500 ms một lần, mức được tài liệu hóa là 10 yêu cầu mỗi giây và 100 phiên truyền phát đồng thời, và hiện chỉ có một khu vực. Về phía Mistral, vLLM phục vụ với WebSocket tại /v1/realtime, hoặc Transformers nguyên bản từ phiên bản 5.2.0, không có giới hạn tốc độ nào ngoài phần cứng của bạn.

Nếu bạn cần phân tách người nói và mốc thời gian, thì cuộc so sánh đã ngã ngũ trước khi độ chính xác kịp được xét đến. Đó không phải là chê bai mô hình Mistral — một chuyên gia tiếng Ả Rập 4B được huấn luyện để tạo ra văn bản phương ngữ chính xác là một mục tiêu kỹ thuật khác với một dịch vụ phiên âm tổng quát — nhưng điều đó có nghĩa là cả hai chỉ trở nên có thể thay thế cho nhau nếu pipeline của bạn coi bản phiên âm là nguyên liệu thô cho quá trình hậu xử lý của chính bạn.

Vấn đề danh sách ngôn ngữ

Cả hai nhà cung cấp đều mô tả hỗ trợ ngôn ngữ theo cách để lại cùng một câu hỏi chưa được giải đáp, từ hai hướng đối lập.

• Grok Voice Transcribe 2.0 — hơn 38 ngôn ngữ, tự động phát hiện ngôn ngữ với khả năng chuyển đổi ngôn ngữ giữa chừng khi ghi âm trong một lượt xử lý duy nhất, trên 12 định dạng âm thanh từ 8 kHz đến 48 kHz. Tài liệu chỉ đưa ra số lượng chứ không đưa ra danh sách. Tiếng Ả Rập không được nêu tên riêng ở bất kỳ đâu trong tài liệu, nghĩa là khả năng hỗ trợ tiếng Ả Rập chỉ được hàm ý bởi con số chứ không được nhà cung cấp xác nhận.

• Voxtral Mini 4B Realtime Arabic — mười sáu biến thể tiếng Ả Rập được nêu đích danh: tiếng Ả Rập Chuẩn Hiện đại; tiếng Maroc, Libya, Tunisia, Algeria và Hassaniya từ Maghreb; tiếng Vùng Vịnh, Najdi, Oman và Sanaani từ Vùng Vịnh; tiếng Ai Cập và Sudan từ Thung lũng sông Nile; tiếng Lưỡng Hà và cả tiếng Levant Nam lẫn Bắc; và tiếng Ả Rập Chad. Mọi thứ nằm ngoài tập hợp đó đều ngoài phạm vi, và thẻ cho biết thay vào đó hãy dùng mô hình thời gian thực tổng quát.

Vậy câu hỏi "mô hình nào trong số này xử lý tiếng Ả Rập tốt hơn" có một cấu trúc kỳ lạ. Mô hình Mistral là một chuyên gia tiếng Ả Rập đã được ghi nhận, với tỷ lệ lỗi tiếng Ả Rập được công bố và không có kiểm chứng độc lập. Mô hình xAI là một đơn vị dẫn đầu bảng xếp hạng đã được ghi nhận, nhưng nhà cung cấp của nó vẫn chưa xác nhận rằng tiếng Ả Rập nằm trong phạm vi hỗ trợ. Một con số 38 ngôn ngữ bao gồm tiếng Ả Rập và một danh sách mười sáu phương ngữ chỉ bao gồm tiếng Ả Rập đều đang trả lời câu hỏi "liệu nó có làm được tiếng Ả Rập không" — nhưng chỉ một trong số đó trả lời "liệu nó có làm được tiếng Darija không".

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

Bảng xếp hạng không giúp ích gì ở đây. Đánh giá chuyển giọng nói thành văn bản của Artificial Analysis là một tổ hợp cố định nghiêng về các đoạn hội thoại kiểu agent bằng tiếng Anh, đây là thiết kế đúng để xếp hạng phiên âm tổng quát nhưng sai để làm nổi bật một chiến thắng ở tiếng Ả Rập phương ngữ. Một mô hình có thể thực sự tốt hơn ở tiếng Ả Rập vùng Vịnh và tiếng Ả Rập Maroc nhưng lại chỉ xuất hiện ở mức khá trên bảng đó. Đây không phải là lời chỉ trích bảng xếp hạng; đó là lý do để không dùng nó làm đầu vào duy nhất cho một triển khai theo khu vực.

Độ chính xác, theo các đơn vị không quy đổi

• Grok Voice Transcribe 2.0 — tỷ lệ lỗi từ của bản ghi cuối cùng là 2,7% với 0,49 giây để có kết quả cuối, và 3,4% ở các partial đầu tiên, cả hai đều được đo trên chỉ số AA-WER v2 của Artificial Analysis, chỉ số này kết hợp một tập dữ liệu trò chuyện giữa các tác nhân riêng tư với VoxPopuli và Earnings22. Con số partial đầu tiên mới là điều đáng chú ý: nó giảm từ 18,3% ở Grok Voice Transcribe 1.0, và đó là khác biệt giữa một bản ghi từng phần mà bạn có thể định tuyến dựa trên đó và một bản ghi chỉ để hiển thị.

• Voxtral Mini 4B Realtime Arabic — Tỷ lệ lỗi ký tự trung bình 8,82% trên bảy bộ đánh giá tiếng Ả Rập ở độ trễ 480 mili giây, theo đánh giá của chính nhà cung cấp với một script chuẩn hoá được cung cấp kèm theo. Mistral báo cáo rằng mức này chỉ cách Voxtral Transcribe Arabic ở 7,91% CER 0,91 điểm phần trăm, vốn là mô hình tiếng Ả Rập ngoại tuyến của cùng phòng thí nghiệm — một so sánh đáng giá hơn so với so sánh giữa các nhà cung cấp khác nhau vì các bộ đánh giá, chuẩn hoá và đo lường đều giống hệt nhau ở cả hai bên.

Đặt 2,7% cạnh 8,82% không phải là một so sánh; đó là một lỗi phạm trù. Tỷ lệ lỗi từ đếm số từ sai so với bản tham chiếu, tỷ lệ lỗi ký tự đếm số ký tự sai, và chính tả tiếng Ả Rập — nơi cùng một từ chấp nhận nhiều cách viết hợp lệ và các yếu tố gắn kết (clitic) gắn tự do — làm khoảng cách giữa hai chỉ số rộng ra vượt xa mức mà các ngôn ngữ dùng chữ viết Latinh thể hiện. Các kho ngữ liệu thì khác nhau, việc chuẩn hóa thì khác nhau, và chỉ một con số đến từ bên thứ ba. Điều mà hai con số này có thể nói với bạn một cách chính đáng là mô hình xAI là một bộ phiên âm tổng quát đã được đo lường, có thứ hạng tốt, còn mô hình Mistral là một bộ được tuyên bố là chuyên biệt cho tiếng Ả Rập. Chúng không thể cho bạn biết mô hình nào phiên âm âm thanh của bạn tốt hơn.

Phép so sánh thực sự thuyết phục là phép so sánh nằm trong chính card của Mistral: 8,82% streaming so với 7,91% offline, cùng bảy benchmark, cùng cách chuẩn hoá, cùng một phòng thí nghiệm. Streaming tốn khoảng một điểm độ chính xác trên tiếng Ả Rập so với mô hình batch. Đó có phải là một đánh đổi tốt hay không là do bạn quyết định, và giờ đây đó là một quyết định đã có đủ thông tin.

Nơi mô hình nhỏ giành chiến thắng, và đó không phải trên bảng điểm

Ba điều về checkpoint Mistral đáng giá hơn những gì các con số gợi ý, và không điều nào trong số đó xuất hiện trên bất kỳ bảng xếp hạng nào.

Đầu tiên là chính hệ thống phân loại phương ngữ. Việc đặt tên mười sáu biến thể như những mục tiêu huấn luyện riêng biệt, bao gồm Hassaniya và tiếng Ả Rập Chad, là một tuyên bố về nơi các lỗi của mô hình được đo lường. Một mô hình đa ngôn ngữ tổng quát bao gồm tiếng Ả Rập như một trong 38 ngôn ngữ sẽ cải thiện trước hết ở tiếng Ả Rập chuẩn hiện đại, vì đó là nơi phần lớn tín hiệu huấn luyện và trọng số đánh giá nằm. Một mô hình được xây dựng cho quan hệ đối tác Ma-rốc cùng với một bộ ở Bắc Phi đang tối ưu hóa cho một phân phối khác, và nó được đồng phát triển với hai bộ đánh giá — ISMA và Darija in the Wild — được xây dựng riêng để đo lường điều đó.

Điểm thứ hai là độ trễ có thể cấu hình. Con số 8,82% được công bố ở mức 480 mili giây, và độ trễ là thứ điều chỉnh được chứ không cố định, điều này biến con số độ chính xác thành một điểm trên đường cong do người vận hành tự chọn. Với một tác vụ phụ đề trực tiếp, bạn có thể rút ngắn độ trễ và chấp nhận nhiều lỗi hơn; với một pipeline ghi âm cuộc gọi, bạn có thể kéo dài nó ra và lấy lại độ chính xác. Grok Voice Transcribe 2.0 đưa ra một điểm vận hành cố định, và chính lộ trình nâng cấp của nhà cung cấp cho thấy vì sao điều đó để lại hệ quả — việc chuyển từ 1.0 lên 2.0 tốn khoảng một phần ba giây ở cả độ trễ của kết quả một phần đầu tiên lẫn kết quả cuối cùng, và cách khắc phục sẵn có cho bạn là ghim mô hình cũ, chứ không phải chỉnh một núm xoay.

Điều thứ ba là việc cấp phép Apache 2.0 là vô điều kiện đối với các trọng số mà bạn đang có. Bất kể điều gì xảy ra với checkpoint ở thượng nguồn — dù nó được công bố, được định giá, bị ngừng hỗ trợ hay không bao giờ được nhắc đến nữa — artifact vẫn có thể tải xuống, tinh chỉnh và đưa vào sản phẩm của riêng bạn. Bảng giá của một endpoint được lưu trữ và lịch ngừng hỗ trợ mô hình của nó đều thuộc quyền thay đổi của nhà cung cấp, và xAI đã báo hiệu ý định biến Grok Voice Transcribe 2.0 thành mặc định và ngừng hỗ trợ 1.0, điều này sẽ cùng lúc chuyển mọi tích hợp chưa từng truyền tham số mô hình sang cấu hình độ trễ mới.

Ở lớp định tuyến phía trên bản ghi, một lưu ý thực tế: không mô hình nào là speech-to-text do chúng tôi vận hành, và bài viết này không khẳng định điều ngược lại. Những gì OrcaRouter bao phủ là lớp mô hình ngôn ngữ tiêu thụ luồng dữ liệu — trình tóm tắt, bộ phân loại, agent — phía sau một API key duy nhất xuyên suốt hơn 200 mô hình ở mức giá niêm yết của nhà cung cấp với 0% markup, nên thay đổi giá từ nhà cung cấp được cập nhật ở đây ngay trong ngày. Các đội đang chạy hai nhà cung cấp giọng nói để đảm bảo phạm vi ngôn ngữ vốn đã phải gánh hai hợp đồng và hai đường xác thực; gộp nửa hạ nguồn về một API key là một chiến thắng ít tốn kém.

Làm gì với cái này

Hãy xây dựng trên Grok Voice Transcribe 2.0 nếu âm thanh của bạn đa ngôn ngữ, nếu bạn cần phân tách người nói, dấu thời gian hoặc thiên lệch theo thuật ngữ chính ngay khi dùng, hoặc nếu bạn muốn một dịch vụ có mức giá được công bố và lộ trình hỗ trợ ngay hôm nay. Đây là sản phẩm hoàn thiện hơn, được đo lường bởi bên thứ ba, và mức giá phát trực tuyến $0.20 mỗi giờ âm thanh đủ thấp để lập luận về chi phí của trọng số mở không còn đáng kể cho đến khi bạn vận hành ở khối lượng lớn.

Hãy xây dựng dựa trên Voxtral Mini 4B Realtime Arabic nếu âm thanh của bạn là tiếng Ả Rập và cụ thể là mang tính phương ngữ, nếu bạn cần mô hình nằm trong mạng riêng của mình vì lý do tuân thủ, hoặc nếu bạn định tinh chỉnh — bởi vì chỉ một trong số này cho phép điều đó. Trước tiên hãy chấp nhận ba điều: không phân tách người nói, không có mốc thời gian, và không có đánh giá độc lập nào được ai công bố. Hai ngày sau khi các trọng số xuất hiện, điều cuối cùng đó không phải là một dấu hiệu cảnh báo; nó chỉ đơn giản là tình trạng bằng chứng hiện tại.

Điều sẽ thay đổi so sánh này nhanh nhất là một đánh giá dành riêng cho tiếng Ả Rập trên âm thanh phương ngữ thực tế, được chạy bên ngoài cả hai nhà cung cấp, với cùng một quy trình chuẩn hóa được áp dụng cho cả hai hệ thống. Cho đến khi điều đó tồn tại, quyết định sẽ dựa vào danh sách phương ngữ của chính một nhà cung cấp so với danh sách không được công bố của chính một nhà cung cấp khác, và bài kiểm tra đáng tin cậy duy nhất là các bản ghi âm của bạn.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Cả hai endpoint đều không phải là dịch vụ do chúng tôi cung cấp — đây là so sánh giữa hai hệ thống nằm ngoài danh mục của chúng tôi — nhưng các mô hình sử dụng bản ghi thoại thì đều có thể định tuyến: hơn 200 mô hình chỉ với một API key duy nhất theo đúng giá niêm yết của nhà cung cấp, mức markup 0%, nên khi mô hình tóm tắt hoặc mô hình phân loại thay đổi giá, mức giá mới sẽ được áp dụng ngay trong ngày công bố.

Chuyển đổi dự phòng tự động là thứ giữ cho một thiết lập giọng nói hai nhà cung cấp không mang theo hai điểm lỗi đơn lẻ vào lớp ngôn ngữ vốn phụ thuộc vào nó.