
Voxtral Mini 4B Realtime Arabic so với Voxtral 4B TTS: Hai đầu của cùng một cuộc hội thoại
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hai mô hình này chia sẻ một cái tên, một số lượng tham số và một tệp giấy phép có hành vi khác nhau, và đó là nơi mọi điểm tương đồng dừng lại. Voxtral Mini 4B Realtime Arabic, được đẩy lên Hugging Face vào ngày 8 tháng 10 năm 2026 mà không kèm theo thông báo nào, nhận âm thanh đầu vào và tạo ra văn bản tiếng Ả Rập — một bản tinh chỉnh streaming của Voxtral-Mini-4B-Realtime-2602 được xây dựng cho tiếng Ả Rập chuẩn hiện đại và mười lăm phương ngữ được đặt tên, giấy phép Apache 2.0, tỷ lệ lỗi ký tự trung bình 8,82% ở độ trễ 480 mili giây. Voxtral 4B TTS, được Mistral AI công bố vào tháng 3 năm 2026, làm điều ngược lại: văn bản đầu vào, giọng nói đầu ra, hai mươi giọng đặt trước cùng khả năng thích ứng từ một đoạn clip tham chiếu ngắn, chín ngôn ngữ bao gồm tiếng Ả Rập, và một giấy phép — CC BY-NC 4.0 — cấm việc sử dụng thương mại đối với chính các trọng số. Chúng không phải là các lựa chọn thay thế và cũng không phải là các biến thể. Chúng là hai nửa của một vòng lặp thoại, và lý do để xem xét chúng cùng nhau là những quyết định bạn đưa ra về một trong hai sẽ ràng buộc cái còn lại nhiều hơn mức hầu hết các nhóm mong đợi.
Hầu hết các trang so sánh sẽ nói với bạn rằng những mô hình này không liên quan đến nhau vì một cái là ASR và một cái là TTS, rồi dừng lại. Điều đó đúng và không hữu ích. Điều thực sự đáng biết là chỗ chúng gặp nhau: một voice agent cần cả hai, hai giấy phép chỉ về hai hướng đối lập, hai dấu chân phần cứng thì tương tự nhau trong khi các đặc tính thông lượng thì không, và những tuyên bố về độ phủ tiếng Ả Rập có những hình dạng hoàn toàn khác nhau. Mọi thứ dưới đây nói về bốn điểm gặp nhau đó.
Mỗi mô hình là gì, xét theo những thuật ngữ quan trọng đối với một pipeline
• Voxtral Mini 4B Realtime Arabic — nhận dạng giọng nói tự động dạng luồng. Đầu vào âm thanh 16 kHz, đầu ra văn bản, khoảng 4,4 tỷ tham số ở BF16, được phục vụ qua vLLM với WebSocket tại /v1/realtime hoặc hỗ trợ gốc trong Transformers từ phiên bản 5.2.0. Một bộ mã hóa âm thanh nhân quả và một bộ giải mã ngôn ngữ, độ trễ phiên âm có thể cấu hình được nêu ở mức 480 mili giây cho chỉ số độ chính xác đã công bố, và một mô-đun chuẩn hóa đi kèm để có thể tính lại tỷ lệ lỗi ký tự tiếng Ả Rập. Apache 2.0.
• Voxtral 4B TTS — chuyển văn bản thành giọng nói dạng luồng và theo lô. Nhập văn bản, xuất âm thanh 24 kHz ở định dạng WAV, PCM, FLAC, MP3, AAC hoặc Opus, với khoảng 4 tỷ tham số, cùng bộ 20 giọng đặt trước và khả năng thích ứng giọng nói từ đoạn clip tham chiếu ngắn chỉ ba giây. Kết quả đánh giá của chính Mistral trên một H200 duy nhất chạy vLLM-Omni 0.18.0 với đầu vào 500 ký tự và tham chiếu dài mười giây cho thấy độ trễ 70 mili giây và hệ số thời gian thực 0,103 ở mức đồng thời 1, tăng lên 331 mili giây và 0,237 ở mức đồng thời 16, và 552 mili giây ở mức đồng thời 32. Có thể truy vấn dưới dạng API với giá 0,016 USD cho mỗi nghìn ký tự.
Nhận xét đầu tiên rút ra từ hai đoạn đó là cặp mô hình này nhỏ. Cả hai mô hình đều nằm trong khoảng 4 tỷ tham số và đều vừa trên một bộ tăng tốc duy nhất ở BF16, nghĩa là một agent thoại tiếng Ả Rập được xây dựng hoàn toàn trên trọng số mở cùng lắm chỉ là triển khai hai GPU, và hợp lý là triển khai một GPU với lượng tử hóa ở cả hai phía. Đó là lý do thực tế để xem chúng như một bộ thay vì hai quyết định sản phẩm riêng biệt.

Sự bất đối xứng về giấy phép chính là phát hiện, chứ không phải là một chú thích.
Đây là điều gây bất ngờ cho những ai cho rằng các mô hình từ cùng một phòng thí nghiệm với cùng một quy ước đặt tên đều có cùng các điều khoản.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Việc sử dụng thương mại, chỉnh sửa, phân phối lại và tinh chỉnh đều được phép, với điều kiện tuân thủ hạn chế tiêu chuẩn về việc xâm phạm quyền của bên thứ ba.
• Voxtral 4B TTS — CC BY-NC 4.0, kế thừa từ các tập dữ liệu giọng nói tham chiếu đứng sau nó. Phi thương mại. Thẻ của Mistral nói rõ rằng mô hình kế thừa giấy phép của các tham chiếu giọng nói, được lấy từ các nguồn bao gồm EARS, CML-TTS, IndicVoices-R và một tập âm thanh tự nhiên tiếng Ả Rập. Các trọng số có thể tải xuống và giấy phép không phải là giấy phép thương mại.
Đây là một ràng buộc cứng đối với đúng kiến trúc mà ai cũng hướng tới đầu tiên. Nếu bạn xây dựng một tác nhân thoại tiếng Ả Rập có nhánh chuyển giọng nói thành văn bản là Voxtral Mini 4B Realtime Arabic và nhánh chuyển văn bản thành giọng nói là Voxtral 4B TTS, thì bạn có một pipeline trong đó một nửa thành phần được dùng thương mại tự do còn một nửa thì không, và nửa hạn chế sẽ chi phối sản phẩm. Việc mô hình ASR dùng Apache 2.0 không cứu được nhánh TTS. Chạy cặp này cục bộ không thay đổi giấy phép, và việc không phát hành trọng số cũng vậy — ràng buộc gắn với việc sử dụng, chứ không phải việc phân phối.

Con đường thương mại mà Mistral cung cấp cho mảng giọng nói là API được host với giá $0,016 mỗi nghìn ký tự, đây là một thỏa thuận dịch vụ chứ không phải là việc cấp phép. Đối với một nhóm sản phẩm, hệ quả thực tế là nửa có thể tự do thương mại hóa của vòng lặp là nửa lắng nghe, còn nửa nói thì hoặc là phụ thuộc vào API hoặc là một cuộc trao đổi về cấp phép. Điều đó đảo ngược điều mà hầu hết các nhóm giả định khi bắt đầu xây dựng một ngăn xếp giọng nói mở, và điều này đáng để phát hiện trước khi bạn viết xong phần tích hợp, chứ không phải sau đó.
Các tuyên bố bằng tiếng Ả Rập không khớp với nhau, và chỉ một trong số đó là lời hứa chi trả
Cả hai mô hình đều liệt kê tiếng Ả Rập. Các mục liệt kê đó mang ý nghĩa khác nhau.
• Voxtral Mini 4B Realtime Arabic — tiếng Ả Rập là toàn bộ phạm vi. Mười sáu loại biến thể được liệt kê làm mục tiêu huấn luyện: tiếng Ả Rập chuẩn hiện đại, tiếng Ả Rập Maroc, Libya, Tunisia, Algeria và Hassaniya, tiếng Ả Rập vùng Vịnh, Najd, Oman và Sanaa, tiếng Ả Rập Ai Cập và Sudan, tiếng Ả Rập Lưỡng Hà cùng cả tiếng Ả Rập Levant Nam và Bắc, và tiếng Ả Rập Chad. Bất cứ thứ gì nằm ngoài tập hợp đó đều được ghi nhận là ngoài phạm vi. Một chỉ số độ chính xác tổng hợp, CER 8,82%, được tính trung bình trên bảy bộ đánh giá tiếng Ả Rập.
• Voxtral 4B TTS — Tiếng Ả Rập là một trong chín ngôn ngữ được hỗ trợ, cùng với tiếng Anh, tiếng Pháp, tiếng Tây Ban Nha, tiếng Đức, tiếng Ý, tiếng Bồ Đào Nha, tiếng Hà Lan và tiếng Hindi. Thẻ mô tả "các phương ngữ đa dạng" trong phạm vi hỗ trợ đó, mà không liệt kê chúng, và không có số liệu chất lượng theo từng ngôn ngữ nào được công bố cho tiếng Ả Rập hay cho bất kỳ ngôn ngữ nào trong tám ngôn ngữ còn lại.
Khi đọc cùng nhau, cặp này cho bạn một tuyên bố chi tiết về việc hệ thống của bạn sẽ nghe tiếng Ả Rập tốt đến đâu và gần như không có tuyên bố nào về việc nó sẽ nói tiếng Ả Rập tốt đến đâu. Sự bất đối xứng đó có hậu quả thực sự đối với một tác nhân thoại tiếng Ả Rập Darija hoặc tiếng Ả Rập vùng Vịnh: phía đầu vào có một điểm chuẩn đã được công bố và một danh sách phương ngữ bạn có thể đánh giá đối chiếu, còn phía đầu ra có một huy hiệu ngôn ngữ và một danh sách giọng nói. Chưa ai công bố phép đo mức độ dễ hiểu của tiếng Ả Rập phương ngữ cho Voxtral 4B TTS, và tính năng thích ứng giọng nói không giải quyết được điều đó — việc thích ứng một giọng nói thay đổi việc giọng nói nghe giống ai, chứ không phải phương ngữ mà nó tạo ra.
Có một điểm thứ hai, tinh tế hơn về chính con số độ chính xác của mô hình ASR, và điểm này cũng đúng ở phía TTS. Mistral báo cáo CER 8,82% khi streaming so với 7,91% đối với Voxtral Transcribe Arabic chạy ngoại tuyến trên cùng bảy benchmark với cùng cách chuẩn hóa, vậy streaming tốn khoảng một điểm. Sự đánh đổi tương đương ở phía TTS — suy luận streaming phải trả giá bao nhiêu về chất lượng đầu ra so với batch — hoàn toàn không được định lượng trong tài liệu. Các con số độ trễ thì có; mức chênh lệch chất lượng thì không.
Thông lượng: một mẫu được chế tạo để đẩy tới giới hạn, mẫu còn lại thì không
Mistral đã công bố dữ liệu thông lượng cho đúng một trong những mô hình này, và những con số đó giải thích tại sao.
• Voxtral 4B TTS — được đo trên một H200 với vLLM-Omni, đầu vào 500 ký tự và tham chiếu âm thanh mười giây, thông lượng chạy từ khoảng 119 ký tự mỗi giây thời gian GPU ở mức đồng thời 1 đến khoảng 879 ở mức đồng thời 16 và khoảng 1.431 ở mức đồng thời 32, với độ trễ tăng từ 70 mili giây lên 331 rồi 552. Đó là một đường cong thông lượng mà bạn có thể dựa vào để lập kế hoạch dung lượng, và nó có dạng mà bạn sẽ mong đợi ở một mô hình được thiết kế như một dịch vụ giọng nói cho môi trường sản xuất.
• Voxtral Mini 4B Realtime Arabic — thẻ mô hình không báo cáo chỉ số thông lượng, hành vi đồng thời hay chuẩn đo hiệu năng phần cứng nào. Điều mà nó nêu rõ là kiến trúc: một bộ mã hóa nhân quả và cơ chế chú ý cửa sổ trượt trên cả bộ mã hóa lẫn bộ giải mã, được mô tả trên mô hình cơ sở là hỗ trợ truyền phát gần như không giới hạn. Điểm độ chính xác được nêu ở mức độ trễ 480 mili giây, ngụ ý rằng mô hình theo kịp âm thanh thời gian thực trên phần cứng phù hợp, và đó là toàn bộ phạm vi hiệu năng được công bố.
Khoảng cách này không hẳn là lời chỉ trích mô hình nào trong hai mô hình mà đúng hơn là một nhận định về độ trưởng thành. Mô hình TTS có bảng SLO được công bố vì nó được phát hành như một sản phẩm với bài blog, bản demo, API và mức giá. Mô hình Arabic ASR không có phạm vi hiệu năng được công bố vì nó đến dưới dạng một repository kèm một card. Nếu hôm nay bạn đang định cỡ một cụm phiên âm tiếng Ả Rập, con số thông lượng bạn cần vẫn chưa tồn tại, và cách duy nhất để có được nó là chạy đường phục vụ vLLM trên phần cứng của chính bạn với âm thanh của chính bạn.
Đó cũng chính là lúc một lớp định tuyến thay đổi hình hài của triển khai chứ không chỉ thay đổi phần tính phí. OrcaRouter không định tuyến cả hai mô hình này — chúng tôi không tự vận hành endpoint giọng nói Mistral nào, và bài viết này không hề ngụ ý điều ngược lại — nhưng lớp mô hình ngôn ngữ nằm giữa chúng lại đúng là lớp hưởng lợi từ việc được định tuyến: một API key dùng chung cho hơn 200 mô hình ở mức giá niêm yết của nhà cung cấp với 0% phụ phí, để khi nhà cung cấp đổi giá thì thay đổi đó đến phía chúng tôi ngay trong ngày được công bố, cùng khả năng chuyển đổi dự phòng tự động để một buổi chiều trục trặc của một nhà cung cấp thượng nguồn chỉ là một lần định tuyến lại chứ không phải một sự cố gián đoạn trong vòng lặp giọng nói của bạn. Một voice agent được ghép từ hai mô hình Mistral tự vận hành cộng với một mô hình suy luận được vận hành bởi bên thứ ba sẽ có ba miền lỗi; lớp định tuyến chính là thứ khiến miền ở giữa trở nên nhàm chán.
Chi phí, so sánh cạnh nhau, với lưu ý rằng một bên không có giá.
• Voxtral 4B TTS — 0,016 USD cho mỗi nghìn ký tự thông qua API của Mistral, hoặc chi phí GPU nếu bạn tự triển khai theo các điều khoản cho phép trường hợp sử dụng của bạn. Để có khái niệm sơ bộ về quy mô, một nghìn ký tự tương đương vài trăm từ, vì vậy một phút đầu ra dạng nói chỉ nằm ở mức vài phần nhỏ của một xu theo giá niêm yết, trước khi tính đến bất kỳ lợi thế xử lý đồng thời nào từ việc tự chạy nó.
• Voxtral Mini 4B Realtime Arabic — không có mức giá công bố, không có dịch vụ được host, không có bảng giá cước. Chi phí nằm ở phần cứng và mức sử dụng. Một mô hình 4.4B BF16 trên một bộ tăng tốc hiện đại là chi phí cố định hàng tháng mà bạn phân bổ cho lượng âm thanh nhiều nhất mà máy có thể xử lý, vốn rẻ khi khối lượng duy trì ổn định và hoàn toàn lãng phí khi khối lượng chỉ thỉnh thoảng.
Phép so sánh có lẽ còn quan trọng hơn là với những lựa chọn thay thế mà bạn sẽ cân nhắc thay vào đó. Về phía nghe, checkpoint tiếng Ả Rập đang cạnh tranh với các API streaming tính theo giờ có mức giá được công bố và thấp — MAI-Transcribe-2-Streaming của Microsoft ở mức 0,54 USD mỗi giờ âm thanh trong giai đoạn giới thiệu, Grok Voice Transcribe 2.0 của xAI ở mức 0,20 USD mỗi giờ âm thanh streaming — nghĩa là có thể mua một dịch vụ phiên âm tiếng Ả Rập với giá vài phần mười xu mỗi phút, và lập luận ủng hộ mô hình trọng số mở phải dựa trên độ chính xác phương ngữ, nơi lưu trú dữ liệu hay tinh chỉnh, chứ không phải dựa trên chi phí đơn vị. Về phía nói, một mô hình TTS tự lưu trữ với chi phí biên bằng không là lợi thế thực sự so với các API tính theo ký tự khi ở quy mô lớn, đó là lý do tại sao giấy phép CC BY-NC mới là yếu tố hạn chế, chứ không phải giá cả.
Một lưu ý mang tính cấu trúc cho bất kỳ ai đang lập ngân sách cho việc chuyển đổi dựa trên giá: một router truyền nguyên giá niêm yết của nhà cung cấp với mức markup 0% chính là nơi thay đổi mức giá của nhà cung cấp xuất hiện ngay trong ngày nó được công bố, thay vì vào chu kỳ định giá lại tiếp theo. Điều đó quan trọng hơn ở phía nghe so với phía nói, vì dịch vụ phiên âm được tính giá theo giờ âm thanh và đó là con số mà các nhà cung cấp có thể thay đổi.
Cách suy nghĩ để lựa chọn giữa chúng
Bạn không phải chọn giữa chúng. Câu hỏi là bạn có thể xây dựng nửa nào của vòng lặp trên trọng số mở, và giấy phép trả lời điều đó.
Nếu yêu cầu của bạn là một tác nhân thoại tiếng Ả Rập khép kín, nơi âm thanh không bao giờ rời khỏi hạ tầng của bạn, thì phần nghe sẽ có sẵn cho bạn vô điều kiện: Apache 2.0, có thể tải xuống, có thể tinh chỉnh, với danh sách phương ngữ để bạn kiểm thử và tỷ lệ lỗi tiếng Ả Rập đã được công bố. Phần nói là nơi ràng buộc nằm ở đó, và bạn có hai lựa chọn trung thực — chuyển tổng hợp giọng nói sang một dịch vụ được lưu trữ theo thỏa thuận thương mại, hoặc loại bỏ Voxtral 4B TTS khỏi kiến trúc và tìm một mô hình tổng hợp tiếng Ả Rập có giấy phép thông thoáng.
Nếu yêu cầu của bạn là một dịch vụ phiên âm cho môi trường vận hành thực tế và ngôn ngữ là tiếng Ả Rập, thì quyết định nằm giữa một checkpoint 4.4B có thể tải xuống với phân loại phương ngữ đã được công bố và một tỷ lệ lỗi tổng hợp duy nhất, và một API phát trực tuyến được host với mức giá đã công bố, độ trễ đã công bố và một bảng xếp hạng của bên thứ ba. Mô hình mở thắng về kiểm soát, lưu trú và tinh chỉnh; các lựa chọn được host thắng về bằng chứng, hỗ trợ và sự đơn giản trong vận hành. Hai ngày sau khi các trọng số xuất hiện, chưa ai ngoài Mistral đo lường chúng, và đó là lý do để tự chạy benchmark của bạn, chứ không phải lý do để gạt bỏ checkpoint.
Điều có thể thay đổi cục diện này nhiều nhất là một bản phát hành tổng hợp tiếng Ả Rập theo các điều khoản cho phép sử dụng thương mại — cùng mô thức mà phía nghe đã đang tuân theo. Cho đến khi điều đó tồn tại, vòng lặp vẫn nửa mở, và công việc thực tế là quyết định xem bạn sẵn lòng thuê nửa nào.

Chúng tôi không tự vận hành cả hai mô hình giọng nói Mistral này và bài viết này cũng không ngụ ý điều ngược lại; thứ mà vòng lặp giọng nói cần ở phía trên chúng là lớp ngôn ngữ, và lớp đó thì có thể định tuyến - một khóa API dùng chung cho hơn 200 mô hình theo đúng giá niêm yết của nhà cung cấp với 0% phụ phí, nên khi nhà cung cấp thay đổi mức giá, phía chúng tôi sẽ cập nhật ngay trong cùng ngày công bố.
Chuyển đổi dự phòng tự động giữ cho phần giữa của một tác nhân thoại gồm ba thành phần - một mô hình suy luận thượng nguồn nằm giữa hai mô hình Mistral tự vận hành - không trở thành phần khiến sản phẩm ngừng hoạt động.
