Thẻ hero của bài viết ghi 'Voxtral Mini 4B Realtime Arabic so với Gemini 3.5 Transcribe Live', với phụ đề '15 phương ngữ tiếng Ả Rập trên trọng số mở so với hơn 85 ngôn ngữ/khu vực trên API đóng', một huy hiệu đánh dấu mô hình Mistral là bản phát hành kho chưa được công bố, ghi ngày 8 tháng 10 năm 2026, và ba chip số liệu: 16 biến thể tiếng Ả Rập so với hơn 85 ngôn ngữ/khu vực; tỷ lệ lỗi ký tự 8,82% ở 480ms so với tỷ lệ lỗi từ streaming 4,0% ở 0,40 giây; trọng số mở Apache 2.0 so với chỉ API. Logo OrcaRouter nằm trong một dải trắng ở góc dưới bên phải.
Guides & Insights

Voxtral Mini 4B Realtime Arabic so với Gemini 3.5 Transcribe Live: Phương ngữ so với độ bao phủ

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình chuyển giọng nói thành văn bản theo luồng, hai canh bạc hoàn toàn khác nhau về việc đâu là phần khó của việc chép lời. Voxtral Mini 4B Realtime Arabic là bản tinh chỉnh 4,4 tỷ tham số mà Mistral AI đẩy lên một kho lưu trữ công khai vào ngày 8 tháng 10 năm 2026 mà không có bài đăng ra mắt, mục blog hay một dòng nào trong mục tin tức của công ty, được huấn luyện chuyên biệt trên tiếng Ả Rập chuẩn hiện đại và mười lăm phương ngữ được nêu tên, phát hành theo Apache 2.0 với trọng số BF16 có thể tải xuống. Gemini 3.5 Transcribe Live là điểm cuối phát trực tuyến của Gemini 3.5 Transcribe do Google cung cấp, được công bố vào tháng 8 năm 2026 với đầy đủ bộ máy của một bản phát hành nền tảng, bao phủ hơn 85 vùng ngôn ngữ, và đóng — một API xem trước không có trọng số và giới hạn phiên mười phút. Một mô hình đi sâu vào một nhóm ngôn ngữ duy nhất và nói rõ điều đó trong phần hạn chế của chính nó; mô hình kia đi rộng và để mặc các bảo đảm ở cấp độ giọng không được nêu. Bạn muốn cái nào phụ thuộc vào một trục mà tiếp thị của cả hai nhà cung cấp đều không đặt lên hàng đầu: âm thanh của bạn thực sự nghe như thế nào.

Đây không phải là một so sánh đối xứng, và đáng nói thẳng điều đó ngay từ đầu thay vì chôn nó đi. Mô hình Mistral mới 48 giờ tuổi tại thời điểm viết bài, không có thông báo từ nhà cung cấp, không có đánh giá độc lập, và không có giá được công bố. Mô hình Google đã ở chế độ xem trước công khai từ cuối tháng 8 và được đo trên một trình theo dõi của bên thứ ba. Hãy coi phía Mistral như một tập hợp các tuyên bố từ thẻ mô hình và phía Google như một tập hợp các phép đo cộng với một tập hợp các tuyên bố, và so sánh sẽ vẫn trung thực.

Mỗi mô hình là gì, trước các con số

• Voxtral Mini 4B Realtime Arabic — một mô hình ASR streaming được tinh chỉnh từ Voxtral-Mini-4B-Realtime-2602, với khoảng 4,4 tỷ tham số ở định dạng BF16, nhận âm thanh 16 kHz qua bộ mã hóa âm thanh nhân quả và bộ giải mã ngôn ngữ. Mô hình phát ra văn bản ngay khi âm thanh đến, với độ trễ phiên âm có thể cấu hình, và theo giấy phép Apache 2.0 với trọng số trên Hugging Face. Mistral đã đồng phát triển mô hình này với Ministère de la Transition Numérique et de la Réforme Administrative của Maroc theo một quan hệ đối tác được ký vào tháng 1 năm 2026, và mô tả mô hình là một tài sản AI có chủ quyền.

Gemini 3.5 Transcribe Live — phần truyền phát của một bản phát hành gồm hai mô hình. Điểm cuối API Live truyền âm thanh micrô liên tục qua WebSocket, trả về bản chép từng phần trong khi người nói vẫn đang nói, và chốt lại bản chép cuối cùng ngay sau khi mỗi phát ngôn kết thúc. Phiên bản anh em xử lý theo lô, gemini-3.5-transcribe, phục vụ các tệp ghi sẵn dài tối đa một giờ. Cả hai đều đang ở bản xem trước công khai, cả hai đều chỉ dùng qua API, và cả hai đều chưa công bố trọng số.

Sự khác biệt cấu trúc đầu tiên không phải là độ chính xác. Đó là việc một trong hai thứ này là một tệp bạn có thể tải về ngay tối nay, còn thứ kia là một dịch vụ mà bạn phải được chấp nhận mới có thể sử dụng.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Phạm vi ngôn ngữ: 16 so với hơn 85, và khoảng cách không phải là vấn đề đáng bàn

Việc đếm số ngôn ngữ khiến mô hình Mistral trông có vẻ hạn hẹp còn mô hình Google trông thật khổng lồ. Các con số này đo lường những thứ khác nhau, và việc đọc chúng cạnh nhau mà không có lưu ý đó chính là sai lầm phổ biến nhất mà sự so sánh này dễ dẫn tới.

• Voxtral Mini 4B Realtime Arabic — 16 biến thể tiếng Ả Rập, được ghi tên riêng trên thẻ mô hình theo nhóm phương ngữ: tiếng Ả Rập Chuẩn Hiện đại, cùng với tiếng Ả Rập Maroc, Libya, Tunisia, Algeria và Hassaniya từ Maghreb; tiếng Ả Rập Vùng Vịnh, Najdi, Oman và Sanaani từ Vùng Vịnh; tiếng Ả Rập Ai Cập và Sudan từ Thung lũng sông Nile; tiếng Ả Rập Lưỡng Hà và cả Levant Nam lẫn Bắc; và tiếng Ả Rập Chad. Cách diễn đạt của chính thẻ mô hình là mô hình nhắm đến việc phiên âm tiếng Ả Rập, và rằng chuyển mã ngôn ngữ — người nói luân phiên ngôn ngữ giữa cuộc trò chuyện — là năng lực mà nó được xây dựng để làm đúng chứ không phải một hiệu ứng phụ.

• Gemini 3.5 Transcribe Live — tự động phát hiện ngôn ngữ trên hơn 85 locale, với chuyển mã trong câu và giữa các câu. Tài liệu của Google liệt kê tiếng Ả Rập trong tập hợp đó; bảng locale ghi tiếng Ả Rập (Ai Cập) là mục tiếng Ả Rập, và phạm vi bao phủ locale tiếng Ả Rập rộng hơn không được liệt kê chi tiết trong tài liệu của chính mô hình.

Đọc điều đó một cách trung thực và hình dạng của sự đánh đổi sẽ hiện ra. Con số 85+ của Google là một tuyên bố về độ bao phủ: nếu âm thanh của bạn ở một ngôn ngữ không phải tiếng Ả Rập, endpoint của Google sẽ bao phủ nó còn mô hình Mistral sẽ từ chối nó — thẻ mô hình nói thẳng rằng với các ngôn ngữ khác, bạn nên dùng Voxtral Mini 4B Realtime gốc, chứ không phải checkpoint này. Con số 16 của Mistral là một tuyên bố về chiều sâu. Nó không tuyên bố phiên âm tiếng Ả Rập nói chung; nó tuyên bố phiên âm tiếng Darija Maroc, tiếng Ả Rập vùng Vịnh, tiếng Ả Rập Ai Cập và tiếng Ả Rập Chad như những mục tiêu riêng biệt, một bài toán khó hơn đáng kể so với việc phiên âm tiếng Ả Rập chuẩn hiện đại rồi hy vọng phương ngữ tự lộ ra từ đó. Một bài benchmark thiên về tiếng Anh, ưu tiên bề rộng sẽ không bao giờ cho bạn thấy sự khác biệt đó, bởi vì các bộ dữ liệu phương ngữ không có trong đó.

Đối với một tổng đài ở Ma-rốc hay một đường dây hỗ trợ khách hàng ở vùng Vịnh, một mô hình chỉ xử lý 16 phương ngữ và không gì khác có thể đánh bại một mô hình xử lý 85 miền địa phương với độ chính xác theo từng phương ngữ không được nêu rõ. Đối với một công ty châu Âu đang phiên âm các cuộc họp bằng năm ngôn ngữ, phương trình đảo ngược ngay lập tức. Cả hai nhà cung cấp đều không sai; họ đã chọn những khách hàng khác nhau.

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

Những con số bạn có thể so sánh, và những con số bạn không thể.

Đây là chỗ mà sự bất đối xứng gây hậu quả. Hai mô hình báo cáo những đơn vị khác nhau, trên những tập ngữ liệu khác nhau, với bằng chứng khác nhau đằng sau chúng, và không có bên thứ ba nào chạy chúng đối đầu với nhau.

• Voxtral Mini 4B Realtime Arabic — 8,82% tỷ lệ lỗi ký tự trung bình trên bảy benchmark tiếng Ả Rập, ở độ trễ phiên âm được cấu hình là 480 mili giây. Theo model card của chính Mistral, và chưa được tái lập độc lập.

• Mô hình mà nó đang bám đuổi — Voxtral Transcribe Arabic đạt 7,91% CER trên cùng bảy bộ đánh giá bằng cùng một phép đo, vì vậy mô hình thời gian thực về đích kém hơn 0,91 điểm phần trăm so với một mô hình tiếng Ả Rập ngoại tuyến của cùng nhà cung cấp. Khoảng cách đó là so sánh của chính Mistral, khiến nó đặc biệt đáng chú ý: nhà cung cấp đang cho bạn biết streaming phải trả giá bao nhiêu về độ chính xác trên nhóm ngôn ngữ này.

• Gemini 3.5 Transcribe Live — tỷ lệ lỗi từ streaming 4,0%, được Artificial Analysis đo và được Google trích dẫn, với bản chép lời cuối cùng đến 0,40 giây sau khi kết thúc lời nói. Cũng được đo: 2,6% trên bảng không streaming của cùng hệ thống theo dõi đó, và 5,50% streaming trên FLEURS theo báo cáo của chính Google.

Đừng đặt 8,82% CER cạnh 4,0% WER rồi rút ra kết luận gì. Tỷ lệ lỗi ký tự và tỷ lệ lỗi từ có mẫu số khác nhau — chính tả tiếng Ả Rập khiến khoảng cách giữa chúng lớn hơn so với các ngôn ngữ dùng chữ Latinh — và các ngữ liệu không giống nhau, cách chuẩn hoá không giống nhau, và một con số đi kèm với một script có thể tái lập trong khi con số kia đến từ một hỗn hợp cố định của tracker được đánh trọng số thiên về lời nói của agent tiếng Anh.

So sánh hữu ích hơn là so sánh nằm trong model card của chính Mistral: 8,82% streaming so với 7,91% offline, trên các benchmark giống hệt nhau với cùng phép chuẩn hóa. Đó là một phép đo rõ ràng về những gì độ trễ thấp mang lại và đánh đổi trên tiếng Ả Rập cụ thể, và nó có giá trị hơn bất kỳ tỷ lệ phần trăm nào giữa các nhà cung cấp. Điều mà chưa ai công bố là một lượt chạy tiếng Ả Rập có thể so sánh tương đương của các mô hình Google và Mistral trên cùng một đoạn âm thanh. Cho đến khi có ai đó làm điều đó, "mô hình nào chính xác hơn trong tiếng Ả Rập" vẫn là một câu hỏi mở, và câu trả lời duy nhất có thể bảo vệ được là: hãy thử cả hai trên các bản ghi âm của bạn.

Một chi tiết trong thẻ model của Mistral đáng được nhắc đến vì nó đi ngược lại lợi ích của chính nhà cung cấp. Nó lưu ý rằng các bộ lọc an toàn của Gemini chặn việc phiên âm một số mẫu âm thanh FLEURS. Đó là một quan sát thực tế, có thể kiểm chứng về pipeline của một đối thủ, và cũng chính là kiểu điều không bao giờ xuất hiện trên bảng xếp hạng — một mô hình từ chối phiên âm một mẫu sẽ bị tính là thất bại hoặc bị coi như không có, và cả hai cách diễn giải đều không công bằng. Nếu âm thanh của bạn chứa nội dung mà bộ lọc nội dung có thể bắt được, thì đó là một rủi ro khi triển khai mà không chỉ số WER nào làm lộ ra.

Độ trễ: một nút điều chỉnh so với một con số cố định

Các mô hình streaming thường được so sánh dựa trên một chỉ số độ trễ duy nhất. Hai mô hình này không có chung một chỉ số như vậy.

• Voxtral Mini 4B Realtime Arabic — độ trễ phiên âm có thể cấu hình. Con số CER 8,82% được nêu ở mốc 480 mili giây và độ trễ có thể điều chỉnh, nghĩa là con số độ chính xác chỉ là một điểm trên đường cong do người vận hành chọn chứ không phải là thuộc tính của mô hình. Mô hình cơ sở của nó công bố dải từ 240 mili giây lên tới 2,4 giây.

Gemini 3.5 Transcribe Live — 0,40 giây từ khi kết thúc lời nói đến bản chép lại cuối cùng, được đo bởi Artificial Analysis, với các phần chép tạm thời đến liên tục trong khi nói. Google riêng rẽ tuyên bố cải thiện 70% về thời gian đến bản chép lại cuối cùng so với Chirp 3, đây là con số của nhà cung cấp và chưa được tái lập.

Cả hai đều rơi vào cùng một vùng — đại khái khoảng nửa giây — nhưng ý nghĩa kỹ thuật lại khác nhau. Mô hình Mistral trao cho bạn việc đánh đổi giữa độ trễ và độ chính xác dưới dạng một tham số, nên bạn có thể chạy ở 240 ms khi phụ đề dưới một giây quan trọng hơn vài điểm chính xác cuối cùng, rồi đẩy độ trễ ra xa hơn khi điều đó không còn quan trọng. Điểm cuối của Google đưa ra một điểm vận hành cố định, gắn kèm chính hành vi lọc nội dung của Google. Với một tác nhân thoại, một núm điều chỉnh đáng giá hơn một con số cố định tốt hơn một chút, vì thiết lập phù hợp phụ thuộc vào âm thanh của bạn và không nhà cung cấp nào có thể chọn thay bạn.

Ranh giới thực sự: trọng số mở so với một điểm cuối xem trước

Sự khác biệt về giấy phép và phân phối lớn hơn bất kỳ khoảng cách điểm chuẩn nào trong so sánh này, và nó quyết định phần lớn các triển khai thực tế trước khi độ chính xác được bàn tới.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, trọng số BF16 trên Hugging Face, có thể phục vụ bằng vLLM qua WebSocket tại /v1/realtime, và được hỗ trợ nguyên bản trong Transformers từ phiên bản 5.2.0. Thẻ mô hình đi kèm một ví dụ Python và một mô-đun chuẩn hoá để bạn có thể tự tái tạo phép tính CER tiếng Ả Rập. Không có phần nào trong quy trình yêu cầu máy chủ của Mistral, và mô hình đủ nhỏ để câu hỏi vận hành là dùng GPU nào, chứ không phải liệu bạn có đủ khả năng chi trả cho một chiếc hay không.

• Gemini 3.5 Transcribe Live — chỉ API, bản xem trước công khai, không có cam kết giá được công bố ngoài giá niêm yết, và giới hạn phiên 10 phút nghĩa là bất kỳ nội dung nào dài hơn đều phải được chia khối, kết nối lại và ghép nối bằng mã của chính bạn. Ba hạn chế được báo cáo cùng đợt ra mắt có ý nghĩa đặc biệt đối với triển khai tiếng Ả Rập: điểm cuối streaming không trả về phân tách người nói và không có dấu thời gian ở cấp từ, cả hai đều tồn tại trên điểm cuối batch nhưng không có trên điểm cuối này. Nếu bản ghi chép tiếng Ả Rập của bạn cần biết ai đã nói gì, hoặc cần được căn chỉnh thời gian với âm thanh, thì điểm cuối Live không thể tạo ra điều đó bất kể ngôn ngữ nào.

Hai ràng buộc đó là lập luận mạnh nhất cho mô hình mở nhỏ trong một triển khai tiếng Ả Rập thực tế, và chúng không liên quan gì đến độ chính xác. Một quy trình tổng đài muốn phân định người nói, một quy trình tuân thủ muốn dấu thời gian, và một mô hình tiếng Ả Rập ngoại tuyến với script chuẩn hóa do bạn kiểm soát sẽ cho bạn cả hai mà không phải tranh cãi với một hợp đồng endpoint. Thẻ mô hình của Mistral cũng liệt kê điều đó như một hạn chế chứ không phải một tính năng — nó hướng đến việc chuyển lời nói thành văn bản, nó là bản tinh chỉnh của một mô hình thời gian thực tổng quát, và nó trung thực rằng có một mô hình rộng hơn tồn tại ở thượng nguồn nếu bạn cần.

Mỗi thứ tốn bao nhiêu, và điều gì chưa rõ

• Gemini 3.5 Transcribe Live — khoảng 0,009 USD mỗi phút âm thanh theo mức giá hỗn hợp, được suy ra từ giá niêm yết 3,50 USD mỗi triệu token đầu vào và 21 USD mỗi triệu token đầu ra, với âm thanh được tính ở mức 25 token mỗi giây và bản ghi ở khoảng 175 token mỗi phút. Endpoint batch có giá khoảng 0,005 USD mỗi phút. Cả hai con số đều là ước tính từ cách tách token giả định của Google, nên chúng sẽ thay đổi nếu cách tính toán thay đổi. Hiện nay có một gói miễn phí.

• Voxtral Mini 4B Realtime Arabic — không có giá công bố, bởi vì không có dịch vụ nào được công bố. Chi phí chính là mức mà phần cứng của bạn tốn kém. Một mô hình BF16 4,4 tỷ tham số nằm gọn trên một accelerator hiện đại duy nhất, nên chi phí biên cho mỗi giờ âm thanh là tiền điện và mức độ sử dụng, còn chi phí cố định là cỗ máy. Điều đó rẻ hơn bất kỳ API tính theo phút nào khi khối lượng lớn và đắt hơn bất kỳ API tính theo phút nào khi khối lượng bằng không, đó chính là hình dáng thông thường của cuộc đánh đổi open-weights.

Ẩn số quan trọng nhất ở phía Mistral không phải là giá. Mà là liệu kho lưu trữ này là khởi đầu của một dòng sản phẩm hay chỉ là một sản phẩm bàn giao một lần gắn với quan hệ đối tác Morocco. Một mô hình được phát hành âm thầm, không có thông báo, không có giá và không có dịch vụ là một mô hình không có cam kết hỗ trợ nào phía sau. Apache 2.0 nghĩa là giấy phép không thể bị thu hồi đối với các trọng số bạn đã có, nhưng nó không nói lên điều gì về việc checkpoint có được duy trì hay không, và chính chỉ dẫn mô hình cơ sở trên thẻ mô hình gợi ý rằng mô hình thời gian thực tổng quát vẫn là dòng được hỗ trợ.

Đối với lớp nằm trên bản chép lời, một lớp định tuyến chứng tỏ giá trị của mình theo cách không liên quan gì đến việc chép lời. Cả hai mô hình này đều không phải là dịch vụ chuyển giọng nói thành văn bản do chúng tôi vận hành — OrcaRouter không định tuyến endpoint nào trong hai endpoint đó — nhưng trình tóm tắt, bộ phân loại ý định hoặc tác nhân tiêu thụ luồng dữ liệu lại là mô hình mà bạn có thể định tuyến: một khóa API dùng cho hơn 200 mô hình với mức giá niêm yết của nhà cung cấp và 0% markup, nhờ đó khi nhà cung cấp giảm giá thì mức giảm sẽ đến phía chúng tôi ngay trong cùng ngày, cộng thêm khả năng chuyển đổi dự phòng tự động nếu một nhà cung cấp bị suy giảm chất lượng. Nếu bạn đang ghép nối hai nhà cung cấp dịch vụ giọng nói để bao phủ phương ngữ, thì việc đặt các mô hình ngôn ngữ hạ nguồn phía sau một khóa thay vì hai hợp đồng chính là nửa rẻ hơn của quá trình tích hợp.

Xây dựng dựa trên cái nào

Nếu âm thanh của bạn là tiếng Ả Rập — một phương ngữ, nhiều phương ngữ, hoặc chuyển mã giữa tiếng Ả Rập và một ngôn ngữ khác — thì mô hình Mistral là ứng viên nghiêm túc hơn, và lý do mang tính cấu trúc chứ không phải số lượng. Nó nêu rõ những phương ngữ mà nó được xây dựng để xử lý, nó đủ nhỏ để chạy trên phần cứng của chính bạn, nó trả về văn bản thô mà bạn có thể hậu xử lý bằng quy tắc chuẩn hoá của riêng mình, và nó không nằm sau giới hạn phiên mười phút hay bộ lọc nội dung mà bạn không thể kiểm tra. Cái giá phải trả là nó chỉ làm một họ ngôn ngữ và từ chối phần còn lại, và rằng chưa có ai công bố đánh giá độc lập về nó.

Nếu âm thanh của bạn trải qua nhiều ngôn ngữ, hoặc nếu hôm nay bạn cần một dịch vụ có lộ trình hỗ trợ và bảng giá được công bố, Gemini 3.5 Transcribe Live hiện có thể gọi được, được đo trên một trình theo dõi của bên thứ ba, và bao phủ các ngôn ngữ mà checkpoint Mistral sẽ từ chối. Cái giá phải trả là giới hạn phiên, việc thiếu phân tách người nói và dấu thời gian trên endpoint streaming, cùng việc độ chính xác riêng cho tiếng Ả Rập là một tuyên bố mà bạn sẽ phải tự mình kiểm nghiệm — danh sách locale có nêu Ai Cập, và hiệu năng phương ngữ không được liệt kê chi tiết.

Điều cần chú ý không phải là một benchmark. Mà là liệu Mistral có công bố mô hình này hay không, và nếu có, thì với mức giá nào và lộ trình ngôn ngữ ra sao. Một kho lưu trữ im lặng với giấy phép Apache 2.0 là một hiện vật hữu ích và một cam kết yếu ớt. Nếu một lộ trình phương ngữ Ả Rập tiếp theo — Levantine, Gulf, Egyptian như các checkpoint riêng biệt — thì con đường mô hình nhỏ trở thành một câu trả lời thực sự hoàn chỉnh cho khu vực, và lập luận về độ bao phủ trở nên khó đưa ra hơn nhiều.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Không cái nào trong số này là mô hình giọng nói do chúng tôi vận hành, nhưng lớp nằm trên bản ghi âm thì có thể định tuyến - hơn 200 mô hình đằng sau một API key theo giá niêm yết của nhà cung cấp với mức markup 0%, nên khi nhà cung cấp giảm giá cho mô hình suy luận phía sau bản ghi âm của bạn, mức giá mới sẽ có hiệu lực ngay trong cùng ngày.

Chuyển đổi dự phòng tự động nghĩa là một pipeline giọng nói được ghép nối có ít hơn một miền lỗi, bởi vì trình tóm tắt hoặc bộ phân loại ý định sử dụng bản chép lời có thể được định tuyến lại thay vì bị sập cùng với nhà cung cấp.