
VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: Hai đối thủ Streaming, cách nhau một ngày
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Trong khoảng 36 giờ vào đầu tháng 9 năm 2026, {{1}}hai phòng thí nghiệm lớn đã trình làng các mô hình chuyển giọng nói thành văn bản theo thời gian thực với cùng một lời hứa đáng chú ý — một bản phiên âm trực tiếp cũng cho bạn biết ai nói gì ngay khi lời nói được cất lên.{{/1}} Vào ngày 1 tháng 9, Meta Superintelligence Labs ra mắt Muse Voice Transcribe dưới dạng dịch vụ API trực tuyến, với giá 3,00 USD cho mỗi 1.000 phút âm thanh, tức khoảng 0,18 USD một giờ, gói gọn khả năng nhận dạng theo thời gian thực, phân tách người nói cho hơn 20 người và xác định điểm kết thúc lượt nói trong một lần xử lý. Vào ngày 2 tháng 9, Microsoft Research đăng tải VibeVoice-ASR-Streaming-7B lên Hugging Face: {{2}}trọng số mở theo giấy phép MIT, không kèm bất kỳ thông báo nào, chỉ có một thẻ mô hình tuyên bố khả năng phiên âm theo thời gian thực gán từng lời cho đúng người nói, hỗ trợ hotwords và 10 ngôn ngữ, mà không hề được triển khai dưới dạng dịch vụ đám mây ở bất cứ đâu.{{/2}} Cùng một lời chào hàng, mô hình kinh doanh trái ngược nhau, {{3}}và bằng chứng từ cả hai phía đều mỏng hơn những gì họ muốn bạn tin.{{/3}}
Trang này được viết theo dạng những gì chúng ta biết cho đến nay, vì cả hai mô hình đều không có con số độ chính xác được xác minh độc lập. Các số liệu của Muse Voice Transcribe là công bố ngày ra mắt của Meta, do nhà cung cấp báo cáo và chưa được tái kiểm chứng; VibeVoice-ASR-Streaming-7B chưa công bố bất kỳ con số độ chính xác streaming nào dưới dạng văn bản. Do đó, phần so sánh dưới đây dựa trên những gì mang tính cấu trúc và có thể kiểm chứng — kiến trúc, giá cả, giấy phép, hành vi được ghi nhận — và gắn nhãn cho vài con số từ nhà cung cấp khi chúng xuất hiện.
Hai thách thức đối với batch pipeline, chỉ cách nhau một ngày
Cả hai mô hình đều tấn công cùng một giả định: rằng chuyển giọng nói thành văn bản là thứ bạn chạy trên một bản ghi đã hoàn tất. Muse Voice Transcribe là sản phẩm đầu tiên Meta gọi là "mô hình cảm nhận âm thanh thời gian thực" — một lượt xử lý theo luồng duy nhất thực hiện nhận dạng, phân tách người nói trên hơn hai mươi giọng nói, và phát hiện điểm kết thúc, tức xác định khi nào người nói đã thực sự nói xong chứ không chỉ tạm dừng. Nó ra mắt đồng thời trên ba bề mặt: Meta Model API với giá $0.18 mỗi giờ âm thanh, Meta AI cho Mac — nơi giữ phím Fn để đọc chính tả vào bất kỳ ứng dụng nào — và Muse Code. VibeVoice-ASR-Streaming-7B của Microsoft là thành viên xử lý theo luồng của gia đình nguồn mở VibeVoice, và dấu vết phát hành của nó âm thầm hơn nhiều: một kho lưu trữ Hugging Face được tạo ngày 2 tháng 9 (dấu thời gian cho thấy 15:46 UTC, được chạm lần cuối ba phút sau đó), tám mảnh safetensors theo giấy phép MIT, và một dòng nhật ký tin tức đề ngày 3 tháng 9 trong kho GitHub microsoft/VibeVoice mô tả nó là "một mô hình ASR theo luồng thống nhất, liên tục phiên âm ai nói gì khi giọng nói đến, hỗ trợ từ kích hoạt tùy chỉnh và 10 ngôn ngữ." Một ngày sau khi tải lên, nó vẫn hiển thị không có lượt tải xuống nào.

Sự xung đột tính năng
• Cơ chế streaming — Muse Voice Transcribe nhận âm thanh thành từng khối 80 mili-giây và chốt các từ ngay khi chúng ổn định, còn VibeVoice-ASR-Streaming-7B xử lý các khối ~2,9 giây với ~0,5 giây nhìn trước, xuất văn bản một lần cho mỗi khối đã hoàn tất.
• Gán nhận diện người nói — hơn 20 người nói trong một lần xử lý, tỷ lệ lỗi phân đoạn người nói trung bình 17,5% do nhà cung cấp báo cáo so với đầu ra "ai nói gì" theo luồng được công bố trên thẻ mô hình, chưa được xác minh.
• Endpointing — tích hợp sẵn: luồng dữ liệu mang ranh giới kết thúc phát ngôn so với việc không được mô tả như một tín hiệu đầu ra.
• Kiểm soát ngữ cảnh — biasing ngôn ngữ, từ khóa và ngữ cảnh so với hotword tùy chỉnh thông qua prompt ngữ cảnh (--context_info).
• Ngôn ngữ — được huấn luyện trên 70+ ngôn ngữ, 25 ngôn ngữ được kiểm chứng kỹ lưỡng khi ra mắt, code-switching tự nhiên, so với con số công bố là 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Bằng chứng — tuyên bố của nhà cung cấp trong ngày ra mắt: 3,1% WER trên các kết quả cuối cùng tại 0,16 giây sau khi phát âm, 3,6% trên các kết quả một phần đầu tiên, viện dẫn bảng xếp hạng phát trực tiếp của Artificial Analysis trong khi không có số liệu WER hoặc độ trễ phát trực tiếp nào được công bố dưới dạng văn bản.
• Chi phí và giấy phép — $0,18 mỗi giờ âm thanh, dùng dịch vụ lưu trữ, trọng số đóng so với $0 cho trọng số (MIT), khoảng 18 GB bf16, tự lưu trữ.

Hai khái niệm rất khác nhau về "phát trực tuyến"
Từ "streaming" bao trùm một dải nhịp độ rất rộng, và khoảng cách giữa hai mức này đủ lớn để thay đổi những gì bạn có thể xây dựng trên mỗi mức. Muse Voice Transcribe phát trực tiếp theo mức độ chi tiết của từng từ. Kiến trúc của Meta tiêu thụ âm thanh theo các khối 80 mili-giây và sử dụng cái gọi là "độ trễ thích ứng" — một chính sách độ trễ được học thông qua học tăng cường, cam kết xuất ra từng từ ngay khi mô hình đủ tự tin, đồng thời giữ nhiều ngữ cảnh hơn cho những từ mà mô hình kém chắc chắn hơn thay vì áp dụng một ngân sách độ trễ cố định. Nhà cung cấp tuyên bố bản phiên mã cuối cùng xuất hiện 0,16 giây sau khi người nói dừng và các kết quả tạm thời đầu tiên xuất hiện sau 0,13 giây. Nhịp độ đó được thiết kế cho các vòng lặp tương tác: phụ đề trực tiếp, đọc chính tả, một trợ lý giọng nói cần phản hồi gần như ngay lập tức sau khi người dùng nói xong một câu.
VibeVoice-ASR-Streaming-7B phát trực tuyến ở mức hạt thô hơn. Cấu hình bộ tiền xử lý của nó cho thấy âm thanh đầu vào ở tần số 24 kHz được nén 3.200 lần thành các token với tốc độ khoảng 7,5 khung hình mỗi giây, sau đó được xử lý thành từng khối 22 khung hình với 4 khung hình nhìn trước — tức khoảng 2,9 giây âm thanh mỗi khối, khoảng nửa giây nhìn trước; các con số này được suy ra từ cấu hình chứ không phải từ độ trễ đo được. Văn bản được xuất ra ngay khi mỗi khối xử lý xong, ngữ cảnh từ các khối trước được giữ lại qua KV cache, nhờ đó một phiên dài không phải tính toán lại từ đầu. Một bản transcript tăng dần theo từng nấc khoảng ba giây là phù hợp cho ghi chú cuộc họp và phân tích cuộc gọi; đó là một sản phẩm khác với kiểu truyền phát từng từ trong thời gian dưới một giây dành cho hội thoại trực tiếp. Cả hai phòng thí nghiệm đều chưa công bố phép đo độ trễ đầu cuối cho checkpoint streaming, vì vậy hãy coi nhịp độ này là thiết kế còn cảm giác thực tế là điều chưa được kiểm chứng.
Nhãn người nói và xác định điểm kết thúc lời nói: được tích hợp sẵn trên một bên, chỉ được tuyên bố là có trên bên còn lại.
Gán nhãn người nói là lĩnh vực mà các sản phẩm streaming thường thổi phồng nhất, và cả hai đều khẳng định điều này. Bản triển khai của Muse Voice Transcribe mang tính cụ thể và có cấu trúc: bước phân tách người nói (diarization) chạy ngay trong cùng một lần xử lý streaming với bước nhận dạng giọng nói, nên bản ghi âm cuộc gọi hai mươi người có thể kèm nhãn riêng cho từng người nói mà không cần thao tác "tải lên, chờ đợi, nhận lại danh sách người nói" một cách riêng biệt; Meta công bố tỷ lệ lỗi diarization trung bình là 17,5% — con số từ phía nhà cung cấp, chưa được kiểm chứng lại, nhưng gắn với một cơ chế hoạt động thực. Công cụ này cũng đưa ra ranh giới điểm kết thúc, một khả năng ít được nói đến: ứng dụng nhận được tín hiệu rõ ràng ngay khi "lượt nói của người này đã kết thúc" mà không cần tự dựng bộ phát hiện hoạt động giọng nói — đây cũng là lý do các trợ lý thoại xây trên nền ASR thô thường hay cắt ngang lời người dùng.
VibeVoice-ASR-Streaming-7B tuyên bố trên thẻ mô hình của mình rằng nó hỗ trợ đầu ra phát trực tuyến kiểu “ai nói gì”, phù hợp với đầu ra có cấu trúc Who/When/What của VibeVoice-ASR bản batch — nhưng với checkpoint phát trực tuyến, tuyên bố này chưa được xác minh, chưa có bài kiểm tra độc lập nào tái tạo được kết quả, và cũng không có tín hiệu endpointing được ghi chép như loại mà Muse cung cấp. Nếu khối lượng công việc của bạn thực sự là âm thanh trực tiếp đa người nói, thì Muse hiện đang mang đến một cơ chế hoàn chỉnh hơn; còn nếu bạn đang đánh giá liệu một mô hình trọng số mở có thể làm được cùng việc đó trên phần cứng bạn kiểm soát hay không, thì tuyên bố của VibeVoice chính là thứ bạn nên thử nghiệm bằng chính bản ghi cuộc họp của mình trước khi tin vào nó.
Bằng chứng: các tuyên bố ngày ra mắt so với một tấm thẻ trống
Cần phải chính xác về những gì mỗi bên có, vì không bên nào có thứ mà người mua thực sự muốn. Muse Voice Transcribe có một tập hợp số liệu từ nhà cung cấp dày đặc — tỷ lệ lỗi từ 3.1% trên bản ghi cuối, 3.6% trên các bản ghi từng phần đầu tiên, độ trễ cuối cùng 0.16 giây, lỗi diarization trung bình 17.5% — tất cả được Meta công bố vào ngày ra mắt và trỏ tới bảng xếp hạng nhận dạng giọng nói thành văn bản theo thời gian thực của Artificial Analysis, nơi Meta tuyên bố chiếm vị trí dẫn đầu. Đó là những tuyên bố, chưa được bất kỳ ai bên ngoài phòng thí nghiệm tái lập, nhưng chúng đủ cụ thể để có thể bác bỏ, và đó là một loại tiến bộ.
VibeVoice-ASR-Streaming-7B không có gì trong số đó. Model card của nó đưa ra một con số đánh giá dưới dạng hình ảnh, còn báo cáo kỹ thuật về streaming là một file PDF, nhưng không có con số WER hay độ trễ streaming nào có thể trích dẫn được trong phần văn bản. Mốc số liệu duy nhất trong dòng VibeVoice là bảng do nhà cung cấp công bố trong model card của bản batch VibeVoice-ASR — WER trung bình 7,77% trên tám bộ kiểm tra tiếng Anh, 2,20% trên LibriSpeech clean — và đó rõ ràng không phải con số của checkpoint này. Khi một tuyên bố ngày ra mắt đối diện với một model card trống trơn, tiêu chí phân xử trung thực là mọi thứ trừ con số WER tiêu đề: giá cả, giấy phép, nhịp phát streaming, và các tính năng mà mỗi bên thực sự ghi lại.
Ngôn ngữ: 25 đã xác minh so với 10 đã khai báo.
Độ phủ ngôn ngữ là yếu tố phân biệt hai sản phẩm rõ rệt hơn các tuyên bố về độ chính xác trên tiêu đề. Muse Voice Transcribe được huấn luyện trên 70+ ngôn ngữ, nhưng Meta chỉ xác thực 25 ngôn ngữ khi ra mắt — và danh sách được xác thực, chứ không phải danh sách huấn luyện, mới là phạm vi hỗ trợ trong thực tế. Điểm khác biệt nằm ở khả năng chuyển mã ngôn ngữ được tích hợp sẵn: mô hình được thiết kế để tự động chuyển ngôn ngữ giữa chừng câu mà không cần được chỉ định. VibeVoice-ASR-Streaming-7B khai báo 10 ngôn ngữ trong thẻ mô hình — tiếng Anh, tiếng Trung, tiếng Tây Ban Nha, tiếng Bồ Đào Nha, tiếng Đức, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Nga, tiếng Ý — so với hơn 50 ngôn ngữ của VibeVoice-ASR phiên bản batch. Nếu lưu lượng của bạn bao gồm hội thoại chuyển mã ngôn ngữ, Muse có đề xuất trúng đích cụ thể hơn; nếu lưu lượng nằm trong mười ngôn ngữ kể trên, phạm vi của mô hình Microsoft ít nhất cũng được nêu rõ ràng, điều mà hầu hết tài liệu ra mắt không mang lại.
Chi phí và những gì bạn giữ lại
Sự khác biệt về mô hình kinh doanh là tiêu chí rõ ràng nhất để quyết định. Muse Voice Transcribe với giá 0,18 USD mỗi giờ âm thanh có giá niêm yết thấp hơn mọi API phiên âm theo luồng chủ đạo — không cần GPU, không vận hành hạ tầng, trọng số đóng, và mức giá do Meta đặt ra. VibeVoice-ASR-Streaming-7B miễn phí tải xuống nhưng cần khoảng 18 GB trọng số bf16 trước KV cache để tự lưu trữ trên GPU hạng 24 GB, với các script demo microsoft/VibeVoice hoặc plugin vLLM là các đường dẫn phục vụ được mô tả trong tài liệu, và hiện chưa có nhà cung cấp suy luận nào lưu trữ mô hình này. Giấy phép MIT là tài sản bền vững: trọng số thuộc về bạn để giữ và tinh chỉnh — điều mà không một gói đăng ký API nào có được. Bức tranh giá cũng sẽ trở nên thú vị ngay tại điểm này — khi một nhà cung cấp thực sự lưu trữ checkpoint mở, mức 0,18 USD một giờ sẽ trở thành giá thị trường thay vì giá niêm yết của một nhà cung cấp duy nhất, và đó chính xác là tình huống mà một bộ định tuyến chuyển tiếp (pass-through router) chứng tỏ được giá trị của mình. OrcaRouter hiện không định tuyến các tác vụ chuyển giọng nói thành văn bản, và cả hai mô hình này đều không nằm trong danh mục của nó; điều nó làm là chuyển tiếp giá niêm yết của nhà cung cấp với mức tăng giá 0% cho hơn 200 mô hình ngôn ngữ sử dụng bản phiên âm trực tiếp, nên bất kỳ đợt giảm giá nào của nhà cung cấp trong stack đó cũng có hiệu lực phía người mua ngay trong ngày được công bố.

Các câu hỏi thường gặp
Chỉ số WER 3,1% của Muse Voice Transcribe có nghĩa là nó chính xác hơn VibeVoice-ASR-Streaming-7B không?
Không, và sự so sánh này chưa có ý nghĩa. Con số 3,1% của Meta là tuyên bố vào ngày ra mắt cho đường dẫn phát trực tuyến, do nhà cung cấp báo cáo và chưa được kiểm chứng độc lập. VibeVoice-ASR-Streaming-7B chưa công bố bất kỳ con số độ chính xác phát trực tuyến nào trong văn bản. Cho đến khi cả hai mô hình được chạy qua cùng một bộ đánh giá công khai trên cùng một dữ liệu âm thanh, phát biểu trung thực duy nhất là Muse có một tuyên bố cụ thể có thể kiểm tra được còn VibeVoice thì chưa có.
Tôi có thể sử dụng một trong hai mô hình cho âm thanh đã được ghi âm sẵn không?
Đúng cho cả hai, nhưng dưới những dạng khác nhau. Muse Voice Transcribe xử lý được các bản ghi âm dài hơn một giờ thông qua cùng một API streaming. Plugin vLLM của VibeVoice-ASR-Streaming-7B cung cấp một endpoint để transcribe toàn bộ tệp bên cạnh endpoint stream WebSocket của nó. Nhưng cả hai đều được thiết kế và định giá cho trường hợp phát trực tiếp — Muse do mô hình kinh doanh chỉ có streaming, còn VibeVoice do kiến trúc phân đoạn xuất dữ liệu ngay khi âm thanh đến — vì vậy nếu khối lượng công việc của bạn chỉ thuần túy là các tệp xử lý theo lô, một API phiên âm tệp chuyên dụng thường sẽ rẻ hơn và cho kết quả đo lường tốt hơn so với cả hai.
