Một thẻ tiêu đề chính so sánh 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo', có dòng overline 'Open-weights ASR - Tháng 9/2026', phụ đề ghi: checkpoint phát trực tuyến của Microsoft gặp gỡ lựa chọn mặc định open-weights - điều mà streaming bổ sung, và cái giá phải trả khi dùng 0.8B so với 9B tham số; kèm các chip 'MIT weights - 2/9', 'MIT weights - 2024' và 'Whisper: 99 ngôn ngữ', cùng chú thích cuối trang 'thành tích của Whisper được công khai'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

VibeVoice-ASR-Streaming-7B so với Whisper Large v3 Turbo: Checkpoint Streaming của Microsoft bổ sung gì cho bản mặc định open-weight?

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trong phần lớn hai năm qua, câu trả lời cho nhu cầu “tự phiên âm, chi phí thấp” là Whisper Large v3 Turbo — mô hình open-weights 809 triệu tham số của OpenAI, được cấp phép MIT, hỗ trợ 99 ngôn ngữ, đủ nhỏ để chạy trên một máy trạm và miễn phí khi bạn đã sở hữu phần cứng. Ngày 2 tháng 9 năm 2026, Microsoft Research đã đăng tải một đối thủ cho lựa chọn mặc định đó: VibeVoice-ASR-Streaming-7B, một checkpoint streaming được cấp phép MIT trên Hugging Face, phiên âm ngay khi âm thanh đến, tuyên bố tạo đầu ra có gán nhãn người nói, và — không giống mô hình mà hầu hết các đội ngũ đang chạy — chưa bao giờ được thiết kế như một tác vụ xử lý theo mẻ. Cả hai mô hình đều là open weights từ các phòng thí nghiệm lớn. Gần như mọi thứ khác giữa chúng đều là một sự đánh đổi, và trang này nói về việc bạn thực sự đang chọn sự đánh đổi nào.

Một sự bất đối xứng chi phối toàn bộ phép so sánh này, nên xin nói trước. Whisper Large v3 Turbo là mô hình nhận dạng tiếng nói được tái lập độc lập nhiều nhất thế giới: các chỉ số word-error của nó đã được hàng nghìn nhóm chạy lại trên các benchmark công khai và trên audio của chính họ suốt nhiều năm, đồng thời điểm yếu của nó cũng được ghi chép kỹ lưỡng như điểm mạnh. VibeVoice-ASR-Streaming-7B mới chỉ ra đời được một ngày, chưa có benchmark độc lập nào ở bất kỳ đâu, và Microsoft cũng chưa công bố tỷ lệ lỗi từ (WER) streaming dưới dạng văn bản đọc được. Mọi thứ về phía Microsoft dưới đây đều được đọc trực tiếp từ repository — config, model card và tài liệu streaming của Microsoft — và được gắn nhãn rõ ràng như vậy.

Lựa chọn mặc định về trọng số mở, và vì sao nó vẫn tồn tại

Whisper Large v3 Turbo là phiên bản chưng cất của Whisper Large v3: nó giữ nguyên bộ mã hóa 32 lớp và cắt bộ giải mã từ 32 lớp xuống còn bốn, nhờ đó số tham số giảm xuống còn 809M và thông lượng trên GPU tăng gấp khoảng bốn lần trong khi độ chính xác vẫn gần như tương đương. Vì trọng số được phát hành theo giấy phép MIT và mô hình nhỏ gọn, nó đã trở thành công cụ chuyển âm nhúng mặc định cho các bot họp, công cụ phụ đề và quy trình ghi lại cuộc gọi. Những hạn chế của nó cũng được biết đến rộng rãi. Đây là mô hình xử lý theo lô — nó nhận một tệp âm thanh và trả về bản chuyển âm, thay vì tạo ra từ ngữ ngay khi chúng được nói. Nó không được huấn luyện cho nhiệm vụ dịch máy, và khi làm nhiệm vụ đó thì kết quả suy giảm nghiêm trọng. Độ chính xác của nó với giọng nói ồn ào, có trọng âm hoặc chồng lấn không đồng đều, và nó trả về văn bản thuần: không có dấu câu hoặc viết hoa theo mặc định, không tách người nói, không có dấu thời gian trong biến thể này, không có kỹ thuật thiên vị từ khóa. Các hệ thống sản xuất xây dựng trên Whisper phải lắp ráp những thành phần đó một cách riêng rẽ, mỗi thành phần lại thêm độ trễ và kiểu lỗi riêng.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Khoảng trống đặc tả

• Tham số — 809M ({{1}}bộ giải mã đã chưng cất{{/1}}) so với tổng cộng khoảng 9B (lõi ngôn ngữ Qwen2-7B cộng với bộ mã hóa giọng nói; con số {{2}}"7B"{{/2}} tính riêng LLM, còn trang Hugging Face ghi 9B).

• Giấy phép — MIT, trọng số mở, cả hai.

• Streaming — vốn được thiết kế để xử lý theo lô: các triển khai streaming tự lưu trữ thường đạt độ trễ 1–5 giây so với streaming nguyên bản: các khối ~2,9 giây với ~0,5 giây nhìn trước, văn bản được phát ra theo từng khối, ngữ cảnh được duy trì trong bộ đệm KV.

• Ngôn ngữ — 99 ngôn ngữ được cộng đồng tái tạo qua nhiều năm so với 10 ngôn ngữ được công bố (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Ngoài bản ghi thoại — mặc định không có gì, so với đầu ra phát trực tiếp phân biệt ai nói gì được quảng cáo và các từ kích hoạt tùy chỉnh (chưa được xác minh).

• Độ chính xác được công bố — 2.1% WER trên LibriSpeech test-clean, 4.2% trên test-other, ~7.7% trên tổ hợp Open ASR, 8–12% trên âm thanh nhiễu trong thử nghiệm cộng đồng, tất cả đều được tái lập độc lập, trong khi không có chỉ số WER streaming nào được công bố dưới dạng văn bản.

• Mức chiếm dụng tài nguyên — chạy được trên laptop hoặc một GPU đơn tầm trung, so với khoảng 18 GB trọng số bf16 trước bộ đệm KV; hãy dự trù một GPU tầm 24 GB.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): parameters - about 9B (Qwen2-7B + encoders); streaming - native, ~2.9 s chunks; WER in print - none in text; output extras - claimed speaker IDs + hotwords; languages - 10 declared; hardware - ~18 GB bf16, 24 GB-class GPU. Right column Whisper Large v3 Turbo (open weights, released 2024): 809M distilled; batch, 1-5 s self-host streaming; 2.1% / 4.2% LibriSpeech, ~7.7% Open ASR; none by default; 99; laptop to small GPU. Footer: 'Whisper WER independently reproduced. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Điều mà việc phát trực tuyến thực sự mang lại

Lý do để nhìn xa hơn Whisper Large v3 Turbo chính là phân khúc trực tiếp, và đây là nơi hai mô hình không còn có thể so sánh được nữa. Whisper theo hướng xử lý theo lô: để lấy được lời nói khi người nói vẫn đang nói, các đội ngũ phải gắn thêm khối phân đoạn, phát hiện hoạt động giọng nói và mã kết dính, và các triển khai phát trực tiếp tự lưu trữ thường rơi vào độ trễ từ một đến năm giây — không đạt được mốc dưới một giây cho agent điện thoại và phụ đề trực tiếp nếu không có kỹ thuật nghiêm túc. VibeVoice-ASR-Streaming-7B được xây dựng cho phân khúc đó. Cấu hình của nó cho thấy âm thanh được nén 3.200× thành luồng token 7,5 khung hình mỗi giây, được xử lý theo khối 22 khung hình với tầm nhìn trước bốn khung hình — khoảng 2,9 giây âm thanh mỗi khối — với văn bản được xuất ra khi mỗi khối hoàn tất và ngữ cảnh trước đó được giữ trong bộ đệm KV, nhờ vậy một phiên không phải tính toán lại từ đầu. Nhịp độ đó là một thiết kế suy ra từ cấu hình, không phải độ trễ được đo lường, và chưa ai công bố con số đầu cuối cho nó; nhưng kiến trúc này rõ ràng là một kiến trúc phiên âm trực tiếp theo cách mà Whisper không phải.

Thành tích của Whisper đã lâu dài và công khai; còn của checkpoint mới thì vẫn trống rỗng.

Ở khía cạnh độ chính xác, {{1}}tuổi đời của Whisper Large v3 Turbo lại là một lợi thế{{/1}}. Các chỉ số {{2}}WER 2.1% trên LibriSpeech test-clean và 4.2% trên test-other{{/2}} là {{3}}những con số open-weights được vô số nhóm nghiên cứu tái lập{{/3}}; mức {{4}}khoảng 7.7% trên chỉ số tổng hợp của bảng xếp hạng Open ASR{{/4}} kém {{5}}khoảng một điểm so với bản Large v3 đầy đủ{{/5}}; và mức {{6}}8–12% được ghi nhận trên âm thanh bị nhiễu trong các thử nghiệm cộng đồng{{/6}} có nghĩa là {{7}}không ai còn bất ngờ về nó{{/7}}. {{8}}Những điểm yếu này đều nằm trong hồ sơ được ghi nhận{{/8}} — {{9}}chúng cho bạn biết chính xác mô hình cần được hỗ trợ ở đâu trước khi bạn xây dựng dựa trên nó{{/9}}.

VibeVoice-ASR-Streaming-7B không có bất kỳ hồ sơ thành tích nào như vậy. Thẻ mô hình của nó cung cấp số liệu đánh giá dưới dạng hình ảnh, còn báo cáo kỹ thuật về streaming của Microsoft là một tệp PDF, nhưng không có con số tỷ lệ lỗi từ (WER) streaming nào có thể trích dẫn ở dạng văn bản. Mốc số liệu duy nhất trong dòng mô hình này là bảng do nhà cung cấp công bố trên thẻ VibeVoice-ASR batch — WER trung bình 7,77% trên tám bộ kiểm tra tiếng Anh và 2,20% trên LibriSpeech clean — vốn không phải con số của checkpoint này, và bản thân mô hình batch cũng nhận được phản hồi trái chiều từ cộng đồng: được khen nhờ khả năng tách người nói (diarization) dùng ngay không cần tinh chỉnh, nhưng bị chê là nặng nề và đôi khi dễ bị "ảo giác" (hallucination). Không điều nào trong số đó áp dụng được cho mô hình streaming, và đó chính là điểm mấu chốt: với Whisper, bạn biết trước các kiểu lỗi sẽ gặp; còn với VibeVoice-ASR-Streaming-7B, bạn chính là người thử nghiệm đầu tiên.

Ngôn ngữ và dung lượng: 99 so với 10, 0,8B so với 9B

Hai chi phí cụ thể nhất của việc chuyển đổi là ngôn ngữ và kích thước. Whisper Large v3 Turbo phiên âm 99 ngôn ngữ; các ngôn ngữ ít tài nguyên và ngôn ngữ thanh điệu bị suy giảm chất lượng — tiếng Thái, tiếng Quảng Đông và tiếng Wales là những điểm yếu thường được nhắc đến — nhưng danh sách này đã được cộng đồng kiểm chứng trong nhiều năm. VibeVoice-ASR-Streaming-7B công bố mười ngôn ngữ: tiếng Anh, tiếng Trung, tiếng Tây Ban Nha, tiếng Bồ Đào Nha, tiếng Đức, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Nga và tiếng Ý. Nếu lưu lượng truy cập của bạn nằm trong mười ngôn ngữ đó thì độ phủ không phải là vấn đề; nếu không thì sự so sánh kết thúc tại đây. Kích thước là chi phí thứ hai: 809 triệu tham số chạy được trên một chiếc laptop, trong khi tổng cộng khoảng 9 tỷ tham số ở định dạng bf16 đồng nghĩa với khoảng 18 GB trọng số trước khi tính KV cache và cần một GPU hạng 24 GB để phục vụ một cách thoải mái. Với những đội ngũ đã chạy Whisper trên phần cứng vừa phải, đây là một bước tiến thực sự về hạ tầng, chỉ hợp lý khi thực sự có nhu cầu phiên âm trực tiếp.

Khi miễn phí không phải là mấu chốt

Whisper Large v3 Turbo miễn phí để chạy; chi phí nằm ở phần cứng và kỹ thuật xung quanh nó. Một triển khai faster-whisper trên một chiếc T4 duy nhất tiêu tốn khoảng $0,05–$0,10 cho mỗi giờ âm thanh theo giá GPU hiện hành, và khi chạy tải liên tục, bạn còn phải xây dựng thêm bộ xử lý diarization và dấu câu vì Whisper chỉ trả về văn bản thô. VibeVoice-ASR-Streaming-7B cũng miễn phí để chạy, trên phần cứng đắt hơn, đổi lại là một kiến trúc streaming được quảng cáo là sở hữu khả năng gán người nói và kiểm soát ngữ cảnh mà Whisper thiếu — những tuyên bố mà bạn sẽ phải tự mình kiểm chứng, vì không có một điểm chuẩn độc lập nào cả. Với phiên âm hàng loạt khối lượng lớn, thông lượng và mức chiếm dụng tài nguyên cực nhỏ của Whisper vẫn thắng thế. Với âm thanh trực tiếp nhiều người nói cần bản phiên âm xuất hiện ngay trong lúc trò chuyện, Whisper đang đi ngược lại thiết kế của chính nó, còn checkpoint streaming thì đi cùng thiết kế ấy — nếu như nó thực sự hoạt động, và đó chính là câu hỏi mà bạn phải tự trả lời bằng chính âm thanh của mình trên chính GPU của mình.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Bộ công nghệ thực dụng

Câu trả lời phổ biến nhất trong thực tế không phải là "một trong hai" mà là "cả hai", và đó là khuyến nghị ở đây: giữ Whisper Large v3 Turbo làm luồng xử lý hàng loạt khối lượng lớn, nơi thành tích và dấu chân tài nguyên khiến nó khó bị đánh bại, đồng thời đánh giá VibeVoice-ASR-Streaming-7B trên luồng trực tiếp mà Whisper không thể phục vụ với độ trễ yêu cầu — kèm theo một tiêu chí đánh giá rõ ràng, bởi vì không có benchmark nào để dựa vào. Hai mô hình có thể dùng chung một ngân sách GPU và một codebase. Chỗ mà một lớp định tuyến thực sự chứng tỏ giá trị của nó trong ngăn xếp đó là lớp phía trên các bản phiên âm, chứ không phải bản thân khâu phiên âm: OrcaRouter hiện không định tuyến chuyển giọng nói thành văn bản và cả hai mô hình đều không nằm trong danh mục của nó, nhưng các bộ tóm tắt, quy tắc cảnh báo và bộ lập kế hoạch tác nhân tiêu thụ một bản phiên âm trực tiếp lại chính là nhóm hơn 200 mô hình ngôn ngữ mà nó làm cổng kết nối chỉ với một API duy nhất, với giá niêm yết của nhà cung cấp được chuyển thẳng không đội giá, cùng khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp. Một checkpoint phát trực tiếp ra mắt mà không kèm một benchmark nào cũng xứng đáng được đối xử như bất kỳ mô hình chưa được kiểm chứng nào — một phần lưu lượng thực tế nằm sau cơ chế dự phòng, để giành được hoặc đánh mất lòng tin của bạn dựa trên bằng chứng từ chính các cuộc họp của bạn thay vì dựa vào thẻ mô hình.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube