Một thẻ tiêu đề chính được tạo cho 'VibeVoice-ASR-Streaming-1.5B so với NVIDIA Parakeet TDT 0.6B: ứng viên MIT chưa được kiểm chứng thách thức nhà vô địch Open ASR', với phụ đề 'Lựa chọn mặc định đã được chứng minh đối đầu kẻ thách thức chỉ mới một ngày tuổi', cùng hai thẻ mô hình — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 thg 9, 2026 · MIT · Chưa công bố điểm chuẩn) và NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 thg 5, 2025 · CC-BY-4.0 · Open ASR số 1 kể từ tháng 5/2025) — và các thẻ ghi '6,05% WER trung bình (Parakeet)', 'Cách nhau 16 tháng' cùng 'Ai-nói-gì + hotwords (Microsoft, chưa xác minh)'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B so với NVIDIA Parakeet TDT 0.6B: một thách thức MIT chưa được kiểm chứng trước nhà vô địch Open ASR.

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nếu bạn cần giải pháp chuyển giọng nói thành văn bản mã nguồn mở để đưa vào sản xuất ngay hôm nay, có một lựa chọn mặc định, và tên của nó là NVIDIA Parakeet TDT 0.6B. Kể từ tháng 5 năm 2025, Parakeet TDT 0.6B v2 với 600 triệu tham số đã giữ vị trí số một trên bảng xếp hạng Hugging Face Open ASR với tỷ lệ lỗi từ trung bình 6,05% — một vị trí mà các bên thứ ba đã tái lập trong hơn một năm nay. Đối thủ tiềm năng mới nhất là VibeVoice-ASR-Streaming-1.5B, được Microsoft Research đăng tải vào ngày 2 tháng 9 năm 2026 — mười sáu tháng sau Parakeet, dưới giấy phép MIT, với câu chuyện về gán nhận dạng người nói theo luồng và, cho đến nay, chưa công bố bất kỳ con số độ chính xác nào. Trang này so sánh nhà vô địch và kẻ thách thức dựa trên bằng chứng, kiến trúc và những gì mỗi mô hình thực sự cung cấp ngay khi sử dụng.

Trước khi xét tới thông số, hai cái nhãn gắn trên mỗi bên đã quan trọng, vì chúng định hình toàn bộ cuộc so tài này. Các con số của Parakeet đã được chốt: WER trung bình 6,05% và con số thông lượng RTFx ~3.386 làm nền tảng cho tuyên bố "một giờ âm thanh trong khoảng một giây" đã nằm trên bảng xếp hạng công khai và trong tài liệu của NVIDIA hơn một năm nay. Về phía VibeVoice-ASR-Streaming-1.5B, những gì có thể biết chỉ là thông tin rút ra từ kho lưu trữ của nó — thẻ mô hình, tệp cấu hình và tài liệu về tính năng streaming của Microsoft — vì Microsoft chưa công bố dưới dạng văn bản con số WER, độ trễ hay thông lượng nào, và tại thời điểm bài viết này, chưa có điểm chuẩn độc lập nào cho checkpoint. Trong mọi so sánh dưới đây, một cột đã qua thử lửa thực chiến; cột còn lại chỉ là bảng thông số kỹ thuật.

Cách nhau mười sáu tháng và một thời kỳ thống trị bảng xếp hạng.

Parakeet TDT 0.6B v2 ra mắt vào ngày 5 tháng 5 năm 2025, được xem là câu trả lời của NVIDIA cho bài toán nhận dạng giọng nói theo luồng (streaming-ASR): bộ mã hóa FastConformer kết hợp với bộ giải mã transducer theo mã thông báo và thời lượng (TDT), cho phép dự đoán từng token và thời lượng của nó trong một bước duy nhất — một thủ thuật hiệu quả giúp loại bỏ chi phí token rỗng của transducer truyền thống. Mô hình được phát hành theo giấy phép CC-BY-4.0, thân thiện với thương mại, và đã vươn lên dẫn đầu bảng xếp hạng Open ASR nhờ tỷ lệ lỗi từ trung bình 6,05%. Nó cũng mang đến các tính năng sản xuất mà bảng xếp hạng không đo lường — dấu câu, viết hoa, dấu thời gian cấp độ từ — cùng bộ mã hóa toàn chú ý (full-attention) có thể tiếp nhận tối đa 24 phút âm thanh trong một lượt xử lý, khiến nó trở nên hữu ích cho các cuộc họp dài và podcast mà không cần phân khúc quá mạnh tay.

VibeVoice-ASR-Streaming-1.5B là kẻ thách thức đúng nghĩa nhất: nó tồn tại, nó có tài liệu, và hiệu quả hoạt động của nó thì chưa có gì được xác chứng. Dòng tin GitHub của Microsoft, đề ngày 3 tháng 9, công bố một mô hình ASR streaming thống nhất có khả năng "liên tục phiên âm ai nói gì khi lời nói đến", với hotwords và mười ngôn ngữ; cấu hình của checkpoint lại mô tả một truyền thống kỹ thuật hoàn toàn khác biệt — một bộ giải mã mô hình ngôn ngữ thuộc họ Qwen2 được cấp dữ liệu từ các bộ tokenizer âm thanh tích chập, với một đầu khuếch tán tạo ra đầu ra theo từng khối khoảng 2,9 giây và khoảng 0,5 giây lookahead. Trong khi Parakeet là một mô hình tiếng nói chuyên dụng được tinh luyện qua một năm triển khai thực tế, thì VibeVoice-ASR-Streaming-1.5B chỉ là một checkpoint thuộc dòng nghiên cứu mới được hai ngày tuổi.

Sự bất đối xứng về bằng chứng chính là câu chuyện.

Hãy đọc phần còn lại của trang này với một sự thật hiển hiện trước mắt: phép so sánh này chỉ có số liệu ở đúng một phía. Phía Parakeet TDT 0.6B có một năm bảo vệ ngôi vị trên bảng xếp hạng — WER trung bình 6,05% trên các tập kiểm tra tiếng Anh dạng ngắn công khai của Open ASR, ~3.386 RTFx ở batch 128 trên phần cứng NVIDIA, cùng hệ sinh thái công cụ triển khai NeMo, tăng tốc TensorRT và lượng tử hóa FP8 đã được kiểm chứng trong môi trường sản xuất. Phía VibeVoice-ASR-Streaming-1.5B có con số đánh giá trên model card, vốn là hình ảnh chứ không phải văn bản, và WER trung bình 7,77% do nhà cung cấp báo cáo trên model card của VibeVoice-ASR batch, tính trên tám tập kiểm tra tiếng Anh — một con số mô tả mô hình non-streaming và không thể áp dụng cho checkpoint này. Mô hình thách thức có thể rất xuất sắc; vấn đề là chữ "có thể" đó chính là toàn bộ cơ sở bằng chứng.

Kiểm tra thông số kỹ thuật

• Tham số — NVIDIA Parakeet TDT 0.6B: 600M, bộ mã hóa FastConformer + bộ giải mã TDT so với VibeVoice-ASR-Streaming-1.5B: tổng ~3B (backbone Qwen loại 1.5B cộng với tokenizer và diffusion head).

• Phát hành — 5 tháng 5, 2025 so với 2 tháng 9, 2026.

• Độ chính xác — WER trung bình 6.05%, Open ASR #1 kể từ tháng 5/2025, được bên thứ ba tái lập trong khi không có công bố nào.

• Tốc độ — ~3,386 RTFx ở batch 128 trên phần cứng NVIDIA, ~1 giờ âm thanh mỗi giây so với không có số liệu thông lượng nào được công bố.

• Streaming — hỗ trợ streaming với ngữ cảnh full-attention lên tới 24 phút mỗi lượt, so với streaming theo khối: các khối ~2,9 giây với khoảng nhìn trước ~0,5 giây.

• Các thông tin bổ sung ở đầu ra — dấu câu, viết hoa, dấu thời gian cấp độ từ so với tính năng xác định ai-nói-gì theo luồng (chưa được xác minh) và hotwords; 10 ngôn ngữ.

• Giấy phép — CC-BY-4.0 so với MIT.

• Hệ sinh thái — NVIDIA NeMo với TensorRT và FP8 so với các bản demo từ repo microsoft/VibeVoice và plugin vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Bên trong: hai ý tưởng về mục đích của các mô hình giọng nói

Hai kiến trúc này thể hiện hai niềm tin khác nhau về công việc. {{1}}Parakeet TDT 0.6B xem phiên âm là một bài toán xử lý tín hiệu được giải quyết một cách hiệu quả: bộ mã hóa FastConformer trích xuất đặc trưng âm thanh, còn bộ giải mã TDT phát ra đồng thời token văn bản và thời lượng; chính vì vậy mô hình chạy nhanh gấp hàng nghìn lần so với tốc độ thời gian thực và tương thích tốt với bộ công cụ triển khai của NVIDIA.{{/1}} VibeVoice-ASR-Streaming-1.5B lại xem phiên âm như một bài toán ngôn ngữ: nén âm thanh thành một luồng token, {{2}}đưa luồng token đó cho một mô hình ngôn ngữ đã đọc một lượng ngữ cảnh dài tương đương cả một bản phiên âm, rồi để sự hiểu biết của mô hình về việc ai nói gì và cách các cuộc hội thoại khớp nối với nhau{{/2}} đảm nhiệm phần việc còn lại. Chính phần lõi LLM cũng là lý do khiến checkpoint có tới khoảng 3B tham số thay vì 600M, và cũng là lý do Microsoft chưa hề khẳng định khả năng triển khai tại biên — đây là một mô hình cần GPU và dùng bộ nhớ để mang theo ngữ cảnh.

Đối với phiên âm trực tiếp, hệ quả thực tế nằm ở hình thái độ trễ. {{1}}Bộ mã hóa full-attention của Parakeet có thể xử lý các cửa sổ dài trong một lượt duy nhất, một triết lý streaming khác với cơ chế chunk-and-lookahead cố định của VibeVoice-ASR-Streaming-1.5B — khoảng 2,9 giây âm thanh cho mỗi phân đoạn được xuất ra.{{/1}} {{2}}Cả hai đều không phải là bộ phát kết quả từng phần theo từng từ theo phong cách của các API thương mại có độ trễ thấp nhất; cả hai đều là hệ thống dạng khối{{/2}}, {{3}}và lựa chọn phù hợp phụ thuộc vào việc âm thanh của bạn đến dưới dạng các tệp có giới hạn hay một phiên trực tiếp không có điểm kết thúc.{{/3}}

Câu chuyện về tính năng và các khu vực triển khai

Ngay khi triển khai mà chưa cần tùy chỉnh gì, Parakeet TDT 0.6B là sản phẩm phiên âm hoàn chỉnh hơn: {{1}}dấu câu và chữ viết hoa đã nằm sẵn trong bản phiên âm, mốc thời gian theo từng từ có sẵn để căn chỉnh, và các cửa sổ xử lý 24 phút trong một lần duyệt giúp giảm lỗi phân đoạn trên các bản ghi âm dài.{{/1}} VibeVoice-ASR-Streaming-1.5B đáp trả bằng những tính năng Parakeet không liệt kê: {{2}}đầu ra gán nhãn người nói và từ nóng, trên mười ngôn ngữ.{{/2}} Tuyên bố về phân vai theo luồng (streaming diarization) đúng là điều cần được kiểm chứng độc lập — {{3}}ranh giới giữa các phân đoạn là nơi gán nhãn người nói dễ bị lệch{{/3}} — nhưng đó lại là lý do để chọn mô hình của Microsoft thay vì của NVIDIA nếu bạn cần biết ai nói gì trong cuộc họp trực tiếp.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

{{1}}Các khu vực lân cận cũng khác biệt chẳng kém gì các mô hình. {{2}}Parakeet TDT 0.6B là một công dân của NVIDIA NeMo: TensorRT, FP8 và các công cụ triển khai được tinh chỉnh cho GPU NVIDIA — điều này rất lý tưởng nếu bạn đã đang dùng hạ tầng NVIDIA. {{3}}VibeVoice-ASR-Streaming-1.5B thì nằm trong một kho lưu trữ nghiên cứu: các đường dẫn được ghi lại là bản demo Python của Microsoft và một plugin vLLM, lớp kiến trúc của nó chưa có trong tài liệu Transformers công khai, và để dựng nó lên nghĩa là phải cài đặt từ mã nguồn và tự bạn kiểm chứng rằng đường dẫn nạp hoạt động. {{4}}Đối với một đội ngũ coi trọng việc triển khai đơn giản, được tài liệu hóa đầy đủ, chỉ riêng sự khác biệt đó thôi cũng đã có thể lớn hơn cả khoảng cách benchmark.

Lập luận cho người đương nhiệm, lập luận cho người thách thức

Lập luận cho NVIDIA Parakeet TDT 0.6B cũng chính là lập luận cho một giá trị đã được kiểm chứng: một năm trụ vững trên bảng xếp hạng, kết quả tái lập từ bên thứ ba, giấy phép thương mại, tính năng production, và hệ sinh thái triển khai đã hấp thụ lưu lượng truy cập thực tế. Nếu bạn ra mắt tính năng phiên âm tiếng Anh trong quý này và muốn dùng trọng số mở (open weights), thì đây là lựa chọn mặc định vững chắc, và nghĩa vụ chứng minh thuộc về bất kỳ giải pháp nào tự tuyên bố có thể thay thế nó.

Lý do chọn VibeVoice-ASR-Streaming-1.5B hẹp hơn và cụ thể hơn: bạn cần gán nhận diện người nói theo luồng hoặc hotwords, bạn cần nhiều ngôn ngữ hơn tiếng Anh, hoặc bạn tin rằng phương pháp tiếp cận mô hình ngôn ngữ cho giọng nói sẽ giành chiến thắng và bạn muốn đi sớm. Đây là một vụ cá cược, không phải một quyết định — chưa có con số nào để biện minh cho việc chuyển lưu lượng sản xuất sang nó, và bản thân Microsoft cũng đặt nghiên cứu lên hàng đầu. Cả hai mô hình hiện chưa được phục vụ qua OrcaRouter, vì vậy cách kiểm chứng vụ cá cược với chi phí thấp là mẫu hình áp dụng cho mọi mô hình mở trẻ: giữ lớp ASR đằng sau một API định tuyến duy nhất điều phối 200+ mô hình ở mức giá niêm yết của nhà cung cấp, không tăng phí và có chuyển đổi dự phòng tự động, định tuyến một phần âm thanh thực đến VibeVoice-ASR-Streaming-1.5B ngay khi có nhà cung cấp lưu trữ nó, và để các bản phiên âm từ lưu lượng của chính bạn quyết định xem kẻ thách thức có xứng đáng với ngôi vương mà Parakeet đã nắm giữ suốt mười sáu tháng hay không.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube