
VibeVoice-ASR-Streaming-1.5B so với Whisper Large v3 Turbo: streaming thuần gốc đối đầu với cỗ máy 99 ngôn ngữ
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
{{1}}Rất có thể mô hình chuyển giọng nói thành văn bản mà bạn đang chạy hiện nay chính là Whisper Large v3 Turbo, và đã có một mô hình mới đặt ra câu hỏi liệu điều đó có nên như vậy hay không.{{/1}} {{2}}Whisper Large v3 Turbo của OpenAI — bản checkpoint chưng cất với 809 triệu tham số, phát hành vào tháng 10 năm 2024 — là con ngựa thồ trọng số mở: 99 ngôn ngữ, nhanh hơn bản large-v3 gốc khoảng bốn đến tám lần, đủ nhỏ để chạy trên laptop, được cấp phép MIT và được hậu thuẫn bởi hệ sinh thái chuyển giọng nói thành văn bản lớn nhất hiện có.{{/2}} {{3}}VibeVoice-ASR-Streaming-1.5B, do Microsoft Research đăng tải vào ngày 2 tháng 9 năm 2026, là kẻ thách thức được tạo ra cho đúng một việc mà Whisper vốn không hỗ trợ sẵn: nhận dạng theo luồng (streaming).{{/3}} {{4}}Nó chuyển giọng nói thành văn bản theo từng đoạn ngay khi âm thanh đến, thay vì nuốt trọn những khung thời gian cố định,{{/4}} {{5}}nó tuyên bố có đầu ra gắn nhãn người nói,{{/5}} {{6}}và nó mới chỉ có mười ngôn ngữ, lại chưa hề có một benchmark được công bố nào.{{/6}}
Điều khoản cuối cùng đó chính là lý do trang này được cấu trúc xoay quanh một câu hỏi về việc chuyển đổi thay vì một cuộc so tài. {{1}}Các con số của Whisper Large v3 Turbo đã được đo lường và công khai — LibriSpeech, bảng tổng hợp Open ASR, Common Voice — trong khi thẻ mô hình của VibeVoice-ASR-Streaming-1.5B {{2}}không công bố con số WER hay độ trễ nào dưới dạng văn bản, và hiện tại chưa có điểm chuẩn độc lập nào tồn tại.{{/2}} {{3}}Mọi thông tin về phía Microsoft bên dưới là những gì có thể biết được từ kho lưu trữ của họ: các tệp cấu hình, thẻ mô hình và tài liệu phát trực tuyến của Microsoft.{{/3}} {{4}}Mọi thông tin về phía Whisper đều là hồ sơ công khai đã được xác lập.{{/4}} Hai mô hình này chưa từng được chạy đối đầu trực tiếp; sự so sánh nằm ở giữa {{5}}điều đã được kiểm chứng và điều mới chỉ là lời hứa.{{/5}}
Mô hình mà có lẽ bạn đã đang chạy.
Whisper Large v3 Turbo đã có được vị trí của mình theo cách không mấy hào nhoáng: nó nhanh, nhỏ gọn, đa ngôn ngữ và nhàm chán theo đúng cách mà các nhóm sản xuất ưa thích. Được chưng cất từ bản Whisper large-v3 với 1,55 tỷ tham số xuống còn 809 triệu tham số, mô hình vẫn bao phủ 99 ngôn ngữ và giữ được khoảng 95% độ chính xác của large-v3 — WER khoảng 2,1% trên LibriSpeech clean, khoảng 7,7–7,8% trên bộ tổng hợp Open ASR, với mức suy giảm lớn nhất ở các ngôn ngữ ít tài nguyên và ngôn ngữ có thanh điệu — đồng thời chạy nhanh hơn gấp nhiều lần và chỉ chiếm khoảng 1,6 GB VRAM ở dạng FP16. Mô hình được phát hành theo giấy phép MIT, chạy được qua faster-whisper, whisper.cpp cùng ba năm tích hợp, và trang Hugging Face của nó cho thấy hơn bảy triệu lượt tải xuống chỉ trong một tháng. Nếu bạn tự lưu trữ dịch vụ phiên âm, rất có thể đây chính là mô hình đang đảm nhiệm việc đó.
Điều mà Whisper Large v3 Turbo không phải là, và chưa bao giờ tuyên bố là, một mô hình phát trực tuyến. Nó tiếp nhận âm thanh trong các cửa sổ cố định 30 giây và trả về bản ghi âm cho từng cửa sổ; nó không có khả năng phát hiện hoạt động giọng nói gốc, không có cơ chế kết thúc luồng, không có phân đoạn người nói, và không có cơ chế từ khóa kích hoạt. Phiên âm trực tiếp trên Whisper luôn là một lớp bổ trợ bạn phải tự xây dựng — và chính lớp bổ trợ đó là nơi chứa độ trễ và chi phí kỹ thuật.
Điều gì thực sự thay đổi nếu bạn chuyển đổi
• Mô hình độ trễ — VibeVoice-ASR-Streaming-1.5B xuất văn bản mỗi khi xử lý xong một đoạn khoảng 2,9 giây với khoảng 0,5 giây nhìn trước, theo thiết kế so với Whisper Large v3 Turbo: mô hình dạng batch với cửa sổ 30 giây, cần một lớp phân đoạn và ghép nối để mô phỏng đầu ra trực tiếp.
• Hình dạng phiên — các phiên trực tiếp không giới hạn, ngữ cảnh được duy trì xuyên các khối trong bộ đệm tiền tố, so với các cửa sổ 30 giây rời rạc không có trạng thái hội thoại xuyên cửa sổ.
• Ngôn ngữ — mười (Tiếng Trung, Tiếng Anh, Tiếng Pháp, Tiếng Đức, Tiếng Ý, Tiếng Nhật, Tiếng Hàn, Tiếng Bồ Đào Nha, Tiếng Nga, Tiếng Tây Ban Nha) so với 99.
• Độ chính xác được công bố — không có công bố nào so với ~2.1% LibriSpeech clean, ~7.7–7.8% Open ASR composite, tất cả đều được đo lường và công khai.
Đầu ra bổ sung — tuyên bố có phân bổ ai nói gì theo streaming và hotwords; còn mốc thời gian từ thì có sẵn, nhưng không có diarization và cũng không có hotwords tích hợp sẵn.
• Phần cứng — khoảng 5.6 GB trọng số bf16 trên GPU NVIDIA, bản cài từ mã nguồn so với khoảng 1.6 GB FP16, chạy được trên laptop và CPU qua whisper.cpp và faster-whisper.
• Giấy phép — MIT, cả hai.

Vấn đề nâng cấp hệ thống phát trực tuyến
Cách trung thực để nhìn nhận cuộc so tài này là Whisper Large v3 Turbo có một vấn đề về streaming mà bạn đã phải trả giá hoặc vẫn đang phải trả giá. Một pipeline trực tiếp trên Whisper đồng nghĩa với việc cần một bộ phát hiện hoạt động giọng nói để nhận diện tiếng nói, một bộ chia nhỏ để cắt âm thanh thành các cửa sổ có kích thước Whisper, các cửa sổ chồng lấp để từ ngữ không bị mất ở ranh giới, và một bộ ghép nối để hợp nhất các bản phiên âm từng phần. Các triển khai cộng đồng cho stack nói trên đạt độ trễ đầu cuối khoảng một đến năm giây — đủ dùng cho ghi chú cuộc họp, nhưng chưa đạt mức chuẩn cho nhân viên tổng đài và phụ đề trực tiếp.
VibeVoice-ASR-Streaming-1.5B loại bỏ retrofit ngay từ cấu trúc. Cấu hình bộ tiền xử lý của nó cố định một chunk gồm 22 frame và lookahead 4 frame trên luồng token tiếng nói ~7,5 Hz — tức khoảng 2,9 giây âm thanh cho mỗi phân đoạn phát ra và nửa giây ngữ cảnh tương lai — còn tài liệu của Microsoft mô tả ngữ cảnh từ các chunk trước đó được duy trì qua KV cache, nên một phiên trực tiếp không phải tính toán lại từ đầu. Nhưng hãy đọc kỹ từ "streaming" ở cả hai phía của phép so sánh này: không mô hình nào là engine trả kết quả từng phần theo từng từ (per-word partials) như loại mà các API thương mại có độ trễ thấp nhất đang bán. Transcript của VibeVoice được thiết kế để tăng lên theo từng nấc khoảng ba giây — một nhịp độ khác và thường chấp nhận được cho các cuộc họp — nhưng nó không ở mức dưới một giây, và nếu yêu cầu của bạn là chữ hiện trên màn hình trong vòng một giây, bạn nên đo cấu trúc chunk này với ngân sách thời gian đó trước khi xây dựng dựa trên nó.
Độ chính xác: điều bạn đánh đổi khi chuyển sang phát trực tuyến gốc
Đây là khoảng trống cần chi phối quyết định. Whisper Large v3 Turbo có hồ sơ độ chính xác công khai mà bạn có thể kiểm chứng — và khi bản ghi nằm trong 99 ngôn ngữ được hỗ trợ, hồ sơ đó rất vững chắc. VibeVoice-ASR-Streaming-1.5B không có hồ sơ như vậy: phần đánh giá trên model card chỉ là một hình ảnh, Microsoft chưa công bố chỉ số WER streaming dưới dạng văn bản, và mốc số liệu duy nhất trong cả dòng mô hình là mức WER trung bình 7,77% do nhà cung cấp báo cáo trên model card VibeVoice-ASR batch, đo trên tám bộ kiểm tra tiếng Anh — con số mô tả một mô hình khác, không phải mô hình streaming. Nói một cách trung thực, chuyển quy trình phiên âm của bạn sang VibeVoice-ASR-Streaming-1.5B ngay hôm nay nghĩa là chấp nhận một mức độ chính xác chưa được biết trên chính dữ liệu âm thanh của bạn — và đó chính là lý do vì sao mọi đánh giá về mô hình này phải do chính bạn thực hiện, trên những bản ghi thực tế khó nhất của bạn, trước khi nó xứng đáng được đưa vào vận hành production.

Ngôn ngữ và quy kết người nói: khoảng trống về tính năng ảnh hưởng theo cả hai chiều
Việc so sánh tính năng không hề nghiêng hẳn về một phía, và chính điều đó khiến bài toán lựa chọn trở nên thực sự thú vị. Nếu audio của bạn đa ngôn ngữ, quyết định sẽ ngã ngũ ngay lập tức: 99 ngôn ngữ của Whisper Large v3 Turbo bao phủ những ngôn ngữ mà 10 ngôn ngữ của VibeVoice-ASR-Streaming-1.5B không có, và giới hạn chỉ 10 ngôn ngữ sẽ khiến VibeVoice-ASR-Streaming-1.5B bị loại khỏi vòng xem xét đối với bất kỳ pipeline nào phải xử lý một hỗn hợp lời nói đa dạng. Nhưng nếu tác vụ của bạn nằm gọn trong 10 ngôn ngữ đó và điều bạn thực sự cần là biết ai đã nói gì trong một cuộc họp trực tiếp, thì cán cân lại nghiêng theo hướng ngược lại: Whisper không có diarization tích hợp sẵn cũng chẳng có hotwords, còn VibeVoice-ASR-Streaming-1.5B thì tuyên bố có cả hai — đầu ra streaming gắn người nói và hotwords theo lĩnh vực được truyền vào như một context prompt. Tuyên bố này vẫn chưa được xác minh, và diarization streaming xuyên qua ranh giới giữa các chunk là bài toán đủ khó để khiến tuyên bố đáng bị hoài nghi, nhưng đó lại là tính năng cụ thể mà dù có kỹ thuật hóa Whisper đến đâu, bạn cũng không thể có được ở dạng sẵn sàng dùng ngay.
Phép toán di cư
Chi phí và công sức nghiêng về giải pháp hiện tại. Whisper Large v3 Turbo đã chạy trong hệ thống của bạn trên phần cứng bạn sở hữu — một chiếc laptop, một CPU, một GPU khiêm tốn — và việc chuyển sang VibeVoice-ASR-Streaming-1.5B đồng nghĩa với việc phải dựng một bản cài đặt nghiên cứu từ mã nguồn trên GPU NVIDIA với khoảng 5,6 GB trọng số, xác minh một đường dẫn tải mà lớp kiến trúc của nó chưa có trong tài liệu Transformers công khai, và xây dựng từ đầu điểm chuẩn mà quyết định của bạn phụ thuộc vào. Đó là một dự án thực sự, và lợi ích thu được chỉ có giá trị khi những tính năng chưa được xác minh đó thực sự quan trọng với bạn.

Cách chạy dự án đó một cách rẻ là không coi nó như một sự hoán đổi. Giữ Whisper Large v3 Turbo làm mặc định và định tuyến một phần âm thanh trực tiếp tới VibeVoice-ASR-Streaming-1.5B qua một API duy nhất — đúng mẫu mà một tầng định tuyến tồn tại để phục vụ: hơn 200 mô hình đằng sau một endpoint duy nhất với giá niêm yết của nhà cung cấp, không tăng giá, tự động chuyển đổi dự phòng khi mô hình mới gặp trục trặc, và một DSL định tuyến cho phép các khối lượng công việc khác nhau chọn bộ phiên âm khác nhau chỉ từ một lệnh gọi. Đó chính là mô hình của OrcaRouter, và đó là sự khác biệt giữa việc đặt cược toàn bộ pipeline sản xuất của bạn vào một checkpoint mới có hai ngày tuổi và việc để checkpoint đó tự chứng minh vị trí của nó khi cạnh tranh với mô hình chủ lực trên chính các transcript của bạn.
Các câu hỏi thường gặp
Liệu Whisper Large v3 Turbo có hỗ trợ live streaming được không?
Chỉ dưới dạng retrofit (trang bị thêm). Whisper Large v3 Turbo là mô hình batch xử lý các cửa sổ cố định 30 giây, vì vậy để phiên âm trực tiếp, bạn phải xây dựng thêm bộ phát hiện hoạt động giọng nói, bộ phân khối, chiến lược chồng lấp và bộ ghép nối ở phía trên nó. Các triển khai hiện có hoạt động được và đạt độ trễ khoảng một đến năm giây — phù hợp với ghi chú cuộc họp nhưng không đạt mốc dưới một giây dành cho các tác tử điện thoại và phụ đề trực tiếp. VibeVoice-ASR-Streaming-1.5B là mô hình streaming thuần túy — nó xuất văn bản theo từng khối ~2,9 giây với ~0,5 giây nhìn trước — nhưng đó là streaming theo khối chứ không phải kết quả từng phần theo từng từ, nên bạn cũng hãy đối chiếu nhịp độ đó với ngân sách độ trễ của riêng mình.
VibeVoice-ASR-Streaming-1.5B có chính xác hơn Whisper Large v3 Turbo không?
Chưa ai có thể trả lời câu hỏi đó, kể cả Microsoft. Độ chính xác của Whisper Large v3 Turbo đã được đo lường và công bố — khoảng 2,1% WER trên LibriSpeech clean và 7,7–7,8% trên bộ tổng hợp Open ASR. VibeVoice-ASR-Streaming-1.5B chưa có số liệu WER streaming nào được công bố dưới dạng văn bản và cũng chưa có điểm chuẩn độc lập nào tính đến thời điểm hiện tại. Cách duy nhất để trả lời câu hỏi này là chạy checkpoint trên dữ liệu âm thanh của chính bạn và đối chiếu bản phiên âm với hệ thống hiện tại — đây chính xác là bài kiểm tra mà trang này khuyến nghị thực hiện trước bất kỳ quá trình di dời nào.
Cả hai hỗ trợ những ngôn ngữ nào?
Whisper Large v3 Turbo hỗ trợ 99 ngôn ngữ với một bộ trọng số duy nhất. VibeVoice-ASR-Streaming-1.5B liệt kê mười ngôn ngữ: tiếng Trung, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Bồ Đào Nha, tiếng Nga và tiếng Tây Ban Nha. Đối với bất kỳ âm thanh nào nằm ngoài bộ mười ngôn ngữ đó, Whisper là lựa chọn duy nhất trong cặp này, và khoảng cách đa ngôn ngữ là lý do rõ ràng nhất khiến hầu hết các nhóm sẽ giữ nguyên lựa chọn hiện tại của họ.
Whisper Large v3 Turbo là mô hình phù hợp với hầu hết các đội ngũ trong hầu hết thời gian, và một checkpoint mới hai ngày tuổi chưa có benchmark không phải là lý do để chuyển nền tảng. Đó là lý do để chạy một thử nghiệm. Nếu audio của bạn nằm trong mười ngôn ngữ của nó và tính năng gán nhận dạng người nói trực tiếp sẽ thay đổi sản phẩm của bạn, hãy đưa VibeVoice-ASR-Streaming-1.5B lên chạy phía sau một bộ định tuyến, trỏ một phần lưu lượng thực vào nó, và để bản transcript — chứ không phải việc thiếu benchmark ở bên nào — quyết định.
