Thẻ tiêu đề nổi bật cho bài viết 'VibeVoice-ASR-Streaming-1.5B' với nhãn 'Những gì chúng ta biết cho đến nay', phụ đề 'Tính năng chuyển giọng nói thành văn bản phát trực tuyến của Microsoft ra mắt âm thầm', và các chip ghi 'Phát hành ngày 2 tháng 9 năm 2026', 'MIT · Trọng số mở' và '10 ngôn ngữ'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B, Được Giải Thích: ASR Truyền Phát Của Microsoft Xuất Hiện Mà Không Có Buổi Ra Mắt Chính Thức

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 2 tháng 9 năm 2026, Microsoft Research đã tải lên Hugging Face hai checkpoint chuyển giọng nói thành văn bản mới mà không có thông cáo báo chí, không có bài đăng blog, và không có chút phô trương nào: microsoft/VibeVoice-ASR-Streaming-1.5B và phiên bản lớn hơn của nó, microsoft/VibeVoice-ASR-Streaming-7B. Thông báo duy nhất cho đến nay là một mục tin tức đề ngày 3 tháng 9 năm 2026 trong mục Tin tức của kho lưu trữ GitHub VibeVoice mã nguồn mở của Microsoft, mô tả bản phát hành này là một mô hình ASR phát trực tuyến thống nhất, phiên âm ai đã nói gì trong khi âm thanh vẫn còn đang đến, cùng với các hotword tùy chỉnh và mười ngôn ngữ. Cả hai checkpoint đều được cấp phép MIT, cả hai được tạo cách nhau khoảng năm phút trên tài khoản Hugging Face chính thức của microsoft, và cả hai đều hiển thị số lượt tải xuống bằng 0 khi chúng tôi kiểm tra một ngày sau đó. Chúng tôi không thể tìm thấy bất kỳ bài đưa tin nào từ bên thứ ba về một trong hai mô hình này.

Điều này khiến bài viết trở nên khác thường: một bản phát hành thực sự, có ngày tháng rõ ràng — trọng số trên Hugging Face ghi ngày 2 tháng 9, thông báo trong kho lưu trữ ghi ngày 3 tháng 9 — mà thế giới bên ngoài vẫn chưa theo kịp. Mọi điều có thể biết được dưới đây đều đến từ việc đọc kho lưu trữ: các tệp cấu hình, thẻ mô hình và tài liệu phát trực tuyến của chính Microsoft. Những điều chưa được xác nhận — độ chính xác, độ trễ thực tế, liệu khả năng gán người nói theo thời gian thực có trụ vững trong một cuộc gọi hai người thực sự hay không — đều được dán nhãn như vậy. Không có điểm chuẩn nào để trích dẫn vì Microsoft vẫn chưa công bố điểm chuẩn dưới dạng văn bản.

Thông báo duy nhất là một dòng tin tức.

VibeVoice là dòng mô hình giọng nói mã nguồn mở, được cấp phép MIT của Microsoft Research. Thành viên ASR nổi tiếng nhất của nó, microsoft/VibeVoice-ASR, được phát hành vào ngày 21 tháng 1 năm 2026: một mô hình batch có thể tiếp nhận tối đa sáu mươi phút âm thanh trong một lần xử lý và trả về các bản ghi thoại có cấu trúc kèm người nói, thời điểm và nội dung — sau đó đã có khoảng 700.000 lượt tải trên Hugging Face. Vào ngày 2 tháng 9, cũng chính tổ chức này đã phát hành các mô hình streaming cùng dòng, microsoft/VibeVoice-ASR-Streaming-7B và microsoft/VibeVoice-ASR-Streaming-1.5B; API của Hugging Face ghi nhận mô hình 7B vào lúc 2026-09-02T15:46 UTC và mô hình 1.5B năm phút sau đó, lúc 15:51 UTC. Bảng mô hình trong kho GitHub hiện liệt kê VibeVoice-ASR-Streaming thành một mục riêng, và mục News của kho này có dòng tin ngày 3 tháng 9 công bố mô hình này.

Điều thực sự mới so với mô hình tháng Một là mô hình tương tác: các checkpoint phát trực tuyến phiên âm ngay khi âm thanh đến thay vì chờ một tệp hoàn chỉnh. Mọi thứ khác — kiến trúc token giọng nói cơ bản, đầu ra gán thuộc tính người nói, cơ chế hotword — là sự tiếp nối của thiết kế batch, được mở rộng quy mô và tái định hướng cho mục đích sử dụng thời gian thực. Lưu ý sự khác biệt về ngôn ngữ ngay từ đầu: mô hình batch quảng cáo hơn 50 ngôn ngữ, trong khi thẻ streaming chỉ liệt kê mười ngôn ngữ.

A screenshot of the microsoft/VibeVoice GitHub repository README showing the model table that lists VibeVoice-ASR-Streaming as a member of the family and the News section entry dated September 3, 2026 announcing the streaming ASR release.

'Streaming' có nghĩa là gì trong checkpoint này?

Tài liệu streaming của Microsoft mô tả rõ ý định: mô hình phiên âm khi âm thanh vẫn đang tới, và nó xuất ra văn bản cho mỗi khối âm thanh, vì vậy bản phiên âm hiện ra ngay khi người nói đang nói. Tệp preprocessor_config.json của repo 1.5B làm cho nhịp độ đó trở nên cụ thể:

• Tốc độ lấy mẫu và tốc độ token — âm thanh đầu vào 24 kHz được nén 3.200×, tạo ra dòng token giọng nói khoảng 7,5 Hz (tức khoảng một token mỗi 133 ms).

Chunk — 22 khung, ở tần số 7,5 Hz tức là khoảng 2,9 giây âm thanh cho mỗi phân đoạn được phát ra.

• Lookahead — 4 khung hình, khoảng 0,5 giây audio tương lai được dùng để củng cố phân đoạn hiện tại.

(Phép tính từ repo khá đơn giản: 22 × 3.200 = 70.400 mẫu ≈ 2,93 giây ở tần số 24 kHz; 4 × 3.200 = 12.800 mẫu ≈ 0,53 giây. Tài liệu của chính Microsoft lưu ý rằng một checkpoint luôn chạy trên đúng chunk mà nó được huấn luyện, nên các thông số này không thể điều chỉnh tại thời điểm suy luận.)

Điều này đưa hệ thống vào nhóm truyền phát theo khối (chunked-streaming) thay vì nhóm xử lý từng từ một: một bản ghi trực tiếp lớn dần theo các bước tăng khoảng ba giây với khoảng nửa giây nhìn trước (lookahead), chứ không phải theo các phần nhỏ cho từng token. Đây là một thiết kế hợp lệ và phổ biến cho việc phiên âm cuộc họp và cuộc gọi, nhưng nó có cấu hình độ trễ khác với các hệ thống phát ra các phần nhỏ trong chưa đầy một giây — vì vậy hãy coi "streaming" như một phổ đo lường và đánh giá nó theo ngân sách độ trễ của riêng bạn trước khi xây dựng một sản phẩm phụ đề trực tiếp dựa trên nó.

Bên trong: LLM giọng nói quy mô Qwen

Đọc config.json của checkpoint 1.5B cho thấy công thức VibeVoice nay đã quen thuộc ở quy mô nhỏ hơn:

Bộ giải mã là một mô hình ngôn ngữ thuộc họ Qwen2 với các chiều khớp chính xác với lớp Qwen2.5 1.5B — 28 lớp, 1.536 đơn vị ẩn, 12 đầu chú ý với 2 đầu khóa-giá trị và cửa sổ 65.536 token. LLM chính là thứ cho phép mô hình duy trì hiểu biết về người nói và nội dung xuyên suốt bản ghi thoại.

• Các bộ token hóa âm học và ngữ nghĩa — bộ mã hóa tích chập sâu với bước trượt 8/5/5/4/2/2 — chuyển đổi âm thanh 24 kHz thành luồng token tiếng nói ~7.5 Hz mà bộ giải mã đọc.

• Một đầu khuếch tán (DDPM, 20 bước khử nhiễu, v-prediction) nằm ở phía tạo sinh, nhất quán với phần còn lại của dòng VibeVoice.

• Trung thực về kích thước: siêu dữ liệu safetensors của chính checkpoint liệt kê khoảng 3 tỷ tham số, tức khoảng 5,6 GB trọng số. Chữ "1.5B" trong tên là quy mô của phần lõi ngôn ngữ — cách đọc hợp lý từ một cấu hình có bộ giải mã là mô hình Qwen hạng 1.5B — còn các bộ token hóa âm thanh và diffusion head bổ sung phần còn lại. Chuỗi kiến trúc trong cấu hình, VibeVoiceForASRStreamingTraining, cho thấy đây là checkpoint thuộc nhóm nghiên cứu.

A single-column scoreboard titled 'VibeVoice-ASR-Streaming-1.5B — the scoreboard' with the subtitle 'Key specs read from the Hugging Face checkpoint and Microsoft's repo' and six rows: 'Released: Sept 2, 2026', 'Streaming cadence: ~3 s chunks, ~0.5 s lookahead', 'Languages: 10', 'Speaker output: who said what (unverified)', 'Scale: 1.5B LM backbone, ~3B total', 'License: MIT, open weights'. Footer: 'Specs from HF config and microsoft/VibeVoice repo — no independent benchmarks yet.' The OrcaRouter logo is composited in the bottom-right corner.

Ai nói gì, bằng mười ngôn ngữ

Khả năng nổi bật trên thẻ mô hình là phiên âm trực tuyến có gán nhãn người nói: theo đúng mô tả trên thẻ, nó “liên tục phiên âm ai đã nói gì khi luồng lời nói đến.” Thẻ cũng quảng cáo các từ kích hoạt tùy chỉnh cho thuật ngữ chuyên ngành, đồng thời liệt kê mười ngôn ngữ được hỗ trợ — tiếng Trung, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Bồ Đào Nha, tiếng Nga và tiếng Tây Ban Nha.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the MIT license tag, the automatic-speech-recognition pipeline tag, and the card description of streaming speaker-attributed transcription with customized hotwords and ten languages.

Từ nóng được triển khai thông qua cùng cơ chế thiên vị ngữ cảnh mà mô hình batch sử dụng. Trong bản demo dòng lệnh của Microsoft, bạn truyền chúng dưới dạng thông tin ngữ cảnh — ví dụ --context_info "Microsoft,VibeVoice" — để thiên vị nhận dạng đối với tên và thuật ngữ kỹ thuật mà không cần tinh chỉnh. Thẻ thông tin không nói gì về tự động phát hiện ngôn ngữ hoặc chuyển mã cho mô hình streaming, đây là một khoảng trống khác so với các tuyên bố của mô hình batch.

Một lưu ý cần được nhấn mạnh. Trang tài liệu về phát trực tuyến tập trung vào việc phát theo khối và hotwords; tài liệu không nêu chi tiết cách duy trì gán nhận diện người nói qua các ranh giới khối. Phân đoạn người nói theo luồng thực sự khó — người nói có thể nói chồng lên nhau, và ranh giới khối chính là nơi gán nhận diện dễ bị lệch. Cách diễn đạt "ai nói gì" trên thẻ chỉ là lời khẳng định của nhà cung cấp cho đến khi có ai đó chạy một cuộc gọi trực tiếp thực sự với hai người nói qua hệ thống và kiểm chứng.

Vị trí của nó: dòng sản phẩm VibeVoice và lĩnh vực streaming-ASR năm 2026

Trong nội bộ gia đình sản phẩm, bản phát hành được xếp vào vị trí như sau:

microsoft/VibeVoice-ASR (21 tháng 1, 2026) — phiên bản batch chủ lực: lên đến 60 phút chỉ trong một lượt xử lý, 50+ ngôn ngữ, đầu ra dạng Ai/Khi nào/Cái gì, hotwords, khoảng 700 nghìn lượt tải.

• microsoft/VibeVoice-ASR-Streaming-7B và microsoft/VibeVoice-ASR-Streaming-1.5B (2 tháng 9 năm 2026) — các biến thể phát trực tuyến mới; bài viết này tập trung vào bản 1.5B.

• microsoft/VibeVoice-ASR-BitNet (23 tháng 7, 2026) — một engine edge được lượng tử hóa, định hướng CPU, dành cho mô hình batch.

• Các mô hình VibeVoice-1.5B TTS và VibeVoice-Realtime-0.5B streaming-TTS là các thành viên riêng biệt trong cùng một họ, không thuộc dòng ASR.

Lĩnh vực ASR trọng số mở rộng hơn đã dịch chuyển về hướng thời gian thực suốt cả năm nay, nên một sản phẩm streaming mới có những điểm so sánh trực tiếp. Qwen3-ASR (Alibaba, ~1,7B) là mô hình hợp nhất streaming và ngoại tuyến, hỗ trợ hơn 50 ngôn ngữ và phương ngữ. Nemotron 3.5 ASR của NVIDIA là mô hình streaming 0,6B phủ 40 ngôn ngữ, phát hành theo giấy phép OpenMDW thay vì MIT. Granite Speech 5.0 470M TurboCTC của IBM dùng Apache-2.0 với số liệu thông lượng nhà cung cấp công bố cao bất thường. So với các mô hình đó, mô hình streaming của Microsoft khác biệt ở ba điểm: giấy phép MIT, nền tảng LLM mang khả năng hiểu người nói lẫn nội dung thay vì chỉ là mô hình âm học thuần túy, và định hướng phiên âm trực tiếp gán nhận diện người nói. Các câu hỏi còn bỏ ngỏ là độ chính xác và độ trễ thực tế — cả hai vẫn chưa có con số đánh giá độc lập nào.

Điều gì chưa được xác minh

Đọc repo cho bạn biết thiết kế; nó không cho bạn biết nó hoạt động tốt đến mức nào. Cụ thể:

• Không có số liệu về độ chính xác hoặc độ trễ trong văn bản. Thẻ mô hình kèm theo một hình ảnh biểu đồ kết quả, nhưng không có bảng số liệu WER, RTF hoặc độ trễ nào trong phần mô tả — không có gì để trích dẫn một cách độc lập.

• Không có đánh giá từ bên thứ ba. Lượt tải xuống ở mức không một ngày sau khi tải lên; không có điểm chuẩn cộng đồng, không có mục xếp hạng, và không có bài kiểm tra độc lập nào chúng tôi có thể tìm thấy.

• Đường dẫn phục vụ là một thiết lập nghiên cứu chạy từ mã nguồn. Tài liệu streaming của Microsoft chạy từ một bản clone của kho lưu trữ VibeVoice trên GitHub bên trong một container NVIDIA PyTorch (nvcr.io/nvidia/pytorch, khuyến nghị dùng flash-attention). Thẻ mô hình cũng hiển thị một đoạn mã pipeline Transformers và chuyển hướng chi tiết cài đặt sang GitHub; chúng tôi chưa xác minh liệu phiên bản Transformers hiện được phát hành có chạy suy luận streaming trên checkpoint này ngay khi cài đặt hay không.

• Cách tiếp cận này đặt nghiên cứu lên hàng đầu. Kho lưu trữ của Microsoft mô tả các mô hình VibeVoice là nhằm mục đích nghiên cứu và phát triển. Trọng số được cấp phép MIT; lập trường ở đây là "đây là khoa học", chứ không phải "đây là một sản phẩm được hỗ trợ". Hãy dành ngân sách cho khâu đánh giá của riêng bạn.

Bạn có nên xây dựng dựa trên nó không?

Đối với các nhóm đã tự triển khai (self-host) ASR, công cụ này đáng để dành một cuối tuần đánh giá nếu audio của bạn nằm trong bộ mười ngôn ngữ và bạn đặc biệt cần phiên âm trực tiếp có gán nhãn người nói từ một mô hình được cấp phép MIT. Hãy dự trù khoảng 5,6 GB trọng số cho mô hình 1.5B chạy trên GPU NVIDIA và bản cài đặt từ mã nguồn, đồng thời lên kế hoạch tự đo độ chính xác trên chính audio của bạn trước khi tin dùng.

Đối với các đội ngũ đang triển khai một pipeline phiên âm (transcription) ở môi trường production hiện nay, câu trả lời thận trọng là chờ đợi một trong ba điều: Microsoft công bố các số liệu về độ chính xác và độ trễ hiện chỉ tồn tại dưới dạng hình ảnh; một bài benchmark độc lập; hoặc một đường dẫn phục vụ (serving path) được bảo trì kèm runtime được hỗ trợ. Nhịp phân đoạn (chunked) ~3 giây cũng là một thông số kỹ thuật cần kiểm tra đối chiếu với yêu cầu độ trễ của bạn, thay vì chỉ giả định dựa trên từ "streaming".

Cách rẻ để giữ mở tùy chọn là tránh gắn cứng ứng dụng của bạn vào một engine phiên âm duy nhất. Một lớp định tuyến đứng trước nhiều mô hình và quy về một API nghĩa là khi VibeVoice-ASR-Streaming — hoặc ASR nguồn mở tiếp theo — xuất hiện trên một nhà cung cấp inference, việc A/B-test nó với mô hình hiện tại trên cùng một lưu lượng chỉ là thay đổi cấu hình, chứ không phải xây lại nền tảng. Vì router chuyển tiếp thẳng tính đúng giá niêm yết của nhà cung cấp mà không cộng thêm phí, phép so sánh đó vẫn rẻ, và cơ chế failover tự động giúp một mô hình non trẻ chưa được chứng minh không trở thành điểm lỗi duy nhất trong pipeline của bạn. Đó chính là khuôn mẫu chung để áp dụng một mô hình mới ra đời vài ngày: hãy để nó tự giành chỗ trên lưu lượng thực tế trước khi bạn đặt cược môi trường production vào nó.

Câu hỏi thường gặp

Based on my knowledge (up to January 2025), **VibeVoice-ASR-Streaming-1.5B is not a real Microsoft release**. I could not find any official Microsoft product, model, or open-source asset with that name. Microsoft's existing speech-to-text offerings primarily include: - **Azure AI Speech** (batch and real-time transcription, custom speech, etc.) - **Microsoft's open-source models** published under the `microsoft` organization on Hugging Face (such as certain Whisper fine-tunes or earlier research models) The naming convention "VibeVoice-ASR-Streaming-1.5B" doesn't match Microsoft's typical branding ("Azure", "Microsoft", "Speech", "ASR", etc.). **What this likely is:** - A third-party or community-built model (possibly fine-tuned on Azure/LibriSpeech/etc.), or - A hypothetical, fictional, or potentially misleading name (e.g., from an AI-generated summary, scam listing, or an unofficial mirror). **How to verify definitively:** 1. Check the official Hugging Face organization page: `https://huggingface.co/microsoft` 2. Check Azure AI Speech documentation: `https://learn.microsoft.com/en-us/azure/ai-services/speech-service/` 3. Search for the exact string "VibeVoice" on official Microsoft domains (learn.microsoft.com, aka.ms, github.com/microsoft, huggingface.co/microsoft). If you came across this name in a specific context — a URL, a paper, a GitHub repo, or a model card — I'd recommend double-checking the source's authenticity before relying on it. If it claims to be from Microsoft but isn't listed in any official channel, treat it with caution.

Vâng. Checkpoint nằm trên tài khoản Hugging Face chính thức của Microsoft với dấu thời gian tạo là ngày 2 tháng 9 năm 2026, và kho lưu trữ GitHub microsoft/VibeVoice tham chiếu VibeVoice-ASR-Streaming trong bảng mô hình của nó với một mục tin tức đề ngày 3 tháng 9 năm 2026. Điều bất thường không nằm ở nguồn gốc mà ở sự im lặng: không có thông cáo báo chí, không có bài đăng blog, và không có phủ sóng nào từ bên thứ ba tính đến thời điểm viết bài này.

Tại sao lại có hai kích thước, 7B và 1.5B?

Microsoft đã tải lên cả hai checkpoint trong cùng một phút nhưng chưa công bố bản so sánh. Từ cấu hình, bản 1.5B là đầu nhỏ — một backbone ngôn ngữ Qwen lớp 1.5B cộng với ngăn xếp âm thanh, khoảng 3B tham số và ~5.6 GB trọng số. Cách đọc tự nhiên là bản 7B có độ chính xác cao hơn và bản 1.5B rẻ hơn, nhanh hơn, nhưng Microsoft chưa nói rõ điều đó, và không có điểm chuẩn nào để xác nhận sự đánh đổi này.

Cái này khác gì so với VibeVoice-ASR trước đây?

Mô hình batch tháng Một xử lý tối đa 60 phút âm thanh trong một lần và được tuyên bố hỗ trợ hơn 50 ngôn ngữ. Các checkpoint streaming phiên âm trong khi âm thanh đang được truyền tới, xuất ra bản phiên âm theo từng khối khoảng 3 giây với độ nhìn trước khoảng 0,5 giây, còn thẻ mô hình liệt kê mười ngôn ngữ. Cả hai đều có chung kiến trúc speech-token, ý tưởng đầu ra gán nhãn người nói và cơ chế hotword.

Hiện tại, VibeVoice-ASR-Streaming-1.5B mới chỉ là một checkpoint kèm một dòng tin tức. Đọc repo nếu bạn tự triển khai và cần một hệ thống ASR streaming có giấy phép cho phép để đánh giá; hãy chờ các con số nếu bạn đang chọn một engine cho sản xuất. Tín hiệu đáng chú ý là Microsoft đang đẩy dòng sản phẩm voice của mình về hướng thời gian thực với hai kích thước cùng lúc — và đã làm điều đó một cách lặng lẽ đến mức một ngày sau, bộ đếm lượt tải vẫn hiển thị con số không.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube