Một thẻ tiêu đề nổi bật so sánh 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live', với dòng ghi chú phía trên là 'Nhận dạng giọng nói thành văn bản theo thời gian thực – Tháng 9/2026', phụ đề nêu rằng checkpoint mã nguồn mở thầm lặng của Microsoft chạm trán Live API dè dặt của Google, kèm các chip 'Trọng số MIT – 2/9', 'API Google – 26/8' và 'Chưa công bố WER nào cho VibeVoice', cùng chú thích cuối 'Những gì chúng ta biết cho đến nay'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

VibeVoice-ASR-Streaming-7B so với Gemini 3.5 Transcribe Live: Một tuần, hai kiểu chuyển giọng nói thành văn bản theo luồng

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tuần cuối của tháng 8 và những ngày đầu tháng 9 năm 2026 đã cho ra hai hệ thống chuyển giọng nói thành văn bản theo luồng trông giống như đối thủ của nhau, nhưng thực chất là những câu trả lời rất khác nhau cho cùng một câu hỏi. Ngày 26 tháng 8, Google đưa Gemini 3.5 Transcribe Live vào bản xem trước công khai: một endpoint chuyển giọng nói thành văn bản đóng, được lưu trữ, trả về bản ghi hoàn chỉnh 0,40 giây sau khi người nói dừng nói, dựa trên tỷ lệ lỗi từ khi phát trực tuyến 4,0% do Artificial Analysis đo được cùng bộ tài liệu ra mắt đầy đủ. Ngày 2 tháng 9, Microsoft Research đã đăng tải VibeVoice-ASR-Streaming-7B lên Hugging Face dưới namespace microsoft: trọng số mở theo giấy phép MIT, không thông cáo báo chí, không trang ra mắt, và một model card hoàn toàn không công bố tỷ lệ lỗi từ hay chỉ số độ trễ nào trong văn bản có thể đọc được. Cả hai đều chấp nhận âm thanh trong khi âm thanh vẫn đang được truyền tới. Đó gần như là điểm chung duy nhất giữa chúng.

Bằng chứng ở hai phía không đối xứng, vì vậy bài so sánh này được viết dưới dạng những gì chúng ta biết cho đến nay. Gemini 3.5 Transcribe Live là sản phẩm của Google với giá token được công bố và số liệu đo lường từ bên thứ ba, và những số liệu đó được ghi chú bên dưới. VibeVoice-ASR-Streaming-7B là một checkpoint mà mọi tuyên bố về nó đều được đọc trực tiếp từ chính repository: các tệp cấu hình, model card, và tài liệu streaming của Microsoft trong repository GitHub VibeVoice. Về phía Microsoft, chưa có điều gì được benchmark một cách độc lập, và chúng tôi nói rõ điều đó ở những chỗ mà nếu không, một con số có thể bị hiểu nhầm là đang tự minh chứng.

Hành trình phát hành: một lần ra mắt API và một lượt tải lên lặng lẽ

Google đã phát hành Gemini 3.5 Transcribe Live theo cách thông thường. Mô hình này nằm dưới mục Gemini Audio cùng với phiên bản Gemini 3.5 Transcribe (nhánh Interactions API dành cho bản ghi trước), giá được niêm yết trên trang mô hình, và các bảng xếp hạng độc lập đã đưa endpoint Live vào danh sách chỉ trong vài ngày — đó là nguồn gốc của các con số WER phát trực tuyến 4.0% và độ trễ cuối cùng 0,40 giây. Vẫn có gói miễn phí, kèm theo lưu ý thường lệ rằng nội dung từ gói miễn phí có thể được dùng để cải thiện các sản phẩm của Google.

Bản phát hành phát trực tuyến của Microsoft không có cơ chế nào như vậy. Kho lưu trữ Hugging Face microsoft/VibeVoice-ASR-Streaming-7B được tạo vào lúc 15:46 UTC ngày 2026-09-02 và được cập nhật lần cuối ba phút sau đó; kho chứa tám shard safetensors, một tokenizer và một cấu hình tiền xử lý, theo giấy phép MIT. Hồ sơ chính thức là một dòng nhật ký tin tức đề ngày 3 tháng 9 trong kho microsoft/VibeVoice, công bố "một mô hình ASR phát trực tuyến thống nhất liên tục phiên âm ai nói gì khi luồng lời nói đến, hỗ trợ hotword tùy chỉnh và 10 ngôn ngữ", kèm liên kết tới bản demo tại aka.ms/vibeasr và một báo cáo kỹ thuật về phát trực tuyến. Khi chúng tôi kiểm tra một ngày sau khi tải lên, checkpoint vẫn hiển thị 0 lượt tải xuống và không có nhà cung cấp suy luận lưu trữ nào liệt kê mô hình này. Model card cung cấp nhiều thông tin hơn thông báo, và kho lưu trữ chính là nguồn của gần như mọi thứ bên dưới.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Thông số kỹ thuật, so sánh cạnh nhau

Đây là gì — VibeVoice-ASR-Streaming-7B: ASR phát trực tuyến mã nguồn mở, tự lưu trữ so với Gemini 3.5 Transcribe Live: API phát trực tuyến được lưu trữ, mã nguồn đóng.

• Dạng phát trực tuyến — phát ra văn bản theo các khối khoảng 2,9 giây với khoảng 0,5 giây nhìn trước (suy ra từ cấu hình checkpoint) so với phiên WebSocket hai chiều có bản phiên âm từng phần liên tục và kết quả cuối cùng 0,40 giây sau khi người nói dừng.

• Độ chính xác trên bản in — không có chỉ số WER hay độ trễ nào được công bố dạng văn bản so với WER truyền phát 4,0% và 2,6% trên mô hình ghi âm sẵn, theo Artificial Analysis.

• Diễn giả — tuyên bố gán nhận định ai-nói-gì trên luồng trực tiếp, chưa xác minh so với không phân tách diễn giả trên điểm cuối Live (khả dụng trên mô hình ghi âm sẵn, tối đa ba diễn giả).

• Ngôn ngữ — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) so với tự động phát hiện trên 85+ với khả năng chuyển đổi giữa luồng.

• Độ dài phiên — chỉ bị giới hạn bởi GPU và bộ nhớ của bạn, thay vì mức trần cứng 10 phút cho mỗi phiên Live.

• Chi phí — $0 cho trọng số, khoảng 18 GB bf16 để tự lưu trữ so với khoảng $0,54 mỗi giờ âm thanh trên Live khi tính cả token đầu ra văn bản.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

"Streaming" nghĩa là gì ở mỗi phía?

Từ này ẩn chứa một khác biệt thiết kế thực sự, và cần nói cho chính xác vì hai hệ thống thậm chí không nhắm tới việc tạo ra cùng một nhịp điệu. Cấu hình tiền xử lý của Microsoft thể hiện cụ thể nhịp VibeVoice: âm thanh đến ở 24 kHz và được nén 3.200× thành một luồng token với tốc độ khoảng 7,5 frame mỗi giây; sau đó, cấu hình khai báo một khối 22 frame và một lookahead 4 frame — khoảng 2,9 giây âm thanh cho mỗi khối, cùng chừng nửa giây âm thanh tương lai để củng cố thêm. Mô hình xuất văn bản một lần cho mỗi khối đã xử lý xong, và ngữ cảnh từ các khối trước được giữ lại qua KV cache, nên một phiên dài không phải tính toán lại từ đầu. Trên thực tế, bản phiên âm tăng dần theo từng nấc khoảng ba giây.

Endpoint Live của Google được thiết kế cho một vòng lặp nhanh hơn, tương tác nhiều hơn: âm thanh truyền lên qua WebSocket theo từng khối PCM 16 hoặc 24 kHz, các bản phiên âm một phần được trả về liên tục trong khi người nói đang nói, và một bản phiên âm hoàn chỉnh có định dạng cuối cùng sẽ về sau 0,40 giây kể từ khi kết thúc lời nói — con số đó là phép đo của Artificial Analysis, được Google trích dẫn. Cái giá phải trả là giới hạn phiên (mười phút âm thanh, sau đó ứng dụng của bạn phải kết nối lại và nối ghép), cùng với các tính năng bổ sung bị thiếu: không có phân tách người nói và không có dấu thời gian cấp từ trên luồng Live, trong khi cả hai đều tồn tại ở Gemini 3.5 Transcribe cho bản ghi sẵn. Vậy nên kết luận trung thực là: mô hình streaming của Google nhanh hơn theo từng lượt phát biểu, còn mốc streaming của Microsoft chậm hơn theo từng khối nhưng tuyên bố có khả năng gán người nói mà luồng Live của Google bỏ qua, ở độ dài phiên mà Google không cung cấp.

Độ chính xác: được đo, so với một khoảng trống

Khoảng cách lớn nhất trong cuộc so sánh này nằm ở bằng chứng, chứ không hẳn ở chất lượng. Artificial Analysis đo Gemini 3.5 Transcribe Live với tỷ lệ lỗi từ trung bình 4,0% trên mô hình streaming và 2,6% trên mô hình non-streaming; mô hình sau được xếp thứ năm trên bảng xếp hạng WER của họ tại thời điểm ra mắt. Google cũng công bố số liệu riêng là 5,50% cho streaming và 5,04% cho non-streaming trên bộ dữ liệu đa ngôn ngữ FLEURS. Hãy đọc những con số này theo đúng nhãn của chúng: Artificial Analysis độc lập với Google, nhưng số liệu từ một API mới ra đời chỉ một ngày vẫn còn quá sớm, và mức chênh lệch mà streaming phải trả so với mô hình batch — 4,0% so với 2,6% — chính là cái giá quen thuộc của việc phân phối theo thời gian thực.

VibeVoice-ASR-Streaming-7B has no comparable figure anywhere. The model card ships an evaluation figure as an image, and Microsoft's technical report is a PDF, but neither offers a plain-text streaming WER or latency number that can be quoted or independently checked. The only numeric anchor in the whole family is the batch VibeVoice-ASR model card, which reports a vendor-run average 7.77% WER across eight English test sets and 2.20% on LibriSpeech clean — figures for the non-streaming model, not this one, and streaming models typically trade a little accuracy for the latency win. Until someone runs the streaming checkpoint through a public harness, the fair statement is that one side of this comparison is measured and the other is not.

Chi phí: một API tính phí theo mức sử dụng so với một GPU bạn đã dự toán ngân sách từ trước.

Google định giá Gemini 3.5 Transcribe Live theo token và tính phí âm thanh ở mức 25 token mỗi giây. Với mức giá Live đã công bố — 3,50 USD/1 triệu token âm thanh và 21 USD/1 triệu token đầu ra văn bản — một giờ âm thanh hỗn hợp rơi vào khoảng 0,54 USD, tức khoảng 9 USD/1.000 phút âm thanh, còn mô hình pre-recorded thậm chí còn rẻ hơn, khoảng 0,30 USD mỗi giờ. Im lặng chỉ miễn phí nếu client của bạn không stream nó: kết nối lại, âm thanh trùng lặp và ghi log đều làm tăng token tính phí trên hóa đơn thực tế.

Checkpoint của Microsoft thay vào đó được định giá theo giờ GPU. Riêng trọng số bf16 đã chiếm khoảng 18 GB trước khi tính đến bất kỳ KV cache nào; các đường dẫn được ghi nhận là các bản demo Python trong kho lưu trữ microsoft/VibeVoice và một plugin vLLM phục vụ các endpoint tương thích WebSocket và OpenAI; và không có mức giá lưu trữ nào vì chưa có nhà cung cấp nào lưu trữ mô hình này — nó không có trên Azure AI Foundry như VibeVoice-ASR batch vốn đã xuất hiện từ tháng 3. Tự lưu trữ một speech-LLM hạng 7B đồng nghĩa với việc phải cân đối ngân sách cho một GPU hạng 24 GB và thời gian vận hành của riêng bạn; đổi lại, bạn có được thời lượng phiên không giới hạn và các trọng số thuộc về bạn. Hai mô hình này không loại trừ lẫn nhau, và đó chính là luận điểm của phần cuối.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Giữ cho sự lựa chọn rẻ

Việc bạn chọn cái nào phụ thuộc vào việc bạn cần một con số hay một mã. Hãy chọn Gemini 3.5 Transcribe Live khi bạn muốn phiên âm hoạt động ngay hôm nay với độ chính xác đã được công bố và không cần GPU để chạy — và khi âm thanh của bạn không bị giới hạn trong mười ngôn ngữ, hoặc bạn sẵn sàng tự xây dựng tính năng gán nhãn người nói vì endpoint Live không cung cấp tính năng này. Hãy chọn VibeVoice-ASR-Streaming-7B khi bạn tự lưu trữ, khi thời lượng phiên không giới hạn hoặc đầu ra phát trực tuyến được cho là có gán nhãn người nói là điều quan trọng, và khi bạn sẵn sàng tự vận hành quy trình đánh giá của riêng mình vì không có chuẩn đối sánh nào để dựa vào.

Cả hai lựa chọn đều không cần phải là vĩnh viễn, và đó là nơi một lớp định tuyến chứng tỏ giá trị của mình — cho các mô hình xoay quanh bản ghi, chứ không phải cho bản thân việc phiên âm. OrcaRouter hiện không định tuyến dịch vụ chuyển giọng nói thành văn bản, và không mô hình nào trên trang này nằm trong danh mục của nó; thay vào đó, nó cung cấp một API duy nhất cho hơn 200 mô hình ngôn ngữ tiêu thụ bản ghi trực tiếp — trình tóm tắt, trình trích xuất mục hành động, bộ lập kế hoạch của voice agent — theo đúng giá niêm yết của nhà cung cấp, được chuyển thẳng không đội giá, kèm khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp. Các đợt hạ giá từ nhà cung cấp cho bất kỳ mô hình nào trong ngăn xếp đó đều có hiệu lực ngay trong ngày, vì giá niêm yết được chuyển thẳng chứ không bị đội lên. Bước phiên âm vẫn nằm ở đúng nơi bạn đặt nó; ngăn xếp xử lý bản ghi chính là lớp mà ở đó một khóa duy nhất cùng một tuyến dự phòng biến một checkpoint một tuần tuổi, chưa qua benchmark, từ một canh bạc thành một lựa chọn có thể kiểm thử.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube