Một thẻ tiêu đề hero được tạo cho 'VibeVoice-ASR-Streaming-1.5B so với Gemini 3.5 Transcribe: ASR streaming lặng lẽ của Microsoft so với API mới của Google', kèm phụ đề 'ASR streaming nguồn mở lặng lẽ của Microsoft so với API lưu trữ mới của Google', với hai thẻ mô hình — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · trọng số MIT, ngày 2 tháng 9 năm 2026 · checkpoint mở · 10 ngôn ngữ) và Gemini 3.5 Transcribe (Google · bản xem trước công khai, ngày 26 tháng 8 năm 2026 · API lưu trữ · 2 điểm cuối) — cùng các nhãn có nội dung 'Chưa có thông báo nào', 'Chưa công bố benchmark' và '~0,30–0,54 USD mỗi giờ audio (Google)'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B so với Gemini 3.5 Transcribe: ASR phát trực tuyến thầm lặng của Microsoft đối đầu với API mới của Google

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bảy ngày và một ranh giới triết lý tách rời hai hệ thống chuyển giọng nói thành văn bản theo thời gian thực mới nhất. Ngày 26 tháng 8 năm 2026, Google đưa Gemini 3.5 Transcribe vào bản xem trước công khai: một API chuyển giọng nói thành văn bản lưu trữ trên đám mây, mã nguồn đóng, tính phí theo token âm thanh, kèm một endpoint Live riêng cho các phiên thời gian thực. Ngày 2 tháng 9 năm 2026, Microsoft Research tải VibeVoice-ASR-Streaming-1.5B lên Hugging Face dưới namespace microsoft — bộ trọng số được cấp phép MIT, không thông cáo báo chí, không bài đăng ra mắt, và tại thời điểm viết bài này, chưa có bất kỳ bên thứ ba nào đưa tin. Cả hai đều chuyển lời nói thành văn bản ngay trong khi lời nói vẫn còn được truyền tới. Gần như mọi thứ khác về chúng — ai được phép chạy chúng, chi phí là bao nhiêu, có bằng chứng gì cho thấy chúng hoạt động — đều khác biệt.

Trang này so sánh hai sản phẩm đúng như thực trạng hiện tại của chúng, nghĩa là hai phía của bằng chứng không đối xứng nhau. Gemini 3.5 Transcribe là một sản phẩm Google đang hoạt động thực tế, với giá token được công bố và số liệu độ chính xác từ bên thứ ba do Artificial Analysis đo đạc; đây là những con số được gắn nhãn AA phía dưới. VibeVoice-ASR-Streaming-1.5B là một checkpoint mà model card của nó hoàn toàn không công bố tỷ lệ lỗi từ (word-error-rate) hay bất kỳ số liệu độ trễ nào dưới dạng văn bản — phần đánh giá trong model card chỉ là một hình ảnh, và cho đến nay, thông báo duy nhất của dòng sản phẩm streaming này chỉ là một dòng tin tức đề ngày 3 tháng 9 trong kho GitHub VibeVoice của Microsoft. Mọi thứ về phía Microsoft được nêu bên dưới đều là những gì có thể biết từ kho lưu trữ: các tệp cấu hình, model card và tài liệu streaming của chính Microsoft. Sản phẩm này vẫn chưa được kiểm chuẩn độc lập.

Hai mô hình trong nháy mắt

• Bản chất — VibeVoice-ASR-Streaming-1.5B: checkpoint mở, giấy phép MIT, tự lưu trữ so với Gemini 3.5 Transcribe: API lưu trữ, trọng số đóng.

• Phát hành — trọng số ngày 2 tháng 9 năm 2026, dòng tin repo ngày 3 tháng 9 so với bản xem trước công khai ngày 26 tháng 8 năm 2026 kèm tài liệu ra mắt đầy đủ.

• Dạng phát trực tuyến — phát văn bản theo từng khối ~2.9 giây với ~0.5 giây nhìn trước, trạng thái phiên được lưu trong bộ đệm tiền tố so với phiên WebSocket Live được tính phí theo token âm thanh, giới hạn tối đa 10 phút âm thanh mỗi phiên.

• Độ chính xác trên ấn phẩm — không có số liệu WER hoặc độ trễ nào được công bố bằng văn bản so với WER 2,6% do AA đo được trên endpoint ghi âm sẵn và 4,0% trên endpoint trực tiếp.

• Đầu ra người nói — tuyên bố gán nhãn ai-nói-gì theo luồng (chưa xác minh) so với việc không phân tách người nói và không có dấu mốc thời gian cấp độ từ trên endpoint Live.

• Hotwords — được hỗ trợ, thông qua cùng prompt ngữ cảnh như bản VibeVoice-ASR batch, trong khi không phải là tính năng được liệt kê của Live endpoint.

• Chi phí — $0 cho trọng số, ~5.6 GB để tự lưu trữ so với khoảng $0.30 mỗi giờ âm thanh kết hợp trên endpoint ghi âm sẵn và ~$0.54 trên Live, theo giá token được Google niêm yết.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, License MIT open weights, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, Speaker output who-said-what claimed, Cost $0 weights / ~5.6 GB self-host. Right column Gemini 3.5 Transcribe: Released Aug 26 2026, License closed API, Streaming WebSocket Live, 10-min cap, WER 2.6% batch / 4.0% Live (AA), Speaker output none on Live, Cost ~$0.30–0.54 per audio-hour. Footer reads 'Gemini figures per Google pricing and Artificial Analysis; VibeVoice specs read from the HF repo; no VibeVoice benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Một API được lưu trữ và một lần tải lên âm thầm, cách nhau bảy ngày

Gemini 3.5 Transcribe là {{1}}mô hình phiên âm thay thế của Google{{/1}}, được cung cấp dưới dạng hai sản phẩm. {{2}}Endpoint xử lý tệp ghi trước{{/2}}, phục vụ qua {{3}}Interactions API{{/3}}, nhận toàn bộ tệp âm thanh và trả về bản phiên âm kèm các tính năng bổ sung thông thường. {{4}}Endpoint trực tiếp{{/4}}, {{5}}gemini-3.5-transcribe-live{{/5}}, chạy qua WebSocket hai chiều và chính là phiên bản cạnh tranh với {{6}}VibeVoice-ASR-Streaming-1.5B{{/6}} về hình thức công việc: phiên âm một phiên làm việc ngay khi đang diễn ra. Google công bố nó theo quy trình quen thuộc — ra mắt {{7}}bản xem trước công khai vào ngày 26 tháng 8{{/7}}, công bố giá trên trang mô hình, và các bảng xếp hạng bên thứ ba đưa nó vào danh sách chỉ trong vài ngày.

Bản phát hành phát trực tuyến của Microsoft không có những điều đó. Vào ngày 2 tháng 9, tài khoản microsoft Hugging Face đã tạo hai checkpoint trong cùng một phút: VibeVoice-ASR-Streaming-7B và VibeVoice-ASR-Streaming-1.5B. Bảng mô hình trong kho lưu trữ GitHub hiện liệt kê VibeVoice-ASR-Streaming như một thành viên trong gia đình, và mục Tin tức của nó có dòng ngày 3 tháng 9 công bố "một mô hình ASR phát trực tuyến thống nhất, liên tục phiên âm ai đã nói gì khi lời nói đến, với hỗ trợ cho các từ nóng tùy chỉnh và 10 ngôn ngữ" — nhưng thông báo đó chỉ nêu tên bản 7B, còn bản 1.5B là phiên bản nhỏ hơn ra mắt cùng lúc nhưng không được nhắc đến. Khi chúng tôi kiểm tra một ngày sau khi tải lên, cả hai checkpoint vẫn hiển thị số lượt tải xuống là không.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

"Streaming" nghĩa là gì ở mỗi phía?

Từ “streaming” che giấu một khác biệt thiết kế thực sự. Cấu hình tiền xử lý của Microsoft khiến nhịp điệu VibeVoice trở nên cụ thể: âm thanh đến ở 24 kHz và được nén 3.200 lần thành một luồng token giọng nói với tốc độ khoảng 7,5 Hz (mỗi token khoảng 133 ms). Cấu hình sau đó khai báo một khối 22 khung và lookahead 4 khung — khoảng 2,9 giây âm thanh cho mỗi khối, với gần nửa giây âm thanh tương lai được dùng để làm vững phân đoạn hiện tại. Mô hình xuất văn bản một lần mỗi khi một khối được giải quyết, và tài liệu của Microsoft nói rằng ngữ cảnh từ các khối trước được bảo toàn qua KV cache, nên một phiên dài không cần tính toán lại từ đầu. Phép toán nằm trong cấu hình; hệ quả thực tế là bản phiên âm phát triển theo từng bước khoảng ba giây, chứ không phải theo các phần rời của từng từ.

Điểm cuối Live của Google có hình thái streaming khác: một phiên WebSocket hai chiều trong đó âm thanh được tính phí 25 token âm thanh mỗi giây, được thiết kế cho mục đích sử dụng tương tác, nhưng giới hạn ở 10 phút âm thanh mỗi phiên và — riêng trên điểm cuối Live — không có tính năng phân biệt người nói hoặc mốc thời gian cấp từ. Với bất kỳ ai so sánh hai hệ thống này như công cụ phiên âm trực tiếp, những khác biệt quan trọng là giới hạn phiên (10 phút ở phía Live của Google, phía Microsoft chỉ bị giới hạn bởi GPU và bộ nhớ của chính bạn), nhịp phát dữ liệu (~khối 3 giây so với bất kỳ thứ gì phiên WebSocket truyền tải), và các tính năng đầu ra bổ sung (gán người nói và từ khóa nóng được quảng cáo trên thẻ của Microsoft, nhưng không có trong danh sách tính năng Live của Google).

Độ chính xác: một bên có số liệu, bên kia có hình ảnh

Đây là khoảng cách lớn nhất trong cuộc so sánh này, và đó là khoảng cách về bằng chứng, không hẳn là về chất lượng. Artificial Analysis đo Gemini 3.5 Transcribe với tỷ lệ lỗi từ là 2.6% trên endpoint ghi sẵn và 4.0% trên endpoint Live — khoản phí bạn phải trả cho việc truyền tải theo thời gian thực thể hiện rõ ở tỷ lệ lỗi, một sự đánh đổi phổ biến và trung thực đối với các hệ thống phát trực tiếp. Đó là những số liệu từ bên thứ ba trên một bảng xếp hạng trung lập, được công bố vài ngày sau khi ra mắt.

VibeVoice-ASR-Streaming-1.5B không có con số nào tương đương để so sánh ở bất kỳ đâu. Thẻ mô hình cung cấp một biểu đồ kết quả đánh giá dưới dạng hình ảnh, nhưng không có số liệu WER, RTF hay độ trễ nào được trình bày dạng văn bản — không có gì để trích dẫn và không có gì để kiểm chứng độc lập. Microsoft cũng chưa công bố số liệu độ chính xác streaming bằng văn bản cho cả bản 7B lẫn bản 1.5B. Điểm tựa số liệu duy nhất trong cả dòng sản phẩm là thẻ mô hình VibeVoice-ASR dạng batch, ghi nhận WER trung bình 7.77% do nhà cung cấp tự chạy trên tám bộ dữ liệu kiểm tra tiếng Anh và 2.20% trên LibriSpeech clean — nhưng con số này mô tả mô hình không streaming, và các mô hình streaming thường đánh đổi một chút độ chính xác để giành lợi thế về độ trễ. Cho đến khi có người chạy checkpoint streaming này trên một bộ kiểm thử công khai, nhận định trung thực là mô hình của Google đã được đo lường, còn mô hình của Microsoft thì chưa.

Chi phí: mỗi giờ âm thanh so với mỗi giờ GPU

Google bán Gemini 3.5 Transcribe theo token, và giá được tách bạch rõ ràng giữa hai endpoint. Endpoint ghi âm sẵn (pre-recorded) niêm yết mức $2 mỗi 1 triệu token âm thanh đầu vào và $12 mỗi 1 triệu token văn bản đầu ra, tương đương khoảng $0,30 mỗi giờ âm thanh tính gộp. Endpoint Live niêm yết $3,50 mỗi 1 triệu token âm thanh và $21 mỗi 1 triệu token văn bản — khoảng $0,54 mỗi giờ âm thanh tính gộp, tức đắt hơn khoảng 80% so với bản ghi âm sẵn, đó là cái giá của việc phân phối thời gian thực. Google tính phí âm thanh ở mức 25 token mỗi giây, nên khoảng lặng chỉ miễn phí nếu client của bạn không stream nó lên; các lần kết nối lại, âm thanh trùng lặp và việc ghi log đều có thể làm tăng hóa đơn thực tế. Có một gói miễn phí, với lưu ý rằng nội dung trong gói miễn phí có thể được sử dụng để cải thiện các sản phẩm của Google.

A generated comparison card titled 'Gemini 3.5 Transcribe — the two endpoints'. Left column 'Pre-recorded': $2 / $12 per 1M audio / text tokens, ~$0.30 per audio-hour, AA WER 2.6%, diarization and word-level timestamps. Right column 'Live': $3.50 / $21 per 1M tokens, ~$0.54 per audio-hour, AA WER 4.0%, no diarization, 10-minute session cap. Footer reads 'Token prices per Google's model page; WER per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Mô hình của Microsoft thì lại được định giá theo giờ GPU. Checkpoint 1.5B chứa khoảng 5,6 GB trọng số bf16 (gồm một backbone ngôn ngữ Qwen cỡ 1.5B, các bộ tokenizer âm thanh và diffusion head – siêu dữ liệu safetensors cho tổng khoảng 3B tham số), và các cách chạy mà tài liệu mô tả đều thuộc dạng tự triển khai: chạy bản demo Python trong kho mã nguồn microsoft/VibeVoice, hoặc dùng plugin vLLM mà Microsoft mô tả để phục vụ mô hình qua các endpoint tương thích OpenAI và WebSocket. Hiện chưa có mức giá cho bản chạy hosted vì chưa có nhà cung cấp dịch vụ suy luận nào niêm yết mô hình này. Bài toán chi phí vì thế hoàn toàn nằm ở việc liệu thời gian GPU của bạn có rẻ hơn mức giá tính theo giờ của Google hay không – và với bất kỳ khối lượng phiên âm duy trì đều đặn nào thì câu trả lời gần như chắc chắn là có. Còn bài toán giấy phép thì tách bạch khỏi bài toán chi phí, vì trọng số MIT là tài sản vĩnh viễn thuộc về bạn theo cách mà không một gói thuê bao API nào có được.

Hai cách này không loại trừ lẫn nhau trong một môi trường production. Mô hình thực dụng cho một đội ngũ cần phiên âm trực tiếp ngay hôm nay là giữ lớp ASR phía sau một endpoint duy nhất để lựa chọn vẫn có thể đảo ngược: một API định tuyến đứng trước hơn 200 mô hình theo giá niêm yết của nhà cung cấp — không cộng thêm phí, nên khi nhà cung cấp thay đổi giá thì giá mới có hiệu lực ngay trong ngày — cùng với automatic failover, chính là lớp giúp bạn chạy API tính phí theo mức sử dụng của Google làm mặc định trong khi một phần lưu lượng thực tế thử nghiệm VibeVoice-ASR-Streaming-1.5B ngay khi có nhà cung cấp host nó. Đó là mô hình của OrcaRouter, và đó là cách ít rủi ro để áp dụng một checkpoint mà độ chính xác của nó chưa được ai xác minh.

Ai nên chọn cái nào

Chọn Gemini 3.5 Transcribe nếu bạn muốn một API phiên âm hoạt động ngay hôm nay, với độ chính xác đã được công bố, mức giá theo giờ dễ dự đoán, và không cần phải chăm GPU — và đặc biệt nếu âm thanh của bạn không nằm trong mười ngôn ngữ mà Microsoft liệt kê, hoặc nếu bạn cần tính năng diarization (tách người nói) và dấu thời gian cấp từ của endpoint ghi âm sẵn (pre-recorded) để phiên âm tệp. Giới hạn phiên Live 10 phút là một ràng buộc thực sự cần kiểm tra với trường hợp sử dụng của bạn trước khi bạn cam kết dùng nó cho các phiên trực tiếp.

Hãy chọn VibeVoice-ASR-Streaming-1.5B nếu bạn tự lưu trữ, nếu bạn muốn có trọng số và quyền kiểm soát dữ liệu mà giấy phép MIT mang lại, nếu bạn cần thời lượng phiên không giới hạn, hoặc nếu đầu ra phát trực tuyến theo dạng ai-nói-gì và hotwords là những tính năng bạn đặc biệt muốn đánh giá. Hãy dự trù cho việc cài đặt từ mã nguồn, khoảng 5,6 GB trọng số trên GPU NVIDIA, và một quy trình đánh giá của riêng bạn — không có benchmark nào để dựa vào, nên câu hỏi về độ chính xác là do chính bạn trả lời bằng dữ liệu audio của mình.

Kết luận sau một tuần: Google tung ra một sản phẩm được cân nhắc kỹ lưỡng, còn Microsoft tung ra một canh bạc thú vị. Gemini 3.5 Transcribe là lựa chọn mặc định an toàn hơn và là bên có số liệu từ bên thứ ba chống lưng; VibeVoice-ASR-Streaming-1.5B là giải pháp mã nguồn mở, có thể tự lưu trữ và hoàn toàn chưa được kiểm chứng. Điều khiến sự lựa chọn này có chi phí thấp là nó không nhất thiết phải là vĩnh viễn — hãy giữ endpoint ASR có thể hoán đổi, và một checkpoint ra mắt không kèm dù chỉ một benchmark vẫn có thể giành hoặc mất lượng truy cập của bạn dựa trên chính transcript của bạn.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube