
VibeVoice-ASR-Streaming-1.5B so với Granite Speech 5.0 470M TurboCTC: hai lựa chọn streaming trọng số mở ít ồn ào
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Hai bản phát hành speech-to-text trực tuyến mã nguồn mở thú vị nhất cuối tháng 8 năm 2026 đều được tung ra mà không có sự kiện ra mắt. Ngày 25 tháng 8, {{1}}IBM đưa Granite Speech 5.0 470M TurboCTC lên Hugging Face — chỉ có trọng số, model card và một bài blog, không gì hơn{{/1}} — và ngày 2 tháng 9, {{2}}Microsoft Research tải VibeVoice-ASR-Streaming-1.5B lên dưới namespace microsoft mà không kèm bất kỳ thông báo nào ngoài một dòng tin trong kho GitHub VibeVoice{{/2}}. Chúng cùng một dạng sản phẩm nhưng lại là hai lựa chọn kỹ thuật đối lập: mô hình của IBM là bộ mã hóa CTC thuần túy với 470 triệu tham số, được thiết kế để chạy ở tốc độ edge ngay trên laptop, còn mô hình của Microsoft thuộc lớp speech language model 1.5B, được bọc trong các audio tokenizer và diffusion head — tổng cộng khoảng ba tỷ tham số — được xây dựng để hiểu lời nói như ngôn ngữ trong khi phiên âm.
Trước khi đi vào các con số, cần nói về những nhãn ghi nguồn – thứ giữ cho nội dung này trung thực. Mọi số liệu được đánh dấu là do IBM báo cáo đều lấy từ thẻ mô hình Granite Speech 5.0 470M TurboCTC và các mục trên bảng xếp hạng Open ASR, được IBM chạy qua bộ kiểm chuẩn chính thức vào ngày phát hành và chưa được tái kiểm chứng độc lập. Mọi thông tin về VibeVoice-ASR-Streaming-1.5B đều đến từ việc đọc kho lưu trữ mã nguồn — các tệp cấu hình, thẻ mô hình và tài liệu về streaming của Microsoft — bởi Microsoft chưa công bố bất kỳ con số độ chính xác hay độ trễ nào dưới dạng văn bản, và bên ngoài Microsoft vẫn chưa ai đo điểm chuẩn checkpoint này. Hai mô hình không được chạy trên cùng một bộ kiểm chuẩn dùng chung; sự so sánh này đối chiếu cả hai với cùng một khối bằng chứng công khai — vốn là toàn bộ những gì mà mỗi công ty đưa ra cho đến nay.
Hai bản phát hành thầm lặng, cách nhau tám ngày
Cả hai mô hình đều ra mắt theo cùng một cách không ồn ào, điều này đáng nói thẳng thừng vì cả hai công ty đều không công bố nhiều kể từ đó. Granite Speech 5.0 470M TurboCTC của IBM là bản có giấy phép Apache-2.0 trong đợt ra mắt gồm hai biến thể — IBM cũng phát hành một biến thể phi thương mại -NC với các thông số chính nhỉnh hơn một chút — và thẻ mô hình của nó ghi ngày phát hành 25 tháng 8 năm 2026, với hỗ trợ Transformers gốc và một bài dự thi trên bảng xếp hạng Open ASR cùng ngày. Cặp mô hình streaming của Microsoft, VibeVoice-ASR-Streaming-7B và VibeVoice-ASR-Streaming-1.5B, được tạo trên Hugging Face trong cùng một phút vào ngày 2 tháng 9; dòng tin trên GitHub công bố "một mô hình ASR streaming hợp nhất liên tục phiên âm ai đã nói gì khi giọng nói đến" ghi ngày 3 tháng 9 và nhắc đến mô hình 7B, để lại mô hình 1.5B được đề cập ở đây với vai trò phiên bản nhỏ hơn đã ra mắt âm thầm bên cạnh.
Điều thú vị là hai nhóm cùng chọn từ “streaming” nhưng lại xây dựng những thứ trái ngược nhau. Granite Speech 5.0 470M TurboCTC là một bộ mã hóa conformer được huấn luyện bằng CTC và giải mã trong một lượt phi tự hồi quy — không có bộ giải mã nào sinh văn bản từng token một, nên xét về cấu trúc, mô hình vừa rẻ vừa nhanh. VibeVoice-ASR-Streaming-1.5B là một speech LLM: hai bộ tokenizer tích chập chuyển đổi âm thanh 24 kHz thành một luồng token tiếng nói ~7,5 Hz; một bộ giải mã thuộc dòng Qwen2 (28 lớp, 1.536 đơn vị ẩn — thuộc phân khúc 1.5B) đọc luồng này; và một diffusion head tạo ra transcript thành từng khối khoảng 2,9 giây với tầm nhìn trước chừng nửa giây. Một bên là một chiếc xe đua; còn bên kia là một mô hình ngôn ngữ nhỏ tình cờ biết lắng nghe.
Kiểm tra thông số kỹ thuật
• Thông số — Granite Speech 5.0 470M TurboCTC: 470M, chỉ có bộ mã hóa (encoder-only) so với VibeVoice-ASR-Streaming-1.5B: ~3B tổng cộng (backbone LM hạng 1.5B cộng với tokenizer và diffusion head).
{{1}}Kiến trúc{{/1}} — bộ mã hóa Conformer với cơ chế tự chú ý theo khối và tự điều kiện hóa, được huấn luyện bằng CTC, giải mã không tự hồi quy theo kiểu tham lam so với các bộ tokenizer âm học/ngữ nghĩa kép làm đầu vào cho bộ giải mã nhân quả họ Qwen2 có đầu khuếch tán DDPM.
• Nhịp đầu ra — ~12,5 khung đầu ra mỗi giây, truyền phát trực tuyến theo từng khối so với ~7,5 Hz token giọng nói, xuất văn bản theo từng khối ~2,9 giây với độ nhìn trước ~0,5 giây.
• Ngôn ngữ — Chỉ tiếng Anh so với mười ngôn ngữ: tiếng Trung, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Bồ Đào Nha, tiếng Nga và tiếng Tây Ban Nha.
• Trọng số — khoảng 0,5 tỷ tham số / chỉ chiếm một phần nhỏ của GB, mức thiết bị biên so với ~5,6 GB bf16, mức GPU NVIDIA.
• Độ chính xác trên tài liệu in — IBM báo cáo WER trung bình ~5,00% trên các tập short-form của Open ASR, trong khi không có con số WER nào được công bố trong văn bản.
• Giấy phép — Apache-2.0 so với MIT.
• Phát hành — 25 tháng 8 năm 2026 so với 2 tháng 9 năm 2026.

Tốc độ: một mô hình được xây dựng để nhỏ gọn, mô hình còn lại để làm mô hình ngôn ngữ.
Sự khác biệt về kiến trúc thể hiện rõ đầu tiên ở tốc độ và phần cứng. Granite Speech 5.0 470M TurboCTC được định vị cho laptop, điện thoại thông minh và các thiết bị biên khác. Vì bộ mã hóa CTC thuần túy không lấy mẫu gì — đầu ra chỉ là một lượt duyệt tham lam duy nhất trên đầu BPE gồm 16.384 đơn vị — nên chi phí chạy cực kỳ thấp, và bảng thông số mô hình của IBM báo cáo thông lượng Open ASR đo trên một GPU H200 duy nhất nằm ở mức hàng chục nghìn RTFx cho dòng TurboCTC, cùng với bản demo WebGPU phiên âm trực tiếp trong tab trình duyệt. Các con số đó do IBM đo lường và chưa được kiểm chứng độc lập, nhưng điểm cốt lõi về cấu trúc vẫn đứng vững: một bộ mã hóa 470M không có bộ giải mã tự hồi quy là mô hình bạn có thể chạy trên phần cứng mà một chiếc điện thoại được trang bị sẵn.
VibeVoice-ASR-Streaming-1.5B lại đi theo hướng đánh đổi ngược lại. Bộ giải mã của nó là một mô hình ngôn ngữ nhân quả, nghĩa là văn bản được tạo sinh trong một vòng lặp nặng nề hơn so với phép argmax CTC, và những cách vận hành được tài liệu hóa đều là tự triển khai trên GPU NVIDIA — các bản demo Python trong kho lưu trữ microsoft/VibeVoice hoặc plugin vLLM của nó — với khoảng 5,6 GB trọng số bf16, trước khi tính đến bất kỳ KV cache nào. Microsoft chưa công bố con số thông lượng hay hệ số thời gian thực nào, nên không có con số nào từ phía nhà cung cấp để đối chiếu với con số của IBM. Bù lại, thứ kiến trúc LLM mang đến là ngữ cảnh: mô hình mang khả năng hiểu người nói và nội dung xuyên suốt bản phiên âm theo cách mà một mô hình ngôn ngữ vẫn làm — đó là sự khác biệt giữa việc phiên âm âm thanh và theo dõi một cuộc hội thoại.
Độ chính xác: một nhà cung cấp hiển thị số liệu, nhà cung cấp kia hiển thị hình ảnh
Xét về bằng chứng, Granite Speech 5.0 470M TurboCTC dẫn trước VibeVoice-ASR-Streaming-1.5B với cách biệt trọn cả một chuẩn đánh giá công bố được. Ngay trong ngày phát hành, IBM đã chạy mô hình của mình trên bộ khung đánh giá chính thức của bảng xếp hạng Open ASR và báo cáo tỷ lệ lỗi từ (WER) trung bình khoảng 5.00% trên các bộ dữ liệu nói ngắn tiếng Anh công khai — con số do chính nhà cung cấp đo, chưa được bên thứ ba xác minh, và hoàn toàn vắng bóng ở phía Microsoft trong phép so sánh này. Thẻ mô hình của VibeVoice-ASR-Streaming-1.5B đăng tải kết quả đánh giá dưới dạng một hình ảnh, nhưng không có chỉ số WER, RTF hay độ trễ dạng số nào trong phần mô tả; mốc số duy nhất trong dòng VibeVoice là mức WER trung bình 7.77% do nhà cung cấp báo cáo trên tám bộ kiểm tra tiếng Anh của thẻ VibeVoice-ASR bản batch — con số mô tả mô hình không-streaming và không thể áp dụng cho mô hình streaming. Dù các lần chạy độc lập cuối cùng có cho ra kết quả thế nào, lời tóm tắt trung thực ở thời điểm này là: IBM công bố một con số, còn Microsoft công bố một hình ảnh.

Ngôn ngữ và đầu ra: chỉ tiếng Anh so với ai-nói-gì trong mười
Granite Speech 5.0 470M TurboCTC chỉ hỗ trợ tiếng Anh và trả về văn bản phiên âm thô. Điều đó không phải là khiếm khuyết đối với các khối lượng công việc mà IBM đang nhắm tới — phiên âm tiếng Anh doanh nghiệp trên phần cứng biên — nhưng nó chấm dứt sự so sánh ngay khi âm thanh của bạn không phải tiếng Anh. VibeVoice-ASR-Streaming-1.5B liệt kê mười ngôn ngữ và tuyên bố cung cấp đầu ra gán người nói theo luồng: thẻ mô hình cho biết nó "liên tục phiên âm ai nói gì khi giọng nói đến", với từ khóa nóng cho các thuật ngữ chuyên ngành được truyền dưới dạng prompt ngữ cảnh. Cả hai tính năng bổ sung này đều cần được xem xét với thái độ hoài nghi — diarization theo luồng xuyên qua các ranh giới chunk thực sự khó, và tuyên bố này chưa được xác minh — nhưng chúng là lý do khiến một nhóm có các cuộc họp trực tiếp đa ngôn ngữ sẽ nhìn đến mô hình của Microsoft ngay từ đầu.
Cấp phép và hệ sinh thái: Apache-2.0 so với MIT, Transformers so với một repo nghiên cứu
Cả hai giấy phép đều cho phép sử dụng thương mại, điều này ngay lập tức đã tách cặp mô hình này khỏi biến thể -NC của chính IBM trên cùng một kiến trúc. Granite Speech 5.0 470M TurboCTC được phát hành theo Apache-2.0 với điều khoản cấp quyền sáng chế thông thường và được hỗ trợ nguyên bản trong Hugging Face Transformers (AutoModelForCTC từ transformers >= 5.16), cùng với mlx-audio cho Apple Silicon — nghĩa là nó chạy được ở bất kỳ đâu mà cộng đồng triển khai lớn nhất trong hệ sinh thái chạy, trên phần cứng của bất kỳ nhà sản xuất nào. VibeVoice-ASR-Streaming-1.5B dùng giấy phép MIT, thậm chí còn đơn giản hơn, nhưng đường dẫn serving của nó lại là một thiết lập nghiên cứu phải dựng từ mã nguồn: lớp kiến trúc của checkpoint, VibeVoiceForASRStreamingTraining, không nằm trong tài liệu Transformers công khai, và tài liệu streaming của chính Microsoft trỏ về mã demo trong repo cùng với plugin vLLM thay vì một thư viện chuẩn có sẵn để nạp trực tiếp. Với một đội ngũ production, sự khác biệt là rất thực: một mô hình có thể gắn thẳng vào pipeline Transformers hiện có ngay hôm nay, còn mô hình kia đòi hỏi bạn phải tự dựng một repo nghiên cứu và tự kiểm chứng đường dẫn nạp mô hình.

Bạn nên đánh giá bản phát hành thầm lặng nào?
Hãy đánh giá Granite Speech 5.0 470M TurboCTC trước nếu khối lượng xử lý của bạn là tiếng Anh, phần cứng của bạn thuộc loại edge-class hoặc bị giới hạn CPU, và bạn cần một mô hình chạy trực tiếp được trên Transformers với con số trên model card để đối chiếu kiểm tra. Đây là lựa chọn có rủi ro thấp hơn trên mọi phương diện, trừ một điểm — nó sẽ không giúp bạn với ngôn ngữ thứ hai hay bản ghi cuộc họp trực tiếp cần biết ai đang nói.
Đánh giá VibeVoice-ASR-Streaming-1.5B nếu bạn cần phát trực tuyến đa ngôn ngữ, nếu muốn thử nghiệm các tính năng như đầu ra ai-nói-gì hoặc hotwords, hoặc nếu bạn muốn tin tưởng vào cách tiếp cận mô hình ngôn ngữ cho nhận dạng giọng nói thay vì encoder thuần túy. Hãy dự trù ngân sách cho một GPU NVIDIA, cài đặt từ mã nguồn, ~5,6 GB trọng số, và một quy trình đánh giá do chính bạn thiết kế, vì chưa ai — kể cả Microsoft — công bố một con số đáng tin cậy.
Điều mà cả hai bản phát hành thầm lặng đều không thay đổi, là giá trị của việc giữ tầng ASR có thể hoán đổi trong lúc bạn chờ xem canh cược nào sẽ mang lại kết quả. Cả hai mô hình đều còn rất mới và tính đến thời điểm viết bài này, chưa mô hình nào được phục vụ qua OrcaRouter; khi một nhà cung cấp lưu trữ một trong hai mô hình, cách dùng thử ít rủi ro nhất là đặt nó đằng sau một lớp định tuyến nằm trước hơn 200 mô hình với đúng giá niêm yết của nhà cung cấp — chênh lệch giá 0%, nên mọi thay đổi giá đều được áp dụng ngay trong ngày — kèm cơ chế tự động chuyển dự phòng (automatic failover) sang hệ thống mà bạn vốn đã tin cậy. Hãy định tuyến một phần âm thanh thực tới mô hình mới, đọc các bản transcript, rồi để chính lưu lượng của bạn — chứ không phải bảng benchmark ra mắt đúng ngày phát hành — quyết định xem đâu mới là canh cược thầm lặng đúng đắn.
