
VibeVoice-ASR-Streaming-7B so với GPT-Transcribe: Điểm kiểm tra phiên trực tiếp so với điểm cuối tệp của OpenAI
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Hai mô hình trên trang này không phải là đối thủ của nhau theo cái cách mà tên gọi của chúng gợi lên — chúng được xây dựng cho những thời điểm khác nhau trong vòng đời của một bản ghi âm, và sự so sánh trung thực chính là ở việc sản phẩm của bạn đang sống trong thời điểm nào. GPT Transcribe là endpoint phiên âm bất đồng bộ của OpenAI: bạn tải lên một tệp hoàn chỉnh, nó xử lý nhanh gấp khoảng 34 lần so với thời gian thực và trả về một bản phiên âm, với mức giá 0,0045 USD mỗi phút âm thanh và tỷ lệ lỗi từ 3,31% được đo lường độc lập trên chuẩn AA-WER của Artificial Analysis. VibeVoice-ASR-Streaming-7B lại có hình thái ngược lại: checkpoint streaming của Microsoft Research, được âm thầm đăng tải lên Hugging Face vào ngày 2 tháng 9 năm 2026 theo giấy phép MIT, được xây dựng để phiên âm âm thanh trong khi âm thanh vẫn đang được truyền tới — một phiên WebSocket phát ra văn bản thành từng phần khi bản ghi vẫn còn đang lớn dần. So sánh hai mô hình chỉ dựa trên độ chính xác sẽ là vô nghĩa, bởi một bên có con số đã được kiểm toán còn bên kia chưa công bố bất kỳ con số nào dưới dạng văn bản.
Mọi thứ dưới đây đều được ghi nhãn tương ứng. Các số liệu của GPT Transcribe là mức giá được OpenAI công bố và kết quả đo lường độc lập của Artificial Analysis, cả hai đều nằm trong hồ sơ công khai kể từ khi mô hình ra mắt vào ngày 28/7/2026. Còn phía VibeVoice-ASR-Streaming-7B chỉ bao gồm những gì có thể biết được từ kho lưu trữ — cấu hình checkpoint, model card và tài liệu streaming của Microsoft — vì chưa có bên thứ ba nào chạy benchmark cho nó và Microsoft cũng chưa công bố tỷ lệ lỗi từ (word-error rate) ở chế độ streaming dưới dạng văn bản đọc được.
Hai khoảnh khắc khác nhau trong đời sống của âm thanh
GPT Transcribe được thiết kế cho các bản ghi âm đã diễn ra. Endpoint của OpenAI chấp nhận các tệp âm thanh tối đa 25 MB với các định dạng phổ biến — mp3, mp4, mpeg, mpga, m4a, wav, webm — và trả về bản transcript đầy đủ sau khi xử lý, nhanh gấp khoảng 34 lần thời gian thực, nên một bản ghi dài một giờ sẽ hoàn tất trong vài phút. Đây là luồng xử lý hàng loạt, và OpenAI định giá tương ứng: $0.0045 mỗi phút âm thanh, khoảng $0.27 mỗi giờ âm thanh. Nếu nhu cầu của bạn thực sự là trực tiếp, OpenAI bán một mô hình riêng cho việc đó — GPT Live Transcribe với giá $0.017 mỗi phút, gần gấp bốn lần giá batch — đây là thứ gần nhất về phía OpenAI với những gì VibeVoice-ASR-Streaming-7B làm.
VibeVoice-ASR-Streaming-7B xóa nhòa sự phân biệt đó theo hướng ngược lại: nó là một checkpoint streaming nhưng cũng xử lý được toàn bộ tệp. Cấu hình tiền xử lý của nó thể hiện quy ước trực tiếp — âm thanh vào ở 24 kHz, nén 3.200× thành luồng token 7,5 Hz, sau đó được xử lý theo khối 22 frame với 4 frame lookahead, mỗi khối khoảng 2,9 giây âm thanh với khoảng nửa giây ngữ cảnh tương lai, xuất ra văn bản ngay khi từng khối hoàn tất. Ngữ cảnh phiên được truyền tiếp qua bộ đệm KV, vì vậy một phiên dài không phải tính toán lại từ đầu. Đường dẫn phục vụ được tài liệu hóa (một plugin vLLM) cung cấp endpoint luồng WebSocket cho các phiên trực tiếp và endpoint phiên âm toàn bộ tệp, nhờ đó cùng một bộ trọng số phục vụ cả hai dạng — nhưng lý do tồn tại của mô hình này là dạng trực tiếp, và không có tính phí theo phút vì không có API lưu trữ. Bạn cần tự cung cấp GPU.

Sổ ghi chép bằng chứng là phiến diện.
GPT Transcribe là một trong những API phiên âm được đo lường kỹ lưỡng nhất đang vận hành thực tế. Artificial Analysis xếp nó ở mức tỷ lệ lỗi từ 3,31% trên AA-WER — đứng thứ chín trong khoảng năm mươi hệ thống được theo dõi — với một điểm yếu đã biết nằm sâu trong các chỉ số phụ: trên bộ dữ liệu Earnings22 có chủ ý đánh giá âm học khó, nó tụt xuống 6,10%. Đó là những con số đã được kiểm toán, có thể tái lập từ một bảng xếp hạng trung lập, và chúng đi kèm với những giới hạn mà bản thân các giới hạn đó cũng được ghi chép rõ ràng. Mô hình này ra mắt rẻ hơn 25% so với phiên bản tiền nhiệm GPT-4o Transcribe và tốt hơn khoảng 0,7 điểm trên cùng một chuẩn đánh giá.
VibeVoice-ASR-Streaming-7B không có con số nào có thể so sánh được ở bất kỳ đâu. Thẻ mô hình của nó đăng tải con số đánh giá dưới dạng hình ảnh và báo cáo kỹ thuật của Microsoft là một tệp PDF, nhưng không có con số WER phát trực tuyến hay độ trễ nào có thể trích dẫn được dưới dạng văn bản, và cũng không có gì có thể kiểm chứng độc lập. Điểm neo số liệu duy nhất trong gia đình VibeVoice là bảng do nhà cung cấp công bố trong thẻ mô hình batch VibeVoice-ASR — trung bình 7,77% WER trên tám bộ kiểm tra tiếng Anh và 2,20% trên LibriSpeech clean — con số này mô tả mô hình không phát trực tuyến và không được hiểu là độ chính xác của checkpoint này. Nếu quyết định mua hàng của bạn cần một con số có thể bảo vệ được trước đồng nghiệp, thì chỉ một phía trong phép so sánh này mới có con số đó.
Những gì mỗi cái trả về ngoài bản ghi đơn thuần
Hai mô hình có cách đặt cược khác nhau về ngữ cảnh, và đó là điểm khiến việc so sánh tính năng trở nên thú vị. Điểm mạnh của GPT Transcribe là gợi ý ngữ cảnh: bạn có thể truyền vào một mô tả tự do về bản ghi âm, danh sách từ khóa và danh từ riêng, cùng danh sách ngôn ngữ dự kiến, và OpenAI báo cáo rằng trên benchmark Context-Aware ASR của họ, độ chính xác ngữ nghĩa đã tăng từ 41,6% khi không có ngữ cảnh lên 45,2% khi có ngữ cảnh. Nó cũng trả về ngôn ngữ được phát hiện. Điều nó không làm là phân tách người nói (speaker diarization) hoặc dấu thời gian ở cấp độ từ — OpenAI chỉ đến các mô hình riêng cho những việc đó — vì vậy bản ghi cuộc họp sẽ trả về dưới dạng một khối văn bản duy nhất không được phân biệt, trừ khi bạn tự xây dựng lớp người nói cho riêng mình.
VibeVoice-ASR-Streaming-7B đặt cược theo hướng ngược lại. Thẻ mô hình (model card) của nó tuyên bố hỗ trợ đầu ra gán nhãn người nói theo luồng (streaming) — ai đã nói gì, được xuất ra ngay khi chunk được xử lý xong — cùng với hotword tùy chỉnh thông qua context prompt (cờ dòng lệnh là --context_info). Đây là tính năng mà GPT Transcribe hoàn toàn bỏ qua, và đó là lý do hai mô hình không thể thay thế cho nhau trong âm thanh trực tiếp nhiều người nói. Điểm đối trọng nằm ở sự kiểm chứng: các tính năng còn thiếu của GPT Transcribe là một quyết định sản phẩm được ghi lại rõ ràng, còn tuyên bố gán nhãn người nói của VibeVoice mới chỉ là một phát biểu trên model card mà chưa có bài kiểm tra độc lập nào xác nhận. Hai bên cũng khác nhau về timestamp — không bên nào cung cấp timestamp cấp độ từ trên luồng đang so sánh, dù mô hình batch của dòng VibeVoice thì có.

Các hình thái giá và câu hỏi về quyền sở hữu
Các cơ cấu chi phí này khó có thể khác biệt hơn được nữa, và không bên nào thực sự tốt hơn hẳn. GPT Transcribe là một API tính phí theo mức sử dụng: $0,27 mỗi giờ âm thanh, không cần hạ tầng, không cần GPU, 25 MB mỗi yêu cầu, cùng các cam kết vận hành của OpenAI — cái giá của việc không tự vận hành một mô hình nhận dạng giọng nói. VibeVoice-ASR-Streaming-7B có giá $0 cho phần trọng số, nhưng cần khoảng 18 GB bf16 trước khi tính thêm KV cache, nghĩa là một GPU thuộc phân khúc 24 GB, mã demo microsoft/VibeVoice hoặc plugin vLLM, cùng việc tự giám sát và tự mở rộng quy mô. Chính giấy phép MIT là điểm khác biệt mà không một mức giá tính theo phút nào phản ánh được: trọng số là của bạn — để giữ, để tinh chỉnh và để chạy trên phần cứng bạn kiểm soát — không có bộ đếm theo người dùng và không có trần 25 MB.
Ngữ cảnh hỗ trợ ngôn ngữ là nơi mà cả hai bên đều mơ hồ hơn so với những gì người mua mong muốn.{{1}} VibeVoice-ASR-Streaming-7B liệt kê 10 ngôn ngữ trong model card của nó — tiếng Anh, tiếng Trung, tiếng Tây Ban Nha, tiếng Bồ Đào Nha, tiếng Đức, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Nga, tiếng Ý —{{/1}} trong khi đó batch VibeVoice-ASR hỗ trợ hơn 50 ngôn ngữ.{{2}} OpenAI không công bố danh sách ngôn ngữ đã được xác minh tương đương cho GPT Transcribe; họ báo cáo kết quả mạnh mẽ trên 22 ngôn ngữ Common Voice trong tài liệu ra mắt của mình,{{/2}} và điểm yếu âm thanh đã được kiểm toán của họ trên Earnings22 là một lời nhắc nhở rằng "được hỗ trợ" và "xử lý tốt âm thanh nhiễu bằng ngôn ngữ đó" là những khẳng định khác nhau.{{3}} Nếu nhu cầu về ngôn ngữ của bạn rộng, thì không danh sách nào trong số đó giải quyết được vấn đề — hãy kiểm tra trên phương ngữ thực tế của bạn.{{/3}}

Điểm mấu chốt: hãy chọn theo làn đua, không phải theo điểm số.
Chọn GPT Transcribe khi audio là một tệp đã hoàn chỉnh, khi bạn muốn một con số độ chính xác được ghi nhận với các giới hạn đã biết, hoặc khi việc không tự vận hành hạ tầng nhận dạng giọng nói của riêng bạn xứng đáng với mức $0.27 một giờ — và chỉ kết hợp nó với GPT Live Transcribe nếu việc phân phối theo thời gian thực biện minh cho mức giá cao gần gấp 4 lần. {{1}}Chọn VibeVoice-ASR-Streaming-7B{{/1}} khi công việc là trực tiếp và có nhiều người nói, khi bạn muốn bản ghi âm đến trong khi cuộc trò chuyện vẫn đang diễn ra, khi đầu ra phát trực tuyến có gán nhãn người nói là một tính năng bạn muốn đánh giá, hoặc khi trọng số mở và quyền kiểm soát dữ liệu quan trọng hơn một điểm chuẩn được đo lường.
Một lưu ý về cấu trúc cho các đội ngũ xây dựng trên một trong hai nền tảng: lớp phiên âm không phải thứ mà OrcaRouter định tuyến hiện nay — không có mô hình chuyển giọng nói thành văn bản nào trên trang này nằm trong danh mục của nó, vì vậy lựa chọn ASR hoàn toàn vẫn là của bạn. Điều mà định tuyến mang lại cho bạn là lớp phía trên bản phiên âm. Một nguồn cấp dữ liệu phiên âm trực tiếp chỉ hữu ích khi có thứ gì đó tác động lên nó — bộ tóm tắt, quy tắc cảnh báo, bộ lập kế hoạch của agent giọng nói — và đó chính là ngăn xếp mà OrcaRouter đứng trước với một API duy nhất kết nối hơn 200 mô hình ở mức giá niêm yết từ nhà cung cấp, chuyển qua mà không tính phí chênh lệch, cùng với cơ chế tự động chuyển đổi dự phòng. Mô hình giúp một điểm kiểm tra chưa được kiểm chứng như VibeVoice-ASR-Streaming-7B trở nên đáng thử chính là như vậy: giữ cho điểm cuối tiêu thụ bản phiên âm của bạn có thể hoán đổi được, và một mô hình chưa có điểm chuẩn nào vẫn có thể giành được hoặc mất lưu lượng truy cập của bạn dựa trên bằng chứng từ chính âm thanh của bạn, thay vì dựa trên tuyên bố ngày ra mắt.
