
VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B:未經實證的 MIT 挑戰者,對上開放語音辨識(Open ASR)冠軍
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
如果你今天在生產環境中需要開放權重的語音轉文字,有一個預設選擇,它的名字是 NVIDIA Parakeet TDT 0.6B。自2025年5月以來,擁有6億參數的 Parakeet TDT 0.6B v2 一直佔據 Hugging Face 開放式 ASR 排行榜的榜首,平均詞錯誤率為6.05%,這個排名已被第三方重現超過一年。最新的潛在挑戰者是 VibeVoice-ASR-Streaming-1.5B,微軟研究院於2026年9月2日上傳——比 Parakeet 晚了十六個月,採用 MIT 授權,以串流說話者歸屬為賣點,但到目前為止完全沒有公布任何準確度數值。本頁將從實證、架構,以及兩者開箱即用的實際功能來比較衛冕者與挑戰者。
在規格之前,有兩個名稱很重要,因為它們勾勒出這場對決的整體樣貌。Parakeet 的數據已經塵埃落定:其「每秒處理約一小時音訊」主張背後的平均 6.05% WER 與約 3,386 RTFx 吞吐量,已公開於排行榜和 NVIDIA 官方資料超過一年。至於 VibeVoice-ASR-Streaming-1.5B 這一方,外界能得知的只有其儲存庫所揭露的內容——模型卡、設定檔與 Microsoft 串流文件——因為 Microsoft 從未以文字發布任何 WER、延遲或吞吐量數據,且截至撰寫本文為止,也沒有任何針對該檢查點的獨立基準評測。以下每個比較中,一邊是經實戰考驗的數據;另一邊只是一份規格表。
相隔十六個月及一段排行榜稱霸時期
Parakeet TDT 0.6B v2 於 2025 年 5 月 5 日推出,是 NVIDIA 針對串流語音辨識(streaming-ASR)問題提出的解答:一個 FastConformer 編碼器,搭配 token 與時長轉換器(TDT)解碼器,在單一步驟中同時預測每個 token 及其持續時間——這項效率技巧消除了傳統轉換器中空白 token 的額外開銷。它採用 CC-BY-4.0 授權,對商用友善,並以 6.05% 的平均詞錯誤率登上 Open ASR 排行榜榜首。它還帶來了排行榜無法衡量的生產級功能——標點符號、大小寫還原、詞級時間戳——以及一個全注意力編碼器,單次處理可接受長達 24 分鐘的音訊,使其在無需積極切塊的情況下,特別適合長時間會議與播客場景。
VibeVoice-ASR-Streaming-1.5B 是最純粹意義上的挑戰者:它確實存在、有完整文件記錄,但關於它的實際表現,尚無任何定論。微軟 GitHub 的 news 動態於 9 月 3 日發布消息,宣布推出一個統一的串流式 ASR 模型,「能在語音送達的當下,持續轉錄誰說了什麼」,並支援熱詞(hotwords)與十種語言。而該 checkpoint 的 config 所描述的,完全是另一套工程傳統——由卷積式音訊 tokenizer 驅動的 Qwen2 家族語言模型解碼器,配上擴散(diffusion)頭,以約 2.9 秒為單位分段輸出,並具備約 0.5 秒的 lookahead。如果說 Parakeet 是歷經一整年實際部署反覆淬煉、專為語音辨識而生的模型,那麼 VibeVoice-ASR-Streaming-1.5B 不過是誕生僅兩天的研究型 checkpoint 而已。
證據不對稱就是重點所在
在閱讀本頁其餘內容之前,請先記住一個事實:這份比較只有一邊有具體數字。在 Parakeet TDT 0.6B 這邊,有一整年的排行榜防禦成績——在 Open ASR 公開英文短句測試集上平均 WER 為 6.05%,在 NVIDIA 硬體上以 batch 128 達到約 3,386 RTFx,以及一套涵蓋 NeMo 部署工具、TensorRT 加速與 FP8 量化的生態系統,且都已經過實際生產環境的驗證。在 VibeVoice-ASR-Streaming-1.5B 這邊,有的是模型卡上的評測數字——但那是圖片而非文字——以及非串流版 VibeVoice-ASR 卡片上、由廠商回報的 7.77% 平均 WER(跨八個英文測試集)。這個數字描述的是非串流模型,不能直接套用於這個 checkpoint。挑戰者或許真的很出色;但重點在於,「或許真的很出色」就是全部的證據基礎。
規格檢查
{{1}}• 參數 — NVIDIA Parakeet TDT 0.6B:600M,FastConformer 編碼器 + TDT 解碼器,對比 VibeVoice-ASR-Streaming-1.5B:總計約 3B(1.5B 級 Qwen 骨幹,加上分詞器與擴散頭)。{{/1}}
• 發布 — 2025年5月5日 vs 2026年9月2日。
• 準確度 — 平均 WER 6.05%,自 2025 年 5 月起為 Open ASR 第一名;第三方已重現其結果,而其他則無任何已發表的成果。
• 速度 — 在 NVIDIA 硬體上、批次大小為 128 時約為 3,386 RTFx,每秒約可處理 1 小時的音訊;相比之下,未公布任何吞吐量數據。
• 串流 — 支援串流,每次完整注意力上下文最多 24 分鐘;對比分塊串流(約 2.9 秒區塊,含約 0.5 秒前瞻)。
• 輸出附加功能 — 標點符號、大小寫、逐詞時間戳 vs 串流式發言人歸屬(未驗證)與熱詞;共十種語言。
• 授權 — CC-BY-4.0 對比 MIT.
• 生態系統 — NVIDIA NeMo(搭配 TensorRT 與 FP8)對比 microsoft/VibeVoice 儲存庫中的示範,以及一個 vLLM 外掛程式。


深入內部:關於語音模型用途的兩種觀點
這幾種架構代表了對這項工作的兩種不同信念。Parakeet TDT 0.6B 將轉錄視為一個可以被高效解決的訊號處理問題:FastConformer 編碼器擷取聲學特徵,而 TDT 解碼器則同時輸出文字 token 與時長,因此它能以即時速度的數千倍運行,也因此在 NVIDIA 的部署堆疊上表現得游刃有餘。VibeVoice-ASR-Streaming-1.5B 則將轉錄視為一個語言問題:先將音訊壓縮成 token 串流,交給一個已讀取相當於整份逐字稿脈絡的語言模型,讓 LM 對「誰說了什麼」以及「對話如何串連」的理解來完成工作。LLM 骨幹也正是這個 checkpoint 約有 3B 參數而非 600M 的原因,也是微軟從未宣稱能在邊緣裝置運行的原因——這是一個需要 GPU 的模型,並利用記憶體來承載脈絡。
對於即時轉錄,實際的後果是延遲的形態。Parakeet 的全注意力編碼器可以在單一遍歷中處理長視窗,這與 VibeVoice-ASR-Streaming-1.5B 的固定區塊與前瞻契約不同,後者每個輸出片段約對應 2.9 秒音訊。兩者都不是最低延遲商用 API 那種逐字部分結果的串流器;兩者都是區塊式系統,正確的選擇取決於你的音訊是以有界檔案的形式到來,還是開放式即時工作階段。
專題報導與部署區域
開箱即用,Parakeet TDT 0.6B 是更完整的轉錄產品:標點符號和大小寫會隨轉錄稿一起提供,逐字時間戳記可用於對齊,而且 24 分鐘的單遍處理視窗意味著在長時間錄音中分段錯誤較少。VibeVoice-ASR-Streaming-1.5B 則以 Parakeet 未列出的功能來反制:說話者歸屬輸出和熱詞,涵蓋十種語言。這個串流式說話者分離的主張,正是需要獨立驗證的那種事——分段邊界正是歸屬容易偏移的地方——但如果你在即時會議中必須知道誰說了什麼,這就是你該考慮 Microsoft 模型而非 NVIDIA 模型的原因。

這些周邊環境的多樣性,絲毫不亞於模型本身。Parakeet TDT 0.6B 是 NVIDIA NeMo 的正式公民:TensorRT、FP8,以及專為 NVIDIA GPU 調校的部署工具鏈,若你已經身處 NVIDIA 基礎設施之中,這點可謂相當出色。VibeVoice-ASR-Streaming-1.5B 則棲身於研究型儲存庫:文件中所描述的路徑是 Microsoft 的 Python 示範程式及一個 vLLM 外掛,其架構類別尚未收錄於公開的 Transformers 文件中,要讓它順利運作,得從原始碼自行建置,並親手驗證載入路徑是否可行。對於一個重視穩定可靠、文件完善的部署流程的團隊而言,光是這項差異,就足以蓋過基準測試上的差距。
現任者的理由,挑戰者的理由
NVIDIA Parakeet TDT 0.6B 的優勢在於它是一個已知量:一年來的排行榜防禦、第三方複現、商用授權、生產級功能,以及已經承載真實流量的部署生態系。如果你本季度要推出英文轉錄功能,而且想要開放權重,這就是站得住腳的預設選擇,任何聲稱能取代它的方案都必須承擔舉證責任。
VibeVoice-ASR-Streaming-1.5B 的適用情境較狹窄且特定:你需要串流說話者歸屬或熱詞,你需要的不只是英文,或者你相信以語言模型為基礎的語音路線終將勝出,並希望提早卡位。這是一場賭注,而不是一項決策——目前還沒有任何數據足以證明將正式流量移轉到它身上是合理的,而微軟自身的姿態也是研究優先。目前這兩種模型都尚未透過 OrcaRouter 提供服務,因此測試這項賭注的低成本方式,正是適用於任何新興開放模型的模式:將 ASR 層保留在單一路由 API 之後,由該 API 以供應商列表價格、無加價且具自動容錯移轉的方式,介接 200 多種模型;一旦有供應商開始託管 VibeVoice-ASR-Streaming-1.5B,就立即將一部分真實音訊路由過去;接著讓你自身流量的轉錄結果來決定,這個挑戰者是否配得上 Parakeet 已蟬聯十六個月的王冠。
