一張為『VibeVoice-ASR-Streaming-1.5B 對決 NVIDIA Parakeet TDT 0.6B:未經驗證的 MIT 挑戰者挑戰 Open ASR 冠軍』所生成的主視覺標題卡,副標題為『久經考驗的預設選擇對上剛出爐的挑戰者』,包含兩張模型卡——VibeVoice-ASR-Streaming-1.5B(Microsoft Research · 2026年9月2日 · MIT · 尚未發布任何基準測試)與 NVIDIA Parakeet TDT 0.6B(NVIDIA · 2025年5月5日 · CC-BY-4.0 · 自2025年5月起位列 Open ASR 第一名)——以及標籤文字:『6.05% 平均 WER(Parakeet)』、『相差16個月』、『誰說了什麼 + 熱詞(Microsoft,未經驗證)』。OrcaRouter 標誌合成於右下角。
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B:未經實證的 MIT 挑戰者,對上開放語音辨識(Open ASR)冠軍

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

如果你今天在生產環境中需要開放權重的語音轉文字,有一個預設選擇,它的名字是 NVIDIA Parakeet TDT 0.6B。自2025年5月以來,擁有6億參數的 Parakeet TDT 0.6B v2 一直佔據 Hugging Face 開放式 ASR 排行榜的榜首,平均詞錯誤率為6.05%,這個排名已被第三方重現超過一年。最新的潛在挑戰者是 VibeVoice-ASR-Streaming-1.5B,微軟研究院於2026年9月2日上傳——比 Parakeet 晚了十六個月,採用 MIT 授權,以串流說話者歸屬為賣點,但到目前為止完全沒有公布任何準確度數值。本頁將從實證、架構,以及兩者開箱即用的實際功能來比較衛冕者與挑戰者。

在規格之前,有兩個名稱很重要,因為它們勾勒出這場對決的整體樣貌。Parakeet 的數據已經塵埃落定:其「每秒處理約一小時音訊」主張背後的平均 6.05% WER 與約 3,386 RTFx 吞吐量,已公開於排行榜和 NVIDIA 官方資料超過一年。至於 VibeVoice-ASR-Streaming-1.5B 這一方,外界能得知的只有其儲存庫所揭露的內容——模型卡、設定檔與 Microsoft 串流文件——因為 Microsoft 從未以文字發布任何 WER、延遲或吞吐量數據,且截至撰寫本文為止,也沒有任何針對該檢查點的獨立基準評測。以下每個比較中,一邊是經實戰考驗的數據;另一邊只是一份規格表。

相隔十六個月及一段排行榜稱霸時期

Parakeet TDT 0.6B v2 於 2025 年 5 月 5 日推出,是 NVIDIA 針對串流語音辨識(streaming-ASR)問題提出的解答:一個 FastConformer 編碼器,搭配 token 與時長轉換器(TDT)解碼器,在單一步驟中同時預測每個 token 及其持續時間——這項效率技巧消除了傳統轉換器中空白 token 的額外開銷。它採用 CC-BY-4.0 授權,對商用友善,並以 6.05% 的平均詞錯誤率登上 Open ASR 排行榜榜首。它還帶來了排行榜無法衡量的生產級功能——標點符號、大小寫還原、詞級時間戳——以及一個全注意力編碼器,單次處理可接受長達 24 分鐘的音訊,使其在無需積極切塊的情況下,特別適合長時間會議與播客場景。

VibeVoice-ASR-Streaming-1.5B 是最純粹意義上的挑戰者:它確實存在、有完整文件記錄,但關於它的實際表現,尚無任何定論。微軟 GitHub 的 news 動態於 9 月 3 日發布消息,宣布推出一個統一的串流式 ASR 模型,「能在語音送達的當下,持續轉錄誰說了什麼」,並支援熱詞(hotwords)與十種語言。而該 checkpoint 的 config 所描述的,完全是另一套工程傳統——由卷積式音訊 tokenizer 驅動的 Qwen2 家族語言模型解碼器,配上擴散(diffusion)頭,以約 2.9 秒為單位分段輸出,並具備約 0.5 秒的 lookahead。如果說 Parakeet 是歷經一整年實際部署反覆淬煉、專為語音辨識而生的模型,那麼 VibeVoice-ASR-Streaming-1.5B 不過是誕生僅兩天的研究型 checkpoint 而已。

證據不對稱就是重點所在

在閱讀本頁其餘內容之前,請先記住一個事實:這份比較只有一邊有具體數字。在 Parakeet TDT 0.6B 這邊,有一整年的排行榜防禦成績——在 Open ASR 公開英文短句測試集上平均 WER 為 6.05%,在 NVIDIA 硬體上以 batch 128 達到約 3,386 RTFx,以及一套涵蓋 NeMo 部署工具、TensorRT 加速與 FP8 量化的生態系統,且都已經過實際生產環境的驗證。在 VibeVoice-ASR-Streaming-1.5B 這邊,有的是模型卡上的評測數字——但那是圖片而非文字——以及非串流版 VibeVoice-ASR 卡片上、由廠商回報的 7.77% 平均 WER(跨八個英文測試集)。這個數字描述的是非串流模型,不能直接套用於這個 checkpoint。挑戰者或許真的很出色;但重點在於,「或許真的很出色」就是全部的證據基礎。

規格檢查

{{1}}• 參數 — NVIDIA Parakeet TDT 0.6B:600M,FastConformer 編碼器 + TDT 解碼器,對比 VibeVoice-ASR-Streaming-1.5B:總計約 3B(1.5B 級 Qwen 骨幹,加上分詞器與擴散頭)。{{/1}}

• 發布 — 2025年5月5日 vs 2026年9月2日。

• 準確度 — 平均 WER 6.05%,自 2025 年 5 月起為 Open ASR 第一名;第三方已重現其結果,而其他則無任何已發表的成果。

• 速度 — 在 NVIDIA 硬體上、批次大小為 128 時約為 3,386 RTFx,每秒約可處理 1 小時的音訊;相比之下,未公布任何吞吐量數據。

• 串流 — 支援串流,每次完整注意力上下文最多 24 分鐘;對比分塊串流(約 2.9 秒區塊,含約 0.5 秒前瞻)。

• 輸出附加功能 — 標點符號、大小寫、逐詞時間戳 vs 串流式發言人歸屬(未驗證)與熱詞;共十種語言。

• 授權 — CC-BY-4.0 對比 MIT.

• 生態系統 — NVIDIA NeMo(搭配 TensorRT 與 FP8)對比 microsoft/VibeVoice 儲存庫中的示範,以及一個 vLLM 外掛程式。

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

深入內部:關於語音模型用途的兩種觀點

這幾種架構代表了對這項工作的兩種不同信念。Parakeet TDT 0.6B 將轉錄視為一個可以被高效解決的訊號處理問題:FastConformer 編碼器擷取聲學特徵,而 TDT 解碼器則同時輸出文字 token 與時長,因此它能以即時速度的數千倍運行,也因此在 NVIDIA 的部署堆疊上表現得游刃有餘。VibeVoice-ASR-Streaming-1.5B 則將轉錄視為一個語言問題:先將音訊壓縮成 token 串流,交給一個已讀取相當於整份逐字稿脈絡的語言模型,讓 LM 對「誰說了什麼」以及「對話如何串連」的理解來完成工作。LLM 骨幹也正是這個 checkpoint 約有 3B 參數而非 600M 的原因,也是微軟從未宣稱能在邊緣裝置運行的原因——這是一個需要 GPU 的模型,並利用記憶體來承載脈絡。

對於即時轉錄,實際的後果是延遲的形態。Parakeet 的全注意力編碼器可以在單一遍歷中處理長視窗,這與 VibeVoice-ASR-Streaming-1.5B 的固定區塊與前瞻契約不同,後者每個輸出片段約對應 2.9 秒音訊。兩者都不是最低延遲商用 API 那種逐字部分結果的串流器;兩者都是區塊式系統,正確的選擇取決於你的音訊是以有界檔案的形式到來,還是開放式即時工作階段。

專題報導與部署區域

開箱即用,Parakeet TDT 0.6B 是更完整的轉錄產品:標點符號和大小寫會隨轉錄稿一起提供,逐字時間戳記可用於對齊,而且 24 分鐘的單遍處理視窗意味著在長時間錄音中分段錯誤較少。VibeVoice-ASR-Streaming-1.5B 則以 Parakeet 未列出的功能來反制:說話者歸屬輸出和熱詞,涵蓋十種語言。這個串流式說話者分離的主張,正是需要獨立驗證的那種事——分段邊界正是歸屬容易偏移的地方——但如果你在即時會議中必須知道誰說了什麼,這就是你該考慮 Microsoft 模型而非 NVIDIA 模型的原因。

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

這些周邊環境的多樣性,絲毫不亞於模型本身。Parakeet TDT 0.6B 是 NVIDIA NeMo 的正式公民:TensorRT、FP8,以及專為 NVIDIA GPU 調校的部署工具鏈,若你已經身處 NVIDIA 基礎設施之中,這點可謂相當出色。VibeVoice-ASR-Streaming-1.5B 則棲身於研究型儲存庫:文件中所描述的路徑是 Microsoft 的 Python 示範程式及一個 vLLM 外掛,其架構類別尚未收錄於公開的 Transformers 文件中,要讓它順利運作,得從原始碼自行建置,並親手驗證載入路徑是否可行。對於一個重視穩定可靠、文件完善的部署流程的團隊而言,光是這項差異,就足以蓋過基準測試上的差距。

現任者的理由,挑戰者的理由

NVIDIA Parakeet TDT 0.6B 的優勢在於它是一個已知量:一年來的排行榜防禦、第三方複現、商用授權、生產級功能,以及已經承載真實流量的部署生態系。如果你本季度要推出英文轉錄功能,而且想要開放權重,這就是站得住腳的預設選擇,任何聲稱能取代它的方案都必須承擔舉證責任。

VibeVoice-ASR-Streaming-1.5B 的適用情境較狹窄且特定:你需要串流說話者歸屬或熱詞,你需要的不只是英文,或者你相信以語言模型為基礎的語音路線終將勝出,並希望提早卡位。這是一場賭注,而不是一項決策——目前還沒有任何數據足以證明將正式流量移轉到它身上是合理的,而微軟自身的姿態也是研究優先。目前這兩種模型都尚未透過 OrcaRouter 提供服務,因此測試這項賭注的低成本方式,正是適用於任何新興開放模型的模式:將 ASR 層保留在單一路由 API 之後,由該 API 以供應商列表價格、無加價且具自動容錯移轉的方式,介接 200 多種模型;一旦有供應商開始託管 VibeVoice-ASR-Streaming-1.5B,就立即將一部分真實音訊路由過去;接著讓你自身流量的轉錄結果來決定,這個挑戰者是否配得上 Parakeet 已蟬聯十六個月的王冠。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube