一張為「VibeVoice-ASR-Streaming-1.5B 對比 Granite Speech 5.0 470M TurboCTC:兩個低調的開放權重串流押注」生成的英雄標題卡,副標題為「兩個開放權重串流ASR模型,相隔八天」,並包含兩張模型卡——VibeVoice-ASR-Streaming-1.5B(Microsoft Research · 2026年9月2日 · MIT · 總參數約3B · 語音LLM)與 Granite Speech 5.0 470M TurboCTC(IBM · 2026年8月25日 · Apache-2.0 · 470M · 純CTC編碼器)——以及標籤寫著「邊緣級速度(IBM)」、「僅限英文(IBM)」和「10種語言中誰說了什麼(Microsoft,未驗證)」。OrcaRouter 標誌合成於右下角。
Guides & Insights

VibeVoice-ASR-Streaming-1.5B 對比 Granite Speech 5.0 470M TurboCTC:兩個低調的開放權重串流押注

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年8月底最有趣的兩個開放權重串流語音轉文字發布,都沒有舉辦發布活動。8月25日,IBM 將 Granite Speech 5.0 470M TurboCTC 放上 Hugging Face——權重、模型卡和一篇部落格文章,僅此而已——而9月2日,微軟研究院在 microsoft 命名空間上傳了 VibeVoice-ASR-Streaming-1.5B,除其 VibeVoice GitHub 儲存庫中的一行新聞外,完全沒有發布公告。它們是同類事物,卻是相反的工程賭注:IBM 的模型是一個 4.7 億參數的純 CTC 編碼器,設計用於在筆電上以邊緣速度運行;而微軟的則是一個 1.5B 級別的語音語言模型,包覆著音訊分詞器和一個擴散頭——總參數約30億——旨在轉錄的同時將語音理解為語言。

在這些數字之前,先說明維持這份比較可信度的來源標籤。所有標示為 IBM 回報的內容,均來自 Granite Speech 5.0 470M TurboCTC 模型卡及其 Open ASR 排行榜條目,由 IBM 在發布當天透過官方測試框架執行,尚未經過獨立重現。所有關於 VibeVoice-ASR-Streaming-1.5B 的內容,均來自閱讀其儲存庫——包括設定檔、模型卡,以及 Microsoft 的串流文件——因為 Microsoft 尚未以文字形式發布任何精確度或延遲數據,且 Microsoft 以外的人也尚未對該檢查點進行基準測試。兩者並未在共用的測試框架中執行;這份比較是將兩者對照同一份公開證據來解讀,而這正是兩家公司迄今所提供的全部內容。

兩次低調的發布,相隔八天

這兩款模型以同樣低調的方式問世——這點值得直說,因為兩家公司此後都少有公開說明。IBM 的 Granite Speech 5.0 470M TurboCTC 是雙版本發布中採用 Apache-2.0 授權的版本;IBM 還另外發布了非商業用途的 -NC 姊妹版,其主打成績略勝一籌。該模型卡標示的發布日期為 2026 年 8 月 25 日,原生支援 Transformers,並於同日提交至 Open ASR 排行榜。微軟的串流雙模型 VibeVoice-ASR-Streaming-7B 與 VibeVoice-ASR-Streaming-1.5B 則是在 9 月 2 日的同一分鐘內於 Hugging Face 建立;GitHub 上日期為 9 月 3 日的新聞稿宣布推出「一個統一的串流式 ASR 模型,能在語音送達的同時持續轉錄說話者是誰、說了些什麼」,文中只點名 7B,而本文涵蓋的 1.5B 便是伴隨它低調上市的較小姊妹版。

有趣的是,兩個團隊都鎖定了「串流」這個詞,卻打造出完全相反的東西。Granite Speech 5.0 470M TurboCTC 是一個以 CTC 訓練的 conformer 編碼器,並以單次非自迴歸解碼完成辨識——沒有逐步產生文字的解碼器,因此模型在結構上既省成本又快速。VibeVoice-ASR-Streaming-1.5B 則是一個語音大型語言模型:兩個卷積 tokenizer 將 24 kHz 音訊轉換成約 7.5 Hz 的語音 token 串流,一個 Qwen2 家族的解碼器(28 層、1,536 個隱藏單元,屬於 1.5B 等級)讀取這些 token,接著由一個 diffusion 頭以約 2.9 秒為一個區塊產出轉錄文字,並有大約半秒的 lookahead。一個是賽車;另一個則是剛好會聽聲音的小型語言模型。

規格檢查

• 參數 — Granite Speech 5.0 470M TurboCTC:470M,僅編碼器;對比 VibeVoice-ASR-Streaming-1.5B:總計約3B(1.5B 級語言模型主幹,外加 tokenizer 與擴散頭)。

• 架構 — Conformer 編碼器具備區塊自注意力與自條件化,經 CTC 訓練,貪婪非自迴歸解碼;對比於雙重聲學/語義 tokenizer 饋入 Qwen2 系列因果解碼器並帶有 DDPM 擴散頭。

• 輸出節奏 — 約每秒 12.5 個輸出幀,以分塊流式方式輸出,對比約 7.5 Hz 的語音詞元,每約 2.9 秒的區塊輸出文字,並具約 0.5 秒的前瞻。

• 語言 — 僅英文 vs 十種:中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文和西班牙文。

• 權重 — 約 0.5B 參數 / 不到 1 GB,邊緣等級,相較於 ~5.6 GB bf16、NVIDIA GPU 等級。

• 書面記載之準確度 — IBM 於 Open ASR 短格式測試集所報告的平均 WER 約為 5.00%,而文本中則未公布任何 WER 數據。

• 授權 — Apache-2.0 與 MIT。

• 發布日期 — 2026年8月25日 vs 2026年9月2日。

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

速度:一個天生小巧,另一個天生是語言模型

架構上的差異首先體現在速度與硬體。Granite Speech 5.0 470M TurboCTC 瞄準的是筆記型電腦、智慧型手機及其他邊緣裝置。由於純 CTC 編碼器完全不採樣——輸出只是對一個 16,384 詞元的 BPE 表頭進行單次貪婪解碼——因此執行成本極低;IBM 的模型卡指出,TurboCTC 系列在單張 H200 上測得的 Open ASR 吞吐量可達數萬 RTFx,此外還有一個 WebGPU 示範,能在瀏覽器分頁中即時轉錄。這些數字由 IBM 自行測得、未經獨立重現,但結構上的論點本身依然成立:一個沒有自迴歸解碼器的 470M 編碼器,就是一種能在手機所搭載的硬體上運行的模型。

VibeVoice-ASR-Streaming-1.5B 做出了相反的取捨。它的解碼器是一個因果語言模型,這意味著文字生成是在比 CTC argmax 更重的迴圈中進行的;而其文件記載的執行方式是在 NVIDIA GPU 上自架託管——也就是 microsoft/VibeVoice 儲存庫中的 Python 示範或它的 vLLM 外掛——在計算任何 KV cache 之前,約需 5.6 GB 的 bf16 權重。Microsoft 並未發布任何吞吐量或即時因子(RTF)的宣稱,因此沒有可與 IBM 數據相比對的廠商數字。LLM 架構換來的反而是語境:這種模型會以語言模型的方式,在整個轉錄稿中帶入說話者與內容的理解,而這正是「轉錄聲音」與「跟隨對話」之間的差別。

準確度:一個廠商印出數字,另一個印出圖片

就現有證據而言,Granite Speech 5.0 470M TurboCTC 領先 VibeVoice-ASR-Streaming-1.5B 的幅度,已大到足以自成一份可發表的基準評測。IBM 在發布當天用官方 Open ASR 排行榜的測試框架跑了自己的模型,並報告在公開英語短句測試集上,平均詞錯誤率約為 5.00%——這個數字是廠商自行測量、未經任何第三方驗證,而且在微軟這一方所提供的比較資料裡完全看不到。VibeVoice-ASR-Streaming-1.5B 的模型卡只附了一張圖片形式的評估結果圖,內文卻未列出任何數值化的 WER、RTF 或延遲;VibeVoice 系列中唯一的數值錨點,是批次版 VibeVoice-ASR 模型卡上由廠商回報的 7.77% 平均 WER,橫跨八個英語測試集;該數據描述的是非串流模型,因此無法沿用於串流模型。無論日後由獨立方執行的評測結果如何,目前最誠實的總結就是:IBM 公布了一個數字,而微軟公布了一張圖片。

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

語言與輸出:僅限英文,對比十個當中的「誰說了什麼」

{{1}}Granite Speech 5.0 470M TurboCTC 僅支援英文,回傳的是未經加工的轉錄文字。{{/1}}{{2}}對於 IBM 鎖定的工作負載——邊緣硬體上的企業級英文轉錄——這並非缺點,{{/2}}{{3}}但一旦你的音訊不是英文,這項比較就到此為止。{{/3}}{{4}}VibeVoice-ASR-Streaming-1.5B 列出了十種語言,並宣稱提供串流式說話者歸屬輸出:模型卡指出,它「會隨著語音送達持續轉錄誰說了什麼」,並可將領域詞彙的熱詞作為上下文提示傳入。{{/4}}{{5}}這兩項額外功能都值得以懷疑的眼光看待——跨區塊邊界的串流式說話者分離確實非常困難,而該宣稱也未經驗證——{{/5}}{{6}}但正是它們,讓需要進行即時多語會議的團隊才會考慮 Microsoft 的模型。{{/6}}

授權與生態系:Apache-2.0 對比 MIT,Transformers 對比研究型儲存庫

這兩種授權都允許商業使用,光是這點就已讓這對模型有別於 IBM 自家同一架構下的 -NC 變體。Granite Speech 5.0 470M TurboCTC 採用 Apache-2.0 授權,內含慣常的專利授權條款,而且原生內建於 Hugging Face Transformers(transformers >= 5.16 中的 AutoModelForCTC),並搭配適用於 Apple Silicon 的 mlx-audio——也就是說,凡是此生態系統中最大部署社群所能運行的環境,它都能運行,且不受硬體廠商限制。VibeVoice-ASR-Streaming-1.5B 則是 MIT 授權,更為精簡;但其部署路徑是一套需從原始碼自行建置的研究型環境:該檢查點的架構類別 VibeVoiceForASRStreamingTraining 並未收錄於公開的 Transformers 文件中,而且微軟自家的串流文件是指向該儲存庫的示範程式碼與 vLLM 外掛程式,而非標準函式庫的載入方式。對生產團隊而言,這個差異真切可感:其中一個模型今天就能直接放入現有的 Transformers 管線,另一個則要你自行架起研究用的儲存庫,並親自驗證載入路徑。

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

您應該評估哪個靜音版本?

如果您的負載是英文、硬體是邊緣級或CPU受限,而且您想要一個能直接放入Transformers、並在卡片上有數字可對照檢查的模型,請先評估 Granite Speech 5.0 470M TurboCTC。除了其中一個面向之外,它在每個層面都是風險較低的選擇——它無法協助您處理第二語言,或需要辨識發言者的即時會議逐字稿。

如果你需要{{1}}多語言串流{{/1}},想測試{{2}}「誰說了什麼」的輸出或熱詞{{/2}}這些功能,或寧可押注於{{3}}以語言模型為核心的語音處理,而非純編碼器{{/3}},那麼 VibeVoice-ASR-Streaming-1.5B 就值得你評估。預算上請把 NVIDIA GPU、{{4}}從原始碼安裝、約 5.6 GB 的權重,以及你自行設計的評測{{/4}}都納入考量,因為到目前為止還沒有人——{{5}}包括微軟在內{{/5}}——{{6}}發表過你可以信賴的數據{{/6}}。

兩次{{1}}低調{{/1}}發布都不會改變一件事,那就是當你還在摸索哪個賭注會得到回報時,保持 ASR 層可替換的價值。兩款模型都還很年輕,截至本文撰寫時,沒有一款透過 OrcaRouter 提供服務;當有供應商開始託管其中任何一款,低風險的試用方式就是把它放在一個路由層之後,該路由層以供應商列表價格接入 200 多款模型——零加價,因此價格變動當天生效——並自動故障轉移到你原本就信任的服務。把一部分真實音訊路由到新模型,閱讀轉錄稿,然後讓你自己的實際流量,而非發布日的基準測試表,來判斷哪個{{2}}低調{{/2}}賭注才是正確的。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube