一張主視覺標題卡,比較 VibeVoice-ASR-Streaming-7B 與 Muse Voice Transcribe。眉題為「串流 ASR — 2026 年 9 月」,副標題寫著兩個相隔一天發布的串流挑戰者:Meta 每小時 0.18 美元的 API,以及 Microsoft 無處託管的 MIT checkpoint。標籤為「MIT 權重 — 9 月 2 日」、「Meta API — 9 月 1 日」、「兩者皆未驗證」,另有「相同的標題承諾」註腳。OrcaRouter 標誌合成於右下角。
Guides & Insights

VibeVoice-ASR-Streaming-7B 對比 Muse Voice Transcribe:相隔一天登場的兩大串流挑戰者

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在2026年9月初的約三十六小時內,兩家大型實驗室相繼推出串流語音轉文字的模型,兩者都作出了同樣的頭條級承諾——即時轉錄內容,而且在話語說出的同時,還能分辨是誰說的。9月1日,Meta Superintelligence Labs 推出了 Muse Voice Transcribe,作為託管 API,定價為每1,000音訊分鐘3美元,約每小時0.18美元,將串流辨識、20+人說話者分離,以及語音端點偵測整合在單一次處理中。9月2日,Microsoft Research 將 VibeVoice-ASR-Streaming-7B 上傳到 Hugging Face:採用 MIT 授權的開放權重,沒有公告,模型卡宣稱支援串流、帶說話者標註的轉錄,以及熱詞和十種語言,而且沒有提供任何託管服務。兩者同樣的主打訴求,卻採取了相反的商業模式,而雙方的證據都遠比兩家實驗室希望你所注意到的還要薄弱。

本頁面是以「目前已知情況」為基礎撰寫,因為這兩個模型皆未有經獨立驗證的精確度數字。Muse Voice Transcribe 的數據是 Meta 發表當日的宣稱,由廠商自行回報且未經再現驗證;VibeVoice-ASR-Streaming-7B 則完全沒有以文字形式公布任何串流精確度數據。因此,以下的比較著重於結構性且可查知的面向——架構、價格、授權、記錄在案的行為——並在少數出現廠商數字之處加以標註。

相隔一天的兩個批次管線挑戰者

這兩個模型都在攻擊同一個假設:語音轉文字是針對已完成的錄音來執行的事情。Muse Voice Transcribe 是 Meta 稱之為「即時音訊感知模型」的第一款產品——單次串流處理即可完成辨識、橫跨二十多種聲音的說話者分離,以及端點偵測(也就是判斷說話者是真的講完了、而非只是停頓的工作)。它一次登上三個介面:Meta Model API(每個音訊小時 0.18 美元)、Mac 版 Meta AI(按住 Fn 鍵即可在任意應用程式中聽寫),以及 Muse Code。Microsoft 的 VibeVoice-ASR-Streaming-7B 是開源 VibeVoice 家族中的串流成員,而它的發布足跡安靜得多:一個於 9 月 2 日建立的 Hugging Face 儲存庫(時間戳顯示 15:46 UTC,三分鐘後即最後編輯)、八個採用 MIT 授權的 safetensors 分片,以及 microsoft/VibeVoice GitHub 儲存庫中一則日期為 9 月 3 日的新聞紀錄,內容稱其為「一個統一的串流 ASR 模型,能在語音抵達時持續轉錄誰說了什麼,並支援自訂熱詞和 10 種語言。」上傳一天後,它仍然顯示零次下載。

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

功能衝突

• 串流機制 — Muse Voice Transcribe 以 80 毫秒的區塊接收音訊,並在字詞穩定後立即提交;VibeVoice-ASR-Streaming-7B 則處理約 2.9 秒的區塊(具約 0.5 秒的前瞻),並於每個區塊解析完成時輸出一次文字。

{{1}}• 說話者歸因 — 單次處理 20+ 位說話者,供應商回報平均 17.5% 的語者分離錯誤率,對比模型卡所宣稱的串流式「誰說了什麼」輸出,未經驗證。{{/1}}

• Endpointing — 內建:串流帶有語句結束邊界,而非記錄為輸出訊號。

• 上下文控制 — 語言、關鍵詞和上下文偏向 vs 通過上下文提示(--context_info)設定的自定義熱詞。

• 語言 — 訓練涵蓋 70+ 種語言,25 種在推出時經過全面驗證;支援原生語碼轉換,有別於宣稱的 10 種 (en, zh, es, pt, de, ja, ko, fr, ru, it)。

• 證據 — 上市當日廠商宣稱:語音結束後 0.16 秒的最終結果 WER 為 3.1%,首批部分結果為 3.6%,引用 Artificial Analysis 串流排行榜,而非以文字形式發布任何串流 WER 或延遲數據。

• 成本與授權 — 封閉權重的託管服務為每音訊小時 $0.18;相比之下,權重免費(MIT 授權),約 18 GB 的 bf16,可自行託管。

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

兩種截然不同的「串流」概念

「串流」一詞涵蓋的節奏範圍很廣,而這兩者之間的差距大到足以改變你能分別在其上建構的事物。Muse Voice Transcribe 以字詞為單位進行串流。Meta 的架構把音訊切成 80 毫秒的區塊來處理,並採用它所稱的「自適應延遲」——一種透過強化學習學到的延遲策略:一旦模型對某個字詞有信心,就立即定案該字詞;而對較不確定的字詞則保留更多上下文,不套用單一的固定延遲預算。該供應商聲稱,說話者停止後 0.16 秒即可產生最終轉錄文字,開始後 0.13 秒即可產生第一批部分轉錄文字。這種節奏是專為互動迴圈所設計:即時字幕、聽寫,以及需要幾乎立即回覆一段完整語句的語音代理。

VibeVoice-ASR-Streaming-7B 以較粗的粒度進行串流。其預處理器設定顯示,音訊以 24 kHz 到達,壓縮 3,200 倍轉為 token,速率約為每秒 7.5 幀;接著以 22 幀為一個區塊進行處理,並帶有 4 幀的 lookahead——每個區塊約含 2.9 秒音訊,lookahead 約半秒,這些數值皆是根據設定推導,而非實測延遲。每個區塊解析完成時即輸出文字,先前區塊的上下文會透過 KV cache 保留,因此長時間的 session 不必從頭重新計算。以約三秒為增量逐步生長的逐字稿,對會議記錄與通話分析來說已足夠;它與即時對話所需的亞秒級逐詞串流,是不同類型的產品。兩個實驗室皆未針對此串流 checkpoint 發布端到端延遲量測,因此請將上述節奏視為設計意圖,實際使用感受仍屬未經測試。

說話者標籤與端點偵測:其中一者實際內建,另一者僅止於宣稱。

說話者歸屬是串流產品最常誇大其詞的地方,而這兩者都做出了這項宣稱。Muse Voice Transcribe 的版本具體且結構化:說話者分離與辨識在同一個串流處理中運行,因此一段二十人通話的錄音可以帶有每位說話者的標籤,而無須額外的「上傳、等待、取得說話者結果」步驟;Meta 報告的平均說話者分離錯誤率為 17.5%——這是廠商提供的數字,未經外部重現,但這個數字背後確實有真實的機制。它也輸出端點邊界,這是較不受矚目的能力:應用程式可以獲得明確的「這位說話者的發言結束了」訊號,而無須自行建構語音活動偵測器——這正是為什麼建立在原始 ASR 上的語音代理如此頻繁地打斷使用者的原因。

VibeVoice-ASR-Streaming-7B 在其模型卡上宣稱具備串流「誰說了什麼」輸出,與批次版 VibeVoice-ASR 的結構化「誰/何時/什麼」輸出一致——但就串流 checkpoint 而言,這項宣稱尚未經過驗證,沒有獨立測試重現過,也沒有 Muse 所提供的那種有文件記錄的 endpointing 訊號。如果你的工作負載確實是多說話者的即時音訊,Muse 目前提供了更完整的機制;如果你正在評估開放權重模型能否在你掌控的硬體上完成相同工作,那麼 VibeVoice 的宣稱正是那種在相信之前,應該用你自己的會議錄音來測試的事情。

證據:發布當日的聲明對照一張空白卡片

值得精確地說明雙方各自擁有什麼,因為雙方都沒有買家真正想要的東西。Muse Voice Transcribe 有一串廠商數據——最終轉錄稿的詞錯率 3.1%、首批部分結果 3.6%、最終延遲 0.16 秒、平均說話者分離錯誤率 17.5%——這些全由 Meta 在發布當天公開,並指向 Artificial Analysis 的串流語音轉文字排行榜,Meta 宣稱佔據榜首。這些說法尚未有任何實驗室以外的人士複現,但由於具體到可以被否證,這也算一種進步。

VibeVoice-ASR-Streaming-7B 完全沒有這些。其模型卡以圖片形式附上評估圖表,串流技術報告也只是一份 PDF,但內文中沒有可引述的串流 WER 或延遲數據。VibeVoice 系列中唯一的數值錨點,是批次版 VibeVoice-ASR 卡片上由供應商回報的表格——在八個英文測試集上平均 WER 為 7.77%,在 LibriSpeech clean 上為 2.20%——而這明確不是此檢查點的數字。當發布當天的宣稱遇上一張空白卡片,誠實的決勝點在於除了頭條 WER 以外的一切:價格、授權、串流節奏,以及雙方實際記載的功能。

語言:已驗證 25 種,聲明 10 種

語言覆蓋範圍比標題中的準確度宣稱更能區分這兩者。Muse Voice Transcribe 以 70 多種語言訓練,但 Meta 在推出時僅驗證 25 種——而實際生產環境的覆蓋範圍是驗證清單,而非訓練清單;其差異化在於原生語碼轉換:它能在不被告知的情況下於句子中途切換語言。VibeVoice-ASR-Streaming-7B 在其模型卡上宣告 10 種語言——英語、中文、西班牙語、葡萄牙語、德語、日語、韓語、法語、俄語、義大利語——相較於批次版 VibeVoice-ASR 的 50 多種。如果你的流量包含語碼轉換對話,Muse 的訴求更為具體;如果流量落在那十種語言之內,微軟模型的覆蓋範圍至少是明確的,這已比多數發表資料所提供的還要多。

成本與您保留的內容

商業模式的差異,是做出判斷最乾淨俐落的方式。Muse Voice Transcribe 每個音訊小時收費 0.18 美元,牌價低於所有主要的串流轉錄 API——不需要 GPU、不需要營運、權重封閉,價格由 Meta 制定。VibeVoice-ASR-Streaming-7B 下載完全免費,但要自行託管在 24 GB 等級的 GPU 上,在 KV cache 之前就需要約 18 GB 的 bf16 權重;文件提供的服務途徑是 microsoft/VibeVoice 示範腳本或 vLLM 外掛,而且目前還沒有任何推論供應商代管它。MIT 授權才是長久資產:你可以永久保有並微調這些權重,這是任何 API 訂閱都做不到的。而這也正是定價版圖可能變得有趣之處——一旦有供應商真的代管這個開放檢查點,「每小時 0.18 美元」這件事就會變成市場價格,而非單一廠商的牌價;這正是 pass-through 路由器最能發揮其價值的處境。OrcaRouter 目前不處理語音轉文字路由,這兩個模型也都不在它的目錄中;它實際做的是,對 200 多個使用即時轉錄稿的語言模型,以 0% 加價率如實轉傳供應商牌價,因此該技術棧中任何供應商宣布降價,買方端都會在當天同步生效。

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

常見問題

Muse Voice Transcribe 的 3.1% WER 是否表示它比 VibeVoice-ASR-Streaming-7B 更準確?

不,這個比較還沒有意義。Meta 的 3.1% 是串流路徑的發布日宣稱,來自廠商報告且未經重現。VibeVoice-ASR-Streaming-7B 完全沒有以文字發布任何串流準確率數字。在兩個模型都透過同一個公開測試框架、在同一份音訊上運行之前,唯一誠實的說法是:Muse 有一項可以被測試的具體宣稱,而 VibeVoice 目前還沒有。

我可以在已經錄製好的音訊上使用任一模型嗎?

兩個都是,但形式不同。Muse Voice Transcribe 可透過相同的串流 API 處理超過一小時的錄音。VibeVoice-ASR-Streaming-7B 的 vLLM 外掛除了 WebSocket 串流端點之外,也另外提供整份檔案轉錄的端點。但兩者的設計與定價都是針對即時串流情境——Muse 因其僅限串流的商業模式,VibeVoice 則因其隨音訊送達即輸出的分塊架構——因此如果你的工作負載純粹是批次檔案,專門的檔案轉錄 API 通常會比這兩者更便宜,也更易於計量。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube