
VibeVoice-ASR-Streaming-7B 對比 Muse Voice Transcribe:相隔一天登場的兩大串流挑戰者
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
在2026年9月初的約三十六小時內,兩家大型實驗室相繼推出串流語音轉文字的模型,兩者都作出了同樣的頭條級承諾——即時轉錄內容,而且在話語說出的同時,還能分辨是誰說的。9月1日,Meta Superintelligence Labs 推出了 Muse Voice Transcribe,作為託管 API,定價為每1,000音訊分鐘3美元,約每小時0.18美元,將串流辨識、20+人說話者分離,以及語音端點偵測整合在單一次處理中。9月2日,Microsoft Research 將 VibeVoice-ASR-Streaming-7B 上傳到 Hugging Face:採用 MIT 授權的開放權重,沒有公告,模型卡宣稱支援串流、帶說話者標註的轉錄,以及熱詞和十種語言,而且沒有提供任何託管服務。兩者同樣的主打訴求,卻採取了相反的商業模式,而雙方的證據都遠比兩家實驗室希望你所注意到的還要薄弱。
本頁面是以「目前已知情況」為基礎撰寫,因為這兩個模型皆未有經獨立驗證的精確度數字。Muse Voice Transcribe 的數據是 Meta 發表當日的宣稱,由廠商自行回報且未經再現驗證;VibeVoice-ASR-Streaming-7B 則完全沒有以文字形式公布任何串流精確度數據。因此,以下的比較著重於結構性且可查知的面向——架構、價格、授權、記錄在案的行為——並在少數出現廠商數字之處加以標註。
相隔一天的兩個批次管線挑戰者
這兩個模型都在攻擊同一個假設:語音轉文字是針對已完成的錄音來執行的事情。Muse Voice Transcribe 是 Meta 稱之為「即時音訊感知模型」的第一款產品——單次串流處理即可完成辨識、橫跨二十多種聲音的說話者分離,以及端點偵測(也就是判斷說話者是真的講完了、而非只是停頓的工作)。它一次登上三個介面:Meta Model API(每個音訊小時 0.18 美元)、Mac 版 Meta AI(按住 Fn 鍵即可在任意應用程式中聽寫),以及 Muse Code。Microsoft 的 VibeVoice-ASR-Streaming-7B 是開源 VibeVoice 家族中的串流成員,而它的發布足跡安靜得多:一個於 9 月 2 日建立的 Hugging Face 儲存庫(時間戳顯示 15:46 UTC,三分鐘後即最後編輯)、八個採用 MIT 授權的 safetensors 分片,以及 microsoft/VibeVoice GitHub 儲存庫中一則日期為 9 月 3 日的新聞紀錄,內容稱其為「一個統一的串流 ASR 模型,能在語音抵達時持續轉錄誰說了什麼,並支援自訂熱詞和 10 種語言。」上傳一天後,它仍然顯示零次下載。

功能衝突
• 串流機制 — Muse Voice Transcribe 以 80 毫秒的區塊接收音訊,並在字詞穩定後立即提交;VibeVoice-ASR-Streaming-7B 則處理約 2.9 秒的區塊(具約 0.5 秒的前瞻),並於每個區塊解析完成時輸出一次文字。
{{1}}• 說話者歸因 — 單次處理 20+ 位說話者,供應商回報平均 17.5% 的語者分離錯誤率,對比模型卡所宣稱的串流式「誰說了什麼」輸出,未經驗證。{{/1}}
• Endpointing — 內建:串流帶有語句結束邊界,而非記錄為輸出訊號。
• 上下文控制 — 語言、關鍵詞和上下文偏向 vs 通過上下文提示(--context_info)設定的自定義熱詞。
• 語言 — 訓練涵蓋 70+ 種語言,25 種在推出時經過全面驗證;支援原生語碼轉換,有別於宣稱的 10 種 (en, zh, es, pt, de, ja, ko, fr, ru, it)。
• 證據 — 上市當日廠商宣稱:語音結束後 0.16 秒的最終結果 WER 為 3.1%,首批部分結果為 3.6%,引用 Artificial Analysis 串流排行榜,而非以文字形式發布任何串流 WER 或延遲數據。
• 成本與授權 — 封閉權重的託管服務為每音訊小時 $0.18;相比之下,權重免費(MIT 授權),約 18 GB 的 bf16,可自行託管。

兩種截然不同的「串流」概念
「串流」一詞涵蓋的節奏範圍很廣,而這兩者之間的差距大到足以改變你能分別在其上建構的事物。Muse Voice Transcribe 以字詞為單位進行串流。Meta 的架構把音訊切成 80 毫秒的區塊來處理,並採用它所稱的「自適應延遲」——一種透過強化學習學到的延遲策略:一旦模型對某個字詞有信心,就立即定案該字詞;而對較不確定的字詞則保留更多上下文,不套用單一的固定延遲預算。該供應商聲稱,說話者停止後 0.16 秒即可產生最終轉錄文字,開始後 0.13 秒即可產生第一批部分轉錄文字。這種節奏是專為互動迴圈所設計:即時字幕、聽寫,以及需要幾乎立即回覆一段完整語句的語音代理。
VibeVoice-ASR-Streaming-7B 以較粗的粒度進行串流。其預處理器設定顯示,音訊以 24 kHz 到達,壓縮 3,200 倍轉為 token,速率約為每秒 7.5 幀;接著以 22 幀為一個區塊進行處理,並帶有 4 幀的 lookahead——每個區塊約含 2.9 秒音訊,lookahead 約半秒,這些數值皆是根據設定推導,而非實測延遲。每個區塊解析完成時即輸出文字,先前區塊的上下文會透過 KV cache 保留,因此長時間的 session 不必從頭重新計算。以約三秒為增量逐步生長的逐字稿,對會議記錄與通話分析來說已足夠;它與即時對話所需的亞秒級逐詞串流,是不同類型的產品。兩個實驗室皆未針對此串流 checkpoint 發布端到端延遲量測,因此請將上述節奏視為設計意圖,實際使用感受仍屬未經測試。
說話者標籤與端點偵測:其中一者實際內建,另一者僅止於宣稱。
說話者歸屬是串流產品最常誇大其詞的地方,而這兩者都做出了這項宣稱。Muse Voice Transcribe 的版本具體且結構化:說話者分離與辨識在同一個串流處理中運行,因此一段二十人通話的錄音可以帶有每位說話者的標籤,而無須額外的「上傳、等待、取得說話者結果」步驟;Meta 報告的平均說話者分離錯誤率為 17.5%——這是廠商提供的數字,未經外部重現,但這個數字背後確實有真實的機制。它也輸出端點邊界,這是較不受矚目的能力:應用程式可以獲得明確的「這位說話者的發言結束了」訊號,而無須自行建構語音活動偵測器——這正是為什麼建立在原始 ASR 上的語音代理如此頻繁地打斷使用者的原因。
VibeVoice-ASR-Streaming-7B 在其模型卡上宣稱具備串流「誰說了什麼」輸出,與批次版 VibeVoice-ASR 的結構化「誰/何時/什麼」輸出一致——但就串流 checkpoint 而言,這項宣稱尚未經過驗證,沒有獨立測試重現過,也沒有 Muse 所提供的那種有文件記錄的 endpointing 訊號。如果你的工作負載確實是多說話者的即時音訊,Muse 目前提供了更完整的機制;如果你正在評估開放權重模型能否在你掌控的硬體上完成相同工作,那麼 VibeVoice 的宣稱正是那種在相信之前,應該用你自己的會議錄音來測試的事情。
證據:發布當日的聲明對照一張空白卡片
值得精確地說明雙方各自擁有什麼,因為雙方都沒有買家真正想要的東西。Muse Voice Transcribe 有一串廠商數據——最終轉錄稿的詞錯率 3.1%、首批部分結果 3.6%、最終延遲 0.16 秒、平均說話者分離錯誤率 17.5%——這些全由 Meta 在發布當天公開,並指向 Artificial Analysis 的串流語音轉文字排行榜,Meta 宣稱佔據榜首。這些說法尚未有任何實驗室以外的人士複現,但由於具體到可以被否證,這也算一種進步。
VibeVoice-ASR-Streaming-7B 完全沒有這些。其模型卡以圖片形式附上評估圖表,串流技術報告也只是一份 PDF,但內文中沒有可引述的串流 WER 或延遲數據。VibeVoice 系列中唯一的數值錨點,是批次版 VibeVoice-ASR 卡片上由供應商回報的表格——在八個英文測試集上平均 WER 為 7.77%,在 LibriSpeech clean 上為 2.20%——而這明確不是此檢查點的數字。當發布當天的宣稱遇上一張空白卡片,誠實的決勝點在於除了頭條 WER 以外的一切:價格、授權、串流節奏,以及雙方實際記載的功能。
語言:已驗證 25 種,聲明 10 種
語言覆蓋範圍比標題中的準確度宣稱更能區分這兩者。Muse Voice Transcribe 以 70 多種語言訓練,但 Meta 在推出時僅驗證 25 種——而實際生產環境的覆蓋範圍是驗證清單,而非訓練清單;其差異化在於原生語碼轉換:它能在不被告知的情況下於句子中途切換語言。VibeVoice-ASR-Streaming-7B 在其模型卡上宣告 10 種語言——英語、中文、西班牙語、葡萄牙語、德語、日語、韓語、法語、俄語、義大利語——相較於批次版 VibeVoice-ASR 的 50 多種。如果你的流量包含語碼轉換對話,Muse 的訴求更為具體;如果流量落在那十種語言之內,微軟模型的覆蓋範圍至少是明確的,這已比多數發表資料所提供的還要多。
成本與您保留的內容
商業模式的差異,是做出判斷最乾淨俐落的方式。Muse Voice Transcribe 每個音訊小時收費 0.18 美元,牌價低於所有主要的串流轉錄 API——不需要 GPU、不需要營運、權重封閉,價格由 Meta 制定。VibeVoice-ASR-Streaming-7B 下載完全免費,但要自行託管在 24 GB 等級的 GPU 上,在 KV cache 之前就需要約 18 GB 的 bf16 權重;文件提供的服務途徑是 microsoft/VibeVoice 示範腳本或 vLLM 外掛,而且目前還沒有任何推論供應商代管它。MIT 授權才是長久資產:你可以永久保有並微調這些權重,這是任何 API 訂閱都做不到的。而這也正是定價版圖可能變得有趣之處——一旦有供應商真的代管這個開放檢查點,「每小時 0.18 美元」這件事就會變成市場價格,而非單一廠商的牌價;這正是 pass-through 路由器最能發揮其價值的處境。OrcaRouter 目前不處理語音轉文字路由,這兩個模型也都不在它的目錄中;它實際做的是,對 200 多個使用即時轉錄稿的語言模型,以 0% 加價率如實轉傳供應商牌價,因此該技術棧中任何供應商宣布降價,買方端都會在當天同步生效。

常見問題
Muse Voice Transcribe 的 3.1% WER 是否表示它比 VibeVoice-ASR-Streaming-7B 更準確?
不,這個比較還沒有意義。Meta 的 3.1% 是串流路徑的發布日宣稱,來自廠商報告且未經重現。VibeVoice-ASR-Streaming-7B 完全沒有以文字發布任何串流準確率數字。在兩個模型都透過同一個公開測試框架、在同一份音訊上運行之前,唯一誠實的說法是:Muse 有一項可以被測試的具體宣稱,而 VibeVoice 目前還沒有。
我可以在已經錄製好的音訊上使用任一模型嗎?
兩個都是,但形式不同。Muse Voice Transcribe 可透過相同的串流 API 處理超過一小時的錄音。VibeVoice-ASR-Streaming-7B 的 vLLM 外掛除了 WebSocket 串流端點之外,也另外提供整份檔案轉錄的端點。但兩者的設計與定價都是針對即時串流情境——Muse 因其僅限串流的商業模式,VibeVoice 則因其隨音訊送達即輸出的分塊架構——因此如果你的工作負載純粹是批次檔案,專門的檔案轉錄 API 通常會比這兩者更便宜,也更易於計量。
