一張比較「VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live」的主視覺標題卡,眉題為「串流語音轉文字 — 2026 年 9 月」;副標題寫道,微軟默默推出的開放檢查點,對上 Google 審慎推出的 Live API;標籤為「MIT 權重 — 9 月 2 日」、「Google API — 8 月 26 日」及「VibeVoice 未公布 WER」;並附有「目前已知資訊」的頁尾註記。OrcaRouter 標誌合成於右下角。
Guides & Insights

VibeVoice-ASR-Streaming-7B 對比 Gemini 3.5 Transcribe Live:一週實測,兩種串流語音轉文字

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年8月最後一週與9月最初幾天,誕生了兩套串流語音轉文字系統;它們看似彼此競爭,實則對同一個問題給出截然不同的答案。8月26日,GoogleGemini 3.5 Transcribe Live推入公開預覽:這是一個代管、封閉的語音轉文字端點,能在說話者停止說話後0.40秒內回傳完整逐字稿,背後有Artificial Analysis實測的4.0%串流詞錯率以及完整的發布資料。9月2日,Microsoft Research以microsoft命名空間將VibeVoice-ASR-Streaming-7B上傳至Hugging Face:MIT授權的開放權重、沒有新聞稿、沒有發布頁面,模型卡上甚至沒有以可讀文字公布任何詞錯率或延遲數據。兩者都能在音訊仍在送達時接收處理。這幾乎是它們僅有的共通點。

雙方的證據並不對稱,因此這份比較是以「我們目前所知」的方式撰寫。Gemini 3.5 Transcribe Live 是 Google 的產品,具有已公布的 token 價格與第三方評測數據,這些內容在下方均有標示。VibeVoice-ASR-Streaming-7B 是一個 checkpoint,其每一項宣稱都直接來自於該儲存庫本身:設定檔、模型卡,以及 VibeVoice GitHub 儲存庫中的 Microsoft 串流文件。關於 Microsoft 端目前尚無任何部分經過獨立基準測試;凡是某個數字若未加說明便可能被視為具有佐證力的地方,我們都會如此標明。

發布軌跡:API 上線與低調上傳

Google 以正常方式推出了 Gemini 3.5 Transcribe Live。該模型與其同門的 Gemini 3.5 Transcribe(預錄內容的 Interactions API 路徑)一同隸屬於 Gemini Audio 產品線之下;定價已列於模型頁面,而獨立排行榜也在數日內收錄了 Live 端點——4.0% 的串流 WER 與 0.40 秒的最終延遲數據即來自於此。此外也設有免費方案,但伴隨一貫的注意事項:免費方案的內容可能被用於改善 Google 產品。

微軟的串流發布完全沒有那套機制。Hugging Face 儲存庫 microsoft/VibeVoice-ASR-Streaming-7B 於 2026-09-02 15:46 UTC 建立,三分鐘後最後一次更動;其中包含八個 safetensors 分片、一個 tokenizer,以及一份採用 MIT 授權的預處理器設定。正式紀錄是 microsoft/VibeVoice 儲存庫中一條日期為 9 月 3 日的新聞日誌,宣布「一個統一的串流 ASR 模型,能在語音送達時持續轉錄誰說了什麼,支援自訂熱詞及 10 種語言」,並附上 aka.ms/vibeasr 示範與串流技術報告的連結。我們在上傳一天後查看,該檢查點的下載次數仍顯示為零,也沒有任何託管推理服務提供商列出它。模型卡所說的比公告還多,而這個儲存庫幾乎是以下所有內容的來源。

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

規格並排比較

• 它是什麼 — VibeVoice-ASR-Streaming-7B:開放權重的串流式 ASR,可自行部署;對比 Gemini 3.5 Transcribe Live:託管式串流 API,封閉權重。

• 串流形式 — 以約 2.9 秒的區塊輸出文字,並有約 0.5 秒的前瞻時間(源自檢查點組態),相較於雙向 WebSocket 工作階段,後者持續提供部分轉錄內容,並在說話者停止後 0.40 秒給出最終結果。

• 印刷品中的準確度 — 沒有以文字形式發布的 WER 或延遲數據,而串流模型的 WER 為 4.0%,預錄模型的 WER 為 2.6%,根據 Artificial Analysis 的資料。

• 說話人 — 宣稱支援串流式「誰說了什麼」歸因;在 Live 端點上,此歸因可能未經驗證,也可能沒有說話人分離(預先錄製的模型則提供此功能,最多三位說話人)。

• 語言 — 10 種(en、zh、es、pt、de、ja、ko、fr、ru、it)vs 自動偵測超過 85 種語言,可中途切換

• 工作階段長度 — 僅受限於您的 GPU 與記憶體,而非每個 Live 工作階段 10 分鐘的硬性上限。

• 成本 — 權重部分為 $0,自架約需 18 GB 的 bf16,相較之下,若將文字輸出 token 計入,在 Live 上每音訊小時約為 $0.54。

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

各端「串流」的含義

這個詞隱藏了一個真正的設計差異,而且值得精確說明,因為這兩種系統根本沒有試圖產生相同的節奏。微軟的前置處理器配置讓 VibeVoice 的節奏具體化:音訊以 24 kHz 到達,並被壓縮 3,200 倍,變成大約每秒 7.5 幀的 token 串流;接著配置宣告一個包含 22 幀的區塊以及 4 幀的前瞻——每個區塊約有 2.9 秒的音訊,加上約半秒的未來音訊來穩固它。模型每次在解析完成的區塊時輸出文字,而來自較早區塊的上下文會透過 KV cache 保留,因此長時間的工作階段不需要從頭重新計算。實際的逐字稿會以大約三秒的增量成長。

Google 的 Live 端點是為了更快、更具互動性的迴圈而建:音訊以 16 或 24 kHz PCM 區塊向上串流至 WebSocket,部分逐字稿在說話者進行時持續回傳,而最終格式化後的逐字稿會在語音結束後 0.40 秒內送達——這個數字是 Artificial Analysis 的測量結果,並由 Google 引用。取捨在於工作階段上限(十分鐘的音訊,之後您的應用程式必須重新連線並拼接),以及缺少的附加功能:沒有說話者分離(diarization),也沒有 Live 路徑上的字級時間戳記,而這兩者在預先錄製的 Gemini 3.5 Transcribe 上都有。因此,誠實的總結是:Google 的串流模型在每個話語(utterance)上較快,而 Microsoft 的串流檢查點(checkpoint)在每個區塊(chunk)上較慢,但宣稱具備 Google 的 Live 通道所缺少的說話者歸屬,且工作階段長度是 Google 未提供的。

準確度:已測量,相對於空白空間

這場對決中最大的落差在於證據的落差,而不一定在於品質。Artificial Analysis 測得 Gemini 3.5 Transcribe Live 在串流模式下的平均詞錯誤率為 4.0%,非串流模型則為 2.6%;後者在推出時於其 WER 排行榜上名列第五。Google 另引用 FLEURS 多語言資料集上的數據:串流 5.50%、非串流 5.04%。請依其標示方式解讀:Artificial Analysis 獨立於 Google,但一個剛推出一天的 API,其數字仍屬早期;而串流模式較批次模型多出的誤差——4.0% 對 2.6%——正是即時傳輸一貫的代價。

VibeVoice-ASR-Streaming-7B 在任何地方都找不到可相比的數據。模型卡附帶的評測數據是以圖片形式呈現,而 Microsoft 的技術報告是一份 PDF,但兩者都沒有提供可引用或可獨立檢驗的純文字串流 WER 或延遲數據。整個系列中唯一的數字錨點是批次版 VibeVoice-ASR 模型卡,它報告了廠商自行測得的八個英語測試集平均 7.77% WER,以及在 LibriSpeech clean 上的 2.20%——但這些是針對非串流模型的數字,並非此模型;而且串流模型通常會以少量準確度換取延遲上的優勢。除非有人透過公開的測試框架來評估這個串流 checkpoint,否則公平的說法是:這項比較的其中一邊有實測數據,另一邊則沒有。

成本:按量計費的 API,對比已編列預算的 GPU

Google 以 token 計價 Gemini 3.5 Transcribe Live,音訊每秒計費 25 個 token。依公布的 Live 費率——每 100 萬音訊 token 3.50 美元、每 100 萬文字輸出 token 21 美元——綜合計算後,每小時音訊約 0.54 美元,約每 1,000 音訊分鐘 9 美元;而預錄模型更便宜,每小時約 0.30 美元。寂靜只有在用戶端不串流時才是免費的:重新連線、重複的音訊以及記錄(logging)都會在實際帳單中增加計量的 token。

微軟的檢查點反而是以 GPU 小時計價。光是 bf16 權重就佔約 18 GB(尚未計入任何 KV 快取),文件記載的用法是 microsoft/VibeVoice 儲存庫中的 Python 示範,以及一個提供 WebSocket 與 OpenAI 相容端點的 vLLM 外掛;此外目前沒有託管定價,因為尚無任何供應商託管此模型——它不像 VibeVoice-ASR 批次模型那樣自 3 月以來就已登上 Azure AI Foundry。自行託管 7B 等級的語音 LLM,意味著要準備 24 GB 等級的 GPU,並投入自己的維運時間;但換來的是無限制的會話長度,以及永遠歸你所有的權重。這兩個模型並非彼此互斥,這正是最後一節要說的重點。

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

讓選擇保持便宜

你選擇哪一個,取決於你需要的是數字還是代碼。若你想要的是現行即可運作、具備公開準確度數據、且免 GPU 即可執行的轉錄方案,同時你的音訊不限於十種語言,或者你願意自行建構說話者標記(因為 Live 端點不提供此功能),請選擇 Gemini 3.5 Transcribe Live。若你採用自行託管、在乎無上限的會話長度或宣稱具備說話者屬性的串流輸出,且願意自行運行評估機制(因為沒有基準可依賴),請選擇 VibeVoice-ASR-Streaming-7B。

兩個選擇都不必是永久的,而這正是路由層發揮其價值之處——針對的是圍繞著逐字稿的模型,而非轉錄本身。OrcaRouter 目前並不路由語音轉文字,此頁面上的任何模型也不在其目錄中;它所做的,是為那些使用即時逐字稿的 200 多個語言模型提供一個統一的 API——包括摘要器、行動項目提取器、語音代理的規劃器——以供應商牌價直接轉嫁,不加任何加成,並在供應商之間自動容錯移轉。該技術棧中任何模型只要供應商降價,當天就會生效,因為價格是按牌價轉嫁,而非加成。轉錄步驟仍維持在你放置的地方;而處理逐字稿的那一層技術棧,正是讓單一金鑰和備援路由能把一個一週前、未經基準測試的檢查點,從一場賭注變成可測試選項的層級。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube