
VibeVoice-ASR-Streaming-1.5B 對上 Whisper Large v3 Turbo:原生串流對上支援 99 種語言的主力
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
你今天執行的語音轉文字模型,很有可能就是 Whisper Large v3 Turbo;而現在有一個新模型正在質問:該輪到我了嗎?OpenAI 的 Whisper Large v3 Turbo——2024 年 10 月發布的蒸餾版 809M 參數檢查點——是開放權重的重量級模型:支援 99 種語言,速度約為原始 large-v3 的四到八倍,小到能跑在筆電上,採用 MIT 授權,而且背後擁有當今最大的語音轉錄生態系。VibeVoice-ASR-Streaming-1.5B 由 Microsoft Research 於 2026 年 9 月 2 日上傳,是專門為了 Whisper 原生做不到的一件事——串流——而打造的挑戰者。它會在音訊到達時逐段轉錄,而不是吞下固定長度的視窗;它宣稱能輸出附帶說話者屬性的結果;而且它支援十種語言,卻沒有任何已發表的基準測試來背書。
最後一項條款,正是本頁面圍繞遷移問題而非對決來編排的原因。Whisper Large v3 Turbo 的數據是已測量且公開的——LibriSpeech、Open ASR 綜合基準、Common Voice——而 VibeVoice-ASR-Streaming-1.5B 的模型卡未以文字發布任何 WER 或延遲數據,截至撰寫本文時也不存在任何獨立基準測試。下方關於 Microsoft 一方的所有內容,都是從其 repository 中可得知的部分:設定檔、模型卡,以及 Microsoft 的串流文件。關於 Whisper 一方的所有內容,則是已定案的公開紀錄。兩者並未進行正面對決;這項比較是在「已被證實者」與「僅被承諾者」之間進行的。
您可能已經在運行的模型
Whisper Large v3 Turbo 以樸實無華的方式贏得了一席之地:它快速、小巧、支援多種語言,而且具備生產團隊喜愛的那種沉穩可靠。它從 1.55B 參數的 Whisper large-v3 蒸餾至 809M 參數,保留了 99 種語言的覆蓋範圍,以及 large-v3 約 95% 的準確度——LibriSpeech clean 的 WER 約為 2.1%,Open ASR 綜合基準約為 7.7–7.8%,最大的效能衰減出現在低資源語言與聲調語言上——同時運行速度快上數倍,FP16 下僅需約 1.6 GB 的 VRAM。它採用 MIT 授權,可透過 faster-whisper、whisper.cpp 以及三年來累積的各種整合方案運行,其 Hugging Face 頁面顯示單月下載量超過七百萬次。如果你自行架設語音轉錄服務,這很可能就是實際在執行的那個模型。
Whisper Large v3 Turbo 不是、也從未宣稱是串流模型。它是以固定 30 秒的視窗接收音訊,並逐窗回傳轉錄文字;它沒有原生的語音活動偵測、沒有斷句偵測、沒有說話者分離,也沒有喚醒詞機制。在 Whisper 上做即時轉錄,始終是你自行建置的改造方案——而延遲與工程成本,正是落在這層改造上。
切換後實際上會改變什麼
延遲模型 — VibeVoice-ASR-Streaming-1.5B 屬刻意設計,每個解析完成的語塊約 2.9 秒輸出一次文字,並帶約 0.5 秒的前瞻;對比之下,Whisper Large v3 Turbo 是 30 秒視窗的批次模型,必須透過分塊與拼接層才能近似即時輸出。
• 會話形態 — 無界限的即時會話,上下文可跨區塊透過前綴快取承接;相較於離散的30秒視窗,跨視窗之間不保留對話狀態。
• 語言 — 十種(中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文、西班牙文)對比 99。
• 書面公布的準確度 — 未公布任何數據 vs LibriSpeech clean 約 2.1%、Open ASR composite 約 7.7–7.8%,全部經實際量測且公開。
• 輸出附加功能 — 聲稱具備串流式的語者歸屬與熱詞,而不是僅有字詞時間戳可用;但原生上既沒有語者分離,也沒有熱詞。
• 硬體 — NVIDIA GPU 上約 5.6 GB 的 bf16 權重(需從原始碼安裝);相較之下,約 1.6 GB 的 FP16 版本可透過 whisper.cpp 和 faster-whisper 在筆電與 CPU 上執行。
• 授權 — MIT,兩者皆是。

「串流改造問題」
看待這組對比的誠實方式是:Whisper Large v3 Turbo 存在一個串流問題,而你已經為之付出代價,或仍在付出代價。Whisper 上的即時管線意味著需要一個語音活動偵測器來找出語音、一個切塊器來將音訊切成 Whisper 大小的視窗、重疊的視窗以免詞語在邊界處遺失,以及一個拼接器來調和部分轉錄結果。社群對這種技術棧的實作,端到端延遲大約落在 1 到 5 秒——用於會議記錄可行,但還未達到電話客服代理與即時字幕的標準。
VibeVoice-ASR-Streaming-1.5B 在構造上就省去了事後修改的需要。它的前處理器配置在約 7.5 Hz 的語音 token 流上固定使用 22 幀的區塊與 4 幀的 lookahead——每個輸出段落約含 2.9 秒的音訊、半秒的未來上下文——而 Microsoft 的文件指出,先前區塊的上下文會透過 KV cache 保留,因此即時工作階段不會從頭重新計算。但在這比較的兩邊,都要仔細閱讀「streaming」這個字:這兩個模型都不是最低延遲商業 API 所提供的那種逐字局部結果引擎。VibeVoice 的逐字稿本來就是設計成約三秒的增量成長,這對會議來說是不同且通常可接受的節奏,但它不是亞秒級;如果你的需求是在一秒內讓文字出現在螢幕上,你應該在建置之前先把這種區塊幾何量測對照那個預算來評估。
準確性:你為了改用原生串流而放棄的東西
這就是應該主導這項決策的差距。Whisper Large v3 Turbo 有一份你可以查核的公開準確度紀錄——而當錄音內容落在其支援的 99 種語言之內時,這份紀錄相當可靠。VibeVoice-ASR-Streaming-1.5B 則沒有這樣的紀錄:模型卡的評估是一張圖片,Microsoft 沒有以文字發布任何串流 WER,而該系列中唯一的數值錨點,是批次版 VibeVoice-ASR 卡片上廠商回報的 7.77% 平均 WER(涵蓋八個英文測試集),但這描述的是一個不同的非串流模型。老實說,今天把你的轉錄工作轉移到 VibeVoice-ASR-Streaming-1.5B,就等於要在你自己的音訊上接受一個未知的準確度水準——這正是為什麼任何對它的評估都必須由你親自執行,用你最困難的真實錄音測試過,它才值得獲得正式環境的流量。

語言與說話者歸因:特徵差距是雙向的
功能比較並非一面倒,而這正是讓選擇真正有趣的地方。如果你的音訊是多語言的,決定馬上就結束:Whisper Large v3 Turbo 的 99 種語言涵蓋了 VibeVoice-ASR-Streaming-1.5B 的十種語言所沒有的範圍,而十種語言的上限,對於任何會見到廣泛混合語音的流程來說,都是直接出局。但若你的工作負載落在這十種語言內,而你真正需要的是在現場會議中知道誰說了什麼,那箭頭就指向另一邊:Whisper 沒有原生語者分離,也沒有熱詞;VibeVoice-ASR-Streaming-1.5B 則宣稱兩者兼具——串流式說話者歸屬輸出,以及以上下文提示傳遞的領域術語熱詞。這項宣稱未經驗證,而且跨區塊邊界的串流式語者分離確實難到值得存疑,但它正是再多的 Whisper 工程也無法開箱即用提供的具體功能。
遷移計算
成本和心力都對既有方案有利。Whisper Large v3 Turbo 已經能在你自有硬體——一台筆電、一顆 CPU、一張中等 GPU——上於你現有的技術棧中運行;而改用 VibeVoice-ASR-Streaming-1.5B,意味著要在 NVIDIA GPU 上從原始碼建置一套研究用安裝,權重約 5.6 GB,要驗證一條其架構類別尚未收錄在公開 Transformers 文件中的載入路徑,還要從零打造你決策所依賴的基準測試。那是個實打實的專案,而且回報取決於那些未經驗證的功能是否真的對你重要。

以低成本運行該專案的省錢之道,是不要把它當作一次替換來處理。將 Whisper Large v3 Turbo 保留為預設,並透過同一個 API 將一部分即時音訊路由到 VibeVoice-ASR-Streaming-1.5B——這正是路由層存在的意義所在:單一端點背後提供 200+ 個模型,按供應商列表價格計費、無任何加價;當新模型出錯時自動故障轉移;以及一種路由 DSL,讓不同的工作負載能從單一呼叫中選用不同的轉錄器。這就是 OrcaRouter 的運作模式,也正是「將生產管線押注在一個才推出兩天的檢查點上」與「讓該檢查點在你自己的轉錄文本上,憑實力與主力模型一較高下」這兩者之間的差異所在。
常見問題
Whisper Large v3 Turbo 究竟能不能進行即時串流?
僅能作為改裝方案。Whisper Large v3 Turbo 是批次模型,處理固定的 30 秒音訊視窗,因此要進行即時轉錄,就必須在其上自行建構語音活動偵測器、區塊切割器、重疊策略與拼接器。目前已有可運作的實作,延遲大約落在一到五秒之間,足以應付會議記錄,但達不到電話代理與即時字幕所需的次秒級門檻。VibeVoice-ASR-Streaming-1.5B 則原生支援串流——約每 2.9 秒輸出一個文字區塊,並具備約 0.5 秒的前瞻時間——不過它是分塊式串流,而非逐字的部分結果,因此請將這種輸出節奏與您自身的延遲預算一併比對。
VibeVoice-ASR-Streaming-1.5B 比 Whisper Large v3 Turbo 更準確嗎?
目前還沒有人能回答這個問題,包括微軟在內。Whisper Large v3 Turbo 的準確度已經被實際測量且公開——在 LibriSpeech clean 上約為 2.1% 的 WER,在 Open ASR 綜合基準上約為 7.7–7.8%。截至本文撰寫時,VibeVoice-ASR-Streaming-1.5B 沒有任何已發表的串流 WER 文字數據,也沒有獨立的基準測試。要回答這個問題,唯一的方法是在你自己的音訊上執行該 checkpoint,並將轉錄結果與你現有的系統進行比較——這正是本頁面建議在任何遷移前所做的測試。
這兩種支援哪些語言?
Whisper Large v3 Turbo 以一套權重支援 99 種語言。VibeVoice-ASR-Streaming-1.5B 則列出十種:中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文和西班牙文。對於這十種語言之外的任何音訊,Whisper 是這組配對中唯一的選項,而多語言支援上的落差,也正是多數團隊之所以維持現狀的最明確原因。
Whisper Large v3 Turbo 對於大多數團隊來說,在大多數情況下都是合適的模型;一個只有兩天歷史、沒有基準測試的 checkpoint,並非更換平台的理由,而是進行實驗的理由。如果您的音訊落在 VibeVoice-ASR-Streaming-1.5B 支援的十種語言之一,且即時說話者歸因會改變您的產品,那就將 VibeVoice-ASR-Streaming-1.5B 架設在路由器後方,把一部分真實流量導向它,讓轉錄結果——而不是任何一方缺少基準測試——來做決定。
