一張主視覺標題卡,比較「VibeVoice-ASR-Streaming-7B 對比 GPT-Transcribe」,上方標題列寫著「語音轉文字——2026 年 9 月」,副標題讀道:即時工作階段檢查點對上 OpenAI 經稽核的檔案端點——音訊生命週期中的兩個不同時刻,標籤分別為「MIT 權重——9 月 2 日」、「OpenAI API——7 月 28 日」及「GPT:3.31% AA-WER」,並附有一則「證據僅限單方面」的腳註。OrcaRouter 標誌合成於右下角。
Guides & Insights

VibeVoice-ASR-Streaming-7B 對比 GPT-Transcribe:針對 OpenAI 檔案端點的即時會話檢查點

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

頁面上的這兩個模型並不像它們的名字所暗示的那樣是競爭對手——它們是為錄音生命週期中不同的時刻而打造的,而最誠實的比較方式在於你的產品屬於哪一個時刻。GPT Transcribe 是 OpenAI 的非同步轉錄端點:你上傳完成後的檔案,它以約比即時快 34 倍的速度處理並回傳逐字稿,收費為每分鐘音訊 $0.0045,且在 Artificial Analysis 的 AA-WER 基準上經獨立測得的字詞錯誤率為 3.31%。VibeVoice-ASR-Streaming-7B 則是完全相反的形式:它是 Microsoft Research 推出的串流檢查點,於 2026 年 9 月 2 日以 MIT 授權安靜地上傳到 Hugging Face,設計目的是在音訊仍在送達時進行轉錄——亦即錄音持續增長之際,透過 WebSocket 工作階段分塊輸出文字。僅以準確度比較兩者並無意義,因為一方已經有經稽核的數字,另一方則完全沒有以文字發布任何數字。

以下所有內容皆已據此標示。GPT Transcribe 的數據,是 OpenAI 公布的定價與 Artificial Analysis 的獨立量測,兩者自該模型於 2026 年 7 月 28 日推出以來,即屬公開紀錄。VibeVoice-ASR-Streaming-7B 這一側,則僅能從儲存庫得知——包括 checkpoint 設定、模型卡與 Microsoft 的串流文件——因為尚無第三方對其做過基準測試,而 Microsoft 也未以可讀文字提供串流詞錯誤率。

音頻生命中的兩個不同時刻

GPT Transcribe 是為已經發生的錄音所設計。OpenAI 的端點接受常見格式中最高 25 MB 的音訊檔案——mp3、mp4、mpeg、mpga、m4a、wav、webm——並在處理後回傳完整逐字稿,速度約為即時的 34 倍,因此一小時的錄音只需幾分鐘就能完成。它屬於批次處理路線,OpenAI 也據此定價:每音訊分鐘 $0.0045,約每音訊小時 $0.27。如果你的需求是真正的即時,OpenAI 有賣另一個專門模型——GPT Live Transcribe 每分鐘 $0.017,幾乎是批次價格的四倍——這是 OpenAI 端最接近 VibeVoice-ASR-Streaming-7B 功能的產品。

VibeVoice-ASR-Streaming-7B 反方向地消除了這種區別:它是一個串流檢查點,同時也能處理完整檔案。其預處理器設定顯示了即時運作的契約——音訊以 24 kHz 輸入,壓縮 3,200 倍成為 7.5 Hz 的 token 流,然後以每 22 幀為一區塊進行處理,搭配 4 幀的前瞻;每個區塊約含 2.9 秒的音訊與約半秒的未來上下文,並在每個區塊解析完成時輸出文字。會話上下文透過 KV cache 向前傳遞,因此長時間的會話不需從頭重新計算。文件記載的服務路徑(一個 vLLM 外掛)為即時會話提供了 WebSocket 串流端點,以及一個整份檔案轉錄端點,因此同一組權重可服務兩種形態——但此模型存在的理由在於即時形態,而且沒有每分鐘計費的機制,因為沒有託管 API。GPU 由你自備。

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

證據帳本是片面的

GPT Transcribe 是生產環境中衡量最徹底的轉錄 API 之一。Artificial Analysis 在 AA-WER 上測得 3.31% 的字錯誤率——在約五十個受追蹤系統中排名第九——其子分數裡藏著一個已知弱點:在刻意以高難度音訊設計的 Earnings22 集上,它掉到 6.10%。這些是來自中立排行榜、經稽核且可重現的數據,而且它們本身也附帶已記載的限制。該模型推出時,價格比前一代 GPT-4o Transcribe 便宜 25%,而在同一基準上提升了約 0.7 個百分點。

VibeVoice-ASR-Streaming-7B 在任何地方都沒有可相比的數據。其模型卡以圖片形式附上評估數據,而 Microsoft 的技術報告是 PDF,但內文中沒有可引用的串流 WER 或延遲數字,也沒有任何可獨立驗證的內容。VibeVoice 系列中唯一的數字錨點,是批次 VibeVoice-ASR 模型卡上廠商回報的表格——在八個英文測試集上平均 7.77% WER,以及 LibriSpeech clean 上 2.20%——該表格描述的是非串流模型,不能視為此檢查點的準確率。如果你的採購決策需要一個能向同事交代的數字,這場比較中只有一方有。

每個項目在純文字稿之外所回傳的內容

這兩個模型在上下文方面押注不同,而這正是功能比較有趣的地方。GPT Transcribe 的賣點是上下文提示:你可以傳入一段對錄音的自由格式描述、關鍵字與專有名詞清單,以及預期語言清單;OpenAI 報告指出,在其 Context-Aware ASR 基準測試上,語義準確度從沒有上下文時的 41.6% 提升到有上下文時的 45.2%。它也會回傳偵測到的語言。它不會做的是說話者分離或逐字時間戳記——OpenAI 指出這些需要分開的模型——因此會議紀錄回傳時會是單一未區分的文字牆,除非你自己建立說話者層。

VibeVoice-ASR-Streaming-7B 則押了相反的賭注。其模型卡宣稱具備串流式說話者歸屬輸出——在語音區塊解析完成時即時輸出誰說了什麼——並可透過情境提示詞(context prompt)自訂熱詞;對應的 CLI 旗標為 --context_info。這正是 GPT Transcribe 明確不提供的功能,也是這兩個模型在多說話者即時音訊場景中無法相互替代的原因。制衡因素在於驗證:GPT Transcribe 的功能缺失是有文件記載的產品決策,而 VibeVoice 所宣稱的說話者歸屬僅是模型卡上的陳述,尚無任何獨立測試證實。雙方在時間戳記上也有所不同——在被比較的這條路徑上,兩者皆不提供逐詞(word-level)時間戳記,不過 VibeVoice 系列的批次模型則具備此功能。

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): job shape - streaming session, live audio; throughput - emits per ~2.9 s chunk; WER published - none in text; speaker output - claimed who-said-what, unverified; context controls - hotwords via --context_info; cost - /bin/bash weights, ~18 GB bf16. Right column GPT-Transcribe (released Jul 28, 2026 - hosted API): async file endpoint, files up to 25 MB; ~34x faster than real time; 3.31% AA-WER (6.10% Earnings22); no speaker output; prompt + keywords + language hints; /bin/bash.27 per audio-hour hosted. Footer: 'GPT-Transcribe price per OpenAI; WER per Artificial Analysis. VibeVoice specs read from the HF repo.'

價格形態與所有權問題

兩種成本結構可說天差地遠,而且沒有哪一種絕對較優。GPT Transcribe 是依用量計費的 API:每音訊小時 0.27 美元,不需基礎設施、不需 GPU、每次請求 25 MB,並享有 OpenAI 的營運保證——這正是你不自行執行語音模型所付出的代價。VibeVoice-ASR-Streaming-7B 的權重雖免費,但 KV cache 之前就需要約 18 GB 的 bf16,也就是你需要一張 24 GB 等級的 GPU、microsoft/VibeVoice 示範程式碼或 vLLM 外掛,並自行負責監控與擴充。MIT 授權正是任何按分鐘計價都無法呈現的差異:權重歸你所有,你可以保留、微調,並在你掌控的硬體上執行,沒有按席次計費,也沒有 25 MB 的上限。

語言覆蓋範圍是雙方都比買家所期望的更模糊的地方。VibeVoice-ASR-Streaming-7B 在其模型卡中列出了 10 種語言——英語、中文、西班牙語、葡萄牙語、德語、日語、韓語、法語、俄語、義大利語——相較之下,VibeVoice-ASR 批次則涵蓋 50 多種語言。OpenAI 並未為 GPT Transcribe 發布可比較的經認證語言清單;其在發布材料中宣稱在 22 種 Common Voice 語言上表現優異,而其經審計的 Earnings22 聲學弱點提醒我們,「支援」與「能處理該語言的嘈雜音訊」是兩種不同的宣稱。如果你的覆蓋需求很廣泛,這兩份清單都無法解決問題——請實際測試你的方言。

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

重點是:按路線選擇,而不是按分數。

當音訊是已完成的檔案、當您想要一個有已知限制且附文件記錄的準確度數字,或當認為不必自己運行語音基礎設施的好處值每小時 0.27 美元時,請選擇 GPT Transcribe——而且只有當即時傳送能證明接近 4 倍的價格合理時,才將它與 GPT Live Transcribe 搭配使用。當工作是即時且多說話者、當您希望對話還在進行時就能收到逐字稿、當您想評估帶有說話者標記的串流輸出這項功能,或當開放權重和資料控制比已測量的基準更重要時,請選擇 VibeVoice-ASR-Streaming-7B。

給基於任一方案建置的團隊一個結構性說明:轉錄層目前並非 OrcaRouter 路由的對象——本頁面上的語音轉文字模型都不在其目錄中,因此 ASR 的選擇完全由你決定。路由真正為你帶來的是轉錄稿之上的那一層。即時轉錄串流只有在有東西對其採取行動時才有價值——摘要器、警示規則、語音代理的規劃器——而這正是 OrcaRouter 以單一 API 覆蓋 200 多個模型所支撐的技術堆疊,按供應商列表價格原價轉嫁、不加任何加成,並具備自動故障轉移。讓像 VibeVoice-ASR-Streaming-7B 這樣尚未經實證的檢查點也能低成本嘗試的模式,正是如此:保持取用你轉錄稿的端點可替換,如此一來,一個尚無基準數據的模型,便能憑藉你自己音訊的實證、而非發布當天的宣稱,來贏得或失去你的流量。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube