主視覺標題卡:Muse Voice Transcribe 對決 Granite Speech 5.0 470M TurboCTC,一側顯示標有 12,600 RTFx 的自托管 GPU 晶片,另一側顯示標有 20+ 說話者的串流波形。
Guides & Insights

Muse Voice Transcribe 對比 Granite Speech 5.0 470M TurboCTC:自有 GPU 或按量計費 API

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

關於這個對決,最需要了解的是:Muse Voice Transcribe 和 Granite Speech 5.0 470M TurboCTC 幾乎無法互相替代。IBM 於 2026 年 8 月 25 日推出 Granite Speech 5.0 470M TurboCTC,這是一個擁有 4.7 億參數、Apache-2.0 授權、僅支援英文的 ASR 模型,專為自架部署而設計——這是一個僅編碼器(encoder-only)的 Conformer 模型,以 CTC 方式訓練,IBM 表示在單一 NVIDIA H200 上的轉錄速度可達即時的 12,600 倍以上。Meta Superintelligence Labs 於 2026 年 9 月 1 日推出 Muse Voice Transcribe,這是一個專有、託管式、串流音訊感知模型——發布時已驗證支援 25 種語言、20 種以上的說話者分離(speaker diarization)、端點偵測,費用為每 1,000 音訊分鐘 3.00 美元。一個要你的 GPU,另一個要你的 API 金鑰。拿它們對外標榜的 WER 數字來比較完全會偏離重點——真正的問題是轉錄允許在哪裡發生,以及每個模型一旦到了那個環境後又能做到什麼。

兩種部署哲學

Granite Speech 5.0 470M TurboCTC 是開放權重邊緣 ASR 運動的巔峰之作。憑藉 470M 參數,它可以輕鬆運行在筆記型電腦、手機或單一 GPU 上;授權為 Apache-2.0,因此你可以將其嵌入商業產品中;IBM 還提供了 WebGPU 示範,無需任何伺服器即可在瀏覽器分頁中即時執行轉錄。其架構刻意精簡 — 16 個 Conformer 區塊、貪婪解碼、無語言模型主幹 — 因為整體設計目標就是在一般硬體上實現高吞吐量。Muse Voice Transcribe 則是相反的賭注:一個你永遠看不到的大型專有模型,透過 Meta 的基礎設施提供服務,每音訊小時收費 0.18 美元,其價值體現在功能而非硬體上。如果你的限制是「音訊不得離開這棟建築」,那麼選擇已經很明確,就是 Granite。如果你的限制是「我想要最具能力的串流模型,而且願意按分鐘付費」,那就是 Muse。

A generated two-column scoreboard titled 'Muse Voice Transcribe vs Granite Speech 5.0 470M TurboCTC — the scoreboard.' Left column Muse Voice Transcribe: Deployment hosted API only, License proprietary closed weights, WER 3.1% streaming (Meta-reported), Languages 25 verified code-switch, Diarization 20+ speakers, Endpointing built-in. Right column Granite Speech 5.0 470M TurboCTC: Deployment self-host 470M params, License Apache-2.0 open weights, WER 5.00% Open ASR (IBM-reported), Languages English only, Diarization none, Endpointing none. Footer reads 'Muse figures Meta-reported; Granite 12,600 RTFx and 5.00% WER IBM-reported, unreproduced.'

速度在這裡代表的意義不同

Granite 的主打數字 12,600 RTFx 是一個吞吐量指標:一台執行批次推論的 H200 每秒能處理 12,600 秒的音訊——也就是每秒處理三個半小時的音訊。對於客服中心的積壓錄音、媒體檔案庫,或任何持續將資料餵給 GPU 的批次管線而言,這才是關鍵指標。它不是延遲數字,而單串流的互動式延遲並非這款模型的強項。Muse Voice Transcribe 則正好相反:其 80 毫秒的區塊處理與自適應延遲,是為了說話者停頓後的最初 300 毫秒而打造,而非為了持續的高吞吐量。在各自設計所針對的指標上,兩者都很出色;但在對方的主場上,兩者都無法發揮所長。如果你需要轉錄一百萬小時的英文檔案音訊,Granite 的原始成本效益會以一個數量級的優勢勝出。如果你需要將即時的多說話者對話在發生當下轉換成帶標籤的文字,只有 Muse 提供這項功能。

準確性,誠實地標示

• Granite Speech 5.0 470M TurboCTC — 在 Open ASR 排行榜的公開英文短句測試集上,整體 WER 為 5.00%;此為 IBM 自行以官方測試工具執行,僅使用英文音訊,結果由廠商回報且未經重現。

• Muse Voice Transcribe — 3.1% 串流 WER,Meta 發布當日宣稱,引用 Artificial Analysis 串流排行榜;首次部分轉錄稿為 3.6%;同樣是廠商回報且未經再現。

這兩個數字無法直接比較——語料庫不同,一個僅限英文且為離線,另一個則是多語言且即時串流——這正是為何這場較勁不該僅以WER來判定。就現有證據而言,兩者就各自的工作負載來說都說得通,但皆未經驗證。結構上可以確定的是,Granite的數字僅涵蓋英文,而Muse的主張則處於即時串流、語碼轉換的場景中,在這種情況下Granite根本無法與之競爭。

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

每個模型根本做不到的事

Granite Speech 5.0 470M TurboCTC 拋棄了所有能讓轉錄內容對產品團隊有用的功能。它僅支援英文。它沒有說話者分離(speaker diarization)——所有聲音都落在同一個串流中。它不會輸出標點符號、大小寫或時間戳記,而且 CTC 設計放棄了早期 Granite Speech 模型具備的關鍵字偏置(keyword biasing)和語音翻譯功能。這些不是品質落差,而是架構選擇,這意味著建立在 Granite 之上的生產環境技術棧,仍需要額外掛載標點符號模型、分離器(diarizer)和 VAD 層。Muse Voice Transcribe 是這些功能內建於模型本身的地方:20+ 說話者分離和端點偵測(endpointing)與文字一起輸出,而且語言涵蓋範圍與句中語碼轉換(code-switching)是 Granite 完全無法比擬的。誠實的總結:Granite 是一個假設你會自己打造產品的辨識引擎;Muse 則是一個產品化的 API,假設你希望到達時就能獲得轉錄文字、說話者和話輪邊界。

授權與所有權

Granite Speech 5.0 470M TurboCTC 採用 Apache-2.0 授權,另有一個非商業用途的姊妹版本(granite-speech-5.0-470m-turboctc-nc,CC-BY-NC-SA-4.0),因額外訓練資料而享有略佳的 4.85% WER,可供研究使用。Apache-2.0 代表您可以將其部署、嵌入、微調,並圍繞它銷售產品,無須支付權利金,也無稽核風險。Muse Voice Transcribe 則是封閉且僅限託管:不提供權重、不能自架、不可微調,您的轉錄資料也會在 Meta 的服務中依 Meta 的條款流動。對於受監管行業,或任何資料政策禁止第三方音訊處理的團隊,光這一點就足以在基準測試開始前結束比較。對其他人而言,「Apache-2.0 加上自己的 GPU」與「專有且按用量計費」只是不同的風險配置,而非優劣之分。

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc showing the English-language and automatic-speech-recognition tags, a model summary describing a compact 470 million parameter English ASR model, the safetensors and Transformers tags, and the Open ASR leaderboard evaluation table.

成本問題

Granite 在 12,600 RTFx 下,讓自託管成本對於批次英文音訊幾乎顯得多餘:一個 H200 小時的運算可涵蓋超過 12,000 小時的音訊,因此一千小時的轉錄僅需幾美元的原始 GPU 時間,按典型租賃費率計算——這還未計入閒置時間、工程成本及缺少的說話者分離層。Muse Voice Transcribe 每音訊小時收費 0.18 美元,就串流 API 而言算便宜,但相較於持續運作的 GPU 就並不便宜。誠實的經驗法則是:如果音訊是英文、預先錄製且你有大量需求,自托管 Granite 在經濟上勝出。如果音訊是即時、多人說話或多語言的,Muse 的定價是作為託管功能服務——而一千小時的即時、已分離、具端點偵測的串流需 180 美元,相對於自行建置整套技術棧的成本,這是個小數字。

同時運行兩者,而不造成混亂。

需要同時具備兩種模式的團隊——英語批次處理通道自行託管 Granite,即時多語言對話則使用受管 API——最終會得到兩個截然不同的整合方式。託管的那一半正是路由閘道所服務的工作負載型態:一個 API 金鑰可跨多家供應商使用,列表價格以 0% 加成直接轉傳,因此你實際支付的帳單金額就是供應商每分鐘的報價;如果供應商端點效能下降,還會自動進行故障轉移。自行託管的那一半則仍由你掌控。Granite 不需要透過閘道路由——它就運行在你自己的硬體上——但這所帶來的混合技術棧,正是單一 API 平台存在所要避免其變成兩個並行工程專案的那種東西。

你應該選哪一個?

如果你的工作是規模化的英文轉錄——檔案、通話錄音、字幕管道——而且你有一塊 GPU 可以投入運算,Granite Speech 5.0 470M TurboCTC 在成本、授權與掌控性上是更明智的工程決策,但前提是你得自行建置標點、說話者分離與串流層。如果你的工作是即時、多人或多語言的對話——語音代理、即時字幕、會議產品——Muse Voice Transcribe 提供了 Granite 所沒有的功能,以受管 API 的價格計費,但前提是它的數字是閉源權重上發布日當天的宣稱。與其說它們是競爭對手,不如說是對不同問題的解答,而能做出正確選擇的團隊,往往最後會兩者並用。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube