
Muse Voice Transcribe 對比 Granite Speech 5.0 470M TurboCTC:自有 GPU 或按量計費 API
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
關於這個對決,最需要了解的是:Muse Voice Transcribe 和 Granite Speech 5.0 470M TurboCTC 幾乎無法互相替代。IBM 於 2026 年 8 月 25 日推出 Granite Speech 5.0 470M TurboCTC,這是一個擁有 4.7 億參數、Apache-2.0 授權、僅支援英文的 ASR 模型,專為自架部署而設計——這是一個僅編碼器(encoder-only)的 Conformer 模型,以 CTC 方式訓練,IBM 表示在單一 NVIDIA H200 上的轉錄速度可達即時的 12,600 倍以上。Meta Superintelligence Labs 於 2026 年 9 月 1 日推出 Muse Voice Transcribe,這是一個專有、託管式、串流音訊感知模型——發布時已驗證支援 25 種語言、20 種以上的說話者分離(speaker diarization)、端點偵測,費用為每 1,000 音訊分鐘 3.00 美元。一個要你的 GPU,另一個要你的 API 金鑰。拿它們對外標榜的 WER 數字來比較完全會偏離重點——真正的問題是轉錄允許在哪裡發生,以及每個模型一旦到了那個環境後又能做到什麼。
兩種部署哲學
Granite Speech 5.0 470M TurboCTC 是開放權重邊緣 ASR 運動的巔峰之作。憑藉 470M 參數,它可以輕鬆運行在筆記型電腦、手機或單一 GPU 上;授權為 Apache-2.0,因此你可以將其嵌入商業產品中;IBM 還提供了 WebGPU 示範,無需任何伺服器即可在瀏覽器分頁中即時執行轉錄。其架構刻意精簡 — 16 個 Conformer 區塊、貪婪解碼、無語言模型主幹 — 因為整體設計目標就是在一般硬體上實現高吞吐量。Muse Voice Transcribe 則是相反的賭注:一個你永遠看不到的大型專有模型,透過 Meta 的基礎設施提供服務,每音訊小時收費 0.18 美元,其價值體現在功能而非硬體上。如果你的限制是「音訊不得離開這棟建築」,那麼選擇已經很明確,就是 Granite。如果你的限制是「我想要最具能力的串流模型,而且願意按分鐘付費」,那就是 Muse。

速度在這裡代表的意義不同
Granite 的主打數字 12,600 RTFx 是一個吞吐量指標:一台執行批次推論的 H200 每秒能處理 12,600 秒的音訊——也就是每秒處理三個半小時的音訊。對於客服中心的積壓錄音、媒體檔案庫,或任何持續將資料餵給 GPU 的批次管線而言,這才是關鍵指標。它不是延遲數字,而單串流的互動式延遲並非這款模型的強項。Muse Voice Transcribe 則正好相反:其 80 毫秒的區塊處理與自適應延遲,是為了說話者停頓後的最初 300 毫秒而打造,而非為了持續的高吞吐量。在各自設計所針對的指標上,兩者都很出色;但在對方的主場上,兩者都無法發揮所長。如果你需要轉錄一百萬小時的英文檔案音訊,Granite 的原始成本效益會以一個數量級的優勢勝出。如果你需要將即時的多說話者對話在發生當下轉換成帶標籤的文字,只有 Muse 提供這項功能。
準確性,誠實地標示
• Granite Speech 5.0 470M TurboCTC — 在 Open ASR 排行榜的公開英文短句測試集上,整體 WER 為 5.00%;此為 IBM 自行以官方測試工具執行,僅使用英文音訊,結果由廠商回報且未經重現。
• Muse Voice Transcribe — 3.1% 串流 WER,Meta 發布當日宣稱,引用 Artificial Analysis 串流排行榜;首次部分轉錄稿為 3.6%;同樣是廠商回報且未經再現。
這兩個數字無法直接比較——語料庫不同,一個僅限英文且為離線,另一個則是多語言且即時串流——這正是為何這場較勁不該僅以WER來判定。就現有證據而言,兩者就各自的工作負載來說都說得通,但皆未經驗證。結構上可以確定的是,Granite的數字僅涵蓋英文,而Muse的主張則處於即時串流、語碼轉換的場景中,在這種情況下Granite根本無法與之競爭。

每個模型根本做不到的事
Granite Speech 5.0 470M TurboCTC 拋棄了所有能讓轉錄內容對產品團隊有用的功能。它僅支援英文。它沒有說話者分離(speaker diarization)——所有聲音都落在同一個串流中。它不會輸出標點符號、大小寫或時間戳記,而且 CTC 設計放棄了早期 Granite Speech 模型具備的關鍵字偏置(keyword biasing)和語音翻譯功能。這些不是品質落差,而是架構選擇,這意味著建立在 Granite 之上的生產環境技術棧,仍需要額外掛載標點符號模型、分離器(diarizer)和 VAD 層。Muse Voice Transcribe 是這些功能內建於模型本身的地方:20+ 說話者分離和端點偵測(endpointing)與文字一起輸出,而且語言涵蓋範圍與句中語碼轉換(code-switching)是 Granite 完全無法比擬的。誠實的總結:Granite 是一個假設你會自己打造產品的辨識引擎;Muse 則是一個產品化的 API,假設你希望到達時就能獲得轉錄文字、說話者和話輪邊界。
授權與所有權
Granite Speech 5.0 470M TurboCTC 採用 Apache-2.0 授權,另有一個非商業用途的姊妹版本(granite-speech-5.0-470m-turboctc-nc,CC-BY-NC-SA-4.0),因額外訓練資料而享有略佳的 4.85% WER,可供研究使用。Apache-2.0 代表您可以將其部署、嵌入、微調,並圍繞它銷售產品,無須支付權利金,也無稽核風險。Muse Voice Transcribe 則是封閉且僅限託管:不提供權重、不能自架、不可微調,您的轉錄資料也會在 Meta 的服務中依 Meta 的條款流動。對於受監管行業,或任何資料政策禁止第三方音訊處理的團隊,光這一點就足以在基準測試開始前結束比較。對其他人而言,「Apache-2.0 加上自己的 GPU」與「專有且按用量計費」只是不同的風險配置,而非優劣之分。

成本問題
Granite 在 12,600 RTFx 下,讓自託管成本對於批次英文音訊幾乎顯得多餘:一個 H200 小時的運算可涵蓋超過 12,000 小時的音訊,因此一千小時的轉錄僅需幾美元的原始 GPU 時間,按典型租賃費率計算——這還未計入閒置時間、工程成本及缺少的說話者分離層。Muse Voice Transcribe 每音訊小時收費 0.18 美元,就串流 API 而言算便宜,但相較於持續運作的 GPU 就並不便宜。誠實的經驗法則是:如果音訊是英文、預先錄製且你有大量需求,自托管 Granite 在經濟上勝出。如果音訊是即時、多人說話或多語言的,Muse 的定價是作為託管功能服務——而一千小時的即時、已分離、具端點偵測的串流需 180 美元,相對於自行建置整套技術棧的成本,這是個小數字。
同時運行兩者,而不造成混亂。
需要同時具備兩種模式的團隊——英語批次處理通道自行託管 Granite,即時多語言對話則使用受管 API——最終會得到兩個截然不同的整合方式。託管的那一半正是路由閘道所服務的工作負載型態:一個 API 金鑰可跨多家供應商使用,列表價格以 0% 加成直接轉傳,因此你實際支付的帳單金額就是供應商每分鐘的報價;如果供應商端點效能下降,還會自動進行故障轉移。自行託管的那一半則仍由你掌控。Granite 不需要透過閘道路由——它就運行在你自己的硬體上——但這所帶來的混合技術棧,正是單一 API 平台存在所要避免其變成兩個並行工程專案的那種東西。
你應該選哪一個?
如果你的工作是規模化的英文轉錄——檔案、通話錄音、字幕管道——而且你有一塊 GPU 可以投入運算,Granite Speech 5.0 470M TurboCTC 在成本、授權與掌控性上是更明智的工程決策,但前提是你得自行建置標點、說話者分離與串流層。如果你的工作是即時、多人或多語言的對話——語音代理、即時字幕、會議產品——Muse Voice Transcribe 提供了 Granite 所沒有的功能,以受管 API 的價格計費,但前提是它的數字是閉源權重上發布日當天的宣稱。與其說它們是競爭對手,不如說是對不同問題的解答,而能做出正確選擇的團隊,往往最後會兩者並用。
