文章主視覺卡片寫著「Grok Voice Transcribe 2.0 vs Muse Voice Transcribe」,帶有「模型比較」徽章與「17 天稱霸與四分之一秒」副標題,資訊標籤顯示最終 WER 2.7% vs 3.1%、語音結束後 0.49 秒 vs 0.16 秒、每串流小時 $0.20 vs $0.18 且批次價格為一半,背景為白到藍的漸層,OrcaRouter 標誌位於右下角。
Guides & Insights

Grok Voice Transcribe 2.0 對上 Muse Voice Transcribe:17 天的稱霸與四分之一秒

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年9月1日,Meta 表示 Muse Voice Transcribe 在 Artificial Analysis 的串流語音辨識評測中,以 3.1% 的最終詞錯誤率拿下第一,而這項說法在十七天內無人挑戰。9月18日,SpaceXAI 推出 Grok Voice Transcribe 2.0,在同一榜單上以 2.7% 的成績取而代之。兩個模型,同一份排名,相隔十七天——而更有意思的比較並不是那 0.4 個百分點的準確率差距,因為 Meta 的模型在完成一句話的處理上仍快上約三倍:語音結束後 0.16 秒,對比 Grok Voice Transcribe 2.0 的 0.49 秒。Muse Voice Transcribe 是 Meta Superintelligence Labs 打造的即時音訊感知模型,用於在 Meta 自家產品內運行;在這些產品中,四分之一秒就是一個感覺隨時在場的助理,與一個感覺遲緩的助理之間的差別。Grok Voice Transcribe 2.0 則是一套轉錄 API,設計上供任何人呼叫,其價格讓批次處理變得可行。這兩個數字都是發表當天由廠商自行公布的,而兩者之中至今只有一個被獨立放上公開榜單。

排行榜現在實際上說的是什麼

AA-WER Streaming 排行榜是一項加權綜合指標——AA-AgentTalk 佔 50%、VoxPopuli 佔 25%、Earnings22 佔 25%,大約八小時、以代理型為主的英語音訊——而兩個模型都在其上受測,這正是讓它成為罕見的正面對決、且數字至少還可相互比較的原因。以下並列呈現,並納入廠商回報的數據:

• 最終轉錄準確度 — Grok Voice Transcribe 2.0 為 2.7% WER,相較於 Muse Voice Transcribe 的 3.1%

• 首次部分轉錄準確度 — 3.4% vs 3.6%

• 首次部分輸出時間 — 0.49 秒 vs 0.13 秒

• 語音結束後到最終逐字稿的時間 — 0.49 秒對比 0.16 秒

• 語者分段錯誤率 — 已納入,未公布數據,而 Meta 的評估平均值為 17.5%

請分開閱讀準確度列與延遲列,因為它們指向相反的方向,而兩者都成立。在準確度方面,這兩個模型在最終轉錄稿上相差不到 0.4 個百分點,在首次部分結果上相差 0.2 個百分點——這個差距小到只要任一公司推出下一個版本就可能逆轉,也小到任何理性的人都不應以此在兩者之間做選擇。在延遲方面,兩者則相去甚遠。Meta 的模型約在八分之一秒內回傳部分結果,並在約六分之一秒內產生最終結果,而 SpaceXAI 的模型在這兩者上都約需半秒。

這就是整個比較,用一句話概括:Grok Voice Transcribe 2.0 用延遲換取準確度,而 Muse Voice Transcribe 則反其道而行。SpaceXAI 將其首次部分結果錯誤率從 1.0 版的 18.3% 降到 2.0 版的 3.4%,而代價是在同一項指標上從 0.25 秒增加到 0.49 秒。Meta 的模型則是往另一個方向設計,採用 80 毫秒的音訊區塊,以及一套經強化學習訓練的自適應延遲,用來決定在確定文字之前要等待多久——這個機制的全部目的,就是在保持準確度的同時,讓確定文字的過程維持快速。這兩種選擇都不是錯誤。它們是對不同問題的不同答案。

你在問哪個問題

如果轉錄結果要餵給必須在對話停頓內回應的語音代理,0.16 秒和 0.49 秒就是不同的產品。人類輪流發話可容忍幾百毫秒的間隔,之後互動才會開始讓人覺得不對勁,而延遲預算是共享的——先轉錄,再推理,然後語音合成。一個能在六分之一秒內交回最終轉錄的模型,會為管線其餘部分留下空間;一個要花半秒的模型,則在模型還沒思考任何事之前就耗掉大部分預算。那正是 Meta 所打造的目標,也是為什麼這個模型在 Mac 上的 Meta AI 裡、以及 Muse Code 裡運行,而不是主要作為他人管線的端點來提供。

如果逐字稿是一份文件——通話錄音、會議、影片庫、合規封存——那麼半秒根本不算什麼,準確度的落差也依然不算什麼,唯一重要的數字是一小時的音訊要花多少錢。而這正是這兩者急遽分歧的地方,而且分歧的方向,會讓只看串流費率的人大吃一驚。

批次價格只要一半,串流則貴一成

Meta 將 Muse Voice Transcribe 定價為每小時音訊 $0.18,或每 1,000 分鐘 $3.00。Grok Voice Transcribe 2.0 的定價為批次每小時 $0.10,串流每小時 $0.20。所以:

• 串流 — Grok Voice Transcribe 2.0 每小時 $0.20,對比 Muse Voice Transcribe 每小時 $0.18,所以 Meta 大約便宜 10%

• 批次或錄製 — 每小時 $0.10 對比 $0.18,因此 SpaceXAI 便宜 44%

• 已包含在定價中——在 SpaceXAI 方面包含說話者分離、帶有置信度的詞時間戳、關鍵詞偏置和反向文本正規化,而 Meta 方面則包含串流轉錄、說話者分離和端點檢測作為一個模型

• 免費方案或自架——兩者皆非

只做串流的團隊,在價格上應該對兩者無差別,並依延遲來選擇,也就是選 Meta。任何有可觀錄音量的團隊,都該看批次計價那一列,因為每小時 0.08 美元會不斷累積:每月 5,000 小時,一個是 500 美元,另一個是 900 美元,而兩者的準確度差距,比任一個數字四捨五入的誤差還小。

授權情況在要緊的地方完全相同,在無關緊要的地方則有所不同。兩者都是封閉權重——Muse Voice Transcribe 是專有軟體,僅能透過 Meta 代管的 API 取得;Grok Voice Transcribe 2.0 則是商業 API,不提供下載。如果你的要求是音訊絕不離開你所掌控的基礎設施,那麼這兩者都不是選項;而且兩者都會讓你暴露在供應商於你腳下變更價格、模型版本或淘汰時程的風險之中。這是真實存在的考量,而非假設性的問題:Grok Voice Transcribe 1.0 在其後繼版本推出後不到兩週,就已經走上淘汰之路。

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

講者分段(Diarization),而這是兩者都沒拿來主打的特色功能

這兩個模型都在單次執行中完成語者歸屬,而這在兩年前還是事後才黏上去的獨立系統;這裡的比較格外具體,因為 Meta 公布了一個數字,而 SpaceXAI 並沒有。

Meta 回報其評估中的平均說話者分離錯誤率為 17.5%,可在未經後處理的情況下處理 20 位以上的說話者,而且是在串流模型內處理,而非作為下游步驟——「誰說了什麼」會隨著文字一起出現,而不是在文字之後才出現。這在串流情境中確實非常困難,因為說話者的發言輪次唯有在你已聽得足夠多之後才能辨識出來;而 17.5% 是個真實的數字,卻也附帶一項真實的但書:那是 Meta 自家的數字,且是在 Meta 自行選擇的評估集上平均得出的。

SpaceXAI 的模型內含免額外收費的語者分離(diarization),並且也在單一請求中支援最多八個獨立音訊聲道,這是解決同一問題的另一種方式——如果你的音訊是以每位參與者各自獨立的聲道送達(聯絡中心電話系統經常如此),聲道分離會比語者分離更可靠,而且完全不需要錯誤率。如果你的音訊是以單一混合串流送達,你就得仰賴語者分離的品質,而這兩家供應商中只有一家告訴過你那個品質是多少。

值得注意的一個次級差異:Muse Voice Transcribe 把語者分離、轉錄與端點偵測視為單一模型、產生單一輸出,這意味著這些元件無法各自獨立失效。Grok Voice Transcribe 2.0 則讓你將聲道、關鍵詞與語者分離當作各自獨立的槓桿來操作。單一模型跑起來更簡單,除錯卻更困難。

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

語言,以及兩份模型卡不再能互相比較之處

Meta 以超過 70 種語言訓練 Muse Voice Transcribe,並在推出時大規模驗證了其中 25 種,具備句子內部與句子之間的母語級語碼轉換能力,並支援長度超過一小時的音訊。Grok Voice Transcribe 2.0 可自動偵測語言,並在錄音過程中切換語言,同時套用反向文字正規化——將口語的日期、貨幣、電話號碼和電子郵件地址轉換為書寫形式——涵蓋 25 種語言。

重疊的部分,一邊是 25 種經過廣泛驗證的語言,另一邊是 25 種正規化語言,而這兩個集合並不是同樣的那 25 種,且兩家供應商都沒有公布這份清單。「訓練了 70 多種語言」和「支援 25 種語言的格式化」並不是可互相比較的宣稱,不應該互相扣減。可以這麼說:Meta 提出的是更廣泛的多語言宣稱,而 SpaceXAI 提出的則是範圍較窄但更具操作性的一項:偵測語言只是基本門檻,而把模型聽到的內容格式化為下游系統能解析的形式,才是缺少時會破壞整合的那一環。

這個選擇,以及它可能不由你來做的原因

剝去行銷話術,這個決定歸結起來只有三句話。如果逐字稿是在對話中即時使用的,就選 Muse Voice Transcribe,因為 0.16 秒絕不是枝微末節。如果你有大量錄音檔要處理,就選 Grok Voice Transcribe 2.0,因為批次價格只要一半,這同樣不是小事。如果你兩種極端需求都沒有,就依其他限制條件來決定——地區、合約、既有的系統整合——因為準確度上的差異並不足以定奪。

麻煩的是,這兩款模型之一其實並不是一般意義上的販售。Muse Voice Transcribe 的存在,是為了讓 Meta 自家的助理感覺起來很快,而它能透過 Meta Model API 提供,主要是因為 Meta 認為曝光所帶來的生態系價值高於獨家專屬的價值。這可能改變,而且可能改變得很快:Meta 在同一週把 Muse 的連接器平台開放給第三方開發者,這是一家公司正在投資自己的通路,而不是在當一個對所有人保持中立的供應商。在生產環境中依賴競爭對手的內部模型,等於是在賭條件不會改變,而這種賭注在歷史上紀錄很差。

這種不對稱性,正是為何不該把其中任何一個寫死的理由。OrcaRouter 透過單一相容 OpenAI 的金鑰提供 200+ 個模型,具備跨供應商的自動容錯移轉,且對供應商標價加價 0%——因此當 SpaceXAI 把預設值切換到 2.0 並棄用 1.0,或當 Meta 重新定位其語音 API 時,這項變動只是改一個模型字串,而非一項遷移專案。對於一個領導者三週內兩度易主的類別而言,路由層是技術堆疊中應該保持穩定的部分,而模型則是那個不該穩定的部分。

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

未來一個月值得留意的一件事:既然 Grok Voice Transcribe 2.0 已取代 Muse Voice Transcribe,Artificial Analysis 是否會在串流排行榜上重新測量 Muse Voice Transcribe。Meta 的 3.1% 與 SpaceXAI 的 2.7% 都是在推出時公布的,但只有 SpaceXAI 的數字被獨立列入。如果 Meta 的數字在有人重跑時站得住腳,準確度差距就跟表面看起來一樣小,而延遲差距將決定一切。如果站不住腳,那十七天的稱霸就是故事的全貌。