
Grok Voice Transcribe 2.0 對上 Muse Voice Transcribe:17 天的稱霸與四分之一秒
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年9月1日,Meta 表示 Muse Voice Transcribe 在 Artificial Analysis 的串流語音辨識評測中,以 3.1% 的最終詞錯誤率拿下第一,而這項說法在十七天內無人挑戰。9月18日,SpaceXAI 推出 Grok Voice Transcribe 2.0,在同一榜單上以 2.7% 的成績取而代之。兩個模型,同一份排名,相隔十七天——而更有意思的比較並不是那 0.4 個百分點的準確率差距,因為 Meta 的模型在完成一句話的處理上仍快上約三倍:語音結束後 0.16 秒,對比 Grok Voice Transcribe 2.0 的 0.49 秒。Muse Voice Transcribe 是 Meta Superintelligence Labs 打造的即時音訊感知模型,用於在 Meta 自家產品內運行;在這些產品中,四分之一秒就是一個感覺隨時在場的助理,與一個感覺遲緩的助理之間的差別。Grok Voice Transcribe 2.0 則是一套轉錄 API,設計上供任何人呼叫,其價格讓批次處理變得可行。這兩個數字都是發表當天由廠商自行公布的,而兩者之中至今只有一個被獨立放上公開榜單。
排行榜現在實際上說的是什麼
AA-WER Streaming 排行榜是一項加權綜合指標——AA-AgentTalk 佔 50%、VoxPopuli 佔 25%、Earnings22 佔 25%,大約八小時、以代理型為主的英語音訊——而兩個模型都在其上受測,這正是讓它成為罕見的正面對決、且數字至少還可相互比較的原因。以下並列呈現,並納入廠商回報的數據:
• 最終轉錄準確度 — Grok Voice Transcribe 2.0 為 2.7% WER,相較於 Muse Voice Transcribe 的 3.1%
• 首次部分轉錄準確度 — 3.4% vs 3.6%
• 首次部分輸出時間 — 0.49 秒 vs 0.13 秒
• 語音結束後到最終逐字稿的時間 — 0.49 秒對比 0.16 秒
• 語者分段錯誤率 — 已納入,未公布數據,而 Meta 的評估平均值為 17.5%
請分開閱讀準確度列與延遲列,因為它們指向相反的方向,而兩者都成立。在準確度方面,這兩個模型在最終轉錄稿上相差不到 0.4 個百分點,在首次部分結果上相差 0.2 個百分點——這個差距小到只要任一公司推出下一個版本就可能逆轉,也小到任何理性的人都不應以此在兩者之間做選擇。在延遲方面,兩者則相去甚遠。Meta 的模型約在八分之一秒內回傳部分結果,並在約六分之一秒內產生最終結果,而 SpaceXAI 的模型在這兩者上都約需半秒。
這就是整個比較,用一句話概括:Grok Voice Transcribe 2.0 用延遲換取準確度,而 Muse Voice Transcribe 則反其道而行。SpaceXAI 將其首次部分結果錯誤率從 1.0 版的 18.3% 降到 2.0 版的 3.4%,而代價是在同一項指標上從 0.25 秒增加到 0.49 秒。Meta 的模型則是往另一個方向設計,採用 80 毫秒的音訊區塊,以及一套經強化學習訓練的自適應延遲,用來決定在確定文字之前要等待多久——這個機制的全部目的,就是在保持準確度的同時,讓確定文字的過程維持快速。這兩種選擇都不是錯誤。它們是對不同問題的不同答案。
你在問哪個問題
如果轉錄結果要餵給必須在對話停頓內回應的語音代理,0.16 秒和 0.49 秒就是不同的產品。人類輪流發話可容忍幾百毫秒的間隔,之後互動才會開始讓人覺得不對勁,而延遲預算是共享的——先轉錄,再推理,然後語音合成。一個能在六分之一秒內交回最終轉錄的模型,會為管線其餘部分留下空間;一個要花半秒的模型,則在模型還沒思考任何事之前就耗掉大部分預算。那正是 Meta 所打造的目標,也是為什麼這個模型在 Mac 上的 Meta AI 裡、以及 Muse Code 裡運行,而不是主要作為他人管線的端點來提供。
如果逐字稿是一份文件——通話錄音、會議、影片庫、合規封存——那麼半秒根本不算什麼,準確度的落差也依然不算什麼,唯一重要的數字是一小時的音訊要花多少錢。而這正是這兩者急遽分歧的地方,而且分歧的方向,會讓只看串流費率的人大吃一驚。
批次價格只要一半,串流則貴一成
Meta 將 Muse Voice Transcribe 定價為每小時音訊 $0.18,或每 1,000 分鐘 $3.00。Grok Voice Transcribe 2.0 的定價為批次每小時 $0.10,串流每小時 $0.20。所以:
• 串流 — Grok Voice Transcribe 2.0 每小時 $0.20,對比 Muse Voice Transcribe 每小時 $0.18,所以 Meta 大約便宜 10%
• 批次或錄製 — 每小時 $0.10 對比 $0.18,因此 SpaceXAI 便宜 44%
• 已包含在定價中——在 SpaceXAI 方面包含說話者分離、帶有置信度的詞時間戳、關鍵詞偏置和反向文本正規化,而 Meta 方面則包含串流轉錄、說話者分離和端點檢測作為一個模型
• 免費方案或自架——兩者皆非
只做串流的團隊,在價格上應該對兩者無差別,並依延遲來選擇,也就是選 Meta。任何有可觀錄音量的團隊,都該看批次計價那一列,因為每小時 0.08 美元會不斷累積:每月 5,000 小時,一個是 500 美元,另一個是 900 美元,而兩者的準確度差距,比任一個數字四捨五入的誤差還小。
授權情況在要緊的地方完全相同,在無關緊要的地方則有所不同。兩者都是封閉權重——Muse Voice Transcribe 是專有軟體,僅能透過 Meta 代管的 API 取得;Grok Voice Transcribe 2.0 則是商業 API,不提供下載。如果你的要求是音訊絕不離開你所掌控的基礎設施,那麼這兩者都不是選項;而且兩者都會讓你暴露在供應商於你腳下變更價格、模型版本或淘汰時程的風險之中。這是真實存在的考量,而非假設性的問題:Grok Voice Transcribe 1.0 在其後繼版本推出後不到兩週,就已經走上淘汰之路。

講者分段(Diarization),而這是兩者都沒拿來主打的特色功能
這兩個模型都在單次執行中完成語者歸屬,而這在兩年前還是事後才黏上去的獨立系統;這裡的比較格外具體,因為 Meta 公布了一個數字,而 SpaceXAI 並沒有。
Meta 回報其評估中的平均說話者分離錯誤率為 17.5%,可在未經後處理的情況下處理 20 位以上的說話者,而且是在串流模型內處理,而非作為下游步驟——「誰說了什麼」會隨著文字一起出現,而不是在文字之後才出現。這在串流情境中確實非常困難,因為說話者的發言輪次唯有在你已聽得足夠多之後才能辨識出來;而 17.5% 是個真實的數字,卻也附帶一項真實的但書:那是 Meta 自家的數字,且是在 Meta 自行選擇的評估集上平均得出的。
SpaceXAI 的模型內含免額外收費的語者分離(diarization),並且也在單一請求中支援最多八個獨立音訊聲道,這是解決同一問題的另一種方式——如果你的音訊是以每位參與者各自獨立的聲道送達(聯絡中心電話系統經常如此),聲道分離會比語者分離更可靠,而且完全不需要錯誤率。如果你的音訊是以單一混合串流送達,你就得仰賴語者分離的品質,而這兩家供應商中只有一家告訴過你那個品質是多少。
值得注意的一個次級差異:Muse Voice Transcribe 把語者分離、轉錄與端點偵測視為單一模型、產生單一輸出,這意味著這些元件無法各自獨立失效。Grok Voice Transcribe 2.0 則讓你將聲道、關鍵詞與語者分離當作各自獨立的槓桿來操作。單一模型跑起來更簡單,除錯卻更困難。

語言,以及兩份模型卡不再能互相比較之處
Meta 以超過 70 種語言訓練 Muse Voice Transcribe,並在推出時大規模驗證了其中 25 種,具備句子內部與句子之間的母語級語碼轉換能力,並支援長度超過一小時的音訊。Grok Voice Transcribe 2.0 可自動偵測語言,並在錄音過程中切換語言,同時套用反向文字正規化——將口語的日期、貨幣、電話號碼和電子郵件地址轉換為書寫形式——涵蓋 25 種語言。
重疊的部分,一邊是 25 種經過廣泛驗證的語言,另一邊是 25 種正規化語言,而這兩個集合並不是同樣的那 25 種,且兩家供應商都沒有公布這份清單。「訓練了 70 多種語言」和「支援 25 種語言的格式化」並不是可互相比較的宣稱,不應該互相扣減。可以這麼說:Meta 提出的是更廣泛的多語言宣稱,而 SpaceXAI 提出的則是範圍較窄但更具操作性的一項:偵測語言只是基本門檻,而把模型聽到的內容格式化為下游系統能解析的形式,才是缺少時會破壞整合的那一環。
這個選擇,以及它可能不由你來做的原因
剝去行銷話術,這個決定歸結起來只有三句話。如果逐字稿是在對話中即時使用的,就選 Muse Voice Transcribe,因為 0.16 秒絕不是枝微末節。如果你有大量錄音檔要處理,就選 Grok Voice Transcribe 2.0,因為批次價格只要一半,這同樣不是小事。如果你兩種極端需求都沒有,就依其他限制條件來決定——地區、合約、既有的系統整合——因為準確度上的差異並不足以定奪。
麻煩的是,這兩款模型之一其實並不是一般意義上的販售。Muse Voice Transcribe 的存在,是為了讓 Meta 自家的助理感覺起來很快,而它能透過 Meta Model API 提供,主要是因為 Meta 認為曝光所帶來的生態系價值高於獨家專屬的價值。這可能改變,而且可能改變得很快:Meta 在同一週把 Muse 的連接器平台開放給第三方開發者,這是一家公司正在投資自己的通路,而不是在當一個對所有人保持中立的供應商。在生產環境中依賴競爭對手的內部模型,等於是在賭條件不會改變,而這種賭注在歷史上紀錄很差。
這種不對稱性,正是為何不該把其中任何一個寫死的理由。OrcaRouter 透過單一相容 OpenAI 的金鑰提供 200+ 個模型,具備跨供應商的自動容錯移轉,且對供應商標價加價 0%——因此當 SpaceXAI 把預設值切換到 2.0 並棄用 1.0,或當 Meta 重新定位其語音 API 時,這項變動只是改一個模型字串,而非一項遷移專案。對於一個領導者三週內兩度易主的類別而言,路由層是技術堆疊中應該保持穩定的部分,而模型則是那個不該穩定的部分。

未來一個月值得留意的一件事:既然 Grok Voice Transcribe 2.0 已取代 Muse Voice Transcribe,Artificial Analysis 是否會在串流排行榜上重新測量 Muse Voice Transcribe。Meta 的 3.1% 與 SpaceXAI 的 2.7% 都是在推出時公布的,但只有 SpaceXAI 的數字被獨立列入。如果 Meta 的數字在有人重跑時站得住腳,準確度差距就跟表面看起來一樣小,而延遲差距將決定一切。如果站不住腳,那十七天的稱霸就是故事的全貌。
