
MAI-Transcribe-2 與 Muse Voice Transcribe:同一週,兩種對音訊截然不同的賭注
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
2026年9月1日那一週,兩個前沿實驗室各推出了一個語音模型;MAI-Transcribe-2 與 Muse Voice Transcribe 最好理解為對「音訊智慧應該存在於何處」這個問題的相反答案。Muse Voice Transcribe 由 Meta Superintelligence Labs 於9月1日發布,是一款即時音訊感知模型:它能在一次對即時音訊的 80 毫秒片段進行的串流處理中,完成轉錄、分辨超過二十位說話者,並偵測說話者是否已結束發言;它在所接受的串流語音轉文字評測上位居榜首。MAI-Transcribe-2 則由微軟在兩天後的9月3日發布,押注的方向相反:這是一個批次引擎,完全不在意即時延遲,而是把所有能力都投入到轉錄預錄檔案上,在獨立的非串流評測榜上取得最佳詞錯率;處理速度約為即時的 411 倍,每 1,000 分鐘約 1.67 美元。將這兩者當作「轉錄模型」直接比較,會掩蓋真正的決策核心:你需要在音訊生命週期的哪個時刻取得文字——是正在發生的當下,還是結束之後。
兩個產品在不同時刻被指向
Muse Voice Transcribe 專為音訊仍持續進行的當下情境而打造。作為 Meta Muse 系列中的自迴歸多模態模型,它將三項工作整合於單一處理流程:自動語音辨識、可區分超過二十位發言者的說話者分離,以及端點偵測——亦即判斷發言者是否已停止說話,以便系統接續回應。Meta 表示,其最終轉錄文本會在發言者停止說話後約 0.16 秒內完成;最終轉錄文本的詞錯誤率為 3.1%,初始部分結果則為 3.6%——這些數據係 Meta 於產品發布當日引用 Artificial Analysis 串流排行榜所公布,截至本文撰寫時尚未經獨立複現驗證。此模型能以單一音訊串流處理超過一小時的內容,可在句子中途切換語言,並以 70 種以上語言訓練,其中 25 種語言於發布時已獲深入驗證。其價格為每 1,000 分鐘音訊 3.00 美元,約合每小時 0.18 美元,可透過 Meta Model API 使用。Meta 已確認不會開放模型權重。
「MAI-Transcribe-2 專為音訊已經成為檔案的情境而打造。微軟的模型在 Artificial Analysis 的非串流排行榜上測得 2.0% 的 AA-WER,名列第二,也是受控批次 API 中的最佳成績;執行速度約為即時的 411 倍,而這項數字是吞吐量,並非延遲保證。它可轉錄 60 種語言並提供自動語言識別,內建說話者分離、逐詞時間戳記、關鍵字偏置,以及 verbatim(逐字)與 clean(淨化)風格,也能處理 Hinglish、Spanglish 這類語碼轉換。此服務目前透過 Microsoft Foundry 公開預覽,也可在 MAI Playground 使用,定價為每音訊小時 0.10 美元,作為限時上市優惠至今年年底結束;微軟並未宣布任何串流產品。微軟的發布文章明確將它定位於長篇幅與批次音訊——在這些工作負載中,串流模型的低延遲毫無用處,但其每分鐘成本卻依然照算。」

為什麼這兩個準確度數字不衝突
天生的直覺是拿2.0%和3.1%比較,然後宣布贏家,但這樣會錯兩次。首先,這兩個數字衡量的是不同的任務:MAI-Transcribe-2的2.0%是對預錄音訊的非串流準確率,模型可以查看整個檔案;Muse Voice Transcribe的3.1%則是對最終逐字稿的串流準確率,是在音訊陸續送達時即時轉錄的限制下產生的。串流是更難的問題,因此串流排行榜和非串流排行榜是分開的榜單,各有各的分數。其次,這些標籤的權重不同:MAI-Transcribe-2的數據是Artificial Analysis對該模型的測量,而Muse Voice Transcribe的則是Meta在發布當天轉述Artificial Analysis的測量結果——由廠商通報且未經複現。老實說,這兩個模型各自在其排行榜頂端都是可信的主張,而這兩個數字都無法告訴你另一條賽道的任何資訊。
真正的比較重點在於語者分離,因為這是兩款產品都具備的功能,也是兩者企圖心明顯分歧之處。{{1}}Muse Voice Transcribe 將區分超過二十位說話者列為核心串流功能,Meta 宣稱其平均語者分離錯誤率為 17.5%,並引用競爭對手的範圍為 21.1% 至 28.6%——這同樣是 Meta 自行宣稱且未經查證的數據。{{/1}} {{2}}MAI-Transcribe-2 也搭載了語者分離功能,但 Microsoft 完全未公布說話者人數上限,也未公布任何語者分離錯誤率。{{/2}} {{3}}就雙人通話而言,兩款產品都表現良好,差異微不足道。{{/3}} {{4}}但若是十二人的焦點團體或座談錄音,兩者之中只有 Muse Voice Transcribe 明確標示了多說話者上限,而 MAI-Transcribe-2 未經實測的語者分離功能,正是你在將較困難的音檔託付給它之前,最需要先行測試的最大理由。{{/4}}
合理的價格比較。
在價格上,這兩者的差距比批次處理與串流處理框架所暗示的還要更接近,因為每 1,000 分鐘 1.67 美元(MAI-Transcribe-2,早鳥價)與每 1,000 分鐘 3.00 美元(Muse Voice Transcribe)都屬於受管語音服務中價格偏低的一端。這種比較只有在同一條賽道內才有意義。就預錄音訊的批次轉錄而言,MAI-Transcribe-2 的價格不到原生串流模型的一半,同時還具備更佳的非串流 WER——但除非你特別想要 Muse Voice Transcribe 的串流管線,否則不會把錄音檔案交給它處理,因為那不是處理檔案庫的有效方式。就即時會議音訊而言,Muse Voice Transcribe 是本文中唯一真正能用的產品,其每 1,000 分鐘 3.00 美元的費率,低於它推出時所面對的其他即時轉錄 API——Gemini 3.5 Transcribe Live 約為每 1,000 分鐘 9 美元,GPT Live Transcribe 為 17 美元——同時還提供這些產品無法比擬、支援超過二十位說話者的語者分離功能。關於價格,最誠實的標題是:Meta 把串流價格訂得低,微軟則把批次價格訂得更低,而這兩個數字都是促銷期的定價,一旦各廠商公布其標準費率,價格就會開始浮動。

哪一個用於哪個音訊
如果您的音訊是即時的——會議即時轉錄、語音代理、即時字幕,任何需要在說話當下取得文字的情境——Muse Voice Transcribe 就是首選,而且沒有懸念。它是這裡唯一的串流模型,能在同一趟處理中區分超過二十位說話者,而且從第一天起就定價鎖定要贏下這個賽道。它的弱點是您該帶進試用的項目:準確度與語者分離數據是 Meta 自行報告的,而且這個才推出一週的串流模型,尚未展現它面對那些存在於發表基準之外的雜亂音訊時會如何表現。
如果你的音訊已是以檔案形式存在——例如歸檔錄音、通話錄音、媒體庫,或任何需要批次處理的內容——MAI-Transcribe-2 在每個關鍵指標上都更勝一籌:實測 WER 更低、吞吐量約高出一個數量級,且每 1,000 分鐘的價格低於串流模型。它的風險與 Muse 恰好互為鏡像:僅推出四天、沒有串流 SKU、語者分離品質未經量測,以及一項背後標準價格尚未揭曉的早鳥費率。
介紹 MAI-Transcribe-2 的 Microsoft 發表頁面,列出了 Microsoft 一併提供、而串流競爭對手未在同一個方案中提供的功能;當你要判斷哪些說法是實際產品功能、哪些仍只是基準測試的承諾時,這份文件正是查閱依據。

如果轉錄稿只是你處理管線的前半段,那麼這兩者之間的選擇,重要性遠低於你在它們之上所做的選擇。由 Muse Voice Transcribe 轉錄的即時會議音訊,在產生實用價值之前,仍需進行摘要、行動項目擷取與後續跟進草擬;由 MAI-Transcribe-2 轉錄的封存通話,仍需被搜尋、修訂或路由至正確的下游系統。而正是在這一層,多模型平台才真正發揮價值——OrcaRouter 以單一 API 串接 200 多個模型,供應商列表價格以 0% 加價轉傳,讓下游工作能透過單一整合,依工作負載呼叫不同模型。因此無論哪個語音模型在你的試驗中勝出,轉錄稿之上的技術堆疊都不必為了轉換而重建。無論是 Muse Voice Transcribe 還是 MAI-Transcribe-2,目前都不在該名單上;兩者皆僅存在於各自廠商的 API 中。本週真正定案的賭注其實更狹窄、也更有用:即時與批次轉錄的成本都剛剛降到夠低,以致於差異化不再在於文字本身——而在於你如何運用這些文字。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
