文章主視覺卡片寫著「Grok Voice Transcribe 2.0 對比 MAI Transcribe 2」,帶有「模型比較」徽章與副標「兩條路線,而非兩個對手」,標籤寫著 3.4% 對比無串流 SKU、2.29% 對比 2.04% 批次 WER、162 倍對比 333 倍即時,以及每 1,000 分鐘各 $1.67,背景為白色至藍色漸層,OrcaRouter 標誌位於右下角。
Guides & Insights

Grok Voice Transcribe 2.0 對 MAI Transcribe 2:兩條賽道,而非兩個對手

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩個模型相隔十五天發布,定價精確到分完全相同,而且它們幾乎永遠不會出現在同一個採購決策中。Grok Voice Transcribe 2.0,由 SpaceXAI 於 2026 年 9 月 18 日推出,是當音訊仍在傳入時你會呼叫的模型——它透過 WebSocket 串流,大約每 500 毫秒發出一次中間結果,並以最終轉錄稿 2.7% 的字詞錯誤率和首次部分結果 3.4% 的成績,在 Artificial Analysis 的 AA-WER Streaming 排行榜上位居榜首。MAI-Transcribe-2,由 Microsoft AI 於 2026 年 9 月 3 日發布,是當音訊已經是檔案時你會呼叫的模型——它僅支援批次處理,而在 Artificial Analysis 的非串流排行榜上,它是測得 2.04% AA-WER 的最準確託管模型,領先 Grok Voice Transcribe 2.0 的 2.29%,且吞吐量約快 2 倍。兩者的定價都是每音訊小時 $0.10,也就是每 1,000 分鐘約 $1.67。如果你的需求是即時,那就沒什麼好比較的。如果你的需求是檔案,那就有。

那條兩家供應商都不會替你劃出的界線

串流支援不是可切換的功能開關。Grok Voice Transcribe 2.0 以同一套模型,透過 REST 為錄音檔案提供服務,並透過 `wss://api.x.ai/v1/stt`為即時音訊提供服務,因此你在封存檔案上測得的準確度,就是你在即時通話中獲得的準確度。MAI-Transcribe-2 完全沒有串流 SKU:Microsoft 的發布資料明確將它定位於長篇與批次音訊,而儘管模型卡在其應用情境中列出了即時字幕,通往該目標的路徑是把音訊分段,再將每個區段送進批次 API——這是一套你得自行建置與運作的流程,而不是你花錢就能買到的延遲保證。Microsoft 所宣稱約 411 倍即時速度的吞吐量,是處理速度的數字,而非回應時間的數字,而兩者在關於此次發布的報導中經常被混為一談。

實務上的結果:如果你正在打造輪流發言的語音代理、即時字幕,或任何需要人類或模型對進行中的語音做出反應的應用,那麼無論 MAI-Transcribe-2 的準確率有多高,它都不是候選方案。如果你是在事後轉錄會議、隔夜處理聯絡中心錄音、媒體檔案庫,或合規積壓作業,串流就是累贅,批次處理的數字才是全部關鍵。

MAI-Transcribe-2 真正領先之處

先談檔案準確度。2.04% 與 2.29% 的差距,是在同一套獨立測試框架上測得的——Artificial Analysis 的 AA-WER v2,其中 50% 為 AA-AgentTalk,VoxPopuli 與 Earnings22 各占 25%——這使它成為這項比較中最乾淨明確的事實。這是 0.25 個百分點的差異,大約相當於每一千字少兩個半錯誤。這是否有影響,取決於你怎麼使用這份逐字稿;對可搜尋的檔案庫來說沒差,但對法律或醫療紀錄來說可能就有差。

其次是吞吐量,而且領先幅度還大於準確度的差距:333× 即時速度,對上 Grok Voice Transcribe 2.0 的 162×。這兩個數字都是 Artificial Analysis 的測量值,衡量每秒可轉錄的輸入音訊秒數,而非廠商宣稱的數據。以這樣的速度,一千小時的存檔在 Microsoft 模型上約需三小時運算時間完成,在 SpaceXAI 模型上則約需六小時。對於一次性的遷移來說,這無關緊要;但對於持續匯入的管線而言,實際耗時減半是實實在在的容量差異。

語言涵蓋範圍,第三。Microsoft 明確列出 60 種語言,支援自動偵測、在單一錄音內進行語碼轉換,並且這些語言在 FLEURS 上的平均詞錯誤率為 5.2%——這是廠商自行回報的數字,未經獨立重現,但至少它描述了一份明列語言清單下的多語言情況。SpaceXAI 記載了數十種語言,支援錄音中途切換,並涵蓋 25 種語言的書面形式格式化。如果你的音訊不屬於涵蓋完善的英語與主要歐洲語言範圍,FLEURS 的數字會比一個偏重英語且客服對話比重偏高的排行榜更具參考價值。

還有兩項在營運層面上至關重要的差異。MAI-Transcribe-2 提供可設定的轉錄風格——逐字稿(保留不流暢的語句)與乾淨稿(將其去除)——而 Grok Voice Transcribe 2.0 則以一個移除填充詞的旗標來處理同樣的問題。此外,微軟的模型在 Microsoft Foundry 上處於公開預覽階段,這意味著沒有 SLA,且在正式推出(GA)前,官方持續建議不要用於正式環境;SpaceXAI 的模型則已正式推出,並公布速率限制為每秒 10 次請求,以及每個團隊 100 個並行串流工作階段。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

Grok Voice Transcribe 2.0 真正領先之處

• 即時串流 — 具備 WebSocket 端點,每約 500 毫秒提供一次中間結果,相較之下僅支援批次處理,且未公布任何即時 SKU

• 首次部分轉錄準確度 — 在 AA-WER Streaming 上,以 0.49 秒達到 3.4% WER,而這是 MAI-Transcribe-2 並未參與競爭的類別

• 代理對話音訊上的批次準確率——整體為 2.29%,但在非串流排行榜的 AA-AgentTalk 子集上,排名順序比標題所暗示的更緊湊,而在串流排行榜以代理為主的組合中,Grok 更是明顯領先

• 語音代理底層機制 — Smart Turn 的發言結束偵測與贅詞移除隨模型一同提供,而 MAI-Transcribe-2 則將發言輪替邏輯留給呼叫方處理

• 多聲道音訊——一次處理即可轉錄多達 8 個獨立聲道,這對立體聲或多路通話錄音很重要

• 詞層級信心度 — 時間戳會為每個詞附帶一組信心分數,因此低信心度的區段可被標記出來,而不是被一視同仁地信任

• 可用性條款 — 正式推出,並提供已公佈的並行處理限制;相較之下,公開預覽版沒有 SLA

• 價格持久性——每小時 $0.10 是批次處理的固定費率,也是 $0.20 串流方案的基礎費率;而微軟相同的 $0.10 則是限時推出優惠,且尚未公布 2027 年的標準費率

最後一點是大多數比較都會略過的重點。這兩個模型今天的價格相同,但其中一個價格有到期日,另一個則沒有。微軟並未公布促銷結束後的費率,而各方報導對於這項優惠是持續到 2026 年底,還是根本沒有明訂結束時間,說法並不一致。如果你是用微軟每 1,000 分鐘 1.67 美元來推算三年的轉錄預算,那麼你推算的是一個廠商尚未承諾的數字。

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

重疊確實存在,而且它占了功能清單的大部分。

先把串流問題擱在一旁,這兩款產品便高度趨同。兩者都具備說話者分段功能。兩者都回傳詞級時間戳記。兩者都能處理反向文字正規化——將數字、日期、貨幣、聯絡資訊以書寫形式呈現。兩者都接受領域術語:Grok Voice Transcribe 2.0 每次請求最多可提供 100 個關鍵術語,而 MAI-Transcribe-2 則是接受領域術語與縮寫清單。兩者都能自動偵測語言,並跟上說話者在錄音中途切換語言。兩者都能處理 8 kHz 電話音訊,這正是大多數轉錄模型悄悄失手的情況,也是 SpaceXAI 著力調校最深的一環——其內部電話資料集在版本之間從 10.6% WER 降至 7.1% WER,這是該公司在其自家音訊上回報的數字。

兩者也都帶有輸入限制,而這些限制形塑的是架構,不只是預算。Grok Voice Transcribe 2.0 接受最高 500 MB 的檔案,涵蓋 12 種音訊格式,取樣率從 8 kHz 到 48 kHz。MAI-Transcribe-2 的限制是由 Foundry 路徑而非模型本身所決定,團隊應查閱 Microsoft 自家的文件以了解目前的上限,而不是假設它與專用的 STT 服務具有同等規格。

這種趨同意味著,決策依序歸結為三個問題:它是否需要即時處理、你實際上擁有多少種語言,以及準確度差距讓你付出多少代價。第一個問題是二選一,且會直接排除掉一個選項。第二個問題通常可以從你自己音訊的樣本得到答案。第三個問題小到對大多數以檔案為基礎的工作負載而言不會決定任何事——0.25 個百分點的差距是真實的,但這兩個模型都落在任何人測得的最佳數字半個百分點之內,同樣也是事實。

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

這該怎麼處理?

把它們當成雙軌並行的架構,而不是正面對決。一個同時執行即時客服輔助與隔夜合規存檔的聯絡中心,並不是在 Grok Voice Transcribe 2.0 與 MAI-Transcribe-2 之間做選擇——它是兩者都用,唯一的問題是這會不會讓它付出兩段供應商關係、兩套憑證、兩張帳單和兩組速率限制的代價。今天這兩個模型都不在 OrcaRouter 的產品目錄中,所以轉錄請求本身會送到各家廠商自己的 API。一把 OrcaRouter 金鑰能涵蓋的,是所有下游的部分:摘要器、分類器、對逐字稿進行推理的代理,以及在同一段錄音上比較兩家廠商輸出的評估任務。最後那一項才是關鍵——你無法靠排行榜在這兩個模型之間做決定,因為那個排行榜是八小時的英語客服通話,而你的音訊不是。

關注兩件事。第一,Microsoft 在上市優惠結束後,是否會為 MAI-Transcribe-2 訂出標準價格;若永久定在每 1,000 分鐘 1.67 美元,光憑成本就足以讓它成為批次處理的預設首選,而若回歸到 MAI-Transcribe-1 每小時 0.36 美元的水準,這場討論就會短得多。第二,Microsoft 是否會推出串流 SKU。模型卡上已把即時字幕列為目標情境,而 MAI-Transcribe-2 與串流這條路線之間唯一還缺的,就是一個端點——一旦到位,這兩者就不再只是不同的路線,而是開始正面交鋒的對手。