文章主視覺卡片寫著「Grok Voice Transcribe 2.0」,帶有「NEWS」徽章與副標題「串流準確度排名第一,價格維持不變」,並有標籤寫著最終轉錄稿 WER 2.7%、首次部分結果 3.4%、語音結束後 0.49 秒,以及每串流小時 $0.20,置於白到藍的漸層上,右下角有 OrcaRouter 標誌。
Engineering & Research

Grok Voice Transcribe 2.0 以不變的價格奪下第一名串流準確度寶座

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Grok Voice Transcribe 2.0 是 SpaceXAI 於 2026 年 9 月 18 日推出的語音轉文字模型,而關於它真正重要的那個數字,並不是發表貼文一開頭主打的那個。而是這個:第一個部分轉錄結果——也就是來電者還在被搶話時,語音代理實際能據以採取行動的文字——其詞錯誤率從 Grok Voice Transcribe 1.0 的 18.3%,降到 3.4%。這是 Artificial Analysis 的 AA-WER Streaming 排行榜上的測量結果;在這份榜單上,新模型目前在最終轉錄結果排名(2.7% WER,語音結束後 0.49 秒)與首次部分轉錄結果排名(3.4%,0.49 秒)都位居第一。最終轉錄準確率也有所提升,從 3.9% 到 2.7%,這是實質但幅度不大的進步。部分轉錄的躍升,才是會改變你能打造什麼的關鍵。

1.0 與 2.0 之間實際上改變了什麼?

這兩個版本是同一個 API 中的同一款產品,而 SpaceXAI 並未對介面做出任何變更:Grok Voice Transcribe 2.0 的選用方式,是傳入grok-voice-transcribe-2.0/v1/stt,而非grok-voice-transcribe-1.0,或是在建立用於串流的 WebSocket 連線時選擇它。既有的整合若省略 model 參數,會持續取得 1.0,直到 SpaceXAI 切換預設值為止;該公司表示這會在接下來幾週內發生,並同時淘汰舊版本。在那之前,2.0 屬於選用(opt-in),而 1.0 則可刻意鎖定,這正是這類變更應有的形態:無論你是否主動要求,你都能先在自己的音訊上做 A/B 測試,再讓它成為你的正式環境預設值。

Artificial Analysis 的數字並排來看,說出的故事比「準確度是兩倍」更具體:

• 最終轉錄準確度 — Grok Voice Transcribe 2.0 的 WER 為 2.7%,對比 Grok Voice Transcribe 1.0 在 AA-WER Streaming 上的 3.9%,兩者皆於語音結束後測量

• 首次部分轉錄準確度 — 3.4% WER 對比 18.3%,是兩個版本之間最大的單一差距

• 產出最終逐字稿的時間 — 0.49 秒對 0.37 秒,因此新模型比它所取代的模型更慢才定稿

• 首個部分結果時間 — 0.49 秒 vs 0.25 秒,同樣較慢

• 批次(非串流)準確度 — 在 Artificial Analysis 的非串流排行榜上,AA-WER 為 2.3%,相較之下 Whisper Large v3 為 4.07%,GPT Transcribe 為 3.31%

• 批次吞吐量 — 在同一塊板卡上約為即時速度的 162×,落後於 MAI-Transcribe-2 的 333×,領先 Gemini 3.5 Transcribe 的 88×

那第四行與第五行是這次發布中最誠實的但書。SpaceXAI 用延遲換來了準確度。新模型回傳第一個部分結果與最終轉錄稿的速度,比 1.0 慢了約三分之一秒。在一個 Deepgram Flux 能在 0.02 秒內回傳部分結果、Soniox v5 能在 0.05 秒內回傳的排行榜上,Grok Voice Transcribe 2.0 根本不是在比速度——它比的是正確性,而且在這個取捨上大幅勝出。這個取捨是否正確,完全取決於你的應用程式是需要開始回話的即時語音代理,還是半秒鐘根本看不出來的轉錄流程。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

「準確度是兩倍」的說法,經查證

SpaceXAI 的頭條宣傳是:2.0 在相同價格下,準確度是 1.0 的兩倍,而它自家的評估表也在其選定的資料集上支持這一點。在 8 kHz 英語客戶支援通話上,詞錯誤率從 10.6% 降至 7.1%。在與 Grok 的對話中,從 8.7% 降至 3.3%。在口說憑證——帳號代碼、電話號碼、電子郵件地址——上,從 7.2% 降至 3.2%。在涵蓋 19 種語言的短指令上,從 20.6% 降至 6.8%,錯誤大約減少了三分之二。這四個資料集取自 SpaceXAI 的生產流量,且這些比較是 SpaceXAI 自己做的;公司外部沒有人重現過這些結果。把這張表視為模型被調校之處的地圖,而不是一般準確度的保證。

Artificial Analysis 的結果正是非廠商自行報告的那部分:一套獨立測試框架針對約八小時的音訊運行,其中 50% 權重分配給私有的 AA-AgentTalk 資料集,VoxPopuli 與 Earnings22 則各佔 25%。它支持的主張比「準確度是兩倍」更狹隘、也更實用——在那個特定的混合資料集上,這個模型是實測最準確的串流轉錄器。有個值得點名的小問題:SpaceXAI 的貼文描述為「在 32 個串流模型中」排名第一,而排行榜頁面本身只繪製了 33 個模型中的 27 個。排名是真的;行銷文案中的模型總數是該公司自己算的,不是排行榜的數字。

同樣值得精確說明的是,AA-WER Streaming 的第一名究竟涵蓋了什麼、又不涵蓋什麼。這個排行榜以英語加權,且客服對話佔比很高。它不評估你的口音、你的編解碼器、你的領域詞彙,也不評估你的八聲道客服中心音訊。一個能在該榜奪冠的模型,仍可能在你的錄音上慘敗,而這正是選擇加入的時間窗口之所以重要的原因。

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

定價維持不變,而這是這裡第二重大的事實

Grok Voice Transcribe 2.0 的費用與 1.0 相同:透過 REST 端點處理批次與錄製檔案每音訊小時 $0.10,透過 WebSocket 串流每音訊小時 $0.20。在 Artificial Analysis 的價格看板上,串流 SKU 為每 1,000 分鐘 $3.33,批次 SKU 為 $1.67——與 Microsoft 對 MAI-Transcribe-2 收取的批次費率相同,且大約是 ElevenLabs Scribe v2 Realtime 每串流分鐘費用的三分之一。

說話者分離、附帶信心分數的詞級時間戳記,以及關鍵詞偏重,全都包含在那個費率內,而非另行計量計費,這在市場上並非普遍做法。Gemini 3.5 Transcribe Live 對音訊輸入與文字輸出都按 token 計費,因此你的成本會隨模型說出多少內容而變動,而不只是取決於音訊持續多久。每小時固定費率更容易預測,也更容易在各供應商之間比較——而且由於 OrcaRouter 以 0% 加價轉嫁供應商的定價表價格,供應商若調整該費率,會在當天就反映在我們這邊,而不是等到一個重新定價週期之後。

API 實際上提供給你的內容

能力清單很廣泛,而且大多是承襲而來,而非全新功能;如果你只依據功能來評估這次升級,這點值得留意:

• 單一模型同時支援批次與串流 —— 錄製檔案最高 500 MB 使用 REST,WebSocket 位於 wss://api.x.ai/v1/stt,約每 500 毫秒輸出一次中間結果

• 包含講者分離功能,以及最多 8 個獨立聲道的多聲道轉錄

詞彙層級的時間戳記附帶信心分數,讓你能為低信賴度的片段設定閾值,而不是一視同仁地信任整份轉錄稿

• 每次請求最多可設定 100 個領域詞彙的關鍵詞偏置,每個詞彙最多 50 個字元

• 數字、日期、貨幣、電話號碼和電子郵件地址的反向文字正規化,並支援 25 種語言的書寫形式格式

• 填充詞移除與 Smart Turn 的話輪結束偵測,明確針對語音代理

• 自動語言偵測,可在單次錄音過程中切換語言,涵蓋 12 種音訊格式,以及 8 kHz 至 48 kHz 的取樣率

• REST 與串流服務的上限均為每秒 10 個請求,每個團隊可有 100 個並行串流工作階段,託管於 us-east-1

有一項未列在功能清單上的正式環境備註:該服務僅在單一區域運行。如果你的音訊來源位於美國境外,網路傳輸路段現在已納入你的延遲預算,而 AA-WER Streaming 明確將網路延遲計入其計時。SpaceXAI 提供零資料保留條款,並援引 SOC 2 Type II、BAAs 與歐盟資料駐留選項,因此其合規方面的說法比地理方面的說法更為完善。

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

誰應該行動,以及該注意什麼

如果你已經在使用 Grok Voice Transcribe 1.0,而你的應用程式會根據部分轉錄結果來運作——例如對話輪次偵測、插話、即時專員回應——那麼部分轉錄準確率從 18.3% 到 3.4% 的差距已經大到讓測試 2.0 不再是選項。那個數字從「通常錯誤」變成「通常正確」,就是你能用來路由的部分轉錄,與只能拿來顯示的部分轉錄之間的差別。如果你的應用程式在處理錄音檔時會等待最終轉錄結果,那麼這項改進雖然真實,但幅度較小,而隨之增加的 0.12 秒提交延遲就是它的代價。

如果你完全使用其他供應商,關注這個版本的原因並不是排行榜排名,而是某間前沿實驗室剛大幅改進了它的轉錄模型,卻沒有調漲價格——這正是當準確度不再是收費賣點時,市場會呈現的樣子。升級途徑也是最便宜的一種:一個參數、無需修改程式碼、無需新合約,而且如果出錯,還有可用的釘選版本。

接下來要留意的是預設版本的翻轉。當 SpaceXAI 讓 2.0 成為預設版本,並開始淘汰 1.0 時,所有從未傳入模型參數的整合都會立刻轉移到新模型上,延遲的變化也包含在內。依賴舊有 0.25 秒部分結果時序的團隊,現在就應該鎖定版本,而不是等到在正式環境中才發現這項變化。第二個要留意的是獨立重現:Artificial Analysis 的紀錄是一項真實測量,但它只是在單一音訊混音上的單一測試板,而且目前還沒有第三方發表在正式音訊上、條件對等的 1.0 對比 2.0 測試結果。