文章主視覺卡片,標題為「Grok Voice Transcribe 2.0 vs GPT Transcribe」,標籤為「模型比較」,副標題為「相同的串流價格,不同的準確度」,標籤顯示 2.7% vs 3.9% 串流 WER、3.4% vs 6.3% 首次部分結果、每 1,000 分鐘 $1.67 vs $4.50,以及 162x vs 41x 即時速度,背景為白到藍的漸層,OrcaRouter 標誌位於右下角。
Guides & Insights

Grok Voice Transcribe 2.0 對決 GPT Transcribe:相同的串流價格,不同的準確度

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這個巧合幾乎過於精巧。在 Artificial Analysis 的 AA-WER Streaming 排行榜上,Grok Voice Transcribe 2.0 與 GPT Live Transcribe——也就是串流轉錄端點——標價皆正好是每 1,000 分鐘音訊 $3.33。SpaceXAI 的 Grok Voice Transcribe 2.0 於 2026 年 9 月 18 日發布,在語音結束後 0.49 秒以 2.7% 詞錯誤率回傳最終轉錄稿,首次部分轉錄則為 3.4%。GPT Live Transcribe 於 2026 年 7 月 28 日與 GPT Transcribe 一同推出,其最終轉錄稿為 3.9%,首次部分轉錄為 6.3%。價格相同,而最終轉錄稿準確率約有 1.2 個百分點、部分轉錄稿準確率約 2.9 個百分點的優勢落在 SpaceXAI 一方。同一組對決的批次處理方面則完全不是巧合:GPT Transcribe 每 1,000 分鐘收費 $4.50,而 Grok Voice Transcribe 2.0 為 $1.67,在錄音檔案路徑上有 63% 的差距。

關於轉錄如何變得更好的兩種不同押注

OpenAI 對準確度的解答在於上下文。GPT Transcribe 與 GPT Live Transcribe 都接受自由格式提示、關鍵詞清單和預期語言清單,而在 Realtime 工作階段中,較早轉錄的輪次會回饋成為後續輪次的上下文。在 OpenAI 自家的 Context Aware ASR 基準測試中,這種條件化設定讓 GPT Live Transcribe 的語意準確率從 38.5% 提升到 44.6%——這是廠商自行報告的數字,而且它衡量的是意義是否保留下來,而非用詞是否正確。OpenAI 提出的取捨很明確:向模型提供它即將聽到的內容資訊,它就能比原始準確度相同的通用模型更好地轉錄你的領域內容。

SpaceXAI 的答案就是模型本身。Grok Voice Transcribe 2.0 確實有偏置機制——每次請求最多 100 個關鍵詞,每個最多 50 個字元——但那是詞彙表,不是提示詞。你可以告訴它「OrcaRouter」和「Kubernetes」是真實存在的詞;但你無法給它一段文字,說明這是一通關於退款的客服電話。2.0 的準確度提升其實來自重新訓練:在 SpaceXAI 自家取自正式環境的評估集上,詞錯誤率在對話音訊上從 8.7% 降至 3.3%,在 8 kHz 電話語音上從 10.6% 降至 7.1%,在口述憑證上從 7.2% 降至 3.2%,在 19 種語言的短指令上從 20.6% 降至 6.8%。這些是該公司在其自家音訊上得出的數字,外界無人重現過,而且它們描述的是一個在聲學問題上變得更好的模型,而不是一個更擅長被預先告知該預期什麼的模型。

實際差異會在工作的第二個小時浮現。一個以情境為條件的模型,表現可能遠比其原始基準測試所顯示的還要好得多,因為詞彙和領域是你提供的。它也可能會對你提供的關鍵詞產生幻覺:把「OrcaRouter」放進提示詞裡,一個無法清楚聽見這個詞的模型還是可能照樣產出它。以關鍵詞為偏好的模型退化得較為平緩,因為偏置改變的是某個詞的機率,而不是斷言它確實存在。這兩種失效模式都不會出現在排行榜上,而兩者都會出現在你的日誌裡。

數字,並排

• 最終轉錄準確率(串流)——在 AA-WER Streaming 上,Grok Voice Transcribe 2.0 的 WER 為 2.7%,GPT Live Transcribe 則為 3.9%;兩項數據均出自 Artificial Analysis

• 首次部分準確率(串流)—— 3.4% 對 6.3%,是比較中最大的差距,也是決定語音代理行為的關鍵一項

• 最終轉錄時間——語音結束後 0.49 秒對比 0.81 秒,因此更準確的模型也是更快給出最終結果的模型

• 首個部分輸出時間 — 0.49 秒對 0.26 秒,這是 OpenAI 唯一徹底勝出的延遲欄位

• 串流價格 — 兩者皆為每 1,000 分鐘 $3.33,由 Artificial Analysis 根據 Grok 的每小時 $0.20 與 OpenAI 的每分鐘 $0.017 標準化換算

• 批次準確率(非串流)— Grok Voice Transcribe 2.0 為 2.3% AA-WER,對比 GPT Transcribe 的 3.31%

• 批次價格 — 每 1,000 分鐘 $1.67 對比每 1,000 分鐘 $4.50,每小時 $0.10 起,對比每分鐘 $0.0045

• 批次處理吞吐量 — 約為即時速度的 162 倍,而同一塊板子上約為 41 倍

把那份清單讀成兩欄,而不是一個總體評斷。OpenAI 在首個部分結果延遲上以明顯幅度勝出,並提供 Grok 所沒有的上下文機制。SpaceXAI 則在兩種模式下的最終準確度、串流中的部分準確度、吞吐量,以及批次價格上,以大幅差距勝出。沒有任何一欄是 GPT Live Transcribe 既比 Grok Voice Transcribe 2.0 更快又更準確;只有一欄是它更快,而那就是最早的那一欄。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

你實際上是在哪個批次路徑上?

1.67 美元對 4.50 美元的差距,是這裡最不含糊的數字,也值得精確說明它為何存在。OpenAI 在推出 GPT Transcribe、從 GPT-4o Transcribe 時代轉換時,將這條產品線降價 25%,結果就是每分鐘 0.0045 美元。SpaceXAI 在從 1.0 版推進到 2.0 版時,批次費率維持在每小時 0.10 美元不動——它改進了模型,收費卻相同,這是更難做到的事,也是更能反映市場走向的訊號。微軟的 MAI-Transcribe-2 則以限時優惠的形式落在完全相同的每小時 0.10 美元,因此每 1,000 分鐘 1.67 美元這個價位,已成為前沿實驗室在批次轉錄上的地板價,而非單一供應商的促銷數字。

以每月一萬小時的音訊來說,那個差距大約是 $2,830 對比 $450。對 Podcast 存檔、通話錄音積壓,或正在進行回溯轉錄的媒體庫而言,價格差異遠超過 2.3% 與 3.31% WER 之間的任何準確度差異。對串流代理來說,這兩款產品成本相同,剩下的爭論點就只有準確度和延遲。

這些費率背後有一個值得點明的結構性差異:{{1}}Grok Voice Transcribe 2.0{{/1}} 以每音訊小時的固定費率計費,{{2}}GPT Live Transcribe{{/2}} 按分鐘計費,但 {{3}}Gemini 3.5 Transcribe Live{{/3}} 則無論音訊輸入或文字輸出都按 token 計費。這三者中,只有一種會讓你的帳單取決於模型選擇要說出什麼。如果你的用量大到讓預測變得重要,固定費率更容易向簽核帳單的人交代——而且因為 {{4}}OrcaRouter{{/4}} 以 0% 加成直接轉嫁供應商定價,像 {{5}}OpenAI{{/5}} 的 25% 這類供應商端降價,會在宣布當天就在我們這邊生效,而不是等到下一次續約。

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

兩個模型都不是什麼

GPT Transcribe 與 GPT Live Transcribe 是兩個產品,不是一個產品附帶切換開關。批次模型處理已完成的檔案、串流檔案轉錄,以及 Realtime 工作階段中已提交的輪次,並且根據 OpenAI 自己公布的數字,處理音訊的速度約比即時快 34 倍——Artificial Analysis 在其測試框架上測得 41 倍。串流模型是兩者中較昂貴的,每分鐘 $0.017,也是在部分結果上錯誤率高 10 倍的那一個。選擇 OpenAI 就意味著要選擇你面對的是這兩個問題中的哪一個,因為較便宜的端點無法勝任另一個的工作。

Grok Voice Transcribe 2.0 是單一模型、兩種傳輸方式:同一組權重透過 REST 提供 /v1/stt 服務,處理最大 500 MB 的檔案,並透過 WebSocket 提供 wss://api.x.ai/v1/stt 服務,用於即時音訊,中間結果大約每 500 毫秒輸出一次。串流費率正好是批次費率的兩倍,而非另外打造的產品,這意味著你在封存音訊上測得的準確度,就是你在即時情境中應該預期的準確度。這也意味著沒有第二個模型需要評估——同一組提示、同一組關鍵詞、同一組期望。

功能涵蓋範圍已相當接近,但並非完全相同。兩者都會回傳字詞層級的時間戳記;Grok Voice Transcribe 2.0 會為每個字詞附加信心分數,讓你可以對低信心的片段設定門檻,而不是一視同仁地信任整份逐字稿。兩者都具備語者分離功能,而 Grok 的版本不額外收費即包含此功能。兩者都能處理數字、日期、貨幣與聯絡資訊的反向文字正規化。Grok Voice Transcribe 2.0 額外支援最多 8 個獨立聲道的多聲道轉錄、語助詞移除,以及 Smart Turn 的語句結束偵測;GPT Transcribe 的獨特之處則在於提示層級的上下文調節,以及在 Realtime 端自動延續先前的對話輪次。OpenAI 並未公布這兩款模型各自支援的語言數量;Grok Voice Transcribe 2.0 則記錄了數十種語言,支援錄音中途切換語言,並涵蓋 25 種語言的書面體格式。

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

如何決定,以及如何測試它

如果你正在打造一個語音代理,必須在來電者講完之前就回應,那麼部分轉錄稿欄位就是你的決策變數,而它乾淨地把這兩個模型一分為二:Grok Voice Transcribe 2.0 在部分轉錄稿上的準確率高出 2.9 個百分點,但產出它們的速度慢了 0.23 秒。如果一份錯誤的部分轉錄稿比一份遲來的更糟——例如路由、升級、合規觸發的回應——就選 SpaceXAI。如果一份遲來的部分轉錄稿比一份錯誤的更糟,而且你有領域詞彙可以餵給脈絡機制,讓準確率差距縮小,就選 OpenAI。接著兩個都要測,因為無論哪家供應商在八小時英語客服通話上的部分轉錄稿行為,都無法預測它們在你的口音、你的編解碼器和你的行話上會有何表現。

如果你是在轉錄檔案,決定就簡單得多:每 1,000 分鐘 $1.67 對上 $4.50,WER 2.3% 對上 3.31%,兩者都指向同一個方向。要繼續在批次工作上使用 GPT Transcribe,唯一的理由是脈絡調節機制對你的音訊有幫助,而這是原始準確度差距所無法抵銷的——這在高度領域特定的錄音上確實有可能,而且是可以驗證的。

目前兩款轉錄模型都不在 OrcaRouter 的目錄中,因此這些呼叫本身會直接送往供應商自家的 API。真正位於單一 OrcaRouter 金鑰背後的,是轉錄內容所餵入的一切:代理模型、摘要器、分類器,以及決定如何處理這些文字的程式碼。第二份合約通常就是在此出現——語音用一家供應商,對其進行推理的模型用另一家——而這並非必然如此。一把金鑰橫跨 200 多款模型、供應商效能下降時自動容錯移轉,以及當你想讓一個請求經過多個模型並在確定前進行比較時可用的路由 DSL。這比「我們替你路由你的轉錄」是更小的宣稱,而它是真的。

值得關注的是,OpenAI 是否會在準確度上做出回應,而非訴諸上下文。該公司如今已在一年內推出兩代轉錄產品,並降價一次;上下文機制確實具有差異化優勢,但在衡量原始轉錄效能的排行榜上,它目前落後於 SpaceXAI 和 Microsoft。若 GPT Transcribe 2 問世時上下文機制完好無損,且錯誤率降至 2% 左右,那麼在批次處理方面,這項比較將在一夜之間翻轉——而串流價格既然已經相同,這就成了一場值得關注的競賽。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新