
Grok Voice Transcribe 2.0 對決 Gemini 3.5 Transcribe:串流這條賽道只屬於其中一方
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 與 Gemini 3.5 Transcribe 是來自相互競爭實驗室的兩款最新前沿語音轉文字模型,而誠實比較它們的方式,就是先坦承它們並非為同一份工作而打造。SpaceXAI 的 Grok Voice Transcribe 2.0 於 2026 年 9 月 18 日發布,是一款以串流優先、附帶批次模式的模型:它在 AA-WER 串流排行榜上居冠,最終轉錄稿的詞錯誤率為 2.7%,首次部分結果為 3.4%,兩者皆在語音結束後 0.49 秒送達。Gemini 3.5 Transcribe 於 2026 年 8 月 26 日發布,則是一款以批次優先、附帶串流 SKU 的模型,而它的這兩半表現截然不同——預錄路徑在 Artificial Analysis 的非串流排行榜上測得 2.6% AA-WER,而另外的 gemini-3.5-transcribe-live端點則在串流排行榜上以 0.40 秒測得 4.0%。把這四個數字並排放在一起,這場對決的輪廓就顯而易見:在 Gemini 3.5 Transcribe 表現強勁之處,兩者差距不大;而在 Grok Voice Transcribe 2.0 佔優之處,兩者則相去甚遠。
他們唯一共同作戰的路線
兩款模型都能轉錄即時音訊,因此串流是唯一一個直接比較具有意義的領域。在那裡,Grok Voice Transcribe 2.0 在最終轉錄稿準確率上領先 Gemini 3.5 Transcribe Live 1.3 個百分點——在相同的測試框架、同樣約八小時的音訊,以及同樣在 AA-AgentTalk、VoxPopuli 和 Earnings22 之間 50/25/25 的加權下,WER 分別為 2.7% 與 4.0%。那不是四捨五入的差異;在這樣的錯誤率下,這相當於 Google 模型每轉錄七十五個字,就多出大約一個錯字。在首次部分轉錄稿上,差距更大,分別是 3.4% 對 5.8%;而部分轉錄稿正是即時語音代理在說話者還沒講完之前就必須據以行動的轉錄內容。
延遲的影響方向相反,而這正是比較中最常被忽略的部分。Gemini 3.5 Transcribe Live 在語音結束後 0.40 秒回傳最終轉錄稿,Grok 則為 0.49 秒;它的第一個部分結果在 0.25 秒出現,Grok 為 0.49 秒——取得第一個可用詞的速度大約快了一倍。這兩個模型都無法與這領域中真正快速的一端競爭,其中 Deepgram Flux 為 0.02 秒,Soniox v5 為 0.05 秒;但在這兩者之間,取捨非常明確:Google 更快開口,SpaceXAI 則更可能在開口時說對。對於必須避免打斷來電者的輪替對話代理而言,多出 0.24 秒的部分結果延遲是真實的成本,準確度的提升必須值得這個代價。

Gemini 3.5 Transcribe 真正勝出的地方
語言涵蓋範圍是最明確的一項,而且差距懸殊。Google 的模型支援 85 種以上語言;Grok Voice Transcribe 2.0 則支援數十種,並具備書寫形式格式化功能——也就是反向文字正規化,把口語中的數字、日期、貨幣和電子郵件地址轉換成書寫形式——且已有橫跨 25 種語言的相關文件記載。如果你的音訊是葡萄牙語、越南語,或是在同一個句子裡混用兩種語言的語碼轉換,那麼「哪個模型在 Artificial Analysis 排行榜上更準確」這個問題基本上只是學術探討,因為該排行榜偏重英語,且充斥大量代理(agent)對話。Google 在其自家的多語言測試套件中,回報 FLEURS 上的串流 WER 為 5.50%、非串流 WER 為 5.04%;這些數字是廠商自行提報,並未經獨立重現,但至少確實談到了多語言的情況。
第二項優勢是免費方案。Gemini 3.5 Transcribe 在 Google 的 API 上提供免費的輸入與輸出權杖,但附帶一項條件:免費方案的內容會用於改良 Google 產品,付費方案的內容則不會。對於原型、副業專案,或處理你不會另外付費轉錄的音訊的內部工具而言,這是按小時計費的供應商無法比擬的實際選項。Grok Voice Transcribe 2.0 從第一小時音訊開始就要付費。
第三點是,Gemini 3.5 Transcribe 是一款具備轉錄模式的通用多模態模型,而非專門打造的 ASR 服務。它可以接受提示詞,可以將文字作為上下文,而且它與 Google 推出的其他一切產品共用同一套 API 介面。如果轉錄只是整條流程中的一個環節,而該流程還需要對轉錄內容進行推理,那麼將兩者保留在同一次模型呼叫中,其價值是逐字錯誤率所無法體現的。
價格計算,以每千分鐘計
Artificial Analysis 將兩個模型都標準化為每 1,000 分鐘音訊的成本,這是唯一能將固定每小時費率與 token 計費進行比較的方式:
• 批次、預錄 — Grok Voice Transcribe 2.0 每 1,000 分鐘 $1.67(每小時 $0.10),相較於 Gemini 3.5 Transcribe 每 1,000 分鐘 $5.00(每小時 $0.30,每 100 萬輸入 token $2.00 與每 100 萬輸出 token $12.00 起)
• 串流 — Grok Voice Transcribe 2.0 每 1,000 分鐘 3.33 美元(每小時 0.20 美元),而 Gemini 3.5 Transcribe Live 每 1,000 分鐘約 5.40 美元,此價格由每 1M 音訊輸入 token 3.50 美元與每 1M 文字輸出 token 21.00 美元混合而成
• 批次處理輸送量 — Grok Voice Transcribe 2.0 約達 162 倍實時速度,而 Gemini 3.5 Transcribe 在同一測試平台上約為 88 倍,因此較便宜的模型在檔案處理上也更快
• 即時工作階段上限 — Grok Voice Transcribe 2.0 透過 WebSocket 串流,除了每個團隊 100 個並行工作階段外,並未公布其他工作階段上限;相較之下,Gemini 3.5 Transcribe Live 每個工作階段上限為 10 分鐘
最後那一行是營運上的細節,而它比準確率數字更能決定架構的走向。即時工作階段設有 10 分鐘的上限,這意味著長時間的通話、長時間的會議和長時間的串流都必須被切斷並重新建立,而每一次重新建立都是一道接縫,上下文就在那裡流失。Grok 的串流端點在批次路徑上帶有 500 MB 的檔案大小上限,在串流路徑上則有每團隊 100 個工作階段的併發限制,這是另一種性質的約束——限制的是吞吐量,而非持續時間。
在決定投入 Google 陣營之前,值得先了解代幣計費方式,因為它讓你的帳單變成兩個變數的函數,而不是一個。Gemini 分別針對音訊輸入與文字輸出計費,因此一個會產生冗長格式或不斷重複的模型,會比不會這樣的模型花費更多;而詞彙較長的语言,成本也會高於詞彙較短的语言。Grok 的每小時固定費率不會因這些因素而有任何變動。對於高流量的工作負載而言,固定費率更容易預測,而且由於 OrcaRouter 以 0% 加成直接傳遞供應商的定價,任一供應商端的變動會在發生的當天就反映到你的帳單上,而不是等到下一次合約續約。

功能樣貌:每一個拒絕做什麼
能力清單的差異比準確率數字所暗示的更大,而缺口正位於對特定應用至關重要的地方:
• 說話者分段 — 已包含於 Grok Voice Transcribe 2.0,無需額外費用;Gemini 3.5 Transcribe Live 不支援,因此該端點完全無法提供標註說話者的即時逐字稿
• 字詞層級時間戳記 — Grok Voice Transcribe 2.0 會回傳這些時間戳記,並附上每個字詞的信心分數;Gemini 3.5 Transcribe Live 則完全不回傳,這排除了信心分數閾值篩選與精確字幕對齊的可能性
• 多聲道音訊 — Grok Voice Transcribe 2.0 可一次轉錄最多 8 個獨立聲道;Gemini 3.5 Transcribe Live 沒有對應功能,因此多聲道通話錄音需要逐聲道的工作階段
• 關鍵詞偏置 — Grok Voice Transcribe 2.0 每次請求最多接受 100 個領域術語;Gemini 3.5 Transcribe 接受自訂詞彙與選用的語言提示
• 語音代理的底層管線——Grok Voice Transcribe 2.0 推出贅詞移除與 Smart Turn 輪次結束偵測;Gemini 3.5 Transcribe Live 涵蓋串流情境,卻把輪次邏輯留給應用程式自行處理
• 輸入處理 — Grok Voice Transcribe 2.0 支援直接上傳檔案,最高 500 MB,涵蓋 12 種音訊格式;Gemini 3.5 Transcribe 的預錄路徑要求公開的 HTTPS URL,有 15 分鐘和 300 MB 的上限,且無法將其智慧格式模式與字詞時間戳記或講者標籤結合使用
那份清單呈現的模式是:SpaceXAI 打造的是轉錄產品,而 Google 打造的是轉錄能力。當轉錄就是整個應用時,說話者分離、時間戳記、聲道分離與發言輪替偵測是你需要的功能;當轉錄只是更大應用中的一個步驟時,可提示性、語言廣度與單一 API 搞定一切才是你想要的。抽象而言,兩份清單沒有哪一份更好,而只憑準確度做選擇的團隊,最終會缺少它不需要的那一組。

在兩者之間做選擇,以及什麼會改變答案
當錄音還在播放、轉錄就必須準確無誤時,就選用 Grok Voice Transcribe 2.0:即時客服人員輪流發言、絕不能出錯的即時字幕、需要講者歸屬與聲道分離的聯絡中心串流,或任何同時看重每 1,000 分鐘 $1.67 與 162× 吞吐量的批次處理流程。當音訊是多語言、且語言不在 Grok 文件所列的支援範圍內時;當轉錄稿要饋入一個也必須對它進行推理的模型時;當你想用免費方案來做原型開發時;或當批次路徑的 2.6% AA-WER 對你正在做的事來說已經足夠,而額外的語言涵蓋範圍比價格差異更有價值時,就選用 Gemini 3.5 Transcribe。
大多數團隊在這裡實際上做的並不是二選一。兩個模型都能透過同一組 OrcaRouter API 金鑰存取,還能一併使用其他 200 多個模型,這表示你可以把即時代理流量導向 Grok Voice Transcribe 2.0,並把多語言長期存檔交給 Gemini 3.5 Transcribe,而不必維護兩份供應商合約、兩套帳務關係和兩組憑證。這也是你為自家音訊解決準確度問題的方式:對同一批錄音跑這兩個模型,比較你實際拿到的逐字稿,再讓路由 DSL 把流量送到該去的地方。排行榜告訴你哪個模型在某個人八小時的英語代理對話上勝出;只有你自己的音訊才能告訴你,哪一個在你的音訊上勝出。
懸而未決的問題是,當 Google 下一次修訂 Live 端點時,那道串流差距會如何變化。Gemini 3.5 Transcribe Live 在公開預覽中推出,其 4.0% 的數字是在它變得可呼叫後大約一天測得——這是強烈的早期訊號,但相較於它如今落後的那個 Grok 數字,它沉澱的時間更短。如果 Google 在維持 0.25 秒部分延遲的同時縮小這 1.3 個百分點的串流差距,這種取捨就不再是取捨,而 Grok 的優勢會縮小到價格與功能。在那之前,分野很清楚:最快的部分結果來自 Google,最準確的則來自 SpaceXAI,而榜上沒有任何模型兩者兼具。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
