文章主視覺卡片上寫著「Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo」,搭配「模型比較」徽章與副標題「免費基準仍做得更好的地方」,標籤寫著 2.7% vs 4.07% WER、每小時 $0.20 vs MIT 權重、0.49 秒 vs 1-5 秒、自架與代管 vs 自有,置於白到藍的漸層背景上,右下角有 OrcaRouter 標誌。
Guides & Insights

Grok Voice Transcribe 2.0 與 Whisper Large v3 Turbo:免費基準仍有哪些做得更好的地方

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Whisper Large v3 Turbo 自 2024 年 10 月 1 日以 MIT 授權釋出以來,一直是「我們需要語音轉錄」的預設答案,而 Grok Voice Transcribe 2.0 的任何特點都沒有改變背後的理由。SpaceXAI 於 2026 年 9 月 18 日推出的新模型,確實是大幅勝出的轉錄器——在 Artificial Analysis 的 AA-WER Streaming 排行榜上,最終轉錄稿的詞錯誤率為 2.7%,首次部分結果為 3.4%,相較之下 Whisper 系列在非串流排行榜上的數字為 4.07%,而 Turbo 本身通常比它所蒸餾自的完整 Large v3 落後零點幾個百分點。它的定價為批次處理每音訊小時 0.10 美元,串流處理每小時 0.20 美元。Whisper Large v3 Turbo 則是一個 1.6 GB 的檔案、8.09 億個參數,在自己的硬體上執行,不計量任何用量,不把音訊傳送到任何地方,也沒有速率限制、沒有並行上限,也沒有淘汰時程。這項比較並不是在一個更好的模型與一個較差的模型之間。而是在租用準確度與擁有一個元件之間。

三十秒的時間窗口就是整個架構。

Whisper Large v3 Turbo 繼承了每個 Whisper 模型的結構:音訊以固定的 30 秒視窗處理,編碼器每個視窗執行一次,解碼器則為該區塊輸出文字。Turbo 讓這件事變得更便宜——解碼器層數從三十二層減為四層,速度大約比 Large v3 快 8 倍,VRAM 約 6 GB 而非 10 GB——但並未改變整體形態。模型內部沒有「到目前為止的句子」這樣的概念,因為跨視窗之間沒有持久狀態。

那個單一設計事實解釋了後續的一切。它沒有原生串流功能,因為串流需要在話語進行到一半時就承諾輸出部分結果,而這個模型沒有對應的機制。即時 Whisper 部署確實存在,但它們是將音訊切塊、加上語音活動偵測,再加一層拼接層——這層是某人寫的,現在還得有人維護——而這條流程產生的延遲是以秒為單位,而不是 Grok Voice Transcribe 2.0 所達到的半秒。它也沒有語者分離,因為語者分離是一個關於「誰在說話」而非「說了什麼」的獨立問題。而 Turbo 變體特別只回傳純文字——沒有時間戳記、沒有信心分數,也沒有反向文字正規化把口說的數字和電子郵件地址轉成書寫形式。

Grok Voice Transcribe 2.0 是以相反方式打造的。串流是主要傳輸方式,批次則是同一組權重放在 REST 端點後方,而功能清單讀起來就像 Whisper 留給應用程式自行處理的事項:詞級時間戳記並附帶逐詞信心度、不加價即內含語者分離、跨最多 8 個獨立聲道的多聲道轉錄、每個請求最多 100 個領域詞彙的關鍵詞偏置、跨 25 種語言的逆文字正規化、贅字移除,以及適用於語音代理的 Smart Turn 輪次結束偵測。如果你一直圍繞 Whisper 維護一套分塊與拼接管線,那份清單描述的就是你寫過的程式碼。

準確度落差,以及為何它比表面上看起來更小

• 最終轉錄準確度(串流)— Grok Voice Transcribe 2.0 在 AA-WER Streaming 上達到 2.7% WER,相較於沒有 Whisper Large v3 Turbo 條目,因為該模型無法原生串流

• 批次準確度——在 Artificial Analysis 的非串流排行榜上,Grok Voice Transcribe 2.0 的 AA-WER 為 2.29%,而 Whisper Large v3 為 4.07%;在獨立測試中,Turbo 通常比完整版 Large v3 落後 0.4 到 0.6 個百分點

• 乾淨的英語音訊 — Whisper Large v3 Turbo 在 LibriSpeech test-clean 上達到約 2.1% 的 WER,在 test-other 上約 4.2%,因此在錄音室品質的語音上,與前沿 API 的差距縮小到幾乎沒有

• 真實世界音訊——同一批獨立基準測試顯示,Turbo 在雙人商務通話上約為 4.6%,在吵雜音訊上則為 8–12%,而這正是前沿模型拉開領先幅度的地方

• 批次吞吐量 — 在單一中等規格的消費級 GPU 上,Grok Voice Transcribe 2.0 約為即時速度的 162 倍,而 Whisper Large v3 Turbo 約為 80 倍;若採用更快的服務硬體,還可達到該數字的數倍

• 串流延遲 — 在 Grok Voice Transcribe 2.0 上取得首個部分結果僅需 0.49 秒,相較之下,自架 Whisper 串流管線需要 1–5 秒,而那靠的是黏合程式碼加上 VAD,並非模型本身的能力

對那份清單的誠實解讀是,付費的準確度論點真實但有條件。在乾淨、單一講者、錄音良好的英語上,Whisper Large v3 Turbo 已經足夠接近,差異很少會改變結果。在 8 kHz 電話語音、嘈雜的客服中心音訊、帶口音的語音,以及簡短的領域特定片語——這正是 SpaceXAI 調校 2.0 所針對的精確集合,其自身報告的數字在電話語音上從 10.6% 變為 7.1%,在簡短多語言指令上從 20.6% 變為 6.8%——差距就變成了你可以據以路由的逐字稿與你必須閱讀的逐字稿之間的差別。那些是公司在其自家音訊上報告的數字,未經 SpaceXAI 以外的任何人重現,而它們指向的方向與每一項針對劣化音訊的 Whisper 獨立測試一致。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

成本比較不是 $0.10 對 $0

Whisper 的授權本身不花錢,但實際運行它卻要。能在 6 GB VRAM 中容納 1.6 GB 模型、並以約 80 倍即時速度進行轉錄的 GPU 執行個體,才是真正的成本項目;以典型的雲端 GPU 費率計算,對於持續性工作負載,這個數字會落在與託管 API 相同的數量級——但有一個重要例外:無論音訊是否正在流入,你都在為容量付費。託管的 Whisper 端點存在於很大的價格範圍內,從便宜端每 1,000 分鐘不到 $1.20,到數美元不等,而這種差異是個有用的提醒:「Whisper」是模型,不是服務等級。Artificial Analysis 的標準化價格看板將最便宜的託管 Whisper Large v3 端點列為每 1,000 分鐘 $0.50 與 $1.15,兩者都低於 Grok Voice Transcribe 2.0 的 $1.67 批次費率——但那些端點都不是你的,而且兩者都附帶別人的速率限制與資料保留政策。

自架方案徹底勝出之處,在於那種帶有突發形態的用量。一萬小時的媒體典藏,無論你花一週還是一年處理完,在自己 GPU 上的成本都一樣,而且在你做決定的期間,不會有任何按小時計費的錶在跑。一套絕不能把音訊送出網路之外的合規流程,無論什麼價格都沒有代管替代方案,因為這項要求是架構性的,而非財務性的。而微調唯有在你握有權重時才可能進行:Whisper 的 MIT 授權讓你得以取用這個 809M 參數的模型,並將其調適到單一講者、單一腔調,或狹窄的領域詞彙,這是任何價格點的 API 都無法提供的能耐。

鏡像的另一面是,託管模型的價格可能在你腳下變動。SpaceXAI 從 1.0 升級到 2.0 時維持價格不變——價格持平,模型卻更進步——而 Microsoft 的 MAI-Transcribe-2 也落在完全相同的每音訊小時 $0.10,這說明了前沿價格的地板在哪裡。如果你透過 OrcaRouter 路由,那些定價會以 0% 加價直接傳遞,因此供應商降價的當天就會反映到你的帳單上,而不是等到重新定價週期之後。這是這個比較中租用那一方的真正優勢,而它也值得與免費那一方根本不會寄帳單給你這件事一起權衡。

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

每個實際上是用來做什麼的

當音訊已經是檔案、音量偏高或不穩定、錄音品質還算乾淨,且資料無法離開你的網路、或預算無法負擔按小時計費的模式時,請繼續使用 Whisper Large v3 Turbo。對於離線典藏、需要把 1.6 GB 模型量化縮小才塞得下的邊緣與裝置端轉錄、瓶頸在於吞吐量而非延遲的批次處理流程,以及任何得靠自家音訊微調才能達到所需準確度的專案,它依然是正確的選擇。圍繞著它的工具生態——邊緣端用的 whisper.cpp、正式環境用的 faster-whisper、記憶體受限時用的 GGUF 版本——背後有兩年的社群淬鍊,這是一種剛問世兩天的 API 所沒有的可靠性。

當音訊還在持續傳入時、當錄音品質已經劣化時、當你需要知道誰在什麼時候發言時、當領域詞彙必須以偏置方式處理而非微調時,或當應用程式在講者還沒說完之前就根據部分轉錄內容採取行動時,就該改用 Grok Voice Transcribe 2.0。升級路徑不過是現有整合上的一個參數,而萬一出錯也能鎖回 1.0,這讓試用成本很低。值得一提的是,反向遷移並不便宜:針對具備語者分離與發話輪次偵測的串流 API 所寫的程式碼,無法優雅地降級成只回傳純文字的批次模型,這正是應該先用你真實音訊的一小部分來驗證託管路徑,再決定是否把整條流程押上去的理由。

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

決策實際上是在哪裡做出的

大多數無論規模大小在跑 Whisper 的團隊,都不是在這兩個模型之間做選擇,而是採用混合做法:歸檔用 Whisper,因為它免費,而且在乾淨音訊上表現夠好;即時路徑用前沿 API,因為沒有其他方案能在 3.4% 部分 WER 下串流;再加上下游的第三個模型,負責摘要、分類或依據輸出的任何文字採取行動。第三步通常就是雜亂蔓延的地方——為推理模型再簽一份供應商合約、再一組憑證、再一個要監控的速率限制。OrcaRouter 把這一層收攏起來:一把金鑰橫跨 200+ 個模型、供應商效能下降時自動容錯移轉,還有一套路由 DSL,讓你想把同一份逐字稿送進多個模型、比較之後再選定一個。轉錄呼叫本身仍然會送到你選擇的供應商;不再倍數成長的是它們之後的一切。

Whisper 這邊值得注意的,並不是新的檢查點——自從 Turbo 之後,這個系列就沒有再動過,而 OpenAI 的注意力已經轉向 GPT Transcribe 產品線。真正該看的是服務層。每年自架工具都變得更快,所需的硬體也變得更小,而那裡的每一項改善,都讓按小時付費的理由變得更薄弱。SpaceXAI 這邊值得注意的,則是預設值的翻轉:當 2.0 成為預設、1.0 遭到棄用時,每一個從未指定模型的整合都會同時跟著移動,延遲也不例外。這兩項發展都不會改變根本的分野。一個是你自己擁有並調校的模型,一個是你租用並呼叫的模型,而最誠實的答案是,大多數正式環境的技術堆疊最後兩者都會跑。