
Grok Voice Transcribe 2.0 與 NVIDIA Parakeet TDT 0.6B:兩個排行榜,一個誤導性的比較
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B 是一款 6 億參數的 FastConformer-TDT transducer,於 2025 年 8 月 14 日以 CC-BY-4.0 發布,一年多來一直是任何想自行執行轉錄的人的首選推薦。Grok Voice Transcribe 2.0 是 SpaceXAI 的託管式語音轉文字模型,於 2026 年 9 月 18 日推出,批次處理定價為每音訊小時 0.10 美元,串流則為每小時 0.20 美元,在 Artificial Analysis 的串流排行榜上最終詞錯誤率為 2.7%。如果你搜尋兩者之間的比較,會看到 Parakeet 被引述為 13.7% WER,而 Grok Voice Transcribe 2.0 為 2.7%,這讓那個託管模型看起來準確度高出五倍,而這讀起來確實極具誤導性。那兩個數字來自不同的 Artificial Analysis 指數,建構於不同資料集,發布時間相隔數年,而且其中一個已被廠商自家較新的量測結果取代。真正的比較更有趣,而且重點在於 600 MB 的權重能為你換來什麼是 API 辦不到的。
13.7% 這個數字,以及為什麼你不應該使用它
Artificial Analysis 的 2025 年第三季《AI 現況》報告在其 AA-WER 指標上,將 NVIDIA Parakeet TDT 列為第三名,數值為 13.7%,落後於 Google 的 Chirp 2(11.6%)與 NVIDIA 自家的 Canary Qwen(13.2%)。該指標是以音訊時長加權的平均值,涵蓋 VoxPopuli、Earnings-22 與 AMI-SDM 各約兩小時的內容——這些是真實世界的語音,帶有各種不同口音、領域詞彙與艱困的通道條件,這也是為何該指標上的每個數字都偏高。在 AMI-SDM 上達到 13.7% 的 WER 並不差;AMI-SDM 是在混響房間中錄製的遠場會議音訊,是一項艱難的測試。
那個指數已經不再以那種形式存在。Artificial Analysis 將其重建為 AA-WER v2,以 50% 的權重納入 AA-AgentTalk,並各以 25% 納入 VoxPopuli-Cleaned-AA 與 Earnings22-Cleaned-AA,音訊約八小時;而資料清理與重新加權大幅改變了每個模型的數字。在目前非串流的排行榜上,Parakeet TDT 0.6B V3 落在低個位數——與其他開放權重領先者屬於同一區間——而非接近 13.7%,且榜首已降至約 2%。任何仍引用 Parakeet 13.7% 的人,引用的是已退役的測量結果;而如果他們拿它與 2026 年的串流數字相比,那也是在拿兩個不同的排行榜互相比較。
真正能誠實地並列比較的範圍其實更窄。NVIDIA 自家在 Open ASR Leaderboard 上的評測——以該排行榜的工具運行標準的公開英語短音檔資料集——報告 Parakeet TDT 0.6B V3 的平均 WER 為 6.32%,RTFx 為 3,332.74,而僅限英語的 v2 平均為 6.05%。Grok Voice Transcribe 2.0 的 2.7% 則是串流排行榜上的最終轉錄數字,於語音結束後測量,且是在以 agent 加權的英語對話音訊上。不同的資料集、不同的排行榜、不同的模式。在兩個排行榜共有的音訊上,託管模型極可能更準確;但這項優勢的幅度不是 5 倍,而且沒有人發表過能據此定論的測量結果。
這兩個模型實際上是什麼形狀?
架構上的差異,解釋了實務表現上的大部分差異。Parakeet TDT 0.6B 是 FastConformer 編碼器搭配 token-and-duration transducer 解碼器——它同時預測一個 token 以及要前進多少個影格,這讓它能以跳過的方式處理,而不必輸出空白,而這正是它效率的主要來源。它內建橫跨 25 種歐洲語言的自動語言偵測、詞與段落層級的時間戳記、標點與大小寫處理,並且能處理長音訊——在完整注意力下最長可達 24 分鐘,在局部注意力下則約可達三小時。它透過 NeMo 2.2 提供服務,具備適用於 Apple Silicon 的 MLX 路徑,另外也有可在一般 CPU 上執行的 ONNX INT8 版本。
Grok Voice Transcribe 2.0 是一項代管服務,因此這是模型與產品之間的比較。該產品依其標價所包含的內容如下:
• 串流 — Grok Voice Transcribe 2.0 原生透過 WebSocket,首個部分結果在 0.49 秒出現,相較於 Parakeet TDT 0.6B 的分塊或緩衝式做法,後者缺乏第一級的部分轉錄介面
• 關鍵詞偏置 — 每次請求最多支援 100 個關鍵詞,有別於 Parakeet 不具備此功能
• 語者分離 — 包含在請求價格中,對比你自己另外新增的獨立系統
• 聲道 — 相較於每次處理一個串流,單次請求最多可達八個音訊聲道
• 反向文字正規化 — 涵蓋 25 種語言,相較之下僅有標點符號與大小寫
• 部署 — us-east-1 中的受管端點,對比你可下載、在任何地方執行和操作的權重
• 授權 — 商業 API 條款 vs 需標示來源的 CC-BY-4.0
• 模型大小 — 未公開 vs 約 6 億個參數,fp32 約 2.4 GB,fp16 約 1.2 GB
最後一列往往決定許多部署方案。Parakeet TDT 0.6B 只需幾 GB 的空間,透過 INT8 ONNX 路徑在筆記型電腦 CPU 上跑得還算可接受,也能輕鬆放進任何消費級 GPU。那並不是 API 功能的縮小版——而是一種不同的能力,因為這正是能在裝置上離線運作、無需網路、也沒有每小時成本的轉錄功能,與做不到這些的轉錄功能之間的差別。

沒人正確計算的成本帳
被發布的比較是「每小時 0.10 美元對比免費」,而這種說法兩邊都錯——API 不是你唯一要付費的東西,權重也不是你唯一能省下的東西。
• 批次轉錄 — Grok Voice Transcribe 2.0 每音訊小時 $0.10,約每 1,000 分鐘 $1.67,相較於 Parakeet TDT 0.6B 免授權費,另加 GPU 或 CPU 時間
• 串流 — 每音訊小時 $0.20,每 1,000 分鐘約 $3.33,相較於自架,後者的限制是你自己的並行上限,而非公開費率
• 服務限制——每秒 10 個請求,以及每個團隊 100 個並行串流工作階段,對比您的硬體所能允許的任何數量,沒有速率限制,也沒有並行上限
• 兩張表都沒列出的那筆成本——沒有工程、沒有服務堆疊、沒有自動擴展與待命輪值的取捨、重試邏輯、模型更新,以及你為了尖峰而一直保持預熱的 GPU
在小量時,託管端幾乎總是更便宜,因為自架路線的固定成本是一個人。在大而穩定的量下,自架端會決定性勝出,而交叉點取決於使用率,而不是音訊量:一張你讓它持續忙碌的 GPU,每小時音訊成本非常低;而一張你為了尖峰流量讓它保持暖機的 GPU,則不然。一個每月處理 20,000 小時的團隊,走託管批次路線要付 $2,000,走自架路線則大約是一張中階 GPU 一個月,外加工程時間,兩者相差甚遠。
這筆帳之所以老是算得很糟,是因為自架這一邊的成本通常以零來計算,而託管那一邊則通常以定價來計算。兩者都不是真實的數字。真正真實的是,Parakeet TDT 0.6B 的 3,332 RTFx——這是 NVIDIA 的數據,採批次處理、在資料中心硬體上測得,應把它當成上限而非承諾——意味著單一張規格普通的 GPU 就能處理比大多數組織所產生的還要多的音訊。
在什麼情況下 Parakeet 不再是正確答案
有三件事會促使團隊放棄開放模型、轉向託管模型,而這三件事都不是準確度。
首先是關鍵詞偏置。如果你的逐字稿中充滿產品名稱、姓氏、股票代號或領域術語,那麼一個沒有偏置機制的模型就會把它們弄錯,除了微調之外別無補救之道。Grok Voice Transcribe 2.0 每次請求最多可接受 100 個關鍵詞。Parakeet TDT 0.6B 則沒有這項功能。對聯絡中心、醫療保健與法律工作而言,無論任何排行榜怎麼說,光是這個缺口就足以構成淘汰理由。
第二個是語者分離(diarization)。Parakeet 會提供帶有時間戳的詞語;但不會告訴你那些話是誰說的。多說話者轉錄意味著要執行一個獨立的語者分離模型並對齊輸出,這是一項專案工作,而不是一個設定選項。託管模型會在同一個請求中回傳標註了說話者的文字。
第三個是串流介面本身。{{1}}Parakeet 夠快,因此人們能在其上建立即時系統{{/1}}——將音訊分塊、在每個區塊上執行模型、將輸出拼接起來——但部分轉錄行為、輪次結束偵測和承諾語義都是你得自行編寫與維護的東西。{{2}}Grok Voice Transcribe 2.0 在你停止說話後 0.49 秒傳回第一個部分轉錄,作為一項產品功能。{{/2}}
還有一個偶爾會讓團隊感到意外的授權細節:Parakeet TDT 0.6B V3 採用 CC-BY-4.0,允許商業使用,但要求標註出處;而部分 NVIDIA 語音模型後來已改採該廠商自家的 Open Model License。如果標註出處對你的產品來說是個問題,請查閱該特定檢查點的模型卡,而不要假設整個系列都適用相同條款。

為什麼 API 通常還是會勝出,以及何時不該如此
過去一年的模式一直很一致:團隊一開始會採用像 Parakeet TDT 0.6B 這樣的開放模型,因為它免費且可控,推出功能後,然後發現持續的成本不是 GPU,而是維護,於是轉向託管端點。反向遷移也會發生,通常是在用量超過某個門檻,每小時的費用開始看起來像是在租用你本可以擁有的東西時。
如果直接把模型接進你的應用程式,這兩個方向的執行成本都很高,這正是主張讓呼叫端保持單純的理由。OrcaRouter 以單一組相容 OpenAI 的金鑰提供 200 多個模型,具備跨供應商的自動容錯移轉,且供應商定價零加成,因此自架部署與託管部署可以位於同一個介面之後,只要換一個模型字串就能互換。這點在語音領域尤其重要——這裡的排行榜每隔幾週就易主,而單一區域的託管服務就等同於單一區域的服務中斷——容錯移轉路徑正是讓一項轉錄功能不至於變成轉錄服務中斷的關鍵。
對於想要開放模型的吞吐量、又不想自己維護服務堆疊的團隊來說,這也正是決策的樣貌:用你自己的音訊對 Parakeet TDT 0.6B 做基準測試,再對同一段音訊測試 Grok Voice Transcribe 2.0,然後讓勝出的那個繼續承接流量,而你也不必再在意上頭掛的是哪家廠商的標誌。

如果你想聽一行版結論:Parakeet TDT 0.6B 仍然是「在任何地方轉錄任何內容、沒有每小時費用、用我已經擁有的硬體」的最佳答案,而 Grok Voice Transcribe 2.0 則是「準確轉錄、帶有講者標籤與我自己的詞彙,且什麼都不用自己跑」的答案。那個讓差距看起來極大的 13.7% 數字,是一項已退役的測量,而誠實的差距——在重疊音訊上大約一到三個 WER 百分點——小到應該由實際操作面的問題來決定。
