文章主視覺卡片寫著「Grok Voice Transcribe 2.0 對比 NVIDIA Parakeet TDT 0.6B」,帶有「模型比較」徽章與副標「兩個排行榜,一個誤導性的比較」,並有標籤寫著 2.7% 串流 WER、6.32% Open ASR 平均值、600M 參數(CC-BY-4.0 授權)及每批次小時 $0.10,背景為白到藍的漸層,OrcaRouter 標誌位於右下角。
Guides & Insights

Grok Voice Transcribe 2.0 與 NVIDIA Parakeet TDT 0.6B:兩個排行榜,一個誤導性的比較

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

NVIDIA Parakeet TDT 0.6B 是一款 6 億參數的 FastConformer-TDT transducer,於 2025 年 8 月 14 日以 CC-BY-4.0 發布,一年多來一直是任何想自行執行轉錄的人的首選推薦。Grok Voice Transcribe 2.0 是 SpaceXAI 的託管式語音轉文字模型,於 2026 年 9 月 18 日推出,批次處理定價為每音訊小時 0.10 美元,串流則為每小時 0.20 美元,在 Artificial Analysis 的串流排行榜上最終詞錯誤率為 2.7%。如果你搜尋兩者之間的比較,會看到 Parakeet 被引述為 13.7% WER,而 Grok Voice Transcribe 2.0 為 2.7%,這讓那個託管模型看起來準確度高出五倍,而這讀起來確實極具誤導性。那兩個數字來自不同的 Artificial Analysis 指數,建構於不同資料集,發布時間相隔數年,而且其中一個已被廠商自家較新的量測結果取代。真正的比較更有趣,而且重點在於 600 MB 的權重能為你換來什麼是 API 辦不到的。

13.7% 這個數字,以及為什麼你不應該使用它

Artificial Analysis 的 2025 年第三季《AI 現況》報告在其 AA-WER 指標上,將 NVIDIA Parakeet TDT 列為第三名,數值為 13.7%,落後於 Google 的 Chirp 2(11.6%)與 NVIDIA 自家的 Canary Qwen(13.2%)。該指標是以音訊時長加權的平均值,涵蓋 VoxPopuli、Earnings-22 與 AMI-SDM 各約兩小時的內容——這些是真實世界的語音,帶有各種不同口音、領域詞彙與艱困的通道條件,這也是為何該指標上的每個數字都偏高。在 AMI-SDM 上達到 13.7% 的 WER 並不差;AMI-SDM 是在混響房間中錄製的遠場會議音訊,是一項艱難的測試。

那個指數已經不再以那種形式存在。Artificial Analysis 將其重建為 AA-WER v2,以 50% 的權重納入 AA-AgentTalk,並各以 25% 納入 VoxPopuli-Cleaned-AA 與 Earnings22-Cleaned-AA,音訊約八小時;而資料清理與重新加權大幅改變了每個模型的數字。在目前非串流的排行榜上,Parakeet TDT 0.6B V3 落在低個位數——與其他開放權重領先者屬於同一區間——而非接近 13.7%,且榜首已降至約 2%。任何仍引用 Parakeet 13.7% 的人,引用的是已退役的測量結果;而如果他們拿它與 2026 年的串流數字相比,那也是在拿兩個不同的排行榜互相比較。

真正能誠實地並列比較的範圍其實更窄。NVIDIA 自家在 Open ASR Leaderboard 上的評測——以該排行榜的工具運行標準的公開英語短音檔資料集——報告 Parakeet TDT 0.6B V3 的平均 WER 為 6.32%,RTFx 為 3,332.74,而僅限英語的 v2 平均為 6.05%。Grok Voice Transcribe 2.0 的 2.7% 則是串流排行榜上的最終轉錄數字,於語音結束後測量,且是在以 agent 加權的英語對話音訊上。不同的資料集、不同的排行榜、不同的模式。在兩個排行榜共有的音訊上,託管模型極可能更準確;但這項優勢的幅度不是 5 倍,而且沒有人發表過能據此定論的測量結果。

這兩個模型實際上是什麼形狀?

架構上的差異,解釋了實務表現上的大部分差異。Parakeet TDT 0.6B 是 FastConformer 編碼器搭配 token-and-duration transducer 解碼器——它同時預測一個 token 以及要前進多少個影格,這讓它能以跳過的方式處理,而不必輸出空白,而這正是它效率的主要來源。它內建橫跨 25 種歐洲語言的自動語言偵測、詞與段落層級的時間戳記、標點與大小寫處理,並且能處理長音訊——在完整注意力下最長可達 24 分鐘,在局部注意力下則約可達三小時。它透過 NeMo 2.2 提供服務,具備適用於 Apple Silicon 的 MLX 路徑,另外也有可在一般 CPU 上執行的 ONNX INT8 版本。

Grok Voice Transcribe 2.0 是一項代管服務,因此這是模型與產品之間的比較。該產品依其標價所包含的內容如下:

• 串流 — Grok Voice Transcribe 2.0 原生透過 WebSocket,首個部分結果在 0.49 秒出現,相較於 Parakeet TDT 0.6B 的分塊或緩衝式做法,後者缺乏第一級的部分轉錄介面

• 關鍵詞偏置 — 每次請求最多支援 100 個關鍵詞,有別於 Parakeet 不具備此功能

• 語者分離 — 包含在請求價格中,對比你自己另外新增的獨立系統

• 聲道 — 相較於每次處理一個串流,單次請求最多可達八個音訊聲道

• 反向文字正規化 — 涵蓋 25 種語言,相較之下僅有標點符號與大小寫

• 部署 — us-east-1 中的受管端點,對比你可下載、在任何地方執行和操作的權重

• 授權 — 商業 API 條款 vs 需標示來源的 CC-BY-4.0

• 模型大小 — 未公開 vs 約 6 億個參數,fp32 約 2.4 GB,fp16 約 1.2 GB

最後一列往往決定許多部署方案。Parakeet TDT 0.6B 只需幾 GB 的空間,透過 INT8 ONNX 路徑在筆記型電腦 CPU 上跑得還算可接受,也能輕鬆放進任何消費級 GPU。那並不是 API 功能的縮小版——而是一種不同的能力,因為這正是能在裝置上離線運作、無需網路、也沒有每小時成本的轉錄功能,與做不到這些的轉錄功能之間的差別。

Screenshot of the Hugging Face model page for nvidia/parakeet-tdt-0.6b-v2, showing the CC-BY-4.0 licence tag, the English language tag, the FastConformer-TDT architecture and 0.6B parameter fields, a callout reading 'NEW: Multilingual Parakeet TDT 0.6B V3 is now available! 25 European Languages', a description stating an RTFx of 3380 on the HF-Open-ASR leaderboard at batch size 128 with transcription of segments up to 24 minutes in a single pass, and a notice that no inference provider deploys it.

沒人正確計算的成本帳

被發布的比較是「每小時 0.10 美元對比免費」,而這種說法兩邊都錯——API 不是你唯一要付費的東西,權重也不是你唯一能省下的東西。

• 批次轉錄 — Grok Voice Transcribe 2.0 每音訊小時 $0.10,約每 1,000 分鐘 $1.67,相較於 Parakeet TDT 0.6B 免授權費,另加 GPU 或 CPU 時間

• 串流 — 每音訊小時 $0.20,每 1,000 分鐘約 $3.33,相較於自架,後者的限制是你自己的並行上限,而非公開費率

• 服務限制——每秒 10 個請求,以及每個團隊 100 個並行串流工作階段,對比您的硬體所能允許的任何數量,沒有速率限制,也沒有並行上限

• 兩張表都沒列出的那筆成本——沒有工程、沒有服務堆疊、沒有自動擴展與待命輪值的取捨、重試邏輯、模型更新,以及你為了尖峰而一直保持預熱的 GPU

在小量時,託管端幾乎總是更便宜,因為自架路線的固定成本是一個人。在大而穩定的量下,自架端會決定性勝出,而交叉點取決於使用率,而不是音訊量:一張你讓它持續忙碌的 GPU,每小時音訊成本非常低;而一張你為了尖峰流量讓它保持暖機的 GPU,則不然。一個每月處理 20,000 小時的團隊,走託管批次路線要付 $2,000,走自架路線則大約是一張中階 GPU 一個月,外加工程時間,兩者相差甚遠。

這筆帳之所以老是算得很糟,是因為自架這一邊的成本通常以零來計算,而託管那一邊則通常以定價來計算。兩者都不是真實的數字。真正真實的是,Parakeet TDT 0.6B 的 3,332 RTFx——這是 NVIDIA 的數據,採批次處理、在資料中心硬體上測得,應把它當成上限而非承諾——意味著單一張規格普通的 GPU 就能處理比大多數組織所產生的還要多的音訊。

在什麼情況下 Parakeet 不再是正確答案

有三件事會促使團隊放棄開放模型、轉向託管模型,而這三件事都不是準確度。

首先是關鍵詞偏置。如果你的逐字稿中充滿產品名稱、姓氏、股票代號或領域術語,那麼一個沒有偏置機制的模型就會把它們弄錯,除了微調之外別無補救之道。Grok Voice Transcribe 2.0 每次請求最多可接受 100 個關鍵詞。Parakeet TDT 0.6B 則沒有這項功能。對聯絡中心、醫療保健與法律工作而言,無論任何排行榜怎麼說,光是這個缺口就足以構成淘汰理由。

第二個是語者分離(diarization)。Parakeet 會提供帶有時間戳的詞語;但不會告訴你那些話是誰說的。多說話者轉錄意味著要執行一個獨立的語者分離模型並對齊輸出,這是一項專案工作,而不是一個設定選項。託管模型會在同一個請求中回傳標註了說話者的文字。

第三個是串流介面本身。{{1}}Parakeet 夠快,因此人們能在其上建立即時系統{{/1}}——將音訊分塊、在每個區塊上執行模型、將輸出拼接起來——但部分轉錄行為、輪次結束偵測和承諾語義都是你得自行編寫與維護的東西。{{2}}Grok Voice Transcribe 2.0 在你停止說話後 0.49 秒傳回第一個部分轉錄,作為一項產品功能。{{/2}}

還有一個偶爾會讓團隊感到意外的授權細節:Parakeet TDT 0.6B V3 採用 CC-BY-4.0,允許商業使用,但要求標註出處;而部分 NVIDIA 語音模型後來已改採該廠商自家的 Open Model License。如果標註出處對你的產品來說是個問題,請查閱該特定檢查點的模型卡,而不要假設整個系列都適用相同條款。

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, diarization included, 100 key terms included, $0.10 per batch hour, managed in us-east-1. The right column gives NVIDIA Parakeet TDT 0.6B the rows: mean WER 6.32% Open ASR, speed 3,332 RTFx batched, diarization not included, no key-term biasing, CC-BY-4.0 weights where you pay compute, 600M params self-hosted anywhere. A footer reads 'Parakeet figures NVIDIA-reported on the Open ASR Leaderboard; Grok figures per Artificial Analysis.'

為什麼 API 通常還是會勝出,以及何時不該如此

過去一年的模式一直很一致:團隊一開始會採用像 Parakeet TDT 0.6B 這樣的開放模型,因為它免費且可控,推出功能後,然後發現持續的成本不是 GPU,而是維護,於是轉向託管端點。反向遷移也會發生,通常是在用量超過某個門檻,每小時的費用開始看起來像是在租用你本可以擁有的東西時。

如果直接把模型接進你的應用程式,這兩個方向的執行成本都很高,這正是主張讓呼叫端保持單純的理由。OrcaRouter 以單一組相容 OpenAI 的金鑰提供 200 多個模型,具備跨供應商的自動容錯移轉,且供應商定價零加成,因此自架部署與託管部署可以位於同一個介面之後,只要換一個模型字串就能互換。這點在語音領域尤其重要——這裡的排行榜每隔幾週就易主,而單一區域的託管服務就等同於單一區域的服務中斷——容錯移轉路徑正是讓一項轉錄功能不至於變成轉錄服務中斷的關鍵。

對於想要開放模型的吞吐量、又不想自己維護服務堆疊的團隊來說,這也正是決策的樣貌:用你自己的音訊對 Parakeet TDT 0.6B 做基準測試,再對同一段音訊測試 Grok Voice Transcribe 2.0,然後讓勝出的那個繼續承接流量,而你也不必再在意上頭掛的是哪家廠商的標誌。

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Non-streaming filter selected, showing the WER Index (Non-streaming), Speed Factor and Price highlight cards, the 'See Streaming Benchmarks' toggle, and the Artificial Analysis Word Error Rate Index (Non-streaming) chart with Parakeet TDT 0.6B V3 appearing among the ranked model bars.

如果你想聽一行版結論:Parakeet TDT 0.6B 仍然是「在任何地方轉錄任何內容、沒有每小時費用、用我已經擁有的硬體」的最佳答案,而 Grok Voice Transcribe 2.0 則是「準確轉錄、帶有講者標籤與我自己的詞彙,且什麼都不用自己跑」的答案。那個讓差距看起來極大的 13.7% 數字,是一項已退役的測量,而誠實的差距——在重疊音訊上大約一到三個 WER 百分點——小到應該由實際操作面的問題來決定。