文章头图卡片,标题为"Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B",带有"模型对比"徽章和副标题"两个排行榜,一场误导性的比较",标签显示 2.7% 流式 WER、6.32% Open ASR 均值、CC-BY-4.0 许可下的 600M 参数以及每批次小时 $0.10,背景为白色到蓝色的渐变,右下角是 OrcaRouter 标志。
Guides & Insights

Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B:两个排行榜,一次误导性的比较

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

NVIDIA Parakeet TDT 0.6B 是一个拥有 6 亿参数的 FastConformer-TDT transducer,于 2025 年 8 月 14 日以 CC-BY-4.0 协议发布,一年多来一直是所有想自己运行转录的人的首选推荐。Grok Voice Transcribe 2.0 是 SpaceXAI 的托管式语音转文字模型,于 2026 年 9 月 18 日推出,批量处理定价为每音频小时 0.10 美元,流式处理为每小时 0.20 美元,在 Artificial Analysis 的流式榜单上最终词错误率为 2.7%。如果你去搜索两者的对比,你会看到 Parakeet 被标为 13.7% WER,而 Grok Voice Transcribe 2.0 为 2.7%,这会让这个托管模型看起来准确率高出五倍——而读到这样的内容实在是一种彻头彻尾的误导。这两个数字来自 Artificial Analysis 不同的评测榜单,基于不同的数据集、发布时间相隔数年,而且其中一个已被厂商自己更新的测量结果所取代。真正的对比其实更有意思,它关乎的是 600 兆字节的权重能给你带来哪些 API 无法提供的东西。

13.7% 这个数字,以及为什么你不应该使用它

Artificial Analysis 的《2025 年第三季度 AI 现状》报告将 NVIDIA Parakeet TDT 在其 AA-WER 指数上以 13.7% 列为第三,落后于 Google 的 Chirp 2(11.6%)和 NVIDIA 自家的 Canary Qwen(13.2%)。该指数是对 VoxPopuli、Earnings-22 和 AMI-SDM 各约两小时音频进行时长加权平均后得出的——这些是带有不同口音、领域词汇和困难信道条件的真实场景语音,因此该指数上的每个数值都偏高。在 AMI-SDM 上取得 13.7% 的 WER 并不算差;AMI-SDM 是在混响房间中录制的远场会议音频,这是一项艰难的测试。

该指数已不再以那种形式存在。Artificial Analysis 将其重建为 AA-WER v2,AA-AgentTalk 的权重为 50%,VoxPopuli-Cleaned-AA 和 Earnings22-Cleaned-AA 各占 25%,音频约八小时,而清洗和重新加权使每个模型的数值都发生了大幅变化。在当前的非流式榜单上,Parakeet TDT 0.6B V3 处于较低的个位数——与其他开源权重领先者同一区间——而不是接近 13.7%,榜单顶部则降至约 2%。任何仍然为 Parakeet 引用 13.7% 的人,引用的都是已退役的测量结果;如果他们将其与 2026 年的流式数据进行比较,那也是在跨两个不同的榜单进行比较。

真正能放在一起比较的范围更窄。NVIDIA 自己在 Open ASR Leaderboard 上的评估——使用该榜单的工具,对标准公开英语短音频集进行测试——报告称,Parakeet TDT 0.6B V3 的平均 WER 为 6.32%,RTFx 为 3,332.74;仅英语的 v2 平均为 6.05%。Grok Voice Transcribe 2.0 的 2.7% 是流式榜单上的最终转写数字,在语音结束后测量,针对的是按 agent 加权的英语对话音频。不同的数据集,不同的榜单,不同的模式。这个托管模型在两个榜单共有的音频上很可能确实更准确;但优势幅度并不是 5 倍,而且还没有人公布能一锤定音的测量结果。

这两个模型实际上是什么形状

架构差异解释了大部分实际差异。Parakeet TDT 0.6B 是一个 FastConformer 编码器,搭配 token-and-duration transducer 解码器——它同时预测 token 和要前进多少帧,这使其可以跳过而不是输出空白,而这正是其效率的主要来源。它自带覆盖 25 种欧洲语言的自动语言检测、词级和片段级时间戳、标点符号和大小写处理,并能处理长音频——完整注意力下最长 24 分钟,局部注意力下约三小时。它通过 NeMo 2.2 提供服务,有适用于 Apple Silicon 的 MLX 路径,还有可在普通 CPU 上运行的 ONNX INT8 构建。

Grok Voice Transcribe 2.0 是一项托管服务,因此比较的是模型与产品。该产品在其标价下包含的内容:

• 流式传输 — Grok Voice Transcribe 2.0 通过 WebSocket 原生实现,首个部分结果在 0.49 秒时即返回,而 Parakeet TDT 0.6B 采用的是分块或缓冲方式,且没有一等公民的部分转录接口

• 关键术语偏置 — 每次请求最多 100 个关键术语,而 Parakeet 不具备此功能

• 说话人分离 —— 包含在请求价格中,还是由你自行添加的单独系统

• 声道 — 单次请求最多八个音频声道,而每次处理仅一个流

• 逆文本归一化——涵盖 25 种语言,而不仅仅是标点符号和大小写

• 部署方式 — us-east-1 中的托管端点,对比可下载、运行并在任何地方操作的权重

• 许可证 — 商业 API 条款与带署名的 CC-BY-4.0 对比

• 模型规模 — 未公开 vs 约6亿参数,fp32下约2.4 GB或fp16下约1.2 GB

最后一行往往决定了许多部署能否落地。Parakeet TDT 0.6B 只需几 GB 空间,通过 INT8 ONNX 路径在笔记本电脑 CPU 上也能以可接受的水平运行,并且能轻松装进任何消费级 GPU。这并不是 API 所提供能力的缩小版——而是一种不同的能力,因为它所代表的差异在于:一种转录功能可以在设备上离线工作,无需网络,也没有按小时计费;而另一种则做不到。

Screenshot of the Hugging Face model page for nvidia/parakeet-tdt-0.6b-v2, showing the CC-BY-4.0 licence tag, the English language tag, the FastConformer-TDT architecture and 0.6B parameter fields, a callout reading 'NEW: Multilingual Parakeet TDT 0.6B V3 is now available! 25 European Languages', a description stating an RTFx of 3380 on the HF-Open-ASR leaderboard at batch size 128 with transcription of segments up to 24 minutes in a single pass, and a notice that no inference provider deploys it.

没人能正确算清的成本账

对外公布的那套对比是“每小时 0.10 美元对比免费”,而它在两个方向上都错了——API 并不是你唯一要付费的东西,权重也不是你唯一能省下的东西。

• 批量转录 — Grok Voice Transcribe 2.0 每音频小时 $0.10,每 1,000 分钟约 $1.67,而 Parakeet TDT 0.6B 不收许可费,但需另计 GPU 或 CPU 时间

• 流式处理——每音频小时 $0.20,每 1,000 分钟约 $3.33;而自托管则不同,其限制是你自己的并发上限,而不是公布的费率

• 服务限制——每秒 10 次请求,每个团队 100 个并发流式会话,相比之下,只要你的硬件允许,就没有速率限制,也没有并发上限

• 不体现在任何一张表上的成本——没有工程投入,没有服务栈,没有自动扩缩容与待命轮班的权衡,没有重试逻辑,没有模型更新,也没有你为应对峰值而保持热备的 GPU

在小规模场景下,托管方案几乎总是更便宜,因为自托管路径的固定成本是一个人。在大规模稳定流量下,自托管一侧会决定性地胜出,而盈亏平衡点取决于利用率,而不是音频时长:一块持续保持忙碌的 GPU,其每小时音频成本非常低;而一块为了峰值流量一直待命的 GPU,则并非如此。一个每月处理 20,000 小时的团队,走托管批处理路径要支付 2,000 美元,而自托管路径大约是一块中端 GPU 一个月的费用外加工程时间,这完全不在一个量级。

这笔账之所以算得糟糕,是因为自托管这一侧通常按零成本来比较,而托管服务那一侧通常按标价来比较。两者都不是真实的数字。真实的是,Parakeet TDT 0.6B 的 3,332 RTFx——这是 NVIDIA 的数据,采用批处理、运行在数据中心硬件上,应当被视为上限而非承诺——意味着单块普通的 GPU 就能处理的音频量,超过大多数组织的生成量。

Parakeet 不再适用的场景

有三件事会促使团队放弃开放模型,转而投向托管模型,而这其中没有一件是准确性。

首先是关键词偏置。如果你的转写文本中充斥着产品名称、姓氏、股票代码或领域术语,那么一个没有偏置机制的模型就会把它们弄错,除了微调之外别无补救办法。Grok Voice Transcribe 2.0 每次请求最多支持 100 个关键词。Parakeet TDT 0.6B 则没有这一功能。对于联络中心、医疗和法律工作而言,无论任何排行榜怎么说,仅这一项差距就足以直接出局。

第二个是说话人分离。Parakeet 会给你带时间戳的词,但不会告诉你这些话是谁说的。多说话人转录意味着要运行一个单独的说话人分离模型并对输出进行对齐,这是一个项目,而不是一个配置选项。托管模型会在同一个请求中返回标注了说话人的文本。

第三点是流式接口本身。Parakeet 足够快,以至于人们能在它之上构建实时系统——把音频分块、在每个分块上运行模型、再把输出拼接起来——但部分转录行为、轮次结束检测和提交语义,全都是需要你自己编写和维护的东西。Grok Voice Transcribe 2.0 则把在你说完后 0.49 秒返回第一段部分结果作为一项产品功能。

还有一个偶尔会让团队感到意外的许可细节:Parakeet TDT 0.6B V3 采用 CC-BY-4.0,这允许商业使用,但要求署名,而一些 NVIDIA 语音模型此后已改为厂商自己的 Open Model License。如果署名对你的产品来说是个问题,请阅读具体检查点的模型卡,而不要想当然地认为该系列的条款适用。

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, diarization included, 100 key terms included, $0.10 per batch hour, managed in us-east-1. The right column gives NVIDIA Parakeet TDT 0.6B the rows: mean WER 6.32% Open ASR, speed 3,332 RTFx batched, diarization not included, no key-term biasing, CC-BY-4.0 weights where you pay compute, 600M params self-hosted anywhere. A footer reads 'Parakeet figures NVIDIA-reported on the Open ASR Leaderboard; Grok figures per Artificial Analysis.'

为什么 API 通常仍然会胜出,以及它何时不该如此

过去一年里,这种模式一直很一致:团队一开始会选用像 Parakeet TDT 0.6B 这样的开放模型,因为它免费且可控,把功能上线后,才发现持续性成本不在于 GPU,而在于维护,于是迁移到托管端点。反向迁移也会发生,通常是在用量跨过某个阈值时,按小时计费开始看起来像是在为本来可以拥有的东西付租金。

如果把模型直接接入你的应用程序,那么双向执行的成本都很高,这正是让调用点保持平淡无奇的理由。OrcaRouter 通过一个与 OpenAI 兼容的单一密钥开放 200 多个模型,支持跨提供商自动故障转移,并对提供商标价加价 0%,因此自托管部署和托管式部署可以位于同一个接口之后,只需改一个模型字符串就能互换。这在语音领域比通常更重要,因为排行榜每隔几周就会易主,而单区域托管服务无异于单区域宕机——故障转移路径正是让转录功能不至于变成转录中断的关键。

对于既想要开放模型的吞吐量、又不想要那套服务栈的团队来说,这同样也是决策的形态:用你自己的音频对 Parakeet TDT 0.6B 做基准测试,再用同一批音频对 Grok Voice Transcribe 2.0 做基准测试,然后让胜出的那个继续承接流量,而你不必再去在意它上面印的是哪家厂商的标识。

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Non-streaming filter selected, showing the WER Index (Non-streaming), Speed Factor and Price highlight cards, the 'See Streaming Benchmarks' toggle, and the Artificial Analysis Word Error Rate Index (Non-streaming) chart with Parakeet TDT 0.6B V3 appearing among the ranked model bars.

如果你想听一句话版本:{{1}}对于“在我已拥有的硬件上,随时随地转录任何内容,且无需按小时付费”这一需求,Parakeet TDT 0.6B 仍然是最佳答案,{{/1}}而{{2}}对于“无需运行任何东西,就能准确转录、带上说话人标签并使用我自己的词汇”这一需求,Grok Voice Transcribe 2.0 就是答案。{{/2}}让差距显得巨大的 13.7% 是一个已废弃的测量值,而诚实的差距——在重叠音频上 WER 只相差 1 到 3 个百分点——小到应该由实际使用问题来决定。