文章主视觉卡片,标题为“Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo”,配有“模型对比”徽章和副标题“免费基线在哪些方面依然更胜一筹”,标签分别显示 2.7% vs 4.07% WER、每小时 $0.20 vs MIT 权重、0.49s vs 1-5s 自托管与托管 vs 自有,背景为白到蓝的渐变,右下角是 OrcaRouter 标志。
Guides & Insights

Grok Voice Transcribe 2.0 对比 Whisper Large v3 Turbo:免费基线仍有哪些更胜一筹之处

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Whisper Large v3 Turbo 自 2024 年 10 月 1 日以 MIT 许可证发布以来,一直是“我们需要转写”这一需求的默认答案,而 Grok Voice Transcribe 2.0 的任何特性都没有改变这背后的原因。SpaceXAI 于 2026 年 9 月 18 日推出的这款新模型,确实是一款优秀得多的转写器,而且优势相当明显——在 Artificial Analysis 的 AA-WER Streaming 榜单上,最终转写的词错误率为 2.7%,首次部分结果为 3.4%,而 Whisper 家族在非流式榜单上的数字为 4.07%,Turbo 本身通常比它蒸馏自的完整版 Large v3 还要落后零点几个百分点。它的定价为批量处理每音频小时 0.10 美元,流式处理每小时 0.20 美元。Whisper Large v3 Turbo 是一个 1.6 GB、含 8.09 亿参数的文件,运行在你自己的硬件上,不计费、不把音频发送到任何地方,没有速率限制、没有并发上限,也没有弃用时间表。这并非一个更好的模型与一个更差的模型之间的比较,而是租用准确率与拥有一个组件之间的比较。

三十秒的窗口就是整个架构

Whisper Large v3 Turbo 继承了每个 Whisper 模型的结构:音频以固定的 30 秒窗口进行处理,编码器每个窗口运行一次,解码器则为该块输出文本。Turbo 让这一过程变得更廉价——解码器层数从三十二层减少到四层,比 Large v3 大约快 8 倍,显存占用约 6 GB 而不是 10 GB——但它没有改变整体形态。模型内部没有“截至目前为止的句子”这一概念,因为跨窗口不存在持久状态。

那一个设计事实解释了所有下游问题。它没有原生流式处理,因为流式处理需要在话语中途提交部分输出,而该模型没有相应的机制。实时 Whisper 部署确实存在,但它们是由分块、语音活动检测,再加上某个由人编写并如今仍在维护的拼接层组成的;这条流水线产生的延迟以秒计,而不是 Grok Voice Transcribe 2.0 所达到的半秒。它没有说话人分离,因为说话人分离是一个独立的问题,关注的是谁在说话,而不是说了什么。而 Turbo 变体具体来说只返回纯文本——没有时间戳,没有置信度分数,也没有把口述的数字和电子邮件地址转换为书面形式的逆文本归一化。

Grok Voice Transcribe 2.0 的构建方式恰恰相反。流式传输是主要通道,批量处理则是同一套权重放在 REST 端点之后,而功能列表读起来就像一份 Whisper 留给应用层去实现的事项清单:带逐词置信度的词级时间戳、免费附带的说话人分离、最多 8 个独立通道的多通道转写、每次请求最多 100 个领域术语的关键词偏置、覆盖 25 种语言的逆文本规范化、填充词移除,以及面向语音代理的 Smart Turn 轮次结束检测。如果你一直在围绕 Whisper 维护一套分块与拼接流水线,那份列表描述的就是你写过的代码。

准确率差距,以及为什么它比看起来要小

• 最终转写准确率(流式)—— Grok Voice Transcribe 2.0 在 AA-WER Streaming 上的 WER 为 2.7%,相比之下 Whisper Large v3 Turbo 没有对应条目,因为该模型无法原生支持流式处理

• 批量准确率 —— 在 Artificial Analysis 的非流式榜单上,Grok Voice Transcribe 2.0 的 AA-WER 为 2.29%,而 Whisper Large v3 为 4.07%;在独立测试中,Turbo 通常比完整版 Large v3 低 0.4 到 0.6 个百分点

• 干净的英语音频——Whisper Large v3 Turbo 在 LibriSpeech test-clean 上的 WER 约为 2.1%,在 test-other 上约为 4.2%,因此在录音室级语音上,与前沿 API 的差距缩小到几乎可以忽略不计

• 真实世界音频——同样的独立基准测试显示,Turbo 在双人商务通话中的表现约为 4.6%,在嘈杂音频中为 8–12%,而前沿模型的领先幅度正是在这里拉开的

• 批处理吞吐量——在单块普通的消费级 GPU 上,Grok Voice Transcribe 2.0 约为实时的 162 倍,而 Whisper Large v3 Turbo 约为 80 倍;使用更快的服务硬件时,还能达到该倍数的数倍

• 流式延迟 — Grok Voice Transcribe 2.0 的首个部分转写结果延迟为 0.49 秒,而自托管 Whisper 流式管道为 1–5 秒;后者靠的是胶水代码加 VAD,而不是模型能力

对那份清单的诚实解读是:为准确率付费的理由确实成立,但有条件。在干净、单人、录制良好的英语上,Whisper Large v3 Turbo 已经足够接近,差异很少会改变结果。但在 8 kHz 电话语音、嘈杂的呼叫中心音频、带口音的语音,以及简短的领域特定短语上——这些正是 SpaceXAI 调优 2.0 时所针对的那几类集合,其自身报告的数字在电话语音上从 10.6% 变为 7.1%,在简短多语言命令上从 20.6% 变为 6.8%——差距就变成了可用于路由的转写文本与必须人工阅读的转写文本之间的区别。这些是公司在自有音频上报告的数据,SpaceXAI 之外的任何人都未复现,而它们所指的方向与所有针对退化音频上 Whisper 的独立测试都一致。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

成本对比不是 $0.10 对 $0

Whisper 的许可证不花一分钱,但运行它要花钱。真正的大头是这样一个 GPU 实例:它把 1.6 GB 的模型装进 6 GB 显存,并以大约 80 倍实时的速度完成转写;按典型的云 GPU 费率计算,对于持续运行的工作负载,这笔开销与托管 API 处于同一数量级——但有一个重要区别:无论音频是否在传输,你都在为这份算力付费。托管的 Whisper 端点价格跨度很大,便宜的一端每 1,000 分钟不到 1.20 美元,贵的则要几美元,而这种差异恰好提醒我们:“Whisper”是一个模型,而不是某个服务等级。Artificial Analysis 的标准化价格榜显示,最便宜的托管 Whisper Large v3 端点分别为每 1,000 分钟 0.50 美元和 1.15 美元,两者都低于 Grok Voice Transcribe 2.0 每 1,000 分钟 1.67 美元的批处理价格——但这两个端点都不属于你,而且都附带着别人的速率限制和数据保留政策。

自托管毫无争议地胜出的场景,是量大且呈突发形态的负载。一万小时的媒体档案,无论是在一周内还是一年内处理,在你自己的 GPU 上成本都一样,而且在你做决定期间,不会有按小时计费的计价器在跑。一条绝不能把音频送出网络的合规流水线,无论什么价格都没有托管替代方案,因为这是架构要求,而非资金问题。而只有当你掌握权重时,微调才对你可用:Whisper 的 MIT 许可证让你可以拿 809M 参数模型,将其适配到单个说话人、单一口音或狭窄的领域词汇表,这是任何 API 在任何价位都不提供的能力。

反过来的情况是:托管模型的价格可能在你脚下变动。SpaceXAI 在从 1.0 升级到 2.0 时费率保持不变——价格不变,模型却升级了——而微软的 MAI-Transcribe-2 也落在了完全相同的每音频小时 0.10 美元,这就告诉了你前沿的价格底线在哪里。如果你经由 OrcaRouter 路由,这些标价会以 0% 加价原样传导,因此厂商一旦降价,当天就能反映到你的账单上,而不必等一个重新定价周期。这是这一对比中“租用”一方的真正优势,而它也值得与另一个事实放在一起权衡:“免费”一方根本不会给你寄账单。

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

每个到底是用来做什么的?

当音频已经是文件、音量较高或不规则、录音质量相当干净,并且要么数据不能离开你的网络,要么预算无法承受按小时计费时,请保留Whisper Large v3 Turbo。对于离线归档、边缘和设备端转写——在这些场景中,一个1.6 GB的模型经过量化后可以适配——吞吐量而非延迟成为约束的批处理流水线,以及任何以在你自己的音频上进行微调作为通往所需准确率之路的项目,它仍然是正确的选择。围绕它的工具链——用于边缘的whisper.cpp,用于生产的faster-whisper,用于受限内存的GGUF构建——背后已有两年的社区打磨,这是一种任何诞生仅两天的API都不具备的可靠性。

当音频仍在传入、录音质量下降、你需要知道谁在何时说话、领域词汇必须通过偏置而非微调来处理,或者应用需要在说话人尚未说完时就依据部分转录内容采取行动时,就迁移到 Grok Voice Transcribe 2.0。升级路径只是在现有集成上改一个参数,如果出问题就回退固定到 1.0,这让试用成本很低。值得注意的是,反向迁移并不便宜:针对带有说话人分离和轮次检测的流式 API 编写的代码,无法优雅地降级为返回纯文本的批量模型,这也就成了在把某条流水线投入其中之前,先用你真实音频的一小部分来验证托管路径的一个理由。

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

决策真正被做出的地方

大多数以任何规模运行 Whisper 的团队,并不是在这两个模型之间二选一,而是在采用混合方案:归档用 Whisper,因为它免费,而且在干净音频上足够好;实时路径用前沿 API,因为没有其他方案能以 3.4% 的部分 WER 进行流式传输;下游再用第三个模型,对输出的任何文本进行摘要、分类或采取行动。通常就是在第三步出现蔓延——推理模型要签第二份供应商合同、第二套凭证、第二个需要监控的速率限制。OrcaRouter 把这层收拢起来:一个密钥通用于 200+ 模型,供应商服务降级时自动故障转移,还有路由 DSL,让你可以把同一份转写送进多个模型,在选定一个之前先进行比较。转写调用本身仍然发往你选择的供应商;不再成倍增加的是它们之后的一切。

Whisper 这边值得关注的不是新的检查点——自 Turbo 以来这个家族就没有变动过,而 OpenAI 的注意力已经转向了 GPT Transcribe 这条产品线。真正值得关注的是服务层。每年,自托管工具都会变得更快,所需的硬件也会变得更小,而这里的每一次改进都会削弱按小时付费的理由。SpaceXAI 这边值得关注的是默认项的切换:当 2.0 成为默认版本、1.0 被弃用时,所有从未指定过模型的集成都会一下子全部迁移过去,延迟也不例外。这两项进展都没有改变根本的格局。一个是你自己拥有并调优的模型,一个是你租用并调用的模型,而最诚实的答案是:大多数生产环境的技术栈最终两个都会用。