Granite Speech 5.0 470M TurboCTC 的主标题卡片:显示语音波形图标;徽章标注 12,600 RTFx(在 1 个 H200 上);标签标注 470M 参数、Encoder-only CTC 和 Apache 2.0;副标题为“IBM 的 Apache-2.0 英语 ASR”;页脚显示“发布于 2026 年 8 月 25 日”;右下角为 OrcaRouter 标志。
Guides & Insights

Granite Speech 5.0 470M TurboCTC:IBM 的 Apache-2.0 ASR 宣称达到 12,600 RTFx

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Granite Speech 5.0 470M TurboCTC 是 IBM 最新语音发布中真正允许你投入商用的模型,而这正是关于它首先需要了解的一点。2026 年 8 月 25 日,IBM 在 Hugging Face 上发布了两个英语语音识别检查点——{{1}}Granite Speech 5.0 470M TurboCTC{{/1}} 采用 Apache 2.0 许可证,而 {{2}}Granite Speech 5.0 470M TurboCTC-NC{{/2}} 则采用非商业性质的 CC-BY-NC-SA-4.0 许可证。两者拥有相同的 4.7 亿参数架构,不同的训练数据,许可证则完全相反。Apache 版本正是 IBM 所指的面向"其他用例"的模型——用供应商的话说就是商业生产——同时它也是承载头条数据的那个版本:IBM 报告称,在单个 NVIDIA H200 上,聚合吞吐量超过 12,600 RTFx,按 IBM 的说法,这相当于使用批量推理每秒可转录超过三个半小时的英语音频。

那个速度数字是厂商一天前发布的宣称,尚未经任何第三方复现,所以应将其视为一个亮眼的纸面数据,而非经审计的事实。但它仍然值得你关注,原因在于其背后的设计:Granite Speech 5.0 TurboCTC 去掉了以往所有 Granite Speech 模型都使用的语言模型解码器,只保留一个纯 Conformer 编码器,用联结主义时间分类(CTC)训练,并以非自回归方式解码。正是因为没有逐 token 的生成循环,一个 470M 参数的模型才能宣称吞吐量超过数倍于其规模的模型——这也是本次发布对任何构建语音转文字系统的人都很重要的原因,而不仅仅是为了基准测试榜单。

实际发布的内容

两个检查点均于2026年8月25日在ibm-granite Hugging Face组织上发布,均为仅英语的ASR,采用相同的仅编码器架构:

• Granite Speech 5.0 470M TurboCTC — Apache 2.0,允许商业使用,基于约 60,000 小时的英语音频训练。

• Granite Speech 5.0 470M TurboCTC-NC —— CC-BY-NC-SA-4.0,仅限研究与非商业用途,基于约 75,000 小时的英语音频训练。

本文介绍的是 Apache 模型——即产品可以合法依赖的那个版本——并在需要说明许可协议之处提及 -NC 孪生版本。两个检查点均以 safetensors 格式提供 F32 和 BF16 版本,并且都通过 AutoModelForCTC 和 AutoProcessor 在 Hugging Face Transformers 中获得原生支持。该功能将在下一个 Transformers 版本中推出;在此之前,你需要从源码安装 Transformers,加载处理器和模型,然后运行贪心解码。IBM 还提供了一个基于浏览器的 WebGPU 流式演示,这是最快能听到实际延迟有多低的方法。

架构押注:只有编码器,没有解码器,每秒12.5个token

设计变更就是速度宣称背后的故事。早期的 Granite Speech 版本将声学编码器与投影器和语言模型解码器配对,而那个解码器正是被移除的部分。Granite Speech 5.0 470M TurboCTC 是一个使用 CTC 训练的 16 层 Conformer 编码器,推理过程是单次非自回归贪心搜索。没有需要采样的内容,因此无需等待生成延迟。

三个配置细节让它不仅小巧,而且快速:

• 按8倍进行时间子采样。前端以每秒100帧的速度运行;模型以每秒12.5个token的速度输出。对log-mel帧进行堆叠和跳帧处理,然后在前两个Conformer模块中进行步长卷积和池化残差操作,分三个2倍阶段降低输出率。

• 使用子词词汇表而非字符。早期 Granite Speech 编码器每秒输出 50 个字符;5.0 每秒从包含 16,384 个单元的 BPE 词汇表(-NC 变体中的 SentencePiece)输出 12.5 个子词标记。每秒音频的输出单元越少,CTC 解码器需要做出的决策就越少。

• Self-conditioned CTC。中间的 Conformer 层细化模型自身的中间表示,这一技巧使小型编码器在解码器被移除时仍能保持其准确性。

所有这些都包含在模型卡和IBM的技术文档中。总而言之,这是一个为笔记本电脑、手机和流式处理管线而构建的检查点,在这些场景下,重量级的自回归解码器并不适用——IBM自己的描述也明确表明了这种边缘端定位。

IBM所声称的数字

本节中的所有内容均由 IBM 报告,通过 Open ASR 排行榜的公共测试工具在 Hugging Face 基础设施上运行,截至 2026 年 8 月 25 日,且未经独立复现。请将其视为看似可信的供应商数据,而非既定事实:

• 吞吐量——在单个 NVIDIA H200 上通过批处理推理实现超过 12,600 RTFx,IBM 将其解读为每秒处理超过 3.5 小时的音频。IBM 还表示,这比早期 Granite Speech 模型的吞吐量高出 20 倍以上。这是数据中心 GPU 批处理推理的数据,并非笔记本电脑能达到的水平。

• 准确性 — Apache 模型在 Open ASR 排行榜的公开英语短格式测试集上实现了 5.00% 的聚合词错误率(-NC 变体在同一测试集上得分 4.85%)。推理通过 Hugging Face 的 Jobs 基础设施运行,并使用排行榜的工具进行评分,因此 IBM 预计一旦新模型被纳入官方表格,这些成绩将与之匹配。

远场——在FFASR噪声与混响排行榜上,Apache模型准确率排名第九,-NC模型排名第五,两者是该榜单上速度最快的条目(吞吐量在单个NVIDIA L4上测得)。

• 训练——为Apache模型提供了约60,000小时的公共英语音频,在IBM的Blue Vela集群上使用八块NVIDIA H100于十天内完成。

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

Apache 2.0 实际上能给你带来什么

此版本的独特之处在于其许可证。开放权重的语音模型通常以研究许可证发布,或附带让生产团队法务部门皱眉的义务;而在这里,商业可用的那个版本恰恰是IBM在准确率上得分略低的那个。你用0.15个百分点的整体词错误率(WER)(5.00%对4.85%)换取了在产品中部署、将输出商业化、微调并保留派生权重,以及在云基础设施中使用而无需受研究专用条款阻碍的权利。

如果一味追逐排行榜,这种取舍很容易朝着错误的方向进行。-NC模型的4.85%来自大约15,000小时的额外训练数据(GigaSpeech和SPGI Speech),而且IBM明确将这一版本标记为"仅限研究和非商业用途"。它是一个不错的基准测试模型,但作为产品依赖却是个糟糕的选择。Apache模型在准确性上略有损失,但换来的是能够作为商业转录流水线、呼叫中心QA系统或边缘设备的基础。如果你正在评估这个系列,许可决策应先于基准测试决策。

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

你将放弃什么

去除语言模型并非没有代价,模型卡坦诚地说明了这些削减:

• 无语音翻译。早期的 Granite Speech 版本可以在转录时通过语言模型进行翻译;5.0 仅支持转录。

• 无关键词偏置。LM 此前还会对领域术语和名称进行偏置;去掉该偏置后,你得到的就是子词词汇表自然产生的结果。

• 仅英文。此版本中没有多语言检查点,也没有迹象表明近期会推出。

5.00%的WER是短格式、干净音频下的数据。FFASR结果(第九名,基于嘈杂的远场语音)才是更能反映会议室和免提使用场景的指标,而且它是一个排名,而非一个宣传数字。

对于窄范围转写任务——通话音频、会议、语音备忘录、字幕、听写——这些都不是障碍。只有当你想让一个小模型顺带翻译,或者能开箱即用地可靠转写自定义词汇表时,这些才会成为问题。

今天如何运行它

你不需要一个尚不存在的云端API。模型在本地运行:

• 从源代码安装 Transformers(最新版本中尚不包含 CTC 特性集),然后 AutoModelForCTC 加上 AutoProcessor 和贪心解码——标准流程。处理器可以在模型设备上计算 log-mel 特征,省去一次从主机到设备的复制。

• 模型卡示例是通过pipeline实现的两行代码:使用模型"ibm-granite/granite-speech-5.0-470m-turboctc"进行automatic-speech-recognition。

WebGPU 流式演示在浏览器标签页中运行,是在投入一个下午搭建基准测试框架之前衡量延迟的最快方式。

• 对于生产环境,实际问题是服务部署。这类开放ASR模型通常运行在CPU或小型GPU上,采用类似批量流式推理的方式——12,600 RTFx 这个头条数字是 H200 的批量数据;实际单流笔记本电脑上的数字会低得多,而且IBM尚未公布 time-to-first-token(首令牌延迟)数据。

这个服务层才是开放ASR真正的成本和复杂性所在,也是路由平台体现价值的地方。OrcaRouter的模式是一个API覆盖200多个模型,按提供商列表价以0%加价原样直传——所以供应商一降价,当天就会生效——再加上跨提供商的自动故障转移,以及用于将多个模型组合成一次调用的路由DSL。这些都不适用于Granite Speech 5.0 470M TurboCTC,因为它的两个变体都还没上架OrcaRouter:权重发布才一天,还没有商业提供商在提供服务。当这样的开放语音模型真正获得托管路径时——或者当你拿它与市面上已有的托管ASR API做对比时——路由层让你无需重写集成就能先试用、再回退,而原价直传的定价方式则保证了这种对比的真实可信。

仍未确认的是什么?

一个才诞生一天的模型,其相关资料记录还很有限,值得明确列出目前尚不清楚的事项:

• 没有第三方基准测试。12,600 RTFx、5.00% WER 以及 FFASR 排名全是 IBM 自己通过公共排行榜框架运行得出的。没有任何独立方发布过相关数字。

• 没有IBM托管的API。没有watsonx模型页面,没有托管端点,没有定价,也没有这些功能何时推出的日期。

• 未提供流式延迟数据。虽有流式支持和 WebGPU 演示,但未给出首 token 耗时和分块延迟数据。

• 尚未在相同的测试条件下与其他快速开放ASR模型进行比较。那些重要的对决——与Whisper large-v3、NVIDIA Parakeet TDT 0.6B以及托管转录API的对比——还没有人在完全相同的数据上运行过。

接下来看什么

近期信号是独立复现的结果。Open ASR 排行榜是公开的,评估框架是标准的,权重也放在 Hugging Face 上,因此第三方运行应该几天内就能落地——要观察 5.00% 能否保持,以及 12,600 RTFx 在 IBM 自家批量环境之外的单块 H200 上是否依然成立。另一个值得关注的是,IBM 是否会把这个 Apache 孪生版本变成托管服务,因为一旦提供 watsonx 端点,它就会立刻成为商业路径最可信的开源 ASR。Granite Speech 5.0 470M TurboCTC 在发布首日就是一个真正快速、许可真正宽松的英文 ASR,只是验证痕迹还非常单薄。前两点是实实在在的;第三点只是时间问题。

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube