
Granite Speech 5.0 470M TurboCTC:IBM 的 Apache-2.0 ASR 宣称达到 12,600 RTFx
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
Granite Speech 5.0 470M TurboCTC 是 IBM 最新语音发布中真正允许你投入商用的模型,而这正是关于它首先需要了解的一点。2026 年 8 月 25 日,IBM 在 Hugging Face 上发布了两个英语语音识别检查点——{{1}}Granite Speech 5.0 470M TurboCTC{{/1}} 采用 Apache 2.0 许可证,而 {{2}}Granite Speech 5.0 470M TurboCTC-NC{{/2}} 则采用非商业性质的 CC-BY-NC-SA-4.0 许可证。两者拥有相同的 4.7 亿参数架构,不同的训练数据,许可证则完全相反。Apache 版本正是 IBM 所指的面向"其他用例"的模型——用供应商的话说就是商业生产——同时它也是承载头条数据的那个版本:IBM 报告称,在单个 NVIDIA H200 上,聚合吞吐量超过 12,600 RTFx,按 IBM 的说法,这相当于使用批量推理每秒可转录超过三个半小时的英语音频。
那个速度数字是厂商一天前发布的宣称,尚未经任何第三方复现,所以应将其视为一个亮眼的纸面数据,而非经审计的事实。但它仍然值得你关注,原因在于其背后的设计:Granite Speech 5.0 TurboCTC 去掉了以往所有 Granite Speech 模型都使用的语言模型解码器,只保留一个纯 Conformer 编码器,用联结主义时间分类(CTC)训练,并以非自回归方式解码。正是因为没有逐 token 的生成循环,一个 470M 参数的模型才能宣称吞吐量超过数倍于其规模的模型——这也是本次发布对任何构建语音转文字系统的人都很重要的原因,而不仅仅是为了基准测试榜单。
实际发布的内容
两个检查点均于2026年8月25日在ibm-granite Hugging Face组织上发布,均为仅英语的ASR,采用相同的仅编码器架构:
• Granite Speech 5.0 470M TurboCTC — Apache 2.0,允许商业使用,基于约 60,000 小时的英语音频训练。
• Granite Speech 5.0 470M TurboCTC-NC —— CC-BY-NC-SA-4.0,仅限研究与非商业用途,基于约 75,000 小时的英语音频训练。
本文介绍的是 Apache 模型——即产品可以合法依赖的那个版本——并在需要说明许可协议之处提及 -NC 孪生版本。两个检查点均以 safetensors 格式提供 F32 和 BF16 版本,并且都通过 AutoModelForCTC 和 AutoProcessor 在 Hugging Face Transformers 中获得原生支持。该功能将在下一个 Transformers 版本中推出;在此之前,你需要从源码安装 Transformers,加载处理器和模型,然后运行贪心解码。IBM 还提供了一个基于浏览器的 WebGPU 流式演示,这是最快能听到实际延迟有多低的方法。
架构押注:只有编码器,没有解码器,每秒12.5个token
设计变更就是速度宣称背后的故事。早期的 Granite Speech 版本将声学编码器与投影器和语言模型解码器配对,而那个解码器正是被移除的部分。Granite Speech 5.0 470M TurboCTC 是一个使用 CTC 训练的 16 层 Conformer 编码器,推理过程是单次非自回归贪心搜索。没有需要采样的内容,因此无需等待生成延迟。
三个配置细节让它不仅小巧,而且快速:
• 按8倍进行时间子采样。前端以每秒100帧的速度运行;模型以每秒12.5个token的速度输出。对log-mel帧进行堆叠和跳帧处理,然后在前两个Conformer模块中进行步长卷积和池化残差操作,分三个2倍阶段降低输出率。
• 使用子词词汇表而非字符。早期 Granite Speech 编码器每秒输出 50 个字符;5.0 每秒从包含 16,384 个单元的 BPE 词汇表(-NC 变体中的 SentencePiece)输出 12.5 个子词标记。每秒音频的输出单元越少,CTC 解码器需要做出的决策就越少。
• Self-conditioned CTC。中间的 Conformer 层细化模型自身的中间表示,这一技巧使小型编码器在解码器被移除时仍能保持其准确性。
所有这些都包含在模型卡和IBM的技术文档中。总而言之,这是一个为笔记本电脑、手机和流式处理管线而构建的检查点,在这些场景下,重量级的自回归解码器并不适用——IBM自己的描述也明确表明了这种边缘端定位。
IBM所声称的数字
本节中的所有内容均由 IBM 报告,通过 Open ASR 排行榜的公共测试工具在 Hugging Face 基础设施上运行,截至 2026 年 8 月 25 日,且未经独立复现。请将其视为看似可信的供应商数据,而非既定事实:
• 吞吐量——在单个 NVIDIA H200 上通过批处理推理实现超过 12,600 RTFx,IBM 将其解读为每秒处理超过 3.5 小时的音频。IBM 还表示,这比早期 Granite Speech 模型的吞吐量高出 20 倍以上。这是数据中心 GPU 批处理推理的数据,并非笔记本电脑能达到的水平。
• 准确性 — Apache 模型在 Open ASR 排行榜的公开英语短格式测试集上实现了 5.00% 的聚合词错误率(-NC 变体在同一测试集上得分 4.85%)。推理通过 Hugging Face 的 Jobs 基础设施运行,并使用排行榜的工具进行评分,因此 IBM 预计一旦新模型被纳入官方表格,这些成绩将与之匹配。
远场——在FFASR噪声与混响排行榜上,Apache模型准确率排名第九,-NC模型排名第五,两者是该榜单上速度最快的条目(吞吐量在单个NVIDIA L4上测得)。
• 训练——为Apache模型提供了约60,000小时的公共英语音频,在IBM的Blue Vela集群上使用八块NVIDIA H100于十天内完成。

Apache 2.0 实际上能给你带来什么
此版本的独特之处在于其许可证。开放权重的语音模型通常以研究许可证发布,或附带让生产团队法务部门皱眉的义务;而在这里,商业可用的那个版本恰恰是IBM在准确率上得分略低的那个。你用0.15个百分点的整体词错误率(WER)(5.00%对4.85%)换取了在产品中部署、将输出商业化、微调并保留派生权重,以及在云基础设施中使用而无需受研究专用条款阻碍的权利。
如果一味追逐排行榜,这种取舍很容易朝着错误的方向进行。-NC模型的4.85%来自大约15,000小时的额外训练数据(GigaSpeech和SPGI Speech),而且IBM明确将这一版本标记为"仅限研究和非商业用途"。它是一个不错的基准测试模型,但作为产品依赖却是个糟糕的选择。Apache模型在准确性上略有损失,但换来的是能够作为商业转录流水线、呼叫中心QA系统或边缘设备的基础。如果你正在评估这个系列,许可决策应先于基准测试决策。

你将放弃什么
去除语言模型并非没有代价,模型卡坦诚地说明了这些削减:
• 无语音翻译。早期的 Granite Speech 版本可以在转录时通过语言模型进行翻译;5.0 仅支持转录。
• 无关键词偏置。LM 此前还会对领域术语和名称进行偏置;去掉该偏置后,你得到的就是子词词汇表自然产生的结果。
• 仅英文。此版本中没有多语言检查点,也没有迹象表明近期会推出。
5.00%的WER是短格式、干净音频下的数据。FFASR结果(第九名,基于嘈杂的远场语音)才是更能反映会议室和免提使用场景的指标,而且它是一个排名,而非一个宣传数字。
对于窄范围转写任务——通话音频、会议、语音备忘录、字幕、听写——这些都不是障碍。只有当你想让一个小模型顺带翻译,或者能开箱即用地可靠转写自定义词汇表时,这些才会成为问题。
今天如何运行它
你不需要一个尚不存在的云端API。模型在本地运行:
• 从源代码安装 Transformers(最新版本中尚不包含 CTC 特性集),然后 AutoModelForCTC 加上 AutoProcessor 和贪心解码——标准流程。处理器可以在模型设备上计算 log-mel 特征,省去一次从主机到设备的复制。
• 模型卡示例是通过pipeline实现的两行代码:使用模型"ibm-granite/granite-speech-5.0-470m-turboctc"进行automatic-speech-recognition。
WebGPU 流式演示在浏览器标签页中运行,是在投入一个下午搭建基准测试框架之前衡量延迟的最快方式。
• 对于生产环境,实际问题是服务部署。这类开放ASR模型通常运行在CPU或小型GPU上,采用类似批量流式推理的方式——12,600 RTFx 这个头条数字是 H200 的批量数据;实际单流笔记本电脑上的数字会低得多,而且IBM尚未公布 time-to-first-token(首令牌延迟)数据。
这个服务层才是开放ASR真正的成本和复杂性所在,也是路由平台体现价值的地方。OrcaRouter的模式是一个API覆盖200多个模型,按提供商列表价以0%加价原样直传——所以供应商一降价,当天就会生效——再加上跨提供商的自动故障转移,以及用于将多个模型组合成一次调用的路由DSL。这些都不适用于Granite Speech 5.0 470M TurboCTC,因为它的两个变体都还没上架OrcaRouter:权重发布才一天,还没有商业提供商在提供服务。当这样的开放语音模型真正获得托管路径时——或者当你拿它与市面上已有的托管ASR API做对比时——路由层让你无需重写集成就能先试用、再回退,而原价直传的定价方式则保证了这种对比的真实可信。
仍未确认的是什么?
一个才诞生一天的模型,其相关资料记录还很有限,值得明确列出目前尚不清楚的事项:
• 没有第三方基准测试。12,600 RTFx、5.00% WER 以及 FFASR 排名全是 IBM 自己通过公共排行榜框架运行得出的。没有任何独立方发布过相关数字。
• 没有IBM托管的API。没有watsonx模型页面,没有托管端点,没有定价,也没有这些功能何时推出的日期。
• 未提供流式延迟数据。虽有流式支持和 WebGPU 演示,但未给出首 token 耗时和分块延迟数据。
• 尚未在相同的测试条件下与其他快速开放ASR模型进行比较。那些重要的对决——与Whisper large-v3、NVIDIA Parakeet TDT 0.6B以及托管转录API的对比——还没有人在完全相同的数据上运行过。
接下来看什么
近期信号是独立复现的结果。Open ASR 排行榜是公开的,评估框架是标准的,权重也放在 Hugging Face 上,因此第三方运行应该几天内就能落地——要观察 5.00% 能否保持,以及 12,600 RTFx 在 IBM 自家批量环境之外的单块 H200 上是否依然成立。另一个值得关注的是,IBM 是否会把这个 Apache 孪生版本变成托管服务,因为一旦提供 watsonx 端点,它就会立刻成为商业路径最可信的开源 ASR。Granite Speech 5.0 470M TurboCTC 在发布首日就是一个真正快速、许可真正宽松的英文 ASR,只是验证痕迹还非常单薄。前两点是实实在在的;第三点只是时间问题。

