
VibeVoice-ASR-Streaming-1.5B 对比 Granite Speech 5.0 470M TurboCTC:两个低调的开权重流式识别选择
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
2026年8月下旬,两个最有趣的开源权重流式语音转文本发布均未伴随任何发布活动。8月25日,IBM在Hugging Face上发布了Granite Speech 5.0 470M TurboCTC——仅有权重、模型卡和一篇博客文章,再无其他——而9月2日,微软研究院在microsoft命名空间下上传了VibeVoice-ASR-Streaming-1.5B,除了其VibeVoice GitHub仓库中的一条新闻动态外,没有任何公告。它们是同类事物,却是截然相反的工程押注:IBM的模型是一个4.7亿参数的纯CTC编码器,设计用于在笔记本电脑上以边缘速度运行;而微软的模型是一个1.5B级别的语音语言模型,包裹在音频分词器和扩散头中——总计约30亿参数——旨在转录的同时将语音理解为语言。
在给出这些数字之前,先说明那些保证本对比诚实可信的资料来源标注。所有标注为IBM报告的内容均来自Granite Speech 5.0 470M TurboCTC模型卡及其Open ASR排行榜条目,由IBM在发布当天通过官方测试工具运行得出,尚未被独立复现。关于VibeVoice-ASR-Streaming-1.5B的所有信息均来自研读其代码仓库——包括配置文件、模型卡以及微软的流式文档——因为微软尚未以文本形式发布任何准确性或延迟数据,且微软之外也无人对该检查点进行过基准测试。两者并未在同一测试框架中运行;本对比将二者与相同的公开证据进行对照,而这也是两家公司迄今所提供的全部资料。
两次低调的发布,相隔八天
这两个模型的发布方式同样悄无声息,这一点值得直说,因为两家公司此后都鲜有表态。IBM的Granite Speech 5.0 470M TurboCTC是Apache-2.0许可下双版本发布的一员——IBM还发布了一个非商业用途的-NC姊妹版本,其头版数字略胜一筹——该模型卡标注的发布日期为2026年8月25日,原生支持Transformers,同日还提交了Open ASR排行榜。微软的流式模型组合VibeVoice-ASR-Streaming-7B和VibeVoice-ASR-Streaming-1.5B于9月2日同一分钟内创建于Hugging Face;GitHub上宣布"一款统一的流式ASR模型,能够在语音到来时持续转写谁说了什么"的新闻稿日期为9月3日,并点名了7B版本,而本文所覆盖的1.5B则是悄无声息随之发布的小型姊妹版本。
有趣的是,两个团队都抓住了“流式”这个词,却做出了截然相反的东西。Granite Speech 5.0 470M TurboCTC 是一个用 CTC 训练的 Conformer 编码器,解码只需单次非自回归过程——没有逐 token 生成文本的解码器,因此它在结构上开销低、速度快。VibeVoice-ASR-Streaming-1.5B 则是一个语音 LLM:两个卷积 tokenizer 将 24 kHz 音频转成约 7.5 Hz 的语音 token 流,一个 Qwen2 系列解码器(28 层、1,536 个隐藏单元,即 1.5B 级别)读取该 token 流,再由扩散头分块生成转录文本,每块约 2.9 秒,并带约半秒的前瞻。前者是赛车;后者则是一个恰好会听的小型语言模型。
规格检查
• 参数 — Granite Speech 5.0 470M TurboCTC:470M,仅编码器(encoder-only);VibeVoice-ASR-Streaming-1.5B:总计约3B(1.5B级LM主干,外加tokenizer和扩散头)。
• 架构 — 采用块级自注意力与自条件化的Conformer编码器,经CTC训练并使用贪婪非自回归解码;另一方案则为声学/语义双分词器,向带DDPM扩散头的Qwen2系列因果解码器馈送输入。
• 输出节奏 — 约每秒 12.5 个输出帧(分块流式),对比语音令牌的约 7.5 Hz;每约 2.9 秒的块发出文本,带约 0.5 秒的前瞻。
语言 — 仅英语 vs 十种:中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
• 权重 — 约 0.5B 参数 / 零点几 GB,边缘级 vs ~5.6 GB bf16,NVIDIA GPU 级。
• 印刷品中的准确率——IBM在Open ASR短格式测试集上报告的平均WER约为5.00%,而文中未公布任何WER数据。
• 许可证 — Apache-2.0 对比 MIT.
• 发布 — 2026年8月25日 vs 2026年9月2日。

速度:一个为小巧而生,另一个为语言模型而生。
架构差异首先体现在速度和硬件上。Granite Speech 5.0 470M TurboCTC 面向笔记本电脑、智能手机和其他边缘设备。由于纯 CTC 编码器不进行采样——输出是在 16,384 单元的 BPE 头上进行单次贪心解码——其运行成本极低;IBM 的模型卡报告称,TurboCTC 系列在单个 H200 上测得的 Open ASR 吞吐量达到数万 RTFx,此外还有一个 WebGPU 演示,可在浏览器标签页中实时转写。这些数字是 IBM 自行测量且未经复现的,但结构上的论点本身就成立:一个没有自回归解码器的 470M 编码器,是可以运行在手机所搭载硬件上的模型。
VibeVoice-ASR-Streaming-1.5B 做出了相反的取舍。其解码器是因果语言模型,这意味着文本的生成过程比 CTC 的 argmax 循环更重;而文档中记载的运行方式是在 NVIDIA GPU 上自行托管——即 microsoft/VibeVoice 仓库中的 Python 演示代码或它的 vLLM 插件——在计入任何 KV 缓存之前就需要约 5.6 GB 的 bf16 权重。微软没有公布任何吞吐量或实时率的声明,因此没有厂商数据能与 IBM 的数据对勘。LLM 架构换来的是上下文:模型会以语言模型的方式,把对说话人和内容的理解贯穿于整个转录文本,这正是“转录音声”与“跟上对话”之间的差别。
准确性:一家供应商打印的是数字,另一家打印的是图片。
在证据层面,Granite Speech 5.0 470M TurboCTC 领先 VibeVoice-ASR-Streaming-1.5B 整整一个可发表的基准测试。IBM 在发布当天使用官方 Open ASR 排行榜工具对其模型进行了测试,并报告在公开英语短语音集上的平均词错误率约为 5.00%——这一数字由供应商自行测量,未经任何第三方验证,而且在微软的这一对比侧完全不存在。VibeVoice-ASR-Streaming-1.5B 的模型卡以图片形式附带评估结果图,但没有文字形式的数值 WER、RTF 或延迟;VibeVoice 系列中唯一的数值锚点是批处理 VibeVoice-ASR 模型卡上供应商报告的 7.77% 平均 WER,覆盖八个英语测试集,但该数字描述的是非流式模型,不能套用。无论最终独立测试结果如何,目前诚实的总结是:IBM 发布了一个数字,而微软发布了一张图片。

语言与输出:仅英语与“谁说了什么”(十分钟)的对比
Granite Speech 5.0 470M TurboCTC 仅支持英语,并返回原始转写文本。对于 IBM 所瞄准的工作负载——边缘硬件上的企业级英语转写——这并非缺陷;但一旦你的音频不是英语,比较就到此为止。VibeVoice-ASR-Streaming-1.5B 列出了十种语言,并声称提供流式说话人归属输出:模型卡称其能“在语音到达时持续转写谁说了什么”,并将领域术语热词作为上下文提示传入。这两项额外功能都值得审慎看待——跨分块边界的流式说话人分离确实很难,且该说法尚未得到验证——但它们正是有实时多语言会议需求的团队会考虑微软模型的原因所在。
许可与生态系统:Apache-2.0 对比 MIT,Transformers 对比研究型代码仓库
这两种许可证都允许商业使用,这已经足以将这一对与 IBM 自家同一架构的 -NC 变体区分开来。Granite Speech 5.0 470M TurboCTC 采用 Apache-2.0 许可证,附带常规专利授权,并且原生支持 Hugging Face Transformers(来自 transformers >= 5.16 的 AutoModelForCTC)以及面向 Apple Silicon 的 mlx-audio——这意味着,凡是该生态系统中最大部署社区能运行的地方,它都能运行,且支持任何厂商的硬件。VibeVoice-ASR-Streaming-1.5B 采用 MIT 许可证,说起来更简单,但其服务路径是一种从源码构建的研究型方案:该检查点的架构类 VibeVoiceForASRStreamingTraining 不在公开的 Transformers 文档中,微软自己的流式文档指向的也是该仓库的演示代码和一个 vLLM 插件,而不是现成的标准库加载方式。对生产团队而言,这种差异是实实在在的:一个模型今天就能直接接入现有的 Transformers 流水线,而另一个则要求你自行搭建研究仓库并亲自验证加载路径。

您应该评估哪个安静版本?
如果你的工作负载是英语、硬件属于边缘级或受 CPU 限制,并且你希望获得一个能直接接入 Transformers、其模型卡上带有可用于对照 sanity-check 的数字的模型,那么请先评估 Granite Speech 5.0 470M TurboCTC。它在每一个维度上都是风险较低的选择,除了一点——它无法帮助你处理第二语言,也无法处理需要知道谁在说话的实时会议转录。
如果你需要多语言流式识别,想测试说话人分离输出或热词这类功能,或者更愿意押注于基于语言模型的语音方案而非纯编码器,那么可以评估 VibeVoice-ASR-Streaming-1.5B。预算需要覆盖一块 NVIDIA GPU、从源码安装、约 5.6 GB 的权重,以及一套你自行设计的评测方案——因为至今还没有任何人(包括微软在内)发布过你可以真正信赖的数字。
无论是哪一项低调发布,都不会改变这一点:在尚未确定哪个押注能兑现之前,让 ASR 层保持可替换仍然是有价值的。这两个模型都还很年轻,而且截至本文撰写之时,两者都尚未通过 OrcaRouter 提供服务;当某个提供商托管其中任何一个时,低风险的试用方式是将它放在一个路由层后面,该路由层前置 200 多个模型,按提供商标价收费——零加价,因此价格变动当日同步生效——并自动故障转移到你原本就信任的任何模型。将一小部分真实音频路由到新模型,阅读转写文本,让你自己的流量,而不是发布当天的基准测试表,来决定哪项低调的押注才是正确的。
