Muse Voice Transcribe 与 Granite Speech 5.0 470M TurboCTC 对决的主标题卡片,一侧显示标注为 12,600 RTFx 的自托管 GPU 芯片,另一侧显示标注为 20+ 说话人的流式波形。
Guides & Insights

Muse Voice Transcribe 对比 Granite Speech 5.0 470M TurboCTC:自有 GPU 或按量计费 API

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

关于这场对决,最值得了解的一点是:Muse Voice Transcribe 和 Granite Speech 5.0 470M TurboCTC 几乎算不上彼此替代品。IBM 于 2026 年 8 月 25 日发布了 Granite Speech 5.0 470M TurboCTC,这是一个 4.7 亿参数、Apache-2.0 许可、仅限英语的 ASR 模型,专为自托管而构建——它是一款仅编码器的 Conformer 模型,采用 CTC 训练,IBM 表示其在单个 NVIDIA H200 上的转录速度超过实时速度的 12,600 倍。Meta Superintelligence Labs 于 2026 年 9 月 1 日发布了 Muse Voice Transcribe,这是一个专有、托管、流式音频感知模型——上线时已验证支持 25 种语言、20 种以上说话人分离、端点检测,价格为每 1,000 音频分钟 3.00 美元。一个想要你的 GPU;另一个想要你的 API 密钥。比较它们宣传中的 WER 数字会完全偏离重点——真正的问题在于转录被允许在哪里发生,以及每个模型到达那里之后还能做什么。

两种部署理念

Granite Speech 5.0 470M TurboCTC 是开放权重边缘语音识别运动的巅峰之作。凭借 470M 参数,它可以轻松运行在笔记本电脑、手机或单块 GPU 上;其许可证为 Apache-2.0,因此你可以将其嵌入商业产品;IBM 还提供了一个 WebGPU 演示,完全不需要服务器即可在浏览器标签页中实时运行转录。该架构刻意做了精简——16 个 Conformer 块、贪心解码、无语言模型主干——因为整个设计目标就是在普通硬件上实现高吞吐量。Muse Voice Transcribe 则押注相反方向:一个你永远看不到的大型专有模型,由 Meta 的基础设施提供服务,价格为每音频小时 0.18 美元,价值体现在功能而非硬件上。如果你的约束条件是“音频不能离开这栋大楼”,那么选择已经确定,那就是 Granite。如果你的约束条件是“我想要最强大的流式模型,并且愿意按分钟付费”,那就是 Muse。

A generated two-column scoreboard titled 'Muse Voice Transcribe vs Granite Speech 5.0 470M TurboCTC — the scoreboard.' Left column Muse Voice Transcribe: Deployment hosted API only, License proprietary closed weights, WER 3.1% streaming (Meta-reported), Languages 25 verified code-switch, Diarization 20+ speakers, Endpointing built-in. Right column Granite Speech 5.0 470M TurboCTC: Deployment self-host 470M params, License Apache-2.0 open weights, WER 5.00% Open ASR (IBM-reported), Languages English only, Diarization none, Endpointing none. Footer reads 'Muse figures Meta-reported; Granite 12,600 RTFx and 5.00% WER IBM-reported, unreproduced.'

速度在这里有不同的含义

Granite 的主打数字 12,600 RTFx 是一个吞吐量指标:一台 H200 运行批量推理时,每秒能处理 12,600 秒的音频——也就是每秒钟消化三个半小时的音频。对于呼叫中心积压、媒体档案库或任何需要持续向 GPU 喂数据的批量流水线来说,这才是真正重要的指标。它不是延迟指标,而单流交互式延迟也并非该模型的强项。Muse Voice Transcribe 则是镜像的另一面:它的 80 毫秒分块处理和自适应延迟是为说话者停顿后的前 300 毫秒打造的,而不是为持续的大批量吞吐设计的。在各自为之设计的指标上,两者都很出色;而在对方的优势领域,两者都发挥不出自己的长处。如果你需要转录一百万小时的英语归档音频,Granite 在原始经济效益上以数量级优势胜出。如果你需要把正在进行的多说话人实时对话转成带标签的文本,只有 Muse 提供这样的能力。

准确性,如实标注

• Granite Speech 5.0 470M TurboCTC — 在 Open ASR 排行榜的公开英语短表单测试集上,聚合词错误率(WER)为 5.00%;该结果由 IBM 自行运行官方测试工具得出,由供应商报告且未经复现,且仅针对英语音频。

• Muse Voice Transcribe — 流式词错误率 3.1%,系 Meta 发布当天引述 Artificial Analysis 流式排行榜的说法;首次部分转写为 3.6%;同样为供应商报告,且未被复现。

这两个数字不能直接比较——语料库不同,一个是仅英语且离线的,一个是多语言且流式的——这正是这场对决不应仅凭WER来决定的原因。就现有证据而言,两者各自在其工作负载下都看似合理,但均未经验证。从结构上可以确定的是,Granite的数字仅覆盖英语,而Muse的主张处于流式、语码转换的语境中,Granite根本无法与之竞争。

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

每个模型根本无法做到的事情

Granite Speech 5.0 470M TurboCTC 抛弃了让转录文本对产品团队有用的一切。它仅支持英语。它没有说话人分离——所有声音都汇入同一条流中。它不输出标点、大写或时间戳,而且CTC设计放弃了早期Granite Speech模型拥有的关键词偏置和语音翻译。这些不是质量缺陷,而是架构选择;它们意味着基于Granite构建的生产堆栈仍然需要额外添加标点模型、说话人分离器和VAD层。Muse Voice Transcribe 将这些功能融入模型本身:20+说话人分离和端点检测随文字一起输出,而且具备句中间语码转换的语言覆盖,这是Granite完全无法企及的。实话实说:Granite是一个识别引擎,它假设你会去构建产品;而Muse是一个产品形态的API,它假设你希望在拿到结果时就有转录文本、说话人和话语边界。

许可和所有权

Granite Speech 5.0 470M TurboCTC 采用 Apache-2.0 许可证,同时还有一个非商业姊妹版本(granite-speech-5.0-470m-turboctc-nc,CC-BY-NC-SA-4.0),供研究使用,得益于额外训练数据,其词错误率略低,为 4.85%。Apache-2.0 意味着你可以托管它、嵌入它、微调它,并围绕它销售产品,无需支付版税,也没有审计风险。Muse Voice Transcribe 是封闭且仅限托管的:不提供权重、不能自托管、不能微调,你的转录数据会经由 Meta 的服务处理,并受 Meta 条款约束。对于受监管行业,或任何数据政策禁止第三方音频处理的团队,仅此一点就足以在基准测试开始之前结束比较。对于其他所有人来说,“Apache-2.0 加自备 GPU”和“专有且按量计费”只是不同的风险特征,而非优劣之分。

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc showing the English-language and automatic-speech-recognition tags, a model summary describing a compact 470 million parameter English ASR model, the safetensors and Transformers tags, and the Open ASR leaderboard evaluation table.

成本问题

Granite 在 12,600 RTFx 下,让批量英语音频的自托管经济账几乎显得离谱:一小时的 H200 算力可覆盖超过 12,000 小时的音频,因此按典型租赁价格,转录一千小时音频仅需几美元的原始 GPU 算力——这还没算空闲时间、工程成本,以及缺失的说话人分离层。Muse Voice Transcribe 按每音频小时 0.18 美元计费,作为流式 API 算便宜,但相比一台满载运行的 GPU 就不便宜了。实在的经验法则是:如果音频是英语、预先录制的,且你有批量需求,自托管 Granite 在经济上完胜。如果音频是实时的、多说话人的或涉及多语言,Muse 的定价定位是托管功能服务——一千小时实时、带说话人分离和端点检测的流式转录收费 180 美元,相对于你自己搭建这套技术栈的成本,是个很小的数字。

同时运行两者,而不会弄得一团糟。

需要同时使用两种方案的团队——英语批处理场景自托管 Granite,实时多语言对话使用托管 API——最终会得到两个截然不同的集成方式。托管的那一半正是路由网关所服务的工作负载形态:一个 API 密钥对接多家供应商,按标价透传且零加价,因此供应商给出的每分钟费用就是你实际支付的金额;一旦某个供应商端点性能下降,还能自动故障转移。自托管的那一半则完全归你所有。Granite 运行在你自己的硬件上,无需通过网关进行路由——但它所隐含的混合技术栈,恰恰是单一 API 平台存在的意义所在:避免其演变成两个并行的工程项目。

你应该选哪一个?

如果你的工作是规模化英语转录——档案、通话录音、字幕流水线——并且你手头有 GPU 可以投入,那么 Granite Speech 5.0 470M TurboCTC 在成本、许可和控制力上是更优的工程决策,但前提是你需要自己搭建标点、说话人分离和流式层。如果你的工作是实时、多人或多语言对话——语音代理、实时字幕、会议产品——Muse Voice Transcribe 提供了 Granite 所没有的功能,以托管 API 的价格出售,但前提是它的数字只是发布当日在闭源权重上的宣传。它们与其说是竞争对手,不如说是对不同问题的回答,而那些能把这盘棋走对的团队,往往最终会同时运行两者。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube