
Muse Voice Transcribe 对比 Granite Speech 5.0 470M TurboCTC:自有 GPU 或按量计费 API
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
关于这场对决,最值得了解的一点是:Muse Voice Transcribe 和 Granite Speech 5.0 470M TurboCTC 几乎算不上彼此替代品。IBM 于 2026 年 8 月 25 日发布了 Granite Speech 5.0 470M TurboCTC,这是一个 4.7 亿参数、Apache-2.0 许可、仅限英语的 ASR 模型,专为自托管而构建——它是一款仅编码器的 Conformer 模型,采用 CTC 训练,IBM 表示其在单个 NVIDIA H200 上的转录速度超过实时速度的 12,600 倍。Meta Superintelligence Labs 于 2026 年 9 月 1 日发布了 Muse Voice Transcribe,这是一个专有、托管、流式音频感知模型——上线时已验证支持 25 种语言、20 种以上说话人分离、端点检测,价格为每 1,000 音频分钟 3.00 美元。一个想要你的 GPU;另一个想要你的 API 密钥。比较它们宣传中的 WER 数字会完全偏离重点——真正的问题在于转录被允许在哪里发生,以及每个模型到达那里之后还能做什么。
两种部署理念
Granite Speech 5.0 470M TurboCTC 是开放权重边缘语音识别运动的巅峰之作。凭借 470M 参数,它可以轻松运行在笔记本电脑、手机或单块 GPU 上;其许可证为 Apache-2.0,因此你可以将其嵌入商业产品;IBM 还提供了一个 WebGPU 演示,完全不需要服务器即可在浏览器标签页中实时运行转录。该架构刻意做了精简——16 个 Conformer 块、贪心解码、无语言模型主干——因为整个设计目标就是在普通硬件上实现高吞吐量。Muse Voice Transcribe 则押注相反方向:一个你永远看不到的大型专有模型,由 Meta 的基础设施提供服务,价格为每音频小时 0.18 美元,价值体现在功能而非硬件上。如果你的约束条件是“音频不能离开这栋大楼”,那么选择已经确定,那就是 Granite。如果你的约束条件是“我想要最强大的流式模型,并且愿意按分钟付费”,那就是 Muse。

速度在这里有不同的含义
Granite 的主打数字 12,600 RTFx 是一个吞吐量指标:一台 H200 运行批量推理时,每秒能处理 12,600 秒的音频——也就是每秒钟消化三个半小时的音频。对于呼叫中心积压、媒体档案库或任何需要持续向 GPU 喂数据的批量流水线来说,这才是真正重要的指标。它不是延迟指标,而单流交互式延迟也并非该模型的强项。Muse Voice Transcribe 则是镜像的另一面:它的 80 毫秒分块处理和自适应延迟是为说话者停顿后的前 300 毫秒打造的,而不是为持续的大批量吞吐设计的。在各自为之设计的指标上,两者都很出色;而在对方的优势领域,两者都发挥不出自己的长处。如果你需要转录一百万小时的英语归档音频,Granite 在原始经济效益上以数量级优势胜出。如果你需要把正在进行的多说话人实时对话转成带标签的文本,只有 Muse 提供这样的能力。
准确性,如实标注
• Granite Speech 5.0 470M TurboCTC — 在 Open ASR 排行榜的公开英语短表单测试集上,聚合词错误率(WER)为 5.00%;该结果由 IBM 自行运行官方测试工具得出,由供应商报告且未经复现,且仅针对英语音频。
• Muse Voice Transcribe — 流式词错误率 3.1%,系 Meta 发布当天引述 Artificial Analysis 流式排行榜的说法;首次部分转写为 3.6%;同样为供应商报告,且未被复现。
这两个数字不能直接比较——语料库不同,一个是仅英语且离线的,一个是多语言且流式的——这正是这场对决不应仅凭WER来决定的原因。就现有证据而言,两者各自在其工作负载下都看似合理,但均未经验证。从结构上可以确定的是,Granite的数字仅覆盖英语,而Muse的主张处于流式、语码转换的语境中,Granite根本无法与之竞争。

每个模型根本无法做到的事情
Granite Speech 5.0 470M TurboCTC 抛弃了让转录文本对产品团队有用的一切。它仅支持英语。它没有说话人分离——所有声音都汇入同一条流中。它不输出标点、大写或时间戳,而且CTC设计放弃了早期Granite Speech模型拥有的关键词偏置和语音翻译。这些不是质量缺陷,而是架构选择;它们意味着基于Granite构建的生产堆栈仍然需要额外添加标点模型、说话人分离器和VAD层。Muse Voice Transcribe 将这些功能融入模型本身:20+说话人分离和端点检测随文字一起输出,而且具备句中间语码转换的语言覆盖,这是Granite完全无法企及的。实话实说:Granite是一个识别引擎,它假设你会去构建产品;而Muse是一个产品形态的API,它假设你希望在拿到结果时就有转录文本、说话人和话语边界。
许可和所有权
Granite Speech 5.0 470M TurboCTC 采用 Apache-2.0 许可证,同时还有一个非商业姊妹版本(granite-speech-5.0-470m-turboctc-nc,CC-BY-NC-SA-4.0),供研究使用,得益于额外训练数据,其词错误率略低,为 4.85%。Apache-2.0 意味着你可以托管它、嵌入它、微调它,并围绕它销售产品,无需支付版税,也没有审计风险。Muse Voice Transcribe 是封闭且仅限托管的:不提供权重、不能自托管、不能微调,你的转录数据会经由 Meta 的服务处理,并受 Meta 条款约束。对于受监管行业,或任何数据政策禁止第三方音频处理的团队,仅此一点就足以在基准测试开始之前结束比较。对于其他所有人来说,“Apache-2.0 加自备 GPU”和“专有且按量计费”只是不同的风险特征,而非优劣之分。

成本问题
Granite 在 12,600 RTFx 下,让批量英语音频的自托管经济账几乎显得离谱:一小时的 H200 算力可覆盖超过 12,000 小时的音频,因此按典型租赁价格,转录一千小时音频仅需几美元的原始 GPU 算力——这还没算空闲时间、工程成本,以及缺失的说话人分离层。Muse Voice Transcribe 按每音频小时 0.18 美元计费,作为流式 API 算便宜,但相比一台满载运行的 GPU 就不便宜了。实在的经验法则是:如果音频是英语、预先录制的,且你有批量需求,自托管 Granite 在经济上完胜。如果音频是实时的、多说话人的或涉及多语言,Muse 的定价定位是托管功能服务——一千小时实时、带说话人分离和端点检测的流式转录收费 180 美元,相对于你自己搭建这套技术栈的成本,是个很小的数字。
同时运行两者,而不会弄得一团糟。
需要同时使用两种方案的团队——英语批处理场景自托管 Granite,实时多语言对话使用托管 API——最终会得到两个截然不同的集成方式。托管的那一半正是路由网关所服务的工作负载形态:一个 API 密钥对接多家供应商,按标价透传且零加价,因此供应商给出的每分钟费用就是你实际支付的金额;一旦某个供应商端点性能下降,还能自动故障转移。自托管的那一半则完全归你所有。Granite 运行在你自己的硬件上,无需通过网关进行路由——但它所隐含的混合技术栈,恰恰是单一 API 平台存在的意义所在:避免其演变成两个并行的工程项目。
你应该选哪一个?
如果你的工作是规模化英语转录——档案、通话录音、字幕流水线——并且你手头有 GPU 可以投入,那么 Granite Speech 5.0 470M TurboCTC 在成本、许可和控制力上是更优的工程决策,但前提是你需要自己搭建标点、说话人分离和流式层。如果你的工作是实时、多人或多语言对话——语音代理、实时字幕、会议产品——Muse Voice Transcribe 提供了 Granite 所没有的功能,以托管 API 的价格出售,但前提是它的数字只是发布当日在闭源权重上的宣传。它们与其说是竞争对手,不如说是对不同问题的回答,而那些能把这盘棋走对的团队,往往最终会同时运行两者。
