
Muse Voice Transcribe 正式上线:Meta 首款实时音频感知模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
Muse Voice Transcribe 是 Meta Superintelligence Labs 推出的首款实时音频感知模型,于 2026 年 9 月 1 日发布,其定价如同一枚彩蛋:在 Meta Model API 上,每 1,000 分钟音频收费 3.00 美元——约合每小时 0.18 美元。它通过一次流式处理,完成了大多数转录系统需要拆分为三个子系统的工作:自动语音识别、对 20 多个说话人的说话人分离,以及端点检测——即判断说话人是真正说完,还是只是停顿一下。Meta 表示,该模型在 Artificial Analysis 流式语音转文本排行榜上位居榜首,最终转写本的词错误率为 3.1%,且在说话人停止说话后 0.16 秒即可输出结果。
那个最后的数字在派上用场之前,需要先贴上诚实的标签:那是Meta发布当天的说法,指向一个独立的排行榜,而该模型在公告发出时被调用的时间还不到一天。实验室之外还没有人复现过3.1%这个数字;准确性声明是一回事,其余的宣传——70多种训练语言、原生语码转换、强化学习得到的“自适应延迟”——则是同样性质的另一组供应商陈述。这篇帖子里的所有内容都是模型第一天的状态,供应商的数字被明确标注为供应商数字。
第一天最重要的数字
• 价格 — Meta Model API 上每 1,000 音频分钟 3.00 美元(约合每音频小时 0.18 美元),低于我们追踪的所有主流流式转录 API。
• 准确率声明 — 最终转录本的词错误率(WER)为3.1%(语音结束后0.16秒);首个部分转录本的词错误率为3.6%(0.13秒)。由供应商报告,引用Artificial Analysis流式排行榜。
• 说话人分离(Diarization)— 支持20+个说话人,流式输出,无需单独的后处理步骤(Meta报告平均说话人分离错误率为17.5%)。
• 语言:基于70+种语言训练;发布时有25种经过“广泛验证”;在句内和句间均可无缝切换语码。
• Context — 处理时长超过一小时的音频;针对术语密集型领域的语言、关键词和上下文偏置。

这里的“音频感知模型”是什么意思
架构本身即故事。Muse Voice Transcribe将音频按80毫秒的块进行消费,并在词语稳定后将其流式输出——这就是“实时”在实践中的含义。真正有趣的部分在于它如何决定何时提交一个词。模型并未采用固定的延迟预算——这是标准权衡,识别器要么提前提交并猜测,要么等待更久并含糊其辞——而是使用了Meta所称的“自适应延迟”:对于简单的语音它快速推进,对于不太确定的词则会保留更多音频上下文。延迟策略本身是通过强化学习习得的,因此该模型实际上是逐词权衡速度与准确性,而非应用某个全局设置。
这种区别正是Meta将Muse Voice Transcribe称为“音频感知模型”而非ASR模型的原因。其输出流是单一的实时转录文本,同时携带说话人身份和话语结束时刻——这三个标签在流式系统中通常是通过将识别器与语音活动检测器及说话人分离模型拼接而成的,每个组件都会增加自身的延迟和各自的故障模式。

内置说话人分离与端点检测
说话人分离是最值得仔细审视的部分,因为这是流式产品最常夸大其词的功能。Meta表示该模型能在单次录音中区分20多个说话人,并报告平均分离错误率为17.5%,与此对比的是它声称的竞争对手系统21.1%–28.6%的范围。这两个数字都是发布当天由厂商公布的,17.5%尚未得到任何独立评估的证实。从结构上确实成立的是,说话人分离与识别在同一个流式处理流程中运行——不存在“上传音频、等待、取回说话人”的第二步,正是这一设计选择使得在实时场景中追踪20多个说话人成为可能。
端点检测是一种更安静的能力,但可以说却最有用。暴露原始流式ASR的转录API迫使调用方自行实现话语结束检测,这正是语音智能体经常打断用户或留下冷场的原因。Muse Voice Transcribe会自行判断何时一轮说话结束,并将该边界作为流的一部分发出,因此应用程序无需构建VAD层,就能获得一个干净的“该说话者已说完”的信号。
多语言声明,请仔细阅读。
Meta在70多种语言上训练了该模型,但发布时仅验证了25种。这两者是不同的概念:“训练”意味着数据中包含了这些语言;而“经过广泛验证”才是Meta通过内部测试真正提供保障的语言子集。在生产环境中,25种已验证的语言列表才是实际的覆盖范围,在将40种语言接入之前,了解70与25之间的差距值得你花时间。真正与众不同的是语码转换能力——该模型无需指令即可在句中和话语中途切换语言,这在多语言地区是一个真实的痛点,也是大多数单语言ASR产品根本无法做到的。语言、关键词和上下文偏置完善了定制化能力:你可以将识别结果偏向特定领域的词汇,正是这一功能让流式ASR在医疗、法律和客服队列中真正可用。
三种表面,一个模型
Muse Voice Transcribe 同时登陆三个平台。付费版是 Meta Model API,每 1,000 音频分钟收费 3.00 美元。消费版是 Meta AI for Mac,按住 Fn 键即可在任何应用中听写输入——这是 Meta 对 Apple 内置听写功能的回应,也是该模型上线首日最引人注目的实际部署。开发者版是 Muse Code,即 Meta 的编程代理,语音指令可驱动多代理会话和重构流程。一个模型同时支撑听写功能和编程代理,正是"一个流式模型,多个平台"这一理念的产品化落地。
价格低于什么
按每音频小时 0.18 美元的价格,Muse Voice Transcribe 在标价上低于流式转录领域的其他产品。根据我们追踪的对比组:Google 的 Gemini 3.5 Transcribe Live 约为每 1,000 分钟 9 美元,ElevenLabs 的 Scribe v2 Realtime 标价为每 1,000 分钟 6.50 美元,Cartesia 的 Ink-2 为 4.00 美元,OpenAI 的 GPT Live Transcribe 为 17.00 美元。这些都是各厂商公布的数字,其中几款模型已有独立的准确性证据,而 Muse 目前还没有——首日价格领先并不等同于最终确定的排行榜。但一款内置说话人分离和端点检测的流式模型,以大约是现有流式 API 价格五分之一到十分之一的价格入场,这样的数字无论怎样都会重新设定人们的预期。

诚实的告诫
Muse Voice Transcribe 是专有软件,权重未公开——不存在“自行运行”的选项,也没有用于审计或微调的开源权重路径。准确性声明来自发布当日,且未经复现。25种经过验证的语言,在低资源覆盖方面可能与70多种“训练过”的数字不符。说话人分离基准尽管前景可期,但在独立运行证实之前,仍只是供应商的测量数据。对于唯一需求是对预录音频进行准确批量转录的团队,仍有更便宜、审计更完善的选项——流式转录的卖点在于实时交互,而不是在每音频小时成本上打败批量转录领域。
接下来看什么
有四件事将决定这次发布是昙花一现,还是长期趋势。第一,独立验证之后,Artificial Analysis 流式排行榜是否真的将 Muse Voice Transcribe 列为第一名——发布当天的说法需要一个尘埃落定的榜单条目来证实。第二,20+ 说话人分离功能能否经受住真实、嘈杂会议的考验。第三,Meta 的 Mac 听写界面能否转化为开发者对 API 的采用。第四,现有厂商如何在价格上应对——一个具备说话人分离和端点检测的流式模型,每小时只要 0.18 美元,这给所有定价更高的厂商都带来了实实在在的压力。当 Meta 向更多服务合作伙伴开放该模型时,像 OrcaRouter 这样的透传网关——以 0% 加价转发提供商挂牌价——会在其上线当天直接呈现同样的每 1,000 分钟 3.00 美元的价格,没有任何转售商加价。在此之前,调用 Muse Voice Transcribe 的唯一途径是 Meta 自己的 API。
