
VibeVoice-ASR-Streaming-7B 对比 Muse Voice Transcribe:两大流式挑战者,发布仅隔一天
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
在2026年9月初的约三十六小时内,两家大型实验室发布了流式语音转文字模型,它们都做出了同样的头条承诺——在话语被说出的同时提供实时转录,并告诉你谁说了什么。9月1日,Meta Superintelligence Labs 推出了 Muse Voice Transcribe,作为托管API,定价为每1000音频分钟3.00美元,约合每小时0.18美元,将流式识别、20+说话人分离和端点检测整合在一次处理中。9月2日,微软研究院将 VibeVoice-ASR-Streaming-7B 上传至 Hugging Face:采用MIT许可的开源权重,没有发布公告,模型卡声称支持带热词和十种语言的流式说话人归属转录,且在任何地方都没有托管服务。同样的卖点,相反的商业模式,而双方的证据都比两家实验室希望你所注意到的更为单薄。
本页面按“目前已知情况”撰写,因为两个模型都没有独立验证的准确率数据。Muse Voice Transcribe 的数字是 Meta 发布当日的声明,由厂商自行报告且未经复现;VibeVoice-ASR-Streaming-7B 则完全未以文字形式发布过任何流式准确率数据。因此,下面的对比侧重于结构性和可确知的信息——架构、价格、许可证、文档记录的行为——并在少数出现厂商数据的地方予以标注。
前后相隔一天,批处理管道的两位挑战者
这两个模型都在攻击同一个假设:语音转文字是在成品录音上运行的东西。Muse Voice Transcribe 是 Meta 首个称之为"实时音频感知模型"的产品——一次流式处理即可完成识别、跨二十多个说话人的说话人分离,以及端点检测,即判断说话人是真正讲完还是只是停顿。它同时登陆三个平台:Meta Model API(每音频小时 0.18 美元)、Mac 版 Meta AI(按住 Fn 键即可在任何应用中听写),以及 Muse Code。微软的 VibeVoice-ASR-Streaming-7B 是开源 VibeVoice 系列中的流式成员,其发布轨迹要低调得多:一个创建于 9 月 2 日的 Hugging Face 仓库(时间戳显示为 15:46 UTC,三分钟后最后修改)、八个采用 MIT 许可的 safetensors 分片,以及 microsoft/VibeVoice GitHub 仓库中日期为 9 月 3 日的一条新闻日志条目,称其为"一个统一的流式 ASR 模型,可在语音到达时持续转写谁说了什么,支持自定义热词和 10 种语言。"上传一天后,它仍显示零下载。

功能冲突
• 流式机制 — Muse Voice Transcribe 以 80 毫秒的音频块进行消费,并在词语稳定后立即提交;而 VibeVoice-ASR-Streaming-7B 则处理约 2.9 秒的音频块,带约 0.5 秒的前瞻,在每个解析完成的块输出一次文本。
• 说话人归属 — 一次处理可识别20+个说话人,平均说话人日志错误率据供应商报告为17.5%;而模型卡上声称的流式“谁说了什么”输出未经验证。
• 端点检测 — 内置:该流带有完整话语结束边界,而不是记录为输出信号。
• 上下文控制 — 通过上下文提示(--context_info)实现语言、关键词和上下文偏置或自定义热词。
• 语言——基于70多种语言训练而成,其中25种在发布时经过广泛验证,原生代码切换,而宣称支持的仅有10种(en, zh, es, pt, de, ja, ko, fr, ru, it)。
• 证据——上市首日供应商宣称:语音结束后0.16秒的最终结果词错率(WER)为3.1%,首次部分结果为3.6%,引用的是Artificial Analysis流式排行榜,但并未以文本形式发布流式WER或延迟数据。
• 成本与许可证——托管服务、闭源权重为每音频小时 0.18 美元;而权重(MIT 许可证)免费,约 18 GB 的 bf16,可自托管。

关于“流媒体”的两种截然不同的概念
“streaming”一词涵盖的节奏范围非常广,而这两者之间的差距足以改变你分别能在它们之上构建什么。Muse Voice Transcribe 以词为粒度进行流式输出。Meta 的架构按 80 毫秒的音频块消费输入,并采用它所谓的“自适应延迟”——一种通过强化学习学到的延迟策略:只要模型有信心,就立即提交对应的词;对不太有把握的词,则保留更多上下文,而不是套用一个固定的延迟预算。该供应商声称,说话者停止说话 0.16 秒后即可得到最终转录文本,而首个部分结果在 0.13 秒时就会出现。这种节奏是为交互式循环而设计的:实时字幕、听写,以及需要在用户话音刚落时几乎立即做出响应的语音代理。
VibeVoice-ASR-Streaming-7B 以更粗的粒度进行流式处理。其预处理器配置显示,音频以 24 kHz 到达,压缩 3,200 倍后生成 token,每秒约 7.5 帧,然后按 22 帧一块进行处理,并带有 4 帧的前瞻——即每块约对应 2.9 秒音频,约半秒前瞻;这些数字来自配置,而非实测延迟。每块解析完成后即输出文本,早期块产生的上下文通过 KV 缓存保留,因此长时间会话不必从头重算。转录内容以大约三秒为增量增长,这对会议纪要和通话分析而言足够适用;它与面向实时对话的亚秒级逐词流式是两种不同的产品。两个实验室都没有发布该流式检查点的端到端延迟测量结果,因此应将这种节奏视为设计预期,而实际体验效果视为尚未测试。
说话人标签和端点检测:一个是内置的,另一个只是声称支持
说话人归属是流式产品最常夸大其词之处,而这两款产品也都作出了这一宣称。Muse Voice Transcribe 的版本具体且结构化:说话人分离(diarization)与识别在同一次流式处理中运行,因此一段二十人通话的录音可以携带逐个说话人的标签,而无需单独的“上传、等待、取回说话人”步骤;Meta 报告其平均说话人分离错误率为 17.5%——一个未经复现的厂商数据,但这个数字确实与真实机制挂钩。它还输出端点边界,这是较为低调的能力:应用无需构建语音活动检测器,就能获得一个清晰的“这位说话人的话轮已结束”信号——这正是基于纯 ASR 构建的语音代理经常打断人说话的原因。
VibeVoice-ASR-Streaming-7B 在其模型卡上声称支持流式"谁说了什么"输出,这与批处理版 VibeVoice-ASR 的结构化"谁/何时/什么"输出一致——但对于流式检查点,这一说法尚未得到验证,没有独立测试复现过它,也没有像 Muse 所提供的那种文档化的端点检测信号。如果你的工作负载确实是多说话人实时音频,Muse 目前提供了更完整的机制;如果你正在评估一个开放权重模型能否在你控制的硬件上完成同样的工作,那么 VibeVoice 的说法正是那种你应该先用自己会议录音测试、然后再决定是否相信的事情。
证据:发布当天的声明与空白卡片相对照
值得精确说明每一方拥有什么,因为双方都没有买家真正想要的东西。Muse Voice Transcribe 提供了一组密集的供应商数据——最终转写词错误率3.1%,首次部分转写词错误率3.6%,最终延迟0.16秒,平均说话人分离错误率17.5%——这些均由 Meta 在发布当天公布,并指向 Artificial Analysis 的流式语音转文字排行榜,Meta 声称在该榜上占据首位。这些只是声明,未经实验室以外的任何人复现,但它们具体到足以被证伪,而这本身就是一种进步。
VibeVoice-ASR-Streaming-7B 完全没有这些。它的模型卡以图片形式附带评估数据,流式技术报告则是 PDF 格式,但正文中没有任何可引用的流式 WER 或延迟数字。VibeVoice 系列中唯一的数字锚点来自批处理 VibeVoice-ASR 模型卡上供应商报告的表格——在八个英文测试集上平均 WER 为 7.77%,在 LibriSpeech clean 上为 2.20%——而该数字明确不属于这个检查点。当发布日的宣传撞上一张内容空白的模型卡,诚实的评判标准是除头条 WER 之外的一切:价格、许可证、流式输出节奏,以及各方实际记录在案的功能特性。
语言:25 种已验证,10 种已声明
语言覆盖率比标题中的准确率宣称更能区分这两者。Muse Voice Transcribe 训练覆盖 70 多种语言,但 Meta 在发布时只验证了 25 种——而实际生产覆盖以验证列表为准,而非训练列表;其差异化优势在于原生语码切换:它无需指令即可在句子中途切换语言。VibeVoice-ASR-Streaming-7B 在其模型卡中声明支持 10 种语言——英语、中文、西班牙语、葡萄牙语、德语、日语、韩语、法语、俄语、意大利语——而批量版 VibeVoice-ASR 则覆盖 50 多种语言。如果你的流量包含语码转换对话,Muse 的宣传定位更具针对性;如果流量仅落在这十种语言之内,微软模型的覆盖范围至少是明确列出的——这一点已优于大多数发布材料所能提供的。
费用与所得
商业模式差异是决策时最清晰的判断依据。Muse Voice Transcribe 按每音频小时 0.18 美元计价,在目录价格上低于所有主流流式转录 API——无需 GPU、无需运维、权重闭源,且价格由 Meta 制定。VibeVoice-ASR-Streaming-7B 下载不花钱,但在 KV cache 之前约有 18 GB 的 bf16 权重,要在 24 GB 级 GPU 上自托管,官方文档化的服务路径是 microsoft/VibeVoice 演示脚本或 vLLM 插件,目前还没有任何推理服务商托管它。MIT 许可证才是真正持久的资产:权重归你所有,可以保留并微调,这是任何 API 订阅都无法比拟的。这也正是定价图景可能变得有趣的地方——一旦有服务商真的托管了这个开放检查点,每小时 0.18 美元的问题就从单一厂商的目录价格变成了市场价格,而这恰恰是透传路由器发挥价值的情形。OrcaRouter 目前不路由语音转文字流量,这两个模型也都不在其目录中;它所做的是在 200 多个处理实时转录文本的语言模型上,以 0% 加价透传各家服务商的目录价格,因此该技术栈中任何一家的降价,都会在宣布当天同步反映到买方一侧。

常见问题
Muse Voice Transcribe 的 3.1% WER 是否意味着它比 VibeVoice-ASR-Streaming-7B 更准确?
不,现在做比较还没有意义。Meta的3.1%只是流式路径发布当天的说法,是供应商自报且未被复现的数字。VibeVoice-ASR-Streaming-7B根本没有以文本形式公布任何流式准确率数字。除非两个模型都曾在相同的音频上跑过同一个公开测试工具,否则唯一诚实的说法是:Muse有一项可以被测试的具体声明,而VibeVoice还没有。
我可以在已经录制的音频上使用任一模型吗?
是的,两者都能做到,只是形态不同。Muse Voice Transcribe 通过同一个流式 API 就能处理超过一小时的录音;VibeVoice-ASR-Streaming-7B 的 vLLM 插件除了 WebSocket 流式端点之外,还提供了一个整文件转写端点。但两者都是为实时场景设计和定价的——Muse 因其仅限流式的商业模式,VibeVoice 因其随音频到达而分块输出的架构——所以,如果你的工作负载纯粹是批量文件,专用的文件转写 API 通常会比这两者都更便宜,也更便于计量。
