一张主标题卡片,对比“VibeVoice-ASR-Streaming-7B 与 Gemini 3.5 Transcribe Live”;眉题文字为“流式语音转文字——2026 年 9 月”;副标题点明微软低调发布的开源检查点与谷歌沉稳的 Live API 正面对决;信息标签包括“MIT 权重——9 月 2 日”“谷歌 API——8 月 26 日”以及“未发布 VibeVoice WER 数据”;底部附注“目前已知情况”。OrcaRouter 标志合成于右下角。
Guides & Insights

VibeVoice-ASR-Streaming-7B 对比 Gemini 3.5 Transcribe Live:一周,两种流式语音转文字

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年8月的最后一周和9月的头几天,出现了两个流式语音转文字系统。它们看似互为对手,其实是对同一个问题的两种不同回答。8月26日,GoogleGemini 3.5 Transcribe Live投入公共预览:这是一个托管式、闭源的语音转文字端点,说话人停止说话0.40秒后即返回完整转录文本,并有Artificial Analysis实测的4.0%流式词错误率以及完整的发布材料作为支撑。9月2日,Microsoft Research在Hugging Face的microsoft命名空间下上传了VibeVoice-ASR-Streaming-7B:MIT许可的开放权重、没有新闻稿、没有发布页面,而且模型卡上完全没有以可读文字形式发布任何词错误率或延迟数据。两者都能在音频仍在到达的过程中接收音频——这几乎就是它们唯一的共同点。

双方证据并不对等,因此本对比按“目前已知信息”来写。Gemini 3.5 Transcribe Live 是谷歌旗下产品,拥有已发布的 token 价格和第三方测量数据,这些内容已在下方标注。VibeVoice-ASR-Streaming-7B 则是一个检查点,其所有声称均直接读取自仓库本身:配置文件、模型卡,以及 VibeVoice GitHub 仓库中的微软流式文档。微软一方尚未经过任何独立基准测试,凡是数字看似在支撑结论的地方,我们都会明确说明这一点。

发布轨迹:一次 API 上线与一次静默上传

Google 以常规方式发布了 Gemini 3.5 Transcribe Live。该模型与其姊妹模型 Gemini 3.5 Transcribe(预录制 Interactions API 路径)一同归入 Gemini Audio 产品线,定价在模型页面上给出,独立排行榜在数天内便收录了 Live 端点——4.0% 的流式 WER 和 0.40 秒的最终延迟即来源于此。免费套餐存在,但附带常见的注意事项:免费套餐的内容可能被用于改进 Google 产品。

微软的流式发布没有那套机制。Hugging Face 仓库 microsoft/VibeVoice-ASR-Streaming-7B 于 2026-09-02 15:46 UTC 创建,三分钟后最后一次更新;其中包含八个 safetensors 分片、一个 tokenizer 和一个预处理器配置,采用 MIT 许可证。正式记录是 microsoft/VibeVoice 仓库中日期为 9 月 3 日的一条新闻日志,宣布“一款统一的流式 ASR 模型,可在语音到达时持续转写谁说了什么,支持自定义热词和 10 种语言”,并附有 aka.ms/vibeasr 的演示链接和一份流式技术报告。我们在上传一天后查看时,该检查点仍显示零下载,也没有任何托管推理提供商收录它。模型卡提供的信息比公告更多,下文几乎所有内容都源自该仓库。

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

规格对比

• 它是什么 — VibeVoice-ASR-Streaming-7B:开放权重流式ASR,可自托管;而 Gemini 3.5 Transcribe Live:托管式流式 API,封闭权重。

• 流式形态 — 以约2.9秒为一个数据块输出文本,具有约0.5秒的前瞻量(源自检查点配置);而双向 WebSocket 会话则持续返回部分转录结果,并在说话者停止后 0.40 秒生成最终结果。

在打印准确性方面——没有任何WER或延迟数据以文本形式公布,而根据Artificial Analysis的数据,流式模型的WER为4.0%,预录制模型为2.6%。

• 说话人 — 声称可对流式内容提供“谁说了什么”的归属,但未经验证;Live 端点不提供说话人分离(该功能仅预录模型支持,最多三位说话人)。

• 语言 — 10种(en、zh、es、pt、de、ja、ko、fr、ru、it),而自动检测支持85+种语言,并可在中途切换。

• 会话时长 — 仅受您的 GPU 和内存限制,而非每个 Live 会话硬性 10 分钟上限。

• 成本 — 权重费用为 $0,自行托管需约 18 GB 的 bf16;若计入文本输出 token,Live 上约为每音频小时 $0.54。

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

"流式传输"在每一侧的含义

这个词掩盖了一个真正的设计差异,值得精确表述,因为这两个系统甚至并不试图产生相同的节奏。微软的预处理器配置使 VibeVoice 的节奏具体化:音频以 24 kHz 到达,并被压缩 3,200 倍成为 token 流,约为每秒 7.5 帧;随后该配置声明一个 22 帧的块和 4 帧的前瞻——每个块约 2.9 秒的音频,外加大约半秒的未来音频来使其稳固。模型每解析完一个块就输出一次文本,并且通过 KV cache 保留来自先前块的上下文,因此长时间会话不会从头重新计算。实际转录文本大约以三秒的增量增长。

Google 的 Live 端点专为更快、更具交互性的循环而构建:音频以 16 或 24 kHz PCM 块的形式通过 WebSocket 上传,在说话人说话时持续返回部分转录,并在语音结束后 0.40 秒内生成最终格式化转录——该数字是 Artificial Analysis 的测量结果,由 Google 引用。权衡之处在于会话上限(十分钟音频,之后您的应用必须重新连接并拼接),以及缺失的附加功能:Live 路径上没有说话人分离和逐词时间戳,而这两者在预录制的 Gemini 3.5 Transcribe 中都存在。因此,诚实的总结是:Google 的流式模型每个话语更快,而 Microsoft 的流式检查点每个块较慢,但声称拥有 Google 实时通道所放弃的说话人归属功能,且其会话时长是 Google 不提供的。

准确度:相对于空白空间进行测量

这场对比中最明显的差距在于证据层面的差距,而不一定在于质量层面。Artificial Analysis 测得 Gemini 3.5 Transcribe Live 在流式模式下的平均词错误率(WER)为 4.0%,非流式模型则为 2.6%,后者在该模型发布时位列其 WER 排行榜第五;谷歌则另外引用 FLEURS 多语言数据集的数据,给出 5.50%(流式)和 5.04%(非流式)的结果。应当根据这些数字各自的标注来解读:Artificial Analysis 独立于谷歌,但一个上线仅一天的 API 的数字仍属早期数据;而流式模式相对于批处理模型的额外误差——4.0% 对 2.6%——正是实时交付通常需要付出的代价。

VibeVoice-ASR-Streaming-7B 在任何地方都找不到可与之比较的数据。其模型卡以图片形式附带了评估结果,微软的技术报告则是 PDF 格式,但两者都没有提供可供引用或独立核验的纯文本流式 WER 或延迟数字。整个系列中唯一的数字锚点来自批处理版 VibeVoice-ASR 模型卡,其中报告了厂商在八个英语测试集上运行得到的平均 7.77% WER,以及在 LibriSpeech clean 上的 2.20%——这些数字针对的是非流式模型,而非本模型;流式模型通常会以少量精度换取延迟优势。在有人通过公开测试框架运行该流式检查点之前,公正的说法是:这场比较中的一方经过实测,而另一方没有。

成本:按量计费的API与您已列入预算的GPU对比

Google 按 token 对 Gemini 3.5 Transcribe Live 定价,音频按每秒 25 个 token 计费。按照已公布的 Live 费率——每 100 万音频 token 3.50 美元、每 100 万文本输出 token 21 美元——一个混合音频小时约为 0.54 美元,即每 1,000 音频分钟约 9 美元;而预录制模型更便宜,约为每小时 0.30 美元。静音只有在客户端不流式传输时才免费:重连、重复音频和日志记录都会为实际账单增加计量 token。

微软的检查点则按GPU小时计费。单是bf16权重就约占18 GB,还没有算上任何KV缓存;文档列出的路径是microsoft/VibeVoice仓库中的Python演示,以及一个提供WebSocket和OpenAI兼容端点的vLLM插件。目前没有托管价格,因为还没有任何提供商托管该模型——它不像批处理版VibeVoice-ASR那样自3月起就已上线Azure AI Foundry。自行托管一个7B级语音LLM意味着你得为一块24 GB级GPU和自己的运维时间做预算;作为交换,你得到的是无限的会话时长和永久归自己所有的权重。这两个模型并不互斥,这正是最后一节的重点。

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

让选择保持便宜

你选择哪一款取决于你需要的是数字还是代码。若你想要现时可用、拥有已公布准确率且无需运行 GPU 的转录方案——并且你的音频不局限于十种语言,或者你已准备好自行构建说话人标注,因为 Live 端点不提供该功能——请选择 Gemini 3.5 Transcribe Live。若你采用自托管,无限制的会话时长或所宣称的说话人归属流式输出至关重要,并且你愿意建立自己的评估门槛,因为没有可供依赖的基准——请选择 VibeVoice-ASR-Streaming-7B。

这两种选择都无需是永久的,而这正是路由层价值所在——它服务于围绕转录文本的模型,而非转录本身。OrcaRouter 目前并不路由语音转文字,本页列出的模型也均不在其目录中;它的作用是:为 200 多个消费实时转录文本的语言模型——包括摘要生成器、行动项提取器、语音智能体规划器——提供统一 API,按提供商列表价格原样直传、不加任何溢价,并支持跨提供商的自动故障转移。该技术栈中任何模型的供应商降价都会在当天生效,因为列表价格是直传而非加价转售。转录环节仍留在你放置它的地方;而消费转录文本的技术栈恰恰就是那一层——用一个密钥加一条回退路由,就能把一周前发布、未经基准测试的模型检查点从一场赌注变成可测试的选项。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube