一张主视觉标题卡片,对比“VibeVoice-ASR-Streaming-7B vs GPT-Transcribe”,眉题“语音转文字——2026年9月”,副标题写道:实时会话检查点遇上 OpenAI 经审计的文件端点——音频生命中的两个不同时刻,信息块分别为“MIT 权重——9月2日”“OpenAI API——7月28日”与“GPT:3.31% AA-WER”,并附一条“证据是单方面的”脚注。OrcaRouter 标志合成于右下角。
Guides & Insights

VibeVoice-ASR-Streaming-7B 对比 GPT-Transcribe:针对 OpenAI 文件端点的实时会话检查

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

本页上的两个模型并非如名称所示那般针锋相对——它们是为音频录制生命周期中的不同时刻而构建的,诚实的比较在于你的产品处于哪个时刻。GPT Transcribe 是 OpenAI 的异步转录端点:你上传一个已完成的文件,它以超过实时约 34 倍的速度进行处理,并返回转录文本,按每分钟音频定价 $0.0045,在 Artificial Analysis 的 AA-WER 基准上独立测得的词错误率为 3.31%。VibeVoice-ASR-Streaming-7B 则是另一种形态:微软研究院的流式检查点,于 2026 年 9 月 2 日以 MIT 许可证悄然上传到 Hugging Face,专为在音频仍在到达时进行转录而构建——一个 WebSocket 会话,随录音增长分块输出文本。仅凭准确性来比较它们毫无意义,因为一方有经过审计的数字,而另一方根本未以文本形式公布任何数值。

以下内容均已相应标注。GPT Transcribe 的数据来自 OpenAI 公布的定价与 Artificial Analysis 的独立测量,这两项均属公开记录,可追溯至该模型于 2026 年 7 月 28 日发布之时。VibeVoice-ASR-Streaming-7B 这边,我们所能了解到的信息仅限于仓库中可见的内容——检查点配置、模型卡以及微软的流式文档——因为目前尚无第三方对其做过基准测试,微软也未以可读文本形式提供流式词错误率。

音频生命中的两个不同时刻

GPT Transcribe 专为已经发生的录音而设计。OpenAI 的端点接受常见格式下最高 25 MB 的音频文件 —— mp3、mp4、mpeg、mpga、m4a、wav、webm —— 并在处理后返回完整转录文本,速度约为实时音频的 34 倍,因此一小时的录音可在几分钟内完成。它属于批处理通道,OpenAI 相应定价为:每音频分钟 $0.0045,约每音频小时 $0.27。如果你的需求是真正的实时转写,OpenAI 提供单独的模型——GPT Live Transcribe,每分钟 $0.017,几乎是批处理价格的四倍——这是 OpenAI 侧最接近 VibeVoice-ASR-Streaming-7B 功能的产品。

VibeVoice-ASR-Streaming-7B 则从相反方向消除了这一区别:它是一个流式检查点,但也能处理完整文件。其预处理器配置展示了实时处理契约——音频以 24 kHz 输入,被压缩 3,200 倍,形成 7.5 Hz 的 token 流;随后按每块 22 帧、带 4 帧前瞻的方式处理,每块约含 2.9 秒音频,并带有大约半秒的未来上下文,每块解析完成时即输出文本。会话上下文通过 KV 缓存向前传递,因此长会话无需从头重新计算。文档记载的服务路径(一个 vLLM 插件)为实时会话提供 WebSocket 流式端点,并另提供整文件转录端点,因此同一套权重即可服务两种形态——但该模型存在的意义在于实时场景,而且由于没有托管 API,也就不存在按分钟计费。GPU 由你自备。

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

证据记录是片面的。

GPT Transcribe 是生产环境中经过最充分测量的转录 API 之一。Artificial Analysis 在 AA-WER 基准上将其词错误率测定为 3.31%——在约五十个被跟踪系统中排名第九——而其子分数中埋藏着一个已知弱点:在刻意采用高难度声学的 Earnings22 数据集上,错误率会升至 6.10%。这些数字来自中立排行榜,经过审计且可复现,不过其本身的局限性也已有文档说明。该模型发布时的定价比前代产品 GPT-4o Transcribe 低 25%,在相同基准上的表现则好约 0.7 个百分点。

VibeVoice-ASR-Streaming-7B 在任何地方都没有可与之匹敌的数据。其模型卡以图像形式附带了一份评估图,微软的技术报告则是 PDF,但正文中没有可引用的流式 WER 或延迟数字,也没有任何可独立验证的内容。VibeVoice 系列中唯一的数据锚点是批处理版 VibeVoice-ASR 模型卡中由供应商报告的表——在八个英语测试集上平均 WER 为 7.77%,在 LibriSpeech clean 上为 2.20%——但它描述的是非流式模型,绝不能将其视为该检查点的准确率。如果你的采购决策需要一个你能向同事交代的数字,那么在这场比较中只有一方有这样的数字。

各返回结果中除纯转录之外的内容

这两个模型在上下文处理上押注不同,而这也正是功能对比变得有趣的地方。GPT Transcribe 的主打卖点是上下文提示:你可以传入一段对录音的自由格式描述、一组关键词和专有名词,以及一份预期语言列表。OpenAI 报告称,在其 Context-Aware ASR 基准测试中,语义准确率从无上下文时的 41.6% 提升到有上下文时的 45.2%。它还会返回检测到的语言。但它不支持说话人分离或词级时间戳——OpenAI 表示这些功能需使用其他模型——因此,除非你自己构建说话人分层,否则会议记录会以一段无法区分的纯文本形式返回。

VibeVoice-ASR-Streaming-7B押注的是相反的路线。其模型卡宣称支持流式说话人归属性输出——在片段解析时即可得知是谁在说话——并且可通过上下文提示词(CLI参数为--context_info)自定义热词。这正是GPT Transcribe明确不提供的功能,也是这两个模型在多方实时音频场景下不可互换的原因。而天平另一端的核查是:GPT Transcribe缺失的功能是记录在案的产品决策,而VibeVoice声称的说话人归属仅为模型卡上的说明文字,尚未有任何独立测试证实。双方在时间戳上也有所不同——当前对比路径下两者都不提供词级时间戳,不过VibeVoice系列的批处理模型支持该功能。

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): job shape - streaming session, live audio; throughput - emits per ~2.9 s chunk; WER published - none in text; speaker output - claimed who-said-what, unverified; context controls - hotwords via --context_info; cost - /bin/bash weights, ~18 GB bf16. Right column GPT-Transcribe (released Jul 28, 2026 - hosted API): async file endpoint, files up to 25 MB; ~34x faster than real time; 3.31% AA-WER (6.10% Earnings22); no speaker output; prompt + keywords + language hints; /bin/bash.27 per audio-hour hosted. Footer: 'GPT-Transcribe price per OpenAI; WER per Artificial Analysis. VibeVoice specs read from the HF repo.'

价格形态与所有权问题

这两种成本结构简直天差地别,而且严格来说没有哪一方更优。GPT Transcribe 是一种按量计费的 API:每音频小时 0.27 美元,无需基础设施,无需 GPU,每次请求 25 MB,并且享有 OpenAI 的运营保障——这就是不必自己运行语音模型的代价。VibeVoice-ASR-Streaming-7B 的权重免费,但在 KV 缓存之前大约需要 18 GB 的 bf16,这意味着需要一块 24 GB 级别的 GPU、microsoft/VibeVoice 演示代码或 vLLM 插件,以及您自己的监控和扩缩容方案。MIT 许可证正是那种按分钟计价无法体现的差异:权重归您所有,可以微调,并可以在您掌控的硬件上运行,没有按席位计量,也没有 25 MB 的上限。

语言覆盖范围是双方都比买家所希望的要含糊其辞的地方。VibeVoice-ASR-Streaming-7B 在其模型卡中列出了10种语言——英语、中文、西班牙语、葡萄牙语、德语、日语、韩语、法语、俄语、意大利语——而批量版 VibeVoice-ASR 则覆盖50多种语言。OpenAI 没有为 GPT Transcribe 发布可比较的经过验证的语言列表;它在发布材料中报告了在22种 Common Voice 语言上的强劲结果,而其在 Earnings22 上经审计的声学短板提醒我们,“支持”和“能处理该语言中的嘈杂音频”是两种不同的说法。如果你的覆盖需求范围很广,这两份列表都无法给你定论——请测试你实际使用的方言。

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

归根结底:按车道选择,而不是按分数选择。

当音频是已完成的文件,或者您希望获得带已知局限性的可记录准确度数字,又或者不运行自己的语音基础设施而节省每小时0.27美元是值得时,请选择GPT Transcribe——并且只有实时交付的代价能匹配其近4倍价格时,才将其与GPT Live Transcribe搭配使用。当任务是实时的且需要多人说话人识别时,当您希望对话进行的同时就能收到转录文本时,当按说话人归属的流式输出是您想评估的功能时,或者当开放权重和数据控制比测得的基准更关键时,请选择VibeVoice-ASR-Streaming-7B。

对于基于其中任一方案进行构建的团队,这里有一个结构层面的说明:转录层并不是 OrcaRouter 当前所路由的对象——本页中列出的任何语音转文本模型都不在其目录中,因此 ASR 的选择完全由你决定。路由真正为你带来的,是位于转录文本之上的那一层。实时转录流只有在某种东西着手处理它时才有意义——无论是摘要器、告警规则,还是语音智能体的规划器——而 OrcaRouter 正是用同一个 API 承接这一技术栈,覆盖 200 多个模型,按提供商目录价格直通、不加任何价,同时具备自动故障转移。让 VibeVoice-ASR-Streaming-7B 这类尚未经证实的检查点也负担得起尝试,其机制恰恰在于:让消费你转录文本的端点保持可切换;这样一来,一个还没有任何基准成绩的模型,能否赢得或失去你的流量,取决于你自己音频所给出的证据,而不是发布当日的宣称。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube