“GPT-Live-1 vs VoxCPM2”的主视觉标题卡,副标题为“租来的对话,还是你自己的 GPU”,徽章文字为“一个是全双工,一个是文本转语音——各司其职”,并配有三张卡片:“GPT-Live-1——每语音分钟 $0.05,仅提供 API,无需安装”、“VoxCPM2——Apache-2.0,2B 参数,约 8 GB 显存,没有推理服务商部署它”和“自托管吞吐量——在 RTF 0.13 下,每 GPU 小时约 7.7 小时音频,过去 30 天下载量 393,079 次”,下方页脚条写着“VoxCPM2 基准数据来自 OpenBMB 报告;GPT-Live-1 语音数据来自 OpenAI 报告且未经复现。”OrcaRouter 徽标合成在右下角。
Engineering & Research

GPT-Live-1 vs VoxCPM2:一个每分钟花费 0.05 美元,另一个则要花上一块 24 GB 的 GPU

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

比较 GPT-Live-1 和 VoxCPM2 最干脆的方式,是注意到:只有在给硬件算一笔账之后,才会发现它们看似竞争对手,实则不然。GPT-Live-1 是 OpenAI 的全双工语音模型,自 2026 年 9 月 10 日起已在 API 中提供,每分钟语音收费 0.05 美元,无需安装任何东西。VoxCPM2 是 OpenBMB 的 20 亿参数开放权重文本转语音模型,于 2026 年 4 月以 Apache 2.0 许可发布,运行大约需要 8 GB 显存,且没有任何推理服务商部署它——所以如果你想要它,就得自己拥有机器。一个是按秒租用的对话,另一个是你自己操作的合成器。问题不在于哪个更好,而在于你的工作负载实际上能承接哪一个。

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

两个模型,两项任务,各自一条诚实的规格说明

• 功能 — GPT-Live-1 进行对话:它同时倾听与说话,轮流发言,处理打断和附和,并返回转录文本。VoxCPM2 将文本转换为语音。它完全听不到任何声音。

• 访问 — GPT-Live-1 为托管且闭源模型,可通过 Live Sessions 端点后的一个模型 ID 访问,已发布的集成示例基于 WebRTC 运行。VoxCPM2 是 Hugging Face 和 ModelScope 上可下载的检查点,采用 Apache 2.0 许可,可免费用于商业用途。

• 价格 — GPT-Live-1 为每语音分钟 $0.05,按秒计费,委托后端单独计量。VoxCPM2 每次调用 $0,外加一块 GPU,而开源托管就是全部成本模型。

• 占用 — GPT-Live-1 无需你自己的任何硬件。VoxCPM2 需要大约 8 GB 显存(Q4 下为 6–8 GB)、Python 3.10+、PyTorch 2.5+ 和 CUDA 12+。

• 基准测试——GPT-Live-1 的每一项语音数据都出自 Open​AI 自己,未经复现;唯一一家独立评测榜单把它排在十一名中的第七位。VoxCPM2 公布的数字来自 OpenBMB,而针对其多语言能力主张的现有独立测量结果却指向相反的方向。

24 GB 之问,已定价

VoxCPM2 的服务性能数字,决定了自托管究竟只是业余爱好,还是能撑起一套正经架构。在单块 RTX 4090 上,该模型在纯 PyTorch 下的实时因子约为 0.30,而走 Nano-VLLM 路径时约为 0.13——也就是说,在更快的配置下,每 1 小时 GPU 时间大约能生成 7.7 小时音频。这些都是模型卡自报的数字,而非外部实测;一套在 4090 上以 CUDA 12.9 验证过的独立服务方案报告称,零样本合成的稳态实时因子约为 0.120,声音克隆为 0.139,峰值 GPU 显存接近 24 GB 中的 22 GB。这两组数据都是稳态值,而非冷启动——全新进程中的第一个请求要慢得多,而人们说这个模型没法用时,引用的正是那个数字。

把它放在 API 旁边对比一下。GPT-Live-1 每分钟 0.05 美元,连续对话一小时就是 3.00 美元。在公开市场上租一张 24 GB 显卡,每小时只要个位数低段的美元,而自己买一张,算上利用率之后,摊销下来也差不多。所以这个对比的结果,和这类对比通常的结局一样,只有一个让人不太舒服的不对称之处:显卡账单不管有没有人跟你的产品说话都会来,而 API 账单在冷清的日子会缩到零,在繁忙的日子会涨到五位数。固定目录的批量合成非常适合显卡。全天候电话线则非常适合按表计费。

VoxCPM2 做到了其他开源方案做不到的事

VoxCPM2 之所以值得如此关注,并不是因为它能在基准测试中胜出——它大多并不能——而是因为它能仅凭文本描述设计出声音,完全不需要参考音频。这是开放权重中一项真正全新的能力,它改变了任何需要一种尚不存在的声音的人的工作流程:用文字描述来试听,用文字描述来迭代,然后才决定是否克隆。围绕这一点,它还叠加了 30 种语言外加九种汉语方言、通过内置超分辨率阶段实现的 48 kHz 输出,以及仅需 5–10 分钟音频即可进行的微调。

证据基础比功能清单更单薄。OpenBMB 自己的报告给出英语词错误率 1.84% 和中文字错误率 0.97%,以及在其自有的每语言 500 条话语数据集上测量、由另一家厂商的模型评分得出的 30 种语言平均 1.68% 错误率。在存在独立测试的地方,差距很大:在 MiniMax 的多语言测试集上,用 Whisper-large-v3 评分,印地语为 19.70,阿拉伯语为 13.05——比自我报告的数字差好几倍。OpenBMB 还警告,语音设计和风格控制在多次运行之间会产生可变结果,并建议生成一到三次以获得想要的输出,这是一种委婉的说法:一次可用结果的每次调用成本并不只是一次调用。

没人会放进对比里的集成税

一个不起眼的细节决定了 VoxCPM2 是一周的工作量还是一个月。其在 Hugging Face 上的仓库被标记为voxcpm而非transformers这意味着该网站上几乎所有其他内容所依托加载的库,都无法加载这个模型。修复此问题的拉取请求于 2026 年 8 月 4 日提交,截至我们最后一次查看时仍未合入。将其添加到其他服务栈的拉取请求已经合入,其采用情况毋庸置疑:截至本次抓取,过去三十天内的下载量为 393,079 次,并在此基础上构建了 27 个适配器、30 个微调、12 个量化版本和 100 个 Space。

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

GPT-Live-1 的等价代价是一次传输层重写。它的会话围绕实时连接构建,而非请求—响应式的音频端点;而双计量计费意味着,每一次委派的推理调用、工具调用和网页搜索,都要在语音分钟数之外,再按后端模型自身的费率计费。从按 token 计费的实时集成迁移过来的团队,应把这笔迁移当作一项工程任务来规划预算,而不是简单地换一个模型 ID。

路由层真正有用的场景

OrcaRouter 既不包含 GPT-Live-1,也不包含 VoxCPM2,这一点值得明说,而不是让本节其余内容暗示并非如此。GPT-Live-1 的语音层位于 OpenAI 自家的端点之后;VoxCPM2 则完全没有托管服务商。这两者都不是你能用我们的密钥调用的。

路由这个问题之所以依然被反复提及,是因为这两种模型都处在一条管道的两端,而管道的中间环节是文本。VoxCPM2 的部署通常要响应某个上游——脚本生成器、翻译环节、文本规范化器、决定接下来该说些什么的对话模型——而这些都只是普通的模型调用。GPT-Live-1 会话会把它的思考委派给会话配置中指定的后端模型,而在 OpenAI 自己的文档中,该后端是 GPT-5.6 Terra,可通过 OrcaRouter 以 OpenAI 的标价获取。客户端委派则更进一步,允许你自己的应用来提供后端,这意味着声音背后的模型可以是你所掌控的任意端点。约 190 个来自十一家上游供应商的模型都汇聚在 一把密钥之下,按标价提供,零加价——因此当某家供应商降价时,这里当天就会生效,而不是等到续约时才调整——还具备跨供应商的自动故障转移,以及一套可将多个模型组合成单次调用的路由 DSL。对于技术栈中变化最频繁的那一半来说,这是份廉价的保险。

有一项提醒应当写进本节,而不是埋没其中,因为正是这个细节,让这次对比中 GPT-Live-1 的那一半不像其厂商基准所暗示的那样尘埃落定。在独立的 Artificial Analysis Speech to Speech Index 上,GPT-Live-1 的得分为 69.8%——在十一个中排名第七,落后于 73.9% 的 GPT-Realtime-2.1 和 79.0% 的 Grok Voice Think Fast 2.0。按输入音频每小时 4.42 美元计算,该模型是那份榜单上最便宜的,但它并不是最好的。要为这种可能性留出预算:你标准化采用的语音层,未必是你最终会保留的那个。

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

哪个,为什么

如果文本先于音频存在,就选 VoxCPM2。旁白、有声书、配音、无障碍、游戏语音台词,以及任何需要一种尚无人录制的嗓音的产品——尤其是那些用量大、可预测、且值得投入一笔固定资本成本的工作负载。接受这一点:你得自己运行它,围绕它的工具链仍在沉淀,而多语言质量方面的说法,值得你在交付给客户之前亲自做一次试听测试。

如果另一端是人,就选 GPT-Live-1。语音代理、电话支持、信息采集流程,任何模型必须实时判断对方是否说完的场景。为享有不必自己解决这个问题的特权支付按分钟计费,并把委托出去的后端作为单独的预算条目,因为通话成本是高是低正取决于此。

错误在于把它们当作一场选型对决中的二选一。对于大多数两者都需要的团队来说,它们是同一产品的两个层次,而唯一真正错误的答案是:因为许可证上写着免费就选择自托管方案,却没有把让这一点成立的 GPU 成本算进去。