
GPT-Live-1 vs VoxCPM2:一个每分钟花费 0.05 美元,另一个则要花上一块 24 GB 的 GPU
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
比较 GPT-Live-1 和 VoxCPM2 最干脆的方式,是注意到:只有在给硬件算一笔账之后,才会发现它们看似竞争对手,实则不然。GPT-Live-1 是 OpenAI 的全双工语音模型,自 2026 年 9 月 10 日起已在 API 中提供,每分钟语音收费 0.05 美元,无需安装任何东西。VoxCPM2 是 OpenBMB 的 20 亿参数开放权重文本转语音模型,于 2026 年 4 月以 Apache 2.0 许可发布,运行大约需要 8 GB 显存,且没有任何推理服务商部署它——所以如果你想要它,就得自己拥有机器。一个是按秒租用的对话,另一个是你自己操作的合成器。问题不在于哪个更好,而在于你的工作负载实际上能承接哪一个。

两个模型,两项任务,各自一条诚实的规格说明
• 功能 — GPT-Live-1 进行对话:它同时倾听与说话,轮流发言,处理打断和附和,并返回转录文本。VoxCPM2 将文本转换为语音。它完全听不到任何声音。
• 访问 — GPT-Live-1 为托管且闭源模型,可通过 Live Sessions 端点后的一个模型 ID 访问,已发布的集成示例基于 WebRTC 运行。VoxCPM2 是 Hugging Face 和 ModelScope 上可下载的检查点,采用 Apache 2.0 许可,可免费用于商业用途。
• 价格 — GPT-Live-1 为每语音分钟 $0.05,按秒计费,委托后端单独计量。VoxCPM2 每次调用 $0,外加一块 GPU,而开源托管就是全部成本模型。
• 占用 — GPT-Live-1 无需你自己的任何硬件。VoxCPM2 需要大约 8 GB 显存(Q4 下为 6–8 GB)、Python 3.10+、PyTorch 2.5+ 和 CUDA 12+。
• 基准测试——GPT-Live-1 的每一项语音数据都出自 OpenAI 自己,未经复现;唯一一家独立评测榜单把它排在十一名中的第七位。VoxCPM2 公布的数字来自 OpenBMB,而针对其多语言能力主张的现有独立测量结果却指向相反的方向。
24 GB 之问,已定价
VoxCPM2 的服务性能数字,决定了自托管究竟只是业余爱好,还是能撑起一套正经架构。在单块 RTX 4090 上,该模型在纯 PyTorch 下的实时因子约为 0.30,而走 Nano-VLLM 路径时约为 0.13——也就是说,在更快的配置下,每 1 小时 GPU 时间大约能生成 7.7 小时音频。这些都是模型卡自报的数字,而非外部实测;一套在 4090 上以 CUDA 12.9 验证过的独立服务方案报告称,零样本合成的稳态实时因子约为 0.120,声音克隆为 0.139,峰值 GPU 显存接近 24 GB 中的 22 GB。这两组数据都是稳态值,而非冷启动——全新进程中的第一个请求要慢得多,而人们说这个模型没法用时,引用的正是那个数字。
把它放在 API 旁边对比一下。GPT-Live-1 每分钟 0.05 美元,连续对话一小时就是 3.00 美元。在公开市场上租一张 24 GB 显卡,每小时只要个位数低段的美元,而自己买一张,算上利用率之后,摊销下来也差不多。所以这个对比的结果,和这类对比通常的结局一样,只有一个让人不太舒服的不对称之处:显卡账单不管有没有人跟你的产品说话都会来,而 API 账单在冷清的日子会缩到零,在繁忙的日子会涨到五位数。固定目录的批量合成非常适合显卡。全天候电话线则非常适合按表计费。
VoxCPM2 做到了其他开源方案做不到的事
VoxCPM2 之所以值得如此关注,并不是因为它能在基准测试中胜出——它大多并不能——而是因为它能仅凭文本描述设计出声音,完全不需要参考音频。这是开放权重中一项真正全新的能力,它改变了任何需要一种尚不存在的声音的人的工作流程:用文字描述来试听,用文字描述来迭代,然后才决定是否克隆。围绕这一点,它还叠加了 30 种语言外加九种汉语方言、通过内置超分辨率阶段实现的 48 kHz 输出,以及仅需 5–10 分钟音频即可进行的微调。
证据基础比功能清单更单薄。OpenBMB 自己的报告给出英语词错误率 1.84% 和中文字错误率 0.97%,以及在其自有的每语言 500 条话语数据集上测量、由另一家厂商的模型评分得出的 30 种语言平均 1.68% 错误率。在存在独立测试的地方,差距很大:在 MiniMax 的多语言测试集上,用 Whisper-large-v3 评分,印地语为 19.70,阿拉伯语为 13.05——比自我报告的数字差好几倍。OpenBMB 还警告,语音设计和风格控制在多次运行之间会产生可变结果,并建议生成一到三次以获得想要的输出,这是一种委婉的说法:一次可用结果的每次调用成本并不只是一次调用。
没人会放进对比里的集成税
一个不起眼的细节决定了 VoxCPM2 是一周的工作量还是一个月。其在 Hugging Face 上的仓库被标记为voxcpm而非transformers这意味着该网站上几乎所有其他内容所依托加载的库,都无法加载这个模型。修复此问题的拉取请求于 2026 年 8 月 4 日提交,截至我们最后一次查看时仍未合入。将其添加到其他服务栈的拉取请求已经合入,其采用情况毋庸置疑:截至本次抓取,过去三十天内的下载量为 393,079 次,并在此基础上构建了 27 个适配器、30 个微调、12 个量化版本和 100 个 Space。

GPT-Live-1 的等价代价是一次传输层重写。它的会话围绕实时连接构建,而非请求—响应式的音频端点;而双计量计费意味着,每一次委派的推理调用、工具调用和网页搜索,都要在语音分钟数之外,再按后端模型自身的费率计费。从按 token 计费的实时集成迁移过来的团队,应把这笔迁移当作一项工程任务来规划预算,而不是简单地换一个模型 ID。
路由层真正有用的场景
OrcaRouter 既不包含 GPT-Live-1,也不包含 VoxCPM2,这一点值得明说,而不是让本节其余内容暗示并非如此。GPT-Live-1 的语音层位于 OpenAI 自家的端点之后;VoxCPM2 则完全没有托管服务商。这两者都不是你能用我们的密钥调用的。
路由这个问题之所以依然被反复提及,是因为这两种模型都处在一条管道的两端,而管道的中间环节是文本。VoxCPM2 的部署通常要响应某个上游——脚本生成器、翻译环节、文本规范化器、决定接下来该说些什么的对话模型——而这些都只是普通的模型调用。GPT-Live-1 会话会把它的思考委派给会话配置中指定的后端模型,而在 OpenAI 自己的文档中,该后端是 GPT-5.6 Terra,可通过 OrcaRouter 以 OpenAI 的标价获取。客户端委派则更进一步,允许你自己的应用来提供后端,这意味着声音背后的模型可以是你所掌控的任意端点。约 190 个来自十一家上游供应商的模型都汇聚在 一把密钥之下,按标价提供,零加价——因此当某家供应商降价时,这里当天就会生效,而不是等到续约时才调整——还具备跨供应商的自动故障转移,以及一套可将多个模型组合成单次调用的路由 DSL。对于技术栈中变化最频繁的那一半来说,这是份廉价的保险。
有一项提醒应当写进本节,而不是埋没其中,因为正是这个细节,让这次对比中 GPT-Live-1 的那一半不像其厂商基准所暗示的那样尘埃落定。在独立的 Artificial Analysis Speech to Speech Index 上,GPT-Live-1 的得分为 69.8%——在十一个中排名第七,落后于 73.9% 的 GPT-Realtime-2.1 和 79.0% 的 Grok Voice Think Fast 2.0。按输入音频每小时 4.42 美元计算,该模型是那份榜单上最便宜的,但它并不是最好的。要为这种可能性留出预算:你标准化采用的语音层,未必是你最终会保留的那个。

哪个,为什么
如果文本先于音频存在,就选 VoxCPM2。旁白、有声书、配音、无障碍、游戏语音台词,以及任何需要一种尚无人录制的嗓音的产品——尤其是那些用量大、可预测、且值得投入一笔固定资本成本的工作负载。接受这一点:你得自己运行它,围绕它的工具链仍在沉淀,而多语言质量方面的说法,值得你在交付给客户之前亲自做一次试听测试。
如果另一端是人,就选 GPT-Live-1。语音代理、电话支持、信息采集流程,任何模型必须实时判断对方是否说完的场景。为享有不必自己解决这个问题的特权支付按分钟计费,并把委托出去的后端作为单独的预算条目,因为通话成本是高是低正取决于此。
错误在于把它们当作一场选型对决中的二选一。对于大多数两者都需要的团队来说,它们是同一产品的两个层次,而唯一真正错误的答案是:因为许可证上写着免费就选择自托管方案,却没有把让这一点成立的 GPU 成本算进去。
