一张为 ElevenLabs Eleven v4 对比 VoxCPM2 生成的英雄卡片,包含两个面板:ElevenLabs Eleven v4 作为托管端点,Elo 得分为 1,319,排名第 1,价格为每 100 万字符 $80.00;VoxCPM2 作为 Apache-2.0 检查点,拥有 2B 参数、48 kHz 输出,且在竞技场中无排名。页脚:“Eleven v4 的排名与价格依据 Artificial Analysis,2026 年 9 月;VoxCPM2 的规格依据 OpenBMB 模型卡。” OrcaRouter 标志位于右下角。
Guides & Insights

Eleven v4 对比 VoxCPM2:一个排名模型,对阵一个你无法租用的检查点

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这场对比中最有用的事实,是一条并不存在的记录。ElevenLabs Eleven v4在 Artificial Analysis 的 Provider Voice Arena 上,以 1,319 的 Elo 在 1,674 次亮相中位居第 1,价格为每百万字符 80.00 美元。VoxCPM2,这个 OpenBMB 于 2026 年 4 月发布的检查点,在两个语音榜单上都毫无踪影——不在已排名之列,不在未排名之列,也没有作为预览条目出现。这不是对质量的评判。这意味着,无论你原本希望拿哪个数字来与 1,319 比较,都没有人给出过它,因此比较必须基于偏好之外的某些东西来进行。剩下的就是所有权、微调,以及一个托管端点让你无法提出的许可问题。

各方实际交到你手上的东西

这些是不同类别的产品,差异并非表面上的。

• 访问方式 — Eleven v4 是通过 ElevenLabs 自家 API 访问的托管端点,按字符计费。VoxCPM2 则是 Hugging Face 上的一个模型检查点,位于 openbmb/VoxCPM2;你需要自行下载并运行,没有第一方端点可供调用。

• 许可证 — VoxCPM2 以 Apache 2.0 发布,明确可免费商用。Eleven v4 是商业 API,其条款由 ElevenLabs 制定。如果你的法务审查要问是否可以微调、再分发或发布权重,这一差异就很重要;对于该检查点,答案是白纸黑字且固定不变的。

• 规模与硬件——VoxCPM2 基于 MiniCPM-4 主干,拥有 20 亿参数,该卡片标注其在 bfloat16 下约需 8 GB 显存,最大序列长度为 8,192 个 token。ElevenLabs 未公布 Eleven v4 的参数数量,而托管模型的硬件占用也并非由你管理的事项。

• 输出链路——VoxCPM2 接受 16 kHz 参考音频,并通过 AudioVAE V2 内置的超分辨率输出 48 kHz,路径中无需外部上采样器。托管 TTS 会以供应商选择的任意采样率向你提供音频流。

• 独立评分——Eleven v4 有,而且是第一名。VoxCPM2 没有。没有并不等于低分;它是一个未评分的模型,两者绝不应被放在同一句话里相提并论,仿佛后者是一个分数。

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

替代缺失 Elo 的数字

如果你无法比较偏好,那就比较你能计算的东西;而对于自托管模型来说,那就是吞吐量。VoxCPM2 的模型卡援引的数据是:在 RTX 4090 上以标准 PyTorch 运行时,实时因子约为 0.30;在 Nano-VLLM 下则降至约 0.13。实时因子是每秒钟音频所需的计算秒数,因此这两个数字意味着:在第一种情况下,一个 GPU 小时大约能产出 3.3 小时的成品语音;在第二种情况下则约为 7.7 小时。

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

两个结论立刻随之而来。服务栈比模型更重要:同一张显卡上的同一个检查点,只要更换推理引擎,其输出就会翻一倍以上,因此任何使用 0.30 这个数字的成本模型,都会把你的自托管成本高估约 2.3 倍。而利用率才是关键:一张闲置的显卡,无论价格如何,都赢不了按字符计费的 API,因为 API 的账单随你说多少而增长,而显卡的账单则随你何时购买而增长。

这就是为什么这个决定诚实的表述不是“哪种听起来更好”,而是“你每个月制作多少小时音频,以及硬件是否繁忙”。在低于让一块卡保持加载状态的用量时,API 胜出,而且优势不小。高于这个用量时,在你自己已经拥有的硬件上,检查点第一千小时的边际成本与第一小时的成本相同——而这是一种任何价目表都无法匹敌的结构性优势。

托管端点不会卖给你的能力

比较到这里就不再是镜像对照了,因为有一件事 VoxCPM2 能做,而 Eleven v4 从根本上做不到:你可以重新训练它。模型卡记录了在少至五到十分钟音频上进行的完整 SFT 和 LoRA 微调,并为二者分别提供了训练脚本和配置。

这会改变语音项目的形态。托管式 API 为你提供固定模型,外加供应商开放的任何克隆功能——就 Eleven v4 而言,即时克隆只需十秒参考音频,其上方还有专业层级。可进行 LoRA 调优的检查点则为你提供一个从未见过他人数据的模型,并且你可以通过版本锁定其行为。对于品牌语音、受监管领域,或供应商的配音阵容处理不佳的语言,这属于另一类解决方案,而不是更便宜的方案。

这笔交易是明摆着的,也值得挑明:用上 VoxCPM2,你就得接受:从未有第三方给这个模型打过分,质量保证得靠你自己去建立和衡量,而 8,192 token 的序列长度上限,以及模型卡自己的那句警告——语音设计和风格控制在每次运行之间都会有所不同,建议生成一到三次——如今都成了你自己的质检难题。

Eleven v4 能带给你、而检查点给不了的东西

反过来说,托管模式的优势是那些会出现在发布日程表上、而不是规格表上的优势。

• 一项有据可依的排名——在估算背后有 1,674 个样本支撑的榜单上位列第一,其误差区间约为 ±19 分。无论该榜单衡量的是什么,它都独立于两家厂商,并且是本次比较中唯一的第三方质量信号。

• 文本中的表演指导——内联音频标签,例如[笑声]、[低语]和[用法语口音愤怒地说],此外还有自然语言表达提示,以及对国际音标的改进支持。想让自托管模型产生情绪变化,意味着要重新生成或进行微调;而在这里,它只是脚本中的一个词元。

• 你无需核实的覆盖范围——90 多种语言对 VoxCPM2 的 30 种,但需注意:该检查点的清单明确且逐一列名(包括汉语方言),而供应商的“90 多种”只是一个数字,没有清单。

• 无运维面 — 无 GPU、无服务栈、无版本漂移,且在 10 月 12 日前为每 1,000 个字符 $0.022 的促销价,之后为 $0.08 的标价。

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

这两者都不是我们的,而这正是本节的重点所在。

OrcaRouter 并不托管这两个模型。我们的目录中既没有 ElevenLabs 端点,也没有 VoxCPM2 端点;诚实的路由答案是:Eleven v4 需通过 ElevenLabs 自家的 API 访问,而 VoxCPM2 则要部署在你自己的硬件上。我们不会为了让对比看起来更整洁而暗示其他情况。

单一密钥真正能帮上忙的地方,是决策之前的那个决策。自托管的讨论之所以停滞,是因为替代方案从未被评估:一次 API 调用就是一次调用,而一个 checkpoint 却是一整套服务栈,于是 API 靠默认胜出,而不是靠算账胜出。OrcaRouter 的贡献在于,让这一比较中托管的那一半变得测试成本很低——200 多个模型汇聚在一个 API 密钥背后,供应商标价按0% 加价原样传递,因此托管方案是按真实费率而非估算费率被评估,同时配有自动故障转移,前提是你在尚未完成决策之前,就把候选方案挂到线上路径上。

如何一遍就做出决定

如果语音必须第一遍就出好效果,而且你想这周就完成,那就选 Eleven v4。你能获得独立榜单的榜首、有文档说明的方向语法、本次对比中有文档记录的最多语言数量,以及零基础设施。自 10 月 13 日起,你需按每 1,000 个字符 0.08 美元付费,并且接受无法重新训练它、固定版本,或把音频保留在你自己的硬件上。

如果模型必须归你所有,就选 VoxCPM2。Apache 2.0、约 8 GB 显存上运行 2B 参数、48 kHz 输出且链路中没有上采样器,以及一条只需五到十分钟音频就能跑通的微调路径——这些能力是托管端点无论出多少钱都提供不了的,而缺少 arena 排名行就是拥有它们的代价。在正式投入之前,先在自己的显卡上跑一遍吞吐量数据,因为 0.30 和 0.13 这两个实时因子是模型卡自身的测量值,你的服务栈不会完全复现它们。

而如果诚实的答案是,你并不知道自己每月的音频播放量,那这个数字就是你要去弄清楚的。它决定了这一比较。两块看板都不会告诉你。