
Eleven v4 对比 VoxCPM2:一个排名模型,对阵一个你无法租用的检查点
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
这场对比中最有用的事实,是一条并不存在的记录。ElevenLabs Eleven v4在 Artificial Analysis 的 Provider Voice Arena 上,以 1,319 的 Elo 在 1,674 次亮相中位居第 1,价格为每百万字符 80.00 美元。VoxCPM2,这个 OpenBMB 于 2026 年 4 月发布的检查点,在两个语音榜单上都毫无踪影——不在已排名之列,不在未排名之列,也没有作为预览条目出现。这不是对质量的评判。这意味着,无论你原本希望拿哪个数字来与 1,319 比较,都没有人给出过它,因此比较必须基于偏好之外的某些东西来进行。剩下的就是所有权、微调,以及一个托管端点让你无法提出的许可问题。
各方实际交到你手上的东西
这些是不同类别的产品,差异并非表面上的。
• 访问方式 — Eleven v4 是通过 ElevenLabs 自家 API 访问的托管端点,按字符计费。VoxCPM2 则是 Hugging Face 上的一个模型检查点,位于 openbmb/VoxCPM2;你需要自行下载并运行,没有第一方端点可供调用。
• 许可证 — VoxCPM2 以 Apache 2.0 发布,明确可免费商用。Eleven v4 是商业 API,其条款由 ElevenLabs 制定。如果你的法务审查要问是否可以微调、再分发或发布权重,这一差异就很重要;对于该检查点,答案是白纸黑字且固定不变的。
• 规模与硬件——VoxCPM2 基于 MiniCPM-4 主干,拥有 20 亿参数,该卡片标注其在 bfloat16 下约需 8 GB 显存,最大序列长度为 8,192 个 token。ElevenLabs 未公布 Eleven v4 的参数数量,而托管模型的硬件占用也并非由你管理的事项。
• 输出链路——VoxCPM2 接受 16 kHz 参考音频,并通过 AudioVAE V2 内置的超分辨率输出 48 kHz,路径中无需外部上采样器。托管 TTS 会以供应商选择的任意采样率向你提供音频流。
• 独立评分——Eleven v4 有,而且是第一名。VoxCPM2 没有。没有并不等于低分;它是一个未评分的模型,两者绝不应被放在同一句话里相提并论,仿佛后者是一个分数。

替代缺失 Elo 的数字
如果你无法比较偏好,那就比较你能计算的东西;而对于自托管模型来说,那就是吞吐量。VoxCPM2 的模型卡援引的数据是:在 RTX 4090 上以标准 PyTorch 运行时,实时因子约为 0.30;在 Nano-VLLM 下则降至约 0.13。实时因子是每秒钟音频所需的计算秒数,因此这两个数字意味着:在第一种情况下,一个 GPU 小时大约能产出 3.3 小时的成品语音;在第二种情况下则约为 7.7 小时。

两个结论立刻随之而来。服务栈比模型更重要:同一张显卡上的同一个检查点,只要更换推理引擎,其输出就会翻一倍以上,因此任何使用 0.30 这个数字的成本模型,都会把你的自托管成本高估约 2.3 倍。而利用率才是关键:一张闲置的显卡,无论价格如何,都赢不了按字符计费的 API,因为 API 的账单随你说多少而增长,而显卡的账单则随你何时购买而增长。
这就是为什么这个决定诚实的表述不是“哪种听起来更好”,而是“你每个月制作多少小时音频,以及硬件是否繁忙”。在低于让一块卡保持加载状态的用量时,API 胜出,而且优势不小。高于这个用量时,在你自己已经拥有的硬件上,检查点第一千小时的边际成本与第一小时的成本相同——而这是一种任何价目表都无法匹敌的结构性优势。
托管端点不会卖给你的能力
比较到这里就不再是镜像对照了,因为有一件事 VoxCPM2 能做,而 Eleven v4 从根本上做不到:你可以重新训练它。模型卡记录了在少至五到十分钟音频上进行的完整 SFT 和 LoRA 微调,并为二者分别提供了训练脚本和配置。
这会改变语音项目的形态。托管式 API 为你提供固定模型,外加供应商开放的任何克隆功能——就 Eleven v4 而言,即时克隆只需十秒参考音频,其上方还有专业层级。可进行 LoRA 调优的检查点则为你提供一个从未见过他人数据的模型,并且你可以通过版本锁定其行为。对于品牌语音、受监管领域,或供应商的配音阵容处理不佳的语言,这属于另一类解决方案,而不是更便宜的方案。
这笔交易是明摆着的,也值得挑明:用上 VoxCPM2,你就得接受:从未有第三方给这个模型打过分,质量保证得靠你自己去建立和衡量,而 8,192 token 的序列长度上限,以及模型卡自己的那句警告——语音设计和风格控制在每次运行之间都会有所不同,建议生成一到三次——如今都成了你自己的质检难题。
Eleven v4 能带给你、而检查点给不了的东西
反过来说,托管模式的优势是那些会出现在发布日程表上、而不是规格表上的优势。
• 一项有据可依的排名——在估算背后有 1,674 个样本支撑的榜单上位列第一,其误差区间约为 ±19 分。无论该榜单衡量的是什么,它都独立于两家厂商,并且是本次比较中唯一的第三方质量信号。
• 文本中的表演指导——内联音频标签,例如[笑声]、[低语]和[用法语口音愤怒地说],此外还有自然语言表达提示,以及对国际音标的改进支持。想让自托管模型产生情绪变化,意味着要重新生成或进行微调;而在这里,它只是脚本中的一个词元。
• 你无需核实的覆盖范围——90 多种语言对 VoxCPM2 的 30 种,但需注意:该检查点的清单明确且逐一列名(包括汉语方言),而供应商的“90 多种”只是一个数字,没有清单。
• 无运维面 — 无 GPU、无服务栈、无版本漂移,且在 10 月 12 日前为每 1,000 个字符 $0.022 的促销价,之后为 $0.08 的标价。

这两者都不是我们的,而这正是本节的重点所在。
OrcaRouter 并不托管这两个模型。我们的目录中既没有 ElevenLabs 端点,也没有 VoxCPM2 端点;诚实的路由答案是:Eleven v4 需通过 ElevenLabs 自家的 API 访问,而 VoxCPM2 则要部署在你自己的硬件上。我们不会为了让对比看起来更整洁而暗示其他情况。
单一密钥真正能帮上忙的地方,是决策之前的那个决策。自托管的讨论之所以停滞,是因为替代方案从未被评估:一次 API 调用就是一次调用,而一个 checkpoint 却是一整套服务栈,于是 API 靠默认胜出,而不是靠算账胜出。OrcaRouter 的贡献在于,让这一比较中托管的那一半变得测试成本很低——200 多个模型汇聚在一个 API 密钥背后,供应商标价按0% 加价原样传递,因此托管方案是按真实费率而非估算费率被评估,同时配有自动故障转移,前提是你在尚未完成决策之前,就把候选方案挂到线上路径上。
如何一遍就做出决定
如果语音必须第一遍就出好效果,而且你想这周就完成,那就选 Eleven v4。你能获得独立榜单的榜首、有文档说明的方向语法、本次对比中有文档记录的最多语言数量,以及零基础设施。自 10 月 13 日起,你需按每 1,000 个字符 0.08 美元付费,并且接受无法重新训练它、固定版本,或把音频保留在你自己的硬件上。
如果模型必须归你所有,就选 VoxCPM2。Apache 2.0、约 8 GB 显存上运行 2B 参数、48 kHz 输出且链路中没有上采样器,以及一条只需五到十分钟音频就能跑通的微调路径——这些能力是托管端点无论出多少钱都提供不了的,而缺少 arena 排名行就是拥有它们的代价。在正式投入之前,先在自己的显卡上跑一遍吞吐量数据,因为 0.30 和 0.13 这两个实时因子是模型卡自身的测量值,你的服务栈不会完全复现它们。
而如果诚实的答案是,你并不知道自己每月的音频播放量,那这个数字就是你要去弄清楚的。它决定了这一比较。两块看板都不会告诉你。
