
HeyGen Voice vs ElevenLabs:克隆语音新晋第一,以及仍主宰全局的厂商
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
2026年10月9日,HeyGen Voice 以 1,202 Elo 登上 Artificial Analysis 的 Controlled Voice 竞技场榜首,而它从那个位置挤下的模型是 ElevenLabs 的一个层级:Eleven v4 Turbo,现以 1,167 位列第三。这是头条新闻,而且准确无误。但这句话的实际分量也远没有听起来那么大,因为同一家厂商的模型在同一张受控榜单上分别位列第二、第三、第四、第十一和第十五,而 Eleven v4 Turbo 在规模大得多的 Provider Voices 竞技场上仍以 1,328 Elo 位居第一——领先 HeyGen Voice 126 分,而后者在那张榜单上根本没有排名。一个引擎赢下了一张榜单。该厂商仍然主宰着这个品类。
同一家供应商现在在前十五名中占据了五个席位。
受控榜单将音色设为固定条件——八个克隆参考音色,四个美国、四个英国——因此每个条目都依据引擎处理一个它无从选择的音色时的表现来评判。该榜单目前的读数是:HeyGen Voice 1,202、Qwen-Audio-3.1-TTS-Plus 1,186、Eleven v4 Turbo 1,167、Eleven v4 1,160、Sonic 3.6 1,143、Realtime TTS-2 1,143。再往下,Eleven v3 以 1,072 位居其后,v3 Conversational 则为 1,056。
该领域排名前十五的条目中,有五个挂着同一个厂商的名号。而榜单上拥有单个最佳模型的那家对手,手握五款好模型,横跨两代、覆盖两个价位,外加一个完全属于另一款产品的对话式变体。这就是从排行榜领先位置内部看到的在位者模样,也正是首次登顶只配得上一则头条、而非一份迁移计划的原因。
ElevenLabs 模型究竟是什么
在厂商自己的文档中,Eleven v4 Turbo 被描述为面向实时语音合成的最先进模型,推荐用于客服坐席、AI 助手和互动角色,可通过 Text to Dialogue websocket 访问,模型标识符为eleven_v4_turbo。ElevenLabs 称其中位推理延迟约为 100ms——这是厂商自报的数据,而且同一页面的脚注已将应用延迟和网络延迟排除在该数字之外,因此它只是一个模型引擎层面的数字,而非端到端往返延迟的承诺。
v4 系列的语言覆盖范围在这次对比中遥遥领先:支持 90 多种语言,涵盖南非荷兰语、阿拉伯语,到粤语、印地语、日语、普通话和祖鲁语。HeyGen 自己的文档列出了横跨“数十种语言”的 300 多种预置语音,却没有公布具体数量——这是描述语音库的另一种方式,与语言数量并不能直接相提并论。
然后是那些根本不会出现在排行榜上的部分:语音库、稳定性和相似度控制、按请求调参,以及长达十年的集成面。模型对比并不等于平台对比,而 ElevenLabs 这一项在两者上都有竞争力。

记分牌
• 受控语音 Elo — HeyGen Voice:1,202(第 1 名)。Eleven v4 Turbo:1,167(第 3 名)。Eleven v4:1,160(第 4 名)。
• 提供商语音 Elo — Eleven v4 Turbo:1,328(96 个中排名第 1)。HeyGen Voice:未排名。
• 每 100 万字符的公布价格 — Eleven v4 Turbo:40.00 美元。Eleven v4:80.00 美元。HeyGen Voice:30.00 美元,依据该竞技场自身对 HeyGen 积分定价的换算;HeyGen 本身并未公布语音费率。
• 标称延迟 — Eleven v4 Turbo:推理时间中位数约 100ms,不含应用与网络延迟(供应商报告)。HeyGen Voice:未公布相关数据。
• 语言覆盖范围 — ElevenLabs v4 系列:90 多种语言(供应商文档)。HeyGen Voice:“数十种语言”,未公布具体数量。
• 受控前十五名中的模型——ElevenLabs:五个层级。HeyGen:一个。

两块板之间的间隙才是有趣的数字。
Eleven v4 Turbo 在 Provider Voices 榜单上领先 HeyGen Voice 161 分,但在受控榜单上落后 35 分。这两个数字来自同一个网站、同一种盲听方法和同一时间段。它们之间的区别就在于声音。
在供应商榜单上,每个厂商都提供自己的原生声音,因此一家花了多年时间构建和精心打磨声音库的公司,可以派出自己最强的一套。在受控榜单上,这种优势消失了——引擎必须渲染一个并非由它挑选的克隆声音。两项结果之间 196 分的差距,实际上衡量的是 ElevenLabs 的地位中有多少来自声音,而不是引擎。这是一个很大的比例。但它也不是零:1,167 在四十二个中仍排第三。
对于买家而言,这就对应到一个具体问题。如果你是从供应商的语音库中挑选一个声音,那么服务商榜单就是你要看的榜单,而 ElevenLabs 在该榜单上的位置无人能撼动。如果你是在克隆某位特定的说话人,那么受控榜单才是你要看的榜单,而本周它的榜首出现了一个新名字。
在位者的成本没有变化
Eleven v4 Turbo 在该供应商的 API 上为每百万字符 40 美元,而较旧的 Eleven v4 是 80 美元——翻倍,却是一个在受控排行榜上 Elo 分低 7 分的模型。同一供应商内部的这种价差值得停下来想想:同一家公司的两款模型,价格相差 2 倍,排名相差三位。
在价格对比中,HeyGen 这一侧的数据确实存在,但并非以 HeyGen 发布过的形式呈现。该竞技场将其列为每百万字符 30.00 美元——比它所取代的 ElevenLabs 档位低十美元,也是更早的 Eleven v4 的 80 美元定价的 62%——但这一数字是 Artificial Analysis 的换算结果,并非厂商报价:HeyGen 的公开定价页面销售积分(600 积分每月 29 美元,1,000 积分 49 美元,1,500 积分 149 美元),并说明消耗量会因模型、时长和复杂度而异,却没有标出语音费率。因此,克隆语音评分更高的挑战者,其定价比在位者低四分之一,而依据的却是一个在位者无须自行换算的数字。

每一方实际上在哪里获胜
当广度成为制约因素时,选择 ElevenLabs。九十多种语言、受控排行榜上的五个排名层级、成熟的语音库,以及一款定价为每百万字符 50 美元、在受控排行榜上排名第十五的对话式变体——这样的组合很难在其他地方凑齐,而这正是该供应商在失去榜首位置后仍能保持领先的原因。
当约束条件是一致性时,测试 HeyGen Voice。同一个说话人、数千行内容,一个每次都必须听起来像那位说话人的克隆——这正是受控竞技场所模拟的那种工作负载,而 HeyGen Voice 目前是这方面得分最高的引擎。适合这项任务的是用二十多分钟音频训练的专业克隆路径,而不是基于单次录音的即时克隆。
不要将 1,202 分解读为 HeyGen Voice 全面胜过 ElevenLabs 的证据。它只在一个榜单上胜过 ElevenLabs 的一个档位。另有三个档位与它的差距在 42 分以内,而另一个榜单的榜首领先它 126 分。
在没有迁移的情况下测试挑战者
这里的成本不对称才是真正有用的部分:替换语音引擎的构建成本很低,一旦出问题又能立刻听出来;而在挑战者处理得更出色的流量上,继续让每百万字符 40 美元的现有方案跑着,是一笔昂贵的开销。解决办法是把两者都放在同一个集成之后,让你自己的音频来做判断——OrcaRouter 把两者放在同一个 API key 下,按供应商标价提供,不加价,因此供应商调价会直接在源头体现,而不是等到合同续签时才反映;自动故障转移意味着失败的语音请求会落到另一台引擎上,而不是悄无声息地断掉。第一轮测试时,你可以在一小段素材上把流量向自己耳朵更偏爱的那台引擎倾斜,而路由 DSL 让你能用一台引擎处理预渲染旁白、另一台处理交互式轮次,无需第二套客户端库。
什么会改变这个故事?
HeyGen Voice 若进入 Provider Voices 竞技场,就能告诉我们:一个克隆音色领先的产品,能否转化为有竞争力的原生音色——这是 ElevenLabs 以 1,328 通过的那项测试。HeyGen 自家定价页面上标出的音色费率,能把竞技场推导出的 $30.00 变成可以核验的算术。再多一个月的投票,也将显示相对 Qwen-Audio-3.1-TTS-Plus 领先的 16 Elo 是稳定排序,还是一时快照。这三者中的任何一个都可能改变推荐结论;目前它们一个都还没发生,而在它们发生之前,诚实的总结就是:HeyGen Voice 赢下了受控棋盘,而 ElevenLabs 依然主导着这个品类。
