一张生成的 hero 卡片,标题为“HeyGen Voice 在 Controlled Voice Arena 上首秀即登顶第 1”,正文为“1,202 Elo — 领先 Qwen-Audio-3.1-TTS-Plus 和 Eleven v4 Turbo”,注释为“同样八个克隆参考音色 — Artificial Analysis,2026 年 10 月 9 日”。OrcaRouter 标志位于右下角。
Guides & Insights

HeyGen Voice 在受控语音 TTS Arena 上首次亮相即排名第一——在克隆语音上击败 Qwen 和 ElevenLabs

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年10月9日,Artificial Analysis将HeyGen Voice加入了其Controlled Voice竞技场,该模型随即直接登顶。HeyGen Voice——HeyGen首个在该榜单上接受评测的文本转语音模型——获得了1,202的Elo分数,领先于Qwen-Audio-3.1-TTS-Plus的1,186分和ElevenLabs的Eleven v4 Turbo的1,167分。在该网站开放Provider Voices榜单上位居榜首的Cartesia Sonic 3.6,在此处以1,143分位列第五。这一成绩在一个旨在消除语音评测中最大单一干扰因素的排行榜上是真实可信的,同时它也具有一个非常具体、却容易被过度解读的含义:HeyGen Voice是在八个克隆参考语音上该竞技场中最好的语音,但尚不能算是这个拥有九十六个模型的榜单上经过实测的冠军。

Controlled Voice 董事会衡量什么,以及为什么这很重要

Artificial Analysis 运营着两个语音榜单,它们回答的是不同的问题。Provider Voices 竞技场允许每家供应商提供自己的原生语音——公司为代表自身而挑选的精致演示语音——并根据这些语音的听感好坏对模型进行排名。其排行榜覆盖广泛且成熟:共有九十六个条目,Eleven v4 Turbo 以 1,328 Elo 位居榜首,Cartesia Sonic 3.6 以 1,280 排名第四。

Controlled Voice 竞技场做的事更聚焦,而且对任何要发布产品的人来说都更有用。它上面的每个模型都用同样的八个克隆声音生成语音——四个美式、四个英式——所以比较的不是“谁的营销嗓音更好听”,而是“每个引擎如何处理同一个声音、同一段文本和同样的录音条件”。这是行业内最接近对引擎本身、而非演示样片进行同条件测试的东西;如果你打算克隆一个声音并把它交给 TTS 模型,这才是真正重要的榜单。

HeyGen Voice 现在领先。它领先 Qwen-Audio-3.1-TTS-Plus 16 Elo,领先 Eleven v4 Turbo 35 Elo,据报道 HeyGen 分数的 95% 置信区间约为 1,185 到 1,219。16 Elo 是实实在在的差距,但不是鸿沟——在如此密集的榜单上,它意味着第一名和第二名之间的差别,而不是可用与不可用之间的差别。

A generated single-column scoreboard titled 'HeyGen Voice — the scoreboard' with rows reading 'Controlled Voice Elo: 1,202', '95% confidence interval: roughly 1,185 to 1,219', 'Rank in the controlled field: #1 of 42 ranked entries', 'Provider Voices Elo: not listed, insufficient votes', "Price on the arena's basis: $30.00 per 1M characters, derived from credit pricing" and 'Elo anchor: the board baseline is 1,000 points', with a footer reading 'Elo per Artificial Analysis, 9 October 2026. Price shown is the arena's conversion of credit pricing.' The OrcaRouter logo appears in the bottom-right corner.

HeyGen Voice 尚未获得排名的地方

这个结果需要坦诚看待的一点是,HeyGen Voice 根本没有出现在 Provider Voices 榜单上,而它的缺席并不是关于质量的信号。Artificial Analysis 指出,模型可能因尚未获得足够投票而被遗漏。一个才上线几天、背后只有一个评分方式不同的竞技场的模型,只是尚未积累起更大榜单所需的盲听者规模。

因此,2026年10月10日的正确解读是:HeyGen Voice 是在受控的克隆语音对比中排名第一的语音,但面对更广泛的领域仍是一个未知量。任何拿这个数字来引用“世界上最好的 TTS 模型”的人,所引用的榜单都比这句话所暗示的范围更小。

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing the ranked model list with Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, alongside samples, release dates and API pricing columns and 8-voice arena badges.

Elo 背后的两个数字

• 受控语音 Elo — HeyGen Voice:1,202(95% 置信区间约为 1,185–1,219)。Qwen-Audio-3.1-TTS-Plus:1,186。Eleven v4 Turbo:1,167。

• Provider Voices Elo — HeyGen Voice:未列出(投票数不足)。Eleven v4 Turbo:1,328,位列第 1。Sonic 3.6:1,280,位列第 4。

• 在受控领域中的排名 — HeyGen Voice:在 42 个参评条目中排名第 1(第 42 名为 OpenVoice v2,得分为 812)。

• 按竞技场基准计价 —— HeyGen Voice:每 100 万字符 $30.00,这是竞技场根据 HeyGen 积分定价自行换算的结果。Qwen-Audio-3.1-TTS-Plus:每 100 万字符 $19.30。Eleven v4 Turbo:每 100 万字符 $40.00。

• Elo 基准 — OpenAudio S1 是位于 1,000 的固定参考点,因此 HeyGen Voice 比该基准高 202 分。

• 还有谁跻身前五——Eleven v4 以 1,160 分、Sonic 3.6 以 1,143 分紧随领先者之后,共同构成了前五名。

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech, above the Realtime Video and Avatar Management groups.

HeyGen 实际发布了什么

该条目背后的引擎是 HeyGen 自研的 TTS,通过该公司的 v3 API 对外提供。GET /v3/voices 调用会接受一个 engine 筛选条件,其取值包括 orca —— HeyGen 自家的语音引擎 —— 以及 starfish 和直通 ElevenLabs 语音的选项。语音渲染通过 POST /v3/voices/speech 进行;按请求调优可设置 speed(0.5 到 1.5)和 pitch(−50 到 +50 半音),并可通过 BCP-47 locale 提示。

该目录列出了数十种语言中的 300 多种预置语音。自定义语音有三种类型:文本转语音设计,可根据不超过 1,000 个字符的描述生成最多三个排序后的选项;基于单段录音的即时克隆;以及用二十分钟或更长音频训练的专业克隆。最后一种正是 Controlled Voice 排行榜实际上在进行压力测试的部分——那八个参考语音都是克隆语音,而克隆质量正是 TTS 引擎分出高下的地方。

文档中还将引擎列为可按语音选择,这意味着 HeyGen 并不强求你使用它的模型:当你更偏好某个第三方语音引擎时,可以通过其 API 路由过去。这相当于厂商在给自己的模型留后路,当你看到有关 HeyGen 的“#1 语音”宣称时,这一点值得了解。

这对任何选择语音的人来说意味着什么变化

受控语音结果落地会带来三个实际后果,而其中没有一个是“全部切换”。

首先,如果你的用例是克隆品牌声音——一个说话人,多段台词——那么现在这就是你要看的榜单,而 HeyGen Voice 是应当最先测试的模型。一个固定声音不变的排行榜,衡量的正是你实际要做的事情。

其次,如果你的用例是需要一大批听起来像母语者的角色,且这些角色使用你的克隆声音并不覆盖的语言,那么 Provider Voices 榜单及其九十六个条目仍然是相关参考,而 HeyGen Voice 在那里尚无排名。克隆声音的结果中没有任何信息能说明该引擎如何处理一百种各不相同的声音。

第三,价格现在有了一个数字,但并不是供应商公布的那个数字。该竞技场将 HeyGen Voice 列为每 100 万字符 30.00 美元,这是 Artificial Analysis 对一套积分系统的换算,而 HeyGen 自己的页面从未将其换算成语音费率。这使得这位新晋领先者低于 Eleven v4 Turbo 的 40.00 美元,高于 Qwen 档位的 19.30 美元——一个与第一名得分挂钩的中游价格,而且是推导出来的,而非直接报价。

路由问题

语音选择有一个大多数模型选择不具备的特性:一旦失败,终端用户在一个音节之内就能听出来。这使得迁移测试成本很低,而在生产环境中出错则代价高昂。让新引擎运行在与现有引擎相同的接口之后——同一套 API 接口、同一个密钥、按供应商标价透传而非加价,并在请求失败时自动故障转移至第二家语音提供商——这样你得到的才是关于自己音频的真实答案,而不是 Elo 图表中关于八个参考语音的答案。OrcaRouter 的路由层正是为这种决策形态而存在:让挑战者承接一小部分流量,保持现有模型处于热备状态,并让故障转移覆盖新模型尚未得到验证的窗口期。排行榜告诉你该往哪里看。它无法告诉你你的脚本听起来如何。

接下来看什么

两个数字将为这件事画上句号。第一个是,HeyGen Voice 能否累积到足够的票数进入 Provider Voices 榜,以及它相对于 Eleven v4 Turbo 的 1,328 票会落在什么位置——后者在那张榜上领先,却在受控竞技场中落后,而这正是这两个榜单存在所要揭示的差距。第二个是,HeyGen 是否会公布自己的语音费率,这样竞技场推算出的 $30.00 就能与供应商给出的数字核对,而不是从积分中推断出来。在这两者都出现之前,在受控榜单上以第 1 名首次亮相,是对克隆语音质量的有力声明,而对其他一切则仍是悬而未决的问题。