一张生成的 hero 卡片,标题为“HeyGen Voice 对比 Cartesia Sonic 3.6——记分牌”,对两款引擎进行对比,并附注说明:根据 Artificial Analysis 于 2026 年 10 月 9 日的数据,该 Elo 对比将八个克隆参考语音保持不变。OrcaRouter 标志出现在右下角。
Engineering & Research

HeyGen Voice 对决 Cartesia Sonic 3.6:克隆语音冠军迎战延迟低于 90 毫秒的在位者

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

HeyGen Voice 和 Cartesia Sonic 3.6 在 Artificial Analysis 上各自持有一项不同的第一名主张,而两者的全部对比就存在于二者之间的落差之中。HeyGen Voice 以 1,202 Elo 位居 Controlled Voice 竞技场榜首——在这个榜单上,每个模型都使用同样的八个克隆声音,四个美式、四个英式。Cartesia Sonic 3.6 以 1,280 Elo 在 Provider Voices 竞技场位列第四,在这里每个厂商都提供自己原生的声音;而 Cartesia 自家网站挂着一枚徽章,声称在 Speech Arena 和 Speech to Text 排行榜上均排名第一——这一厂商展示的主张,当前的 Artificial Analysis 实时榜单在榜首位置上并不支持。一款引擎在声音保持不变的测试中胜出,另一款则在实际制作预算的测试中领先。

从每个模型实际优化的目标开始

Sonic 3.6 生来就为流式消费而打造。Cartesia 自家的产品页开篇主打“90 毫秒内输出首个音频”——这是厂商自报的数据,尚未被复现——同一页面还介绍了一个原生支持流式传输的实时 TTS API。它以单一模型覆盖 44 种语言,默认解读情感潜台词,接受写入转录文本中的笑声等非语言线索,可从约十秒的音频中克隆声音,将现有音频本地化为其他语言,并支持为领域术语和专有名词提供自定义发音词典。上述每一项功能都瞄准同一类客户:一个能快速回话、并使用来电者听得懂的语言的东西。

HeyGen Voice 的构建目的,就是作为一种表演被消费。它是 HeyGen 的自研引擎,通过公司的 v3 API 对外提供,拥有覆盖数十种语言的 300 多种预置声音,以及三条通往自定义声音的途径——描述驱动的声音设计,可根据一段上限为 1,000 个字符的提示返回最多三个带排名的选项;一段录音即可完成的即时克隆;以及基于二十分钟或更长时间训练的专业克隆。按请求调优涵盖 语速从 0.5 到 1.5,以及音高在 ±50 个半音范围内。HeyGen 的公开材料中完全没有承诺任何延迟数值。

这种不对称恰恰就是全文的重点。一个模型公布了毫秒数,却没有给出按字符计费的价格;另一个公布了价格,却没有给出延迟数字。

记分牌

A generated two-column scoreboard titled 'HeyGen Voice vs Cartesia Sonic 3.6 — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', "Price: $30.00 per 1M characters, arena conversion of credit pricing", 'Latency: no figure published', 'Languages: dozens, count unpublished' and 'Custom voice: design, instant clone, professional clone'. The Cartesia Sonic 3.6 column reads 'Controlled Voice Elo: 1,143, #5 of 42', 'Provider Voices Elo: 1,280, #4 of 96', 'Price: $49.00 per 1M characters, vendor rate card', 'Latency: under 90ms to first audio, vendor-reported', 'Languages: 44 from one model' and 'Custom voice: roughly 10-second clone'. A footer distinguishes vendor-published rates from the arena's derived conversion.

• 受控语音 Elo(相同的 8 个克隆语音) — HeyGen Voice:1,202,在 42 个中排名第 1。Sonic 3.6:1,143,排名第 5。

• 提供商之声 Elo(原生语音) — HeyGen Voice:未排名,投票不足。Sonic 3.6:1,280,96 个中排名第 4。

• 公布价格——Sonic 3.6:每 100 万字符 49.00 美元,供应商费率卡。HeyGen Voice:每 100 万字符 30.00 美元,系该竞技场自行换算 HeyGen 积分定价所得;HeyGen 本身并未公布语音费率。

• 延迟 — Sonic 3.6:首个音频输出低于 90ms(厂商报告,未经复现)。HeyGen Voice:厂商未公布任何数据,Artificial Analysis 也未进行测量。

• 语言 — Sonic 3.6:单个模型支持 44 种。HeyGen Voice:300 多种声音,覆盖“数十种语言”,未以具体数量列举。

• 自定义语音路径 — Sonic 3.6:约 10 秒克隆。HeyGen Voice:根据文本描述设计语音、即时克隆,或基于 20 分钟以上素材训练的专业克隆。

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked model list with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186, Eleven v4 Turbo third at 1,167, Eleven v4 fourth at 1,160 and Sonic 3.6 fifth at 1,143, with samples, release dates and per-1M-character API pricing columns.

正确解读 Elo 差距

在受控竞技场中领先 59 分,到了供应商排行榜上却反转为落后 137 分,而这种反转并非矛盾。受控榜单消除了厂商挑选讨喜音色的能力,考察的是引擎如何处理一个它并未选择的音色。HeyGen Voice 在这点上胜出。供应商排行榜考察的则是厂商自家最佳音色听起来有多好,这更接近客户在销售演示中听到的效果——Sonic 3.6 在该项表现不错,在 96 个中位列第四,落后排名第一的 Eleven v4 Turbo 38 分。

两个数字都不是普遍适用的真理。如果你是在克隆某个特定的人,并且需要引擎把那个人渲染得令人信服,那么受控结果才是更好的预测指标,而 HeyGen Voice 目前在这方面领先。如果你是在为某个必须在大规模下听起来有辨识度的智能体从语音库中挑选声音,那么提供商结果才是更好的预测指标,而 Sonic 3.6 拥有一个排名,HeyGen Voice 却没有。

值得提醒任何仍在使用旧数据的人:这两个榜单都会随着投票累积而变化。2026 年早些时候,据报道 Sonic 3.6 在可控语音榜上绝对领先;当前榜单显示,它在该榜以 1,143 位列第五,HeyGen Voice、Qwen-Audio-3.1-TTS-Plus 以及两个 Eleven v4 层级排在它前面。排行榜引用是一个时间戳,而不是模型的永久属性。

定价比较在哪里失效

Sonic 3.6 的每百万字符 49.00 美元是该竞技场自身的基准价格,取自供应商公布的默认设置下的 API 费率。这使得每月五位数的音频账单在你编写一行集成代码之前就可以计算出来。

HeyGen 的数字更软一些,但确实存在。该竞技场的价格图表将 HeyGen Voice 列为每百万字符 30.00 美元——比 Sonic 3.6 低 19 美元——而这一数字是 Artificial Analysis 根据 HeyGen 的积分定价换算而来的,并非 HeyGen 公布的费率。HeyGen 自己的页面出售积分(Creator 每月 29 美元 600 积分,Pro 49 美元 1,000 积分,Business 149 美元 1,500 积分),并明确说明消耗量会因模型、时长和生成复杂度而异,却从未将这些积分换算成字符数。因此,在受控语音排行榜上胜出的模型,其定价远低于排名第五的模型,而这个差距是一个推导出来的数字;你最好用你自己的文本去核实,而不是把它当成一份可供审计的费率卡。

这不是反对 HeyGen Voice 的理由。这恰恰说明,应当在你负担得起衡量的流量上测试它,因为要了解它在你的流水线中的真实成本,唯一的方法就是把你自己的文本跑一遍。

在两者之间选择

当语音必须应答时,选择 Sonic 3.6。低于 90 毫秒的首音频宣称、流式原生 API、单一模型支持 44 种语言,以及——关键的是——一份公开的费率表,使其成为对话式智能体、IVR 以及任何停顿即故障的场景中风险更低的生产选择。其在受控语音中排名第 5 是可观的,而非弱点,而它在更广泛榜单上位列第四,则是这两个模型所具备的最强独立信号。

当声音需要真正上阵表现时,先测试 HeyGen Voice。旁白、品牌口播内容、角色演绎,以及任何你要克隆一位说话人、并需要该说话人的克隆成为最终输出中最好听的声音的项目——这正是受控竞技场被构建来衡量的任务,也正是 HeyGen Voice 刚刚赢下的任务。基于二十多分钟素材训练的专业克隆路径,与十秒即时克隆是有着本质区别的产品,而它才与竞技场中的八个克隆参考声音相对应。

不要仅凭一个 Elo 数值就选定其中任何一个。这两个排行榜在这些模型上意见不一,这说明排行榜确实在告诉你一些实情:质量取决于音色和任务负载,而不只取决于引擎本身。

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, with samples, release dates, 8-voice arena badges and API pricing columns.

运行两者而不提交

遇到这类分歧,务实的做法是不要再把它当成一项采购决策。把两个引擎放到同一个接口之后,分流流量,再根据自己的音频来判断——几行旁白加上一个实时智能体循环,能告诉你的会比 50 个 Elo 分更多。OrcaRouter 用单个 API 密钥按供应商标价路由二者,且不加价,所以你付的就是供应商自己的价目表,Sonic 3.6 的价格变动当天就会体现,而不是等到续约时才体现。自动故障转移在这里比在大多数模型替换场景中更重要,因为语音供应商如果在句子中间卡住,来电者是听得出来的;而路由 DSL 让你可以把一个引擎固定用于延迟敏感的轮次,把另一个用于预渲染旁白,而不必维护两套集成。

什么能了结它

两件事。HeyGen 若公布按字符或按积分的语音费率,就会让这项对比中成本的那一半像质量那一半一样具体;而 HeyGen Voice 若累积到足够票数、得以进入 Provider Voices 竞技场,就会告诉我们:它的受控语音优势在与原生语音正面交锋后是否依然成立——这项测试 Sonic 3.6 已经通过,在九十六个中位列第四。在那之前,Sonic 3.6 是守擂者,手握价格和延迟数据;HeyGen Voice 则是挑战者,拥有更出色的克隆语音证据,却拿不出成本数据与之并列。