
HeyGen Voice 与 Qwen-Audio-3.0-TTS:你为 Elo 付出了什么,以及你实际基准测试的是哪个 Qwen 层级
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
先算一笔账,因为它并不像记分牌显示的那样悬殊。Qwen-Audio-3.0-TTS-Plus 在 Model Studio 平台上的价格是每百万字符 19.30 美元——这是厂商自己公布的价格。而 HeyGen Voice 在 Artificial Analysis 自家的价格图表上为每百万字符 30.00 美元,这个数字是该网站根据 HeyGen 的积分定价推算出来的,因为 HeyGen 公开的定价页面只按积分出售,并未说明一次语音生成究竟消耗多少积分。与此同时,两者在控制语音条件下的差距为 79 Elo:在把全部八个参考音色都保持不变的竞技场上,HeyGen Voice 得分 1,202,Qwen-Audio-3.0-TTS-Plus 为 1,123。也就是说,更便宜的那个模型排名远落后于更好的那个,两者之间的价格比约为 1.55 倍,而这两个价格中,只有一个数字是出售它的厂商愿意署名认可的。
名字中的陷阱
在做任何这些之前,先把层级搞对,因为这是一个会轻易让你对错误模型做基准测试的系列。这里有两个 Alibaba 条目很重要,而且它们不能互换。
Qwen-Audio-3.0-TTS-Plus 是本文用来比较的模型。它在受控榜单上得分为 1,123——在四十二个中排名第七——在 Provider Voices 榜单上得分为 1,264,在九十六个中排名第六。它是一款真实、当前可用的流式 TTS 产品,公布费率为每百万字符 19.30 美元。
Qwen-Audio-3.1-TTS-Plus 是其后继层级,它在受控榜单上以 1,186 位列第二——是首秀时最接近击败 HeyGen Voice 的模型。其价格同样标为 $19.30,不过阿里巴巴的文档提醒,不同模型版本需要匹配的音色,因此“同价、更新的层级”并不意味着“可直接替换”。
读到“领先Qwen,排名第一”这句话、随后又去测评Qwen-Audio-3.0-TTS的人,测的其实是一个比标题所指模型弱63个Elo的模型。关于档位归属的这点纠结值63分,比HeyGen Voice与第三名之间的差距还大。
记分牌

• 受控语音 Elo(同样是 8 个克隆语音) — HeyGen Voice:1,202,42 个中排名第 1。Qwen-Audio-3.0-TTS-Plus:1,123,排名第 7。
• 提供商语音 Elo(原生语音) — Qwen-Audio-3.0-TTS-Plus:1,264,在 96 个中排名第 6。HeyGen Voice:未排名。
• 每百万字符价格 — Qwen-Audio-3.0-TTS-Plus:19.30 美元,由供应商在阿里云上公布。HeyGen Voice:30.00 美元,依据该竞技场对积分定价的自行换算;HeyGen 并未公布语音费率。
• 100 小时旁白成本 — Qwen-Audio-3.0-TTS-Plus:按每语音小时约 480,000 个字符计算,约 926 美元。HeyGen Voice:按该竞技场的 30.00 美元换算,约 1,440 美元——此为推算所得,并非报价。
• 语音控制 — Qwen-Audio-3.0-TTS-Plus:指令参数、情感与语言标签、语音克隆和语音设计。HeyGen Voice:根据不超过 1,000 字符的描述进行文本转语音设计、即时克隆、基于 20 分钟以上素材训练的专业克隆。
• 输出 — Qwen-Audio-3.0-TTS-Plus:支持 PCM、WAV、MP3 和 Opus,最高 48kHz,并可调节语速、音调、音量和比特率。HeyGen Voice:每次请求支持 0.5–1.5 的语速和 ±50 半音的音调。

阿里的工程究竟为你带来了什么
Qwen-Audio-3.0-TTS 系列是流式产品,其文档的写法也体现了这一点。请求通过一个与 CosyVoice 共享的 WebSocket 协议传输,并采用 run-task、continue-task 和 finish-task 事件流,同时伴随 task-started、result-generated、task-finished 和 task-failed 响应。取消功能在北京和新加坡两个区域的每款 Qwen-Audio-TTS 模型上均受支持,通过 streaming_cancel() 实现。输出达到 48kHz,格式包括 Opus,如果你要把音频送入浏览器或电话通话而不是 WAV 文件,这一点很重要。
该文档中有两个细节很容易被忽略,而等到很晚才发现则代价高昂。情感标签和丰富语言标签仅适用于 Plus 和 Flash 层级——而非整个模型系列——并且只在单向流式模式下生效。wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference区域密钥平时只是一个配置层面的细节,直到有一天它们变成一场故障。
HeyGen 这边则是另一种形态的产品:一套 REST 风格的 v3 API,其中 POST /v3/voices/speech 用于合成语音,GET /v3/voices 在 engine 过滤条件下返回语音目录,而语音设计功能则根据文本提示返回最多三个排序后的候选方案,并可通过种子保证结果可复现。文档还显示,engine 过滤器接受的不只是 HeyGen 自家的取值——也就是说,HeyGen 会很乐意通过它的 API 把你路由到第三方语音引擎。一个厂商愿意把竞争对手的模型作为可选项提供,这本身就在告诉你,它认为自己的优势究竟在哪里。

79 Elo 的去向
在一个受控榜单上,79分的差距相当大——比将 HeyGen Voice 与第二名分隔开的16分差距还要大,也大致相当于该榜单中第三名与第八名之间的距离。而且,它只在一个维度上进行衡量。
受控竞技场克隆了八个声音,并将它们固定下来。它没有说明 Qwen 所暴露的由指令驱动的控制面,没有说明通过可取消的 WebSocket 输出 48kHz Opus,也没有说明区域化部署。这些是工程属性,而它们正是构建普通话联络中心的团队不会转向一个在八个英语参考语音上得分高出 79 分的模型的原因。
受控结果确实能说明的问题更窄,但仍然有用:当两个引擎拿到同一个克隆声音时,听者更偏爱 HeyGen Voice 的渲染效果。如果你的产品做的是声音克隆,那这就是你的衡量维度。如果你的产品是从声音库中挑选一个声音并把它流式接入通话,那么供应商榜单更贴近你的实际情况——而在那里,HeyGen Voice 根本没有任何排名,Qwen-Audio-3.0-TTS-Plus 则位列九十六个中的第六。
认真对待价格论证
每百万字符 19.30 美元,Qwen-Audio-3.0-TTS-Plus 的成本大约只有 ElevenLabs 40 美元档位的一半,约为 Cartesia Sonic 3.6 的 49 美元的 40%。对于 100 小时旁白的工作负载——按典型语速约合 4800 万字符——成本约为 926 美元。同样体量使用 Eleven v4 Turbo 约为 1,920 美元,使用 Sonic 3.6 约为 2,352 美元。HeyGen Voice 按 arena 的 30.00 美元计算,成本接近 1,440 美元:介于低价档与两家现有厂商之间,更接近中档而非高档。
这笔计算带有一个其他计算无需的注意事项。$19.30 是 Alibaba 自己公布的价格。$30.00 是 Artificial Analysis 对 HeyGen 从未换算成字符数的积分体系所做的换算,因此它是诚意估算,而非报价。如果真实的每积分字符数比例比图表假设的更差,那么 79-Elo 的优势代价就高于其暗示的 1.55×;如果更好,则更低。一个你必须推断其价格的模型,是你会在一小块可测量的流量上试运行的模型,而不是你会标准化采用的模型。这不是对引擎的批评——而是对 2026 年 10 月 10 日可获得信息的描述。
决定
在成本与流式基础设施主导决策时,选择 Qwen-Audio-3.0-TTS-Plus。每百万字符低于 20 美元、可取消的 WebSocket 与 48kHz Opus 输出、一个指令参数和情绪标签,以及在提供商榜单上第六名的排名,使其成为本次对比中最经济且评分良好的语音。如果你想要的是在受控榜单上实际排名第二的模型,那就改选 3.1 层级,并在假定这次替换是免费之前先核实语音列表。
当克隆保真度本身就是产品时,请测试 HeyGen Voice。单一说话人、大量台词、一个每次都必须*就是*那个声音的声音——这正是受控评测榜所衡量的维度,也是它领先整个领域的维度。要为一段测量期预留预算,因为额度计费模式意味着,你的真实成本要靠跑自己的文本才能摸清,而不是靠读价目表。
并且,如果工作负载是中文、实时的,那就完全忽略这项比较。这两个 Elo 数值都不是在你们的语音、你们的语言、你们的延迟预算下测得的。
保持两者都可访问
这是路由层真正凭实力立足、而非作为附加组件硬塞进来的组合之一。一个 API key 同时覆盖两家供应商——按供应商目录价原样透传、不加价,因此阿里巴巴公布的 $19.30 就是你实付的价格,Qwen 调价当天即生效——让你不必在拿到证据之前就先选定赢家。自动故障转移覆盖了语音流水线中显而易见的风险:流一旦卡住,听者立刻就能听出来;而路由 DSL 让你可以把批量旁白交给便宜的引擎,把对克隆至关重要的台词交给得分高出 79 分的那个,同时无需维护两套客户端库和两个计费关系。OrcaRouter 在这里的价值不在于它托管了某个语音模型,而在于它让你弄清自己究竟想要哪一个的成本几乎为零。
悬而未决的问题
三件事就能解决这个问题。HeyGen 自家定价页上的语音费率,会把竞技场推算出的 $30.00 变成一个你可以审计的数字。Provider Voices 榜单上的 HeyGen 条目会告诉我们,克隆语音的领先优势能否在原生语音面前保住——Qwen-Audio-3.0-TTS-Plus 以九十六个中第六名的成绩通过了这项测试。而在获得更多投票后,Qwen-Audio-3.1-TTS-Plus 对 HeyGen Voice 的受控语音结果,会告诉我们 16 Elo 是否是一个稳定的排序。在那之前:Qwen 是有定价、可流式传输、排名靠前的选项;HeyGen Voice 是得分更高、却无法定价的那个;而你用来做基准测试的层级,比你读到的头条更重要。
