为 ElevenLabs Eleven v4 与 OpenAI TTS-1 HD 生成的主视觉卡片,包含两张评分卡:Eleven v4 的 Elo 为 1,319,排名第 1,每 100 万字符 $80.00;OpenAI TTS-1 HD 的 Elo 为 1,104,排名第 35,每 100 万字符 $30.00;配文为“216 Elo 分,且两个端点仍在接收流量”。页脚:“Provider Voice Arena,依据 Artificial Analysis,2026 年 9 月。”OrcaRouter 标志位于右下角。
Guides & Insights

Eleven v4 对比 OpenAI TTS-1 HD:一块看板上的两年漂移

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

TTS-1 HD 的发布日期是 2023 年 11 月 6 日。ElevenLabs Eleven v4的发布日期则是 2026 年 9 月 28 日。在 Artificial Analysis 的 Provider Voice Arena 上,这两个日期相差 216 Elo 分——TTS-1 HD 排名第 35,得分为 1,104,出场 3,500 次,价格为每字符 30.00 美元;而 Eleven v4 排名第 1,得分为 1,319,出场 1,674 次,价格为每字符 80.00 美元。这两个数字的置信区间都很窄,分别为 ±12 和 ±19,因此排序毋庸置疑。有趣的问题不是哪个模型更好,因为在本文问世之前这一点就已经有定论了。而是为什么一个 2023 年的端点仍能在一个上线仅五天的模型就有 1,674 次出场的榜单上拥有 3,500 次出场,以及这向你揭示了关于你被要求考虑的迁移的什么信息。

记分牌,以及OpenAI唯一胜出的那一行

五个维度将决定这场较量,而每个维度的双方观点都值得对照阅读。

• 盲测偏好、厂商语音——Eleven v4 排名第 1,Elo 1,319(±19,1,674 次出现)对比 TTS-1 HD 排名第 35,Elo 1,104(±12,3,500 次出现)。216 分的差距,超出误差范围依然成立。

• 每百万字符的标价——Eleven v4 $80.00,对比 TTS-1 HD $30.00。OpenAI 按标价便宜 62%,而在 ElevenLabs 促销期间还要更便宜。

• 音色 — Eleven v4 文档说明可从十秒音频即时克隆,并提供专业克隆层级;TTS-1 HD 随附一组固定音色,在 OpenAI 自己的文档中,tts-1 系列有九个(alloy、ash、coral、echo、fable、onyx、nova、sage、shimmer),且不支持克隆。

• 表现控制 — Eleven v4 记录了内联音频标签和自然语言指导提示;TTS-1 HD 只接受纯文本,而 OpenAI 的可引导指令参数属于其较新的 TTS 模型,而非这一款。

• 发布日期 — Eleven v4 2026年9月28日 对比 TTS-1 HD 2023年11月6日

A generated scoreboard comparing ElevenLabs Eleven v4 and OpenAI TTS-1 HD across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 35 / 1,104), samples (1,674 with an interval of plus or minus 19 against 3,500 with plus or minus 12), board price ($80.00 against $30.00 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $30.00 per 1M at list), voices (cloning from 10 s of audio plus a professional tier against nine fixed presets) and direction (inline audio tags against plain text only). Footer: 'Ranks, Elo and board prices per Artificial Analysis; voice set, list price and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

价格是 OpenAI 获胜的一行,而且这场胜利比表面看起来更大,因为 ElevenLabs 的促销是暂时的。按每 1,000 个字符 0.022 美元计算,Eleven v4 在 10 月 12 日之前为每百万字符 22 美元——直接比 TTS-1 HD 更便宜。10 月 12 日之后,它的价格为每百万字符 80 美元,而 OpenAI 为 30 美元,并且会一直保持这个价格。

为什么 2023 年的模型拥有两倍的样本数量

那个数字是这块看板上最有用的东西,而且很容易被误读。Arena 的出场次数随流量累积,而流量则随那些一次搭建、此后再无人过问的集成而累积。TTS-1 HD 背后有 3,500 次出场,因为它一直是那些已经在调用 OpenAI 做 chat completions 的团队所用的默认语音端点:同一把密钥、同一个 SDK、同一条计费项,多打一次调用而已。这句话里没有一个字与语音质量有关,而 216 分的差距也没能拦住它。

A screenshot of Artificial Analysis' TTS-1 HD model page, titled TTS-1 HD Quality Elo, Speed & Price Analysis, credited to OpenAI and the OpenAI TTS family with an Elo of 1,103.83. The Provider Voice Arena Preference Elo bar chart runs from Eleven v4 at 1,319 at the left through Gemini 3.8 Flash TTS, Simba 3.2, Eleven v3 and Gemini 3.8 Flash-Lite TTS to TTS-1 HD at 1,104 at the right, with the model selector reading '28 of 96 models'.

这就是迁移债务在排行榜上的样子。它并不表明旧模型仍有竞争力;它表明切换是有代价的,而且大量团队已经认定,这个代价比 216 个 Elo 分更值。对于通知朗读来说,这是一个合理的结论;而对于一个声音就是客户所听到的内容的产品来说,则是一个糟糕的结论。

继续使用 TTS-1 HD 的理由

有三件事让它站得住脚,而它们中没有一件是质量。

确定性优先。一组固定的九种声音能在各个版本间产生一致的输出,这是克隆流程做不到的;而在没人期待艺术性的实用路径中,一致的输出正是你想要的。没有会漂移的克隆,没有需要重新录制的参考样本,也没有需要维护的同意凭证。

集成成本是第二项,也是竞技场无法定价的那一项。增加第二家语音供应商意味着一个新账户、一份新费率表、一种新的故障模式,以及一项需要监控的新东西。对于已经身处 OpenAI 技术栈内部的团队来说,那是实实在在的工程时间,而 216 个 Elo 积分并不足以为此买单。

低端用量属于第三种情况。按每百万字符30美元计算,一个小产品整月的语音账单不过是个零头,根本没有什么可优化的。在这种情形下,省钱的答案和偷懒的答案就是同一个答案,而这也没什么不好。

支持搬迁的理由,以及反对它的论点

当语音需要面向客户时,就该行动了。十秒克隆、内联表演指导、90 多种语言以及每次请求 10,000 字符的输入上限,与 2023 年固定的九种语音相比,并非表面差异,而竞技场中 216 分的差距,只是一个更大能力差距的压缩体现。如果你正在构建智能体、品牌化助手,或任何会让听众在第一句话中就对你产品形成看法的东西,那么较旧的端点就是错误的默认选择。

反方观点则认为,“改用 Eleven v4” 并不是唯一的选择。OpenAI 此后推出了更新的 TTS 模型,带有可控的 instructions 参数;而 Google 的 Gemini 3.8 Flash TTS 也以 1,267 分和归一化后每百万 16.49 美元在同一榜单上位列第三——相比 TTS-1 HD 提升 163 分,而价格大约只有榜单价格的一半。如果你的约束是留在当前供应商体系内,那这是更省钱的升级方案。如果约束是留在当前的云平台内,那这就是唯一的选择。

OrcaRouter 在这项对比中实际处于什么位置

This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

A screenshot of the OrcaRouter model page for openai/tts-1-hd. The header shows the model ID openai/tts-1-hd with Audio and JSON tags, the description 'OpenAI's high-definition text-to-speech model, accessed via OrcaRouter's API at $30 per 1M tokens (zero markup)', and the endpoint /v1/audio/speech. Stat tiles read $30.00 per 1M characters, p50 TTFT 2.46 s, p95 TTFT 4.77 s and traffic of 1.5K characters over 7 days. Supported parameters are response_format, speed and voice, the OpenAI-compatible base URL is https://api.orcarouter.ai/v1, and the pricing panel states 'This model is not billed per token. The rate above is the unit it actually meters, and it is what settlement charges.'

ElevenLabs Eleven v4 不在我们的目录里,也无法经由我们调用:它走的是 ElevenLabs 自家的 API,按 ElevenLabs 自家的价目表计费。而一枚密钥所能改变的,是迁移的形态。如果你迟迟没有测试这位新晋领跑者,是因为那意味着要接入一家新的供应商,那么探明代价的方式就只是一次 API 调用——用你手上已有的密钥——而不是走完一轮采购流程。供应商标价以 0% 加价率原样透传,因此任何重新定价——包括 ElevenLabs 在 10 月 12 日的价格回调——在我们这边都是发生即刻生效,而自动故障转移意味着,在你做决定期间,处于评估中的语音链路不必变成生产环境的依赖。

本应能解决问题的算术

每月五百万字符,这属于中型产品,大约相当于100小时的语音。TTS-1 HD 的费用为150美元。Eleven v4 在促销窗口期内费用为110美元,10月12日之后则为400美元。按照董事会的标准化口径,Gemini 3.8 Flash TTS 的费用约为82.50美元。

把这四个数字读一遍,选择就泾渭分明了。在窗口期内,榜单上最新、排名最高的模型同时也是第二便宜的——比它高出 216 Elo 分的那个 2023 年端点还要便宜。10 月 12 日之后,它却成了名单上最贵的选项,价格接近前者的五倍。那一天,模型本身没有任何变化,变的只有账单。

所以:如果你这个月正在做评估,就用促销价来评估,并把标价写进商业论证里。如果你下个季度就要上线,就按每 1,000 个字符 $0.08 来规划,并把任何引用 $0.022 的对比都视为一份印着有效期的文件。而如果你仍在使用 TTS-1 HD,且真正的原因是集成惯性,那么有用的第一步不是迁移计划——而是在你自己的脚本上做一次 A/B 测试,并按你 11 月实际将要支付的价格来计价。