
Eleven v4 对比 OpenAI TTS-1 HD:一块看板上的两年漂移
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
TTS-1 HD 的发布日期是 2023 年 11 月 6 日。ElevenLabs Eleven v4的发布日期则是 2026 年 9 月 28 日。在 Artificial Analysis 的 Provider Voice Arena 上,这两个日期相差 216 Elo 分——TTS-1 HD 排名第 35,得分为 1,104,出场 3,500 次,价格为每字符 30.00 美元;而 Eleven v4 排名第 1,得分为 1,319,出场 1,674 次,价格为每字符 80.00 美元。这两个数字的置信区间都很窄,分别为 ±12 和 ±19,因此排序毋庸置疑。有趣的问题不是哪个模型更好,因为在本文问世之前这一点就已经有定论了。而是为什么一个 2023 年的端点仍能在一个上线仅五天的模型就有 1,674 次出场的榜单上拥有 3,500 次出场,以及这向你揭示了关于你被要求考虑的迁移的什么信息。
记分牌,以及OpenAI唯一胜出的那一行
五个维度将决定这场较量,而每个维度的双方观点都值得对照阅读。
• 盲测偏好、厂商语音——Eleven v4 排名第 1,Elo 1,319(±19,1,674 次出现)对比 TTS-1 HD 排名第 35,Elo 1,104(±12,3,500 次出现)。216 分的差距,超出误差范围依然成立。
• 每百万字符的标价——Eleven v4 $80.00,对比 TTS-1 HD $30.00。OpenAI 按标价便宜 62%,而在 ElevenLabs 促销期间还要更便宜。
• 音色 — Eleven v4 文档说明可从十秒音频即时克隆,并提供专业克隆层级;TTS-1 HD 随附一组固定音色,在 OpenAI 自己的文档中,tts-1 系列有九个(alloy、ash、coral、echo、fable、onyx、nova、sage、shimmer),且不支持克隆。
• 表现控制 — Eleven v4 记录了内联音频标签和自然语言指导提示;TTS-1 HD 只接受纯文本,而 OpenAI 的可引导指令参数属于其较新的 TTS 模型,而非这一款。
• 发布日期 — Eleven v4 2026年9月28日 对比 TTS-1 HD 2023年11月6日

价格是 OpenAI 获胜的一行,而且这场胜利比表面看起来更大,因为 ElevenLabs 的促销是暂时的。按每 1,000 个字符 0.022 美元计算,Eleven v4 在 10 月 12 日之前为每百万字符 22 美元——直接比 TTS-1 HD 更便宜。10 月 12 日之后,它的价格为每百万字符 80 美元,而 OpenAI 为 30 美元,并且会一直保持这个价格。
为什么 2023 年的模型拥有两倍的样本数量
那个数字是这块看板上最有用的东西,而且很容易被误读。Arena 的出场次数随流量累积,而流量则随那些一次搭建、此后再无人过问的集成而累积。TTS-1 HD 背后有 3,500 次出场,因为它一直是那些已经在调用 OpenAI 做 chat completions 的团队所用的默认语音端点:同一把密钥、同一个 SDK、同一条计费项,多打一次调用而已。这句话里没有一个字与语音质量有关,而 216 分的差距也没能拦住它。

这就是迁移债务在排行榜上的样子。它并不表明旧模型仍有竞争力;它表明切换是有代价的,而且大量团队已经认定,这个代价比 216 个 Elo 分更值。对于通知朗读来说,这是一个合理的结论;而对于一个声音就是客户所听到的内容的产品来说,则是一个糟糕的结论。
继续使用 TTS-1 HD 的理由
有三件事让它站得住脚,而它们中没有一件是质量。
确定性优先。一组固定的九种声音能在各个版本间产生一致的输出,这是克隆流程做不到的;而在没人期待艺术性的实用路径中,一致的输出正是你想要的。没有会漂移的克隆,没有需要重新录制的参考样本,也没有需要维护的同意凭证。
集成成本是第二项,也是竞技场无法定价的那一项。增加第二家语音供应商意味着一个新账户、一份新费率表、一种新的故障模式,以及一项需要监控的新东西。对于已经身处 OpenAI 技术栈内部的团队来说,那是实实在在的工程时间,而 216 个 Elo 积分并不足以为此买单。
低端用量属于第三种情况。按每百万字符30美元计算,一个小产品整月的语音账单不过是个零头,根本没有什么可优化的。在这种情形下,省钱的答案和偷懒的答案就是同一个答案,而这也没什么不好。
支持搬迁的理由,以及反对它的论点
当语音需要面向客户时,就该行动了。十秒克隆、内联表演指导、90 多种语言以及每次请求 10,000 字符的输入上限,与 2023 年固定的九种语音相比,并非表面差异,而竞技场中 216 分的差距,只是一个更大能力差距的压缩体现。如果你正在构建智能体、品牌化助手,或任何会让听众在第一句话中就对你产品形成看法的东西,那么较旧的端点就是错误的默认选择。
反方观点则认为,“改用 Eleven v4” 并不是唯一的选择。OpenAI 此后推出了更新的 TTS 模型,带有可控的 instructions 参数;而 Google 的 Gemini 3.8 Flash TTS 也以 1,267 分和归一化后每百万 16.49 美元在同一榜单上位列第三——相比 TTS-1 HD 提升 163 分,而价格大约只有榜单价格的一半。如果你的约束是留在当前供应商体系内,那这是更省钱的升级方案。如果约束是留在当前的云平台内,那这就是唯一的选择。
OrcaRouter 在这项对比中实际处于什么位置
This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

ElevenLabs Eleven v4 不在我们的目录里,也无法经由我们调用:它走的是 ElevenLabs 自家的 API,按 ElevenLabs 自家的价目表计费。而一枚密钥所能改变的,是迁移的形态。如果你迟迟没有测试这位新晋领跑者,是因为那意味着要接入一家新的供应商,那么探明代价的方式就只是一次 API 调用——用你手上已有的密钥——而不是走完一轮采购流程。供应商标价以 0% 加价率原样透传,因此任何重新定价——包括 ElevenLabs 在 10 月 12 日的价格回调——在我们这边都是发生即刻生效,而自动故障转移意味着,在你做决定期间,处于评估中的语音链路不必变成生产环境的依赖。
本应能解决问题的算术
每月五百万字符,这属于中型产品,大约相当于100小时的语音。TTS-1 HD 的费用为150美元。Eleven v4 在促销窗口期内费用为110美元,10月12日之后则为400美元。按照董事会的标准化口径,Gemini 3.8 Flash TTS 的费用约为82.50美元。
把这四个数字读一遍,选择就泾渭分明了。在窗口期内,榜单上最新、排名最高的模型同时也是第二便宜的——比它高出 216 Elo 分的那个 2023 年端点还要便宜。10 月 12 日之后,它却成了名单上最贵的选项,价格接近前者的五倍。那一天,模型本身没有任何变化,变的只有账单。
所以:如果你这个月正在做评估,就用促销价来评估,并把标价写进商业论证里。如果你下个季度就要上线,就按每 1,000 个字符 $0.08 来规划,并把任何引用 $0.022 的对比都视为一份印着有效期的文件。而如果你仍在使用 TTS-1 HD,且真正的原因是集成惯性,那么有用的第一步不是迁移计划——而是在你自己的脚本上做一次 A/B 测试,并按你 11 月实际将要支付的价格来计价。
