一张关于"ElevenLabs Eleven v4 对比 Sesame Preview"的主视觉卡片,包含两张对照卡片:ElevenLabs Eleven v4 被描述为"一款可以买到的模型"、"在线 API,公开价格表"、"Arena Elo 1,319,排名第 1";Sesame Preview 被描述为"一个可以对话的演示"、"仅限网页,没有可调用的端点"、"未登上任何竞技场榜单";配文为"两个类别,而非两个选项"。页脚:"Vendor pages 与 artificialanalysis.ai,2026 年 9 月。"OrcaRouter 标志位于右下角。
Guides & Insights

Eleven v4 对比 Sesame Preview:这并不是你所想的那种比较

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

搜索 ElevenLabs Eleven v4与 Sesame Preview的对比,会翻出大量乐于把它们塞进一张表格里的页面。几乎所有这些页面都在把一个产品、一个基准拿来和一个演示作比较,而表格恰恰是页面上最没用的东西。Eleven v4 是一个已正式商用的语音合成模型,配有 API、价格表和公开的竞技场排名。Sesame Preview 则是一个免费的消费级语音助手,点一下链接它就会应答。它们并不是同一笔采购里的两个选项,而本文诚实的版本要谈的是你真正想要的是哪一个——因为答案取决于一个两家厂商的营销页面都没有提出的问题。

A two-column card for ElevenLabs Eleven v4 and Sesame Preview. Eleven v4: model identifier Eleven v4; live API; $0.022 per 1K until Oct 12; Arena Elo 1,319 at rank 1; 10,000-character input cap; 90-plus languages. Sesame Preview: no announced model identifier; web demo only; free and not purchasable; not on any arena board; sessions capped around 30 minutes; English only. Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; Sesame Preview per its own site.'

Eleven v4 实际上是什么

ElevenLabs 于 9 月 28 日发布 Eleven v4 和 Eleven v4 Turbo,作为生产端点。Eleven v4 支持 90 多种语言,每次请求上限为 10,000 个字符,支持说话人身份稳定的多说话人对话、内联表达指令、改进的 IPA 音素支持,并可从十秒音频进行即时语音克隆。它在 Artificial Analysis 的 Provider Voice Arena 上以 Elo 1,319 排名第一,该估计背后有 1,674 个样本,并在 Controlled Voice 榜单上以 1,157 排名第二。在 API 费率卡上,其标价为每千字符 0.022 美元,此促销持续至 10 月 12 日,之后恢复为 0.08 美元——与此前的 ElevenLabs Eleven v3 一直沿用的费率相同。

那段话的每一部分都可核查。有一个模型标识符、一项有文档记录的输入上限、一个公开发布的按字符计价的价格、一条针对旧版 Turbo 层级的弃用说明,以及一条附有置信区间的独立排行榜记录。这就是一个模型在可以买到时的样子。

A screenshot of ElevenLabs' blog post announcing Eleven v4, captured in English and dated Sep 28, 2026, headed 'Introducing Eleven v4, our most emotive model' and credited to Mati Staniszewski and Piotr Dabkowski, showing the site-wide 'Introducing Eleven v4, our fastest and most emotive voice model' banner, a 'Listen to this article 10:32' control, the line 'Ranked #1 by Artificial Analysis, and preferred by ~75% of listeners in blind head-to-head tests over competing models', and a left-hand section list running from 'A new architecture built for performance' to 'Hear the difference for yourself'.

Sesame Preview 究竟是什么

Sesame Preview 是一款面向消费者的演示产品。它是一个语音助手,你可以通过该公司自己的网站访问它,其中有一小群具名角色——Maya、Miles、Simone 和 Charlie——会话记忆可以在不同会话之间延续,还有网页搜索、笔记和提醒,以及通话后的摘要。它是免费的。登录会话大约持续半小时;访客会话大约五分钟。它仅支持英语。而且 Sesame 明确表示它不执行任务:这个演示的重点是对话的质感,而不是一个帮你预订会议的智能体。

对这次比较而言,关键之处在于那些缺失的东西。没有模型标识符,没有端点,没有价目表,没有可供你据此设计输入上限的输入限制,也没有公布生产模型的上线日期。Sesame 已发布的研究线是另一回事——一个具有 4K 上下文、开放权重的对话语音模型——而它并不是你在 Preview 中交谈的那个系统。所以,每个对比表里那个名为“Sesame Preview”的东西,是一个你无法与之集成的产品,而你能下载的东西并不是这个产品。

为什么他们不能共用一个记分牌

Artificial Analysis 上的受控语音竞技场,是该领域最接近中立衡量标准的东西,而 Sesame Preview 并不在其中。它也不在提供商语音榜上。没有 Elo,没有票数,没有价格标准化——也无法生成一项,因为排行榜需要一个可调用的端点和一个按单位计的价格,而 Sesame Preview 两者都没有。

所以,任何把这两者并排放在一起的表格,都是在用一次产品导览来填充 Sesame 那一栏。把每百万字符 80 美元的端点与免费网页演示在“自然度”上作比较,根本算不上比较;这是一种范畴错误,里面还带着一个 Elo 形状的洞。如果某个页面声称这场对决有了赢家,那它就是编造了这一说法的依据。

可以诚实地说,它们各自想成为什么,就是什么。Eleven v4 经过优化,能够通过 API 大规模地把脚本变成表演,而且每次都用同一种声音。Sesame Preview 经过优化,旨在让陌生人在浏览器标签页里,一次就感觉像是在和某个人交谈。

唯一真正具有可比性的地方

搜索背后有一个真正的问题,而它关乎开放权重。如果你真正想要的是一个可以自己下载并运行的语音模型,那么两家厂商的旗舰产品都不是答案——ElevenLabs 的技术栈是闭源的,而你能运行的 Sesame 系统是 4K 上下文的研究模型,并非那个助手。

对于这项工作,有用的参照点在竞技场排行榜上:Breeze TTS 2 是 Provider Voice 上排名最高的开放权重条目,Elo 为 1,206,价格为每百万字符 34.00 美元,而该榜单的 92 个模型中包含 16 个开放权重模型。它落后 Eleven v4 113 分,但远高于 Qwen3 TTS 系列(944 和 930)。如果你的项目需要在自己的硬件上运行,值得做的比较是 Eleven v4 与 Breeze TTS 2 的对比——而不是与浏览器演示对比——而且这里的取舍是真实存在的:你放弃大约一百个 Elo 分和音频标签工作流,换来对整个技术栈的控制。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276, Google Gemini 3.8 Flash TTS third at Elo 1,267, and BreezeBlue Breeze TTS 2 tenth at Elo 1,206 with $34.0 per 1M chars and an Open Weights flag, over the Open Weights and Global Leaderboard filter tabs.

选择时,考虑到每个的用途

• 如果你正在构建一款具备语音能力的产品——Eleven v4,通过 API 提供,并按价目表计费。Sesame Preview 没有任何可集成的部分,因此不在本次决策范围内。

• 如果你想用对话式演示向别人展示语音 AI 的体验——Sesame Preview,而且它是免费的,这正是它全部的说服力所在。

• 如果你是在决定选用哪家厂商之前评估情感范围,那么 Eleven v4 在厂商语音榜上的 Elo 1,319 和在克隆语音榜上的 1,157 就是要看的数字,但有一个前提:第二个数字对应的才是描述克隆品牌语音产品的那一个。

• 如果你需要英语以外的语音——Eleven v4 记录了 90 多种语言;Sesame Preview 仅支持英语,并且它自己也这么说明。

• 如果你需要模型真正去做点什么——在这场对比中,两者都不行。Sesame Preview 刻意不执行任务,而 Eleven v4 是一个合成引擎,需要你围绕它自建整套技术栈。

• 如果你需要在本地运行它——两者都不用。Breeze TTS 2 是开放权重的参考基准。

• 如果成本是决定性因素——Eleven v4 在10月12日之前每千字符收费0.022美元,之后为0.08美元,而Sesame Preview是免费的,因为它不是可以购买的产品。免费演示不是更便宜的选择;它是另一个类别。

两者唯一的共同点,是一个日期问题。Eleven v4 的促销定价将于 10 月 12 日到期,这会让其成本变动近四倍。而 Sesame 则根本没有给出正式版的日期,这是另一种不确定性——Preview 可能下个月就被取代,也可能一整年毫无变化,而面对一场没人排期的发布,根本无从规划。

如果你的技术栈最终涉及多个语音供应商

OrcaRouter 既不托管 ElevenLabs,也不托管 Sesame,因此本文没有任何内容可以经由我们调用,我们也不会暗示并非如此。我们真正要讲的是已经处于多供应商状态的技术栈之上的那一层。一个 API 密钥即可触达 200 多个模型,供应商目录价以 0% 加价原样透传,因此上游一调价——本次发布的促销窗口就是一个现成例子——当天就会落到我们这边,而不会等到下一张账单。在语音链路面向客户之处,当某条上游链路质量下降时,自动故障转移会将流量切换到健康的上游,这样你就能在真实流量上试听一个新端点,而不必拿一次发布去赌它。

要点总结

Eleven v4 是一个你可以购买、衡量并依赖的模型,目前它正以为期两周的降价位居厂商语音排行榜榜首。Sesame Preview 是一个免费的对话感实验,仅支持英语,时长上限为三十分钟,并且不是你可以作为基础来构建的东西。它们会出现在同一搜索结果中,是因为两者都是语音 AI,而且都是新事物——而不是因为其中任何一个是另一个的替代品。

如果你来这里是为了在它们之间做选择,那么更有用的重新框定是这样的:你不是在选择一个语音模型。你是在决定自己究竟是在发布产品,还是在做一个演示,而这两个决定中只有一个附带价目表。如果是产品,那就读一读 Eleven v4 的数字,并在 10 月 13 日再读一遍——那时促销费率将到期,与榜单上其他所有供应商的对比也会随之改变。