
HeyGen Voice 与 Sesame Preview:你能购买的声音 vs 只能与之交谈的声音
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
这不是模型对比,而假装是,将是这里唯一真正会犯的错误。HeyGen Voice 是一个 API 引擎——在 Artificial Analysis 的 Controlled Voice 竞技场中以 1,202 Elo 排名第一,通过 HeyGen 的 v3 端点开放,按积分出售,可通过单次录音克隆。Sesame Preview 是一个免费的消费级语音助手,你只需打开一个网页并与四个具名角色之一对话即可使用,它没有公开端点、没有模型标识符,也没有可供租用的价格。其中一个你可以交付。另一个则是让你知道好的对话语音听起来是什么样的原因,而绝不是你会部署的东西。
每一个到底是什么
Sesame Preview 是对话式语音的一次演示。你可以通过该公司自己的网站访问它,与 Maya、Miles、Simone 或 Charlie 交谈,而这种体验刻意针对友好度和表现力进行了优化——公司在描述这些伙伴为何会有如此表现时也这么说过。它目前仅支持英语,团队指出,多语言能力是数据污染附带显现出来的,而且“目前表现不佳”,并称扩展到二十种以上语言是未来的计划。该公司自己的说法也仍在完善之中:“我们还没到那一步。”
演示之下是 Conversational Speech Model,一种多模态文本和语音架构,由两个自回归的 Llama 风格 transformer 构建而成。它有三种规模——Tiny 拥有 1B 主干和 100M 解码器,Small 为 3B 和 250M,Medium 为 8B 和 300M——每个都在 2,048 token 的序列长度上训练,大约两分钟音频,在约一百万小时、主要为英语语音的数据上训练了五个 epoch。关键研究组件在 Apache 2.0 下开源,并且有一个 GitHub 仓库。演示——人们实际称赞的东西——并不是那个。演示没有公共 API。
HeyGen Voice 是正好相反的情形。没有可供试用的免费消费者应用;有的是一套配有文档的 API,包含语音目录、语音端点、克隆路径,以及一张账单。而你无法做到的,是在浏览器里打开它,然后心血来潮地跟它聊上几句。
为什么这两个还是会被拿来比较呢
它们被拿来比较,是因为两者都被当作合成语音已经跨过某道门槛的证据。Sesame Preview 重新定义了人们对对话式音频能听起来怎样的预期——它问世时的反响,关注的是它听起来有多像真人,而不是像文本转语音引擎。HeyGen Voice 在受控榜单上的 1,202 分,是以数字形式表达的同一主张:当每个模型都用同样的八个克隆参考语音说话时,它在四十二个参赛条目中排名第一。
区别在于事后你能用这个说法做什么。一个榜单位置是可复现、可检验的,并且与某个端点相关联。而一次演示给人的印象则不具备其中任何一项——而且重要的是,Sesame Preview 根本没有出现在受控榜单上,因此没有 Elo 可以与 1,202 进行比较。人们想要进行的比较无法进行,不是因为 Sesame 输掉了它,而是因为该模型从未被录入。
记分牌

• 受控语音 Elo — HeyGen 语音:1,202,在 42 个中排名第 1。Sesame Preview:未列出。
• 访问方式——HeyGen Voice:有文档记录的 v3 API,POST /v3/voices/speech。Sesame Preview:面向消费者的网页应用和 iOS 应用;无公开端点。
• 价格 — HeyGen Voice:按该竞技场自身对积分定价的换算,每 100 万字符 30.00 美元;HeyGen 并未公布语音费率。Sesame Preview:免费,且无论出价多少都无法购买。
• 语音选择 — HeyGen Voice:300+ 款预置语音,支持文本描述式语音设计,即时克隆与专业级克隆。Sesame Preview:四种固定人设。
• 语言 — HeyGen Voice:“数十种语言”,数量未公布。Sesame Preview:仅支持英语,按该公司自己的说法,其多语言支持目前表现欠佳。
• 开放权重 — HeyGen Voice:无。Sesame Preview:CSM 以 Apache 2.0 许可发布,提供 1B、3B 和 8B 三种规模。

Apache 2.0 的细节才是关键
在“没有 API”这一结论之下,被掩盖的事实是:Sesame 以 Apache 2.0 开源了该研究模型——这是一种宽松许可证,提供三种规模,其中 1B 版本小到无需数据中心即可运行。这与演示有着本质上的不同,而且它是任何类似 Sesame Preview 声音的东西最终进入已发布产品的唯一途径。
有两点告诫让它保持诚实。已发布的 CSM 组件属于研究性产物:公司指出,这些模型能处理语音内容,却不处理对话结构,并把全双工模型列为未来工作——因此,已发布的权重并不等同于那种可交互体验。而本地运行的 8B 主干网络,与托管推理每百万字符 19.30 美元是截然不同的成本结构,后者正是该竞技场上最便宜的一流竞争对手所收取的价格。自托管没有按字符计的账单,却有一份非常真实的按 GPU 小时计的账单。
对构建者来说,这重新框定了问题。如果你对 Sesame Preview 印象深刻之处在于对话,那么开放权重并不能把对话给你。如果你印象深刻之处在于语音模型本身的音质,那开放权重或许能给你——而这是可以检验的,demo 则做不到。
HeyGen Voice 的上线过程是怎样的
实际差异都是些寻常之处。HeyGen 的 API 接收一项音色选择、文本,以及可选的语速(介于 0.5 到 1.5 之间)和音高(±50 个半音范围),外加一个 BCP-47 语言区域提示。自定义音色有三种获取方式:一种由描述驱动的设计路径,可从不超过 1,000 个字符的提示词中返回最多三个排序后的候选;一种基于单段录音的即时克隆;以及一种用二十分钟或更长时间音频训练而成的专业克隆。引擎音色端点上的筛选器也接受非 HeyGen 引擎,因此该平台并未围绕自家模型筑起围墙花园。
Sesame 那边并不存在这些东西,而这并不是 Sesame Preview 的缺点——这就是它的本质。一个为展示可能性而优化的演示,不应附带 SLA。
不过,账单这一半则要温和一些。HeyGen 卖的是积分——600 积分每月 29 美元,1,000 积分 49 美元,1,500 积分 149 美元——并表示消耗量因模型、时长和复杂程度而异,却未公布语音费率。该竞技场列出的每百万字符 30.00 美元,是 Artificial Analysis 对这些积分所做的换算,并非 HeyGen 的报价。所以,你能上线的那个模型是有定价的,只不过建立在别人的算术之上——这恰恰是主张先做一次审慎试点的理由,而不是对引擎的批评。

对于你欣赏的 demo,实际该做什么
有用的做法是把 Sesame Preview 所展示的两件事分开。对话行为——轮流发言、记忆、与人交谈的感觉——是一个尚未发布、也没有终点的系统的产物。语音质量则是背后有 Apache 2.0 权重支持的那部分,也是你可以无需征得任何人许可、用自己的音频来评估的那部分。
对于介于两者之间的一切,迁移路径是那种平平无奇的路:先在一个有 API、也有排名的引擎上发布,并在设计上确保,如果 Sesame 的模型有朝一日商业化落地,采用它只是一次配置变更,而不是重写。这意味着从第一天起就要在语音提供商之上做一层抽象——一个接口、一个密钥,引擎由配置选择。OrcaRouter 的路由层正是为此而生:众多提供商汇聚在单一端点之后,按提供商标价提供、不加价;当某个供应商停滞时自动故障转移;还有一套路由 DSL,让你无需改动应用代码,就能替换某个语音背后的引擎。重点不在于它托管了 Sesame 模型——它并没有——而在于,当你欣赏的某个语音变得可以购买的那一天,尝试它的代价应该只是配置文件中的一行。
诚实的成交
Sesame Preview 不是 HeyGen Voice 的竞争对手,也不应被当作竞争对手来评估。它是一个免费的、仅支持英语的、包含四种角色的演示,恰好重新设定了对对话式音频的期望,并且恰好发布了三种规模的、采用宽松许可的研究权重。HeyGen Voice 是唯一一个保持语音恒定的语音排行榜上排名最高的引擎,通过一个你今天就可以调用的 API 进行销售,而价格却尚无法计算。
如果你需要一个能在本季度交付的语音,那么要决定的并不是这两者之间——而是 HeyGen Voice 与竞技场上其他有定价的引擎之间。如果你在等 Sesame,那就等权重,而不是等应用。
