'GPT-Live-1 对比 Sesame Preview' 的英雄标题卡,副标题为'这里最好的声音,是那个没有 API 的',配有一枚徽章,写着'一个是免费且封闭的,一个是付费且可调用的',以及三张卡片:'Sesame Preview — 免费应用,无 API,生产级语音尚未发布'、'GPT-Live-1 — 每语音分钟 $0.05,自 2026 年 9 月 10 日起公开 API',以及'Sesame 中可自建的部分 — CSM-1B,Apache-2.0,10 亿参数,每 100 万字符 $7,或自行托管',下方有一条页脚横条,写着'Sesame 的生产级语音没有公开的基准测试;GPT-Live-1 的语音数据由 OpenAI 报告。'OrcaRouter 标志合成于右下角。
Guides & Insights

GPT-Live-1 对比 Sesame Preview:这场比较中最好的语音,是你买不到的那一个

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

随便问一个两者都用过的人,排名都毫无悬念:Sesame Preview 是大多数人交谈过的最令人信服的语音助手。它也是你无法基于其进行开发的那一个。GPT-Live-1 和 Sesame Preview 经常被拿来比较——两者都能对话,都能处理打断,听起来都像真人而不是电话语音菜单——但它们的提供方式截然相反。GPT-Live-1 是按分钟租用的托管模型,自 2026 年 9 月 10 日起可公开调用。Sesame Preview 是一款免费的消费级应用,完全没有 API,而让人们印象深刻的那个声音,运行在一个从未发布过的生产模型上。

每一个到底是什么

• GPT-Live-1 — OpenAI 的全双工语音模型,自 2026 年 7 月 8 日起在 ChatGPT 中提供,自 9 月 10 日起在 API 中提供,价格为每分钟语音 0.05 美元。提供十二种 API 音色,不支持声音克隆,不支持图像或视频输入,每次会话都会返回转录文本和响应文本。

• Sesame Preview — Sesame 面向消费者的语音助手。自 2026 年 5 月起在 iOS 上免费提供,自 2026 年 8 月初起在 Android 上广泛可用,另有一个语音优先的网页预览版。四款智能体——Maya、Miles、Simone 和 Charlie——仅支持英语,通话时长上限为 30 分钟,未登录时会降至 5 分钟。

• CSM-1B —— Sesame 中开源的部分:一个 1B 对话语音模型,于 2026 年 4 月 23 日以 Apache 2.0 许可证发布,基于 Llama 架构主干,配有独立解码器和 Kyutai 的 Mimi 编解码器,可从约 4K 个 token 的上下文生成 24 kHz 单声道英语语音。

上面三行就是整个决策的全貌。一家公司按分钟出售模型,另一家免费送出一款应用,还开源了一个更小的模型——而那个模型并不是应用中用的那一个。

演示版与下载版之间的差距

Sesame 对此异常直白,而对任何评估这两者的人来说,这是唯一最重要的事实。Preview 应用中的语音——也就是催生出那些病毒式传播片段和“同类最佳语音模式”评测的那个语音——是一个规模更大的闭源生产模型。CSM-1B 是来自同一实验室的 10 亿参数开放检查点,而根据同时运行过两者的人的评估,它是一个明显更弱的语音。Preview 上的会话还有上限,并且仅限英语,而且没有任务执行:这些智能体只会交谈,不会预订、购买或提交任何东西。

这让开发者获得了一个真实但更狭窄的选项:一个可自托管、无许可费的对话语音检查点,由一家第三方推理提供商托管,每百万字符收费7美元——约合每合成音频小时0.35美元——或在自有硬件上免费使用。无论是 Preview 语音还是 CSM-1B,都没有人发布过独立的基准测试,因此任何一方对质量的宣称都只是听感印象,而非测量结果。Sesame 也没有公布公开定价、企业版或盈利计划;该公司宣称的方向是研究合作和计划中的硬件产品。

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

每分钟花 0.05 美元能换来哪些免费所不能提供的东西

GPT-Live-1 对开发者的卖点,不在于它听起来更好,因为面对一个无人能测量的闭源模型,这个论点根本赢不了。而在于这东西可调用、有定价。具体来说,按表计费时你能得到的是:

• 一个由你掌控的会话——一个模型 ID、一个 Live Sessions 端点、一个通过 WebRTC 运行的已发布集成示例,以及一个你通过指令、音色和委派块配置的会话。

• 中断处理作为一项有文档记载的行为——在 Full Duplex Bench v1.5 上交互性达到 80.1%,而 GPT-Realtime-2.1 为 45.4%,轮次转换延迟为 0.798 秒,工具调用成功率为 87%。这三个数字均出自 Ope​nAI 自己,随发布一同公布,截至本文撰写时无人复现。

• 你选择的推理后端——语音层会跨越异步边界,将繁重工作交给会话配置中指定的另一个模型,该模型会在对话继续进行时持续工作。在 Ope​nAI 的文档示例中,该后端是 GPT-5.6 Terra;而在 7 月的消费者版发布时,它是 GPT-5.5

• 转录文本、响应文本和电话式计费——持续接通线路一小时收费 $3.00,按秒计费,其中 15 秒的会话初始化时间予以抵扣,而不是额外计入。

Sesame 给你更好的对话,而那些它一概没有。如果你正在打造一款产品,“更好的对话、没有 API、没有定价、没有基准测试、仅支持英语、30 分钟上限”就不是一份对比——它是一张候补名单。

GPT-Live-1现在所具备的一项数值,在其面向消费者发布时并不存在,而它是对上述一切最诚实的平衡。Artificial Analysis的Speech to Speech Index给GPT-Live-1打出69.8%——在十一个模型中位列第七,落后于73.9%的GPT-Realtime-2.1,也落后于79.0%的Grok Voice Think Fast 2.0。所以,你能买到的这个模型在独立榜单上也不是最好的那个。而榜单无法评分的,恰恰是Sesame真正占据优势的地方:该指数上的十一个模型,没有一个被评过“和它说话是什么感觉”,而Sesame Preview的声音在任何地方都没有一行评分。

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

技术栈中既不属于这家公司也不属于那家公司的部分

这里正是两个选项交汇之处,也是决策不再非此即彼的地方。Sesame Preview 和 GPT-Live-1 都不是完整的智能体。Sesame 的智能体不执行任务;GPT-Live-1 则明确把任何需要推理、检索或工具的事情委托给后端模型。在这两种设计中,真正有意思的工作都发生在声音背后,在一次纯文本模型调用中,而这一层具有语音层所不具备的可移植性——你可以更换后端,而无需为语音模型重新录制哪怕一条提示词。

那个后端也是 OrcaRouter 发挥作用的地方,值得精确说明我们承载什么、不承载什么。我们不路由 GPT-Live-1:Live Sessions 端点是 OpenAI 的,而那里的语音层不在我们可及范围内。我们也不路由 Sesame 的生产模型,原因更简单:它从未作为 API 提供。我们路由的是这两个产品都会把工作交给的那一层。来自十一家上游提供商的大约 190 个模型运行在一个密钥,按提供商列表价,无加价之后,并具备跨提供商的自动故障转移,以及一个能将多个模型组合成单次调用的路由 DSL。对于一支构建在未经验证的语音前端之上的团队来说,这才是真正重要的对冲:语音层可以被替换或被弃置,而不会把推理层一并带走;你三月押注的模型,到六月只需编辑一行就能替换。

看什么

有三件事会改变这一比较,而目前它们都不在任何人的掌控之中。一个 Sesame API——即便是付费的——会立刻把该类别中最强的语音变成可构建的选项,并在 GPT-Live-1 的 0.05 美元旁边摆上一个真实的价格。一份公开发布的 Preview 语音基准测试会把聆听印象转化为数字,而独立评估往往对那些只在演示中比拼过的语音并不友善。而首次由外部对 OpenAI 的交互性与延迟数据进行复现,将能判定全双工究竟是一个真实的能力差距,还是一次精心挑选的评测。

在那之前,诚实的区别是这样的。如果你是在为自己挑选语音,就用 Sesame Preview——它免费,它更好,而且偏好它不需要你付出任何代价。如果你是在为一个必须发布、销售和支持的产品挑选语音,那么 GPT-Live-1 是两者中唯一你真正能买到的,而它并不是听起来更好的那一个,这就是入场代价。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新