
GPT-Live-1 对比 Sesame Preview:这场比较中最好的语音,是你买不到的那一个
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码

随便问一个两者都用过的人,排名都毫无悬念:Sesame Preview 是大多数人交谈过的最令人信服的语音助手。它也是你无法基于其进行开发的那一个。GPT-Live-1 和 Sesame Preview 经常被拿来比较——两者都能对话,都能处理打断,听起来都像真人而不是电话语音菜单——但它们的提供方式截然相反。GPT-Live-1 是按分钟租用的托管模型,自 2026 年 9 月 10 日起可公开调用。Sesame Preview 是一款免费的消费级应用,完全没有 API,而让人们印象深刻的那个声音,运行在一个从未发布过的生产模型上。
每一个到底是什么
• GPT-Live-1 — OpenAI 的全双工语音模型,自 2026 年 7 月 8 日起在 ChatGPT 中提供,自 9 月 10 日起在 API 中提供,价格为每分钟语音 0.05 美元。提供十二种 API 音色,不支持声音克隆,不支持图像或视频输入,每次会话都会返回转录文本和响应文本。
• Sesame Preview — Sesame 面向消费者的语音助手。自 2026 年 5 月起在 iOS 上免费提供,自 2026 年 8 月初起在 Android 上广泛可用,另有一个语音优先的网页预览版。四款智能体——Maya、Miles、Simone 和 Charlie——仅支持英语,通话时长上限为 30 分钟,未登录时会降至 5 分钟。
• CSM-1B —— Sesame 中开源的部分:一个 1B 对话语音模型,于 2026 年 4 月 23 日以 Apache 2.0 许可证发布,基于 Llama 架构主干,配有独立解码器和 Kyutai 的 Mimi 编解码器,可从约 4K 个 token 的上下文生成 24 kHz 单声道英语语音。
上面三行就是整个决策的全貌。一家公司按分钟出售模型,另一家免费送出一款应用,还开源了一个更小的模型——而那个模型并不是应用中用的那一个。
演示版与下载版之间的差距
Sesame 对此异常直白,而对任何评估这两者的人来说,这是唯一最重要的事实。Preview 应用中的语音——也就是催生出那些病毒式传播片段和“同类最佳语音模式”评测的那个语音——是一个规模更大的闭源生产模型。CSM-1B 是来自同一实验室的 10 亿参数开放检查点,而根据同时运行过两者的人的评估,它是一个明显更弱的语音。Preview 上的会话还有上限,并且仅限英语,而且没有任务执行:这些智能体只会交谈,不会预订、购买或提交任何东西。
这让开发者获得了一个真实但更狭窄的选项:一个可自托管、无许可费的对话语音检查点,由一家第三方推理提供商托管,每百万字符收费7美元——约合每合成音频小时0.35美元——或在自有硬件上免费使用。无论是 Preview 语音还是 CSM-1B,都没有人发布过独立的基准测试,因此任何一方对质量的宣称都只是听感印象,而非测量结果。Sesame 也没有公布公开定价、企业版或盈利计划;该公司宣称的方向是研究合作和计划中的硬件产品。

每分钟花 0.05 美元能换来哪些免费所不能提供的东西
GPT-Live-1 对开发者的卖点,不在于它听起来更好,因为面对一个无人能测量的闭源模型,这个论点根本赢不了。而在于这东西可调用、有定价。具体来说,按表计费时你能得到的是:
• 一个由你掌控的会话——一个模型 ID、一个 Live Sessions 端点、一个通过 WebRTC 运行的已发布集成示例,以及一个你通过指令、音色和委派块配置的会话。
• 中断处理作为一项有文档记载的行为——在 Full Duplex Bench v1.5 上交互性达到 80.1%,而 GPT-Realtime-2.1 为 45.4%,轮次转换延迟为 0.798 秒,工具调用成功率为 87%。这三个数字均出自 OpenAI 自己,随发布一同公布,截至本文撰写时无人复现。
• 你选择的推理后端——语音层会跨越异步边界,将繁重工作交给会话配置中指定的另一个模型,该模型会在对话继续进行时持续工作。在 OpenAI 的文档示例中,该后端是 GPT-5.6 Terra;而在 7 月的消费者版发布时,它是 GPT-5.5。
• 转录文本、响应文本和电话式计费——持续接通线路一小时收费 $3.00,按秒计费,其中 15 秒的会话初始化时间予以抵扣,而不是额外计入。
Sesame 给你更好的对话,而那些它一概没有。如果你正在打造一款产品,“更好的对话、没有 API、没有定价、没有基准测试、仅支持英语、30 分钟上限”就不是一份对比——它是一张候补名单。
GPT-Live-1现在所具备的一项数值,在其面向消费者发布时并不存在,而它是对上述一切最诚实的平衡。Artificial Analysis的Speech to Speech Index给GPT-Live-1打出69.8%——在十一个模型中位列第七,落后于73.9%的GPT-Realtime-2.1,也落后于79.0%的Grok Voice Think Fast 2.0。所以,你能买到的这个模型在独立榜单上也不是最好的那个。而榜单无法评分的,恰恰是Sesame真正占据优势的地方:该指数上的十一个模型,没有一个被评过“和它说话是什么感觉”,而Sesame Preview的声音在任何地方都没有一行评分。

技术栈中既不属于这家公司也不属于那家公司的部分
这里正是两个选项交汇之处,也是决策不再非此即彼的地方。Sesame Preview 和 GPT-Live-1 都不是完整的智能体。Sesame 的智能体不执行任务;GPT-Live-1 则明确把任何需要推理、检索或工具的事情委托给后端模型。在这两种设计中,真正有意思的工作都发生在声音背后,在一次纯文本模型调用中,而这一层具有语音层所不具备的可移植性——你可以更换后端,而无需为语音模型重新录制哪怕一条提示词。
那个后端也是 OrcaRouter 发挥作用的地方,值得精确说明我们承载什么、不承载什么。我们不路由 GPT-Live-1:Live Sessions 端点是 OpenAI 的,而那里的语音层不在我们可及范围内。我们也不路由 Sesame 的生产模型,原因更简单:它从未作为 API 提供。我们路由的是这两个产品都会把工作交给的那一层。来自十一家上游提供商的大约 190 个模型运行在一个密钥,按提供商列表价,无加价之后,并具备跨提供商的自动故障转移,以及一个能将多个模型组合成单次调用的路由 DSL。对于一支构建在未经验证的语音前端之上的团队来说,这才是真正重要的对冲:语音层可以被替换或被弃置,而不会把推理层一并带走;你三月押注的模型,到六月只需编辑一行就能替换。
看什么
有三件事会改变这一比较,而目前它们都不在任何人的掌控之中。一个 Sesame API——即便是付费的——会立刻把该类别中最强的语音变成可构建的选项,并在 GPT-Live-1 的 0.05 美元旁边摆上一个真实的价格。一份公开发布的 Preview 语音基准测试会把聆听印象转化为数字,而独立评估往往对那些只在演示中比拼过的语音并不友善。而首次由外部对 OpenAI 的交互性与延迟数据进行复现,将能判定全双工究竟是一个真实的能力差距,还是一次精心挑选的评测。
在那之前,诚实的区别是这样的。如果你是在为自己挑选语音,就用 Sesame Preview——它免费,它更好,而且偏好它不需要你付出任何代价。如果你是在为一个必须发布、销售和支持的产品挑选语音,那么 GPT-Live-1 是两者中唯一你真正能买到的,而它并不是听起来更好的那一个,这就是入场代价。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
