一张为 StepAudio 3 Realtime 对 Sesame Preview 生成的英雄标题卡,引题为“OrcaRouter · 模型雷达——正面对决”,主标题为“StepAudio 3 Realtime 对 Sesame Preview”,副标题为“人人称赞的嗓音对阵拥有排行榜分数的那一个”,位于两张圆角模型卡上方,两张卡片分列于对阵标记两侧。
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview:人人称赞的语音 vs 拥有评分的那一个

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在2026年的大部分时间里,任何人关于语音 AI 所能作出的最有力论断,都只是一种聆听印象。Sesame 的助手听起来比任何其他产品都更像真人,而且说这话的人足够多,使它成了参照标准——没有基准、没有数字,也无从核实。2026年9月15日,StepAudio 3 Realtime由 StepFun 推出,并为这一品质最接近可衡量的版本配上了一个数字:在 Artificial Analysis 的 Conversational Dynamics 评测中获得 98.9%,排名第一。Sesame Preview并不在该榜单上。

有意思的不是一方打败了另一方,而是 Sesame 赖以成名的那个品质如今成了第三方打分的对象,而那个享有声誉的模型却从未以它作为衡量标准。

这些实际上分别是什么

它们不是同一类对象,而这一点对比较结果的影响,比任何评分都要大。

Sesame Preview 是一款面向消费者的语音助手。自 2026 年 5 月起在 iOS 上免费提供,自 2026 年 8 月初起在 Android 上广泛可用。它围绕四个具名智能体——Maya、Miles、Simone 和 Charlie——构建,这些智能体能够跨会话保持上下文、搜索网页并设置提醒。它仅支持英语。通话时长上限为 30 分钟,退出登录后会降至 5 分钟。其生产级语音没有 API,没有企业版,也没有公开定价。

StepAudio 3 Realtime 是一个开发者接口。它是 StepAudio 3 系列五个模型之一,这五个模型均于同一天发布,并都已作为商业 API 上线 StepFun 开放平台。它支持原生全双工对话,可直接基于语音进行推理,而非先转写,并支持工具调用以及在对话继续期间异步执行长任务。它以中文优先。它不是开放权重模型,目前采用限时免费预览定价,尚未公布预览期后的价格。

其中一个你可以在上面建造,另一个你可以参观。

Sesame 以之闻名的可衡量事物

Conversational Dynamics 是一个特定的基准,值得了解它涵盖哪些内容。它评估轮流发言、停顿处理、打断恢复,以及模型是否能正确地将简短的反向反馈——“嗯哼”、“对”、“嗯”——理解为鼓励,而不是争夺对话发言权。这些正是听者在说某个声音感觉像人而非机器人时所描述的行为,也正是让助手变得令人乐于交谈、而不仅仅是准确的行为。

StepAudio 3 Realtime 以 98.9% 的成绩领跑该榜单,领先于 Qwen Audio 3.0 Realtime Plus 的 98.4% 和 GPT-Realtime-2 的 95.3%。据 StepFun 称,它还在语音推理(Speech Reasoning)上以 99.7% 位列第一,其背后所依托的架构主张是:直接对原始音频进行推理,能够保留转写环节会抹平的语调与重音——这正是听出讽刺与听出赞美之间的差别。

对这个结果,诚实的表述是这样的。这个基准测试是业界最接近衡量 Sesame 因何受赞誉的手段,而 Sesame 尚未被纳入其中。这并不能证明 StepAudio 3 Realtime 听起来比 Sesame 更好。它证明的是,这些说法中有一个是可检验的,而另一个迄今为止则不是——并且那个可检验的说法目前由一个大多数人从未与之交谈过的模型持有。

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

可用性不对称,这才是真正的决策

以上内容都很有趣,但这一部分才是关键。

Sesame 的声音——那款让人们赞不绝口的声音——是一个规模更大的闭源生产模型,Sesame 从未将其作为 API 发布。你无法购买它、获得它的授权,也无法从你自己的产品中调用它。如果你读到 Sesame 的对话时序是市面上最好的,并由此得出结论说你可以拥有它,那么这个结论并不能从证据中推出。

Sesame 实际开源的其实是 CSM-1B,以 Apache-2.0 许可发布。它是一个合成模块,而非助手:一个 Llama 主干预测第一个 Mimi 码本,一个更小的 Llama 解码器预测其余部分,再由 Mimi 编解码器渲染成 24 kHz 波形。它仅支持英语,可从一段 10 到 15 秒的参考片段克隆声音,而且完全不能生成文本——你需要把它与一个单独的语言模型搭配使用。同时运行过两者的人都说,CSM-1B 的声音明显弱于 Preview 应用的;而模型卡则把心照不宣的部分直说了:驱动交互式演示的是 CSM 的一个微调变体,而那个变体并不是你能下载的检查点。

StepAudio 3 Realtime 完全没有这种模糊性。它是一款商业 API,背后有已公开的模型系列、明确的能力清单,以及可供查证的第三方测评排名。它还是中文优先、预览定价,并在同一个排行榜上,在赢得对话动态表现的同时,首次音频延迟高达 8.83 秒——相比之下,Gemini 3.8 Live 为 1.18 秒,GPT-Live-1 为 1.24 至 1.34 秒。无论它在对话质量上能提供什么,它尚未证明自己能在 StepFun 自家部署环境之外,以对话级的速度实现这一点。

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

如果你正在选择语音技术栈,该怎么处理这个

首先要把这两个问题分开来。「对话应该给人什么感觉?」和「我能交付什么?」的答案并不相同,而且其中只有一个属于采购决策。

如果你正在校准品味——判断你的产品该有多少温度、多少沉默才算舒适、一个智能体该多快让出话轮——Sesame Preview 是免费的,确实出色,值得花一个下午去体验。把它当作一个参照基准。但不要围绕它规划集成,因为没有什么可集成的。

如果你正准备上线产品,StepAudio 3 Realtime 是一个真正值得考虑的候选方案,但也伴随着实实在在的注意事项:预览版定价、以中文为先的覆盖范围、在 Artificial Analysis 上没有索引评分,以及尚未解决的延迟问题。先测延迟,再测对话质量。一个在话轮转换基准测试中胜出、却要花上大半句话的时间才开始说话的模型,其最佳质量你可能永远没机会展示出来。

如果Sesame的生产级语音有朝一日开放API,这整套对比都会被重新跑一遍——因为能一锤定音的那个基准测试早已存在,而Sesame终将不得不在上面露面。

路由适合何处,不适合何处

语音智能体并不是单一模型。无论你运行的是 StepAudio 3 Realtime 还是其他任何东西,对话都会不断把工作交给普通文本模型——一次查询、一次抽取、一次在保持停顿背后运行的推理调用。正是这个委派层,成本波动就存在于这里,也是某个提供商糟糕的一小时变成你的服务中断的地方。

要准确说明我们自身的覆盖范围:StepAudio 3 系列中的实时与语音端点并不在 OrcaRouter 上,Sesame 所做的任何东西也都不在其中。OrcaRouter 上提供的是语音智能体所委派的文本层——一个 API 背后有近 200 个模型、自动故障转移,以及一套可将多个模型组合为单次调用的路由 DSL,还有当单个模型的判断力不足时的模型融合,且供应商标价原样传递、不加价。

正是这一区分,让可用性问题不像看上去那么致命。语音模型是可以回头重新审视的决定;而委派层才是拆解起来代价高昂的那一层,也是在选定任何语音供应商之前,值得置于路由层之后的那一层。

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

裁决

Sesame Preview 赢在无法衡量之处,输在所有可以买到的东西上。它是目前可用的音质最好的语音,而且免费,却无法投入生产——而既然现在有第三方为它赖以成名的那种质量评分,它在那份排行榜上的缺席就是证据中的一处空白,而非受保护的领先优势。

StepAudio 3 Realtime 在可用性、可衡量性和能力方面胜出,但在价格、语言覆盖范围和延迟方面仍存在真正的未解问题。它是这两者中唯一一个你今天就能在其上构建的,这比任何基准测试都更快地解决了实际问题。

值得关注的事情很简单,而且两边都适用:要么是 Sesame 生产环境语音的 Conversational Dynamics 分数,要么是 StepAudio 3 Realtime 的延迟数据,使其进入它目前在质量上胜过的那批模型所在的同一区间。任何一项都能让这件事从测量数据与声誉之间的比较,变成一场真正的正面对决。