《Realtime-Venus 对比 Sesame Preview》主标题卡,副标题为"两家实验室,同一个陷阱,相反的方向",另有三张卡片,分别写着"Sesame Preview:免费应用,四个智能体,自 2026 年 5 月起不再提供 API"、"Realtime-Venus:Apache-2.0 权重,没有产品,没有公告",以及"两者均未公布经独立验证的语音评分",上方有一条页脚横幅,写着"Sesame 的能力依据其自家移动端预览文档;Realtime-Venus 的数据来自其技术报告,未经复现。"OrcaRouter 标志合成于右下角。
Guides & Insights

Realtime-Venus 对比 Sesame Preview:能得到的,并非就是好的

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Realtime-Venus 和 Sesame Preview 出自不同的实验室,它们对语音模型的用途有着截然不同的理解,却从相反的方向跌入了同一个陷阱。Sesame Preview 是一款免费的消费级应用——2026 年 5 月起登陆 iOS,8 月初登陆 Android——内置四个对话智能体,通话中可实时进行网络搜索,其语音被评测者称为同类最佳。Sesame 发布的开放权重是另一个更小的模型,公司自己也不把它当作你在演示中听到的那个声音。Realtime-Venus 则走了另一条路:它是来自蚂蚁集团 Venus 团队与清华大学的 9B 全双工系统,可下载的产物就是真家伙,而根本没有对应的产品。在这两种情况下,可获取的东西与令人惊艳的东西之间的落差,才是你在围绕其中任何一个做规划之前最该弄明白的事。

每一个到底是什么

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview 是一款产品。Sesame 是一家旧金山实验室,由 Brendan Iribe、Ankit Kumar 和 Ryan Brown 于 2023 年创立,获得 a16z、Sequoia、Spark 和 Matrix 投资,其消费级语音助手提供四种人格——Maya、Miles、Simone 和 Charlie——每种都有独特的性情和声音。该智能体可以在对话中搜索网络、记笔记和设置提醒,并在通话后发送摘要。记忆是按智能体区分的,登录后会在网页端和移动端同步,另有无痕模式,可读取过去的记忆而不写入新的记忆。它免费,不投放广告,公司表示不会出售数据。

Realtime-Venus 是一个研究发布版本。在 Hugging Face 上以 Apache-2.0 许可发布的两个 9B 检查点——用于音视频交互的 Realtime-Venus-Omni 和用于语音交互的 Realtime-Venus-Audio——外加一份于 2026 年 9 月 12 日提交至 arXiv 的技术报告、一个项目页面,以及一个包含 Realtime-Venus-Harness 组件的配套代码仓库。没有应用,没有 API,没有定价,厂商也没有发布任何公告。该代码仓库未被任何推理服务提供商部署,下载量也未被追踪。

双向的陷阱

Sesame 的版本是典型的“开放洗白”形态,而 Sesame 在这一点上比大多数公司更诚实。该实验室以 Apache-2.0 发布的 CSM 检查点是一个基础语音生成模型——一个 Llama 主干网络馈入 Mimi 编解码器解码器——文档明确指出,它不是该应用的声音,也不是端到端的语音到语音系统。它无法生成文本,而且主要在英语数据上训练,在英语之外能力有限。驱动 Sesame Preview 的是一个尚未发布的大型生产模型。所以,如果你去寻找演示中的那个声音,你找到的是它的研究谱系,而不是它本身。当四个智能体中的一个回应你的呼叫时,你听到的是无法下载的东西。

Realtime-Venus 的版本则是镜像的另一面,而且可以说是更奇怪的那个。它所发布的一切都是真实的:真实的权重、真实的代码、真实的报告、宽松的许可证。缺失的是任何不涉及拥有一块 GPU 就能使用它的途径。BF16 下的两个 9B 检查点,每个在激活内存之前就大约有十八 GB 的权重,而且两者都设计为以实时音频和视频输入运行一个持续的一秒流式循环。这是服务器级部署。一个把同样能力送到手机上的消费级应用,做的是本次发布并未尝试的事,而一个可下载的模型与一个可运行的模型之间的差距,恰恰是大多数想要它的人会卡住的地方。

可衡量性是更鲜明的差异

两个模型都没有独立的音质评分,但原因各不相同。

• Sesame Preview —— 没有竞技场参赛记录,也没有对生产版语音的公开评估。它的声誉依赖于评测者以及原始演示对听众的影响,这算是一种真实证据,但完全未经量化。

• CSM-1B — 开放检查点是一个基础生成模型;它未与对话系统进行基准对比,因为它本身就不是对话系统。

• Realtime-Venus —— 仅有一项自行报告的语音指标,即 VoiceBench AlpacaEval 得分 4.81,其报告称该分数与最佳对比数值相当。尚无第三方对其进行过评估。

• 两者都给不了你的东西——一个由与结果没有利害关系的人给出的数字。如果语音质量是你的购买标准,那么整个对比就是无法评分的,而诚实的做法是亲自去听两者,自己做出判断,而不是听信一张表格。

轮流上阵,双方都有要证明的东西

Sesame 的声誉正是建立在这件事上。让这家实验室一举成名的那个演示,是一段带着呼吸、迟疑和打断时机的语音,其逼真程度足以让听众以为电话那头是个真人。这是一个关于对话动态的主张,也正是这款产品所主打的卖点。

Realtime-Venus 也提出了同样的说法,并附上了具体数字。在 Full-Duplex-Bench v1.5 上,其音频检查点报告称,对 75% 的用户打断作出了响应,在附和反馈下的延续率为 97%,在他人导向语音下为 88%,在背景语音下为 86%——据称在这三项延续指标上均超过 Gemini 3.1 Live 和 GPT-4o。这些数字来自其自身的报告,且尚未有人复现。

所以,这个对比就是一场没有数字的演示,对阵一个没有演示的数字,这确实是一个相当尴尬的处境,也如实描述了这整个类别目前是如何自我报告的。有一点可以确信:这两种说法都没有经受过外部第三方的检验,而私下渠道下97%的延续率高到足以在被当作定论引用之前,值得让第三方来验证一下。

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

你实际能构建什么

Sesame Preview 对构建者毫无价值。没有 API,没有模型标识符,没有价格表,也没有推出这些的明确计划。登录后通话时长上限为三十分钟,未登录则为五分钟;英语是唯一官方支持的语言;该代理会研究并记住信息,但不执行任务——它不会预订航班。免费层就是产品本身。作为面向消费者的方案,这完全没问题,但对集成来说却是死路一条。

Realtime-Venus 为构建者提供了一切,唯独没有运行它的地方。权重以宽松许可发布,代码可通过标准 Transformers 调用加载,只需切换一个方法就能进入全双工流式模式,而文档中描述的循环是先进行一秒的流式预填充,随后进行流式生成,如此重复。长视频记忆通过一个记忆分钟数参数启用,并被描述为免训练,这对于通常需要微调的能力来说很不寻常。两个注意事项被写进了文档,而不是留待用户自行发现:一个帧数上限会静默截断长视频,除非在导入该实用工具之前提高某个常量;以及将非拉丁字幕渲染进双工视频时需要 CJK 字体。

这一切都无法改变的是,harness——即执行异步委托的组件,而异步委托正是该架构最具特色的部分——位于另一个 GitHub 仓库中,其文档远不如模型完善,也是最难判断其生产就绪程度的部分。在实际部署中,委托这一环节不过是位于对话式前端之后的普通文本推理。OrcaRouter 既不提供 Realtime-Venus,也不提供 Sesame Preview;这两个语音层都不在我们所提供的服务范围内,我们对此直言不讳,而不会暗示一种并不存在的托管关系。一个密钥即可使用近 200 个文本模型,按供应商标价计费,不加价,正是该架构中我们确实覆盖的那一半,并具备自动故障转移,使被委托的任务能在上游中断时依然存活、可将多个模型组合为一次调用的路由 DSL,以及在单一模型的判断力不足时所采用的模型融合。它是一个设计中可购买的部分,而这个设计中最有意思的部分却并不出售。

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

诚实的推荐

如果你是一名消费者,想要当下可用的音质最好的对话语音,并且不需要将它集成,那么 Sesame Preview 是免费的,它在两个移动平台上都有,而且它的声誉名副其实,评测者们一直在这么说。用它,享受它吧。

如果你是研究人员或资源充足的工程团队,需要一套可检查、可微调的开放音视频全双工技术栈,那么 Realtime-Venus 是为数不多的真正选择之一,而其基准结果是自行报告的这一点,并不会改变其权重确实开放、架构确实有文档记录的事实。

如果你是一个产品团队,正在寻找一个本季度就能交付的语音层,那么这两者都不是你要找的答案,而把二者放在一起看,最有价值的启示恰恰在于原因。一家实验室做出了出色的东西,却把好的部分闭源了;另一家则公开了一切,把基础设施留给你自己搭建。这个品类已经证明,它能够做出值得一听的语音,但尚未决定这种语音除了以应用形式提供之外,是否应该以任何其他形式出售。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新