
Sesame Preview 对比 NVIDIA NemotronLabs VoiceChat 11B:你无法获得许可的声音,与你无法发布的声音
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1653智能69代码60数学
2026年最受热议的两款语音模型有一个共同点,而所有发布报道都不会告诉你:你无法将其中任何一款用于产品中。Sesame Preview是免费的消费者助手,其对话语音让 TestingCatalog 称之为“市场上最好的语音模式之一”,而且它背后的生产模型没有 API、没有模型 ID、也没有可购买的许可证——该公司根本没有公开发布。NVIDIA NemotronLabs VoiceChat 11B则正好相反:权重公开,全双工设计确实是首创,而且许可证规定仅供研究用途,所以也没有人能合法地将其发布。一个是你能听到却租不到的声音,另一个是你能拥有却无法出售的声音。这就像是在比较两扇锁着的门,而有用的问题是:你正站在哪把锁前。
两扇锁着的门,配有不同的锁。
先从两者的形态说起,因为名称掩盖了这两款产品之间的巨大差异。Sesame Preview 是一款应用,而非 API。它内置了四位性格各异的智能体——Maya(温暖而富有创意)、Miles(随和而敏锐)、Simone(好奇而理性)、Charlie(诙谐而温暖)——每位都有自己独特的声音和记忆,登录后可在网页端和移动端之间同步。它可以搜索网络、进行深度探索、记录笔记和提醒事项,并在每次通话结束后发送摘要。预览版免费使用,没有付费层级,仅支持英语,登录状态下每次通话上限为30分钟(未登录则为5分钟),并且它刻意不执行实际操作任务:它可以进行头脑风暴和研究,但不会替你预订航班。产品中没有任何 API 密钥——正式版语音是应用的一项功能,而不是一个端点。

NVIDIA NemotronLabs VoiceChat 11B 则恰恰相反:它是一个检查点,而非产品。它于 2026 年 8 月 3 日毫无预告地出现在 Hugging Face 上——没有发布文章,没有技术报告,没有推文;模型卡本身就是发布公告。这是一个 11B 参数的全双工语音模型(我们解析了 safetensors 头文件,统计出分布在 1,626 个张量中的 110.95 亿个参数),以单一技术栈构建:Fast Conformer 编码器以 80 毫秒帧处理 16 kHz 音频(零右上下文),Nemotron Nano 9B v2 主干负责推理,NVIDIA TTS 解码器生成 22.05 kHz 音频,RNN-T 解码器转录用户语音,外加一个独立输出通道发出工具调用脚本,而不会污染口语回复。它可以同时聆听和说话,可以在某个词说到一半时被打断;NVIDIA 称其为首个支持工具调用的开放全双工模型。这一说法能否经得起现实的检验,是下文专门章节的主题。
他们产生分歧的基准 —— “最佳对话”的两个候选者,两种破碎的证据标准
两个模型都将全部声誉押在同一件事上:对话质量——轮流发言、打断、自然的节奏,以及真实交流的感觉。这正是它们能出现在同一标题下的原因。也是比较变得奇怪的地方,因为两位候选者都无法被恰当评分。
Sesame Preview 没有给出任何数字。生产模型尚未发布且未列出——没有模型 ID,没有出现在 Artificial Analysis 的语音到语音排行榜上,没有延迟目标,也没有任何基准测试。TestingCatalog 的“市场上最好的语音模式之一”只是评论者的共识,而非测量结果,也无法对它与任何东西进行盲测 A/B 对比。唯一任何人都能独立运行的 Sesame 模型是开放权重的 CSM-1B 基础模型,而那是文本转语音检查点,并非该应用的声音。
NVIDIA NemotronLabs VoiceChat 11B 的问题正好相反:它有数字,但这些数字分散在两个互不一致的评估标准中。NVIDIA 报告其平稳轮换耗时 448 毫秒,被打断时让出话语权耗时 480 毫秒,用户打断时的接管率达到完美的 1.0——这些都是厂商在 NVIDIA 自家的 Full-Duplex-Bench 1.0 上测得的,没有任何一项被独立复现。该系列的独立测量结果则归在另一个名称和参数量之下——“Nemotron 3 VoiceChat (V1)” 12B,这个标签 NVIDIA 从未将其与 Hugging Face 上的 11B checkpoint 对账过;而这些测量在理解侧并不好看:根据 Artificial Analysis,Big Bench Audio 上为 29.2%,而 NVIDIA 自家卡片上为 37.0%。在 VoiceBench 上,该系列得分为 58.10,是榜单上最好的开源全双工结果。因此,同一个模型既是开源全双工 checkpoint 中的领跑者,同时在对所听到内容的理解上,又比托管的实时对话领先者大约落后三倍。

因此,分歧不在于哪个更好。而在于,2026年最佳对话的两个候选者,正基于截然相反且同样不完整的证据被评判。评测者称最像人声的那个声音,根本没有测量数据;而真正登上排行榜的声音,其弱点却是公开的。你不能将一个声誉与一个数字相比较,而这里只有一个数字——而且并不是那个讨喜的数字。
访问 — 应用商店下载,或 80 GB 的构建版本
如果你想尝试其中任何一个,起跑线的差异比任何规格都更重要。
Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.
NVIDIA NemotronLabs VoiceChat 11B 也不是一个下载下来就能直接运行的模型——它是一个需要你自己搭建的构建版本。Hugging Face 上注明,该模型“未由任何推理提供商部署”;NVIDIA 也没有托管它;而且仓库中的 config.json 是 NeMo 训练配置,因此没有可供 AutoModel 直接指向的 Transformers 检查点。受支持的路径是:在运行 vLLM 的 80 GB GPU(A100、H100、H200、B200 或 RTX 6000)上,使用一个锁定 Python 3.12、PyTorch 2.10 和 Transformers 4.56 版本的 conda 环境,并从源码编译 causal-conv1d 和 mamba-ssm——或者使用 NVIDIA 的 NGC NIM 容器,一旦你使用该硬件,它会在 /v1/realtime 提供一个与 OpenAI Realtime 兼容的 WebSocket。下载计数说明了实际访问情况:该模型发布首月约有 80 次下载,而点赞数为 107。人们收藏了它;几乎没有人运行过它。对于那些确实会运行它的研究人员,这里有一句实话:这个检查点所基于的推理骨干模型 Nemotron Nano 9B v2 本身就是一个你今天就能调用的托管模型——而围绕它的全双工模型则不然,这种差距正是全部重点所在。

价格 — 一款免费应用、自由重量器械,以及80 GB的账单
这两种模型都“免费”,而这个词在两种情况下都具有同样程度的误导性。
Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.
当这两者中的任何一个变得可购买时,诚实的衡量标准就是:无论你最终选择哪个托管的语音模型,你都应支付提供商的标价,而不在其上加收任何路由费用——这种直通模式能让供应商的降价当天就反映在你的账单上,而不是等到合同周期结束之后。本文中的两个模型都无法通过OrcaRouter调用:Sesame的生产级语音完全没有API,而NVIDIA NemotronLabs VoiceChat 11B则无法通过任何途径调用。这一衡量标准针对的是你实际能买到的语音,正是这一标准能让每百万字符7美元的TTS基础模型或未来达到Sesame品质的API被诚实地定价。
Memory — 会记住的应用 vs 会遗忘的模型
这里的差距犹如鸿沟,这也是两者无法互相替代的最具体原因。Sesame Preview 这款应用会记住:每个智能体都带有各自的记忆,登录后可在网页端和移动端之间同步;通话最长可达 30 分钟;无痕模式(Incognito Mode)会读取过往记忆,但不会创建新的记忆。相比之下,开源的 CSM-1B 只有 4K 上下文窗口——大约相当于三四分钟的文本——而且它反正也没有耳朵听你说话。
NVIDIA NemotronLabs VoiceChat 11B最多只能容纳大约两分钟的音频上下文——训练数据加载器将语音输入上限设为142.39秒,模型卡也警告称,超出两分钟窗口的对话可能不会被保留。对于需要记住四分钟前达成共识内容的支持电话来说,这一上限本身就足以让其失去资格。再加上发布版本中只有单一固定音色(Aria)且不支持克隆,这个在架构上保持开放的模型,同时也成了一个既无法记住客户、也无法改变自身声音的模型。
每个事物真正不擅长的方面
已收集,因为止步于优势的比较就是营销:
• Sesame Preview:没有 API——你不能将此语音用于产品中,生产模型尚未发布也未评分。仅支持英语,不能执行任务,通话时长上限为 30 分钟,且没有任何独立的基准测试。唯一开放模型 CSM-1B 具有 4K 上下文窗口,不支持工具调用,没有聆听功能,也不是该应用的语音。
• NVIDIA NemotronLabs VoiceChat 11B:仅限研究使用的许可证(OpenMDW v1.1)—— 你可以下载、研究和微调它,但不能发布它,基于它构建的任何人也同样不行。没有托管端点,所以“试用”意味着需要一块 80 GB 的 GPU 并从源码自行构建。仅支持英语,记忆上限约 2 分钟,只有一个固定的音色。NVIDIA 表示,它在知识和指令遵循方面可能不如其自身的主干模型,多步推理和算术能力也被明确指出是弱项。它可能会在句子中途打断你,经过几轮对话后退化为无法恢复的胡言乱语或自说自话,转写时会漏词,并且明确不适合嘈杂或混响强烈的房间。工具调用仅适用于纯 ASCII 的提示词和响应,每次会话最多五个工具,其参数准确率(44.2%)和首次尝试通过率(33%)意味着它选对工具的可靠性高于填对工具参数的可靠性。
谁应该选择哪个
因为两者都不可调用,诚实的回答要从你试图做的事情开始。
• 体验2026年评价最高的语音: Sesame Preview,今日免费提供——作为一款应用。评论者反复提及的四个智能体、打断处理、驾驶模式易用性:这就是一款消费级产品,其价值恰恰是你无法衡量的东西。
• 研究全双工语音建模: NVIDIA NemotronLabs VoiceChat 11B 是其类别中更值得关注的下载——一个 11B 开放检查点,拥有可用的工具调用通道、约 55 万小时的混合训练音频,以及迄今最佳的开放全双工 VoiceBench 结果,而权重成本为零。仅限研究的许可证并不会限制这项工作。
• Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.
• 本季度推出语音产品:以上两者皆不可行。你需要一个拥有商业许可的托管式实时语音转语音模型。安全采用一个你尚未押注生产路径的模型的方式,是将其与经过验证的模型并行路由,并配备自动故障转移,这样未经证实的语音永远不会导致实时通话中断。一个API即可接入200多个托管模型,按提供商标价收费、不加价,这让尝试新推出的语音只是配置变更,而非重写代码。
这种模式值得命名,因为它会反复出现。这两个模型距离可调用都只差一个事件——Sesame 在发布模型 ID 或 API 的那一天,NVIDIA NemotronLabs VoiceChat 11B 在 NVIDIA 发布商业许可证或有人托管它的那一天。届时,正确的做法不是拆除你现有的语音栈,而是在旧语音旁边添加新语音,并通过故障转移进行路由,就像你对待任何新的、未经验证的模型一样。它们是 2026 年两款最优秀却尚未推出的语音;而交付第三款所需的基础设施已经存在。
什么会改变这一比较?
有四件事会改写这篇文章。Sesame生产级语音的API或模型ID——一旦发生,Sesame就不再是一款应用,而会成为托管语音API市场期待已久的入场者。NVIDIA NemotronLabs VoiceChat 11B的商业许可或托管端点,这将在一夜之间把研究产物变成真正的产品选项。Sesame语音的独立评分——在Artificial Analysis的语音到语音榜单上列名,会让“{{1}}best voice{{/1}}”这一说法有据可查。以及NVIDIA发布一份技术报告,将11B检查点与排行榜所衡量的12B“Nemotron 3 VoiceChat (V1)”条目对应起来,这是信任该系列任何数字的前提条件。在这些落地之前,准确的总结很简单:2026年最有趣的两个对话式语音都被锁住了——一个被不出售的公司锁住,另一个被无法交付的许可锁住。
常见问题
我可以在自己的应用中使用任一模型的声音吗?
No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.
两个当中哪一个实际上听起来更像人类?
未知,各自理由不同。Sesame Preview 根本没有独立评分——TestingCatalog 所说的“市面上最好的语音模式之一”是评测者的共识,不是测量结果。NVIDIA NemotronLabs VoiceChat 11B 的对话时序(448 毫秒话轮切换、480 毫秒插话让位)由 NVIDIA 自行报告,尚未被复现;其独立的 Big Bench Audio 得分(29.2%,据 Artificial Analysis,归入“Nemotron 3 VoiceChat (V1)”名下)衡量的是理解能力,而不是语音好听与否。一个拥有你能听到的名声;另一个拥有的数字回答的则是另一个问题。
NVIDIA NemotronLabs VoiceChat 11B真的免费吗?
权重是免费的;但模型本身并不便宜。运行它需要一块 80 GB 的 GPU(按需租用约每小时 2–3 美元,若持续保持运行则每月 1,500–2,200 美元),并且需要从源码自行构建;此外,OpenMDW v1.1 许可证将其限制为仅供研究使用——因此,即使投入了这些成本,你也不能合法地将其提供给客户使用。
