一张为“Gemini 3.8 TTS vs Sesame Preview”生成的主视觉卡片,白色背景,带有柔和的蓝青渐变点缀。左侧卡片“Gemini 3.8 Flash TTS”列出 Elo 1,260、排名第 2、8 个竞技场音色、一个 API 端点,以及每 100 万字符 16.50 美元(标准化后);右侧卡片“Sesame”分为“预览应用——免费、仅英语、无 API、无模型 ID”和“CSM-1B 检查点——Apache 2.0、20 亿参数、Llama 骨干”。页脚一行文字为“Elo 数据来自 Artificial Analysis Provider Voice Arena,2026 年 9 月;CSM-1B 详情来自其模型卡。”OrcaRouter 标志合成于右下角。
Guides & Insights

Gemini 3.8 TTS 对比 Sesame Preview:其中一个是下载,另一个是应用

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

搜索两者之间的对比:Gemini 3.8 Flash TTSSesame Preview,你会发现大量文章将它们视为同一类别中的两款产品。它们并非如此,而且这种差异并非技术细节。Gemini 3.8 Flash TTS 是一个 API 端点:它有一个模型标识符、一份公布的费率卡、在 Artificial Analysis Provider Voice Arena 上以 1,999 个样本获得 Elo 1,260 分、排名第 2 的排行榜记录,以及有文档说明的请求格式。Sesame Preview 是一款免费的消费级语音助手应用,有具名智能体、多轮对话和 30 分钟通话上限。它没有 API、没有模型 ID、没有计费方案,也没有在该榜单上的得分。

Sesame 唯一真正能拿来构建应用的产物,又是另一回事:CSM-1B,这是 Hugging Face 上采用 Apache 2.0 许可的检查点,它用 Llama 骨干网络和 Mimi 音频解码器从文本生成音频编码。当人们描述这款应用听起来有多像真人时,说的并不是这个声音。所以这一比较最终归结为一个可以回答的问题:你是想租用一个语音模型,还是想下载一个?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

有两个东西都叫 Sesame,而其中只有一个是可以构建的

命名的分歧是大部分困惑的根源,所以在进一步深入之前先把它分离出来。

• Sesame Preview——这款应用。免费使用,智能体名为 Maya、Miles、Simone 和 Charlie,支持多轮对话且上下文可跨轮次保持,具备网络搜索和提醒功能,仅支持英语,单次通话上限为 30 分钟。没有任何开发者接口:没有需要认证的对象,没有需要计量的内容,也没有可调用的端点。

• CSM-1B —— 该检查点。以 Apache 2.0 许可证发布在 Hugging Face 上,名称是 sesame/csm-1b,采用 Llama 主干和一个较小的解码器来生成 Mimi 音频编码。约 20 亿参数,英语,F32 权重,可通过 Hugging Face Transformers 运行。模型卡记录显示,1B 变体于 2025 年 3 月发布,原生 Transformers 支持于 2025 年 5 月推出。

这两者同属一家公司,也共享同一研究谱系,而它们的关系大致也就到此为止。那个应用是一款产品;而那个检查点则是先于它诞生的研究留下的产物。那些称赞该应用对话记忆能力的评测者,描述的其实是一个在语音模型之外配有检索与状态管理的系统,而不是你可以下载的那个 2B 检查点本身的属性。

检查点里实际包含什么?

CSM-1B 从架构意义上说是一个文本转语音模型,这对任何计划运行它的人都很重要:它以文本和音频上下文作为输入,并输出 RVQ 音频编码,解码器再将其转换为波形。模型卡中的实际事实如下:

• 许可证 — Apache 2.0。这是本页上最关键的一行。与仅限研究的权重许可证不同,Apache 2.0 允许无需另行签订协议即可商业使用,这使 CSM-1B 成为少数真正可用的开放语音检查点之一。

• 规模 — 在 F32 精度下约 20 亿参数。大到任何并发场景都需要真正的硬件,小到可以在单个加速器上运行以进行开发。

• 语言 — 英语,以卡片为准。并非多语言模型。

• 增长势头 — 在撰写本文时,上个月下载量为141,461次,该仓库获得约245,000个点赞。按照开放语音模型的标准,这是一个被广泛使用的检查点,也是证明该模型产物拥有真实用户基础、且独立于应用宣传的最有力论据。

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

模型卡没有给你的,是一个可以拿来与任何东西比较的质量声明。没有竞技场排行榜上的一行,没有第三方复现的厂商基准,也没有已发布的评估来说明该检查点的输出与这个应用的输出有何关联。任何告诉你可下载模型听起来像这个应用的人,都只是在从名称上推断。

为什么没有头对头比较,以及为什么这并不是研究空白

排行榜上不存在 Gemini 3.8 TTS 与 Sesame Preview 的对比,因为根本不可能有。这个竞技场对模型进行排名的方式,是让听众比较由托管端点生成的音频片段。而这一组合中的一方没有端点,因此无法参赛。

这一点值得精确说明,因为“不存在头对头比较”常常被写成仿佛数据缺失一样。它并没有缺失。它是未定义的。被比较的这两者并不共享一个可测量的表面:

• {{1}}Gemini 3.8 Flash TTS{{/1}} 的评分基于其原生托管语音。{{2}}Sesame Preview{{/2}} 没有可在此意义上评分的原生语音——它有的是智能体。

• Gemini 3.8 Flash TTS 以 token 为单位公布费率表。Sesame Preview 免费,且什么都不公布,因为没有任何可计费的内容。

• Gemini 3.8 Flash TTS 接收脚本并返回音频。Sesame Preview 接收一段对话并返回一段对话,并叠加应用层所提供的检索与记忆功能。

最接近正当比较的,是 Gemini 3.8 Flash TTS 与 CSM-1B 之间的比较,但即便如此也并不对等:一个有独立的 Elo 和供应商费率卡,另一个两者皆无。你能比较的是这种承诺的形态——按量计费的 API 与可下载的检查点——而这种比较并不需要排行榜。

这上面唯一有数字的一面

这个配对中所有量化的内容都落在谷歌这一边,而这本身就是重点所在。

在 Artificial Analysis Provider Voice Arena 上(数据采集于 2026 年 9 月 24 日),Gemini 3.8 Flash TTS 以 1,260 的 Elo 位列第 2 名,基于 1,999 个样本和 8 个 Arena 音色,发布于 2026 年 9 月 23 日。其同系列模型 Gemini 3.8 Flash-Lite TTS 以 1,235 位列第 6 名。Google 对 Flash TTS 的计费为:输入文本 token 每百万 0.50 美元,输出音频 token 每百万 9.00 美元,此价格持续到 2026 年 12 月 31 日,之后为 18.00 美元;Flash-Lite TTS 则为 0.50 美元和 6.00 美元,之后为 12.00 美元;Artificial Analysis 将这些价格归一化为每百万字符 16.50 美元和 11.00 美元,以便它们能与按其他单位计费的模型共用同一榜单。该归一化是该榜单的算术结果,并非 Google 的报价。

与此相对,CSM-1B 没有价格,因为它没有计量表。它有的是下载量、许可证和参数数量。如果你的决策框架需要 Elo 评分,这一比较不会为 Sesame 一方提供 Elo 评分,而诚实的结论是,这两个选项正在依据不同的标准被评估,而不是其中某一个尚未得到验证。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

如果你想要的是应用体验的话

很多搜索这个对比的人根本不是在选模型。他们用过 Sesame 应用,喜欢那种对话的感觉,并希望自己的产品也能有那种体验。那是另一个问题,下载并不能解决它。

让这款应用给人那种感觉的,主要不是语音模型。跨轮次的持久上下文、在对话中途决定要不要联网搜索、智能体何时开口说话的时机——这些都是编排,而它们没有一样存在于一个 2B 检查点里。下载 CSM-1B 只是给了你一副嗓音。在它之上构建应用的行为,是你的工程活儿;而 30 分钟的通话上限和没有 API,意味着你也租不到那个成品版本。

如果你想要的是一个可以调用的语音模型,那么诚实的答案是:Gemini 3.8 Flash TTS 是那个拥有有文档记录的接口、已公开定价、独立评分,并能在单次请求中实现双说话人对话的选项。如果你想要的是可以自己保留的权重,那么在 Apache 2.0 许可下的 CSM-1B 才是这两者中你真正能握在手里的那个——而代价是,硬件、服务栈以及每一项质量保证,都得由你自己来提供。

这两者 OrcaRouter 都不托管。Google 的模型是通过 Google 自家的 API 及其 9 月 23 日公告中所提及的各个接口来调用的;CSM-1B 则是由你自己运行的检查点。OrcaRouter 的用武之地,在于这一选择之上的那一层:200 多个模型通过单一密钥即可访问,按供应商标价、无任何加价,因此供应商调价当天即可生效,自动故障转移让实验性路由不会成为生产环境的依赖,以及一套路由 DSL,当单一声音无法胜任全部工作时,可将多个模型组合为一次调用。

这个比较的简短结论是:它其实算不上比较。一方有费率表和 Elo 评分,另一方有许可证和下载量。挑那个你真正填得上一栏的吧。