
Gemini 3.8 TTS 与 Cartesia Sonic 3.6:13 个 Elo 分与 16 美元
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
在 Artificial Analysis 盲投排行榜上,最接近的两个文本转语音模型之间相差一个名次、十六美元,而这两个差距指向相反的方向。Cartesia Sonic 3.6以 1,273 的 Provider Voice Arena Elo 位居第一,样本量为 1,757。Gemini 3.8 Flash TTS以 1,260 位居第二,样本量为 1,999。两者的 Elo 差距为十三分——落在双方各自公布的置信区间之内——而价格差距则朝相反方向拉开:Gemini 为每百万字符 33.00 美元,Cartesia 则为 49.00 美元。如果你要在这两者之间做选择,最诚实的说法是:你每百万字符多付十六美元,换来的却是排行榜无法分辨的质量差异。
这就是整个决策,值得放慢脚步仔细考虑,因为这两款模型都太新了,以至于几乎没有其他任何东西被测量过。Cartesia Sonic 3.6 于 2026 年 8 月发布。Gemini 3.8 Flash TTS 于 2026 年 9 月 23 日发布。除了竞技场投票之外,两者都没有公布独立的基准测试,而竞技场投票显示它们位居榜首,在统计上并列。
排行榜实际上说明了什么
Artificial Analysis 的 Provider Voice Arena 在这里是一个有用的榜单,因为它通过盲测两两投票的方式,将每个提供商的自家原生语音与其他所有提供商的语音进行对比。对于“哪个产品听起来更好”这个问题,这种比较比固定语音的榜单更公平,因为它让每个厂商使用其实际发布的语音。
• 第 1 名 — Cartesia Sonic 3.6,Elo 1,273,17 分区间,1,757 个样本,8 个竞技场语音,发布于 2026 年 8 月,每 100 万个字符 $49.0。
• 排名第2 — Gemini 3.8 Flash TTS,Elo评分1,260,置信区间17分,1,999个样本,8种竞技场语音,发布于2026年9月,每百万字符33.0美元。
• 第3名 — Alibaba Qwen-Audio-3.0-TTS-Plus,Elo 1,259,1,447个样本,15个竞技场语音,每100万字符27.6美元。
• 第 4 至第 9 名,供参考——Inworld Realtime TTS-2 为 1,245,SpeechifyAI Simba 3.2 为 1,237,Google Gemini 3.8 Flash-Lite TTS 为 1,235,VUI Labs Luna TTS 为 1,230,Inworld Realtime TTS-2 Flash 为 1,210,BreezeBlue Breeze TTS 2 为 1,204。
读一下区间就会发现,前三名彼此重叠到分不清了。Sonic 3.6 的 1,273 分对应的区间跨度为十七分;Gemini 的 1,260 分区间跨度相同。两者的区间几乎在整个宽度上都相互重叠。Qwen-Audio-3.0-TTS-Plus 以 1,259 分与这两者都有重叠。榜单在告诉你:就目前收集到的样本而言,这三个模型在盲测偏好上无法区分,而且它们之间的排序并不构成稳定证据。
样本数量也足够接近,无法解释这一差异——Cartesia 为 1,757,Gemini 为 1,999。两者都处于几千的低位,这足以把模型归入某一档,却不足以区分同一档内的相邻模型。

这十六美元来自哪里
Cartesia 自己的定价页面并未公布 Sonic 的每百万字符费率。它销售包含捆绑分钟数的订阅层级——Free 为 $0,包含 20,000 积分,大约 27 分钟的 Sonic 3.6;Pro 为 $5,包含 100,000 积分,大约 133 分钟;Startup 为 $49,包含 125 万积分,大约 1,667 分钟;Scale 为 $299,包含 800 万积分,大约 10,667 分钟——以及分别为 2、3、5 和 15 的并发限制,语音本地化按每个新增口音 225 积分收费,语音代理通话时长为每分钟 $0.06,电话通信为每分钟 $0.014。
所以,每百万字符 49.00 美元并不是 Cartesia 以其自身计价单位给出的标价。它是 Artificial Analysis 把 Cartesia 的积分折算成一个共同分母,以便该榜单至少能按价格排名。对于对比榜单来说,这样做是合理的,而且这是唯一可获得的同口径可比数字,但这意味着 Cartesia 的数字是推算出来的费率,而 Gemini 的数字是已公布的费率。
谷歌的定价很直接。Gemini 3.8 Flash TTS 在 2026 年 12 月 31 日之前,每百万输入文本 token 收费 0.50 美元,每百万输出音频 token 收费 9.00 美元,之后则分别为 1.00 美元和 18.00 美元。音频按每秒 25 个 token 计量,因此音频输出费率换算下来约为每秒钟语音 0.02 美分。更便宜的同类产品 Flash-Lite TTS 在同样每秒 25 个 token 的计量下,每百万音频 token 为 6.00 美元,而 Artificial Analysis 将其等效价格列为每百万字符 22.10 美元,排名第 6,Elo 为 1,235。

• 每 100 万字符价格 — Cartesia Sonic 3.6 为 $49.00,Gemini 3.8 Flash TTS 为 $33.00,Gemini 3.8 Flash-Lite TTS 为 $22.10。
• 竞技场 Elo — 1,273 对 1,260 对 1,235,前两名的分差均为 17 分。
• 竞技场语音 — 8 vs 8 vs 8。
• 样本 — 1,757 对比 1,999 对比 2,000。
• 可用性 —— Cartesia 托管的测试版,对比 Google 自家的 Gemini Developer API,已正式全面可用。
• 重量发布——两者均已关闭;两者均不可下载。
比价所隐藏的部分
每百万字符是一个方便的单位,而这两种产品的计费方式都不是这样的。
Cartesia 的计量单位是订阅套餐内的一种额度(credit),并发上限则绑定在套餐层级上。这意味着,在你触及上限之前,接下来一千个字符的边际成本为零;一旦触及上限,成本就变成升到下一档套餐的费用。对于上限可预测的工作负载,这比按字符计费所显示的费率更划算——你买的是余量,而不是消耗量。对于会突发尖峰的工作负载,这反而更糟,因为 Free 层级并发为 2、Pro 层级并发为 3,这是一堵硬墙,而不是一个价格。
Gemini 的计费单位是 token,按调用计量,未公布并发上限,并且有三个服务层级——Standard、Batch 和 Flex,以及 Priority——费率各不相同。Batch 和 Flex 将 Flash TTS 的音频费率减半至每百万 token 4.50 美元;Priority 则将其提高到 16.20 美元。这是一种精细得多的成本模型,而且它奖励的正是 Google 定价通常所奖励的:提前知道任务是交互式还是批处理。
因此,哪个更便宜取决于你的语音工作负载看起来像订阅还是像计量表。Cartesia 的各档定价面向用量稳定且有限的产品。Gemini 的定价则面向你可以分类的消费用量。
Cartesia 仍然拥有哪些 Google 没有的东西
两件事,而这两件事都关乎成为一款语音产品,而非一个语音模型。
Cartesia 直接销售电话通信和语音代理基础设施:电话通信每分钟 $0.014,语音代理通话时长每分钟 $0.06,语音本地化则按每增加一种口音 225 点信用计费。如果你正在构建一个电话代理,这是一个可以一站式购买的整套技术栈。Gemini 3.8 Flash TTS 是一个合成端点——它返回音频后就结束了。传输层、轮次检测和电话通信都由你自己提供,或者从其他供应商那里拼装。

Cartesia 在榜单上的时间也更长。它 8 月发布,而谷歌是 9 月,这意味着它更多的样本数是在对一个已经稳定的版本上累积的,而 9 月发布的模型仍在收集投票。一个模型第一周的 Elo 估计比同一模型一个月后的 Elo 估计噪声更大,这不利于把十三分的差距解读为支持 Cartesia 的证据。
Google 拥有哪些 Cartesia 没有的东西
语言覆盖是最明显的一点。{{1}}Flash TTS{{/1}} 支持 130 种语言并具备自动检测能力;Flash-Lite 则支持 101 种。Cartesia 的本地化模式是叠加式的——你要在基础音色之上购买口音,每个 225 积分——这是一种不同的思路,而且一旦超过少数几种语言,成本曲线也截然不同。
第二个是演绎层面。Gemini 3.8 Flash TTS 让你能像指导演员那样指导一句台词,在一次调用中编排双人对话场景,还能把非语言提示写进脚本——<laughs>、<sigh>、<gasp>、|mhm|、|yeah|——直接写进脚本。它还支持根据自然语言描述进行声音设计,以及基于 30 秒样本进行声音复刻,并附带同意验证、输出上的 SynthID 水印和 C2PA 凭证。语音混音功能标注为即将推出。
它已正式发布,而非测试版。Cartesia Sonic 3.6 则是托管测试版,这反映出厂商自身对该端点在高负载下表现的信心。
到底该调用哪一个
如果你的工作负载是通话量可预测的电话代理,并且你希望电话通信、并发和语音合成都由同一家供应商提供,那么 Cartesia Sonic 3.6 就是更协调一致的选择,而 16 美元的差价,就是你不必自己整合三家供应商所付出的代价。
如果你的工作负载是已运营产品内部的语音合成——旁白、无障碍层、客服机器人的语音、一次覆盖130种语言的本地化处理——那么 Gemini 3.8 Flash TTS 的每字符成本更低、语言覆盖更广、语调控制更精细,并且已全面可用。Elo 分数上的差距并不能否定这一点,因为该 Elo 差距在统计上并不真实。
如果你想选榜单前列三者中最便宜的那个,并且可以接受更短的语言列表,那么 Gemini 3.8 Flash-Lite TTS 的价格是每百万音频 token 6.00 美元,排名低六位、位列第 1,235 名——这一差距同样落在噪声范围内。
无论你选哪一个,迁移路径都比选择本身更重要,因为两个模型都是新的,两家厂商也都还在调优。OrcaRouter 就是那份对冲:一个密钥即可访问 200 多个模型,按供应商标价计费,绝无加价,因此无论哪家实验室降价,当天就会反映在你的账单上,而不用等到续约时,合成调用失败时自动故障转移,还有一套路由 DSL,让你可以把批处理任务发给一个模型、把交互式调用发给另一个。我们不托管 Cartesia Sonic 3.6 或 Gemini 3.8 TTS 端点——Cartesia 的合成是它自己的产品,Gemini 语音模型来自 Google 的 API——但文本层和故障转移路径是我们的,而正是这些部分让全新模型可以放心尝试。
值得关注的是下一次 Artificial Analysis 修订。如果 Gemini 3.8 Flash TTS 在样本量成熟后能弥合这 13 个点的差距,那么价格差距就不再是一种取舍,而开始成为一个直截了当的答案。如果它不能,Cartesia 保住质量王冠,Google 保住价格王冠,而选择就完全停留在现在的位置:一个附带电话功能的订阅,或一个附带 130 种语言的计量器。
