一张生成的英雄卡片,主题为“Gemini 3.8 TTS 对比 ElevenLabs”,背景为白色,配有柔和的蓝青色渐变点缀。左侧卡片“ElevenLabs Eleven v3”列出每 100 万字符 100 美元、支持 70 多种语言、Elo 1,167、排名第 17;右侧卡片“Gemini 3.8 Flash TTS”列出每 100 万字符 33 美元、支持 130 种语言、Elo 1,260、排名第 2。页脚一行写着“Elo 数据来自 Artificial Analysis Provider Voice Arena,2026 年 9 月。”OrcaRouter 徽标合成在右下角。
Guides & Insights

Gemini 3.8 TTS 与 ElevenLabs:三倍价格能为你带来什么

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在相同用量下,ElevenLabs 的旗舰合成模型成本约为该厂商新模型的三倍。ElevenLabs Eleven v3每千字符收费 0.10 美元——每百万字符 100 美元——而 Gemini 3.8 Flash TTS每百万音频 token 收费 9.00 美元,Artificial Analysis 将其归一化为每百万字符 33.00 美元。按计费口径,这就是 3.0 倍的差距,也是本次对比中最重要的一个事实。有意思的问题不在于这个差距是否真实,而在于每百万字符多出的六十七美元实际上买到了什么,因为答案并不是“更好的语音”。

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

三米,而不是一米

首先要弄清楚的是,这两款产品衡量的并不是同一回事,而对外公布的价目表恰恰掩盖了这一点。

• ElevenLabs 按字符计费。Eleven v3 为每 1,000 个字符 0.10 美元,每次请求上限为 5,000 个字符。Eleven v3 Conversational 为每 1,000 个字符 0.05 美元,Flash 和 Turbo 模型也是每 1,000 个字符 0.05 美元,但每次请求限制为 40,000 个字符,并声称其延迟约为 75 毫秒,而 v3 Conversational 约为 280 毫秒。

Google 按 token 计费,而音频 token 与文本 token 不同。Gemini 3.8 Flash TTS 对输入的文本 token 收费为每百万 $0.50,对输出的音频 token 收费为每百万 $9.00,按每生成一秒语音计 25 个音频 token 来计量。官方并未公布单次请求的字符数上限。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis 两者都不计费;它进行归一化。其 Provider Voice Arena 排行榜上的每百万字符 $100.00 和 $33.00 是一个推导出的共同分母,以便该榜单至少能够按价格排名。它对比率有用,但不适用于报价。

所以,对 3.0x 这个数字的诚实解读是:在唯一可用的同类比较口径下,Google 的价格约为三分之一。这对你自己的电子表格意味着什么,取决于你的工作负载是以短字符串为主还是长字符串为主——随着话语变长,按秒计费的音频计量和按字符计费的文本计量会急剧分化,因为静音、停顿和韵律填充都会消耗音频 token,而不消耗任何字符。

已完成的一个月

比如把一百万字的文本,大约相当于一部中等长度小说的篇幅,转换成语音一次。

• ElevenLabs Eleven v3 — 合成费用为 $100.00,再加上根据你的并发量运行所需的任意套餐层级。已公布的套餐中,Starter 为 $6,Creator 为 $22,Pro 为 $99,Scale 为 $299,Business 为 $990,字符额度已打包在这些套餐中,而非单独计费。

• Gemini 3.8 Flash TTS — 折合 33.00 美元,或者如果任务可批处理,则大约 16.50 美元,因为 Batch 和 Flex 层级将音频费率减半至每百万 token 4.50 美元。优先服务将其提高到每百万 16.20 美元,或约合 59.40 美元,仍远低于 ElevenLabs。

• Gemini 3.8 Flash-Lite TTS — 每百万音频token收费$6.00,按相同标准化折算约合$22.10,代价是支持101种语言而非130种。

如果把这同样的一百万个字符按 Google 的促销定价来算,差距还会进一步拉大,因为两款新的 Gemini TTS 模型在 2026 年 12 月 31 日前都按半价计费,之后价格会翻倍。任何基于 9 月数字来构建商业论证的人,都是在依赖一个有公开到期日的折扣。

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

比较结果唯一发生逆转的地方,就是非常短的话语。按字符计费时,一句三个词的确认几乎不花什么钱;而按音频秒数计费时,就要为说出这句确认所花的那一秒付费,包括它周围的静默。如果你的产品是由单句回复构成的语音界面,这笔账就会偏向 ElevenLabs。如果是旁白、有声书、长文本本地化,或任何文本很长、音频更长的场景,它就会大幅偏向 Google。

质量问题,说实话

在 Artificial Analysis Provider Voice Arena 上——对每个提供商自家原生语音进行的盲测两两投票——这两个模型差距不小,Google 领先。

• Gemini 3.8 Flash TTS — 排名第 2,Elo 1,260,17 点区间,1,999 个样本,8 种竞技场语音,发布于 2026 年 9 月。

• ElevenLabs Eleven v3 — 排名第 17,Elo 1,167,11 分区间,4,345 个样本,8 个竞技场声线,在榜单上标注为 2026 年 2 月。

两者相差 93 个 Elo 分,而且与那个榜单上前三名之间的差距不同,这个差距是真实的:Eleven v3 的区间为 1,156 至 1,178,Gemini 的区间为 1,243 至 1,277,二者没有重叠。Eleven v3 的样本量是 Gemini 的两倍多,因此这一估计也并不单薄。

对价格论点来说,这是个着实尴尬的结果,而且有悖于显而易见的结论。ElevenLabs 的收费是别家的三倍,在盲测偏好中的排名却低了十七位。多出的六十七美元无论买到了什么,在一对一比较中都不是听起来更好的声音。

ElevenLabs 究竟在卖什么

ElevenLabs主要销售的并不是一个合成端点,而大多数比较之所以出错,正是因为把它当作合成端点来定价。这笔钱买到的是:

• 语音库。ElevenLabs 的共享语音库拥有数百种语音,是一个实实在在的产品门面——人们来到 ElevenLabs,往往是为了在某处听到过的某个特定语音,而不是它背后的模型。Gemini 3.8 Flash TTS 自带 30 种预置的录音棚级语音,一条语音设计路径可根据自然语言描述生成语音,还有一条复刻路径,能从 30 秒样本中克隆语音,并附带同意验证、SynthID 水印和 C2PA 凭证。默认目录规模更小;创建特定语音的能力则不相上下。

• 延迟档位作为独立产品。Flash 和 Turbo 约为 75 毫秒、限制为 40,000 字符,与约为 280 毫秒、5,000 字符的 v3 是不同的产品,而且两者都比 v3 便宜。如果你的应用需要低于 100 毫秒,ElevenLabs 明确销售这种能力,而 Google 的发布材料并未对这两款新 TTS 模型中的任何一款做出可比的延迟声明。

• 一个生态系统。配音、语音代理、对话端点,以及一个带有并发额度的套餐结构——这与 Cartesia 出售电话服务是同一个道理:它是一套技术栈,而不是一个模型。

如果你购买的是整套方案,那 3.0 倍的价格就是你不自己组装的代价。如果你购买的是合成调用,那你付的钱买的是一个语音库和一个延迟档位。

Google 实际上在卖什么

反面论据比“更便宜”更狭窄,也更有力。

• 语言覆盖范围——Flash TTS 支持 130 种语言,Flash-Lite TTS 支持 101 种,均可从文本中自动检测;而 ElevenLabs 为 Eleven v3 记录的受支持语言为 70 多种。对于本地化流程而言,这一差异并非功能对比,而是覆盖缺口。

• 指导 —— 逐行交付控制、单次调用内的双说话人场景编排,以及写入脚本的非语言提示,如 <laughs><sigh><gasp>|mhm||yeah|。Google 声称,3.8 代在长篇一致性和双说话人控制上相较 Gemini 3.1 Flash TTS 有所改进,而这正是这些功能存在的意义。厂商声明,未经复现。

• 语音状态模型 —— 每个项目 200 个有状态自定义语音,TTL 为一年;或无状态语音,通过voicekey_... 句柄寻址,这些语音七天后过期。这是一项你可以提前规划的基础设施决策。

• 输出控制 — 在一元端点上输出 WAV 24 kHz 单声道 16 位有符号 PCM,在流式端点上输出无文件头 PCM(audio/l16),以及 audio/mulaw 和 audio/alaw,并支持可配置的采样率。

Google 的发布基准测试结果由厂商自行报告,也应按此方式看待:在 Hume AI Voice Design Benchmark 上以 71.4 位列第一,在口音建模上以 60.8 位列第一,Flash 和 Flash-Lite 分别在 Hume Overall Quality Index 上位列第一和第二,并声称在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语中取得盲测偏好排名前列。这些测试的运行结果没有一个是公开的。本文上方的竞技场 Elo 是唯一独立收集的数据,而它恰好与厂商声称的方向一致。

切换演算

如果你的工作负载属于长篇、多语言,或规模大到 3.0x 会作为一项单独支出出现,并且你能接受较小的默认语音库以及没有公布低于 100 毫秒的档位,那就切换。这涵盖了旁白、配音、无障碍以及大多数产品内嵌语音。

如果你购买的是整套方案——语音库、延迟层级、配音和智能体产品——或者你的工作负载以极短话语为主,而按秒计的音频计量会惩罚你,那就留下。同样,如果你已经在 ElevenLabs 上微调出一个你的用户能识别的声音身份,也请留下,因为声音连续性是一项产品功能,而在新模型上重新创建它是一项工程。

无论哪种方式,明智的做法都是先在真实流量上把两者都跑一个月再决定,而这正是不该把其中任何一个直接接入你的代码库的理由。OrcaRouter 把 200 多款模型置于单个密钥之后,按提供商标价提供,不加价,因此任何一家实验室的调价当天就会反映到你的账单上,而不是等到续费时,并且自动故障转移能让生产环境的语音链路保持存活,即使某个全新端点出问题也是如此。我们不托管 ElevenLabs——它的合成层和智能体层是它自己的产品——我们也不托管 Gemini 3.8 TTS 端点,那些来自 Google 的 API。我们承载的是底层的文本层,以及其上的路由层。

值得关注的数字是 Eleven v3 在下一版排行榜修订中的 Elo。对于一个收费高出三倍的模型来说,九十三分的差距是很大的劣势,而如果置信区间收窄而差距却没有缩小,那么价格上的理由就不再是一种权衡取舍,而会变成一纸判决。