一张为 ElevenLabs Eleven v4 与 Google Gemini 3.1 Flash TTS 生成的主视觉卡片,包含两张评分卡:Eleven v4 的 Elo 为 1,319,每百万字符 80.00 美元;Gemini 3.1 Flash TTS 的 Elo 为 1,203,每百万字符 18.31 美元。配文为“116 Elo 分,是榜单价格的 4.4 倍”。页脚:“Provider Voice Arena,依据 Artificial Analysis,2026 年 9 月。”OrcaRouter 标志位于右下角。
Guides & Insights

Eleven v4 对比 Gemini 3.1 Flash TTS:116 分的差距,以及更便宜的 Google 模型

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

今天要选购 Goog​le 的语音,你会选错那一个。Goog​le Gemini 3.1 Flash TTS在 Artificial Analysis 的 Provider Voice Arena 中排名第 11,Elo 为 1,203,出场 3,512 次,价格为每百万字符 18.31 美元。ElevenLabs Eleven v4于 2026 年 9 月 28 日发布,以 1,319 的 Elo 排名第 1,出场 1,674 次,价格为每百万 80.00 美元。这看起来像是面对一个更便宜的挑战者时 116 分的差距——直到你注意到 Goog​le 自家的 Gemini 3.8 Flash TTS 在同一榜单上排名第三,Elo 为 1,267,标准化价格也更低,为 16.49 美元。真正的较量并不是标题里的对决所暗示的那一场,而原因在于一个发布日期。

其中一个比它看上去要新十八个月。

在榜单上,Gemini 3.1 Flash TTS 的发布日期是 2026 年 4 月 15 日。Eleven v4 的发布日期是 2026 年 9 月 28 日。这中间相隔五个半月,在语音合成领域算不上一个代际,但已经足够长,以至于 Google 已经推出了继任者:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 均于 2026 年 9 月 23 日正式全面可用,比 Eleven v4 早五天,而且在同一榜单上的排名都高于 3.1。Gemini 3.8 Flash-Lite TTS 以 1,241 分位列第六,价格为每百万 11.03 美元。

A generated scoreboard comparing ElevenLabs Eleven v4 and Google Gemini 3.1 Flash TTS across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 11 / 1,203), samples (1,674 with an interval of plus or minus 19 against 3,512 with plus or minus 12), board price ($80.00 against $18.31 per 1M characters), rate card ($0.022 per 1K characters until October 12 against billed per token), script direction (inline audio tags against a voice set and prompting) and release date (September 28, 2026 against April 15, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis; rate meters and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

那么,诚实的比较有三点,而不是两点,而按价格排序才是有趣的地方:

• 排名第 1,ElevenLabs Eleven v4 — Elo 1,319,每百万字符 80.00 美元,1,674 次出现,±19 区间

• 排名第 3,Google Gemini 3.8 Flash TTS — Elo 1,267,每百万字符 16.49 美元,发布于 2026 年 9 月 23 日

• 第6名,Google Gemini 3.8 Flash-Lite TTS — Elo 1,241,每百万字符 11.03 美元,发布于2026年9月23日

• 第 11 名,Google Gemini 3.1 Flash TTS — Elo 1,203,每百万字符 18.31 美元,发布于 2026 年 4 月 15 日,3,512 次出场,±12 区间

注意这些区间对那个排序造成的影响。Gemini 3.1 Flash TTS 的估计值为 1,203,区间是 ±12,所以它的真实值大约落在 1,191 到 1,215 之间。Eleven v4 的估计值为 1,319,区间是 ±19——大致在 1,300 到 1,338 之间。这两个范围互不重叠,而且它们之间的间隔超过一百分。这已经是偏好榜能做到的最干净利落的结果了。

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard, top of the table. ElevenLabs Eleven v4 is rank 1 at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices, released Sept 2026 at $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276. Google Gemini 3.8 Flash TTS is third at 1,267 with $16.5 per 1M characters. Google Gemini 3.8 Flash-Lite TTS is sixth at 1,241 with $11.0. SpeechifyAI Simba 3.2 is seventh at 1,240 with $6.6. Google Gemini 3.1 Flash TTS is eleventh at 1,203 with an interval of plus or minus 12, 3,512 samples, seven arena voices, released Apr 2026 at $18.3 per 1M characters.

为什么样本数量比排名更重要

Gemini 3.1 Flash TTS 距离其估计值还差 3,512 次出场;Eleven v4 则差 1,674 次,因为它在这个榜单上才刚满一天。较新的模型,其估计值每份样本所承载的不确定性更大,±19 的区间正体现了这一点。如果你是那种要等数字稳定下来才出手的买家,经验法则是:区间宽度之上的排序,才是你能据以行动的部分。在这里,该排名在两个方向上都轻松越过了自身的误差棒——领先于 3.8 Flash TTS,且在此项对比中不落后于任何模型。

该竞技场还统计了竞技场语音数量:Eleven v4 有八个,Gemini 3.1 Flash TTS 有七个。这是盲测中使用的不同厂商语音的数量,大致可以反映厂商自带默认语音阵容的规模。Eleven v4 的第一名是用八个语音赢得的,这意味着这次获胜并非依靠单一幸运的旁白者。

Elo 未计入的那些能力差异

这些榜单衡量的是偏好,而不是功能覆盖面。四个差异决定真实的项目,而它们没有一个体现在 Elo 中。

• 脚本表演指示 — Eleven v4 的文档中记载了内联音频标签([laughs]、[whispers]、[said angrily in French accent])以及自然语言表演提示;Google 的 3.1 代文档中记载了音色选择与提示方式,但并未提供用于表演指示的等效标签语法。

• 语音创建——Gemini 3.8 这一代新增了根据书面描述进行语音设计,以及从 30 秒样本进行语音复刻,并在输出中带有水印和来源元数据。Gemini 3.1 Flash TTS 早于该功能,提供的是预置音色集。

• 从真实音频克隆——Eleven v4 的 Instant Voice Cloning 只需十秒音频即可运行,其上还有专业层级。Google 在 3.8 代中的复制路径要求 30 秒,并增加了同意验证。不同的门槛,不同的同意机制。

• 每次请求的输入上限 — Eleven v4 标明为 10,000 个字符。Google 对其 TTS 模型按 token 而非字符计费,因此不存在可进行同类比较的每次请求字符上限,不应将这两种计量方式并排列出,仿佛它们可以直接对比。

最后一点正是最容易让采购电子表格出错的地方。ElevenLabs 按每 1,000 个字符报价。Google 按每百万 token 报价,输入和输出都是如此。Artificial Analysis 把两者统一折算到每百万字符的坐标轴上——$80.00 和 $18.31 就是这么来的——但这种归一化是该榜单的换算,而不是任何一家供应商的账单。用它来排名,而不是用来预测。

A screenshot of Google's Gemini API documentation page for text-to-speech generation, headed by a banner reading 'Gemini 3.8 Flash is now available'. The page covers single-speaker and multi-speaker TTS, states that the TTS capability differs from the Live API in being designed for exact text recitation with fine-grained control, names the gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts models, notes that TTS models accept text-only input and produce audio-only output, and shows a Python example that attaches a speech_metadata annotation with the style 'cheerful and friendly' and a voice of 'Kore' in generation_config.speech_config.

Eleven v4 费率表给这一对比带来了什么影响

在为期两周的时间里,上面的价格对比是错误的,且偏向 ElevenLabs;随后又会反过来对它不利,同样是错误的。在 ElevenLabs 的 API 定价页面上,Eleven v4 标价为每 1,000 个字符 $0.022,而标明的目录价为 $0.08,并标注在 10 月 12 日前优惠 72%。Eleven v4 Turbo 标价为 $0.011,而目录价为 $0.04。10 月 12 日之后,促销数字会消失,每百万 $80.00 的牌价将成为你实际支付的费率。

算一笔一个月五百万字符的账。Eleven v4 在窗口期内花费 $110,窗口期后为 $400。按照该榜单的 $18.31 归一化标准,Gemini 3.1 Flash TTS 同一个月约为 $92——比促销价还便宜,大约只有标价的四分之一。一个在九月做基准测试、十一月才上线的团队,将会依据一个已不复存在的数字做出决定。

路由适合何处,不适合何处

这两个模型都不在 OrcaRouter 的目录中。这里没有可调用的 ElevenLabs 端点,也没有 Google TTS 端点,而对于“我怎样才能通过你访问它们”这个问题,诚实的回答是:你不能通过我访问:Eleven v4 要通过 ElevenLabs 自己的 API 访问,Gemini 3.1 Flash TTS 则要通过 Google 的 API 访问。说别的就等于编造一个集成。

在这种对比中,单一密钥的价值就在于决策本身。如果你在权衡每月 400 美元的端点与每月 92 美元的端点,答案取决于你自己的脚本、你自己的语言和你自己的监听器——而要得到这个答案,意味着用相同的代码路径、相同的请求形态分别调用两者,而不是为了跑一次测试就搭建两套供应商集成。OrcaRouter 覆盖了这一层:200 多款模型通过一个密钥接入,供应商目录价按0% 加价传递,因此供应商调价在生效当天即会体现,另外还有自动故障转移,可在评估途中某一上游性能下降时接管。

谁应该选哪个

当语音本身就是产品时,选择 Eleven v4。它以 116 分优势领跑榜单,区间比排在它下面的模型更干净;两者之中,只有它具备有文档记录的、用于表演指导的内联标签语法;而且它的克隆门槛是十秒,而不是三十秒。溢价是真实存在的——达到标价中归一化价格的四倍——它换来的是榜单首位。

只有在已经决定投入 Gemini 3.1 Flash TTS 的情况下,才选择它。它是一个已推出五个月的预览代模型,得分低于 Google 自家 9 月发布的版本,归一化价格却更高;保留它的唯一理由,只是现有集成中的惯性。如果你有这种惯性,在 Google 技术栈内迁移到 3.8 Flash TTS,无需更换供应商,就能获得 64 个 Elo 分和更低的归一化价格——这是一种罕见的情况:升级同时也是更便宜的选择。

对其他所有人来说,眼下真正的问题是 Eleven v4 对阵 Gemini 3.8 Flash TTS,而答案是一场真正的取舍,而非排名:一边是 52 个 Elo 分和标签语法,另一边是大约只有五分之一的每字符成本。等到 10 月 12 日之后,用同样的脚本把两者都跑一遍;那时 ElevenLabs 的促销已经结束,价格差距才是你实际要支付的那个差距。