
Eleven v4 对比 Gemini 3.1 Flash TTS:116 分的差距,以及更便宜的 Google 模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
今天要选购 Google 的语音,你会选错那一个。Google Gemini 3.1 Flash TTS在 Artificial Analysis 的 Provider Voice Arena 中排名第 11,Elo 为 1,203,出场 3,512 次,价格为每百万字符 18.31 美元。ElevenLabs Eleven v4于 2026 年 9 月 28 日发布,以 1,319 的 Elo 排名第 1,出场 1,674 次,价格为每百万 80.00 美元。这看起来像是面对一个更便宜的挑战者时 116 分的差距——直到你注意到 Google 自家的 Gemini 3.8 Flash TTS 在同一榜单上排名第三,Elo 为 1,267,标准化价格也更低,为 16.49 美元。真正的较量并不是标题里的对决所暗示的那一场,而原因在于一个发布日期。
其中一个比它看上去要新十八个月。
在榜单上,Gemini 3.1 Flash TTS 的发布日期是 2026 年 4 月 15 日。Eleven v4 的发布日期是 2026 年 9 月 28 日。这中间相隔五个半月,在语音合成领域算不上一个代际,但已经足够长,以至于 Google 已经推出了继任者:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 均于 2026 年 9 月 23 日正式全面可用,比 Eleven v4 早五天,而且在同一榜单上的排名都高于 3.1。Gemini 3.8 Flash-Lite TTS 以 1,241 分位列第六,价格为每百万 11.03 美元。

那么,诚实的比较有三点,而不是两点,而按价格排序才是有趣的地方:
• 排名第 1,ElevenLabs Eleven v4 — Elo 1,319,每百万字符 80.00 美元,1,674 次出现,±19 区间
• 排名第 3,Google Gemini 3.8 Flash TTS — Elo 1,267,每百万字符 16.49 美元,发布于 2026 年 9 月 23 日
• 第6名,Google Gemini 3.8 Flash-Lite TTS — Elo 1,241,每百万字符 11.03 美元,发布于2026年9月23日
• 第 11 名,Google Gemini 3.1 Flash TTS — Elo 1,203,每百万字符 18.31 美元,发布于 2026 年 4 月 15 日,3,512 次出场,±12 区间
注意这些区间对那个排序造成的影响。Gemini 3.1 Flash TTS 的估计值为 1,203,区间是 ±12,所以它的真实值大约落在 1,191 到 1,215 之间。Eleven v4 的估计值为 1,319,区间是 ±19——大致在 1,300 到 1,338 之间。这两个范围互不重叠,而且它们之间的间隔超过一百分。这已经是偏好榜能做到的最干净利落的结果了。

为什么样本数量比排名更重要
Gemini 3.1 Flash TTS 距离其估计值还差 3,512 次出场;Eleven v4 则差 1,674 次,因为它在这个榜单上才刚满一天。较新的模型,其估计值每份样本所承载的不确定性更大,±19 的区间正体现了这一点。如果你是那种要等数字稳定下来才出手的买家,经验法则是:区间宽度之上的排序,才是你能据以行动的部分。在这里,该排名在两个方向上都轻松越过了自身的误差棒——领先于 3.8 Flash TTS,且在此项对比中不落后于任何模型。
该竞技场还统计了竞技场语音数量:Eleven v4 有八个,Gemini 3.1 Flash TTS 有七个。这是盲测中使用的不同厂商语音的数量,大致可以反映厂商自带默认语音阵容的规模。Eleven v4 的第一名是用八个语音赢得的,这意味着这次获胜并非依靠单一幸运的旁白者。
Elo 未计入的那些能力差异
这些榜单衡量的是偏好,而不是功能覆盖面。四个差异决定真实的项目,而它们没有一个体现在 Elo 中。
• 脚本表演指示 — Eleven v4 的文档中记载了内联音频标签([laughs]、[whispers]、[said angrily in French accent])以及自然语言表演提示;Google 的 3.1 代文档中记载了音色选择与提示方式,但并未提供用于表演指示的等效标签语法。
• 语音创建——Gemini 3.8 这一代新增了根据书面描述进行语音设计,以及从 30 秒样本进行语音复刻,并在输出中带有水印和来源元数据。Gemini 3.1 Flash TTS 早于该功能,提供的是预置音色集。
• 从真实音频克隆——Eleven v4 的 Instant Voice Cloning 只需十秒音频即可运行,其上还有专业层级。Google 在 3.8 代中的复制路径要求 30 秒,并增加了同意验证。不同的门槛,不同的同意机制。
• 每次请求的输入上限 — Eleven v4 标明为 10,000 个字符。Google 对其 TTS 模型按 token 而非字符计费,因此不存在可进行同类比较的每次请求字符上限,不应将这两种计量方式并排列出,仿佛它们可以直接对比。
最后一点正是最容易让采购电子表格出错的地方。ElevenLabs 按每 1,000 个字符报价。Google 按每百万 token 报价,输入和输出都是如此。Artificial Analysis 把两者统一折算到每百万字符的坐标轴上——$80.00 和 $18.31 就是这么来的——但这种归一化是该榜单的换算,而不是任何一家供应商的账单。用它来排名,而不是用来预测。

Eleven v4 费率表给这一对比带来了什么影响
在为期两周的时间里,上面的价格对比是错误的,且偏向 ElevenLabs;随后又会反过来对它不利,同样是错误的。在 ElevenLabs 的 API 定价页面上,Eleven v4 标价为每 1,000 个字符 $0.022,而标明的目录价为 $0.08,并标注在 10 月 12 日前优惠 72%。Eleven v4 Turbo 标价为 $0.011,而目录价为 $0.04。10 月 12 日之后,促销数字会消失,每百万 $80.00 的牌价将成为你实际支付的费率。
算一笔一个月五百万字符的账。Eleven v4 在窗口期内花费 $110,窗口期后为 $400。按照该榜单的 $18.31 归一化标准,Gemini 3.1 Flash TTS 同一个月约为 $92——比促销价还便宜,大约只有标价的四分之一。一个在九月做基准测试、十一月才上线的团队,将会依据一个已不复存在的数字做出决定。
路由适合何处,不适合何处
这两个模型都不在 OrcaRouter 的目录中。这里没有可调用的 ElevenLabs 端点,也没有 Google TTS 端点,而对于“我怎样才能通过你访问它们”这个问题,诚实的回答是:你不能通过我访问:Eleven v4 要通过 ElevenLabs 自己的 API 访问,Gemini 3.1 Flash TTS 则要通过 Google 的 API 访问。说别的就等于编造一个集成。
在这种对比中,单一密钥的价值就在于决策本身。如果你在权衡每月 400 美元的端点与每月 92 美元的端点,答案取决于你自己的脚本、你自己的语言和你自己的监听器——而要得到这个答案,意味着用相同的代码路径、相同的请求形态分别调用两者,而不是为了跑一次测试就搭建两套供应商集成。OrcaRouter 覆盖了这一层:200 多款模型通过一个密钥接入,供应商目录价按0% 加价传递,因此供应商调价在生效当天即会体现,另外还有自动故障转移,可在评估途中某一上游性能下降时接管。
谁应该选哪个
当语音本身就是产品时,选择 Eleven v4。它以 116 分优势领跑榜单,区间比排在它下面的模型更干净;两者之中,只有它具备有文档记录的、用于表演指导的内联标签语法;而且它的克隆门槛是十秒,而不是三十秒。溢价是真实存在的——达到标价中归一化价格的四倍——它换来的是榜单首位。
只有在已经决定投入 Gemini 3.1 Flash TTS 的情况下,才选择它。它是一个已推出五个月的预览代模型,得分低于 Google 自家 9 月发布的版本,归一化价格却更高;保留它的唯一理由,只是现有集成中的惯性。如果你有这种惯性,在 Google 技术栈内迁移到 3.8 Flash TTS,无需更换供应商,就能获得 64 个 Elo 分和更低的归一化价格——这是一种罕见的情况:升级同时也是更便宜的选择。
对其他所有人来说,眼下真正的问题是 Eleven v4 对阵 Gemini 3.8 Flash TTS,而答案是一场真正的取舍,而非排名:一边是 52 个 Elo 分和标签语法,另一边是大约只有五分之一的每字符成本。等到 10 月 12 日之后,用同样的脚本把两者都跑一遍;那时 ElevenLabs 的促销已经结束,价格差距才是你实际要支付的那个差距。
