一张为“Gemini 3.8 TTS 对比 Inworld Realtime TTS-2”生成的主视觉卡片,白色背景,带有柔和的蓝青色渐变点缀。左侧卡片“Gemini 3.8 Flash TTS”列出 Elo 1,260、排名第 2、8 个竞技场语音、声称支持 130 种语言,以及每百万字符标准化价格 $16.50;右侧卡片“Inworld Realtime TTS-2”列出 Elo 1,245、排名第 4、8 个竞技场语音、仅支持英语、每百万字符标准化价格 $20.80,并在 Controlled Voice Arena 上位列第一。页脚一行写着“Elo 数据来自 Artificial Analysis Provider Voice Arena,2026 年 9 月;价格来自 Google 和 Inworld。”OrcaRouter 标志合成于右下角。
Guides & Insights

Gemini 3.8 TTS 对比 Inworld Realtime TTS-2:你相信哪个排行榜会改变答案

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Flash TTSInworld Realtime TTS-2并排放在 Artificial Analysis Provider Voice Arena 上,答案就显而易见了:第 2 名对第 4 名,Elo 1,260 对 1,245,各有 8 个竞技场音色,归一化价格为每百万字符 $16.50 对 $20.80。厂商在名次和价格上都胜出,而且 15 分的差距本来就在两行数据的置信区间之内。

转到 Artificial Analysis 发布的另一个榜单,排序就反过来了。在 Controlled Voice Arena 上,Inworld Realtime TTS-2 以 1,123 的 Elo 位居榜首,其 Flash 版本为 1,075。这不是舍入误差——而是不同的模型在获胜,原因在于这两个榜单衡量的并不是同一件事。如果你在为产品选择声音,弄清楚你的用例真正要问的是这两个问题中的哪一个,就是决策的全部。

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Inworld Realtime TTS-2, showing Provider Arena position (rank 2, Elo 1,260 against rank 4, Elo 1,245), Controlled Arena position (not top ranked against rank 1 at Elo 1,123), price ($16.50 against $20.80 per 1M characters), languages (130 claimed against English only), cloning path (a 30-second sample against 5 to 15 seconds) and dialogue (two speakers against a single voice).

两块板,两个不同的问题

Provider Voice Arena 对模型自带原生语音进行评分——即供应商随产品提供并托管的语音。Controlled Voice Arena 则保持语音不变,评估每个模型在被要求用并非自己的声音说话时表现如何。相同的评委,同类的盲评比较,不同的变量。

这种区分对应着两种不同的工作:

• 提供商排行榜回答的是"这个模型开箱即用是否好听"。对于一款出厂即配备一组固定旁白音色、且从不克隆任何声音的产品来说,那才是它该看的榜单。

• 受控排名回答的是“这个模型是否遵循声音规范”。对于一个声音属于客户的产品——克隆的品牌声音、经授权的演员声音、按租户区分的身份——来说,它才是合适的排行榜。

Google 的模型在第一个榜单上领先。Inworld 的在第二个榜单上领先。这两种说法同时成立,彼此并不矛盾,而这恰恰说明,一个单一的“哪个 TTS 模型最好”的答案,通常意味着作者只挑了一个榜单,而没看另一个。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Inworld Realtime TTS-2 at rank 4 with an Elo of 1,245, with Inworld Realtime TTS-2 Flash further down at 1,210 and Gemini 3.8 Flash-Lite TTS at rank 6.

Inworld 排名第一的地位在实践中意味着什么?

排名第一的受控结果是对指令忠实度的断言,而对指令的忠实度正是决定克隆究竟是否可用的属性。

Inworld 的克隆路径有两种形式。即时克隆基于一小段样本即可运作——厂商给出的数字是 5 至 15 秒的参考音频——而专业克隆层级目前处于测试阶段,所需时长在十分钟左右。两者均为厂商自报,且均未经竞技场独立验证;竞技场所衡量的是模型在拥有声音之后的行为表现,而非生成该声音的克隆环节的质量。

与该系列相关的延迟宣称也属于同一类别。Flash 变体的首字节数字——25 毫秒,来自第三方测量——以及完整模型的 p99 数值,都是 Inworld 自家的数据,而竞技场对这两者都没有任何说法。对于一个面向实时的模型来说,这些数字合情合理,同时也未经证实,而这才是不该轻信它们的正确态度。

所以实际解读是:如果你的产品会克隆声音,那么在两个分数中,Inworld 的 Controlled 结果更具参考意义,也正是它使得较低的 Provider 排名不构成淘汰理由。如果你的产品不做克隆,那这项优势对你就不可见,此时该看的是 Provider 榜单。

价格阶梯有三档,而便宜的那一档是订阅制

用一个价格去对比另一个价格,会把这场比较判断错,因为 Inworld 并没有一个价格——它有的是一整套阶梯。

• 按需 — Realtime TTS-2 为每百万字符 $25.00,Flash 为 $15.00。这是按量付费调用方看到的价格,也是供应商自己公布的数字。

• 创作者套餐——同样两个模型分别为 $20.00 和 $10.00,即选择套餐而非按量计费可享受 20% 和 33% 的折扣。该数据由厂商提供,也是在你做出决定前最值得在实时定价页面上再次核实的一档,因为套餐条款的变动速度比标价更快。

• 归一化后 —— arena 按每百万字符换算,Realtime TTS-2 为 $20.80,Flash 为 $10.40,这是该榜单自己算出来的数,而非任何一家厂商的报价。

相比之下,Google 的费率基于 token 且为促销价:截至 2026 年 12 月 31 日,文本 token 输入为每百万 $0.50,音频 token 输出为每百万 $9.00,之后为 $18.00;Flash-Lite TTS 为 $0.50 和 $6.00,之后为 $12.00。归一化后,即 $16.50 和 $11.00。

A screenshot of Inworld's text-to-speech product page, showing the Realtime TTS-2 and TTS-2 Flash model cards, the instant and professional voice cloning tiers, per-million-character pricing, and usage statistics including 642,022,085 characters used and 223,764 minutes generated.

把两者放在一起看,情况比“Google更便宜”要有意思得多。按照今天公布的数字,Flash TTS是三款模型中最便宜的,而Inworld的Flash版本则排在第二便宜的位置——这两款Flash模型价格非常接近,以至于音频与文本比例的微小变化,就可能让计费更低的一方发生翻转。到了2027年1月1日,当Google的费率翻倍时,排序便会尘埃落定,Inworld在其阶梯的每一档上都会成为更便宜的选择。任何在9月比较这两者、却在12月才做决定的人,比较的都是错误的数字。

各自在何种情况下是更好的答案

两个模型在质量上足够接近,因此区分因素在于结构,所以诚实的做法是列出一系列条件,而非给出一个结论。

当声音由你选择时,就选 Gemini 3.8 Flash TTS。根据文字描述进行声音设计、一次调用完成双说话人对话、按轮次设置风格,以及按 Google 自己的统计在两者中拥有最广的语言覆盖——在这项对比中,Inworld 这些全都无法匹敌。它目前也是更便宜的模型,而它的同门 Flash-Lite 在同一 API 内为你提供了第二个价格档位。

当声音是客户自己的时候,选择 Inworld Realtime TTS-2。一条顶级的 Controlled Voice 行、一条以数秒参考音频来衡量的即时克隆路径、一个面向需求更多场景的专业克隆层级,以及一种由厂商发布的首字节声明所支撑的实时定位——但需注意,这些声明出自厂商自身。按厂商自己的文档,它仅支持英语,如果你需要其他语言,这是一项硬性约束。

这两个模型都不由 OrcaRouter 托管,这一点值得明说,而不是暗示并非如此:调用 Gemini 3.8 Flash TTS 的地方是 Google 自己的 API 以及 Google 在 9 月 23 日指定的那些入口;调用 Inworld Realtime TTS-2 的地方是 Inworld 自己的平台。OrcaRouter 的用途,是围绕这一选择的一切——200 多款模型通过单个密钥即可访问,价格为提供商目录价,没有任何加价,因此像 1 月那次费率调整,当天就会在我们这边生效,自动故障转移,这样被评估的模型不必成为生产依赖;以及一种路由 DSL,用于在单一音色无法胜任整项工作时,把多个模型组合成一次调用。

让这两者都继续留在考虑范围内的原因是,1月的费率变动以及“受控方与提供方”的区分,是答案可能发生变化的两个独立原因。一条只能调用其中之一的流水线,无法跟踪其中任何一个。