
Gemini 3.8 TTS 与 VoxCPM2:租用声音还是自行运行,用真实数据说话
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
没有任何排行榜行会把Gemini 3.8 Flash TTS和VoxCPM2并排放置,而这种缺失正是本次比较中最有用的事实。Gemini 3.8 Flash TTS 是一个托管端点,在 Artificial Analysis Provider Voice Arena 上以 1,260 的 Elo 位列第 2,并公布了以 token 计价的价目表。VoxCPM2 是 OpenBMB 的一个检查点——20 亿参数,Apache 2.0,于 2026 年 4 月发布——没有任何推理提供商托管它。你无法租用它。你得自己运行它。
所以问题不在于哪个模型听起来更好,而在于你的工作负载究竟更适合按字符为别人的 GPU 付费,还是自己拥有 GPU,并且无论它们是否在运行都要为其买单。这是一个算术问题,而且与大多数模型对比不同,它有一个你可以在投入之前就算出来的答案。

其中一个你租用,另一个你运营。
从每一个实际交到你手上的东西开始。
• 访问方式 — Gemini 3.8 Flash TTS 仅提供 API,通过 Gemini API 及其 2026 年 9 月 23 日公告中提及的 Google 各入口调用。VoxCPM2 在生产使用中没有第一方端点,也没有推理服务商为其提供服务;检查点本身即是产品。
• 许可 — VoxCPM2 以 Apache 2.0 许可发布,该许可允许商业使用,无需另行签订协议。这是一份真正宽松的许可,而这并非开放语音权重的默认做法:其中不少模型以仅限研究的条款发布,让商业使用仍需绕回托管 API。
• 规模 — VoxCPM2 拥有 20 亿参数,在开发场景下以降低的精度运行时可容纳于约 8 GB 显存中,而在 24 GB 显卡上服务峰值约为 22 GB。Google 未公布 Gemini 3.8 TTS 两款模型中任何一款的参数数量。
• 语音创建 — Gemini 3.8 Flash TTS 可根据书面描述进行语音设计,根据30秒样本进行语音复制,并在一次调用中完成双说话人对话。VoxCPM2 是单语音文本转语音模型;一次对话是两次运行的拼接。
• 独立评分——Flash TTS 有一个。在 2026 年 9 月 24 日抓取的 Provider Voice Arena 上,VoxCPM2 并未出现在有排名的行中。未出现在榜单上并不代表对质量的评判——这通常意味着还没有人提交该模型——但这确实意味着没有第三方偏好数据可供权衡。

最后这一点是把双刃剑,值得直说而非含糊带过:如果你在做出承诺前需要一个独立的质量信号,那么这两者中只有一个能提供。
决定成败的数字:实时因子
自行托管语音模型会将按字符计费的账单变成按 GPU 小时计费的账单,而这两个单位之间的汇率就是模型的实时因子——即生成一秒音频需要消耗多少秒的计算时间。
VoxCPM2 公布的数据是:原生 PyTorch 下为 0.30,Nano-VLLM 下为 0.13。应把这些数字理解为吞吐量,而非延迟:在 0.13 的情况下,一个 GPU 小时的挂钟时间可产出约 7.7 小时的成品音频。而在 0.30 时,同样一个 GPU 小时的产出接近 3.3 小时。这些数字均来自模型卡本身,由 OpenBMB 实测得出,是此处任何"自建还是采购"决策中最重要的单一输入因素。
由此得出三件事。
• 服务栈比模型更重要。在相同硬件上,从原生 PyTorch 迁移到 Nano-VLLM,吞吐量可提升一倍以上。任何基于 0.30 这一数字构建的成本模型,都会将自托管成本高估约 2.3 倍。
• 利用率就是一切。一块 90% 时间都闲置的租用 GPU,无论价格多低,都不会比 API 更便宜。只有当你让显卡持续忙碌时,盈亏平衡点才会出现。
• 批处理再次改变了算术。实时因子按每条流来测量;处理并发请求的服务器会将固定成本分摊到这些请求上,而这正是自托管开始占据优势的情形。
一小时的音频成本,双向计算
把两种计费模式放在同一坐标轴上。一小时的成品音频,产出就是 3,600 秒。
在租用端,Google 按 token 而非字符计费:截至 2026 年 12 月 31 日,输入文本每百万 token 为 0.50 美元,输出音频每百万 token 为 9.00 美元,之后为 18.00 美元;Flash-Lite TTS 为 0.50 美元和 6.00 美元,之后为 12.00 美元。Batch 和 Flex 对 Flash TTS 的收费为 0.25 美元和 4.50 美元,而 Flash-Lite TTS 为 0.25 美元和 3.00 美元;Priority 则为 0.90 美元和 16.00 美元。Artificial Analysis 将标准费率换算为每百万字符 16.50 美元和 11.00 美元,这是排行榜的换算,而非 Google 的报价;在与按字符计费的模型进行比较时,应使用这个数字。
在{{1}}自有{{/1}}侧,根本不存在按字符的费率。成本是{{2}}GPU 小时{{/2}},乘以你在上述吞吐量下所需的任意小时数,再加上服务栈,再加上维持其运行的人员。{{3}}VoxCPM2{{/3}} 的优势在于,第一千小时的边际成本与第一小时相同——而它的劣势在于,第一小时的边际成本就是一块 GPU。
这就是为什么这个决定异常清晰:
• 低于一定用量时,API 会胜出,而且优势悬殊。你每小时音频只需支付个位数美元,而另一种方案是资本支出,并且 Google 的促销费率会让这一差距在 2027 年 1 月 1 日之前进一步扩大。
超过这一规模,在你已经拥有、且能持续跑满的硬件上,Apache 2.0 检查点会以压倒性优势胜出——而且与研究许可的检查点不同,许可证里没有任何条款会阻止你将其交付使用。
• 介于两者之间,诚实的答案是:你买的是可选择性,而不是节省。自托管带来的是锁定某个版本、把音频保留在自己的基础设施上,以及不再关心供应商费率变化的能力。
在每一个都是正确答案的情况下
当你想要文档更完善的产品时,选择 Gemini 3.8 Flash TTS。它拥有独立评分、公开定价、单次调用即可实现双人对话、语音设计与复刻,并且除 API 密钥外没有任何运维面。它的同门 Flash-Lite TTS 在同一接口内提供了第二个价格档位,标准化价格为每百万字符 $11.00。作为交换,你需要接受的是:费率将于 2027 年 1 月 1 日翻倍,并且无法在任何地方自行运行该模型。
当运维本身才是重点时,就选 VoxCPM2。Apache 2.0 意味着商业使用被直接允许,2B 的体量意味着单张加速卡就够用,而在 Nano-VLLM 下 0.13 的实时因子意味着,一张不算高端的卡每过一小时挂钟时间就能产出数小时音频。你要接受的是:没有人会替你跑它——没有托管端点,没有 arena 榜单条目,没有厂商价目表,你得到的每一项质量保证,都得靠你自己去构建和测量。

OrcaRouter 并不托管这两个模型,这一点值得直说,而不是含糊其辞地暗示相反的情况。调用 Gemini 3.8 Flash TTS 的地方是 Google 自家的 API 以及 Google 指定的那些入口;VoxCPM2 则是一个需要你自己部署的检查点。OrcaRouter 覆盖的是这一决策之上的一层——200 多个模型只需一个密钥,按供应商标价提供且不加价,因此供应商调价当天我们这边就会同步生效,而不必等到下个计费周期;自动故障转移让处于评估中的模型不必成为生产依赖;还有一个路由 DSL,当单一模型无法承担整项工作时,可将多个模型组合成一次调用。
接下来看什么
有两件事会实质性改变这一对比,而这两件事都尚未发生。
第一个是有人托管 VoxCPM2。它缺席推理市场,正是这两个模型被拿来从经济性而非质量角度比较的主要原因——如果有服务商接手,租用与自有的算术就不再是决定性因素,而那块缺失的竞技场榜单条目反倒成了你希望被补上的一行。
第二点是谷歌方面一月份的费率调整。在促销费率下,API 足够便宜,大多数工作负载都不该再自行托管任何东西;而在促销结束后的费率下,差距缩小到这种地步:拥有现成 GPU 容量且业务量稳定的团队,应该重新算一算账,而不是想当然地认为 API 仍然更划算。
在那其中某一项发生变化之前,决定性的输入并非排行榜。而是你每月制作多少小时的音频,以及声卡是否忙碌。
