
GPT-Live-1 vs Inworld Realtime TTS-2:语音的价格战,聆听的溢价
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Inworld Realtime TTS-2 正式全面可用,带来了语音市场一直缺失的东西:一份公开的价目表。旗舰模型按需计费为每百万字符 25 美元,其速度更快的兄弟型号 Inworld Realtime TTS-2 Flash 为 15 美元,两者还随用量阶梯分别降至 12.50 美元和 7 美元。它在 Artificial Analysis 的语音竞技场中以 Elo 1,244 位列第二,这使得旗舰模型的价格约为当前竞技场榜首的一半,也是购买前五名语音最便宜的方式之一。GPT-Live-1 是本次对比中的另一款模型,主张恰恰相反——每分钟语音 0.05 美元,不涉及字符,而且想买它,就无法不连带买下随之而来的聆听、轮流发言和打断处理功能。
比较它们的有趣之处在于,价格差距看起来大得惊人,随后却基本消失了。合成正处于价格战中。对话则不是。
Inworld 究竟交付了什么
TTS-2 系列最初于 2026 年 5 月以研究预览的形式亮相,并提出了一个明确的说法:这是一种并非孤立生成语音的模型。它把对话的前几轮作为音频输入,对语气和节奏进行推理,并据此调整自己的回应方式。这一定位——对话感知,而非更清晰的音频——正是它区别于那些在 2025 年一直主导文本转语音的旁白引擎之处。
正式可用(GA)让这个预览版发展成了一个系列,并附上了一份价格表。Flash 是主打吞吐量的选择,Inworld 称其服务端首字节时间在第 90 百分位约为 20 毫秒,而旗舰型号为 100 毫秒,首个音频的中位延迟低于 200 毫秒。这些都是 Inworld 自家文档中的厂商数据;目前流传的唯一一项第三方测量来自 Coval,其给出的 Flash 约为 25 毫秒,旗舰型号则在 100 毫秒出头。两者都未经端到端的独立审计。
最值得注意的功能与延迟毫无关系。Inworld 增加了一种逐字模式,使订单号、确认码、地址和序列号被逐字符读回,而不是被规范成听起来自然但实则错误的内容。对于刚刚完成预订的语音智能体来说,这一个标签就是能正常工作的产品与会被升级给人工处理的演示之间的区别。

逐个维度
• 类型——GPT-Live-1:在单一模型中实现全双工语音到语音,对比 Inworld Realtime TTS-2:一个文本转语音模型,其双工能力需通过 Inworld 的 Realtime API 单独获取
• 价格单位 — GPT-Live-1:每语音分钟 $0.05,按秒计费,推理后端单独计量;对比 Inworld Realtime TTS-2:按需每百万字符 $25,Creator 套餐 $20,最高档 $12.50,而 Flash 为 $15、$10 和 $7
• 独立质量——GPT-Live-1:在 Speech to Speech Index 上得分 70.3%,在十四个模型中并列第六,对比 Inworld Realtime TTS-2:基于 1,091 个样本的 Elo 为 1,244,在 Artificial Analysis Provider Voice arena 中排名第二,而 Flash 基于 1,626 个样本的 Elo 为 1,211,排名第六
• 打断 — GPT-Live-1:原生能力,由模型内部每秒多次决策,而 Inworld Realtime TTS-2:并非 TTS 模型的属性;Inworld 的 Realtime API 支持打断,中断延迟约为 100 毫秒,通过一个采用 OpenAI Realtime 协议的单一套接字实现
• 延迟 — GPT-Live-1:在 OpenAI 自身的测试中,轮流对话延迟为 0.798 秒,未公布首音频时间;而 Inworld Realtime TTS-2:服务器端第 90 百分位为 100 毫秒,Flash 为 20 毫秒,在整个 Realtime API 流水线中,首个音频块的中位延迟低于一秒
• 语言 — GPT-Live-1:主流语言表现良好,超出这些语言范围则参差不齐;对比 Inworld Realtime TTS-2:支持 200 多个地区语言,其中 15 个达到 Tier 1 质量,另有 79 个达到 Tier 2,且在所有语言中保持同一音色身份
• 语音与克隆 — GPT-Live-1:十二种预设,不支持克隆;对比 Inworld Realtime TTS-2:282 种内置语音,可从 5 至 15 秒的授权音频进行即时零样本克隆,专业克隆与完整演绎控制仅在旗舰版上提供
• 部署 — GPT-Live-1:仅托管,单一端点,无免费层级,并发上限为 25 到 500 个会话;对比 Inworld Realtime TTS-2:托管 API,外加需要 H100 的受限本地部署容器,以及一个免费按需层级,包含最多约 70 分钟的合成

双工问题,精准解答
把这番对比写成“一个只听,另一个只会说”会很容易,但错得要紧。Inworld 的文本转语音模型是文本输入、音频输出。但 Inworld 还售卖一套 Realtime API,它通过单条 WebSocket、WebRTC 或 SIP 连接运行,并且按开发者真正在意的那种意义实现全双工:它采用语义语音活动检测,并带有可调节的 eagerness 设置,支持手动轮次控制,并且能在被打断时以大约 100 毫秒中断。它在协议上与 OpenAI Realtime 接口兼容,因此迁移只是配置工作,而不是重写。
Inworld 的 Realtime API 不是原生语音到语音模型。它是一个级联系统——一个可替换的语音识别模型、一个由你选择的语言模型,以及一个合成器——在一个连接内协同编排。这是一个合理的架构选择,也是大多数生产级语音智能体所做的同一种选择。它只是与 GPT-Live-1 不同,后者由单个模型决定何时让出对话轮次。
实际差异在调用方于从句中途打断时才会显现。在级联架构中,打断会被检测到,生成会被取消,随后新一轮开始——这一流程运行良好,但会消耗一次往返。在端到端模型中,决策本就在持续做出。前者是一个快速响应的系统。后者是一个从未停止倾听的系统。

算一算数字,因为单位掩盖了答案
语音速度大约为每分钟 150 个单词,而英语平均每个单词约五个半字符,因此一分钟的语音输出大约为 800 到 900 个字符。按每百万 25 美元计算,Inworld Realtime TTS-2 生成一分钟语音大约花费两美分。按 Flash 的 15 美元计算,则不到 1.5 美分。
与 GPT-Live-1 每分钟语音 0.05 美元相比,这看起来像是一场碾压——直到你把 GPT-Live-1 正在做的其余事情也算了价。Inworld 的 Realtime API 仍然需要语音识别和语言模型,两者分别计费,而且各自都带来自己的延迟。把这些算进去,对于任何涉及真实提问的通话,级联方案的每分钟成本都会超过五美分。端到端模型的溢价并不是为语音付的。它是为话轮转换付的,而且大致相当于你不再购买的那个语音识别阶段的成本。
级联方案取得决定性优势的地方,是无需对话的高话务量场景。通知外呼、送达确认、预约提醒、脚本化IVR——凡是通话开始前文本内容就已确定、且没有人会打断的场合。在这些场景下,每百万字符7到15美元的按字符计价就是比按分钟计费的双工更便宜,而为根本用不到的轮流对话付费纯属浪费。
还有一种被双模型框架所掩盖的中间路径。如果你无论如何都要搭建级联架构,语音层也不必来自专门的语音供应商:OpenAI 自家的 TTS 模型和 Google 的 Gemini TTS 预览版模型都是普通的 API 端点,而且都被纳入了路由。来自十一家上游提供商的约 190 个模型只需一把 OrcaRouter 密钥即可调用,按提供商标价、零加价——因此合成模型可以与其所服务的推理模型共处同一目录、共用同一把密钥和同一份账单,并且当某个端点在部署中途性能下降时可自动故障转移。这是语音技术栈中最不起眼的一环,也是最容易整合的一环。Inworld 的 Realtime TTS-2 和 GPT-Live-1 的 Live Sessions 端点都无法以这种方式获取;这两者属于各自的厂商。
该选哪一个
如果音量是关键、对话是照本宣科的,那就选择 Inworld Realtime TTS-2。高吞吐量的智能体、通知、需要支持 200 个语言区域并保持单一音色身份的多语言产品,或者任何需要本地部署容器的部署场景,都适用。你能以大约只有领头者一半的价格获得竞技场排名前二的语音,还有可用于原型开发的免费套餐,以及 GPT-Live-1 完全没有提供的声音克隆,还有一个 Realtime API,它能在你可能已经在用的级联模式中妥善处理打断。
如果打断本身就是产品,就选 GPT-Live-1。那些偏离脚本的通话、抢在智能体说话时插话的来电者,以及轮流发言决定了一场交流是一场对话还是一份菜单的工作流。你支付的每分钟费率不会随着语音变便宜而下降,你放弃了声音克隆和 200 种语言,买回的是那些接缝。
语音合成领域的价格战真实存在,这对任何构建语音代理的人来说都是好消息——如今排名前五的语音,成本只有十八个月前的五分之一。只是这并不能化解这一比较,因为 GPT-Live-1 收费的东西,并不是 Inworld 正在打折的东西。
