
Inworld Realtime TTS-2 对比 Cartesia Sonic 3.6:倾听之声对决竞技场之王
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
关于合成语音为何会让人感觉像真人,目前有两种相互竞争的理论,而眼下这两种理论各自最出色的商业产品分别是Inworld Realtime TTS-2与Cartesia Sonic 3.6。Cartesia 的理论是,人性存在于音频之中:只要把音色、韵律和节奏都做得与真人无法区分,听众就会把你排在第一位——这正是 Sonic 3.6 在 8 月做到的,它以 Elo 1,282 分跃升至 Artificial Analysis 的 Provider Voice 竞技场榜首。Inworld 的理论则是,人性存在于聆听之中:TTS-2 会根据此前对话的真实音频来调整自己的表达,因此它不仅听起来像人,回应起来也像人。本周,这两种理论在排行榜上正面相撞:正是同一轮重新评分,让 Inworld Realtime TTS-2 以 Elo 1,252 分位列 Provider 榜第二,也让它以 1,123 分对 Sonic 3.6 的 1,119 分,登上了 Controlled Voice 竞技场的榜首——而这一榜单此前正由 Cartesia 领跑。一个模型守住了 Provider 榜的桂冠,另一个则刚刚夺下受控语音竞技场的头名。
这并非一场某一方明显占理的较量。两款模型是为重叠但并非完全相同的任务而打造的,价格差异——Sonic 3.6 每百万字符收费 49.0 美元,而 Inworld Realtime TTS-2 按需使用收费 25 美元——确实不容忽视,因此决策既要考虑预算,也要考虑质量。
两种关于听起来像人声的理论
Cartesia 在 2026 年 8 月悄然发布了 Sonic 3.6,这是一个点版本,在 Sonic 3.5 的基础上有所改进,但价格和架构叙事均未改变。改进出现在 Cartesia 需要的地方:该模型在 Artificial Analysis 的 Provider Voice 竞技场中跃升至 Elo 1,282——该竞技场中每个模型都使用自己的原生语音——并在整个 8 月保持 Controlled Voice 竞技场的榜首。在受控榜单上,每个模型都被克隆到相同的八位参考发音人身上,因此这一桂冠是对合成引擎本身的评判,与语音人才无关。本周 Inworld 正式发布并重新评分后,Cartesia 仍然领跑 Provider 榜单,但 Sonic 3.6 现在以 Elo 1,119 位居受控榜单第二,落后于以 1,123 分排在首位的 Inworld Realtime TTS-2 仅 4 分。
Inworld Realtime TTS-2 走的是一条不同的路线。其前代产品线 TTS 1.5 在 2026 年初曾位居同类竞技榜单前列;TTS-2 的研究预览版于 6 月在供应商排行榜上测得 Elo 1209 分。自那以后,正式发布版(GA)模型的排名不断攀升:在目前的榜单上,它在 Provider Voice 榜以 1252 分位列第 2(仅次于 Sonic 3.6 的 1282 分),在 Controlled Voice 榜以 1123 分位列第 1。不过,这款旗舰模型真正的不同之处并不在于 Elo 分数,而在于它会把对话中此前几轮的发言作为音频输入,并以此决定下一句话的表达方式。Cartesia 根据文字记录来校准情感,Inworld 则倾听上一句话说出来时的语气。
记分牌,诚实标注
Elo分数来自Artificial Analysis的语音竞技场,读取自2026年9月的实时排行榜。延迟数据除非另有说明,均为供应商报告值,且两个模型均未发布独立的延迟审计。
• 独立质量——Cartesia Sonic 3.6:Elo 1,282(#1,提供商语音)和 1,119(#2,受控语音)对比 Inworld Realtime TTS-2:Elo 1,252(#2,提供商语音)和 1,123(#1,受控语音)
• 每100万字符价格 — 49.0美元(Artificial Analysis追踪)对比按需25美元;据Artificial Analysis追踪的混合价为20.8美元;批量购买(厂商)低至12.50美元。
• 首次音频时间——厂商声称低于90毫秒,而在Inworld的发布测试中(亦为厂商声称),中位数低于200毫秒、p99低于100毫秒;Inworld对标Sonic的低延迟方案是独立的TTS-2 Flash层级,首字节时间约为25毫秒。
• 语言 — 42种本地化语言,对比100+种用于交付引导的语言;而Inworld的“单一语音身份”宣称覆盖200+个区域(供应商口径)
即时语音克隆——约10秒音频(对比5–15秒);另有专业克隆测试版,使用约10分钟音频,可生成更高保真度的克隆声音。
• 语音表现控制 — 可通过内联文本标签(如 [laughter])、音量与语速调节实现,也可借助自然英文引导(如 “[calm, reassuring]” 或 [whisper])及请求级指令;另提供三种稳定性模式,从 Stable 到 Expressive。

为什么“倾听对话”是一个不同的维度
上面的评分板衡量的是声音在单独呈现时的听感如何。而这两个模型真正产生差异的维度,不会出现在任何排行榜上,因为它只存在于多轮交互之中。
Inworld Realtime TTS-2 专为“有人刚对它说了什么”的场景而构建。该模型会摄取先前轮次的音频——而不仅仅是文本记录——推断语气、节奏和情绪状态,并在开口之前选择一种回应状态。如果来电者感到沮丧,表达方式就会转变;如果他们很放松,表达方式又会转回来。这就是为什么 Inworld 将该模型面向智能体、伴侣和游戏进行营销,而不是用于旁白:这一功能在一次性文本转语音调用中毫无意义,而在对话中则很有意义。
Cartesia Sonic 3.6 的工作方式不同。它是一个快速、高质量的流式引擎,Cartesia 自己的说法是能够根据转录文本自动校准情绪——它会读取文字并相应地进行调制。它不会做的是聆听前几轮对话的音频。在单个话语内,两者听起来可能相似;但在整个对话过程中,Inworld 所建模的是 Sonic 并未尝试的事情。如果你的产品是单轮配音,那么这种建模就是多余的;如果它是一个实时智能体,那么它本身就是产品。

速度、价格以及 Flash 注意事项
就纯粹的延迟而言,{{1}}Cartesia一直占据着优势:{{/1}}{{2}}90毫秒以内的首音频时间虽然是厂商自己宣称的,{{/2}}{{3}}但这是该公司自Sonic 3代以来就一直保持的数字,{{/3}}{{4}}目前也没有人发布过与之相悖的审计结果。{{/4}}{{5}}Inworld旗舰产品的响应速度也处于类似的对话级别,在200毫秒以内,{{/5}}{{6}}这对实时智能体来说完全够用。{{/6}}{{7}}Inworld真正的延迟优势在于随GA模型一同发布的Flash层级——{{/7}}{{8}}这是一个独立的模型,首字节时间约为25毫秒,{{/8}}{{9}}面向的是高并发工作负载,{{/9}}{{10}}在这类场景下,Sonic级别的成本和延迟比表现力更为重要。{{/10}}{{11}}但需要注意的是,Flash是该系列中一个精简版成员:{{/11}}{{12}}支持即时克隆和内联非语言表达,{{/12}}{{13}}但不支持专业克隆,也没有完整的自然语言控制能力。{{/13}}
价格方面则完全是另一番景象。Sonic 3.6 每百万字符收费 49.0 美元——约为 Inworld 按需费率 25 美元的两倍,也接近最高档 12.50 美元的四倍。在两者都出现的排行榜上,它们之间的质量差距不足以让高批量买家接受这一价格倍数。对于每次对话生成数千字符的实时语音代理来说,按字符计的价差决定了单位经济是健康还是微薄。
该选哪个
• 选择 Cartesia Sonic 3.6——如果你想要的是该供应商排行榜的桂冠:它是这张榜单上使用自有原生语音的声音中得分最高的,Elo 1,282,适合助手回答、游戏台词和状态播报这类简短自足的语句。每百万字符 49 美元,你是在为这顶桂冠付费;而在这张榜单上,它依然是最值得被击败的标杆。
• 选择 Inworld Realtime TTS-2:如果产品属于多轮对话场景,语音输出需要回应另一端的人——客服电话、陪伴、面试、辅导课。它目前在受控排行榜上领先(榜单中每个模型都使用相同的八种参考语音),而且它在大约一半的价格下就能做到这一点,同时还能聆听对话的音频。
• 把切换逻辑构建到路由中,用在无法事先知道一次通话需要哪种语音的场景。截至撰写本文时,这两个模型都还没有接入 OrcaRouter——Sonic 可通过 Cartesia 自己的 API 及数个第三方平台访问,Inworld 则可通过自己的 API 访问——但路由层恰恰是一种能让对话从一种语音开始、并在需要时故障切换到另一种语音的结构;各提供商的标价会以 0% 加价原样透传。当其中一个这类榜单再次翻转时——本周它们确实翻转了——所谓的选择就变成了一次配置修改,而不是推倒重写。
简短版本
这是一个真正的分叉;最诚实的回答是,分叉的焦点在于话轮切换(turn-taking),而非音频质量。如果你需要的是使用自家原生语音、在独立语音评测中得分最高的产品,Cartesia Sonic 3.6 以 Elo 1,282 分居提供方之首,并为此按每百万字符 49 美元收费。如果你需要的是能察觉别人和它说话的方式、并据此作出回应的语音,Inworld Realtime TTS-2 本周以按需价格 25 美元正式发布(GA);它在双方使用相同语音正面交锋的受控排行榜上领先,还具备一项任何评测竞技场都无法完全衡量的对话感知特性。如今,计分榜已在这两款模型之间一分为二——对一个“最佳”取决于使用何种测试的市场来说,这是最诚实的图景。

