一张主视觉标题卡,用于「Inworld Realtime TTS-2 VS Cartesia Sonic 3.6 —— 会倾听的声音 VS 竞技场之王」这一主题:左侧卡片为「Cartesia Sonic 3.6 —— 提供商第 1 名 · Elo 1,282 · $49 / 百万字符」,右侧卡片为「Inworld Realtime TTS-2 —— 受控第 1 名 · Elo 1,123 · $25 / 百万字符」;并配一枚统计徽章「双冠分属 —— 提供商 VS 受控竞技场」;右下角为 OrcaRouter 标志。
Guides & Insights

Inworld Realtime TTS-2 对比 Cartesia Sonic 3.6:倾听之声对决竞技场之王

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

关于合成语音为何会让人感觉像真人,目前有两种相互竞争的理论,而眼下这两种理论各自最出色的商业产品分别是Inworld Realtime TTS-2Cartesia Sonic 3.6。Cartesia 的理论是,人性存在于音频之中:只要把音色、韵律和节奏都做得与真人无法区分,听众就会把你排在第一位——这正是 Sonic 3.6 在 8 月做到的,它以 Elo 1,282 分跃升至 Artificial Analysis 的 Provider Voice 竞技场榜首。Inworld 的理论则是,人性存在于聆听之中:TTS-2 会根据此前对话的真实音频来调整自己的表达,因此它不仅听起来像人,回应起来也像人。本周,这两种理论在排行榜上正面相撞:正是同一轮重新评分,让 Inworld Realtime TTS-2 以 Elo 1,252 分位列 Provider 榜第二,也让它以 1,123 分对 Sonic 3.6 的 1,119 分,登上了 Controlled Voice 竞技场的榜首——而这一榜单此前正由 Cartesia 领跑。一个模型守住了 Provider 榜的桂冠,另一个则刚刚夺下受控语音竞技场的头名。

这并非一场某一方明显占理的较量。两款模型是为重叠但并非完全相同的任务而打造的,价格差异——Sonic 3.6 每百万字符收费 49.0 美元,而 Inworld Realtime TTS-2 按需使用收费 25 美元——确实不容忽视,因此决策既要考虑预算,也要考虑质量。

两种关于听起来像人声的理论

Cartesia 在 2026 年 8 月悄然发布了 Sonic 3.6,这是一个点版本,在 Sonic 3.5 的基础上有所改进,但价格和架构叙事均未改变。改进出现在 Cartesia 需要的地方:该模型在 Artificial Analysis 的 Provider Voice 竞技场中跃升至 Elo 1,282——该竞技场中每个模型都使用自己的原生语音——并在整个 8 月保持 Controlled Voice 竞技场的榜首。在受控榜单上,每个模型都被克隆到相同的八位参考发音人身上,因此这一桂冠是对合成引擎本身的评判,与语音人才无关。本周 Inworld 正式发布并重新评分后,Cartesia 仍然领跑 Provider 榜单,但 Sonic 3.6 现在以 Elo 1,119 位居受控榜单第二,落后于以 1,123 分排在首位的 Inworld Realtime TTS-2 仅 4 分。

Inworld Realtime TTS-2 走的是一条不同的路线。其前代产品线 TTS 1.5 在 2026 年初曾位居同类竞技榜单前列;TTS-2 的研究预览版于 6 月在供应商排行榜上测得 Elo 1209 分。自那以后,正式发布版(GA)模型的排名不断攀升:在目前的榜单上,它在 Provider Voice 榜以 1252 分位列第 2(仅次于 Sonic 3.6 的 1282 分),在 Controlled Voice 榜以 1123 分位列第 1。不过,这款旗舰模型真正的不同之处并不在于 Elo 分数,而在于它会把对话中此前几轮的发言作为音频输入,并以此决定下一句话的表达方式。Cartesia 根据文字记录来校准情感,Inworld 则倾听上一句话说出来时的语气。

记分牌,诚实标注

Elo分数来自Artificial Analysis的语音竞技场,读取自2026年9月的实时排行榜。延迟数据除非另有说明,均为供应商报告值,且两个模型均未发布独立的延迟审计。

• 独立质量——Cartesia Sonic 3.6:Elo 1,282(#1,提供商语音)和 1,119(#2,受控语音)对比 Inworld Realtime TTS-2:Elo 1,252(#2,提供商语音)和 1,123(#1,受控语音)

• 每100万字符价格 — 49.0美元(Artificial Analysis追踪)对比按需25美元;据Artificial Analysis追踪的混合价为20.8美元;批量购买(厂商)低至12.50美元。

• 首次音频时间——厂商声称低于90毫秒,而在Inworld的发布测试中(亦为厂商声称),中位数低于200毫秒、p99低于100毫秒;Inworld对标Sonic的低延迟方案是独立的TTS-2 Flash层级,首字节时间约为25毫秒。

• 语言 — 42种本地化语言,对比100+种用于交付引导的语言;而Inworld的“单一语音身份”宣称覆盖200+个区域(供应商口径)

即时语音克隆——约10秒音频(对比5–15秒);另有专业克隆测试版,使用约10分钟音频,可生成更高保真度的克隆声音。

• 语音表现控制 — 可通过内联文本标签(如 [laughter])、音量与语速调节实现,也可借助自然英文引导(如 “[calm, reassuring]” 或 [whisper])及请求级指令;另提供三种稳定性模式,从 Stable 到 Expressive。

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

为什么“倾听对话”是一个不同的维度

上面的评分板衡量的是声音在单独呈现时的听感如何。而这两个模型真正产生差异的维度,不会出现在任何排行榜上,因为它只存在于多轮交互之中。

Inworld Realtime TTS-2 专为“有人刚对它说了什么”的场景而构建。该模型会摄取先前轮次的音频——而不仅仅是文本记录——推断语气、节奏和情绪状态,并在开口之前选择一种回应状态。如果来电者感到沮丧,表达方式就会转变;如果他们很放松,表达方式又会转回来。这就是为什么 Inworld 将该模型面向智能体、伴侣和游戏进行营销,而不是用于旁白:这一功能在一次性文本转语音调用中毫无意义,而在对话中则很有意义。

Cartesia Sonic 3.6 的工作方式不同。它是一个快速、高质量的流式引擎,Cartesia 自己的说法是能够根据转录文本自动校准情绪——它会读取文字并相应地进行调制。它不会做的是聆听前几轮对话的音频。在单个话语内,两者听起来可能相似;但在整个对话过程中,Inworld 所建模的是 Sonic 并未尝试的事情。如果你的产品是单轮配音,那么这种建模就是多余的;如果它是一个实时智能体,那么它本身就是产品。

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

速度、价格以及 Flash 注意事项

就纯粹的延迟而言,{{1}}Cartesia一直占据着优势:{{/1}}{{2}}90毫秒以内的首音频时间虽然是厂商自己宣称的,{{/2}}{{3}}但这是该公司自Sonic 3代以来就一直保持的数字,{{/3}}{{4}}目前也没有人发布过与之相悖的审计结果。{{/4}}{{5}}Inworld旗舰产品的响应速度也处于类似的对话级别,在200毫秒以内,{{/5}}{{6}}这对实时智能体来说完全够用。{{/6}}{{7}}Inworld真正的延迟优势在于随GA模型一同发布的Flash层级——{{/7}}{{8}}这是一个独立的模型,首字节时间约为25毫秒,{{/8}}{{9}}面向的是高并发工作负载,{{/9}}{{10}}在这类场景下,Sonic级别的成本和延迟比表现力更为重要。{{/10}}{{11}}但需要注意的是,Flash是该系列中一个精简版成员:{{/11}}{{12}}支持即时克隆和内联非语言表达,{{/12}}{{13}}但不支持专业克隆,也没有完整的自然语言控制能力。{{/13}}

价格方面则完全是另一番景象。Sonic 3.6 每百万字符收费 49.0 美元——约为 Inworld 按需费率 25 美元的两倍,也接近最高档 12.50 美元的四倍。在两者都出现的排行榜上,它们之间的质量差距不足以让高批量买家接受这一价格倍数。对于每次对话生成数千字符的实时语音代理来说,按字符计的价差决定了单位经济是健康还是微薄。

该选哪个

选择 Cartesia Sonic 3.6——如果你想要的是该供应商排行榜的桂冠:它是这张榜单上使用自有原生语音的声音中得分最高的,Elo 1,282,适合助手回答、游戏台词和状态播报这类简短自足的语句。每百万字符 49 美元,你是在为这顶桂冠付费;而在这张榜单上,它依然是最值得被击败的标杆。

选择 Inworld Realtime TTS-2:如果产品属于多轮对话场景,语音输出需要回应另一端的人——客服电话、陪伴、面试、辅导课。它目前在受控排行榜上领先(榜单中每个模型都使用相同的八种参考语音),而且它在大约一半的价格下就能做到这一点,同时还能聆听对话的音频。

把切换逻辑构建到路由中,用在无法事先知道一次通话需要哪种语音的场景。截至撰写本文时,这两个模型都还没有接入 OrcaRouter——Sonic 可通过 Cartesia 自己的 API 及数个第三方平台访问,Inworld 则可通过自己的 API 访问——但路由层恰恰是一种能让对话从一种语音开始、并在需要时故障切换到另一种语音的结构;各提供商的标价会以 0% 加价原样透传。当其中一个这类榜单再次翻转时——本周它们确实翻转了——所谓的选择就变成了一次配置修改,而不是推倒重写。

简短版本

这是一个真正的分叉;最诚实的回答是,分叉的焦点在于话轮切换(turn-taking),而非音频质量。如果你需要的是使用自家原生语音、在独立语音评测中得分最高的产品,Cartesia Sonic 3.6 以 Elo 1,282 分居提供方之首,并为此按每百万字符 49 美元收费。如果你需要的是能察觉别人和它说话的方式、并据此作出回应的语音,Inworld Realtime TTS-2 本周以按需价格 25 美元正式发布(GA);它在双方使用相同语音正面交锋的受控排行榜上领先,还具备一项任何评测竞技场都无法完全衡量的对话感知特性。如今,计分榜已在这两款模型之间一分为二——对一个“最佳”取决于使用何种测试的市场来说,这是最诚实的图景。

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.