Карточка с главным заголовком для «Inworld Realtime TTS-2 против Cartesia Sonic 3.6 — голос, который слушает, против короля арен», с левой карточкой «Cartesia Sonic 3.6 — Провайдер №1 · Эло 1 282 · $49 / 1 млн символов» и правой карточкой «Inworld Realtime TTS-2 — Контролируемый №1 · Эло 1 123 · $25 / 1 млн символов», чипом статистики «Короны разделены — провайдерская и контролируемая арены» и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Inworld Realtime TTS-2 против Cartesia Sonic 3.6: Голос, который слушает, против Короля арен

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Существуют две конкурирующие теории о том, почему синтетический голос кажется человеческим, и сейчас два лучших коммерческих примера каждой из них — это Inworld Realtime TTS-2 и Cartesia Sonic 3.6. Теория Cartesia заключается в том, что человечность живёт в аудио: сделайте тембр, просодию и тайминг неотличимыми от человеческих — и слушатели поставят вас на первое место. Именно это Sonic 3.6 и сделал в августе, поднявшись на вершину арены Provider Voice от Artificial Analysis с Elo 1 282. Теория Inworld заключается в том, что человечность живёт в слушании: TTS-2 выстраивает подачу с учётом реального аудио предшествовавшего разговора, поэтому он не просто звучит как человек, а отвечает как человек. На этой неделе две теории столкнулись на табло: тот же пересчёт, который поставил Inworld Realtime TTS-2 на второе место в рейтинге провайдеров с Elo 1 252, также вывел его на первое место в арене Controlled Voice — рейтинге, который раньше возглавляла Cartesia, — с результатом 1 123 против 1 119 у Sonic 3.6. Одна модель удерживает корону среди провайдеров. Другая только что взяла верх в Controlled Voice.

Это не то противостояние, где одна сторона очевидно неправа. Обе модели создавались для пересекающихся, но не идентичных задач, и разница в цене — Sonic 3.6 за $49.0 за миллион символов против $25 по запросу у Inworld Realtime TTS-2 — вполне реальна, так что в решении есть и бюджетная составляющая, и составляющая качества.

Две теории человекоподобного голоса

В августе 2026 года Cartesia тихо выпустила Sonic 3.6 — точечный релиз, который улучшил Sonic 3.5, не изменив ни цену, ни архитектурную концепцию. Улучшение проявилось там, где Cartesia это было нужно: модель поднялась до Elo 1,282 на арене Provider Voice от Artificial Analysis — где каждая модель использует собственные нативные голоса, — и удерживала верхнюю строчку арены Controlled Voice весь август. На контролируемой таблице каждая модель клонируется на одни и те же восемь эталонных дикторов, так что эта корона — оценка самого движка синтеза, не зависящая от голосового таланта. После пересчёта результатов Inworld в связи с общедоступным релизом на этой неделе Cartesia по-прежнему лидирует в провайдерской таблице, но Sonic 3.6 теперь занимает #2 в контролируемой таблице с Elo 1,119, отставая на четыре очка от Inworld Realtime TTS-2 с 1,123.

Inworld Realtime TTS-2 происходит из другой традиции. Линейка-предшественница TTS 1.5 провела начало 2026 года у вершин тех же арен, а исследовательская предварительная версия TTS-2 в июне показала Elo 1 209 на доске провайдеров. С тех пор GA-модель поднялась: на текущих досках она занимает 1 252 в Provider Voice (#2, позади Sonic 3.6 с его 1 282) и 1 123 в Controlled Voice (#1). Однако настоящее отличие флагмана — не его Elo, а то, что модель принимает предыдущие реплики разговора как аудиовход и позволяет им влиять на подачу следующей реплики. Cartesia калибрует эмоции по транскрипту. Inworld прислушивается к тому, как была сказана последняя фраза.

Табло, честно подписанное

Показатели Эло взяты из речевых арен Artificial Analysis — данные сняты с живых таблиц в сентябре 2026 года. Показатели задержки приведены производителями, если не указано иное; независимый аудит задержек не публиковался ни для одной из моделей.

• Независимое качество — Cartesia Sonic 3.6: Elo 1,282 (#1, голос провайдера) и 1,119 (#2, контролируемый голос) против Inworld Realtime TTS-2: Elo 1,252 (#2, голос провайдера) и 1,123 (#1, контролируемый голос)

• Цена за 1 млн символов — $49.0 (по данным Artificial Analysis) против $25 по запросу, $20.8 — средневзвешенно по данным Artificial Analysis, и до $12.50 при больших объёмах (от вендора).

• Время до первого аудио — менее 90 мс (заявлено производителем) против медианы менее 200 мс и менее 100 мс на уровне p99 в запусковых тестах Inworld (заявлено производителем); низколатентный ответ Inworld на Sonic — отдельный тариф TTS-2 Flash со временем до первого байта около 25 мс.

<end_utterance>" — no, that's the end of the user turn. Hmm, but wait, in the message I see: "...(vendor-stated)" That's it? Then the instruction mentions "numbered span markers" but there are none in this particular text. But wait, actually, I need to re-read the complete user message. Let me paste: "• Languages — 42 localized vs 100+ languages for delivery steering, with Inworld's one-voice-identity claim extending to 200+ locales (vendor-stated)" Hmm, I should double-check if maybe there was supposed to be more content — like "here" links or {{1}} markers. The system prompt itself mentions keeping markers, but the actual user text may just not have any. Actually wait — look at the user message again. I see this at the beginning: "• Languages — 42 localized vs 100+ languages for delivery steering, with Inworld's one-voice-identity claim extending to 200+ locales (vendor-stated)" No markers. But earlier on in the full conversation I might be missing something. The user message as provided ends around there. Let me look at the message content one more time in full: "• Languages — 42 localized vs 100+ languages for delivery steering, with Inworld's one-voice-identity claim extending to 200+ locales (vendor-stated)" Yes, I'm fairly confident that's the entirety. So I need to translate this into Russian. The instruction says to keep markers byte-for-byte, but there are no markers. Also no {{KEEP}} spans. And no URLs or brand names except "Inworld" which is a product/company name. Let me translate: "• Languages — 42 localized vs 100+ languages for delivery steering, with Inworld's one-voice-identity claim extending to 200+ locales (vendor-stated)" Translation considerations: - "Languages" → "Языки" - "42 localized" → "42 локализованных" or "42 языка локализованы" - "100+ languages for delivery steering" → "100+ языков для управления доставкой" — "delivery steering" hmm. Could be "для маршрутизации доставки"? Context suggests this is about some gaming or content platform comparing localization options. "delivery steering" might mean steering the delivery of content. Perhaps "для управления поставкой/доставкой". - "Inworld's one-voice-identity claim" → "заявление Inworld об одном голосовом идентификаторе"? Actually "one-voice-identity" is a product concept — maintaining a single voice identity across languages. Could be "единая голосовая идентичность". - "extending to 200+ locales (vendor-stated)" → "распространяется на 200+ локалей (по заявлению вендора/производителя)". Let me craft a natural Russian sentence: "• Языки — 42 локализованных языка против 100+ языков для управления доставкой, при этом заявленная Inworld функция единой голосовой идентичности охватывает 200+ локалей (по заявлению вендора)" Hmm, "vendor-stated" at the end — meaning the 200+ locales figure is stated by the vendor. We can say "(по данным вендора)" or "(по заявлению вендора)". Let me think about what the context is. This looks like a comparison chart: "Languages — 42 localized vs 100+ languages for delivery steering, with Inworld's one-voice-identity claim extending to 200+ locales (vendor-stated)". So maybe it's comparing a product with 42 localized languages against something with 100+ languages for "delivery steering" (possibly steering content delivery, or steerable voices?). Actually in AI voice/localization context, "delivery steering" maybe means "choice of delivery" — perhaps "for delivery steering" = для выбора варианта доставки/воспроизведения? Alternatively "delivery" could mean "provision of speech", and "steering" = management. I'll translate as "управление доставкой/поставкой". Let me make the translation clear: "• Языки — 42 локализованных против 100+ языков для управления доставкой; заявленная Inworld функция единой голосовой идентичности распространяется на 200+ локалей (по заявлению вендора)" That reads well. Since there are no markers, I must simply output this translation with no preamble. Wait, but let me double-check: the instruction says "Output ONLY the translated text with its markers — no preamble, no quotes, no explanation." No markers to preserve here. Fine. Actually, hold on. Let me re-read the user message even more carefully to ensure I'm not missing hidden content like "here" and "here". The user content from my perspective: "• Languages — 42 localized vs 100+ languages for delivery steering, with Inworld's one-voice-identity claim extending to 200+ locales (vendor-stated)" Hmm, wait — further up in the prompt I see: "Similarly, robust multilingual support localization handling ... while also providing low-latency and private-cloud deployment" — no, that's not there either. I might be confusing with something else. Let me just parse token by token from the user turn: <user> • Languages — 42 localized vs 100+ languages for delivery steering, with Inworld's one-voice-identity claim extending to 200+ locales (vendor-stated) </user> OK so that's indeed all. Translation into Russian, keeping the bullet point: "• Языки — 42 локализованных против 100+ языков для управления доставкой, при этом заявленная Inworld функция единой голосовой идентичности распространяется на 200+ локалей (по заявлению вендора)" Hmm, a dash is used in the Russian as well. Let me refine: "• Языки: 42 локализованных языка против 100+ языков для управления доставкой; заявленная Inworld способность сохранять единую голосовую идентичность охватывает 200+ локалей (данные вендора)" I think simpler: "• Языки — 42 локализованных языка против 100+ языков для контроля доставки; заявление Inworld о единой голосовой идентичности распространяется на 200+ локалей (по заявлению вендора)." That's fine. Hmm, "for delivery steering" in a context of voice agents — possibly "steering" of a conversation, like steering/guding delivery of speech? Maybe this table is comparing platforms for AI voice agents. "Delivery steering" might be, e.g., "Steering delivery" = "управление произнесением/доставкой речи". But without more context, my Russian equivalent should be safe: "для управления доставкой" is a fine functional translation. Alternatively "для управления озвучиванием"? No — overcommitting. I'll go with "управление доставкой". Let me finalize translation: "• Языки — 42 локализованных языка против 100+ языков для управления доставкой; заявленная Inworld поддержка единой голосовой идентичности расширяется до 200+ локалей (по заявлению вендора)" Hmm wait, the English structure: "with Inworld's one-voice-identity claim extending to 200+ locales" — meaning Inworld's claim is that its one-voice-identity extends to 200+ locales. So: "при этом заявленная Inworld единая голосовая идентичность распространяется на 200+ локалей". Ok, let me finalize: "• Языки — 42 локализованных языка против 100+ языков для управления доставкой; заявленная Inworld единая голосовая идентичность охватывает 200+ локалей (по заявлению вендора)" Good. Since no markers, no brands except Inworld which is preserved. Numbers preserved. Output just this line.• Языки — 42 локализованных языка против 100+ языков для управления доставкой; заявленная Inworld единая голосовая идентичность охватывает 200+ локалей (по заявлению вендора)

• Мгновенное клонирование голоса — ~10 секунд аудио против 5–15 секунд, плюс бета-версия профессионального клонирования, требующая ~10 минут аудио для создания клонов более высокого качества.

• Управление доставкой — встроенные теги транскрипта, такие как [laughter], плюс модуляция громкости и скорости, а также управление на простом английском, например «[calm, reassuring]» или «[whisper]», инструкции на уровне запроса и три режима стабильности: от Stable до Expressive.

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

Почему «слушает разговор» — это другая ось

Табло выше показывает, как голос звучит в изоляции. Аспект, по которому эти две модели действительно расходятся, не отображается ни в одном рейтинге, потому что он проявляется только в рамках многоходового диалога.

Inworld Realtime TTS-2 создан для случая, когда человек только что что-то сказал ему. Модель обрабатывает аудио предыдущих реплик — не только их транскрипцию, — анализирует тон, темп и эмоциональное состояние и выбирает состояние ответа перед тем, как заговорить. Если звонящий раздражён, подача меняется; если он расслаблен, она возвращается в прежнее русло. Именно поэтому Inworld позиционирует модель для агентов, компаньонов и игр, а не для озвучивания: эта функция бессмысленна в разовом вызове «текст-в-аудио» и значима в разговоре.

Cartesia Sonic 3.6 работает иначе. Это быстрый высококачественный стриминговый движок, который, по собственному заявлению Cartesia, автоматически выполняет эмоциональную калибровку по транскрипту: читает слова и соответствующим образом модулирует звучание. При этом он не слушает аудио предыдущих реплик. В рамках одного высказывания оба движка могут звучать сопоставимо; в ходе диалога Inworld моделирует то, что Sonic не пытается делать. Если ваш продукт — одноразовая озвучка, такое моделирование — излишние затраты. Если же это агент реального времени, то моделирование и есть продукт.

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

Скорость, цена и предостережение о Flash

По чистой задержке пальма первенства у Cartesia: время до первого аудио менее 90 мс — это заявленная вендором цифра, но компания поставляет именно её начиная с поколения Sonic 3, и никто не публиковал опровергающий аудит. Флагман Inworld отвечает в том же разговорном классе с задержкой менее 200 мс, что вполне подходит для живых агентов. Настоящая низколатентная фишка Inworld — это уровень Flash, выпущенный вместе с моделью GA: отдельная модель с временем до первого байта около 25 мс, предназначенная для высоконагруженных сценариев, где стоимость и задержка класса Sonic важнее выразительности. Нюанс в том, что Flash — урезанный член семейства: есть мгновенное клонирование и встроенные невербальные звуки, но нет профессионального клонирования и полноценного управления на естественном языке.

А вот по цене всё наоборот. Sonic 3.6 стоит $49.0 за миллион символов — примерно вдвое больше ставки Inworld в $25 по требованию и почти в четыре раза больше максимального тарифа в $12.50. Разница в качестве между ними — на лидербордах, где представлены оба, — не оправдывает такой кратности для покупателя с большими объёмами. Для голосового агента реального времени, генерирующего тысячи символов за один разговор, разница в цене за символ — это разница между здоровой юнит-экономикой и тощей.

Что выбрать

Выбирайте Cartesia Sonic 3.6, если вам нужна корона в таблице провайдеров — это самый высокорейтинговый голос на собственных нативных голосах, Elo 1,282, для коротких самодостаточных высказываний вроде ответов ассистента, игровых реплик и озвучивания статуса. Цена 49 долларов за миллион символов — плата за эту корону, и именно его предстоит превзойти в этой категории.

Выберите Inworld Realtime TTS-2, если продукт — это многоходовой диалог, где речь должна реагировать на собеседника: звонки в поддержку, компаньон, интервью, репетиторство. Теперь он лидирует в контрольном тесте, где каждая модель произносит одни и те же восемь эталонных голосов, и делает это примерно вдвое дешевле, слушая аудио разговора.

Встройте переключатель в маршрутизацию, если заранее невозможно узнать, какой именно голос потребуется звонку. На момент написания ни одна из этих моделей не представлена на OrcaRouter: Sonic доступен через собственный API Cartesia и несколько сторонних платформ, Inworld — через собственный API. Но слой маршрутизации как раз и позволяет разговору начаться на одном голосе, а при сбое переключиться на другой; при этом заявленная цена каждого провайдера передаётся с нулевой наценкой. Когда один из этих игроков снова изменит курс — а на этой неделе так и было, — выбор превратится в изменение конфигурации, а не в переписывание кода.

Краткая версия

Это настоящая развилка, и честный ответ — различие касается управления репликами, а не качества звука. Если вам нужен максимально высоко оценённый автономный голос на собственных нативных голосах, Cartesia Sonic 3.6 удерживает корону среди провайдеров с Elo 1 282 и берёт за это $49 за миллион символов. Если вам нужен голос, который реагирует на то, как с ним говорят, Inworld Realtime TTS-2 на этой неделе вышел в общий доступ по цене $25 по запросу, лидирует в контролируемом рейтинге, где обе модели сравниваются на равных голосах, и обладает функцией понимания контекста беседы, которую ни один арена-тест полностью не измеряет. Таблицы лидеров теперь разделены между двумя моделями — это максимально честная картина рынка, где «лучший» зависит от теста.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.