
GPT-Live-1 против Inworld Realtime TTS-2: ценовая война за голоса, премиум за прослушивание
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Inworld Realtime TTS-2 стал общедоступным вместе с тем, чего не хватало рынку голосовых технологий: опубликованным прайс-листом. Флагманская модель стоит $25 за миллион символов при оплате по требованию, её более быстрый собрат Inworld Realtime TTS-2 Flash — $15, и обе ступенчато дешевеют по мере роста объёма — до $12,50 и $7. Занимая 1244 балла Elo и второе место в речевой арене Artificial Analysis, флагман оказывается примерно вдвое дешевле текущего лидера арены и одним из самых дешёвых способов купить голос из топ-5. GPT-Live-1 — другая модель в этом сравнении и противоположное предложение: $0,05 за минуту голоса, никаких символов, и его нельзя купить, не купив заодно слушание, передачу слова и обработку перебиваний, которые идут в комплекте.
Самое интересное в их сравнении — это то, что ценовой разрыв кажется огромным, а затем по большей части исчезает. Синтез находится в ценовой войне. Разговор — нет.
Что Inworld на самом деле выпустила
Линейка TTS-2 началась как исследовательский предпросмотр в мае 2026 года с конкретного утверждения: это модель, которая не генерирует речь изолированно. Она принимает предыдущие реплики разговора в качестве аудиовхода, анализирует тон и темп и корректирует то, как отвечает. Именно эта позиция — осведомлённость о разговоре, а не более чистый звук, — отличала её от движков озвучивания, доминировавших в сфере синтеза речи на протяжении 2025 года.
Общая доступность превратила предварительную версию в семейство и приложила к нему прайс-лист. Flash — это ставка на пропускную способность: Inworld заявляет около 20 миллисекунд серверного времени до первого байта на 90-м процентиле против 100 миллисекунд у флагманской модели и медиану менее 200 миллисекунд до первого аудио. Это вендорские цифры из собственной документации Inworld; единственное стороннее измерение, имеющее хождение, от Coval, оценивает Flash примерно в 25 миллисекунд, а флагманскую модель — в первые сотни. Ни одно из них не прошло независимый сквозной аудит.
Самая примечательная функция не имеет никакого отношения к задержке. Inworld добавила режим дословного воспроизведения, чтобы номера заказов, коды подтверждения, адреса и серийные номера зачитывались посимвольно, а не нормализовались во что-то, что звучит естественно, но неверно. Для голосового агента, только что принявшего бронирование, этот единственный тег — разница между работающим продуктом и демо, которое передают живому оператору.

Измерение за измерением
• Тип — GPT-Live-1: полнодуплексное преобразование речи в речь в одной модели, тогда как Inworld Realtime TTS-2 — это модель преобразования текста в речь, а дуплекс доступен отдельно через Realtime API от Inworld
• Единица тарификации — GPT-Live-1: $0.05 за голосовую минуту с посекундной оплатой, бэкенд reasoning тарифицируется отдельно, против Inworld Realtime TTS-2: $25 за миллион символов по требованию, $20 на тарифе Creator и $12.50 на топовом тарифе, при этом Flash — $15, $10 и $7
• Независимое качество — GPT-Live-1: 70,3% в Speech to Speech Index, делит шестое место среди четырнадцати против Inworld Realtime TTS-2: Elo 1 244 из 1 091 образца и второе место на Artificial Analysis Provider Voice arena, а Flash — с Elo 1 211 из 1 626 образцов и на шестом месте
• Прерывание — GPT-Live-1: нативное, решение принимается внутри модели много раз в секунду, тогда как Inworld Realtime TTS-2: это не свойство TTS-модели; Realtime API Inworld поддерживает перебивание с задержкой прерывания примерно 100 миллисекунд через один сокет, работающий по протоколу OpenAI Realtime
• Задержка — GPT-Live-1: 0,798 секунды задержки смены реплики в собственных тестах OpenAI, время до первого аудио не опубликовано, против Inworld Realtime TTS-2: 100 миллисекунд на стороне сервера на 90-м процентиле, Flash — 20, при медианном значении менее одной секунды до первого аудиофрагмента по всему конвейеру Realtime API.
• Языки — GPT-Live-1: основные языки хорошо поддерживаются, за их пределами — неравномерно, в сравнении с Inworld Realtime TTS-2: более 200 локалей, из которых 15 — качества уровня 1, ещё 79 — уровня 2, и одна голосовая идентичность сохраняется во всех них
• Голоса и клонирование — GPT-Live-1: двенадцать предустановок, без клонирования против Inworld Realtime TTS-2: 282 встроенных голоса, мгновенное zero-shot-клонирование на основе 5–15 секунд авторизованного аудио, профессиональное клонирование и полное управление подачей только на флагмане
• Развёртывание — GPT-Live-1: только облачный хостинг, одна конечная точка, нет бесплатного тарифа, параллелизм ограничен 25–500 сессиями, в отличие от Inworld Realtime TTS-2: облачный API плюс локальный контейнер с ограниченным доступом, требующий H100, и бесплатный тариф по требованию, включающий до примерно 70 минут синтеза

Точный ответ на вопрос о дуплексе
Было бы легко описать это сравнение как «один слушает, другой только говорит», и это было бы неправильно, причём эта ошибка была бы существенной. Модели преобразования текста в речь от Inworld работают по схеме «текст на входе — аудио на выходе». Но Inworld также продаёт Realtime API, который работает через одно соединение WebSocket, WebRTC или SIP и является полнодуплексным в том смысле, который важен разработчику: он использует семантическое обнаружение голосовой активности с настраиваемым параметром eagerness, поддерживает ручное управление сменой реплик и прерывает при перебивании примерно за 100 миллисекунд. Он протокольно совместим с интерфейсом OpenAI Realtime, что делает миграцию вопросом настройки, а не переписывания.
Чем Inworld Realtime API не является, так это нативной моделью speech-to-speech. Это каскад — сменная модель распознавания речи, языковая модель на ваш выбор и синтезатор, — оркестрируемый в рамках одного соединения. Это вполне законный архитектурный выбор, и именно его делают большинство продакшен-голосовых агентов. Он просто отличается от GPT-Live-1, где одна модель решает, когда уступить ход.
Практическая разница проявляется, когда звонящий перебивает на середине фразы. В каскадной схеме прерывание обнаруживается, генерация отменяется и начинается новый ход — последовательность, которая хорошо работает и стоит вам одного кругового обмена. В сквозной модели решение уже принималось непрерывно. Первое — это система, которая быстро реагирует. Второе — это система, которая никогда не переставала слушать.

Считаю цифры, потому что единицы измерения скрывают ответ
Речь звучит со скоростью примерно 150 слов в минуту, а в английском в среднем около пяти с половиной символов на слово, поэтому минута произнесённого текста — это примерно 800–900 символов. При цене $25 за миллион Inworld Realtime TTS-2 создаёт минуту речи примерно за два цента. При цене Flash в $15 это меньше полутора центов.
На фоне $0,05 за голосовую минуту у GPT-Live-1 это выглядит как разгром — пока не оценишь всё остальное, что делает GPT-Live-1. Realtime API от Inworld по-прежнему требует распознавания речи и языковой модели, причём и то и другое тарифицируется отдельно и добавляет собственную задержку. Если включить их в расчёт, стоимость минуты в каскадной схеме превысит пять центов для любого вызова, в котором есть настоящий вопрос. Надбавка за сквозную модель — не за голос. Она — за смену реплик, и она примерно равна стоимости этапа распознавания речи, который вы больше не покупаете.
Там, где каскад выигрывает decisively, — это объём без разговора. Уведомительные звонки, подтверждения доставки, напоминания о записи, сценарный IVR — всё, где текст известен до начала звонка и никто не собирается перебивать. Там посимвольная тарификация от 7 до 15 долларов за миллион просто дешевле, чем поминутный дуплекс, а платить за смену реплик, которой вы никогда не пользуетесь, — это трата.
Существует также средний путь, который скрывает двухмодельная схема. Если вы всё равно собираете каскад, речевой слой не обязательно должен поступать от специализированного голосового поставщика: собственные TTS-модели OpenAI и предварительные модели Gemini TTS от Google — это обычные конечные точки API, и они маршрутизируются. Около 190 моделей от одиннадцати вышестоящих провайдеров находятся за одним ключом OrcaRouter по каталожной цене провайдера без наценки — так что модель синтеза может находиться в том же каталоге, на том же ключе и в том же счёте, что и модель рассуждений, которую она питает, с автоматическим переключением при сбое, если одна конечная точка деградирует в середине развёртывания. Это самый неприглядный этап голосового стека и самый простой для консолидации. Ни Realtime TTS-2 от Inworld, ни конечная точка Live Sessions от GPT-Live-1 не доступны таким образом; эти две принадлежат своим поставщикам.
Какой выбрать?
Выбирайте Inworld Realtime TTS-2, если объём — это главное, а разговор идёт по сценарию. Высоконагруженные агенты, уведомления, многоязычные продукты, где важны 200 локалей и одна сохранённая идентичность голоса, или любое развёртывание, которому нужен локальный контейнер. Вы получаете голос из топ-2 арены примерно за половину цены лидера, бесплатный тариф для прототипирования, клонирование, которого GPT-Live-1 вообще не предлагает, и Realtime API, которое уверенно обрабатывает перебивания в каскадной схеме, которую вы, вероятно, уже используете.
Выбирайте GPT-Live-1, если прерывание — это и есть продукт. Звонки, которые идут не по сценарию, абоненты, которые перебивают агента, рабочие процессы, где очерёдность реплик — это разница между разговором и меню. Вы платите поминутный тариф, который не снижается, когда речь дешевеет, вы отказываетесь от клонирования и 200 языков и выкупаете обратно стыки.
Ценовая война в синтезе речи реальна, и это хорошая новость для всех, кто создаёт голосового агента: голос из топ-5 теперь стоит пятую часть того, сколько он стоил восемнадцать месяцев назад. Но это вовсе не разрешает данное сравнение, потому что то, за что взимает плату GPT-Live-1, — не то, на что Inworld даёт скидку.
