Титульная карточка для «GPT-Live-1 vs Inworld Realtime TTS-2» с подзаголовком «Синтез дешевеет; слушание по-прежнему дорого», несущая три карточки с текстом: «Inworld Realtime TTS-2: $25 за 1 млн символов, со снижением до $12.50», «Inworld Realtime TTS-2 Flash: $15 за 1 млн символов, со снижением до $7», «GPT-Live-1: $0.05 за минуту голоса, плюс обоснование, стоящее за этим», — над нижней полосой с текстом «Цены Inworld опубликованы вендором, сентябрь 2026; цены GPT-Live-1 — согласно документации OpenAI». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

GPT-Live-1 против Inworld Realtime TTS-2: ценовая война за голоса, премиум за прослушивание

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Inworld Realtime TTS-2 стал общедоступным вместе с тем, чего не хватало рынку голосовых технологий: опубликованным прайс-листом. Флагманская модель стоит $25 за миллион символов при оплате по требованию, её более быстрый собрат Inworld Realtime TTS-2 Flash — $15, и обе ступенчато дешевеют по мере роста объёма — до $12,50 и $7. Занимая 1244 балла Elo и второе место в речевой арене Artificial Analysis, флагман оказывается примерно вдвое дешевле текущего лидера арены и одним из самых дешёвых способов купить голос из топ-5. GPT-Live-1 — другая модель в этом сравнении и противоположное предложение: $0,05 за минуту голоса, никаких символов, и его нельзя купить, не купив заодно слушание, передачу слова и обработку перебиваний, которые идут в комплекте.

Самое интересное в их сравнении — это то, что ценовой разрыв кажется огромным, а затем по большей части исчезает. Синтез находится в ценовой войне. Разговор — нет.

Что Inworld на самом деле выпустила

Линейка TTS-2 началась как исследовательский предпросмотр в мае 2026 года с конкретного утверждения: это модель, которая не генерирует речь изолированно. Она принимает предыдущие реплики разговора в качестве аудиовхода, анализирует тон и темп и корректирует то, как отвечает. Именно эта позиция — осведомлённость о разговоре, а не более чистый звук, — отличала её от движков озвучивания, доминировавших в сфере синтеза речи на протяжении 2025 года.

Общая доступность превратила предварительную версию в семейство и приложила к нему прайс-лист. Flash — это ставка на пропускную способность: Inworld заявляет около 20 миллисекунд серверного времени до первого байта на 90-м процентиле против 100 миллисекунд у флагманской модели и медиану менее 200 миллисекунд до первого аудио. Это вендорские цифры из собственной документации Inworld; единственное стороннее измерение, имеющее хождение, от Coval, оценивает Flash примерно в 25 миллисекунд, а флагманскую модель — в первые сотни. Ни одно из них не прошло независимый сквозной аудит.

Самая примечательная функция не имеет никакого отношения к задержке. Inworld добавила режим дословного воспроизведения, чтобы номера заказов, коды подтверждения, адреса и серийные номера зачитывались посимвольно, а не нормализовались во что-то, что звучит естественно, но неверно. Для голосового агента, только что принявшего бронирование, этот единственный тег — разница между работающим продуктом и демо, которое передают живому оператору.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Измерение за измерением

• Тип — GPT-Live-1: полнодуплексное преобразование речи в речь в одной модели, тогда как Inworld Realtime TTS-2 — это модель преобразования текста в речь, а дуплекс доступен отдельно через Realtime API от Inworld

• Единица тарификации — GPT-Live-1: $0.05 за голосовую минуту с посекундной оплатой, бэкенд reasoning тарифицируется отдельно, против Inworld Realtime TTS-2: $25 за миллион символов по требованию, $20 на тарифе Creator и $12.50 на топовом тарифе, при этом Flash — $15, $10 и $7

• Независимое качество — GPT-Live-1: 70,3% в Speech to Speech Index, делит шестое место среди четырнадцати против Inworld Realtime TTS-2: Elo 1 244 из 1 091 образца и второе место на Artificial Analysis Provider Voice arena, а Flash — с Elo 1 211 из 1 626 образцов и на шестом месте

• Прерывание — GPT-Live-1: нативное, решение принимается внутри модели много раз в секунду, тогда как Inworld Realtime TTS-2: это не свойство TTS-модели; Realtime API Inworld поддерживает перебивание с задержкой прерывания примерно 100 миллисекунд через один сокет, работающий по протоколу Open​AI Realtime

• Задержка — GPT-Live-1: 0,798 секунды задержки смены реплики в собственных тестах OpenAI, время до первого аудио не опубликовано, против Inworld Realtime TTS-2: 100 миллисекунд на стороне сервера на 90-м процентиле, Flash — 20, при медианном значении менее одной секунды до первого аудиофрагмента по всему конвейеру Realtime API.

• Языки — GPT-Live-1: основные языки хорошо поддерживаются, за их пределами — неравномерно, в сравнении с Inworld Realtime TTS-2: более 200 локалей, из которых 15 — качества уровня 1, ещё 79 — уровня 2, и одна голосовая идентичность сохраняется во всех них

• Голоса и клонирование — GPT-Live-1: двенадцать предустановок, без клонирования против Inworld Realtime TTS-2: 282 встроенных голоса, мгновенное zero-shot-клонирование на основе 5–15 секунд авторизованного аудио, профессиональное клонирование и полное управление подачей только на флагмане

• Развёртывание — GPT-Live-1: только облачный хостинг, одна конечная точка, нет бесплатного тарифа, параллелизм ограничен 25–500 сессиями, в отличие от Inworld Realtime TTS-2: облачный API плюс локальный контейнер с ограниченным доступом, требующий H100, и бесплатный тариф по требованию, включающий до примерно 70 минут синтеза

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Точный ответ на вопрос о дуплексе

Было бы легко описать это сравнение как «один слушает, другой только говорит», и это было бы неправильно, причём эта ошибка была бы существенной. Модели преобразования текста в речь от Inworld работают по схеме «текст на входе — аудио на выходе». Но Inworld также продаёт Realtime API, который работает через одно соединение WebSocket, WebRTC или SIP и является полнодуплексным в том смысле, который важен разработчику: он использует семантическое обнаружение голосовой активности с настраиваемым параметром eagerness, поддерживает ручное управление сменой реплик и прерывает при перебивании примерно за 100 миллисекунд. Он протокольно совместим с интерфейсом OpenAI Realtime, что делает миграцию вопросом настройки, а не переписывания.

Чем Inworld Realtime API не является, так это нативной моделью speech-to-speech. Это каскад — сменная модель распознавания речи, языковая модель на ваш выбор и синтезатор, — оркестрируемый в рамках одного соединения. Это вполне законный архитектурный выбор, и именно его делают большинство продакшен-голосовых агентов. Он просто отличается от GPT-Live-1, где одна модель решает, когда уступить ход.

Практическая разница проявляется, когда звонящий перебивает на середине фразы. В каскадной схеме прерывание обнаруживается, генерация отменяется и начинается новый ход — последовательность, которая хорошо работает и стоит вам одного кругового обмена. В сквозной модели решение уже принималось непрерывно. Первое — это система, которая быстро реагирует. Второе — это система, которая никогда не переставала слушать.

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

Считаю цифры, потому что единицы измерения скрывают ответ

Речь звучит со скоростью примерно 150 слов в минуту, а в английском в среднем около пяти с половиной символов на слово, поэтому минута произнесённого текста — это примерно 800–900 символов. При цене $25 за миллион Inworld Realtime TTS-2 создаёт минуту речи примерно за два цента. При цене Flash в $15 это меньше полутора центов.

На фоне $0,05 за голосовую минуту у GPT-Live-1 это выглядит как разгром — пока не оценишь всё остальное, что делает GPT-Live-1. Realtime API от Inworld по-прежнему требует распознавания речи и языковой модели, причём и то и другое тарифицируется отдельно и добавляет собственную задержку. Если включить их в расчёт, стоимость минуты в каскадной схеме превысит пять центов для любого вызова, в котором есть настоящий вопрос. Надбавка за сквозную модель — не за голос. Она — за смену реплик, и она примерно равна стоимости этапа распознавания речи, который вы больше не покупаете.

Там, где каскад выигрывает decisively, — это объём без разговора. Уведомительные звонки, подтверждения доставки, напоминания о записи, сценарный IVR — всё, где текст известен до начала звонка и никто не собирается перебивать. Там посимвольная тарификация от 7 до 15 долларов за миллион просто дешевле, чем поминутный дуплекс, а платить за смену реплик, которой вы никогда не пользуетесь, — это трата.

Существует также средний путь, который скрывает двухмодельная схема. Если вы всё равно собираете каскад, речевой слой не обязательно должен поступать от специализированного голосового поставщика: собственные TTS-модели OpenAI и предварительные модели Gemini TTS от Google — это обычные конечные точки API, и они маршрутизируются. Около 190 моделей от одиннадцати вышестоящих провайдеров находятся за одним ключом OrcaRouter по каталожной цене провайдера без наценки — так что модель синтеза может находиться в том же каталоге, на том же ключе и в том же счёте, что и модель рассуждений, которую она питает, с автоматическим переключением при сбое, если одна конечная точка деградирует в середине развёртывания. Это самый неприглядный этап голосового стека и самый простой для консолидации. Ни Realtime TTS-2 от Inworld, ни конечная точка Live Sessions от GPT-Live-1 не доступны таким образом; эти две принадлежат своим поставщикам.

Какой выбрать?

Выбирайте Inworld Realtime TTS-2, если объём — это главное, а разговор идёт по сценарию. Высоконагруженные агенты, уведомления, многоязычные продукты, где важны 200 локалей и одна сохранённая идентичность голоса, или любое развёртывание, которому нужен локальный контейнер. Вы получаете голос из топ-2 арены примерно за половину цены лидера, бесплатный тариф для прототипирования, клонирование, которого GPT-Live-1 вообще не предлагает, и Realtime API, которое уверенно обрабатывает перебивания в каскадной схеме, которую вы, вероятно, уже используете.

Выбирайте GPT-Live-1, если прерывание — это и есть продукт. Звонки, которые идут не по сценарию, абоненты, которые перебивают агента, рабочие процессы, где очерёдность реплик — это разница между разговором и меню. Вы платите поминутный тариф, который не снижается, когда речь дешевеет, вы отказываетесь от клонирования и 200 языков и выкупаете обратно стыки.

Ценовая война в синтезе речи реальна, и это хорошая новость для всех, кто создаёт голосового агента: голос из топ-5 теперь стоит пятую часть того, сколько он стоил восемнадцать месяцев назад. Но это вовсе не разрешает данное сравнение, потому что то, за что взимает плату GPT-Live-1, — не то, на что Inworld даёт скидку.