
GPT-Live-1 против Cartesia Sonic 3.6: TTS-лидерборд номер один не измеряет перебивание
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Cartesia Sonic 3.6 в настоящее время лидирует в обеих аренах синтеза речи Artificial Analysis — 1275 Elo в таблице Provider Voice и первое место также в таблице Controlled Voice, опережая все коммерческие движки, за которыми стоит более крупная платформа. GPT-Live-1 не представлен ни в одном из них, потому что это не модель синтеза речи. Он делит шестое место из четырнадцати в другом рейтинге Artificial Analysis — Speech to Speech Index — с показателем 70,3%. Взятые вместе, эти два факта описывают реальное различие между этими продуктами: Sonic 3.6, весьма вероятно, обладает лучшим голосом, а GPT-Live-1 — единственный из двух, кто может слышать, когда звонящий начинает говорить и когда замолкает.
Оба уже работают и оба коммерчески доступны — Sonic 3.6 в собственном API Cartesia с момента выхода его стабильного снапшота 27 августа 2026 года, GPT-Live-1 в API OpenAI для разработчиков с 10 сентября 2026 года, по цене $0,05 за голосовую минуту. Выбор между ними — не решение о качестве. Это решение о том, какую половину голосового агента вы покупаете.
Две арены, два вопроса и почему раскол реален
Artificial Analysis ведёт свои речевые рейтинги так, что в этом стоит разобраться, прежде чем вам начнут цитировать любой из Elo. Арена Provider Voice ранжирует движки, используя собственные нативные голоса каждого вендора, — она измеряет голос, который вы реально получаете «из коробки», а это тот показатель, который важен покупателю. Арена Controlled Voice клонирует каждую модель на одни и те же восемь эталонных голосов, чтобы слушатели сравнивали сам движок синтеза, а не голосовой талант. Sonic 3.6 лидирует в обеих, а это реже, чем кажется: на протяжении большей части 2026 года у этих двух рейтингов были разные победители.
Ни одна из таблиц не содержит ни единого примера прерывания модели. Они измеряют, как звучит речь сама по себе, для слушателя. Индекс Speech to Speech устроен иначе — он сводит в один показатель речевое мышление, агентную производительность, предпочтения арены и успешность выполнения задач, и допускает только модели, изначально работающие в режиме речь-в-речь. Cartesia там не представлена. Не потому, что Sonic 3.6 плох, а потому, что движку текст-в-речь нечего предоставить.
Итак, 1 275 и 70,3% — не конкурирующие числа, и любое сравнение, которое ставит их в один ряд, тихо лжёт вам. Вместе они устанавливают, что качество перестало быть осью, вокруг которой вращается это решение.

Измерение за измерением
• Kind — GPT-Live-1: полнодуплексное преобразование речи в речь, одна модель для всего цикла, против Cartesia Sonic 3.6: потоковое преобразование текста в речь в паре с распознаванием речи Ink-2 для агентов
• Независимое качество — GPT-Live-1: 70,3% в индексе Speech to Speech, делит шестое место из четырнадцати против Cartesia Sonic 3.6: 1 275 Elo в рейтинге Provider Voice по 1 755 образцам, а также первое место в рейтинге Controlled Voice
• Обработка прерываний — GPT-Live-1: свойство модели, которое много раз в секунду решает, уступать ли ход, против Cartesia Sonic 3.6: паттерн интеграции, где клиент отменяет контекст синтеза и полагается на временные метки слов, чтобы обрезать в нужный момент
• Цена — GPT-Live-1: $0,05 за голосовую минуту, оплата посекундно, бэкенд рассуждений тарифицируется отдельно, против Cartesia Sonic 3.6: около $49 за миллион символов по кредитным планам, плюс $0,06 за минуту длительности вызова агента и $0,014 за минуту для телефонного номера Cartesia
• Задержка — GPT-Live-1: опубликованных данных на уровне модели нет; задержка при передаче реплик указана как 0,798 секунды в собственных тестах OpenAI по сравнению с Cartesia Sonic 3.6: менее 90 миллисекунд до первого аудио, заявлено поставщиком и не измерено независимо сквозным образом
• Пропускная способность — GPT-Live-1: одновременные сессии, с ограничением 25 на уровне 1 и 500 на уровне 5, без бесплатного тарифа, против Cartesia Sonic 3.6: около 132 символов в секунду, примерно вдвое больше скорости ElevenLabs v3 при том же сравнении, с бесплатным тарифом на 20 000 кредитов в месяц
• Языки — GPT-Live-1: неравномерная беглость за пределами основных языков в стартовом покрытии по сравнению с Cartesia Sonic 3.6: 44 языка в 61 локали, при этом в этом релизе добавлены ория и урду
• Управление голосом — GPT-Live-1: двенадцать пресетов, тон и темп через промптинг, без клонирования, в отличие от Cartesia Sonic 3.6: более 500 предустановленных голосов, мгновенное клонирование, профессиональное клонирование на старших тарифах, временные метки слов и фонем, а также отсутствие SSML — модель адаптирует темп исходя из самого текста

Barge-in — это особенность архитектуры, а не галочка
Самая распространённая ошибка покупателей при таком сравнении — считать поддержку прерываний булевым значением. Документация Cartesia честно описывает, как работает её версия: когда звонящий перебивает агента, клиент отправляет отмену для текущего контекста синтеза, а метки времени на уровне слов, возвращаемые по WebSocket-соединению, позволяют остановить воспроизведение на нужном слоге. Это грамотное решение, и именно так большинство продакшен-голосовых агентов обрабатывают перебивание сегодня.
Это по-прежнему архитектура, в которой решение перестать говорить принимает ваше приложение с помощью сигнала голосовой активности — с той задержкой, которую допускает круговой обмен. GPT-Live-1 переносит это решение внутрь модели. Она непрерывно решает, продолжать ли слушать, приостановиться, взять ход или передать его, поэтому собственные данные OpenAI сообщают об интерактивности 80,1% против 45,4% у GPT-Realtime-2.1 на Full Duplex Bench v1.5, а задержка смены хода составляет 0,798 секунды против 1,41. Эти цифры принадлежат OpenAI, опубликованы вместе с релизом и не воспроизведены никем за пределами компании — но архитектурное различие, стоящее за ними, не оспаривается, и это именно то, что каскад не может приблизить с помощью настройки.
Каскад выигрывает во всём, что происходит после предложения. Заявленное Cartesia время до первого звука менее 90 миллисекунд — это показатель производителя, и он измеряет модель, а не разговор: число, которое ощущает звонящий, также включает распознавание речи, определение реплик, время генерации языковой модели, передачу по сети и буферизацию аудио. Именно поэтому каскад стоит строить, когда нужно контролировать каждый этап — быстрая небольшая модель для простых реплик, передовая модель для сложных и синтезатор, который никогда не заставляет ждать.
Этот средний этап — единственная часть в обоих стеках, которая действительно переносима, и именно он определяет как качество, так и стоимость вызова. Примерно 190 моделей от одиннадцати вышестоящих провайдеров доступны через один ключ OrcaRouter по прайсу провайдера с нулевой наценкой, а DSL маршрутизации позволяет одной конечной точке направлять простые реплики к дешёвой модели и эскалировать сложные к передовой модели — именно тот паттерн, который нужен голосовому агенту, применённый к этапу, который варьируется сильнее всего. Ни Sonic 3.6, ни GPT-Live-1 недоступны через слой маршрутизации; голосовые слои принадлежат их поставщикам.

Управление деньгами
Две модели ценообразования не совпадают, поэтому преобразование стоит выполнить как следует. Речь звучит примерно со скоростью 150 слов в минуту, а в английском в среднем около пяти с половиной символов на слово, так что минута произнесённого текста — это примерно 800–900 символов. При цене $49 за миллион символов синтез Cartesia стоит около четырёх центов за минуту аудио.
Затем приходит остальная часть каскада. Cartesia берет $0.06 за минуту длительности звонка голосового агента и $0.014 за минуту, если вы используете ее номер телефона, — сверх платы за символы. Добавьте распознавание речи и языковую модель для текста — и вы уже перевалили за десять центов за минуту, прежде чем кто-либо сказал что-то сложное. Тариф GPT-Live-1 в $0.05 за голосовую минуту покрывает слушание, смену реплик и говорение, а делегированные рассуждения тарифицируются отдельно по обычному тарифу бэкенд-модели — что для звонка по бронированию с одним-двумя привязанными поисковыми запросами является реальной суммой, а не погрешностью округления.
Точка перехода определяется объёмом и сложностью. Короткие, повторяющиеся, высокочастотные звонки — подтверждения, уведомления, простые справки — благоприятствуют каскаду, потому что дешёвая модель, отвечающая на шаблонный вопрос, — самое дешёвое в этом сравнении. Звонки, в которых абонент отклоняется от сценария, перебивает агента или меняет решение на середине фразы, благоприятствуют сквозной модели, потому что режим отказа каскада в таком случае — не неправильный ответ, а неловкий.
Какой выбрать?
Выбирайте Cartesia Sonic 3.6, если вам нужен голос с наилучшими оценками из доступных и вы готовы сами отвечать за логику диалога. Это правильное решение для озвучивания, для высоконагруженных сценарных агентов, для команд с уже существующим конвейером распознавания речи и для всех, кому нужны временные метки на уровне слов, делающие возможной точную обработку перебиваний. Вы получаете бесплатный тариф, более 500 голосов, клонирование, 44 языка и первые места в обоих рейтингах качества, а также сохраняете контроль над каждым этапом.
Выбирайте GPT-Live-1, если прерывание — это и есть продукт. Во всех случаях, когда вас перебивают не как исключение, а как норму и когда передача хода за 0,8 секунды лучше, чем старт за 90 миллисекунд на фразе, которую никто не успел договорить. Вы принимаете закрытую хостируемую модель с поминутной оплатой, двенадцатью голосами и без клонирования и миритесь с тем, что её независимая оценка качества находится в середине таблицы.
Соблазнительно посмотреть на 1 275 против 70,3% и решить, что вопрос закрыт. Но это не так, и разница между этими двумя числами — это и есть весь спор: одно измеряет, как звучит голос, другое — стоит ли вообще с ним разговаривать.
