
GPT-Live-1 против ElevenLabs: одна модель, которая слушает, и одна компания, которая продаёт всё остальное
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Самое полезное число в этом сравнении — 90,5%. Это показатель успешности выполнения задач, который Artificial Analysis измерила для ElevenLabs Agents в своей Speech Agent Arena — самый высокий среди первой шестёрки этого рейтинга, достигнутый системой, которая вовсе не является единой моделью, а представляет собой каскад из распознавания речи, языковой модели и синтезатора, соединённых собственной логикой перехода хода ElevenLabs. GPT-Live-1, сквозная полнодуплексная модель OpenAI, не фигурирует в этом рейтинге, поскольку соревнуется в другом: в индексе Speech to Speech, где делит шестое место из четырнадцати с показателем 70,3%. Тем временем ElevenLabs Eleven v3 остаётся самым широко используемым голосом для продакшена в отрасли: в его библиотеке более 10 000 голосов и более 70 языков.
Если кратко: одна сторона продаёт вам разговор, а другая — компанию. Эта формулировка в основном верна и скрывает под собой более интересный вывод: грамотно спроектированный каскад всё ещё превосходит нативную полнодуплексную модель в доведении задачи до конца.
Две архитектуры, и разница в том, где проходят швы.
GPT-Live-1 — это единая модель, которая принимает аудио и текст на входе и выдаёт аудио и текст на выходе. Она обрабатывает прерывания нативно — собственное тестирование OpenAI, опубликованное вместе с сентябрьским релизом API и не воспроизведённое за пределами компании, сообщает о 80,1% интерактивности в Full Duplex Bench v1.5 против 45,4% у GPT-Realtime-2.1 и задержке при передаче очереди 0,798 секунды против 1,41. Здесь нет стыков, потому что нечего состыковывать.
ElevenLabs Agents — это намеренно противоположная ставка. В документации ElevenLabs описывается пайплайн: настроенное распознавание речи, языковая модель, которую вы выбираете или приносите свою, низколатентный синтезатор — обычно что-то из линейки Flash — и проприетарная модель управления очередностью реплик поверх. Barge-in — это конфигурация для каждого агента, задающая степень готовности к перехвату инициативы и тайм-ауты, а не свойство модели. В эталонной конфигурации по умолчанию от Artificial Analysis стек выглядит так: Scribe v2 Realtime для распознавания речи, модель Gemini для рассуждений и Eleven Flash v2 для синтеза.
У этой архитектуры есть одно огромное преимущество и одна структурная издержка. Преимущество в том, что каждый этап можно заменить: дешёвая модель для простых реплик, передовая модель для сложных, другой синтезатор для другого региона. Издержка в том, что задержка накапливается на каждом стыке, а решение о передаче хода приходится принимать извне.
Измерение за измерением
• Архитектура — GPT-Live-1: одна сквозная модель, аудио на входе и аудио на выходе, в отличие от ElevenLabs Agents: каскадное распознавание речи, языковая модель и синтез с проприетарным слоем управления очередностью реплик
• Независимое подтверждение — GPT-Live-1: 70,3% в Artificial Analysis Speech to Speech Index, делит шестое место из четырнадцати; в сравнении с ElevenLabs Agents: Elo 937 в Speech Agent Arena при доле успешно выполненных задач 90,5% на 676 примерах — лучший показатель успешности среди первой шестёрки этого рейтинга
• Рейтинги качества — GPT-Live-1: не представлен на TTS-аренах, так как это модель другого типа по сравнению с ElevenLabs: Eleven v3 Conversational — 1,194 Elo и Eleven v3 — 1,166 в таблице Provider Voice, по цене $50 и $100 за миллион символов соответственно
• Цена — GPT-Live-1: $0,05 за голосовую минуту, с посекундной оплатой, серверные вычисления для рассуждений тарифицируются отдельно; для сравнения, ElevenLabs: около $50 за миллион символов для Eleven v3 Conversational и примерно $100 для Eleven v3, при этом, по сообщениям, агенты обходятся примерно в $0,08 за минуту, а при превышении лимита одновременных сессий цена возрастает; расходы на языковую модель и телефонию тарифицируются отдельно
• Задержка — GPT-Live-1: данные о времени до первого аудио на уровне модели не опубликованы; задержка смены реплик 0,798 секунды при тестировании поставщика по сравнению с ElevenLabs: около 75 миллисекунд для Flash v2.5 и около 280 миллисекунд для Eleven v3 Conversational, при рекомендации поставщика менее 800 миллисекунд до первого аудио на уровне агента
• Голоса и клонирование — GPT-Live-1: двенадцать API-пресетов, клонирование не предусмотрено по замыслу, против ElevenLabs: более 10 000 голосов в библиотеке, мгновенное клонирование по короткому образцу, профессиональное клонирование по аудио длительностью от 30 до 180 минут с самопроверкой
• Языки — GPT-Live-1: основные языки хорошо поддерживаются, но за их пределами — неравномерная беглость в стартовом охвате; в сравнении с ElevenLabs Eleven v3: более 70 языков, против 32 у линейки Flash и более 90 для распознавания речи.
• Широта — GPT-Live-1: одна конечная точка, один идентификатор модели, уровни параллелизма от 25 до 500 сессий и отсутствие бесплатного тарифа, в отличие от ElevenLabs: синтез речи, распознавание речи, дубляж, звуковые эффекты, музыка, маркетплейс голосов и платформа агентов в рамках одного договора, с бесплатным тарифом, который не включает коммерческую лицензию


Где ElevenLabs не просто впереди, а вне конкуренции
Три из разрывов в этом списке отнюдь не малы, и любое сравнение, которое отводит им целое предложение, несправедливо по отношению к действующему обладателю должности.
Клонирование идёт первым. GPT-Live-1 поставляется с двенадцатью пресетами и, по замыслу, вообще без клонирования — это намеренная позиция в области безопасности, а не отсутствующая функция. ElevenLabs предлагает мгновенное клонирование по короткому эталонному образцу и профессиональное клонирование, обученное на 30–180 минутах аудио, причём доступ к обоим возможен только на определённых тарифных уровнях и после этапа самостоятельной верификации. Если голос вашего продукта — часть его идентичности, это не тот параметр, по которому GPT-Live-1 конкурирует.
Библиотека голосов — вторая. Более 10 000 голосов плюс лицензированный маркетплейс культовых голосов от наследников и исполнителей — это актив, который не воспроизведёт ни один релиз модели. Это также то, что покупатели чаще всего недооценивают: выбор голоса — это последняя миля голосового продукта, а наличие десяти тысяч голосов на выбор превращает работу над брендом в дело одного дня.
Третье — широта. Распознавание речи, дубляж, звуковые эффекты, музыка, платформа агентов — команда, которой нужны четыре из этого, покупает один контракт вместо четырёх. Это стратегическое преимущество, а не преимущество в качестве, и оно сохраняется, даже если другая сторона выиграет бенчмарк.
Обе компании несут вопросы управления, которые должны рассматриваться в рамках закупочной проверки, а не в сноске. Профессиональное клонирование ElevenLabs требует самостоятельной верификации, а его условия запрещают клонировать голос другого человека даже с согласия; компания также сталкивается с рядом коллективных исков, поданных в мае 2026 года по поводу согласия на использование данных для обучения, при этом исковые требования в них не доказаны. Позиция OpenAI проще, поскольку она удалила функцию, создающую этот риск.

Каскадный налог, и где его стоит платить
Издержки каскада проявляются как задержка и как оркестрация. Рекомендации производителя для ElevenLabs указывают, что время агента до первого аудио составляет менее 800 миллисекунд по медиане и менее 1,5 секунд на 95-м процентиле — цифры, которые описывают весь конвейер, а не 75 миллисекунд синтезатора. Сверху накладываются время генерации языковой модели и сетевая передача. Часть этого можно компенсировать, тщательно выбирая этапы; но ничто из этого не бесплатно.
Счёт за оркестрацию менее ощутим, но он реален. Каждый дополнительный этап — это ещё одно место, где вызов может сорваться, ещё один тайм-аут, который нужно настроить, ещё один поставщик, с которым нужно сверять счета. Именно эту часть нативная сквозная модель устраняет полностью: есть только одна вещь, которая может сломаться, и она либо отвечает, либо нет.
Именно на среднем этапе каскад окупает себя. Языковая модель, стоящая за голосовым агентом, — это компонент, качество которого растёт быстрее всего, а стоимость варьируется сильнее всего, и возможность заменить её, не трогая голосовой слой, стоит реальных денег на протяжении всего жизненного цикла продукта. Примерно 190 моделей от одиннадцати вышестоящих провайдеров доступны через единственный ключ OrcaRouter по каталожным ценам провайдеров без наценки, так что изменение цены поставщиком доходит до этого слоя в тот же день, а автоматическое переключение при сбое не даёт таймауту бэкенда оборвать живой звонок. Ни стек агентов ElevenLabs, ни эндпоинт Live Sessions от GPT-Live-1 недоступны таким образом — голосовые слои принадлежат своим поставщикам, а это слой под ними.
Какой выбрать?
Выбирайте GPT-Live-1, если механика разговора — это и есть продукт и вам нужен один контракт с одним режимом отказа. Телефонные линии, где звонящие перебивают агента, где естественная передача важнее идеального голоса и где достаточно двенадцати хороших голосов. Вы принимаете закрытую хостируемую модель, без клонирования, независимое качество среднего уровня и отсутствие бесплатного тарифа для прототипирования.
Выбирайте ElevenLabs, если ограничение — качество голоса, клонирование или широта охвата. Озвучивание, дубляж, многоязычные продукты, всё, где голос — это бренд, всё, что требует распознавания речи в рамках того же договора. Вы соглашаетесь с тем, что работать придётся с каскадом, что цены примерно в десять–двадцать раз выше, чем у GPT-Live-1, за единицу речи, и что логику прерываний настраиваете вы — и ошибаться в ней тоже вам.
90,5% — это то, что стоит унести с собой. Эта цифра говорит, что компания, собравшая три модели и слой управления сменой реплик, обошла компанию, обучившую одну модель делать всё это, по метрике, наиболее близкой к тому, удался ли звонок. Полный дуплекс — это настоящее архитектурное достижение, но, судя по текущим данным, не оно решает, получит ли звонящий то, что хотел.
