Сгенерированная hero-карточка для статьи «Muse Realtime Avatar vs GPT-Live-1», показывающая две скруглённые карточки по обе стороны от заголовка. На левой карточке написано «Muse Realtime Avatar» над иконкой портретного аватара и строки «видео + голос, один поток» и «без API, без цены, без даты»; на правой карточке написано «GPT-Live-1» над иконкой речевого пузыря и строки «$0,05 за минуту, оплата по секундам» и «одновременные сессии, WebRTC». Подзаголовок гласит: «Одна продаёт минуты. Другая продаёт присутствие». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1: присутствие против разговора

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Единица тарификации говорит о том, что, по мнению каждой компании, она продаёт. GPT-Live-1, полнодуплексная голосовая модель OpenAI, тарифицируется по фиксированной ставке $0,05 за минуту голоса с посекундным начислением, а её лимиты скорости выражаются в одновременных сессиях — 25 на Tier 1, возрастая до 500 на Tier 5. Это единица измерения телефонной линии. Muse Realtime Avatar, анонсированный Meta 23 сентября 2026 года, не имеет единицы тарификации, потому что тарифицировать нечего: ни API, ни эндпоинта, ни цены, ни даты. Его опубликованная единица — это аппаратный показатель: 12 одновременных сессий в реальном времени на одном NVIDIA GB200. Одна компания продаёт разговор по минутам. Другая показывает, сколько стоит отрендерить лицо, и пока не решила его продавать.

Обе модели довольно новые, и ни одна из них не является запуском в том смысле, который обычно вкладывают в это слово. GPT-Live-1 вышел внутри ChatGPT 8 июля 2026 года и лишь 10 сентября добрался до API для разработчиков — два месяца, в течение которых он был голосом по умолчанию потребительского продукта и был недоступен всем, кто что-то создавал. Muse Realtime Avatar был анонсирован 23 сентября 2026 года на Meta Connect, демонстрируется в собственном исследовательском посте Meta и остаётся возможностью агента Muse, а не продуктом. Сравнивать их — значит сравнивать две разные стадии одной и той же идеи: что происходит, когда разговорная модель становится достаточно хороша, и следующий вопрос — на что смотрит пользователь, пока она говорит.

Что создала OpenAI: разговор, который никогда не останавливается

GPT-Live-1 является полнодуплексным в том смысле, который важен операционно — он не ждёт, пока вы закончите, прежде чем начать работу. Он обращается к API для разработчиков ровно через один эндпоинт, эндпоинт Live Sessions, под ровно одним ID модели, gpt-live-1, без датированных снимков для закрепления и без включённых родственных эндпоинтов. Ни Chat Completions, ни Responses, ни Realtime, ни тонкой настройки, ни эндпоинтов для транскрипции аудио или синтеза речи. Ввод изображений и видео явно не поддерживается.

Проектное решение, определяющее всё дальнейшее, — это делегирование. GPT-Live-1 не выполняет тяжёлую мыслительную работу самостоятельно. В документации OpenAI голосовой слой соединён с отдельным бэкендом рассуждений, и в опубликованном примере WebRTC этот бэкенд — GPT-5.6 Terra. Так что сессия GPT-Live-1 — это два счётчика, работающих одновременно: $0,05 в минуту за голос плюс обычные тарифы на токены бэкенд-модели за каждый вызов инструмента, поиск и шаг рассуждения, которые она передаёт. В индексе Speech to Speech эта раздвоенность проявляется в том, что одна и та же модель получает две оценки — 81,5 с GPT-6 Astra, выполняющей рассуждения при среднем уровне усилий, и 80,1 с GPT-5.6 Sol при низком уровне усилий. Разрыв в 1,4 пункта между этими двумя конфигурациями шире, чем преимущество в 0,2 пункта, которое ставит лучшую конфигурацию GPT-Live-1 на первое место.

Такова честная структура модели. Голосовой фронтенд фиксирован; интеллект — это параметр, который вы задаёте, и он влияет на оценку сильнее, чем любая конкурирующая модель.

Что создала Meta: лицо, которое движется в такт голосу

Muse Realtime Avatar берётся за проблему, которой нет у GPT-Live-1 — сохранение синхронности сгенерированного видео со сгенерированной речью. Ответ Meta — сделать их одним потоком: Muse Realtime Voice выдаёт речевые токены, несущие как содержание, так и просодию, а аватар — это аудиоуправляемый Diffusion Transformer, потребляющий те же самые токены и обусловленный референсным изображением и скользящим окном последних видеолатентов. Ничего не синхронизируется с губами постфактум, потому что никакого «постфактума» не существует — голос, губы и мимика порождаются одним процессом.

Опубликованные цифры — собственные данные Meta, измеренные относительно выбранных Meta базовых значений, и ни одна из них не была воспроизведена за пределами компании. 870 мс от завершения вашей реплики до первого байта синхронизированного голосового и видеоответа. Портретное видео 448×768 с частотой 25 кадров в секунду, с водяным знаком в виде прозрачного наложения, чтобы зритель мог понять, что это не съёмка с камеры. Двенадцать одновременных сессий на одном GB200 — восьмикратный прирост ёмкости относительно собственной двухэтапной базовой конфигурации Meta на BF16, полученный за счёт четырёхбитного обучения с учётом квантования, постоянных KV-кэшей и динамического батчирования с учётом задержки. И результат по предпочтениям, о котором сообщает Meta: рост с 45% до 55% относительно этой базовой конфигурации, с двумя раскрытыми победами над коммерческими системами аватаров — плюс раскрытие того, что по манере поведения результат против одной из них статистически неотличим от паритета.

Ничто в этом списке не является ни ставкой, ни конечной точкой, ни датой.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

Счёт длиной в два метра, и где маршрутизация оправдывает себя

Структура затрат GPT-Live-1 — это не одно число, и именно отношение к ней как к одному числу приводит к тому, что дешёвая на слух голосовая модель оборачивается дорогим месяцем. Голос стоит $0,05 в минуту, тарифицируется посекундно без округления вверх, а первые 15 секунд сессии оплачиваются сразу, но зачитываются в счёт последующей длительности, а не добавляются сверху. Всё, что сессия делегирует — рассуждения, вызовы инструментов, любой поиск, — тарифицируется отдельно по собственным тарифам бэкенд-модели. Направьте делегирование на фронтирную модель рассуждений и разрешите ей искать на каждом ходу — и вы получите открытую линию за $3 в час, за которой стоит премиальная модель.

Второй счётчик — это маршрутизируемая половина. В OrcaRouter бэкенд сессии GPT-Live-1 — это всего лишь ещё один вызов модели: 196 моделей от 15 провайдеров за одним ключом, по прайсовой цене провайдера, переданной без наценки, с автоматическим переключением при сбое, если выбранная модель выдаёт ошибку или превышает время ожидания. Маршрутизировать голосовой слой нельзя — Live Sessions — это исключительно эндпоинт OpenAI, — но всё, что голосовой слой делегирует, работает через один ключ, а значит, та часть счёта, которая растёт в зависимости от того, насколько напряжённо думают ваши звонящие, — это также та часть, которую можно изменить без контракта.

Muse Realtime Avatar, напротив, не имеет индикаторов, которые нужно маршрутизировать. Это функция приложения.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Две ставки на то, для чего нужен голосовой агент

Если отбросить характеристики, две компании расходятся в том, что считать продуктом. Ставка OpenAI в том, что разговор и есть продукт — что голосовой агент — это телефонная линия, а задача — сделать так, чтобы он ощущался как она: никогда не зависать, передавать сложные размышления модели, стоящей за ним, тарифицировать по минутам, масштабироваться по количеству одновременных вызовов. Каждый выбор в API GPT-Live-1 вытекает из этого. Лимиты на основе параллелизма, транспорт только через WebRTC, единственный намеренно узкий эндпоинт, никакого видео ни на входе, ни на выходе.

Ставка Meta в том, что присутствие — это и есть продукт: что пользователь, который видит агента, — это пользователь, который остаётся в разговоре, и что интересная инженерия заключается не в смене реплик, а в сохранении целостности отрисовываемого персонажа на протяжении всего звонка. Эти решения дают систему, оптимизированную под частоту кадров и плотность сессий на GPU, вообще без коммерческой составляющей.

Вполне возможно, что оба правы, и эти две вещи объединяются. Продукт мог бы вести свой разговор на полнодуплексной голосовой модели, а визуальный слой — на рендерере аватаров, и единственное, что мешает этому сегодня, — у рендерера аватаров нет эндпоинта. А вот что неправдоподобно — так это рассматривать их как две версии одной и той же покупки.

Кто должен действовать, а кто должен ждать

Если вы сейчас создаёте голосовой продукт, GPT-Live-1 можно вызывать, а Muse Realtime Avatar — нет, и это закрывает вопрос выбора. Интересный выбор внутри GPT-Live-1 — это бэкенд, которому вы делегируете, потому что именно там реально меняются и оценка, и счёт — и это единственная часть стека, которую можно маршрутизировать, заменять и переводить на резерв без изменения голосовой интеграции.

Если вам нужен аватар, ожидание — не пассивная позиция. Следить стоит за конкретными вещами: опубликует ли Meta тарифную сетку и эндпоинт, появится ли названная дата и выдержит ли 870 мс столкновение с телефоном в сотовой сети, а не с демо на Connect. В собственном посте Meta отмечает, что её демо отражают не все аватары, доступные в приложении Muse, — и именно за эту фразу стоит держаться.

Пока одно из этого не изменится, у сравнения есть ответ в одну строку. GPT-Live-1 — это телефонная линия с мозгом на ваш выбор. Muse Realtime Avatar — это лицо без номера телефона.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.