
Muse Realtime Avatar vs GPT-Live-1: присутствие против разговора
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 180 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Единица тарификации говорит о том, что, по мнению каждой компании, она продаёт. GPT-Live-1, полнодуплексная голосовая модель OpenAI, тарифицируется по фиксированной ставке $0,05 за минуту голоса с посекундным начислением, а её лимиты скорости выражаются в одновременных сессиях — 25 на Tier 1, возрастая до 500 на Tier 5. Это единица измерения телефонной линии. Muse Realtime Avatar, анонсированный Meta 23 сентября 2026 года, не имеет единицы тарификации, потому что тарифицировать нечего: ни API, ни эндпоинта, ни цены, ни даты. Его опубликованная единица — это аппаратный показатель: 12 одновременных сессий в реальном времени на одном NVIDIA GB200. Одна компания продаёт разговор по минутам. Другая показывает, сколько стоит отрендерить лицо, и пока не решила его продавать.
Обе модели довольно новые, и ни одна из них не является запуском в том смысле, который обычно вкладывают в это слово. GPT-Live-1 вышел внутри ChatGPT 8 июля 2026 года и лишь 10 сентября добрался до API для разработчиков — два месяца, в течение которых он был голосом по умолчанию потребительского продукта и был недоступен всем, кто что-то создавал. Muse Realtime Avatar был анонсирован 23 сентября 2026 года на Meta Connect, демонстрируется в собственном исследовательском посте Meta и остаётся возможностью агента Muse, а не продуктом. Сравнивать их — значит сравнивать две разные стадии одной и той же идеи: что происходит, когда разговорная модель становится достаточно хороша, и следующий вопрос — на что смотрит пользователь, пока она говорит.
Что создала OpenAI: разговор, который никогда не останавливается
GPT-Live-1 является полнодуплексным в том смысле, который важен операционно — он не ждёт, пока вы закончите, прежде чем начать работу. Он обращается к API для разработчиков ровно через один эндпоинт, эндпоинт Live Sessions, под ровно одним ID модели, gpt-live-1, без датированных снимков для закрепления и без включённых родственных эндпоинтов. Ни Chat Completions, ни Responses, ни Realtime, ни тонкой настройки, ни эндпоинтов для транскрипции аудио или синтеза речи. Ввод изображений и видео явно не поддерживается.
Проектное решение, определяющее всё дальнейшее, — это делегирование. GPT-Live-1 не выполняет тяжёлую мыслительную работу самостоятельно. В документации OpenAI голосовой слой соединён с отдельным бэкендом рассуждений, и в опубликованном примере WebRTC этот бэкенд — GPT-5.6 Terra. Так что сессия GPT-Live-1 — это два счётчика, работающих одновременно: $0,05 в минуту за голос плюс обычные тарифы на токены бэкенд-модели за каждый вызов инструмента, поиск и шаг рассуждения, которые она передаёт. В индексе Speech to Speech эта раздвоенность проявляется в том, что одна и та же модель получает две оценки — 81,5 с GPT-6 Astra, выполняющей рассуждения при среднем уровне усилий, и 80,1 с GPT-5.6 Sol при низком уровне усилий. Разрыв в 1,4 пункта между этими двумя конфигурациями шире, чем преимущество в 0,2 пункта, которое ставит лучшую конфигурацию GPT-Live-1 на первое место.
Такова честная структура модели. Голосовой фронтенд фиксирован; интеллект — это параметр, который вы задаёте, и он влияет на оценку сильнее, чем любая конкурирующая модель.
Что создала Meta: лицо, которое движется в такт голосу
Muse Realtime Avatar берётся за проблему, которой нет у GPT-Live-1 — сохранение синхронности сгенерированного видео со сгенерированной речью. Ответ Meta — сделать их одним потоком: Muse Realtime Voice выдаёт речевые токены, несущие как содержание, так и просодию, а аватар — это аудиоуправляемый Diffusion Transformer, потребляющий те же самые токены и обусловленный референсным изображением и скользящим окном последних видеолатентов. Ничего не синхронизируется с губами постфактум, потому что никакого «постфактума» не существует — голос, губы и мимика порождаются одним процессом.
Опубликованные цифры — собственные данные Meta, измеренные относительно выбранных Meta базовых значений, и ни одна из них не была воспроизведена за пределами компании. 870 мс от завершения вашей реплики до первого байта синхронизированного голосового и видеоответа. Портретное видео 448×768 с частотой 25 кадров в секунду, с водяным знаком в виде прозрачного наложения, чтобы зритель мог понять, что это не съёмка с камеры. Двенадцать одновременных сессий на одном GB200 — восьмикратный прирост ёмкости относительно собственной двухэтапной базовой конфигурации Meta на BF16, полученный за счёт четырёхбитного обучения с учётом квантования, постоянных KV-кэшей и динамического батчирования с учётом задержки. И результат по предпочтениям, о котором сообщает Meta: рост с 45% до 55% относительно этой базовой конфигурации, с двумя раскрытыми победами над коммерческими системами аватаров — плюс раскрытие того, что по манере поведения результат против одной из них статистически неотличим от паритета.
Ничто в этом списке не является ни ставкой, ни конечной точкой, ни датой.

Счёт длиной в два метра, и где маршрутизация оправдывает себя
Структура затрат GPT-Live-1 — это не одно число, и именно отношение к ней как к одному числу приводит к тому, что дешёвая на слух голосовая модель оборачивается дорогим месяцем. Голос стоит $0,05 в минуту, тарифицируется посекундно без округления вверх, а первые 15 секунд сессии оплачиваются сразу, но зачитываются в счёт последующей длительности, а не добавляются сверху. Всё, что сессия делегирует — рассуждения, вызовы инструментов, любой поиск, — тарифицируется отдельно по собственным тарифам бэкенд-модели. Направьте делегирование на фронтирную модель рассуждений и разрешите ей искать на каждом ходу — и вы получите открытую линию за $3 в час, за которой стоит премиальная модель.
Второй счётчик — это маршрутизируемая половина. В OrcaRouter бэкенд сессии GPT-Live-1 — это всего лишь ещё один вызов модели: 196 моделей от 15 провайдеров за одним ключом, по прайсовой цене провайдера, переданной без наценки, с автоматическим переключением при сбое, если выбранная модель выдаёт ошибку или превышает время ожидания. Маршрутизировать голосовой слой нельзя — Live Sessions — это исключительно эндпоинт OpenAI, — но всё, что голосовой слой делегирует, работает через один ключ, а значит, та часть счёта, которая растёт в зависимости от того, насколько напряжённо думают ваши звонящие, — это также та часть, которую можно изменить без контракта.
Muse Realtime Avatar, напротив, не имеет индикаторов, которые нужно маршрутизировать. Это функция приложения.

Две ставки на то, для чего нужен голосовой агент
Если отбросить характеристики, две компании расходятся в том, что считать продуктом. Ставка OpenAI в том, что разговор и есть продукт — что голосовой агент — это телефонная линия, а задача — сделать так, чтобы он ощущался как она: никогда не зависать, передавать сложные размышления модели, стоящей за ним, тарифицировать по минутам, масштабироваться по количеству одновременных вызовов. Каждый выбор в API GPT-Live-1 вытекает из этого. Лимиты на основе параллелизма, транспорт только через WebRTC, единственный намеренно узкий эндпоинт, никакого видео ни на входе, ни на выходе.
Ставка Meta в том, что присутствие — это и есть продукт: что пользователь, который видит агента, — это пользователь, который остаётся в разговоре, и что интересная инженерия заключается не в смене реплик, а в сохранении целостности отрисовываемого персонажа на протяжении всего звонка. Эти решения дают систему, оптимизированную под частоту кадров и плотность сессий на GPU, вообще без коммерческой составляющей.
Вполне возможно, что оба правы, и эти две вещи объединяются. Продукт мог бы вести свой разговор на полнодуплексной голосовой модели, а визуальный слой — на рендерере аватаров, и единственное, что мешает этому сегодня, — у рендерера аватаров нет эндпоинта. А вот что неправдоподобно — так это рассматривать их как две версии одной и той же покупки.
Кто должен действовать, а кто должен ждать
Если вы сейчас создаёте голосовой продукт, GPT-Live-1 можно вызывать, а Muse Realtime Avatar — нет, и это закрывает вопрос выбора. Интересный выбор внутри GPT-Live-1 — это бэкенд, которому вы делегируете, потому что именно там реально меняются и оценка, и счёт — и это единственная часть стека, которую можно маршрутизировать, заменять и переводить на резерв без изменения голосовой интеграции.
Если вам нужен аватар, ожидание — не пассивная позиция. Следить стоит за конкретными вещами: опубликует ли Meta тарифную сетку и эндпоинт, появится ли названная дата и выдержит ли 870 мс столкновение с телефоном в сотовой сети, а не с демо на Connect. В собственном посте Meta отмечает, что её демо отражают не все аватары, доступные в приложении Muse, — и именно за эту фразу стоит держаться.
Пока одно из этого не изменится, у сравнения есть ответ в одну строку. GPT-Live-1 — это телефонная линия с мозгом на ваш выбор. Muse Realtime Avatar — это лицо без номера телефона.

