Сгенерированная hero-карточка для статьи «Muse Realtime Avatar против Gemini 3.8 Live», показывающая две скруглённые карточки по обе стороны от заголовка. В левой карточке над иконкой видеокадра написано «Muse Realtime Avatar», а ниже — строки «видео + голос на выходе», «448x768, портретная ориентация, 25 кадр/с» и «анонсировано 23 сентября, без API»; в правой карточке над иконкой микрофона с речевым пузырём написано «Gemini 3.8 Live», а ниже — строки «аудио + текст на выходе», «$0.005/мин аудио на входе» и «общая доступность 15 сентября, Live API». Подзаголовок гласит: «Один рендерит лицо. Другой обслуживает телефонную линию.» Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Muse Realtime Avatar против Gemini 3.8 Live: лицо против голосовой линии

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Эти двое — не замена друг другу, и быстрее всего это понять, если спросить, что выдаёт каждый из них. Muse Realtime Avatar, анонсированный Meta 23 сентября 2026 года, возвращает синхронизированное видео говорящего персонажа — вы даёте эталонное изображение, а он отрисовывает, как это существо говорит и жестикулирует, в портретных кадрах 448×768. Gemini 3.8 Live, анонсированный Google 15 сентября 2026 года и в тот же день ставший общедоступным для разработчиков, возвращает аудио и текст. У него вообще нет видеовыхода. Ставить их в одно сравнение — не ошибка: эти двое конкурируют за одну и ту же разговорную поверхность, и покупатели уже спрашивают, на чём из них строить, — но решение не в том, «кто лучше». Оно в том, «какой из двух разных продуктов мне нужен», и почти все опубликованные сравнения этой пары ошибаются, выстраивая в ряд бенчмарки, которые измеряют разные вещи.

Вот асимметрия, которая должна задавать контекст для всего ниже. Вы можете вызвать Gemini 3.8 Live сегодня, из терминала, с ключом. Вы не можете вызвать Muse Realtime Avatar вообще — ни API, ни цены, ни даты. Meta продемонстрировала его на Connect и опубликовала исследовательский пост; Goog​le выпустила тарифную сетку и ID модели. Это сравнение между продуктом и анонсом, и это означает, что полезный вопрос не в том, кто победит, а в том, к чему каждый из них вас обязывает.

Что каждый из них на самом деле производит

Вот всё сравнение в шести строках, и ни одна из шести не близка.

Вывод — Muse Realtime Avatar возвращает синхронизированные голос и портретное видео, генерируемые совместно из одного потока речевых токенов; Gemini 3.8 Live возвращает аудио и текст, и генерация видео в модели отсутствует в принципе.

Доступ для разработчиков — у Muse Realtime Avatar его нет: 23 сентября 2026 года он был анонсирован как возможность агента Muse от Meta, без API, без конечной точки и без объявленной даты. Gemini 3.8 Live присутствует в Gemini API и Goog​le AI Studio с 15 сентября 2026 года, под двумя идентификаторами моделей: gemini-3.8-live и gemini-3.8-live-extended-thinking.

Цена — у Muse Realtime Avatar нет опубликованной цены, потому что покупать нечего. Gemini 3.8 Live публикует $0.005 за минуту аудиовхода и $0.018 за минуту аудиовыхода через Live API.

Независимая оценка — у Muse Realtime Avatar её нет; его цифры — собственные цифры Meta, измеренные относительно базовых уровней, которые выбрала сама Meta. Gemini 3.8 Live показывает 76,0 в Artificial Analysis Speech to Speech Index, а вариант с расширенным мышлением — 82,6; это число от независимой третьей стороны, и это совершенно иной класс доказательств.

Задержка — эти две опубликованные цифры описывают разные измерения, и именно здесь большинство материалов допускают ошибку. Meta сообщает 870 мс от конца вашей реплики до первого байта синхронизированного голосового и видеоответа. Цифра Google, по измерениям Artificial Analysis, составляет 1,18 секунды до первого звука для стандартной модели и 1,35 секунды для reasoning-варианта.

Частота кадров и язык — Muse Realtime Avatar рендерит портретное видео 448×768 с частотой 25 кадров в секунду. Gemini 3.8 Live обеспечивает автоматическое переключение в середине разговора между 97 поддерживаемыми языками и обрабатывает почти в реальном времени визуальные входные данные.

В последней строке заключено различие, которое люди постоянно стирают. Gemini 3.8 Live умеет видеть. Но не умеет показывать. Muse Realtime Avatar умеет показывать. А умеет ли он видеть — не об этом пост Meta: это генератор на основе аудио, обусловленный речевыми токенами и эталонным изображением, и его задача — создавать лицо, а не считывать его.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

Показатели задержки несопоставимы, а разрыв меньше, чем кажется.

870 мс против 1,18 секунды — кажется, что Meta быстрее на 26 %. Но вчитайтесь в измерения — и сравнение рассыпается. Показатель Meta — это время от конца реплики пользователя до первого байта ответа, включающего видео, — и в посте Meta прямо указано, что это измерение до первого байта, а не время до полного ответа и не задержка доставки на протяжении остальной части звонка. Система может уложиться в 870 мс до первого байта и всё равно казаться медленной на двенадцатой секунде. Показатель Google — это время до первого аудио, а это строго меньший объём для создания, и его измеряет внешний оценщик, а не сам вендор.

Оба они — из тех показателей, которые говорят, что система ведёт диалог, а не основана на чередовании реплик, и ни один из них не говорит, каким звонок ощущается на пятой минуте. Если вы выбираете между ними по отзывчивости, честная позиция такова: никто не опубликовал сопоставимого измерения в одинаковых условиях, и единственный способ получить его — запустить тот, который можно вызвать.

На что вы можете опереться сегодня, и чего вам придётся ждать

Gemini 3.8 Live включает то, что нужно для решения о выводе в продакшен: два ID моделей, которые можно закрепить, опубликованные поминутные тарифы, оценку в стороннем индексе и заявленную дату общего выпуска. У него также есть ограничения, обычно присущие голосовым продуктам, — аудио на входе, аудио и текст на выходе и никакой генерации видео.

В Muse Realtime Avatar есть то, что обычно бывает в исследовательском посте: архитектура, четыре заявленных компанией показателя и набор раскрытых тестов предпочтений, которые Meta провела против двух коммерческих аватарных систем, причём одна из них, по сообщению самой Meta, статистически неотличима от паритета по манере поведения. Чего у него нет — так это способа его купить. В посте Meta также отмечается, что не все показанные демо отражают аватары, доступные в приложении Muse, и именно эта фраза должна определять любой план, который вы строите вокруг этого.

Есть третий вариант, который стоит назвать, потому что именно его в реальности выбирает большинство команд. Ни одна из этих моделей не является полноценным агентом. Gemini 3.8 Live передаёт фоновую работу инструментам и API, продолжая разговор; GPT-Live-1 полностью делегирует своё рассуждение отдельной бэкенд-модели. Разговорный слой — это фронтенд, а мышление — это отдельный вызов к другой модели. Этот второй вызов — обычный текстовый инференс, и его можно маршрутизировать.

В OrcaRouter этот слой — один эндпоинт: 196 моделей от 15 провайдеров под одним ключом, по каталожной цене провайдера, передаваемой без наценки, с автоматическим переключением при сбое, если выбранная вами модель выдаёт ошибку или не отвечает вовремя. Мы не размещаем Gemini 3.8 Live — Live API принадлежит только Goog​le — и мы не размещаем Muse Realtime Avatar, который не размещает никто. Мы предоставляем ту половину голосового агента, которая масштабируется в зависимости от того, насколько напряжённо думают ваши звонящие, и ту половину, которую можно менять, ничего не пересогласовывая.

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

Где эти двое могли бы на самом деле встретиться

Аргумент в пользу того, чтобы поставить их рядом, — не бенчмарки. А то, что обе пытаются занять одно и то же место в продукте: то, с чем пользователь разговаривает. Ставка Goog​le — в том, что это место — разговор, а результат — качественный: 97 языков, фоновое выполнение инструментов, вариант с рассуждениями, который решает 68,6% сценариев клиентского обслуживания τ-Voice против 30,1% у стандартной модели. Ставка Meta — в том, что это место — присутствие, и что пользователь, который видит агента, — это пользователь, который остаётся в разговоре.

Эти ставки не исключают друг друга. Продукт вполне может использовать Gemini 3.8 Live для голосового цикла и что-то вроде Muse Realtime Avatar для визуального слоя, если аватарный слой когда-нибудь станет вызываемым. Чего он не может — так это относиться к ним как к взаимозаменяемым, потому что один из них никогда не даст вам лицо, а другой, возможно, никогда не даст вам эндпоинт.

Как решить

Если вы выпускаете голосовой продукт в этом квартале, решение уже принято за вас: Gemini 3.8 Live можно вызвать, а Muse Realtime Avatar — нет. Выбирайте свой вариант по той оси, вокруг которой на самом деле строятся аргументы в релизе, — модель с расширенным мышлением даёт 38 пунктов выполнения агентных задач за чуть более чем четырёхкратную почасовую стоимость аудио, а стандартная модель — самая дешёвая из работоспособных голосовых моделей в публичном рейтинге. Затем маршрутизируйте делегированные рассуждения отдельно, потому что именно там сосредоточены и расходы, и задержка.

Если вы оцениваете аватарный слой, честный ответ таков: оценивать пока нечего. Есть исследовательский пост с четырьмя цифрами, заявленными компанией, и демонстрацией. Следить нужно не за индексом — Muse Realtime Avatar в него не попадёт — а за тем, опубликует ли Meta прайс-лист, эндпоинт и дату, и выдержит ли показатель в 870 мс, когда аватар работает на телефоне в сотовой сети, а не в демо на Connect.

А до тех пор сравнение имеет более краткую форму, чем ему обычно дают в большинстве статей. Один из них — продукт с ценой, идентификатором модели и внешней оценкой. Другой — очень хорошая демонстрация чего-то, у чего пока нет ничего из этого.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.