
Muse Realtime Avatar против Gemini 3.8 Live: лицо против голосовой линии
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 180 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Эти двое — не замена друг другу, и быстрее всего это понять, если спросить, что выдаёт каждый из них. Muse Realtime Avatar, анонсированный Meta 23 сентября 2026 года, возвращает синхронизированное видео говорящего персонажа — вы даёте эталонное изображение, а он отрисовывает, как это существо говорит и жестикулирует, в портретных кадрах 448×768. Gemini 3.8 Live, анонсированный Google 15 сентября 2026 года и в тот же день ставший общедоступным для разработчиков, возвращает аудио и текст. У него вообще нет видеовыхода. Ставить их в одно сравнение — не ошибка: эти двое конкурируют за одну и ту же разговорную поверхность, и покупатели уже спрашивают, на чём из них строить, — но решение не в том, «кто лучше». Оно в том, «какой из двух разных продуктов мне нужен», и почти все опубликованные сравнения этой пары ошибаются, выстраивая в ряд бенчмарки, которые измеряют разные вещи.
Вот асимметрия, которая должна задавать контекст для всего ниже. Вы можете вызвать Gemini 3.8 Live сегодня, из терминала, с ключом. Вы не можете вызвать Muse Realtime Avatar вообще — ни API, ни цены, ни даты. Meta продемонстрировала его на Connect и опубликовала исследовательский пост; Google выпустила тарифную сетку и ID модели. Это сравнение между продуктом и анонсом, и это означает, что полезный вопрос не в том, кто победит, а в том, к чему каждый из них вас обязывает.
Что каждый из них на самом деле производит
Вот всё сравнение в шести строках, и ни одна из шести не близка.
• Вывод — Muse Realtime Avatar возвращает синхронизированные голос и портретное видео, генерируемые совместно из одного потока речевых токенов; Gemini 3.8 Live возвращает аудио и текст, и генерация видео в модели отсутствует в принципе.
• Доступ для разработчиков — у Muse Realtime Avatar его нет: 23 сентября 2026 года он был анонсирован как возможность агента Muse от Meta, без API, без конечной точки и без объявленной даты. Gemini 3.8 Live присутствует в Gemini API и Google AI Studio с 15 сентября 2026 года, под двумя идентификаторами моделей: gemini-3.8-live и gemini-3.8-live-extended-thinking.
• Цена — у Muse Realtime Avatar нет опубликованной цены, потому что покупать нечего. Gemini 3.8 Live публикует $0.005 за минуту аудиовхода и $0.018 за минуту аудиовыхода через Live API.
• Независимая оценка — у Muse Realtime Avatar её нет; его цифры — собственные цифры Meta, измеренные относительно базовых уровней, которые выбрала сама Meta. Gemini 3.8 Live показывает 76,0 в Artificial Analysis Speech to Speech Index, а вариант с расширенным мышлением — 82,6; это число от независимой третьей стороны, и это совершенно иной класс доказательств.
• Задержка — эти две опубликованные цифры описывают разные измерения, и именно здесь большинство материалов допускают ошибку. Meta сообщает 870 мс от конца вашей реплики до первого байта синхронизированного голосового и видеоответа. Цифра Google, по измерениям Artificial Analysis, составляет 1,18 секунды до первого звука для стандартной модели и 1,35 секунды для reasoning-варианта.
• Частота кадров и язык — Muse Realtime Avatar рендерит портретное видео 448×768 с частотой 25 кадров в секунду. Gemini 3.8 Live обеспечивает автоматическое переключение в середине разговора между 97 поддерживаемыми языками и обрабатывает почти в реальном времени визуальные входные данные.
В последней строке заключено различие, которое люди постоянно стирают. Gemini 3.8 Live умеет видеть. Но не умеет показывать. Muse Realtime Avatar умеет показывать. А умеет ли он видеть — не об этом пост Meta: это генератор на основе аудио, обусловленный речевыми токенами и эталонным изображением, и его задача — создавать лицо, а не считывать его.

Показатели задержки несопоставимы, а разрыв меньше, чем кажется.
870 мс против 1,18 секунды — кажется, что Meta быстрее на 26 %. Но вчитайтесь в измерения — и сравнение рассыпается. Показатель Meta — это время от конца реплики пользователя до первого байта ответа, включающего видео, — и в посте Meta прямо указано, что это измерение до первого байта, а не время до полного ответа и не задержка доставки на протяжении остальной части звонка. Система может уложиться в 870 мс до первого байта и всё равно казаться медленной на двенадцатой секунде. Показатель Google — это время до первого аудио, а это строго меньший объём для создания, и его измеряет внешний оценщик, а не сам вендор.
Оба они — из тех показателей, которые говорят, что система ведёт диалог, а не основана на чередовании реплик, и ни один из них не говорит, каким звонок ощущается на пятой минуте. Если вы выбираете между ними по отзывчивости, честная позиция такова: никто не опубликовал сопоставимого измерения в одинаковых условиях, и единственный способ получить его — запустить тот, который можно вызвать.
На что вы можете опереться сегодня, и чего вам придётся ждать
Gemini 3.8 Live включает то, что нужно для решения о выводе в продакшен: два ID моделей, которые можно закрепить, опубликованные поминутные тарифы, оценку в стороннем индексе и заявленную дату общего выпуска. У него также есть ограничения, обычно присущие голосовым продуктам, — аудио на входе, аудио и текст на выходе и никакой генерации видео.
В Muse Realtime Avatar есть то, что обычно бывает в исследовательском посте: архитектура, четыре заявленных компанией показателя и набор раскрытых тестов предпочтений, которые Meta провела против двух коммерческих аватарных систем, причём одна из них, по сообщению самой Meta, статистически неотличима от паритета по манере поведения. Чего у него нет — так это способа его купить. В посте Meta также отмечается, что не все показанные демо отражают аватары, доступные в приложении Muse, и именно эта фраза должна определять любой план, который вы строите вокруг этого.
Есть третий вариант, который стоит назвать, потому что именно его в реальности выбирает большинство команд. Ни одна из этих моделей не является полноценным агентом. Gemini 3.8 Live передаёт фоновую работу инструментам и API, продолжая разговор; GPT-Live-1 полностью делегирует своё рассуждение отдельной бэкенд-модели. Разговорный слой — это фронтенд, а мышление — это отдельный вызов к другой модели. Этот второй вызов — обычный текстовый инференс, и его можно маршрутизировать.
В OrcaRouter этот слой — один эндпоинт: 196 моделей от 15 провайдеров под одним ключом, по каталожной цене провайдера, передаваемой без наценки, с автоматическим переключением при сбое, если выбранная вами модель выдаёт ошибку или не отвечает вовремя. Мы не размещаем Gemini 3.8 Live — Live API принадлежит только Google — и мы не размещаем Muse Realtime Avatar, который не размещает никто. Мы предоставляем ту половину голосового агента, которая масштабируется в зависимости от того, насколько напряжённо думают ваши звонящие, и ту половину, которую можно менять, ничего не пересогласовывая.

Где эти двое могли бы на самом деле встретиться
Аргумент в пользу того, чтобы поставить их рядом, — не бенчмарки. А то, что обе пытаются занять одно и то же место в продукте: то, с чем пользователь разговаривает. Ставка Google — в том, что это место — разговор, а результат — качественный: 97 языков, фоновое выполнение инструментов, вариант с рассуждениями, который решает 68,6% сценариев клиентского обслуживания τ-Voice против 30,1% у стандартной модели. Ставка Meta — в том, что это место — присутствие, и что пользователь, который видит агента, — это пользователь, который остаётся в разговоре.
Эти ставки не исключают друг друга. Продукт вполне может использовать Gemini 3.8 Live для голосового цикла и что-то вроде Muse Realtime Avatar для визуального слоя, если аватарный слой когда-нибудь станет вызываемым. Чего он не может — так это относиться к ним как к взаимозаменяемым, потому что один из них никогда не даст вам лицо, а другой, возможно, никогда не даст вам эндпоинт.
Как решить
Если вы выпускаете голосовой продукт в этом квартале, решение уже принято за вас: Gemini 3.8 Live можно вызвать, а Muse Realtime Avatar — нет. Выбирайте свой вариант по той оси, вокруг которой на самом деле строятся аргументы в релизе, — модель с расширенным мышлением даёт 38 пунктов выполнения агентных задач за чуть более чем четырёхкратную почасовую стоимость аудио, а стандартная модель — самая дешёвая из работоспособных голосовых моделей в публичном рейтинге. Затем маршрутизируйте делегированные рассуждения отдельно, потому что именно там сосредоточены и расходы, и задержка.
Если вы оцениваете аватарный слой, честный ответ таков: оценивать пока нечего. Есть исследовательский пост с четырьмя цифрами, заявленными компанией, и демонстрацией. Следить нужно не за индексом — Muse Realtime Avatar в него не попадёт — а за тем, опубликует ли Meta прайс-лист, эндпоинт и дату, и выдержит ли показатель в 870 мс, когда аватар работает на телефоне в сотовой сети, а не в демо на Connect.
А до тех пор сравнение имеет более краткую форму, чем ему обычно дают в большинстве статей. Один из них — продукт с ценой, идентификатором модели и внешней оценкой. Другой — очень хорошая демонстрация чего-то, у чего пока нет ничего из этого.

