
Muse Realtime Avatar: Meta даёт своему агенту Muse лицо — 870 миллисекунд на ход
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 180 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Число, с которого Meta решила начать, — 870 миллисекунд. Именно столько времениMuse Realtime Avatar требует, по собственному измерению Meta, с момента, когда вы заканчиваете говорить, до момента, когда приходит первый байт синхронизированного ответа с голосом и видео. Это по-настоящему агрессивный показатель для системы, которой приходится генерировать видео, и его стоит читать точно — потому что почти всё интересное в новой модели воплощения Meta кроется в разрыве между тем, что измеряет это число, и тем, что люди предположат, будто оно измеряет.
Muse Realtime Avatar был анонсирован 23 сентября 2026 года на Meta Connect и в тот же день описан Meta Superintelligence Labs в исследовательской публикации под заголовком «Оживляя вашу Muse». Он расширяет Muse Realtime Voice — разговорный слой внутри агента Muse от Meta, — давая ему тело. Это не чат-бот со стандартным аватаром: вы передаёте ему референсное изображение — фотографию, иллюстрацию в полный рост, животное, бытовой предмет — и он рендерит, как этот объект говорит, жестикулирует и меняет позу в непрерывном видео на протяжении всего разговора. Цукерберг сказал со сцены, что аватар, привязанный к его собственному Muse, называется Jolly.
Общий поток токенов, а не проход липсинка
Архитектура — это та часть, которую стоит понять, потому что она объясняет, почему Meta продолжает говорить «воплощение», а не «аватар». Muse Realtime Voice создаёт поток речевых токенов — в публикации они называются VQs, — которые несут как содержание произносимого, так и его просодию: темп, акценты, повышения и понижения. Muse Realtime Avatar потребляет тот же самый поток. Это управляемый аудио Diffusion Transformer, обусловленный этими речевыми токенами, предоставленными вами референсными медиа и скользящим окном недавних видеолатентов, и он генерирует видео короткими причинными фрагментами, передавая каждый новый латент вперёд как контекст движения для следующего.
Совместное использование одного потока токенов — это то, что удерживает голос, движение губ и мимику в жёсткой связке. Альтернатива — сгенерировать аудио, а затем прогнать по нему отдельную модель липсинка — так работает большая часть индустрии аватаров, и именно поэтому многие из таких аватаров выглядят как дублированные. Дизайн Meta устраняет этот шов на уровне конструкции. Скользящее латентное окно — вторая половина идеи: без него генератор на основе чанков дрейфует, и к третьей минуте ваш персонаж незаметно становится кем-то другим.

Четыре опубликованных числа, и что каждое из них на самом деле измеряет
Meta опубликовала больше цифр, чем обычно бывает в исследовательском посте, привязанном к потребительской функции. Все четыре ниже — это данные, сообщённые самой компанией и измеренные Meta относительно выбранных Meta базовых показателей; ни один из них не был воспроизведён за пределами компании.
• 870 мс от конца реплики до первого байта. Это показатель начала ответа. Это не время до полного ответа и не текущая задержка доставки на протяжении остальной части разговора. Система может уложиться в 870 мс до первого байта и всё равно ощущаться вялой на двенадцатой секунде. В публикации Meta прямо указано, что это метрика первого байта; материалы, опускающие эту оговорку, трактуют её как отзывчивость от начала до конца, чем она не является.
• Портретный видеофайл 448×768 с частотой 25 кадров в секунду. Это вытянутый кадр в форме телефонного экрана, а не горизонтальный, и 25 кадров в секунду — это кинематографично, а не плавно: стандартная частота кадров для кино, ниже 30 или 60 кадров в секунду, которые дал бы вам поток с нативной камеры. Meta говорит, что демо помечаются водяным знаком в виде прозрачного оверлея, чтобы получатель мог понять, что он смотрит не на обычный поток с камеры.
• В 60 раз меньше оценок модели.Ниже это подробно разъясняется, потому что именно это число чаще всего понимают неправильно.
• 12 одновременных сессий в реальном времени на одном NVIDIA GB200. Meta сообщает, что её работа по обслуживанию — постоянные KV-кэши, маршрутизация с учётом кэша, динамическое батчирование с учётом задержки, обучение с учётом четырёхбитного квантования, объединённые ядра и захват CUDA Graph, разработанные совместно с NVIDIA — повысила пропускную способность в 8 раз по сравнению с её собственной двухшаговой базовой линией BF16. Арифметика за этим проста: каждый шаг генерации создаёт восемь кадров, что составляет 320 мс воспроизведения, за 20 мс модельного времени, или 2,5 мс на кадр. И 12, и 8× — относительно указанной Meta базовой линии, а не аппаратного обеспечения другого поставщика.
Почему 60× — это не в 60 раз быстрее
Утверждение о сжатии — это то, что будут повторять чаще всего и понимать меньше всего. Модель-учитель от Meta была 40-шаговой диффузионной моделью с трёхсторонним classifier-free guidance — три прохода на шаг, то есть 120 прогонов модели, чтобы создать один фрагмент видео. Ученик — это двухшаговая каузальная модель без guidance с KV-кэшем фиксированной длины, обученная дистилляцией и self-forcing, и ей требуется два прогона для того же фрагмента. Это 60-кратное сокращение числа прогонов на фрагмент при, по словам Meta, качестве, близком к качеству учителя.
Это сокращение вычислений на каждый чанк. В шестьдесят раз меньше вычислений не означает, что пользователь ждёт в шестьдесят раз меньше времени, потому что на задержку влияли и другие факторы до дистилляции, и после неё они всё ещё есть. График в собственном посте Meta показывает, что дало это сокращение с точки зрения качества: доля предпочтений людей выросла с 45% до 55%. Это честная версия истории — целью дистилляции было сделать систему, которая вообще могла бы работать в реальном времени, а издержки по качеству удалось удержать на уровне примерно десяти процентных пунктов предпочтения, а не устранить их.
Оценка, включая результат, который пошёл в обратную сторону
Meta провела тестирование в сравнении с двумя коммерческими системами аватаров — Runway Characters и HeyGen LiveAvatar, — используя совпадающие идентичности аватаров, чтобы оценщики сравнивали анимацию, а не дизайн персонажа. Оценщики вели с каждой системой живые разговоры длительностью от двух до трёх минут, а затем сравнивали визуальное качество, синхронизацию, согласованность персонажа и манеры.
Meta сообщает, что её предпочитают в соотношении 78% против 22% по сравнению с Runway Characters и 88% против 12% по сравнению с HeyGen LiveAvatar, причём предпочитают по каждому оцениваемому измерению. Затем в посте делается то, чего не делает большинство вендорских оценок: раскрывается, что сравнение манер с Runway Characters статистически неотличимо от паритета. Ничья внутри полной победы — мелочь, но именно эта деталь говорит о том, что об этой победе сообщают честно, а не подбирают выгодные данные.
Ограничения теста важнее, чем ничья. Две-три минуты — это короткий разговор. Оценщики были из Meta. И сам пост предупреждает, что его демонстрации «иллюстрируют возможности модели и не все отражают аватары, доступные в приложении Muse», — а это исследовательская команда прямо говорит, что видео, которое вы посмотрели, не обязательно является тем продуктом, который вы получите.
Что вы не можете с ним сделать
Для Muse Realtime Avatar нет API. Нет ни цены, ни тарифной сетки, ни списка ожидания и нет опубликованной даты. Meta не сообщила, когда пользователи или разработчики смогут его использовать. Приложение Muse 18+ — единственная платформа, на которую он ориентирован, и аватар появится вместе с рядом других функций Muse — настройкой голоса, адресом электронной почты Muse, управлением компьютером Mac, интеграцией с очками — у которых свои сроки; некоторые из них обозначены как «в ближайшие месяцы».
Сравнение, которое здесь имеет значение, — не с Runway или HeyGen. Оно — с остальной частью стека Muse. Muse Spark, модель рассуждений, на которой работает агент, доступна разработчикам с тех пор, как Meta открыла доступ к ней через Meta Model API, а Muse Spark 1.2 предоставляется через OrcaRouter как meta/muse-spark-1.2 по $1,25 за миллион входных токенов и $4,25 за миллион выходных токенов, по прайс-листовой цене провайдера с нулевой наценкой, в контекстном окне размером в один миллион токенов, которое уже принимает текст, изображения, видео, аудио и файлы. Это та часть Muse, которую вы можете вызвать уже сегодня. А «лицо» — та часть, которую вы вызвать не можете.
Над этой асимметрией стоит поразмыслить, если вы что-то планируете. Агент, который рассуждает в ходе видеозвонка, и агент, который появляется в видеозвонке, — это разные продукты с разными ограничениями, и только один из них фигурирует в прайс-листе.

Что посмотреть дальше
Три вещи превратили бы это из анонса в решение. Первая — дата выпуска аватара внутри Muse, потому что всё, что опубликовала Meta, касается модели, и ничто из опубликованного ею не касается продукта, которым можно пользоваться в четверг. Вторая — измерение задержки, проведённое на протяжении долгого разговора, а не на первом байте: 870 мс — это стартовый выстрел, а вопрос, который задаёт настоящий звонок, — что происходит на десятой минуте. Третья — сохраняет ли система характер в состязательных условиях: пользователь, который намеренно меняет тему, действует быстро или подаёт ей референсное изображение, призванное выглядеть как реальный человек.
А до тех пор честная формулировка — это то, что исследовательский пост подразумевает, не проговаривая прямо. Muse Realtime Avatar — это настоящая инженерная разработка, за которой стоит реальный результат по сжатию, продемонстрированный в контролируемых условиях и оценённый компанией, которая её создала, в разговорах, длившихся ровно столько, сколько занимает заказ кофе. Это не вымышленный продукт. И это также не то, что можно купить, маршрутизировать или протестировать в бенчмарке — а это разные утверждения.

