Сгенерированная hero-карточка для «Muse Realtime Avatar: Meta даёт своему агенту Muse Agent лицо — 870 миллисекунд на ход», с надзаголовком «Meta Superintelligence Labs — 23 сентября 2026», заголовком и тремя фактами из исследовательского поста Meta: портретное видео 448×768 при 25 кадрах в секунду, около 870 мс от окончания хода до первого байта и 12 одновременных сеансов реального времени на одном NVIDIA GB200. Подзаголовок гласит: «Это не говорящая голова. Это слой рендеринга поверх голосовой модели». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

Muse Realtime Avatar: Meta даёт своему агенту Muse лицо — 870 миллисекунд на ход

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Число, с которого Meta решила начать, — 870 миллисекунд. Именно столько времениMuse Realtime Avatar требует, по собственному измерению Meta, с момента, когда вы заканчиваете говорить, до момента, когда приходит первый байт синхронизированного ответа с голосом и видео. Это по-настоящему агрессивный показатель для системы, которой приходится генерировать видео, и его стоит читать точно — потому что почти всё интересное в новой модели воплощения Meta кроется в разрыве между тем, что измеряет это число, и тем, что люди предположат, будто оно измеряет.

Muse Realtime Avatar был анонсирован 23 сентября 2026 года на Meta Connect и в тот же день описан Meta Superintelligence Labs в исследовательской публикации под заголовком «Оживляя вашу Muse». Он расширяет Muse Realtime Voice — разговорный слой внутри агента Muse от Meta, — давая ему тело. Это не чат-бот со стандартным аватаром: вы передаёте ему референсное изображение — фотографию, иллюстрацию в полный рост, животное, бытовой предмет — и он рендерит, как этот объект говорит, жестикулирует и меняет позу в непрерывном видео на протяжении всего разговора. Цукерберг сказал со сцены, что аватар, привязанный к его собственному Muse, называется Jolly.

Общий поток токенов, а не проход липсинка

Архитектура — это та часть, которую стоит понять, потому что она объясняет, почему Meta продолжает говорить «воплощение», а не «аватар». Muse Realtime Voice создаёт поток речевых токенов — в публикации они называются VQs, — которые несут как содержание произносимого, так и его просодию: темп, акценты, повышения и понижения. Muse Realtime Avatar потребляет тот же самый поток. Это управляемый аудио Diffusion Transformer, обусловленный этими речевыми токенами, предоставленными вами референсными медиа и скользящим окном недавних видеолатентов, и он генерирует видео короткими причинными фрагментами, передавая каждый новый латент вперёд как контекст движения для следующего.

Совместное использование одного потока токенов — это то, что удерживает голос, движение губ и мимику в жёсткой связке. Альтернатива — сгенерировать аудио, а затем прогнать по нему отдельную модель липсинка — так работает большая часть индустрии аватаров, и именно поэтому многие из таких аватаров выглядят как дублированные. Дизайн Meta устраняет этот шов на уровне конструкции. Скользящее латентное окно — вторая половина идеи: без него генератор на основе чанков дрейфует, и к третьей минуте ваш персонаж незаметно становится кем-то другим.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Четыре опубликованных числа, и что каждое из них на самом деле измеряет

Meta опубликовала больше цифр, чем обычно бывает в исследовательском посте, привязанном к потребительской функции. Все четыре ниже — это данные, сообщённые самой компанией и измеренные Meta относительно выбранных Meta базовых показателей; ни один из них не был воспроизведён за пределами компании.

870 мс от конца реплики до первого байта. Это показатель начала ответа. Это не время до полного ответа и не текущая задержка доставки на протяжении остальной части разговора. Система может уложиться в 870 мс до первого байта и всё равно ощущаться вялой на двенадцатой секунде. В публикации Meta прямо указано, что это метрика первого байта; материалы, опускающие эту оговорку, трактуют её как отзывчивость от начала до конца, чем она не является.

Портретный видеофайл 448×768 с частотой 25 кадров в секунду. Это вытянутый кадр в форме телефонного экрана, а не горизонтальный, и 25 кадров в секунду — это кинематографично, а не плавно: стандартная частота кадров для кино, ниже 30 или 60 кадров в секунду, которые дал бы вам поток с нативной камеры. Meta говорит, что демо помечаются водяным знаком в виде прозрачного оверлея, чтобы получатель мог понять, что он смотрит не на обычный поток с камеры.

В 60 раз меньше оценок модели.Ниже это подробно разъясняется, потому что именно это число чаще всего понимают неправильно.

12 одновременных сессий в реальном времени на одном NVIDIA GB200. Meta сообщает, что её работа по обслуживанию — постоянные KV-кэши, маршрутизация с учётом кэша, динамическое батчирование с учётом задержки, обучение с учётом четырёхбитного квантования, объединённые ядра и захват CUDA Graph, разработанные совместно с NVIDIA — повысила пропускную способность в 8 раз по сравнению с её собственной двухшаговой базовой линией BF16. Арифметика за этим проста: каждый шаг генерации создаёт восемь кадров, что составляет 320 мс воспроизведения, за 20 мс модельного времени, или 2,5 мс на кадр. И 12, и 8× — относительно указанной Meta базовой линии, а не аппаратного обеспечения другого поставщика.

Почему 60× — это не в 60 раз быстрее

Утверждение о сжатии — это то, что будут повторять чаще всего и понимать меньше всего. Модель-учитель от Meta была 40-шаговой диффузионной моделью с трёхсторонним classifier-free guidance — три прохода на шаг, то есть 120 прогонов модели, чтобы создать один фрагмент видео. Ученик — это двухшаговая каузальная модель без guidance с KV-кэшем фиксированной длины, обученная дистилляцией и self-forcing, и ей требуется два прогона для того же фрагмента. Это 60-кратное сокращение числа прогонов на фрагмент при, по словам Meta, качестве, близком к качеству учителя.

Это сокращение вычислений на каждый чанк. В шестьдесят раз меньше вычислений не означает, что пользователь ждёт в шестьдесят раз меньше времени, потому что на задержку влияли и другие факторы до дистилляции, и после неё они всё ещё есть. График в собственном посте Meta показывает, что дало это сокращение с точки зрения качества: доля предпочтений людей выросла с 45% до 55%. Это честная версия истории — целью дистилляции было сделать систему, которая вообще могла бы работать в реальном времени, а издержки по качеству удалось удержать на уровне примерно десяти процентных пунктов предпочтения, а не устранить их.

Оценка, включая результат, который пошёл в обратную сторону

Meta провела тестирование в сравнении с двумя коммерческими системами аватаров — Runway Characters и HeyGen LiveAvatar, — используя совпадающие идентичности аватаров, чтобы оценщики сравнивали анимацию, а не дизайн персонажа. Оценщики вели с каждой системой живые разговоры длительностью от двух до трёх минут, а затем сравнивали визуальное качество, синхронизацию, согласованность персонажа и манеры.

Meta сообщает, что её предпочитают в соотношении 78% против 22% по сравнению с Runway Characters и 88% против 12% по сравнению с HeyGen LiveAvatar, причём предпочитают по каждому оцениваемому измерению. Затем в посте делается то, чего не делает большинство вендорских оценок: раскрывается, что сравнение манер с Runway Characters статистически неотличимо от паритета. Ничья внутри полной победы — мелочь, но именно эта деталь говорит о том, что об этой победе сообщают честно, а не подбирают выгодные данные.

Ограничения теста важнее, чем ничья. Две-три минуты — это короткий разговор. Оценщики были из Meta. И сам пост предупреждает, что его демонстрации «иллюстрируют возможности модели и не все отражают аватары, доступные в приложении Muse», — а это исследовательская команда прямо говорит, что видео, которое вы посмотрели, не обязательно является тем продуктом, который вы получите.

Что вы не можете с ним сделать

Для Muse Realtime Avatar нет API. Нет ни цены, ни тарифной сетки, ни списка ожидания и нет опубликованной даты. Meta не сообщила, когда пользователи или разработчики смогут его использовать. Приложение Muse 18+ — единственная платформа, на которую он ориентирован, и аватар появится вместе с рядом других функций Muse — настройкой голоса, адресом электронной почты Muse, управлением компьютером Mac, интеграцией с очками — у которых свои сроки; некоторые из них обозначены как «в ближайшие месяцы».

Сравнение, которое здесь имеет значение, — не с Runway или HeyGen. Оно — с остальной частью стека Muse. Muse Spark, модель рассуждений, на которой работает агент, доступна разработчикам с тех пор, как Meta открыла доступ к ней через Meta Model API, а Muse Spark 1.2 предоставляется через OrcaRouter как meta/muse-spark-1.2 по $1,25 за миллион входных токенов и $4,25 за миллион выходных токенов, по прайс-листовой цене провайдера с нулевой наценкой, в контекстном окне размером в один миллион токенов, которое уже принимает текст, изображения, видео, аудио и файлы. Это та часть Muse, которую вы можете вызвать уже сегодня. А «лицо» — та часть, которую вы вызвать не можете.

Над этой асимметрией стоит поразмыслить, если вы что-то планируете. Агент, который рассуждает в ходе видеозвонка, и агент, который появляется в видеозвонке, — это разные продукты с разными ограничениями, и только один из них фигурирует в прайс-листе.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

Что посмотреть дальше

Три вещи превратили бы это из анонса в решение. Первая — дата выпуска аватара внутри Muse, потому что всё, что опубликовала Meta, касается модели, и ничто из опубликованного ею не касается продукта, которым можно пользоваться в четверг. Вторая — измерение задержки, проведённое на протяжении долгого разговора, а не на первом байте: 870 мс — это стартовый выстрел, а вопрос, который задаёт настоящий звонок, — что происходит на десятой минуте. Третья — сохраняет ли система характер в состязательных условиях: пользователь, который намеренно меняет тему, действует быстро или подаёт ей референсное изображение, призванное выглядеть как реальный человек.

А до тех пор честная формулировка — это то, что исследовательский пост подразумевает, не проговаривая прямо. Muse Realtime Avatar — это настоящая инженерная разработка, за которой стоит реальный результат по сжатию, продемонстрированный в контролируемых условиях и оценённый компанией, которая её создала, в разговорах, длившихся ровно столько, сколько занимает заказ кофе. Это не вымышленный продукт. И это также не то, что можно купить, маршрутизировать или протестировать в бенчмарке — а это разные утверждения.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.