Сгенерированная hero-карточка для «Muse Realtime Avatar» с надписью сверху «Meta AI Research — 23 сентября 2026 г.», заголовком и тремя подписанными карточками с текстом: «Muse Realtime Voice — разговорный слой, потоковые речевые токены», «Muse Realtime Avatar — слой воплощения, построенный поверх него, только для исследований» и «Muse Spark 1.2 — модель Muse, которую уже сегодня можно маршрутизировать через OrcaRouter». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

Muse Realtime Avatar: что построила Meta, на чём он работает и почему вы всё ещё не можете ему позвонить

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Muse Realtime Avatar — это технология воплощения от Meta. Она берет речевой поток, который Muse Realtime Voice создает, и воспроизводит соответствующее исполнение: наведите её на фотографический портрет — и лицо ответит небольшими изменениями мимики; наведите её на иллюстрацию в полный рост — и персонаж жестикулирует и меняет позу, пока говорит. Meta AI Research представила её 23 сентября 2026 года в посте под названием «Bringing Your Muse to Life». Это результат исследования, а не продукт — на собственной странице Meta нет ни API, ни цены, ни списка ожидания, ни даты публикации для неё — поэтому честный ответ на вопрос «можно ли использовать её сегодня» — нет. Модель Muse, которую можно вызвать сегодня, — другая, Meta Muse Spark 1.2.

Этот ответ стоит изложить в первом абзаце, а не в последнем, потому что читатель, который ищет это название, обычно решает, стоит ли планировать с учётом этого. Планируйте исходя из исследования, а не из конечной точки.

Об одном стоит сказать прямо, прежде чем что-либо ещё, потому что эта страница нарушает правило, и ей следовало бы это признать. Этот блог обычно пишет о моделях в неделю их запуска. Muse Realtime Avatar была анонсирована за неделю до появления этой страницы, так что при строгом прочтении окна свежести этот материал был бы пропущен. Это не новостная статья о событии, привязанном к дате. Это справочная страница о модели, которая сегодня живёт в разговоре о каталоге: страница, на которую читатель попадает, набрав название самой модели, и её основание — устойчивый поисковый спрос, который мы измерили сами, а не свежесть запуска. Сентябрьский анонс упоминается здесь как факт, датирующий модель, а не как событие, о котором нужно сообщать, и ничто ниже не является вторым анонсом. Наш материал о том дне — отдельная публикация, и она остаётся отдельной.

Какое место оно занимает в семействе Muse

Meta прямо заявляет, что это два слоя одной системы, а не два продукта. В формулировке Meta: «Muse Realtime Voice и Muse Realtime Avatar образуют единую потоковую систему, соединяющую интеллект, голос и воплощение». Голосовой слой обеспечивает интеллект для ведения разговора и выдаёт поток речевых токенов — Meta называет их VQs, — которые несут и то, что говорится, и то, как это подаётся. Аудиодекодер превращает эти токены в звук, а слой аватара потребляет тот же поток, чтобы генерировать изображение. Именно общий поток токенов удерживает голос, движение губ и мимику синхронными; отдельного этапа синхронизации губ, прикрученного задним числом, здесь нет.

Итак: Muse Realtime Voice — это разговорный слой. Muse Realtime Avatar — это слой воплощения, построенный поверх него. Ни то, ни другое не является тем, что можно вызвать.

Проявляйте такую же осторожность и в отношении соседнего названия, потому что именно его с наибольшей вероятностью можно спутать с любым из двух. Muse Voice Transcribe — это эндпоинт транскрипции, и это действительно другой продукт. Документация для разработчиков Meta недвусмысленна: «Он предназначен только для преобразования речи в текст; он не синтезирует речь и не предоставляет API для разговора в режиме речь-в-речь». Он возвращает временные метки на уровне реплик, а не на уровне слов, и Meta указывает его цену на той странице как $0.18 в час. Это настоящий эндпоинт с установленной ценой. Это не голос и уж точно не аватар.

Модель Muse, к которой действительно можно обратиться, — это Meta Muse Spark 1.2, модель рассуждений, которую Meta выпускает с контекстом в миллион токенов и поддержкой ввода текста, изображений, видео, файлов и аудио. Именно её здесь можно маршрутизировать уже сегодня, по цене провайдера из прайс-листа, без наценки, по тому же ключу, что и всё остальное в каталоге, а её актуальная карточка содержит полную спецификацию. Muse Realtime Avatar мы не предоставляем. Мы ещё раз проверили актуальный список моделей, пока писали это, и единственные записи Muse в нём — два чекпоинта Spark: 1.2 и его предшественник 1.1. Любая более мягкая формулировка, чем эта, — что семейство «частично доступно», — подразумевала бы, что мы маршрутизируем то, что на самом деле не маршрутизируем.

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Технология, изложенная собственными словами Meta

Описание архитектуры от Meta достаточно компактно, чтобы процитировать его, а не пересказывать. Muse Realtime Avatar — это «управляемый аудио диффузионный трансформер, обусловленный потоком речевых токенов, референсными медиа и скользящим окном последних видеолатентов», и он «генерирует видео короткими каузальными фрагментами». Вторая половина этого предложения — несущая часть: по завершении каждого фрагмента его новейшие сгенерированные латенты становятся контекстом движения для следующего. Заявленная причина от Meta — непрерывность: внешность и манеры аватара сохраняются от хода к ходу, а вычисления остаются ограниченными, что позволяет генерации продолжаться столько же, сколько длится разговор, вместо того чтобы дрейфовать или исчерпывать бюджет.

Механизм подтверждения происхождения следует оставить в том же абзаце, потому что Meta представляет его как часть системы, а не как что-то добавленное задним числом: сгенерированное видео несёт устойчивый невидимый водяной знак, наносимый с помощью Meta Video Seal, который, по словам Meta, не добавляет задержки в конвейер реального времени.

Meta измерила эту штуку и опубликовала для неё четыре цифры. Эти цифры — и конкретные оговорки, нужные каждой из них, включая ту, что читается как ускорение и ускорением не является, — относятся к публикации о запуске, где они приведены с сохранённым контекстом. Мы не собираемся повторять здесь голые цифры, потому что голая цифра — это ровно то, что версия с оговорками призвана предотвращать.

В день анонса мы осветили его в нашей публикации о запуске Muse Realtime Avatar, и она по-прежнему остаётся местом, где можно в полном объёме прочитать взвешенные формулировки.

Что не является именем

Трёх ложных соседей стоит исключать по одному, потому что каждый из них — разумная догадка, основанная лишь на названии.

• Это не Muse Voice Transcribe. Этот эндпоинт преобразует речь в текст и, согласно собственному описанию Meta, не делает ничего в обратном направлении. Если вам нужен транскрипт, Meta продаёт его, и это другая вещь с другой ценой.

• Это не сервис клонирования голоса. Ни на одной из страниц Meta не описывается синтез голоса конкретного человека, продажа голосовой модели или приём образца голоса от пользователя. Голосовой слой описывается как создающий поток токенов; слой аватара — как потребляющий его. Форма продукта, которую обычно подразумевает эта фраза — загрузите образец, получите клон, — не то, что описывается здесь, а демонстрационные материалы, которые Meta действительно публикует, подаются как иллюстрация возможностей модели.

• Это не потребительский аватар в собственном приложении Meta. Meta сопровождает свои примеры оговоркой, которую легко не заметить и которую стоит запомнить: демонстрации «иллюстрируют возможности модели и не все отражают аватары, доступные в приложении Muse», а Muse предназначено для пользователей в возрасте 18 лет и старше. Читайте это буквально. Кое-что из показанного в посте — это возможности, а не ассортимент.

Четвёртое название стоит отделить по другой причине. Muse Realtime Avatar — это не Muse Video, модель генерации видео, которая большую часть этого года провисела в публичном лидерборде, так и не выйдя. Наша собственная страница об этой ситуации — Muse Video: дата выхода, доступ к API и что может изменить Meta Connect — содержит ограничение, которое мы повторим здесь дословно, а не станем улучшать: любая страница, называющая конкретный день запуска или цену для Muse Video без более свежего анонса Meta, занимается спекуляциями. Та же дисциплина применяется к теме этой страницы, поэтому эта страница не называет ни того, ни другого. В том материале также указана дата, которую не нам путать: Muse Video представлена в предварительном просмотре 7 июля 2026 года и не выпущена — вот почему поиск по этому семейству выдаёт даты, относящиеся к другой модели.

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Для чего эта страница и что могло бы её изменить

Причина, по которой справочная страница — правильный формат в данном случае, измерима. За 28 дней, закончившихся 25 сентября 2026 года, точный запрос получил 164 показа в нашем поисковом ресурсе и ни одного клика, а его лучшая позиция — 9,3. Более пятидесяти наших страниц где-то упоминают этот фрагмент, и почти весь этот трафик приходится на один анонсный пост. Термин с реальным, устойчивым спросом, находящийся сразу за пределами первой страницы и не конвертирующий никого, — это не проблема спроса и не проблема качества, а проблема страницы. Не было страницы, темой которой была бы сама модель. Эта страница — она.

Такая позиция — ещё и причина, по которой ничто здесь не подаётся как новость. Читатель, пришедший из поиска по названию, хочет узнать три вещи по порядку: что это, доступно ли это и на чём это построено. Ответы на них даны выше, именно в этом порядке, без выдуманных дат и без упоминания конкурентов.

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

Что изменило бы эту страницу — так это одно-единственное объявление. Если Meta опубликует эндпоинт, цену, лист ожидания или дату для Muse Realtime Avatar, раздел о доступности перестанет быть отказом и станет спецификацией, и эту страницу придётся переписывать, а не дополнять. Если Meta выпустит Muse Video, абзац выше изменится вместе с ним. Пока не случилось ни того, ни другого, полезный шаг для разработчика — самый неброский: держать уже имеющийся у вас интерфейс нацеленным на модель, до которой вы действительно можете дотянуться. Каждая модель в каталоге, включая Meta Muse Spark 1.2, стоит за одним эндпоинтом, совместимым с OpenAI, и одним ключом, а значит, попробовать ту часть этого семейства, которая существует, стоит вам смены строки с названием модели, а не нового контракта. Когда слой воплощения станет вызываемым, стоимость переключения тоже должна быть строкой.