Сгенерированная hero-карточка для статьи «Muse Realtime Avatar vs Realtime-Venus», на которой показаны две скруглённые карточки по обе стороны от заголовка. На левой карточке написано «Muse Realtime Avatar» над значком исходящего видеокадра и строки «генерирует видео» и «448x768 при 25 fps, закрытая»; на правой карточке написано «Realtime-Venus» над значком входящей камеры и строки «считывает видео» и «2 x 9B, Apache-2.0, можно скачать». Подзаголовок гласит: «Один отрисовывает лицо. Другой смотрит на него.» Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Muse Realtime Avatar против Realtime-Venus: видеовыход против видеовхода

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две системы, анонсированные с разницей в девять дней, обе называют себя системами реального времени и обе претендуют на ярлык «аудиовизуальные», и при этом они указывают в противоположных направлениях вдоль одной и той же оси. Muse Realtime Avatar, анонсированная Meta 23 сентября 2026 года, берёт фотографию и генерирует видео того, как она говорит, — её видео является выходом, портретные кадры 448×768 со скоростью 25 в секунду, созданные управляемым аудио Diffusion Transformer, который разделяет поток токенов с Muse Realtime Voice. Realtime-Venus, загруженная на arXiv 12 сентября 2026 года командой Venus Team из Ant Group совместно с Университетом Цинхуа, принимает на вход видео: чекпойнт Realtime-Venus-Omni передаёт кадры с камеры через энкодер SigLIP2 и рассказывает о том, что видит, тогда как чекпойнт Realtime-Venus-Audio — это тот же бэкбон с отключённым на этапе загрузки зрением. Одна рендерит лицо. Другая за ним наблюдает. Ни одну из них нельзя вызвать, и только одну из них можно скачать — и это, как выясняется, более значимое различие.

Об инверсии доступности стоит прямо сказать прежде всего остального, потому что она идёт вразрез со всеми ожиданиями о продукте Meta и релизе исследовательской лаборатории. Система Meta закрыта: анонсирована на Connect, продемонстрирована в исследовательском посте, встроена в агент Muse, без API, без весов, без цены и без даты. Система Ant Group открыта: два 9B-чекпоинта в формате BF16 safetensors под Apache-2.0 по адресу inclusionAI/Realtime-Venus на Hugging Face, с кастомным кодом Transformers, файлом requirements, референсным голосом, страницей проекта и сопутствующим репозиторием на GitHub. Компания с потребительским продуктом не выпустила ничего осязаемого. Исследовательская команда выпустила всё целиком.

Что каждый из них делает с фреймом

Направление видео — это всё архитектурное различие, и дело не в акценте.

Видео — Muse Realtime Avatar генерирует его на основе речевых токенов, эталонного изображения и скользящего окна последних видеолатентов; Realtime-Venus-Omni воспринимает его, а визуальный энкодер SigLIP2 передаёт кадры в модель вместе со звуком.

Аудио — Muse Realtime Avatar управляет генерацией на основе речевых токенов Muse Realtime Voice, которые несут в себе содержание и просодию вместе; Realtime-Venus генерирует речь в виде дискретных токенов S3, декодируемых потоковым декодером flow-matching, вместо того чтобы прикручивать отдельную модель синтеза речи на выходе.

Основа — архитектура Meta представляет собой аудиоуправляемый Diffusion Transformer неразглашённого размера; Realtime-Venus построена на языковой основе Qwen3-8B с аудиокодером Whisper-Medium, и в её карточке модели указано, что чекпойнт Omni адаптирован из MiniCPM-o 4.5.

Веса — веса Muse Realtime Avatar не опубликованы, и нет никаких указаний на то, что они будут опубликованы; Realtime-Venus поставляется с двумя чекпоинтами 9B, BF16, контекстом в 40 960 токенов у обоих, под лицензией Apache-2.0.

Доступ — У Muse Realtime Avatar нет API и нет даты; у Realtime-Venus тоже нет API, и в его карточке прямо указано, что он не развёрнут ни одним провайдером инференса.

Где это работает — Muse Realtime Avatar работает внутри приложения Muse для пользователей, которых Meta ещё не перечислила, на условиях 18+; Realtime-Venus уже сегодня работает на ваших собственных GPU, если у вас есть железо и аппетит.

Прочитайте последние две строки вместе — и практическая разница проявится. Ни одну из систем нельзя вызвать. Одну из них можно запустить.

Загрузка 9B реальна, и то, во что она вам обходится, — тоже.

Realtime-Venus — не заглушка репозитория. Веса там есть, кастомный код загрузки там есть, а лицензия верхнего уровня — Apache-2.0. Прежде чем планировать что-либо на его основе, стоит знать о нём две вещи.

Первое — это то, что не содержится в весах. Двухконтурная среда выполнения, которая делает архитектуру отличительной, — односекундный цикл взаимодействия плюс фоновый планировщик, который в статье называется Realtime-Venus-Harness и который выполняет делегированные задачи на основе изолированного снимка состояния разговора, чтобы длительную задачу не мог испортить продолжающийся разговор, — находится в репозитории GitHub как отдельный компонент. Схема делегирования, которая представляет собой по-настоящему новую идею в отчёте, — это та часть, которую вы собираете и которой доверяете сами.

Второе — происхождение. В карточке указано, что чекпоинт Omni адаптирован из MiniCPM-o 4.5 — 9B-омнимодальной модели, которую OpenBMB выложила в открытый доступ ранее в 2026 году. Это не просто сноска. Это означает, что вклад Ant Group — это постобучение, среда выполнения и архитектура делегирования, надстроенные поверх чужого потокового бэкбона, — более узкое и конкретное утверждение, чем «новая 9B omni-модель», и более полезное, потому что оно говорит, куда смотреть, если что-то в визуальном энкодере поведёт себя не так.

Числа, и чьи именно они

Именно здесь две системы сходятся не самым полезным образом: ни у одной из них нет ни одной независимой оценки. Четыре показателя Meta — это данные, заявленные компанией, по базовым уровням, выбранным самой Meta. Показатели Realtime-Venus заявлены авторами в техническом отчёте, при этом ни одна третья сторона не опубликовала запуск, и нет записи в таблице лидеров, с которой можно было бы свериться. Нет публичных измерений ни одной из систем, выполненных кем-либо, кто её не создавал.

Четыре показателя Meta, как опубликовано: 870 мс от конца вашей реплики до первого байта синхронизированного голосового и видеоответа; портретное видео 448×768 при 25 кадрах в секунду; в 60 раз меньше прогонов модели, чем в собственном бейзлайне; и 12 одновременных сессий в реальном времени на одном NVIDIA GB200 — восьмикратный прирост ёмкости по сравнению с двухэтапным бейзлайном Meta на BF16. Meta также публикует результаты сравнения предпочтений с двумя коммерческими аватар-системами, одна из которых, по её сообщению, статистически неотличима от паритета по манере поведения, — и это признание заслуживает уважения, поскольку такие результаты большинство анонсов опускают.

Согласно опубликованным данным Ant Group: лучший результат в шести из восьми видеобенчмарков, используемых в отчёте, включая StreamingBench 70,2, OVO-Bench 64,7 и Daily-Omni 81,3 для чекпоинта Omni; а для аудиочекпоинта — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8 и оценка VoiceBench AlpacaEval 4,81, которую отчёт описывает как совпадающую с лучшим сравнительным показателем.

Об одной асимметрии в данных стоит сказать отдельно. Цифры Ant Group — это оценки бенчмарков с названными наборами тестов, воспроизводимые в принципе любым, кто готов скачать веса и запустить этот набор. Ключевая цифра Meta — это измерение задержки на собственном сервисном стеке Meta, которое никто за пределами Meta воспроизвести не может, потому что ни у кого за пределами Meta нет этой системы. Иными словами, открытый релиз — ещё и более проверяемый.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

Почему и то и другое — на самом деле замаскированная проблема маршрутизации

Ни одна из этих систем не является полноценным агентом, и это в равной мере верно для обеих. Muse Realtime Avatar — это слой рендеринга, надстроенный над Muse Realtime Voice; Muse Realtime Voice — разговорный слой агента, чьи рассуждения выполняются на Muse Spark. Realtime-Venus делегирует всё, что превышает её возможности работать инлайн, — извлечение информации, вызовы инструментов, сложные рассуждения — внешнему харнессу, который выполняет работу в фоне по снимку разговора. В обеих схемах то, с чем взаимодействует пользователь, — это фронтенд, а мышление происходит в отдельной текстовой модели.

Эта отдельная текстовая модель — та часть, которую можно маршрутизировать. В OrcaRouter это одна конечная точка для 196 моделей от 15 провайдеров, по цене из прайс-листа провайдера, передаваемой без наценки, с автоматическим переключением при сбое, если модель выдаёт ошибку или истекает время ожидания, — что важнее обычного, когда на другой стороне находится самостоятельно размещённый чекпоинт, который никто независимо не оценивал. Мы не размещаем Realtime-Venus: это файл для скачивания, и мы его не обслуживаем. Мы также не размещаем Muse Realtime Avatar, потому что этого не делает никто. То, что мы предоставляем, — это слой, которому обе архитектуры передают свою сложную работу, поэтому непроверенный компонент с любой стороны разговора — это одна строка конфигурации, а не ставка на продакшен.

Что из этого на самом деле продвинулось дальше?

Инстинктивно хочется сказать, что это система Meta, потому что у Meta есть продукт и демонстрационное видео. Но факты говорят о кое-чём более интересном. У системы Meta лучше продакшн-инженерия — 12 одновременных сессий на GB200 это результат по сервингу, а обнародованные тесты предпочтений против уже выпускаемых аватарных продуктов — единственные прямые сравнительные цифры, которыми располагает любая из двух систем. У системы Ant Group лучше проверяемость: названные бенчмарки, опубликованные веса, лицензия Apache-2.0 и отчёт, который любой может попытаться воспроизвести.

Ни у одного из них нет способа за это заплатить. А тот, что ближе к тому, чтобы стать пригодным к использованию, — не тот, у которого есть потребительское приложение, а тот, который вы можете скачать сегодня вечером и выяснить всё сами, на собственном оборудовании, со своими данными и без каких-либо анонсов.

Если вы выбираете, вопрос не в том, какая модель лучше. А в том, хотите ли вы лицо, которому не можете позвонить, или камеру, которую можете запустить.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.