
Muse Realtime Avatar против Realtime-Venus: видеовыход против видеовхода
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 180 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Две системы, анонсированные с разницей в девять дней, обе называют себя системами реального времени и обе претендуют на ярлык «аудиовизуальные», и при этом они указывают в противоположных направлениях вдоль одной и той же оси. Muse Realtime Avatar, анонсированная Meta 23 сентября 2026 года, берёт фотографию и генерирует видео того, как она говорит, — её видео является выходом, портретные кадры 448×768 со скоростью 25 в секунду, созданные управляемым аудио Diffusion Transformer, который разделяет поток токенов с Muse Realtime Voice. Realtime-Venus, загруженная на arXiv 12 сентября 2026 года командой Venus Team из Ant Group совместно с Университетом Цинхуа, принимает на вход видео: чекпойнт Realtime-Venus-Omni передаёт кадры с камеры через энкодер SigLIP2 и рассказывает о том, что видит, тогда как чекпойнт Realtime-Venus-Audio — это тот же бэкбон с отключённым на этапе загрузки зрением. Одна рендерит лицо. Другая за ним наблюдает. Ни одну из них нельзя вызвать, и только одну из них можно скачать — и это, как выясняется, более значимое различие.
Об инверсии доступности стоит прямо сказать прежде всего остального, потому что она идёт вразрез со всеми ожиданиями о продукте Meta и релизе исследовательской лаборатории. Система Meta закрыта: анонсирована на Connect, продемонстрирована в исследовательском посте, встроена в агент Muse, без API, без весов, без цены и без даты. Система Ant Group открыта: два 9B-чекпоинта в формате BF16 safetensors под Apache-2.0 по адресу inclusionAI/Realtime-Venus на Hugging Face, с кастомным кодом Transformers, файлом requirements, референсным голосом, страницей проекта и сопутствующим репозиторием на GitHub. Компания с потребительским продуктом не выпустила ничего осязаемого. Исследовательская команда выпустила всё целиком.
Что каждый из них делает с фреймом
Направление видео — это всё архитектурное различие, и дело не в акценте.
• Видео — Muse Realtime Avatar генерирует его на основе речевых токенов, эталонного изображения и скользящего окна последних видеолатентов; Realtime-Venus-Omni воспринимает его, а визуальный энкодер SigLIP2 передаёт кадры в модель вместе со звуком.
• Аудио — Muse Realtime Avatar управляет генерацией на основе речевых токенов Muse Realtime Voice, которые несут в себе содержание и просодию вместе; Realtime-Venus генерирует речь в виде дискретных токенов S3, декодируемых потоковым декодером flow-matching, вместо того чтобы прикручивать отдельную модель синтеза речи на выходе.
• Основа — архитектура Meta представляет собой аудиоуправляемый Diffusion Transformer неразглашённого размера; Realtime-Venus построена на языковой основе Qwen3-8B с аудиокодером Whisper-Medium, и в её карточке модели указано, что чекпойнт Omni адаптирован из MiniCPM-o 4.5.
• Веса — веса Muse Realtime Avatar не опубликованы, и нет никаких указаний на то, что они будут опубликованы; Realtime-Venus поставляется с двумя чекпоинтами 9B, BF16, контекстом в 40 960 токенов у обоих, под лицензией Apache-2.0.
• Доступ — У Muse Realtime Avatar нет API и нет даты; у Realtime-Venus тоже нет API, и в его карточке прямо указано, что он не развёрнут ни одним провайдером инференса.
• Где это работает — Muse Realtime Avatar работает внутри приложения Muse для пользователей, которых Meta ещё не перечислила, на условиях 18+; Realtime-Venus уже сегодня работает на ваших собственных GPU, если у вас есть железо и аппетит.
Прочитайте последние две строки вместе — и практическая разница проявится. Ни одну из систем нельзя вызвать. Одну из них можно запустить.
Загрузка 9B реальна, и то, во что она вам обходится, — тоже.
Realtime-Venus — не заглушка репозитория. Веса там есть, кастомный код загрузки там есть, а лицензия верхнего уровня — Apache-2.0. Прежде чем планировать что-либо на его основе, стоит знать о нём две вещи.
Первое — это то, что не содержится в весах. Двухконтурная среда выполнения, которая делает архитектуру отличительной, — односекундный цикл взаимодействия плюс фоновый планировщик, который в статье называется Realtime-Venus-Harness и который выполняет делегированные задачи на основе изолированного снимка состояния разговора, чтобы длительную задачу не мог испортить продолжающийся разговор, — находится в репозитории GitHub как отдельный компонент. Схема делегирования, которая представляет собой по-настоящему новую идею в отчёте, — это та часть, которую вы собираете и которой доверяете сами.
Второе — происхождение. В карточке указано, что чекпоинт Omni адаптирован из MiniCPM-o 4.5 — 9B-омнимодальной модели, которую OpenBMB выложила в открытый доступ ранее в 2026 году. Это не просто сноска. Это означает, что вклад Ant Group — это постобучение, среда выполнения и архитектура делегирования, надстроенные поверх чужого потокового бэкбона, — более узкое и конкретное утверждение, чем «новая 9B omni-модель», и более полезное, потому что оно говорит, куда смотреть, если что-то в визуальном энкодере поведёт себя не так.
Числа, и чьи именно они
Именно здесь две системы сходятся не самым полезным образом: ни у одной из них нет ни одной независимой оценки. Четыре показателя Meta — это данные, заявленные компанией, по базовым уровням, выбранным самой Meta. Показатели Realtime-Venus заявлены авторами в техническом отчёте, при этом ни одна третья сторона не опубликовала запуск, и нет записи в таблице лидеров, с которой можно было бы свериться. Нет публичных измерений ни одной из систем, выполненных кем-либо, кто её не создавал.
Четыре показателя Meta, как опубликовано: 870 мс от конца вашей реплики до первого байта синхронизированного голосового и видеоответа; портретное видео 448×768 при 25 кадрах в секунду; в 60 раз меньше прогонов модели, чем в собственном бейзлайне; и 12 одновременных сессий в реальном времени на одном NVIDIA GB200 — восьмикратный прирост ёмкости по сравнению с двухэтапным бейзлайном Meta на BF16. Meta также публикует результаты сравнения предпочтений с двумя коммерческими аватар-системами, одна из которых, по её сообщению, статистически неотличима от паритета по манере поведения, — и это признание заслуживает уважения, поскольку такие результаты большинство анонсов опускают.
Согласно опубликованным данным Ant Group: лучший результат в шести из восьми видеобенчмарков, используемых в отчёте, включая StreamingBench 70,2, OVO-Bench 64,7 и Daily-Omni 81,3 для чекпоинта Omni; а для аудиочекпоинта — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8 и оценка VoiceBench AlpacaEval 4,81, которую отчёт описывает как совпадающую с лучшим сравнительным показателем.
Об одной асимметрии в данных стоит сказать отдельно. Цифры Ant Group — это оценки бенчмарков с названными наборами тестов, воспроизводимые в принципе любым, кто готов скачать веса и запустить этот набор. Ключевая цифра Meta — это измерение задержки на собственном сервисном стеке Meta, которое никто за пределами Meta воспроизвести не может, потому что ни у кого за пределами Meta нет этой системы. Иными словами, открытый релиз — ещё и более проверяемый.


Почему и то и другое — на самом деле замаскированная проблема маршрутизации
Ни одна из этих систем не является полноценным агентом, и это в равной мере верно для обеих. Muse Realtime Avatar — это слой рендеринга, надстроенный над Muse Realtime Voice; Muse Realtime Voice — разговорный слой агента, чьи рассуждения выполняются на Muse Spark. Realtime-Venus делегирует всё, что превышает её возможности работать инлайн, — извлечение информации, вызовы инструментов, сложные рассуждения — внешнему харнессу, который выполняет работу в фоне по снимку разговора. В обеих схемах то, с чем взаимодействует пользователь, — это фронтенд, а мышление происходит в отдельной текстовой модели.
Эта отдельная текстовая модель — та часть, которую можно маршрутизировать. В OrcaRouter это одна конечная точка для 196 моделей от 15 провайдеров, по цене из прайс-листа провайдера, передаваемой без наценки, с автоматическим переключением при сбое, если модель выдаёт ошибку или истекает время ожидания, — что важнее обычного, когда на другой стороне находится самостоятельно размещённый чекпоинт, который никто независимо не оценивал. Мы не размещаем Realtime-Venus: это файл для скачивания, и мы его не обслуживаем. Мы также не размещаем Muse Realtime Avatar, потому что этого не делает никто. То, что мы предоставляем, — это слой, которому обе архитектуры передают свою сложную работу, поэтому непроверенный компонент с любой стороны разговора — это одна строка конфигурации, а не ставка на продакшен.
Что из этого на самом деле продвинулось дальше?
Инстинктивно хочется сказать, что это система Meta, потому что у Meta есть продукт и демонстрационное видео. Но факты говорят о кое-чём более интересном. У системы Meta лучше продакшн-инженерия — 12 одновременных сессий на GB200 это результат по сервингу, а обнародованные тесты предпочтений против уже выпускаемых аватарных продуктов — единственные прямые сравнительные цифры, которыми располагает любая из двух систем. У системы Ant Group лучше проверяемость: названные бенчмарки, опубликованные веса, лицензия Apache-2.0 и отчёт, который любой может попытаться воспроизвести.
Ни у одного из них нет способа за это заплатить. А тот, что ближе к тому, чтобы стать пригодным к использованию, — не тот, у которого есть потребительское приложение, а тот, который вы можете скачать сегодня вечером и выяснить всё сами, на собственном оборудовании, со своими данными и без каких-либо анонсов.
Если вы выбираете, вопрос не в том, какая модель лучше. А в том, хотите ли вы лицо, которому не можете позвонить, или камеру, которую можете запустить.

