
Muse Realtime Avatar vs SeedRealtime: две модели, за которыми можно только наблюдать
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 180 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Ни у одного из них нет прайс-листа. Muse Realtime Avatar, анонсированный Meta 23 сентября 2026 года на Meta Connect, не имеет ни API, ни эндпоинта, ни цены, ни даты — это возможность агента Muse от Meta, продемонстрированная в исследовательской публикации под названием «Bringing Your Muse to Life». SeedRealtime, выпущенный ByteDance Seed 5 августа 2026 года, не имеет ни API, ни весов, ни технического отчёта, ни сведений о числе параметров — он существует внутри собственного приложения Doubao от ByteDance, а в посте ByteDance говорится лишь о том, что он был «полностью внедрён». Две из крупнейших в мире потребительских ИИ-компаний выпустили аудиовизуальные системы реального времени с разницей в семь недель, и ни одну из них нельзя купить. Вот это и есть сравнение, и оно интереснее, чем таблица бенчмарков, которую никто не может построить.
Что их различает — это направление видеопотока. SeedRealtime смотрит, слушает и рассказывает о том, что видит, — аудио, видео и текст поступают в одну сквозную сеть, а передача очереди говорящего перенесена из внешнего детектора голосовой активности в саму модель. Muse Realtime Avatar генерирует: вы даёте ему опорное изображение — фотографию, иллюстрацию или объект, — и он отображает, как этот объект говорит и жестикулирует, в непрерывном видео на протяжении всего разговора. Видео у SeedRealtime — это вход. Видео у Muse Realtime Avatar — это выход. Оба описываются как полнодуплексные, оба являются аудиовизуальными, и они выполняют противоположные задачи с этим обозначением.
Что представляет собой каждый из них и где он находится
Шесть строк, и последние две — те, что вообще что-то решают.
• Видео — Muse Realtime Avatar генерирует его в портретном разрешении 448×768 и со скоростью 25 кадров в секунду, с водяным знаком в виде прозрачного оверлея, чтобы зритель мог понять, что это не поток с камеры; SeedRealtime воспринимает его, передавая кадры в ту же сеть, которая обрабатывает аудио.
• Архитектурная ставка — Muse Realtime Avatar использует единый поток токенов для голоса и видео, поэтому управляемый аудио Diffusion Transformer напрямую потребляет речевые токены Muse Realtime Voice, и после этого ничего не синхронизируется с губами; SeedRealtime встраивает смену реплик в саму модель, поэтому то, кто и когда говорит, перестаёт быть решением внешнего детектора голосовой активности.
• Где это работает — Muse Realtime Avatar — это функция внутри агента Muse от Meta; SeedRealtime — внутри приложения Doubao от ByteDance.
• Доступ для разработчиков — ни у одного из них нет API. Ни один из них не публикует веса. Нет бессерверного варианта, нет хостируемого эндпоинта и нет сторонней платформы, предоставляющей любой из них.
• Цена — не раскрыта для обеих сторон, поскольку ни с одной стороны нет коммерческого предложения.
• Независимая оценка — отсутствует для обеих систем. Все цифры, которые каждая компания опубликовала о своей собственной модели, получены от неё же самой, и ни один сторонний оценщик не тестировал ни одну из них.
Две доказательные базы, обе — из первых рук, и одна из них гораздо тоньше.
Здесь сравнение перестаёт быть симметричным. Meta опубликовала четыре показателя для Muse Realtime Avatar, все — по данным компании, измеренные относительно базовых вариантов, выбранных Meta, и ни один не воспроизведён за пределами компании: 870 мс от окончания вашей реплики до первого байта синхронизированного голосового и видеоответа; вертикальное видео 448×768 с частотой 25 кадров в секунду; в 60 раз меньше прогонов модели, чем в её собственной базовой конфигурации; и 12 одновременных сессий в реальном времени на одном NVIDIA GB200 — 8-кратный прирост ёмкости по сравнению с двухшаговой базовой конфигурацией Meta на BF16, достигнутый благодаря 4-битному обучению с учётом квантования и динамическому батчингу с учётом задержек. Meta также опубликовала сравнение предпочтений с двумя коммерческими аватарными системами — 78/22 против одной, 88/12 против другой — и раскрыла, что по манере поведения результат против одной из них статистически неотличим от равного счёта. Это раскрытие ценнее побед; такие результаты большинство постов о запуске опускают.
Опубликованное свидетельство SeedRealtime — это одна сквозная оценка с участием людей. ByteDance заявляет, что по сравнению с каскадными системами — модель компьютерного зрения, подключённая к модели ASR, подключённой к LLM, подключённой к голосу text-to-speech — SeedRealtime вдвое сокращает проблемы с темпом аудиовизуального разговора: меньше обрывов, меньше ложных срабатываний и более медленные, более естественные ответы. Чего ByteDance не опубликовала — это размер выборки, методологию, число аннотаторов, показатель задержки в миллисекундах, название бенчмарка или оценку. Один вторичный отчёт сообщает о 12%-м приросте плавности разговора по сравнению с предыдущими моделями команды. На этом публичная доказательная база исчерпывается.
Итак, честная оценка проверяемости выглядит так: ни у одного нет независимого прогона; у Meta — набор измерений с заявленными базовыми уровнями и раскрытым отрицательным результатом; у ByteDance — единственное утверждение о предпочтениях, дизайн которого не описан. Ни то, ни другое не воспроизводимо, но лишь одно из них достаточно конкретно, чтобы с ним спорить.

Ход, который сделал каждый из них
Обе системы представляют собой ответы на одну и ту же проблему, и стоит увидеть, что эти два ответа различны.
Для системы, которая наблюдает, самое сложное — понять, когда говорить. Модель, которая непрерывно получает кадры с камеры и аудио, должна без внешнего триггера решить, закончил ли человек перед ней, обращаются ли к ней и имеет ли значение объект, только что появившийся в кадре. Именно эту задачу SeedRealtime перенесла внутрь модели, и ByteDance осуществила этот переход для трёх модальностей, а не двух — более сложную версию того, что Google, OpenAI и NVIDIA сделали каждая только для аудио. Из этого вытекают демонстрационные модели поведения: привязка голоса к лицу в групповом разговоре, высказывание по собственной инициативе, когда что-то появляется в кадре, сопровождение человека по музею или через процесс ремонта.
Для системы, которая занимается рендерингом, самое сложное — сохранять связность. Генерация видео короткими причинными фрагментами означает, что каждый фрагмент обусловлен предыдущим, а режим отказа — это дрейф: к третьей минуте персонаж незаметно становится кем-то другим. Скользящее окно недавних видеолатентов от Meta — ответ на это, а общий поток токенов — ответ на другую проблему: «дублированный» вид, который возникает, когда сначала генерируется аудио, а затем поверх него прогоняется модель липсинка.
Ни один из этих ходов недоступен в другой системе. У SeedRealtime нет референсного изображения, которому нужно оставаться верным, потому что он никого не рендерит. У Muse Realtime Avatar нет внешнего мира, который нужно отслеживать, потому что вся его задача — создавать лицо, соответствующее голосу.

Почему модель, которую невозможно вызвать, всё равно остаётся вопросом маршрутизации
Обе эти системы делегируют. Muse Realtime Avatar надстроен над Muse Realtime Voice — разговорным слоем агента, рассуждения которого выполняются на Muse Spark: модель занимается рендерингом, а не мышлением. Архитектура SeedRealtime поддерживает разговор, пока происходит фоновая работа, а значит, работа, выходящая за пределы того, что можно сделать встроенно, уходит куда-то ещё и возвращается. В обеих архитектурах то, с чем взаимодействует пользователь, — это фронтенд, а интеллект — отдельная текстовая модель за ним.
Эта отдельная текстовая модель — обычный инференс, и именно та часть стека, которую вы действительно можете купить. В OrcaRouter это одна конечная точка, охватывающая 196 моделей от 15 провайдеров, по прайсовой цене провайдеров, передаваемой без наценки, с автоматическим переключением при сбое, если выбранная вами модель выдаёт ошибку или превышает время ожидания. Мы не размещаем SeedRealtime — он принадлежит ByteDance, находится внутри Doubao, и маршрутизировать здесь нечего. Мы также не размещаем Muse Realtime Avatar, и никто другой тоже. То, что мы предоставляем, — это слой, которому обе системы передают свою сложную работу, и именно этот слой меняется, когда вы хотите, чтобы размышления выполняла другая модель.
Что изменило бы ответ?
Для SeedRealtime недостающий элемент — это не функция, а доказательства. Технический отчёт с указанием количества параметров, набором бенчмарков и описанной оценкой с участием людей перевёл бы его из «демонстрации внутри приложения» в нечто такое, о чём команда могла бы рассуждать. В посте ByteDance также содержатся ссылки на стандартные целевые страницы «Try Dola» и «Try in Playground», без заявлений о наличии весов или документированного API, что характерно для продуктовой функции, а не для выпуска модели.
Для Muse Realtime Avatar недостающим звеном остаётся коммерческая составляющая: тарифная сетка, эндпоинт, дата, а также региональные и возрастные условия, которые Meta полностью не прописала. В посте Meta отмечается, что её демо не все отражают аватары, доступные в приложении Muse, — и именно это предложение должно определять любой план, построенный вокруг этого.
Пока одно из этого не изменится, сравнение имеет необычно короткую форму. Обе модели аудиовизуальные, обе полнодуплексные, обе представляют собой по-настоящему впечатляющую инженерную работу, и ни одну из них не может вызвать из терминала никто из тех, кто это читает. Разница в том, что вы бы делали с ними, если бы могли: одна даёт вам персонажа, который разговаривает, а другая — систему, которая замечает.

