
Tavus Griffin vs Muse Realtime Avatar: два лица 2026 года, две разные проблемы
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 223 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
И Tavus Griffin, и Muse Realtime Avatar существуют, чтобы решить одну и ту же неловкую проблему — языковая модель, которая умеет говорить, но у неё нет лица, — и они атакуют её с противоположных сторон. Griffin — это Human Interaction Model типа видео-в-видео, которая наблюдает за участником через камеру и генерирует другую сторону разговора в реальном времени; Tavus анонсировала её в октябре 2026 года как исследовательский предпросмотр для избранных тестировщиков. Muse Realtime Avatar — это слой воплощения Meta для её агента Muse, анонсированный на Meta Connect 23 сентября 2026 года; он принимает аудио и превращает его в синхронизированный говорящий портрет. Ни то, ни другое нельзя купить. Разница в том, что каждый из них пытается сделать правильно, и она проявляется в тот момент, когда вы спрашиваете, что именно каждая модель фактически получает на вход.
Краткая версия
• Вход Griffin — это человек на другом конце — видео и аудио живого участника, которые он должен считывать, на которые должен реагировать и которыми может быть прерван.
• На вход Muse Realtime Avatar поступает собственная речь агента — поток токенов от Muse Realtime Voice, который он преобразует в соответствующее лицо.
• Tavus оценивает Griffin по тому, верят ли в него люди, и публикует показатель в 48% по результатам одноминутного видеозвонка.
• Meta оценивает Muse Realtime Avatar по тому, успевает ли он, и публикует 870 миллисекунд от конца хода до первого байта.
• Ни у одного из них нет публичного API, опубликованной цены или даты общего доступа.
Прочитайте эти четыре строки вместе — и форма разногласия очевидна. Tavus оптимизирует под убеждения другого человека. Meta оптимизирует под время.

Griffin: модель, в которую нужно верить
Позиционирование Tavus таково: Griffin — первая модель человеческого взаимодействия, а архитектура, стоящая за этим утверждением, представляет собой систему из двух частей, объединяющую непрерывное моделирование разговора с аудиовизуальной генерацией. Первая часть — поведенческая: она решает, что персона должна делать в следующий момент, используя то, что она может видеть и слышать. Вторая часть — рендеринг, и Tavus делит её ещё на потоковую генерацию речи и потоковую генерацию видео.
Цифры, которые Tavus выдвигает на первый план, — не показатели пропускной способности. В исследовании, которое компания провела совместно с Queen Mary University of London, 26 из 54 участников — 48% — поверили, что Griffin — реальный человек, после одноминутного видеозвонка, против 1 из 41 (2,4%) для её предыдущего стека из генерации лиц Phoenix-4.5, смены реплик Sparrow-2 и компьютерного зрения Raven-1. Участники, которых не удалось обмануть, обычно начинали сомневаться в первые 20 секунд. В бенчмарке VideoFDB от NVIDIA, оценки по которому проводились в сентябре 2026 года, Tavus сообщает, что Griffin занял первое место в категории ИИ для общения лицом к лицу с оценкой генерации 3,83 против 2,80 у сильнейшего заявленного базового показателя и 3,92 у человеческого эталона, а также с оценкой восприятия 3,73 против 3,44 у лучшего заявленного базового показателя и 4,20 у человеческого эталона. Эти цифры заявлены производителем и относятся к конкретному бенчмарку, но именно сравнения с людьми представляют интерес.
В основе этих показателей лежит инженерное решение — кодек под названием Tavec и авторегрессионный диффузионный трансформер. Tavec работает на частоте 48 кГц с 40 значениями на кадр при 100 кадрах в секунду, без кодовых книг, с полностью каузальным декодером и пакетами размером всего 10 миллисекунд — он спроектирован так, чтобы лицо могло начать двигаться до того, как завершится предложение. Видеотракт передаёт 720p фрагментами по 320 миллисекунд, где один латент равен восьми кадрам при 25 fps, три шага диффузии на латент и 8-кратное временное сжатие в VAE. Именно трёхэтапный процесс дистилляции (сопоставление распределений, затем авторегрессия с teacher forcing, затем self-forcing) позволяет ему вообще выполнять эти три шага в реальном времени. Заявленная ключевая задержка — в среднем 0,43 секунды от аудио к видео на H100, что, по словам Tavus, примерно вдвое меньше, чем у следующего самого быстрого измеренного метода. Клонирование голоса требует примерно 10-секундного образца.
Цена всего этого — то, что Tavus не может её выпустить. Griffin-Lite, исследовательская предварительная версия, доступна только отобранной группе ранних тестировщиков; в публикации о выпуске компания прямо заявляет, что Griffin-Lite в настоящее время не будет доступна для использования клиентами и что она рассчитывает выпустить Griffin очень скоро после устранения определённых проблем безопасности. Griffin отсутствует на платформе Tavus и появится там, «как только мы разберёмся, как безопасно его выпустить». Модель, которая убедительна в 48 % случаев при одноминутном звонке, с точки зрения развёртывания — это модель, которая убедительна в 48 % случаев при одноминутном звонке.

Muse Realtime Avatar: модель, которая должна успевать
Muse Realtime Avatar был анонсирован 23 сентября 2026 года на Meta Connect и в тот же день описан Meta Superintelligence Labs под заголовком «Bringing Your Muse to Life». Подача Meta более узкая и механистичная, чем у Tavus: у агента Muse уже был голос — благодаря Muse Realtime Voice, — а аватар — это слой, который даёт этому голосу тело.
Опубликованный показатель — 870 миллисекунд от окончания реплики до первого байта, то есть от момента, когда пользователь заканчивает говорить, до момента, когда готов первый видеобайт аватара. Аватар отрисовывает портрет 448×768 при 25 кадрах в секунду. Meta утверждает, что система выполняет примерно в 60 раз меньше вычислений на фрагмент, чем её базовая версия, и что один NVIDIA GB200 может обслуживать 12 одновременных сессий в реальном времени при восьмикратном приросте ёмкости по сравнению с двухэтапной реализацией на BF16.
Архитектурное отличие от Griffin состоит в том, откуда берётся информация. Muse Realtime Avatar расширяет Muse Realtime Voice и разделяет его поток речевых токенов — то же VQ-представление, которое создаёт голосовая модель, управляет лицом, а не отдельное визуальное понимание участника. Это делает его слоем воплощения DiT, управляемым аудио: эффективным, тесно связанным с собственной голосовой моделью и вовсе не пытающимся считывать человека на другом конце звонка. Это рот и лицо для агента, а не собеседник, который смотрит на вас.
Meta не опубликовала ни API, ни цену, ни дату выпуска для Muse Realtime Avatar. Исследовательская публикация — это всё, что есть в открытом доступе.
Где два дизайна действительно расходятся
Самый наглядный способ увидеть это разделение — задать вопрос: что происходит, когда пользователь прерывает работу.
Griffin — полнодуплексный и спроектирован так, чтобы его можно было перебивать посреди реплики: он способен смотреть и слушать, пока говорит, поэтому маркетинг Tavus опирается на идею, что Griffin учится разговорному поведению, а не видео. Именно поэтому его набор бенчмарков строится вокруг восприятия и реакции, и именно поэтому 37%-ное преимущество над следующей лучшей системой по реакции в моменте — это заявление, которое компания не поленилась сделать.
Показатель Muse Realtime Avatar в 870 миллисекунд на завершение хода говорит об обратном: это конвейер, в котором ход заканчивается, аудиотокены разрешаются, а затем лицо догоняет. Это быстро — 870 мс — хороший показатель для рендерера портрета — но само измерение предполагает, что граница хода существует, а именно это допущение дуплексная модель и создана отбросить.
Это не критика ни того, ни другого дизайна. Meta создаёт лицо для агента, который живёт внутри собственных интерфейсов ассистента Meta, где чёткая граница реплики — разумная модель взаимодействия. Tavus создаёт нечто такое, что должно выдержать ситуацию, когда незнакомец за двадцать секунд решает, реален ли человек на экране.
Ни один из них не указан в прайс-листе — и только одна часть Muse доступна для вызова.
Ни Tavus Griffin, ни Muse Realtime Avatar сегодня нельзя запустить в продакшен. Griffin доступен только избранным тестировщикам; у Muse Realtime Avatar нет API, нет цены и нет даты. Если вы планируете сборку, оба этих факта должны быть в плане.
Что действительно стоит отметить — это та часть стека Muse, к которой есть доступ. Семейство Muse от Meta включает Muse Spark, и одна из его контрольных точек — meta/muse-spark-1.2 — уже доступна в нашем каталоге по цене $1.25 за миллион входных токенов и $4.25 за миллион выходных токенов при нулевой наценке к прайс-листу Meta. Это не аватар: она принимает на вход текст, изображения, видео, аудио и PDF, а возвращает текст, с контекстным окном на 1 млн токенов и настраиваемым уровнем глубины рассуждений. Но это именно та часть линейки Muse, которую вы действительно можете вызвать, и если вы создаёте агента, которому однажды предстоит стоять за аватаром, то языковая половина — это то, с чего можно начать. OrcaRouter передаёт прайс-листы провайдеров с наценкой 0%, поэтому изменение цен Meta отражается в нашей карточке в тот же день, а не в следующем расчётном периоде, а запрос, завершившийся ошибкой у одного провайдера, повторяется у работоспособного, вместо того чтобы вылиться в тайм-аут.

Та же логика применима к видеочасти мира. Мы не маршрутизируем Muse Realtime Avatar и не маршрутизируем Tavus Griffin, и не будем утверждать обратное. Что мы маршрутизируем, так это каталог более двухсот моделей по тем же модальностям, поэтому прототип, который переключается между текстовым агентом, голосовой моделью и видеогенератором, остаётся на одном ключе, пока две модели из этой статьи остаются невыпущенными.
Какой из них дальше от отправки?
Судя по публичной информации, Muse Realtime Avatar находится дальше от этого. У него есть исследовательская публикация, но нет API, нет цены и нет даты. У Griffin тоже нет API и нет цены, но есть явно выраженное намерение выпустить его — «очень скоро после того, как эти проблемы безопасности будут решены» — именованный уровень предварительного доступа, который существует уже сегодня для избранных тестировщиков, и целый набор опубликованных результатов бенчмарков от независимого испытательного стенда. Это более продвинутая позиция, даже несмотря на признание, что модель недостаточно безопасна, чтобы передавать её клиентам.
Ловушка при их сравнении — это рассматривать показатель в 870 миллисекунд как напрямую сравнимый с показателем в 0,43 секунды. Они измеряют разные вещи: Meta измеряет от конца реплики до первого байта портрета, а Tavus измеряет задержку между аудио и видео внутри непрерывного дуплексного потока, где реплики не являются чёткими событиями. Эти числа оба реальны, и они не являются одним и тем же измерением, и любой, кто представляет их в одном столбце, оказывает читателю медвежью услугу.
Итог
Muse Realtime Avatar — это слой воплощения: аудио на входе, портрет на выходе, 870 миллисекунд от конца реплики до первого байта, 448×768 при 25 кадрах в секунду, без API и без даты. Tavus Griffin — это дуплексная Human Interaction Model: участник на входе, реагирующее лицо на выходе, средняя задержка от аудио до видео 0,43 секунды на H100s, и поставщик, готовый опубликовать, что 48% людей считали его человеком, при этом заявляя, что клиенты не могут им пользоваться. Meta строит нечто, что не отстаёт. Tavus строит нечто, что проходит. Ни то, ни другое нельзя купить, а значит, единственное доступное сегодня решение — с какой половины проблемы начать; и для большинства команд эта половина — языковая модель в основе.
