
Tavus Griffin: первая модель человеческого взаимодействия и 48%, прошедшие видеотест Тьюринга
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 223 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Двадцать шесть из пятидесяти четырёх человек завершили минутный видеозвонок и заявили, что их собеседник был настоящим человеком. Именно эту цифру Tavus кладёт в основу Tavus Griffin, анонсированного 1 октября 2026 года, — и это по-настоящему ошеломляющий результат: по тому же протоколу предыдущий стек компании — Phoenix-4.5 отрисовывал лицо, Raven-1 обеспечивал восприятие, Sparrow-2 отвечал за динамику реплик — дал одного поверившего из сорока одного, то есть 2,4%. Оба очевидных толкования этого скачка неверны, и их разграничению посвящена большая часть дальнейшего. Griffin — не более совершенный движок аватаров, и это не продукт, который можно купить. Это исследовательская предварительная версия под названием Griffin-Lite, доступная избранному кругу доверенных тестировщиков, без цен, без публичного API и без упоминания в каком-либо независимом видео-лидерборде. То, что оба эти факта верны одновременно, и есть настоящая история.
Что измеряет 48% и что нет
Исследование представляет собой тест Тьюринга лицом к лицу, а не опрос предпочтений, и протокол стоит изложить точно, потому что это несущее утверждение. Пятьдесят четыре участника были набраны через независимую исследовательскую платформу, и им сказали, что их сопоставят с другим участником для минутного видеозвонка о том, чего они ждут в этом году. Их партнёром был PAL, работающий на Griffin-Lite, генерирующий лицо, голос и ответы в реальном времени. Только в конце опроса их спросили, не приходило ли им в голову, что партнёр может быть не настоящим человеком, и каждому участнику затем сказали, что это ИИ. Сравнительный прогон использовал тот же протокол на более старом стеке, с сорока одним участником.
Сопутствующие цифры значат не меньше, чем главный вывод. Верующие были уверены — в среднем на 79% — и сомневающиеся тоже, на 81%, а это как раз то, чего хочет любое исследование: никто не гадал. Больше половины участников сказали, что такая возможность вообще не приходила им в голову во время разговора, и почти все из этой группы затем заявили, что партнёр был настоящим. Те участники, которые всё же подозревали, как правило, начинали подозревать в первые двадцать секунд. Это самая некомфортная строчка в отчёте и та, которая должна определить, как вы будете читать раздел о безопасности дальше.
По семибалльной шкале модель в среднем набирала 5,4 за то, что казалась естественной, 5,6 — за то, что казалась заслуживающей доверия, 5,8 — за то, хотели бы участники снова с ней поговорить (эта оценка держалась на уровне 5,4 даже среди участников, которые правильно определили, что это ИИ), и 5,5 — за то, чувствовали ли они, что их собеседник действительно их слушает. Самая низкая оценка составила 4,9 — за то, насколько естественно протекал разговор. Если взять их вместе, это вполне определённый профиль: Griffin-Lite убедителен, если смотреть момент за моментом, и чуть менее убедителен как целостная дуга.
Независимый бенчмарк и как читать его два трека
Показатели качества взяты из VideoFDB от NVIDIA — бенчмарка для полнодуплексного аудиовизуального разговора, который оценивает модель по двум отдельным трекам: генерации, то есть тому, демонстрирует ли модель правильное поведение, и восприятию, то есть тому, понимает ли она момент, — каждый со своей рубрикой и своей таблицей лидеров. NVIDIA создала этот бенчмарк, проводит оценку с помощью собственного судьи по опубликованным метрикам и оценивает ответ по шкале от нуля до пяти. Tavus его не проводила, и именно поэтому на него стоит ссылаться.
• Генерация — Griffin-Lite получила оценку 3,83, следующая по величине опубликованная система — 2,80 (Gemini 2.5 с Anam), а эталонный человеческий ориентир — 3,92. Это на 1,03 опережает лучшую сопоставимую систему и на 0,09 уступает человеку.
• Восприятие — 3,73 при человеческом эталоне 4,20; 3,44 — у самого сильного из заявленных базовых показателей, MiniCPM-o 4.5 в конфигурации только с аудио. Gemini 2.5 Flash Native набрала 3,17, а gpt-realtime от OpenAI — 2,97.
• Согласованность частоты перехвата инициативы — 62,8% при генерации и 73,8% при восприятии. Это измеряет, насколько точно решения модели о том, когда говорить, соответствуют таймингу в эталонных разговорах, и Tavus утверждает, что оба показателя — самые высокие среди всех систем в таблице лидеров.
Две оговорки должны сопровождать эти цифры, прежде чем кто-либо начнёт их повторять. Разрыв с человеком составляет 0,09 по пятибалльной шкале, оцениваемой языковой моделью, и это лучше читать как «близко к человеку по данному критерию», а не как «на уровне человека». И сравнение восприятия — не сопоставление равного с равным: MiniCPM-o 4.5 и gpt-realtime оцениваются в конфигурациях только с аудио, тогда как Griffin ещё и читает видео. Превосходство на 0,29 балла над базовой моделью только с аудио — реально, но часть того, что оно измеряет, — это ценность наличия глаз.
Собственная сводная формулировка поставщика — первое место в независимом тесте NVIDIA на ИИ при общении лицом к лицу, на 37% опережающее следующий лучший ИИ по реакции в моменте — представляет собой интерпретацию тех же данных, а не отдельный вывод. Сохраняйте исходные оценки по трекам, а не эту подачу.

Два двигателя, работающих одновременно
Архитектурное утверждение оценить проще, чем маркетинг вокруг него, потому что это утверждение о том, что выполняется параллельно. Griffin описывается как две системы, работающие параллельно, а не как конвейер, передающий работу между этапами.
Первый — это движок непрерывного моделирования разговора. Он принимает аудио и видео человека и переоценивает обмен репликами через регулярные субсекундные интервалы — Tavus называет их мини-ходами — решая на каждом, молчать, подать сигнал, бэкчанелить или взять ход. На выходе — не только слова, но и набор экспрессивных управляющих параметров, несущих тайминг, позицию, мимику и жесты. Смысл конструкции в том, что решение, принятое в середине предложения, отражается в голосе и на лице в рамках того же мини-хода, а не после передачи хода, что и позволяет модели остановиться, когда её перебивают, кивать, пока она слушает, и воспринимать паузу для размышления как нечто иное, нежели конец хода.
Второй — это движок аудиовизуальной генерации, который превращает эти управляющие сигналы в звук и пиксели одновременно: потоковый генератор речи и потоковый генератор видео, управляемые одними и теми же сигналами, так что изменение тона и изменение выражения приходятся на один и тот же такт.
Одна честная оговорка о материале, который Tavus опубликовала вместе с этим, потому что его легко ошибочно принять за измерения. Интерактивная диаграмма девятисекундного обмена в тексте самой страницы помечена как иллюстративная, и прямо указано, что она не измерялась в реальной сессии. Та же оговорка относится к графику таймингов для поочерёдного режима по сравнению с полнодуплексным. Что действительно измерено — так это значение задержки ниже.
Внутри стримингового стека
Аудиочасть построена вокруг кодека под названием Tavec — свёрточного автоэнкодера, который преобразует аудио с частотой 48 кГц в непрерывное латентное представление из 40 значений на кадр при 100 кадрах в секунду, без кодовых книг. Его декодер полностью причинный, поэтому он переносит состояние между чанками и выдаёт аудиопакеты размером всего 10 мс без заглядывания вперёд. Минута речи — это 6 000 латентных кадров, а не 2,88 млн необработанных сэмплов, что делает последовательность достаточно дешёвой, чтобы речевой трансформер мог предсказывать её быстрее реального времени. Сам речевой генератор — это авторегрессионный диффузионный трансформер, который обусловливается на закодированном префиксе говорящего — голос можно клонировать примерно из десяти секунд аудио — и генерирует по одному латентному чанку за раз по мере поступления управляющих сигналов, поэтому воспроизведение начинается до того, как высказывание завершено.
Видеочасть исходит из той же предпосылки: именно сильное временное сжатие позволяет диффузионной модели быть достаточно быстрой, чтобы поддерживать разговор. Авторегрессионный генератор с несколькими шагами берёт опорное фото, потоковое аудио и потоковые управляющие сигналы и создаёт один латент на шаг при трёх шагах диффузии на латент. VAE сжимает время в восемь раз, поэтому при 25 кадрах/с один латент — это восемь кадров, или 320 мс видео 720p. Старые латенты хранятся со всё более низким разрешением, чтобы длительные прогоны оставались доступными по затратам. В результате получается генератор, который выдаёт 720p фрагментами по 320 мс в реальном времени.
Чтобы этого достичь, потребовалась трёхэтапная дистилляция из большой двунаправленной многошаговой диффузионной модели-учителя: Distribution Matching Distillation в ученика с малым числом шагов, teacher forcing, чтобы превратить этого ученика в авторегрессионную модель, генерирующую по одному латенту за раз, и наконец обучение с self-forcing на собственной сгенерированной истории модели плюс добавленный механизм, воздействующий на кадры истории, — чтобы при длинных развёртках не возникало дрейфа. Именно третий этап устраняет тот режим отказа, который обычно свойственен этому классу моделей, — лицо, которое деградирует, или фон, который медленно уплывает, за разговор, длящийся минуты.
Показатель задержки — это и есть настоящее заявление о продукте.
В сравнении с четырьмя опубликованными потоковыми диффузионными моделями в сценарии «аудио — видео», где каждая модель получает речь и опорное изображение и должна создать говорящее лицо, генератор Griffin-Lite показал в среднем 0,43 секунды истинной задержки от аудио к видео на H100s — время от поступления фрагмента аудио до того, как видео отобразит его эффект. Tavus описывает это как половину показателя следующего по скорости метода. Также сообщается о первом месте по перцептивному качеству DOVER и FID и по THEval, системе оценки говорящих голов, и о втором месте по уверенности синхронизации губ LSE-C на уровне 7,27, уступая одному базовому методу, — при этом производитель отмечает, что LSE-C поощряет выраженное движение рта, в том числе движения, выходящие за пределы того, что выглядит естественно.
Все они — собственные измерения Tavus по выбранным им базовым показателям. Они полезны, потому что конкретны, и потому что показатель в 0,43 секунды — это тот тип числа, который либо подтверждается в живом тесте, либо нет. Они не являются независимыми, и единственные независимые оценки в этой статье — это два трека VideoFDB выше.

Почему нет цены для сравнения?
Griffin-Lite сегодня доступен избранной группе ранних тестировщиков в виде исследовательского предпросмотра; в дальнейшем последует более широкий выпуск более мощной модели. На данный момент он не будет доступен для использования клиентами. Доступ предоставляется по форме запроса. Его нет на платформе Tavus, и заключительная фраза самого объявления компании говорит об этом прямо: Griffin пока не на платформе Tavus и появится там, как только Tavus определит, как безопасно его выпустить. Всё, что покупатель обычно сравнивает — цена за секунду или за запрос, идентификатор модели, ограничения скорости, SLA, список регионов — пока не существует. Tavus направляет всех, кто хочет создавать решения уже сегодня, к моделям, которые уже используют 150 000 разработчиков и компаний, — это три предшественника, а не Griffin.
Это не техническая формальность, которую можно упомянуть в сноске. Это меняет то, для чего эта модель нужна прямо сейчас. Это объект оценки для команд, чей продукт зависит от того, может ли человек отличить, и сигнал о том, куда движется дорожная карта вендора. На этом не стоит строить клиентский путь в этом квартале.
Контрольная точка безопасности — это план релиза.
Самое интересное из написанного Tavus о Griffin — не о модели. Это признание того, что те же свойства, которые делают модель человеческого взаимодействия лучшим интерфейсом, также делают её более способной обмануть человека, заставив его поверить, что она не ИИ; что перед безопасным выпуском требуется дальнейшая работа по выравниванию и безопасности; и что компания работает над функциями раскрытия и совместно с организациями над оценками безопасности ИИ. Учитывая, что почти половина живой выборки не смогла распознать ИИ, а те, кто смог, в основном поняли это за двадцать секунд, механизм раскрытия, который выдерживает непринуждённую беседу, — не просто приятное дополнение.
Две вещи могли бы поставить точку в этой статье. Опубликованная карточка модели с эндпоинтом и ценой перевела бы Griffin из разряда результата исследования в разряд вопроса закупки. А запись в независимом видеолидерборде — с той оговоркой, что такие лидерборды оценивают короткие клипы по попарному предпочтению и не предназначены для оценки живого разговора, поэтому такая оговорка может быть постоянной, а не временной, — дала бы утверждениям о задержке и когерентности независимую проверку. Пока не появится что-то из этого, треки VideoFDB лидируют и по задержке, и по когерентности — с преимуществом 0,4 и 0,47 балла соответственно.
Контраргумент, который стоит взвесить, состоит в том, что запуск бенчмарка — это не развёртывание. Протокол NVIDIA даёт каждой системе одну и ту же задачу на смену реплик и одного и того же судью; он ничего не говорит о том, как ведёт себя девятый час звонка, что происходит, когда два человека перебивают друг друга целую минуту, или деградируют ли выразительные элементы управления на лице, которое плохо передала эталонная фотография. Tavus сообщает, что обучение, специфичное для дрейфа — этап self-forcing и механизм истории — является исправлением именно этой проблемы, а отчёты — это всё, что есть у читателя, пока кто-то за пределами Tavus не проведёт длинную сессию и не опубликует её. Относитесь к бенчмарку как к лучшему из доступных доказательств, а не как к результату развёртывания.
Что построить вокруг этого тем временем
Практический вопрос для команды, которая хочет что-то подобное уже сегодня, — какие части стека уже можно купить. Разговорный видеоинтерфейс — это цепочка: распознавание речи, языковая модель, синтез речи, а в случае Tavus — ещё и модель рендеринга. Первые три компонента — это стандартные массовые решения. Они доступны через одну совместимую с OpenAI конечную точку в OrcaRouter, где более 200 моделей работают с одним и тем же ключом, а цена по прайс-листу провайдера передаётся без наценки, поэтому снижение цены вендором действует здесь в тот же день, а не после контрактного цикла. Если вы собираете конвейер взаимодействия и хотите оставить слой генерации открытым до тех пор, пока Griffin или что-то подобное не станет реальным продуктом, то именно здесь замена потребует изменения конфигурации, а не миграции. Сам Tavus Griffin здесь не является маршрутизируемой моделью, и не будет, пока остаётся предварительной версией, доступной через форму запроса.
То, за чем стоит следить, — это не очередной демонстрационный ролик. А за тем, будет ли опубликован инструментарий для раскрытия информации, который создаёт Tavus, и воспроизведёт ли вторая исследовательская группа протокол взаимодействия лицом к лицу. Прохождение теста Тьюринга такого масштаба — как раз тот результат, который требует, чтобы его провела вторая лаборатория.

