Титульная карточка для «Tavus Griffin vs MiniMax H3» с подзаголовком «Дуплексная диалоговая модель встречает выпущенный видеогенератор», над четырьмя чипами: Tavus Griffin — исследовательский предпросмотр, только для тестировщиков; MiniMax H3 — открытые веса, выпущено; MiniMax H3 — $0.08/с при 768P; Griffin: нет API, нет цены.
Guides & Insights

Tavus Griffin против MiniMax H3: дуплексная диалоговая модель встречает выпущенный видеогенератор

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Tavus Griffin и MiniMax H3 оба выводят на экран движущегося говорящего человека, но если отвлечься от этого первого впечатления, они едва ли относятся к одной категории продуктов. Griffin — это Human Interaction Model — система «видео-в-видео», созданная для ведения двустороннего разговора в реальном времени, анонсированная Tavus в октябре 2026 года и в настоящее время доступная лишь избранной группе ранних тестировщиков. MiniMax H3 — омнимодальный генератор видео: вы задаёте ему промпт и, опционально, референсы в виде изображения, видео и аудио, а он возвращает готовый клип. Один оценивают за закрытыми дверями; другой уже несколько месяцев доступен для скачивания, лицензирования и оплаты. Именно это различие — а не разрешение или частота кадров — определяет, кому из них место в вашем стеке.

Что каждый из них на самом деле из себя представляет

Griffin — это попытка Tavus создать модель, которая ведёт себя как участник, а не как рендерер. Компания описывает её как первую Human Interaction Model, и опубликованная ею архитектура делит задачу на две части: Continuous Conversational Modeling, которая решает, что персона должна делать в каждый момент времени, и Audio-Visual Generation, которая передаёт потоком соответствующие друг другу речь и лицо. Что принципиально важно, она полнодуплексная: она смотрит и слушает, пока говорит, поэтому её можно перебить, она может реагировать в середине реплики и не ждёт чёткого сигнала окончания хода, прежде чем ответить. По формулировке самой Tavus, предыдущие системы учились генерировать лица; Griffin был создан, чтобы учиться разговорному поведению у людей.

MiniMax H3 — это поколение Hailuo 3, выпущенное 31 июля 2026 года и открытое 3 августа 2026 года под лицензией MiniMax H3 Community License; варианты H3-Base-FL2VA и H3-Base-Ref2VA опубликованы в открытом доступе. Он обрабатывает текстовые, графические, видео- и аудиореференсы как единый контекст и возвращает клип длительностью от 4 до 15 секунд в 768P или 2K с нативным стереозвуком, сгенерированный с помощью трёхэтапного конвейера (H3-Context-IR, затем H3-Base при 768p, затем H3-Regenerate-2K). Это генератор с необычно широким набором входных данных и по-настоящему разрешительной лицензией — всё то, чем Griffin на данный момент не является.

Характеристики, бок о бок

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

Почему «duplex» — это интересное слово

О каждом генераторе видео, включая H3, судят по тому, как выглядит готовый клип. О Griffin судят по тому, что клип показать не может: что происходит в течение 200 миллисекунд после того, как вы его прерываете. Именно на эту проблему указывает фрейминг Human Interaction Model, и именно поэтому ключевые показатели Tavus являются поведенческими, а не визуальными.

Самая цитируемая цифра — 48% людей поверили, что Griffin — реальный человек, после минутного видеозвонка — 26 из 54 участников — против 2,4% у предыдущего стека Tavus из Phoenix-4.5, Sparrow-2 и Raven-1, который убедил 1 из 41. Tavus также сообщает, что люди, которых не удалось убедить, обычно начинали подозревать в течение первых 20 секунд; это более полезная деталь, чем заголовок: это значит, что иллюзия либо держится с самого начала, либо рушится в самом начале.

Второй набор цифр взят из бенчмарка VideoFDB от NVIDIA, оценка по которому проводилась в сентябре 2026 года, где, по словам Tavus, Griffin занял первое место в независимом тесте ИИ для общения лицом к лицу. Что касается генерации, Griffin набрал 3,83 против 2,80 у сильнейшего из заявленных базовых вариантов (конфигурация Gemini 2.5 плюс Anam) при человеческом ориентире 3,92 и показателе выполнения задач 62,8%. Что касается восприятия, он набрал 3,73 против 3,44 у MiniCPM-o 4.5, 3,17 у Gemini 2.5 Flash Native и 2,97 у ориентированной только на аудио конфигурации OpenAI gpt-realtime, при человеческом ориентире 4,20 и показателе выполнения задач 73,8%, среди пятнадцати оценённых моделей. Tavus также утверждает, что Griffin опережает следующую лучшую систему на 37% по реакции в моменте. Это цифры, заявленные производителем и опирающиеся на созданный NVIDIA бенчмарк, и их следует воспринимать именно так — но именно точки сравнения с человеком стоит запомнить, потому что 3,83 против человеческих 3,92 — это гораздо меньший разрыв, чем исторически демонстрировала генерация видео.

Что вы можете купить сегодня

Здесь две модели вообще перестают быть сопоставимыми.

MiniMax H3 — это продукт. Он размещён в облаке, оплата взимается за каждую секунду сгенерированного результата, а его открытые варианты лежат на хабе моделей и ждут загрузки. Если вам нужен пятнадцатисекундный клип в 2K со стереозвуком, изображающий то, чего не существует, вы можете получить его уже сегодня днём, и вы можете запустить веса самостоятельно, если предпочитаете не арендовать их.

Tavus Griffin — не продукт. Tavus прямо указывает в описании Griffin, что Griffin-Lite, исследовательский предпросмотр, уже сегодня доступен избранной группе ранних тестировщиков, что после этого последует более широкий выпуск более мощной модели и что Griffin пока не представлен на платформе Tavus и появится только после того, как компания проработает способ его безопасного выпуска. Это необычная для вендора откровенность относительно собственного самого громкого результата, и она важна для планирования: вы не можете включить Griffin в дорожную карту продукта как зависимость и не можете назначить на него цену, потому что её не существует.

Так что честный вопрос планирования — не «что лучше», а «какой из них существует на том уровне, который мне нужен».

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

Где применяется OrcaRouter

MiniMax H3 есть в нашем каталоге. Страница модели находится по адресу minimax/minimax-h3, и тарификация соответствует той, что устанавливает провайдер: $0,08 за секунду сгенерированного результата в 768P и $0,13 за секунду в 2K. OrcaRouter транслирует прайс-листовые цены провайдеров с наценкой 0%, поэтому изменение цены MiniMax появляется в нашей карточке в тот же день, когда о нём объявлено, а не в следующем расчётном цикле. Griffin в каталоге отсутствует и не появится, пока Tavus не выпустит его для клиентов — мы не размещаем модель, которую не можем обслуживать, а исследовательский предпросмотр, доступный лишь избранным тестировщикам, — не то, что роутер может маршрутизировать.

Практическое следствие таково: одну из этих двух моделей от вашего приложения отделяет всего одна строка кода, а вторая — это научная статья с номером телефона. Если вы уже маршрутизируете несколько видеомоделей и языковых моделей, посекундная тарификация в H3 также делает этот маршрут таким, который стоит поставить за автоматическим переключением при сбое: запрос, попавший к перегруженному провайдеру, повторяется у работоспособного вместо того, чтобы вернуть тайм-аут, а DSL маршрутизации позволяет закрепить задачи 2K за конкретным провайдером, тогда как черновики 768P могут уходить туда, где мощности дешевле. Слияние моделей — ещё один рычаг, который стоит здесь упомянуть: посекундная цена H3 достаточно низка, чтобы потратить текстовую модель на переписывание и перекройку промпта перед генерацией — это часто дешевле, чем потерянные секунды из-за неудачной первой попытки.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Где сравнение может перевернуться

Три вещи изменили бы это сравнение, и только три.

Во-первых, если Tavus выведет Griffin на коммерческий API с опубликованным тарифом, вся эта «разговор против клипа»рамка превратится в настоящее решение о покупке, а не о планировании, и показатель в 48% для общения лицом к лицу начнёт напрямую конкурировать с качеством генеративного результата. Во-вторых, если история H3 с работой в реальном времени улучшится — а MiniMax выпускает продукты весьма агрессивно, — генератор с посекундной оплатой, способный работать в потоковом режиме, притупит главное преимущество Griffin. В-третьих, если NVIDIA или другая нейтральная сторона заново прогонит VideoFDB, включив туда H3 или его преемника, утверждение, что Griffin первым достиг уровня ИИ для общения лицом к лицу, перестанет быть нефальсифицируемым. Tavus заявляет, что рассчитывает выпустить Griffin очень скоро после устранения опасений по поводу безопасности; эта фраза — и есть весь график.

Итог

MiniMax H3 и Tavus Griffin сейчас не соперники, потому что только один из них можно купить. H3 — это выпущенный, с открытыми весами, посекундный омнимодальный генератор с опубликованной ценой и окном вывода от 4 до 15 секунд; Griffin — это дуплексная диалоговая модель с лучшими из всех опубликованных показателями в сценариях лицом к лицу, без API, без цены и с явным заявлением самого вендора о том, что клиенты пока не могут ею пользоваться. Если вам нужна генерация видео сегодня, ответ — H3, и это можно измерить в центах за секунду. Если вам нужно лицо в реальном времени, которое можно перебивать, следите за Tavus — но сначала создайте остальную часть продукта, потому что дата выпуска — это фраза, а не дата.