Hero-карточка для «Tavus Griffin против HeyGen Video 1» с тремя чипами: «HeyGen Video — $0,01 в секунду», «Griffin — цены нет, запросить доступ» и «HeyGen Video — от 5 до 15 секунд при 768p», над шестью строками: HeyGen запущен: 30 сентября 2026; Griffin анонсирован: 1 октября 2026; Цена HeyGen: $0,01 в секунду; Цена Griffin: не опубликована; Результат HeyGen: клипы от 5 до 15 секунд; Результат Griffin: живая сессия. Футер: «HeyGen Video запущен 30 сентября 2026; Griffin был анонсирован 1 октября 2026 в качестве превью.»
Guides & Insights

Tavus Griffin против HeyGen Video 1: Тридцать шесть часов разницы, и только один можно купить

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Два запуска вышли с разницей в тридцать шесть часов в одном и том же углу рынка, и календарь — самое интересное в этой паре. HeyGen Video вышел 30 сентября 2026 года по цене $0,01 за секунду до конца октября, дообучен на основе MiniMax H3 и выпущен под идентификатором heygen-video-1. Tavus Griffin был анонсирован 1 октября 2026 года вместе с исследованием живого взаимодействия лицом к лицу, в котором 26 из 54 участников поверили, что их собеседник — реальный человек, и он доступен только избранным доверенным тестировщикам по заявке, без идентификатора, без эндпоинта и без цены. Оба продукта посвящены созданию убедительного человека. Честная причина сравнивать Tavus Griffin и HeyGen Video 1 не в том, что покупатель стал бы выбирать между ними — сегодня купить можно только один из них, — а в том, что разница объясняет, для чего был создан каждый из них, и сколько на самом деле стоит секунда сгенерированного человека.

Один продаёт клип, другой продаёт разговор.

HeyGen Video — это универсальная видеомодель, которая на удивление хорошо справляется с людьми. Она принимает промпт, либо промпт плюс изображение, либо промпт плюс до девяти референсных изображений, трёх референсных видео и трёх референсных аудиоклипов, и возвращает клип длительностью от 5 до 15 секунд в 480p или 768p, 24 кадра/с, с AAC-аудио 32 кГц стерео, несущим сгенерированные диалоги, атмосферу и эффекты. Три режима охватывают обусловливание — text_to_video, image_to_video, и reference_to_video, который используется по умолчанию, — а порядок списка становится меткой, к которой вы обращаетесь в промпте, поэтому первая запись reference_images — это <Picture 1>. Неизвестные поля в запросе отклоняются, а не игнорируются, а seed — это беззнаковое 32-битное целое, которое делает дубль воспроизводимым, когда вы фиксируете его и меняете по одному условию за раз. Это production-инструмент с детерминированной оболочкой.

Griffin инвертирует почти каждое из этих свойств. Он генерирует 720p фрагментами по 320 мс при 25 fps из одной эталонной фотографии и воспроизводит каждый фрагмент по мере его декодирования, так что нет необходимости указывать длину клипа и не нужно возвращать файл. Движок Continuous Conversational Modeling принимает аудио и видео и переоценивает обмен с субсекундными интервалами, выбирая, молчать, подавать сигнал, поддакивать или брать слово, а его средства управления выразительностью параллельно управляют потоковым генератором речи и потоковым генератором видео. Решение, принятое в середине предложения, проявляется в голосе и на лице в рамках того же мини-хода. Вы не пишете промпт; вы говорите с ним, и он реагирует на паузу, отведённый взгляд или перебивание.

Вот почему они не взаимозаменяемы, хотя оба генерируют человека. HeyGen Video задают вопрос, как выглядит описанный момент. Griffin задают вопрос, что должно произойти дальше.

Сколько стоит каждая секунда там, где можно купить секунды

Стартовая цена HeyGen Video составляет $0.01 за секунду до конца октября, и собственное описание HeyGen называет это скидкой 50% от стандартных $0.02. График стоимости на той же странице, снабжённый сноской «прейскурантная цена за секунду при 768p со звуком до стартовых промоакций», указывает $0.03. Это разрыв в 50% между описанием и графиком в собственном стартовом материале вендора, и пока HeyGen не опубликует страницу с ценами API, безопасная трактовка такова: $0.01 подтверждена, поскольку действует, а цифра после октября находится где-то между $0.02 и $0.03.

Прогони расчёт на тысячу секунд — сто десятисекундных клипов — именно в таких единицах на самом деле мыслит команда, работающая с объёмами:

• Видео HeyGen в октябре — $10 по $0.01 за секунду.

• HeyGen Video после октября — $20 при $0,02 или $30 при $0,03 согласно графику.

• MiniMax H3, базовая модель, на основе которой она была дообучена, — 80 долларов по прейскурантной цене MiniMax в 0,08 доллара в секунду.

• Kling 3.0 Pro — $168 по $0.168 за секунду.

• Veo 3.1 — $400 по цене $0,40 за секунду.

Причина, по которой арифметика оказалась в заголовках запуска HeyGen, — это доля отбраковки. Команды, делающие короткие версии для соцсетей, рекламные варианты и продуктовые лупы, создают гораздо больше, чем выпускают, а при цене десять центов за десятисекундную попытку экономика выбрасывания кандидатов меняется полностью. Подвох — в потолке: 768p при 24 fps — это не формат выдачи 2K, и MiniMax H3 достигает 2K через отдельный модуль регенерации в собственном хостируемом API MiniMax по цене $0,13 в секунду, при этом аналога в HeyGen Video нет. Если ваша цель по выдаче выше 768p, дешёвая секунда — не та секунда, которая вам нужна.

Столбец Griffin в этом списке пуст, и это не сулит ничего хорошего. Tavus не опубликовала тариф, потому что Griffin-Lite — это исследовательский предпросмотр, о котором в собственном анонсе говорится, что в настоящее время он не будет доступен для клиентского использования и не представлен на платформе Tavus. При модели с тысячей секунд вписывать нечего. Любой, кто называет цифру для Griffin, её выдумывает.

Показатели качества, и кто оценивает

Ни у одной из этих моделей нет независимой оценки — об этом стоит сказать сразу, потому что у обоих вендоров есть графики.

У HeyGen это таблица Elo, где HeyGen Video нормирован на 1000, затем Dreamina Seedance 2.0 с 955, семейство H3 Max занимает диапазон от 952 до 860, Kling 3.0 Pro с 857 и Veo 3.1 с 744. Основную работу выполняет сноска: оценки взяты из внутреннего оценочного набора запросов Artificial Analysis Arena с 4 800 голосами, а собственная оценка HeyGen нормирована на 1000 для упрощения сравнения. То, что вендор нормирует себя на вершину собственной диаграммы, — это выбор подачи, а не доказательство того, что он лидирует. Информативна именно относительная разница между позициями под ней.

Полезнее прямое сравнение — единственное место, где HeyGen тестируется против чего-то, что создал не он. HeyGen утверждает, что слепые тестировщики предпочли его модель отмеченному на графике H3 Max post-train в 55,8% сравнений из 650 голосов, с диапазоном от 49 до 62%. Этот диапазон — честная деталь: на нижнем пределе он пересекает 50%, так что по собственным цифрам вендора предпочтение перед этим конкурентом неотчётливо отделено от шума. Разбивка по осям неоднородна и читается как специфический профиль неудачи — 65% за верность исходному изображению и 66% за тайминг, против 43% за согласованность и 45% за музыку.

Цифры Griffin получены с помощью инструмента, созданного кем-то другим, — и именно в этом заключается принципиальная разница. VideoFDB от NVIDIA — это бенчмарк для полноудуплексного аудиовизуального диалога с оценкой по двум трекам, и NVIDIA сама его создала и проводит оценивание с помощью собственного судьи по опубликованному рубрикатору. Griffin-Lite набрал 3,83 из 5 по генерации против 3,92 у человеческого эталона и 2,80 у следующей по результатам опубликованной системы, а также 3,73 по восприятию против 4,20 у человеческого эталона. Tavus также сообщает о 0,43 секунды истинной задержки от аудио к видео для генератора в сравнении с четырьмя опубликованными базовыми решениями потоковой диффузии на H100. Оговорки по-прежнему в силе — разрыв в 0,09 балла с человеком по пятибалльной шкале, оцениваемой языковой моделью, — это «близко», а не «наравне», и часть преимущества по восприятию измеряется в сравнении с системами, работающими без видеовхода, — но оценщик — не сам производитель.

• Независимые оценки качества — ни у одного из них таковых нет. HeyGen Video не фигурирует ни в одном из трёх видеорейтингов Artificial Analysis по состоянию на 2 октября 2026 года, как и Griffin. Возможно, Griffin не появится там никогда: попарное голосование предпочтений по коротким клипам не может оценить живой разговор.

Те же таблицы лидеров действительно включают базовую модель. MiniMax H3 занимает 4-е место в text-to-video (со звуком) с Elo 1 139 и 2-е место в image-to-video с 1 181, причём в обоих случаях цена — $4,80/мин, — так что посттренировка HeyGen конкурирует на базе, которую независимая арена уже оценивает как одну из лучших; и это самый сильный аргумент в её пользу, который сама HeyGen не опубликовала.

A screenshot of the top of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026: Wan 3.0 first at Elo 1,157 and $12.00/min, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at Elo 1,139 with 7,496 votes and $4.80/min, MiniMax H3 Max (based on MiniMax H3) fifth at 1,134 with 5,510 votes, and FLUX 3 sixth at 1,127, with release months and per-minute API pricing columns visible.

Оба дешевы или бесценны по одной и той же причине

Структурный факт, лежащий в основе обоих запусков, состоит в том, что создание убедительного человека подешевело, и ни у одной из компаний преимущество в издержках не проистекает из того, что она продаёт.

HeyGen Video — это результат пост-обучения MiniMax H3, которую MiniMax выпустила с весами, доступными по её собственной лицензии сообщества. Это превратило H3 в основу, которую другие компании могут специализировать и перепродавать, и HeyGen — второй продукт, сделавший это за пять недель для другой вертикали — бизнес-видео, демонстраций продуктов, обучения, обзоров недвижимости. Именно из-за этой схемы HeyGen может устанавливать цену ниже базовой: она не несёт затрат на базовую модель, а база — это выпущенный кем-то другим релиз с открытыми весами.

Griffin — это противоположная ставка. Tavus построила всю систему — кодек, потоковый генератор речи, потоковый генератор видео, диалоговую модель — вокруг самого взаимодействия, дистиллируя большой двунаправленный диффузионный учитель в малошаговый авторегрессионный генератор в три этапа, чтобы длительные прогоны не дрейфовали. Это дорогостоящее исследование, не имеющее открытой базы, на которую можно опереться, и это правдоподобная часть объяснения того, почему релиз ограничен: под ним нет дешёвого субстрата, на котором можно было бы амортизировать затраты.

Обе компании также приходят к одной и той же неудобной точке, но с разных сторон. В собственной документации HeyGen перечислено то, в чём модель хуже всего, — такое встречается редко и заслуживает прочтения: длинный текст на экране, мягкое органическое движение, например лепестков, бумаги и волос, и работа руками крупным планом, такая как сборка или управление оборудованием. Лучше всего она работает на коротких, замкнутых кадрах — один субъект, одно место, одно действие, зафиксированная или почти неподвижная камера. Ограничение Griffin — не список режимов отказа, а нерешённая проблема безопасности: Tavus прямо заявляет, что свойства, которые делают модель взаимодействия с человеком лучшим интерфейсом, также делают её лучше в убеждении кого-то, что он разговаривает с человеком, и что компания придерживает превью, пока разрабатывает механизмы раскрытия.

Что покупатель действительно может сделать сегодня

HeyGen Video теперь доступен для вызова. Он работает через POST /v3/models/videos с заголовком x-api-key, только на платных API-ключах, со ссылками на скачивание, которые подписываются и истекают — поэтому опрос обновляет их, — и колбэками, которые вызываются один раз на задачу, причём сам HeyGen советует считать это оптимизацией задержки, а не гарантией. Если вы тестируете это в текущем месяце: промо-секунда за $0,01 действует, потолок вывода — 768p, а режим улучшения промпта — реальный рычаг управления затратами: turbo по умолчанию, quality для более длительного прохода, disabled — чтобы отправить ваш текст без изменений.

Griffin недоступен для вызова. Доступ — это форма запроса и предварительная версия для исследований. Нет ни ключа, ни идентификатора, ни эндпоинта, ни SLA, и единственное опубликованное заявление о доступности состоит в том, что она появится, как только Tavus разберётся, как безопасно его выпустить.

One thing both have in common is that neither is a model a router can help you reach, and in Griffin's case that is a category problem rather than a temporary one — a real-time full-duplex session is not a request-response call. What a router does help with in either pipeline is the layer around the video. Prompt expansion, reference-image inventory, shot descriptions, caption generation and review summarisation are all text calls, and the ones from OpenAI, Google and the rest sit on the OrcaRouter catalogue behind one OpenAI-compatible endpoint at 200+ models on the same key, at provider list price with 0% markup added, so a vendor price change is live the same day. Where the video model itself is concerned there is one useful fact: MiniMax H3 — the base HeyGen Video was tuned from, and the thing whose per-second price HeyGen's $0.01 is undercutting — is routed here as minimax/minimax-h3 at $0.08 per second, with 2K at $0.13. HeyGen Video itself is not in our catalogue and neither is Griffin; both are served through their own vendors' APIs and several third-party platforms.

A screenshot of OrcaRouter's own model page for MiniMax-H3, captured 2 October 2026, showing the model id minimax/minimax-h3 labelled "text + image + video + audio", an Output type of video, a p50 time-to-first-token of 375 ms, and the OrcaRouter navigation and pricing panels alongside.

Какой именно и для кого?

• Используйте HeyGen Video, если результат — короткий, компактный видеоматериал с человеком в центре и встроенным звуком, и вас устраивает 768p при 24 кадрах/с. Закладывайте тариф после октября где-то между $0.02 и $0.03 за секунду, а не промо-цену в 10 центов, и тщательно проверяйте длинный текст на экране и работу руками крупным планом, прежде чем закреплять за ним рабочий процесс, потому что HeyGen уже сказал вам, что именно на этом он и ломается.

• Не стройте планов с расчётом на Griffin. Запросите доступ, если ваш вопрос заключается в том, сможет ли человек отличить сгенерированного человека от реального за минутный разговор, или если вам нужно понять, куда движется слой взаимодействия в реальном времени, прежде чем привязывать дорожную карту к рендеренным клипам.

• Следите за вопросом раскрытия информации, потому что это единственное, что заставит обе компании сдвинуться с места. У клиентов HeyGen Video есть простой готовый ответ — модель представляет собой дообученную версию открытой базовой модели с открытыми весами, а результат — это файл с известным происхождением, — тогда как Tavus придерживает модель именно потому, что у неё такого ответа пока нет. Какая бы компания ни опубликовала лучший механизм раскрытия информации, она решит более ценную проблему.

A two-column scoreboard titled "Tavus Griffin vs HeyGen Video 1 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Output: live session; Resolution: 720p at 25 fps; Clip length: none - a session; Independent score: none. Right column "HeyGen Video 1": Status: live 30 September 2026; Price: $0.01 per second; Output: video file; Resolution: 768p at 24 fps; Clip length: 5 to 15 seconds; Independent score: none yet. Footer: "HeyGen price per HeyGen's launch page, October 2026. Neither has an independent score."