Титульная карточка для «Tavus Griffin vs Seedance 2.5» с подзаголовком «Один генерирует тридцать секунд, а другой ждёт, пока вы закончите предложение», над четырьмя чипами: Seedance 2.5 — 30 с за один проход; Seedance 2.5 — около $0,51 за 5 с при 480p; Griffin — 0,43 с из аудио в видео; Griffin пока нельзя продавать клиентам.
Guides & Insights

Tavus Griffin против Seedance 2.5: один генерирует тридцать секунд, другой ждёт, пока вы договорите предложение

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самый быстрый способ понять разницу между Tavus Griffin и Seedance 2.5 — посмотреть, что каждый из них делает, когда вы замолкаете. Seedance 2.5, выпущенный командой Seed компании ByteDance 31 июля 2026 года, продолжает работать: дайте ему запрос, и он создаст до тридцати секунд видео за один проход, с синхронным звуком, в том разрешении и с той частотой кадров, которые вы выбрали перед тем, как нажать Enter. Tavus Griffin, анонсированный Tavus в октябре 2026 года как исследовательский предпросмотр, останавливается — а затем снова начинает, потому что он всё это время слушал и ему есть что ответить. Одна модель — это производственный движок, который работает без участия человека. Другая — участник, который работает только тогда, когда вы рядом.

Тридцать секунд одним дублем

Главная особенность Seedance 2.5 — длительность. Если предшественник ограничивался пятнадцатью секундами, то 2.5 создаёт тридцать секунд за одну генерацию — вдвое большее окно, а это разница между кадром и сценой. Помимо этого, он поддерживает многораундовое продление, а ByteDance продемонстрировала в бета-версии сверхдлинный режим, в котором модель просят продолжать собственный вывод, а не начинать с нуля.

Поверхность ввода широка даже по меркам 2026 года. Один запрос может содержать до примерно тридцати изображений, десяти видеоклипов и десяти аудиоклипов в качестве референсов, причём референсные видео и аудио имеют длительность примерно тридцать секунд каждое. Этого достаточно, чтобы сразу задать персонажа, локацию, движение и звуковую дорожку. Модель также поставляется с набором именованных режимов, которые больше напоминают пакет для композитинга, чем поле для промпта: режимы white-model и clay для превиза, зелёного экрана, референса движения и творческого референса. Поверх этого находятся управление на уровне временных меток и редактирование на уровне областей, и именно здесь тридцатисекундное окно перестаёт быть просто длительностью и становится таймлайном.

Аудио и видео получаются за один проход, а не мультиплексируются после, причём более чем на десяти языках диалогов, а список партнёров по запуску — XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence — выглядит как клиентская база промышленного и автомобильного сектора, а не как база пользователей творческих инструментов. Сама ByteDance формулирует это так: Seedance 2.5 предназначен для тех, кому нужен готовый фрагмент видеоматериала, а не взаимодействие.

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard filtered to models with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144 with 7,526 votes and $34.12 per minute, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns.

Модель, которая существует только пока вы говорите

Griffin — это система противоположной конфигурации, и Tavus необычно откровенно говорит об этой конфигурации. Она называет Griffin первой Human Interaction Model: системой «видео-в-видео», которая во время разговора наблюдает за участником, слушает его и в реальном времени генерирует другую сторону разговора. Архитектура делится на Continuous Conversational Modeling, которая решает, что персона должна делать в каждый момент, и Audio-Visual Generation, которая потоково передаёт соответствующую речь и лицо. Она работает в режиме полного дуплекса, поэтому её можно прервать, и ей не нужен чёткий сигнал конца реплики, чтобы ответить.

Всё в реализации настроено на следующую долю секунды, а не на следующий план. Аудиокодек Tavec работает на частоте 48 кГц с 40 значениями на кадр при 100 кадрах в секунду, без кодовых книг, с полностью каузальным декодером и пакетами размером всего 10 миллисекунд. Видео транслируется в 720p фрагментами по 320 миллисекунд, один латент на восемь кадров при 25 кадрах в секунду, три шага диффузии на латент, с 8-кратным временным сжатием в VAE. Трёхэтапная дистилляция — сначала сопоставление распределений, затем авторегрессия с teacher forcing, затем self-forcing — вот что делает три шага диффузии жизнеспособными в реальном времени. Задержка от аудио к видео в среднем составляет 0,43 секунды на H100, что, по словам Tavus, примерно вдвое меньше, чем у следующего по скорости метода, который она измерила. Для клонирования голоса требуется примерно десятисекундный образец.

А затем предложение, которое определяет, как вам строить планы с учётом этого: Tavus заявляет, что Griffin-Lite, исследовательский предпросмотр, доступен избранной группе ранних тестировщиков, что на данный момент Griffin-Lite не будет доступен для использования клиентами, что далее последует более широкий выпуск более мощной модели, и что Griffin пока отсутствует на платформе Tavus — он появится, как только компания разберётся, как безопасно его выпустить.

Утверждения, которые делает каждый из них, и чего они стоят

Доказательства Seedance 2.5 в основном касаются возможностей: что он может принимать, как долго может работать, сколько стоит. Доказательства Griffin в основном касаются эффекта. В исследовании совместно с Лондонским университетом королевы Марии Tavus сообщает, что 26 из 54 участников — 48% — поверили, что Griffin — реальный человек, после минутного видеозвонка, против 1 из 41 (2,4%) на его предыдущем стеке Phoenix-4.5, Sparrow-2 и Raven-1, причём сомневающиеся обычно начинали подозревать в первые двадцать секунд. В бенчмарке VideoFDB от NVIDIA, оценённом в сентябре 2026 года, Griffin занимает первое место по ИИ для общения лицом к лицу, по подсчётам Tavus: генерация 3,83 против 2,80 у сильнейшего заявленного базового показателя и 3,92 у человека, восприятие 3,73 против 3,44 и 4,20, и опережение на 37% следующей лучшей системы по мгновенному реагированию. Сообщено производителем, на бенчмарке, созданном NVIDIA, — но именно показатели сравнения с человеком имеют вес.

Для Seedance 2.5 не существует сопоставимого независимого теста на «поверила ли в это аудитория», потому что он не для этого предназначен. Две модели отвечают на разные вопросы, и ни один из наборов чисел не переносится на другую.

Что вы действительно можете купить

Seedance 2.5 — это продукт с тарифной сеткой. На платформе ByteDance ModelArk его цена составляет $10,70 за миллион токенов без видеовхода и $6,40 за миллион с видеовходом, что даёт примерно $0,51 за пятисекундный клип 16:9 в 480p и примерно $1,16 за тот же клип в 720p. Доступ осуществляется через потребительские приложения ByteDance и через API на Volcano Engine Ark в Китае и BytePlus ModelArk на международном рынке. По крайней мере один дистрибьютор утверждает, что продукт недоступен в США, а источники расходятся во мнениях о том, максимальное разрешение — 720p или 1080p; и то, и другое стоит знать, прежде чем вносить это в спецификацию.

У Griffin нет тарифной сетки, нет публичного API и нет даты. Это и есть всё, что определяет решение о покупке, и это упрощает вопрос сильнее, чем готова признать большинство сравнительных статей.

Board titled 'Seconds versus Sentences'. Seedance 2.5 card: what it reads a prompt plus up to 30 images, 10 video clips and 10 audio clips; what it returns up to 30 seconds of video in one pass; audio joint audio and video over 10 languages; latency batch generation, no real-time mode; price about $0.51 per five-second 480p clip on ModelArk; availability shipped 31 July 2026, live on ModelArk. Tavus Griffin card: what it reads the live participant, video and audio; what it returns the other side of the conversation in real time; audio streaming speech with a voice cloned from a ten-second sample; latency 0.43 s average audio to video on H100s; price none published; availability research preview, selected testers only.

Где маршрутизатор заслуживает своё место

Если вы создаёте что-то, что требует и того и другого — агента, который ведёт беседу и при этом выдаёт готовый видеоматериал, — вы имеете дело с двумя поставщиками, двумя консолями, двумя системами биллинга и двумя разными представлениями о том, что такое запрос. Именно на этом стыке OrcaRouter действительно полезен, а не просто декоративен: один ключ для более чем двухсот моделей, со сквозной передачей прайс-листовых цен провайдеров при наценке 0%, чтобы снижение цены поставщиком попадало в счёт в тот же день, автоматическое переключение при сбое, чтобы один перегруженный провайдер не превратился в ваш простой, и DSL маршрутизации, позволяющий привязать критичные задачи к конкретному бэкенду, пока черновики уходят туда, где мощности дешевле всего. И слияние моделей здесь важно в частных случаях — для генератора с оплатой за токен или за секунду потратить дешёвую текстовую модель на оттачивание промпта перед тем, как тратиться на дорогую генерацию, обычно самая выгодная строка в конвейере.

Если быть точным насчёт двух моделей из заголовка: ни Seedance 2.5, ни Griffin не являются маршрутом OrcaRouter. Seedance доступна через собственные платформы ByteDance и сторонних дистрибьюторов; Griffin же недоступна вообще. Что действительно есть в каталоге со стороны видео — так это minimax/minimax-h3, омнимодальный генератор MiniMax, по цене $0,08 за секунду выходных данных при 768P и $0,13 за секунду при 2K, продаётся в тех же единицах за секунду, что и Seedance, и уже доступен.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Часто задаваемые, кратко

Могу ли я использовать Seedance 2.5 и Griffin в одном продукте?С архитектурной точки зрения — да, и это очевидное разделение: Seedance для всего, что можно предварительно отрендерить, Griffin для live-поверхности. С коммерческой точки зрения — нет, потому что Griffin пока нельзя продать вам.

Griffin — это всего лишь генератор говорящих голов? Нет, и Tavus тщательно относится к этому различию — генератор говорящих голов принимает текст и возвращает видео, тогда как Griffin принимает видео и аудио участника в качестве входных данных и оценивается по тому, реагирует ли он в моменте.

Работает ли Seedance 2.5 в реальном времени? Нет. Это пакетный генератор с ограничением в тридцать секунд и режимом многораундового продления; задержка — не та ось, по которой он конкурирует.

Итог

Seedance 2.5 — это уже выпущенный рабочий движок: тридцать секунд за один проход, совместное аудио, до тридцати изображений и десяти видео- и аудиореференсов, управление на уровне таймстемпов и областей, примерно $0,51 за пятисекундный клип 480p и примерно $1,16 при 720p на ModelArk, доступен уже сейчас через собственные платформы ByteDance и, насколько кому-либо известно, не в США. Tavus Griffin — это не продукт: это дуплексная Human Interaction Model, чьи опубликованные достижения — 48% участников, поверивших, что она человек, в минутном звонке, и средняя задержка от аудио к видео 0,43 секунды на H100s, а её поставщик письменно заявил, что клиенты пока не могут её использовать. Если вам нужны отснятые материалы сегодня, ответ — Seedance, и его цена открыта. Если вам нужно лицо, которое реагирует, пока вы говорите, ответ таков: пока никто такого не продаёт.