Главная карточка для «Tavus Griffin vs Alibaba Wan 2.7» с двумя чипами: «Tavus Griffin — цена не опубликована» и «Alibaba Wan 2.7 — $9.00 за минуту в 1080p», над шестью строками: Создаёт: живой разговор; Против: клип длительностью от 2 до 15 секунд; Цена Griffin: не опубликована; Цена Wan 2.7: $9.00 за минуту; Статус Griffin: исследовательский предпросмотр; Статус Wan 2.7: общедоступно. Нижний колонтитул: «Тарифы Wan 2.7 — это прейскурантные цены Alibaba Cloud; Griffin — исследовательский предпросмотр без тарифной сетки.»
Guides & Insights

Tavus Griffin против Alibaba Wan 2.7: разговорная модель против генеративной

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Заманчивый способ сравнить Tavus Griffin и Alibaba Wan 2.7 — это стоимость за секунду видео, но такое сравнение провести нельзя. У Wan 2.7 есть опубликованная тарифная сетка — $9.00 за минуту при 1080p на международных эндпоинтах Alibaba Cloud в Сингапуре, а также более дешёвый тариф для Пекина и Токио, — а у Tavus Griffin тарифной сетки нет вообще, потому что Griffin-Lite был выпущен 1 октября 2026 года как исследовательский предпросмотр для избранных доверенных тестировщиков после заполнения формы запроса. Что их объединяет, так это слово: видео. За этим исключением они отвечают на разные вопросы. Первого спрашивают, что должно произойти дальше в разговоре; второго — как выглядит описанная сцена. Интересное сравнение — не в качестве, а в том, что каждому из них нужно от вас, прежде чем он что-либо создаст, и что вы получите в ответ.

Разница в цикле, а не в разрешении.

Wan 2.7 генерирует клип за клипом по промпту. Вы пишете описание, получаете фрагмент видео, смотрите его, пишете следующее. Wan 2.7 — это набор из четырёх моделей: текст-в-видео, изображение-в-видео, референс-в-видео и видеомонтаж — и взаимодействие по сути транзакционное: вход, отрендеренный результат и решение, оставлять ли его. Ничто в нём не запускается, пока вы ещё решаете, что попросить.

Griffin устроен по обратному принципу. Это полнодуплексная система: движок непрерывного моделирования разговора, который принимает аудио и видео и заново оценивает беседу с интервалами менее секунды, решая, промолчать, подать сигнал, вставить короткую реплику или взять слово, и выдаёт выразительные управляющие сигналы, которые параллельно приводят в действие потоковый генератор речи и потоковый генератор видео. Он генерирует 720p фрагментами по 320 мс на основе единственной эталонной фотографии, и главное утверждение состоит в том, что решение, принятое в середине предложения, проявляется в голосе и на лице в пределах того же мини-хода. Критерий оценки здесь — не таблица лидеров по клипам. А то, можно ли его перебить.

Проще говоря: Wan 2.7 отвечает на вопрос «как эта сцена выглядит в движении?» Griffin отвечает: «что должны делать это лицо и голос в следующие двести миллисекунд, учитывая, что человек только что сделал паузу».

Цена, с той стороны, где она есть

Опубликованные расценки Wan 2.7 указаны за секунду сгенерированного видео, и тарифные уровни не одинаковы по всей линейке — именно эту деталь большинство страниц сравнений пропускает.

• wan2.7-t2v и wan2.7-i2v — тарифицируются только по длительности выходного видео. Международный Сингапур: $0,10/с при 720p и $0,15/с при 1080p, что соответствует показателю $9,00/мин в таблицах лидеров. Пекин и Токио указывают $0,086/с и $0,143/с за ту же работу.

• wan2.7-r2v (reference-to-video) — тарифицируется по длительности входного видео, но не более пяти секунд, плюс выходное видео. Если подать пятисекундный референс в пятнадцатисекундную генерацию, с вас возьмут плату за двадцать секунд.

• wan2.7-videoedit — оплата только за результат, входное видео бесплатно.

Рядом с этими цифрами следует упомянуть два факта жизненного цикла. Alibaba предлагала ограниченную по времени 30-процентную скидку в честь запуска на собственных платформах Bailian и Qwen Cloud, действовавшую до 23 сентября 2026 года включительно, и этот срок уже прошёл. А уведомление Alibaba Cloud Model Studio о выводе из эксплуатации (ID 118434) отключает несколько более старых моделей 10 октября 2026 года, включая wan2.7-r2v и wan2.7-image. Речь идёт о выводе на уровне вариантов, а не всего поколения, — wan2.7-t2v и wan2.7-i2v по-прежнему в списке с актуальными тарифами, а их страницы обновлялись совсем недавно, 11 сентября, — но если reference-to-video — это причина, по которой вы смотрели на 2.7, у этого маршрута есть дата.

У сравнения с Griffin есть одна честная строка: рядом с ценой Wan 2.7 нечего поставить, потому что Tavus не опубликовала никакой. Griffin-Lite отсутствует на платформе Tavus, в анонсе говорится, что в настоящее время он не будет доступен для использования клиентами, а заключительная фраза самой компании такова: Griffin появится, как только она разберётся, как безопасно его выпустить. Нет ни тарифа за секунду, ни тарифа за запрос, ни бесплатного тарифа, ни корпоративного тарифа. Любой, кто называет цену за Griffin, её выдумывает.

Оценки качества: два совета, которые не заседают

Обе модели оценивались по совершенно разным инструментам, поэтому сравнение их рейтингов Эло невозможно.

У Wan 2.7 есть две записи на видеоарене Artificial Analysis, и они находятся не в одном и том же месте — в этом-то и ловушка, если приводить для него одну цифру. Elo там выводится из слепых попарных голосований людей по предпочтениям, методологии, созданной для коротких сгенерированных клипов, и оба приведённых ниже показателя взяты с табло по состоянию на 2 октября 2026 года.

• Wan2.7-260612 (июньская сборка) в категории «текст — видео» (со звуком) — 13–14-е место, Elo 1 032 (±10) по результатам 4 645 голосов, $9,00/мин.

• Wan 2.7 (апрельская сборка) в категории «изображение → видео» (со звуком) — 12-е место из 34, Elo 1 077 по итогам 4 571 голоса, $9,00/мин, рейтинг, в котором примерно столько же голосов, но который отводит ему существенно более высокое место.

• Wan 3.0, более новый собрат — 1-е место с рейтингом Elo 1 157 в преобразовании текста в видео и 6-е место с 1 164 в преобразовании изображения в видео, в обоих случаях — $12.00/мин. Вот это число стоит знать, прежде чем сравнивать Wan 2.7 с чем угодно: собственное следующее поколение Alibaba возглавляет таблицу, а 2.7 — середняк в таблице.

A screenshot of the top of Artificial Analysis's "AA-Video-T2V v2.0" leaderboard, text-to-video with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157 with 7,575 votes and $12.00/min; Utopai X (based on MiniMax H3) second at 1,150; Dreamina Seedance 2.5 third at 1,144; MiniMax H3 (768p) fourth at 1,139 and $4.80/min; MiniMax H3 Max fifth at 1,134; FLUX 3 sixth at 1,127; Gemini Omni Flash eighth at 1,117 and $9.12/min; Wan2.7-260612 thirteenth at 1,032 with 4,645 votes and $9.00/min; and the two Kling 3.0 1080p tiers sixteenth, at Elo 1,018 and Elo 1,000.

Griffin представлен в VideoFDB от NVIDIA — бенчмарке для полнодуплексного аудиовизуального разговора, который NVIDIA создала и независимо оценила в сентябре 2026 года, используя судью на основе языковой модели по рубрике с оценками от нуля до пяти. Griffin-Lite набрал 3,83 на треке генерации против человеческого эталона 3,92 и 2,80 у следующей по результату опубликованной системы, а также 3,73 на треке восприятия против человеческого эталона 4,20. Tavus также сообщает о 0,43 секунды реальной задержки преобразования аудио в видео для генератора по сравнению с четырьмя опубликованными базовыми моделями потоковой диффузии на H100.

Оба набора чисел правомерны, и ни один из них не переносится на другой контекст. Elo на арене — это подсчёт голосов о предпочтении видеоклипов; VideoFDB — оценка судьи по рубрике о поведении в разговоре. Между ними нет моста, и ловушка малой выборки работает и в обратную сторону: диапазон ±10 у арены на Wan 2.7 достаточно широк, чтобы его позиция относительно соседей не была строго определена, а разрыв в 0,09 балла между генерацией NVIDIA и человеком достаточно мал по пятибалльной шкале, чтобы честной интерпретацией было «близко к человеческому эталону», а не «на уровне человека». Сравнение восприятия тоже не является сравнением равного с равным — несколько систем, которые Griffin опережает, включая gpt-realtime от OpenAI и MiniCPM-o 4.5, оценивались в конфигурациях только с аудио, тогда как Griffin воспринимает и видео. Часть преимущества в 0,29 балла отражает просто наличие глаз.

Что каждому из них нужно от вас

Именно здесь сравнение становится полезным, потому что входные данные — это продукты.

• Ввод — Wan 2.7 принимает текст, изображение, видео и аудио. Griffin принимает живого человека через камеру и микрофон и вообще не генерирует клип по запросу.

• Выходные данные — Wan 2.7 создаёт видеофайл: от 2 до 15 секунд на одну генерацию, разрешение до 1080p, с нативным аудио. Griffin создаёт непрерывный разговор: видео 720p при 25 кадрах в секунду фрагментами по 320 мс, генерируемое в реальном времени и воспроизводимое по мере декодирования.

• Что управляет им — Wan 2.7 управляется промптом, а также до пятью изображениями субъекта и до пятью референсными клипами, в пределах максимума в десять референсных ассетов на запрос. Griffin управляется тем, что делает человек: пауза, взгляд в сторону, жест, перебивание.

• Временной горизонт — единица работы Wan 2.7 — это клип длительностью не более пятнадцати секунд, который затем монтируете вы. Единица работы Griffin — это разговор, и именно поэтому архитектуре пришлось решать проблему дрейфа — трёхэтапная дистилляция в авторегрессионный генератор, обученный на собственной сгенерированной истории, чтобы длинные прогоны оставались стабильными, — а не бороться за более длинную одиночную генерацию.

• Выходной контейнер — Wan 2.7 возвращает файл, которым вы владеете и который можете редактировать, цветокорректировать и распространять. Griffin возвращает отрендеренную сессию. Файла для редактирования нет, потому что пиксели генерируются по чанкам на основе референсного фото и собственной истории модели, а фон, тени и стул, на котором сидит человек, являются частью генерации.

Одно структурное различие, которое стоит назвать: затраты Wan 2.7 масштабируются с длительностью результата, а качество — с тем, насколько конкретен ваш промпт. Затраты Griffin не измерены, а его качество масштабируется с тем, насколько естественен человек на другом конце. Одно можно улучшить, написав более качественные брифы, а другое — только используя его с реальными людьми.

A screenshot of the top of Artificial Analysis's "AA-Video-I2V v1.0" leaderboard, image-to-video with audio, captured 2 October 2026: MiniMax H3 Max first at Elo 1,195; MiniMax H3 second at 1,181; Gemini Omni Flash third at 1,178; Dreamina Seedance 2.0 720p fourth at 1,176; HiDream-O1-Video-1.0 fifth at 1,175; Wan 3.0 sixth at 1,164 with 9,302 votes and $12.00/min; Veo 3.1 eleventh at 1,082; and Wan 2.7 twelfth at Elo 1,077 with 4,571 votes and $9.00/min. A note above the table says "AA-Video-I2V v2.0 is coming soon".

Референс и согласованность: где сталкиваются два дизайна

Wan 2.7 обеспечивает согласованность субъекта с помощью предоставленных референсов: пять изображений субъекта, пять референсных клипов, всего десять ассетов. Это фотографический подход — вы показываете, как выглядит субъект, и он сохраняет эту внешность на протяжении всей генерации.

Griffin управляет тем же самым, но противоположным способом. Он генерирует каждый пиксель в каждом кадре из одного эталонного изображения в реальном времени, и в анонсе прямо сказано, что он управляет всей сценой, а не лицом: руками и пальцами, движением стула, отбрасываемыми тенями и фоном позади. Согласованность здесь достигается за счёт того, что среда становится целью генерации, а не композитным слоем.

Ни один из подходов не является однозначно лучше — они ломаются по-разному. Генерация, обусловленная референсом, даёт сбой из-за дрейфа в сторону от заданного субъекта на длинном клипе. Погенерируемая по фрагментам генерация с авторегрессионной историей даёт сбой из-за блуждания на длинной сессии, если обработка дрейфа настроена неправильно, — и именно этот сбой призван предотвратить третий этап дистилляции. Wan 2.7 — более безопасный выбор, когда результат должен быть конкретным человеком в конкретном образе. Griffin не конкурирует за эту задачу.

Безопасность, происхождение и готовность к выпуску

Wan 2.7 не содержит опубликованной системы подтверждения происхождения, сравнимой с водяным знаком, который выдерживает сжатие, — в анонсе качество звука и точность текста на экране названы областями, всё ещё требующими доработки, что является скорее оговоркой о точности, чем о безопасности.

История безопасности Griffin перевёрнута: заявленная Tavus причина держать его в предварительном доступе состоит в том, что те же свойства, которые делают его лучшим интерфейсом, делают его и лучше в убеждении собеседника, будто тот говорит с человеком, и цифры подтверждают эту обеспокоенность. В собственном исследовании компании в реальном времени 26 из 54 участников считали, что их собеседник — настоящий человек, тогда как на предыдущем стеке Phoenix-4.5 / Raven-1 / Sparrow-2 таких был 1 из 41. У тех, кто всё же заподозрил, подозрение обычно возникало в первые двадцать секунд. Tavus говорит, что до выпуска требуется дополнительная работа по выравниванию и раскрытию информации, что компания создаёт функции раскрытия информации и сотрудничает с организациями по оценкам безопасности. Это самое содержательное, что кто-либо публиковал об этой модели, и именно поэтому продукта для покупки нет.

Для любого, кто сравнивает эти два решения как инструменты, практическое следствие простое: одно можно сгенерировать по запросу и выпустить уже сегодня, а другое представляет собой объект оценки, выпуск которого зависит от проблемы, которую поставщик ещё не решил.

Какой именно и для чего

• Выбирайте Wan 2.7, если результат — это видеоматериал. Редактирование существующего материала по инструкциям — та рабочая нагрузка, где он необычно силён и необычно дёшев, потому что вариант для редактирования тарифицирует только вывод и считает входной видеоматериал бесплатным. Его вариант reference-to-video стоит проверить с учётом вывода из эксплуатации 10 октября, прежде чем остановиться на нём.

• Не выбирайте Griffin ни для чего в этом квартале, потому что вы не можете. Запросите доступ, если вам нужно узнать, может ли человек определить это, или если ваша дорожная карта зависит от слоя взаимодействия, а не от слоя видеоматериала.

• Обращайте внимание на разрыв, а не на ту или иную модель. Появление Griffin делает более интересным сравнение с будущим: система, генерирующая весь разговор, против набора, генерирующего всю сцену. Первый продукт, который умеет и то и другое, станет тем, с чем стоит перечитать это заново.

Где маршрутизатор уместен, а где нет

Ни одной из этих моделей нет в каталоге OrcaRouter, и об этом стоит заявить прежде всего остального в этом разделе. Wan 2.7 доступна через собственные платформы Alibaba — Model Studio на Alibaba Cloud и Qwen Cloud — а также через сторонние креативные инструменты, которые интегрировали её после запуска; Tavus Griffin доступна только по форме запроса. Если какая-либо из них станет доступна для маршрутизации, она появится по прейскурантной цене провайдера.

Та часть видеоконвейера, которая представляет собой задачу маршрутизации, — это текст вокруг неё. Списки кадров, расширение промптов, генерация подписей, сводки по проверке качества, а также работа с транскриптом или диалогами, которая питает проход «референс-в-видео», — всё это текстовые вызовы, и они выполняются на том же OpenAI-совместимом эндпоинте в OrcaRouter, что и 200+ других моделей по прайс-листовой цене провайдера с добавленной наценкой 0%, поэтому снижение цены поставщиком вступает в силу в тот же день, а не после контрактного цикла. Использование дешёвой модели для массового прохода и передовой модели для финального — это изменение конфигурации там, а не вторые отношения с поставщиком — тот же аргумент применим и к слою генерации, как только слой генерации станет чем-то, что можно вызвать.

Что отслеживать: сохранятся ли без изменений референсный и редактирующий варианты набора Wan 2.7 после вывода Model Studio из эксплуатации 10 октября, и выпустит ли защитный механизм Griffin опубликованную карточку модели с указанным в ней эндпоинтом. Именно эти два события превратили бы данное сравнение из проектного эссе в решение о закупке.

A two-column scoreboard titled "Tavus Griffin vs Alibaba Wan 2.7 — the scoreboard". Left column "Tavus Griffin": Makes: a live conversation; Price: none published; Output: 720p in 320 ms chunks; Input: a person on camera; Clip length: none - a session; Score: VideoFDB 3.83 of 5. Right column "Alibaba Wan 2.7": Makes: 2 to 15 second clips; Price: $9.00 per minute; Output: up to 1080p; Input: text, image, video; Clip length: 2 to 15 seconds; Score: arena Elo 1,032. Footer: "Wan rates per Alibaba Cloud; Elo per Artificial Analysis, 2 October 2026. Griffin figures Tavus-reported."
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube