Сгенерированная титульная карточка для Vidu Q4 Preview с подзаголовком «Третье место в рейтинге image-to-video в первый день», с карточками «AA-Video-I2V v1.0: №3, Elo 1 179» и «Vidu Q3 Pro: №19, Elo 1 056», а также ряд плиток с характеристиками: «Макс. длина клипа: 16 секунд», «Макс. разрешение: 4K», «Референсные изображения: до 15» и «Text-to-video: не поддерживается». Логотип OrcaRouter расположен в правой нижней полосе с отступами.
Guides & Insights

Vidu Q4 Preview дебютирует на третьем месте в рейтинге Image-to-Video — и отсутствует в другом

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Vidu Q4 Previewвошла в таблицу лидеров Artificial Analysis AA-Video-I2V v1.0 на третье место с рейтингом Elo 1 179, а модель, которую она сместила с позиции лучшего результата Vidu, Vidu Q3 Pro, занимает девятнадцатое место с 1 056. Это скачок на 123 пункта за один релиз — на таблице, где доверительные интервалы составляют примерно двадцать пунктов в ширину, — и произошёл он при цене $7,20 за минуту сгенерированного видео вместо $9,60, которые взимаются за более старую модель. Shengshu Technology выпустила Vidu Q4 Preview 7 октября 2026 года как первую публичную предварительную версию своего флагмана нового поколения, намеренно опережая полную модель Q4, и призывает авторов использовать её в реальных проектах, пока финальный релиз ещё дорабатывается.

Дебютная цифра — это заголовок. Отсутствие — более интересный факт, и именно поэтому это статья, а не график.

Что на самом деле вышло 7 октября

Vidu Q4 — это модель генерации видео с нативным звуком, которая продаётся через собственный веб-продукт и API-платформу Vidu. В материалах Shengshu о запуске описываются три направления работы: актёрская игра персонажа (мимика, эмоции, тело и голос согласованы, а не наложены слоями), согласованность камеры и монтажа в динамичных сценах и визуальные эффекты — взрывы, частицы, фейерверки, — которые являются частью сцены, а не накладываются поверх неё.

Спецификация, как её излагает поставщик:

• Максимальное разрешение — 4K, при этом 2K и 4K имеют 10-битную глубину цвета; полная линейка — 540p, 720p, 1080p, 2K, 4K

• Максимальная длина клипа — 16 секунд, распределены неравномерно: Image-to-Video длится от 3 до 16 секунд, Reference-to-Video — от 1 до 16

• Бюджет референсов — до 15 референсных изображений (персонажи, гардероб, реквизит, продукты, окружение в рамках одной настройки) и до 3 референсных аудиоклипов

• Стартовая цена — от $0,014 за секунду, что является цифрой продавца и явно носит промо-характер.

Производитель также выдвигает сравнительное утверждение, за которое его нелегко призвать к ответу: что при сопоставимых спецификациях выходных данных и условиях тарификации Vidu Q4 Preview обеспечивает «до пяти раз больший объём выходных данных за тот же бюджет». Это утверждение об эффективности, а не о качестве, и поскольку фраза «сопоставимые спецификации выходных данных и условия тарификации» делает в этом предложении всю работу, всё утверждение стоит рассматривать как маркетинговый приём, пока кто-нибудь не воспроизведёт его. Собственная оговорка Shengshu, опубликованная вместе с ним, состоит в том, что итоговые цены, поддерживаемые разрешения, доступность функций и условия использования могут различаться в зависимости от тарифа и региона.

A generated single-column scoreboard titled 'Vidu Q4 Preview — the scoreboard' with six rows reading 'AA I2V rank: 3rd, Elo 1,179', 'Max resolution: 4K at 10-bit', 'Max clip: 16 seconds', 'Reference images: up to 15', 'Reference audio: up to 3' and 'Measured rate: $7.20 per minute', with a footer reading 'Elo, rank and rate per Artificial Analysis, 8 October 2026; resolution and clip length are vendor-stated.' The OrcaRouter logo sits in the bottom-right padded strip.

Два совета расходятся во мнениях о том, для чего предназначена эта модель.

Artificial Analysis ведёт отдельные таблицы лидеров для видео с отдельными шкалами Elo и отдельными пулами голосов, и разница между ними — в этом вся суть.

On AA-Video-I2V v1.0 — image-to-video, ranked from pairwise human preference votes with audio kept in — Vidu Q4 Preview is third at 1,179 ±10 over 5,543 samples, dated October 2026, priced at $7.20 per minute. Only two models are above it: MiniMax H3 Max at 1,195 ±9 over 5,894 samples ($4.80/min, August 2026) and MiniMax H3 at 1,181 ±8 over 7,284 samples ($7.80/min, July 2026). Gem​ini Omni Flash is fourth at 1,178 ±7 over 12,327 samples. The board's own notice says two models were added in the last 30 days: Vidu Q4 Preview and HiDream-O1-Video-1.0, which is sixth at 1,175 ±10.

В AA-Video-T2V v2.0 — преобразование текста в видео, другой таблице, построенной на другой таксономии вариантов использования — Vidu Q4 Preview вообще не появляется. Лучшая позиция Vidu там — Vidu Q3 Pro, двадцатое место с 941 ±10 на 4 088 образцах. Wan 3.0 возглавляет эту таблицу с 1,156 ±9.

Прочитайте эти два предложения вместе, и характер релиза становится ясен. Это модель для работы с изображениями и референсами. На собственной странице продукта Vidu перечислены ровно два режима для неё — Image-to-Video и Reference-to-Video, без вкладки text-to-video, и документация API это подтверждает. Запуск, который в маркетинге вендора выглядит как универсальный флагман, на независимых площадках оказывается узконаправленным.

Ещё одна оговорка относительно самого ранга. Десятипунктовые интервалы таблицы I2V сильно перекрываются с третьего по шестое место — 1 179, 1 178, 1 176, 1 175, — так что «третье место» — это позиция в пределах шума, а не чёткое отделение от четвёртого. А вот что не находится в пределах шума, так это разрыв с моделью, которую он заменил. 123 пункта Elo между Vidu Q3 Pro и Vidu Q4 Preview больше, чем весь разброс по шести верхним местам таблицы.

The Artificial Analysis image-to-video board on 8 October 2026, with Vidu Q4 Preview third at Elo 1,179 and Vidu Q3 Pro nineteenth at 1,056.

То, что вы на самом деле называете, и сколько это стоит

API не блещет красотой и предельно конкретен. Image-to-Video отправляет POST-запрос на /ent/v2/img2video с именем модели viduq4-preview, принимает одно изображение стартового кадра (png, jpeg, jpg или webp, размером до 50 МБ), промпт длиной до 20 000 символов, длительность от 3 до 16 секунд со значением по умолчанию 5 и разрешение от 540p до 4K со значением по умолчанию 720p. Reference-to-Video отправляет POST-запрос на /ent/v2/reference2video, принимает от одного до пятнадцати изображений плюс от нуля до трёх mp3-аудиореференсов длительностью от трёх до двенадцати секунд каждый и предлагает соотношения сторон 1:1, 9:16, 16:9, 3:4 и 4:3 со значением по умолчанию 16:9.

Параметр, на который стоит обратить внимание, —audio, который по умолчанию равен true. Vidu Q4 Preview по умолчанию генерирует звук вместе с изображением — включая диалоги и звуковые эффекты, — а отключаете вы его намеренно. Возвращаемые URL созданий остаются действительными в течение 24 часов, а это достаточно короткий срок, чтобы иметь значение, если вы генерируете пакетно, а рендерите позже.

Если говорить о цене, то честная арифметика такова: две озвученные цифры — «0,014 доллара в секунду» и 7,20 доллара в минуту, которые фиксирует Artificial Analysis, — относятся не к одному и тому же продукту. 0,014 доллара в секунду — это 0,84 доллара в минуту, примерно девятая часть показателя из рейтинга; именно так выглядит акционная минимальная цена при самом низком разрешении рядом с измеренной ставкой при рабочем. Всё, что вы закладываете в бюджет исходя из стартовой цифры, следует пересчитать исходя из вашего собственного разрешения и длительности, а не из заголовка.

Vidu's own API documentation for the Image-to-Video and Reference-to-Video endpoints behind Vidu Q4 Preview.

Практическая проблема с SKU предварительного просмотра

Vidu Q4 Preview, по формулировке самого вендора, еще не завершён. Он вышел раньше Q4, чтобы отзывы о производительности, творческом контроле и повседневных производственных нуждах помогли сформировать финальный релиз. Цены носят промо-характер. Доступность функций зависит от тарифа и региона. В документации API даже есть алиас с опечаткой — viduq4-previerw появляется в описании параметра модели рядом с правильным viduq4-preview — и это мелочь, которая говорит кое-что правдивое о том, где эта сборка находится в пайплайне.

Это не аргумент против его использования. Это аргумент против того, чтобы ставить его на критический путь без плана на случай, если закончится промо-цена или предварительная сборка будет заменена более новой, — а для модели, выпущенной таким образом, это вопрос недель, а не кварталов.

Если вы хотите попробовать это, не ставя на кон весь продакшн-пайплайн, OrcaRouter создан именно для такого случая: один эндпоинт с совместимостью с OpenAI для более чем 200 моделей, автоматическое переключение при сбоях между провайдерами и сквозные прайс-листовые цены провайдеров без каких-либо наценок. Роль автоматического переключения при сбоях здесь важнее, чем обычно, в случае превью-сборки, потому что именно оно позволяет направить запрос к стабильной модели с тем же ключом, когда превью-маршрут недоступен. Скажем прямо о маршрутизации: Vidu Q4 Preview сегодня не является маршрутом OrcaRouter. Видеомодели, которые мы обслуживаем — включая MiniMax H3, модель с самым высоким рейтингом на этой самой доске — вызываются через тот же эндпоинт, что и текстовые модели, а посекундная тарификация видео — это отдельная строка расходов, а не отдельный контракт.

Что посмотреть

Три вещи сдвинули бы эту историю с места.

Сначала — лидерборд по text-to-video. Artificial Analysis сообщила, что выйдет AA-Video-I2V v2.0 — согласованная с таксономией T2V v2.0 и на всём протяжении охватывающая видео в 1080p. Если Vidu Q4 Preview — это модель для изображений и референсов, она там тоже не появится — а если появится, это говорит о том, что Shengshu выпустила более широкую модель, чем предполагает превью.

Во-вторых, полноценный релиз в Q4. Переход от предварительной версии к финальной — это этап, на котором промо-цены обычно заканчиваются и на котором набор функций либо сохраняется, либо незаметно сужается. Бюджет референсов в 15 изображений и 3 аудио — та часть спецификации, которая с наибольшей вероятностью выживет, потому что именно на этом отличии построен весь запуск.

Третье — размер выборки. 5 543 голоса — это реальное измерение, но пока ещё раннее; интервалы сузятся, а место сместится — в ту или иную сторону — по мере заполнения таблицы. Любой, кто цитирует «третье место» как установленный факт, должен указывать дату, когда он это прочитал.

Вопрос, который стоит держать в голове, уже, чем предполагает маркетинг. Vidu Q4 Preview измеримо лучшая модель преобразования изображения в видео из всех, что создала Vidu, с отрывом, превышающим разброс между шестью лучшими в собственной таблице, и с более низкой ценой за минуту, чем у предшественника. Станет ли это устойчивым положением или всплеском на волне предпросмотра — на это не ответит ни одна из текущих цифр.