Сгенерированная титульная карточка с надписью «Kandinsky 6.0 Video vs Grok Imagine Video» и подзаголовком «Таблица лидеров перевернулась», над рядом значков с подписями «Генерация видео», «Синхронизированное аудио» и «Развёртывание с открытыми весами». Логотип OrcaRouter расположен в правом нижнем углу.
Guides & Insights

Kandinsky 6.0 Video против Grok Imagine Video: таблица лидеров перевернулась

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В январе 2026 года, когда Grok Imagine Videoвышла, она возглавила видеоарену Artificial Analysis в обоих режимах. Сегодня на той же таблице лидеров её текущая сборка занимает одиннадцатое или двенадцатое место в категории «текст — видео». Это не скандал и не провал — это то, что происходит со стремительно развивающейся категорией за девять месяцев, и это честная причина прямо сейчас сравнить генеративную модель xAI с Kandinsky 6.0 Video. Один из них — сервис, оптимизированный под то, как быстро вы можете создать очередной клип; другой — чекпойнт под лицензией MIT, 29 млрд параметров в версии Pro и 3 млрд в Lite, выпущенный лабораторией Kandinsky Lab компании Sber в первую неделю октября 2026 года, генерирующий пять секунд видео с синхронизированным звуком 44 кГц и липсинком. Интересный вопрос не в том, кто из них впереди в таблице лидеров, а в том, что каждый из них структурно способен сделать дальше.

Доска, которая сдвинулась под ним

Grok Imagine Video — генеративная модель xAI, впервые выпущенная 29 января 2026 года; начиная с 16 июня стабильной является версия 1.5. В рейтинге Artificial Analysis по преобразованию текста в видео её сборка 1.5 занимает 11–12-е места с Elo 1 045 (±9) по результатам 4 056 голосов и указана по цене $15.00 за минуту. Исходной сборки в этом рейтинге нет.

Генерация видео из изображения — это область, где семейство сильнее, и где две сборки расходятся так, что это стоит внимательно изучить:

• grok-imagine-video-1.5 — 7–9-е места, Elo 1 098 (±8), 5 267 голосов, 8,40 $/мин.

• grok-imagine-video (январская сборка) — 12–17-е места, Elo 1 072 (±7), 14 371 голос, $4,20/мин.

• Для сравнения, верхняя позиция той таблицы I2V — MiniMax H3 Max — находится на Elo 1 195 (±9) при 5 894 голосах, а Wan 3.0 занимает шестое место с 1 164.

Ниже следуют две интерпретации, и обе верны. Новая сборка xAI действительно опережает своего предшественника в задаче «изображение-в-видео» на 26 пунктов Elo, но за это приходится платить вдвое больше за минуту. А история недели запуска — модель, которая сразу оказалась на вершине — не удержалась: расклад изменился, арена накопила десятки тысяч голосов по дюжине новых систем, и позиция в середине таблицы — это место, куда девять месяцев конкуренции помещают быстрый генератор общего назначения.

У Kandinsky 6.0 Video нет Elo ни на одном табло. Его доказательства — это запуск VABench и проведённая в лаборатории оценка людьми, обе опубликованы Sber, ни одна не воспроизведена за пределами Sber. Ставить непроверенную открытую модель рядом с оценённой коммерческой — это именно то сравнение, к которому нужно относиться с осторожностью: позиция оценённой модели реальна и нелестна, а позиция неоценённой модели неизвестна. «Неизвестно» — не значит «лучше».

Быстрота бывает двух видов, и только один из них измеряется в секундах.

Цель дизайна Grok Imagine Video — пропускная способность в расчёте на создателя. Он встроен в X, возвращает готовый клип со звуком, а его набор функций читается как список того, что люди на самом деле делают в ленте: несколько соотношений сторон, движение камеры, добавление, удаление и замена объектов, перенос стиля, генерация по референсам из нескольких изображений для согласованности персонажа, нативный звук с диалогами, эффектами и музыкой. Длина клипа — до пятнадцати секунд, разрешение — максимум 1080p. Весь продукт построен так, что вторая попытка стоит вам пары минут и нескольких центов.

Kandinsky 6.0 Video быстр в другом смысле — не за попытку, а за единицу владения. Ничто в нём не является мгновенным. Собственные рабочие времена репозитория для недистиллированной модели, после прогрева и исключая загрузку весов и кодирование MP4, ставят пятисекундный клип Pro Full HD примерно на 402 секунды на H100, 854 на RTX 5090, 1 247 на RTX 4090 и 3 530 на RTX 5060 Ti. Lite Full HD — 284 секунды на H100. Инструмент, который делает это терпимым, — это дистиллированный чекпоинт, который в статье измерили на паритете с полной моделью — предпочтение или равенство по большинству критериев, среднее предпочтение 51% против 49%, ни одно отдельное различие не достигло значимости. Что вы получаете в обмен на медленный рендеринг — это модель на вашем собственном диске без какого-либо счётчика за клип.

В этом и заключается настоящая суть этого противостояния. Grok Imagine Video оптимизирует стоимость десятой попытки. Kandinsky 6.0 Video оптимизирует стоимость десятитысячной, но за первую берёт с вас плату железом и терпением.

Оба генерируют аудио — и это не одно и то же утверждение.

Это та ось, по которой поверхностное сравнение сказало бы «ничья» — и ошиблось бы.

Grok Imagine Video создаёт нативное аудио с диалогами, эффектами и музыкой как одну из многих функций. Это генератор общего назначения, в котором просто есть звук.

Kandinsky 6.0 Video построен вокруг звука. Архитектура представляет собой двухпоточный CrossDiT, который объединяет видеопоток, инициализированный из Kandinsky 5.0 Video, с аудиопотоком, обученным с нуля на больших аудиокорпусах, соединённых двунаправленным кросс-вниманием и обученных совместно. Выход — 44 кГц с явной синхронизацией губ, и сообщается, что этап обучения с подкреплением в статье сокращает частоту ошибок в словах сгенерированной речи на 47% — измерено с помощью Whisper-large-v3, который является одной из моделей вознаграждения RL; эта деталь важна, поскольку в статье сообщается о второй, несопоставимой WER наряду с VABench с использованием Qwen3-ASR-1.7B. Речь — это то, на чём модель была дообучена.

Напротив, собственное исследование Sber откровенно говорит о том, где модель уступает. В сравнительной оценке лаборатории MiniMax H3 и Dreamina Seedance 2.0 предпочитаются по визуальным критериям со значительным отрывом, а модель описывается как конкурентоспособная, а не лидирующая. Утверждение, заслуживающее серьёзного внимания, более узкое и полезное: в сравнении с Kling 2.6 и Veo 3.1 Fast результаты обмениваются преимуществом по каждому критерию, а Kandinsky 6.0 Video остаётся конкурентоспособной по качеству речи и синхронизации аудио и видео, где значительная доля сравнений — ничьи.

Пятнадцать секунд против пяти, и чего стоит достичь каждого

• Макс. клип — Grok Imagine Video: до 15 с. Kandinsky 6.0 Video: фиксированные 5 с, 121 кадр при 24 fps, в релизе нет режима продления.

• Разрешение — Grok Imagine Video: до 1080p. Kandinsky 6.0 Video: SD, HD и Full HD благодаря специальной модели суперразрешения; увеличение пятисекундных клипов в 2, 4 или 2,25 раза.

• Референсный ввод — Grok Imagine Video: генерация с опорой на референсы из нескольких изображений для согласованности персонажа, а также добавление/удаление/замена объектов. Kandinsky 6.0 Video: одно изображение, применяемое как маскированный конечный кадр.

• Стоимость — Grok Imagine Video: за секунду выходного видео, от нижней границы диапазона до $0,30/с при 1080p, с дополнительной платой за каждое входное изображение; бесплатный доступ доступен только на определённых уровнях подписки X. Kandinsky 6.0 Video: нет — ни сервиса, ни тарифа, только время GPU, которое вы предоставляете.

• Веса — Grok Imagine Video: нет. Kandinsky 6.0 Video: MIT, Pro и Lite, с интеграцией diffusers.

Надбавка за более новую сборку Grok — это число, которое стоит обвести. Переход с январской сборки на 1.5 стоит вдвое дороже за минуту в рейтинге image-to-video и приносит 26 пунктов Elo. Это реальное улучшение по реальной цене, и это та же сделка, которую сейчас предлагают совершить покупателям все видеовендоры.

Где маршрутизатор уместен, а где нет

OrcaRouter не обслуживает Grok Imagine Video или Kandinsky 6.0 Video, и здесь ничто не утверждает обратного: Kandinsky вы можете скачать и запускать самостоятельно, а Grok Imagine Video доступен через собственные интерфейсы xAI. Пайплайну, построенному на любой из этих моделей, от роутера нужен текст, окружающий рендер: шот-лист, расширение промпта, превращающее идею в длинную или короткую подпись, на которых обучались эти модели, работа по составлению подписей и транскрипции, а также итоговые обзоры, определяющие, какая генерация остаётся. Всё это работает через одну конечную точку, совместимую с OpenAI, охватывающую более 200 текстовых моделей по прайсовой цене провайдера с наценкой 0%, так что новинка от вендора становится доступна по тому же ключу в день её выхода, с автоматическим переключением при сбое, чтобы неудачный вызов посреди очереди рендеринга перенаправлялся, а не останавливал пакет. Оркестрация вокруг видеомодели — это задача маршрутизации, даже когда сама видеомодель не поддаётся маршрутизации, а именно так обстоит дело с обеими сегодня.

Какой из них и для чего

Обращайтесь к Grok Imagine Video, когда работа — это объём: социальные клипы, быстрые итерации, кадр, который вы перегенерируете шесть раз, прежде чем он получится, и дедлайн, который не сдвигается. Его цена за попытку — это и есть продукт, а то, что сейчас он находится в середине таблицы, а не на вершине, — нормальная плата за категорию, которая движется так быстро.

Выбирайте Kandinsky 6.0 Video, когда работа — это конвейер: фиксированный пятисекундный фрагмент, который можно обрабатывать пакетами; проход «изображение → видео», где важнее всего точность соответствия предоставленному стоп-кадру; речь, которую вы намерены сделать разборчивой; и готовый результат, который вы предпочли бы не арендовать. Закладывайте расходы на рендер, ожидайте, что на любом оборудовании потребительского класса он будет медленным, и считайте все показатели качества в этом материале собственными данными Sber, пока кто-нибудь извне лаборатории не оценит их.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

Что делает эту пару достойной наблюдения, так это то, кто из них способен пережить плохой квартал. Если Grok Imagine Video опустится ещё ниже в арене, ответ — лучшая модель и новая цена — так работает эта категория, и xAI уже показала, что выпустит такую. Если Kandinsky 6.0 Video после подсчёта баллов окажется в середине таблицы, чекпойнт всё ещё существует, всё ещё работает и всё ещё дообучается; в лицензии от числа ничего не меняется. Это разные виды устойчивости, и только один из них измеряется с помощью Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.