Сгенерированная титульная карточка с надписью «Видео Kandinsky 6.0 появилось в vLLM-Omni» и подзаголовком «Чекпойнт становится сервисом», над рядом значков с подписями «Генерация видео», «Синхронизированный звук» и «Развёртывание открытых весов». Логотип OrcaRouter расположен в правом нижнем углу.
Engineering & Research

Kandinsky 6.0 Video появляется в vLLM-Omni: что даёт открытой модели слой обслуживания

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Пулл-реквест #8537, слитый в vLLM-Omni в 07:55 UTC сегодня утром, делает ровно одну вещь: он делает Kandinsky 6.0 Video доступной для обслуживания. Сама модель прибыла из Kandinsky Lab от Sber в тот же день в виде пары — Kandinsky 6.0 Video Pro с 29 млрд параметров и Kandinsky 6.0 Video Lite с 3 млрд — генерирующей пятисекундные клипы с синхронизированным аудио 44 кГц, включая липсинк, по текстовому запросу или референсному изображению, при этом код, веса и интеграция с diffusers — всё под MIT. Чего у неё не было до сегодняшнего утра — так это способа запускать её внутри инференс-сервера, а не из одноразовой командной строки.

Это различие значит больше, чем может показаться, и именно поэтому это отдельная история, а не часть релиза. Открытый чекпойнт, который можно запустить на своей видеокарте, — это исследовательский артефакт; открытый чекпойнт с серверным пайплайном, общими точками входа и рецептом сервинга — это то, что можно поставить за очередь. Релиз этой недели дал вам первое. Сегодняшнее слияние — начало второго.

Что на самом деле объединилось

В этом PR в vLLM-Omni добавляются возможности преобразования текста в видео и аудио, а также изображения в видео и аудио на основе чекпоинта kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Самое интересное здесь — инженерные решения: они показывают, как архитектура выглядит в реальности, когда её приходится обслуживать кому-то, кроме авторов.

• Один DiT выполняет денойзинг обеих модальностей. Пайплайн зарегистрирован как Kandinsky6TI2VAPipeline, и видео-латенты и аудио-латенты денойзятся совместно одним трансформером, а не двумя моделями, запускаемыми последовательно. Это отражает описанную в статье двухпотоковую CrossDiT, где предобученный видеопоток и аудиопоток, обучаемый с нуля, соединены двунаправленным кросс-вниманием.

• Веса загружаются папка за папкой. Чекпойнт из Hub читается как transformer/, vae/, text_encoder/, text_encoder_2/ и audio_vae/. Внутренние имена опубликованного чекпойнта — videoT и audioT — сопоставляются с video_dec_block и audio_dec_block во время загрузки, а это как раз та деталь, которая съедает день, если обнаружишь её сам.

• Аудио включено по умолчанию. Конвейер выдаёт AAC с частотой 44,1 кГц, а не рассматривает звук как флаг опционального включения, поэтому запрос без аудиопараметров всё равно возвращается с синхронизированными речью, музыкой или фоновым звуком.

• Входное изображение — это маскированный хвостовой кадр, а не отдельный режим. Обусловливание по референсному изображению применяется через маскирование — именно так один и тот же пайплайн обслуживает и T2AV, и I2AV без ветвления.

Дымовой тест отправителя — полезный минимум: одна NVIDIA H100 80GB с FlashAttention-3, с включённой выгрузкой на CPU, 864×480, 125 кадров, 50 шагов, CFG 5.0, seed 42. Это 5-секундный клип чуть ниже HD, а не рендер в Full HD, и PR не утверждает обратного.

Контрольная точка — это не служба

Причина, по которой стоит обращать внимание на такое слияние, — это то, что оно убирает из вашего списка. Запуск эталонной реализации означает: клонировать репозиторий, выполнить just setup, дать ей скомпилировать SageAttention на всём, что ниже Hopper, скачать чекпоинт в каталог кеша и вызвать команду generate, вывод которой окажется в папке с отметкой времени. Для первого знакомства это нормально, а для продукта — неудобно.

vLLM-Omni даёт вам модель внутри сервисного процесса, с теми же точками входа для офлайн-инференса, которые проект использует для других своих диффузионных моделей (examples/offline_inference/text_to_video/text_to_video.py и его аналог для image-to-video), и рецептом обслуживания в recipes/Kandinsky/Kandinsky6-TI2VA.md. Отсюда следуют два практических последствия. Ваш сценарий развёртывания превращается в контейнер, который общается через HTTP-интерфейс, а не в скрипт, за которым вы присматриваете, и модель перестаёт быть особым случаем в вашем стеке — она оказывается рядом с чем угодно другим, что вы запускаете на том сервере.

Обратите внимание, чем это не является. Это не размещённый эндпоинт, это не цена и не независимое измерение качества. Это ещё одно место, где модель может работать, предоставленное кем-то извне лаборатории, через три дня после появления весов.

Сколько пятисекундный клип стоит по реальному времени на реальных картах

Собственная таблица репозитория — это честная отправная точка. Это значения времени работы недистиллированной базовой модели для одного 5-секундного клипа после прогрева, без учёта загрузки весов и кодирования в MP4. Full HD здесь означает, что также выполняется проход суперразрешения.

• Full HD (Pro) — 402 с на H100, 765 с на RTX PRO 6000, 854 с на RTX 5090, 1 106 с на A100 80GB, 1 247 с на RTX 4090 и 3 530 с на RTX 5060 Ti.

• Full HD (Lite) — 284 с на H100, 387 с на RTX PRO 6000, 406 с на RTX 5090, 664 с на A100 80GB, 578 с на RTX 4090 и 1 774 с на RTX 5060 Ti.

• SD (Pro) — 356 с на H100 против 936 с на RTX 4090, где штраф за потребительскую карту минимален, а экономика наименее плоха.

Форма той таблицы важнее, чем любая отдельная ячейка. H100 примерно в три раза быстрее, чем 4090, на Pro Full HD и примерно в шесть раз быстрее, чем 5060 Ti, в той же задаче — но этап SR стоит одинаково при любом размере модели: около 64 секунд в HD и около 96 секунд в Full HD на 5090. Lite не даёт более короткого прохода суперразрешения, потому что модель SR обучается отдельно, и ей не важно, какая базовая модель её питала.

Путь на 16 ГБ и одна настройка, которая меняет вашу картинку

Пиковый объём выделенной памяти при запуске Pro SD достигает 72,8 ГиБ — это больше, чем может предложить любая потребительская карта. Репозиторий отвечает выгрузкой блоков: одновременно на GPU находятся только два блока трансформера, остальные потоково передаются из памяти хоста. Плюс есть три пресета для карт на 32 ГБ, 24 ГБ и 16 ГБ. Пресеты для 32 и 24 ГБ идентичны, поскольку свыше 24 ГБ дополнительный запас памяти не даёт прироста скорости.

Эта оговорка спрятана, и её стоит повторить: на пресете 16 ГБ текстовый энкодер квантуется до NF4, и в статье прямо сказано, что это единственное изменение пресета, которое влияет на сам клип. Другое текстовое представление даёт другое видео. Всё остальное — длина сегмента, пространственные полосы, выгрузка — меняет вывод на уровне шума округления: около 12 % пикселей отличаются на один уровень яркости при примерно 57 дБ PSNR. Если вы воспроизводите чей-то результат на карте с 16 ГБ и он не совпадает, это первое, что стоит проверить.

Три вещи, которые не проясняют примечания к выпуску

• Пять секунд — это потолок, а не значение по умолчанию. Модель обучалась на 121 кадре при 24 кадрах в секунду, и как статья, так и рецепт сервинга построены вокруг этого. В релизе нет режима продления. Всё, что длиннее, — это проблема сшивки, и решать её вам.

• Дистиллированный чекпоинт — это то, что вы фактически будете отдавать в продакшене, и его качество было измерено на уровне паритета. Абляционный анализ в статье показывает, что дистиллированную модель предпочитают или признают равной по большинству критериев, при этом ни одно отдельное различие не достигает значимости, при среднем предпочтении 51% против 49%. Это тот компромисс, на который вы идёте ради скорости.

• В статье есть два значения WER, и они несопоставимы. 47%-ное снижение WER для сгенерированной речи, сопровождающее этап обучения с подкреплением, оценивается с помощью Whisper-large-v3 — одной из моделей вознаграждения RL; WER, приведённый рядом с VABench, использует Qwen3-ASR-1.7B на речевом подмножестве. Сами авторы это говорят. Выдать одно за другое — самая простая ошибка при работе с этим релизом.

Где маршрутизатор расположен в таком стеке

OrcaRouter не обслуживает Kandinsky 6.0 Video, и ничто здесь не должно восприниматься как заявление, что это так — модель вы можете запустить из Hub самостоятельно или получить к ней доступ через собственные интерфейсы лаборатории. Такому пайплайну от роутера нужен текст вокруг него. Этап расширения промпта, который превращает описание кадра в длинную, среднюю или короткую подпись, на которой обучалась модель, работа с подписями и расшифровками, которая питает этап преобразования изображения в видео, сводки проверок, которые решают, какие из четырёх генераций сохранить: это обычные текстовые вызовы, и они выполняются на одной конечной точке, совместимой с OpenAI, для более чем 200 моделей с списочными ценами провайдеров, передаваемыми с наценкой 0%, поэтому изменение цены поставщика вступает в силу в тот же день. Автоматическое переключение при сбое здесь важнее, чем обычно, потому что пятиминутный рендер, который падает на этапе подписей, должен быть перенаправлен, а не перезапускать задание.

Следующее, за чем стоит следить, — это не очередное слияние, а число. У Kandinsky 6.0 Video Pro есть заявленные вендором результаты на VABench и проведённая лабораторией человеческая оценка в сравнении с Kling 2.6, Veo 3.1 Fast, MiniMax H3 и Seedance 2.0 — и пока нет независимой оценки в арене. Когда она появится, утверждение об открытых весах перестанет быть аргументом о доступе и станет аргументом о качестве — а именно это сравнение решает, будут ли команды скачивать эту модель или восхищаться ею.

A generated scoreboard titled 'Kandinsky 6.0 Video — the scoreboard' with a single column of six rows: 'Sizes: Pro 29B, Lite 3B', 'Clip length: 5s fixed', 'Audio: 44 kHz lip-sync', 'Resolution: Full HD plus SR', 'Licence: MIT' and 'Serving: vLLM-Omni day 0'. A footer reads 'All figures vendor-reported; no independent Elo yet. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the GitHub repository page for kandinskylab/kandinsky-6, showing 11 commits, 35 stars and 4 forks, an MIT license badge, and a README titled 'Kandinsky 6.0: A family of diffusion models for Video + Audio Generation' with badges for KANDINSKYLAB, REPORT, DIFFUSERS and COMFYUI; recent commits include 'README update', 'Added source code', 'Some improvements for just generate' and 'Keep ComfyUI user documentation in README'.

Репозиторий также включает два узла ComfyUI — kandinsky6 и kandinsky6-sr — устанавливаемых через ComfyUI Manager, и два Hugging Face Spaces: один для дистиллированного чекпоинта Pro, а другой для демонстрации суперразрешения видео. Между CLI, узлами ComfyUI, набором diffusers и теперь ещё конвейером vLLM-Omni поверхность развёртывания на третий день шире, чем большинство открытых видеомоделей успевают охватить за квартал. Эта широта и есть главная история недели: Sber выпустил семейство, а не статью с приложенным демо.

A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.