
Kandinsky 6.0 Video появляется в vLLM-Omni: что даёт открытой модели слой обслуживания
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Пулл-реквест #8537, слитый в vLLM-Omni в 07:55 UTC сегодня утром, делает ровно одну вещь: он делает Kandinsky 6.0 Video доступной для обслуживания. Сама модель прибыла из Kandinsky Lab от Sber в тот же день в виде пары — Kandinsky 6.0 Video Pro с 29 млрд параметров и Kandinsky 6.0 Video Lite с 3 млрд — генерирующей пятисекундные клипы с синхронизированным аудио 44 кГц, включая липсинк, по текстовому запросу или референсному изображению, при этом код, веса и интеграция с diffusers — всё под MIT. Чего у неё не было до сегодняшнего утра — так это способа запускать её внутри инференс-сервера, а не из одноразовой командной строки.
Это различие значит больше, чем может показаться, и именно поэтому это отдельная история, а не часть релиза. Открытый чекпойнт, который можно запустить на своей видеокарте, — это исследовательский артефакт; открытый чекпойнт с серверным пайплайном, общими точками входа и рецептом сервинга — это то, что можно поставить за очередь. Релиз этой недели дал вам первое. Сегодняшнее слияние — начало второго.
Что на самом деле объединилось
В этом PR в vLLM-Omni добавляются возможности преобразования текста в видео и аудио, а также изображения в видео и аудио на основе чекпоинта kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Самое интересное здесь — инженерные решения: они показывают, как архитектура выглядит в реальности, когда её приходится обслуживать кому-то, кроме авторов.
• Один DiT выполняет денойзинг обеих модальностей. Пайплайн зарегистрирован как Kandinsky6TI2VAPipeline, и видео-латенты и аудио-латенты денойзятся совместно одним трансформером, а не двумя моделями, запускаемыми последовательно. Это отражает описанную в статье двухпотоковую CrossDiT, где предобученный видеопоток и аудиопоток, обучаемый с нуля, соединены двунаправленным кросс-вниманием.
• Веса загружаются папка за папкой. Чекпойнт из Hub читается как transformer/, vae/, text_encoder/, text_encoder_2/ и audio_vae/. Внутренние имена опубликованного чекпойнта — videoT и audioT — сопоставляются с video_dec_block и audio_dec_block во время загрузки, а это как раз та деталь, которая съедает день, если обнаружишь её сам.
• Аудио включено по умолчанию. Конвейер выдаёт AAC с частотой 44,1 кГц, а не рассматривает звук как флаг опционального включения, поэтому запрос без аудиопараметров всё равно возвращается с синхронизированными речью, музыкой или фоновым звуком.
• Входное изображение — это маскированный хвостовой кадр, а не отдельный режим. Обусловливание по референсному изображению применяется через маскирование — именно так один и тот же пайплайн обслуживает и T2AV, и I2AV без ветвления.
Дымовой тест отправителя — полезный минимум: одна NVIDIA H100 80GB с FlashAttention-3, с включённой выгрузкой на CPU, 864×480, 125 кадров, 50 шагов, CFG 5.0, seed 42. Это 5-секундный клип чуть ниже HD, а не рендер в Full HD, и PR не утверждает обратного.
Контрольная точка — это не служба
Причина, по которой стоит обращать внимание на такое слияние, — это то, что оно убирает из вашего списка. Запуск эталонной реализации означает: клонировать репозиторий, выполнить just setup, дать ей скомпилировать SageAttention на всём, что ниже Hopper, скачать чекпоинт в каталог кеша и вызвать команду generate, вывод которой окажется в папке с отметкой времени. Для первого знакомства это нормально, а для продукта — неудобно.
vLLM-Omni даёт вам модель внутри сервисного процесса, с теми же точками входа для офлайн-инференса, которые проект использует для других своих диффузионных моделей (examples/offline_inference/text_to_video/text_to_video.py и его аналог для image-to-video), и рецептом обслуживания в recipes/Kandinsky/Kandinsky6-TI2VA.md. Отсюда следуют два практических последствия. Ваш сценарий развёртывания превращается в контейнер, который общается через HTTP-интерфейс, а не в скрипт, за которым вы присматриваете, и модель перестаёт быть особым случаем в вашем стеке — она оказывается рядом с чем угодно другим, что вы запускаете на том сервере.
Обратите внимание, чем это не является. Это не размещённый эндпоинт, это не цена и не независимое измерение качества. Это ещё одно место, где модель может работать, предоставленное кем-то извне лаборатории, через три дня после появления весов.
Сколько пятисекундный клип стоит по реальному времени на реальных картах
Собственная таблица репозитория — это честная отправная точка. Это значения времени работы недистиллированной базовой модели для одного 5-секундного клипа после прогрева, без учёта загрузки весов и кодирования в MP4. Full HD здесь означает, что также выполняется проход суперразрешения.
• Full HD (Pro) — 402 с на H100, 765 с на RTX PRO 6000, 854 с на RTX 5090, 1 106 с на A100 80GB, 1 247 с на RTX 4090 и 3 530 с на RTX 5060 Ti.
• Full HD (Lite) — 284 с на H100, 387 с на RTX PRO 6000, 406 с на RTX 5090, 664 с на A100 80GB, 578 с на RTX 4090 и 1 774 с на RTX 5060 Ti.
• SD (Pro) — 356 с на H100 против 936 с на RTX 4090, где штраф за потребительскую карту минимален, а экономика наименее плоха.
Форма той таблицы важнее, чем любая отдельная ячейка. H100 примерно в три раза быстрее, чем 4090, на Pro Full HD и примерно в шесть раз быстрее, чем 5060 Ti, в той же задаче — но этап SR стоит одинаково при любом размере модели: около 64 секунд в HD и около 96 секунд в Full HD на 5090. Lite не даёт более короткого прохода суперразрешения, потому что модель SR обучается отдельно, и ей не важно, какая базовая модель её питала.
Путь на 16 ГБ и одна настройка, которая меняет вашу картинку
Пиковый объём выделенной памяти при запуске Pro SD достигает 72,8 ГиБ — это больше, чем может предложить любая потребительская карта. Репозиторий отвечает выгрузкой блоков: одновременно на GPU находятся только два блока трансформера, остальные потоково передаются из памяти хоста. Плюс есть три пресета для карт на 32 ГБ, 24 ГБ и 16 ГБ. Пресеты для 32 и 24 ГБ идентичны, поскольку свыше 24 ГБ дополнительный запас памяти не даёт прироста скорости.
Эта оговорка спрятана, и её стоит повторить: на пресете 16 ГБ текстовый энкодер квантуется до NF4, и в статье прямо сказано, что это единственное изменение пресета, которое влияет на сам клип. Другое текстовое представление даёт другое видео. Всё остальное — длина сегмента, пространственные полосы, выгрузка — меняет вывод на уровне шума округления: около 12 % пикселей отличаются на один уровень яркости при примерно 57 дБ PSNR. Если вы воспроизводите чей-то результат на карте с 16 ГБ и он не совпадает, это первое, что стоит проверить.
Три вещи, которые не проясняют примечания к выпуску
• Пять секунд — это потолок, а не значение по умолчанию. Модель обучалась на 121 кадре при 24 кадрах в секунду, и как статья, так и рецепт сервинга построены вокруг этого. В релизе нет режима продления. Всё, что длиннее, — это проблема сшивки, и решать её вам.
• Дистиллированный чекпоинт — это то, что вы фактически будете отдавать в продакшене, и его качество было измерено на уровне паритета. Абляционный анализ в статье показывает, что дистиллированную модель предпочитают или признают равной по большинству критериев, при этом ни одно отдельное различие не достигает значимости, при среднем предпочтении 51% против 49%. Это тот компромисс, на который вы идёте ради скорости.
• В статье есть два значения WER, и они несопоставимы. 47%-ное снижение WER для сгенерированной речи, сопровождающее этап обучения с подкреплением, оценивается с помощью Whisper-large-v3 — одной из моделей вознаграждения RL; WER, приведённый рядом с VABench, использует Qwen3-ASR-1.7B на речевом подмножестве. Сами авторы это говорят. Выдать одно за другое — самая простая ошибка при работе с этим релизом.
Где маршрутизатор расположен в таком стеке
OrcaRouter не обслуживает Kandinsky 6.0 Video, и ничто здесь не должно восприниматься как заявление, что это так — модель вы можете запустить из Hub самостоятельно или получить к ней доступ через собственные интерфейсы лаборатории. Такому пайплайну от роутера нужен текст вокруг него. Этап расширения промпта, который превращает описание кадра в длинную, среднюю или короткую подпись, на которой обучалась модель, работа с подписями и расшифровками, которая питает этап преобразования изображения в видео, сводки проверок, которые решают, какие из четырёх генераций сохранить: это обычные текстовые вызовы, и они выполняются на одной конечной точке, совместимой с OpenAI, для более чем 200 моделей с списочными ценами провайдеров, передаваемыми с наценкой 0%, поэтому изменение цены поставщика вступает в силу в тот же день. Автоматическое переключение при сбое здесь важнее, чем обычно, потому что пятиминутный рендер, который падает на этапе подписей, должен быть перенаправлен, а не перезапускать задание.
Следующее, за чем стоит следить, — это не очередное слияние, а число. У Kandinsky 6.0 Video Pro есть заявленные вендором результаты на VABench и проведённая лабораторией человеческая оценка в сравнении с Kling 2.6, Veo 3.1 Fast, MiniMax H3 и Seedance 2.0 — и пока нет независимой оценки в арене. Когда она появится, утверждение об открытых весах перестанет быть аргументом о доступе и станет аргументом о качестве — а именно это сравнение решает, будут ли команды скачивать эту модель или восхищаться ею.


Репозиторий также включает два узла ComfyUI — kandinsky6 и kandinsky6-sr — устанавливаемых через ComfyUI Manager, и два Hugging Face Spaces: один для дистиллированного чекпоинта Pro, а другой для демонстрации суперразрешения видео. Между CLI, узлами ComfyUI, набором diffusers и теперь ещё конвейером vLLM-Omni поверхность развёртывания на третий день шире, чем большинство открытых видеомоделей успевают охватить за квартал. Эта широта и есть главная история недели: Sber выпустил семейство, а не статью с приложенным демо.

