Una tarjeta de título generada que dice «Kandinsky 6.0 Video llega a vLLM-Omni» con el subtítulo «Un checkpoint se convierte en un servicio», sobre una fila de iconos etiquetados como «Generación de vídeo», «Audio sincronizado» y «Despliegue de pesos abiertos». El logotipo de OrcaRouter se encuentra en la esquina inferior derecha.
Engineering & Research

Kandinsky 6.0 Video llega a vLLM-Omni: qué aporta una capa de servicio a un modelo abierto

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La pull request #8537 se fusionó en vLLM-Omni a las 07:55 UTC de esta mañana, y hace exactamente una cosa: hace que Kandinsky 6.0 Video sea servible. El modelo en sí llegó desde el Kandinsky Lab de Sber el mismo día en forma de par — Kandinsky 6.0 Video Pro con 29B de parámetros y Kandinsky 6.0 Video Lite con 3B —, generando clips de cinco segundos con audio sincronizado de 44 kHz, sincronización labial incluida, a partir de un prompt de texto o una imagen de referencia, con código, pesos e integración con diffusers, todo bajo la licencia MIT. Lo que no tenía hasta esta mañana era una forma de ejecutarlo dentro de un servidor de inferencia en lugar de una línea de comandos de una sola ejecución.

Esa distinción vale más de lo que parece, y es la razón por la que esta es una historia aparte del lanzamiento. Un checkpoint abierto que puedes ejecutar en tu propia tarjeta es un artefacto de investigación; un checkpoint abierto con un pipeline del lado del servidor, puntos de entrada compartidos y una receta de servicio es algo que puedes poner detrás de una cola. El lanzamiento de esta semana te dio lo primero. La fusión de hoy es el comienzo de lo segundo.

Qué se fusionó realmente

El PR añade texto-a-vídeo-y-audio e imagen-a-vídeo-y-audio a vLLM-Omni desde el checkpoint kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Las decisiones de ingeniería son la parte interesante, porque te dicen cómo es realmente la arquitectura cuando alguien distinto de los autores tiene que servirla.

• Un DiT elimina el ruido de ambas modalidades. El pipeline está registrado como Kandinsky6TI2VAPipeline, y un único transformer elimina conjuntamente el ruido de los latentes de video y de audio, en lugar de dos modelos ejecutados en secuencia. Eso refleja el CrossDiT de doble flujo del artículo, donde un flujo de video preentrenado y un flujo de audio creado desde cero están conectados mediante atención cruzada bidireccional.

• Los pesos se cargan carpeta por carpeta. El checkpoint del Hub se lee como transformer/, vae/, text_encoder/, text_encoder_2/ y audio_vae/. Los nombres internos del checkpoint publicado — videoT y audioT — se asignan a video_dec_block y audio_dec_block en el momento de la carga, que es el tipo de detalle que te lleva un día entero si lo descubres por tu cuenta.

• El audio está activado de forma predeterminada. El pipeline emite AAC a 44,1 kHz en lugar de tratar el sonido como un indicador de activación voluntaria, por lo que una solicitud sin parámetros de audio sigue devolviendo voz, música o sonido ambiente sincronizados.

• Una entrada de imagen es un fotograma final enmascarado, no un modo separate. El condicionamiento por imagen de referencia se aplica mediante enmascaramiento, que es como el mismo pipeline sirve tanto para T2AV como para I2AV sin ramificaciones.

La prueba de humo de quien lo envía es un mínimo útil: una sola NVIDIA H100 80GB con FlashAttention-3, descarga a CPU activada, 864×480, 125 fotogramas, 50 pasos, CFG 5,0, semilla 42. Eso es un clip de 5 segundos a poco menos de HD, no un render en Full HD, y el PR no afirma lo contrario.

Un checkpoint no es un servicio

La razón para preocuparte por un merge como este es lo que elimina de tu lista. Ejecutar la implementación de referencia implica clonar el repositorio, ejecutar just setup, dejar que compile SageAttention en cualquier cosa por debajo de Hopper, descargar el checkpoint en un directorio de caché e invocar un comando generate cuya salida acaba en una carpeta con marca de tiempo. Eso está bien para un primer vistazo y resulta incómodo para un producto.

vLLM-Omni te ofrece el modelo dentro de un proceso de servicio, con los mismos puntos de entrada de inferencia sin conexión que el proyecto usa para sus otros modelos de difusión (examples/offline_inference/text_to_video/text_to_video.py y su equivalente para imagen a vídeo) y una receta de servicio en recipes/Kandinsky/Kandinsky6-TI2VA.md. De ello se derivan dos consecuencias prácticas. Tu panorama de despliegue pasa a ser un contenedor que habla una interfaz HTTP en lugar de un script que tú administras, y el modelo deja de ser un caso especial en tu stack: queda junto a cualquier otra cosa que ejecutes en ese servidor.

Fíjate en lo que esto no es. No es un endpoint alojado, no es un precio, y no es una medición de calidad independiente. Es un lugar más donde el modelo puede ejecutarse, aportado por alguien ajeno al laboratorio, tres días después de que aparecieran los pesos.

Lo que cuesta un clip de cinco segundos en tiempo real, en tarjetas reales

El repositorio es el punto de partida honesto. Estos son los tiempos del modelo base no destilado para un único clip de 5 segundos después del calentamiento, excluyendo los pesos y el MP4. En la suite completa, la superresolución está activada.

• Full HD (Pro) — 402 s en una H100, 765 s en una RTX PRO 6000, 854 s en una RTX 5090, 1.106 s en una A100 80GB, 1.247 s en una RTX 4090 y 3.530 s en una RTX 5060 Ti.

• Full HD (Lite) — 284 s en una H100, 387 s en una RTX PRO 6000, 406 s en una RTX 5090, 664 s en una A100 80GB, 578 s en una RTX 4090 y 1774 s en una RTX 5060 Ti.

• SD (Pro) — 356 s en una H100 frente a 936 s en una RTX 4090, que es donde la penalización por usar tarjetas de consumo es menor y la economía es menos mala.

La forma de esa tabla importa más que cualquier celda individual. Una H100 es aproximadamente tres veces más rápida que una 4090 en Pro Full HD, y aproximadamente seis veces más rápida que una 5060 Ti en la misma tarea, pero la etapa de SR cuesta lo mismo en cualquiera de los dos tamaños de modelo: unos 64 segundos en HD y unos 96 segundos en Full HD en una 5090. Lite no te ofrece una pasada de superresolución más corta, porque el modelo de SR se entrena por separado y no le importa qué modelo base lo alimentó.

La ruta de 16 GB, y el único ajuste que cambia tu imagen

La memoria máxima asignada en una ejecución de Pro SD alcanza los 72,8 GiB, lo cual supera a cualquier tarjeta de consumo. El repositorio responde con offloading de bloques —solo dos bloques transformer residentes en la GPU a la vez, y el resto se transmite desde la memoria del host—, además de tres preajustes para tarjetas de 32 GB, 24 GB y 16 GB. Los preajustes de 32 y 24 GB son idénticos, porque por encima de 24 GB el margen adicional no se traduce en velocidad.

La advertencia está enterrada y merece repetirse: en el preset de 16 GB, el codificador de texto está cuantizado a NF4, y el artículo es explícito en que este es el único cambio de preset que altera el propio clip. Una representación textual diferente produce un video diferente. Todo lo demás —longitud de segmento, franjas espaciales, descarga— cambia la salida al nivel del ruido de redondeo, alrededor del 12 % de los píxeles que difieren en un nivel de brillo a aproximadamente 57 dB de PSNR. Si estás reproduciendo el resultado de otra persona en una tarjeta de 16 GB y no coincide, eso es lo primero que debes revisar.

Tres cosas que las notas de la versión no resuelven

• Cinco segundos es el techo, no un valor predeterminado. El modelo se entrenó con 121 fotogramas a 24 fps, y tanto el artículo como la receta de servicio se basan en eso. No hay un modo de extensión en la versión. Cualquier duración mayor es un problema de empalme que es tu responsabilidad.

• El checkpoint destilado es el que realmente vas a servir, y se midió a la par. La ablación del artículo sitúa al modelo destilado como preferido o empatado en la mayoría de los criterios, sin que ninguna diferencia individual alcance significación, con una preferencia media de 51 % a 49 %. Ese es el sacrificio que asumes a cambio de la velocidad.

• En el artículo hay dos cifras de tasa de error de palabras y no son comparables. La reducción del 47 % en el WER del habla generada que acompaña a la etapa de aprendizaje por refuerzo se evalúa con Whisper-large-v3, uno de los modelos de recompensa del RL; el WER que se reporta junto con VABench utiliza Qwen3-ASR-1.7B en el subconjunto de habla. Los propios autores lo dicen. Citar una por la otra es el error más fácil de cometer con este lanzamiento.

Dónde encaja un router en una pila como esta

OrcaRouter no ofrece Kandinsky 6.0 Video, y nada de lo aquí dicho debe interpretarse como una afirmación de que sí lo hace: el modelo es tuyo para ejecutarlo desde el Hub, o se puede acceder a él a través de las interfaces propias del laboratorio. Lo que un pipeline como este necesita de un router es el texto que lo rodea. El pase de expansión de prompts que convierte la descripción de una toma en la descripción larga, media o corta con la que se entrenó el modelo, el trabajo de descripción y transcripción que alimenta un pase de imagen a video, los resúmenes de revisión que deciden cuál de las cuatro generaciones conservar: esas son llamadas de texto ordinarias, y se ejecutan en un único endpoint compatible con OpenAI en más de 200 modelos con precios de lista de los proveedores transferidos con un 0 % de margen, así que un cambio de precio de un proveedor se refleja el mismo día. La conmutación por error automática importa más de lo habitual aquí, porque un render de cinco minutos que falla en la etapa de descripción debería redirigirse en lugar de reiniciar el trabajo.

Lo siguiente que hay que observar no es otra fusión, sino un número. Kandinsky 6.0 Video Pro tiene resultados reportados por el proveedor en VABench y una evaluación humana realizada por el laboratorio frente a Kling 2.6, Veo 3.1 Fast, MiniMax H3 y Seedance 2.0 —y aún no tiene una puntuación independiente en arena. Cuando aparezca una, la afirmación de pesos abiertos deja de ser un argumento sobre el acceso y pasa a ser un argumento sobre la calidad, que es la comparación que decide si este es un modelo que los equipos descargan o un modelo que admiran.

A generated scoreboard titled 'Kandinsky 6.0 Video — the scoreboard' with a single column of six rows: 'Sizes: Pro 29B, Lite 3B', 'Clip length: 5s fixed', 'Audio: 44 kHz lip-sync', 'Resolution: Full HD plus SR', 'Licence: MIT' and 'Serving: vLLM-Omni day 0'. A footer reads 'All figures vendor-reported; no independent Elo yet. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the GitHub repository page for kandinskylab/kandinsky-6, showing 11 commits, 35 stars and 4 forks, an MIT license badge, and a README titled 'Kandinsky 6.0: A family of diffusion models for Video + Audio Generation' with badges for KANDINSKYLAB, REPORT, DIFFUSERS and COMFYUI; recent commits include 'README update', 'Added source code', 'Some improvements for just generate' and 'Keep ComfyUI user documentation in README'.

El repositorio también incluye dos nodos de ComfyUI —kandinsky6 y kandinsky6-sr— instalables a través de ComfyUI Manager, y dos Hugging Face Spaces: uno para el checkpoint destilado Pro y otro para la demo de superresolución de vídeo. Entre la CLI, los nodos de ComfyUI, el paquete de diffusers y ahora un pipeline de vLLM-Omni, la superficie de despliegue es más amplia al tercer día de lo que la mayoría de los modelos de vídeo abiertos consiguen en un trimestre. Esa amplitud es la verdadera historia de la semana: Sber lanzó una familia, no un artículo con una demo adjunta.

A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.