
Kandinsky 6.0 Video llega a vLLM-Omni: qué aporta una capa de servicio a un modelo abierto
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
La pull request #8537 se fusionó en vLLM-Omni a las 07:55 UTC de esta mañana, y hace exactamente una cosa: hace que Kandinsky 6.0 Video sea servible. El modelo en sí llegó desde el Kandinsky Lab de Sber el mismo día en forma de par — Kandinsky 6.0 Video Pro con 29B de parámetros y Kandinsky 6.0 Video Lite con 3B —, generando clips de cinco segundos con audio sincronizado de 44 kHz, sincronización labial incluida, a partir de un prompt de texto o una imagen de referencia, con código, pesos e integración con diffusers, todo bajo la licencia MIT. Lo que no tenía hasta esta mañana era una forma de ejecutarlo dentro de un servidor de inferencia en lugar de una línea de comandos de una sola ejecución.
Esa distinción vale más de lo que parece, y es la razón por la que esta es una historia aparte del lanzamiento. Un checkpoint abierto que puedes ejecutar en tu propia tarjeta es un artefacto de investigación; un checkpoint abierto con un pipeline del lado del servidor, puntos de entrada compartidos y una receta de servicio es algo que puedes poner detrás de una cola. El lanzamiento de esta semana te dio lo primero. La fusión de hoy es el comienzo de lo segundo.
Qué se fusionó realmente
El PR añade texto-a-vídeo-y-audio e imagen-a-vídeo-y-audio a vLLM-Omni desde el checkpoint kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Las decisiones de ingeniería son la parte interesante, porque te dicen cómo es realmente la arquitectura cuando alguien distinto de los autores tiene que servirla.
• Un DiT elimina el ruido de ambas modalidades. El pipeline está registrado como Kandinsky6TI2VAPipeline, y un único transformer elimina conjuntamente el ruido de los latentes de video y de audio, en lugar de dos modelos ejecutados en secuencia. Eso refleja el CrossDiT de doble flujo del artículo, donde un flujo de video preentrenado y un flujo de audio creado desde cero están conectados mediante atención cruzada bidireccional.
• Los pesos se cargan carpeta por carpeta. El checkpoint del Hub se lee como transformer/, vae/, text_encoder/, text_encoder_2/ y audio_vae/. Los nombres internos del checkpoint publicado — videoT y audioT — se asignan a video_dec_block y audio_dec_block en el momento de la carga, que es el tipo de detalle que te lleva un día entero si lo descubres por tu cuenta.
• El audio está activado de forma predeterminada. El pipeline emite AAC a 44,1 kHz en lugar de tratar el sonido como un indicador de activación voluntaria, por lo que una solicitud sin parámetros de audio sigue devolviendo voz, música o sonido ambiente sincronizados.
• Una entrada de imagen es un fotograma final enmascarado, no un modo separate. El condicionamiento por imagen de referencia se aplica mediante enmascaramiento, que es como el mismo pipeline sirve tanto para T2AV como para I2AV sin ramificaciones.
La prueba de humo de quien lo envía es un mínimo útil: una sola NVIDIA H100 80GB con FlashAttention-3, descarga a CPU activada, 864×480, 125 fotogramas, 50 pasos, CFG 5,0, semilla 42. Eso es un clip de 5 segundos a poco menos de HD, no un render en Full HD, y el PR no afirma lo contrario.
Un checkpoint no es un servicio
La razón para preocuparte por un merge como este es lo que elimina de tu lista. Ejecutar la implementación de referencia implica clonar el repositorio, ejecutar just setup, dejar que compile SageAttention en cualquier cosa por debajo de Hopper, descargar el checkpoint en un directorio de caché e invocar un comando generate cuya salida acaba en una carpeta con marca de tiempo. Eso está bien para un primer vistazo y resulta incómodo para un producto.
vLLM-Omni te ofrece el modelo dentro de un proceso de servicio, con los mismos puntos de entrada de inferencia sin conexión que el proyecto usa para sus otros modelos de difusión (examples/offline_inference/text_to_video/text_to_video.py y su equivalente para imagen a vídeo) y una receta de servicio en recipes/Kandinsky/Kandinsky6-TI2VA.md. De ello se derivan dos consecuencias prácticas. Tu panorama de despliegue pasa a ser un contenedor que habla una interfaz HTTP en lugar de un script que tú administras, y el modelo deja de ser un caso especial en tu stack: queda junto a cualquier otra cosa que ejecutes en ese servidor.
Fíjate en lo que esto no es. No es un endpoint alojado, no es un precio, y no es una medición de calidad independiente. Es un lugar más donde el modelo puede ejecutarse, aportado por alguien ajeno al laboratorio, tres días después de que aparecieran los pesos.
Lo que cuesta un clip de cinco segundos en tiempo real, en tarjetas reales
El repositorio es el punto de partida honesto. Estos son los tiempos del modelo base no destilado para un único clip de 5 segundos después del calentamiento, excluyendo los pesos y el MP4. En la suite completa, la superresolución está activada.
• Full HD (Pro) — 402 s en una H100, 765 s en una RTX PRO 6000, 854 s en una RTX 5090, 1.106 s en una A100 80GB, 1.247 s en una RTX 4090 y 3.530 s en una RTX 5060 Ti.
• Full HD (Lite) — 284 s en una H100, 387 s en una RTX PRO 6000, 406 s en una RTX 5090, 664 s en una A100 80GB, 578 s en una RTX 4090 y 1774 s en una RTX 5060 Ti.
• SD (Pro) — 356 s en una H100 frente a 936 s en una RTX 4090, que es donde la penalización por usar tarjetas de consumo es menor y la economía es menos mala.
La forma de esa tabla importa más que cualquier celda individual. Una H100 es aproximadamente tres veces más rápida que una 4090 en Pro Full HD, y aproximadamente seis veces más rápida que una 5060 Ti en la misma tarea, pero la etapa de SR cuesta lo mismo en cualquiera de los dos tamaños de modelo: unos 64 segundos en HD y unos 96 segundos en Full HD en una 5090. Lite no te ofrece una pasada de superresolución más corta, porque el modelo de SR se entrena por separado y no le importa qué modelo base lo alimentó.
La ruta de 16 GB, y el único ajuste que cambia tu imagen
La memoria máxima asignada en una ejecución de Pro SD alcanza los 72,8 GiB, lo cual supera a cualquier tarjeta de consumo. El repositorio responde con offloading de bloques —solo dos bloques transformer residentes en la GPU a la vez, y el resto se transmite desde la memoria del host—, además de tres preajustes para tarjetas de 32 GB, 24 GB y 16 GB. Los preajustes de 32 y 24 GB son idénticos, porque por encima de 24 GB el margen adicional no se traduce en velocidad.
La advertencia está enterrada y merece repetirse: en el preset de 16 GB, el codificador de texto está cuantizado a NF4, y el artículo es explícito en que este es el único cambio de preset que altera el propio clip. Una representación textual diferente produce un video diferente. Todo lo demás —longitud de segmento, franjas espaciales, descarga— cambia la salida al nivel del ruido de redondeo, alrededor del 12 % de los píxeles que difieren en un nivel de brillo a aproximadamente 57 dB de PSNR. Si estás reproduciendo el resultado de otra persona en una tarjeta de 16 GB y no coincide, eso es lo primero que debes revisar.
Tres cosas que las notas de la versión no resuelven
• Cinco segundos es el techo, no un valor predeterminado. El modelo se entrenó con 121 fotogramas a 24 fps, y tanto el artículo como la receta de servicio se basan en eso. No hay un modo de extensión en la versión. Cualquier duración mayor es un problema de empalme que es tu responsabilidad.
• El checkpoint destilado es el que realmente vas a servir, y se midió a la par. La ablación del artículo sitúa al modelo destilado como preferido o empatado en la mayoría de los criterios, sin que ninguna diferencia individual alcance significación, con una preferencia media de 51 % a 49 %. Ese es el sacrificio que asumes a cambio de la velocidad.
• En el artículo hay dos cifras de tasa de error de palabras y no son comparables. La reducción del 47 % en el WER del habla generada que acompaña a la etapa de aprendizaje por refuerzo se evalúa con Whisper-large-v3, uno de los modelos de recompensa del RL; el WER que se reporta junto con VABench utiliza Qwen3-ASR-1.7B en el subconjunto de habla. Los propios autores lo dicen. Citar una por la otra es el error más fácil de cometer con este lanzamiento.
Dónde encaja un router en una pila como esta
OrcaRouter no ofrece Kandinsky 6.0 Video, y nada de lo aquí dicho debe interpretarse como una afirmación de que sí lo hace: el modelo es tuyo para ejecutarlo desde el Hub, o se puede acceder a él a través de las interfaces propias del laboratorio. Lo que un pipeline como este necesita de un router es el texto que lo rodea. El pase de expansión de prompts que convierte la descripción de una toma en la descripción larga, media o corta con la que se entrenó el modelo, el trabajo de descripción y transcripción que alimenta un pase de imagen a video, los resúmenes de revisión que deciden cuál de las cuatro generaciones conservar: esas son llamadas de texto ordinarias, y se ejecutan en un único endpoint compatible con OpenAI en más de 200 modelos con precios de lista de los proveedores transferidos con un 0 % de margen, así que un cambio de precio de un proveedor se refleja el mismo día. La conmutación por error automática importa más de lo habitual aquí, porque un render de cinco minutos que falla en la etapa de descripción debería redirigirse en lugar de reiniciar el trabajo.
Lo siguiente que hay que observar no es otra fusión, sino un número. Kandinsky 6.0 Video Pro tiene resultados reportados por el proveedor en VABench y una evaluación humana realizada por el laboratorio frente a Kling 2.6, Veo 3.1 Fast, MiniMax H3 y Seedance 2.0 —y aún no tiene una puntuación independiente en arena. Cuando aparezca una, la afirmación de pesos abiertos deja de ser un argumento sobre el acceso y pasa a ser un argumento sobre la calidad, que es la comparación que decide si este es un modelo que los equipos descargan o un modelo que admiran.


El repositorio también incluye dos nodos de ComfyUI —kandinsky6 y kandinsky6-sr— instalables a través de ComfyUI Manager, y dos Hugging Face Spaces: uno para el checkpoint destilado Pro y otro para la demo de superresolución de vídeo. Entre la CLI, los nodos de ComfyUI, el paquete de diffusers y ahora un pipeline de vLLM-Omni, la superficie de despliegue es más amplia al tercer día de lo que la mayoría de los modelos de vídeo abiertos consiguen en un trimestre. Esa amplitud es la verdadera historia de la semana: Sber lanzó una familia, no un artículo con una demo adjunta.

