Tarjeta de título para un artículo que compara Kandinsky 6.0 Video con su oponente nombrado, con el subtítulo «La versión del paper no es la versión que compras», y tres etiquetas de apoyo tomadas de la propia evidencia del artículo.
Engineering & Research

Kandinsky 6.0 Video vs Seedance 2.5: La versión del artículo no es la versión que compras

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La frase más citada de este enfrentamiento es una comparación contra el modelo equivocado. El informe técnico de Kandinsky 6.0 Video, publicado el 6 de octubre de 2026 junto con la liberación de los pesos bajo licencia MIT, se compara con Dreamina Seedance 2.0 — la generación anterior. Seedance 2.5, el modelo actual de vídeo y audio de ByteDance, está disponible desde el 31 de julio de 2026 y es el que está a la venta. Así que cuando el informe concluye que Seedance «se prefiere en los criterios visuales, con márgenes estadísticamente significativos en calidad visual general, artefactos, realismo del movimiento y seguimiento de instrucciones visuales», está describiendo una versión que hoy no se puede licenciar, evaluada por el laboratorio que escribió Kandinsky 6.0 Video. Ambas mitades de esa frase importan, y ninguna de las dos es motivo para ignorar la comparación: la brecha de versiones establece un límite inferior de lo que puede decirte, y el encuadre te indica en quién confiar y para qué.

¿Qué cambió entre las dos versiones de Seedance?

El paso de 2.0 a 2.5 no es un repintado, que es exactamente por lo que la sustitución no es cosmética. Seedance 2.5 genera hasta treinta segundos en una sola pasada — seis veces el envolvente del modelo en el informe, y seis veces los cinco fijos de Kandinsky 6.0 Video. Añade segmentación a nivel de marca de tiempo y ediciones posteriores a la generación a nivel de región, lo que significa que se puede aplicar un cambio a una ventana del clip o a una porción del fotograma en lugar de regenerar todo. Lee texto junto con aproximadamente treinta imágenes, diez vídeos y diez clips de audio como material de referencia en una sola solicitud, frente al único fotograma final enmascarado de Kandinsky 6.0 Video. Y produce audio sincronizado con diálogo, que es la única razón por la que este par pertenece siquiera al mismo artículo.

Cada una de esas es una capacidad que la evaluación del informe no probó. Por lo tanto, el resultado de los criterios visuales te indica que Kandinsky 6.0 Video quedó por detrás de la generación anterior de Seedance en calidad visual general, artefactos, realismo de movimiento y seguimiento de instrucciones. No te dice qué haría la compilación actual, y la suposición honesta es que una generación más reciente no empeora en los ejes que sus propias notas de la versión enfatizan.

Lo que la propia evaluación del informe establece y no establece

El método se describe con suficiente detalle como para ser sopesado. Pares lado a lado generados a partir del mismo prompt por dos modelos, ambos clips anonimizados, posiciones izquierda/derecha aleatorizadas por tarea, orden de las tareas barajado, audio primero desactivado para las preguntas visuales y luego activado para las de audio, una opción de empate simétrica y una opción explícita de N/A cuando un criterio no puede juzgarse, agregación mediante voto mayoritario entre anotadores, y aproximadamente 200 o más comparaciones por pares para cada criterio evaluado.

Con ese método, el resultado de Seedance 2.0 se divide de una manera que le resultará familiar a cualquiera que haya leído la comparación con Kling del mismo informe. Los criterios visuales se los lleva Seedance con márgenes que superan el umbral de significación. El ámbito de audio está mucho más reñido: la sincronización audio-video queda cerca de la paridad, y la calidad del habla favorece a Kandinsky 6.0 Video Pro. Entre esas dos afirmaciones reside toda la decisión, porque significa que el checkpoint abierto de audio-video más reciente está mediblemente por detrás en cómo se ve un clip y mediblemente por delante en cómo suena el habla en él.

Los límites de ese resultado son los habituales y ninguno de ellos es fatal para él. Fue ejecutado por los autores de Kandinsky con prompts de su elección y anotadores que ellos mismos reclutaron. Ninguna arena ciega pública puntúa a Kandinsky 6.0 Video en absoluto, así que nada externo ha comprobado si los prompts de un desconocido reproducen la división. El informe también revela el techo contra el que mide: clips de hasta cinco segundos, generación base en resolución SD con Full HD alcanzado mediante una etapa de superresolución, y una brecha que persiste frente a los sistemas propietarios más potentes en calidad visual y calidad de audio.

Tres brechas estructurales que ningún benchmark capturaría

La duración es lo primero y lo más contundente. Kandinsky 6.0 Video se entrena y evalúa a 121 fotogramas, ejecuta la inferencia a 121 fotogramas, 5 segundos a 24 fps, y se distribuye sin modo de extensión: una pieza de treinta segundos son seis generaciones, cinco uniones y un riesgo de continuidad que corre por tu cuenta. Seedance 2.5 hace treinta segundos en una sola pasada. Para un único intercambio de diálogo, un recorrido de producto o cualquier cosa donde la unión sea visible, eso no es una diferencia de benchmark; es una diferencia en si el trabajo es un solo render o un paso de ensamblaje.

El segundo es el condicionamiento por referencia, y la asimetría es marcada. Kandinsky 6.0 Video toma una imagen de referencia y la aplica como fotograma final enmascarado: un fotograma clave hacia el que interpolar. Seedance 2.5 toma un conjunto de trabajo de unas treinta imágenes, diez clips de vídeo y diez clips de audio como un único contexto. La consistencia de personajes a lo largo de una secuencia, la transferencia de estilo desde un tablero de inspiración, una interpretación traída de un clip existente: esas son cargas de trabajo que el número de referencias hace posibles y que el modo de fotograma único no intenta.

El tercero es la editabilidad, y es el que cambia un flujo de trabajo en lugar de una sola toma. La edición a nivel de región y a nivel de marca temporal significa que una ventana defectuosa de tres segundos se repara en el mismo lugar. Kandinsky 6.0 Video no tiene superficie de edición: unos malos cinco segundos se regeneran y, si se unieron a otros cuatro, también se reconsideran las uniones. Los equipos que calculan el coste de un hábito de re-renderización deberían incluir esa diferencia en la elección del modelo en lugar de descubrirla.

• Duración — Kandinsky 6.0 Video: 5 s fijos, 121 fotogramas a 24 fps, sin modo de extensión. Seedance 2.5: hasta 30 s en una sola pasada.

• Acondicionamiento de referencia — Kandinsky 6.0 Video: una imagen, aplicada como fotograma final enmascarado. Seedance 2.5: aproximadamente treinta imágenes, diez vídeos y diez clips de audio por solicitud.

• Edición — Kandinsky 6.0 Video: ninguna; regenerar y volver a unir. Seedance 2.5: selección a nivel de marca de tiempo y ediciones posteriores a la generación a nivel de región.

• Resolución — Kandinsky 6.0 Video: SD a 512×768, Full HD 1920×1080 mediante una etapa de superresolución integrada. Seedance 2.5: según el modo, con el precio por clip determinado por la resolución que elijas.

• Audio — Kandinsky 6.0 Vídeo: 44 kHz con sincronización labial, generado conjuntamente con la imagen. Seedance 2.5: audio sincronizado que incluye diálogo, generado con el vídeo.

• Pesos — Kandinsky 6.0 Video: MIT, Lite 3B y Pro 29B, con código e integración con diffusers. Seedance 2.5: no.

Dos metros que no se convierten entre sí

Seedance 2.5 se mide en tokens, lo que equivale a aproximadamente $0.51 por un clip de cinco segundos a 480p y aproximadamente $1.16 a 720p. La razón para expresarlo así en lugar de como una tarifa por segundo es que el recuento de tokens escala con el metraje, por lo que una generación de treinta segundos no son treinta segundos de una tarifa fija — son seis veces los tokens de una de cinco segundos con la misma configuración, y las operaciones de edición se cobran según lo que tocan. Un pipeline que regenera habitualmente descubrirá que el medidor responde a ese hábito.

Kandinsky 6.0 Video no tiene medidor porque no hay nada que comprar. Su costo es una máquina y un reloj, y el informe proporciona el reloj: aproximadamente 402 segundos de tiempo de trabajo en una H100 para un clip Pro Full HD de cinco segundos, 854 en una RTX 5090, 1.247 en una RTX 4090, se requiere block offloading por debajo de una asignación máxima de 72,8 GiB, y un preset de 16 GB de VRAM que cuantiza el codificador de texto a NF4 —el único cambio de preset que, según el informe, altera el clip en sí. El checkpoint destilado, medido en paridad con el modelo completo con una preferencia media de 51% a 49% sin que ningún criterio alcanzara significación estadística, es el que hace que esos números sean viables.

• Coste por cada cinco segundos — Kandinsky 6.0 Video: sin precio de lista; entre seis y veintiún minutos de una GPU según la tarjeta. Seedance 2.5: aproximadamente $0,51 a 480p y $1,16 a 720p en tokens.

Nada en esas dos líneas es conmensurable, y el intento habitual de reducirlas a una sola cifra —dividir una tarifa de GPU-hora entre clips de cinco segundos— asume en silencio una utilización plena, cero tiempo de inactividad y una tarjeta que ya posees. La comparación más útil es cualitativa: el coste de Seedance 2.5 escala con cuánto generas y desaparece cuando paras; el coste de Kandinsky 6.0 Video se incurre tanto si generas como si no.

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

Dónde se puede contactar a cada uno

Ninguno de los dos modelos está en OrcaRouter, y no se está haciendo ninguna de las dos afirmaciones. Se accede a Seedance 2.5 a través de las propias plataformas del proveedor y de varios servicios de terceros; Kandinsky 6.0 Video es un checkpoint que se descarga bajo licencia MIT y se ejecuta en tu propio hardware. Cualquier página que te diga que ambos están a una sola llamada de API de distancia en una plataforma multimodelo está describiendo modelos diferentes.

La razón por la que una capa de enrutamiento sigue mereciendo mención en un pipeline de Kandinsky o Seedance es que estos sistemas son, en su mayoría, texto por número de llamadas y vídeo por coste. La expansión de prompts convierte una nota de plano en la descripción larga y estructurada que espera un modelo T2AV. El diálogo se redacta antes de que un pase de sincronización labial lo intente, y se reescribe cuando el pase lo estropea. Se revisan seis generaciones candidatas del mismo beat y se selecciona una —un juicio textual sobre un artefacto de vídeo, que es la forma más barata de tomar correctamente la decisión costosa. En un único endpoint compatible con OpenAI que abarca más de 200 modelos a precios de lista del proveedor, aplicados con un 0 % de margen, esas llamadas cuestan lo que cobra el proveedor y nada más, incluso el día después de que un proveedor cambie sus tarifas. El DSL de enrutamiento se gana su lugar cuando el revisor barato y el revisor cuidadoso deberían ser modelos distintos en el mismo punto de llamada, y la conmutación por error automática se lo gana porque una descripción que falla mientras se renderiza el clip cuatro de seis debería redirigirse en lugar de terminar la sesión.

¿Qué movería este enfrentamiento?

La brecha de versiones lo es todo y también la vía más corta para resolverla. Una prueba de Seedance 2.5 frente a Kandinsky 6.0 Video zanjaría si las pérdidas en los criterios visuales que el informe registra frente a 2.0 se han ampliado, reducido o invertido; el informe no puede responder eso, y sus autores no tenían forma de hacerlo. Por ahora, la postura defendible es más limitada de lo que quiere el marketing de cualquiera de las dos partes: según la evidencia publicada por el propio laboratorio del modelo, Seedance va por delante en cómo se ve el clip y Kandinsky 6.0 Video va por delante en cómo suena el habla que contiene, y la versión de Seedance en la que se basa esa afirmación está una generación por detrás de la que comprarías.

Elige en consecuencia. Si el trabajo es largo, tiene muchas referencias o está orientado a la edición, las lagunas estructurales deciden antes de que la calidad entre en escena. Si el trabajo es un plano hablado de cinco segundos en el que el diálogo tiene que sonar bien a la primera, la ventaja medida de Kandinsky 6.0 Video está exactamente en ese criterio — y la licencia MIT significa que la respuesta no depende de la hoja de ruta de nadie. Lo que hay que observar no es una tabla de clasificación. Es una repetición de una comparación que el informe nunca pudo llevar a cabo.

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

La forma más barata de hacer correctamente la llamada costosa: un DSL de enrutamiento que intercambia al revisor por etapa, con conmutación automática por error para que un subtítulo caído no cueste el clip.