
Kandinsky 6.0 Video vs Alibaba Wan 2.7: pesos abiertos contra una suite de cuatro modelos
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Kandinsky 6.0 Video te ofrece un checkpoint de 29B parámetros que puedes descargar y, a cambio, un clip de cinco segundos. Wan 2.7 te ofrece cuatro variantes específicas para tareas, clips de hasta quince segundos y una factura por segundo. Esas dos frases son la comparación, y la razón por la que vale la pena anotarla es que la mayoría de las páginas de comparación directa los comparan por calidad visual, donde ninguno tiene una puntuación independiente que lo resuelva, y se saltan el eje en el que realmente divergen, que es lo que cada uno espera que aportes.
El Kandinsky Lab de Sber publicó como código abierto Kandinsky 6.0 Video en la primera semana de octubre de 2026 bajo licencia MIT, en dos tamaños —Pro con 29B y Lite con 3B—, con código, checkpoints e integración con diffusers. El Wan 2.7 de Alibaba se lanzó el 3 de abril de 2026 como una suite: texto a video, imagen a video, referencia a video y edición de video, facturado por segundo de video generado. Uno de ellos es un modelo que ejecutas; el otro es un servicio que compras. La pregunta interesante no es cuál es mejor, sino cuál es la forma correcta para el trabajo.
El único eje en el que son directamente comparables
Ambos modelos generan vídeo con sonido, no un vídeo al que después se le añade la banda sonora. Eso es más raro de lo que parece y es la razón por la que estos dos se mencionan juntos — la mayor parte del sector todavía produce un MP4 silencioso y deja el audio para una pasada aparte.
Kandinsky 6.0 Video lo hace con un CrossDiT de doble flujo: un flujo de vídeo inicializado desde el checkpoint de Kandinsky 5.0 Video, un flujo de audio entrenado desde cero con grandes corpus de audio, y atención cruzada bidireccional que los une, entrenados conjuntamente tras una etapa de preentrenamiento continuo. La salida es audio de 44 kHz con sincronización labial, a partir de un prompt de texto (T2AV) o una imagen de referencia (I2AV).
Wan 2.7 también produce audio nativo, sin publicar el mecanismo con el mismo nivel de detalle. Su propia documentación señala la calidad del audio y la precisión del texto en pantalla como las dos áreas que aún deben mejorarse — una advertencia sobre la fidelidad que conviene tener presente, porque la hace el propio proveedor, no un crítico que especula.
Ahí es donde termina el parecido. Todo lo que está por debajo de esta línea es una divergencia, no una clasificación.
Cinco segundos frente a quince, y lo que eso le hace a una lista de planos
Kandinsky 6.0 Video está entrenado con 121 fotogramas, 24 fps —cinco segundos— y la versión publicada no contiene ningún modo de extensión. El artículo, la receta de servicio integrada en vLLM-Omni y la tabla de rendimiento del repositorio están construidos en torno a esa única duración de clip. Una pieza de treinta segundos son seis generaciones y cinco empalmes, y los empalmes te toca ocultarlos.
Wan 2.7 cubre de dos a quince segundos en una sola generación, y se decide en cada solicitud. Para un clip de una persona hablando a cámara, una inserción de producto o un solo movimiento de cámara, esa diferencia no es una simple comodidad: es la diferencia entre un único render y un paso de ensamblaje. Para cualquier cosa construida plano por plano, cinco segundos es una unidad de trabajo normal y la brecha casi desaparece.
• Clip máx. — Kandinsky 6.0 Video: 5 s, fijo, 121 fotogramas a 24 fps. Wan 2.7: 2–15 s, definido según la solicitud.
• Resolución — Kandinsky 6.0 Video: SD, HD y Full HD (1920×1080) mediante un modelo de superresolución independiente. Wan 2.7: hasta 1080p.
• Condicionamiento por referencia — Kandinsky 6.0 Video: una imagen, aplicada como fotograma final enmascarado. Wan 2.7: hasta cinco imágenes de sujeto y cinco clips de referencia, diez recursos por solicitud.
• Tareas — Kandinsky 6.0 Video: T2AV e I2AV. Wan 2.7: texto a vídeo, imagen a vídeo, referencia a vídeo y edición de vídeo como variantes separadas con facturación independiente.
• Pesos — Kandinsky 6.0 Video: MIT, descargables, Pro y Lite. Wan 2.7: no.
Cuatro tareas contra dos modos
El número de tareas es la parte de Wan 2.7 que queda infravalorada en las tablas comparativas, porque no es una afirmación de calidad: es una afirmación de alcance. La edición basada en instrucciones de metraje existente, en la que describes un cambio y recibes el mismo plano con ese cambio aplicado, es una carga de trabajo que Kandinsky 6.0 Video no intenta en absoluto. La referencia a vídeo, en la que una interpretación proporcionada guía a un sujeto generado, también queda fuera de sus dos modos.
Su facturación refleja el alcance. Las variantes de texto a vídeo e imagen a vídeo de Wan 2.7 facturan únicamente por la duración de salida — $0.10/s a 720p y $0.15/s a 1080p en los endpoints internacionales de Singapur, mientras que Pekín y Tokio listan $0.086/s y $0.143/s por el mismo trabajo. La variante de referencia a vídeo también factura el vídeo de entrada, con un límite de cinco segundos, por lo que una referencia de cinco segundos que genera un vídeo de quince segundos se factura como veinte segundos de trabajo. La variante de edición de vídeo solo factura la salida y considera que el metraje de entrada es gratuito — lo que representa la tarifa más favorable de toda la familia y la razón por la que la edición es donde 2.7 es realmente barato.
Junto a esas cifras hay dos datos sobre el ciclo de vida. Alibaba aplicó a sus propias plataformas Bailian y Qwen Cloud un descuento de lanzamiento del 30 % por tiempo limitado, y este expiró el 23 de septiembre de 2026. Por separado, el aviso de retirada de Model Studio de Alibaba Cloud (ID 118434) deja fuera de línea varios modelos más antiguos el 10 de octubre de 2026, y wan2.7-r2v y wan2.7-image están en esa lista. Se trata de una cuestión a nivel de variante, no de un apagado de la generación — wan2.7-t2v y wan2.7-i2v siguen listados con tarifas activas —pero si reference-to-video era el motivo por el que mirabas la 2.7, a esa vía le quedan cuatro días.
Lo que las juntas independientes muestran y no muestran
Esta es la sección donde la mayoría de las comparaciones de estos dos modelos hacen trampa en silencio, así que vale la pena ser preciso sobre lo que existe.
Wan 2.7 tiene puntuaciones independientes en tres tablas de video separadas de Artificial Analysis, y no coinciden entre sí porque miden cosas diferentes:
• Texto a video — Wan2.7-260612 (la compilación de junio) ocupa el 13.º–14.º puesto con 1.030 (±9) de Elo sobre 5.571 votos, a $9,00/min.
• Imagen a vídeo — Wan 2.7 (la versión de abril) ocupa el puesto 12 con Elo 1.077 (±8) sobre 4.571 votos, a 9,00 $/min.
• Edición de vídeo — Wan 2.7 ocupa el 5.º puesto con un Elo de 1.077 (±5) con más de 17.988 votos, a $16,90/min.
Lee esos tres juntos, y la conclusión útil no es "Wan 2.7 es duodécimo en vídeo". Es que el modelo es marcadamente más fuerte en edición que en generación, en tablas creadas para cada una, y que citar un solo número para él es un error en cualquier dirección.
Kandinsky 6.0 Video no tiene puntuación en ninguno de ellos. Su evidencia publicada es del lado del proveedor y vale la pena decir exactamente qué es: una ejecución de VABench en la que el laboratorio informa que Pro lidera en calidad de voz, estética de audio, alineación texto-video y audio-video, precisión de sincronización labial, desincronización y realismo visual entre los tres sistemas evaluados — siendo los otros dos su propio modelo Lite y LTX 2.5 — y una evaluación humana comparativa lado a lado realizada por el laboratorio con aproximadamente 200 o más comparaciones por pares por criterio, en la que Pro es competitivo con Kling 2.6 y Veo 3.1 Fast, va por detrás de MiniMax H3 y Dreamina Seedance 2.0 en criterios visuales, y se mantiene competitivo en calidad de voz y sincronización audio-video. Nada de esto ha sido reproducido fuera de Sber, y nada de esto es un Elo en una tabla pública a ciegas. La lectura correcta es "prometedor y no auditado", no "coincide con Veo".
Lo que cuesta cada uno, expresado en los términos que utiliza cada parte
Los dos modelos de precios no se pueden reducir a un único número, y pretender lo contrario es lo que lleva a los equipos a tomar una decisión equivocada.
Wan 2.7 es una tarifa por segundo. Un clip de quince segundos en 1080p cuesta unos $2.25. Una pieza de treinta segundos son dos generaciones más una edición: $4.50 de generación en bruto más tu tiempo de montaje, o menos si la variante de edición hace el trabajo, porque no factura la entrada.
Kandinsky 6.0 Video no tiene ninguna tarifa, porque no hay ningún servicio que comprar. Lo que sí tiene es un costo por hora de GPU que uno mismo aporta. Los propios números del repositorio marcan el mínimo: un clip Pro Full HD de cinco segundos supone unos 402 segundos de tiempo de trabajo en una H100 tras el calentamiento, 854 en una RTX 5090 y 1.247 en una RTX 4090. El checkpoint destilado —que el artículo midió como equivalente al modelo completo, con una preferencia media del 51% frente al 49% y sin que ningún criterio alcanzara significancia— es el que en realidad servirías. Todo lo que esté por debajo de 72,8 GiB de asignación máxima necesita offloading por bloques, y el preajuste de 16 GB cuantiza el codificador de texto a NF4, que el artículo confirma que es el único cambio de preajuste que altera el propio clip.
Dicho claramente: el costo de Wan 2.7 es una línea en una factura que puedes prever. El costo de Kandinsky 6.0 Video es una máquina que posees, un renderizado que tarda minutos por cada cinco segundos y la opción —no la obligación— de hacer ajustes finos.
Dónde se ubica un router en esto.
OrcaRouter no da servicio ni a Kandinsky 6.0 Video ni a Alibaba Wan 2.7, y aquí no se está haciendo ninguna de esas afirmaciones. Kandinsky puedes descargarlo y ejecutarlo por tu cuenta; se accede a Wan 2.7 a través de las propias plataformas de Alibaba. Lo que un pipeline construido sobre cualquiera de los dos modelos necesita de un router es la capa de texto que rodea al render: la expansión del prompt que convierte la descripción de un plano en la descripción larga o corta con la que se entrenó a estos modelos, el trabajo de descripción y diálogo que alimenta una pasada de imagen a vídeo, y los resúmenes de revisión que deciden cuál de varias generaciones es la que se conserva. Esas son llamadas de texto ordinarias, y se ejecutan en un único endpoint compatible con OpenAI a través de más de 200 modelos con precios de lista de proveedores repercutidos con un 0 % de margen, así que una rebaja de proveedor está activa el mismo día en lugar de después de un ciclo de contrato. La conmutación automática por error vale más aquí que en una carga de trabajo de chat, porque una llamada de descripción que falla en el minuto cuatro de una sesión de preguntas y respuestas debería redirigirse en lugar de perder el render.
La decisión, en una línea cada una
Si el entregable es un clip terminado con sonido y prefieres no tener una GPU, Wan 2.7 es el único de los dos que te ofrece eso, y su variante de edición es lo más potente de la familia según la evidencia disponible. Comprueba la retirada del 10 de octubre antes de comprometerte con reference-to-video.
Si el entregable es un pipeline que tú controlas, si las unidades de cinco segundos le convienen a tu lista de planos y si quieres ajustar o ejecutar sin conexión, Kandinsky 6.0 Video es el único de los dos que lo permite —a costa de un renderizado lento en hardware de consumo y de una afirmación de calidad que sigue siendo enteramente del laboratorio. El evento que hay que seguir de ese lado es simple: un Elo.


Merece la pena nombrar una asimetría antes de cerrar, porque sobrevivirá a ambos modelos. El techo de Wan 2.7 lo fija Alibaba, tanto contractual como técnicamente: cuando se retiren o se cambie el precio de las variantes de la suite, tu pipeline heredará la decisión. El techo de Kandinsky 6.0 Video es tu propio hardware, y la licencia MIT hace que un fork pueda sobrevivir a la hoja de ruta del laboratorio. Los equipos que se han quemado con que un modelo desaparezca de un catálogo tienden a dar más peso a esa diferencia un año después de lo que lo hicieron el día en que eligieron.

