
Kandinsky 6.0 Video vs Grok Imagine Video: La clasificación se dio la vuelta
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
En enero de 2026, cuando Grok Imagine Video se lanzó, encabezó la arena de video de Artificial Analysis en ambos modos. Hoy, ese mismo tablero sitúa su versión actual en el puesto once o doce en texto a video. Eso no es un escándalo y no es un fracaso — es lo que le ocurre a una categoría que avanza rápido en nueve meses, y es la razón honesta para comparar el modelo de generación de xAI con Kandinsky 6.0 Video ahora mismo. Uno de ellos es un servicio optimizado para la rapidez con la que puedes producir otro clip; el otro es un checkpoint con licencia MIT, 29B de parámetros en el tamaño Pro y 3B en el Lite, publicado por el Kandinsky Lab de Sber en la primera semana de octubre de 2026, que genera cinco segundos de video con audio sincronizado de 44 kHz y sincronización labial. La pregunta interesante no es cuál va por delante en un tablero — es qué es capaz de hacer estructuralmente cada uno a continuación.
El tablero que se movió debajo de él
Grok Imagine Video es el modelo de generación de xAI, lanzado por primera vez el 29 de enero de 2026 y estable en la versión 1.5 desde el 16 de junio. En la tabla de clasificación de texto a video de Artificial Analysis, su versión 1.5 ocupa el 11.º–12.º puesto con 1.045 de Elo (±9) sobre 4.056 votos, con un precio listado de 15,00 $ por minuto. La versión original no aparece en esa tabla.
La conversión de imagen a vídeo es donde la familia es más fuerte, y donde las dos compilaciones se separan de una manera que vale la pena leer con atención:
• grok-imagine-video-1.5 — 7.º–9.º, Elo 1.098 (±8), 5.267 votos, $8.40/min.
• grok-imagine-video (la versión de enero) — 12-17, Elo 1.072 (±7), 14.371 votos, $4,20/min.
• Para dar una idea de la escala, la cima de esa tabla de I2V —MiniMax H3 Max— se sitúa en 1.195 de Elo (±9) con 5.894 votos, y Wan 3.0 es sexto con 1.164.
A continuación, dos lecturas, y ambas son ciertas. La nueva build de xAI está genuinamente por delante de su propia predecesora en imagen a vídeo, por 26 puntos Elo, y cuesta el doble por minuto estarlo. Y la historia de la semana del lanzamiento —un modelo que llegó a lo más alto— no se ha mantenido: el campo se movió, la arena acumuló decenas de miles de votos entre una docena de sistemas más nuevos, y una posición de media tabla es donde nueve meses de competencia sitúan a un generador rápido y de propósito general.
Kandinsky 6.0 Video no tiene Elo en ninguna clasificación. Su evidencia es una ejecución de VABench y una evaluación humana realizada por el laboratorio, ambas publicadas por Sber, ninguna reproducida fuera de ella. Colocar un modelo abierto no auditado junto a uno comercial con puntuación es exactamente la comparación que hay que tratar con cuidado: la posición del modelo con puntuación es real y poco halagadora, y la posición del modelo sin puntuación es desconocida. "Desconocido" no es "mejor".
Dos tipos de rapidez, y solo uno de ellos se mide en segundos.
El objetivo de diseño de Grok Imagine es el uso por parte de cada creador. Está integrado en X, devuelve un clip terminado con sonido, y su conjunto de funciones parece una lista de cosas que realmente harías en un feed: relaciones de aspecto, movimiento de cámara, añadir, eliminar e intercambiar objetos, transferencia de estilo, generación condicionada por referencias a partir de varias imágenes para la consistencia de personajes, audio nativo con efectos y música. La duración del clip llega hasta los quince segundos y la resolución máxima es 1080p. Todo el producto está diseñado para que un segundo intento te cueste un par de minutos y unos pocos centavos.
Kandinsky 6.0 Video es rápido en un sentido distinto: no por intento, sino por unidad de propiedad. Nada en él es instantáneo. Los propios tiempos de trabajo del repositorio para el modelo no destilado, tras el calentamiento y excluyendo la carga de pesos y la codificación MP4, sitúan un clip Pro Full HD de cinco segundos en unos 402 segundos en una H100, 854 en una RTX 5090, 1.247 en una RTX 4090 y 3.530 en una RTX 5060 Ti. Lite Full HD son 284 segundos en una H100. La herramienta que hace que eso sea soportable es el checkpoint destilado, que el artículo midió en paridad con el modelo completo: preferido o empatado en la mayoría de los criterios, con una preferencia media del 51 % frente al 49 %, sin que ninguna diferencia individual alcanzara significación. Lo que obtienes a cambio del renderizado lento es un modelo en tu propio disco sin ningún contador por clip en funcionamiento.
Esa es la verdadera forma de este enfrentamiento. Grok Imagine Video optimiza el coste del décimo intento. Kandinsky 6.0 Video optimiza el coste del intento número diez mil, y te cobra en hardware y paciencia por el primero.
Ambos generan audio — y no son la misma afirmación
Este es el eje en el que una comparación perezosa diría «empate» y se equivocaría.
Grok Imagine Video produce audio nativo con diálogo, efectos y música como una característica más entre muchas. Es un generador de propósito general que resulta que incluye sonido.
Kandinsky 6.0 Video está construido en torno al sonido. La arquitectura es un CrossDiT de doble flujo que empareja un flujo de vídeo inicializado a partir de Kandinsky 5.0 Video con un flujo de audio entrenado desde cero con grandes corpus de audio, unidos mediante atención cruzada bidireccional y entrenados conjuntamente. La salida es de 44 kHz con sincronización labial explícita, y se informa de que la etapa de aprendizaje por refuerzo del artículo reduce la tasa de error de palabras del habla generada en un 47 %, medida con Whisper-large-v3, que es uno de los modelos de recompensa del RL, un detalle que importa porque el artículo reporta una segunda WER no comparable junto con VABench usando Qwen3-ASR-1.7B. El habla es aquello sobre lo que se postentrenó el modelo.
Frente a eso, el propio estudio de Sber es sincero sobre dónde pierde. En la evaluación comparativa del laboratorio, MiniMax H3 y Dreamina Seedance 2.0 son preferidos en criterios visuales por márgenes significativos, y el modelo se describe como competitivo más que como superior. La afirmación que merece tomarse en serio es más acotada y más útil: frente a Kling 2.6 y Veo 3.1 Fast, los resultados intercambian criterio por criterio, y Kandinsky 6.0 Video se mantiene competitivo en calidad de voz y sincronización audio-video, donde una gran fracción de las comparaciones son empates.
Quince segundos frente a cinco, y lo que cuesta alcanzar cada uno.
• Duración máxima del clip — Grok Imagine Video: hasta 15 s. Kandinsky 6.0 Video: 5 s fijos, 121 fotogramas a 24 fps, sin modo de extensión en esta versión.
• Resolución — Grok Imagine Video: hasta 1080p. Kandinsky 6.0 Video: SD, HD y Full HD mediante un modelo dedicado de superresolución, con reescalados x2, x4 o x2,25 de clips de cinco segundos.
• Entrada de referencia — Grok Imagine Video: generación condicionada por referencia a partir de varias imágenes para la coherencia de personajes, además de añadir/eliminar/intercambiar objetos. Kandinsky 6.0 Video: una imagen, aplicada como fotograma final enmascarado.
• Precios — Grok Imagine Video: por segundo de salida, desde el extremo inferior del rango hasta $0.30/s a 1080p, con un cargo adicional por entrada de imagen; el acceso gratuito está detrás de los niveles de suscripción de X. Kandinsky 6.0 Video: ninguno — sin servicio, sin tarifa, solo el tiempo de GPU que usted proporciona.
• Pesos — Grok Imagine Video: no. Kandinsky 6.0 Video: MIT, Pro y Lite, con integración de diffusers.
El sobreprecio por la versión más reciente de Grok es la cifra que hay que rodear. Pasar de la versión de enero a la 1.5 cuesta el doble por minuto en la tabla de imagen a vídeo y aporta 26 Elo. Es una mejora real a un precio real, y es el mismo intercambio que todos los proveedores de vídeo les piden a los compradores que hagan ahora mismo.
Dónde encaja un router y dónde no
OrcaRouter no ofrece Grok Imagine Video ni Kandinsky 6.0 Video, y nada de lo que aquí se dice afirma lo contrario: Kandinsky es tuyo para descargarlo y ejecutarlo, y se accede a Grok Imagine Video a través de las propias interfaces de xAI. Lo que una canalización construida sobre cualquiera de los dos modelos necesita de un enrutador es el texto que rodea al render — la lista de planos, la expansión del prompt que convierte una idea en la descripción larga o corta con la que se entrenó a estos modelos, el trabajo de generación de descripciones y transcripción, y los resúmenes de revisión que deciden qué generación se conserva. Se ejecutan en un único endpoint compatible con OpenAI en más de 200 modelos de texto al precio de lista del proveedor con 0% de margen, así que una rebaja del proveedor está activa en la misma clave el día que llega, con conmutación por error automática para que una llamada fallida en medio de una cola de renderizado se redirija en lugar de estancar el lote. La orquestación en torno a un modelo de video es un problema de enrutamiento incluso cuando el propio modelo de video no es enrutable, que es el caso de ambos hoy.
¿Cuál, y para qué?
Recurre a Grok Imagine Video cuando el trabajo es de volumen: clips para redes sociales, iteraciones rápidas, una toma que regenerarás seis veces antes de que quede bien y una fecha límite que no se estira. Su precio por intento es el producto, y el hecho de que ahora se sitúe en la zona media de la tabla en lugar de en lo más alto es el coste normal de una categoría que avanza tan rápido.
Recurre a Kandinsky 6.0 Video cuando el trabajo sea una cadena de producción: una unidad fija de cinco segundos que puedes procesar por lotes, una pasada de imagen a vídeo en la que lo que importa es la fidelidad a una imagen fija proporcionada, habla que pretendes que sea inteligible y un entregable que preferirías no alquilar. Presupuesta el render, espera uno lento en cualquier equipo de gama de consumo y trata cada cifra de calidad de este artículo como propia de Sber hasta que alguien fuera del laboratorio la puntúe.


Lo que hace que este emparejamiento valga la pena seguir es cuál de los dos puede absorber un mal trimestre. Si Grok Imagine Video cae más abajo en la arena, la respuesta es un mejor modelo y un nuevo precio: así funciona la categoría, y xAI ya ha demostrado que lanzará uno. Si Kandinsky 6.0 Video resulta ser de media tabla cuando se le puntúe, el checkpoint sigue existiendo, sigue funcionando y sigue ajustándose; nada de la licencia cambia con el número. Son tipos distintos de durabilidad, y solo uno de ellos se mide con Elo.

