Tarjeta de título para Odyssey-3 vs Kandinsky 6.0 Video, con un panel izquierdo encabezado por Odyssey-3 que muestra un entorno interactivo, una vista previa de investigación abierta el 8 de octubre de 2026, 832x480 o 1280x720 Pro, sin pesos y sin precio; y un panel derecho encabezado por Kandinsky 6.0 Video que muestra pesos abiertos el 6 de octubre de 2026 bajo una licencia MIT, clips de 5 s con audio de 44 kHz, Full HD 1920x1080, Physics-IQ no presentado.
Guides & Insights

Odyssey-3 vs Kandinsky 6.0 Video: pesos abiertos y audio frente a una vista previa interactiva cerrada

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Kandinsky 6.0 Video llegó el 6 de octubre de 2026 con algo que los lanzamientos de modelos abiertos rara vez tienen el primer día: soporte en Diffusers, ComfyUI, vLLM-Omni, SGLang y FastVideo, todo documentado en el propio registro de actualizaciones del repositorio, junto con un informe de arXiv presentado el 4 de octubre y checkpoints con licencia MIT en Hugging Face. Odyssey-3 llegó dos días después, el 8 de octubre, como una vista previa pública de investigación de un transformer de difusión autorregresivo que construye un entorno a partir de un prompt y predice cambios en tiempo real a medida que avanzas por él. Uno es un modelo de 29.000 millones de parámetros que puedes descargar y ejecutar en tu propia GPU esta noche. El otro es un sistema interactivo al que solo puedes acceder a través de la vista previa en el navegador de Odyssey y un formulario de contacto. Son los dos polos de lo que significaba “modelo de vídeo” en la misma semana de octubre de 2026, y la elección entre ellos tiene menos que ver con los benchmarks que con quién posee los pesos.

También esperan cosas distintas de ti. Kandinsky 6.0 Video es un modelo de generación: entra un prompt y sale un clip de cinco segundos con audio sincronizado. Odyssey-3 es un modelo de predicción: actúa y observa cómo responde el mundo. Ninguno sustituye al otro, y el hecho de que se lanzaran con 48 horas de diferencia es el contexto más útil que tiene cualquiera de los dos.

Las dos arquitecturas, en los propios términos de los proveedores

Kandinsky 6.0 Video es una familia de modelos de difusión fundacionales para la generación sincronizada de audio y vídeo, que comprende Kandinsky 6.0 Video Lite con 3B de parámetros y Kandinsky 6.0 Video Pro con 29B. Ambos generan clips de cinco segundos con audio sincronizado a 44 kHz, incluida la sincronización labial, en modos de texto a audio-vídeo e imagen a audio-vídeo, y un modelo de superresolución complementario eleva la salida a Full HD 1920×1080. La técnica es un CrossDiT de doble flujo que conecta un flujo de vídeo preentrenado con un flujo de audio entrenado desde cero mediante atención cruzada bidireccional, de modo que ambas modalidades se alinean en el tiempo y en la semántica en lugar de generarse por separado y multiplexarse. La receta de entrenamiento es continua: el flujo de audio se entrena desde cero con grandes corpus de audio, después ambos flujos se entrenan conjuntamente con datos emparejados de audio y vídeo preservando la fidelidad unimodal, seguido de un ajuste fino supervisado, un postentrenamiento con aprendizaje por refuerzo y la destilación.

Odyssey-3 es un transformador de difusión autorregresivo descrito por Odyssey como un modelo de difusión de vídeo de varios pasos ampliado mediante teacher forcing y enmascaramiento causal, entrenado para continuar a partir de observaciones previas y predecir estados futuros condicionados por entradas de acción, y luego destilado con coincidencia de distribuciones y destilación adversarial hasta obtener una variante de pocos pasos lo bastante rápida como para interactuar con ella. Funciona a 832×480, con Odyssey-3 Pro a 1280×720, no produce audio, y su propósito completo es que su salida dependa de lo que hiciste hace un momento.

El soporte desde el primer día es la diferencia que nadie mide

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Vuelve a leer el registro de actualizaciones de Kandinsky 6.0, porque es el dato más concreto en esta comparación. El 6 de octubre el proyecto registró disponibilidad en Diffusers, el registro de nodos de ComfyUI, vLLM-Omni, SGLang y FastVideo, y un Hugging Face Space para el modelo Pro destilado. Eso son cinco stacks de inferencia independientes en un solo día. Para cualquiera que haya esperado meses a que un checkpoint llegue a un framework de servicio, ese es el número que decide si el modelo es usable.

Ahora colócalo junto a la historia de acceso de Odyssey-3. La vista previa se ejecuta en experience.odyssey.systems con navegación en primera persona, navegación en tercera persona y movimiento de cámara independiente. El acceso a la API es un formulario de contacto. No hay página de precios, ni documentación de límites de velocidad, ni clave de autoservicio. Los términos de API del sitio se actualizaron por última vez el 2026-01-22 y aún rigen "el prototipo de la API de Odyssey-2": la superficie comercial no se ha reescrito para el modelo que se lanzó este mes.

• Dónde se ejecuta — tus propias GPU, con pesos y código bajo licencia MIT, solo frente a los servidores de Odyssey.

• Cómo lo integras — pipeline de Diffusers, nodos de ComfyUI, vLLM-Omni, SGLang, FastVideo, frente a una vista previa en el navegador y un formulario de contacto.

• Qué puedes inspeccionar — arquitectura, receta de entrenamiento y tamaños de checkpoint en un informe público, frente a una descripción del proveedor del pipeline de entrenamiento sin pesos ni artículo.

• Qué puedes modificar: ajustes finos, LoRAs, cuantización y destilación, todo lo cual la comunidad ya estaba publicando en Hugging Face el día posterior al lanzamiento, frente a nada en absoluto.

Dimensión a dimensión

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

Salida — clips de cinco segundos con audio sincronizado de 44 kHz para ambos niveles de Kandinsky, frente a un entorno interactivo sin audio para Odyssey-3.

• Resolución — Full HD 1920×1080 mediante el modelo de superresolución de complemento para Kandinsky 6.0 Video, frente a 832×480 de Odyssey-3 y 1280×720 de Odyssey-3 Pro.

• Modalidades de entrada: texto e imagen para Kandinsky, en los modos de texto a audio-vídeo e imagen a audio-vídeo; un prompt más entrada de control en vivo para Odyssey-3.

• Parámetros — 3B y 29B publicados para los niveles Lite y Pro, frente a no divulgados para ambos niveles de Odyssey-3.

• Hardware — una GPU NVIDIA y Python 3.13 o 3.14, con presets incluidos para tarjetas de clase H100/H200 hasta RTX 5090 para Kandinsky; un navegador para Odyssey-3.

• Precio — $0 por clip para Kandinsky 6.0 Video si tienes la GPU, frente a ningún precio publicado de ningún tipo para Odyssey-3. Las estimaciones de costo normalizadas del panel para Odyssey-3 y Odyssey-3 Pro son $0.139 y $0.267 por video generado, excluyendo el manejo de prompts.

• Puntuación de terceros — la generación propia de ninguno de los dos modelos se somete a una comparación directa independiente. El informe de Kandinsky se basa en una evaluación humana lado a lado frente a su predecesor; las cifras de Odyssey-3 provienen de un envío a un benchmark más una evaluación realizada por el proveedor.

• Licencia — MIT para Kandinsky 6.0 Video, frente a ninguna licencia publicada porque no hay pesos.

Lo que los benchmarks dicen y no dicen

Kandinsky 6.0 Video no aparece en Physics-IQ Verified, el tablero de Anates Labs y DeepMind que puntúa continuaciones de experimentos físicos reales en 41 modelos. Tampoco aparece aquí su rival directo de Odyssey-3, porque el tablero puntúa modelos que generan clips y ambos lo hacen. Lo que sí incluye el tablero es la línea anterior de modelos del mundo de Kandinsky, Kandinsky-WM 1.0, en el puesto 20 y −8,02 pp frente a la media de la pista — una familia distinta, un propósito distinto y la única entrada de Kandinsky en el tablero.

Las filas de Odyssey-3, para contrastar: puesto 8 con +2,15 pp en los prompts propios del benchmark y 0,129 $ por vídeo, y puesto 3 con +9,99 pp en prompts personalizados, con Odyssey-3 Pro segundo en general con +11,15 pp. Esas son mejores cifras que cualquier cosa que tenga la línea Kandinsky en esa prueba en particular, y además miden una capacidad distinta: Odyssey-3 se puntúa por lo que predice después de una perturbación, que es lo mismo que promociona su preview.

La propia evidencia de Kandinsky es la evaluación humana del informe técnico: Kandinsky 6.0 Video Pro supera claramente a su predecesor, Kandinsky 5.0 Video Pro, y se mantiene competitivo frente a los principales modelos de generación de audio y vídeo, en particular en calidad de voz. Se trata de una comparación lado a lado realizada por el proveedor, y es el tipo de afirmación que cualquiera con una 5090 y una tarde libre puede verificar contra un checkpoint publicado. La afirmación equivalente de Odyssey-3 no puede verificarla nadie sin una clave de API.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Alcanzarlos

OrcaRouter no aloja ninguno de los dos modelos, y nunca dará a entender lo contrario: Odyssey-3 no tiene ninguna tarifa publicada para que nadie pueda enrutarlo, y Kandinsky 6.0 Video es de pesos abiertos, lo que significa que la forma correcta de ejecutarlo es la propia configuración del repositorio en tu propia GPU, no un endpoint alojado.

El lugar donde encaja una clave de OrcaRouter es la capa que rodea el experimento. El repositorio de Kandinsky asume que tú proporcionas la GPU, el entorno y la comparación; lo que no proporciona es una forma de llamar a los modelos con los que quieres compararlo. Más de 200 modelos están detrás de una sola clave de OrcaRouter a precio de lista del proveedor con 0% de margen — incluido minimax/minimax-h3, el modelo de vídeo de pesos abiertos M​iniMax lanzado el 31 de julio de 2026, a $0.08 por segundo de salida 768P — así que un cambio de precio del proveedor llega a tu factura el mismo día, la conmutación por error automática evita que un barrido de evaluación muera por una mala hora de un proveedor ascendente, y el DSL de enrutamiento te permite poner un modelo de vídeo alojado y un modelo de visión detrás de una interfaz cuando el trabajo consiste en generar y luego puntuar. Aún clonas el repositorio y ejecutas la configuración tú mismo. Simplemente no tienes que construir la otra mitad del montaje.

¿Cuál quieres realmente?

Si necesitas resultados que puedas poseer —términos abiertos que puedes leer, pesos que puedes ajustar, un framework que se ejecuta sin que el de otra persona esté activo—, Kandinsky 6.0 Video es la respuesta, y el soporte de framework desde el primer día significa que no estás apostando por un artefacto de investigación. Si necesitas sonido en el video, es el único de los dos que lo genera.

Si el problema es la predicción más que la producción —una política que tiene que reaccionar, un entorno de entrenamiento, cualquier cosa en la que el siguiente estado dependa de la última acción—, Odyssey-3 es el de los dos que lo hace, y además es el que no se puede comprar. Esa es la forma honesta de este enfrentamiento en la semana en que ambos se lanzaron: un modelo abierto que puedes descargar y un modelo interactivo que solo puedes probar, con la evidencia de los benchmarks favoreciendo al cerrado y la evidencia práctica favoreciendo al abierto.