
Odyssey-3 vs Luma Ray 3.2: ¿Un mundo al que entrar o un archivo que calibrar?
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Luma Ray 3.2 hace algo que casi nada más en la generación de video hace: te entrega fotogramas HDR de 10, 12 y 16 bits en el estándar EXR ACES2065-1, que es el formato que un colorista realmente quiere y la razón por la que el modelo existe en su forma actual. Odyssey-3 hace algo que ningún modelo de video hace en absoluto: toma una acción como entrada y predice lo que hará el mundo a continuación, y luego convierte esa predicción en comandos motores para un brazo robótico, un humanoide, un coche o un dron. Luma Ray 3.2, lanzado por Luma AI el 9 de junio de 2026, es una herramienta de generación cercana a la finalización con una API para desarrolladores. Odyssey-3, presentado en avance por Odyssey el 15 de septiembre de 2026, es un modelo fundacional del mundo no lanzado, sin precio ni fecha. Compararlos es menos una prueba comparativa que una forma de preguntar cuál de dos salidas muy diferentes le falta en realidad a tu pipeline: un fotograma etalonado o un mundo que responde al control.
Ray 3.2 está construido en torno al entregable
El lanzamiento de Ray 3.2 es notable menos por su calidad de generación que por dónde se detiene. Genera en 540p, 720p y 1080p, en clips de 5 o 10 segundos, en seis relaciones de aspecto que cubren vertical, cuadrado y panorámico, y acepta texto, un fotograma inicial, un fotograma final o un video existente para su modificación. La ruta HDR es el diferenciador, y viene con restricciones reales que vale la pena enunciar con precisión: la salida HDR de 10, 12 y 16 bits en ACES2065-1 EXR solo está disponible en 720p y 1080p, y solo para clips de 5 segundos. La exportación EXR debe solicitarse habilitando HDR. La salida estándar es MP4. El bucle sin interrupciones se aplica a clips de 5 segundos. Hasta 16 fotogramas clave por clip brindan un control a nivel de toma que se acerca más a la animación que al prompting, y el seguimiento del rendimiento facial cubre hasta ocho rostros.
Dos hechos más moldean la decisión de compra. Ray 3.2 es el primer modelo de la familia Ray con una API de desarrollador completa —los modelos Ray anteriores eran solo por suscripción—, dividida en un nivel Build de pago por uso y un nivel Scale de rendimiento reservado con un SLA. Y no genera audio sincronizado para trabajos de texto a video o de imagen a video; el audio solo se conserva en las rutas de modificación y reencuadre. Luma ha realizado su propia evaluación en la que afirma estar a la par de Veo 3 de Google y por delante de varios competidores, pero se trata de comparaciones realizadas por el proveedor y sin puntuaciones numéricas publicadas, por lo que deben interpretarse como posicionamiento, no como medición.

El Odyssey-3 está construido en torno al controlador
El centro de diseño de Odyssey-3 es el extremo opuesto del pipeline. Es un transformer de difusión autorregresivo entrenado con observación visual del mundo, y su componente distintivo es un decodificador de acciones aprendido —en palabras de Odyssey, "un componente de salida aprendido unido al modelo del mundo"— que traduce la representación interna del modelo en las acciones que requiere una pieza de hardware determinada. Odyssey informa que el mismo backbone controla brazos robóticos a partir de decenas de horas de demostraciones, impulsa políticas humanoides construidas con Flexion en tiempo real, produce puntos de ruta de conducción en bucle cerrado a partir de un backbone congelado entrenado con 20 horas de datos simulados, vuela drones en interiores alrededor de obstáculos y juega a Grand Theft Auto V con transferencia a Red Dead Redemption 2 y Sleeping Dogs sin entrenamiento adicional de políticas en esos juegos.
La única cifra comparativa que Odyssey publicó es que las políticas de conducción entrenadas en simulación recorrieron entre intervenciones del conductor de seguridad alrededor del 77% de la distancia que las políticas entrenadas con grabaciones reales. No hay tabla de referencia, ni informe técnico de Odyssey-3, ni evaluación independiente, ni fecha de disponibilidad más allá de "las próximas semanas". Es una vista previa, y su precio es cero porque no se puede comprar.
El contraste, dimensión por dimensión
• Lo que se obtiene — Luma Ray 3.2: MP4, además de EXR ACES2065-1 de 10/12/16 bits cuando HDR está activado. Odyssey-3: un estado de mundo simulado más acciones motoras.
• Techo de formato — Luma Ray 3.2: ACES2065-1 EXR a 720p y 1080p, solo clips de 5 s. Odyssey-3: no es un formato de archivo; la salida es un despliegue.
• Resolución y duración — Luma Ray 3.2: hasta 1080p, 5 s o 10 s (10 s solo de texto a vídeo). Odyssey-3: continuo, a la velocidad que necesite el despliegue.
• Audio — Luma Ray 3.2: ninguno para T2V/I2V; se conserva en modificar y reencuadrar. Odyssey-3: ninguno; no es un generador de medios.
• Precio — Luma Ray 3.2: por video según resolución, rango dinámico y duración, con la exportación en HDR y EXR multiplicando el costo del clip; los listados de terceros sitúan un clip de 5 s en 720p cerca de $0.30 y uno en 1080p cerca de $1.20. Odyssey-3: sin publicar.
• Disponibilidad — Luma Ray 3.2: lanzado el 2026-06-09, niveles de API Build y Scale. Odyssey-3: vista previa, "en las próximas semanas".
Entregable versus entorno
La razón por la que este emparejamiento es instructivo en lugar de arbitrario es que los dos modelos terminan en lugares diferentes. Ray 3.2 termina en un archivo que va a un colorista, un compositor o una casa de finalización — la ruta EXR existe precisamente para que la imagen generada pueda sobrevivir a ser graduada, compuesta y vuelta a graduar sin desmoronarse. Esa es una decisión de flujo de trabajo, y es por eso que Ray 3.2 compite más directamente con las herramientas de postproducción que con otros generadores.
Odyssey-3 no termina en absoluto en el sentido de archivo. Su salida es un estado simulado que sigue ejecutándose, y su consumidor es un programa. La prueba de si funcionó no es si los fotogramas se ven correctos, sino si una política entrenada dentro de él se transfiere al hardware. Esos son criterios de éxito distintos, medidos por personas distintas, y ninguna cantidad de resolución en ninguno de los dos lados los vuelve comparables.
Donde podrían tocarse es en el camino de previsualización a finalización. Un modelo del mundo es la herramienta natural para explorar un espacio de forma interactiva —cambiar un movimiento de cámara, rebloquear una escena, ver la consecuencia de inmediato—, que es exactamente lo que un clip generado fijo no puede hacer. Un modelo como Ray 3.2 es la herramienta natural para convertir el resultado elegido en algo entregable en HDR. Hoy ese camino tiene un agujero en el medio, porque Odyssey-3 no está disponible y no produce ningún formato de archivo que consuma un pipeline de finalización.
Sorteando a ambos
Ni Luma Ray 3.2 ni Odyssey-3 se sirven a través de OrcaRouter, y este artículo no afirma que ninguno de los dos lo haga. Lo que vale la pena señalar es qué gran parte de una canalización como esta no es ninguno de los dos modelos. El modelo de prompts que redacta la descripción de una toma, el modelo de visión que verifica un fotograma contra el brief, el modelo de transcripción que recupera el diálogo de una pista de referencia — esos se ejecutan constantemente, a una fracción del costo por clip del modelo de video, y son las partes que fallan a horas inconvenientes. Ejecutarlos en una sola API que abarca más de 200 modelos al precio de lista del proveedor con 0 % de margen mantiene esa capa con una sola clave y una sola factura, y la conmutación por error automática significa que un endpoint de prompts degradado se redirige en lugar de bloquear la cola detrás de él. Cuando un proveedor reduce el precio de un modelo de video, la transferencia directa significa que esa reducción está activa aquí el mismo día — pero para los modelos que realmente servimos, lo que hoy no incluye a ninguno de estos dos.

Por qué vale la pena esperar cada uno
Ray 3.2 ya está disponible, y la razón para elegirlo es concreta: si tu entregable pasa por un pipeline de color, la ruta ACES2065-1 EXR es una capacidad que la mayoría de los generadores simplemente no ofrece, y las restricciones de resolución y duración —techo de 1080p, clips de 5 segundos para HDR, sin audio nativo— son el precio de entrada. Si necesitas sonido sincronizado, este es el modelo equivocado y deberías buscar uno que lo genere.
Odyssey-3 vale la pena seguir por una razón, y no es ninguna de las dimensiones de Ray 3.2. Si un único conjunto de pesos realmente impulsa brazos, humanoides, un coche, un dron y tres juegos a partir de decenas de horas de datos cada uno, eso es una afirmación sobre la generalidad que ningún renderizador hace, y es la afirmación con más potencial en el campo actual. El problema es que la evidencia de ello, hoy, es el propio reel de demostración de Odyssey y una única cifra de sim-to-real. Lo que cambiaría la lectura no es una mejor demo — es un precio, una fecha y un número medido por alguien que no trabaja allí.

