
Odyssey-3 vs Runway Gen-4.5: dos apuestas por las mismas dos palabras
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Lo interesante de poner frente a frenteOdyssey-3 y Runway Gen-4.5 es que las dos empresas coinciden en el destino y discrepan sobre el camino. Ambas afirman que el objetivo es un modelo del mundo general —un sistema aprendido que simula la realidad con la suficiente fidelidad como para resultar útil. La postura de Runway, expuesta sin rodeos por su CTO, es que se llega hasta ahí construyendo primero un modelo de vídeo muy bueno, porque enseñar a una red a predecir píxeles directamente es la vía más prometedora hacia la simulación general. La postura de Odyssey, visible en cada decisión arquitectónica que ha publicado sobre Odyssey-3, es que los píxeles son el subproducto y la dinámica es lo esencial. Gen-4.5 es la expresión actual más sólida de la primera apuesta. Odyssey-3, anunciado el 15 de septiembre de 2026 y prometido para su lanzamiento público «en las próximas semanas», es la segunda apuesta formulada como modelo completo. Leídos en paralelo, en realidad no son competidores: son dos respuestas a la misma pregunta, y la pregunta es si el camino hacia un modelo del mundo pasa por el renderizado.
La apuesta de Runway: ganarse el modelo del mundo mediante el renderizado
Runway no llegó tarde ni por accidente al planteamiento del modelo del mundo. Entrega un modelo que etiqueta como modelo del mundo general —GWM-1, descrito como construido para la simulación de la realidad en tiempo real, interactivo y controlable—, y lo trata como la capa situada por encima de sus modelos de vídeo, no como un reemplazo de estos. El argumento es una escalera: la misma señal de entrenamiento que hace que un modelo sea bueno manteniendo una escena cohesionada a lo largo de diez segundos es la señal que le enseña cómo persisten los objetos, cómo se comporta la luz, cómo continúa el movimiento. Basta con ser lo suficientemente bueno con los píxeles y la simulación general sale sola.
Gen-4.5 es el escalón actual. Anunciado el 1 de diciembre de 2025 y desplegado para los suscriptores de pago a partir del 12 de diciembre, es un modelo de texto a video y de imagen a video con las cualidades sobre las que Runway ha construido su reputación: calidad de movimiento, adherencia al prompt, consistencia de personajes y sujetos, y control de cámara. Sus límites se declaran con la misma claridad que sus fortalezas. Los clips duran de dos a diez segundos —diez es el techo, no el valor predeterminado—. La salida es de 720p a 24 o 25 fotogramas por segundo en seis relaciones de aspecto. No hay pista de audio ni storyboard de múltiples planos; una secuencia es algo que se ensambla a partir de generaciones separadas. Es un renderizador, y uno muy bueno, que es exactamente lo que su empresa matriz necesita que sea.
Cuánto cuesta Gen-4.5 y cómo se estructura el precio
Runway cotiza Gen-4.5 a 12 créditos por segundo de video generado. Los créditos se venden a un centavo cada uno, así que la cifra de trabajo es de $0.12 por segundo: un clip de cinco segundos cuesta $0.60 y uno de diez segundos, $1.20. Las opciones de salida conllevan recargos en la API: las secuencias ProRes o PNG añaden cinco créditos por segundo, y HDR añade veinte por segundo, y asciende a cuarenta por encima de aproximadamente cuatro megapíxeles. Esas son cifras de lista del proveedor, y la diferencia importa más que el titular: un clip HDR de diez segundos cuesta más del triple que uno normal, así que un modelo de costos basado en $0.12/segundo es incorrecto en el momento en que HDR entra en la especificación de entrega.
Vale la pena conocer dos detalles estructurales antes de presupuestar. Los créditos de API y los créditos de suscripción a la aplicación son saldos separados —un plan Standard, Pro o Max no paga las generaciones de API—, y la API es asíncrona, por lo que una tarea se envía y se consulta periódicamente en lugar de devolverse de forma inmediata. Ninguno de los dos es una crítica; ambos son cosas que los equipos descubren después de haberse comprometido con una integración. La API también sirve modelos de vídeo de terceros junto con los propios de Runway, lo que significa que una clave de Runway puede llegar más allá del catálogo de Runway si así lo deseas.

La apuesta de Odyssey: lo importante no es la imagen
Odyssey-3 es descrito por su creador como un modelo fundacional del mundo que puede impulsar robots, conducir coches, entrenar IAs, pilotar drones y jugar videojuegos. Arquitectónicamente, es un transformador de difusión autorregresivo entrenado con una gran colección de observaciones visuales, y Odyssey afirma que el resultado conlleva una comprensión aprendida de la física, la dinámica, la causa y efecto y el comportamiento humano. El detalle que revela la apuesta es cómo se adaptan las tareas: en lugar de ajustar el modelo, Odyssey adjunta un decodificador de acciones entrenado con pares observación-acción y mantiene congelado el modelo del mundo preentrenado durante todo el proceso. Una pequeña política lee la representación interna del modelo congelado y la convierte en comandos motores.
Ese diseño solo tiene sentido si crees que la representación —no el fotograma renderizado— es el activo. Las demostraciones lo respaldan en seis encarnaciones, todas reportadas por el proveedor. Brazos robóticos a partir de decenas de horas de demostraciones, incluidos comportamientos de recuperación que nadie incluyó en los datos, como reorientar una pinza tras un agarre fallido. Políticas humanoides construidas con Flexion a partir de decenas de horas de datos de teleoperación, que Odyssey afirma que generalizan mejor que las líneas base de VLA que probó, sin publicar cifras. Conducción en bucle cerrado en India a partir de veinte horas de datos simulados. Vuelo de drones en interiores a partir de datos simulados. Políticas de Grand Theft Auto V que se transfirieron a Red Dead Redemption 2 y Sleeping Dogs sin entrenamiento adicional en esos títulos —unas dos horas de metraje de GTA fueron suficientes para el movimiento a caballo en RDR2. Y generación de entornos para entrenar otras IA, vinculada al trabajo de aprendizaje por refuerzo PROWL de Odyssey.
Se publica un número. Odyssey informa de que las políticas de conducción entrenadas en simulación recorrieron, entre intervenciones del conductor de seguridad, aproximadamente el 77 % de la distancia que recorrieron las políticas entrenadas con metraje real. Ninguna de las afirmaciones del párrafo anterior ha sido reproducida, no hay informe técnico y ningún tercero ha ejecutado el modelo. La amplitud a través de seis encarnaciones es la afirmación interesante; la ausencia de una tabla de referencia es la razón para tomarla con reservas.

Donde las dos apuestas se vuelven comprobables
Un desacuerdo sobre estrategia solo es útil si produce una predicción, y este lo hace. Si Runway tiene razón —si la fidelidad de renderizado es el camino—, entonces la calidad de la física de un modelo de video debería mejorar en función de lo bueno que sea en video, y las dos tablas de clasificación deberían moverse juntas. Si Odyssey tiene razón, debería haber casos en los que un modelo que renderiza de forma hermosa sea inútil y un modelo que renderiza de forma tosca sea útil, porque la propiedad útil es si el siguiente estado es lo suficientemente predecible como para que un controlador actúe sobre él.
Ya hay un indicio de hacia dónde se inclina esto, y no favorece a ninguna de las dos partes. La propia lista que hace Runway de las debilidades de Gen-4.5 —la física entre ellas— es un recordatorio de que un renderizador está optimizado para resultar convincente ante un espectador, y un espectador es indulgente de maneras en que un bucle de control no lo es. Mientras tanto, el único número publicado por Odyssey, 77 % del rendimiento de conducción con metraje real, representa una pérdida frente a los datos reales, no una victoria. Ninguna de las dos empresas afirma que el camino esté terminado. Lo que es diferente es lo que cada una mide.
El punto en el que las apuestas realmente divergen es la encarnación. Nada en el diseño o los precios de Gen-4.5 contempla un espacio de acción; es una función de texto o una imagen a un clip. Nada en el material de Odyssey-3 contempla un archivo entregable; es una función de un estado del mundo y una acción al siguiente estado del mundo. Son productos diferentes con compradores diferentes, y ningún avance en cualquiera de los dos lados convierte a uno en el otro, porque la interfaz es lo que difiere.
Lado a lado
• Qué es — Runway Gen-4.5: un renderizador de texto a vídeo e imagen a vídeo. Odyssey-3: un modelo del mundo que predice estados siguientes y emite acciones motoras.
• Cómo lo controlas — Runway Gen-4.5: un prompt o una imagen fija, mediante una API asíncrona. Odyssey-3: un decodificador de acciones más una pequeña política que lee un backbone congelado.
• Salida — Runway Gen-4.5: clips de 2–10 s, 720p, 24/25 fps, seis relaciones de aspecto, sin audio. Odyssey-3: sin entregable renderizado; estados simulados en seis encarnaciones.
• Precio — Runway Gen-4.5: 12 créditos por segundo, $0.12/segundo, más 5 créditos/segundo por ProRes o PNG y 20 por HDR (lista del proveedor). Odyssey-3: sin publicar, sin condiciones comerciales anunciadas.
• Madurez — Runway Gen-4.5: en el mercado desde diciembre de 2025, con una API consolidada y cobertura de terceros. Odyssey-3: anunciado el 15 de septiembre de 2026, con lanzamiento público «en las próximas semanas».
• Evidencia — Runway Gen-4.5: ocho meses de producción pública. Odyssey-3: una cifra del proveedor, sin ejecuciones independientes.
Ninguno de estos está en nuestra clave, y esa es la versión honesta.
OrcaRouter no enruta ninguno de los dos modelos, y este artículo no va a pretender lo contrario: Runway Gen-4.5 se sirve a través de la propia API de Runway, y Odyssey-3 no tiene ningún endpoint. Para lo que el enfoque de enrutamiento sí resulta útil en una comparación como esta es para el pipeline que los rodea. Un flujo de trabajo realista con Gen-4.5 no es un solo modelo: es un modelo de prompts que expande un brief, un modelo de imágenes que genera el primer fotograma, el propio modelo de vídeo y algo posterior que puntúe o etiquete la salida. Componer todo eso en una sola llamada a través del DSL de enrutamiento, con una sola clave, al precio de lista del proveedor con un 0 % de recargo, es la parte del stack que OrcaRouter sí puede quitarte de encima hoy. El failover automático importa aquí por una razón mundana: las API de vídeo asíncronas hacen polling, las colas se acumulan, y un pipeline que se atasca en un endpoint degradado se atasca hasta llegar al entregable.
Cuando Odyssey-3 llegue a lanzarse, la cuestión del enrutamiento será distinta y más difícil. Un modelo cuyo argumento de venta es que se ejecuta sobre hardware que posees no es, ni mucho menos, un candidato obvio para el enrutamiento, y la pregunta interesante para un enrutador será qué lo rodea —las herramientas de sim-to-real, el entrenamiento de políticas, la evaluación— en lugar de la propia llamada al modelo.
¿Quién tiene razón es una pregunta para 2027?
Si necesita video este trimestre, Gen-4.5 es la respuesta y no hay nada que sopesar: tiene un precio, está documentado y lleva ocho meses de uso público, y a $0.12 por segundo, el costo de averiguar si se adapta a su trabajo es bajo. Presupueste los recargos y el saldo de crédito de API independiente, y trate el límite de diez segundos como una restricción de diseño estricta en lugar de un número que va a sortear.
Si estás construyendo un controlador —cualquier cosa en la que un modelo entrenado tenga que decirle al hardware qué hacer a continuación—, Gen-4.5 no entra en consideración a ningún precio, y Odyssey-3 es el que apunta a tu problema y no hay forma de conseguirlo. La razón concreta para que te importe es el resultado del backbone congelado: si un único modelo preentrenado puede controlar brazos, humanoides, un coche, un dron y tres juegos mediante un decodificador pequeño, eso es una afirmación sobre cuánta comprensión física se transfiere, y es la afirmación que haría que los modelos del mundo fueran una capa fundacional en lugar de una política por tarea. La razón concreta para esperar es que nadie fuera de Odyssey lo ha ejecutado.
Qué hay que observar, en orden: un informe técnico, luego una licencia, luego un tercero que reproduzca la cifra del 77 % en su propio hardware. La ruta de Runway y la ruta de Odyssey desembocan ambas en un modelo general del mundo. Solo una de ellas tiene actualmente una caseta de peaje a la que puedas acercarte.

Enruta el modelo de prompts, el modelo de imágenes y el modelo de video a través de un único endpoint con failover automático en lugar de tres integraciones.
