
Odyssey-3: el nuevo modelo del mundo de Odyssey se lleva la corona de Physics-IQ y abre una vista previa pública
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Odyssey-3 Pro obtuvo una puntuación de 66.1 en la pista de vídeo a vídeo de Physics-IQ Verified, y Odyssey publicó esa cifra el 8 de octubre de 2026 junto a lo que de verdad le importa a un desarrollador: una vista previa pública de investigación de Odyssey-3, un transformer de difusión autorregresivo creado para generar un entorno a partir de un prompt y luego seguir prediciéndolo en tiempo real mientras alguien lo recorre, mueve una cámara o activa un evento. Odyssey-3 es el modelo; Odyssey-3 Pro es el nivel 720p de este, y funciona a 1280×720 frente a los 832×480 del modelo base. Ambos se publican el mismo día, en una vista previa que puedes probar tú mismo en experience.odyssey.systems, con una vía de contacto aparte para el acceso a la API.
Esa combinación es lo que hace que esto sea más que una publicación sobre un benchmark. Los modelos de mundo interactivos han sido software de demostración durante dos años; los que generan unos pocos fotogramas de movimiento verosímil en una trayectoria fija no son el mismo artefacto que un modelo que mantiene sus predicciones coherentes después de que agitás los controles. Odyssey afirma lo segundo, y está dejando que cualquiera ponga a prueba esa afirmación.
Qué se lanzó, exactamente
Dos checkpoints, una arquitectura, sin pesos.
• Odyssey-3 — el nivel de 480p, salida de 832×480, 16 fps en el arnés de referencia, con un precio listado de $0.139 por vídeo generado en la columna de coste normalizado de la tabla de clasificación.
• Odyssey-3 Pro — el nivel de 720p, 1280×720, a un precio de $0.267 por video con la misma base.
• Acceso — una vista previa de investigación en el navegador con navegación en primera persona, navegación en tercera persona y movimiento de cámara independiente. El acceso a la API es mediante un formulario de contacto, no una clave de autoservicio.
• Apertura: ninguna. No se publican pesos, ni licencia, ni precio por token. La página de términos de la API en el mismo sitio se actualizó por última vez el 22/01/2026 y sigue rigiendo "el prototipo de Odyssey-2 API", lo que da una idea de lo reciente que es esta superficie comercial.
La arquitectura se describe en el propio texto de Odyssey como un transformer de difusión de video de varios pasos extendido de forma autorregresiva mediante teacher forcing y enmascaramiento causal, con un pipeline de postentrenamiento que combina coincidencia de distribuciones y destilación adversaria en una variante destilada de pocos pasos — la parte que hace posible la interacción en tiempo real. La difusión te da fidelidad; la autorregresión te da un modelo que sobrevive a una secuencia de acciones; la destilación te da la velocidad de reloj. Las tres son fundamentales, y las tres son el relato del proveedor sobre su propio sistema, no uno independiente.
El benchmark, leído tal como lo lee realmente el consejo.
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
Physics-IQ Verified lo gestionan Anates Labs junto con DeepMind, y es un benchmark genuinamente incómodo de manipular: muestra a los modelos vídeo de experimentos físicos reales —dinámica de fluidos, óptica, mecánica de sólidos, magnetismo, termodinámica— y puntúa la continuación con lo que ocurrió realmente. Actualmente clasifica 41 modelos de 16 laboratorios. El 66.1 de Odyssey-3 Pro es la puntuación bruta más alta en la pista de vídeo a vídeo que reporta Odyssey, y la columna de mejora neta del mismo tablero, que mide la ganancia sobre la media de la pista en puntos porcentuales, cuenta una historia sutilmente distinta:
• Mejora neta con respecto a la media del track — FLUX 3 [large] lidera con +12,27 pp; Odyssey-3 Pro es segundo con +11,15 pp; Odyssey-3 es tercero con +9,99 pp.
• Coste por vídeo generado — Odyssey-3 Pro $0.267, Odyssey-3 $0.139, frente a FLUX 3 [large] con $0.868 y Seedance 2.5 con $2.838. (Los costes están normalizados a 24 fps y a una salida de 1280 de ancho siempre que la tabla de clasificación puede hacerlo, por lo que son comparables entre modelos que no comparten la misma tasa de fotogramas).
• Liderazgo en submétricas — Odyssey-3 se lleva el primer puesto en la submétrica espaciotemporal con 44,97, por delante de Odyssey-3 Pro con 42,97; FLUX 3 [large] se lleva la espacial con 64,36 y la espacial ponderada con 53,25, con las dos entradas de Odyssey en segunda y cuarta posición en la espacial.
Así que la lectura honesta no es «Odyssey-3 es el mejor modelo de video del mundo». Es: un modelo del mundo construido para la interacción se ha situado cerca de lo más alto de una tabla de plausibilidad física que antes era propiedad de los generadores cinematográficos, y lo hizo con aproximadamente un tercio del costo normalizado de FLUX 3. La afirmación separada de Odyssey —54.7 para Odyssey-3 Pro en la categoría de imagen a video, mejor de 8— está en la misma tabla, y se aplica la misma salvedad: son configuraciones autopresentadas, y la tabla de clasificación mezcla entradas enviadas con prompts personalizados y entradas ejecutadas con los prompts propios del benchmark. Odyssey aparece en ambas columnas, lo cual es inusualmente transparente y también significa que sus dos filas no están midiendo lo mismo.

Por qué "modelo del mundo" no es sinónimo de "modelo de vídeo"
La distinción es todo el argumento del producto, así que vale la pena enunciarla con claridad. Un generador de clips toma un prompt y devuelve un objeto fijo; la salida es la misma para todos los que lo piden. Odyssey-3 toma un prompt y devuelve un sistema en el que actúas — los modos de cámara en primera y tercera persona de la vista previa y su capacidad de aceptar un evento en mitad de la generación son el mecanismo mediante el cual predice lo que sucede a continuación dado lo que acabas de hacer, no dado lo que decía el prompt.
Esa propiedad es lo que hace que los resultados de sistemas físicos en el material de lanzamiento de Odyssey tengan el aspecto que tienen. La compañía informa que un decodificador de acciones conectado al modelo del mundo congelado, entrenado con decenas de horas de demostraciones de robots, produjo comportamientos de recuperación que nunca estuvieron en las demostraciones —reorientar una pinza tras un agarre fallido, recuperar un objeto que se dejó caer en una orientación inusual. Informa que una política humanoide construida por Flexion sobre Odyssey-3 con decenas de horas de datos de teleoperación siguió ejecutándose bajo cambios de iluminación que hicieron fallar las líneas base VLA con las que fue comparada. Informa que una política de conducción entrenada con 20 horas de datos simulados condujo en bucle cerrado en carreteras reales, recorriendo, entre intervenciones del conductor de seguridad, alrededor del 77% de la distancia que recorría una política entrenada con metraje real. Informa que la navegación de drones a partir de datos de vuelo simulados y la jugabilidad en GTA V transfirieron el movimiento a Red Dead Redemption 2 y la conducción de motocicletas a Sleeping Dogs sin entrenamiento adicional.
Cada uno de esos es un resultado reportado por el proveedor, sin replicación independiente, y dos de ellos están explícitamente enmarcados por Odyssey como observaciones cualitativas más que como mediciones. Pero son el tipo correcto de evidencia para la afirmación: lo interesante no es que el modelo pueda hacer una tarea para la que fue entrenado. Es que un backbone congelado más un pequeño adaptador logra un comportamiento significativo a partir de unas pocas decenas de horas de datos, y ocasionalmente generaliza más allá de ellos.
¿Qué sigue sin demostrarse?

Tres cosas, y no son pequeñas.
Primero, ningún evaluador independiente ha ejecutado Odyssey-3. La entrada de Physics-IQ es una presentación, y la segunda fuente de puntuación en el propio informe de Odyssey —WorldMark, en la que Odyssey-3 ocupa el primer puesto en tres de cuatro divisiones— es una evaluación del proveedor que utiliza las leyendas propias del benchmark y, en palabras de Odyssey, «la media de sus 13 puntuaciones métricas reportadas». Eso es la empresa puntuándose a sí misma con el conjunto de datos de otro. Es más de lo que ofrecen la mayoría de los lanzamientos. No es un tercero.
En segundo lugar, la única categoría que Odyssey-3 no gana en esa evaluación es la más cercana a la afirmación de marketing. En entornos reales en primera persona, ocupa el tercer puesto con 80.6, por detrás de Lyra 2.0 con 84.4 y AlayaWorld con 83.0. La ventaja del modelo en la misma evaluación se concentra en entornos estilizados y en tercera persona: 77.2 en entornos estilizados en primera persona, 79.0 en entornos reales en tercera persona y 76.3 en entornos estilizados en tercera persona. Si estás construyendo para una encarnación fotorrealista en primera persona, la clasificación que deberías tener en cuenta es aquella en la que Odyssey-3 no está en primer lugar.
Tercero, la disponibilidad. "Research preview" está haciendo un trabajo real en esa frase. No hay página de precios, ni documentación sobre límites de velocidad, ni clave de autoservicio. Si quieres esto en un producto, estás en una cola.
Comparándolo sin un segundo contrato
Este es el problema práctico con un lanzamiento como este: Odyssey-3 es lo más interesante en generación de video esta semana, y aún no puedes invocarlo. Los modelos con los que realmente lo compararías son otra historia.
OrcaRouter no aloja Odyssey-3, y no hay un precio publicado que podamos trasladar aunque lo hiciéramos. Lo que una clave sí alcanza es el resto del conjunto de comparación — minimax/minimax-h3 a $0.08 por segundo de vídeo generado en 768P, la línea de vídeo Kling, y más de 200 modelos detrás de un único endpoint — al precio de lista del proveedor con un 0 % de margen, así que un cambio de precio de un proveedor se refleja en tu factura el mismo día en lugar de en la próxima renovación. La conmutación automática por error entre proveedores significa que una ronda de evaluación no fracasa porque un upstream esté teniendo una tarde difícil, y el DSL de enrutamiento te permite poner varios modelos detrás de una interfaz, de modo que una comparación directa sea un cambio de configuración en lugar de una segunda integración. Si Odyssey abre una API de autoservicio, esa es la forma en la que querrás encajarlo.
¿Qué lo resolvería?
Una ejecución independiente de Odyssey-3 en un arnés que no eligió. Una docena de profesionales con acceso anticipado describiendo dónde el entorno se sostiene tras un minuto de movimiento agresivo de cámara y dónde no. Un precio. Cualquiera de esas cosas convierte esto de un lanzamiento sólido en un punto de referencia.
Lo que ya es cierto es más limitado y aun así notable: en el único tablero público que mide si un modelo generativo entiende la física en lugar de si fotografía bien, un modelo cuyo propósito es la interacción ocupa el segundo y el tercer puesto, con un coste normalizado inferior al del modelo que está primero.
