Una tarjeta de título generada para Odyssey-3 con el subtítulo «Un modelo del mundo que actúa, no solo renderiza» y seis tarjetas etiquetadas —Brazos robóticos, Humanoides, Conducción, Drones, Juegos, Entrenamiento—, cada una enlazada a un único nodo marcado como «un único backbone», con una nota al pie que dice «Vista previa el 2026-09-15; reportado por el proveedor, no evaluado de forma independiente».
Engineering & Research

Vista previa de Odyssey-3: el Modelo del Mundo de Odyssey pasa de observar el mundo a actuar en él

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Odyssey-3 es el modelo fundacional del mundo más reciente de Odyssey, presentado en primicia por la empresa el 15 de septiembre de 2026 y descrito en su propio anuncio como un modelo destinado a impulsar «robots, conducir coches, entrenar IA, pilotar drones e incluso jugar a videojuegos». Lo que hace que el avance merezca una lectura atenta no es la lista de cuerpos —es el mecanismo. Odyssey-3 es un transformer de difusión autorregresivo entrenado para simular diversos escenarios a partir de la observación visual, y la empresa le incorpora un decodificador de acción aprendido, un componente que traduce la representación interna que el modelo hace de una escena a los comandos motores que necesita un hardware concreto. Esa es la diferencia entre un modelo que genera un clip verosímil de un brazo robótico y un modelo al que se le pide que mueva uno. Odyssey denomina «agentes físicos» a la clase de sistemas que esto habilita —modelos que, en palabras de la empresa, «hablan el lenguaje del mundo». Si el planteamiento suena cercano a la etiqueta «agente de física» que circula en la cobertura del avance, es una lectura razonable de la misma afirmación, aunque no es la frase que usa Odyssey y, en esta etapa, es una descripción de intenciones más que un resultado medido.

Lo que Odyssey realmente anunció

El post es un avance, no un lanzamiento. Odyssey dice que está "emocionada de lanzarlo públicamente en las próximas semanas" y no menciona ninguna fecha, ningún precio y ningún canal de acceso. No hay ningún informe técnico de Odyssey-3 enlazado desde el anuncio: el único artículo al que apunta la página es PROWL-1, el trabajo de aprendizaje por refuerzo de la empresa, y el único PDF es el de Starchild-1. Esa ausencia merece decirse con claridad, porque condiciona todo lo que sigue: cada afirmación sobre capacidades en este artículo es de Odyssey, no ha sido reproducida, y no hay ningún tercero que haya publicado todavía una cifra sobre Odyssey-3 que Odyssey no haya proporcionado.

Lo que sí especifica la publicación es una arquitectura y una filosofía de entrenamiento. El modelo es un transformador de difusión autorregresivo. Se entrena con observación visual del mundo en lugar de con etiquetas específicas de tareas, lo que, según sostiene Odyssey, le da una comprensión aprendida de "física, dinámicas, causa y efecto, comportamientos humanos" y, según su propio relato, un requisito de datos menor que el de los sistemas que no fueron preentrenados de esta manera. La apuesta subyacente es la que está haciendo todo el campo de los modelos del mundo: que predecir el siguiente estado de una escena a escala obliga a un modelo a internalizar cómo se comportan realmente los objetos físicos, porque un modelo que se equivoca en la física deriva hacia la incoherencia a lo largo de un despliegue prolongado y no puede recuperarse.

A generated single-column scoreboard for Odyssey-3 listing: what it is, foundation world model; output, world state plus motor actions; embodiments, arms, humanoid, car, drone, games; price, not published; availability, preview in the coming weeks; independent benchmarks, none yet. The footer reads "All figures Odyssey-reported; no independent evaluation published."

Una columna vertebral, seis cuerpos

La evidencia más concreta en el anuncio es la difusión de encarnaciones impulsadas por el mismo modelo fundacional. Odyssey informa:

Brazos robóticos — aprendieron a controlar una variedad de brazos y a completar tareas complejas a partir de "solo decenas de horas de demostraciones de robots", incluidos comportamientos de recuperación que no aparecían en absoluto en las demostraciones, como reorientar una pinza después de un agarre fallido.

Humanoides — trabajo realizado con Flexion, con políticas construidas a partir de decenas de horas de datos de teleoperación de humanoides ejecutándose en tiempo real, que, según afirma Odyssey, se generalizaron a los cambios de iluminación mejor que las líneas base de visión-lenguaje-acción contra las que se probaron.

Driving — un backbone congelado que genera waypoints en tiempo real para la conducción en bucle cerrado, entrenado con «solo 20 horas de datos de conducción simulada».

Drones — vuelo en interiores con evasión de obstáculos a partir de decenas de horas de datos de vuelo simulados, además de rollouts cualitativos con el backbone congelado.

Videojuegos — sesiones prolongadas de Grand Theft Auto V, con transferencia a Red Dead Redemption 2 y Sleeping Dogs sin ningún entrenamiento adicional de la política en esos títulos.

Entornos de entrenamiento de IA — mundos generados que se utilizan como campos de entrenamiento para otros agentes, vinculados al trabajo de PROWL-1.

El patrón en esas filas es la verdadera afirmación: no que Odyssey-3 sea excelente en una sola de ellas, sino que un único conjunto de pesos, con un pequeño adaptador de salida aprendido, llega a todas ellas. Un modelo de propósito general de cómo se mueve el mundo es un activo muy diferente de una política por robot, y es la razón por la que la vista previa terminó donde terminó.

El único número, y lo que no demuestra

Odyssey publica exactamente una cifra comparativa para Odyssey-3: las políticas de conducción entrenadas puramente en simulación recorrieron, entre intervenciones del conductor de seguridad, alrededor del 77 % de la distancia que recorrieron las políticas entrenadas con metraje real, usando las mismas 20 horas de datos simulados. Esa es una cifra de simulación a realidad, y es genuinamente interesante — cerrar aunque sea parte de la brecha entre la conducción entrenada en simulación y la entrenada con datos reales es la parte difícil del problema. También es la única cifra en la publicación.

No hay tabla de precisión, ni tasa de éxito, ni benchmark entre distintos cuerpos, ni comparación con otro modelo del mundo con nombre en una evaluación compartida. La tarjeta del pie de página afirma que Odyssey-3 impulsa "el estado del arte en precisión física de los modelos del mundo", pero nada en la página lo respalda con una cifra. Odyssey también menciona una asociación de evaluación con Poke & Wiggle que abarca "diferentes cuerpos, puntos de vista y controles", y todavía no publica resultados de ella. Todo lo que hay aquí es una afirmación del proveedor, y la cifra del 77% debe leerse exactamente como eso hasta que un tercero independiente la vuelva a ejecutar.

Qué significa la tabla de referencia faltante

Sería fácil leer la ausencia de benchmarks como una señal de alarma. Es mejor leerla como el estado del campo. Los modelos del mundo todavía no tienen el equivalente de un MMLU o un GPQA: una evaluación compartida, barata y ampliamente confiable frente a la cual todos publiquen resultados. El propio planteamiento de Odyssey reconoce el problema de escala desde la dirección opuesta: la publicación dice que los modelos del mundo de frontera siguen estando «aproximadamente dos órdenes de magnitud por detrás de los modelos de lenguaje». Cuando el estándar de evaluación aún no está definido, una publicación de avance que abre con arquitectura y diversidad de encarnaciones en lugar de una tabla de resultados describe la frontera con honestidad, y el lector debería tomar las afirmaciones cualitativas como orientativas, no como concluyentes. La asociación Poke & Wiggle es lo que hay que seguir de cerca: una evaluación transversal a distintos cuerpos y puntos de vista, con cifras publicadas, sería la primera lectura independiente de todo esto.

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

"En las próximas semanas" es el verdadero titular

Para cualquiera que necesite tomar una decisión este trimestre, la frase decisiva del anuncio es la de disponibilidad. Odyssey-3 no está disponible de forma general, no tiene un precio publicado, no tiene documentación de API y no tiene una fecha indicada —solo «las próximas semanas». Eso lo sitúa en una categoría distinta de la de un modelo que se puede evaluar hoy. También significa que las páginas de comparación que inevitablemente se escribirán sobre él son, por ahora, comparaciones entre un producto ya lanzado y una vista previa de investigación, lo cual es una distinción real y no un tecnicismo: una vista previa puede ser excelente y aun así no ser algo que se pueda poner en un pipeline un lunes.

Hay una segunda razón por la que el momento importa. Odyssey recaudó una Serie B de $310M con una valoración de $1.45B, y AWS se convirtió en su proveedor de nube preferido: la empresa tiene la capacidad de cómputo para impulsar un modelo de mundo de frontera, y una vista previa que llega meses antes de un lanzamiento público es la forma en que ese trabajo se da a conocer. Lee el anuncio como una declaración de trayectoria, más que de capacidad.

Qué hacer con esto si lo construyes hoy

Odyssey-3 en sí no es algo a lo que puedas llamar, y OrcaRouter no lo sirve — ninguna capa de enrutamiento lo hace, porque todavía no hay nada a lo que enrutar. Lo que vale la pena hacer ahora es dividir la decisión en dos partes. La primera parte es el modelo del mundo, y para eso la respuesta honesta es esperar el lanzamiento público y la primera evaluación independiente. La segunda parte es todo lo que lo rodea: el modelo de lenguaje que convierte una tarea en algo que una política pueda consumir, el modelo de visión que lee una escena, el modelo de transcripción que etiqueta una demostración grabada. Ese stack circundante es trabajo de enrutamiento ordinario, y está disponible hoy en una única API con más de 200 modelos al precio de lista del proveedor y con 0% de margen, con conmutación automática por error cuando un proveedor se degrada. La razón para enrutar esa capa ahora en lugar de más adelante es que es la capa que seguirás ejecutando cuando se lance Odyssey-3, y cambiar un modelo de prompts es un cambio de configuración, mientras que reescribir una integración no lo es.

También vale la pena mantener abierta la cuestión del modelo del mundo de la forma más barata posible. Cuando un modelo como Odyssey-3 llega a un proveedor enrutado, aparece al precio de lista del proveedor ese mismo día, así que probarlo cuesta una llamada a la API en lugar de un contrato. Construir el pipeline circundante para que se pueda integrar un nuevo modelo es la preparación práctica para una frontera que todavía se mueve.

¿Qué cambiaría la lectura?

Tres cosas convertirían esta vista previa en un hecho firme. Un informe técnico publicado con los detalles de arquitectura y entrenamiento permitiría a grupos externos reproducir cualquier cosa. Un primer benchmark independiente —idealmente el trabajo cross-body de Poke & Wiggle— sustituiría la afirmación del proveedor por un número medido por alguien más. Y un lanzamiento público con fecha y precio haría que toda comparación con Odyssey-3 fuera una comparación entre dos cosas que un lector realmente puede ejecutar.

Hasta entonces, el resumen defendible es este: Odyssey-3 es una afirmación creíble sobre algo genuinamente difícil —un solo modelo del mundo, muchos cuerpos, control en lugar de renderizado— de un laboratorio bien financiado con una trayectoria en el sector, presentado con casi ningún dato numérico y sin fecha de disponibilidad. Así es como se ve una vista previa de frontera. Trata las afirmaciones de capacidades como direccionales, la arquitectura como la parte interesante y la fecha de lanzamiento como la única línea que cambia tus planes.

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.