Tarjeta de título para un artículo que compara Odyssey-3 y MiniMax H3, con el subtítulo “La diferencia es una descarga”, y tres chips de estadísticas que dicen “Pesos abiertos desde el 3 de agosto de 2026”, “Licencia comunitaria, 768p” y “Odyssey-3: sin precio publicado”.
Guides & Insights

Odyssey-3 vs MiniMax H3: La diferencia es una descarga

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 3 de agosto de 2026, los pesos de un modelo de vídeo 2K aparecieron en Hugging Face bajo un nombre que cualquiera puede descargar y ejecutar: MiniMax H3. Seis semanas después, el 15 de septiembre, Odyssey publicó una página de investigación sobre Odyssey-3 —un modelo fundacional del mundo que maneja brazos robóticos, un coche, un dron y tres videojuegos— y puso una sola frase donde iría el enlace de descarga: se publicará «en las próximas semanas». Esas dos frases son toda la comparación. Uno de estos modelos puede estar en tu clúster esta misma noche, en tu propio hardware, bajo una licencia que puedes leer. El otro no puede ser comprado, alquilado ni descargado por nadie fuera de su laboratorio, y la empresa no ha dicho cuándo cambiará eso. Esa asimetría no es una nota al pie del enfrentamiento. Es el enfrentamiento.

Qué te ofrece realmente MiniMax H3

H3 se anunció el 31 de julio de 2026 y se publicó como código abierto el 3 de agosto. Es un modelo general en lugar de un generador de vídeo de una sola tarea: lee texto, imágenes, vídeo y audio como contexto, y genera vídeo de hasta 15 segundos a hasta 2K con audio estéreo nativo a 32 kHz y 24 fotogramas por segundo. Se admiten seis relaciones de aspecto (de 21:9 a 9:16), y el diálogo se admite de forma estable en once idiomas. Hay dos variantes publicadas de la base abierta: H3-Base-FL2VA para texto a vídeo y generación con primer fotograma, último fotograma o primer y último fotograma, y H3-Base-Ref2VA, que acepta hasta nueve imágenes, tres clips de vídeo y tres clips de audio, con un límite de doce archivos de entrada.

La parte que importa para esta comparación es dónde se detiene la mitad abierta. El sistema H3 completo es un pipeline de tres etapas: H3-Context-IR preprocesa y orquesta el contexto, H3-Base genera a 768p, y H3-Regenerate-2K eleva el resultado a 2K. Solo los pesos de H3-Base son públicos, y se distribuyen bajo la MiniMax H3 Community License en lugar de Apache o MIT —una licencia con condiciones asociadas, que vale la pena leer antes de que termine en un pipeline comercial. La etapa Context-IR y el módulo de regeneración a 2K se ejecutan del lado de MiniMax. Así que «open weights» aquí te da la parte intermedia del pipeline. Un equipo que descarga H3-Base y lo aloja por su cuenta obtiene generación de video a 768p y ninguna vía hacia 2K sin contactar al proveedor.

Two-column scoreboard for Odyssey-3 and MiniMax H3 across six shared dimensions — what it produces, what you can download, price, availability, third-party runs and evidence. MiniMax H3 reads H3-Base weights under a community licence, $0.08/s at 768p and $0.13/s at 2K, open since 3 Aug 2026; Odyssey-3 reads nothing yet, not published, announced 15 Sep 2026 with no date.

Lo que Odyssey-3 te ofrece en su lugar

Lo que Odyssey-3 te ofrece en cambio es una afirmación y un conjunto de demostraciones. Odyssey lo describe como un modelo fundacional del mundo, y el detalle arquitectónico que ha publicado es lo bastante específico como para poder verificarlo más adelante: un transformer de difusión autorregresivo entrenado con una gran colección de observaciones visuales del mundo, que, según la empresa, produce una comprensión aprendida de la física, la dinámica, la causa y el efecto y el comportamiento humano. La adaptación a tareas se realiza añadiendo un decodificador de acciones entrenado con pares observación-acción mientras el modelo mundial preentrenado permanece congelado; una política pequeña lee las representaciones del modelo congelado en lugar de realizar un ajuste fino del propio modelo.

Las demostraciones abarcan seis encarnaciones. Brazos robóticos, tras decenas de horas de demostraciones, incluyendo comportamientos de recuperación que no estaban en los datos de entrenamiento —reorientar una pinza después de un agarre fallido—. Políticas humanoides creadas con Flexion a partir de decenas de horas de datos de teleoperación, que, según Odyssey, generalizan mejor que las líneas base VLA con las que se probaron, sin publicar una cifra. Conducción en bucle cerrado aprendida de veinte horas de datos simulados, conducida en India. Vuelo de drones en interiores evitando obstáculos a partir de datos simulados. Entornos de videojuegos, incluidas políticas entrenadas en Grand Theft Auto V que se transfirieron a Red Dead Redemption 2 y Sleeping Dogs sin entrenamiento adicional en esos títulos; aproximadamente dos horas de metraje de GTA bastaron para producir movimiento a caballo en RDR2. Y generación de entornos para entrenar otras IA, vinculada al trabajo de aprendizaje por refuerzo PROWL de la empresa.

El único dato duro de la página es una comparación con metraje real: Odyssey informa que las políticas de conducción entrenadas en simulación recorrieron, entre intervenciones del conductor de seguridad, aproximadamente el 77 % de la distancia que recorrieron las políticas entrenadas con datos reales. Es una cifra de proveedor, no reproducida, sin ningún informe técnico que la respalde y ningún tercero ha publicado un resultado sobre Odyssey-3. Es el tipo de número que decide si un modelo del mundo es útil, y actualmente es la palabra de una sola empresa.

Dos bloqueos que no se parecen en nada

Es tentador catalogar MiniMax H3 como "el abierto" y Odyssey-3 como "el cerrado", pero la realidad de las licencias es más interesante que eso, y va en ambas direcciones.

MiniMax H3 es abierto en el centro y cerrado en los extremos. Puedes disponer del generador, inspeccionarlo, ajustarlo y ejecutarlo sin una llamada de red. No puedes disponer de la orquestación de contexto que lo convierte en un modelo general, y no puedes disponer del paso 2K. Si la promesa de calidad de tu producto depende de la resolución de salida, tu despliegue de pesos abiertos tiene un techo que solo el nivel alojado del proveedor puede superar.

Odyssey-3 está cerrado en todos los niveles, y el propio planteamiento de la empresa es la razón por la que eso resulta extraño. Un modelo del mundo orientado a robots, drones y vehículos está orientado a compradores que ejecutan inferencia en hardware que ellos controlan: plantas de producción, vehículos de prueba, fuselajes. Esos compradores no pueden usar un endpoint alojado para el bucle de control; la latencia y la conectividad lo descartan. Así que el modelo de negocio de un modelo como este tiene que incluir pesos, o no tendrá clientes en los segmentos que Odyssey no deja de mencionar. La ausencia de una licencia hoy es menos una declaración de intenciones que una declaración de que los términos comerciales todavía se están redactando. La ronda Serie B de 310 millones de dólares de Odyssey, anunciada en junio de 2026 con una valoración de 1.450 millones de dólares, con AWS como nube preferente y Trainium como sustrato de cómputo, es el contexto en el que se decidirán esos términos.

Dimensión a dimensión

Qué produce — MiniMax H3: un clip renderizado, de 4 a 15 s, de hasta 2K con audio estéreo. Odyssey-3: un estado de mundo simulado más acciones motrices para el hardware conectado.

Lo que puedes descargar — MiniMax H3: pesos de H3-Base, licencia comunitaria, 768p. Odyssey-3: nada; ni pesos, ni licencia, ni repositorio.

Lo que se queda del lado del proveedor — MiniMax H3: H3-Context-IR y H3-Regenerate-2K, los dos módulos que lo hacen general y le aportan los 2K. Odyssey-3: todo.

Precio — MiniMax H3: tarifas publicadas por segundo, aproximadamente 0,08 $ a 768p y 0,13 $ a 2K, más 0,05 $ por segundo de resultado regenerado (cifras del proveedor). Odyssey-3: ninguna publicada en ningún sitio.

Disponibilidad — MiniMax H3: abierto desde el 3 de agosto de 2026, ya se puede invocar. Odyssey-3: anunciado el 15 de septiembre de 2026, «en las próximas semanas», sin fecha.

Pruebas de terceros — MiniMax H3: ocupa el primer puesto en edición de vídeo y el segundo o tercero en texto a vídeo e imagen a vídeo según evaluaciones de terceros. Odyssey-3: una cifra del proveedor y ninguna ejecución externa.

Si necesitas construir algo este mes

La consecuencia práctica es que solo una de estas dos es una decisión sobre la que puedes actuar. MiniMax H3 se enruta en OrcaRouter como minimax/minimax-h3 al precio de lista del proveedor, con un 0% de recargo — por lo que la tarifa del proveedor es la tarifa que pagas, y cuando MiniMax mueve una cifra, tu factura se mueve con ella el mismo día en lugar de hacerlo en la renovación. Eso importa en un modelo de vídeo por segundo más que en la mayoría de las cosas, porque la diferencia entre 768p y 2K es de casi dos a uno, y la diferencia entre un prototipo y un lanzamiento puede ser la diferencia entre esos dos niveles.

Hay una segunda razón para recurrir a un enrutador aquí en lugar de una integración directa con el proveedor. La parte abierta de H3 es realmente útil por sí sola, y los equipos con más probabilidades de que eso les importe son los que tienen GPUs y opiniones al respecto. Esos equipos terminan en una configuración mixta: H3-Base autoalojado para el trabajo de volumen, una ruta alojada para la regeneración 2K y uno o dos modelos más para lo que el pipeline necesite en torno al vídeo. Una única clave y la conmutación automática por error entre proveedores valen más en esa forma que en una pila de un solo modelo, y el DSL de enrutamiento compone los modelos circundantes —un modelo de prompts, un modelo de imagen para el fotograma inicial, el modelo de vídeo— en una sola llamada en lugar de tres integraciones.

Odyssey-3, para ser explícitos, no es enrutado por OrcaRouter ni por nadie más. No hay ningún endpoint al que enrutar ni ningún precio que traspasar. Este artículo no afirma lo contrario.

La pregunta que merece la pena hacerles a ambos proveedores

MiniMax ya ha respondido a la pregunta interesante sobre H3, y la respuesta es «el punto medio, a 768p, bajo nuestra licencia». Si estás evaluando H3, lo que hay que probar es si la base abierta más tu propia infraestructura supera a la ruta alojada de 2K en coste por segundo utilizable —y probarlo antes de construir una afirmación de producto sobre la salida en 2K.

Odyssey aún no ha respondido sobre su versión. Cuando se cierre la ventana de lanzamiento, la primera pregunta no es un benchmark, es una licencia: cuál de estas seis encarnaciones es un despliegue con soporte, en el hardware de quién, a qué precio, y si el decodificador de acciones que hace que un modelo del mundo congelado accione un brazo robótico es algo que entrena un cliente o algo que Odyssey entrega. Un modelo del mundo que abarca brazos robóticos, humanoides, coches, drones y tres juegos con una sola arquitectura troncal es una afirmación de generalidad, y la generalidad es lo que lo convierte en un modelo fundacional en lugar de una política —que es exactamente por lo que las condiciones comerciales, y no el video de demostración, decidirán quién puede usarlo.

Screenshot of Odyssey's “Introducing Odyssey-3: A General-Purpose Physical Intelligence” page, dated September 15th, 2026, showing the model subtitle “Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games” and the authors Oliver Cameron and Jeff Hawke.

Hasta entonces, el marcador honesto dice: un modelo que puedes descargar, un modelo que puedes observar. Fíjate primero en un repositorio y una licencia, y después en un benchmark —en ese orden, porque sin los dos primeros, el tercero no se puede verificar.

Screenshot of the OrcaRouter model page for MiniMax-H3, model ID minimax/minimax-h3, showing a release date of 2026-07-31, 4–15 second clips at 768P or 2K with native stereo audio, and pricing of $0.08 per second at 768P and $0.13 per second at 2K.

Pon toda la canalización detrás de una sola clave de API con conmutación automática por error en lugar de tres integraciones separadas.