
Odyssey-3 vs Wan 3.0: Un modelo del mundo se encuentra con una fábrica de video
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Odyssey-3 y Wan 3.0 se archivan ambos bajo «modelo de vídeo», y esa etiqueta compartida soporta más peso del que puede aguantar. Odyssey-3 es un sistema dinámico aprendido —un simulador que construye un entorno a partir de un prompt y predice cómo cambia ese entorno cuando alguien se desplaza por él o desencadena un evento—, publicado por Odyssey el 8 de octubre de 2026 como avance de investigación. Wan 3.0 es un generador de vídeo de producción de Alibaba Cloud, disponible de forma general desde su lanzamiento el 24 de agosto de 2026, facturado por segundo y ya evaluado en dos clasificaciones independientes. Uno de ellos aspira a ser un lugar donde colocas una cámara. El otro aspira a ser lo que renderiza el material que publicas.
Ponga las dos páginas de lanzamiento una al lado de la otra y la diferencia es inmediata. Odyssey prioriza la precisión física: lo bien que su modelo entiende lo que hacen los objetos cuando se encuentran. Alibaba prioriza el rendimiento, la duración y el control de referencias: tomas de 30 segundos, audio nativo, y hasta diez imágenes y cinco vídeos suministrados por generación. Ninguna es una versión inferior de la otra. Son respuestas a preguntas diferentes, y las respuestas cambian lo que un equipo debería hacer esta semana.
Una nota de encuadre antes de los números. La mayoría de las cifras de este artículo provienen del propio material de lanzamiento de los proveedores y no han sido reproducidas por nadie fuera de esos laboratorios. Cuando una cifra proviene de un panel independiente en lugar de una página de prensa, el texto lo indica. Esa distinción importa aquí más de lo habitual, porque los dos modelos publican cantidades radicalmente distintas de información verificable: uno se vende por segundo en una API abierta, el otro no ha publicado ningún precio en absoluto.
Lo que realmente es cada uno
La propia descripción que hace Odyssey de Odyssey-3 es inusualmente específica para una publicación de lanzamiento, y merece citarse en lugar de redondearla: es "un sistema dinámico aprendido, implementado como un transformer de difusión autorregresivo, que predice cómo se mueven e interactúan los objetos en el espacio y cómo evolucionan las situaciones con el tiempo". Lo que devuelve no es un clip en el sentido habitual. Es un estado que sigue evolucionando mientras se le impulsa. El modelo se ofrece en dos tamaños —Odyssey-3 a 832×480 y Odyssey-3 Pro a 1280×720—, y Odyssey afirma que su vista previa admite navegación en primera y tercera persona junto con movimiento de cámara independiente. La versión también incluye una variante destilada de pocos pasos, producida mediante una combinación de coincidencia de distribución y destilación adversaria, que el proveedor describe como interactiva en tiempo real.
Wan 3.0 es un generador bajo el modelo establecido: entra un prompt y una o más referencias, y sale una pieza de vídeo terminada. Las capacidades principales de Alibaba son la generación de 30 segundos en una sola pasada, audio nativo y entradas de referencia que abarcan texto, imagen, vídeo y audio — además de documentos en formatos doc, xls, ppt, pdf, md, txt, key, pages y numbers, de hasta 100 MB y 50 páginas. La edición está basada en instrucciones, lo que significa que una generación puede modificarse en lo visual, la trama o el diálogo sin regenerarla desde cero. Alibaba también afirma con claridad que la calidad del audio y la precisión del texto en pantalla aún necesitan mejoras, algo que es una admisión más rara en una publicación de lanzamiento de lo que debería ser y útil de tener registrada.
• Qué es la salida — un entorno simulado en el que actúas (Odyssey-3) frente a un clip renderizado que publicas (Wan 3.0) • Tamaños anunciados — 832×480, o 1280×720 en Odyssey-3 Pro, frente a 480p, 720p y 1080p • Duración de una sola ejecución — todo el tiempo que se siga ejecutando el entorno, frente a 30 segundos por generación • Audio — no es una capacidad destacada en ninguno de los dos tamaños, frente a audio nativo con límites de calidad señalados por el proveedor • Entradas — un prompt que define el entorno, frente a texto, imagen, video, audio y documentos de hasta 100 MB y 50 páginas • Modelo de edición — cambiar el estado y volver a simular, frente a ediciones basadas en instrucciones sobre una generación finalizada • API documentada — ninguna publicada, frente a abierta y con medición de uso desde el 24 de agosto de 2026 • Precio publicado — ninguno, frente a 0.3 / 0.6 / 1.2 yuanes por segundo a 480p / 720p / 1080p
Cuánto cuesta un segundo de salida, y por qué las unidades no cuadran
Wan 3.0 tiene un precio expresado en la unidad más legible de la que dispone un comprador: el tiempo. Las tarifas de Alibaba son 0,3 yuanes (unos 0,05 USD) por segundo de video generado a 480p, 0,6 yuanes (unos 0,10 USD) a 720p y 1,2 yuanes (unos 0,20 USD) a 1080p. Por lo tanto, una ejecución completa de 30 segundos ronda los 9 yuanes (1,50 USD) a 480p, los 18 yuanes (3,00 USD) a 720p o los 36 yuanes (6,00 USD) a 1080p. Esas son las tarifas de lanzamiento de agosto; la promoción de lanzamiento que las redujo un 30 % solo estuvo vigente hasta el 23 de septiembre, así que las cifras anteriores son las que encuentra hoy un comprador. Los proveedores que revenden Wan 3.0 suelen cotizar tarifas por minuto en lugar de por segundo, lo que conviene comparar con la aritmética por segundo antes de aprobar cualquier presupuesto.
Odyssey-3 no tiene una cifra comparable, porque Odyssey no ha publicado un precio, una lista de tarifas, una licencia ni documentación de API. Lo que existe en su lugar es una cifra de coste dentro de un benchmark de terceros, calculada sobre una suposición que el proveedor declara abiertamente: $1 por hora de GPU MI355X. Sobre esa base, Physics-IQ Verified sitúa a Odyssey-3 Pro en $0.267 por vídeo generado y a Odyssey-3 en $0.139, ambos normalizados a 24 FPS y una salida de 1280 de ancho. Esa misma tabla señala por separado que la reescritura de prompts mediante la API de Odyssey se estima en $0.01 por vídeo enviado. Lee eso con atención: es una base de modelado, no un precio. Te indica cuánto costaría una simulación a la tarifa de hardware asumida por el proveedor, no lo que Odyssey facturará.
Esos dos hechos apuntan en direcciones opuestas para un comprador. Wan 3.0 es una línea facturable por uso cuyo peor caso puede calcularse antes de renderizar nada. Odyssey-3 tiene un costo modelado por video más bajo y ninguna factura a la que adjuntarlo, que es precisamente la etapa en la que se detiene una conversación de adquisición. Para que una comparación sea justa, el lector tiene que sostener ambas mitades: una tarifa real con una factura real, y una tarifa estimada sin nada que la respalde todavía.

El único marcador que comparten, y el nombre que falta en él
Physics-IQ Verified, un ranking dinámico de Anates Labs y DeepMind sobre qué tan bien manejan los modelos de video los principios físicos, es la única clasificación independiente que esta pareja tiene en común — y es donde la comparación se vuelve verdaderamente interesante, porque también es donde se rompe.
El post de lanzamiento de Odyssey afirma que Odyssey-3 Pro «establece un nuevo estado del arte en el benchmark Physics-IQ Verified, y ocupa el 1.er puesto en 3 de las 4 categorías de WorldMark». La parte de WorldMark de esa afirmación cuadra con las cifras que Odyssey publica: primer puesto en First-Person Stylized (77.2), Third-Person Real (79.0) y Third-Person Stylized (76.3), con First-Person Real en segundo lugar con 80.6, por detrás del 83.0 de AlayaWorld y el 84.4 de Lyra 2.0. Todas esas son cifras reportadas por el proveedor a partir de la propia ejecución de evaluación de Odyssey.
La parte de vanguardia es donde un lector debería detenerse. En la versión del tablero Physics-IQ Verified disponible ahora, clasificado por mejora neta en puntos porcentuales por encima de la media de la pista, FLUX 3 [large] de Black Forest Labs ocupa el puesto 01 con +12,27 pp. Odyssey-3 Pro ocupa el puesto 02 con +11,15 pp, y Odyssey-3 ocupa el puesto 03 con +9,99 pp. Por lo tanto, el "nuevo estado de la técnica" del proveedor es, en el tablero que el propio proveedor cita, el segundo lugar — ya sea porque la afirmación es anterior a una actualización del tablero o porque está delimitada de forma más estrecha de lo que sugiere la frase. En cualquier caso, la lectura honesta es que Odyssey-3 Pro es un modelo de física entre los tres primeros, no un líder absoluto. FLUX 3 [large] también conlleva un costo por vídeo mucho mayor de $0,868 frente a los $0,267 de Odyssey-3 Pro, que es la disyuntiva que la vista de costos del tablero existe para exponer.
Odyssey sí ocupa un primer puesto absoluto en el desglose de submétricas: Espaciotemporal, con 44,70, por delante de Odyssey-3 Pro, con 42,97, y de Physis-Lang (Cosmos3 Super), con 41,57. En Espacial es cuarto (59,17), por detrás de FLUX 3 (64,36), Odyssey-3 Pro (61,78) y Physis-Lang (59,87); en Espacial ponderado y MSE es cuarto y tercero, respectivamente. Ese patrón —liderazgo absoluto en qué tan bien se mantiene coherente el movimiento a lo largo del tiempo, segundo nivel en fidelidad espacial de un solo fotograma— es una firma coherente de un modelo construido para simular la evolución en lugar de renderizar una hermosa imagen fija.
Ahora, el nombre que falta. Wan 3.0 no aparece en absoluto en Physics-IQ Verified. Las únicas entradas de Wan son Wan 2.2 14B en el puesto 17, −6.64 pp, y Wan 2.2 5B en el puesto 22, −11.13 pp — ambas por debajo de la media del track, ambas de código abierto, ambas una generación por detrás. La propia nota de alcance del tablero dice que la clasificación "incluye modelos evaluados con benchmark y modelos conocidos por preprints o anuncios, incluso si el acceso público no está disponible o no se confirma una fecha de lanzamiento", así que la ausencia de Wan 3.0 no es prueba de que obtenga malos resultados. Es prueba de que nadie lo ha medido en este eje. La consecuencia práctica es contundente: cualquier afirmación de que Odyssey-3 supera a Wan 3.0 en plausibilidad física no está verificada en ninguna de las dos direcciones, y cualquier afirmación de que no lo hace está igualmente sin verificar. El historial independiente de Wan 3.0 está en otra parte — quedó en el puesto n.º 2 general en OpenArt Arena y n.º 1 en Video Editing with Audio en Artificial Analysis —, en tableros que miden la calidad percibida y la calidad de edición, no la física.
Lo que puedes llamar hoy, y aquello sobre lo que solo puedes preguntar.
Wan 3.0 es invocable desde el 24 de agosto de 2026, cuando el lanzamiento de Alibaba Cloud convirtió la beta de pago por uso y con acceso limitado por solicitud en una API totalmente abierta. Se puede acceder al modelo a través de la propia API del proveedor y de varias plataformas de terceros, todas ellas de pago por uso, con las tarifas por segundo indicadas arriba. Si un equipo necesita video generado esta tarde, esa es una opción real y conlleva una factura.
Odyssey-3 no ofrece eso. La página de Odyssey dice que la vista previa de investigación está "ya disponible" e invita a los desarrolladores de IA física a ponerse en contacto, lo que describe una demostración y una conversación, no un endpoint detrás de una clave. No hay precio publicado, ni licencia, ni documentación de API y, como muestra la sección anterior, tampoco una evaluación independiente. Un desarrollador que lea la publicación de lanzamiento no puede hoy calcular cuánto costaría una implementación de producción sobre Odyssey-3, ni comprobar si las afirmaciones sobre física se sostienen fuera del banco de pruebas del propio proveedor. Eso es normal para un modelo del mundo del día de lanzamiento, y también es el hecho más importante de esta comparación.
Como ninguno de los dos modelos está en nuestro catálogo —la lista de modelos de OrcaRouter no incluye Odyssey-3 ni Wan 3.0—, el punto de enrutamiento útil es la capa que se sitúa por encima de ellos. Lo más probable es que un desarrollo de vídeo no llame a un solo modelo. Llama a un modelo de reescritura de prompts, a un modelo de vídeo, a veces a un modelo de audio, y vuelve a llamarlos a todos cada vez que un proveedor cambia un precio o un límite de velocidad. En OrcaRouter, esos quedan detrás de una única API que cubre más de 200 modelos al precio de lista del proveedor con un 0 % de recargo, de modo que un recorte de precio por segundo de un proveedor de vídeo está activo aquí el mismo día en lugar de esperar a un cambio de configuración, y la conmutación por error automática significa que la caída de un modelo no bloquea una cola de renderizado. Los modelos de vídeo que sí servimos —MiniMax H3, Kling 3.0, Kling Video O1 y otros— están bajo esa misma clave, que es lo que abarata la sustitución cuando por fin se abra una vista previa de Wan 3.0 o una prueba de Odyssey-3.

¿Cuál pertenece a tu stack?
La elección no es para nada reñida, porque no hay solapamiento en lo que producen las dos. La regla de decisión honesta tiene que ver con el artefacto que necesitas al final.
Elige Wan 3.0 si el entregable es metraje que una persona ve: un anuncio, una inserción de plano, un corte para redes sociales, un segmento didáctico. Treinta segundos por ejecución con audio nativo, control de referencias entre imágenes, video y audio, edición basada en instrucciones y documentos como entrada es una lista de funciones de producción, y la API medida por uso significa que el costo de una prueba se puede conocer de antemano. Es una generación, no una simulación: el trabajo del modelo termina cuando termina el clip. Presupuesta a partir de las tarifas por segundo del proveedor y trata las advertencias del propio proveedor sobre el audio y el texto en pantalla como restricciones de diseño, no como notas al pie.
Elige Odyssey-3, cuando puedas conseguirlo, si el entregable es un comportamiento y no un archivo: un entorno en el que aprende una política, una escena cuya respuesta a una acción tiene que mantenerse consistente a lo largo de un rollout largo, una tarea de navegación o manipulación en la que la cámara forma parte del problema. Ahí es donde el primer puesto absoluto en plausibilidad espaciotemporal y el coste modelado de $0.139–$0.267 por vídeo realmente importan. Lo que falta es todo lo que un equipo de producción necesita para comprometerse —un precio, una licencia, un endpoint y una medición externa—, y nada de eso es algo que una demo pueda suplir.
Lo que hay que vigilar es concreto y cercano. Si Wan 3.0 aparece en Physics-IQ Verified, la cuestión de la física se vuelve respondible en una dirección. Si Odyssey publica una lista de precios o una API, la cuestión del coste se resuelve en la otra. Hasta que ocurra una de esas cosas, esta comparación tiene una forma extraña: un sistema de producción con un precio publicado y ninguna puntuación de física, junto a un simulador con puntuaciones de física publicadas y ningún precio. Cualquiera que te diga cuál es mejor hoy está adivinando al menos uno de esos dos números.
![Capture of the Physics-IQ Verified leaderboard from Anates Labs and DeepMind, ranked by net improvement in percentage points above the track mean, showing FLUX 3 [large] first at +12.27 pp, Odyssey-3 Pro second at +11.15 pp and Odyssey-3 third at +9.99 pp, with Wan 2.2 14B at rank 17 and Wan 2.2 5B at rank 22 and no entry for Wan 3.0.](https://cms.orcarouter.ai/api/media/file/4-1741.png)
