Tarjeta de título para Odyssey-3 vs ByteDance Seedance 2, con un panel izquierdo encabezado Odyssey-3 que dice “un mundo que pilotas en vivo”, 832x480 o 1280x720 Pro, Physics-IQ +9,99 pp, puesto 03; y un panel derecho encabezado ByteDance Seedance 2 que dice GA desde el 12 de febrero de 2026, plataforma tarificada por uso, un clip terminado de hasta 15 s, resolución no publicada, Physics-IQ no presentado.
Guides & Insights

Odyssey-3 vs ByteDance Seedance 2: un entorno en el que actúas frente a un clip que ves

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon Odyssey-3 y B​yteDance Seedance 2 lado a lado y lo primero que se advierte es que no compiten por la misma solicitud. Odyssey-3, lanzado por Odyssey el 8 de octubre de 2026, genera un entorno a partir de un prompt y luego sigue prediciéndolo en tiempo real mientras te mueves por él o desencadenas un evento; es un simulador con una cámara que tú controlas. B​yteDance Seedance 2 es un generador de clips con silla de director: entran referencias de texto, imagen, audio y video, y sale un video terminado, de hasta quince segundos, generado en una sola pasada y entregado como un objeto fijo. Uno de ellos tiene una entrada de control; el otro tiene una línea de tiempo. Aun así, vale la pena hacer la comparación, porque los dos están convergiendo en el mismo comprador y porque apuestan en direcciones opuestas sobre dónde reside el valor de un modelo de video generativo.

Hay una única tabla de puntuaciones compartida, y es más endeble de lo que parece. Seedance 2 en sí no aparece en Physics-IQ Verified, la tabla de Anates Labs y DeepMind que evalúa qué tan bien predice un modelo experimentos físicos reales. Seedance 2.5, el sucesor del 31 de julio de 2026, sí aparece. Por lo tanto, el único dato de terceros que coloca algo de esta familia junto a Odyssey-3 es una comparación entre dos generaciones de modelos en uno de los lados, lo cual conviene aclarar antes de que alguien lo cite como una pelea justa.

Los dos mecanismos

Odyssey-3 es un transformer de difusión autorregresivo. La propia descripción de Odyssey: un modelo de difusión de video de varios pasos extendido autorregresivamente con teacher forcing y enmascaramiento causal, de modo que continúa a partir de observaciones previas y predice estados futuros condicionados a las entradas de acción; después, una pasada de postentrenamiento de emparejamiento de distribuciones y destilación adversarial produce una variante de pocos pasos lo suficientemente rápida como para interactuar con ella. La salida no es una escena que se reproduce; es una escena que responde. La vista previa expone la navegación en primera persona, la navegación en tercera persona y el movimiento de cámara independiente — tres formas distintas de presionar sobre la misma predicción y observar qué hace.

B​yteDance Seedance 2 es un modelo multimodal unificado de generación conjunta de audio y video. Acepta texto, imagen, audio y video como referencias y genera el clip en una sola pasada, de hasta quince segundos, con el audio generado de forma conjunta en lugar de doblado a posteriori. La página de B​yteDance describe que las referencias de imágenes, audio y video dan control sobre la actuación, la iluminación, las sombras y el movimiento de cámara, lo cual es el lenguaje de la producción y no de la simulación: estás especificando un plano, no controlando un mundo. Lanzado el 12 de febrero de 2026, se volvió viral en pocos días con clips de actores reales y películas existentes, y eso también fue lo que provocó la tormenta por derechos de autor, con cartas de cese y desistimiento de Disney y Netflix, la condena de la Motion Picture Association y SAG-AFTRA, y una carta de marzo de 2026 de dos senadores estadounidenses en la que pedían a B​yteDance que lo cerrara. B​yteDance dijo en febrero de 2026 que estaba reforzando las salvaguardas. Esa historia es parte de la especificación del modelo si vas a lanzar algo comercial.

Dimensión a dimensión

ByteDance's BytePlus ModelArk developer documentation in English, showing the Ark SDK quick-start with a Python client using model seed-2-0-lite-260228 against base_url https://ark.ap-southeast.bytepluses.com/api/v3, a sidebar covering Models, video generation, image generation and the Model list, and three endpoint cards for Dola Seed 2.0, Dreamina Seedance 2.5 (described as the mainline video generation model with 30s extended storytelling, multimodal references and improved generation quality) and Dola Seedream 5.0.

• Qué produce — un entorno interactivo dentro del cual actúas, frente a un clip fijo de hasta quince segundos. Todo lo que sigue a esta fila cambia.

• Superficie de control — navegación en vivo y eventos durante la generación, frente a un prompt más referencias de imagen, audio y video especificadas de antemano. Una se pilota durante la generación; la otra se dirige antes de que esta comience.

• Audio — Seedance 2 lo genera conjuntamente con el video, en el mismo modelo. El material de lanzamiento de Odyssey-3 no dice absolutamente nada sobre el audio.

• Resolución — Odyssey-3 funciona a 832×480, con Odyssey-3 Pro a 1280×720. La página de B​yteDance para Seedance 2 no publica una resolución de salida, y la cifra de 1080p que circula pertenece a la línea anterior Seedance 1.0.

• Coste — Odyssey-3 figura a $0.139 por vídeo generado en la columna de coste normalizado de Physics-IQ, y Odyssey-3 Pro a $0.267, ambos excluyendo el manejo de prompts. Seedance 2 no publica ningún precio de lista por segundo o por clip que hayamos podido verificar; su sucesor, Seedance 2.5, figura en el mismo panel a $2.838 por vídeo.

• Puntuación independiente: la generación propia de ninguno de los dos modelos cuenta con una comparación directa por parte de terceros. Los resultados publicados de Seedance 2.0 son el SeedVideoBench-2.0 interno de B​yteDance; los de Odyssey-3 son una presentación a un benchmark más una evaluación realizada por el proveedor sobre un conjunto de datos ajeno.

• Pesos — cerrados por ambos lados. Odyssey no ha publicado ningún checkpoint, y Seedance nunca ha estado abierto.

• Postura comercial — Odyssey-3 es una vista previa de investigación con un formulario de contacto para acceso a la API y sin lista de precios. Seedance 2 se vende a través de las plataformas propias de B​yteDance y, fuera de China, a través de CapCut como Dreamina Seedance 2.0.

El único número que realmente los compara

Physics-IQ Verified puntúa a los modelos según la mejora neta en plausibilidad física respecto a la media del track, en puntos porcentuales, y registra qué conjunto de prompts se utilizó. Con los prompts propios del benchmark, Seedance 2.5 ocupa el séptimo puesto con +3,59 pp, con un coste normalizado de 2,838 $ por vídeo. Odyssey-3, con el mismo conjunto de prompts, ocupa el octavo puesto con +2,15 pp, a 0,129 $ por vídeo. Léalo con atención: se trata de una diferencia de 1,44 puntos a favor de Seedance y de una diferencia de coste de aproximadamente veintidós veces en su contra.

Las filas principales de Odyssey-3 usan una columna diferente. Presentado con prompts personalizados, Odyssey-3 obtiene +9,99 pp y Odyssey-3 Pro +11,15 pp — tercero y segundo en la tabla, por detrás de FLUX 3 [large] con +12,27 pp. La misma familia de modelos aparece dos veces en la misma tabla de clasificación bajo dos regímenes de prompts diferentes con puntuaciones muy distintas, que es lo más útil que hay que entender sobre cómo leer esta tabla: el número es en parte una propiedad del modelo y en parte una propiedad de quien escribió el prompt.

Odyssey también reporta 66.1 en la pista de vídeo a vídeo para Odyssey-3 Pro, la puntuación más alta que afirma, y 54.7 para Odyssey-3 Pro en imagen a vídeo. Ambas son la propia lectura del proveedor de un tablero al que lo presentó, no una ejecución independiente.

Two-column scoreboard headed “Odyssey-3 vs ByteDance Seedance 2 — the scoreboard” with six shared dimension labels. Odyssey-3: an environment you act inside; live navigation and mid-run events; no audio; 832x480, 1280x720 Pro; /bin/bash.139 a video, Pro /bin/bash.267; no independent scoring yet. ByteDance Seedance 2: a fixed clip up to 15 seconds; text, image, audio and video references upfront; audio generated jointly with the video; resolution not published; no per-second list price published; not on Physics-IQ. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Seedance 2 has no third-party score; Seedance 2.5, a later model, is on Physics-IQ at +3.59 pp”.

Dónde gana realmente cada uno

Si tu problema es «necesito un plano», el diseño de Seedance 2 responde exactamente a eso: las referencias multimodales significan que puedes darle el parecido del actor, la base de audio y el movimiento de cámara, y obtener un clip terminado con sonido. Nada en la vista previa de Odyssey-3 hace eso, y nada en su material de lanzamiento sugiere que lo hará. El límite de quince segundos es una restricción real, pero también lo es un despliegue de modelo del mundo de cinco segundos sin audio.

Si tu problema es «necesito saber qué pasa después», la disyuntiva va en sentido contrario. A Seedance 2 no se le puede pedir un contrafactual: obtienes un solo clip y, para ver otro resultado, vuelves a introducir el prompt y obtienes uno que no tiene nada que ver. Toda la premisa de Odyssey-3 es que el siguiente estado depende de la acción que acabas de tomar, que es lo que lo hace utilizable para una política de conducción, un brazo robótico o un entorno de entrenamiento donde la secuencia importa más que la toma.

La evidencia de precisión física favorece a Odyssey-3 en el mecanismo incluso donde la columna de puntuación no lo hace: el modelo se está evaluando en continuaciones tras una perturbación, que es la misma capacidad que vende la vista previa interactiva. El +3,59 pp de Seedance 2.5 en la misma tabla es un resultado sólido para un generador de clips y, notablemente, mejor que el de Odyssey-3 en el conjunto de prompts emparejados —por lo que el resumen honesto es que el modelo de vídeo de B​yteDance es más plausible físicamente de lo que un modelo de vídeo tiene derecho a ser, no que Odyssey-3 haya sido superado en su propio juego.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Llegar a cualquiera de los dos

Ninguno de los dos modelos se puede invocar desde aquí hoy. OrcaRouter no aloja Odyssey-3 ni B​yteDance Seedance 2 — Odyssey-3 no tiene un precio publicado para que nadie lo enrute, y Seedance se vende a través de las propias plataformas de B​yteDance.

Lo que una sola clave de OrcaRouter sí alcanza es el resto del stack de vídeo: MiniMax-H3 a $0.08 por segundo de salida en 768P, la línea de vídeo Kling de $0.084 a $0.28 por solicitud, y más de 200 modelos en total, todos a precio de lista del proveedor con 0 % de recargo, así que un cambio de precio de un proveedor se refleja en tu factura el mismo día en lugar de en la renovación. La conmutación por error automática mantiene vivo un barrido de evaluación cuando un upstream se degrada, y el DSL de enrutamiento pone varios modelos de vídeo detrás de una sola interfaz, de modo que probar un nuevo generador es un cambio de configuración en lugar de una integración. Cuando cualquiera de estos dos abra un endpoint de autoservicio, esa es la forma en la que deberías integrarlo.

Qué ver

Dos cosas cambiarían esta comparación más que cualquier actualización de benchmark. La primera es el audio: si la próxima generación de Odyssey-3 genera sonido de forma conjunta tal como lo hace Seedance, el «entorno en el que actúas» deja de ser una categoría más estrecha. La segunda es un arnés independiente: un tercero que ejecuta Seedance 2.0 y Odyssey-3 en paralelo con los mismos clips, en lugar de que uno aparezca en una tabla a la que el otro nunca ha sido enviado. Hasta entonces, la lectura correcta de Odyssey-3 frente a ByteDance Seedance 2 es que no son dos candidatos para el mismo trabajo. Son dos respuestas a preguntas diferentes, y la pregunta que haces elige el modelo por ti.