
Odyssey-3 vs Google Veo 3.1: Física de frontera contra diez meses de producción
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
La comparación entre Odyssey-3 y Veo 3.1 es en realidad una comparación entre dos fechas. Veo 3.1 está disponible de forma general desde el 17 de noviembre de 2025 — diez meses de uso en producción, precios por segundo publicados, 4K nativo y una pila de servicio que ha pasado por una revisión empresarial al menos una vez. Odyssey-3 fue presentado en vista previa por Odyssey el 15 de septiembre de 2026, no tiene precio publicado, ni documentación de API, ni benchmark independiente, y una ventana de lanzamiento de "las próximas semanas". Aun así, vale la pena ponerlos uno al lado del otro, porque la razón por la que se mencionan juntos es real: Veo 3.1 renderiza video hermoso, y Odyssey-3 intenta simular un mundo que se comporta correctamente bajo control. Esos son los dos productos diferentes que los equipos siguen confundiendo bajo la palabra "video", y la brecha entre ellos es exactamente donde reside la decisión de compra.
Lo que te aportan diez meses de envíos
La ventaja de Veo 3.1 no es una función, es el tiempo transcurrido. El modelo ha estado en manos de clientes de pago desde octubre de 2025 como versión preliminar y desde el 17 de noviembre como producto GA, con un nivel Lite añadido el 31 de marzo de 2026 y un nivel gratuito el 2 de abril. Esa trayectoria produce cosas que una versión preliminar no puede: una superficie de API documentada, un conjunto establecido de modos de falla que los profesionales ya han mapeado y una curva de costos que un equipo de finanzas puede modelar.
La ficha técnica refleja la misma madurez. Veo 3.1 genera en 720p, 1080p y 4K nativo, a 24 fotogramas por segundo, en duraciones nativas de 4, 6 u 8 segundos, con salidas más largas reportadas en 1080p y encadenamiento de extensión de escena más allá de eso. Acepta hasta tres imágenes de referencia para la consistencia de personajes y escenas, además de controles de semilla y prompt negativo. La salida incluye metadatos de procedencia SynthID y C2PA. Para trabajos de marca, transmisión o pantalla grande, la ruta de 4K nativo es la única capacidad que la mayor parte del campo competidor simplemente no tiene, y es la razón por la que Veo 3.1 sigue ganando proyectos que no gana por precio.

La configuración de audio predeterminada que sesga silenciosamente todas las comparaciones
Veo 3.1 genera audio estéreo nativo de 48 kHz —diálogo, sonido ambiente, foley— conjuntamente con la imagen, lo cual es, de verdad, una de sus características más sólidas. En la API, no obstante, el parámetro de audio está desactivado de forma predeterminada, y la generación silenciosa tiene un precio inferior a la generación con audio. En el nivel Standard publicado por Google, eso equivale a aproximadamente $0.20 por segundo en silencio frente a aproximadamente $0.40 por segundo con audio. De ello se derivan dos consecuencias. Primero, el precio efectivo de un clip de Veo depende por completo de un indicador que la mayoría de la gente nunca cambia, así que una cifra de «$0.20 por segundo» y una cifra de «$0.40 por segundo» pueden ser correctas ambas para el mismo modelo. Segundo, y de forma más sutil, significa que muchísimas comparativas directas que has leído enfrentaron un Veo 3.1 silencioso contra competidores cuyo audio siempre está activado, y luego los puntuaron en una tabla de clasificación que tiene en cuenta el audio. Si tu resultado necesita sonido, la cifra honesta con la que debes planificar es la que incluye audio.
Lo que Odyssey-3 realmente afirma
Odyssey-3 no es un mejor generador de vídeo y no pretende serlo. Es un transformador de difusión autorregresivo entrenado con la observación visual del mundo, y la capacidad en el centro del anuncio es un decodificador de acciones —"un componente de salida aprendido adjunto al modelo del mundo"— que convierte la representación interna de la escena del modelo en comandos motores para hardware específico. Odyssey informa que controla brazos robóticos a partir de decenas de horas de demostraciones, ejecuta políticas humanoides creadas con Flexion en tiempo real, produce puntos de ruta de conducción en bucle cerrado a partir de un backbone congelado entrenado con 20 horas de datos simulados, pilota drones en interiores alrededor de obstáculos y juega a Grand Theft Auto V con transferencia a Red Dead Redemption 2 y Sleeping Dogs sin entrenamiento adicional de políticas allí. El único número comparativo publicado es que las políticas de conducción entrenadas en simulación recorrieron entre intervenciones del conductor de seguridad alrededor del 77 % de la distancia que recorrieron las políticas entrenadas con material real.
Fíjate en qué tipo de afirmaciones son esas. Ninguna de ellas trata sobre cómo se ve la salida. Todas tratan sobre lo que un programa posterior al modelo puede hacer con ella.
Las dimensiones que no se superponen
• Salida — Google Veo 3.1: un clip renderizado, hasta 4K nativo, con audio estéreo opcional de 48 kHz. Odyssey-3: un estado de mundo simulado, más acciones motoras a través del decodificador de acciones.
• Consumidor — Google Veo 3.1: un visor o un editor. Odyssey-3: un controlador de robot, una política de conducción o un bucle de entrenamiento.
• Duración del clip — Google Veo 3.1: 4/6/8 s nativos, más largos en 1080p, cadenas de extensión más allá. Odyssey-3: despliegue continuo, sin concepto de clip.
• Precio — Google Veo 3.1: ~$0.20/s sin audio, ~$0.40/s con audio en Standard; los niveles Fast y Lite, por debajo de eso. Odyssey-3: ninguno publicado.
• Disponibilidad — Google Veo 3.1: GA desde el 17/11/2025. Odyssey-3: vista previa el 15/09/2026, público "en las próximas semanas".
• Evidencia — Google Veo 3.1: diez meses de uso en producción y una posición independiente en tablas de clasificación. Odyssey-3: demostraciones del proveedor, sin tabla de benchmarks, sin informe técnico.
Dónde la afirmación sobre la física realmente da sus frutos — y dónde no
Es tentador asumir que un modelo con mejor física produce mejor vídeo, y eso no es lo que vende Odyssey. El problema de un equipo de vídeo casi nunca es que el mundo del clip sea físicamente inconsistente — es que el plano necesita ser 4K, o que el personaje debe verse igual en tres configuraciones distintas, o que el entregable necesita metadatos de procedencia adjuntos antes de que legal dé su aprobación. Veo 3.1 responde a esas preguntas hoy. Un simulador físicamente preciso responde a una pregunta distinta: ¿puedo entrenar algo aquí que funcione allá fuera? Si no estás entrenando nada, la precisión física de Odyssey-3 es una característica sin comprador en tu flujo de trabajo.
Donde los dos convergen de verdad es en la previsualización. Un director que quiere explorar un espacio de forma interactiva —recorrer un set con una cámara, cambiar una decisión de blocking, ver la consecuencia— quiere exactamente lo que proporciona un modelo del mundo y lo que un clip renderizado no puede, porque el clip queda fijado en el momento en que se genera. Ese es un caso de uso real, y también es uno en el que una preview no lanzada aún no es una opción.
Ejecutar esto en producción sin apostar por un solo endpoint
La razón por la que a los equipos de producción les importa la arquitectura que rodea al modelo es que un pipeline de vídeo rara vez es una sola llamada. Un modelo de prompts redacta la lista de planos, un modelo de imágenes produce el fotograma inicial, un modelo de visión comprueba el resultado contra el brief, un modelo de transcripción se encarga de la voz en off. Cada uno de ellos es una dependencia que puede fallar a las 2 de la madrugada, y cada uno es una integración separada si los compras por separado. Poner esa capa sobre una única API para más de 200 modelos al precio de lista del proveedor con 0 % de recargo reduce las integraciones, y la conmutación por error automática hace que una caída del modelo de prompts se redirija en lugar de bloquear la cola de renderizado. El DSL de enrutamiento importa más aquí que en un flujo de trabajo de un solo modelo, porque componer varios modelos en una sola llamada es lo que permite que un pipeline de varias etapas falle de forma controlada etapa por etapa en lugar de como un todo. Para que quede claro el alcance: OrcaRouter no sirve Google Veo 3.1 ni Odyssey-3, y ninguno de los dos modelos es accesible a través de él.

¿Quién debería actuar ahora y quién debería esperar?
Si tu fecha límite es este trimestre y tu entregable es un archivo, Google Veo 3.1 es la elección defendible, y el precio —aproximadamente $0.40 por segundo a 1080p con audio, menos en los niveles Fast y Lite— es el costo de un modelo que ha estado en producción el tiempo suficiente como para ser aburrido. Presupuesta el flag de audio deliberadamente en lugar de descubrirlo más tarde.
Si tu problema es una política que tiene que funcionar en hardware, Odyssey-3 está pensado para ti y todavía no hay nada que comprar. Espera tres cosas: un precio publicado, una fecha de lanzamiento que sea una fecha y no una ventana, y un número independiente. La cifra del 77% de sim-to-real es de la propia Odyssey, y hasta que alguien ajeno a la empresa la vuelva a ejecutar, la postura correcta es el interés, no la planificación. Mientras tanto, el stack circundante es la parte que puedes construir, y construirlo de modo que un nuevo modelo pueda insertarse más adelante es la posición más barata de mantener.

