Una tarjeta principal generada para HiDream-O1-Video-1.0 con el antetítulo 'OrcaRouter · radar de modelos — vídeo' sobre el titular 'Sexto en la tabla, una entrada en la API', una tarjeta izquierda 'La tabla' que lista AA imagen a vídeo 6.º de más de 80, Elo 1.175 ±10, 3.231 muestras y 0,80 por minuto, una tarjeta derecha 'La API documentada' que lista una imagen de referencia, un prompt opcional, solo force_10s, y vídeo, resolución y audio no expuestos, y cuatro chips que dicen Publicado ago 2026, Anunciado 17 sep 2026, Pesos: ninguno publicado, y sin entrada en las tablas de T2V o de edición.
Engineering & Research

HiDream-O1-Video-1.0 debuta en el sexto puesto en Artificial Analysis — y su API pública es mucho más pequeña que su lanzamiento

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

HiDream-O1-Video-1.0 ocupa el sexto puesto en la tabla de clasificación de Imagen a Vídeo de Artificial Analysis, con un Elo de 1.175 sobre 3.231 votos a 5,80 $ por minuto de vídeo generado. Esa es la posición que anunció su creador, salvo que la nota de lanzamiento de HiDream.ai, fechada el 17 de septiembre de 2026, decía que era el número cuatro. Ambas cifras son ciertas y describen cosas distintas: la nota cita el puesto que ocupaba el modelo el día en que se anunció, y la tabla ha cambiado desde entonces. Leída el 10 de octubre de 2026 con el filtro de audio activado, HiDream V1 se sitúa por detrás de MiniMax H3 Max, MiniMax H3, Vidu Q4 Preview, Omni Flash y Dreamina Seedance 2.0 720p, en ese orden.

La historia más interesante no es la clasificación. Es que HiDream-O1-Video-1.0 se anunció como un modelo que acepta texto, imágenes y vídeo y devuelve metraje 1080p de cinco a veinte segundos con audio sincronizado de forma nativa, y que lo que de verdad puedes invocar hoy acepta exactamente una imagen de referencia y un prompt de texto opcional, y nada más. Ambas afirmaciones están documentadas. La brecha entre ambas es lo que vale la pena saber antes de construir sobre este modelo.

El tablero, leído correctamente

Artificial Analysis ejecuta sus evaluaciones de vídeo por niveles, cada uno con su propia escala Elo y su propio conjunto, por lo que una puntuación no se transfiere entre ellos. En AA-Video-I2V v1.0 con el audio incluido, los seis primeros están separados por veinte puntos Elo y los intervalos de confianza tienen entre siete y diez puntos de amplitud. Ese grupo de los seis primeros, a 10 de octubre de 2026:

• MiniMax H3 Max — 1,195 ±9 sobre 5,894 muestras, agosto de 2026, $4.80/min

• MiniMax H3 — 1.181 ±8 sobre 7.284 muestras, julio de 2026, $7,80/min

• Vidu Q4 Preview — 1.179 ±10 sobre 5.543 muestras, octubre de 2026, 5,04 $/min

• Gemini Omni Flash — 1,178 ±7 sobre 12,327 muestras, mayo de 2026, $6.00/min

• Dreamina Seedance 2.0 720p — 1.176 ±7 sobre 15.721 muestras, marzo de 2026, 9,07 $/min

HiDream-O1-Video-1.0 — 1.175 ±10 en 3.231 muestras, agosto de 2026, $5,80/min

Lee esos intervalos en conjunto y el resumen honesto es que las posiciones de la uno a la seis son, estadísticamente, una sola contienda con una cola muy larga de empates. La brecha que no está dentro del ruido es la que hay entre HiDream V1 y el resto del pelotón: el séptimo puesto, el Wan 3.0 de Alibaba, está en 1.164 — once puntos y un intervalo completo por debajo del sexto, y casi trescientos votos por delante de él. El propio recuento de muestras de HiDream es el más bajo de ese top seis, lo que significa que su intervalo está entre los más amplios y su posición es la menos definida.

A generated scoreboard titled 'HiDream-O1-Video-1.0 — announced versus served', contrasting the vendor's launch claims (inputs: text, image and video; output: 1080p, 5 to 20 seconds; audio: natively synchronised; duration planned from narrative; generation as one joint multimodal process; physics of gravity, collision and inertia) against the HiHarness request surface (one reference image; aspect ratio preserved; no audio parameter; force_10s boolean only; no resolution selector documented; physics not exposed as a control), with a footer stating the launch claims are vendor-reported.

Dos cosas que Artificial Analysis afirma sobre la propia tabla merecen tenerse en cuenta. Registra un solo modelo como añadido en los últimos 30 días, y dice que AA-Video-I2V v2.0 está en camino, alineado con la taxonomía de AA-Video-T2V v2.0 con 1080p en todo momento. Eso importa para un modelo cuyas afirmaciones de lanzamiento son sobre 1080p y sobre condicionamiento de texto y vídeo: la tabla en la que debuta es explícitamente transitoria, y el reemplazo cambia lo que se mide.

Donde el modelo no está

HiDream-O1-Video-1.0 aparece en exactamente un panel de vídeo de Artificial Analysis. Está ausente de AA-Video-T2V v2.0, el panel de texto a vídeo, y del panel de edición de vídeo. Revisé ambos el 10 de octubre de 2026: Wan 3.0 lidera texto a vídeo con 1.156 y edición de vídeo con 1.157, FLUX 3 es sexto en texto a vídeo con 1.128, y HiDream no aparece en ninguna de las dos clasificaciones.

Esa ausencia es una señal, más que una descalificación. Un modelo que solo consume una imagen de referencia no puede participar en una votación de texto a video, y uno que solo anima no puede entrar en una comparación de edición. La consecuencia práctica es que no existe una medición independiente de HiDream V1 realizando texto a video o edición de video, que son precisamente dos de los tres modos de entrada que publicita su lanzamiento.

Dos fechas, y los noventa días entre ellas

Hay un matiz complicado en la datación que cualquiera que cite estas cifras debería tratar con cuidado. Artificial Analysis registra la fecha de lanzamiento de HiDream-O1-Video-1.0 como el 28 de agosto de 2026 y la fecha en que se introdujo en la clasificación como el 10 de septiembre de 2026. El propio anuncio de lanzamiento de HiDream está fechado el 17 de septiembre. Las referencias de modelos de terceros que han aparecido desde entonces lo describen como publicado el 15 de septiembre y verificado el 17 de septiembre.

Lo que ese patrón describe es un modelo que llegó al pipeline de evaluación antes que al comunicado de prensa —algo bastante normal, y significa que la fecha de lanzamiento en la tabla es la más temprana de las dos, no un error. No describe un modelo de marzo que se vuelve a anunciar en agosto, que es el modo de fallo con el que este blog ya se ha quemado antes. HiDream-O1-Video-1.0 es genuinamente nuevo: la propia infraestructura de la tabla de clasificación data su llegada dentro de los últimos dos meses.

Qué afirma el lanzamiento, y quién lo dice

La historia de la arquitectura proviene de HiDream y no ha sido reproducida de forma independiente. Según el proveedor: HiDream-O1-Video-1.0 — HiDream V1, o HD-V1 — modela conjuntamente texto, vídeo y audio dentro de un único proceso de generación en lugar de generar la imagen y añadir el sonido después, de modo que el movimiento de labios, el sonido ambiente y la acción física comparten una línea temporal. La duración se planifica en lugar de ser fija, y el modelo elige una longitud de entre cinco y veinte segundos a partir del evento que se describe. El comportamiento físico — gravedad, colisión, inercia, deformación, atenuación de la luz — se entrena como una restricción de generación. El postentrenamiento utiliza aprendizaje por refuerzo de difusión contra un modelo de recompensa multimodal alineado con la percepción humana. La generación se ejecuta en tres etapas que la empresa describe como planificación primero, generación conjunta segundo y alineación tercero.

HiDream sitúa el modelo dentro de una cartera de cuatro familias construida sobre una base compartida de transformer unificado —HiDream-O1-Image, HiDream-O1-Video, HiDream-O1-World y HiDream-O1-Embodied— y cita posiciones previas en benchmarks de sus hermanos, incluidos HiDream-O1-Image 1.5 en segundo lugar a nivel mundial en el ranking de texto a imagen de Artificial Analysis y HiDream-O1-World en primer lugar en WBench. Esas son las cifras del proveedor para otros modelos de la familia, expuestas aquí sin confirmación independiente. El material corporativo de la empresa también describe una pila tecnológica de modelos fundacionales de "más de 200 mil millones" de parámetros; esa es una declaración a nivel de plataforma, no una especificación de HiDream-O1-Video-1.0, y ninguna fuente publica un recuento de parámetros para este checkpoint. No se han publicado pesos abiertos para él.

A screenshot of the Artificial Analysis AA-Video-I2V v1.0 image-to-video leaderboard with the audio filter applied, captured 10 October 2026, headed by MiniMax H3 Max at Elo 1,195 and .80 per minute, with HiDream-O1-Video-1.0 sixth at Elo 1,175 over 3,231 samples, released August 2026 at .80 per minute, and a banner noting that AA-Video-I2V v2.0 is coming soon with 1080p videos throughout.

Lo que realmente puedes llamar

Aquí la documentación es inusualmente clara, y es más limitada que el anuncio. HiDream sirve el modelo a través de HiHarness, su plataforma MaaS. El endpoint de video es un POST a /api/maas/gw/v1/videos/generations con el identificador de modelo HiDream-O1-Video-1.0. La entrada requerida es exactamente una imagen de referencia — una URL pública, o Base64 sin el prefijo data-URL, entre 40 KB y 20 MB. El prompt de texto es opcional y por defecto está vacío. La generación es asíncrona: envías, recibes un task_id, y consultas /api/maas/gw/v1/videos/generations/results hasta que result.status indique 1.

Tres omisiones en ese esquema merecen nombrarse explícitamente, porque cada una es una capacidad que la versión de lanzamiento anuncia.

• Vídeo de referencia — el anuncio incluye el vídeo entre las entradas del modelo; la solicitud documentada no tiene ningún campo para ello.

• Resolución explícita — el anuncio afirma 1080p; la solicitud documentada no tiene selector de resolución y, en su lugar, el resultado conserva la relación de aspecto de la imagen de referencia.

• Control de audio — el anuncio afirma disponer de audio sincronizado nativo; la solicitud documentada no expone ninguna entrada de audio ni ningún parámetro de generación de audio.

Lo que el esquema sí expone es force_10s, un booleano que por defecto es false. Si se deja en false, el modelo elige la duración. Si se establece en true, se obtienen diez segundos. No hay un campo numérico de duración, por lo que el rango anunciado de cinco a veinte segundos es una afirmación a nivel del modelo que la superficie de solicitud pública no permite controlar salvo eligiendo uno de dos modos.

A screenshot of the HiHarness documentation page for the HiDream-O Series video models, captured 10 October 2026, describing HiDream-O1-Video-1.0 as a single-image-to-video model that generates a video from one reference image and a text prompt, with Model ID HiDream-O1-Video-1.0, input as one reference image by public URL or Base64, output of one video, resolution that preserves the input aspect ratio, a dynamic or fixed ten-second duration, and an asynchronous workflow of submitting a task and polling the result endpoint until result.status is 1.

Hay un detalle de implementación en ese contrato de respuesta que afectará a cualquier integración escrita imitando otras API de video. result.status = 1 significa que cada subtarea ha alcanzado un estado terminal — no que la generación haya tenido éxito. Aún hay que leer sub_task_results[].task, donde 1 es éxito, 3 es fallo de generación y 4 es un fallo de revisión de seguridad. Un cliente que trate terminal como exitoso te entregará una URL de video que no existe.

El precio, en contexto

A los 5,80 $ por minuto que registra Artificial Analysis, HiDream V1 tiene un precio medio para su categoría, más que barato. Dentro de los seis primeros del ranking, es más barato que MiniMax H3 (7,80 $) y Dreamina Seedance 2.0 (9,07 $), y más caro que MiniMax H3 Max y Vidu Q4 Preview. Frente a los modelos con los que se lo comparará con más frecuencia, la diferencia es mayor: Google Veo 3.1 cuesta 24,00 $ por minuto, Kling 3.0 1080p Pro 20,16 $, Alibaba Wan 2.7 9,00 $ y Wan 3.0 12,00 $, mientras que Grok Imagine Video 1.5 se sitúa en 8,40 $.

Estas tarifas por minuto no son directamente comparables, porque un minuto de salida a qué resolución y con audio es exactamente lo que la documentación de la API deja sin especificar para este modelo. Trata el como punto de partida para tus cálculos en lugar de una tarifa.

Probar una vía no comprobada sin apostar un pipeline a ello

El argumento a favor de la cautela aquí no es que el modelo sea malo. Es que una superficie de servicio propia de la era de vista previa —un tipo de entrada, un interruptor de duración, un indicador terminal de dos estados— es el lugar equivocado para codificar de forma rígida una ruta de producción. HiDream-O1-Video-1.0 no es un modelo que sirvamos en OrcaRouter hoy, así que nada de lo que sigue es una afirmación sobre alojarlo: el lugar donde nuestro producto realmente ayuda es en el otro lado de la decisión, donde quieres probar una nueva ruta de video frente a una opción ya establecida y poder abandonarla en cualquier momento. Un único endpoint compatible con OpenAI para más de 200 modelos, conmutación por error automática para que una ruta que empieza a fallar en silencio no sea la ruta que pongas en producción, precios de lista de los proveedores traspasados sin añadir ningún margen, y un DSL de enrutamiento que te permite comparar dos modelos dentro de una sola solicitud en lugar de dos integraciones. Nada de eso requiere específicamente el modelo de HiDream.

¿Qué cambiaría esta pieza?

Tres acontecimientos cambiarían el panorama, en orden decreciente de probabilidad.

Primero, un contrato de servicio más amplio. Si HiHarness añade un campo de vídeo de referencia, un selector de resolución o controles de audio documentados, la brecha entre el anuncio y la API se cierra y las afirmaciones sobre 1080p y texto a vídeo se vuelven comprobables. Eso es un cambio de documentación, no un cambio de modelo, y podría llegar cualquier semana.

En segundo lugar, el tablero AA-Video-I2V v2.0. Artificial Analysis ha dicho que está en camino, alineado con la taxonomía T2V v2.0 y con 1080p en todo. Un tablero exclusivo de 1080p sería el primer entorno independiente en el que la afirmación sobre la resolución de HiDream V1 significaría algo — y si el modelo sigue sin poder incluirse en el tablero de texto a vídeo bajo la nueva taxonomía, su ausencia allí se convierte en un hallazgo sustantivo en lugar de un artefacto de las antiguas categorías.

Tercero, el tamaño de la muestra. 3.231 votos es una medición real y reciente, la más exigua entre los seis primeros. El intervalo ahora es de ±10 y se estrechará en la dirección que los votantes lo empujen. Cualquiera que cite «sexto» como un hecho consolidado debería decir la fecha en que lo leyó, porque el sexto puesto es un empate dentro de un empate a seis bandas.

La pregunta que vale la pena conservar no es si HiDream-O1-Video-1.0 es competitivo —en el único ranking donde puede medirse, lo es claramente, y a un precio por minuto defendible—. Es si el modelo que finalmente llegue a una API amplia es el que se anunció. Según la documentación actual, esos siguen siendo dos productos diferentes.

HiDream-O1-Video-1.0 no es una de las rutas que servimos hoy, pero el mismo tipo de superficie está detrás de más de 200 modelos con los precios de lista del proveedor traspasados y sin recargo añadido.