MiniMax H3 (Hailuo 3.0): El modelo de video AI 2K con Omni-Reference, explicado
Guides & Insights

MiniMax H3 (Hailuo 3.0): El modelo de video AI 2K con Omni-Reference, explicado

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

MiniMax H3 — más conocido como Hailuo 3.0 — es el modelo de generación de video por IA más nuevo de Mini​Max, presentado en WAIC 2026 (17 de julio de 2026), lanzado al público el 31 de julio y ahora disponible de cuatro maneras a la vez: la plataforma Hailuo de Mini​Max, Luma Agents, una descarga de pesos abiertos y —desde el 30 de agosto— AI Gateway de Vercel, donde también se lanzó el nuevo MiniMax H3 Max, centrado en la velocidad. Lleva la línea de video de Mini​Max a la resolución nativa 2K, añade audio sincronizado en una sola pasada e introduce un sistema de control “omni-reference” inusualmente rico. La novedad más reciente está en el lado del autoalojamiento: desde el 1 de septiembre, los pesos abiertos de H3-Base pueden servirse mediante vLLM-Omni con el FastH3 de FastVideo, lo bastante rápido como para renderizar un MP4 completo de 10,1 segundos de video y audio en unos 8,7 segundos, más rápido que su duración de reproducción. Esta guía explica qué es realmente H3, qué hay de genuinamente nuevo y dónde se sitúa entre los modelos de video de vanguardia de 2026, con las capacidades citadas y las afirmaciones de calidad claramente indicadas.

Nota de precisión: las capacidades de H3 provienen del anuncio de Mini​Max y de la documentación de su plataforma. La disponibilidad en Vercel AI Gateway está confirmada —el catálogo de modelos de Vercel incluye tanto MiniMax H3 como MiniMax H3 Max, y el registro de cambios de Vercel documenta el descuento de lanzamiento—, aunque los términos de la promoción en sí los anuncia el proveedor. La integración con Luma Agents y el lanzamiento de pesos abiertos siguen siendo solo anuncios del proveedor al momento de redactar esta nota; la documentación de producto de Luma aún no incluye H3 y los términos de acceso de la integración no están claros. La calidad de video es en gran medida subjetiva y se juzga en arenas de preferencia humana; H3 ya cuenta con puntuaciones iniciales en Artificial Analysis Arena —alrededor de 1.184 en imagen a video y 1.226 en texto a video con audio, registradas el 27 de agosto de 2026—, aunque las clasificaciones del arena cambian a medida que se acumulan votos. La cifra del 1 de septiembre sobre el serving más rápido que la reproducción —un MP4 completo de 10,1 segundos con audio sincronizado, renderizado en unos 8,7 segundos— la reporta el equipo de vLLM-Omni en su propia entrada de blog, medida en un servidor con 8× NVIDIA B300; es un benchmark del equipo que aún no ha sido reproducido de forma independiente, y mide FastH3, el adaptador destilado de cuatro pasos de FastVideo, no el modelo base completo. Trata las afirmaciones comparativas de «cuál se ve mejor» como provisionales. Las especificaciones y los precios cambian: verifica antes de construir.

TL;DR. H3 es un modelo de texto a video y de imagen a video, nativo de 2K y 24 fps, que genera clips de 5 a 15 segundos (ampliables a unos 30 s) con diálogo sincronizado, efectos de sonido y ambiente en una sola pasada. Sus características más destacadas son la omni-referencia (hasta 9 imágenes de referencia, 3 clips de video y 3 clips de audio para mantener la coherencia) y la edición basada en instrucciones (cambiar personajes, objetos, escenas, sonido o ritmo sin regenerar). Desde su lanzamiento se ha difundido rápidamente: los pesos base se abrieron al público el 3 de agosto, MiniMax anunció H3 en Luma Agents el 6 de agosto (hasta 15 segundos de video 2K con sonido estéreo nativo, aunque las condiciones de acceso aún no son públicas), y el 30 de agosto MiniMax H3 y MiniMax H3 Max llegaron al AI Gateway de Vercel con un 50% de descuento de lanzamiento durante dos semanas. Desde el 1 de septiembre, los pesos base abiertos también pueden usarse para generación en tiempo real: a través de vLLM-Omni con FastH3 de FastVideo, un MP4 completo de video y audio de 10,1 segundos se renderiza en unos 8,7 segundos — más rápido que la reproducción, según el benchmark del equipo de vLLM-Omni. Es un gran paso frente a Hailuo 2.3 (que era 1080p, ~10 s, sin omni-referencia), y compite con Kling 3.0, Google Veo 3.1, ByteDance Seedance 2.0 y otros — fuerte en control y audio, con puntuaciones iniciales de arena independientes aún por consolidarse.

Conclusiones clave

H3 = Hailuo 3.0, el último modelo de video de MiniMax, presentado en la WAIC 2026 y lanzado el 31 de julio; disponible a través de Hailuo, Luma Agents, pesos abiertos y el AI Gateway de Vercel.

• 2K nativo a 24fps, clips de 5 a 15 segundos (extensibles a ~30s), múltiples relaciones de aspecto, texto a video e imagen a video.

• Omni-reference: hasta 9 imágenes, 3 videoclips y 3 clips de audio como referencias para la consistencia de estilo, personaje, movimiento y voz.

• Diálogo sincronizado, efectos de sonido y ambiente generados en una sola pasada; edición basada en instrucciones sin regeneración completa.

• Los pesos base se publicaron como código abierto el 3 de agosto bajo una licencia comunitaria; los módulos Context-IR y de regeneración de 2K siguen siendo solo API.

• El 30 de agosto, MiniMax H3 y MiniMax H3 Max se lanzaron en el AI Gateway de Vercel con un 50% de descuento de lanzamiento hasta el 13 de septiembre.

• Desde el 1 de septiembre, los pesos abiertos de H3-Base pueden servirse para generación en tiempo real — un MP4 de video y audio de 10,1 segundos renderizado en unos 8,7 segundos, más rápido que la reproducción — mediante vLLM-Omni y FastH3 de FastVideo (punto de referencia reportado por el equipo, aún no reproducido de forma independiente).

• Gran mejora respecto a Hailuo 2.3 (1080p, ~10s); compite con Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 y más.

Qué es realmente MiniMax H3

Mini​Max es una importante empresa china de inteligencia artificial (completó una OPI en Hong Kong en enero de 2026, recaudando supuestamente unos 619 millones de dólares con una valoración de aproximadamente 4.000 millones de dólares, con el respaldo de inversores como Alibaba y Tencent). Su marca de vídeo para consumidores es Hailuo, conocida por su simulación física líder en su categoría, su generación rápida y sus precios accesibles. H3 es el modelo de tercera generación de Hailuo, presentado junto con el modelo de texto M3 de Mini​Max y otras soluciones multimodales en la WAIC 2026 y lanzado al público el 31 de julio de 2026. Mientras que M3 es un LLM de texto/agente, H3 es claramente un modelo de generación de vídeo.

Novedades: 2K, referencia omnidireccional y audio de una sola pasada

Tres cosas definen a H3. Primero, 2K nativo a 24 fps — un avance respecto al 1080p de Hailuo 2.3 — a cadencia cinematográfica, con clips de 5 a 15 segundos (ampliable hasta unos 30 segundos mediante una herramienta Extend) y relaciones de aspecto de 21:9 a 9:16. Segundo, omni-reference: puedes ingresar hasta 9 imágenes de referencia, 3 clips de video y 3 clips de audio simultáneamente para fijar estilo, identidad del personaje, movimiento o voz — una superficie de control inusualmente generosa para mantener un personaje o apariencia consistente entre tomas. Tercero, audio sincronizado en una sola pasada: H3 genera diálogo, efectos de sonido y atmósfera ambiente sincronizados con la acción en pantalla, en lugar de requerir un paso de audio separado.

edición basada en instrucciones

Una característica discretamente importante es la edición basada en instrucciones: en lugar de regenerar un clip desde cero para hacer un cambio, puedes describir una edición — intercambiar un personaje, alterar un objeto, cambiar la escena, ajustar el sonido o reajustar el ritmo del plano — y H3 la aplica. Para el trabajo creativo iterativo, editar en el lugar en lugar de volver a tirar los dados en una generación nueva es una verdadera ventaja de flujo de trabajo.

Cómo se compara con Hailuo 2.3

El salto generacional es claro: H3 pasa de 1080p a 2K nativo, extiende la longitud máxima de una sola generación de unos 10 segundos a 15 (con una extensión de 30 segundos) y añade tanto entradas de referencia omni como edición basada en instrucciones, algo de lo que carecía 2.3. Si usaste Hailuo 2.3, H3 es una mejora directa en resolución, longitud, control y audio.

Donde se sitúa H3 en la frontera de 2026

H3 ahora presenta puntuaciones tempranas de la arena de Artificial Analysis — aproximadamente 1.184 en imagen a video y 1.226 en texto a video con audio, recopiladas el 27 de agosto de 2026 — aunque las clasificaciones de la arena cambian a medida que se acumulan los votos, así que evalúalo con tus propios prompts de prueba en lugar de basarte en una sola afirmación.

Una nota sobre O​penAI Sora

Si estás mapeando el campo: OpenAI descontinuó las experiencias web y de aplicación de Sora en abril de 2026, con su API programada para finalizar en septiembre de 2026 — por lo que Sora no es un modelo sobre el cual iniciar nuevos flujos de trabajo de video. La frontera activa es el conjunto anterior, y H3 se une a él.

Cómo acceder a H3 y al resto del campo

H3 ahora se puede alcanzar de cuatro maneras, y esa lista ha crecido desde el lanzamiento.

• Hailuo (la plataforma propia de Mini​Max): el producto completo, incluida la edición basada en instrucciones y el escalado H3-Regenerate-2K a 2K.

• Luma Agents: Mini​Max anunció el 6 de agosto de 2026 que H3 ya está disponible en el producto Agents multimodelo de Luma, generando hasta 15 segundos de video 2K con sonido estéreo nativo. Esto es anunciado por el proveedor, y los términos de acceso aún no son públicos — los documentos del producto de Luma no incluyen H3 al momento de escribir esto — por lo que se espera que los detalles de precios y elegibilidad se definan en breve. Que Luma aloje un modelo de video de un rival dentro de su propio producto Agents es una señal de lo intercambiable que se ha vuelto el mercado de modelos de video en 2026.

• Vercel AI Gateway: el 30 de agosto de 2026, MiniMax y Vercel anunciaron que tanto MiniMax H3 como MiniMax H3 Max están disponibles a través de AI Gateway de Vercel, con solicitudes facturadas mediante la puerta de enlace con un 50 % de descuento desde el 30 de agosto hasta el 13 de septiembre de 2026. Los ID de modelo — minimax/minimax-h3 y minimax/minimax-h3-max — no cambian, por lo que las integraciones existentes de la puerta de enlace reciben la tarifa con descuento sin ningún cambio de código. La disponibilidad está confirmada en el catálogo de modelos y en el registro de cambios de Vercel; los términos de la promoción son anunciados por el proveedor.

• Pesos abiertos: el 3 de agosto de 2026, Mini​Max publicó los pesos base de H3 —un transformer denso de 33B, H3-Base— en Hugging Face y ModelScope bajo la Licencia Comunitaria MiniMax H3, como dos checkpoints: H3-Base-FL2VA para la generación de texto a video/audio y fotogramas clave, y H3-Base-Ref2VA para la generación basada en referencias. Dos de los tres módulos del sistema —H3-Context-IR (el preprocesador de prompts) y H3-Regenerate-2K (el upscaler a 2K)— no están incluidos en la versión abierta y siguen siendo solo API, por lo que las ejecuciones autoalojadas se limitan a menos de 2K. Y desde el 1 de septiembre, los mismos pesos base se pueden servir para generación en tiempo real mediante vLLM-Omni y FastH3 de FastVideo —un adaptador destilado de cuatro pasos que genera un MP4 completo de video y audio de 10,1 segundos en unos 8,7 segundos en un servidor con 8× NVIDIA B300, más rápido que su duración de reproducción (según el equipo, aún no reproducido de forma independiente).

MiniMax H3 está en OrcaRouter al precio de lista del proveedor — $0.08 por segundo a 768p y $0.13 por segundo a 2K — se pasa con un margen del 0% y conmutación automática por error, así que puedes llamar a la familia H3 a través de una API compatible con O​penAI en lugar de conectar un endpoint de proveedor que tiene apenas unos días. Como ningún proveedor aloja todos los modelos, el patrón práctico es canalizar el tráfico de tu LLM y de tus agentes a través de un solo endpoint (OrcaRouter también transporta el modelo de texto M3 de la propia Mini​Max) y usar directamente el mejor modelo de video para cada proyecto. MiniMax H3 Max aún no está enrutado en OrcaRouter — por ahora se sirve a través de canales de terceros — así que si estás creando prototipos con él, el hábito de la conmutación por error da sus frutos: prueba un modelo de hace unos días sin apostar un pipeline de producción en él.

Servicio en tiempo real: vídeo más rápido que la reproducción

El desarrollo detrás de esta actualización está en el lado del autoalojamiento. El checkpoint base abierto de MiniMax H3 es un transformer denso de 33B, y generar un clip de la manera estándar implica ejecutar aproximadamente 49 pasadas hacia adelante del transformer de difusión a través de un largo esquema de eliminación de ruido. FastVideo, el proyecto de código abierto de entrenamiento e inferencia de video, publicó un modelo alumno destilado de H3-Base llamado FastH3: un modelo de cuatro pasos (estilo DMD2) que reutiliza el codificador de texto, el VAE de video, el VAE de audio, los tokenizadores y los schedulers de H3, pero reduce el bucle de eliminación de ruido a cuatro pasadas de transformer en cinco posiciones sigma. vLLM-Omni, el runtime de servicio multimodal, fusiona el adaptador FastH3 en el momento de la carga (pull request #6714) y lo expone a través de un endpoint /v1/videos compatible con O​penAI, junto con su soporte anterior para H3-Base.

La cifra principal se mide en hardware de gran tamaño. En un servidor 8× NVIDIA B300 a 1344×768 y 24 fps, el equipo de vLLM-Omni informa de un MP4 completo de 10,1 segundos —vídeo y audio sincronizado— renderizado de extremo a extremo en unos 8,7 segundos, más rápido que su duración de reproducción. Se trata de un benchmark reportado por el equipo, publicado el 1 de septiembre de 2026 y aún no reproducido de forma independiente; el propio equipo señala que el paquete bruto del benchmark sigue pendiente de publicación y no hace ninguna afirmación de paridad de calidad entre la versión base y FastH3. En hardware más modesto las cifras son menos espectaculares —la receta comunitaria también cubre configuraciones de 2× RTX 5090 y de una sola GPU— y FastH3 v1 solo cubre la generación de texto a vídeo-audio (T2VA), a 1344×768 en lugar de los 2K que siguen en el lado de la API.

Para un lector, esto cambia lo que puede significar “autoalojar H3”. Antes, los pesos base abiertos funcionaban, pero lentamente; bien para trabajo por lotes, no para algo interactivo. Con FastH3 en vLLM-Omni, un pipeline de H3 local puede procesar un clip de diez segundos en mucho menos que la duración del clip, que es el umbral donde los bucles de producto en tiempo real — previsualización en vivo, iteración rápida de tomas, video impulsado por agentes — se vuelven prácticos. Si prefieres no ejecutar un servidor de ocho GPU, la ruta administrada no cambia: MiniMax H3 está en OrcaRouter al precio de lista del proveedor, con un traspaso sin margen de beneficio y con conmutación automática por error, de modo que puedes llamar a la familia H3 a través de una sola API compatible con O​penAI sin ser dueño del hardware.

Tres escenarios donde H3 destaca

1. Cortometrajes con personajes y estilo consistentes

Omni-reference (hasta 9 imágenes, 3 clips, 3 audios) está diseñado para mantener coherentes un personaje, su apariencia y su voz a través de múltiples tomas — ideal para cortometrajes narrativos y contenido episódico.

2. Creativos sociales y publicitarios con sonido.

Diálogo sincronizado en una sola pasada, efectos de sonido y ambiente, además de relaciones de aspecto flexibles (9:16 a 21:9), se adaptan a flujos de trabajo rápidos en redes sociales y publicidad que necesitan audio terminado, no solo imágenes.

3. Edición creativa iterativa

La edición basada en instrucciones permite a los equipos refinar un clip de manera descriptiva en lugar de regenerarlo, lo que acelera la producción con muchas revisiones.

Preguntas frecuentes

¿Qué es MiniMax H3?

H3 es Hailuo 3.0, el último modelo de generación de video con IA de Mini​Max, presentado en WAIC 2026 (17 de julio de 2026) y lanzado el 31 de julio de 2026. Produce video nativo de 2K a 24 fps con audio sincronizado, a partir de texto o imágenes, con control de referencia omni y edición basada en instrucciones.

¿Es H3 lo mismo que MiniMax M3?

No. M3 es el LLM de texto/agentes de MiniMax; H3 (Hailuo 3.0) es su modelo de generación de video. Se presentaron en el mismo evento, pero cumplen funciones diferentes.

¿Dónde puedo usar H3 ahora?

Cuatro lugares: la plataforma Hailuo de Mini​Max (el producto completo), el AI Gateway de Vercel (tanto H3 como MiniMax H3 Max, con un 50 % de descuento de lanzamiento hasta el 13 de septiembre), Luma Agents (anunciado el 6 de agosto de 2026 — hasta 15 segundos de video 2K con sonido estéreo nativo, términos de acceso aún sin aclarar), y el autoalojamiento mediante los pesos abiertos H3-Base en Hugging Face y ModelScope — que, desde el 1 de septiembre, puede servirse a una velocidad superior a la de reproducción a través de vLLM-Omni con FastH3 de FastVideo (un MP4 de 10,1 segundos de video y audio en unos 8,7 segundos en 8× B300, según el equipo de vLLM-Omni). El modelo base también se enruta en OrcaRouter al precio de lista del proveedor.

¿Cuánto duran y qué resolución tienen los clips H3?

Native 2K a 24 fps, de 5 a 15 segundos por generación, extensible hasta unos 30 segundos, en relaciones de aspecto desde 21:9 hasta 9:16.

¿Qué es omni-reference?

Un sistema de control que acepta hasta 9 imágenes de referencia, 3 videoclips y 3 clips de audio a la vez para mantener consistentes el estilo, el personaje, el movimiento y la voz.

¿Es H3 mejor que Kling 3.0 o Veo 3.1?

Depende del eje. Kling 3.0 ofrece 4K nativo y lidera algunas arenas; Veo 3.1 es fuerte en diálogo de 48 kHz. H3 enfatiza el control de referencia omni, audio de una sola pasada, edición y precio. H3 tiene puntuaciones tempranas de Artificial Analysis arena (alrededor de 1,184 de imagen a video y 1,226 de texto a video con audio a finales de agosto) que cambiarán a medida que se acumulen votos: prueba con tus propios prompts.

¿Es H3 de peso abierto?

En parte. Mini​Max publicó los pesos base de H3 como código abierto el 3 de agosto de 2026 — un transformer de 33B lanzado en Hugging Face y ModelScope bajo la Licencia Comunitaria MiniMax H3, con los checkpoints FL2VA y Ref2VA. Según los términos de la licencia de Mini​Max, el lanzamiento restringe las regiones de despliegue y se extiende a los resultados generados, con atribución obligatoria. Los dos módulos que completan la experiencia insignia — H3-Context-IR (preprocesamiento de prompts) y H3-Regenerate-2K (el escalado a 2K) — no están en el lanzamiento de código abierto y siguen siendo solo API. Desde el 1 de septiembre, los pesos base abiertos también pueden servirse para generación en tiempo real a través de vLLM-Omni y FastH3 de FastVideo (FastH3 v1 cubre únicamente la conversión de texto a video y audio). Así que sí para el modelo base, con salvedades.

En resumen

MiniMax H3 (Hailuo 3.0) supone un serio paso adelante para la línea de video de MiniMax: 2K nativo, audio sincronizado en una sola pasada, amplio control de omni-referencia y edición basada en instrucciones, a un precio accesible. Desde su lanzamiento, también se ha vuelto drásticamente más accesible: se enruta por OrcaRouter al precio de lista del proveedor, se ejecuta dentro de Luma Agents, sus pesos base están abiertos para autoalojamiento (y desde el 1 de septiembre es lo bastante rápido como para renderizar un clip de 10,1 segundos más rápido de lo que tarda en reproducirse, mediante vLLM-Omni y FastH3 de FastVideo), y tanto él como MiniMax H3 Max están ahora en AI Gateway de Vercel con un 50 % de descuento de lanzamiento durante dos semanas. No superará automáticamente en resolución a los rivales que apuestan por 4K nativo, y sus primeras puntuaciones en la arena aún se están consolidando, pero en control, audio y velocidad de iteración es convincente. Evalúa H3 contra Kling 3.0, Veo 3.1, Seedance 2.0 y el resto con tu propio material, y mantén tu stack de modelos más amplio neutral en cuanto al proveedor mediante un único endpoint como OrcaRouter.