
Cómo usar MiniMax H3: prompts, ejecuciones locales y audio que no sea basura
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
El 4 de agosto, Simon Willison descargó aproximadamente 115 GB de pesos, apuntó un puerto MLX no oficial de MiniMax H3 a su MacBook Pro M5 Max, y pidió un zorrillo de colores arcoíris saltando sobre un tronco cubierto de musgo en un supermercado. Poco menos de 45 minutos después tenía un clip que describió como genuinamente impresionante — con una pista de audio que describió como basura extraña, similar al habla. Su propio diagnóstico fue la parte útil: no le había dado ninguna indicación de audio al modelo, y no había leído primero la guía de instrucciones. Ese es el resumen más breve posible de lo que es empezar a usar H3, también vendido como Hailuo 3.0. La imagen llega más o menos gratis. Todo lo demás — el sonido, el ritmo de los planos, el 2K, el personaje que tiene que sobrevivir cuatro tomas seguidas — tienes que pedirlo explícitamente, en un formato más estricto que casi cualquier otro modelo de video en uso actualmente.
Esta es una guía de uso, no una cobertura de lanzamiento. Tres niveles de fuentes recorren el documento y se etiquetan en cada ocasión: su propia documentación (la ficha del modelo, las dos guías de redacción de prompts incluidas en el repositorio y la documentación de la API de la plataforma); hallazgos de la comunidad, de personas que realmente lo han ejecutado — los mantenedores de ComfyUI, evaluadores independientes, documentación de revendedores e hilos de discusión de Hugging Face, todos fechados entre el 31 de julio y el 5 de agosto de 2026 —; y un pequeño número de casos en los que hemos leído nosotros mismos un archivo primario y así lo indicamos. Las cifras de la comunidad son informes individuales sobre hardware no controlado, salvo que se indique lo contrario. Cuando los profesionales discrepan entre sí, se informa de la discrepancia en lugar de resolverla.
Antes que nada: probablemente no estás ejecutando el modelo completo.
La mayor parte de la confusión en la primera semana de H3 se debe a un hecho estructural que el texto de marketing difumina. H3 no es un modelo único. Según su ficha de modelo, es un sistema de tres partes, y solo la parte central se publicó como código abierto:
• H3-Context-IR — un preprocesador de instrucciones multimodales. Lee tu texto, imágenes, audio y video, razona sobre cómo se relacionan y emite una representación estructurada y semánticamente enriquecida de lo que has pedido. Solo API alojada. Se expone como su propio tipo de tarea que devuelve un prompt enriquecido y ningún video.
• H3-Base — el modelo de generación de 33B parámetros que realmente genera fotogramas y sonido. Esta es la parte de pesos abiertos.
• H3-Regenerate-2K — una pasada de regeneración en contexto que eleva el resultado de 768p a 2K. Solo API alojada.
Dos consecuencias se derivan de inmediato, y deciden todo tu flujo de trabajo. Primero, la generación local tiene un techo de 768p. El lienzo nativo de H3 tiene un borde corto de 768 píxeles, limitado a 768×1344 — aproximadamente 1344×768 para 16:9. Si tu salida de ComfyUI no es 2K, nada está roto; el paquete que descargaste es H3-Base, y el módulo de upscaling no está en él. Segundo, la API alojada corregirá un prompt descuidado y tu instalación local no lo hará. Todo lo que Context-IR hace en una llamada de API de pago — inferir la estructura, resolver qué referencia significa qué, completar las partes que dejaste vagas — es un paso que ahora realizas a mano, o con otro modelo, antes de que H3-Base vea tus palabras. Esa única asimetría explica la mayoría de los informes de «el mismo prompt funciona en Hailuo pero se ve roto en ComfyUI».

Cabe destacar del propio repositorio: los pesos llevan una etiqueta minimax-h3-community-license-agreement en lugar de Apache o MIT (más sobre esto a continuación, porque es la parte que decide si puedes distribuirlo o no), el modelo figura con 33B parámetros en F32/BF16, y a día de hoy exactamente un proveedor de inferencia — fal — figura sirviéndolo. Veintitrés finetunes, veinte cuantizaciones y treinta y un Spaces ya existen sobre él, lo cual es una señal bastante clara de lo rápido que se movió la comunidad.
El formato del prompt: bloques de toma, no códigos de tiempo
Aquí es donde la comunidad y la documentación están abiertamente en conflicto, y esto importa más que cualquier otra cosa en este artículo.
La plantilla que se difundió más rápido —a través de Reddit, luego en varias guías publicadas— divide el clip en corchetes de código de tiempo: [0s-2s], [2s-5s], y así sucesivamente, seguido de una estructura de seis bloques: contrato de estilo, cronología, cámara, audio, texto deletreado y una lista negativa. Se dedujo mediante ingeniería inversa al leer los 45 ejemplos de indicaciones que la empresa envió, y no es un disparate: esos ejemplos en realidad son listas de tomas con una hoja de señales de sonido adjunta, con una longitud mediana de unos 130 caracteres chinos y los más largos llegando a 657 y 858 caracteres.
Pero el propio VIDEO_PROMPT_WRITING_GUIDE_base_en.md de la empresa, que se encuentra en la carpeta docs del repositorio, prescribe algo diferente. Organiza por bloque de tomas, no por rango de tiempo. Lo leemos directamente; la estructura que pide es:
• Instrucciónreglas de alineación de imagen, utilizadas para los modos de fotograma clave (I2VA, FL2VA, L2VA) y omitidas para texto a video puro.
• descripción multimodal integrada — el cuerpo principal, dividido en [Toma 1], [Toma 2], y así sucesivamente.
• overall_soundscape — de una a cuatro oraciones de sonido diegético.
• non_diegetic_music — de una a tres frases de música.
En ese marco, las convenciones son lo bastante específicas como para poder comprobarse.[Shot 1] no lleva ninguna marca de tiempo — las tomas posteriores se abren con un corte absoluto, formulado como «At 00:03.500, the camera cuts to…». El movimiento de cámara se escribe como tipo de movimiento más amplitud más velocidad, expresado en inglés natural en lugar de apilarse como etiquetas: a small-amplitude slow push-in, no camera: dolly-in, slow. Los movimientos disponibles son el conjunto habitual — zoom, pan, tilt, tracking, arc, POV y shake en variantes ligeras o fuertes. El diálogo se envuelve en etiquetas: <d>[English] Get in the car.</d>, con la puntuación preservada exactamente y nunca traducida ni parafraseada. Los hablantes reciben identificadores estables — (S1), (S2) y (S1,S2) para una línea conjunta — con edad, género, timbre y acento descritos en la primera aparición. La voz en off se marca como una línea fuera de pantalla con una nota explícita de que los labios permanecen cerrados, que es como se evita que el modelo sincronice los labios con la narración sobre un rostro. Las conversaciones en corte cruzado usan un <scenetrans> marcador más una declaración de continuidad.
Las prohibiciones explícitas de la guía son tan informativas como sus reglas: no pongas marca de tiempo al primer disparo, no repitas diálogos, cantos ni música en pantalla dentro de overall_soundscape, no uses palabras abstractas de estado de ánimo en non_diegetic_music, y nunca reescribas una línea de diálogo. Y una ausencia notable — la guía oficial no tiene ninguna sección de prompt negativo, lo que significa que la lista de "transiciones prohibidas" en la plantilla popular de la comunidad es un invento de la comunidad, no una característica documentada.
¿Qué tan en serio tomar el conflicto? En una discusión de Hugging Face en el repositorio H3, un miembro de la comunidad publicó la estructura de estilo marca de tiempo como guía y otro practicante respondió sin rodeos que había usado una estructura similar, que estaba completamente equivocada, y que la gente debería leer el manual incluido. Eso es una persona contradiciendo a otra, no una decisión de un mantenedor. Nuestra lectura de la evidencia: ambos funcionan a través de la API alojada, porque Context-IR normaliza lo que sea que le envíes; solo el formato documentado es confiable directamente contra H3-Base. Si estás ejecutando pesos locales, sigue el archivo en el repositorio. Si estás en la API y un aviso de marca de tiempo te está dando buenos clips, el preprocesador está haciendo ese trabajo por ti, y no deberías concluir que el formato es lo que lo logró.
Compilando un brief perezoso al dialecto de H3
Toma el prompt de doce palabras de Willison como entrada: una mofeta de colores arcoíris saltando sobre un tronco cubierto de musgo en un supermercado. Escrito de la manera documentada, eso se convierte aproximadamente en: un [Toma 1] bloque que comienza nombrando el estilo (acción real, cámara en mano, iluminación fluorescente) y el encuadre (un pasillo de supermercado, un tronco cubierto de musgo atravesando el linóleo, estanterías que se alejan), luego el sujeto y la acción en orden físico — dos pasos sigilosos, una agachada, el salto, el aterrizaje — con la cámara como un movimiento de travelling lento y de baja amplitud que termina al otro lado del tronco; un overall_soundscape de garras sobre linóleo, el roce húmedo del tronco, un zumbido de refrigeración y ruedas de carrito a lo lejos; y una non_diegetic_music línea de una breve y ligera pieza de cuerdas pulsadas sin voces. Nada de eso es genio creativo. Es la misma idea, con las cuatro cosas que H3 pide realmente proporcionadas — y es la diferencia entre un tono de sala no solicitado y una banda sonora que diseñaste.
Este paso es mecánico, repetitivo y un mal uso de un humano, que es exactamente por lo que la empresa lanzó una herramienta para ello que casi ninguna cobertura ha recogido. El repositorio contiene un directorio skills de nueve habilidades de agente, y la primera — h3-prompt-writing — hace precisamente esto: toma una solicitud y escribe un prompt H3 estructurado en los cinco modos de generación, completo con las secciones de paisaje sonoro y música. Las otras ocho son recetas de género (anuncio de producto, corto animado en 3D, explicador de papercraft, subtítulos de videoclip, intro de juego cooperativo, híbrido de acción real dibujado a mano, y así sucesivamente) que envuelven el mismo formato en un flujo de trabajo.
Ejecutar esa habilidad necesita un modelo de texto, no un modelo de video, y aquí es donde un enrutador es genuinamente útil en lugar de un complemento. El LLM propio de la compañía, MiniMax M3, es una opción sensata para el trabajo y está en OrcaRouter a $0.30 por millón de tokens de entrada y $1.20 por millón de salida — precio de lista del proveedor, ya que lo transmitimos con un margen del 0% — con una ventana de contexto de 1M de tokens y, inusualmente, video como tipo de entrada aceptado. Ese último detalle es lo que lo hace encajar: puedes entregarle la guía oficial de prompts, tu brief y un clip de referencia real en una sola llamada, y recibir el bloque [Shot N] que lo describe. Compilar un prompt cuesta una fracción de centavo frente a la generación de video que se factura por segundo, así que no hay razón para escribir estos a mano. Dos advertencias honestas: la generación de video H3 en sí no se ejecuta en OrcaRouter — los clips provienen de la plataforma de la compañía, fal, o tu propia GPU — y el paso de compilación es una conveniencia, no una garantía de calidad. Lo que el enrutador te aporta aquí es que la mitad de texto del pipeline queda detrás de una sola clave con conmutación automática por error, de modo que una caída del proveedor a mitad de lote no deje varada una cola de renderizado, y cambiar M3 por un modelo diferente para comparar prompts compilados es un cambio de cadena, no un nuevo contrato.

El audio es donde todos pierden el primer día.
El modo de fallo más corroborado en la primera semana es el que Willison encontró: deja el sonido sin especificar y H3 inventa algo, mal. Obtuvo ruido similar al habla a partir de un prompt sin indicación de audio. El análisis de ingeniería inversa de los ejemplos oficiales informa de la misma clase de fallo en una forma más atenuada — omitir el bloque de audio y el modelo produce un tono de ambiente no solicitado — y enmarca estos casos como ausencias en lugar de errores, que es la forma correcta de pensar en un modelo conjunto de audio y video. Siempre está generando una banda sonora. Tu única opción es si la especificas.
Combinando la orientación de la guía oficial de prompts con lo que la documentación de revendedores y los revisores informan que funciona realmente:
• El diálogo es lo más difícil de conseguir. Limita las líneas habladas a una o dos frases por cada cinco segundos de clip. Las líneas demasiado largas provocan una entrega apresurada, audio que se extiende más allá del último fotograma o una sincronización labial forzada — tal como reportan de forma consistente los revisores.
• Describe al hablante antes de la línea y la forma de decirla junto con ella. Edad, género, timbre y acento en la primera aparición según la guía oficial; notas de entrega simples y directas (con claridad, calidez, de forma plana) en lugar de instrucciones de interpretación elaboradas, que según se informa degradan la sincronización.
• Vincule cada efecto a un evento visible."Un pop de corcho exactamente cuando el corcho vuela" en lugar de "sonido: un pop". Las palabras como, cuando y entonces son las que llevan la sincronización.
• Describe la música brevemente por género, tempo, estado de ánimo e instrumentación — nunca por artista ni canción. Agrega "no vocals" cuando la imagen debe liderar; es una forma documentada de mantener la mezcla limpia.
• Apila la ambientación en una sola cláusula. Lluvia sobre cristales, un murmullo bajo de conversación, el tintineo ocasional de una taza, jazz suave de fondo — apilados en una sola frase en lugar de enumerados.
• No repitas el diálogo en la sección de paisaje sonoro. Una prohibición explícita en la guía oficial; se pretende que las secciones sean disjuntas, y repetir una línea allí es una manera de conseguirla dos veces.
• Si una palabra debe ser legible en pantalla, escribe la palabra entre comillas. Los revisores informan que las cadenas especificadas se muestran correctamente, mientras que las solicitudes vagas ("HUD elements", "a sign") se convierten en ruido con forma de letras.
Donde el audio realmente cumple, según varios revisores, es en el sonido físico concreto — foley y efectos vinculados a algo visible — y el ambiente. Es más débil en solicitudes abstractas o atmosféricas. Las escenas con varios hablantes suelen necesitar edición para que el orden de los hablantes quede bien, y la calidad de pronunciación varía según el idioma, así que prueba tu idioma de destino en un clip desechable antes de comprometer un proyecto a ese idioma. Varios revisores también señalan el techo honesto: el sonido es suficientemente bueno para distribución en redes sociales y, en general, no lo bastante bueno para publicarse como mezcla de emisión o anuncio pagado sin reemplazo. Nada de eso es orientación del proveedor; es lo que reportan los profesionales.
Referencias: dale a cada archivo una función
El sistema de referencia de H3 es su diferenciador más fuerte y el lugar donde los errores de configuración son más comunes. Los límites documentados, de la documentación de la API de la plataforma: hasta 9 imágenes, 3 videoclips y 3 clips de audio, con un máximo de 12 archivos en total, con cada video o audio de referencia entre 2 y 15 segundos y el total entre ellos sin exceder los 15 segundos. La referencia a video requiere al menos una imagen o un video; el audio por sí solo no se acepta.
La técnica en la que coinciden tanto la guía de referencia oficial como los informes de la comunidad es etiquetar cada entrada y asignarle un trabajo. Referencia por etiqueta en el orden exacto en que se adjuntaron los archivos — <Picture 1>, <Video 1>, <Audio 1> — y luego indica en el prompt qué referencia controla qué propiedad: identidad, estilo, movimiento, cámara o voz. Los prompts de ejemplo oficiales comienzan exactamente así, declarando que la imagen uno es la referencia de estado de ánimo y estilo general y la imagen dos es el personaje principal. Los profesionales informan que la asignación explícita funciona sustancialmente mejor que tirar nueve imágenes y esperar.
Dos detalles que les cuestan renders a la gente:
• <Picture 1> no es un mood board — es el primer fotograma literal en el segundo 0.000, y pertenece al [Shot 1]. Describe qué hay en él (estilo, sujetos, composición, anclajes de escena) antes de describir la acción que se deriva de él. Trátalo como un fotograma fijo que estás animando, no como una pista.
• Hay dos checkpoints separados, y usar el equivocado falla silenciosamente. fl2va maneja el trabajo de texto a video y de primer/último fotograma; ref2va maneja la referencia a video. Este es el error de ComfyUI más reportado: el grafo R2V se ejecuta con el modelo FL2VA aún seleccionado. También vale la pena saber que un comentarista en el anuncio de ComfyUI señala que la plantilla R2V incluida solo expone dos ranuras de referencia de imagen, aunque el modelo acepta nueve: una limitación de la plantilla, no del modelo.
En el lado alojado, dos notas prácticas más de la documentación para revendedores: la ratio es un parámetro obligatorio en los endpoints ref2va y no se puede dejar como "adaptive", y los trabajos superpuestos devuelven un 429 por concurrencia de tareas en lugar de hacer cola, así que procesa en lotes secuencialmente o crea tu propia cola. Localmente, ref_image_size tiene como valor predeterminado match, que es más rápido; max conserva un borde corto de hasta 2048 píxeles en la referencia y cuesta tiempo.
Lo que realmente cuesta una ejecución local en tiempo de reloj
Descargar el repositorio oficial completo son 498 GB, y el espejo reempaquetado de ComfyUI es de 343 GB. No necesitas ninguno de ellos por completo. Los cuatro archivos que el propio tutorial de ComfyUI enumera para texto a video y de imagen a video suman aproximadamente 42.5 GB:
• Modelo de difusión — minimax_h3_fl2va_pruned_int8_convrot.safetensors, 20.97 GB, en models/diffusion_models.
• Codificador de texto — qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors, 15.69 GB, en models/text_encoders.
• Video VAE — minimax_h3_video_vae_fp16.safetensors, 5.21 GB, en models/vae.
• Audio VAE — minimax_h3_audio_vae_fp32.safetensors, 0.61 GB, también en models/vae.
• Añadir para referencia a video — minimax_h3_ref2va_pruned_int8_convrot.safetensors, otros 20.97 GB.
". Actually the user's message ends at "fidelity." There are no numbered markers. So I just translate. But the instruction is specific: "ANY text inside a {{KEEP}}...{{/KEEP}} span must be reproduced EXACTLY as-is (do not translate it)." There is no such span. Also "Preserve URLs and brand/product names." Brand names: ComfyUI, AdaLN, int8, bf16, GB, VRAM. I should preserve those. Let me produce a natural Spanish translation. Text: "That 42.5 GB is not a VRAM figure — it is disk, and the pieces are streamed and offloaded." Translation: "Esos 42,5 GB no son una cifra de VRAM: es espacio en disco, y las partes se transmiten y se descargan." Hmm, "streamed and offloaded" — streamed (transmitidas en flujo) and offloaded (descargadas a la CPU/desplazadas). In ML context, "streamed" means pieces are loaded on the fly. "Offloaded" means moved out of VRAM to system RAM or disk. Maybe: "las piezas se transmiten en streaming y se descargan/desplazan". Let me use "se transmiten por streaming y se desplazan" or "se transmiten y se descargan". To be clear: "y las piezas se transmiten y se descargan". But "offload" in GPU context often is "descargar" but that clashes with "unload". Actually "offload" = "transferir fuera de la VRAM". I'll say "se transmiten por streaming y se descargan de la VRAM". But the original says "offloaded" without specifying. Let's do "las piezas se transmiten por streaming y se descargan." Second: "The reason the model fits on consumer cards at all is an engineering trick ComfyUI documented: roughly 40% of the parameters live in AdaLN modulation branches whose outputs can be precomputed and replaced by functionally equivalent lookup tables, taking the loaded model from 33.12B to about 20.11B with, per ComfyUI, no quality loss." Translation: "La razón por la que el modelo cabe siquiera en tarjetas de consumo es un truco de ingeniería que ComfyUI documentó: aproximadamente el 40% de los parámetros vive en ramas de modulación AdaLN cuyas salidas pueden precomputarse y sustituirse por tablas de consulta funcionalmente equivalentes, lo que reduce el modelo cargado de 33,12B a unos 20,11B sin pérdida de calidad, según ComfyUI." Third: "Full precision would be 123.6 GB." -> "En precisión completa serían 123,6 GB." Fourth: "Unpruned int8 checkpoints (34.04 GB each) and bf16 ones (66.28 GB each) exist if you are fine-tuning or chasing the last few percent of fidelity." -> "Existen checkpoints sin podar en int8 (34,04 GB cada uno) y en bf16 (66,28 GB cada uno) si estás afinando el modelo o buscando el último porcentaje de fidelidad." Need to use decimal comma in Spanish, but the original has decimal points. Usually localized numbers use comma. I'll use comma for decimals: 42,5 GB; 33,12B; 20,11B; 123,6 GB; 34,04 GB; 66,28 GB. That's standard Spanish localization. Check for any markers — none. Output only translated text. Let me finalize.Esos 42,5 GB no son una cifra de VRAM: es espacio en disco, y las piezas se transmiten por streaming y se descargan. La razón por la que el modelo cabe siquiera en tarjetas de consumo es un truco de ingeniería que ComfyUI documentó: aproximadamente el 40% de los parámetros vive en ramas de modulación AdaLN cuyas salidas pueden precomputarse y sustituirse por tablas de consulta funcionalmente equivalentes, lo que reduce el modelo cargado de 33,12B a unos 20,11B sin pérdida de calidad, según ComfyUI. En precisión completa serían 123,6 GB. Existen checkpoints sin podar en int8 (34,04 GB cada uno) y en bf16 (66,28 GB cada uno) si estás afinando el modelo o buscando el último porcentaje de fidelidad.
Se requiere ComfyUI 0.30.0 o posterior, e incluye tres plantillas: T2V, I2V y R2V. La base sobre la que convergen todas las guías y mantenedores para una primera ejecución es deliberadamente pequeña: 16:9 a 0,4 MP (864×480), 5 segundos, 20 pasos, muestreador res_multistep con el programador simple, denoise 1.0, lote 1. Obtén un MP4 de salida que contenga tanto video como audio estéreo antes de tocar la resolución o la duración. Una peculiaridad aritmética que esperar: las duraciones se ajustan a una cuadrícula de fotogramas de 17k+5, por lo que una solicitud de 5 segundos se convierte en 124 fotogramas — aproximadamente 5,17 segundos a 24 fps — y una de 10 segundos llega a 243 fotogramas, o 10,125 segundos. Las solicitudes en el rango de 5 a 15 segundos son la zona más segura.

Lo que eso cuesta en tiempo real, según informes de la comunidad (todas ejecuciones únicas, no controladas, con diferentes configuraciones — el gráfico anterior imprime cada configuración junto a su barra): una RTX 3060 de 12 GB con 32 GB de RAM del sistema y un NVMe rápido completó la línea base de 864×480 / 124 fotogramas / 20 pasos en menos de nueve minutos usando descarga dinámica. Una RTX 4090 de 16 GB para portátil con SageAttention habilitado hizo 960×540, 5 segundos, 20 pasos en 182 segundos. Una compilación NVFP4 en una sola RTX 5090 produjo un clip de 864×480 de 243 fotogramas (10.1 s) a 10 pasos en 175 segundos, alcanzando un pico de 26.9 GiB de VRAM con solo 31.7 GB de archivos en disco. La referencia del propio cookbook de SGLang — 1344×768, 124 fotogramas, 50 pasos en dos RTX 5090 con descarga por capas — tomó 559.67 segundos. Y la ruta de Apple Silicon, a través del puerto MLX no oficial, tomó poco menos de 45 minutos para un solo clip.
Notas prácticas extraídas de esos informes:
• La RAM del sistema y la velocidad del disco son fundamentales, no opcionales.En una tarjeta de 12 GB, los archivos seleccionados superan la VRAM por diseño, por lo que la ruta de descarga pasa por la RAM y luego por el SSD. En ambos informes exitosos de baja VRAM aparecen 32 GB de RAM. No existe ningún resultado verificado de 8 GB.
• SageAttention es la única aceleración gratuita — aproximadamente 2× según ComfyUI, menos si tu ejecución está dominada por el tráfico de offload. Instala el wheel que coincida exactamente con tu compilación de PyTorch y CUDA además de ComfyUI-KJNodes, luego inserta Patch Sage Attention KJ entre el cargador de UNET y el guider, y ajústalo a automático. Espera advertencias de que algunas capas H3 no son FP16/BF16; ese fallback está documentado y es normal.
• Los pasos son negociables. El benchmark 5090 ejecutó 10 y la línea base de ComfyUI ejecuta 20, mientras que la configuración de referencia de SGLang usa 50. Nadie ha publicado una curva de calidad por paso, así que encuentra tu propio mínimo antes de asumir que necesitas 50.
• Cambie una variable a la vez para salir del OOM. La recuperación documentada consiste en volver a 0.4 MP, 5 segundos, lote 1, y mover una sola perilla por intento.
• El audio silencioso significa que el VAE de audio no está conectado al nodo de salida de video. Es un fallo distinto al de un audio deficiente, y es fácil malinterpretarlo como que el modelo se niega a generar sonido.
• Apple Silicon no es oficial. La vía de Willison fue PipeNetwork/minimax-h3-mlx, un port comunitario, ejecutado mediante uv contra un archivo de requisitos de MLX. Los materiales de la propia empresa mencionan SGLang, vLLM, Diffusers y ComfyUI, con un despliegue típico de cuatro GPU en BF16, y no dicen nada sobre Metal o MPS. Considera el soporte para Mac como mantenido por la comunidad.
Local versus alojado, con los números.
Debido a que el módulo 2K y el preprocesador de indicaciones son exclusivos de la versión alojada, esto no es realmente una disyuntiva. El patrón hacia el que te empuja la arquitectura es: itera localmente a 768p donde cada intento cuesta electricidad y tres minutos, y luego compra el acabado. Un cargo por segundo está bien para la toma que conservas, pero es ruinoso para las cuarenta que desechas.
En cuanto al precio, ten cuidado, porque varía aproximadamente 2× según a quién le compres y la publicación del blog del propio proveedor no cita ninguna cifra en dólares — solo que 2K cuesta menos de un tercio de los modelos convencionales y 768p menos de la mitad del precio de los 720p de la competencia. Lo que está publicado concretamente: fal, actualmente el único proveedor de inferencia listado en el repositorio de Hugging Face, cobra $0.16 por segundo a 768p y $0.26 por segundo a 2K. Los rastreadores secundarios reportan que el precio de lista de la propia empresa es materialmente más bajo — alrededor de $0.09–$0.10 por segundo a 768p y $0.13–$0.14 por segundo a 2K — y no coinciden entre sí al centavo, así que trata esos datos como indicativos y consulta la página de precios de la plataforma antes de modelar un presupuesto. También ten en cuenta que un video de referencia se factura por su propia duración además de la salida generada.
Ejecútalo con un número real. Cien clips aprobados de ocho segundos cada uno suman 800 segundos generados: unos $112 a una tarifa de $0.14 para 2K, aproximadamente $208 a los $0.26 de fal, y alrededor de $76 si entregas en 768p al precio de lista más bajo. Los cuarenta rechazos por cada clip aprobado son lo que decide la factura, y esos son los que hay que generar localmente. Esta es también la razón por la que el precio que estás comparando debe ser honesto: en OrcaRouter, el lado de texto de ese pipeline se pasa a precio de lista del proveedor con un margen del 0%, así que cuando un proveedor baja un precio, se aplica el mismo día en lugar de después de un recálculo de margen. La generación de video, de nuevo, no es nuestra; el punto es solo que el paso de compilación no debería ser la partida en la que tengas que pensar.
Lee la licencia antes de construir un producto sobre esto.
Esta es la parte que la mayoría de las guías de "cómo usar" omiten, y para muchos lectores es la única parte que cambia una decisión. Leemos directamente el archivo LICENSE del repositorio. Los pesos se distribuyen bajo la H3 Community License Agreement, no una licencia de código abierto, y contiene términos lo suficientemente inusuales como para citarlos en sustancia:
• Territorio.La licencia define su «Territorio Aplicable» como mundial excluyendo la Unión Europea, el Reino Unido, la República de Corea y los Estados Unidos de América. Dicho sin rodeos, eso excluye a una gran parte de las personas que actualmente publican resultados de generación local — y la restricción está redactada para alcanzar los resultados, no solo los pesos.
• Atribución. El uso comercial requiere mostrar "H3" en la interfaz del producto; la licencia también anima a incluir un aviso de "Powered by H3".
• Umbral de ingresos. Las organizaciones que ganan más de 20 millones de dólares al año con productos o servicios basados en él deben obtener una autorización escrita independiente de la empresa.
• Sin destilación. No puedes utilizar H3 ni sus resultados para mejorar ningún otro modelo de IA, excepto los derivados de H3. Eso descarta la jugada estándar de datos sintéticos.
• Legislación aplicable. La RAE de Hong Kong, con jurisdicción exclusiva en los tribunales de Hong Kong.
• Un componente genuinamente abierto.El codificador de texto Qwen3-VL-32B es Apache 2.0; las restricciones anteriores se aplican a los pesos H3.
No somos tus abogados y esto no es asesoramiento legal: lee la licencia y el documento de preguntas y respuestas que la empresa incluye junto a ella, y si estás desarrollando comercialmente en un territorio excluido, busca asesoramiento legal en lugar de la interpretación de un blog. La bifurcación práctica: la API alojada es una transacción diferente con términos diferentes de la licencia comunitaria sobre los pesos, así que si la licencia local no te sirve, la vía de la API puede seguir disponible. Revisa los términos de la plataforma de la que compres.
Un plan de pruebas para la primera semana
Cinco ejecuciones, en este orden, son suficientes para saber si H3 pertenece a tu pipeline:
• Ejecución 1 — probar la fontanería. Plantilla T2V, 864×480, 5 segundos, 20 pasos, res_multistep/simple. El criterio de éxito es un MP4 con audio estéreo, no un buen clip.
• Ejecución 2 — demuestra que el formato importa. El mismo tema dos veces: una vez como una descripción suelta de una línea, otra vez escrita como [Plano 1] más paisaje_sonoro_general más música_no_diegética. Si la segunda no es claramente mejor que H3-Base, algo está mal en tu configuración.
• Toma 3: una línea de diálogo. Un hablante, una frase, entrega descrita, cinco segundos. Esta es la forma más rápida de saber si el audio es lo suficientemente bueno para tu uso y cómo se pronuncia tu idioma de destino.
• Ejecución 4 — disciplina de referencia. R2V con el ref2va checkpoint, dos o tres referencias, cada una etiquetada explícitamente y con una tarea asignada, con <Picture 1> descrito como el primer fotograma real. Luego, rómpela deliberadamente: adjunta las mismas referencias sin asignaciones y compara.
• Run 5 — el final. Lleva tu mejor prompt local de 768p a la API alojada a 2K y observa qué aportan Context-IR y la pasada de regeneración. Ese delta es lo que compra el precio por segundo, y es la única manera de valorar con honestidad el flujo de trabajo híbrido.
Preguntas frecuentes
¿Puedo sacar 2K de los pesos locales?
No. El paquete abierto es H3-Base, cuyo lienzo nativo tiene un borde corto de 768 píxeles (hasta 768×1344). 2K proviene de H3-Regenerate-2K, un módulo separado de regeneración en contexto que la empresa mantuvo en la API alojada. Puedes ampliar localmente con cualquier escalador de propósito general, pero eso es una operación distinta de la pasada de regeneración propia de H3 y no coincidirá con ella.
¿Por qué el mismo prompt se comporta de manera diferente en la API y en ComfyUI?
Porque la API ejecuta H3-Context-IR primero. Lee tu texto y tus referencias, razona sobre cómo se relacionan y le entrega a H3-Base una instrucción estructurada y enriquecida. Localmente no existe tal etapa: H3-Base recibe tus palabras en bruto. Un prompt vago que produce un clip competente a través de la API está siendo rescatado por un preprocesador que no instalaste, por lo que el formato de prompt documentado importa mucho más a los usuarios locales que a los usuarios de la API.
¿Está mal la plantilla de código de tiempo [0s-2s]?
No es lo que pide la guía incluida. La guía de la empresa, VIDEO_PROMPT_WRITING_GUIDE_base_en.md, organiza por bloques [Shot N], no asigna ninguna marca de tiempo al Shot 1 y expresa los cortes posteriores como tiempos absolutos ("En 00:03.500, la cámara corta a…"). Tampoco tiene sección de prompt negativo, por lo que la lista de "transiciones prohibidas" de la plantilla popular es un añadido de la comunidad. Dicho esto, los profesionales informan de buenos resultados con la API usando el formato de código de tiempo — posiblemente porque Context-IR lo normaliza. Nuestra lectura: usar el formato documentado con los pesos locales, y no atribuir a los corchetes de código de tiempo los resultados de la API que el preprocesador puede haber conseguido.
¿Puede una empresa en los EE. UU. o la UE utilizar los pesos abiertos comercialmente?
El texto de la licencia que hemos leído excluye a la UE, el Reino Unido, Corea del Sur y los Estados Unidos de su Territorio Aplicable, y la exclusión está redactada para cubrir tanto los resultados como los pesos. Eso es un obstáculo serio para un despliegue comercial en esos lugares, y es una cuestión legal más que técnica — lea usted mismo la licencia y el archivo de preguntas y respuestas, y busque asesoramiento. La API alojada se rige por los propios términos de la plataforma, no por la licencia comunitaria, por lo que vale la pena evaluarla por separado en lugar de asumir que está igualmente restringida.
Qué verificar antes de hacer commit
H3 ofrece una relación calidad-precio inusualmente buena para un tipo específico de trabajo: clips cortos, con diseño de sonido y coherentes con la referencia, donde estés dispuesto a escribir una lista de planos real. Es inusualmente exigente en cuanto a cómo se lo pides. Las tres cosas que vale la pena verificar por ti mismo, porque son las que cambian más rápido: si aparecen más proveedores de inferencia junto a fal (que es lo que bajará el precio por segundo), si la plantilla de ComfyUI R2V crece más allá de dos ranuras de referencia hasta las nueve del modelo, y si el hábito de timecode de la comunidad o el formato de bloque de tomas documentado gana una vez que alguien haga una comparación controlada contra los pesos locales. Nadie ha publicado esa comparación todavía. Hasta que lo hagan, el manual del repositorio es la mejor apuesta, y está en la misma descarga en la que ya gastaste 42 GB.
