
Vidu Q4 Preview vs MiniMax H3: Lo más alto de la tabla es un empate, y solo uno de ellos está en tres tablas
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
La tabla de imagen a vídeo de Artificial Analysis, consultada el 8 de octubre de 2026, sitúa MiniMax H3 Max en primer lugar con 1.195 Elo, MiniMax H3 en segundo lugar con 1.181, y Vidu Q4 Preview en tercer lugar con 1.179. Dieciséis puntos separan al primero del tercero, con intervalos de aproximadamente ±10 y ±11, sobre 5.894, 7.284 y 5.543 votos respectivamente. Eso es un empate estadístico disfrazado de podio, y cualquier página que comience declarando un ganador en esta tabla está leyendo ruido.
Así que la pregunta interesante no es cuál de estos dos modelos es mejor. Es qué le ocurre a la comparación cuando sales del único ranking en el que aparecen ambos, porque MiniMax H3 se lanzó el 31 de julio de 2026 como un modelo omnimodal que lee referencias de texto, imagen, video y audio como un único contexto, y Vidu Q4 Preview llegó el 7 de octubre de 2026 con dos modos de entrada y dos endpoints de API. A uno de ellos se lo mide en tres lugares. Al otro, en uno.
Qué significa y qué no significa el empate a tres
Tanto las entradas de MiniMax como la versión de Vidu se sitúan dentro de los intervalos de las demás, así que la afirmación honesta es que los tres mejores modelos de imagen a vídeo son indistinguibles en preferencia humana con los tamaños de muestra actuales. Dos detalles hacen que ese empate sea menos halagador para todos de lo que parece.
El primero es la antigüedad. Los votos de MiniMax H3 son de julio de 2026 y los de H3 Max, de agosto; los de Vidu Q4 Preview son de octubre. Los conjuntos de votos más grandes y antiguos se miden frente a un campo competitivo distinto y un conjunto diferente de oponentes, lo que juega en ambos sentidos: mejor medidos, y sobre una pregunta ligeramente distinta. Una diferencia de 16 puntos en cualquier dirección aquí no es evidencia.
La segunda es la columna de precio. Artificial Analysis registra MiniMax H3 a $7.80 por minuto y H3 Max a $4.80 por minuto en esta tabla. Vidu Q4 Preview se registra a $7.20. Si se leen como un ranking, H3 Max parece la mejor opción en precio de las tres, pero las tarifas subyacentes del proveedor explican esa etiqueta en lugar de contradecirla. En nuestra propia ficha del modelo, indicamos MiniMax-H3 a $0.08 por segundo en 768P y $0.13 por segundo en 2K, lo que equivale a $4.80 y $7.80 por minuto. Las dos cifras de MiniMax en la tabla son el mismo modelo con precios en dos niveles de resolución, no un nivel premium y uno barato. Las columnas por minuto en una tabla de preferencias son útiles para órdenes de magnitud y peligrosas para cualquier cosa más fina.
Donde aparece MiniMax H3 y no Vidu Q4 Preview
Esta es la parte del enfrentamiento que sobrevive al empate, y es una diferencia estructural más que de calidad.
MiniMax H3 (768p) ocupa el cuarto puesto en la tabla de texto a vídeo, con 1.137 de Elo y 8.315 votos, mientras que H3 Max es quinto, con 1.130 y 5.719. Vuelve a ser cuarto en la tabla de edición de vídeo, con 1.119 y 7.023 votos, en una tabla que clasifica a los modelos según su capacidad de editar un vídeo a partir de una instrucción de texto manteniendo el audio. Vidu Q4 Preview no aparece en ninguna de las dos.
Esa ausencia no es una laguna de medición — es lo que es el producto. La API de Vidu Q4 Preview documenta dos endpoints, /ent/v2/img2video y /ent/v2/reference2video, y la página del producto enumera dos modos, Imagen a Vídeo y Referencia a Vídeo. No hay una ruta de texto a vídeo en la documentación. Tampoco hay una ruta de edición de vídeo, lo que significa que el modelo no puede tomar un clip existente y cambiar algo en él. MiniMax H3 hace ambas cosas, y su enfoque omnimodal —referencias de texto, imagen, vídeo y audio en un solo contexto— es la razón por la que puede hacerlo.
Merece la pena ser precisos con la parte de audio, porque ambos modelos hacen audio nativo y los dos no son lo mismo. Vidu Q4 Preview genera audio y vídeo juntos, con un audio parámetro en el endpoint de imagen a vídeo que produce un vídeo con diálogo y efectos de sonido, y acepta hasta tres clips de audio de referencia para mantener consistente la voz de un personaje. MiniMax H3 produce audio estéreo nativo y acepta audio como modalidad de entrada junto con imágenes y vídeo. El caso de uso de la voz de referencia es la fortaleza específica de Vidu; el caso de uso de la referencia para todo es la de MiniMax.
La aritmética por segundo, nivel por nivel
Ambos modelos facturan por segundo de salida generada, lo que convierte esta en una de esas raras comparaciones en las que las tarifas pueden cotejarse directamente sin necesidad de conversión.
• 540p — solo Vidu Q4 Preview: 9 créditos por segundo, aproximadamente $0.045 según la tarifa de crédito estándar de $0.005 publicada por la plataforma
• 720P / 768P — Vidu Q4 Preview 19 créditos por segundo, aproximadamente $0.095 frente a MiniMax-H3 $0.08 por segundo
• 1080p — Vidu Q4 Preview 24 créditos por segundo, unos $0.12 frente a MiniMax-H3 sin nivel 1080p publicado
• 2K — Vidu Q4 Preview 38 créditos por segundo, unos $0,19 frente a MiniMax-H3 $0,13 por segundo
• 4K — solo en Vidu Q4 Preview: 78 créditos por segundo, aproximadamente $0.39
El patrón que se desprende de esto no es «uno es más barato». El suelo de Vidu Q4 Preview es genuinamente más bajo: su nivel de 540p es un nivel de blocking con un precio pensado para exactamente aquello para lo que se usa, comprobar una composición antes de pagar por un render a resolución completa, y nada en la tarifa de MiniMax cumple esa función. MiniMax H3 es más barato en 2K, el nivel superior que ambos modelos comparten, alrededor de un tercio. Y el nivel 4K de Vidu es el único nivel de generación en 4K de la comparativa, con un precio que lo refleja.
La cifra de lanzamiento de $0.014 por segundo que acompañó el anuncio de Vidu corresponde al nivel de 540p con una tarifa de créditos con descuento, no a una tarifa general. La plataforma de Shengshu ofrece actualmente descuentos por paquete de tiempo limitado de hasta el 30 % en paquetes de créditos, que bajan todos los niveles en conjunto en lugar de cambiar la forma de la curva. Considera la curva de tarifas de lista como la comparación y el descuento como un ajuste temporal.
De nuestro lado: enrutamos MiniMax-H3. Está disponible en la API pública de modelos en minimax/minimax-h3, facturado por segundo de salida generada a la tarifa de lista del proveedor, traspasada sin añadir nada, y se puede invocar en el mismo endpoint compatible con OpenAI que todos los modelos de texto que servimos. Vidu Q4 Preview no es una ruta de OrcaRouter, y esta página no afirma lo contrario — los modelos de video que sí servimos se ubican bajo una sola clave y una sola forma de solicitud junto a los modelos de lenguaje, que es la disposición que hace económico comparar varios de ellos. Una consecuencia práctica de los precios de traspaso: cuando un proveedor cambia una tarifa por segundo, ese cambio se ve en la ruta el mismo día en lugar de en la renovación del contrato.
Qué aporta "omni-modal" en una solicitud real
El contexto unificado de MiniMax H3 es fácil de leer como una lista de funciones y pasar por alto que es una diferencia de ingeniería. Un modelo que acepta video como referencia de entrada puede apuntarse a una toma existente y pedírsele que la continúe, la extienda o le cambie el estilo; un modelo sin entrada de video no puede. Ese es el mecanismo detrás de la presencia de H3 en el tablero de edición, y también es la razón por la que el rango de salida de 4 a 15 segundos del modelo es menos limitante de lo que sugiere la cifra — la extensión multiturno es la forma normal de construir una secuencia más larga a partir de él.
El límite de 16 segundos de Vidu Q4 Preview también es por generación, y su modo Reference-to-Video está diseñado para narrativa de múltiples tomas dentro de esa ventana, y la documentación describe cambio inteligente de cámara y consistencia entre múltiples posiciones de cámara. Lo que no tiene es una vía para aceptar un clip que ya grabaste y modificarlo. Si tu flujo de trabajo parte de metraje en lugar de una imagen fija o un conjunto de referencias, uno de estos dos modelos simplemente no está disponible para ti, y ningún número Elo cierra eso.
¿Cuál, por trabajo?
Usa MiniMax H3 cuando la entrada sea cualquier cosa que no sea una imagen o un conjunto de referencias. Texto a vídeo, edición de vídeo a vídeo, entrada de audio, extensión multiturno más allá de los quince segundos, o una pipeline en la que el modelo tenga que cubrir casos de uso como para tres tableros diferentes: ese es el territorio de H3, y es el único de los dos que tiene algo de eso. Su tarifa de 2K también es la más económica de las dos en el nivel superior que comparten.
Elige Vidu Q4 Preview cuando lo que importa es la coherencia del reparto y la voz, o cuando necesitas un nivel de generación en 4K, o cuando quieres una pasada económica de bloqueo en 540p para iterar un plano antes de comprometerte. Quince referencias de imagen y tres referencias de audio son un presupuesto de referencias publicadas mayor que el que documenta MiniMax, y ningún otro modelo de esta comparativa genera de forma nativa en 4K. El conjunto de modos más limitado es lo que se sacrifica a cambio.
Qué cambiaría esto: un lanzamiento completo de Vidu Q4 que añadiera un endpoint de texto a vídeo pondría a los dos modelos en las mismas tablas y convertiría esto en una contienda directa. AA-Video-I2V v2.0, anunciado para llegar con 1080p en todo y una taxonomía de capacidades revisada, reemplazaría los votos en lo más alto de la tabla en lugar de reordenarlos, y resolvería si el actual empate a tres es un empate o un límite de medición. Hasta entonces, el número que hay que conservar es dieciséis, con el nombre de la tabla y la fecha al lado.
Lo único que merece la pena extraer del propio podio: un primer puesto que se sitúa dieciséis Elo por encima del tercero, con intervalos tan amplios, no es una clasificación. Son tres modelos que los votantes humanos no pueden separar, y la decisión entre ellos tiene que venir de todo lo demás en esta página.



