
Vidu Q4 Preview debuta en tercera posición en la tabla de imagen a vídeo — y está ausente de la otra
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Vidu Q4 Preview entró en la clasificación AA-Video-I2V v1.0 de Artificial Analysis en el tercer puesto, con un Elo de 1,179, y el modelo al que desplazó como la entrada mejor situada de Vidu, Vidu Q3 Pro ocupa el decimonoveno puesto con 1,056. Se trata de un movimiento de 123 puntos en un solo lanzamiento, en una tabla donde los intervalos de confianza rondan los veinte puntos de amplitud, y se produjo a un precio de $7.20 por minuto de vídeo generado en lugar de los $9.60 que tiene el modelo más antiguo. Shengshu Technology lanzó Vidu Q4 Preview el 7 de octubre de 2026 como la primera vista previa pública de su buque insignia de nueva generación, explícitamente por delante del modelo Q4 completo, y pide a los creadores que lo usen en proyectos reales mientras la versión final todavía se está perfilando.
La cifra del debut es el titular. La ausencia es el hecho más interesante, y es la razón de que esto sea un artículo y no un gráfico.
Lo que realmente se lanzó el 7 de octubre
Vidu Q4 Preview es un modelo de generación de vídeo con audio nativo, que se vende a través del propio producto web y la plataforma API de Vidu. El material de lanzamiento de Shengshu describe tres áreas de trabajo: la interpretación de los personajes (expresión facial, emoción, movimiento corporal y voz coordinados en lugar de superpuestos), la coherencia de cámara y corte en acciones rápidas, y los efectos visuales —explosiones, partículas, fuegos artificiales— que forman parte de una escena en lugar de superponerse a ella.
La especificación, tal como la declara el proveedor:
• Resolución máxima — 4K, con 2K y 4K que cuentan con profundidad de color de 10 bits; la gama completa es 540p, 720p, 1080p, 2K, 4K
• Duración máxima del clip — 16 segundos, dividida de forma desigual: Image-to-Video va de 3 a 16 segundos, Reference-to-Video va de 1 a 16
• Presupuesto de referencias — hasta 15 imágenes de referencia (personajes, vestuario, utilería, productos, entornos en una misma configuración) y hasta 3 clips de audio de referencia
• Precio de lanzamiento — desde $0.014 por segundo, que es la cifra del proveedor y es explícitamente promocional
El proveedor también hace una afirmación comparativa de la que no se le puede pedir cuentas fácilmente: que, con especificaciones de salida y condiciones de facturación comparables, Vidu Q4 Preview ofrece «hasta cinco veces más resultados por el mismo presupuesto». Esa es una afirmación de eficiencia, no de calidad, y como la frase «especificaciones de salida y condiciones de facturación comparables» hace todo el trabajo en esa oración, vale la pena tratarla como una construcción de marketing hasta que alguien la reproduzca. La propia advertencia de Shengshu, publicada junto con lo anterior, es que los precios finales, las resoluciones compatibles, la disponibilidad de funciones y las condiciones de uso pueden variar según el plan y la región.

Las dos juntas no se ponen de acuerdo sobre para qué sirve este modelo.
Artificial Analysis gestiona clasificaciones de vídeo separadas, con escalas Elo separadas y grupos de votos separados, y la diferencia entre ellas es lo que lo explica todo aquí.
On AA-Video-I2V v1.0 — image-to-video, ranked from pairwise human preference votes with audio kept in — Vidu Q4 Preview is third at 1,179 ±10 over 5,543 samples, dated October 2026, priced at $7.20 per minute. Only two models are above it: MiniMax H3 Max at 1,195 ±9 over 5,894 samples ($4.80/min, August 2026) and MiniMax H3 at 1,181 ±8 over 7,284 samples ($7.80/min, July 2026). Gemini Omni Flash is fourth at 1,178 ±7 over 12,327 samples. The board's own notice says two models were added in the last 30 days: Vidu Q4 Preview and HiDream-O1-Video-1.0, which is sixth at 1,175 ±10.
En AA-Video-T2V v2.0 —texto a video, una tabla diferente construida sobre una taxonomía de casos de uso diferente—, Vidu Q4 Preview no aparece en absoluto. La mejor entrada de Vidu allí es Vidu Q3 Pro, en el puesto veinticinco con 941 ±10 sobre 4,088 muestras. Wan 3.0 lidera esa tabla con 1,156 ±9.
Lee esas dos frases juntas y la forma del lanzamiento queda clara. Este es un modelo de imagen y referencia. La propia página de producto de Vidu enumera exactamente dos modos para él, Image-to-Video y Reference-to-Video, sin pestaña de texto a video, y la documentación de la API coincide. Un lanzamiento que parece un buque insignia general en el marketing del proveedor es, en los foros independientes, uno específico.
Una salvedad más sobre la propia clasificación. Los intervalos de diez puntos de la tabla I2V se solapan en gran medida del tercero al sexto —1.179, 1.178, 1.176, 1.175—, por lo que «tercero» es una posición dentro del ruido, no una separación clara del cuarto. Lo que no está dentro del ruido es la brecha con el modelo al que reemplazó. Los 123 puntos Elo entre Vidu Q3 Pro y Vidu Q4 Preview son mayores que toda la dispersión entre los seis primeros puestos de la tabla.

Lo que realmente llamas, y lo que cuesta
La API es poco glamurosa y específica. Image-to-Video hace POST a /ent/v2/img2video con el nombre del modelo viduq4-preview, toma una única imagen de fotograma inicial (png, jpeg, jpg o webp, hasta 50 MB), un prompt de hasta 20.000 caracteres, una duración de 3 a 16 segundos con valor predeterminado de 5, y una resolución de 540p a 4K con valor predeterminado de 720p. Reference-to-Video hace POST a /ent/v2/reference2video, toma de una a quince imágenes más de cero a tres referencias de audio mp3 de tres a doce segundos cada una, y ofrece relaciones de aspecto de 1:1, 9:16, 16:9, 3:4 y 4:3 con valor predeterminado de 16:9.
El parámetro que merece la pena destacar es audio, que de forma predeterminada es true. Vidu Q4 Preview genera sonido junto con la imagen de forma predeterminada —diálogos y efectos de sonido incluidos—, y eres tú quien lo desactiva deliberadamente. Las URLs de creación devueltas siguen siendo válidas durante 24 horas, lo cual es lo bastante breve como para tenerlo en cuenta si generas por lotes y renderizas más tarde.
En cuanto al precio, la aritmética honesta es que los dos números que se han barajado —«$0.014 por segundo» y los $7.20 por minuto que registra Artificial Analysis— no son el mismo producto. $0.014 por segundo es $0.84 por minuto, aproximadamente una novena parte de la cifra del tablero, que es lo que parece un mínimo promocional en la resolución más baja junto a una tarifa medida en una de producción. Todo lo que presupuestes a partir de la cifra de lanzamiento debería recalcularse a partir de tu propia resolución y duración, no de la cifra titular.

El problema práctico con un SKU de vista previa
Vidu Q4 Preview, según el propio planteamiento del proveedor, no está terminado. Se lanzó antes que Q4 para que los comentarios sobre el rendimiento, el control creativo y las necesidades de producción diaria sirvieran de base para la versión final. El precio es promocional. La disponibilidad de funciones varía según el plan y la región. La documentación de la API incluso incluye un alias mal escrito — viduq4-previerw aparece en la descripción del parámetro del modelo junto al correcto viduq4-preview —, lo cual es un detalle pequeño que revela algo cierto sobre el punto en el que se encuentra esta versión dentro del pipeline.
Eso no es un argumento en contra de usarlo. Es un argumento en contra de ponerlo en una ruta crítica sin un plan para lo que ocurra cuando termine el precio promocional o la compilación de vista previa sea reemplazada, lo cual, para un modelo lanzado de esta manera, es cuestión de semanas, no de trimestres.
Si quieres probarlo sin apostar una pipeline de producción a ello, OrcaRouter está hecho exactamente para este caso: un endpoint compatible con OpenAI a través de más de 200 modelos, conmutación automática por error entre proveedores, y los precios de lista de los proveedores traspasados sin añadir ningún margen. La parte de la conmutación por error importa más de lo habitual con una compilación preliminar, porque es lo que te permite enrutar una solicitud a un modelo estable con la misma clave cuando una ruta preliminar no está disponible. Para ser claros con el enrutamiento: Vidu Q4 Preview no es hoy una ruta de OrcaRouter. Los modelos de vídeo que sí servimos —incluido MiniMax H3, el modelo mejor clasificado en este mismo tablero— se pueden invocar en el mismo endpoint que los modelos de texto, y una tarifa de vídeo por segundo es una línea de facturación, no un contrato aparte.
Qué ver
Tres cosas harían avanzar esta historia.
Primero, el ranking de texto a video. Artificial Analysis ha dicho que AA-Video-I2V v2.0 está en camino, alineado con la taxonomía de T2V v2.0 y con cobertura de video en 1080p en todos los casos. Si Vidu Q4 Preview es un modelo de imagen y referencia, tampoco aparecerá ahí — y si lo hace, eso te indica que Shengshu ha lanzado un modelo más amplio de lo que da a entender la vista previa.
Segundo, el lanzamiento completo del cuarto trimestre. El paso de la vista previa a la versión final es donde suelen terminar los precios promocionales y donde el conjunto de funciones o se mantiene o se reduce discretamente. El límite de referencias de 15 imágenes y 3 audios es la parte de la especificación con más probabilidades de perdurar, porque es el diferenciador sobre el que se construye todo el lanzamiento.
Tercero, el tamaño de la muestra. 5.543 votos son una medición real pero joven; los intervalos se estrecharán y la posición se moverá, en cualquiera de las dos direcciones, a medida que se llene la tabla. Cualquiera que cite «tercero» como un hecho establecido debería indicar la fecha en que lo leyó.
La pregunta que vale la pena conservar es más limitada de lo que sugiere el marketing. Vidu Q4 Preview es, de forma medible, el mejor modelo de imagen a vídeo que Vidu ha producido, por un margen mayor que la propia diferencia entre los seis primeros de la tabla, y a un precio por minuto más bajo que el de su predecesor. Que eso se convierta en una posición duradera o en un repunte pasajero por ser una preview no es algo que ninguno de los números actuales pueda responder.
