Una tarjeta de título generada que dice «Vidu Q4 Preview vs Seedance 2.5» con el subtítulo «Quince referencias frente a treinta, además de una entrada de video» y dos tarjetas, la de la izquierda dice «Vidu Q4 Preview: 15 imágenes, 3 clips de audio, 16 segundos, hasta 4K» y la de la derecha dice «Seedance 2.5: 30 imágenes, 10 videos, 10 clips de audio, 30 segundos por ejecución». El logotipo de OrcaRouter está superpuesto en la esquina inferior derecha.
Guides & Insights

Vidu Q4 Preview vs. Seedance 2.5: El presupuesto de referencias no es la verdadera diferencia

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Los presupuestos de referencia publicados se leen como una victoria clara para Seedance 2.5: hasta 30 imágenes, 10 videos y 10 clips de audio frente a Vidu Q4 Preview, con sus 15 imágenes y 3 clips de audio. Eso es el doble de imágenes y el triple de audio, y por sí solo resolvería la cuestión. No lo hace, porque el número que importa no es la cantidad, sino la segunda modalidad. Seedance 2.5 acepta video como referencia de entrada. Vidu Q4 Preview acepta imágenes y audio, y no tiene una vía documentada para tomar un clip existente como entrada.

Seedance 2.5 se lanzó el 31 de julio de 2026 como la opción de formato largo de ByteDance, generando un clip de 30 segundos en una sola ejecución con extensión multiturno para secuencias más largas. Vidu Q4 Preview se lanzó el 7 de octubre de 2026 de Shengshu Technology como una vista previa de su buque insignia de próxima generación, con dos modos —Imagen a video y Referencia a video— y dos endpoints de API documentados. Ambos son modelos con un uso intensivo de referencias. Fueron creados para contener cosas diferentes.

Lo que cada modalidad de entrada realmente desbloquea

Un modelo que toma imágenes como referencias puede mantener un reparto y un aspecto visual. La documentación de Vidu Q4 Preview describe cómo combinar de 1 a 15 imágenes entre personajes, escenas y estilo para que los sujetos se mantengan consistentes a lo largo de una toma de varios planos, con hasta 3 referencias de audio mp3 de 3 a 12 segundos que clonan una voz y mantienen la interpretación alineada. Quince espacios repartidos entre el reparto, el vestuario, la utilería y la iluminación de una sola escena constituyen un presupuesto coherente, y es la razón por la que el modelo comparte el primer puesto en la tabla de preferencias de imagen a vídeo.

Un modelo que también acepta video como referencia puede recibir metraje como entrada. Que Seedance 2.5 acepte hasta 10 entradas de video junto con 30 imágenes y 10 clips de audio significa que el conjunto de referencias puede incluir movimiento, ritmo y comportamiento de cámara tomados de un clip existente en lugar de descritos en un prompt. Esa es una capacidad distinta, no una versión ampliada de la misma, y es lo que coloca a Seedance 2.5 en la tabla de edición de video de Artificial Analysis —segundo, con 1.161 de Elo y 5.162 votos, según la lectura del 8 de octubre de 2026—, editando un video a partir de una instrucción de texto y manteniendo el audio. Vidu Q4 Preview no está en esa tabla, y la razón es su lista de endpoints, no su puntuación.

El contraste práctico:

• Referencias de imagen — Vidu Q4 Preview hasta 15 vs Seedance 2.5 hasta 30

• Referencias de video — Vidu Q4 Preview ninguna documentada vs Seedance 2.5 hasta 10

• Referencias de audio — Vidu Q4 Preview hasta 3 clips mp3 de 3–12 segundos frente a Seedance 2.5 hasta 10

• Duración de una sola ejecución — Vidu Q4 Preview 3–16 segundos en Image-to-Video, 1–16 segundos en Reference-to-Video frente a Seedance 2.5, 30 segundos en una sola ejecución, con extensión multiturno más allá de eso

• Modos — Vidu Q4 Preview imagen a vídeo y referencia a vídeo frente a Seedance 2.5 texto a vídeo, referencia a vídeo y referencia desde vídeo, con una ruta de edición en el tablero

• Resolución de salida — Vidu Q4 Preview de 540p a 4K como niveles de generación tarifados, 2K y 4K a color de 10 bits frente a Seedance 2.5 480p y 720p en los hosts que publican sus ajustes, y los niveles superiores alcanzan la resolución de entrega mediante un escalado

Ponlos uno al lado del otro y los modelos no compiten por el mismo brief. Una toma 4K de dieciséis segundos con quince referencias y una toma 720p de treinta segundos con treinta referencias y entrada de video son respuestas a dos preguntas de producción diferentes.

Las unidades de precios no se convierten, y esa es toda la historia

Aquí es donde fallan la mayoría de las comparaciones entre estos dos, y la culpa es de la unidad, no de la aritmética.

Seedance 2.5 no lo vende por segundo su proveedor. ByteDance mide el modelo en tokens de video según la tarifa oficial, publicada a través de Volcano Engine Ark en China y de BytePlus ModelArk a nivel internacional. Lo que cuesta un clip depende de la resolución, la duración y el uso real de tokens, por lo que una cifra por segundo solo es válida para una resolución y una duración — y las tomas fallidas se facturan igual que las exitosas. Los proveedores externos que ofrecen Seedance 2.5 añaden su propio margen encima y publican su propia tarifa por segundo o por clip, y por eso una docena de páginas da una docena de cifras distintas y ninguna de ellas es la del proveedor.

Vidu Q4 Preview se cotiza a la inversa: una tarifa plana de créditos por segundo que varía únicamente según el nivel de resolución que selecciones, publicada abiertamente por Shengshu. Nueve créditos por segundo a 540p, 19 a 720p, 24 a 1080p, 38 a 2K, 78 a 4K, frente a una tarifa de créditos de plataforma declarada de $0.005, con descuentos por tiempo limitado en paquetes de hasta el 30% actualmente en vigor. A tarifa de lista, la curva va desde aproximadamente $0.045 por segundo a 540p hasta unos $0.39 a 4K. La cifra de $0.014 por segundo del anuncio de lanzamiento corresponde al nivel de 540p con el descuento aplicado.

Lo cual significa que las dos tarifas no se pueden comparar línea por línea, y cualquier página que lo haga está comparando la lista abierta de un proveedor con el margen de un host. Lo que sí se puede comparar es lo que el proveedor publica sobre la forma de cada una: el costo de Vidu escala con la resolución y la duración, y se puede conocer antes de pulsar generar; el de Seedance se mide por tokens y, por lo tanto, depende de cómo elija el modelo gastar tokens con tu prompt. Uno es predecible, el otro se mide por consumo. Ninguno está mal, pero le convienen a compradores distintos, y el segundo es el más peligroso de los dos a la hora de presupuestar, porque la variación está del lado del proveedor.

En el panel independiente, las cifras por minuto registradas solo deben interpretarse como un orden de magnitud. Artificial Analysis registra Vidu Q4 Preview a $7.20 por minuto en la tabla de imagen a vídeo, y Dreamina Seedance 2.5 a $34.12 por minuto en texto a vídeo y $40.82 en edición. Esas columnas son el coste de un minuto de salida en 1080p con la configuración predeterminada de cada modelo —y Seedance 2.5 usa por defecto la configuración más larga y pesada para la que su tarifa establece precios, mientras que la predeterminada de Vidu Q4 Preview es un clip de una sola generación. Miden comportamientos predeterminados distintos, no una diferencia de eficiencia de cuatro a cinco veces.

Dieciséis segundos contra treinta es una diferencia real

Hay una comparación que sí sobrevive al problema de las unidades, y es la duración. Treinta segundos en una sola ejecución son casi el doble del límite de dieciséis segundos de Vidu Q4 Preview, y la extensión multiturno de Seedance 2.5 significa que se puede construir una secuencia más allá de eso. Para el trabajo narrativo —una escena con un arco, un anuncio con un planteamiento y un desenlace—, la diferencia entre dieciséis y treinta segundos es la diferencia entre un plano y una escena.

En el extremo fino, ocurre lo contrario. Vidu Q4 Preview genera a partir de tres segundos, y su nivel de 540p tiene un precio de aproximadamente un tercio de su propia tarifa de 720p, lo que abarata bloquear una composición antes de comprometerse con un render a resolución completa. Nada en la estructura de tarifas publicada de Seedance 2.5 desempeña ese papel: su nivel host de 480p cuesta menos que 720p, pero la facturación del propio proveedor se basa en tokens, por lo que una prueba corta de baja resolución no tiene un precio publicado claro con el que planificar.

¿Cuál, por brief?

Elige Seedance 2.5 cuando el trabajo implique material de archivo que ya tienes. Si la labor consiste en extender, cambiar el estilo o recortar de nuevo un clip existente, o si el conjunto de referencia debe aportar movimiento en lugar de solo apariencia, la entrada de video es la capacidad decisiva y Vidu Q4 Preview no puede sustituirse. Añade la generación única de treinta segundos, y el caso es claro para trabajos narrativos y publicitarios con un arco más largo.

Elige Vidu Q4 Preview cuando el trabajo sea un elenco que tiene que mantenerse y una especificación de entrega que supere los 720p. La generación nativa en 2K y 4K con color de 10 bits es un nivel que Seedance 2.5 no publica a nivel de proveedor, y el precio por segundo hace que una toma en 4K sea una cantidad que realmente puedes presupuestar en lugar de una incógnita medida por consumo. Quince referencias de imagen y tres referencias de voz son suficientes para un elenco de una sola escena, y el nivel de blocking de 540p abarata la iteración.

Lo que cambiaría esto: un lanzamiento completo de Vidu Q4 que añadiera una modalidad de entrada de vídeo colapsaría la diferencia estructural y convertiría a estos dos en competidores directos, y el propio material de Shengshu dice que la preview existe precisamente para recabar los comentarios que dan forma a la versión final. Por otro lado, si ByteDance publica una tabla de ejemplos de tarifas por tokens con más configuraciones, la asimetría entre lo medido y lo predecible se vuelve mucho más fácil de planificar. Hasta que se materialice cualquiera de las dos cosas, la lectura correcta de «30 referencias frente a 15» es que uno de estos modelos acepta vídeo y el otro no.

Una clave para los modelos de video que de verdad puedes llamar

OrcaRouter coloca los modelos de vídeo y de lenguaje detrás de un único endpoint compatible con OpenAI y con una sola clave, a los precios de lista del proveedor trasladados sin añadir ningún margen, de modo que un cambio de tarifa de un proveedor se aplica el mismo día en lugar de en la renovación. Vidu Q4 Preview y Seedance 2.5 no son actualmente rutas de OrcaRouter, y esta página no sugiere lo contrario. Las rutas de vídeo que sí servimos — Kling 3.0 y sus variantes Turbo y v2.6 entre ellas — se sitúan junto a los modelos de lenguaje en el mismo endpoint y con la misma estructura de solicitud, con conmutación por error automática entre rutas en lugar de un contrato independiente por modelo.

Esa es la estructura que hace que una comparación como esta se pueda completar: pon a prueba a los candidatos con tu propio brief, con tu propia configuración, y deja que la tasa de aceptación decida en lugar de dos tarjetas de tarifas en unidades diferentes.

A generated two-column scoreboard titled 'Vidu Q4 Preview vs Seedance 2.5 - the scoreboard'. The left column reads: Image references up to 15; Video references none; Audio references up to 3; Single-run length up to 16 seconds; Max resolution 4K generation; Billing unit per second by tier. The right column reads: Image references up to 30; Video references up to 10; Audio references up to 10; Single-run length up to 30 seconds; Max resolution 720p on published hosts; Billing unit tokens, per vendor. A footer reads 'Vidu figures per vendor docs; Seedance figures vendor-reported, unreproduced.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the Artificial Analysis AA-Video-T2V v2.0 text-to-video leaderboard, read 8 October 2026, showing Wan 3.0 first at 1,156 Elo, Dreamina Seedance 2.5 third at 1,143 over 8,264 samples with an API price of $34.12 per minute, MiniMax H3 (768p) fourth at 1,137 and MiniMax H3 Max fifth at 1,130, with Vidu Q4 Preview absent from the board entirely.