Une carte de titre générée affichant « Vidu Q4 Preview vs Seedance 2.5 » avec pour sous-titre « Quinze références contre trente, plus une entrée vidéo » et deux cartes, celle de gauche indiquant « Vidu Q4 Preview : 15 images, 3 clips audio, 16 secondes, jusqu'à 4K » et celle de droite indiquant « Seedance 2.5 : 30 images, 10 vidéos, 10 clips audio, 30 secondes par exécution ». Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Vidu Q4 Preview vs Seedance 2.5 : le budget de référence n'est pas la véritable différence

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Les budgets de référence publiés ressemblent à une victoire nette pour Seedance 2.5 : jusqu'à 30 images, 10 vidéos et 10 clips audio contre Vidu Q4 Preview, avec ses 15 images et 3 clips audio. C'est deux fois plus d'images et trois fois plus d'audio, et à lui seul, cela suffirait à trancher la question. Ce n'est pas le cas, car le nombre qui compte n'est pas la quantité — c'est la seconde modalité. Seedance 2.5 accepte la vidéo comme référence d'entrée. Vidu Q4 Preview accepte les images et l'audio, et ne dispose d'aucun moyen documenté d'intégrer un clip existant.

Seedance 2.5 a été lancé le 31 juillet 2026 comme l'offre long format de ByteDance, générant un clip de 30 secondes en une seule exécution, avec extension multi-tours pour les séquences plus longues. Vidu Q4 Preview a été lancé le 7 octobre 2026 par Shengshu Technology comme un aperçu de son fleuron de nouvelle génération, avec deux modes — Image-to-Video et Reference-to-Video — et deux points de terminaison API documentés. Tous deux sont des modèles très axés sur les références. Ils ont été conçus pour contenir des choses différentes.

Ce que chaque modalité d'entrée débloque réellement

Un modèle qui prend des images comme références peut maintenir une distribution et une esthétique. La documentation de Vidu Q4 Preview décrit la combinaison de 1 à 15 images couvrant personnages, scènes et style afin que les sujets restent cohérents tout au long d'une prise multi-plans, avec jusqu'à 3 références audio mp3 de 3 à 12 secondes clonant une voix et maintenant une interprétation alignée. Quinze emplacements répartis entre la distribution, les costumes, les accessoires et l'éclairage d'une même scène constituent un budget cohérent, et c'est la raison pour laquelle le modèle occupe une position à égalité en tête du classement de préférence pour la génération de vidéo à partir d'image.

Un modèle qui prend aussi une vidéo comme référence peut être pointé vers des séquences filmées. Le fait que Seedance 2.5 accepte jusqu’à 10 entrées vidéo aux côtés de 30 images et de 10 clips audio signifie que l’ensemble de références peut inclure le mouvement, le rythme et le comportement de caméra tirés d’un clip existant plutôt que décrits dans un prompt. C’est une capacité différente, et non une version agrandie de la même, et c’est ce qui place Seedance 2.5 sur le tableau d’édition vidéo d’Artificial Analysis — deuxième, avec 1 161 Elo sur 5 162 votes, selon le relevé du 8 octobre 2026 —, pour l’édition d’une vidéo à partir d’une instruction textuelle avec l’audio conservé. Vidu Q4 Preview ne figure pas sur ce tableau, et la raison tient à sa liste de points de terminaison, non à son score.

Le contraste pratique :

• Références d’images — Vidu Q4 Preview jusqu’à 15 vs Seedance 2.5 jusqu’à 30

Références vidéo — Vidu Q4 Preview : aucune documentée vs Seedance 2.5 : jusqu'à 10

• Références audio — Q4 Preview jusqu’à 3 clips mp3 de 3 à 12 secondes vs Seedance 2.5 jusqu’à 10

• Durée d'une génération unique — Vidu Q4 Preview : 3–16 secondes en Image-to-Video, 1–16 secondes en Reference-to-Video, contre Seedance 2.5 : 30 secondes en une seule exécution, avec extension multi-tours au-delà

• Modes — Vidu Q4 Preview image vers vidéo et référence vers vidéo vs Seedance 2.5 texte vers vidéo, référence vers vidéo et référence avec entrée vidéo, avec une piste d’édition à l’étude

• Résolution de sortie — Vidu Q4 Preview de 540p à 4K sous forme de paliers de génération tarifés, 2K et 4K en couleur 10 bits contre Seedance 2.5 en 480p et 720p sur les hôtes qui publient ses paramètres, les paliers supérieurs atteignant la résolution de livraison via un upscale

Mettez-les côte à côte et les modèles ne sont plus en concurrence pour le même brief. Une prise 4K de seize secondes à quinze références et une prise 720p de trente secondes à trente références avec entrée vidéo répondent à deux questions de production différentes.

Les unités de tarification ne se convertissent pas, et c’est toute l’histoire.

C'est là que la plupart des comparaisons entre ces deux-là échouent, et le problème tient à l'unité plutôt qu'à l'arithmétique.

Seedance 2.5 n'est pas vendu à la seconde par son fournisseur. ByteDance mesure le modèle en jetons vidéo sur la grille tarifaire officielle, publiée via Volcano Engine Ark en Chine et BytePlus ModelArk à l'international. Le coût d'un clip dépend de la résolution, de la durée et de l'utilisation réelle des jetons, donc un chiffre par seconde n'est valable que pour une seule résolution et une seule durée — et les prises échouées sont facturées comme les prises réussies. Les hébergeurs tiers qui proposent Seedance 2.5 ajoutent leur propre marge et publient leur propre tarif à la seconde ou par clip, c'est pourquoi une douzaine de pages donnent une douzaine de chiffres différents et aucun n'est celui du fournisseur.

Vidu Q4 Preview est facturé à l'inverse : un tarif forfaitaire en crédits par seconde qui ne varie qu'en fonction du palier de résolution que vous sélectionnez, publié ouvertement par Shengshu. Neuf crédits par seconde en 540p, 19 en 720p, 24 en 1080p, 38 en 2K, 78 en 4K, par rapport à un taux de crédit de plateforme déclaré de 0,005 $, avec des remises à durée limitée allant jusqu'à 30 % sur les offres groupées, actuellement en cours. Au tarif catalogue, la courbe s'étend d'environ 0,045 $ par seconde en 540p à environ 0,39 $ en 4K. Le chiffre de 0,014 $ par seconde issu de l'annonce de lancement correspond au palier 540p avec la remise appliquée.

Ce qui signifie que les deux grilles tarifaires ne peuvent pas être comparées ligne par ligne, et toute page qui le fait compare la liste ouverte d’un fournisseur à la marge d’un hôte. Ce qui peut être comparé, c’est ce que le fournisseur publie sur la structure de chacune : le coût de Vidu évolue avec la résolution et la durée et est connu avant que vous n’appuyiez sur Générer ; celui de Seedance est facturé au token et dépend donc de la manière dont le modèle choisit de dépenser les tokens sur votre prompt. L’un est prévisible, l’autre est au compteur. Aucun des deux n’est faux, mais ils conviennent à des acheteurs différents — et le second est le plus dangereux des deux pour établir un budget, car la variance se situe du côté du fournisseur de la ligne.

Sur le tableau indépendant, les chiffres par minute enregistrés ne valent qu’à titre d’ordre de grandeur. Artificial Analysis relève Vidu Q4 Preview à 7,20 $ par minute dans le tableau image-vers-vidéo, et Dreamina Seedance 2.5 à 34,12 $ par minute en texte-vers-vidéo et à 40,82 $ en montage. Ces colonnes correspondent au coût d’une minute de sortie 1080p avec les réglages par défaut de chaque modèle — et Seedance 2.5 utilise par défaut la configuration plus longue et plus lourde que sa grille tarifaire facture, tandis que le réglage par défaut de Vidu Q4 Preview est un clip à génération unique. Ces chiffres mesurent des comportements par défaut différents, et non un écart d’efficacité de quatre à cinq fois.

Seize secondes contre trente, c’est une vraie différence

Il existe une comparaison qui résiste au problème des unités : la durée. Trente secondes en une seule génération représentent presque le double du plafond de seize secondes de Vidu Q4 Preview, et l'extension multi-tours de Seedance 2.5 permet de construire une séquence au-delà. Pour le travail narratif — une scène avec un arc, une publicité avec une mise en place et un dénouement — la différence entre seize et trente secondes est celle entre un plan et une scène.

Du côté des petites résolutions, la logique s’inverse. Vidu Q4 Preview génère à partir de trois secondes, et son palier 540p est facturé environ un tiers de son propre tarif 720p, ce qui permet de bloquer une composition à moindre coût avant de s’engager dans un rendu en pleine résolution. Rien dans la structure tarifaire publiée de Seedance 2.5 ne joue ce rôle : son palier hôte 480p coûte moins cher que le 720p, mais la facturation propre du fournisseur est basée sur les tokens, donc un test court en basse résolution n’a pas de tarif publié clair sur lequel s’appuyer pour planifier.

Lequel, en bref

Choisissez Seedance 2.5 lorsque le travail implique des séquences que vous possédez déjà. Si la tâche consiste à étendre, restyler ou remonter un clip existant, ou si l’ensemble de références doit transmettre le mouvement plutôt que seulement l’apparence, l’entrée vidéo est la capacité décisive et Vidu Q4 Preview ne peut pas être substitué. Ajoutez la prise unique de trente secondes, et le choix s’impose pour les travaux narratifs et publicitaires à plus long arc.

Choisissez Vidu Q4 Preview lorsque le travail implique un casting qui doit tenir la distance et un cahier des charges de livraison qui dépasse le 720p. La génération native en 2K et 4K avec des couleurs 10 bits constitue un niveau que Seedance 2.5 ne publie pas au niveau du fournisseur, et le prix à la seconde fait d'une prise 4K une quantité que vous pouvez réellement budgéter plutôt qu'une inconnue facturée à l'usage. Quinze références d'image et trois références vocales suffisent pour un casting à scène unique, et le palier de blocking en 540p rend l'itération peu coûteuse.

Ce qui pourrait faire basculer les choses : une sortie complète de Vidu Q4 qui ajouterait une modalité d'entrée vidéo effacerait cette différence structurelle et ferait de ces deux modèles des concurrents directs, et les propres documents de Shengshu indiquent que la préversion existe précisément pour recueillir les retours qui façonnent la version finale. De l'autre côté, si ByteDance publie un tableau d'exemples de tarifs par token pour davantage de réglages, l'asymétrie entre facturation à l'usage et coût prévisible devient bien plus facile à anticiper. Tant que l'un ou l'autre n'aboutit pas, la bonne lecture de « 30 références contre 15 » est que l'un de ces modèles accepte la vidéo en entrée et pas l'autre.

Une seule clé pour les modèles vidéo que vous pouvez réellement appeler

OrcaRouter place les modèles vidéo et de langage derrière un seul point de terminaison compatible OpenAI sur une seule clé, aux prix catalogue des fournisseurs, répercutés sans marge ajoutée, de sorte qu'un changement de tarif d'un fournisseur est appliqué le jour même plutôt qu'au renouvellement. Vidu Q4 Preview et Seedance 2.5 ne sont pas actuellement des routes OrcaRouter, et cette page ne suggère pas le contraire. Les routes vidéo que nous desservons — Kling 3.0 et ses variantes Turbo et v2.6 parmi elles — se trouvent aux côtés des modèles de langage sur le même point de terminaison et avec la même structure de requête, avec un basculement automatique entre les routes plutôt qu'un contrat distinct par modèle.

C’est la structure qui permet de mener à terme une comparaison comme celle-ci : faites tourner les candidats sur votre propre brief, avec vos propres réglages, et laissez le taux d’acceptation trancher plutôt que deux grilles tarifaires exprimées dans des unités différentes.

A generated two-column scoreboard titled 'Vidu Q4 Preview vs Seedance 2.5 - the scoreboard'. The left column reads: Image references up to 15; Video references none; Audio references up to 3; Single-run length up to 16 seconds; Max resolution 4K generation; Billing unit per second by tier. The right column reads: Image references up to 30; Video references up to 10; Audio references up to 10; Single-run length up to 30 seconds; Max resolution 720p on published hosts; Billing unit tokens, per vendor. A footer reads 'Vidu figures per vendor docs; Seedance figures vendor-reported, unreproduced.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the Artificial Analysis AA-Video-T2V v2.0 text-to-video leaderboard, read 8 October 2026, showing Wan 3.0 first at 1,156 Elo, Dreamina Seedance 2.5 third at 1,143 over 8,264 samples with an API price of $34.12 per minute, MiniMax H3 (768p) fourth at 1,137 and MiniMax H3 Max fifth at 1,130, with Vidu Q4 Preview absent from the board entirely.