Une carte de titre générée pour Vidu Q4 Preview, sous-titrée « Troisième au classement image-vers-vidéo dès le premier jour », avec des cartes indiquant « AA-Video-I2V v1.0 : #3, Elo 1 179 » et « Vidu Q3 Pro : #19, Elo 1 056 », et une rangée de tuiles de spécifications indiquant « Clip max : 16 secondes », « Résolution max : 4K », « Images de référence : jusqu'à 15 » et « Texte-vers-vidéo : non proposé ». Le logo OrcaRouter se trouve dans la bande à marge intérieure en bas à droite.
Guides & Insights

Vidu Q4 Preview fait ses débuts à la troisième place du classement image-vers-vidéo — et est absent de l'autre

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Vidu Q4 Preview fait son entrée à la troisième place du classement Artificial Analysis AA-Video-I2V v1.0, avec un Elo de 1 179, et le modèle qu'il détrône comme meilleure entrée de Vidu, Vidu Q3 Pro, se classe dix-neuvième avec 1 056. Soit un gain de 123 points en une seule version, sur un classement où les intervalles de confiance font environ vingt points de large, et ce, à un prix de 7,20 $ par minute de vidéo générée, contre 9,60 $ pour le modèle plus ancien. Shengshu Technology a lancé Vidu Q4 Preview le 7 octobre 2026 comme premier aperçu public de son fleuron de nouvelle génération, explicitement avant la version complète du Q4, et invite les créateurs à l'utiliser dans de vrais projets pendant que la version finale est encore en cours d'élaboration.

Le chiffre de départ fait la une. L’absence est le fait le plus intéressant, et c’est la raison pour laquelle il s’agit d’un article plutôt que d’un graphique.

Qu’est-ce qui a réellement été livré le 7 octobre ?

Vidu Q4 Preview est un modèle de génération vidéo avec audio natif, vendu via le produit web et la plateforme API de Vidu. Le matériel de lancement de Shengshu décrit trois domaines de travail : la performance des personnages (expression faciale, émotion, mouvement corporel et voix coordonnés plutôt que superposés), la cohérence de la caméra et du montage dans les scènes d'action rapide, et les effets visuels — explosions, particules, feux d'artifice — qui s'intègrent à une scène au lieu de se superposer à elle.

La spécification, telle que le fournisseur la présente :

• Résolution maximale — 4K, les 2K et 4K offrant une profondeur de couleur 10 bits ; l'échelle complète est 540p, 720p, 1080p, 2K, 4K

• Durée maximale du clip — 16 secondes, répartie de manière inégale : Image-to-Video dure de 3 à 16 secondes, Reference-to-Video dure de 1 à 16

• Budget de références — jusqu’à 15 images de référence (personnages, garde-robe, accessoires, produits, environnements dans une même configuration) et jusqu’à 3 clips audio de référence

• Tarif de lancement — à partir de 0,014 $ par seconde, qui correspond au montant indiqué par le fournisseur et est explicitement promotionnel

Le fournisseur avance en outre une affirmation comparative à laquelle il est difficile de le tenir : que, dans des conditions comparables de spécifications de sortie et de facturation, Vidu Q4 Preview délivre « jusqu'à cinq fois plus de sorties pour le même budget ». Il s'agit d'une affirmation d'efficacité, et non de qualité, et comme l'expression « spécifications de sortie et conditions de facturation comparables » fait tout le travail dans cette phrase, il vaut la peine de la considérer comme une construction marketing jusqu'à ce que quelqu'un la reproduise. La mise en garde de Shengshu lui-même, publiée en parallèle, est que le prix final, les résolutions prises en charge, les fonctionnalités et les conditions d'utilisation peuvent varier selon le forfait et la région.

A generated single-column scoreboard titled 'Vidu Q4 Preview — the scoreboard' with six rows reading 'AA I2V rank: 3rd, Elo 1,179', 'Max resolution: 4K at 10-bit', 'Max clip: 16 seconds', 'Reference images: up to 15', 'Reference audio: up to 3' and 'Measured rate: $7.20 per minute', with a footer reading 'Elo, rank and rate per Artificial Analysis, 8 October 2026; resolution and clip length are vendor-stated.' The OrcaRouter logo sits in the bottom-right padded strip.

Les deux conseils ne sont pas d’accord sur la finalité de ce modèle.

Artificial Analysis exploite des classements vidéo distincts, avec des échelles Elo distinctes et des pools de votes distincts, et c’est la différence entre eux qui est tout l’enjeu ici.

On AA-Video-I2V v1.0 — image-to-video, ranked from pairwise human preference votes with audio kept in — Vidu Q4 Preview is third at 1,179 ±10 over 5,543 samples, dated October 2026, priced at $7.20 per minute. Only two models are above it: MiniMax H3 Max at 1,195 ±9 over 5,894 samples ($4.80/min, August 2026) and MiniMax H3 at 1,181 ±8 over 7,284 samples ($7.80/min, July 2026). Gem​ini Omni Flash is fourth at 1,178 ±7 over 12,327 samples. The board's own notice says two models were added in the last 30 days: Vidu Q4 Preview and HiDream-O1-Video-1.0, which is sixth at 1,175 ±10.

Sur AA-Video-T2V v2.0 — texte vers vidéo, un autre classement construit sur une taxonomie de cas d’usage différente — Vidu Q4 Preview n’apparaît pas du tout. La meilleure entrée Vidu y est Vidu Q3 Pro, vingt-cinquième à 941 ±10 sur 4 088 échantillons. Wan 3.0 mène ce classement à 1 156 ±9.

Lisez ces deux phrases ensemble et la nature de la sortie devient évidente. C'est un modèle image-et-référence. La page produit de Vidu elle-même ne liste que deux modes pour ce modèle, Image-to-Video et Reference-to-Video, sans onglet text-to-video, et la documentation API concorde. Un lancement qui, dans le marketing du fournisseur, ressemble à un produit phare généraliste est, sur les forums indépendants, un lancement ciblé.

Une réserve supplémentaire concernant le rang lui-même. Les intervalles de dix points du classement I2V se chevauchent fortement du troisième au sixième rang — 1 179, 1 178, 1 176, 1 175 — de sorte que « troisième » est une position noyée dans le bruit, et non une séparation nette avec la quatrième place. Ce qui n’est pas noyé dans le bruit, c’est l’écart avec le modèle qu’il a remplacé. L’écart de 123 Elo entre Vidu Q3 Pro et Vidu Q4 Preview est plus grand que toute l’amplitude des six premières places du classement.

The Artificial Analysis image-to-video board on 8 October 2026, with Vidu Q4 Preview third at Elo 1,179 and Vidu Q3 Pro nineteenth at 1,056.

Ce que vous appelez réellement, et ce que cela coûte

L'API n'a rien de glamour et reste très spécifique. Image-to-Video effectue un POST vers /ent/v2/img2video avec le nom de modèle viduq4-preview, prend une seule image de départ (png, jpeg, jpg ou webp, jusqu'à 50 Mo), un prompt allant jusqu'à 20 000 caractères, une durée de 3 à 16 secondes avec 5 par défaut, et une résolution de 540p à 4K avec 720p par défaut. Reference-to-Video effectue un POST vers /ent/v2/reference2video, prend de une à quinze images, plus de zéro à trois références audio mp3 de trois à douze secondes chacune, et propose des ratios d'image de 1:1, 9:16, 16:9, 3:4 et 4:3 avec 16:9 par défaut.

Le paramètre à remarquer est audio, dont la valeur par défaut est true. Vidu Q4 Preview génère du son avec l'image par défaut — dialogues et effets sonores inclus — et vous le désactivez délibérément. Les URL de création renvoyées restent valides pendant 24 heures, ce qui est suffisamment court pour avoir son importance si vous générez en lot et effectuez le rendu plus tard.

Sur le plan tarifaire, le calcul honnête est que les deux nombres avancés — « 0,014 $ par seconde » et les 7,20 $ par minute qu’enregistre Artificial Analysis — ne correspondent pas au même produit. 0,014 $ par seconde équivaut à 0,84 $ par minute, soit environ un neuvième du chiffre du classement, ce qui correspond à ce que donne un tarif promotionnel plancher à la résolution la plus basse face à un tarif mesuré à une résolution de production. Tout budget que vous établissez à partir du chiffre de lancement devrait être recalculé à partir de votre propre résolution et de votre propre durée, et non à partir du titre.

Vidu's own API documentation for the Image-to-Video and Reference-to-Video endpoints behind Vidu Q4 Preview.

Le problème pratique d'un SKU de prévisualisation

Vidu Q4 Preview n'est pas terminé, de l'aveu même de son fournisseur. Il est sorti avant le Q4 afin que les retours sur les performances, le contrôle créatif et les besoins de production au quotidien nourrissent la version finale. La tarification est promotionnelle. La disponibilité des fonctionnalités varie selon le forfait et la région. La documentation de l'API comporte même un alias mal orthographié — viduq4-previerw apparaît dans la description du paramètre du modèle aux côtés du viduq4-preview correct — un petit détail qui en dit long sur la place de cette version dans le pipeline.

Ce n'est pas un argument contre son utilisation. C'est un argument contre le fait de le placer sur un chemin critique sans plan pour ce qui se passera lorsque le prix promotionnel prendra fin ou que la version d'aperçu sera remplacée, ce qui, pour un modèle publié de cette manière, est une question de semaines, pas de trimestres.

Si vous souhaitez l'essayer sans miser un pipeline de production dessus, OrcaRouter est conçu exactement pour ce cas de figure : un point de terminaison compatible OpenAI couvrant plus de 200 modèles, un basculement automatique entre fournisseurs, et les tarifs catalogue des fournisseurs répercutés sans marge ajoutée. La partie « basculement » compte plus que d'ordinaire avec une version en préversion, car c'est elle qui vous permet d'acheminer une requête vers un modèle stable sur la même clé lorsqu'une route de préversion est indisponible. Pour être clair sur le routage : Vidu Q4 Preview n'est pas une route d'OrcaRouter aujourd'hui. Les modèles vidéo que nous proposons — dont MiniMax H3, le modèle le mieux classé sur ce tableau même — sont appelables sur le même point de terminaison que les modèles de texte, et un tarif vidéo à la seconde est une simple ligne de facturation, pas un contrat à part.

Que regarder

Trois choses feraient avancer cette histoire.

D’abord, le classement text-to-video. Artificial Analysis a annoncé l’arrivée d’AA-Video-I2V v2.0, aligné sur la taxonomie T2V v2.0 et couvrant la vidéo 1080p de bout en bout. Si Vidu Q4 Preview est un modèle image-et-référence, il n’y apparaîtra pas non plus — et s’il y apparaît, cela vous indique que Shengshu a livré un modèle plus étendu que ne le laisse entendre l’aperçu.

Deuxièmement, la version complète du T4. C’est au passage de l’aperçu à la version finale que la tarification promotionnelle se termine généralement et que l’ensemble des fonctionnalités tient ou se réduit discrètement. Le budget de références de 15 images et 3 audios est l’élément de la spécification le plus susceptible de perdurer, car c’est le différenciateur sur lequel repose tout le lancement.

Troisièmement, la taille de l’échantillon. 5 543 votes constituent une mesure réelle, mais encore jeune ; les intervalles se resserreront et le rang évoluera, dans un sens comme dans l’autre, à mesure que le tableau se remplit. Quiconque cite « troisième » comme un fait établi devrait préciser la date à laquelle il l’a lu.

La question qu’il vaut la peine de garder en tête est plus étroite que ne le suggère le marketing. Vidu Q4 Preview est, de manière mesurable, le meilleur modèle image-vers-vidéo que Vidu ait produit, avec une marge supérieure à l’écart des six premiers du classement lui-même, et à un tarif par minute inférieur à celui de son prédécesseur. Que cela devienne une position durable ou un simple engouement lié à la préversion, aucun des chiffres actuels ne peut le dire.