
Vidu Q4 Preview vs MiniMax H3 : le sommet du classement est à égalité, mais un seul des deux figure sur trois classements
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le classement image-vers-vidéo d'Artificial Analysis, consulté le 8 octobre 2026, place MiniMax H3 Max premier à 1 195 Elo, MiniMax H3 deuxième à 1 181, et Vidu Q4 Preview troisième à 1 179. Seize points séparent le premier du troisième, avec des intervalles d'environ ±10 et ±11, sur respectivement 5 894, 7 284 et 5 543 votes. C'est une égalité statistique déguisée en podium, et toute page qui s'ouvre en déclarant un gagnant sur ce classement lit du bruit.
La question intéressante n'est donc pas de savoir lequel de ces deux modèles est le meilleur. C'est ce qui arrive à la comparaison dès que l'on quitte le seul tableau où les deux apparaissent — car MiniMax H3 a été publié le 31 juillet 2026 en tant que modèle omni-modal qui lit les références textuelles, visuelles, vidéo et audio comme un contexte unique, et Vidu Q4 Preview est arrivé le 7 octobre 2026 avec deux modes d'entrée et deux points de terminaison API. L'un d'eux est mesuré à trois endroits. L'autre ne l'est qu'à un seul.
Ce que l’égalité à trois signifie et ne signifie pas
Les deux entrées MiniMax et la build Vidu se situent à l'intérieur des intervalles l'une de l'autre, donc l'affirmation honnête est que les trois meilleurs modèles image-vers-vidéo sont indiscernables selon la préférence humaine aux tailles d'échantillon actuelles. Deux détails rendent cette égalité moins flatteuse pour tout le monde qu'elle n'en a l'air.
Le premier, c’est l’âge. Les votes de MiniMax H3 datent de juillet 2026 et ceux de H3 Max d’août ; ceux de Vidu Q4 Preview datent d’octobre. Des viviers de votes plus grands et plus anciens sont mesurés face à un paysage concurrentiel différent et à un ensemble d’adversaires différent, ce qui joue dans les deux sens : mieux mesurés, et portant sur une question légèrement différente. Un écart de 16 points dans un sens ou dans l’autre ne constitue pas une preuve ici.
Le deuxième est la colonne des prix. Artificial Analysis enregistre MiniMax H3 à 7,80 $ par minute et H3 Max à 4,80 $ par minute dans ce classement. Vidu Q4 Preview y est enregistré à 7,20 $. Si on les lit comme un classement, H3 Max apparaît comme le meilleur rapport qualité-prix des trois — mais les tarifs pratiqués par les fournisseurs sous-jacents expliquent cette étiquette plutôt qu'ils ne la contredisent. Sur notre propre fiche modèle, nous indiquons MiniMax-H3 à 0,08 $ par seconde en 768P et à 0,13 $ par seconde en 2K, soit 4,80 $ et 7,80 $ par minute. Les deux chiffres MiniMax du classement correspondent au même modèle facturé à deux niveaux de résolution, et non à une offre haut de gamme et à une offre bon marché. Les colonnes de prix à la minute d'un classement fondé sur les préférences sont utiles pour les ordres de grandeur et dangereuses dès qu'on entre dans le détail.
Là où MiniMax H3 apparaît et où Vidu Q4 Preview n'apparaît pas
C’est la partie de l’affrontement qui survit à l’égalité, et il s’agit d’une différence structurelle plutôt que qualitative.
MiniMax H3 (768p) occupe la quatrième place du classement texte-vers-vidéo avec 1 137 Elo sur 8 315 votes, H3 Max étant cinquième avec 1 130 sur 5 719. Il est de nouveau quatrième du classement de montage vidéo avec 1 119 sur 7 023 votes, dans un classement qui évalue les modèles sur le montage d’une vidéo à partir d’une instruction textuelle, l’audio étant conservé. Vidu Q4 Preview ne figure dans aucun des deux.
Cette absence n'est pas une lacune de mesure — c'est ce qu'est le produit. L'API de Vidu Q4 Preview documente deux points de terminaison, /ent/v2/img2video et /ent/v2/reference2video, et la page produit répertorie deux modes, Image-to-Video et Reference-to-Video. Il n'existe aucun parcours text-to-video dans la documentation. Il n'existe pas non plus de parcours d'édition vidéo, ce qui signifie que le modèle ne peut pas prendre un clip existant et y modifier quelque chose. MiniMax H3 fait les deux, et son cadrage omnimodal — des références texte, image, vidéo et audio dans un même contexte — est la raison pour laquelle il en est capable.
Il vaut la peine d’être précis sur le volet audio, car les deux modèles gèrent l’audio en natif et ce ne sont pas la même chose. Vidu Q4 Preview génère l’audio et la vidéo ensemble, avec un audio paramètre dans le point de terminaison image-vers-vidéo qui produit une vidéo avec dialogues et effets sonores, et il accepte jusqu’à trois clips audio de référence pour assurer la cohérence de la voix d’un personnage. MiniMax H3 produit un audio stéréo natif et accepte l’audio comme modalité d’entrée aux côtés des images et de la vidéo. Le cas d’usage de la voix de référence est la force spécifique de Vidu ; le cas d’usage de la référence pour tout est celle de MiniMax.
L’arithmétique par seconde, palier par palier
Les deux modèles facturent à la seconde de sortie générée, ce qui en fait l’une des rares comparaisons où les grilles tarifaires peuvent être mises en regard l’une de l’autre sans conversion.
• 540p — Vidu Q4 Preview uniquement : 9 crédits par seconde, soit environ 0,045 $ au tarif standard de 0,005 $ par crédit publié par la plateforme
• 720P / 768P — Vidu Q4 Preview 19 crédits par seconde, environ 0,095 $ contre MiniMax-H3 0,08 $ par seconde
• 1080p — Vidu Q4 Preview 24 crédits par seconde, environ 0,12 $ contre MiniMax-H3, aucun palier 1080p publié
• 2K — Vidu Q4 Preview 38 crédits par seconde, environ 0,19 $ contre MiniMax-H3 0,13 $ par seconde
• 4K — Vidu Q4 Preview uniquement : 78 crédits par seconde, environ 0,39 $
Le schéma qui en ressort n’est pas « l’un est moins cher ». Le plancher tarifaire de Vidu Q4 Preview est réellement plus bas — son palier 540p est un palier de blocking dont le prix correspond exactement à son usage, valider une composition avant de payer un rendu en pleine résolution, et rien dans la grille tarifaire de MiniMax ne joue ce rôle. MiniMax H3 est moins cher d’environ un tiers en 2K, le palier le plus élevé que partagent les deux modèles. Et le palier 4K de Vidu est le seul palier de génération 4K de la comparaison, à un prix qui le reflète.
Le chiffre de lancement de 0,014 $ par seconde qui accompagnait l’annonce de Vidu correspond au palier 540p à un tarif de crédits remisé, et non à un tarif général. La plateforme de Shengshu propose actuellement des remises promotionnelles à durée limitée allant jusqu’à 30 % sur les lots de crédits, qui abaissent tous les paliers ensemble plutôt que de modifier la forme de la courbe. Considérez la courbe des tarifs catalogue comme point de comparaison et la remise comme un décalage temporaire.
De notre côté, nous routons MiniMax-H3. Il est en production sur l'API publique de modèles sous l'identifiant minimax/minimax-h3, facturé à la seconde de sortie générée au tarif catalogue du fournisseur, répercuté tel quel sans aucune majoration, et appelable sur le même point d'accès compatible OpenAI que tous les modèles de texte que nous servons. Vidu Q4 Preview n'est pas une route OrcaRouter, et cette page ne prétend pas le contraire : les modèles vidéo que nous servons se trouvent sur une seule clé et une seule forme de requête, aux côtés des modèles de langage — une configuration qui permet de comparer plusieurs d'entre eux à faible coût. Une conséquence pratique de la tarification en répercussion : lorsqu'un fournisseur modifie un tarif à la seconde, ce changement est visible sur la route le jour même, plutôt qu'à la date de renouvellement du contrat.
Ce que « omni-modal » apporte dans une requête réelle
Le contexte unifié de MiniMax H3 se lit facilement comme une liste de fonctionnalités, au risque de passer à côté de ce qu'il représente sur le plan de l'ingénierie. Un modèle qui accepte la vidéo comme référence d'entrée peut être pointé vers un plan existant et invité à le poursuivre, à l'étendre ou à en modifier le style ; un modèle sans entrée vidéo ne le peut pas. C'est le mécanisme qui explique la présence de H3 sur la table de montage, et c'est aussi pourquoi la plage de sortie de 4 à 15 secondes du modèle est moins une limite que le chiffre ne le suggère — l'extension multi-tours est la manière normale d'en tirer une séquence plus longue.
Le plafond de 16 secondes de Vidu Q4 Preview est lui aussi par génération, et son mode Reference-to-Video est conçu pour la narration multi-plans dans cette fenêtre, la documentation décrivant une commutation intelligente des caméras et une cohérence entre plusieurs positions de caméra. Ce qu'il n'a pas, c'est un moyen d'accepter un clip que vous avez déjà tourné et de le modifier. Si votre flux de travail part de séquences filmées plutôt que d'une image fixe ou d'un ensemble de références, l'un de ces deux modèles ne vous est tout simplement pas accessible, et aucun score Elo ne comble cet écart.
Lequel, par métier ?
Choisissez MiniMax H3 lorsque l'entrée n'est ni une image ni un ensemble de références. Texte-vers-vidéo, montage vidéo-vers-vidéo, entrée audio, extension multi-tours au-delà de quinze secondes, ou un pipeline où le modèle doit couvrir les cas d'usage de trois cartes différentes — c'est le territoire de H3, et c'est le seul des deux qui en dispose de l'un d'entre eux. Son tarif 2K est également le plus avantageux des deux au niveau supérieur qu'ils partagent.
Prenez Vidu Q4 Preview lorsque l'enjeu est la cohérence du casting et de la voix, ou lorsque vous avez besoin d'un palier de génération en 4K, ou lorsque vous voulez une passe de blocking 540p bon marché pour itérer sur un plan avant de vous engager. Quinze références d'image et trois références audio constituent un budget de références publié plus large que ce que documente MiniMax, et aucun autre modèle de cette comparaison ne génère nativement en 4K. L'ensemble de modes plus restreint est la contrepartie.
Ce qui changerait cela : une sortie complète de Vidu Q4, qui ajoute un point de terminaison texte-vers-vidéo, placerait les deux modèles sur les mêmes classements et transformerait cette situation en une compétition directe. AA-Video-I2V v2.0, annoncé comme devant proposer du 1080p de bout en bout et une taxonomie révisée des capacités, remplacerait les votes en tête du classement plutôt que de les retrier — et il permettrait de trancher si l’actuelle égalité à trois est une égalité ou une limite de mesure. D’ici là, le nombre à retenir est seize, avec le nom du classement et la date à côté.
La seule chose à retenir du podium lui-même : une première place située seize points Elo au-dessus de la troisième, sur des intervalles aussi larges, n’est pas un classement. Ce sont trois modèles que les votants humains ne peuvent pas départager, et le choix entre eux doit venir de tout le reste sur cette page.



