Un carton-titre indiquant « Utopai X fait ses débuts à la 2e place en texte-vers-vidéo », sous-titré « Le post-entraînement d'un studio de cinéma de MiniMax H3 - Elo 1 150, deuxième derrière Wan 3.0 seulement », avec des pastilles indiquant « Elo 1 150 », « 5 455 votes » et « Aucune API ».
Guides & Insights

Utopai X fait ses débuts à la 2e place en texte-vidéo : dans les coulisses du post-entraînement de MiniMax H3 par un studio de cinéma

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Utopai X est un modèle vidéo qui n'existait pas la semaine dernière, qui n'a pas été entraîné de zéro par un laboratoire de pointe et qui n'est pas vendu via une API — et il occupe actuellement la deuxième place mondiale en texte-vers-vidéo. Le modèle vient d'Utopai Studios, un studio de cinéma et de télévision natif de l'IA basé à Mountain View, et il s'agit d'un post-entraînement de MiniMax H3, le modèle vidéo omni-modal de MiniMax. Dans le classement texte-vers-vidéo avec audio d'Artificial Analysis (le tableau qu'Artificial Analysis désigne désormais sous le nom d'AA-Video-T2V v2.0, résultats du 29 septembre 2026), Utopai X se situe à 1 150 au classement Elo — derrière seulement Wan 3.0 d'Aliba​sba, à 1 157, et devant Dreamina Seedance 2.5 de ByteDance, à 1 143, ainsi que le modèle de base MiniMax H3 (768p) dont il a été affiné, à 1 138. Il est arrivé le 30 septembre 2026, le jour même où le classement a été actualisé, et il n'est disponible qu'à un seul endroit : au sein de PAI, la plateforme de production d'Utopai. Aucune API publique n'est disponible, et la colonne de tarification d'Artificial Analysis pour cette ligne indique « No API available ».

Cette combinaison — deuxième au monde, un seul canal de distribution, aucune grille tarifaire à la seconde au sens habituel — est toute l’histoire. Un studio qui fait des films a pris le modèle de fondation de quelqu’un d’autre, l’a ajusté en fonction de son propre jugement de production, et a grillé la file d’attente. Savoir s’il s’agit d’un résultat durable ou d’un instantané d’une arène toute nouvelle est la question qui mérite d’être posée, et la réponse dépend de la lecture du classement plutôt que du communiqué de presse.

Ce que le tableau montre réellement

Artificial Analysis classe les modèles vidéo à l'aide d'un score Elo dérivé d'un vote de préférence humaine en aveugle par paires. Les votants voient deux clips générés à partir du même prompt et choisissent celui qu'ils préfèrent, sans savoir quel modèle a produit l'un ou l'autre. Le classement évolue à mesure que les votes s'accumulent, et chaque ligne comporte un intervalle de confiance qui indique de combien la position peut bouger. Capturé le 2026-10-01, le classement texte-vers-vidéo avec audio se lit comme suit :

A scoreboard card reading 'Utopai X (based on MiniMax H3) - the scoreboard', with rows for text-to-video rank #2 (board range #1-3), Elo 1,150 (+/-11), votes 5,455, parent model MiniMax H3 (768p), parent model Elo 1,138 (+/-10), and availability PAI subscribers only with no API.

• #1 Wan 3.0 — Elo 1 157 (±10), 6 391 échantillons, publié en août 2026, 12,00 $/min.

• #2 Utopai X (basé sur MiniMax H3) — Elo 1 150 (±11), 5 455 échantillons, sorti en sept. 2026, aucune API disponible.

• #3 Dreamina Seedance 2.5 — Elo 1 143 (±10), 6 375 échantillons, sorti en juillet 2026, 34,12 $/min.

• #4 MiniMax H3 (768p) — Elo 1 138 (±10), 6 343 échantillons, sorti en juil. 2026, 4,80 $/min.

• #5 FLUX 3 — Elo 1 129 (±10), 5 628 échantillons, publié en juil. 2026, 17,40 $/min.

Deux détails importent plus que l’ordre. Premièrement, l’écart entre le premier et le deuxième est de sept points Elo, et les deux intervalles se chevauchent explicitement — Artificial Analysis affiche la fourchette d’Utopai X comme allant de 1 139 à 1 161, qui contient l’estimation ponctuelle de Wan 3.0, à savoir 1 157. Le tableau indique le rang d’Utopai X sous forme de fourchette, #1–3, et non de position fixe. Deuxièmement, l’écart entre Utopai X et le modèle à partir duquel il a été post-entraîné est de douze points, avec le même problème de chevauchement, donc « le modèle post-entraîné bat son parent » est directionnellement vrai et statistiquement fragile. Le texte publié par Utopai est plus prudent que la plupart des publications de lancement à ce sujet : il indique que le résultat Elo « fournit une évaluation indépendante de la façon dont les gens réagissent à ses séquences générées », ce qui est une lecture juste de ce que mesure une arène de préférence humaine, et non une affirmation sur la réalisation cinématographique.

La couche déclarée par le fournisseur, en revanche, se montre confiante. Utopai décrit des points forts en matière de réflexions et de caustiques — les motifs concentrés qui se forment lorsque la lumière se réfléchit ou se réfracte — ainsi que de cohérence spatiale au sein d’un clip, deux éléments qui sont des objectifs de développement plutôt que des résultats de benchmark. Ce sont les mots du fournisseur, pas les mesures d’Artificial Analysis.

Un studio plutôt qu'un laboratoire

Utopai Studios développe, finance et produit ses propres projets de cinéma et de télévision, et elle construit ses modèles à l'intérieur de cette activité plutôt qu'à côté. Le mécanisme énoncé est celui du retour d'information : les productions génèrent des scénarios, des conceptions de personnages et de lieux approuvées, des plans de tournage et des prises successives, et les réalisateurs, directeurs de la photographie et artistes du studio enregistrent non seulement quelles prises ont été conservées, mais aussi pourquoi les autres ont été rejetées. Ce registre devient un signal d'entraînement et d'évaluation. L'équipe de recherche gère également un système Elo interne qui combine l'évaluation des préférences humaines avec un vote automatisé par des modèles vision-langage, les artistes participant au volet humain.

C'est un avantage plausible, et invérifiable de l'extérieur. Le post-entraînement peut orienter un modèle vidéo général vers les préférences des utilisateurs du cinéma et de la publicité sans remplacer le modèle de fondation — c'est du moins ce qui est cohérent avec le classement. La part des douze points de progression par rapport à MiniMax H3 qui provient des données d'entraînement, de l'optimisation des préférences, de la gestion des prompts, des paramètres d'inférence ou des modifications au moment du service ne figure pas dans les documents de lancement. Utopai n'a publié aucune divulgation de données de post-entraînement, aucune méthode d'optimisation, aucun budget de calcul et aucune évaluation de sécurité. Les chercheurs indépendants ne peuvent pas reproduire le gain, et il n'y a aucun rapport technique à contester.

La couche de distribution est l'endroit où la thèse du studio se concrétise. PAI — Production Assistive Intelligence — est la plateforme qu'Utopai a lancée en parallèle du modèle, et elle contient le contexte du projet : découpage du scénario en scènes et en plans, une bibliothèque de production de personnages, de lieux et d'objets, l'historique des versions, des validations partagées pour les équipes d'entreprise, et une timeline qui s'exporte vers Premiere Pro ou DaVinci Resolve. L'argument de vente, c'est que générer un clip est la partie peu coûteuse et que maintenir la cohérence d'un plan avec le reste du film est la partie coûteuse. Utopai X génère des séquences dans cet espace de travail « lorsqu'il est sélectionné par le cinéaste », selon la formulation même de l'entreprise — le modèle est une option parmi plusieurs modèles d'image, de vidéo et d'audio disponibles dans PAI, et non la seule.

Ce que coûte Utopai X, et comment le lire

The Artificial Analysis Video Arena text-to-video leaderboard, last updated September 29, 2026, listing Wan 3.0 at Elo 1,157, Utopai X at 1,150, Dreamina Seedance 2.5 at 1,143, MiniMax H3 (768p) at 1,138 and FLUX 3 at 1,129, each with sample counts, release months and price per minute.

PAI est vendu sous forme d’abonnement avec des crédits, et non comme une API à la seconde. Les paliers publiés sont 15 $/mois pour 1 000 crédits, 49 $/mois pour 3 500 crédits, 129 $/mois pour 10 000 crédits et 379 $/mois pour 35 000 crédits, la facturation annuelle offrant une remise d’environ 8 à 10 %, plus des recharges à 15 $ par 1 000 crédits. Utopai X a sa propre ligne dans le tableau des crédits de PAI : 93 crédits par seconde de vidéo en 1080p. Les autres modèles vidéo de la plateforme se situent plus bas — 50 crédits par seconde en 1080p sur le palier standard et 76 sur le palier pro.

Convertir cela en un chiffre par minute est un calcul que tout le monde peut faire et que presque personne ne devrait citer comme prix. À 93 crédits par seconde, une minute de sortie d'Utopai X coûte 5 580 crédits. Le forfait d'entrée à 15 $ permet d'obtenir 1 000 crédits par mois, soit environ 10,8 secondes de séquences si chaque crédit était consacré à ce modèle. En extrapolant linéairement le taux de crédits du forfait d'entrée, le coût implicite se situe dans l'ordre de 80 $ ou plus par minute de vidéo générée. Ce chiffre ne mérite d'être énoncé qu'accompagné de ses réserves : il suppose une conversion strictement linéaire des crédits en dollars, il ignore que les crédits sont mutualisés entre tous les modèles de PAI et qu'ils expirent ou restent inutilisés, il ignore les remises annuelles et les forfaits de recharge, et il ne dit rien des limites de résolution ou de durée, qu'Utopai n'a pas précisées séparément pour Utopai X. C'est un ordre de grandeur utile, pas une grille tarifaire.

Pour comparaison, sur le même tableau Artificial Analysis, MiniMax H3 (768p) est indiqué à 4,80 $ par minute et Wan 3.0 à 12,00 $, tandis que Dreamina Seedance 2.5 est indiqué à 34,12 $. Il s’agit de flux de tarification automatisés provenant des propres API des fournisseurs, et non d’estimations dérivées d’abonnements ; la comparaison n’est donc au mieux qu’indicative — mais la direction est claire : au niveau d’entrée, la génération au sein d’une plateforme de studio basée sur des crédits ne rivalise pas avec une tarification API à la seconde. Ce que l’acheteur paie, c’est l’espace de travail autour du modèle, pas la seconde marginale du modèle.

La partie qui n'est pas publique

Trois lacunes méritent d’être nommées, car chacune bloque une décision différente.

• Pas d'API, et aucune voie d'intégration. Utopai X n'a actuellement aucune voie d'intégration directe. Une équipe produit qui souhaite l'appeler dans un pipeline ne peut pas le faire. Artificial Analysis le répertorie comme « No API available », et les documents de lancement ne mentionnent aucun accès développeur.

• Aucune spécification distincte. MiniMax H3 génère des clips de 4 à 15 secondes, jusqu'en 2K, avec un audio stéréo natif. Utopai n'a pas publié de durée ni de résolution maximale propres à Utopai X, ce qui signifie que la valeur 1080p du tableau de crédits est la seule indication de résolution disponible et que la durée des clips est inconnue.

• Aucune évaluation au-delà de l'arène. Le résultat Elo est une mesure indépendante de la préférence humaine sur des clips courts. Ce n'est pas une mesure de la capacité d'une séquence à servir un plan voulu, à s'intégrer dans un montage ou à survivre à une révision. Le post d'Utopai lui-même le reconnaît explicitement — « l'évaluation se poursuit également après la génération d'un clip » — ce qui est un cadrage d'une honnêteté inhabituelle pour un lancement, et aussi un avertissement sur la portée du classement.

Du côté du studio, il y a davantage d’historique à évoquer. Utopai a lancé PAI 2.0 le 2 juin 2026 et a déclaré à l’époque que la plateforme avait atteint 11 millions de dollars de revenu récurrent annuel moins de deux mois après ses débuts en avril, porté par les licences commerciales vendues à des sociétés de production. La société dit qu’elle a trois films pour le cinéma et deux séries prévus pour 2027 et qu’elle applique PAI et Utopai X à ses propres productions, y compris Le Pet le plus sérieux, un long métrage d’animation écrit et réalisé par Mike Bender. Ce sont les chiffres du studio et le calendrier du studio, et c’est la raison pour laquelle un post-train sans API mérite tout simplement qu’on en parle : le modèle est utilisé pour faire des films que l’entreprise compte sortir, ce qui est un test plus difficile qu’un classement.

Là où le modèle de base reste le choix pratique

The OrcaRouter model page for MiniMax H3, showing the 0% markup badge, a description of omni-modal 4-to-15-second video generation at up to 2K with native stereo audio, a $0.08 per second price panel, a performance panel with p50 latency, and a release date of 7/31/2026.

Pour quiconque a réellement besoin de générer de la vidéo cette semaine, la moitié routable de cette famille est le modèle de base. MiniMax H3 est disponible sur OrcaRouter au prix catalogue du fournisseur — 0,08 $ par seconde en 768p, soit 4,80 $ par minute, le même chiffre que celui indiqué par Artificial Analysis — avec 0 % de marge, de sorte que toute baisse de prix d'un fournisseur est répercutée le jour même plutôt qu'après un cycle de réévaluation tarifaire, et avec un basculement automatique entre fournisseurs afin qu'une panne d'un seul point de terminaison ne fasse pas tomber votre pipeline. Il accepte des références texte, image, vidéo et audio comme un contexte unifié et renvoie des clips de 4 à 15 secondes en 768P ou 2K avec audio stéréo natif, facturés à la seconde de sortie générée.

Utopai X n'est pas routé, et rien dans cet article ne doit être lu comme une affirmation qu'il l'est. Ce que le modèle de base vous offre, c'est un moyen de tester les caractéristiques esthétiques et de mouvement de la famille H3 — le même socle que celui dont Utopai est parti, avant le post-entraînement qu'il a appliqué, quel qu'il soit — via une seule clé API aux côtés de plus de 200 autres modèles, sans abonnement PAI. Si Utopai X atteint un jour un fournisseur routable, il apparaîtrait au prix catalogue le jour même, avec le tarif du fournisseur répercuté plutôt que majoré. D'ici là, la répartition honnête est la suivante : Utopai X pour les studios au sein de PAI, MiniMax H3 pour tous ceux qui assemblent un pipeline.

Qu’est-ce qui détermine si c’était un début ou un moment ?

Trois choses méritent d’être surveillées au cours du prochain trimestre. Premièrement, si l’écart de sept points en tête survit à quelques milliers de votes supplémentaires — les intervalles se chevauchent aujourd’hui, et un classement qui se réorganise lorsqu’une nouvelle série de comparaisons arrive n’a rien tranché. Deuxièmement, si Utopai ouvre ne serait-ce qu’un accès développeur ; un modèle classé deuxième au monde que seul un abonné PAI peut appeler est une décision produit, et elle est réversible. Troisièmement, si la concurrence évolue dans l’autre direction. Wan 3.0 génère déjà jusqu’à 30 secondes de 1080p avec audio natif et accepte le texte, les images, la vidéo, l’audio, les documents et les pages web comme références, et il domine le classement sur l’éclairage, les matériaux et le contrôle de la caméra dans la répartition par cas d’usage. Un gain de douze points après entraînement par rapport à un modèle de base est suggestif ; conserver la deuxième place face à un modèle de fondation avec une enveloppe d’entrée plus large est un exercice différent.

Ce qui est réellement nouveau ici, ce n’est pas l’Elo. C’est la forme de l’affirmation : un studio doté d’une chaîne de production soutient que la propriété des décisions qui se cachent derrière les images — quelle prise, quelle référence, quelle révision — vaut plus que la propriété du cycle de pré-entraînement. Cet argument est testable, et le box-office de la programmation 2027 est l’un des tests.