MiniMax H3 (Hailuo 3.0) : Le modèle vidéo IA 2K avec Omni-Reference, expliqué
Guides & Insights

MiniMax H3 (Hailuo 3.0) : Le modèle vidéo IA 2K avec Omni-Reference, expliqué

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

MiniMax H3 — mieux connu sous le nom de Hailuo 3.0 — est le tout dernier modèle de génération vidéo par IA de MiniMax, dévoilé à la WAIC 2026 (17 juillet 2026), mis à la disposition du public le 31 juillet et désormais disponible de quatre façons à la fois : la plateforme Hailuo de MiniMax, Luma Agents, un téléchargement de poids ouverts et — depuis le 30 août — l’AI Gateway de Vercel, où le nouveau MiniMax H3 Max, pensé pour la rapidité, a été lancé à ses côtés. Il fait passer la gamme vidéo de MiniMax à la résolution native 2K, ajoute une piste audio synchronisée en une seule passe et introduit un système de contrôle « omni-reference » d’une richesse inhabituelle. La nouveauté la plus récente se situe du côté de l’auto-hébergement : depuis le 1er septembre, les poids ouverts H3-Base peuvent être servis via vLLM-Omni avec le FastH3 de FastVideo, assez rapide pour générer un MP4 complet de 10,1 secondes avec vidéo et audio en environ 8,7 secondes — plus rapidement que sa durée de lecture. Ce guide explique ce qu’est réellement H3, ce qui est vraiment nouveau et où il se situe parmi les modèles vidéo de pointe de 2026 — avec des capacités sourcées et des allégations de qualité clairement étiquetées.

Note sur l'exactitude : les capacités de H3 proviennent de l'annonce de MiniMax et de la documentation de sa plateforme. La disponibilité de H3 sur Vercel AI Gateway est confirmée — le catalogue de modèles de Vercel répertorie à la fois MiniMax H3 et MiniMax H3 Max, et le changelog de Vercel documente la remise de lancement — bien que les conditions de l'offre elle-même soient annoncées par le fournisseur. L'intégration avec Luma Agents et la sortie des poids ouverts ne sont toujours qu'annoncées par le fournisseur au moment où nous écrivons ; la documentation produit de Luma ne répertorie pas encore H3, et les conditions d'accès à l'intégration sont peu claires. La qualité vidéo est largement subjective et s'évalue dans des arènes de préférence humaine ; H3 dispose désormais de premiers scores dans l'arène Artificial Analysis — environ 1 184 en image-to-video et 1 226 en text-to-video avec audio, relevés le 27 août 2026 — même si les classements des arènes évoluent à mesure que les votes s'accumulent. Le chiffre du 1er septembre concernant une génération plus rapide que la lecture — un MP4 complet de 10,1 secondes avec audio synchronisé, généré en environ 8,7 secondes — est rapporté par l'équipe vLLM-Omni dans son propre article de blog, mesuré sur un serveur 8× NVIDIA B300 ; il s'agit d'un benchmark d'équipe qui n'a pas encore été reproduit de manière indépendante, et il mesure FastH3, l'adaptateur distillé en quatre étapes de FastVideo, et non le modèle de base complet. Traitez les affirmations comparatives du type « lequel rend le mieux » comme provisoires. Les spécifications et les prix changent — vérifiez avant de construire.

TL;DR. H3 est un modèle texte-vers-vidéo et image-vers-vidéo natif 2K, 24 fps, qui génère des clips de 5 à 15 secondes (extensibles à ~30 s) avec dialogue synchronisé, effets sonores et ambiance en un seul passage. Ses atouts majeurs sont l’omni-reference (jusqu’à 9 images de référence, 3 clips vidéo et 3 clips audio pour la cohérence) et l’édition basée sur des instructions (modifier les personnages, les objets, les scènes, le son ou le rythme sans régénération). Depuis son lancement, il s’est répandu rapidement : les poids de base ont été ouverts le 3 août, MiniMax a annoncé H3 dans Luma Agents le 6 août (jusqu’à 15 secondes de vidéo 2K avec son stéréo natif, bien que les conditions d’accès ne soient pas encore publiques), et le 30 août, MiniMax H3 et MiniMax H3 Max sont arrivés sur l’AI Gateway de Vercel avec une remise de lancement de 50 % pendant deux semaines. Depuis le 1er septembre, les poids de base ouverts peuvent également être utilisés pour la génération en temps réel : via vLLM-Omni avec FastH3 de FastVideo, un MP4 complet de 10,1 secondes (vidéo et audio) est généré en environ 8,7 secondes — plus rapide que la lecture, selon le benchmark de l’équipe vLLM-Omni. C’est un grand pas par rapport à Hailuo 2.3 (qui était en 1080p, ~10 s, sans omni-reference), et il concurrence Kling 3.0, Google Veo 3.1, ByteDance Seedance 2.0 et d’autres — solide sur le contrôle et l’audio, avec des premiers scores indépendants en arène encore à confirmer.

Points clés

H3 = Hailuo 3.0, le dernier modèle vidéo de MiniMax, dévoilé au WAIC 2026 et publié le 31 juillet ; disponible via Hailuo, Luma Agents, les poids ouverts et l'AI Gateway de Vercel.

• 2K natif à 24fps, clips de 5 à 15 secondes (extensibles jusqu'à ~30s), plusieurs ratios d'aspect, texte-vers-vidéo et image-vers-vidéo.

• Référence omnibus : jusqu'à 9 images, 3 clips vidéo et 3 clips audio comme références pour la cohérence du style, du personnage, du mouvement et de la voix.

• Dialogue synchronisé, SFX et ambiance générés en une seule passe ; édition basée sur des instructions sans régénération complète.

• Poids de base open-sourcés le 3 août sous une licence communautaire ; les modules Context-IR et 2K-regeneration restent disponibles uniquement via API.

Le 30 août, MiniMax H3 et MiniMax H3 Max ont été lancés sur l'AI Gateway de Vercel avec une remise de lancement de 50 % jusqu'au 13 septembre.

• Depuis le 1er septembre, les poids ouverts de H3-Base peuvent être servis pour la génération en temps réel — un MP4 vidéo et audio de 10,1 secondes rendu en environ 8,7 secondes, plus rapide que la lecture — via vLLM-Omni et FastH3 de FastVideo (benchmark rapporté par l’équipe, pas encore reproduit indépendamment).

• Grande amélioration par rapport à Hailuo 2.3 (1080p, ~10s) ; rivalise avec Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7, et plus encore.

Ce qu'est réellement MiniMax H3

MiniMax est une grande entreprise chinoise d'IA (elle a réalisé son introduction en bourse à Hong Kong en janvier 2026, levant environ 619 millions de dollars pour une valorisation d'environ 4 milliards de dollars, avec des investisseurs dont Alibaba et Tencent). Sa marque vidéo grand public est Hailuo, réputée pour sa simulation physique de premier plan dans sa catégorie, sa génération rapide et ses prix accessibles. H3 est le modèle Hailuo de troisième génération, dévoilé aux côtés du modèle texte M3 de MiniMax et d'autres solutions multimodales au WAIC 2026 et rendu public le 31 juillet 2026. Alors que M3 est un LLM textuel/agentique, H3 est résolument un modèle de génération vidéo.

Nouveautés : 2K, omni-reference et audio one-pass.

Trois choses définissent H3. Premièrement, native 2K à 24 ips — une amélioration par rapport au 1080p de Hailuo 2.3 — à une cadence cinéma standard, avec des clips de 5 à 15 secondes (extensibles jusqu'à environ 30 secondes via un outil Extend) et des rapports d'aspect de 21:9 à 9:16. Deuxièmement, omni-reference : vous pouvez fournir jusqu'à 9 images de référence, 3 clips vidéo et 3 clips audio simultanément pour verrouiller le style, l'identité du personnage, le mouvement ou la voix — une surface de contrôle exceptionnellement généreuse pour maintenir un personnage ou un aspect cohérent entre les prises. Troisièmement, audio synchronisé en une seule passe : H3 génère des dialogues, des effets sonores et une ambiance synchronisés avec l'action à l'écran, plutôt que de nécessiter une étape audio séparée.

Édition basée sur des instructions

Une fonctionnalité discrètement importante est l'édition basée sur des instructions : au lieu de régénérer un clip à partir de zéro pour apporter une modification, vous pouvez décrire une modification — remplacer un personnage, modifier un objet, changer la scène, ajuster le son, ou redéfinir le rythme du plan — et H3 l'applique. Pour un travail créatif itératif, l'édition sur place plutôt que de relancer les dés sur une nouvelle génération est un véritable avantage en termes de flux de travail.

Comment cela se compare-t-il à Hailuo 2.3

Le bond générationnel est clair : H3 passe de la 1080p à la 2K native, étend la durée maximale d’une génération unique d’environ 10 secondes à 15 (avec une extension de 30 secondes), et ajoute à la fois les entrées omni-référence et l’édition basée sur les instructions, qui manquaient à la version 2.3. Si vous avez utilisé Hailuo 2.3, H3 est une mise à niveau directe en termes de résolution, de durée, de contrôle et d’audio.

Où se situe H3 dans la frontière de 2026

H3 affiche désormais des scores préliminaires de l'arène Artificial Analysis — environ 1 184 en image-vers-vidéo et 1 226 en texte-vers-vidéo avec audio, relevés le 27 août 2026 — bien que les classements de l'arène évoluent au fil des votes, jugez-le donc avec vos propres prompts de test plutôt que sur une seule affirmation.

Une note sur O​penAI Sora

Si vous planifiez le domaine vidéo : OpenAI a abandonné les expériences web et application Sora en avril 2026, avec son API prévue pour prendre fin en septembre 2026 — Sora n'est donc pas un modèle sur lequel lancer de nouveaux flux de travail vidéo. La frontière active est l'ensemble ci-dessus, et H3 la rejoint.

Comment accéder à H3 et au reste du champ

H3 est maintenant accessible de quatre manières, et cette liste s'est allongée depuis le lancement.

• Hailuo (la plateforme propre de Mini​Max) : le produit complet, y compris l’édition basée sur des instructions et l’upscale H3-Regenerate-2K jusqu’en 2K.

• Luma Agents : Mini​Max a annoncé le 6 août 2026 que H3 est désormais disponible dans le produit Agents multi-modèles de Luma, générant jusqu'à 15 secondes de vidéo 2K avec son stéréo natif. Cette annonce provient du fournisseur, et les conditions d'accès ne sont pas encore publiques — la documentation produit de Luma ne répertorie pas H3 à l'heure où nous écrivons — attendez-vous donc à ce que les détails de tarification et d'éligibilité se précisent sous peu. Le fait que Luma héberge le modèle vidéo d'un concurrent dans son propre produit Agents est un signe de la façon dont le marché des modèles vidéo de 2026 est devenu interchangeable.

• Vercel AI Gateway : le 30 août 2026, Mini​Max et Vercel ont annoncé que MiniMax H3 et MiniMax H3 Max sont disponibles via Vercel AI Gateway, les requêtes étant facturées via la passerelle avec 50 % de réduction du 30 août au 13 septembre 2026. Les identifiants de modèles — minimax/minimax-h3 et minimax/minimax-h3-max — restent inchangés, de sorte que les intégrations existantes de la passerelle bénéficient automatiquement du tarif réduit sans modification de code. La disponibilité est confirmée dans le catalogue de modèles et le changelog de Vercel ; les conditions de la promotion sont annoncées par le fournisseur.

Poids ouverts : le 3 août 2026, Mini​Max a publié les poids de base de H3 — un transformer dense de 33B, H3-Base — sur Hugging Face et ModelScope sous la MiniMax H3 Community License, sous la forme de deux points de contrôle : H3-Base-FL2VA pour la génération texte-vers-vidéo/audio et d'images clés, et H3-Base-Ref2VA pour la génération basée sur une référence. Deux des trois modules système — H3-Context-IR (le préprocesseur de prompt) et H3-Regenerate-2K (l'upscaling 2K) — ne font pas partie de la version publique et restent exclusivement disponibles via l'API ; les exécutions auto-hébergées sont donc plafonnées en dessous de 2K. Et depuis le 1er septembre, les mêmes poids de base peuvent être servis pour la génération en temps réel via vLLM-Omni et FastH3 de FastVideo — un adaptateur distillé en quatre étapes qui génère un MP4 complet de 10,1 secondes avec vidéo et audio en environ 8,7 secondes sur un serveur 8× NVIDIA B300, plus rapide que sa durée de lecture (chiffres annoncés par l'équipe, pas encore reproduits indépendamment).

MiniMax H3 est disponible sur OrcaRouter au prix catalogue du fournisseur — 0,08 $ par seconde en 768p et 0,13 $ par seconde en 2K — sans marge et avec bascule automatique, vous pouvez donc appeler la famille H3 via une API compatible O​penAI plutôt que de connecter un point de terminaison fournisseur qui date de quelques jours. Comme aucun fournisseur unique n’héberge tous les modèles, le schéma pratique consiste à faire passer le trafic de vos LLM et agents par un seul point de terminaison (OrcaRouter achemine également le modèle de texte M3 de Mini​Max) et à utiliser directement le meilleur modèle vidéo pour chaque projet. MiniMax H3 Max n’est pas encore routé sur OrcaRouter — il est pour l’instant servi par des canaux tiers — donc si vous prototypiez avec, le réflexe de la bascule automatique porte ses fruits : essayez un modèle de quelques jours sans y engager un pipeline de production.

Service en temps réel : vidéo plus rapide que la lecture

Le développement derrière cette mise à jour se situe du côté de l’auto-hébergement. Le checkpoint de base ouvert de MiniMax H3 est un transformateur dense de 33B, et générer un clip de la manière standard implique d’exécuter environ 49 passes de transformateur de diffusion sur un long calendrier de débruitage. FastVideo, le projet open source d’entraînement et d’inférence vidéo, a publié un étudiant distillé de H3-Base appelé FastH3 : un modèle en quatre étapes (style DMD2) qui réutilise l’encodeur de texte, le VAE vidéo, le VAE audio, les tokenizers et les planificateurs de H3, mais réduit la boucle de débruitage à quatre passes de transformateur sur cinq positions sigma. vLLM-Omni, l’environnement d’exécution de service multimodal, fusionne l’adaptateur FastH3 au moment du chargement (pull request #6714) et l’expose via un endpoint /v1/videos compatible O​penAI, en plus de son support antérieur de H3-Base.

Le chiffre principal est mesuré sur du matériel de grande taille. Sur un serveur 8× NVIDIA B300 à 1344×768 et 24 fps, l’équipe vLLM-Omni rapporte un MP4 complet de 10,1 secondes — vidéo et audio synchronisé — rendu de bout en bout en environ 8,7 secondes, plus rapide que sa durée de lecture. Il s’agit d’un benchmark rapporté par l’équipe, publié le 1er septembre 2026, et pas encore reproduit de manière indépendante ; l’équipe elle-même précise que l’ensemble brut du benchmark est encore en attente de publication et ne revendique aucune parité de qualité base-vs-FastH3. Sur du matériel plus modeste, les chiffres sont moins spectaculaires — la recette communautaire couvre aussi les configurations 2× RTX 5090 et mono-GPU — et FastH3 v1 ne couvre que le texte-vers-vidéo-audio (T2VA), à 1344×768 plutôt qu’en 2K, qui reste côté API.

Pour le lecteur, cela change ce que « l’auto-hébergement de H3 » peut signifier. Avant, les poids de base ouverts tournaient, mais lentement — convenables pour des traitements par lots, pas pour un usage interactif. Avec FastH3 sur vLLM-Omni, un pipeline H3 sur site peut traiter un clip de dix secondes en bien moins que sa durée, ce qui représente le seuil où les boucles produit en temps réel — prévisualisation en direct, itération rapide des plans, vidéo pilotée par des agents — deviennent pratiques. Si vous préférez ne pas faire tourner un serveur à huit GPU, la voie managée reste inchangée : MiniMax H3 est sur OrcaRouter au prix catalogue du fournisseur, répercuté sans aucune marge et avec basculement automatique, si bien que vous pouvez appeler la famille H3 via une seule API compatible O​penAI sans posséder le matériel.

Trois scénarios où H3 excelle

1. Courts métrages cohérents en termes de personnage et de style

Omni-reference (jusqu'à 9 images, 3 clips, 3 fichiers audio) est conçu pour maintenir la cohérence d'un personnage, d'un look et d'une voix à travers plusieurs plans — idéal pour les courts métrages narratifs et le contenu épisodique.

2. Social et créatif publicitaire avec son

Un dialogue synchronisé en une seule passe, des effets sonores et une ambiance, ainsi que des rapports d'aspect flexibles (9:16 à 21:9), conviennent aux workflows rapides sur les réseaux sociaux et la publicité qui nécessitent un son fini, pas seulement des visuels.

3. Édition créative itérative

L'édition basée sur des instructions permet aux équipes d'affiner un clip de manière descriptive plutôt que de le régénérer, ce qui accélère la production lourde en révisions.

FAQ

Qu'est-ce que MiniMax H3 ?

H3 est Hailuo 3.0, le dernier modèle de génération vidéo par IA de MiniMax, dévoilé au WAIC 2026 (17 juillet 2026) et publié le 31 juillet 2026. Il génère des vidéos natives en 2K à 24 fps avec un audio synchronisé, à partir de texte ou d'images, avec un contrôle omni-référence et une édition basée sur des instructions.

Est-ce que H3 est le même que Mini​Max M3 ?

Non. M3 est le LLM textuel/agentique de Mini​Max ; H3 (Hailuo 3.0) est son modèle de génération vidéo. Ils ont été dévoilés lors du même événement mais remplissent des fonctions différentes.

Où puis-je utiliser H3 maintenant ?

Quatre options : la plateforme Hailuo de MiniMax (le produit complet), l’AI Gateway de Vercel (à la fois H3 et MiniMax H3 Max, avec une remise de lancement de 50 % jusqu’au 13 septembre), Luma Agents (annoncé le 6 août 2026 — jusqu’à 15 secondes de vidéo 2K avec son stéréo natif, conditions d’accès encore floues), et l’auto-hébergement via les poids ouverts H3-Base sur Hugging Face et ModelScope — qui, depuis le 1er septembre, peut être servi à une vitesse supérieure à celle de la lecture via vLLM-Omni avec le FastH3 de FastVideo (un MP4 de 10,1 secondes avec vidéo et audio en environ 8,7 secondes sur 8× B300, selon l’équipe vLLM-Omni). Le modèle de base est également routé sur OrcaRouter au prix catalogue du fournisseur.

Quelle est la durée et la résolution des clips H3 ?

2K natif à 24 ips, 5 à 15 secondes par génération, extensible jusqu'à environ 30 secondes, dans des rapports d'aspect allant de 21:9 à 9:16.

Qu'est-ce que omni-reference ?

Un système de contrôle qui accepte jusqu'à 9 images de référence, 3 clips vidéo et 3 clips audio à la fois pour garder le style, le personnage, le mouvement et la voix cohérents.

H3 est-il meilleur que Kling 3.0 ou Veo 3.1 ?

Tout dépend de l'axe. Kling 3.0 propose de la 4K native et arrive en tête dans certaines arènes ; Veo 3.1 excelle pour le dialogue à 48 kHz. H3 met l'accent sur le contrôle omni-référence, l'audio en une seule passe, le montage et le prix. Les premiers scores d'H3 dans l'arène Artificial Analysis (environ 1 184 en image-vers-vidéo et 1 226 en texte-vers-vidéo avec audio, fin août) évolueront à mesure que les votes s'accumulent — testez avec vos propres prompts.

H3 est-il open-weight ?

En partie. MiniMax a publié en open source les poids de base de H3 le 3 août 2026 — un transformer de 33B mis à disposition sur Hugging Face et ModelScope sous la licence communautaire MiniMax H3, avec les checkpoints FL2VA et Ref2VA. Selon les termes de la licence de MiniMax, cette publication restreint les régions de déploiement et s’étend aux sorties générées, avec obligation d’attribution. Les deux modules qui complètent l’expérience phare — H3-Context-IR (prétraitement des prompts) et H3-Regenerate-2K (l’agrandissement 2K) — ne font pas partie de la version ouverte et restent exclusivement accessibles via l’API. Depuis le 1er septembre, les poids de base ouverts peuvent également être servis pour la génération en temps réel via vLLM-Omni et FastH3 de FastVideo (FastH3 v1 ne couvre que le texte-vers-vidéo-audio). Donc oui pour le modèle de base, avec des réserves.

En résumé

MiniMax H3 (Hailuo 3.0) est un vrai bond en avant pour la gamme vidéo de MiniMax : 2K natif, audio synchronisé en une seule passe, contrôle omni-référence généreux et édition basée sur des instructions, à un prix abordable. Depuis son lancement, il est aussi devenu beaucoup plus facile d’accès — il est routé sur OrcaRouter au prix catalogue du fournisseur, il fonctionne dans Luma Agents, ses poids de base sont ouverts pour l’auto-hébergement (et depuis le 1er septembre, assez rapide pour générer un clip de 10,1 secondes plus vite que sa durée de lecture, via vLLM-Omni et FastH3 de FastVideo), et lui et MiniMax H3 Max sont maintenant sur l’AI Gateway de Vercel avec une remise de lancement de 50 % pendant deux semaines. Il ne surpassera pas automatiquement en résolution les concurrents qui misent sur le 4K natif, et ses premiers scores d’arène se consolident encore — mais sur le contrôle, l’audio et la vitesse d’itération, il est convaincant. Évaluez H3 contre Kling 3.0, Veo 3.1, Seedance 2.0 et les autres sur vos propres séquences, et gardez votre pile de modèles plus large neutre vis-à-vis des fournisseurs via un point d’accès unique comme OrcaRouter.