
Comment utiliser MiniMax H3 : prompts, exécutions locales et audio qui n'est pas nul
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Le 4 août, Simon Willison a téléchargé environ 115 Go de poids, a fait tourner un port MLX non officiel de MiniMax H3 sur son MacBook Pro M5 Max, et a demandé une mouffette aux couleurs de l'arc-en-ciel sautant par-dessus une bûche moussue dans un supermarché. Moins de 45 minutes plus tard, il avait un clip qu'il décrivait comme véritablement impressionnant — avec une piste audio qu'il décrivait comme un charabia étrange, ressemblant à de la parole. Son propre diagnostic était la partie utile : il n'avait donné aucune direction audio au modèle et n'avait pas lu le guide d'invites au préalable. C'est le résumé le plus court possible de ce que c'est que de commencer à utiliser H3, également vendu sous le nom de Hailuo 3.0. L'image arrive plus ou moins gratuitement. Tout le reste — le son, le timing des plans, le 2K, le personnage qui doit survivre à quatre plans consécutifs — il faut le demander explicitement, dans un format plus strict que presque tout autre modèle vidéo actuellement en usage.
Ceci est un guide d'utilisation, pas une couverture de lancement. Trois niveaux de sources le parcourent, et ils sont signalés à chaque fois : sa propre documentation (la fiche du modèle, les deux guides de rédaction de prompts fournis dans le dépôt, les documentations de l'API de la plateforme) ; constats de la communauté de personnes qui l'ont effectivement exécuté — les mainteneurs de ComfyUI, des benchmarkeurs indépendants, des documentations de revendeurs et des fils de discussion Hugging Face, tous datés entre le 31 juillet et le 5 août 2026 ; et un petit nombre de cas où nous avons nous-mêmes lu un fichier primaire et le disons. Les chiffres de la communauté proviennent de rapports isolés sur des configurations matérielles non contrôlées, sauf indication contraire. Lorsque les praticiens ne sont pas d'accord entre eux, le désaccord est rapporté plutôt que résolu.
Avant toute chose : vous n'exécutez probablement pas le modèle entier.
La majeure partie de la confusion au cours de la première semaine de H3 remonte à un fait structurel que le discours marketing occulte. H3 n'est pas un modèle unique. Selon sa fiche de modèle, il s'agit d'un système en trois parties, et seule la partie du milieu a été publiée en open source :
• H3-Context-IR — un préprocesseur d'instructions multimodal. Il lit votre texte, vos images, votre audio et vos vidéos, comprend comment ils se rapportent, et émet une représentation structurée et sémantiquement enrichie de ce que vous avez demandé. API hébergée uniquement. Il est exposé comme son propre type de tâche qui renvoie une invite enrichie et aucune vidéo du tout.
• H3-Base — le modèle de génération à 33 milliards de paramètres qui génère réellement des images et du son. C'est la partie à poids ouverts.
• H3-Regenerate-2K — une passe de régénération en contexte qui fait passer le résultat 768p à 2K. API hébergée uniquement.
Deux conséquences s'ensuivent immédiatement, et elles déterminent tout votre flux de travail. Premièrement, la génération locale est plafonnée à 768p. La toile native de H3 a un petit côté de 768 pixels, plafonnée à 768×1344 — environ 1344×768 pour du 16:9. Si la sortie de votre ComfyUI n'est pas en 2K, rien n'est cassé ; le paquet que vous avez téléchargé est H3-Base, et le module de suréchantillonnage n'y est pas inclus. Deuxièmement, l'API hébergée corrigera un prompt bâclé, contrairement à votre installation locale. Tout ce que Context-IR fait pour un appel API payant — déduire la structure, résoudre à quoi correspond chaque référence, combler les parties que vous avez laissées vagues — est une étape que vous devez désormais effectuer à la main, ou avec un autre modèle, avant que H3-Base ne voie vos mots. Cette seule asymétrie explique la plupart des retours du type « le même prompt fonctionne sur Hailuo mais semble cassé dans ComfyUI ».

À noter dans le référentiel lui-même : les poids portent une étiquette minimax-h3-community-license-agreement plutôt que Apache ou MIT (plus de détails ci-dessous, car c’est ce qui détermine si vous pouvez le distribuer ou non), le modèle est répertorié à 33B paramètres en F32/BF16, et à ce jour, exactement un fournisseur d’inférence — fal — est répertorié comme le servant. Vingt-trois finetunes, vingt quantifications et trente-et-un Spaces existent déjà sur cette base, ce qui est un bon indicateur de la rapidité avec laquelle la communauté a évolué.
Le format du prompt : des blocs de plans, pas des timecodes.
C'est ici que la communauté et la documentation sont ouvertement en conflit, et cela importe plus que toute autre chose dans cet article.
Le modèle qui s'est diffusé le plus rapidement — via Reddit, puis dans plusieurs guides publiés — découpe le clip en tranches de timecode : [0s-2s], [2s-5s], et ainsi de suite, suivi d'une structure en six blocs comprenant le contrat de style, la timeline, la caméra, l'audio, le texte écrit en toutes lettres et une liste négative. Il a été conçu par rétro-ingénierie en lisant les 45 exemples de prompts fournis par l'entreprise, et ce n'est pas absurde : ces exemples sont réellement des feuilles de tournage accompagnées d'une feuille de repères sonores, avec une longueur médiane d'environ 130 caractères chinois et les plus longs atteignant 657 et 858 caractères.
Mais le propre fichier de l'entreprise, VIDEO_PROMPT_WRITING_GUIDE_base_en.md, situé dans le dossier docs du dépôt, prescrit quelque chose de différent. Il organise par bloc de plans, et non par plage temporelle. Nous l'avons lu directement ; la structure qu'il demande est :
• Instruction — règles d'alignement d'image, utilisées pour les modes keyframe (I2VA, FL2VA, L2VA) et omises pour la génération pure text-to-video.
• description multimodale intégrée — le corps principal, divisé en [Plan 1], [Plan 2], et ainsi de suite.
• paysage sonore global — une à quatre phrases de son diégétique.
• non_diegetic_music — une à trois phrases de musique.
Dans ce cadre, les conventions sont suffisamment précises pour être vérifiables. [Plan 1] ne prend aucun horodatage — les plans suivants s'ouvrent sur une coupe franche, formulée comme « À 00:03.500, la caméra coupe vers… ». Le mouvement de caméra est écrit comme type de mouvement plus amplitude plus vitesse, intégré dans un anglais naturel plutôt qu’empilé comme des étiquettes : un push-in lent de faible amplitude, et non caméra: dolly-in, lent. Les mouvements disponibles sont l’ensemble familier — zoom, panoramique, inclinaison, travelling, arc, POV et tremblement dans des variantes légères ou fortes. Le dialogue est encadré par des balises : <d>[English] Get in the car.</d>, avec la ponctuation préservée exactement et jamais traduite ni paraphrasée. Les locuteurs reçoivent des identifiants stables — (S1), (S2) et (S1,S2) pour une réplique conjointe — avec l’âge, le genre, le timbre et l’accent décrits à la première apparition. La voix off est marquée comme une ligne hors champ avec une note explicite indiquant que les lèvres restent fermées, c’est ainsi que vous empêchez le modèle de synchroniser les lèvres du visage avec une narration. Les conversations en montage alterné utilisent un <scenetrans> marqueur plus une déclaration de continuité.
Les interdictions explicites du guide sont aussi instructives que ses règles : ne pas horodater le premier plan, ne pas répéter le dialogue, le chant ou la musique à l'écran dans overall_soundscape, ne pas utiliser de mots d'ambiance abstraits dans non_diegetic_music, et ne jamais réécrire une réplique. Et une absence notable — le guide officiel ne comporte aucune section de prompt négatif, ce qui signifie que la liste des « transitions interdites » dans le modèle communautaire populaire est une invention de la communauté, et non une fonctionnalité documentée.
Faut-il prendre ce conflit au sérieux ? Dans une discussion Hugging Face sur le dépôt H3, un membre de la communauté a présenté la structure de type timecode comme guide, et un autre praticien a répondu sans détour qu’il avait utilisé une structure similaire, que c’était tout faux, et que les gens devraient plutôt lire le manuel fourni. C’est une personne qui contredit une autre, pas une décision d’un mainteneur. Notre lecture des éléments : les deux formats fonctionnent via l’API hébergée, car Context-IR normalise tout ce que vous lui envoyez ; seul le format documenté est fiable directement avec H3-Base. Si vous utilisez des poids locaux, suivez le fichier du dépôt. Si vous êtes sur l’API et qu’une invite de type timecode vous donne de bons clips, c’est le préprocesseur qui fait ce travail pour vous, et vous ne devriez pas en conclure que c’est le format qui en est la cause.
Compiler un brief paresseux dans le dialecte de H3.
Prenez le prompt en douze mots de Willison comme entrée — une mouffette aux couleurs de l'arc-en-ciel sautant par-dessus une bûche moussue dans un supermarché. Une fois rédigé de la manière documentée, cela donne approximativement : un [Shot 1] bloc qui commence par nommer le style (prises de vues réelles, caméra à l'épaule, éclairage fluorescent) et le cadre (une allée de supermarché, une bûche couverte de mousse en travers du linoléum, des étagères qui s'éloignent), puis le sujet et l'action dans l'ordre physique — deux pas feutrés, un accroupissement, le bond, l'atterrissage — avec la caméra en lent travelling de faible amplitude qui se termine de l'autre côté de la bûche ; un overall_soundscape avec des griffes sur le linoléum, le frottement humide de la bûche, un bourdonnement de réfrigération et des roues de chariot au loin ; et une ligne non_diegetic_music d'un court passage musical léger aux cordes pincées, sans voix. Rien de tout cela n'est du génie créatif. C'est la même idée, avec les quatre éléments demandés par H3, effectivement fournis — et c'est la différence entre un son d'ambiance non demandé et une bande-son que vous avez conçue.
Cette étape est mécanique, répétitive et une mauvaise utilisation d'un humain, ce qui explique exactement pourquoi l'entreprise a lancé un outil pour cela, que presque aucun média n'a relayé. Le dépôt contient un répertoire skills de neuf compétences d'agent, et la première — h3-prompt-writing — fait précisément ceci : elle prend une requête et rédige un prompt H3 structuré pour les cinq modes de génération, avec les sections paysage sonore et musique. Les huit autres sont des recettes par genre (publicité produit, court-métrage d'animation 3D, vidéo explicative en papercraft, sous-titres de clip musical, introduction de jeu coopératif, hybride dessiné/live-action, etc.) qui intègrent le même format dans un workflow.
Exécuter cette compétence nécessite un modèle de texte, pas un modèle vidéo, et c'est là qu'un routeur est réellement utile plutôt qu'un plug-in. Le LLM maison de l'entreprise, MiniMax M3, est un choix judicieux pour cette tâche et se trouve sur OrcaRouter à $0.30 par million de jetons d'entrée et $1.20 par million de sortie — prix catalogue du fournisseur, puisque nous le transmettons avec une marge de 0 % — avec une fenêtre de contexte de 1M de jetons et, fait inhabituel, la vidéo comme type d'entrée accepté. Ce dernier détail est ce qui le rend adapté : vous pouvez lui fournir le guide de prompt officiel, votre brief, et un clip de référence réel en un seul appel, et obtenir en retour le [Shot N] bloc qui le décrit. Compiler un prompt coûte une fraction de centime par rapport à la génération vidéo facturée à la seconde, il n'y a donc aucune raison de les écrire à la main. Deux mises en garde honnêtes : La génération vidéo H3 elle-même ne fonctionne pas sur OrcaRouter — les clips proviennent de la plateforme de l'entreprise, de fal, ou de votre propre GPU — et l'étape de compilation est un confort, pas une garantie de qualité. Ce que le routeur vous apporte ici, c'est que la partie texte du pipeline se trouve derrière une seule clé avec basculement automatique, de sorte qu'une panne de fournisseur en cours de lot n'immobilise pas une file de rendu, et remplacer M3 par un autre modèle pour comparer les prompts compilés est un simple changement de chaîne plutôt qu'un nouveau contrat.

L'audio, c'est là où tout le monde perd le premier jour.
Le mode de défaillance le plus corroboré de la première semaine est celui que Willison a rencontré : laissez le son non spécifié et H3 invente quelque chose, mal. Il a obtenu un bruit ressemblant à de la parole à partir d'un prompt sans indication audio. L'analyse en rétro-ingénierie des exemples officiels rapporte la même classe de défaillance sous une forme plus modérée — omettez le bloc audio et le modèle génère un son ambiant non demandé — et les présente comme des absences plutôt que des erreurs, ce qui est la bonne manière d'aborder un modèle audio-vidéo conjoint. Il génère toujours une bande-son. Votre seul choix est de la spécifier ou non.
En combinant les recommandations du guide officiel des invites avec ce que la documentation des revendeurs et les examinateurs rapportent comme réellement efficace :
• Le dialogue est la chose la plus difficile à demander. Limitez les répliques à une ou deux phrases par tranche de cinq secondes de clip. Des répliques trop longues entraînent un débit précipité, un audio qui dépasse la dernière image, ou une synchronisation labiale forcée — un problème signalé de manière constante par les évaluateurs.
• Décrivez le locuteur avant la réplique, et la diction avec celle-ci. Âge, genre, timbre et accent à la première apparition, selon le guide officiel ; notes de diction simples et directes (clairement, chaleureusement, d'un ton plat) plutôt que des indications de jeu élaborées, qui, d'après les retours, dégradent la synchronisation.
• Associez chaque effet à un événement visible.« Un bruit de bouchon exactement comme le bouchon vole » plutôt que « bruit : un pop ». Les mots comme, quand et puis sont ce qui porte la synchronisation.
• Décrivez brièvement la musique par genre, tempo, ambiance et instrumentation — jamais par artiste ou chanson. Ajoutez « no vocals » lorsque l’image doit primer ; c’est une façon documentée de garder le mix propre.
• Superposez l'ambiance en une seule proposition. Pluie sur la vitre, un faible murmure de conversation, le tintement occasionnel d'une tasse, un doux jazz de fond — empilés dans une seule phrase plutôt qu'énumérés.
• Ne répétez pas le dialogue dans la section paysage sonore. Une interdiction explicite dans le guide officiel ; les sections sont censées être disjointes, et répéter une ligne à cet endroit est un moyen de l'obtenir deux fois.
• Si un mot doit être lisible à l'écran, saisissez le mot entre guillemets. Les réviseurs signalent que les chaînes spécifiées s'affichent correctement, tandis que les demandes vagues ("HUD elements", "a sign") reviennent comme un bruit en forme de lettres.
Là où l’audio est réellement à la hauteur, selon plusieurs testeurs, c’est pour les sons physiques concrets — bruitages et effets liés à quelque chose de visible — ainsi que l’ambiance. C’est plus faible sur les demandes abstraites ou atmosphériques. Les scènes à plusieurs intervenants nécessitent souvent des retouches pour obtenir le bon ordre des locuteurs, et la qualité de prononciation varie selon la langue ; testez donc votre langue cible sur un clip jetable avant d’engager un projet. Plusieurs testeurs notent aussi le plafond honnête : le son est suffisant pour une diffusion sur les réseaux sociaux, mais généralement pas assez bon pour être livré en mix broadcast ou publicité payante sans remplacement. Rien de tout cela ne provient des recommandations du fournisseur ; c’est ce que rapportent les praticiens.
Références : attribuez un rôle à chaque fichier.
Le système de référence de H3 est son principal différenciateur et l'endroit où les erreurs de configuration sont les plus courantes. Les limites documentées, issues de la documentation de l'API de la plateforme : jusqu'à 9 images, 3 clips vidéo et 3 clips audio, plafonnés à 12 fichiers au total, chaque vidéo ou audio de référence devant durer entre 2 et 15 secondes et le total cumulé ne dépassant pas 15 secondes. La référence vers une vidéo nécessite au moins une image ou une vidéo ; l'audio seul n'est pas accepté.
La technique sur laquelle convergent à la fois le guide de référence officiel et les retours de la communauté consiste à taguer chaque entrée et lui attribuer une tâche. Référencez par balise dans l'ordre exact où les fichiers ont été attachés — <Picture 1>, <Video 1>, <Audio 1> — puis précisez dans le prompt quelle référence pilote quelle propriété : identité, style, mouvement, caméra ou voix. Les exemples de prompts officiels commencent exactement de cette façon, déclarant que l'image un est la référence globale d'ambiance et de style et que l'image deux est le personnage principal. Les praticiens rapportent que l'attribution explicite fonctionne nettement mieux que de déverser neuf images et d'espérer.
Deux détails qui font perdre des rendus aux gens :
• <Picture 1> n'est pas un mood board — c'est la toute première image à 0,000 seconde, et elle appartient au [Shot 1]. Décrivez ce qu'elle contient (style, sujets, composition, points d'ancrage de la scène) avant de décrire l'action qui en découle. Traitez-la comme une image fixe que vous animez, pas comme un indice.
• Il existe deux checkpoints distincts, et utiliser le mauvais échoue en silence. fl2va gère la conversion texte-vers-vidéo et le travail sur la première/dernière image ; ref2va gère la conversion référence-vers-vidéo. C'est l'erreur ComfyUI la plus signalée : le graphe R2V s'exécute alors que le modèle FL2VA est toujours sélectionné. Il est également bon de savoir qu'un commentateur de l'annonce ComfyUI fait remarquer que le gabarit R2V fourni n'expose que deux emplacements de référence d'image alors que le modèle en accepte neuf — une limitation du gabarit, pas une limite du modèle.
Du côté hébergé, deux autres notes de praticien issues de la documentation revendeur : le ratio paramètre est requis sur les endpoints ref2va et ne peut pas être laissé sur « adaptive », et les tâches qui se chevauchent renvoient un 429 pour la concurrence des tâches plutôt que de faire la queue — donc exécutez par lots séquentiellement, ou construisez votre propre file d’attente. Localement, ref_image_size est par défaut sur match, ce qui est plus rapide ; max préserve jusqu’à un bord court de 2048 pixels sur la référence et coûte du temps.
Ce que coûte réellement une exécution locale en temps réel
Télécharger le dépôt officiel complet fait 498 Go, et le miroir reconditionné pour ComfyUI fait 343 Go. Vous n’avez besoin ni de l’un ni de l’autre en totalité. Les quatre fichiers que le tutoriel de ComfyUI lui-même liste pour la vidéo à partir de texte et la vidéo à partir d’image représentent environ 42,5 Go :
• Modèle de diffusion — minimax_h3_fl2va_pruned_int8_convrot.safetensors, 20,97 Go, dans models/diffusion_models.
• Encodeur de texte — qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors, 15,69 Go, dans models/text_encoders.
• Video VAE — minimax_h3_video_vae_fp16.safetensors, 5.21 Go, dans models/vae.
• Audio VAE — minimax_h3_audio_vae_fp32.safetensors, 0,61 Go, également dans models/vae.
• Ajouter pour référence-vers-vidéo — minimax_h3_ref2va_pruned_int8_convrot.safetensors, encore 20,97 Go.
Ce 42,5 Go n’est pas une valeur de VRAM — c’est du disque, et les morceaux sont diffusés en continu et déportés. Si le modèle tient sur des cartes grand public, c’est grâce à une astuce d’ingénierie documentée par ComfyUI : environ 40 % des paramètres se trouvent dans les branches de modulation AdaLN dont les sorties peuvent être précalculées et remplacées par des tables de correspondance fonctionnellement équivalentes, ce qui fait passer le modèle chargé de 33,12B à environ 20,11B, selon ComfyUI, sans perte de qualité. La précision complète serait de 123,6 Go. Des checkpoints int8 non élagués (34,04 Go chacun) et des versions bf16 (66,28 Go chacune) existent si vous faites du fine-tuning ou recherchez les derniers pour cent de fidélité.
ComfyUI 0.30.0 ou une version ultérieure est nécessaire, et il est livré avec trois modèles : T2V, I2V et R2V. La configuration de base sur laquelle tous les guides et mainteneurs convergent pour une première exécution est volontairement réduite : 16:9 à 0,4 MP (864×480), 5 secondes, 20 étapes, sampler res_multistep avec le scheduler simple, denoise 1.0, batch 1. Obtenez un MP4 qui contient à la fois la vidéo et l'audio stéréo avant de toucher à la résolution ou à la durée. Une bizarrerie arithmétique à prévoir : les durées s'alignent sur une grille de 17k+5 images, donc une demande de 5 secondes devient 124 images — environ 5,17 secondes à 24 fps — et une demande de 10 secondes aboutit à 243 images, soit 10,125 secondes. Les demandes comprises entre 5 et 15 secondes se situent dans la zone la plus sûre.

Cela coûte en temps réel, d’après les rapports de la communauté (tous des exécutions uniques, non contrôlées, avec des paramètres différents — le graphique ci-dessus affiche chaque configuration à côté de sa barre) : une RTX 3060 12 Go avec 32 Go de RAM système et un NVMe rapide a terminé la référence 864×480 / 124 images / 20 étapes en moins de neuf minutes avec déchargement dynamique. Un ordinateur portable RTX 4090 16 Go avec SageAttention activé a réalisé 960×540, 5 secondes, 20 étapes en 182 secondes. Une version NVFP4 sur une seule RTX 5090 a produit un clip 864×480 de 243 images (10,1 s) en 10 étapes en 175 secondes, avec un pic de 26,9 Gio de VRAM et seulement 31,7 Go de fichiers sur disque. La propre référence du cookbook de SGLang — 1344×768, 124 images, 50 étapes sur deux RTX 5090 avec déchargement par couches — a pris 559,67 secondes. Et le chemin Apple Silicon, via le port MLX non officiel, a pris un peu moins de 45 minutes pour un seul clip.
Notes pratiques distillées à partir de ces rapports :
• La mémoire système et la vitesse du disque sont essentielles, pas facultatives.Sur une carte de 12 Go, les fichiers sélectionnés dépassent volontairement la VRAM, donc le chemin de déchargement passe par la RAM puis le SSD. 32 Go de RAM apparaissent dans les deux rapports réussis avec une faible VRAM. Aucun résultat vérifié avec 8 Go n'existe.
• SageAttention est la seule accélération gratuite — environ 2× pour ComfyUI, moins si votre exécution est dominée par le trafic d’offload. Installez la wheel correspondant exactement à votre build PyTorch et CUDA ainsi que ComfyUI-KJNodes, puis insérez Patch Sage Attention KJ entre le chargeur UNET et le guider, puis réglez-le sur auto. Attendez-vous à des avertissements indiquant que certaines couches H3 ne sont pas en FP16/BF16 ; ce repli est documenté et normal.
• Les étapes sont négociables.Le benchmark 5090 a tourné avec 10 et la baseline ComfyUI tourne avec 20, tandis que la configuration de référence SGLang utilise 50. Personne n'a publié de courbe qualité-par-étape, alors trouvez votre propre plancher avant de supposer que vous avez besoin de 50.
• Modifiez une variable à la fois pour sortir de l'OOM. La procédure de récupération documentée consiste à revenir à 0,4 MP, 5 secondes, batch 1, et à modifier un seul réglage par tentative.
• Un audio silencieux signifie que le VAE audio n'est pas câblé au nœud de sortie vidéo. Une défaillance distincte d'un mauvais audio, et facile à confondre avec un refus du modèle de générer du son.
• Apple Silicon n'est pas officiel. La méthode de Willison était PipeNetwork/minimax-h3-mlx, un portage communautaire, exécuté via uv contre un fichier d'exigences MLX. Les propres documents de l'entreprise nomment SGLang, vLLM, Diffusers et ComfyUI, avec un déploiement typique de quatre GPU en BF16, et ne disent rien de Metal ni de MPS. Considérez le support Mac comme maintenu par la communauté.
Local versus hébergé, avec les chiffres.
Comme le module 2K et le préprocesseur de prompt ne sont disponibles qu'en hébergement, ce n'est pas vraiment un choix binaire. Le modèle vers lequel l'architecture vous pousse est :itérer localement en 768p, où chaque tentative coûte de l'électricité et trois minutes, puis acheter la finition. Une facturation à la seconde convient pour le résultat que vous gardez, mais elle est ruineuse pour les quarante que vous jetez.
Côté prix, soyez prudent, car il varie d'environ 2× selon le fournisseur, et le billet de blog du vendeur lui-même ne cite aucun montant en dollars — seulement que le 2K coûte moins d'un tiers du prix des modèles grand public et que le 768p coûte moins de la moitié du prix des 720p des concurrents. Ce qui est concrètement publié : fal, actuellement le seul fournisseur d'inférence listé sur le dépôt Hugging Face, facture 0,16 $ par seconde en 768p et 0,26 $ par seconde en 2K. Des trackers secondaires rapportent que le prix catalogue de l'entreprise est nettement inférieur — environ 0,09 $ à 0,10 $ par seconde en 768p et 0,13 $ à 0,14 $ par seconde en 2K — et ils ne s'accordent pas au centime près, alors considérez ces chiffres comme indicatifs et vérifiez la page des tarifs de la plateforme avant d'établir votre budget. Prévoyez également le fait qu'une vidéo de référence est facturée sur sa propre durée en plus de la sortie générée.
Faisons le calcul avec un vrai chiffre. Cent clips retenus de huit secondes chacun représentent 800 secondes générées : environ 112 $ à un tarif 2K de 0,14 $, à peu près 208 $ au tarif de 0,26 $ de fal, et environ 76 $ si vous livrez en 768p au prix catalogue le plus bas. Les quarante rejets par clip retenu sont ce qui détermine la facture, et ce sont ceux-là qu'il faut générer localement. C'est aussi la raison pour laquelle il faut garder honnête le prix comparé — sur OrcaRouter, le côté texte de ce pipeline est transmis au prix catalogue fournisseur avec une marge de 0 %, donc quand un fournisseur baisse un prix, il est appliqué le jour même plutôt qu'après un recalcul de marge. Encore une fois, la génération vidéo n'est pas la nôtre ; le seul point est que l'étape de compilation ne devrait pas être la ligne à laquelle il faut penser.
Lisez la licence avant de créer un produit basé sur ceci.
C'est la partie que la plupart des guides « comment utiliser » omettent, et pour beaucoup de lecteurs, c'est la seule partie qui change une décision. Nous avons lu directement le fichier LICENSE dans le dépôt. Les poids sont fournis sous le H3 Community License Agreement, pas une licence open source, et il contient des conditions suffisamment inhabituelles pour être citées en substance :
• Territoire. La licence définit son « territoire applicable » comme étant le monde entier à l'exclusion de l'Union européenne, le Royaume-Uni, la République de Corée et les États-Unis d'Amérique. À la lire simplement, cela exclut une grande partie des personnes qui publient actuellement des résultats de génération locale — et la restriction est rédigée de manière à atteindre les sorties, pas seulement les poids.
• Attribution. L'utilisation commerciale exige d'afficher « H3 » sur l'interface du produit ; la licence encourage également à inclure la mention « Powered by H3 ».
• Seuil de chiffre d'affaires. Les organisations qui génèrent plus de 20 millions de dollars par an grâce à des produits ou services construits sur celle-ci doivent obtenir une autorisation écrite distincte de la société.
• Pas de distillation. Vous ne pouvez pas utiliser H3 ou ses sorties pour améliorer tout autre modèle d'IA, à l'exception des dérivés de H3. Cela exclut la pratique standard des données synthétiques.
• Droit applicable. R.A.S. de Hong Kong, avec compétence exclusive des tribunaux de Hong Kong.
• Un composant véritablement ouvert. L'encodeur de texte Qwen3-VL-32B est sous licence Apache 2.0 ; les restrictions ci-dessus s'appliquent aux poids H3.
Nous ne sommes pas vos avocats et ceci n'est pas un avis juridique — lisez la licence et le document de questions-réponses que l'entreprise fournit avec celle-ci, et si vous développez un produit commercial dans un territoire exclu, consultez un avocat plutôt que de vous fier à la lecture d'un blog. La bifurcation pratique : l'API hébergée est une transaction distincte avec des conditions différentes de la licence communautaire sur les poids, donc si la licence locale ne vous convient pas, la voie de l'API peut tout de même être disponible. Vérifiez les conditions de la plateforme auprès de laquelle vous achetez.
Un plan de test pour la première semaine
Cinq exécutions, dans cet ordre, suffisent pour savoir si H3 a sa place dans votre pipeline :
• Essai 1 — vérifier que tout fonctionne. Modèle T2V, 864×480, 5 secondes, 20 étapes, res_multistep/simple. Le critère de réussite est un MP4 avec de l'audio stéréo, pas un bon clip.
• Essai 2 — prouvez que le format importe. Même sujet deux fois : une fois comme description libre sur une ligne, une fois écrit comme [Shot 1] avec overall_soundscape et non_diegetic_music. Si la deuxième n'est pas clairement meilleure par rapport à H3-Base, il y a un problème dans votre configuration.
• Run 3 — une ligne de dialogue. Un locuteur, une phrase, la diction décrite, cinq secondes. C'est le moyen le plus rapide de savoir si l'audio est assez bon pour votre usage et si votre langue cible est bien prononcée.
• Run 4 — discipline des références. R2V avec le ref2va checkpoint, deux ou trois références, chacune explicitement étiquetée et dotée d'un rôle, avec <Picture 1> décrite comme la véritable première image. Puis brisez-la délibérément : attachez les mêmes références sans aucune affectation et comparez.
• Run 5 — la fin.Prenez votre meilleur prompt local en 768p, envoyez-le à l'API hébergée en 2K et voyez ce que Context-IR et la passe de régénération apportent. C'est ce delta que le prix par seconde achète, et c'est la seule façon de tarifer honnêtement le workflow hybride.
FAQ
Puis-je obtenir 2K à partir des poids locaux ?
Non. Le package ouvert est H3-Base, dont le canevas natif a un petit côté de 768 pixels (jusqu'à 768×1344). La 2K provient de H3-Regenerate-2K, un module distinct de régénération en contexte que l'entreprise a conservé sur l'API hébergée. Vous pouvez upscaler localement avec n'importe quel upscaler polyvalent, mais c'est une opération différente de la passe de régénération propre de H3 et cela ne lui correspondra pas.
Pourquoi le même prompt se comporte-t-il différemment sur l'API et dans ComfyUI ?
Parce que l'API exécute d'abord H3-Context-IR. Elle lit votre texte et vos références, raisonne sur la façon dont ils sont liés, et transmet à H3-Base une instruction structurée et enrichie. Localement, il n'existe pas une telle étape — H3-Base reçoit vos mots bruts. Un prompt vague qui produit un clip compétent via l'API est sauvé par un préprocesseur que vous n'avez pas installé, c'est pourquoi le format de prompt documenté est bien plus important pour les utilisateurs locaux que pour les utilisateurs de l'API.
Le modèle de timecode [0s-2s] est-il incorrect ?
Ce n'est pas ce que demande le guide fourni. Le VIDEO_PROMPT_WRITING_GUIDE_base_en.md de l'entreprise s'organise par blocs [Plan N], ne donne pas d'horodatage au Plan 1 et exprime les coupes ultérieures en temps absolus (« À 00:03.500, la caméra coupe sur… »). Il ne comporte pas non plus de section sur les prompts négatifs, donc la liste des « transitions interdites » du template populaire est un ajout de la communauté. Cela dit, les praticiens rapportent de bons résultats API avec le format timecode — vraisemblablement parce que Context-IR le normalise. Notre lecture : utiliser le format documenté avec les poids locaux, et ne pas attribuer aux crochets de timecode les résultats API que le préprocesseur a peut-être obtenus.
Une entreprise aux États-Unis ou dans l'UE peut-elle utiliser les poids ouverts à des fins commerciales ?
Le texte de licence que nous avons lu exclut l'UE, le Royaume-Uni, la Corée du Sud et les États-Unis de son Territoire applicable, et l'exclusion est rédigée pour couvrir les sorties ainsi que les poids. Cela constitue un obstacle sérieux pour un déploiement commercial dans ces régions, et c'est une question juridique plutôt que technique — lisez vous-même la licence et le fichier Q&A et demandez conseil. L'API hébergée est régie par les conditions propres de la plateforme, et non par la licence communautaire, il vaut donc la peine de l'évaluer séparément plutôt que de supposer qu'elle est tout aussi restrictive.
Que vérifier avant de committer
H3 offre un rapport qualité-prix inhabituellement bon pour un type de travail bien précis : des clips courts, au sound design soigné, fidèles aux références, pour lesquels vous êtes prêt à rédiger une véritable liste de plans. Il est inhabituellement exigeant sur la façon de formuler vos requêtes. Les trois choses qui méritent d'être vérifiées par vous-même, car ce sont celles qui évoluent le plus vite : si d'autres fournisseurs d'inférence apparaissent à côté de fal (ce qui fera baisser le prix par seconde), si le template ComfyUI R2V dépasse les deux emplacements de référence pour atteindre les neuf du modèle, et si l'habitude du timecode de la communauté ou le format documenté de bloc de plans l'emporte lorsqu'une comparaison contrôlée avec les poids locaux aura été menée. Personne n'a encore publié cette comparaison. En attendant, le manuel du dépôt est le meilleur pari — et il se trouve dans le même téléchargement sur lequel vous avez déjà dépensé 42 Go.
