MiniMax H3 (Hailuo 3.0): Het 2K AI-videomodel met Omni-Reference, uitgelegd
Guides & Insights

MiniMax H3 (Hailuo 3.0): Het 2K AI-videomodel met Omni-Reference, uitgelegd

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

MiniMax H3 — beter bekend als Hailuo 3.0 — is het nieuwste AI-videogeneratiemodel van MiniMax, onthuld op WAIC 2026 (17 juli 2026), op 31 juli voor het publiek uitgebracht, en nu op vier manieren tegelijk beschikbaar: via het Hailuo-platform van MiniMax, via Luma Agents, als download met open gewichten, en — sinds 30 augustus — via Vercel's AI Gateway, waar naast H3 ook het nieuwe, op snelheid gerichte MiniMax H3 Max werd gelanceerd. Het brengt de videolijn van MiniMax naar native 2K-resolutie, voegt in één doorgang gesynchroniseerde audio toe en introduceert een opmerkelijk rijk besturingssysteem met “omni-reference”. De nieuwste ontwikkeling zit aan de self-hosting-kant: sinds 1 september kunnen de open H3-Base-gewichten via vLLM-Omni met FastVideo's FastH3 worden geserveerd — snel genoeg om een complete video-en-audio-MP4 van 10,1 seconden in ongeveer 8,7 seconden te renderen, dus sneller dan de afspeelduur. Deze gids legt uit wat H3 daadwerkelijk is, wat er echt nieuw is en waar het zich bevindt te midden van de frontier-videomodellen van 2026 — met vermelde bronnen voor de mogelijkheden en duidelijk gelabelde kwaliteitsclaims.

Opmerking over de nauwkeurigheid: de mogelijkheden van H3 komen uit de aankondiging en platformdocumentatie van MiniMax. De beschikbaarheid van de Vercel AI Gateway is bevestigd — de modelcatalogus van Vercel vermeldt zowel MiniMax H3 als MiniMax H3 Max, en de changelog van Vercel documenteert de introductiekorting — hoewel de voorwaarden van de promotie zelf door de leverancier zijn aangekondigd. De Luma Agents-integratie en de release met open gewichten zijn op het moment van schrijven nog steeds alleen door de leverancier aangekondigd; de eigen productdocumentatie van Luma vermeldt H3 nog niet en de toegangsvoorwaarden van de integratie zijn onduidelijk. Videokwaliteit is grotendeels subjectief en wordt beoordeeld in arena's waarin mensen hun voorkeur uitspreken; H3 heeft nu vroege Artificial Analysis-arenascores — rond 1.184 voor image-to-video en 1.226 voor text-to-video met audio, vastgelegd op 27 augustus 2026 — hoewel arena-ranglijsten verschuiven naarmate er meer stemmen binnenkomen. Het cijfer van 1 september over verwerking die sneller is dan afspeelsnelheid — een volledige MP4 van 10,1 seconden met gesynchroniseerde audio die in ongeveer 8,7 seconden is gerenderd — wordt gerapporteerd door het vLLM-Omni-team in hun eigen blogpost, gemeten op een server met 8× NVIDIA B300; het is een teambenchmark die nog niet onafhankelijk is gereproduceerd en die FastH3 meet, de vierstaps gedistilleerde adapter van FastVideo, niet het volledige basismodel. Beschouw vergelijkende claims over 'wat ziet er het beste uit' als voorlopig. Specificaties en prijzen veranderen — controleer voordat je gaat bouwen.

TL;DR. H3 is een model met native 2K-resolutie en 24 fps voor tekst-naar-video en beeld-naar-video, dat clips van 5–15 seconden genereert (uitbreidbaar tot ~30s) met gesynchroniseerde dialoog, geluidseffecten en omgevingsgeluid in één doorgang. De meest opvallende functies zijn omni-reference (tot 9 referentieafbeeldingen, 3 videoclips en 3 audioclips voor consistentie) en instructiegebaseerde bewerking (personages, objecten, scènes, geluid of tempo wijzigen zonder opnieuw te genereren). Sinds de lancering heeft het zich snel verspreid: de basisgewichten werden op 3 augustus openbaar gemaakt, Mini​Max kondigde H3 op 6 augustus aan in Luma Agents (tot 15 seconden 2K-video met native stereogeluid, hoewel de toegangsvoorwaarden nog niet openbaar zijn), en op 30 augustus verschenen MiniMax H3 en MiniMax H3 Max op de AI Gateway van Vercel met een introductiekorting van 50% voor twee weken. Sinds 1 september kunnen de open basisgewichten ook worden ingezet voor realtime-generatie: via vLLM-Omni met FastH3 van FastVideo wordt een volledige MP4 met 10,1 seconden video en audio in ongeveer 8,7 seconden gerenderd — sneller dan de afspeelduur, volgens de benchmark van het vLLM-Omni-team. Het is een grote stap vooruit ten opzichte van Hailuo 2.3 (dat 1080p was, ~10s duurde en geen omni-reference had), en het concurreert met Kling 3.0, Go​ogle Veo 3.1, ByteDance Seedance 2.0 en andere modellen — sterk op controle en audio, terwijl vroege onafhankelijke arena-scores nog moeten worden bevestigd.

Belangrijkste conclusies

• H3 = Hailuo 3.0, MiniMax's nieuwste videomodel, onthuld op WAIC 2026 en uitgebracht op 31 juli; beschikbaar via Hailuo, Luma Agents, open weights en Vercel's AI Gateway.

• Native 2K bij 24fps, clips van 5–15 seconden (uitbreidbaar tot ~30s), meerdere beeldverhoudingen, tekst-naar-video en afbeelding-naar-video.

• Omni-reference: tot 9 afbeeldingen, 3 videoclips en 3 audioclips als referenties voor consistentie in stijl, karakter, beweging en stem.

• Gesynchroniseerde dialoog, geluidseffecten en sfeer gegenereerd in één keer; op instructie gebaseerde bewerking zonder volledige regeneratie.

• De basisgewichten zijn op 3 augustus als open source uitgebracht onder een communitylicentie; de Context-IR- en 2K-regeneratiemodules blijven alleen via API beschikbaar.

• Op 30 augustus werden MiniMax H3 en MiniMax H3 Max gelanceerd op Vercel's AI Gateway met een lanceerkorting van 50% tot en met 13 september.

• Sinds 1 september kunnen de open H3-Base-gewichten worden gebruikt voor real-time generatie — een video- en audio-MP4 van 10,1 seconden wordt in ongeveer 8,7 seconden gerenderd, sneller dan afspelen — via vLLM-Omni en FastVideo's FastH3 (door het team gerapporteerde benchmark, nog niet onafhankelijk gereproduceerd).

• Grote upgrade ten opzichte van Hailuo 2.3 (1080p, ~10s); concurreert met Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 en meer.

Wat MiniMax H3 eigenlijk is

Mini​Max is een grote Chinese AI-onderneming (het voltooide in januari 2026 een beursgang in Hongkong, waarbij naar verluidt ongeveer 619 miljoen dollar werd opgehaald bij een waardering van circa 4 miljard dollar, met investeerders als Alibaba en Tencent). Het consumentenvideomerk is Hailuo, bekend om toonaangevende fysicasimulatie, snelle generatie en toegankelijke prijzen. H3 is het derdegeneratiemodel van Hailuo, onthuld naast Mini​Max's M3-tekstmodel en andere multimodale oplossingen op WAIC 2026 en op 31 juli 2026 voor het publiek vrijgegeven. Waar M3 een tekst-/agentisch LLM is, is H3 in de eerste plaats een videogeneratiemodel.

Wat is er nieuw: 2K, omni-reference en one-pass audio.

Drie dingen definiëren H3. Ten eerste, native 2K bij 24fps — een stap vooruit ten opzichte van Hailuo 2.3's 1080p — met een filmstandaardcadans, met clips van 5 tot 15 seconden (uitbreidbaar tot ongeveer 30 seconden via een Extend tool) en beeldverhoudingen van 21:9 tot 9:16. Ten tweede, omni-reference: u kunt maximaal 9 referentieafbeeldingen, 3 videoclips en 3 audioclips tegelijkertijd invoeren om stijl, karakteridentiteit, beweging of stem vast te leggen — een ongewoon genereus bedieningsoppervlak om een personage of uiterlijk consistent te houden over opnamen. Ten derde, gesynchroniseerde audio in één enkele doorgang: H3 genereert dialoog, geluidseffecten en omgevingsatmosfeer die zijn afgestemd op de actie op het scherm, in plaats van dat er een aparte audiostap nodig is.

Instructiegestuurd bewerken

Een stille maar belangrijke functie is instructiegebaseerd bewerken: in plaats van een clip helemaal opnieuw te genereren om een wijziging aan te brengen, kun je een bewerking beschrijven — een personage verwisselen, een object veranderen, de scène aanpassen, het geluid aanpassen of het tempo van de opname aanpassen — en H3 past het toe. Voor iteratief creatief werk is ter plaatse bewerken in plaats van opnieuw de dobbelstenen te werpen voor een nieuwe generatie een echt workflowvoordeel.

Hoe het zich verhoudt tot Hailuo 2.3

De generatiesprong is duidelijk: H3 gaat van 1080p naar native 2K, verlengt de maximale enkelvoudige generatielengte van ongeveer 10 seconden naar 15 (met een verlenging van 30 seconden), en voegt zowel omni-referentie invoeren als instructie-gebaseerd bewerken toe, wat 2.3 miste. Als je Hailuo 2.3 hebt gebruikt, is H3 een eenvoudige upgrade op het gebied van resolutie, lengte, controle en audio.

Waar H3 zich in het grensgebied van 2026 bevindt

H3 heeft nu vroege scores in de Artificial Analysis-arena — ruwweg 1.184 voor image-to-video en 1.226 voor text-to-video met audio, vastgelegd op 27 augustus 2026 — hoewel arena-ranglijsten verschuiven naarmate er meer stemmen binnenkomen, dus beoordeel het op basis van je eigen testprompts in plaats van op één enkele claim.

Een opmerking over OpenAI Sora

Als je het veld in kaart brengt: O​penAI heeft de Sora-web- en app-ervaringen in april 2026 stopgezet, en de API zal naar verwachting in september 2026 eindigen — dus Sora is geen model om nieuwe videowerkstromen op te baseren. De huidige frontier is de bovenstaande set, en H3 voegt zich daarbij.

Hoe krijg je toegang tot H3 en de rest van het veld?

H3 is nu op vier manieren bereikbaar, en die lijst is sinds de lancering gegroeid.

• Hailuo (het eigen platform van Mini​Max): het volledige product, inclusief instructiegebaseerd bewerken en de H3-Regenerate-2K-upscale naar 2K.

• Luma Agents: Mini​Max heeft op 6 augustus 2026 aangekondigd dat H3 nu beschikbaar is in Luma's multi-model Agents-product, waarmee tot 15 seconden 2K-video met native stereogeluid wordt gegenereerd. Dit is door de leverancier aangekondigd en de toegangsvoorwaarden zijn nog niet openbaar — Luma's eigen productdocumentatie vermeldt H3 op dit moment niet — dus verwacht dat prijs- en geschiktheidsdetails binnenkort worden bevestigd. Dat Luma een videomodel van een concurrent binnen zijn eigen Agents-product host, is een teken van hoe uitwisselbaar de videomodellenmarkt van 2026 is geworden.

• Vercel AI Gateway: op 30 augustus 2026 hebben Mini​Max en Vercel aangekondigd dat zowel MiniMax H3 als MiniMax H3 Max beschikbaar zijn via Vercel's AI Gateway, waarbij verzoeken die via de gateway worden gefactureerd van 30 augustus tot en met 13 september 2026 50% korting krijgen. De model-ID's — minimax/minimax-h3 en minimax/minimax-h3-max — zijn ongewijzigd, zodat bestaande gateway-integraties het kortingstarief automatisch overnemen zonder codewijziging. De beschikbaarheid wordt bevestigd in Vercel's modelcatalogus en changelog; de promotievoorwaarden zijn door de leverancier aangekondigd.

• Open gewichten: op 3 augustus 2026 bracht Mini​Max de basisgewichten van H3 uit — een dense transformer van 33B, H3-Base — op Hugging Face en ModelScope onder de MiniMax H3 Community License, als twee checkpoints: H3-Base-FL2VA voor tekst-naar-video/audio- en keyframe-generatie, en H3-Base-Ref2VA voor referentiegebaseerde generatie. Twee van de drie systeemmodules — H3-Context-IR (de promptpreprocessor) en H3-Regenerate-2K (de 2K-upscaler) — zijn niet opgenomen in de open release en blijven API-only, waardoor zelfgehoste runs onder 2K blijven. En sinds 1 september kunnen dezelfde basisgewichten worden ingezet voor realtime generatie via vLLM-Omni en FastH3 van FastVideo — een vierstaps gedistilleerde adapter die op een 8× NVIDIA B300-server een complete MP4 van 10,1 seconden met video en audio in ongeveer 8,7 seconden rendert, sneller dan de afspeelduur (door het team gerapporteerd, nog niet onafhankelijk gereproduceerd).

MiniMax H3 is beschikbaar op OrcaRouter tegen de catalogusprijs van de provider — $0.08 per seconde bij 768p en $0.13 per seconde bij 2K — met 0% opslag en automatische failover, zodat je de H3-familie via één O​penAI-compatibele API kunt aanroepen in plaats van een vendor-endpoint aan te sluiten dat pas een paar dagen oud is. Omdat geen enkele provider alle modellen host, is de praktische aanpak om je LLM- en agentverkeer via één endpoint te laten lopen (OrcaRouter biedt ook het eigen M3-tekstmodel van Mini​Max aan) en per project direct het beste videomodel te gebruiken. MiniMax H3 Max wordt nog niet via OrcaRouter gerouteerd — het wordt voorlopig via kanalen van derden aangeboden — dus als je ermee aan het prototypen bent, betaalt de failover-gewoonte zich uit: probeer een model dat pas een paar dagen oud is uit, zonder er een productiepijplijn aan te wagen.

Realtime levering: video sneller dan afspelen

De ontwikkeling achter deze update bevindt zich aan de self-hosting-kant. Het open basischeckpoint van MiniMax H3 is een dichte transformer van 33B, en het genereren van een clip op de standaardmanier betekent dat je ongeveer 49 voorwaartse diffusion-transformerpassages moet uitvoeren over een lang denoising-schema. FastVideo, het opensourceproject voor videotraining en -inferentie, heeft een gedestilleerde student van H3-Base gepubliceerd, genaamd FastH3: een vierstapsmodel (in DMD2-stijl) dat de tekstencoder, video-VAE, audio-VAE, tokenizers en schedulers van H3 hergebruikt, maar de denoising-loop terugbrengt naar vier voorwaartse transformerpassages over vijf sigmaposities. vLLM-Omni, de multimodale serving-runtime, integreert de FastH3-adapter bij het laden (pull request #6714) en stelt deze beschikbaar via een O​penAI-compatibel /v1/videos-eindpunt, naast de eerdere ondersteuning voor base-H3.

Het cijfer in de kop is gemeten op grote hardware. Op een 8× NVIDIA B300-server rapporteert het vLLM-Omni-team een complete MP4 van 10,1 seconden — video en gesynchroniseerde audio — die op 1344×768 en 24 fps in ongeveer 8,7 seconden end-to-end is gerenderd, sneller dan de afspeelduur. Dat is een door het team gerapporteerde benchmark die op 1 september 2026 is gepubliceerd en nog niet onafhankelijk is gereproduceerd; het team merkt zelf op dat het ruwe benchmarkpakket nog op publicatie wacht en doet geen uitspraak over kwaliteitspariteit tussen de basisversie en FastH3. Op bescheidener hardware zijn de cijfers minder indrukwekkend — het community-recept omvat ook 2× RTX 5090- en single-GPU-opstellingen — en FastH3 v1 dekt alleen tekst-naar-video-audio (T2VA) af, op 1344×768 in plaats van de 2K-resolutie die alleen via de API beschikbaar blijft.

Voor de lezer verschuift dit wat “self-hosting H3” kan betekenen. Voorheen draaiden de open basisgewichten wel, maar langzaam — prima voor batchwerk, niet voor iets interactiefs. Met FastH3 op vLLM-Omni kan een on-premises H3-pipeline een clip van tien seconden verwerken in ruim minder tijd dan de lengte van de clip, en dat is de drempel waar realtime-productloops — live-previsualisatie, snelle shot-iteratie, agentgestuurde video — praktisch worden. Als je liever geen server met acht GPU's draait, is het beheerde pad ongewijzigd: MiniMax H3 staat op OrcaRouter tegen de lijstprijs van de provider, wordt zonder opslag en met automatische failover doorgegeven, zodat je de H3-familie via één O​penAI-compatibele API kunt aanroepen zonder de hardware in bezit te hebben.

Drie scenario's waarin H3 uitblinkt

1. Karakter- en stijlconsistente korte films

Omni-reference (tot 9 afbeeldingen, 3 clips, 3 audio) is ontworpen om een personage, uiterlijk en stem consistent te houden over meerdere opnames — ideaal voor narratieve korte films en episodische content.

2. Sociale en advertentiecreatie met geluid

Eénmalige gesynchroniseerde dialoog, geluidseffecten en omgevingsgeluid plus flexibele beeldverhoudingen (9:16 tot 21:9) zijn geschikt voor snelle sociale en advertentieworkflows die kant-en-klare audio nodig hebben, niet alleen beelden.

3. Iteratief creatief bewerken

Op instructies gebaseerd bewerken stelt teams in staat om een clip beschrijvend te verfijnen in plaats van opnieuw te genereren, wat de productie met veel revisies versnelt.

Veelgestelde vragen

Wat is MiniMax H3?

H3 is Hailuo 3.0, MiniMax's nieuwste AI-videogeneratiemodel, onthuld op WAIC 2026 (17 juli 2026) en uitgebracht op 31 juli 2026. Het produceert native 2K-video van 24 fps met gesynchroniseerde audio, op basis van tekst of afbeeldingen, met omnireferentiebesturing en op instructies gebaseerde bewerking.

Is H3 hetzelfde als MiniMax M3?

Nee. M3 is MiniMax's tekst-/agentische LLM; H3 (Hailuo 3.0) is zijn videogeneratiemodel. Ze werden op hetzelfde evenement gepresenteerd, maar doen verschillende taken.

Waar kan ik H3 nu gebruiken?

Vier plaatsen: het Hailuo-platform van Mini​Max (het volledige product), de AI Gateway van Vercel (zowel H3 als MiniMax H3 Max, met 50% introductiekorting tot en met 13 september), Luma Agents (aangekondigd op 6 augustus 2026 — tot 15 seconden 2K-video met native stereogeluid, toegangsvoorwaarden nog onduidelijk), en zelfgehost via de open gewichten van H3-Base op Hugging Face en ModelScope — die sinds 1 september via vLLM-Omni met FastH3 van FastVideo sneller dan realtime geserveerd kunnen worden (een 10,1 seconden durende MP4 met video en audio in ongeveer 8,7 seconden op 8× B300, volgens het vLLM-Omni-team). Het basismodel wordt ook via OrcaRouter gerouteerd tegen de lijstprijs van de provider.

Hoe lang en welke resolutie hebben H3-clips?

Native 2K bij 24fps, 5–15 seconden per generatie, verlengbaar tot ongeveer 30 seconden, in beeldverhoudingen van 21:9 tot 9:16.

Wat is omni-reference?

Een besturingssysteem dat tot 9 referentieafbeeldingen, 3 videoclips en 3 audioclips tegelijk accepteert om stijl, karakter, beweging en stem consistent te houden.

Is H3 beter dan Kling 3.0 of Veo 3.1?

Het hangt van de as af. {{1}}Kling 3.0 biedt native 4K en staat in sommige arena's voorop; Veo 3.1 is sterk op het gebied van 48kHz-dialoog.{{/1}} {{2}}H3 benadrukt omni-reference-controle, one-pass-audio, montage en prijs.{{/2}} {{3}}H3 heeft vroege Artificial Analysis-arena-scores (rond 1.184 voor image-to-video en 1.226 voor text-to-video met audio per eind augustus), die zullen verschuiven naarmate er meer stemmen binnenkomen — test het op je eigen prompts.{{/3}}

Is H3 open gewicht?

Gedeeltelijk. Mini​Max heeft de basisgewichten van H3 op 3 augustus 2026 als open source vrijgegeven — een 33B-transformer die beschikbaar is gesteld op Hugging Face en ModelScope onder de MiniMax H3 Community License, met FL2VA- en Ref2VA-checkpoints. Volgens de licentievoorwaarden van Mini​Max beperkt de release de implementatieregio's, strekt deze zich uit tot gegenereerde outputs en is naamsvermelding vereist. De twee modules die de vlaggenschip-ervaring compleet maken — H3-Context-IR (promptvoorverwerking) en H3-Regenerate-2K (de 2K-opschaling) — maken geen deel uit van de open release en blijven exclusief via de API beschikbaar. Sinds 1 september kunnen de open basisgewichten ook worden gebruikt voor realtime generatie via vLLM-Omni en FastH3 van FastVideo (FastH3 v1 ondersteunt alleen text-to-video-audio). Dus ja voor het basismodel, met kanttekeningen.

Kortom

MiniMax H3 (Hailuo 3.0) is een flinke stap vooruit voor Mini​Max's videolijn: native 2K, gesynchroniseerde audio in één doorgang, royale omni-reference-aansturing en instructiegebaseerde bewerking, tegen een toegankelijke prijs. Sinds de lancering is het ook aanzienlijk eenvoudiger te bereiken geworden — het wordt gerouteerd via OrcaRouter tegen de catalogusprijs van de provider, het draait binnen Luma Agents, de basisgewichten zijn open voor self-hosting (en sinds 1 september snel genoeg om een clip van 10,1 seconden sneller te renderen dan dat deze afspeelt, via vLLM-Omni en FastVideo's FastH3), en het en MiniMax H3 Max staan nu op de AI Gateway van Vercel met een introductiekorting van 50% voor twee weken. Het zal rivalen die native 4K pushen niet automatisch verslaan op resolutie, en de vroege arena-scores worden nog steeds scherper — maar op het gebied van aansturing, audio en iteratiesnelheid is het overtuigend. Evalueer H3 ten opzichte van Kling 3.0, Veo 3.1, Seedance 2.0 en de rest op je eigen beeldmateriaal, en houd je bredere modellenstack leveranciersonafhankelijk via één endpoint zoals OrcaRouter.