MiniMax H3 (Hailuo 3.0): 2K AI-videomodellen med Omni-Reference, förklarad
Guides & Insights

MiniMax H3 (Hailuo 3.0): 2K AI-videomodellen med Omni-Reference, förklarad

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MiniMax H3 — mer känd som Hailuo 3.0 — är Mini​Maxs senaste AI-modell för videogenerering, presenterad på WAIC 2026 (den 17 juli 2026), släppt för allmänheten den 31 juli och nu tillgänglig på fyra sätt samtidigt: Mini​Maxs Hailuo-plattform, Luma Agents, en nedladdning med öppna vikter och — sedan den 30 augusti — Vercels AI Gateway, där den nya hastighetsfokuserade MiniMax H3 Max lanserades parallellt med den. Den lyfter Mini​Maxs videogenerering till inbyggd 2K-upplösning, lägger till synkroniserat ljud i ett enda steg och introducerar ett ovanligt rikt “omni-reference”-kontrollsystem. Den senaste utvecklingen rör självhostning: sedan den 1 september kan de öppna H3-Base-vikterna serveras via vLLM-Omni med FastVideos FastH3, tillräckligt snabbt för att rendera en komplett 10,1-sekunders MP4 med video och ljud på cirka 8,7 sekunder — snabbare än dess uppspelningstid. Den här guiden förklarar vad H3 faktiskt är, vad som verkligen är nytt och var den står bland 2026 års främsta videomodeller — med källbelagda funktioner och tydligt märkta kvalitetspåståenden.

Noggrannhetsnot: Uppgifterna om H3:s kapacitet kommer från MiniMax:s tillkännagivande och plattformsdokumentation. Att H3 är tillgänglig i Vercel AI Gateway är bekräftat — Vercels modellkatalog listar både MiniMax H3 och MiniMax H3 Max, och Vercels changelog dokumenterar lanseringsrabatten — men själva kampanjvillkoren bygger endast på leverantörens tillkännagivande. Luma Agents-integrationen och utgivningen av öppna vikter bygger i skrivande stund fortfarande endast på leverantörens tillkännagivanden; Lumas egen produktdokumentation listar ännu inte H3, och integrationens åtkomstvillkor är oklara. Videokvalitet är i hög grad subjektiv och bedöms i arenor för mänskliga preferenser. H3 har nu tidiga arenapoäng från Artificial Analysis — cirka 1 184 för bild-till-video och 1 226 för text-till-video med ljud, insamlade den 27 augusti 2026 — även om arenarankningarna ändras allteftersom röster samlas in. Siffran från 1 september om serving snabbare än uppspelningstakt — en komplett MP4 på 10,1 sekunder med synkroniserat ljud renderad på cirka 8,7 sekunder — rapporteras av vLLM-Omni-teamet i deras eget blogginlägg, uppmätt på en server med 8× NVIDIA B300. Det är en intern benchmark från teamet som ännu inte har reproducerats av oberoende part, och den mäter FastH3, FastVideos fyrstegs destillerade adapter, inte hela basmodellen. Betrakta jämförande påståenden om ”vilket ser bäst ut” som preliminära. Specifikationer och priser ändras — verifiera innan du bygger.

TL;DR. H3 är en text-till-video- och bild-till-video-modell med nativ 2K-upplösning och 24 fps som genererar 5–15 sekunder långa klipp (förlängbara till ~30 s) med synkroniserad dialog, ljudeffekter och omgivningsljud i ett enda steg. Dess utmärkande funktioner är omni-referens (upp till 9 referensbilder, 3 videoklipp och 3 ljudklipp för konsistens) och instruktionsbaserad redigering (ändra karaktärer, objekt, scener, ljud eller tempo utan att regenerera). Sedan lanseringen har den spridit sig snabbt: basvikterna gjordes öppna den 3 augusti, Mini​Max tillkännagav H3 i Luma Agents den 6 augusti (upp till 15 sekunders 2K-video med nativt stereoljud, även om tillgångsvillkoren ännu inte är offentliga), och den 30 augusti blev MiniMax H3 och MiniMax H3 Max tillgängliga på Vercels AI Gateway med en lanseringsrabatt på 50 % i två veckor. Sedan den 1 september kan de öppna basvikterna också användas för realtidsgenerering: via vLLM-Omni med FastVideos FastH3 renderas en komplett 10,1-sekunders MP4 med video och ljud på cirka 8,7 sekunder — snabbare än uppspelning, enligt vLLM-Omni-teamets benchmark. Det är ett stort steg framåt jämfört med Hailuo 2.3 (som var 1080p, ~10 s, utan omni-referens), och det konkurrerar med Kling 3.0, Go​ogle Veo 3.1, ByteDance Seedance 2.0 och andra — starkt när det gäller kontroll och ljud, med tidiga oberoende arenaresultat som ännu inte stabiliserats.

Viktiga slutsatser

• H3 = Hailuo 3.0, Mini​Maxs senaste videomodell, presenterad på WAIC 2026 och släppt den 31 juli; tillgänglig via Hailuo, Luma Agents, öppna vikter och Vercels AI Gateway.

• Native 2K vid 24 fps, 5–15 sekunders klipp (förlängningsbar till ~30 s), flera bildförhållanden, text-till-video och bild-till-video.

• Omni-referens: upp till 9 bilder, 3 videoklipp och 3 ljudklipp som referenser för stil, karaktär, rörelse och röstkonsistens.

• Synkroniserad dialog, SFX och bakgrundsljud genererade i en enda körning; instruktionsbaserad redigering utan fullständig regenerering.

• Basvikterna släpptes som öppen källkod den 3 augusti under en communitylicens; Context-IR- och 2K-regenereringsmodulerna förblir enbart API.

• Den 30 augusti lanserades MiniMax H3 och MiniMax H3 Max på Vercels AI Gateway med 50 % lanseringsrabatt till och med 13 september.

• Sedan den 1 september kan de öppna H3-Base-vikterna användas för realtidsgenerering – en 10,1 sekunder lång video- och ljud-MP4 renderad på cirka 8,7 sekunder, snabbare än uppspelning – via vLLM-Omni och FastVideo:s FastH3 (teamrapporterat riktmärke, ännu inte oberoende reproducerat).

• Stor uppgradering jämfört med Hailuo 2.3 (1080p, ~10s); konkurrerar med Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 och fler.

Vad MiniMax H3 egentligen är

Mini​Max är ett stort kinesiskt AI-företag (det genomförde en börsnotering i Hongkong i januari 2026, som enligt uppgift tog in cirka 619 miljoner dollar till en värdering på ungefär 4 miljarder dollar, med stöd från bland annat Alibaba och Tencent). Dess konsumentvideomärke är Hailuo, känt för kategoriledande fysiksimulering, snabb generering och tillgängliga priser. H3 är den tredje generationens Hailuo-modell, som avtäcktes tillsammans med Mini​Max M3-textmodell och andra multimodala lösningar på WAIC 2026 och släpptes till allmänheten den 31 juli 2026. Medan M3 är en text-/agentisk LLM, är H3 helt klart en videogenereringsmodell.

Vad är nytt: 2K, omni-referens och enpassningsljud

Tre saker definierar H3. För det första, native 2K vid 24 fps — ett steg upp från Hailuo 2.3:s 1080p — i filmstandardens kadens, med klipp från 5 till 15 sekunder (förlängningsbart till cirka 30 sekunder via ett Extend-verktyg) och bildförhållanden från 21:9 till 9:16. För det andra, omni-reference: du kan mata in upp till 9 referensbilder, 3 videoklipp och 3 ljudklipp samtidigt för att låsa stil, karaktärsidentitet, rörelse eller röst — en ovanligt generös kontrollpanel för att hålla en karaktär eller ett utseende konsekvent mellan tagningar. För det tredje, synkroniserat ljud i en enda omgång: H3 genererar dialog, ljudeffekter och atmosfär som är tidsinställda efter handlingen på skärmen, istället för att kräva ett separat ljudsteg.

Instruktionsbaserad redigering

En tyst viktig funktion är instruktionsbaserad redigering: istället för att generera en klipp från grunden för att göra en ändring kan du beskriva en redigering – byta ut en karaktär, ändra ett objekt, ändra scenen, justera ljudet eller omstrukturera tagningen – och H3 tillämpar den. För iterativt kreativt arbete är redigering på plats snarare än att kasta tärningen på en ny generation en verklig arbetsflödesfördel.

Hur det jämförs med Hailuo 2.3

Det generationsmässiga klivet är tydligt: H3 går från 1080p till inbyggd 2K, förlänger maximal singelgenerationslängd från cirka 10 sekunder till 15 (med en 30-sekunders förlängning), och lägger till både omni-referensingångar och instruktionsbaserad redigering, vilket 2.3 saknade. Om du använt Hailuo 2.3 är H3 en rak uppgradering i fråga om upplösning, längd, kontroll och ljud.

Var H3 befinner sig i 2026 års frontier

H3 har nu tidiga Artificial Analysis arena-poäng — ungefär 1 184 i bild-till-video och 1 226 i text-till-video med ljud, tagna den 27 augusti 2026 — även om arenarankningarna skiftar allteftersom rösterna samlas in, så bedöm det utifrån dina egna testprompter snarare än på något enskilt påstående.

En notering om O​penAI Sora

Om du kartlägger området: OpenAI avvecklade Sora webb- och appupplevelserna i april 2026, och dess API är planerat att upphöra i september 2026 — så Sora är inte en modell att bygga nya videoarbetsflöden på. Den levande frontlinjen är uppsättningen ovan, och H3 ansluter sig till den.

Hur man får tillgång till H3 och resten av fältet

H3 kan nu nås på fyra sätt, och den listan har vuxit sedan lanseringen.

• Hailuo (Mini​Maxs egen plattform): hela produkten, inklusive instruktionsbaserad redigering och H3-Regenerate-2K-uppskalning till 2K.

• Luma Agents: Mini​Max tillkännagav den 6 augusti 2026 att H3 nu finns tillgängligt i Lumas multi-modell Agents-produkt, som genererar upp till 15 sekunder 2K-video med inbyggt stereoljud. Detta är leverantörsannoncerat, och åtkomstvillkoren är ännu inte offentliga — Lumas egna produktdokument listar inte H3 i skrivande stund — så förvänta dig att pris- och behörighetsdetaljer klarnar inom kort. Att Luma är värd för en konkurrents videomodell i sin egen Agents-produkt är ett tecken på hur utbytbar 2026 års videomodellmarknad har blivit.

• Vercel AI Gateway: den 30 augusti 2026 tillkännagav Mini​Max och Vercel att både MiniMax H3 och MiniMax H3 Max är tillgängliga via Vercels AI Gateway, med förfrågningar som faktureras via gatewayen med 50 % rabatt från 30 augusti till 13 september 2026. Modell‑ID:erna — minimax/minimax-h3 och minimax/minimax-h3-max — är oförändrade, så befintliga gateway‑integrationer får den rabatterade avgiften utan kodändring. Tillgängligheten bekräftas i Vercels modellkatalog och ändringslogg; kampanjvillkoren har tillkännagivits av leverantören.

• Öppna vikter: Den 3 augusti 2026 släppte Mini​Max H3:s basvikter — en 33B-dense-transformer, H3-Base — på Hugging Face och ModelScope under MiniMax H3 Community License, som två checkpoints: H3-Base-FL2VA för text-till-video/ljud och nyckelbildsgenerering, och H3-Base-Ref2VA för referensbaserad generering. Två av de tre systemmodulerna — H3-Context-IR (promptförbehandlaren) och H3-Regenerate-2K (2K-uppskalningen) — ingår inte i den öppna releasen och förblir endast API-tillgängliga, så självhostade körningar når inte över 2K. Och sedan den 1 september kan samma basvikter användas för realtidsgenerering via vLLM-Omni och FastVideos FastH3 — en fyrstegs destillerad adapter som renderar en komplett 10,1-sekunders video- och ljud-MP4 på cirka 8,7 sekunder på en 8× NVIDIA B300-server, snabbare än dess uppspelningstid (enligt teamet, ännu inte oberoende reproducerat).

MiniMax H3 finns på OrcaRouter till leverantörens listpris — $0,08 per sekund vid 768p och $0,13 per sekund vid 2K — utan påslag och med automatisk failover, så du kan anropa H3-familjen genom ett O​penAI-kompatibelt API istället för att koppla in en leverantörsendpoint som är några dagar gammal. Eftersom ingen enskild leverantör erbjuder alla modeller är det praktiska mönstret att köra din LLM- och agenttrafik genom en endpoint (OrcaRouter bär även Mini​Max:s egen M3-textmodell) och använda den bästa videomodellen per projekt direkt. MiniMax H3 Max är ännu inte dirigerad via OrcaRouter — den tillhandahålls via tredjepartskanaler för närvarande — så om du prototypar mot den lönar sig vanan med failover: prova en några dagar gammal modell utan att satsa en produktionspipeline på den.

Realtidsservering: video snabbare än uppspelning

Utvecklingen bakom denna uppdatering ligger på self-hosting-sidan. MiniMax H3:s öppna bascheckpoint är en tät transformer med 33B parametrar, och att generera ett videoklipp på standardvis innebär att köra ungefär 49 diffusionstransformer-forwardpass genom ett långt denoising-schema. FastVideo, det öppna källkodsprojektet för videoträning och inferens, publicerade en destillerad studentmodell av H3-Base som kallas FastH3: en modell i fyra steg (DMD2-stil) som återanvänder H3:s textkodare, video-VAE, ljud-VAE, tokeniserare och schedulers, men som reducerar denoising-loopen till fyra transformer-forwardpass över fem sigma-positioner. vLLM-Omni, multimodala serving-runtime, fuserar FastH3-adaptern vid laddning (pull request #6714) och exponerar den via en O​penAI-kompatibel /v1/videos-endpoint, utöver sitt tidigare base-H3-stöd.

Siffran i rubriken mäts på stor hårdvara. På en server med 8× NVIDIA B300 vid 1344×768 och 24 fps rapporterar vLLM-Omni-teamet att en komplett 10,1 sekunder lång MP4 – video och synkroniserat ljud – renderas från början till slut på ungefär 8,7 sekunder, snabbare än dess speltid. Det är ett teamrapporterat riktmärke publicerat den 1 september 2026 och ännu inte oberoende reproducerat; teamet självt påpekar att det råa riktmärkespaketet fortfarande väntar på publicering och gör inga anspråk på kvalitetsparitet mellan basmodellen och FastH3. På mer modest hårdvara är siffrorna mindre dramatiska – communityreceptet täcker även 2× RTX 5090 och konfigurationer med en enda GPU – och FastH3 v1 täcker endast text-till-video-ljud (T2VA), vid 1344×768 snarare än 2K som fortfarande ligger på API-sidan.

För en läsare ändrar detta vad ”self-hosting H3” kan innebära. Tidigare kördes de öppna basvikterna men långsamt — okej för batcharbete, inte för något interaktivt. Med FastH3 på vLLM-Omni kan en lokal H3-pipeline processa ett tio sekunder långt klipp på väl under klippets längd, vilket är tröskeln där realtidsproduktslingor — live-previsualisering, snabba tagningsiterationer, agentstyrd video — blir praktiska. Om du hellre inte vill köra en server med åtta GPU:er är den hanterade vägen oförändrad: MiniMax H3 finns på OrcaRouter till leverantörens listpris, förmedlad med 0 % påslag och automatisk failover, så att du kan anropa H3-familjen via ett O​penAI-kompatibelt API utan att äga hårdvaran.

Tre scenarier där H3 lyser

1. Karaktärs- och stilkonsistenta kortfilmer

Omni-reference (upp till 9 bilder, 3 klipp, 3 ljud) är byggd för att hålla en karaktär, utseende och röst konsekventa över flera tagningar — idealisk för narrativa kortfilmer och episodiskt innehåll.

2. Socialt och reklammaterial med ljud

Synkroniserad dialog, ljudeffekter och omgivningsljud i en enda tagning plus flexibla bildförhållanden (9:16 till 21:9) passar snabba sociala medier- och reklamarbetsflöden som behöver färdigt ljud, inte bara bild.

3. Iterativ kreativ redigering

Instruktionsbaserad redigering gör att team kan förfina ett klipp beskrivande istället för att återskapa, vilket snabbar upp revisionsintensiv produktion.

FAQ

Vad är MiniMax H3?

H3 är Hailuo 3.0, Mini​Maxs senaste AI-videogenereringsmodell, som presenterades på WAIC 2026 (17 juli 2026) och släpptes den 31 juli 2026. Den producerar nativ 2K-video med 24 fps och synkroniserat ljud, från text eller bilder, med omni-referenskontroll och instruktionsbaserad redigering.

Är H3 samma som MiniMax M3?

Nej. M3 är Mini​Max:s text-/agent-LLM; H3 (Hailuo 3.0) är dess videogenereringsmodell. De presenterades vid samma evenemang men utför olika uppgifter.

Var kan jag använda H3 nu?

Fyra ställen: Mini​Max:s Hailuo-plattform (hela produkten), Vercels AI Gateway (med stöd för både H3 och MiniMax H3 Max; 50 % lanseringsrabatt till och med den 13 september), Luma Agents (tillkännagavs den 6 augusti 2026 – upp till 15 sekunders 2K-video med inbyggt stereoljud; åtkomstvillkoren är fortfarande oklara) och egen drift via de öppna H3-Base-vikterna på Hugging Face och ModelScope – som sedan den 1 september kan köras snabbare än realtid via vLLM-Omni med FastVideos FastH3 (det tar cirka 8,7 sekunder att generera en 10,1 sekunders video- och ljud-MP4 på 8× B300, enligt vLLM-Omni-teamet). Basmodellen kan också nås via OrcaRouter till leverantörens listpris.

Hur långa och vilken upplösning har H3-klippen?

Native 2K vid 24 fps, 5–15 sekunder per generation, förlängningsbar till cirka 30 sekunder, i bildförhållanden från 21:9 till 9:16.

Vad är omni-reference?

Ett styrsystem som accepterar upp till 9 referensbilder, 3 videoklipp och 3 ljudklipp samtidigt för att hålla stil, karaktär, rörelse och röst konsekventa.

Är H3 bättre än Kling 3.0 eller Veo 3.1?

Det beror på axeln. Kling 3.0 erbjuder inbyggd 4K och leder inom vissa områden; Veo 3.1 är stark på 48kHz-dialog. H3 betonar omni-referenskontroll, one-pass-ljud, redigering och pris. H3 har tidiga Artificial Analysis-arenapoäng (runt 1 184 för bild-till-video och 1 226 för text-till-video med ljud, från slutet av augusti) som kommer att förändras när röster ackumuleras — testa på dina egna prompts.

Är H3 open-weight?

Delvis. Mini​Max släppte H3:s basvikter som öppen källkod den 3 augusti 2026 – en 33B-transformer publicerad på Hugging Face och ModelScope under MiniMax H3 Community License, med FL2VA- och Ref2VA-checkpoints. Enligt licensvillkoren för Mini​Max begränsar releasen distributionsregioner och omfattar även genererade utdata, med krav på attribution. De två moduler som fullbordar flaggskeppsupplevelsen – H3-Context-IR (förprocessning av prompt) och H3-Regenerate-2K (2K-uppskalningen) – ingår inte i den öppna releasen och förblir enbart API-tillgängliga. Sedan den 1 september kan de öppna basvikterna också serveras för realtidsgenerering via vLLM-Omni och FastVideos FastH3 (FastH3 v1 täcker endast text-till-video-audio). Så ja för basmodellen, med förbehåll.

Slutsats

MiniMax H3 (Hailuo 3.0) är ett rejält steg upp för MiniMax videolinje: nativ 2K, synkroniserat ljud i ett enda pass, generös omni-reference-styrning och instruktionsbaserad redigering, till ett överkomligt pris. Sedan lanseringen har den också blivit dramatiskt lättare att nå — den routas via OrcaRouter till leverantörens listpris, den körs i Luma Agents, dess basvikter är öppna för självhostning (och sedan 1 september tillräckligt snabbt för att rendera ett klipp på 10,1 sekunder snabbare än det spelas upp, via vLLM-Omni och FastVideos FastH3), och den och MiniMax H3 Max finns nu på Vercels AI Gateway med 50 % lanseringsrabatt i två veckor. Den kommer inte automatiskt att överträffa rivaler som satsar på nativ 4K i upplösning, och dess tidiga arena-resultat håller fortfarande på att stabilisera sig — men när det gäller kontroll, ljud och iterationshastighet är den övertygande. Utvärdera H3 mot Kling 3.0, Veo 3.1, Seedance 2.0 och resten på ditt eget material, och håll din bredare modellstack leverantörsneutral genom en enda slutpunkt som OrcaRouter.