MiniMax H3 (Hailuo 3.0): Model AI wideo 2K z Omni-Reference, wyjaśniony.
Guides & Insights

MiniMax H3 (Hailuo 3.0): Model AI wideo 2K z Omni-Reference, wyjaśniony.

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MiniMax H3 — lepiej znany jako Hailuo 3.0 — to najnowszy model generowania wideo AI firmy MiniMax, zaprezentowany na WAIC 2026 (17 lipca 2026), udostępniony publicznie 31 lipca, a obecnie dostępny jednocześnie na cztery sposoby: na platformie Hailuo firmy MiniMax, w Luma Agents, jako wersja open-weight do pobrania oraz — od 30 sierpnia — w AI Gateway firmy Vercel, gdzie razem z nim zadebiutował nowy, stawiający na szybkość MiniMax H3 Max. Podnosi linię wideo MiniMax do natywnej rozdzielczości 2K, dodaje zsynchronizowany dźwięk w jednym przebiegu i wprowadza niezwykle bogaty system sterowania „omni-reference”. Najnowsze zmiany dotyczą strony self-hostingu: od 1 września otwarte wagi H3-Base mogą być serwowane przez vLLM-Omni, a FastH3 od FastVideo jest na tyle szybki, że renderuje kompletny 10,1-sekundowy plik MP4 z wideo i dźwiękiem w około 8,7 sekundy — szybciej, niż wynosi czas jego odtwarzania. Ten przewodnik wyjaśnia, czym naprawdę jest H3, co jest w nim naprawdę nowego i gdzie plasuje się wśród czołowych modeli wideo 2026 roku — z udokumentowanymi możliwościami i jasno oznaczonymi twierdzeniami o jakości.

Uwaga dotycząca dokładności: możliwości modelu H3 pochodzą z zapowiedzi firmy MiniMax i dokumentacji jej platformy. Dostępność Vercel AI Gateway jest potwierdzona — katalog modeli Vercela wymienia zarówno MiniMax H3, jak i MiniMax H3 Max, a dziennik zmian Vercela dokumentuje rabat na start — choć same warunki promocji ogłasza producent. Integracja z Luma Agents i udostępnienie otwartych wag pozostają w chwili pisania tego tekstu wyłącznie zapowiedziami producenta; Luma nie umieszcza jeszcze H3 we własnej dokumentacji produktowej, a warunki dostępu do integracji są niejasne. Jakość wideo jest w dużej mierze subiektywna i oceniana w arenach preferencji ludzkich; H3 ma już wstępne wyniki na arenie Artificial Analysis — około 1184 punktów w kategorii image-to-video i około 1226 punktów w kategorii text-to-video z dźwiękiem, zarejestrowane 27 sierpnia 2026 r. — choć rankingi aren zmieniają się w miarę gromadzenia głosów. Wartość z 1 września dotycząca serwowania szybszego niż odtwarzanie — kompletny plik MP4 o długości 10,1 sekundy ze zsynchronizowanym dźwiękiem, wyrenderowany w około 8,7 sekundy — została podana przez zespół vLLM-Omni we własnym wpisie na blogu; pomiar wykonano na serwerze z ośmioma układami NVIDIA B300. Jest to wewnętrzny benchmark zespołu i nie został on jeszcze niezależnie powtórzony; dotyczy modelu FastH3 — czterokrokowego destylowanego adaptera FastVideo — a nie pełnego modelu bazowego. Porównawcze twierdzenia typu „który wygląda najlepiej” traktuj jako prowizoryczne. Specyfikacje i ceny się zmieniają — zweryfikuj je, zanim zaczniesz budować.

TL;DR. H3 to natywny model text-to-video i image-to-video w rozdzielczości 2K, 24 kl./s, generujący 5–15-sekundowe klipy (możliwe do wydłużenia do ~30 s) ze zsynchronizowanym dialogiem, efektami dźwiękowymi i atmosferą w jednym przebiegu. Jego wyróżniające cechy to omni-reference (do 9 obrazów referencyjnych, 3 klipów wideo i 3 klipów audio dla spójności) oraz edycja oparta na instrukcjach (zmiana postaci, obiektów, scen, dźwięku lub tempa bez ponownego generowania). Od premiery szybko się rozprzestrzenia: wagi bazowe stały się otwarte 3 sierpnia, MiniMax ogłosił H3 w Luma Agents 6 sierpnia (do 15 sekund wideo 2K z natywnym dźwiękiem stereo, choć warunki dostępu nie są jeszcze publiczne), a 30 sierpnia MiniMax H3 i MiniMax H3 Max trafiły do AI Gateway Vercela z 50% rabatem promocyjnym na dwa tygodnie. Od 1 września otwarte wagi bazowe można również wykorzystywać do generowania w czasie rzeczywistym: przez vLLM-Omni z FastH3 od FastVideo, kompletny 10,1-sekundowy plik MP4 z wideo i audio renderuje się w około 8,7 sekundy — szybciej niż czas odtwarzania, według benchmarku zespołu vLLM-Omni. To duży krok względem Hailuo 2.3 (który oferował 1080p, ~10 s, bez omni-reference), i konkuruje z Kling 3.0, Google Veo 3.1, ByteDance Seedance 2.0 i innymi — mocny w zakresie kontroli i dźwięku, a wczesne wyniki z niezależnych aren wciąż wymagają potwierdzenia.

Najważniejsze wnioski

• H3 = Hailuo 3.0, najnowszy model wideo MiniMaxa, zaprezentowany na WAIC 2026 i wydany 31 lipca; dostępny przez Hailuo, Luma Agents, otwarte wagi i AI Gateway od Vercel.

• Natywny 2K przy 24 kl./s, klipy 5–15 s (możliwość przedłużenia do ~30 s), wiele proporcji ekranu, tekst-na-wideo i obraz-na-wideo.

• Omni-reference: do 9 obrazów, 3 klipy wideo i 3 klipy audio jako odniesienia dla spójności stylu, postaci, ruchu i głosu.

• Zsynchronizowany dialog, SFX i atmosfera generowane w jednym przebiegu; edycja oparta na instrukcjach bez pełnej regeneracji.

• Podstawowe wagi udostępniono jako open source 3 sierpnia na licencji społecznościowej; moduły Context-IR i 2K-regeneration pozostają dostępne wyłącznie przez API.

• 30 sierpnia MiniMax H3 i MiniMax H3 Max zadebiutowały w AI Gateway Vercel z 50% zniżką startową obowiązującą do 13 września.

• Od 1 września otwarte wagi H3-Base mogą być wykorzystywane do generowania w czasie rzeczywistym — 10,1-sekundowy plik MP4 z wideo i audio renderowany w około 8,7 sekundy, szybciej niż odtwarzanie — za pośrednictwem vLLM-Omni oraz FastVideo's FastH3 (benchmark zgłoszony przez zespół, nie został jeszcze niezależnie potwierdzony).

• Duże ulepszenie w porównaniu do Hailuo 2.3 (1080p, ~10s); konkuruje z Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 i innymi.

Czym tak naprawdę jest MiniMax H3?

Mini​Max to duża chińska firma AI (w styczniu 2026 r. przeprowadziła IPO w Hongkongu, pozyskując podobno około 619 milionów dolarów przy wycenie na mniej więcej 4 miliardy dolarów, a wśród inwestorów znalazły się Alibaba i Tencent). Jej marką wideo dla konsumentów jest Hailuo, znane z wiodącej w swojej kategorii symulacji fizyki, szybkiego generowania i przystępnych cen. H3 to model trzeciej generacji Hailuo, zaprezentowany wraz z modelem tekstowym M3 firmy Mini​Max i innymi rozwiązaniami multimodalnymi na WAIC 2026, a udostępniony publicznie 31 lipca 2026 r. Podczas gdy M3 to tekstowy/agentowy LLM, H3 jest jednoznacznie modelem generowania wideo.

Co nowego: 2K, omni-reference i jednoprzebiegowe audio.

Trzy rzeczy definiują H3. Po pierwsze, natywne 2K przy 24 fps — krok naprzód w porównaniu z 1080p Hailuo 2.3 — o standardowej kadencji filmowej, z klipami od 5 do 15 sekund (można przedłużyć do około 30 sekund za pomocą narzędzia Extend) i proporcjami obrazu od 21:9 do 9:16. Po drugie, omni-reference: możesz podać jednocześnie do 9 obrazów referencyjnych, 3 klipów wideo i 3 klipów audio, aby ustalić styl, tożsamość postaci, ruch lub głos — niezwykle hojna powierzchnia kontrolna do utrzymania spójności postaci lub wyglądu między ujęciami. Po trzecie, zsynchronizowany dźwięk w jednym przejściu: H3 generuje dialogi, efekty dźwiękowe i atmosferę otoczenia zsynchronizowane z akcją na ekranie, zamiast wymagania osobnego etapu dźwiękowego.

Edycja oparta na instrukcjach

Cichą, ale ważną funkcją jest edycja oparta na instrukcjach: zamiast regenerować klip od początku, aby wprowadzić zmianę, możesz opisać edycję — zamienić postać, zmienić obiekt, zmienić scenę, dostosować dźwięk lub zmienić tempo ujęcia — a H3 to zastosuje. W przypadku iteracyjnej pracy twórczej edycja w miejscu zamiast ponownego rzucania kośćmi na nową generację to prawdziwa zaleta dla przepływu pracy.

Jak wypada w porównaniu z Hailuo 2.3

Skok pokoleniowy jest wyraźny: H3 przechodzi z 1080p do natywnego 2K, wydłuża maksymalny czas pojedynczej generacji z około 10 sekund do 15 (z możliwością przedłużenia do 30 sekund) oraz dodaje zarówno wejścia omni-referencyjne, jak i edycję opartą na instrukcjach, których brakowało w 2.3. Jeśli używałeś Hailuo 2.3, H3 to prosty upgrade pod względem rozdzielczości, długości, kontroli i dźwięku.

Gdzie H3 plasuje się na granicy 2026 roku

H3 ma obecnie wczesne wyniki arena Artificial Analysis — około 1,184 w image-to-video i 1,226 w text-to-video z dźwiękiem, zarejestrowane 27 sierpnia 2026 — chociaż rankingi arena zmieniają się wraz z gromadzeniem głosów, więc oceń je na podstawie własnych promptów testowych, a nie pojedynczego twierdzenia.

Nota na temat OpenAI Sora

Jeśli mapujesz ten obszar: OpenAI wycofało webowe i aplikacyjne wersje Sory w kwietniu 2026 r., a jej API ma zakończyć działanie we wrześniu 2026 r. — więc Sora nie jest modelem, na którym warto budować nowe przepływy pracy wideo. Aktualna czołówka to zestaw powyżej, do którego dołącza H3.

Jak uzyskać dostęp do H3 i reszty pola

H3 jest teraz osiągalny na cztery sposoby, a ta lista rozrosła się od czasu premiery.

• Hailuo (własna platforma firmy Mini​Max): pełny produkt, w tym edycję opartą na instrukcjach oraz powiększanie do 2K za pomocą H3-Regenerate-2K.

• Luma Agents: MiniMax ogłosił 6 sierpnia 2026 roku, że H3 jest teraz dostępne w wielomodelowym produkcie Agents firmy Luma, generując do 15 sekund wideo 2K z natywnym dźwiękiem stereo. To ogłoszenie pochodzi od dostawcy, a warunki dostępu nie są jeszcze publiczne — dokumentacja produktu Luma nie wymienia H3 w chwili pisania tego tekstu — więc szczegóły dotyczące cen i kwalifikowalności powinny wkrótce się skonkretyzować. Umieszczenie przez Lumę modelu wideo konkurencji we własnym produkcie Agents jest oznaką tego, jak wymienny stał się rynek modeli wideo w 2026 roku.

• Vercel AI Gateway: 30 sierpnia 2026 r. firmy Mini​Max i Vercel ogłosiły, że zarówno MiniMax H3, jak i MiniMax H3 Max są dostępne za pośrednictwem AI Gateway Vercela, a żądania rozliczane przez bramkę objęte są 50% zniżką od 30 sierpnia do 13 września 2026 r. Identyfikatory modeli — minimax/minimax-h3 i minimax/minimax-h3-max — pozostają bez zmian, więc istniejące integracje z bramką automatycznie korzystają ze zniżki bez zmian w kodzie. Dostępność jest potwierdzona w katalogu modeli Vercela i dzienniku zmian; warunki promocji zostały ogłoszone przez dostawcę.

• Otwarte wagi: 3 sierpnia 2026 r. MiniMax udostępnił bazowe wagi H3 — gęsty transformer o 33B parametrów, H3-Base — w serwisach Hugging Face i ModelScope na licencji MiniMax H3 Community License, jako dwa punkty kontrolne: H3-Base-FL2VA do generowania tekstu na wideo/audio i klatek kluczowych oraz H3-Base-Ref2VA do generowania na podstawie referencji. Dwa z trzech modułów systemu — H3-Context-IR (preprocesor promptów) i H3-Regenerate-2K (upscale do 2K) — nie zostały objęte otwartą publikacją i pozostają dostępne wyłącznie przez API, więc samodzielnie hostowane uruchomienia są ograniczone do rozdzielczości poniżej 2K. Od 1 września te same bazowe wagi można serwować do generowania w czasie rzeczywistym przez vLLM-Omni i FastH3 firmy FastVideo — adapter destylowany w czterech krokach, który renderuje kompletny 10,1-sekundowy plik MP4 z wideo i dźwiękiem w około 8,7 sekundy na serwerze z 8× NVIDIA B300, czyli szybciej niż czas jego odtwarzania (dane zespołu, nie zostały jeszcze niezależnie zweryfikowane).

MiniMax H3 jest na OrcaRouter w cenie katalogowej dostawcy — 0,08 USD za sekundę przy 768p i 0,13 USD za sekundę przy 2K — przekazywane z 0% narzutem i automatycznym przełączaniem awaryjnym, więc możesz wywoływać rodzinę H3 przez jeden interfejs API zgodny z O​penAI zamiast podłączać punkt końcowy dostawcy, który ma kilka dni. Ponieważ żaden pojedynczy dostawca nie udostępnia wszystkich modeli, praktycznym wzorcem jest kierowanie ruchu LLM i agentów przez jeden punkt końcowy (OrcaRouter obsługuje również własny model tekstowy M3 firmy Mini​Max) i korzystanie bezpośrednio z najlepszego modelu wideo dla każdego projektu. MiniMax H3 Max nie jest jeszcze trasowany przez OrcaRouter — na razie jest dostarczany przez kanały zewnętrzne — więc jeśli na nim prototypujesz, nawyk przełączania awaryjnego się opłaca: wypróbuj model sprzed kilku dni, nie stawiając na niego produkcyjnego potoku.

Serwowanie w czasie rzeczywistym: wideo szybsze niż odtwarzanie

Rozwój stojący za tą aktualizacją skupia się po stronie self-hostingu. Otwarty bazowy checkpoint modelu MiniMax H3 to gęsty transformator o 33 miliardach parametrów, a wygenerowanie klipu w standardowy sposób oznacza wykonanie około 49 przepuszczeń przez transformator dyfuzyjny w długim harmonogramie odszumiania. FastVideo, projekt open source do treningu i inferencji wideo, opublikował wydestylowanego ucznia modelu H3-Base o nazwie FastH3: model czterokrokowy (w stylu DMD2), który ponownie wykorzystuje enkoder tekstu H3, wideo VAE, audio VAE, tokenizatory i schedulery, ale ogranicza pętlę odszumiania do czterech przepuszczeń transformatora w pięciu pozycjach sigma. vLLM-Omni, wielomodalne środowisko serwowania, łączy adapter FastH3 podczas ładowania (pull request #6714) i udostępnia go przez kompatybilny z OpenAI endpoint /v1/videos, obok wcześniejszej obsługi bazowego modelu H3.

Liczba z nagłówka została zmierzona na dużym sprzęcie. Na serwerze 8× NVIDIA B300 przy rozdzielczości 1344×768 i 24 kl./s zespół vLLM-Omni podaje, że kompletny 10,1-sekundowy plik MP4 — wideo i zsynchronizowane audio — został wyrenderowany end-to-end w około 8,7 sekundy, czyli szybciej, niż trwa jego odtwarzanie. To benchmark zgłoszony przez zespół, opublikowany 1 września 2026 roku i jeszcze niezależnie niezweryfikowany; sam zespół zaznacza, że surowy pakiet benchmarkowy wciąż czeka na publikację, i nie deklaruje parytetu jakości między wersją bazową a FastH3. Na skromniejszym sprzęcie wyniki są mniej spektakularne — przepis społeczności obejmuje też konfiguracje z 2× RTX 5090 i pojedynczym GPU — a FastH3 v1 obsługuje wyłącznie tryb tekst-wideo-audio (T2VA), w rozdzielczości 1344×768, a nie 2K, która pozostaje dostępna wyłącznie po stronie API.

Dla czytelnika zmienia to, co może oznaczać „self-hosting H3”. Wcześniej otwarte wagi bazowe działały, ale powoli — wystarczająco dobrze do pracy wsadowej, ale nie do niczego interaktywnego. Dzięki FastH3 na vLLM-Omni lokalny potok H3 może przetworzyć dziesięciosekundowy klip w czasie znacznie krótszym niż długość klipu, a to próg, przy którym pętle produktowe czasu rzeczywistego — prewizualizacja na żywo, szybka iteracja ujęć, wideo sterowane agentami — stają się praktyczne. Jeśli wolisz nie uruchamiać serwera z ośmioma GPU, ścieżka zarządzana pozostaje bez zmian: MiniMax H3 jest dostępny w OrcaRouter po cenie katalogowej dostawcy, bez marży i z automatycznym failover, więc możesz wywoływać rodzinę H3 przez jeden interfejs API zgodny z OpenAI, nie posiadając własnego sprzętu.

Trzy scenariusze, w których H3 błyszczy

1. Krótkie filmy spójne pod względem charakteru i stylu.

Omni-reference (do 9 obrazów, 3 klipów, 3 nagrań audio) został stworzony, aby utrzymać spójność postaci, wyglądu i głosu w wielu ujęciach — idealny do krótkich filmów narracyjnych i treści epizodycznych.

2. Treści społecznościowe i reklamowe z dźwiękiem

Jednoprzebiegowy zsynchronizowany dialog, SFX i ambient oraz elastyczne proporcje obrazu (9:16 do 21:9) pasują do szybkich procesów pracy w mediach społecznościowych i reklamie, które potrzebują gotowego dźwięku, a nie tylko wizualizacji.

3. Iteracyjne kreatywne edytowanie

Edycja oparta na instrukcjach pozwala zespołom udoskonalać klip opisowo, zamiast go regenerować, co przyspiesza produkcję wymagającą wielu poprawek.

Często zadawane pytania

Czym jest MiniMax H3?

H3 to Hailuo 3.0, najnowszy model generowania wideo AI firmy Mini​Max, zaprezentowany na WAIC 2026 (17 lipca 2026) i wydany 31 lipca 2026. Generuje natywne wideo 2K, 24fps z zsynchronizowanym dźwiękiem, na podstawie tekstu lub obrazów, z kontrolą omni-reference i edycją opartą na instrukcjach.

Czy H3 jest tym samym co Mini​Max M3?

Nie. M3 to tekstowy/agentowy LLM firmy Mini​Max; H3 (Hailuo 3.0) to jej model generowania wideo. Zostały zaprezentowane na tym samym wydarzeniu, ale pełnią różne funkcje.

Gdzie mogę teraz używać H3?

Cztery miejsca: platforma Hailuo od MiniMax (pełny produkt), AI Gateway od Vercel (zarówno H3, jak i MiniMax H3 Max, z 50% rabatem startowym do 13 września), Luma Agents (ogłoszone 6 sierpnia 2026 — do 15 sekund wideo 2K z natywnym dźwiękiem stereo, warunki dostępu wciąż niejasne) oraz samodzielne hostowanie dzięki otwartym wagom H3-Base na Hugging Face i ModelScope — które od 1 września mogą być serwowane szybciej, niż trwa odtwarzanie, przez vLLM-Omni z FastH3 od FastVideo (10,1-sekundowy plik MP4 z wideo i dźwiękiem w około 8,7 sekundy na 8× B300, według zespołu vLLM-Omni). Model bazowy jest również kierowany przez OrcaRouter po cenie katalogowej dostawcy.

Jak długie i jakiej rozdzielczości są klipy H3?

Native 2K przy 24fps, 5–15 sekund na generację, możliwe do przedłużenia do około 30 sekund, w proporcjach od 21:9 do 9:16.

Co to jest omni-reference?

System sterowania, który akceptuje jednocześnie do 9 obrazów referencyjnych, 3 klipy wideo i 3 klipy audio, aby zachować spójność stylu, postaci, ruchu i głosu.

Czy H3 jest lepsze niż Kling 3.0 lub Veo 3.1?

To zależy od osi. Kling 3.0 oferuje natywne 4K i prowadzi w niektórych arenach; Veo 3.1 jest mocny w dialogach 48 kHz. H3 kładzie nacisk na kontrolę omni-reference, audio w jednym przebiegu, montaż i cenę. H3 ma wczesne wyniki w Artificial Analysis arena (około 1,184 dla image-to-video i 1,226 dla text-to-video z audio na koniec sierpnia), które będą się zmieniać wraz z gromadzeniem głosów — przetestuj na własnych promptach.

Czy H3 jest open-weight?

Częściowo. Firma Mini​Max udostępniła bazowe wagi H3 jako open source 3 sierpnia 2026 roku — transformator 33B opublikowany na Hugging Face i ModelScope na licencji MiniMax H3 Community License, z punktami kontrolnymi FL2VA i Ref2VA. Zgodnie z warunkami licencji Mini​Max, udostępnienie ogranicza regiony wdrożenia i obejmuje wygenerowane wyniki, przy czym wymagane jest podanie autora. Dwa moduły dopełniające flagowe doświadczenie — H3-Context-IR (wstępne przetwarzanie promptów) i H3-Regenerate-2K (upskalowanie 2K) — nie są objęte otwartą publikacją i pozostają dostępne wyłącznie przez API. Od 1 września otwarte wagi bazowe mogą być również serwowane do generowania w czasie rzeczywistym przez vLLM-Omni oraz FastH3 od FastVideo (FastH3 v1 obejmuje wyłącznie generowanie tekst-wideo-audio). Więc tak, jeśli chodzi o model bazowy, z zastrzeżeniami.

Sedno sprawy

MiniMax H3 (Hailuo 3.0) to poważny krok naprzód w ofercie wideo MiniMaxa: natywne 2K, zsynchronizowany dźwięk w jednym przebiegu, rozbudowana kontrola omni-reference i edycja oparta na instrukcjach — w przystępnej cenie. Od premiery stał się też znacznie łatwiej dostępny — jest kierowany przez OrcaRouter w cenie katalogowej dostawcy, działa w ramach Luma Agents, jego bazowe wagi są otwarte do samodzielnego hostowania (a od 1 września jest wystarczająco szybki, aby wyrenderować 10,1-sekundowy klip w czasie krótszym niż jego długość, dzięki vLLM-Omni oraz FastH3 od FastVideo), a on i MiniMax H3 Max są teraz dostępne na AI Gateway Vercel z dwutygodniowym 50% rabatem startowym. Pod względem rozdzielczości nie przebije automatycznie rywali stawiających na natywne 4K, a jego wczesne wyniki na arenie porównawczej wciąż się stabilizują — ale w zakresie kontroli, dźwięku i szybkości iteracji jest przekonujący. Przetestuj H3 w zestawieniu z Kling 3.0, Veo 3.1, Seedance 2.0 i innymi na własnym materiale wideo, a swój szerszy zestaw modeli utrzymuj neutralnym względem dostawców dzięki jednemu punktowi końcowemu, takiemu jak OrcaRouter.