
MiniMax H3 (Hailuo 3.0): Il modello video AI 2K con Omni-Reference, spiegato
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
MiniMax H3 — meglio conosciuto come Hailuo 3.0 — è il più recente modello di generazione video AI di MiniMax, presentato al WAIC 2026 (17 luglio 2026), rilasciato al pubblico il 31 luglio e ora disponibile in quattro modi contemporaneamente: la piattaforma Hailuo di MiniMax, Luma Agents, un download open-weight e — dal 30 agosto — l'AI Gateway di Vercel, dove è stato lanciato anche il nuovo MiniMax H3 Max, pensato per la velocità. Spinge la linea video di MiniMax alla risoluzione nativa 2K, aggiunge audio sincronizzato in un'unica passata e introduce un sistema di controllo “omni-reference” insolitamente ricco. L'ultima novità riguarda il lato self-hosting: dal 1° settembre, i pesi open di H3-Base possono essere serviti tramite vLLM-Omni con FastH3 di FastVideo, abbastanza veloce da renderizzare un MP4 completo di video e audio di 10,1 secondi in circa 8,7 secondi — più veloce della sua durata di riproduzione. Questa guida spiega che cos'è realmente H3, cosa c'è di veramente nuovo e dove si colloca tra i modelli video d'avanguardia del 2026 — con capacità documentate e affermazioni sulla qualità chiaramente etichettate.
Nota sull'accuratezza: le capacità di H3 derivano dall'annuncio di MiniMax e dalla documentazione della piattaforma. La disponibilità su Vercel AI Gateway è confermata — il catalogo dei modelli di Vercel elenca sia MiniMax H3 sia MiniMax H3 Max, e il changelog di Vercel documenta lo sconto di lancio — sebbene i termini promozionali stessi siano annunciati dal fornitore. L'integrazione con Luma Agents e il rilascio open-weight restano annunciati dal fornitore al momento della stesura; la documentazione ufficiale di Luma non elenca ancora H3 e i termini di accesso all'integrazione non sono chiari. La qualità video è in gran parte soggettiva e viene valutata tramite arene basate sulle preferenze umane; H3 ha ora i primi punteggi nell'arena di Artificial Analysis — circa 1.184 per image-to-video e 1.226 per text-to-video con audio, rilevati il 27 agosto 2026 — anche se le classifiche dell'arena cambiano man mano che i voti si accumulano. Il dato del 1° settembre sul serving più veloce della riproduzione — un MP4 completo di 10,1 secondi con audio sincronizzato renderizzato in circa 8,7 secondi — è riportato dal team di vLLM-Omni nel proprio post sul blog, misurato su un server 8× NVIDIA B300; si tratta di un benchmark del team non ancora riprodotto in modo indipendente, e misura FastH3, l'adattatore distillato in quattro passaggi di FastVideo, non il modello base completo. Tratta le affermazioni comparative su "quale sia il migliore" come provvisorie. Specifiche e prezzi cambiano — verifica prima di sviluppare.
TL;DR. H3 è un modello text-to-video e image-to-video nativo 2K a 24fps che genera clip di 5–15 secondi (estendibili a ~30s) con dialogo, effetti sonori e atmosfera sincronizzati in un'unica passata. Le sue caratteristiche principali sono l'omni-reference (fino a 9 immagini di riferimento, 3 clip video e 3 clip audio per la coerenza) e l'editing basato su istruzioni (modifica personaggi, oggetti, scene, audio o ritmo senza rigenerare). Dal lancio si è diffuso rapidamente: i pesi base sono diventati open il 3 agosto, MiniMax ha annunciato H3 in Luma Agents il 6 agosto (fino a 15 secondi di video 2K con audio stereo nativo, anche se i termini di accesso non sono ancora pubblici), e il 30 agosto MiniMax H3 e MiniMax H3 Max sono arrivati su Vercel's AI Gateway con uno sconto di lancio del 50% per due settimane. Dal 1° settembre, i pesi base open possono anche essere serviti per la generazione in tempo reale: tramite vLLM-Omni con FastVideo's FastH3, un video MP4 completo di 10,1 secondi con audio viene renderizzato in circa 8,7 secondi, più velocemente della riproduzione, secondo il benchmark del team di vLLM-Omni. È un grande passo avanti rispetto a Hailuo 2.3 (che era 1080p, ~10s, senza omni-reference) e compete con Kling 3.0, Google Veo 3.1, ByteDance Seedance 2.0 e altri: forte su controllo e audio, con i primi punteggi indipendenti dell'arena ancora da consolidare.
Punti chiave
• H3 = Hailuo 3.0, l'ultimo modello video di MiniMax, presentato al WAIC 2026 e rilasciato il 31 luglio; disponibile tramite Hailuo, Luma Agents, open weights e l'AI Gateway di Vercel.
• 2K nativo a 24fps, clip da 5–15 secondi (estensibili a ~30s), multipli rapporti d'aspetto, da testo a video e da immagine a video.
• Omni-reference: fino a 9 immagini, 3 clip video e 3 clip audio come riferimenti per stile, personaggio, movimento e coerenza vocale.
• Dialogo sincronizzato, effetti sonori e atmosfera generati in un unico passaggio; editing basato su istruzioni senza rigenerazione completa.
• I pesi base sono stati rilasciati come open source il 3 agosto sotto licenza comunitaria; i moduli Context-IR e 2K-regeneration restano disponibili solo tramite API.
• Il 30 agosto, MiniMax H3 e MiniMax H3 Max sono stati lanciati sull'AI Gateway di Vercel con uno sconto di lancio del 50% fino al 13 settembre.
• Dal 1 settembre, i pesi open H3-Base possono essere serviti per la generazione in tempo reale — un MP4 video e audio di 10,1 secondi renderizzato in circa 8,7 secondi, più veloce della riproduzione — tramite vLLM-Omni e FastH3 di FastVideo (benchmark riportato dal team, non ancora riprodotto in modo indipendente).
• Grande miglioramento rispetto a Hailuo 2.3 (1080p, ~10s); compete con Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 e altri.
Cosa è realmente MiniMax H3
MiniMax è una grande azienda cinese di IA {{1}}(ha completato una IPO a Hong Kong nel gennaio 2026, raccogliendo secondo quanto riportato circa 619 milioni di dollari con una valutazione di circa 4 miliardi di dollari, con investitori tra cui Alibaba e Tencent){{/1}}. Il suo marchio video consumer è Hailuo, noto per la simulazione fisica leader di categoria, la generazione rapida e i prezzi accessibili. H3 è il modello di terza generazione di Hailuo, presentato insieme al modello di testo M3 di MiniMax e ad altre soluzioni multimodali al WAIC 2026 e rilasciato al pubblico il 31 luglio 2026. {{2}}Mentre M3 è un LLM testuale/agentico, H3 è decisamente un modello di generazione video.{{/2}}
Novità: 2K, omni-reference e audio a una passata.
Tre cose definiscono H3. Innanzitutto, nativo 2K a 24fps — un passo avanti rispetto al 1080p di Hailuo 2.3 — a cadenza cinematografica, con clip da 5 a 15 secondi (estensibile fino a circa 30 secondi tramite uno strumento Extend) e proporzioni da 21:9 a 9:16. In secondo luogo, omni-reference: puoi caricare fino a 9 immagini di riferimento, 3 clip video e 3 clip audio contemporaneamente per fissare stile, identità del personaggio, movimento o voce — una superficie di controllo insolitamente generosa per mantenere un personaggio o un aspetto coerente tra le inquadrature. In terzo luogo, audio sincronizzato in un unico passaggio: H3 genera dialoghi, effetti sonori e atmosfera ambientale temporizzati rispetto all'azione sullo schermo, anziché richiedere un passaggio audio separato.

Modifica basata su istruzioni
Una caratteristica silenziosamente importante è la modifica basata su istruzioni: invece di rigenerare una clip da zero per apportare una modifica, puoi descrivere una modifica — sostituire un personaggio, alterare un oggetto, cambiare la scena, regolare l'audio o ripensare l'inquadratura — e H3 la applica. Per il lavoro creativo iterativo, modificare sul posto piuttosto che tirare di nuovo i dadi su una generazione fresca è un vero vantaggio per il flusso di lavoro.
Come si confronta con Hailuo 2.3
Il salto generazionale è chiaro: H3 passa da 1080p a 2K nativo, estende la durata massima di una singola generazione da circa 10 secondi a 15 (con un'estensione di 30 secondi) e aggiunge sia input omni-riferimento che editing basato su istruzioni, che mancavano in 2.3. Se hai usato Hailuo 2.3, H3 è un aggiornamento diretto per risoluzione, durata, controllo e audio.
Dove si colloca H3 nella frontiera del 2026
H3 ora riporta i primi punteggi dell'arena Artificial Analysis — circa 1.184 in image-to-video e 1.226 in text-to-video con audio, rilevati il 27 agosto 2026 — sebbene le classifiche dell'arena cambino man mano che i voti si accumulano, quindi giudicalo in base ai tuoi prompt di test piuttosto che su una singola affermazione.
Una nota su OpenAI Sora
Se stai mappando il campo: OpenAI ha interrotto le esperienze web e app di Sora nell'aprile 2026, con la sua API programmata per terminare nel settembre 2026 — quindi Sora non è un modello su cui avviare nuovi flussi di lavoro video. La frontiera attuale è l'insieme qui sopra, e H3 si aggiunge a esso.
Come accedere a H3 e al resto del campo
H3 è ora raggiungibile in quattro modi, e questo elenco è cresciuto dal lancio.
• Hailuo (la piattaforma di MiniMax): il prodotto completo, inclusa la modifica basata su istruzioni e l'upscaling H3-Regenerate-2K fino a 2K.
• Luma Agents: MiniMax ha annunciato il 6 agosto 2026 che H3 è ora disponibile nel prodotto Agents multimodale di Luma, in grado di generare fino a 15 secondi di video 2K con audio stereo nativo. Questo è stato annunciato dal fornitore e i termini di accesso non sono ancora pubblici — i documenti del prodotto di Luma non elencano H3 al momento — quindi è prevedibile che i dettagli su prezzi e idoneità vengano definiti a breve. Il fatto che Luma ospiti un modello video rivale all'interno del proprio prodotto Agents è un segno di quanto sia diventato intercambiabile il mercato dei modelli video nel 2026.
• Vercel AI Gateway: il 30 agosto 2026, MiniMax e Vercel hanno annunciato che sia MiniMax H3 che MiniMax H3 Max sono disponibili tramite l'AI Gateway di Vercel, con le richieste fatturate attraverso il gateway con uno sconto del 50% dal 30 agosto al 13 settembre 2026. Gli ID dei modelli — minimax/minimax-h3 e minimax/minimax-h3-max — sono invariati, quindi le integrazioni esistenti con il gateway ottengono la tariffa scontata senza modifiche al codice. La disponibilità è confermata nel catalogo modelli e nel changelog di Vercel; i termini della promozione sono annunciati dal fornitore.
• Pesi aperti: il 3 agosto 2026, MiniMax ha rilasciato i pesi base di H3 — un trasformatore denso da 33B, H3-Base — su Hugging Face e ModelScope con la MiniMax H3 Community License, come due checkpoint: H3-Base-FL2VA per la generazione testo-video/audio e di keyframe, e H3-Base-Ref2VA per la generazione basata su riferimenti. Due dei tre moduli di sistema — H3-Context-IR (il preprocessore del prompt) e H3-Regenerate-2K (l'upscale 2K) — non sono inclusi nella release aperta e restano solo via API, quindi le esecuzioni self-hosted si fermano sotto i 2K. E dal 1° settembre, gli stessi pesi base possono essere serviti per la generazione in tempo reale tramite vLLM-Omni e FastH3 di FastVideo — un adattatore distillato a quattro step che genera un intero MP4 video-audio di 10,1 secondi in circa 8,7 secondi su un server 8× NVIDIA B300, più veloce della sua durata di riproduzione (riportato dal team, non ancora riprodotto in modo indipendente).
MiniMax H3 è su OrcaRouter al prezzo di listino del fornitore — $0.08 al secondo a 768p e $0.13 al secondo a 2K — offerto con ricarico 0% e failover automatico, così puoi chiamare la famiglia H3 attraverso un'unica API compatibile con OpenAI invece di collegare un endpoint di un fornitore che ha pochi giorni. Poiché nessun singolo provider ospita tutti i modelli, l'approccio pratico è far passare il traffico LLM e degli agenti attraverso un unico endpoint (OrcaRouter instrada anche il modello di testo M3 di MiniMax) e usare direttamente il miglior modello video per ogni progetto. MiniMax H3 Max non è ancora instradato su OrcaRouter — per ora è erogato tramite canali di terze parti — quindi se stai facendo prototipazione con esso, l'abitudine al failover ripaga: prova un modello di pochi giorni senza scommettere una pipeline di produzione su di esso.

Erogazione in tempo reale: video più veloce della riproduzione
Lo sviluppo dietro questo aggiornamento riguarda il lato self-hosting. Il checkpoint open di base di MiniMax H3 è un transformer denso da 33B, e generare un clip nel modo standard significa eseguire circa 49 forward pass del diffusion-transformer su un lungo denoising schedule. FastVideo, il progetto open-source di training e inferenza video, ha pubblicato uno studente distillato di H3-Base chiamato FastH3: un modello a quattro passi (in stile DMD2) che riutilizza l'encoder di testo di H3, il VAE video, il VAE audio, i tokenizer e gli scheduler, ma riduce il ciclo di denoising a quattro forward pass del transformer su cinque posizioni sigma. vLLM-Omni, il runtime di serving multimodale, integra l'adattatore FastH3 al momento del caricamento (pull request #6714) e lo espone tramite un endpoint /v1/videos compatibile con OpenAI, insieme al precedente supporto per H3-Base.
Il dato di punta è misurato su hardware di grandi dimensioni. Su un server NVIDIA B300 8× a 1344×768 e 24 fps, il team di vLLM-Omni riporta un MP4 completo di 10,1 secondi — video e audio sincronizzati — renderizzato end-to-end in circa 8,7 secondi, più veloce della sua durata di riproduzione. Si tratta di un benchmark riportato dal team, pubblicato il 1° settembre 2026 e non ancora riprodotto in modo indipendente; il team stesso nota che il bundle grezzo del benchmark è ancora in attesa di pubblicazione e non avanza alcuna rivendicazione di parità qualitativa tra base e FastH3. Su hardware più modesto i numeri sono meno eclatanti — la ricetta della community copre anche configurazioni 2× RTX 5090 e single-GPU — e FastH3 v1 copre solo text-to-video-audio (T2VA), a 1344×768 anziché i 2K che restano lato API.
Per un lettore, questo cambia il significato di “self-hosting H3”. Prima, i pesi base aperti funzionavano ma lentamente — ok per il batch, non per qualcosa di interattivo. Con FastH3 su vLLM-Omni, una pipeline H3 on-premises può elaborare una clip di dieci secondi in un tempo ben inferiore alla durata della clip, che è la soglia in cui i cicli di prodotto in tempo reale — previsualizzazione live, iterazione rapida delle inquadrature, video guidato da agenti — diventano pratici. Se preferisci non gestire un server a otto GPU, il percorso gestito è invariato: MiniMax H3 è su OrcaRouter al prezzo di listino del fornitore, inoltrato con margine 0% e failover automatico, così puoi chiamare la famiglia H3 tramite un'unica API compatibile con OpenAI senza possedere l'hardware.
Tre scenari in cui H3 brilla
1. Cortometraggi coerenti per personaggio e stile
Omni-reference (fino a 9 immagini, 3 clip, 3 audio) è progettato per mantenere coerenti personaggio, aspetto e voce attraverso più riprese — ideale per cortometraggi narrativi e contenuti episodici.
2. Creatività social e pubblicitaria con audio
Dialogo sincronizzato in un unico passaggio, effetti sonori e atmosfera più rapporti di aspetto flessibili (da 9:16 a 21:9) si adattano a flussi di lavoro social e pubblicitari veloci che necessitano di audio finito, non solo di immagini.
3. Editing creativo iterativo
L'editing basato su istruzioni consente ai team di perfezionare un clip in modo descrittivo invece di rigenerarlo, il che accelera la produzione con molte revisioni.

Domande frequenti
Cos'è MiniMax H3?
H3 è Hailuo 3.0, il modello di generazione video AI più recente di MiniMax, presentato al WAIC 2026 (17 luglio 2026) e rilasciato il 31 luglio 2026. Produce video nativi in 2K a 24fps con audio sincronizzato, da testo o immagini, con controllo omni-reference e modifica basata su istruzioni.
H3 è lo stesso di MiniMax M3?
No. M3 è l'LLM testuale/agentico di MiniMax; H3 (Hailuo 3.0) è il suo modello di generazione video. Sono stati presentati allo stesso evento ma svolgono compiti diversi.
Dove posso usare H3 ora?
Quattro opzioni: la piattaforma Hailuo di MiniMax (il prodotto completo), l'AI Gateway di Vercel (sia H3 che MiniMax H3 Max, con uno sconto di lancio del 50% fino al 13 settembre), Luma Agents (annunciato il 6 agosto 2026 — fino a 15 secondi di video 2K con audio stereo nativo, termini di accesso ancora poco chiari), e il self-hosting tramite i pesi aperti H3-Base su Hugging Face e ModelScope — che, dal 1° settembre, può essere servito a una velocità superiore a quella di riproduzione tramite vLLM-Omni con FastH3 di FastVideo (un MP4 con video e audio di 10,1 secondi in circa 8,7 secondi su 8× B300, secondo il team di vLLM-Omni). Il modello base viene inoltre instradato su OrcaRouter al prezzo di listino del provider.
Quanto durano e che risoluzione hanno i clip H3?
Native 2K a 24 fps, da 5 a 15 secondi per generazione, estendibile fino a circa 30 secondi, in rapporti d'aspetto da 21:9 a 9:16.
Che cos'è omni-reference?
Un sistema di controllo che accetta fino a 9 immagini di riferimento, 3 video clip e 3 clip audio contemporaneamente per mantenere coerenti stile, personaggio, movimento e voce.
H3 è migliore di Kling 3.0 o Veo 3.1?
Dipende dall'asse. Kling 3.0 offre 4K nativo ed è in testa in alcune arene; Veo 3.1 è forte sul dialogo a 48kHz. H3 enfatizza il controllo omni-reference, l'audio a passata singola, l'editing e il prezzo. H3 ha punteggi iniziali nell'arena Artificial Analysis (circa 1.184 per image-to-video e 1.226 per text-to-video con audio a fine agosto) che cambieranno man mano che i voti si accumulano — prova con i tuoi prompt.
H3 è a pesi aperti?
In parte. MiniMax ha reso open-source i pesi base di H3 il 3 agosto 2026 — un transformer da 33B rilasciato su Hugging Face e ModelScope sotto la licenza comunitaria MiniMax H3, con i checkpoint FL2VA e Ref2VA. Secondo i termini della licenza di MiniMax, il rilascio limita le regioni di distribuzione e si estende agli output generati, con attribuzione richiesta. I due moduli che completano l'esperienza di punta — H3-Context-IR (pre-elaborazione del prompt) e H3-Regenerate-2K (l'upscaling 2K) — non sono inclusi nel rilascio open e rimangono solo API. Dal 1° settembre, i pesi base aperti possono anche essere serviti per la generazione in tempo reale tramite vLLM-Omni e FastH3 di FastVideo (FastH3 v1 copre solo text-to-video-audio). Quindi sì per il modello base, con riserve.
Il risultato finale
MiniMax H3 (Hailuo 3.0) è un serio passo avanti per la linea video di MiniMax: 2K nativo, audio sincronizzato in un'unica passata, generoso controllo omni-reference e modifica basata su istruzioni, a un prezzo accessibile. Dal lancio è anche diventato drasticamente più facile da raggiungere: è instradato su OrcaRouter al prezzo di listino del provider, gira all'interno di Luma Agents, i suoi pesi base sono aperti per l'hosting autonomo (e dal 1° settembre abbastanza veloce da renderizzare una clip di 10,1 secondi in meno del suo tempo di riproduzione, tramite vLLM-Omni e FastH3 di FastVideo), e sia esso che MiniMax H3 Max ora si trovano sull'AI Gateway di Vercel con uno sconto di lancio del 50% per due settimane. Non supererà automaticamente in risoluzione i rivali che puntano sul 4K nativo, e i suoi primi punteggi in arena sono ancora in via di consolidamento — ma su controllo, audio e velocità di iterazione è convincente. Valuta H3 contro Kling 3.0, Veo 3.1, Seedance 2.0 e gli altri sui tuoi filmati, e mantieni il tuo stack di modelli più ampio neutrale rispetto al fornitore tramite un unico endpoint come OrcaRouter.
