Come usare MiniMax H3-1
Guides & Insights

Come Usare MiniMax H3: Prompt, Esecuzioni Locali e Audio che Non Fa Schifo

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 4 agosto, Simon Willison ha scaricato circa 115 GB di pesi, ha puntato una porta MLX non ufficiale di MiniMax H3sul suo MacBook Pro M5 Max, e ha chiesto una moffetta color arcobaleno che saltava sopra un tronco muschioso in un supermercato. Poco meno di 45 minuti dopo aveva un clip che ha definito davvero impressionante — con una traccia audio che ha descritto come strana, spazzatura simile al parlato. La sua stessa diagnosi era la parte utile: non aveva dato al modello alcuna direzione audio e non aveva letto prima la guida ai prompt. Questo è il riassunto più breve possibile di cosa significhi iniziare a usare H3, venduto anche come Hailuo 3.0. L'immagine arriva più o meno gratis. Tutto il resto — il suono, la tempistica delle inquadrature, il 2K, il personaggio che deve sopravvivere a quattro riprese di fila — bisogna chiederlo esplicitamente, in un formato più rigoroso di quasi qualsiasi altro modello video in uso al momento.

Questa è una guida all'uso, non una copertura del lancio. Tre livelli di fonti la attraversano, e vengono etichettati ogni volta: la sua propria documentazione (la scheda del modello, le due guide per la scrittura dei prompt incluse nel repository, la documentazione dell'API della piattaforma); risultati della comunità provenienti da persone che lo hanno effettivamente eseguito — i manutentori di ComfyUI, benchmarker indipendenti, documentazione di rivenditori e thread di discussione su Hugging Face, tutti datati tra il 31 luglio e il 5 agosto 2026; e un piccolo numero di casi in cui abbiamo letto noi stessi un file primario e lo diciamo. I numeri della comunità sono report singoli su hardware non controllato, salvo diversamente indicato. Laddove i professionisti non sono d'accordo tra loro, il disaccordo viene riportato piuttosto che risolto.

Prima di ogni altra cosa: probabilmente non stai eseguendo l'intero modello

La maggior parte della confusione nella prima settimana di H3 risale a un fatto strutturale che i testi di marketing offuscano. H3 non è un modello singolo. Secondo la sua scheda del modello, è un sistema in tre parti, e solo la parte centrale è stata rilasciata come open source:

H3-Context-IR — un preprocessore multimodale di istruzioni. Legge testo, immagini, audio e video, analizza come si relazionano tra loro e genera una rappresentazione strutturata e semanticamente arricchita di ciò che hai richiesto. Solo API ospitata. È esposto come un tipo di task dedicato che restituisce un prompt arricchito e nessun video.

H3-Base — il modello di generazione da 33B parametri che crea davvero fotogrammi e audio. Questa è la parte open-weights.

H3-Regenerate-2K — un passaggio di rigenerazione in-context che porta il risultato 768p fino a 2K. Solo API hosted.

Da ciò derivano subito due conseguenze, che determinano il tuo intero flusso di lavoro. Primo, la generazione locale ha un tetto di 768p. La tela nativa di H3 ha un lato corto di 768 pixel, limitata a 768×1344 — circa 1344×768 per il 16:9. Se l'output di ComfyUI non è 2K, non c'è niente di rotto; il pacchetto che hai scaricato è H3-Base, e il modulo di upscaling non è incluso. Secondo, l'API ospitata correggerà un prompt approssimativo e la tua installazione locale no. Tutto ciò che Context-IR fa per una chiamata API a pagamento — inferire la struttura, risolvere quale riferimento corrisponda a cosa, riempire le parti che hai lasciato vaghe — è un passaggio che ora devi eseguire a mano, o con un altro modello, prima ancora che H3-Base veda le tue parole. Questa singola asimmetria spiega la maggior parte delle segnalazioni del tipo "lo stesso prompt funziona su Hailuo ma in ComfyUI sembra rotto."

How to Use MiniMax H3-2

Vale la pena notare dal repository stesso: i pesi portano un minimax-h3-community-license-agreement tag piuttosto che Apache o MIT (ne parleremo più avanti, perché è la parte che determina se puoi distribuire il modello). Il modello è elencato con 33B parametri in F32/BF16 e, ad oggi, esattamente un provider di inferenza — fal — risulta servirlo. Ventitré finetune, venti quantizzazioni e trentuno Spaces esistono già sopra di esso, un chiaro segnale della velocità con cui la community si è mossa.

Il formato del prompt: blocchi di inquadrature, non timecode

È qui che la comunità e la documentazione sono apertamente in conflitto, e questo conta più di qualsiasi altra cosa in questo articolo.

Il modello che si è diffuso più rapidamente — tramite Reddit, poi in diverse guide pubblicate — suddivide il clip in intervalli di timecode: [0s-2s], [2s-5s], e così via, seguito da una struttura a sei blocchi composta da contratto di stile, timeline, camera, audio, testo trascritto e lista negativa. È stato ricavato attraverso reverse engineering leggendo i 45 prompt di esempio forniti dall'azienda, e non è senza senso: questi esempi sono in realtà elenchi di inquadrature con un foglio di cue audio allegato, con una lunghezza mediana di circa 130 caratteri cinesi e i più lunghi che arrivano a 657 e 858 caratteri.

Ma la sua stessa VIDEO_PROMPT_WRITING_GUIDE_base_en.md, che si trova nella cartella docs del repository, prescrive qualcosa di diverso. Organizza per blocco di inquadrature, non per intervallo di tempo. La leggiamo direttamente; la struttura che richiede è:

Istruzione — regole di allineamento delle immagini, utilizzate per le modalità keyframe (I2VA, FL2VA, L2VA) e omesse per la sola generazione testo-video.

descrizione_multimodale_integrata — il corpo principale, diviso in [Inquadratura 1], [Inquadratura 2], e così via.

overall_soundscape — da una a quattro frasi di suono diegetico.

non_diegetic_music — da una a tre frasi sulla colonna sonora.

In questo quadro, le convenzioni sono abbastanza specifiche da essere verificabili. [Shot 1] non ha alcun timestamp — gli scatti successivi si aprono con uno stacco assoluto, formulato come "Alle 00:03.500, la telecamera taglia su…". Il movimento della telecamera è scritto come tipo di movimento più ampiezza più velocità, integrato in un inglese naturale piuttosto che impilato come etichette: una lenta carrellata in avanti di piccola ampiezza, non camera: dolly-in, slow. I movimenti disponibili sono la solita serie — zoom, pan, tilt, tracking, arc, POV e shake in varianti lievi o forti. Il dialogo è racchiuso in tag: <d>[English] Get in the car.</d>, con punteggiatura preservata esattamente e mai tradotta o parafrasata. I parlanti ricevono ID stabili — (S1), (S2) e (S1,S2) per una battuta congiunta — con età, genere, timbro e accento descritti alla prima apparizione. La voce fuori campo è marcata come una battuta fuori schermo con una nota esplicita che le labbra restano chiuse, ed è così che si impedisce al modello di sincronizzare le labbra sulla narrazione. Le conversazioni in montaggio alternato usano un marcatore <scenetrans> più una dichiarazione di continuità.

Le proibizioni esplicite della guida sono altrettanto rivelatrici delle sue regole: non inserire un timestamp nella prima inquadratura, non ripetere dialoghi, canti o musica in scena all'interno di overall_soundscape, non usare parole astratte di atmosfera in non_diegetic_music, e non riscrivere mai una battuta di dialogo. E un'assenza degna di nota — la guida ufficiale non ha alcuna sezione sui prompt negativi, il che significa che l'elenco delle "transizioni vietate" nel popolare template della community è un'invenzione della community, non una funzionalità documentata.

Quanto prendere sul serio il conflitto? In una discussione su Hugging Face nel repository H3, un membro della community ha pubblicato la struttura in stile timecode come guida e un altro professionista ha risposto seccamente che aveva usato una struttura simile, che era del tutto sbagliata, e che invece le persone avrebbero dovuto leggere il manuale fornito. Questa è una persona che contraddice un'altra, non una decisione di un maintainer. La nostra lettura delle prove: entrambi funzionano tramite l'API ospitata, perché Context-IR normalizza qualunque cosa tu invii; solo il formato documentato è affidabile direttamente con H3-Base. Se stai eseguendo pesi locali, segui il file nel repository. Se sei sull'API e un prompt con timecode ti dà buoni clip, è il preprocessor a fare quel lavoro per te, e non dovresti concludere che sia il formato a meritarselo.

Compilare un brief pigro nel dialetto di H3

Prendete il prompt di dodici parole di Willison come input — una puzzola color arcobaleno che salta sopra un tronco muschioso in un supermercato. Scritto nel modo documentato, diventa all'incirca: un [Shot 1] blocco che si apre nominando lo stile (live-action, a mano, illuminato da luci fluorescenti) e l'inquadratura (una corsia di supermercato, tronco coperto di muschio sul linoleum, scaffali che si allontanano), poi il soggetto e l'azione in ordine fisico — due passi felpati, un accovacciarsi, il balzo, l'atterraggio — con la camera come una lenta carrellata a bassa ampiezza che termina sul lato opposto del tronco; un overall_soundscape di artigli sul linoleum, lo striscio umido del tronco, un ronzio di refrigerazione e ruote di carrelli in lontananza; e una non_diegetic_music riga di una breve e leggera cue di corde pizzicate senza voci. Niente di tutto ciò è genio creativo. È la stessa idea, con le quattro cose che H3 richiede effettivamente presenti — ed è questa la differenza tra un room tone non richiesto e una colonna sonora che hai progettato tu.

Questo passaggio è meccanico, ripetitivo e uno spreco di tempo umano, ed è esattamente per questo che l'azienda ha rilasciato uno strumento dedicato, che è passato quasi inosservato. Il repository contiene una directory skills con nove skill per agenti, e la prima — h3-prompt-writing — fa esattamente questo: prende una richiesta e scrive un prompt H3 strutturato in tutte e cinque le modalità di generazione, completo delle sezioni soundscape e musica. Le altre otto sono ricette di genere (spot pubblicitario, corto animato 3D, spiegazione in papercraft, sottotitoli per video musicali, intro di gioco cooperativo, ibrido tra disegno a mano e live-action, e così via) che racchiudono lo stesso formato in un workflow.

Per eseguire quella skill serve un modello di testo, non un modello video, ed è qui che un router è davvero utile, non un semplice connettore. Il LLM dell'azienda stessa, MiniMax M3, è una scelta sensata per il compito ed è disponibile su OrcaRouter a $0,30 per milione di token in input e $1,20 per milione in output — prezzo di listino del provider, dato che lo inoltriamo con margine 0% — con una finestra di contesto da 1 milione di token e, in modo insolito, video come tipo di input accettato. Quest'ultimo dettaglio è ciò che lo rende adatto: puoi passargli la guida ufficiale dei prompt, il tuo brief e una clip di riferimento reale in un'unica chiamata, e ricevere indietro il [Shot N] blocco che lo descrive. Compilare un prompt costa una frazione di centesimo rispetto alla generazione video fatturata al secondo, quindi non c'è motivo di scriverli a mano. Due avvertenze oneste: La generazione video H3 di per sé non gira su OrcaRouter — le clip provengono dalla piattaforma dell'azienda, fal, o dalla tua GPU — e la fase di compilazione è una comodità, non una garanzia di qualità. Ciò che il router ti dà qui è che la metà testuale della pipeline sta dietro un'unica chiave con failover automatico, quindi un'interruzione del provider a metà batch non blocca una coda di rendering, e sostituire M3 con un modello diverso per confrontare i prompt compilati è un cambio di stringa, non un nuovo contratto.

How to Use MiniMax H3-3

L'audio è dove tutti perdono il primo giorno.

La modalità di guasto più ampiamente confermata nella prima settimana è quella che ha colpito Willison: lasciare il suono non specificato e H3 inventa qualcosa, male. Ha ottenuto un rumore simile al parlato da un prompt senza indicazioni audio. L'analisi di reverse engineering degli esempi ufficiali riporta la stessa classe di guasto in forma più lieve — ometti il blocco audio e il modello genera un suono ambientale non richiesto — e li inquadra come assenze piuttosto che errori, che è il modo giusto di pensare a un modello audio-video congiunto. Genera sempre una colonna sonora. La tua unica scelta è se specificarla.

Combinando le indicazioni della guida ufficiale sui prompt con ciò che la documentazione dei rivenditori e le recensioni segnalano come effettivamente funzionante:

Il dialogo è la cosa più difficile da ottenere. Limitare le battute a una o due frasi ogni cinque secondi di clip. Le battute troppo lunghe producono una recitazione affrettata, audio che va oltre l'ultimo fotogramma o un lip-sync forzato — un problema segnalato costantemente dai revisori.

Descrivi chi parla prima della battuta e l'interpretazione che la accompagna.Età, genere, timbro e accento alla prima apparizione secondo la guida ufficiale; note di interpretazione semplici e dirette (chiaramente, calorosamente, in modo piatto) piuttosto che elaborate indicazioni di recitazione, che secondo quanto riportato compromettono la sincronizzazione.

Collega ogni effetto a un evento visibile."Il 'pop' del tappo esattamente mentre il tappo vola" piuttosto che "suono: un pop". Le parole mentre, quando e poi sono ciò che veicola la sincronizzazione.

Definisci brevemente la musica per genere, tempo, atmosfera e strumentazione — mai per artista o canzone. Aggiungi "no vocals" quando l'immagine deve prevalere; è un modo documentato per mantenere il mix pulito.

Stratifica l'atmosfera in una sola proposizione.Pioggia sul vetro, un mormorio sommesso di conversazioni, il tintinnio occasionale di una tazza, jazz di sottofondo leggero — accumulati in un'unica frase anziché elencati.

Non ripetere il dialogo nella sezione soundscape. Un esplicito divieto nella guida ufficiale; le sezioni sono concepite per essere disgiunte, e ripetere una battuta è un modo per averla due volte.

Se una parola deve essere leggibile sullo schermo, scrivi la parola tra virgolette. I revisori riferiscono che le stringhe specificate vengono renderizzate correttamente, mentre le richieste vaghe ("elementi HUD", "un cartello") producono rumore a forma di lettere.

Dove l'audio offre davvero buoni risultati, secondo diversi recensori, è nel suono fisico concreto — effetti sonori e rumori legati a qualcosa di visibile — e nell'atmosfera. È più debole sulle richieste astratte o atmosferiche. Le scene con più parlanti richiedono spesso modifiche per ottenere l'ordine corretto degli interventi, e la qualità della pronuncia varia a seconda della lingua, quindi testate la lingua di destinazione su una clip usa e getta prima di affidarle un progetto. Diversi recensori notano anche il limite reale: l'audio è abbastanza buono per la distribuzione sui social e generalmente non abbastanza buono per essere pubblicato come mix broadcast o per annunci a pagamento senza sostituzioni. Niente di tutto ciò è una indicazione del fornitore; è ciò che riportano i professionisti.

Riferimenti: assegna a ogni file un lavoro.

Il sistema di riferimento di H3 è il suo elemento di differenziazione più forte e il punto in cui gli errori di configurazione sono più comuni. I limiti documentati, dalla documentazione dell'API della piattaforma: fino a 9 immagini, 3 clip video e 3 clip audio, con un massimo di 12 file in totale, con ogni video o audio di riferimento tra 2 e 15 secondi e il totale complessivo non superiore a 15 secondi. Il riferimento per il video richiede almeno un'immagine o un video; solo l'audio non è accettato.

La tecnica su cui convergono sia la guida di riferimento ufficiale che i resoconti della community è quella di taggare ogni input e assegnargli un compito. Fai riferimento ai tag nell'ordine esatto in cui i file sono stati allegati — <Picture 1>, <Video 1>, <Audio 1> — e poi indica nel prompt quale riferimento determina quale proprietà: identità, stile, movimento, inquadratura o voce. Gli esempi di prompt ufficiali iniziano esattamente così, dichiarando che l'immagine uno è il riferimento per l'atmosfera e lo stile generali e che l'immagine due è il personaggio principale. I professionisti riferiscono che l'assegnazione esplicita funziona molto meglio che caricare nove immagini e sperare.

Due dettagli che costano render alle persone:

<Picture 1> non è una mood board — è letteralmente il primo fotogramma a 0.000 secondi, e appartiene a [Shot 1]. Descrivi cosa contiene (stile, soggetti, composizione, punti di riferimento della scena) prima di descrivere l'azione che ne consegue. Trattalo come un fotogramma fisso che stai animando, non come un suggerimento.

Ci sono due checkpoint separati, e usare quello sbagliato fallisce silenziosamente. fl2va gestisce il text-to-video e il lavoro su primo/ultimo frame; ref2va gestisce il reference-to-video. Questo è l'errore ComfyUI più segnalato: il grafico R2V viene eseguito con il modello FL2VA ancora selezionato. Vale anche la pena sapere che un commentatore sull'annuncio di ComfyUI fa notare che il template R2V fornito espone solo due slot di riferimento immagine anche se il modello ne accetta nove — un limite del template, non del modello.

Sul lato hosted, altre due note pratiche dalla documentazione dei reseller: il parametro ratio è obbligatorio sugli endpoint ref2va e non può essere lasciato su "adaptive", e i job sovrapposti restituiscono un 429 per la concorrenza dei task invece di accodarsi — quindi esegui i batch in sequenza, oppure costruisci la tua coda. In locale, ref_image_size ha come default match, che è più veloce; max preserva il lato corto del riferimento fino a 2048 pixel e costa tempo.

Quanto costa realmente un'esecuzione locale in termini di tempo reale

Scaricare il repository ufficiale completo è di 498 GB, e il mirror ricompattato di ComfyUI è di 343 GB. Non hai bisogno di nessuno dei due per intero. I quattro file che il tutorial di ComfyUI elenca per text-to-video e image-to-video ammontano a circa 42,5 GB:

Modello di diffusioneminimax_h3_fl2va_pruned_int8_convrot.safetensors, 20.97 GB, in models/diffusion_models.

Encoder di testoqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors, 15,69 GB, in models/text_encoders.

Video VAEminimax_h3_video_vae_fp16.safetensors, 5.21 GB, in models/vae.

Audio VAEminimax_h3_audio_vae_fp32.safetensors, 0.61 GB, anche in models/vae.

Aggiunto per reference-to-videominimax_h3_ref2va_pruned_int8_convrot.safetensors, altri 20.97 GB.

Quei 42,5 GB non sono una cifra di VRAM — è spazio su disco, e i pezzi vengono trasmessi in streaming e scaricati. Il motivo per cui il modello riesce a stare sulle schede consumer è un trucco ingegneristico documentato da ComfyUI: circa il 40% dei parametri risiede nei rami di modulazione AdaLN, le cui uscite possono essere precalcolate e sostituite da tabelle di lookup funzionalmente equivalenti, portando il modello caricato da 33,12B a circa 20,11B senza, secondo ComfyUI, alcuna perdita di qualità. La piena precisione sarebbe di 123,6 GB. Esistono checkpoint int8 non potati (34,04 GB ciascuno) e versioni bf16 (66,28 GB ciascuno) se si sta facendo fine-tuning o si inseguono gli ultimi punti percentuali di fedeltà.

È necessario ComfyUI 0.30.0 o successivo, e viene fornito con tre template: T2V, I2V e R2V. La configurazione di base su cui tutte le guide e i manutentori convergono per una prima esecuzione è volutamente ridotta: 16:9 a 0,4 MP (864×480), 5 secondi, 20 passi, campionatore res_multistep con lo scheduler semplice, denoise 1.0, batch 1. Ottieni un singolo MP4 che contenga sia video che audio stereo prima di toccare risoluzione o durata. Una peculiarità aritmetica da tenere presente: le durate si agganciano a una griglia di fotogrammi 17k+5, quindi una richiesta di 5 secondi diventa 124 fotogrammi — circa 5,17 secondi a 24 fps — e una di 10 secondi arriva a 243 fotogrammi, ovvero 10,125 secondi. Le richieste nell'intervallo 5–15 secondi sono la zona più sicura.

How to Use MiniMax H3-4

Quanto costa in tempo reale, stando ai report della community (tutte esecuzioni singole, non controllate, su impostazioni diverse — il grafico sopra riporta ogni configurazione accanto alla propria barra): una RTX 3060 da 12 GB con 32 GB di RAM di sistema e un NVMe veloce ha completato la baseline 864×480 / 124 frame / 20 step in meno di nove minuti usando l'offload dinamico. Una RTX 4090 laptop da 16 GB con SageAttention abilitato ha eseguito 960×540, 5 secondi, 20 step in 182 secondi. Una build NVFP4 su una singola RTX 5090 ha prodotto una clip 864×480 da 243 frame (10.1 s) a 10 step in 175 secondi, con un picco di 26.9 GiB di VRAM e soli 31.7 GB di file su disco. Il riferimento del cookbook di SGLang — 1344×768, 124 frame, 50 step su due RTX 5090 con offload per layer — ha richiesto 559.67 secondi. E il percorso Apple Silicon, tramite la porta MLX non ufficiale, ha impiegato poco meno di 45 minuti per una singola clip.

Note pratiche tratte da quei rapporti:

La RAM di sistema e la velocità del disco sono elementi portanti, non opzionali.Su una scheda da 12 GB i file selezionati superano la VRAM per progettazione, quindi il percorso di offload passa attraverso la RAM e poi l'SSD. 32 GB di RAM compaiono in entrambi i report di successo a bassa VRAM. Non esiste alcun risultato verificato con 8 GB.

SageAttention è l'unico speedup gratuito — circa 2× secondo ComfyUI, meno se l'esecuzione è dominata dal traffico di offload. Installa la wheel corrispondente alla tua build esatta di PyTorch e CUDA, insieme a ComfyUI-KJNodes, quindi inserisci Patch Sage Attention KJ tra il loader UNET e il guider e impostalo su auto. Aspettati avvisi su alcuni layer H3 non in FP16/BF16; questo fallback è documentato e normale.

I passi sono negoziabili.Il benchmark 5090 ne ha eseguiti 10 e la baseline ComfyUI ne esegue 20, mentre la configurazione di riferimento SGLang ne usa 50. Nessuno ha pubblicato una curva qualità-per-step, quindi trova il tuo minimo prima di presumere di aver bisogno di 50.

Cambia una variabile alla volta in caso di OOM. La procedura di ripristino documentata prevede di tornare a 0.4 MP, 5 secondi, batch 1, e spostare una singola manopola per tentativo.

Audio silenzioso significa che il VAE audio non è collegato al nodo di uscita video. Un guasto ben distinto da un audio difettoso, e facile da fraintendere come un rifiuto del modello di generare suoni.

Apple Silicon non è ufficiale. Il percorso di Willison era PipeNetwork/minimax-h3-mlx, un port della comunità, eseguito tramite uv con un file di requisiti MLX. I materiali dell'azienda citano SGLang, vLLM, Diffusers e ComfyUI, con un tipico deployment di quattro GPU in BF16, e non dicono nulla su Metal o MPS. Tratta il supporto Mac come mantenuto dalla comunità.

Locale vs hosted, con i numeri

Dato che il modulo 2K e il preprocessore di prompt sono disponibili solo in cloud, non si tratta di un vero aut aut. Lo schema verso cui l'architettura ti spinge è: itera in locale a 768p, dove ogni tentativo costa elettricità e tre minuti, poi compra la rifinitura. Una tariffa al secondo va bene per la prova che tieni, ma è rovinosa per le quaranta che butti via.

Sul prezzo, fai attenzione, perché varia di circa 2× a seconda del fornitore e il post del blog del fornitore non cita alcuna cifra in dollari — solo che il 2K costa meno di un terzo dei modelli mainstream e il 768p meno della metà del prezzo del 720p dei concorrenti. Ciò che è concretamente pubblicato: fal, attualmente l'unico provider di inferenza elencato nel repository Hugging Face, addebita $0,16 al secondo a 768p e $0,26 al secondo a 2K. I tracker secondari riportano un prezzo di listino dell'azienda notevolmente inferiore — circa $0,09–$0,10 al secondo a 768p e $0,13–$0,14 al secondo a 2K — e non concordano tra loro al centesimo, quindi considerali indicativi e controlla la pagina dei prezzi della piattaforma prima di pianificare un budget. Considera anche che un video di riferimento viene fatturato in base alla propria durata oltre che all'output generato.

Proviamo con un numero reale. Cento clip buone da otto secondi l'una fanno 800 secondi generati: circa 112 $ a una tariffa 2K di 0,14 $, all'incirca 208 $ con fal a 0,26 $, e intorno ai 76 $ se consegni a 768p al prezzo di listino più basso. I quaranta scarti per ogni clip tenuta decidono il conto, e sono quelli che conviene generare in locale. Questo è anche il motivo per cui il prezzo che stai confrontando deve restare onesto — su OrcaRouter, il lato testuale di quella pipeline viene inoltrato al prezzo di listino del fornitore con un margine dello 0%, così quando un fornitore taglia un prezzo, la modifica è attiva lo stesso giorno, invece che dopo un ricalcolo del margine. La generazione video, ripeto, non è roba nostra; il punto è solo che la fase di compilazione non dovrebbe essere la voce a cui devi pensare.

Leggi la licenza prima di creare un prodotto basato su questo

Questa è la parte che la maggior parte delle guide "come si usa" tralascia, e per molti lettori è l'unica parte che fa cambiare idea. Abbiamo letto direttamente il file LICENSE nel repository. I pesi sono distribuiti sotto la H3 Community License Agreement, non una licenza open-source, e contiene termini abbastanza insoliti da citare nella sostanza:

Territorio. La licenza definisce il suo "Territorio applicabile" come mondiale esclusi l'Unione Europea, il Regno Unito, la Repubblica di Corea e gli Stati Uniti d'America. A una semplice lettura, ciò esclude gran parte delle persone che attualmente pubblicano risultati di generazione locale — e la restrizione è formulata in modo da applicarsi agli output, non solo ai pesi.

Attribuzione. L'uso commerciale richiede la visualizzazione di "H3" sull'interfaccia del prodotto; la licenza incoraggia inoltre un avviso "Powered by H3".

Soglia di fatturato. Le organizzazioni che guadagnano oltre 20 milioni di dollari all'anno da prodotti o servizi basati su di esso devono ottenere una separata autorizzazione scritta dalla società.

Nessuna distillazione. Non è consentito utilizzare H3 o i suoi output per migliorare qualsiasi altro modello di IA, ad eccezione dei derivati di H3. Ciò esclude la classica strategia dei dati sintetici.

Legge applicabile. Hong Kong SAR, con giurisdizione esclusiva dei tribunali di Hong Kong.

Un componente genuinamente aperto. Il text encoder Qwen3-VL-32B è Apache 2.0; le restrizioni sopra indicate si applicano ai pesi H3.

Non siamo i tuoi avvocati e questo non è un parere legale — leggi la licenza e il documento di domande e risposte che l'azienda distribuisce insieme ad essa, e se stai sviluppando un'attività commerciale in un territorio escluso, rivolgiti a un consulente piuttosto che all'interpretazione di un blog. Il bivio pratico: l'API ospitata è una transazione diversa con termini diversi dalla licenza comunitaria sui pesi, quindi se la licenza locale non va bene per te, la via dell'API potrebbe essere comunque disponibile. Controlla i termini di qualunque piattaforma da cui acquisti.

Un piano di test per la prima settimana

Cinque esecuzioni, in questo ordine, bastano per sapere se H3 fa parte della tua pipeline:

Run 1 — verifica dell'infrastruttura. Template T2V, 864×480, 5 secondi, 20 step, res_multistep/simple. Il criterio di successo è un MP4 con audio stereo, non un buon clip.

Esecuzione 2 — dimostra che il formato conta. Stesso soggetto due volte: una volta come descrizione libera su una riga, una volta scritto come [Shot 1] più overall_soundscape più non_diegetic_music. Se la seconda non è chiaramente migliore rispetto a H3-Base, c'è qualcosa di sbagliato nella tua configurazione.

Run 3 — una battuta di dialogo. Un solo parlante, una frase, interpretazione descritta, cinque secondi. Questo è il modo più rapido per capire se l'audio è abbastanza buono per il tuo utilizzo e come viene pronunciata la tua lingua di destinazione.

Run 4 — disciplina di riferimento. R2V con il ref2va checkpoint, due o tre riferimenti, ciascuno esplicitamente taggato e con un compito assegnato, con <Picture 1> descritto come il primo fotogramma reale. Poi rompilo deliberatamente: attacca gli stessi riferimenti senza assegnazioni e confronta.

Run 5 — il traguardo. Porta il tuo miglior prompt locale 768p all'API ospitata a 2K e vedi cosa aggiungono Context-IR e il pass di rigenerazione. Questo delta è ciò che il prezzo al secondo compra, ed è l'unico modo per prezzare onestamente il workflow ibrido.

Domande frequenti

Posso ottenere 2K dai pesi locali?

No. Il pacchetto open è H3-Base, la cui tela nativa ha un lato corto di 768 pixel (fino a 768×1344). La 2K proviene da H3-Regenerate-2K, un modulo separato di rigenerazione in-context che l'azienda ha mantenuto sull'API ospitata. Puoi fare upscale localmente con qualsiasi upscaler generico, ma è un'operazione diversa dalla passata di rigenerazione di H3 e non darà lo stesso risultato.

Perché lo stesso prompt si comporta in modo diverso sull'API e in ComfyUI?

Perché l'API esegue prima H3-Context-IR. Legge il tuo testo e i tuoi riferimenti, valuta come sono correlati e passa a H3-Base un'istruzione strutturata e arricchita. In locale non esiste questa fase: H3-Base riceve le tue parole grezze. Un prompt vago che tramite l'API produce un clip decente viene salvato da un preprocessore che non hai installato; ecco perché il formato di prompt documentato è molto più importante per gli utenti locali che per quelli dell'API.

Il template del timecode [0s-2s] è sbagliato?

Non è ciò che richiede la guida in dotazione. La guida dell'azienda VIDEO_PROMPT_WRITING_GUIDE_base_en.md organizza per blocchi [Shot N], non assegna timestamp allo Shot 1 ed esprime i tagli successivi come tempi assoluti ("A 00:03.500, la camera taglia su…"). Inoltre non ha una sezione per i prompt negativi, quindi l'elenco delle "transizioni vietate" nel template popolare è un'aggiunta della community. Ciò detto, gli addetti ai lavori segnalano buoni risultati API con il formato timecode — verosimilmente perché Context-IR lo normalizza. La nostra lettura: usare il formato documentato con i pesi locali, e non attribuire ai timecode tra parentesi i risultati API che potrebbero essere merito del preprocessore.

Un'azienda negli Stati Uniti o nell'UE può utilizzare i pesi aperti commercialmente?

Il testo della licenza che abbiamo letto esclude l'UE, il Regno Unito, la Corea del Sud e gli Stati Uniti dal proprio Territorio Applicabile, e l'esclusione è formulata per coprire sia gli output sia i pesi. Questo rappresenta un serio ostacolo per una distribuzione commerciale in quei luoghi, ed è una questione legale più che tecnica — leggi tu stesso la licenza e il file delle FAQ e chiedi un parere. L'API ospitata è disciplinata dai termini della piattaforma stessa, non dalla licenza comunitaria, quindi vale la pena valutarla separatamente piuttosto che assumere che sia soggetta a restrizioni equivalenti.

Cosa controllare prima del commit

H3 è un valore insolitamente buono per una forma specifica di lavoro: clip brevi, con sound design, coerenti con i riferimenti, per le quali sei disposto a scrivere una vera lista di inquadrature. È insolitamente esigente su come chiedi. Le tre cose che vale la pena verificare di persona, perché sono quelle che si muovono più velocemente: se accanto a fal compaiono più provider di inferenza (che è ciò che farà scendere il prezzo al secondo), se il template ComfyUI R2V supera i due slot di riferimento fino ai nove del modello, e se l'abitudine del timecode della community o il formato documentato di shot-block vincerà quando qualcuno eseguirà un confronto controllato con i pesi locali. Nessuno ha ancora pubblicato quel confronto. Fino ad allora, il manuale nel repository è la scommessa migliore — e si trova nello stesso download su cui hai già speso 42 GB.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube