Como Usar o MiniMax H3-1
Guides & Insights

Como Usar o MiniMax H3: Prompts, Execuções Locais e Áudio Que Não É Lixo

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 4 de agosto, Simon Willison baixou cerca de 115 GB de pesos, direcionou um port MLX não oficial do MiniMax H3 para seu MacBook Pro M5 Max e pediu um gambá com cores de arco-íris saltando sobre um tronco coberto de musgo em um supermercado. Pouco menos de 45 minutos depois, ele tinha um clipe que descreveu como genuinamente impressionante — com uma trilha de áudio que ele descreveu como estranha, um lixo que parecia fala. Seu próprio diagnóstico foi a parte útil: ele não tinha dado nenhuma direção de áudio ao modelo e não tinha lido o guia de prompts antes. Esse é o resumo mais curto possível do que é começar a usar o H3, também vendido como Hailuo 3.0. A imagem vem mais ou menos de graça. Todo o resto — o som, o timing dos planos, o 2K, o personagem que tem que sobreviver a quatro planos seguidos — você precisa pedir explicitamente, em um formato mais rígido do que quase qualquer outro modelo de vídeo em uso atualmente.

Este é um guia de utilização, não uma cobertura de lançamento. Três camadas de fontes percorrem-no, e estão sempre rotuladas: a documentação própria da empresa (o model card, os dois guias de escrita de prompts incluídos no repositório, a documentação da API da plataforma); descobertas da comunidade de pessoas que de facto o executaram — os mantenedores do ComfyUI, avaliadores independentes, documentação de revendedores e tópicos de discussão do Hugging Face, todos datados entre 31 de julho e 5 de agosto de 2026; e um pequeno número de casos em que nós próprios lemos um arquivo primário e o afirmamos. Os números da comunidade são relatos individuais em hardware não controlado, salvo indicação em contrário. Quando os profissionais discordam entre si, o desacordo é relatado em vez de resolvido.

Antes de qualquer coisa: você provavelmente não está executando o modelo inteiro

A maior parte da confusão na primeira semana do H3 remonta a um fato estrutural que o texto de marketing obscurece. H3 não é um modelo único. De acordo com sua ficha do modelo, é um sistema de três partes, e apenas a parte do meio foi disponibilizada como código aberto:

H3-Context-IR — um pré-processador multimodal de instruções. Ele lê seu texto, imagens, áudio e vídeo, raciocina sobre como eles se relacionam e emite uma representação estruturada e semanticamente enriquecida do que você pediu. Somente API hospedada. Ele é exposto como seu próprio tipo de tarefa que retorna um prompt enriquecido e nenhum vídeo.

H3-Base — o modelo de geração de 33B parâmetros que realmente produz quadros e som. Esta é a parte de pesos abertos.

H3-Regenerate-2K — uma passagem de regeneração em contexto que leva o resultado 768p até 2K. Apenas API hospedada.

Duas consequências decorrem imediatamente, e elas determinam todo o seu fluxo de trabalho. Primeiro, a geração local tem um teto de 768p. A tela nativa do H3 tem borda curta de 768 pixels, limitada a 768×1344 — cerca de 1344×768 para 16:9. Se a saída do seu ComfyUI não for 2K, nada está quebrado; o pacote que você baixou é o H3-Base, e o módulo de upscaling não está nele. Segundo, a API hospedada corrigirá um prompt mal elaborado, e a sua instalação local não. Tudo o que o Context-IR faz em uma chamada de API paga — inferir a estrutura, resolver o que cada referência significa, preencher as partes que você deixou vagas — é uma etapa que você agora executa manualmente, ou com outro modelo, antes que o H3-Base sequer veja suas palavras. Essa única assimetria explica a maioria dos relatos de "o mesmo prompt funciona no Hailuo, mas parece quebrado no ComfyUI."

How to Use MiniMax H3-2

Vale notar no próprio repositório: os pesos carregam uma minimax-h3-community-license-agreement tag em vez de Apache ou MIT (mais sobre isso abaixo, porque é a parte que decide se você pode distribuir ou não), o modelo está listado com 33B parâmetros em F32/BF16 e, até o momento, exatamente um provedor de inferência — fal — está listado como servindo-o. Vinte e três fine-tunes, vinte quantizações e trinta e um Spaces já existem sobre ele, o que é um bom sinal de quão rápido a comunidade se mobilizou.

O formato do prompt: blocos de cena, não timecodes.

É aqui que a comunidade e a documentação estão abertamente em conflito, e isso importa mais do que qualquer outra coisa neste artigo.

O modelo que se espalhou mais rápido — pelo Reddit, e depois em vários guias publicados — divide o clipe em intervalos de timecode: [0s-2s], [2s-5s], e assim por diante, seguido por uma estrutura de seis blocos: contrato de estilo, cronograma, câmera, áudio, texto por extenso e uma lista de negativos. Ele foi obtido por engenharia reversa a partir da leitura dos 45 exemplos de prompts que a empresa disponibilizou, e não é absurdo: esses exemplos realmente são listas de planos com uma folha de dicas de som anexada, com comprimento mediano em torno de 130 caracteres chineses e os mais longos chegando a 657 e 858 caracteres.

Mas o próprio VIDEO_PROMPT_WRITING_GUIDE_base_en.md da empresa, localizado na pasta docs do repositório, prescreve algo diferente. Ele organiza por bloco de planos, não por intervalo de tempo. Nós o lemos diretamente; a estrutura que ele pede é:

Instrução — regras de alinhamento de imagem, usadas para os modos de keyframe (I2VA, FL2VA, L2VA) e omitidas para texto-para-vídeo puro.

integrated_multimodal_description — o corpo principal, dividido em [Shot 1], [Shot 2], e assim por diante.

paisagem sonora geral — de uma a quatro frases de som diegético.

música não diegética — uma a três frases sobre a trilha sonora.

Dentro disso, as convenções são específicas o suficiente para serem verificáveis. [Shot 1] não recebe timestamp nenhum — os planos seguintes abrem com um corte absoluto, formulado como "At 00:03.500, the camera cuts to…". O movimento de câmera é descrito como tipo de movimento mais amplitude mais velocidade, integrado ao inglês natural em vez de empilhado como rótulos: um push-in lento de pequena amplitude, não camera: dolly-in, slow. Os movimentos disponíveis são o conjunto familiar — zoom, pan, tilt, tracking, arc, POV e shake em variantes leves ou fortes. O diálogo é envolvido em tags: <d>[English] Get in the car.</d>, com pontuação preservada exatamente e nunca traduzida ou parafraseada. Os falantes recebem IDs estáveis — (S1), (S2) e (S1,S2) para uma fala conjunta — com idade, gênero, timbre e sotaque descritos na primeira aparição. Voiceover é marcado como uma fala fora da tela, com uma nota explícita de que os lábios permanecem fechados, que é assim que se evita que o modelo sincronize os lábios com a narração sobre um rosto. Conversas com corte paralelo usam um <scenetrans> marcador mais uma declaração de continuidade.

As proibições explícitas do guia são tão informativas quanto suas regras: não coloque timestamp no primeiro trecho, não repita diálogo, canto ou música na tela dentro de overall_soundscape, não use palavras abstratas de clima em non_diegetic_music, e nunca reescreva uma fala de diálogo. E uma ausência notável — o guia oficial não tem nenhuma seção de prompt negativo, o que significa que a lista de "transições proibidas" no template popular da comunidade é uma invenção da comunidade, não um recurso documentado.

Qual a seriedade do conflito? Em uma discussão no Hugging Face no repositório H3, um membro da comunidade publicou a estrutura em estilo de timecode como guia, e outro profissional respondeu de forma direta que já havia usado uma estrutura semelhante, que estava tudo errado, e que as pessoas deveriam ler o manual incluído. Isso é uma pessoa contradizendo outra, não uma decisão do mantenedor. Nossa leitura das evidências: ambos funcionam através da API hospedada, porque o Context-IR normaliza tudo o que você envia; somente o formato documentado é confiável diretamente contra o H3-Base. Se você está executando pesos locais, siga o arquivo no repositório. Se você está na API e um prompt de timecode está gerando bons clipes, o pré-processador está fazendo esse trabalho por você, e você não deve concluir que o formato foi o responsável.

Compilando um resumo preguiçoso para o dialeto do H3.

Pegue o prompt de doze palavras de Willison como entrada — um gambá colorido de arco-íris saltando sobre um tronco coberto de musgo em um supermercado. Escrito da forma documentada, isso se torna aproximadamente: um [Shot 1] bloco que começa nomeando o estilo (live-action, câmera na mão, luz fluorescente) e o enquadramento (um corredor de supermercado, tronco coberto de musgo atravessando o linóleo, prateleiras em perspectiva), depois o sujeito e a ação em ordem física — dois passos de preparação, um agachamento, o salto, a aterrissagem — com a câmera como um movimento de travelling lento e de baixa amplitude que termina no lado oposto do tronco; uma paisagem_sonora_geral de garras no linóleo, o roçar úmido do tronco, o zumbido da refrigeração e rodas de carrinho distantes; e uma música_não_diegética linha de uma deixa musical curta, leve, com cordas dedilhadas e sem vocais. Nada aí é gênio criativo. É a mesma ideia, com as quatro coisas que o H3 pede de fato fornecidas — e é a diferença entre um tom de ambiente não solicitado e uma trilha sonora que você projetou.

Este passo é mecânico, repetitivo e um mau uso de um humano, exatamente por isso a empresa lançou uma ferramenta para isso que quase nenhuma cobertura mencionou. O repositório contém um diretório de habilidades com nove competências de agente, e a primeira — h3-prompt-writing — faz precisamente isto: recebe uma solicitação e escreve um prompt H3 estruturado em todos os cinco modos de geração, completo com as seções de paisagem sonora e música. As outras oito são receitas de gênero (anúncio de produto, curta animado em 3D, vídeo explicativo em papercraft, legendas de videoclipe, intro de jogo cooperativo, híbrido de desenho à mão com live-action, e assim por diante) que incorporam o mesmo formato em um fluxo de trabalho.

Executar essa habilidade exige um modelo de texto, não um modelo de vídeo, e é aqui que um roteador é genuinamente útil em vez de um plugue. o LLM da própria empresa, MiniMax M3, é uma escolha sensata para a tarefa e está no OrcaRouter a US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de saída — preço de tabela do provedor, já que o repassamos com margem de 0% — com uma janela de contexto de 1 milhão de tokens e, inusitadamente, vídeo como tipo de entrada aceito. Esse último detalhe é o que o torna adequado: você pode entregar a ele o guia oficial de prompts, seu briefing e um clipe de referência real em uma única chamada, e receber de volta o [Shot N] — o bloco que o descreve. Compilar um prompt custa uma fração de centavo em comparação com a geração de vídeo cobrada por segundo, então não há razão para escrevê-los à mão. Duas ressalvas honestas: a geração de vídeo H3 em si não roda no OrcaRouter — os clipes vêm da plataforma da empresa, da fal ou da sua própria GPU — e a etapa de compilação é uma conveniência, não uma garantia de qualidade. O que o roteador oferece aqui é que a metade de texto do pipeline fica atrás de uma única chave com failover automático, então uma interrupção do provedor no meio do lote não deixa uma fila de renderização presa, e trocar o M3 por um modelo diferente para comparar prompts compilados é uma mudança de string, em vez de um novo contrato.

How to Use MiniMax H3-3

É no áudio que todos se perdem no primeiro dia.

O modo de falha mais corroborado na primeira semana é aquele que Willison encontrou: deixar o som não especificado e o H3 inventa algo, mal. Ele obteve ruído semelhante a fala a partir de um prompt sem direção de áudio. A análise de engenharia reversa dos exemplos oficiais relata a mesma classe de falha em forma mais branda — omita o bloco de áudio e o modelo produz um tom de ambiente não solicitado — e enquadra essas ocorrências como ausências, em vez de erros, que é a maneira certa de pensar sobre um modelo conjunto de áudio e vídeo. Ele está sempre gerando uma trilha sonora. Sua única escolha é se você a especifica.

Reunindo as orientações do guia oficial de prompts com o que a documentação de revendedores e revisores relatam como realmente funcionando:

Diálogo é a coisa mais difícil de se pedir. Mantenha as falas em uma ou duas frases a cada cinco segundos de clipe. Falas longas demais resultam em entrega apressada, áudio que ultrapassa o último quadro ou sincronização labial forçada — relatado de forma consistente entre os revisores.

Descreva o locutor antes da fala e a entrega junto com ela. Idade, gênero, timbre e sotaque na primeira aparição, conforme o guia oficial; notas de entrega simples e diretas (claramente, calorosamente, de forma monótona) em vez de direções de interpretação elaboradas, que, segundo relatos, prejudicam a sincronização.

Vincule cada efeito a um evento visível. "Um estalo de rolha exatamente enquanto a rolha voa" em vez de "som: um estalo". As palavras enquanto, quando e então são o que carregam a sincronização.

Descreva brevemente a música por gênero, andamento, clima e instrumentação — nunca por artista ou canção. Adicione "no vocals" quando a imagem deve liderar; é uma forma documentada de manter a mixagem limpa.

Empilhe a ambientação em uma única oração. Chuva no vidro, um murmúrio baixo de conversa, o tilintar ocasional de xícaras, jazz suave ao fundo — empilhados em uma única frase em vez de listados.

Não repita o diálogo na seção de soundscape. Um "não" explícito no guia oficial; as seções devem ser disjuntas, e repetir uma fala ali é uma forma de obtê-la duas vezes.

Se uma palavra precisar ser legível na tela, digite a palavra entre aspas. Revisores relatam que strings especificadas são renderizadas com clareza, enquanto solicitações vagas ("elementos de HUD", "uma placa") retornam como ruído em forma de letras.

Onde o áudio realmente entrega, segundo vários avaliadores, é no som físico concreto — foley e efeitos ligados a algo visível — e na ambiência. Ele é mais fraco em pedidos abstratos ou atmosféricos. Cenas com vários falantes frequentemente precisam de edição para acertar a ordem dos falantes, e a qualidade da pronúncia varia conforme o idioma, então teste seu idioma alvo em um clipe descartável antes de comprometer um projeto com ele. Vários avaliadores também observam o teto honesto: o som é bom o suficiente para distribuição em redes sociais e, em geral, não é bom o suficiente para ser lançado como mix de transmissão ou anúncio pago sem substituição. Nada disso é orientação do fornecedor; é o que os profissionais relatam.

Referências: dê a cada arquivo uma tarefa.

O sistema de referência do H3 é seu diferencial mais forte e o lugar onde erros de configuração são mais comuns. Os limites documentados na documentação da API da plataforma: até 9 imagens, 3 clipes de vídeo e 3 clipes de áudio, limitados a 12 arquivos no total, com cada vídeo ou áudio de referência entre 2 e 15 segundos e o total combinado não excedendo 15 segundos. Referência para vídeo exige pelo menos uma imagem ou vídeo; apenas áudio não é aceito.

A técnica em que tanto o guia de referência oficial quanto os relatos da comunidade convergem é marcar cada entrada com uma tag e atribuir-lhe uma função. Referencie pela tag na ordem exata em que os arquivos foram anexados — <Picture 1>, <Video 1>, <Audio 1> — e então indique no prompt qual referência determina qual propriedade: identidade, estilo, movimento, câmera ou voz. Os prompts de exemplo oficiais começam exatamente assim, declarando que a imagem um é a referência geral de clima e estilo e que a imagem dois é o personagem principal. Praticantes relatam que a atribuição explícita funciona substancialmente melhor do que despejar nove imagens e esperar.

Dois detalhes que custam renders às pessoas:

<Picture 1> não é um mood board — é o primeiro quadro literal aos 0.000 segundos, e pertence ao [Shot 1]. Descreva o que há nele (estilo, assuntos, composição, âncoras de cena) antes de descrever a ação que se segue a partir dele. Trate-o como um still que você está animando, não como uma dica.

Existem dois checkpoints separados, e usar o errado falha silenciosamente. fl2va lida com texto-para-vídeo e trabalho de primeiro/último quadro; ref2va lida com referência-para-vídeo. Este é o erro mais relatado do ComfyUI: o grafo R2V roda com o modelo FL2VA ainda selecionado. Também vale saber que um comentarista no anúncio do ComfyUI aponta que o template R2V fornecido expõe apenas dois slots de referência de imagem, embora o modelo aceite nove — uma limitação do template, não do modelo.

No lado hospedado, mais duas notas práticas da documentação de revendedores: o ratio é um parâmetro obrigatório nos endpoints ref2va e não pode ser deixado como "adaptive", e jobs sobrepostos retornam 429 para concorrência de tarefas em vez de enfileiramento — então processe em lote sequencialmente ou crie sua própria fila. Localmente, ref_image_size tem como padrão match, que é mais rápido; max preserva uma borda curta de até 2048 pixels na referência e custa tempo.

O que uma execução local realmente custa em tempo de relógio

Baixar o repositório oficial completo tem 498 GB, e o espelho reempacotado do ComfyUI tem 343 GB. Você não precisa de nenhum deles por completo. Os quatro arquivos que o próprio tutorial do ComfyUI lista para texto-para-vídeo e imagem-para-vídeo totalizam cerca de 42,5 GB:

Modelo de difusãominimax_h3_fl2va_pruned_int8_convrot.safetensors, 20.97 GB, em models/diffusion_models.

Codificador de textoqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors, 15,69 GB, para models/text_encoders.

VAE de vídeominimax_h3_video_vae_fp16.safetensors, 5,21 GB, em models/vae.

Audio VAEminimax_h3_audio_vae_fp32.safetensors, 0,61 GB, também em models/vae.

Adicionar para referência de vídeominimax_h3_ref2va_pruned_int8_convrot.safetensors, mais 20,97 GB.

Esses 42,5 GB não são um valor de VRAM — é espaço em disco, e as partes são transmitidas e descarregadas (offloaded). O motivo de o modelo caber em GPUs de consumo é um truque de engenharia que a ComfyUI documentou: cerca de 40% dos parâmetros estão em ramos de modulação AdaLN, cujas saídas podem ser pré-computadas e substituídas por tabelas de consulta (lookup tables) funcionalmente equivalentes, reduzindo o modelo carregado de 33,12 bilhões para cerca de 20,11 bilhões de parâmetros, sem perda de qualidade, segundo a ComfyUI. Em precisão total, seriam 123,6 GB. Existem checkpoints int8 sem poda (34,04 GB cada) e versões bf16 (66,28 GB cada), caso você esteja fazendo fine-tuning ou em busca dos últimos percentuais de fidelidade.

É necessário o ComfyUI 0.30.0 ou posterior, e ele inclui três modelos: T2V, I2V e R2V. A configuração básica em que todos os guias e mantenedores convergem para uma primeira execução é propositalmente pequena: 16:9 a 0,4 MP (864×480), 5 segundos, 20 passos, amostrador res_multistep com o agendador simple, denoise 1.0, lote 1. Obtenha um MP4 de saída que contenha tanto vídeo quanto áudio estéreo antes de mexer na resolução ou na duração. Uma peculiaridade aritmética a se esperar: as durações se ajustam a uma grade de quadros 17k+5, então uma solicitação de 5 segundos vira 124 quadros — cerca de 5,17 segundos a 24 fps — e uma de 10 segundos chega a 243 quadros, ou 10,125 segundos. Solicitações na faixa de 5 a 15 segundos são a zona mais segura.

How to Use MiniMax H3-4

O que isso custa em tempo real, de acordo com relatos da comunidade (todas execuções únicas, não controladas, em configurações diferentes — o gráfico acima mostra cada configuração ao lado de sua barra): uma RTX 3060 de 12 GB com 32 GB de RAM do sistema e um NVMe rápido completou a linha de base de 864×480 / 124 quadros / 20 passos em menos de nove minutos usando offload dinâmico. Um laptop RTX 4090 de 16 GB com SageAttention ativado fez 960×540, 5 segundos, 20 passos em 182 segundos. Uma compilação NVFP4 em uma única RTX 5090 produziu um clipe de 864×480 de 243 quadros (10,1 s) em 10 passos em 175 segundos, com pico de 26,9 GiB de VRAM e apenas 31,7 GB de arquivos em disco. A referência do cookbook do próprio SGLang — 1344×768, 124 quadros, 50 passos em duas RTX 5090s com offload por camadas — levou 559,67 segundos. E o caminho Apple Silicon, por meio do port não oficial do MLX, levou pouco menos de 45 minutos para um único clipe.

Notas práticas destiladas desses relatórios:

A RAM do sistema e a velocidade do disco são essenciais, não opcionais. Em uma placa de 12 GB, os arquivos selecionados excedem a VRAM de propósito, então o caminho de offload passa pela RAM e depois pelo SSD. 32 GB de RAM aparecem em ambos os relatos bem-sucedidos de baixa VRAM. Não existe nenhum resultado verificado de 8 GB.

SageAttention é o único speedup gratuito — aproximadamente 2× no ComfyUI, menos se sua execução for dominada por tráfego de offload. Instale o wheel correspondente à sua build exata de PyTorch e CUDA, além do ComfyUI-KJNodes, e insira Patch Sage Attention KJ entre o carregador UNET e o guider, e defina-o para automático. Espere avisos de que algumas camadas H3 não são FP16/BF16; esse fallback é documentado e normal.

Passos são negociáveis.O benchmark 5090 rodou 10 e a linha de base do ComfyUI roda 20, enquanto a configuração de referência do SGLang usa 50. Ninguém publicou uma curva de qualidade por passo, então encontre seu próprio mínimo antes de presumir que você precisa de 50.

Altere uma variável por vez para sair do OOM. A recuperação documentada é voltar para 0,4 MP, 5 segundos, lote 1, e mover um único controle por tentativa.

Áudio silencioso significa que o VAE de áudio não está conectado ao nó de saída de vídeo. É uma falha distinta de áudio ruim, e fácil de confundir com o modelo se recusando a gerar som.

Apple Silicon não é oficial. O caminho de Willison foi PipeNetwork/minimax-h3-mlx, um port da comunidade, executado via uv com um arquivo de requisitos MLX. Os materiais da própria empresa citam SGLang, vLLM, Diffusers e ComfyUI, com uma implantação típica de quatro GPUs em BF16, e não dizem nada sobre Metal ou MPS. Trate o suporte ao Mac como mantido pela comunidade.

Local versus hospedado, com os números

Como o módulo 2K e o pré-processador de prompts são apenas hospedados, isto não é realmente uma questão de um ou outro. O padrão para o qual a arquitetura o leva é: iterar localmente em 768p, onde cada tentativa custa eletricidade e três minutos, e depois comprar a finalização. Uma cobrança por segundo é aceitável para a tentativa que você aproveita e desastrosa para as quarenta que você descarta.

Em relação ao preço, tenha cuidado, porque ele varia cerca de 2× conforme o fornecedor e o próprio post do blog do fornecedor não cita nenhum valor em dólar — apenas que o 2K custa menos de um terço do preço dos modelos convencionais e o 768p menos da metade do preço do 720p dos concorrentes. O que está concretamente publicado: fal, atualmente o único provedor de inferência listado no repositório do Hugging Face, cobra US$ 0,16 por segundo em 768p e US$ 0,26 por segundo em 2K. Rastreadores secundários relatam que o preço de tabela da própria empresa é substancialmente menor — em torno de US$ 0,09–US$ 0,10 por segundo em 768p e US$ 0,13–US$ 0,14 por segundo em 2K — e eles não concordam entre si ao centavo, portanto trate esses valores como indicativos e consulte a página de preços da plataforma antes de modelar um orçamento. Além disso, inclua no orçamento o fato de que um vídeo de referência é cobrado por sua própria duração, além da saída gerada.

Rode com um número real. Cem clipes aprovados de oito segundos cada um equivalem a 800 segundos gerados: cerca de US$ 112 a uma taxa de US$ 0,14 em 2K, aproximadamente US$ 208 à taxa de US$ 0,26 da fal, e por volta de US$ 76 se você entregar em 768p pelo preço de tabela mais baixo. Os quarenta rejeitados por clipe aprovado são o que decide a fatura, e são esses que devem ser gerados localmente. Esta é também a razão para manter honesto o preço que você está comparando — no OrcaRouter, o lado de texto desse pipeline é repassado ao preço de tabela do provedor com 0% de margem; então, quando um fornecedor reduz um preço, ele fica ativo no mesmo dia, em vez de após um recálculo de margem. A geração de vídeo, novamente, não é nossa; o ponto é apenas que a etapa de compilação não deveria ser o item da fatura com o qual você precisa se preocupar.

Leia a licença antes de construir um produto sobre isto

Esta é a parte que a maioria dos guias de "como usar" pula, e para muitos leitores é a única parte que muda uma decisão. Lemos o arquivo LICENSE diretamente no repositório. Os pesos são distribuídos sob a H3 Community License Agreement, que não é uma licença de código aberto, e contém termos incomuns o suficiente para citar em substância:

Território. A licença define seu "Território Aplicável" como mundial excluindo a União Europeia, o Reino Unido, a República da Coreia e os Estados Unidos da América. Em termos simples, isso exclui uma grande parcela das pessoas que atualmente publicam resultados de geração local — e a restrição é redigida para alcançar os resultados, não apenas os pesos.

Atribuição. O uso comercial exige a exibição de "H3" na interface do produto; a licença também incentiva um aviso "Powered by H3".

Limite de receita. Organizações que ganham mais de 20 milhões de dólares por ano com produtos ou serviços construídos com base nele devem obter autorização escrita separada da empresa.

Sem destilação. Você não pode usar H3 ou suas saídas para melhorar qualquer outro modelo de IA, exceto derivados do H3. Isso exclui a prática padrão de dados sintéticos.

Lei aplicável. RAE de Hong Kong, com jurisdição exclusiva nos tribunais de Hong Kong.

Um componente genuinamente aberto. O codificador de texto Qwen3-VL-32B é Apache 2.0; as restrições acima se aplicam aos pesos H3.

Não somos seus advogados e isto não é aconselhamento jurídico — leia a licença e o documento de perguntas e respostas que a empresa distribui junto com ela e, se você estiver desenvolvendo comercialmente em um território excluído, consulte um advogado em vez de confiar na leitura de um blog. Na prática, a divisão é: a API hospedada é uma transação diferente, com termos diferentes da licença comunitária para os pesos; portanto, se a licença local não funcionar para você, o caminho da API ainda pode estar disponível. Verifique os termos da plataforma da qual você comprar.

Um plano de testes da primeira semana

Cinco execuções, nesta ordem, bastam para saber se o H3 pertence ao seu pipeline:

Execução 1 — testar o encanamento. Modelo T2V, 864×480, 5 segundos, 20 passos, res_multistep/simple. O critério de sucesso é um MP4 com áudio estéreo, não um bom clipe.

Execução 2 — prove que o formato importa. O mesmo assunto duas vezes: uma vez como uma descrição solta de uma linha, uma vez escrito como [Shot 1] mais overall_soundscape mais non_diegetic_music. Se a segunda não for claramente melhor em relação à H3-Base, algo na sua configuração está errado.

Tomada 3 — uma linha de diálogo. Um locutor, uma frase, entrega descrita, cinco segundos. É a forma mais rápida de saber se o áudio é bom o suficiente para o seu uso e como a sua língua-alvo é pronunciada.

Execução 4 — disciplina de referência. R2V com o ref2va checkpoint, duas ou três referências, cada uma explicitamente etiquetada e com uma função atribuída, com <Picture 1> descrito como o primeiro quadro real. Em seguida, quebre deliberadamente: anexe as mesmas referências sem atribuições e compare.

Execução 5 — o final. Leve seu melhor prompt local em 768p para a API hospedada em 2K e veja o que o Context-IR e a passada de regeneração acrescentam. Esse delta é o que o preço por segundo está comprando, e é a única maneira de precificar honestamente o fluxo de trabalho híbrido.

Perguntas Frequentes

Posso obter 2K dos pesos locais?

Não. O pacote aberto é o H3-Base, cujo canvas nativo tem um lado curto de 768 pixels (até 768×1344). O 2K vem do H3-Regenerate-2K, um módulo separado de regeneração em contexto que a empresa manteve na API hospedada. Você pode fazer upscale localmente com qualquer upscaler de uso geral, mas isso é uma operação diferente da passada de regeneração do próprio H3 e não vai corresponder a ela.

Por que o mesmo prompt se comporta de forma diferente na API e no ComfyUI?

Porque a API executa o H3-Context-IR primeiro. Ele lê seu texto e suas referências, raciocina sobre como eles se relacionam e entrega ao H3-Base uma instrução estruturada e enriquecida. Localmente, não existe essa etapa — o H3-Base recebe suas palavras brutas. Um prompt vago que produz um clipe competente pela API está sendo resgatado por um pré-processador que você não instalou, e é por isso que o formato de prompt documentado importa muito mais para usuários locais do que para usuários da API.

O modelo de timecode [0s-2s] está errado?

Não é o que o guia incluído pede. O VIDEO_PROMPT_WRITING_GUIDE_base_en.md da empresa organiza-se em blocos [Shot N], não atribui timestamp ao Shot 1 e expressa os cortes posteriores como tempos absolutos ("Em 00:03.500, a câmera corta para…"). Ele também não tem seção de prompt negativo, então a lista de "transições proibidas" no template popular é uma contribuição da comunidade. Dito isso, profissionais estão relatando bons resultados com a API usando a forma de timecode — provavelmente porque o Context-IR a normaliza. Nossa leitura: use o formato documentado com pesos locais e não credite os colchetes de timecode pelos resultados da API que o pré-processador pode ter obtido.

Uma empresa nos EUA ou na UE pode usar os pesos abertos comercialmente?

O texto da licença que lemos exclui a UE, o Reino Unido, a Coreia do Sul e os EUA do seu Território Aplicável, e a exclusão está redigida para abranger tanto as saídas quanto os pesos. Isso é um obstáculo sério para uma implantação comercial nesses locais, e é uma questão jurídica, não técnica — leia a licença e o arquivo de perguntas e respostas você mesmo e procure aconselhamento. A API hospedada é regida pelos próprios termos da plataforma, não pela licença comunitária, portanto vale a pena avaliá-la separadamente, em vez de presumir que esteja igualmente restrita.

O que verificar antes do commit

H3 oferece um custo-benefício excepcionalmente bom para um formato específico de trabalho: clipes curtos, com design de som e consistentes com a referência, em que você está disposto a escrever uma lista de planos de verdade. Ele é excepcionalmente exigente quanto à forma de pedir. As três coisas que valem a pena verificar por conta própria, porque são as que mudam mais rápido: se mais provedores de inferência aparecem ao lado da fal (que é o que vai reduzir o preço por segundo), se o template R2V do ComfyUI cresce além de dois slots de referência até os nove do modelo, e se o hábito de timecode da comunidade ou o formato documentado de shot-block vence quando alguém fizer uma comparação controlada contra os pesos locais. Ninguém publicou essa comparação ainda. Até que publiquem, o manual no repositório é a melhor aposta — e ele está no mesmo download em que você já gastou 42 GB.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube