
MiniMax H3 (Hailuo 3.0): O Modelo de Vídeo AI 2K com Omni-Reference, Explicado
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
MiniMax H3 — mais conhecido como Hailuo 3.0 — é o mais novo modelo de geração de vídeo por IA da MiniMax, apresentado na WAIC 2026 (17 de julho de 2026), lançado ao público em 31 de julho e agora disponível de quatro maneiras ao mesmo tempo: na plataforma Hailuo da MiniMax, no Luma Agents, como download de pesos abertos e — desde 30 de agosto — no AI Gateway da Vercel, onde o novo MiniMax H3 Max, com foco em velocidade, foi lançado junto. Ele eleva a linha de vídeo da MiniMax para resolução 2K nativa, adiciona áudio sincronizado em uma única passada e introduz um sistema de controle “omni-reference” excepcionalmente rico. A novidade mais recente está no lado da auto-hospedagem: desde 1º de setembro, os pesos abertos do H3-Base podem ser servidos via vLLM-Omni, com o FastH3 da FastVideo sendo rápido o suficiente para renderizar um MP4 completo de vídeo e áudio de 10,1 segundos em cerca de 8,7 segundos — mais rápido que a duração de reprodução. Este guia explica o que o H3 realmente é, o que é genuinamente novo e onde ele se posiciona entre os modelos de vídeo de fronteira de 2026 — com capacidades citadas e alegações de qualidade claramente rotuladas.
Nota de precisão: as capacidades do H3 vêm do anúncio da MiniMax e da documentação da plataforma. A disponibilidade do Vercel AI Gateway está confirmada — o catálogo de modelos da Vercel lista o MiniMax H3 e o MiniMax H3 Max, e o changelog da Vercel documenta o desconto de lançamento —, embora os próprios termos da promoção sejam anunciados pelo fornecedor. A integração com o Luma Agents e o lançamento de pesos abertos (open-weight) permanecem apenas anunciados pelo fornecedor até o momento desta redação; a documentação do produto da própria Luma ainda não lista o H3, e os termos de acesso da integração não estão claros. A qualidade de vídeo é em grande parte subjetiva e avaliada por arenas de preferência humana; o H3 agora tem pontuações iniciais na arena Artificial Analysis — cerca de 1.184 em image-to-video e 1.226 em text-to-video com áudio, capturadas em 27 de agosto de 2026 —, embora os rankings das arenas mudem à medida que os votos se acumulam. O número de 1º de setembro sobre geração mais rápida que a reprodução — um MP4 completo de 10,1 segundos com áudio sincronizado renderizado em cerca de 8,7 segundos — é relatado pela equipe do vLLM-Omni em seu próprio post no blog, medido em um servidor com 8 GPUs NVIDIA B300; trata-se de um benchmark da equipe que ainda não foi reproduzido de forma independente, e ele mede o FastH3, o adaptador destilado de quatro passos do FastVideo, não o modelo base completo. Trate como provisórias as afirmações comparativas de “qual tem a melhor aparência”. As especificações e os preços mudam — verifique antes de construir.
TL;DR. O H3 é um modelo texto-para-vídeo e imagem-para-vídeo nativo em 2K a 24fps, que gera clipes de 5–15 segundos (extensíveis a ~30s) com diálogo sincronizado, efeitos sonoros e ambiente em uma única passada. Seus recursos mais notáveis são omni-reference (até 9 imagens de referência, 3 clipes de vídeo e 3 clipes de áudio para consistência) e edição baseada em instruções (alterar personagens, objetos, cenas, som ou ritmo sem regenerar). Desde o lançamento, ele se espalhou rápido: os pesos base foram abertos em 3 de agosto, a MiniMax anunciou o H3 no Luma Agents em 6 de agosto (até 15 segundos de vídeo 2K com som estéreo nativo, embora os termos de acesso ainda não sejam públicos), e em 30 de agosto o MiniMax H3 e o MiniMax H3 Max chegaram ao AI Gateway da Vercel com desconto de lançamento de 50% por duas semanas. Desde 1º de setembro, os pesos base abertos também podem ser servidos para geração em tempo real: por meio do vLLM-Omni com o FastH3 da FastVideo, um MP4 completo de 10,1 segundos com vídeo e áudio é renderizado em cerca de 8,7 segundos — mais rápido do que a reprodução, segundo o benchmark da equipe do vLLM-Omni. É um grande avanço em relação ao Hailuo 2.3 (que era 1080p, ~10s, sem omni-reference), e compete com o Kling 3.0, o Google Veo 3.1, o ByteDance Seedance 2.0 e outros — forte em controle e áudio, com as primeiras pontuações independentes de arena ainda a se firmar.
Principais conclusões
• H3 = Hailuo 3.0, o modelo de vídeo mais recente da MiniMax, apresentado na WAIC 2026 e lançado em 31 de julho; disponível via Hailuo, Luma Agents, pesos abertos e o AI Gateway da Vercel.
• Nativo 2K a 24fps, clipes de 5 a 15 segundos (extensíveis até ~30s), múltiplas proporções de tela, texto para vídeo e imagem para vídeo.
• Omni-reference: até 9 imagens, 3 videoclipes e 3 clipes de áudio como referências para consistência de estilo, personagem, movimento e voz.
• Diálogo sincronizado, SFX e ambiente gerados em uma única passagem; edição baseada em instruções sem regeneração completa.
• Pesos base disponibilizados como código aberto em 3 de agosto sob licença comunitária; os módulos Context-IR e regeneração de 2K permanecem somente via API.
• Em 30 de agosto, MiniMax H3 e MiniMax H3 Max foram lançados no AI Gateway da Vercel com 50% de desconto de lançamento até 13 de setembro.
Desde 1º de setembro, os pesos abertos do H3-Base podem ser servidos para geração em tempo real — um MP4 de vídeo e áudio de 10,1 segundos renderizado em cerca de 8,7 segundos, mais rápido que a reprodução — por meio do vLLM-Omni e do FastH3 da FastVideo (benchmark relatado pela equipe, ainda não reproduzido de forma independente).
• Grande atualização em relação ao Hailuo 2.3 (1080p, ~10s); compete com Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7, e mais.
O que é realmente o MiniMax H3
MiniMax é uma importante empresa chinesa de IA (concluiu um IPO em Hong Kong em janeiro de 2026, supostamente levantando cerca de US$ 619 milhões a uma avaliação de aproximadamente US$ 4 bilhões, com investidores incluindo Alibaba e Tencent). Sua marca de vídeo para consumidores é a Hailuo, conhecida por simulação física líder de categoria, geração rápida e preços acessíveis. O H3 é o modelo de terceira geração da Hailuo, apresentado juntamente com o modelo de texto M3 da MiniMax e outras soluções multimodais no WAIC 2026 e lançado ao público em 31 de julho de 2026. Enquanto o M3 é um LLM de texto/agente, o H3 é claramente um modelo de geração de vídeo.
Novidades: 2K, omni-reference e one-pass audio
Três coisas definem o H3. Primeiro, nativo 2K a 24fps — um avanço em relação ao 1080p do Hailuo 2.3 — na cadência padrão de cinema, com clipes de 5 a 15 segundos (extensível até cerca de 30 segundos através de uma ferramenta Extend) e proporções de 21:9 a 9:16. Segundo, omni-reference: você pode fornecer até 9 imagens de referência, 3 clipes de vídeo e 3 clipes de áudio simultaneamente para fixar estilo, identidade do personagem, movimento ou voz — uma superfície de controle excepcionalmente generosa para manter um personagem ou visual consistente entre as tomadas. Terceiro, áudio sincronizado em uma única passagem: O H3 gera diálogo, efeitos sonoros e atmosfera ambiente sincronizados com a ação na tela, em vez de exigir uma etapa de áudio separada.

Edição baseada em instruções
Uma característica silenciosamente importante é a edição baseada em instruções: em vez de regenerar um clipe do zero para fazer uma alteração, você pode descrever uma edição — trocar um personagem, alterar um objeto, mudar a cena, ajustar o som ou reajustar o ritmo do plano — e o H3 a aplica. Para trabalho criativo iterativo, editar no lugar em vez de jogar os dados novamente em uma geração nova é uma verdadeira vantagem de fluxo de trabalho.
Como se compara ao Hailuo 2.3
O salto geracional é claro: o H3 passa de 1080p para 2K nativo, estende a duração máxima de geração única de cerca de 10 segundos para 15 (com uma extensão de 30 segundos) e adiciona tanto entradas de referência omni quanto edição baseada em instruções, que faltavam no 2.3. Se você usou o Hailuo 2.3, o H3 é uma melhoria direta em resolução, duração, controle e áudio.
Onde a H3 se situa na fronteira de 2026
O H3 agora carrega pontuações iniciais do Artificial Analysis arena — aproximadamente 1.184 em imagem-para-vídeo e 1.226 em texto-para-vídeo com áudio, capturadas em 27 de agosto de 2026 — embora os rankings da arena mudem conforme os votos se acumulam, então avalie-o com seus próprios prompts de teste em vez de confiar em qualquer alegação isolada.
Uma nota sobre OpenAI Sora
Se você está mapeando o campo: a OpenAI descontinuou as experiências web e de aplicativo do Sora em abril de 2026, com sua API programada para encerrar em setembro de 2026 — então o Sora não é um modelo para iniciar novos fluxos de trabalho de vídeo. A fronteira ativa é o conjunto acima, e o H3 se junta a ele.
Como acessar o H3 e o restante do campo
H3 agora é acessível de quatro maneiras, e essa lista cresceu desde o lançamento.
• Hailuo (plataforma própria da MiniMax): o produto completo, incluindo edição baseada em instruções e o upscale H3-Regenerate-2K para 2K.
• Luma Agents: a MiniMax anunciou em 6 de agosto de 2026 que o H3 agora está disponível no produto Agents multimodelo da Luma, gerando até 15 segundos de vídeo 2K com som estéreo nativo. Isso é anunciado pelo fornecedor, e os termos de acesso ainda não são públicos — a documentação do produto da própria Luma não lista o H3 no momento — então espere que os detalhes de preço e elegibilidade sejam definidos em breve. A Luma hospedar um modelo de vídeo rival dentro de seu próprio produto Agents é um sinal de quão intercambiável o mercado de modelos de vídeo de 2026 se tornou.
• Vercel AI Gateway: em 30 de agosto de 2026, a MiniMax e a Vercel anunciaram que os modelos MiniMax H3 e MiniMax H3 Max estão disponíveis por meio do AI Gateway da Vercel, com as solicitações cobradas pelo gateway com 50% de desconto de 30 de agosto a 13 de setembro de 2026. Os IDs dos modelos — minimax/minimax-h3 e minimax/minimax-h3-max — permanecem inalterados, portanto as integrações existentes com o gateway recebem automaticamente a tarifa com desconto, sem nenhuma alteração de código. A disponibilidade está confirmada no catálogo de modelos e no changelog da Vercel; os termos da promoção são anunciados pelo fornecedor.
• Pesos abertos: em 3 de agosto de 2026, a MiniMax lançou os pesos base do H3 — um transformador denso de 33B, H3-Base — no Hugging Face e no ModelScope sob a Licença Comunitária MiniMax H3, como dois checkpoints: H3-Base-FL2VA para geração de texto para vídeo/áudio e quadros-chave, e H3-Base-Ref2VA para geração baseada em referência. Dois dos três módulos do sistema — H3-Context-IR (o pré-processador de prompts) e H3-Regenerate-2K (o upscale de 2K) — não estão na versão aberta e permanecem somente via API, portanto execuções autohospedadas ficam limitadas a menos de 2K. E desde 1º de setembro, os mesmos pesos base podem ser servidos para geração em tempo real por meio do vLLM-Omni e do FastH3 da FastVideo — um adaptador destilado de quatro etapas que renderiza um MP4 completo de vídeo e áudio de 10,1 segundos em cerca de 8,7 segundos em um servidor 8× NVIDIA B300, mais rápido que a duração de sua reprodução (relatado pela equipe, ainda não reproduzido de forma independente).
O MiniMax H3 está disponível no OrcaRouter pelo preço de lista do provedor — US$ 0,08 por segundo em 768p e US$ 0,13 por segundo em 2K — repassado com 0% de markup e com failover automático, para que você possa chamar a família H3 por meio de uma única API compatível com OpenAI, em vez de integrar um endpoint que acabou de ser lançado por um fornecedor. Como nenhum provedor hospeda todos os modelos, o padrão prático é centralizar o tráfego de LLMs e de agentes em um único endpoint (o OrcaRouter também oferece o modelo de texto M3 da própria MiniMax) e usar diretamente o melhor modelo de vídeo para cada projeto. O MiniMax H3 Max ainda não é roteado pelo OrcaRouter — por enquanto, ele é servido por canais de terceiros — então, se você estiver prototipando com ele, o hábito de usar failover compensa: experimente um modelo recém-lançado sem apostar um pipeline de produção nele.

Serviço em tempo real: vídeo mais rápido que a reprodução
O desenvolvimento por trás desta atualização está no lado da auto-hospedagem. O checkpoint base aberto do MiniMax H3 é um transformer denso de 33B, e gerar um clipe da maneira padrão significa executar cerca de 49 forward passes do transformer de difusão ao longo de um longo cronograma de denoising. O FastVideo, projeto open-source de treinamento e inferência de vídeo, publicou um aluno destilado do H3-Base chamado FastH3: um modelo de quatro passos (estilo DMD2) que reutiliza o codificador de texto, o VAE de vídeo, o VAE de áudio, os tokenizadores e os schedulers do H3, mas reduz o loop de denoising para quatro forward passes do transformer em cinco posições sigma. O vLLM-Omni, o runtime de serving multimodal, funde o adaptador FastH3 no momento do carregamento (pull request #6714) e o expõe por meio de um endpoint /v1/videos compatível com OpenAI, além de seu suporte anterior ao H3-Base.
O número principal é medido em hardware grande. Em um servidor NVIDIA B300 8× a 1344×768 e 24fps, a equipe vLLM-Omni relata um MP4 completo de 10,1 segundos — vídeo e áudio sincronizado — renderizado de ponta a ponta em cerca de 8,7 segundos, mais rápido que a duração de reprodução. Esse é um benchmark divulgado pela equipe em 1º de setembro de 2026 e ainda não reproduzido de forma independente; a própria equipe observa que o pacote bruto do benchmark ainda está pendente de publicação e não faz nenhuma afirmação de paridade de qualidade entre o base e o FastH3. Em hardware mais modesto os números são menos dramáticos — a receita da comunidade também cobre configurações com 2× RTX 5090 e GPU única — e o FastH3 v1 cobre apenas texto-para-vídeo-áudio (T2VA), a 1344×768 em vez dos 2K que continuam no lado da API.
Para um leitor, isso muda o que “auto-hospedar H3” pode significar. Antes, os pesos base abertos rodavam, mas lentamente — adequados para trabalho em lote, não para algo interativo. Com FastH3 no vLLM-Omni, um pipeline H3 on-premises pode processar um clipe de dez segundos em bem menos que a duração do clipe, que é o limiar em que ciclos de produto em tempo real — pré-visualização ao vivo, iteração rápida de planos, vídeo dirigido por agentes — se tornam práticos. Se você preferir não executar um servidor com oito GPUs, o caminho gerenciado permanece inalterado: o MiniMax H3 está no OrcaRouter pelo preço de lista do provedor, repassado com markup de 0% e failover automático, para que você possa chamar a família H3 por meio de uma única API compatível com OpenAI sem possuir o hardware.
Três cenários onde o H3 se destaca
1. Curtas-metragens consistentes em personagem e estilo
Omni-reference (até 9 imagens, 3 clipes, 3 áudios) foi criada para manter um personagem, visual e voz consistentes em várias tomadas — ideal para curtas narrativos e conteúdo episódico.
2. Criativo social e de anúncios com som
Diálogo sincronizado em uma única passagem, efeitos sonoros (SFX) e ambiente, além de proporções de tela flexíveis (9:16 a 21:9), adequam-se a fluxos de trabalho rápidos de mídia social e publicidade que precisam de áudio finalizado, não apenas de visuais.
3. Edição criativa iterativa
A edição baseada em instruções permite que as equipes refinem um clipe de forma descritiva, em vez de regenerá-lo, o que acelera a produção com muitas revisões.

Perguntas Frequentes
O que é MiniMax H3?
O H3 é o Hailuo 3.0, o mais recente modelo de geração de vídeo por IA da MiniMax, apresentado na WAIC 2026 (17 de julho de 2026) e lançado em 31 de julho de 2026. Ele produz vídeo nativo em 2K e 24fps, com áudio sincronizado, a partir de texto ou imagens, com controle de referência omni e edição baseada em instruções.
O H3 é o mesmo que MiniMax M3?
Não. O M3 é o LLM de texto/agente da MiniMax; o H3 (Hailuo 3.0) é o modelo de geração de vídeo. Eles foram apresentados no mesmo evento, mas desempenham funções diferentes.
Onde posso usar H3 agora?
Quatro lugares: a plataforma Hailuo da MiniMax (o produto completo), o AI Gateway da Vercel (tanto o H3 quanto o MiniMax H3 Max, com 50% de desconto de lançamento até 13 de setembro), o Luma Agents (anunciado em 6 de agosto de 2026 — até 15 segundos de vídeo 2K com som estéreo nativo, termos de acesso ainda indefinidos) e auto-hospedado por meio dos pesos abertos H3-Base no Hugging Face e no ModelScope — que, desde 1º de setembro, pode ser servido a uma velocidade superior à de reprodução via vLLM-Omni com o FastH3 da FastVideo (um MP4 de vídeo e áudio de 10,1 segundos em cerca de 8,7 segundos em 8× B300, segundo a equipe do vLLM-Omni). O modelo base também é roteado no OrcaRouter pelo preço de tabela do provedor.
Qual a duração e resolução dos clíps H3?
Nativo 2K a 24fps, 5–15 segundos por geração, extensível até cerca de 30 segundos, em proporções de aspecto de 21:9 a 9:16.
O que é omni-reference?
Um sistema de controle que aceita até 9 imagens de referência, 3 videoclipes e 3 clipes de áudio de uma só vez para manter consistência de estilo, personagem, movimento e voz.
H3 é melhor que Kling 3.0 ou Veo 3.1?
Depende do eixo. O Kling 3.0 oferece 4K nativo e lidera algumas arenas; o Veo 3.1 é forte em diálogo de 48kHz. Já o H3 enfatiza controle de referência onisciente, áudio em uma passada, edição e preço. O H3 tem pontuações iniciais na arena da Artificial Analysis (cerca de 1.184 em imagem-para-vídeo e 1.226 em texto-para-vídeo com áudio, no final de agosto) que vão mudar conforme os votos se acumulam — teste com seus próprios prompts.
O H3 é de pesos abertos?
Em parte. A MiniMax disponibilizou os pesos base do H3 como código aberto em 1º de agosto de 2026 — um transformer de 33B lançado no Hugging Face e no ModelScope sob a Licença Comunitária MiniMax H3, com checkpoints FL2VA e Ref2VA. De acordo com os termos da licença da MiniMax, o lançamento restringe as regiões de implantação e se estende às saídas geradas, com atribuição obrigatória. Os dois módulos que completam a experiência principal — H3-Context-IR (pré-processamento de prompts) e H3-Regenerate-2K (a ampliação de 2K) — não estão no lançamento aberto e permanecem disponíveis apenas via API. Desde 1º de setembro, os pesos base abertos também podem ser servidos para geração em tempo real por meio do vLLM-Omni e do FastH3 da FastVideo (o FastH3 v1 cobre apenas texto para vídeo e áudio). Portanto, sim para o modelo base, com ressalvas.
Conclusão
O MiniMax H3 (Hailuo 3.0) é um grande passo adiante para a linha de vídeo da MiniMax: 2K nativo, áudio sincronizado em uma única passada, amplo controle de referência e edição baseada em instruções, a um preço acessível. Desde o lançamento, também se tornou muito mais fácil de acessar — ele é roteado no OrcaRouter pelo preço de tabela do provedor, roda dentro do Luma Agents, seus pesos base são abertos para auto-hospedagem (e, desde 1º de setembro, rápido o suficiente para renderizar um clipe de 10,1 segundos mais rápido do que a reprodução, via vLLM-Omni e FastH3 da FastVideo), e ele e o MiniMax H3 Max agora estão no AI Gateway da Vercel com desconto de lançamento de 50% por duas semanas. Ele não vai superar automaticamente em resolução os rivais que oferecem 4K nativo, e suas primeiras pontuações na arena ainda estão se consolidando — mas em controle, áudio e velocidade de iteração, é convincente. Avalie o H3 contra o Kling 3.0, o Veo 3.1, o Seedance 2.0 e os demais no seu próprio material, e mantenha sua pilha de modelos mais ampla neutra em relação a fornecedores por meio de um endpoint como o OrcaRouter.
