MiniMax H3 (Hailuo 3.0):具备全参考能力的2K AI视频模型详解
Guides & Insights

MiniMax H3 (Hailuo 3.0):具备全参考能力的2K AI视频模型详解

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

MiniMax H3——更广为人知的名称是Hailuo 3.0——是MiniMax最新的AI视频生成模型:它于2026年7月17日在WAIC 2026上亮相,7月31日面向公众发布,如今同时提供四种使用途径——MiniMax的Hailuo平台、Luma Agents、开源权重下载,以及自8月30日起上线的Vercel AI Gateway(新的速度优先型MiniMax H3 Max也一并在此推出)。H3将MiniMax的视频产品线提升到原生2K分辨率,单次生成即可加入同步音频,并引入了一套相当丰富的“全参考”(omni-reference)控制系统。最新进展出现在自托管方面:自9月1日起,开源H3-Base权重可以通过vLLM-Omni提供服务,配合FastVideo的FastH3,其速度快到只需约8.7秒即可渲染出一段完整的10.1秒音视频MP4——比其播放时长还要短。本指南将介绍H3究竟是什么、真正新增了什么,以及它在2026年前沿视频模型中的地位——所有能力的来源和质量声明均已清楚标注。

准确性说明:关于 H3 的能力描述,来源于 MiniMax 的公告与平台文档。Vercel AI Gateway 的可用性已获确认——Vercel 的模型目录同时列出了 MiniMax H3 与 MiniMax H3 Max,其更新日志也记录了上线折扣——尽管促销条款本身仍由厂商宣布。截至撰写本文时,Luma Agents 集成与开放权重版本发布仍只是厂商方面的公告;Luma 自己的产品文档尚未列出 H3,该集成的访问条款也不明确。视频质量在很大程度上是主观的,需要借助人类偏好竞技场来评判;H3 目前已有 Artificial Analysis 竞技场的早期评分——图生视频约 1184 分、带音频的文生视频约 1226 分,数据采集于 2026 年 8 月 27 日——不过,竞技场排名会随着投票累积而不断变化。9 月 1 日“生成速度快于播放速度”的服务指标——一个带同步音频的完整 10.1 秒 MP4 在大约 8.7 秒内渲染完成——由 vLLM-Omni 团队在其博客文章中报告,测量环境为 8× NVIDIA B300 服务器;该数据属于团队自测基准,尚未被独立复现,并且度量的是 FastH3——FastVideo 的四步蒸馏适配器——而非完整的基础模型。请将“哪个看起来最好”这类比较性说法视为临时结论。规格和价格都会变动——构建之前,请先核实。

TL;DR:H3 是一款原生 2K、24fps 的文生视频与图生视频模型,可一次性生成 5–15 秒的片段(可延长至约 30 秒),并同步生成对白、音效和环境声。其突出特性包括全参考(omni-reference,最多支持 9 张参考图、3 个视频片段和 3 个音频片段,用于保持一致性)以及指令式编辑(无需重新生成即可更改角色、物体、场景、声音或节奏)。自发布以来,它迅速铺开:8 月 3 日,基础权重开源;8 月 6 日,MiniMax 宣布 H3 上线 Luma Agents(支持最长 15 秒、带原生立体声的 2K 视频,不过访问条款尚未公开);8 月 30 日,MiniMax H3 与 MiniMax H3 Max 登陆 Vercel 的 AI Gateway,并推出为期两周的 50% 发布折扣。自 9 月 1 日起,开源基础权重还可用于实时生成:通过 vLLM-Omni 与 FastVideo 的 FastH3,一段完整的 10.1 秒视频+音频 MP4 约 8.7 秒即可渲染完成——据 vLLM-Omni 团队的基准测试,这比实时播放还要快。相较于 Hailuo 2.3(1080p、约 10 秒、不支持全参考),这是一大步;同时 H3 还要与 Kling 3.0、Google Veo 3.1、ByteDance Seedance 2.0 等产品竞争——它在可控性和音频方面表现出色,不过早期独立的竞技场评分仍有待进一步稳固。

关键要点

• H3 = Hailuo 3.0,MiniMax 最新视频模型,于 WAIC 2026 亮相,7 月 31 日发布;可通过 Hailuo、Luma Agents、开放权重及 Vercel 的 AI Gateway 获取。

• 原生2K 24fps,5–15秒片段(可延长至约30秒),多种宽高比,文本转视频和图像转视频。

• 全能参考:最多可提供9张图片、3个视频片段和3个音频片段作为参考,以确保风格、角色、动作和声音一致性。

• 同步对话、音效和氛围一次生成;基于指令的编辑,无需完整重新生成。

• 基础权重于8月3日在社区许可下开源;Context-IR和2K再生模块仍仅限API使用。

8月30日,MiniMax H3和MiniMax H3 Max在Vercel的AI Gateway上线,发布期至9月13日可享5折优惠。

• 自9月1日起,开放的H3-Base权重可通过vLLM-Omni和FastVideo的FastH3进行实时生成服务——一段10.1秒的影音MP4大约在8.7秒内渲染完成,快于播放速度——(团队报告的基准测试结果,尚未经独立复现)。

• 相较于 Hailuo 2.3 有重大升级(1080p,约10秒);与 Kling 3.0、Veo 3.1、Seedance 2.0、Wan 2.7 等竞争。

MiniMax H3 实际上是什么

MiniMax是一家重要的中国AI公司(于2026年1月完成香港IPO,据报道以约40亿美元估值募资约6.19亿美元,投资方包括阿里巴巴和腾讯)。其消费级视频品牌为Hailuo,以领先同类的物理模拟、快速生成和亲民定价而闻名。H3是第三代Hailuo模型,在WAIC 2026上与MiniMax的M3文本模型及其他多模态解决方案一同亮相,并于2026年7月31日向公众发布。M3是文本/智能体大语言模型,而H3则完全是视频生成模型。

新功能:2K、omni-reference 与 one-pass 音频

H3 由三大要素定义。首先,原生 2K 分辨率搭配 24fps 帧率——相比 Hailuo 2.3 的 1080p 是显著提升——采用电影标准节奏,片段时长 5 至 15 秒(可通过扩展工具延长至约 30 秒),支持从 21:9 到 9:16 的画面比例。其次,全参考(Omni-Reference):你可同时输入最多 9 张参考图像、3 个视频片段和 3 个音频片段,以锁定风格、角色特征、动作或声音——如此丰富的控制接口,能确保角色或外观在多镜头间保持一致性。第三,单遍同步音频生成:H3 能生成与画面动作同步的对白、音效和环境氛围,无需单独的音频处理步骤。

基于指令的编辑

一个低调但重要的功能是基于指令的编辑:无需从头重新生成片段来做出修改,只需描述编辑内容——替换角色、更改对象、变换场景、调整声音或重新剪辑节奏——H3便会应用这些修改。对于迭代式创意工作而言,原地编辑而非在全新生成上重新碰运气,实际上是一个工作流程优势。

它与Hailuo 2.3相比如何

代际提升非常明显:H3从1080p升级到原生2K,最大单次生成时长从约10秒延长至15秒(可扩展至30秒),同时新增了全参考输入和指令式编辑功能,这些是2.3版本所不具备的。如果你使用过海螺2.3,那么H3在分辨率、时长、控制能力和音频方面是一次直接升级。

H3在2026年前沿中的地位

H3 现已带有早期 Artificial Analysis 竞技场评分——图生视频约 1,184 分,带音频的文生视频约 1,226 分,数据采集于 2026 年 8 月 27 日——不过竞技场排名会随投票累积而变动,所以请用你自己的测试提示词来判断,而不是轻信任何单一说法。

关于O​penAI Sora的一点说明

如果你在梳理这个领域:O​penAI 已于 2026 年 4 月停用 Sora 网页版和应用版体验,其 API 计划于 2026 年 9 月终止——因此,Sora 不是适合用来开启新视频工作流的模型。当前的前沿是上面这组模型,H3 也加入了其中。

如何访问H3和现场的其余部分

H3 现在可通过四种方式到达,而且自发布以来,这个列表一直在增长。

• Hailuo (Mini​Max 自己的平台):完整产品,包括基于指令的编辑和 H3-Regenerate-2K 放大至 2K。

• Luma Agents:MiniMax于2026年8月6日宣布,H3现已上线Luma的多模型Agents产品,可生成最长15秒、带原生立体声的2K视频。这是厂商公布的消息,访问条款尚未公开——Luma自己的产品文档截至撰稿时仍未收录H3——因此定价和资格细则预计很快就会敲定。Luma在自己的Agents产品中接入竞争对手的视频模型,足见2026年视频模型市场已变得多么可互换。

• Vercel AI Gateway:2026年8月30日,MiniMax和Vercel宣布,MiniMax H3和MiniMax H3 Max均可通过Vercel的AI Gateway使用,在2026年8月30日至9月13日期间,通过该网关计费的请求可享50%折扣。模型ID——minimax/minimax-h3和minimax/minimax-h3-max——保持不变,因此现有网关集成无需更改代码即可享受折扣价。Vercel的模型目录和更新日志中已确认可用性;促销条款由供应商宣布。

• 开放权重:2026年8月3日,Mini​Max在Hugging Face和ModelScope上根据MiniMax H3社区许可发布了H3的基础权重——一个33B密集Transformer,H3-Base——作为两个检查点:H3-Base-FL2VA用于文本到视频/音频和关键帧生成,以及H3-Base-Ref2VA用于基于参考的生成。三个系统模块中的两个——H3-Context-IR(提示预处理器)和H3-Regenerate-2K(2K放大)——不在开放发布之列,仍仅限API使用,因此自托管运行的输出上限低于2K。自9月1日起,相同的基础权重可通过vLLM-Omni和FastVideo的FastH3进行实时生成——FastH3是一个四步蒸馏适配器,可在8×NVIDIA B300服务器上约8.7秒内渲染出完整的10.1秒视频和音频MP4,快于其播放时长(团队报告,尚未独立复现)。

MiniMax H3 现已在 OrcaRouter 上架,按提供商的列表价计费——768p 每秒 0.08 美元,2K 每秒 0.13 美元——以 0% 加价并内置自动故障转移透传,因此你可以通过一个兼容 O​penAI 的 API 调用 H3 系列,而无需自行接通一个才上线没几天的厂商端点。由于没有哪家单一提供商托管所有模型,实际做法是把你的 LLM 和智能体流量统一走一个端点(OrcaRouter 也承载 Mini​Max 自家的 M3 文本模型),并按项目直接选用最合适的视频模型。MiniMax H3 Max 目前尚未接入 OrcaRouter 路由——现阶段是通过第三方渠道提供——所以如果你要针对它做原型验证,保持故障转移的习惯会很有价值:可以试用一个刚发布几天的模型,而不必把生产管线押在它上面。

实时传输:视频传输速度快于播放速度

本次更新的开发工作主要在自托管方面。MiniMax H3 的开源基础检查点是一个 33B 稠密 Transformer;按标准方式生成一段视频片段,意味着需要在一条漫长的去噪调度上执行约 49 次扩散 Transformer 前向传播。开源视频训练与推理项目 FastVideo 发布了 H3-Base 的蒸馏学生模型 FastH3:一种四步(DMD2 风格)模型,复用了 H3 的文本编码器、视频 VAE、音频 VAE、分词器和调度器,但将去噪循环缩减为在五个 sigma 位置上仅执行四次 Transformer 前向传播。多模态服务运行时 vLLM-Omni 在加载时将 FastH3 适配器融合进来(拉取请求 #6714),并通过兼容 OpenAI 的 /v1/videos 端点将其开放,与此前对 base-H3 的支持并列提供。

标题中的这个数字是在大型硬件上测得的。在配备8× NVIDIA B300的服务器上,以1344×768分辨率和24fps运行,vLLM-Omni团队报告称,一段完整的10.1秒MP4——包含视频和同步音频——端到端渲染耗时约8.7秒,比其播放时长还快。这是该团队于2026年9月1日发布的基准测试结果,尚未被独立复现;团队自己也指出,原始基准测试包仍在等待发布,且并未声称基础版本与FastH3在质量上相当。在配置更普通的硬件上,数字就没那么引人注目了——社区方案也涵盖2× RTX 5090和单GPU配置——而且FastH3 v1仅支持文本到视频-音频(T2VA)生成,分辨率为1344×768,而非仍保留在API侧的2K。

对读者而言,这改变了“自托管 H3”的含义。此前,开放的基础权重虽然能跑,但速度很慢——适合批处理,不适合任何交互式场景。借助 vLLM-Omni 上的 FastH3,本地部署的 H3 流水线能够以远短于片段时长的时间完成一段十秒片段的处理,而这正是实时产品循环——实时预可视化、快速镜头迭代、智能体驱动视频——变得切实可行的门槛。如果你不想运行一台八 GPU 服务器,托管路径则保持不变:MiniMax H3 已在 OrcaRouter 上以厂商标价提供,0% 加价直通并带自动故障转移,因此你可以通过一个 O​penAI 兼容 API 调用 H3 全系列模型,而无需自购硬件。

H3大放异彩的三个场景

1. 角色和风格一致的短片

全参考(最多9张图片、3个片段、3个音频)旨在保持角色、外观和声音在多镜头中的一致性——非常适合叙事短片和剧集内容。

2. 带音频的社交和广告创意

一次性同步对话、音效和环境音,加上灵活的画面比例(9:16到21:9),适用于需要成品音频而非仅视觉的快节奏社交和广告工作流程。

3. 迭代创意编辑

基于指令的编辑让团队可以通过描述来细化剪辑,而不是重新生成,从而加速了需要大量修改的制作过程。

常见问题

什么是MiniMax H3?

H3 即 Hailuo 3.0,是 MiniMax 最新发布的 AI 视频生成模型,于 WAIC 2026(2026 年 7 月 17 日)亮相,并于 2026 年 7 月 31 日发布。它能根据文本或图像生成本地 2K、24fps 视频,并带有同步音频,支持全方位参考控制和基于指令的编辑。

H3 和 MiniMax M3 是一样的吗?

不。M3 是 Mini​Max 的文本/智能体 LLM;H3(Hailuo 3.0)是其视频生成模型。它们在同一场发布会上亮相,但分工不同。

我现在可以在哪里使用H3?

四个渠道:MiniMax的Hailuo平台(完整产品)、Vercel的AI Gateway(H3和MiniMax H3 Max均可,9月13日前享受发布五折优惠)、Luma Agents(2026年8月6日发布——支持最长15秒2K视频及原生立体声,访问条款仍不明确),以及通过Hugging Face和ModelScope上的开源H3-Base权重进行自托管——自9月1日起,可通过vLLM-Omni配合FastVideo的FastH3以快于播放速度的速度提供服务(根据vLLM-Omni团队的说法,在8× B300上处理一段10.1秒的影音MP4约需8.7秒)。基础模型也以提供商标价在OrcaRouter上路由。

H3视频片段的时长和分辨率是多少?

原生2K分辨率,24fps帧率,每次生成5-15秒,可延长至约30秒,支持从21:9到9:16的画面比例。

什么是全参考?

一个控制系统,一次最多可接受9张参考图片、3个视频片段和3个音频片段,以保持风格、角色、动作和声音的一致性。

H3比Kling 3.0或Veo 3.1更好吗?

这取决于轴。Kling 3.0 提供原生 4K,并在某些领域领先;Veo 3.1 在 48kHz 对话方面表现出色。H3 强调全参考控制、单遍音频、编辑和价格。H3 有早期的人工分析竞技场分数(截至八月底,图像转视频约为 1,184,带音频的文本转视频约为 1,226),这些分数会随着投票累积而变化——请在您自己的提示词上测试。

H3是开源权重的吗?

部分可以。Mini​Max 于 2026 年 8 月 3 日开源了 H3 的基础权重——这是一个 33B 参数的 Transformer 模型,以 MiniMax H3 社区许可证发布在 Hugging Face 和 ModelScope 上,并提供 FL2VA 和 Ref2VA 检查点。根据 Mini​Max 的许可条款,这次发布限制了部署区域,而且限制同样覆盖模型生成的内容,并要求注明出处。构成旗舰体验的两个模块——H3-Context-IR(提示词预处理)和 H3-Regenerate-2K(2K 放大)——不在开放范围内,仍仅通过 API 提供。自 9 月 1 日起,开放的基础权重还可以通过 vLLM-Omni 和 FastVideo 的 FastH3 进行实时生成(FastH3 v1 目前仅支持文本到视频和音频)。所以对于基础模型,答案是肯定的,但有一些附加限制。

底线

MiniMax H3 (Hailuo 3.0) 是 MiniMax 视频产品线一次实打实的升级:原生 2K、单遍生成同步音频、丰富的全参考控制,以及基于指令的剪辑,而且定价亲民。自发布以来,它的触达门槛也大幅降低——以供应商目录价接入 OrcaRouter,可在 Luma Agents 内运行,基础权重已开源、支持自托管(自 9 月 1 日起,借助 vLLM-Omni 和 FastVideo 的 FastH3,渲染一段 10.1 秒的片段已经比实时播放更快),并且它和 MiniMax H3 Max 现已上架 Vercel 的 AI Gateway,提供为期两周的上市五折优惠。它在分辨率上不会自动胜过主打原生 4K 的竞品,早期竞技场评分也仍在逐步稳固——但在控制、音频和迭代速度方面,它极具吸引力。建议你用自有素材,将 H3 与 Kling 3.0、Veo 3.1、Seedance 2.0 等产品一并评估,并通过 OrcaRouter 这样的统一端点,让更广泛的模型栈保持厂商中立。