
MiniMax H3 (Hailuo 3.0):具備全參考功能的 2K AI 影片模型,深入解析
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
MiniMax H3,也就是Hailuo 3.0,是 MiniMax 最新的 AI 影片生成模型:於 2026 年 7 月 17 日在 WAIC 2026 上首次亮相,7 月 31 日對外發布,如今一次就有四種使用方式——MiniMax 的 Hailuo 平台、Luma Agents、開放權重下載,以及自 8 月 30 日起上線的 Vercel AI Gateway,主打速度的 MiniMax H3 Max 也在此同步推出。它將 MiniMax 的影片產品線推進到原生 2K 解析度,能在單次生成中同步加入音訊,並導入一套內容異常豐富的「omni-reference」控制系統。最新進展則在自架(self-hosting)方面:自 9 月 1 日起,開放的 H3-Base 權重可透過 vLLM-Omni 搭配 FastVideo 的 FastH3 提供服務——速度快到只要約 8.7 秒就能渲染出一個完整的 10.1 秒影音 MP4,比播放時長還短。這份指南說明 H3 究竟是什麼、真正新在哪裡,以及它在 2026 年前沿影片模型中位居何處;所有能力均附來源,品質宣稱也都有清楚標示。
準確性說明:H3 的能力來自 MiniMax 的公告與平台文件。Vercel AI Gateway 的可用性已獲得確認——Vercel 的模型目錄列出 MiniMax H3 與 MiniMax H3 Max,且 Vercel 的變更日誌記錄了上線折扣——但促銷條款本身仍由廠商公告。截至撰寫本文時,Luma Agents 整合與開放權重釋出仍屬廠商公告;Luma 自家產品文件尚未列出 H3,且該整合的存取條款並不清楚。影片品質在很大程度上是主觀的,並由人類偏好競技場(arena)來評判;H3 目前在 Artificial Analysis 競技場已有早期分數——約 1,184 分的影像轉影片(image-to-video)與 1,226 分的含音訊文字轉影片(text-to-video),數據擷取於 2026 年 8 月 27 日——但競技場排名會隨著投票累積而變動。9 月 1 日的「快於播放速度」伺服推論數字——一段完整的 10.1 秒 MP4,含同步音訊,約 8.7 秒內渲染完成——是由 vLLM-Omni 團隊在他們自己的部落格文章中報導,測量環境為 8× NVIDIA B300 伺服器;這是團隊自己的基準測試,尚未被獨立重現,而且測量的是 FastH3,即 FastVideo 的四步蒸餾配接器,而非完整的基礎模型。請將比較性的「哪個看起來最好」說法視為暫定結論。規格與價格會變動——動手建置前請先查證。
長話短說。{{1}}H3 是原生 2K、24fps 的文字轉影片與圖片轉影片模型,可一次生成 5–15 秒的片段(可延長至約 30 秒),並在單次處理中同步輸出對白、音效與環境音。{{/1}}它的兩大特色是 {{2}}全參考{{/2}}(最多可輸入 9 張參考圖片、3 段參考影片與 3 段參考音訊,以維持一致性),以及 {{3}}以指令為基礎的編輯{{/3}}(不必重新生成,就能修改角色、物體、場景、聲音或節奏)。自發布以來,它快速擴散:{{4}}基礎權重於 8 月 3 日對外開放{{/4}};{{5}}MiniMax 於 8 月 6 日宣布 H3 上線 Luma Agents{{/5}}(可提供最高 15 秒、具原生立體聲的 2K 影片,惟使用條款尚未公開);{{6}}8 月 30 日,MiniMax H3 與 MiniMax H3 Max 登陸 Vercel 的 AI Gateway,並提供為期兩週的上市五折優惠。{{/6}}自 9 月 1 日起,這些開放基礎權重也能用於即時生成:{{7}}透過 vLLM-Omni 搭配 FastVideo 的 FastH3,一段完整的 10.1 秒影音 MP4 約在 8.7 秒內即可渲染完成——比播放速度還快,這是 vLLM-Omni 團隊基準測試的結果。{{/7}}相較於 Hailuo 2.3(1080p、約 10 秒、無全參考),這是一大躍進,也足以和 Kling 3.0、Google Veo 3.1、ByteDance Seedance 2.0 等產品一較高下——在控制性與音訊方面表現尤其強勁,早期獨立競技場的分數則仍有待鞏固。
關鍵要點
• H3 = Hailuo 3.0,MiniMax 最新的影片模型,於 WAIC 2026 亮相並於 7 月 31 日發布;可透過 Hailuo、Luma Agents、開放權重及 Vercel 的 AI Gateway 使用。
• 原生 2K 解析度,24fps,5–15 秒短片(可延長至約 30 秒),多種寬高比,文字轉影片與圖片轉影片。
• 全方位參考:最多 9 張圖片、3 段影片和 3 段音訊作為風格、角色、動作和聲音一致性的參考。
• 同步對話、音效與環境音一次生成;基於指令的編輯無需完整重新生成。
基礎權重已於8月3日依據社群授權開源;Context-IR與2K-regeneration模組仍僅提供API使用。
8月30日,MiniMax H3 和 MiniMax H3 Max 在 Vercel 的 AI Gateway 上線,並提供上市五折優惠,活動至 9 月 13 日為止。
• 自9月1日起,H3-Base的開放權重可透過vLLM-Omni與FastVideo的FastH3進行即時生成——一段10.1秒的影音MP4約在8.7秒內即可渲染完成,比播放速度還快(此為團隊回報的基準,尚未經獨立重現)。
• 相比 Hailuo 2.3(1080p,約 10 秒)大幅升級;可與 Kling 3.0、Veo 3.1、Seedance 2.0、Wan 2.7 等競爭。
MiniMax H3 到底是什麼
MiniMax是一家重要的中國AI公司(於2026年1月完成香港IPO,據報導以約40億美元估值籌集約6.19億美元,投資者包括阿里巴巴和騰訊)。其消費級影片品牌為Hailuo,以同類領先的物理模擬、快速生成及親民定價著稱。H3是第三代Hailuo模型,於WAIC 2026與MiniMax的M3文字模型及其他多模態解決方案一同亮相,並於2026年7月31日向公眾發布。M3是文字/代理型LLM,而H3則完全是影片生成模型。
最新功能:2K、全向參考,以及單遍音頻
H3 由三項要素定義。首先,原生 2K 24fps——相較於 Hailuo 2.3 的 1080p 再上一階,採用電影級幀率,片段長度 5 至 15 秒(可透過延伸工具延長至約 30 秒),支援從 21:9 到 9:16 的畫面比例。其次,全參照:您可同時輸入最多 9 張參考圖片、3 段影片與 3 段音訊,以鎖定風格、角色身份、動態或聲音——這是一套異常慷慨的控制機制,便於在不同鏡頭間維持角色或視覺的一致性。第三,單次生成同步音訊:H3 會依畫面動作同步生成對白、音效與環境氛圍,無需另外進行音訊處理步驟。

基於指令的編輯
一個低調但重要的功能是基於指令的編輯:無需從頭重新生成片段來進行修改,您可以描述一個編輯——替換角色、改變物體、變更場景、調整音效或重新調整鏡頭節奏——然後H3會執行它。對於迭代創意工作,原地編輯而不是重新賭一把重新生成,是真正的工作流程優勢。
它與 Hailuo 2.3 相比如何
世代躍進很明顯:H3從1080p升級到原生2K,最大單次生成長度從約10秒延長至15秒(可延伸30秒),並增加了全參考輸入和基於指令的編輯功能,這些都是2.3所沒有的。如果你使用過Hailuo 2.3,H3在解析度、長度、控制與音訊方面都是直接的升級。
H3在2026年前沿中的位置
H3 目前帶有早期的 Artificial Analysis 競技場分數——影像轉影片約 1,184 分,含音訊的文字轉影片約 1,226 分,紀錄時間為 2026 年 8 月 27 日——不過競技場排名會隨著票數累積而變動,所以請以你自己的測試提示詞來評斷,而非僅憑任何單一說法。
關於 OpenAI Sora 的說明
如果你正在評估這個領域:OpenAI 已於 2026 年 4 月停止 Sora 的網頁與應用程式體驗,其 API 預計於 2026 年 9 月終止——因此 Sora 不是適合在其上啟動新影片工作流程的模型。當前的活躍前沿是上述集合,而 H3 也加入了其中。
如何存取H3以及該領域的其他部分
H3 現在可以透過四種方式存取,而且這份清單自推出以來一直在增長。
• Hailuo(MiniMax 自家平台):完整產品,包括基於指令的編輯,以及可升級至 2K 的 H3-Regenerate-2K 功能。
• Luma Agents:MiniMax 於 2026 年 8 月 6 日宣布,H3 現已可用於 Luma 的多模型 Agents 產品,可生成長達 15 秒、具原生立體聲的 2K 影片。此為廠商發布的消息,使用條款尚未公開——截至撰寫本文時,Luma 自家的產品文件並未列出 H3——因此定價與資格條件預料很快會明朗。Luma 在其自家 Agents 產品中託管競爭對手的影片模型,正顯示了 2026 年影片模型市場已變得何其可互相替換。
• Vercel AI Gateway:2026年8月30日,MiniMax 與 Vercel 宣布,MiniMax H3 與 MiniMax H3 Max 皆可透過 Vercel 的 AI Gateway 使用,於2026年8月30日至9月13日期間,透過該 Gateway 計費的請求享 50% 折扣。模型 ID — minimax/minimax-h3 與 minimax/minimax-h3-max — 維持不變,因此現有 Gateway 整合無需變更程式碼即可套用折扣費率。可用性已確認於 Vercel 的模型目錄與更新日誌中;促銷條款由廠商公告。
• 開放權重:2026年8月3日,MiniMax 在 Hugging Face 與 ModelScope 上,以 MiniMax H3 Community License 釋出 H3 的基礎權重——一個 33B 密集 Transformer,名為 H3-Base——提供兩個檢查點:H3-Base-FL2VA 用於文字轉影片/音訊及關鍵影格生成,H3-Base-Ref2VA 則用於基於參考的生成。三個系統模組中的兩個——H3-Context-IR(提示詞預處理器)和 H3-Regenerate-2K(2K 放大)——並未包含在開放釋出中,仍僅限 API 使用,因此自架執行的解析度上限低於 2K。此外,自 9 月 1 日起,同一基礎權重可透過 vLLM-Omni 與 FastVideo 的 FastH3 提供即時生成服務——這是一個四步蒸餾適配器,能在 8× NVIDIA B300 伺服器上以約 8.7 秒渲染出完整的 10.1 秒影音 MP4,比其播放時長更快(團隊宣稱,尚未經獨立重現)。
MiniMax H3 已可在 OrcaRouter 上以提供商的牌價取得——768p 每秒 0.08 美元、2K 每秒 0.13 美元——以 0% 加價透傳並具自動容錯移轉,因此您可以透過單一 OpenAI 相容 API 呼叫 H3 系列,而無需自行接上一個才推出沒幾天的廠商端點。由於沒有任何單一供應商託管所有模型,實務模式是讓您的 LLM 與代理程式流量統一通過一個端點(OrcaRouter 也承載 MiniMax 自家的 M3 文字模型),並按專案直接使用最佳的影片模型。MiniMax H3 Max 尚未納入 OrcaRouter 路由——目前是透過第三方管道提供——因此若您要針對它進行原型開發,容錯移轉的習慣會有所回報:試用一個才推出沒幾天的模型,而不必把生產管線押注在它身上。

即時傳輸:影片速度快於播放速度
這次更新背後的開發工作聚焦在自託管端。MiniMax H3 的開放基礎檢查點是一個 33B 的稠密 Transformer;以標準方式生成一段影片片段,意味著要在漫長的去噪排程上執行約 49 次擴散 Transformer 前向傳播。開源影片訓練與推論專案 FastVideo 發布了 H3-Base 的蒸餾學生模型,名為 FastH3:這是一個四步驟(DMD2 風格)模型,重用了 H3 的文字編碼器、影片 VAE、音訊 VAE、分詞器和排程器,但將去噪迴圈縮減為在五個 sigma 位置上的四次 Transformer 前向傳播。多模態服務執行環境 vLLM-Omni 在載入時融合了 FastH3 適配器(pull request #6714),並透過相容 OpenAI 的 /v1/videos 端點將其提供出來,與其先前對 base-H3 的支援並行。
The headline number is measured on large hardware. On an {{1}}8× NVIDIA B300 server{{/1}} at {{2}}1344×768{{/2}} and {{3}}24fps{{/3}}, the vLLM-Omni team reports a complete 10.1-second MP4 — video and synchronized audio — rendered end-to-end in about 8.7 seconds, faster than its playback duration. That is a {{4}}team-reported benchmark{{/4}} published September 1, 2026, and not yet independently reproduced; the team itself notes the raw benchmark bundle is still pending publication and makes no base-vs-FastH3 quality-parity claim. On more modest hardware the numbers are less dramatic — the community recipe also covers 2× RTX 5090 and single-GPU setups — and FastH3 v1 covers text-to-video-audio (T2VA) only, at 1344×768 rather than the 2K that remains API-side. --- 這個標題數字是在大型硬體上測得的。在一台{{1}}8× NVIDIA B300伺服器{{/1}}上,以{{2}}1344×768{{/2}}解析度和{{3}}24fps{{/3}}運行的情況下,vLLM-Omni團隊報告稱,一個完整的10.1秒MP4檔案(包含影片與同步音訊)可以在約8.7秒內完成端到端渲染,比其播放時長還要快。這是一項{{4}}由團隊回報的基準測試{{/4}},發布於2026年9月1日,尚未經獨立重現驗證;團隊本身也指出,原始基準測試套件仍待發布,且並未聲稱基線版本與FastH3之間具有品質同等性。在較普通的硬體上,數字就沒那麼驚人——社群配方也涵蓋2× RTX 5090和單GPU配置——而FastH3 v1僅涵蓋文字轉影片音訊(T2VA),解析度為1344×768,而非仍保留在API端的2K。
對讀者而言,這讓「自行部署 H3」的意義產生了轉變。以前,開放基礎權重雖能運行,但速度很慢——適合批次作業,卻不適合任何互動式用途。有了 vLLM-Omni 上的 FastH3,地端 H3 管線可以在遠比「影片本身長度」更短的時間內處理完一段十秒片段;而這正是即時產品迴圈——即時預覽、快速鏡頭迭代、代理驅動影片——變成可行方案的臨界點。如果你不想自己運行八 GPU 伺服器,代管路線不變:MiniMax H3 在 OrcaRouter 上以供應商定價供應、0% 加價轉傳,並有自動容錯移轉,所以你不需要擁有硬體,就能透過一個 OpenAI 相容 API 呼叫整個 H3 系列。
H3 大放異彩的三種情境
1. 角色和風格一致的短片
Omni-reference(最多9張圖片、3個片段、3個音頻)旨在保持角色、外觀和聲音在多個鏡頭中一致——非常適合敘事短片和連續劇內容。
2. 社群與含音效的廣告素材
一次同步對話、音效與環境音,加上靈活畫面比例(9:16至21:9),適合需要完成音訊而不僅是畫面的快速社交與廣告工作流程。
3. 迭代創意編輯
基於指令的編輯讓團隊可以用描述性方式精煉片段,而不是重新生成,這加快了需要大量修改的製作流程。

常見問題
什麼是MiniMax H3?
H3 是 Hailuo 3.0,MiniMax 最新的 AI 影片生成模型,於 WAIC 2026(2026年7月17日)亮相,並於 2026年7月31日發布。它能從文字或圖片生成帶同步音訊的原生 2K、24fps 影片,並支援全方位參考控制與指令式編輯。
H3 和 MiniMax M3 是同一款嗎?
不。M3 是 MiniMax 的文字/代理型 LLM;H3(Hailuo 3.0)是它的影片生成模型。它們在同一場活動中亮相,但負責不同的工作。
我現在可以在哪裡使用 H3?
四個地方:MiniMax 的 Hailuo 平台(即完整產品)、Vercel 的 AI Gateway(H3 與 MiniMax H3 Max,9 月 13 日前可享上市 5 折優惠)、Luma Agents(2026 年 8 月 6 日發布——最多 15 秒、具原生立體聲的 2K 影片,使用條件尚不明確),以及透過 Hugging Face 與 ModelScope 上的開放 H3-Base 權重自架部署——自 9 月 1 日起,可透過 vLLM-Omni 搭配 FastVideo 的 FastH3,以比即時播放更快的速度提供服務(據 vLLM-Omni 團隊表示,在 8× B300 上,一段 10.1 秒的影音 MP4 只需約 8.7 秒即可生成)。基礎模型也可在 OrcaRouter 上以供應商牌價進行路由。
H3影片的時長和解析度是多少?
原生2K 24fps,每次生成5-15秒,可延長至約30秒,長寬比從21:9到9:16。
什麼是omni-reference?
一個可同時接受最多9張參考圖片、3段影片剪輯和3段音訊剪輯的控制系統,以保持風格、角色、動作和聲音的一致性。
H3 比 Kling 3.0 或 Veo 3.1 更好嗎?
這取決於軸線。Kling 3.0 原生支援 4K,在某些領域領先;Veo 3.1 在 48kHz 對話方面表現強勁。H3 則強調全參考控制、單次音訊、剪輯與價格。H3 早期在 Artificial Analysis 的競技場分數(約八月底時,圖生影片約 1,184 分,文生影片含音訊約 1,226 分)會隨著投票累積而變動——請用你自己的提示詞測試。
H3 是開放權重的嗎?
部分是。MiniMax 於 2026 年 8 月 3 日開源了 H3 的基礎權重——這是一款 33B 參數的 Transformer,以 MiniMax H3 Community License 發布於 Hugging Face 與 ModelScope,並提供 FL2VA 與 Ref2VA 檢查點。根據 MiniMax 的授權條款,此次發布限制部署地區,限制範圍亦延伸至生成輸出,且需標註出處。構成旗艦體驗的另外兩個模組——H3-Context-IR(提示詞預處理)與 H3-Regenerate-2K(2K 放大)——並未包含在開放發布中,仍僅限 API 使用。自 9 月 1 日起,開放的基礎權重也可透過 vLLM-Omni 與 FastVideo 的 FastH3 提供即時生成服務(FastH3 v1 僅支援文字轉影片與音訊)。所以,就基礎模型而言,答案是肯定的,但附有條件。
底線
MiniMax H3 (Hailuo 3.0) 是 MiniMax 影片產品線的一次重大升級:原生 2K、單次生成即同步的音訊、充裕的全參考控制,以及指令式編輯,而且價格親民。自推出以來,它也變得大幅更容易取得——目前可透過 OrcaRouter 以供應商列表價格進行路由,可在 Luma Agents 內執行,基礎權重也已開放可自行託管(自 9 月 1 日起,透過 vLLM-Omni 與 FastVideo 的 FastH3,渲染一段 10.1 秒的片段已比實際播放還要快),而且它與 MiniMax H3 Max 現已上架 Vercel 的 AI Gateway,並提供兩週 50% 的上市折扣。它不會自動在解析度上勝過那些主打原生 4K 的競爭對手,其早期的競技場分數也仍在鞏固中——但在控制力、音訊與迭代速度方面,它極具吸引力。建議你用自有素材,將 H3 與 Kling 3.0、Veo 3.1、Seedance 2.0 及其他方案一併評測,並透過 OrcaRouter 這類單一端點,讓你更廣泛的模型技術組合保持供應商中立。
