
MiniMax H3(Hailuo 3.0):全方位参照を備えた2K AI動画モデルの解説
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
MiniMax H3(通称Hailuo 3.0)は、MiniMaxの最新のAI動画生成モデルであり、2026年7月17日にWAIC 2026で発表され、7月31日に一般公開された。現在は、MiniMaxのHailuoプラットフォーム、Luma Agents、オープンウェイトでのダウンロード、そして8月30日からはVercelのAI Gatewayという4つの方法で同時に利用できる。このAI Gatewayでは、新しい速度優先のMiniMax H3 Maxも併せてローンチされた。これは、MiniMaxの動画ラインをネイティブ2K解像度へ押し上げ、1パスで同期音声を追加し、異例にリッチな「オムニリファレンス」制御システムを導入する。最新の進展はセルフホスティング側にある。9月1日以降、オープンなH3-Baseウェイトは、FastVideoのFastH3を備えたvLLM-Omniを通じて提供できる。FastH3は、10.1秒の完全な動画・音声MP4を約8.7秒でレンダリングできるほど高速であり、これは再生時間よりも速い。本ガイドでは、H3が実際に何であるか、何が本当に新しいのか、そして2026年のフロンティア動画モデルの中でどこに位置するのかを説明する。機能は情報源を明記し、品質に関する主張は明確にラベル付けされている。
正確性に関する注記:H3の機能は、MiniMaxの発表とプラットフォームのドキュメントに基づいています。Vercel AI Gatewayでの利用可能性は確認済みです — VercelのモデルカタログにはMiniMax H3とMiniMax H3 Maxの両方が掲載され、Vercelのチェンジログにはローンチ割引が記載されています — ただし、プロモーション条件自体はベンダーによる発表です。Luma Agentsとの統合とオープンウェイトでのリリースは、本稿執筆時点ではベンダーによる発表のみです。Luma自身のプロダクトドキュメントにはまだH3が掲載されておらず、統合のアクセス条件も不明瞭です。映像品質は主観的な部分が大きく、人間の好みによるアリーナ評価で判断されます。H3は現在、Artificial Analysisアリーナの初期スコアを獲得しています — image-to-videoで約1,184、音声付きtext-to-videoで約1,226(2026年8月27日時点)— ただし、アリーナのランキングは投票の蓄積に応じて変動します。9月1日時点の「再生速度を超えるサービング」の数値 — 同期された音声付きの完全な10.1秒MP4を約8.7秒でレンダリング — は、vLLM-Omniチームが自社のブログ記事で報告しており、8× NVIDIA B300サーバー(NVIDIA B300を8基搭載)上で測定されました。これはチーム自身によるベンチマークであり、まだ独立に再現されておらず、また測定対象はFastVideoの4ステップ蒸留アダプターであるFastH3であり、ベースモデルそのものではありません。「どれが最も見栄えが良いか」といった比較に関する主張は暫定的なものとして扱ってください。仕様と価格は変更されます — 構築する前に確認してください。
TL;DR. H3は、テキストまたは画像から、ネイティブ2K・24fpsの5〜15秒(約30秒まで延長可能)クリップを、同期した台詞・効果音・環境音付きでワンパス生成するモデルです。特筆すべき機能は、オムニリファレンス(一貫性を保つため最大9枚の参照画像、3本の動画クリップ、3つの音声クリップを使用)と、指示ベースの編集(再生成せずにキャラクター、オブジェクト、シーン、音声、テンポを変更可能)です。 リリース以来、急速に普及しています。ベースウェイトは8月3日にオープン化され、MiniMaxは8月6日にLuma AgentsでのH3対応を発表しました(最大15秒の2K動画とネイティブステレオサウンドに対応。アクセス条件はまだ公開されていません)。8月30日には、MiniMax H3とMiniMax H3 MaxがVercelのAI Gatewayに登場し、2週間限定の50%ローンチ割引が適用されています。9月1日以降は、オープンなベースウェイトをリアルタイム生成にも利用できます。vLLM-OmniとFastVideoのFastH3を介せば、動画と音声を含む完全な10.1秒のMP4が約8.7秒でレンダリングされます(再生時間より高速。vLLM-Omniチームのベンチマークによる)。 これはHailuo 2.3(1080p・約10秒・オムニリファレンスなし)からの大きな前進であり、Kling 3.0、Google Veo 3.1、ByteDance Seedance 2.0などと競合します。制御性と音声に強みがあり、初期の独立系アリーナスコアはまだ固まっていません。
重要なポイント
• H3 = Hailuo 3.0、MiniMax の最新ビデオモデル。WAIC 2026 で発表され、7月31日にリリース。Hailuo、Luma Agents、オープンウェイト、Vercel の AI Gateway から利用可能。
• 24fpsでのネイティブ2K、5~15秒のクリップ(約30秒まで延長可能)、複数のアスペクト比、テキストから動画および画像から動画。
• オムニリファレンス:スタイル、キャラクター、動き、音声の一貫性のための参照として、最大9枚の画像、3つのビデオクリップ、3つのオーディオクリップ。
• 同期された台詞、効果音、環境音が1パスで生成され、完全再生成なしで指示ベースの編集が可能。
• ベースウェイトは8月3日にコミュニティライセンスの下でオープンソース化されました。Context-IRおよび2K-regenerationモジュールは引き続きAPI限定です。
8月30日、MiniMax H3およびMiniMax H3 MaxがVercelのAI Gatewayにてローンチし、9月13日まで50%のローンチ割引が適用されます。
• 9月1日以降、オープンなH3-Baseウェイトをリアルタイム生成に利用できます。10.1秒の映像・音声MP4が約8.7秒でレンダリングされ、再生速度よりも高速です(vLLM-OmniとFastVideoのFastH3経由。チーム報告によるベンチマークであり、まだ第三者による再現はされていません)。
• Hailuo 2.3(1080p、約10秒)からの大幅なアップグレード。Kling 3.0、Veo 3.1、Seedance 2.0、Wan 2.7などと競合します。
MiniMax H3 とは実際には何か
MiniMaxは中国の大手AI企業である(2026年1月に香港IPOを完了し、約6億1900万ドルを調達、評価額は約40億ドルと報じられており、出資者にはAlibabaとTencentが含まれる)。その消費者向け動画ブランドはHailuoであり、カテゴリーをリードする物理シミュレーション、高速生成、手頃な価格で知られている。H3は第3世代のHailuoモデルであり、WAIC 2026でMiniMaxのM3テキストモデルや他のマルチモーダルソリューションとともに発表され、2026年7月31日に一般公開された。M3がテキスト/エージェント型LLMであるのに対し、H3はまさに動画生成モデルである。
新機能: 2K、オムニリファレンス、ワンパスオーディオ
H3は3つの要素で定義されます。まず、24fpsのネイティブ2K—Hailuo 2.3の1080pからのステップアップであり、映画標準のフレームレートで、5秒から15秒のクリップ(Extendツールを使用して約30秒まで延長可能)、21:9から9:16のアスペクト比に対応しています。第二に、omni-reference:最大9枚の参照画像、3つのビデオクリップ、3つのオーディオクリップを同時に供給して、スタイル、キャラクターのアイデンティティ、動き、または声を固定できます。これは、ショット間でキャラクターやルックを一貫させるための非常に豊富なコントロールサーフェスです。第三に、シングルパスでの同期オーディオ:H3は、画面上のアクションにタイミングを合わせて、ダイアログ、効果音、および周囲の雰囲気を生成します。別個のオーディオステップは必要ありません。

指示ベースの編集
静かに重要な機能は、指示ベースの編集です。変更を加えるためにクリップを最初から再生成する代わりに、編集内容を記述することができます。キャラクターの交換、オブジェクトの変更、シーンの変更、サウンドの調整、またはショットのリペースなど、H3がそれを適用します。反復的なクリエイティブ作業において、新しい生成でサイコロを振り直すのではなく、その場で編集することは、真のワークフローの利点です。
Hailuo 2.3 との比較
世代間の飛躍は明白です。H3は1080pからネイティブ2Kに移行し、最大単一生成長さを約10秒から15秒に延長し(30秒の延長オプションあり)、さらに2.3に欠けていたomni-reference inputsとinstruction-based editingの両方を追加しました。Hailuo 2.3を使用していた場合、H3は解像度、長さ、制御、およびオーディオにおいて明らかなアップグレードです。
2026年のフロンティアにおけるH3の位置
H3は現在、Artificial Analysisアリーナの初期スコアを掲載しています — 画像から動画への変換で約1,184、音声付きテキストから動画への変換で約1,226(2026年8月27日時点)— ただし、アリーナのランキングは投票の蓄積に応じて変動するため、単一の主張ではなく、ご自身のテストプロンプトで判断してください。
OpenAI Soraに関するノート
フィールドをマッピングしているなら:OpenAIは2026年4月にSoraのウェブおよびアプリ体験を終了し、APIは2026年9月に終了予定です。つまりSoraは新しい動画ワークフローを始めるためのモデルではありません。現在の最前線は上記のセットであり、H3がそれに加わります。
H3とその他のフィールドにアクセスする方法
H3には現在4つの方法でアクセスできるようになり、その数はローンチ以来増加しています。
• Hailuo(MiniMax独自のプラットフォーム):インストラクションベースの編集とH3-Regenerate-2Kによる2Kへのアップスケールを含む完全な製品。
• {{1}}Luma Agents{{/1}}: {{2}}MiniMax{{/2}}は2026年8月6日、{{3}}H3{{/3}}が{{4}}LumaのマルチモデルAgents製品{{/4}}で利用可能になり、最大{{5}}15秒の2Kビデオ{{/5}}を{{6}}ネイティブステレオ音声{{/6}}付きで生成できると発表しました。これは{{7}}ベンダー発表{{/7}}であり、アクセス条件はまだ公開されていません。本稿執筆時点では{{8}}Luma自身の製品ドキュメント{{/8}}にH3は記載されていないため、{{9}}価格と利用資格の詳細{{/9}}は間もなく確定する見込みです。{{10}}Lumaが自社のAgents製品内で競合他社のビデオモデルをホストしている{{/10}}ことは、2026年のビデオモデル市場がどれほど代替可能になったかを示しています。
• Vercel AI Gateway: 2026年8月30日、MiniMaxとVercelは、MiniMax H3とMiniMax H3 Maxの両方がVercelのAI Gatewayを通じて利用可能になったことを発表しました。2026年8月30日から9月13日まで、ゲートウェイ経由のリクエストは50%割引で請求されます。モデルID(minimax/minimax-h3 および minimax/minimax-h3-max)は変更されていないため、既存のゲートウェイ統合はコード変更なしで割引料金が適用されます。利用可能性はVercelのモデルカタログとチェンジログで確認されています。プロモーション条件はベンダーから発表されたものです。
• オープンウェイト:2026年8月3日、MiniMaxはH3のベースウェイト(33Bの高密度トランスフォーマー、H3-Base)をHugging FaceとModelScopeで「MiniMax H3 Community License」の下に公開しました。チェックポイントは2つあり、テキストからビデオ/オーディオおよびキーフレーム生成を行うH3-Base-FL2VAと、参照ベース生成用のH3-Base-Ref2VAです。3つのシステムモジュールのうち2つ(プロンプト前処理を行うH3-Context-IRと2KアップスケールのH3-Regenerate-2K)はオープンリリースには含まれず、API専用のままなので、自己ホスト型の実行は2K未満に制限されます。さらに9月1日以降、同じベースウェイトをvLLM-OmniおよびFastVideoのFastH3を通じてリアルタイム生成に利用できます。FastH3は4ステップの蒸留アダプターであり、8×NVIDIA B300サーバー上で、完全な10.1秒のビデオおよびオーディオMP4を約8.7秒でレンダリングします。これは再生時間よりも高速です(チーム報告によるもので、まだ独立して再現されていません)。
MiniMax H3は、プロバイダーの定価でOrcaRouterに搭載されています — 768pでは1秒あたり$0.08、2Kでは1秒あたり$0.13 — 0%マークアップで透過的に提供され、自動フェイルオーバーも備えているため、数日前に登場したばかりのベンダーエンドポイントを接続する代わりに、H3ファミリーを1つのOpenAI互換APIから呼び出すことができます。単一のプロバイダーがすべてのモデルをホストしているわけではないため、実際的なパターンは、LLMとエージェントのトラフィックを1つのエンドポイント(OrcaRouterはMiniMax独自のM3テキストモデルも扱っています)に通し、プロジェクトごとに最適なビデオモデルを直接使用することです。MiniMax H3 MaxはまだOrcaRouterでルーティングされていません — 現在はサードパーティのチャネルを通じて提供されています — そのため、これを対象にプロトタイピングする場合は、フェイルオーバーの習慣が役立ちます。数日前に登場したばかりのモデルを、本番パイプラインを賭けずに試すことができます。

リアルタイム配信:再生より速いビデオ
このアップデートの開発は、セルフホスティング側に焦点を当てたものです。MiniMax H3のオープンベースチェックポイントは33Bのデンストランスフォーマーであり、標準的な方法でクリップを生成するには、長いデノイジングスケジュールにわたって約49回の拡散トランスフォーマーフォワードを実行することになります。オープンソースのビデオトレーニング・推論プロジェクトであるFastVideoは、H3-Baseの蒸留版であるFastH3を公開しました。これは4ステップ(DMD2スタイル)のモデルで、H3のテキストエンコーダー、ビデオVAE、オーディオVAE、トークナイザー、スケジューラーを再利用しつつ、デノイジングループを5つのシグマ位置に対する4回のトランスフォーマーフォワードに削減しています。マルチモーダルサービングランタイムであるvLLM-Omniは、ロード時にFastH3アダプターを融合し(プルリクエスト#6714)、これをOpenAI互換の/v1/videosエンドポイントを通じて公開します。これは従来のベースH3サポートに加えての対応です。
見出しの数字は、大規模なハードウェア上で測定されたものです。NVIDIA B300を8基搭載したサーバー上で、1344×768・24fpsの条件下において、vLLM-Omniチームは、映像と同期した音声を含む完全な10.1秒のMP4を、エンドツーエンドで約8.7秒でレンダリングしたと報告しています。これは再生時間(10.1秒)よりも高速です。これは2026年9月1日に公表された、チーム報告によるベンチマークであり、まだ第三者による独立した再現は行われていません。チーム自身も、生のベンチマーク一式がまだ公表待ちであると述べており、ベースモデルとFastH3の品質同等性については主張していません。より控えめなハードウェアでは、数値はそれほど劇的ではありません。コミュニティのレシピは、2× RTX 5090構成やシングルGPU構成にも対応しています。また、FastH3 v1が対応するのはテキストから映像・音声を生成するT2VAのみで、解像度も、API側に残されている2Kではなく1344×768です。
{{1}}読者にとって、これは「H3のセルフホスティング」が意味し得るものを変える。以前は、オープンなベースウェイトでも動作はしたが低速で、バッチ処理には適していても、インタラクティブな用途には向かなかった。vLLM-Omni上のFastH3を使えば、オンプレミスのH3パイプラインは10秒のクリップを、そのクリップの再生時間を大きく下回る時間で処理できる。これは、リアルタイムのプロダクトループ(ライブでのプリビジュアライゼーション、ショットの迅速な反復、エージェント駆動のビデオ)が実用になる閾値である。{{/1}} {{2}}8基のGPUサーバーを運用したくないのであれば、マネージドの経路も従来どおりだ。MiniMax H3はOrcaRouter上でプロバイダーの定価のまま提供され、マークアップ0%の透過的な中継と自動フェイルオーバーが適用される。したがって、ハードウェアを所有せずとも、OpenAI互換の単一APIを通じてH3ファミリーを呼び出せる。{{/2}}
H3が輝く3つのシナリオ
1. キャラクターとスタイルが一貫した短編映画
オムニリファレンス(最大9枚の画像、3つのクリップ、3つの音声)は、複数のショットにわたってキャラクター、外見、声を一貫させるために作られています。ナラティブショートやエピソードコンテンツに最適です。
2. 音声付きソーシャルおよび広告クリエイティブ
ワンパスで同期されたダイアログ、SFX、アンビエンス、さらに柔軟なアスペクト比(9:16から21:9)は、完成したオーディオ(映像だけでなく)を必要とする迅速なソーシャルおよび広告ワークフローに適しています。
3. 反復的な創造的編集
指示ベースの編集により、チームはクリップを再生成する代わりに説明を使って洗練できるため、修正の多い制作が高速化されます。

よくある質問
MiniMax H3とは何ですか?
H3はHailuo 3.0、MiniMaxの最新AI動画生成モデルで、WAIC 2026(2026年7月17日)で発表され、2026年7月31日にリリースされました。テキストまたは画像から、同期オーディオ付きのネイティブ2K・24fps動画を生成し、オムニリファレンス制御と指示ベースの編集に対応しています。
H3はMiniMax M3と同じですか?
いいえ、M3はMiniMaxのテキスト/エージェント型LLMです。H3(Hailuo 3.0)はその動画生成モデルです。これらは同じイベントで発表されましたが、役割は異なります。
H3は今どこで使えますか?
4つの場所:MiniMaxのHailuoプラットフォーム(フル製品)、VercelのAI Gateway(H3とMiniMax H3 Maxの両方、9月13日まで50%のローンチ割引あり)、Luma Agents(2026年8月6日発表 — ネイティブステレオサウンド付きの最大15秒の2Kビデオ、アクセス条件はまだ不明)、そしてHugging FaceとModelScope上のオープンなH3-Baseウェイトによるセルフホスティング — これは9月1日以降、FastVideoのFastH3を使ったvLLM-Omniを通じて、再生速度より速い速度で提供できる(vLLM-Omniチームによると、8× B300で約8.7秒で10.1秒のビデオ&オーディオMP4)。ベースモデルはOrcaRouterでもプロバイダー定価でルーティングされる。
H3クリップの長さと解像度はどのくらいですか?
ネイティブ2K、24fps、ジェネレーションごとに5~15秒、約30秒まで延長可能、アスペクト比は21:9から9:16まで。
omni-referenceとは何ですか?
最大9枚の参照画像、3本の動画クリップ、3本の音声クリップを同時に受け付け、スタイル、キャラクター、動き、音声の一貫性を保つ制御システム。
H3はKling 3.0やVeo 3.1よりも優れていますか?
軸によって異なります。Kling 3.0はネイティブ4Kに対応し、いくつかのアリーナでリードしています。Veo 3.1は48kHzの対話音声に強みがあります。H3はオムニリファレンス制御、ワンパスオーディオ、編集機能、そして価格を重視しています。H3にはArtificial Analysisアリーナの初期スコア(8月下旬時点で画像から動画が約1,184、音声付きテキストから動画が約1,226)があり、これらは投票が蓄積されるにつれて変動します。ご自身のプロンプトでテストしてみてください。
H3はオープンウェイトですか?
部分的にそうです。MiniMaxは2026年8月3日、H3のベースウェイトをオープンソース化しました。これは33Bパラメータのトランスフォーマーで、MiniMax H3 Community LicenseのもとでHugging FaceとModelScopeに公開され、FL2VAおよびRef2VAチェックポイントが含まれています。MiniMaxのライセンス条項によれば、このリリースは展開地域を制限し、生成された出力にも適用が及ぶほか、帰属表示が求められます。フラッグシップ体験を完成させる2つのモジュール、H3-Context-IR(プロンプト前処理)とH3-Regenerate-2K(2Kアップスケール)は、オープンリリースには含まれておらず、API専用のままです。9月1日以降、オープンなベースウェイトは、vLLM-OmniおよびFastVideoのFastH3を通じてリアルタイム生成にも利用できます(FastH3 v1はテキストからビデオオーディオへの生成のみに対応)。つまり、ベースモデルに関しては、条件付きでイエスということです。
結論
MiniMax H3(Hailuo 3.0)は、MiniMaxの動画ラインにとって本格的なステップアップである。ネイティブ2K、ワンパスでの同期オーディオ、充実したオムニリファレンス制御、指示ベースの編集を、手頃な価格で実現している。ローンチ以来、その入手しやすさも劇的に向上した。OrcaRouter上でプロバイダー定価のままルーティングされ、Luma Agents内でも動作し、ベースウェイトはセルフホスティング用に公開されている(さらに9月1日以降は、vLLM-OmniとFastVideoのFastH3により、10.1秒のクリップを再生時間より速くレンダリングできるまでに高速化されている)。また、H3とMiniMax H3 Maxは現在、VercelのAI Gateway上で、2週間の50%ローンチ割引付きで利用できる。ネイティブ4Kを掲げる競合を、解像度の面で自動的に凌ぐわけではないし、初期のアリーナスコアもまだ固まりつつある。だが、制御性、音声、イテレーション速度の点では説得力がある。H3をKling 3.0、Veo 3.1、Seedance 2.0などと、自分の映像で比較評価し、より広範なモデルスタックは、OrcaRouterのような単一エンドポイントを通じてベンダーニュートラルに保とう。
