
MiniMax H3 (Hailuo 3.0): Model Video AI 2K dengan Omni-Reference, Dijelaskan
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
MiniMax H3 — lebih dikenal sebagai Hailuo 3.0 — adalah model pembuatan video AI terbaru dari MiniMax, diluncurkan di WAIC 2026 (17 Juli 2026), dirilis ke publik pada 31 Juli, dan kini tersedia dalam empat cara sekaligus: platform Hailuo milik MiniMax, Luma Agents, unduhan bobot terbuka, dan — sejak 30 Agustus — AI Gateway milik Vercel, yang juga meluncurkan MiniMax H3 Max yang mengutamakan kecepatan. Model ini mendorong lini video MiniMax ke resolusi 2K native, menambahkan audio tersinkronisasi dalam satu proses, dan menghadirkan sistem kontrol "omni-reference" yang luar biasa kaya. Perkembangan terbaru ada di sisi self-hosting: sejak 1 September, bobot H3-Base yang terbuka dapat disajikan melalui vLLM-Omni dengan FastVideo's FastH3 yang cukup cepat untuk merender MP4 video-dan-audio lengkap berdurasi 10,1 detik dalam sekitar 8,7 detik — lebih cepat dari durasi pemutarannya. Panduan ini menjelaskan apa sebenarnya H3, apa yang benar-benar baru, dan di mana posisinya di antara model video frontier 2026 — dengan kemampuan yang bersumber dan klaim kualitas yang diberi label jelas.
Catatan akurasi: Klaim tentang kemampuan H3 bersumber dari pengumuman MiniMax dan dokumentasi platform. Ketersediaan H3 di Vercel AI Gateway telah terkonfirmasi — katalog model Vercel mencantumkan MiniMax H3 dan MiniMax H3 Max, serta changelog Vercel mendokumentasikan diskon peluncurannya — meskipun ketentuan promo itu sendiri diumumkan oleh vendor. Integrasi Luma Agents dan perilisan model open-weight masih sebatas pengumuman vendor hingga tulisan ini dibuat; dokumentasi produk Luma sendiri belum mencantumkan H3, dan ketentuan akses integrasi tersebut belum jelas. Kualitas video sebagian besar bersifat subjektif dan dinilai dalam arena preferensi manusia; H3 kini memiliki skor awal arena Artificial Analysis — sekitar 1.184 untuk image-to-video dan 1.226 untuk text-to-video dengan audio, yang dicatat pada 27 Agustus 2026 — meskipun peringkat arena dapat bergeser seiring bertambahnya jumlah voting. Angka serving yang lebih cepat daripada pemutaran (faster-than-playback) pada 1 September — MP4 utuh berdurasi 10,1 detik dengan audio tersinkronisasi yang dirender dalam sekitar 8,7 detik — dilaporkan oleh tim vLLM-Omni dalam posting blog mereka sendiri, diukur pada server 8× NVIDIA B300; angka ini merupakan tolok ukur dari tim tersebut yang belum direproduksi secara independen, dan tolok ukur ini mengukur FastH3, adapter distilasi empat langkah dari FastVideo, bukan untuk model dasar sepenuhnya. Anggaplah klaim komparatif soal “mana yang terlihat terbaik” bersifat sementara. Spesifikasi dan harga dapat berubah — verifikasi sebelum Anda membangun.
TL;DR. H3 adalah model teks-ke-video dan gambar-ke-video native-2K, 24fps, yang membuat klip 5–15 detik (dapat diperpanjang hingga ~30 detik) dengan dialog, efek suara, dan ambience yang tersinkronisasi dalam satu proses. Fitur unggulannya adalah omni-reference (hingga 9 gambar referensi, 3 klip video, dan 3 klip audio untuk konsistensi) serta pengeditan berbasis instruksi (ubah karakter, objek, adegan, suara, atau tempo tanpa membuat ulang). Sejak peluncurannya, penyebarannya cepat: bobot dasar (base weights) dibuka pada 3 Agustus, MiniMax mengumumkan H3 di Luma Agents pada 6 Agustus (hingga 15 detik video 2K dengan audio stereo native, meski ketentuan aksesnya belum dipublikasikan), dan pada 30 Agustus MiniMax H3 dan MiniMax H3 Max tersedia di AI Gateway Vercel dengan diskon peluncuran 50% selama dua minggu. Sejak 1 September, bobot dasar terbuka juga dapat digunakan untuk generasi real-time: melalui vLLM-Omni dengan FastH3 dari FastVideo, MP4 video-dan-audio lengkap berdurasi 10,1 detik dapat dirender dalam sekitar 8,7 detik — lebih cepat daripada durasi pemutarannya, menurut tolok ukur tim vLLM-Omni. Ini langkah besar dibandingkan Hailuo 2.3 (yang 1080p, ~10 detik, tanpa omni-reference), dan bersaing dengan Kling 3.0, Google Veo 3.1, ByteDance Seedance 2.0, dan lainnya — kuat dalam kontrol dan audio, dengan skor arena independen awal yang masih perlu dikokohkan.
Poin-poin penting
• H3 = Hailuo 3.0, model video terbaru MiniMax, diperkenalkan di WAIC 2026 dan dirilis pada 31 Juli; tersedia melalui Hailuo, Luma Agents, open weights, dan AI Gateway Vercel.
• Native 2K pada 24fps, klip 5–15 detik (dapat diperpanjang hingga ~30 detik), beberapa rasio aspek, teks-ke-video dan gambar-ke-video.
• Referensi omniguna: hingga 9 gambar, 3 klip video, dan 3 klip audio sebagai referensi untuk konsistensi gaya, karakter, gerakan, dan suara.
• Dialog yang disinkronkan, SFX, dan suasana dihasilkan dalam satu proses; pengeditan berbasis instruksi tanpa regenerasi penuh.
• Bobot dasar diopen-sourcekan pada 3 Agustus di bawah lisensi komunitas; modul Context-IR dan 2K-regeneration tetap hanya dapat diakses melalui API.
Pada 30 Agustus, MiniMax H3 dan MiniMax H3 Max diluncurkan di AI Gateway Vercel dengan diskon peluncuran 50% hingga 13 September.
Sejak 1 September, bobot H3-Base yang terbuka dapat digunakan untuk generasi real-time — sebuah MP4 berdurasi 10,1 detik yang memuat video dan audio serta dirender dalam sekitar 8,7 detik, lebih cepat daripada pemutaran — melalui vLLM-Omni dan FastH3 dari FastVideo (benchmark yang dilaporkan oleh tim, belum direproduksi secara independen).
• Peningkatan besar dibandingkan Hailuo 2.3 (1080p, ~10 detik); bersaing dengan Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7, dan lainnya.
Apa sebenarnya MiniMax H3 itu
MiniMax adalah perusahaan AI besar asal Tiongkok (menyelesaikan IPO di Hong Kong pada Januari 2026, dilaporkan mengumpulkan sekitar $619 juta dengan valuasi sekitar $4 miliar, dengan pendukung termasuk Alibaba dan Tencent). Merek video konsumennya adalah Hailuo, yang dikenal dengan simulasi fisika terdepan di kategorinya, pembuatan cepat, dan harga terjangkau. H3 adalah model Hailuo generasi ketiga, diluncurkan bersamaan dengan model teks M3 milik MiniMax dan solusi multimodal lainnya di WAIC 2026 serta dirilis untuk publik pada 31 Juli 2026. Jika M3 adalah LLM teks/agentic, H3 adalah model pembuatan video.
Apa yang baru: 2K, omni-reference, dan audio satu pass.
Tiga hal mendefinisikan H3. Pertama, 2K asli pada 24fps — sebuah peningkatan dari 1080p milik Hailuo 2.3 — pada irama standar film, dengan klip dari 5 hingga 15 detik (dapat diperpanjang hingga sekitar 30 detik melalui alat Extend) dan rasio aspek dari 21:9 hingga 9:16. Kedua, omni-reference: Anda dapat memasukkan hingga 9 gambar referensi, 3 klip video, dan 3 klip audio secara bersamaan untuk mengunci gaya, identitas karakter, gerakan, atau suara — antarmuka kontrol yang sangat murah hati untuk menjaga karakter atau tampilan konsisten di seluruh bidikan. Ketiga, audio tersinkronisasi dalam satu kali proses: H3 menghasilkan dialog, efek suara, dan atmosfer ambient yang disesuaikan dengan aksi di layar, daripada memerlukan langkah audio terpisah.

Pengeditan berbasis instruksi
Fitur yang penting secara diam-diam adalah pengeditan berbasis instruksi: alih-alih membuat ulang klip dari awal untuk melakukan perubahan, Anda dapat mendeskripsikan suntingan — mengganti karakter, mengubah objek, mengubah latar, menyesuaikan suara, atau mengatur ulang tempo pengambilan gambar — dan H3 menerapkannya. Untuk pekerjaan kreatif yang berulang, mengedit di tempat daripada mengocok ulang dadu pada generasi baru adalah keuntungan alur kerja yang nyata.
Bagaimana perbandingannya dengan Hailuo 2.3
Lompatan generasi jelas: H3 beralih dari 1080p ke 2K asli, memperpanjang panjang generasi tunggal maksimum dari sekitar 10 detik menjadi 15 (dengan perpanjangan 30 detik), dan menambahkan baik input omni-referensi maupun pengeditan berbasis instruksi, yang tidak dimiliki 2.3. Jika Anda menggunakan Hailuo 2.3, H3 adalah peningkatan langsung pada resolusi, panjang, kontrol, dan audio.
Posisi H3 dalam frontier 2026
H3 kini membawa skor awal arena Artificial Analysis — sekitar 1,184 untuk image-to-video dan 1,226 untuk text-to-video dengan audio, dicatat pada 27 Agustus 2026 — meskipun peringkat arena bergeser seiring bertambahnya suara, jadi nilailah dengan prompt uji Anda sendiri daripada mengandalkan klaim tunggal mana pun.
Catatan tentang OpenAI Sora
Jika Anda memetakan bidang ini: OpenAI menghentikan versi web dan aplikasi Sora pada April 2026, dengan API-nya dijadwalkan berakhir pada September 2026 — jadi Sora bukan model yang sebaiknya dipakai untuk memulai alur kerja video baru. Yang masih menjadi garis terdepan adalah kumpulan di atas, dan H3 ikut bergabung.
Cara mengakses H3 dan sisa lapangan
H3 kini dapat diakses melalui empat cara, dan daftar itu telah bertambah sejak peluncuran.
• Hailuo (platform milik MiniMax): produk lengkap, termasuk pengeditan berbasis instruksi dan peningkatan H3-Regenerate-2K hingga 2K.
• Luma Agents: MiniMax mengumumkan pada 6 Agustus 2026 bahwa H3 kini tersedia dalam produk Agents multi-model Luma, yang menghasilkan hingga 15 detik video 2K dengan suara stereo asli. Ini diumumkan oleh vendor, dan ketentuan aksesnya belum dipublikasikan — dokumentasi produk Luma sendiri belum mencantumkan H3 saat tulisan ini dibuat — jadi detail harga dan kelayakan diperkirakan akan segera dipastikan. Luma yang menghosting model video pesaing di dalam produk Agents-nya sendiri menjadi tanda betapa mudahnya model-model video di pasar 2026 saling menggantikan.
• Vercel AI Gateway: pada 30 Agustus 2026, MiniMax dan Vercel mengumumkan bahwa MiniMax H3 dan MiniMax H3 Max tersedia melalui AI Gateway Vercel, dengan permintaan yang ditagih melalui gateway tersebut mendapat diskon 50% dari 30 Agustus hingga 13 September 2026. ID model — minimax/minimax-h3 dan minimax/minimax-h3-max — tidak berubah, sehingga integrasi gateway yang ada langsung mendapat tarif diskon tanpa perubahan kode. Ketersediaan dikonfirmasi dalam katalog model dan changelog Vercel; ketentuan promo diumumkan oleh vendor.
• Berat terbuka: pada 3 Agustus 2026, MiniMax merilis bobot dasar H3 — sebuah transformer padat 33B, H3-Base — di Hugging Face dan ModelScope di bawah Lisensi Komunitas MiniMax H3, sebagai dua checkpoint: H3-Base-FL2VA untuk pembuatan teks-ke-video/audio dan keyframe, dan H3-Base-Ref2VA untuk pembuatan berbasis referensi. Dua dari tiga modul sistem — H3-Context-IR (preprocessor prompt) dan H3-Regenerate-2K (upscale 2K) — tidak termasuk dalam rilis terbuka dan tetap khusus API, sehingga proses self-hosted dibatasi di bawah 2K. Dan sejak 1 September, bobot dasar yang sama dapat digunakan untuk generasi real-time melalui vLLM-Omni dan FastH3 dari FastVideo — sebuah adapter distilasi empat langkah yang merender MP4 video-dan-audio lengkap 10,1 detik dalam sekitar 8,7 detik di server 8× NVIDIA B300, lebih cepat dari durasi pemutarannya (dilaporkan tim, belum direproduksi secara independen).
MiniMax H3 tersedia di OrcaRouter dengan harga daftar penyedia — $0,08 per detik pada 768p dan $0,13 per detik pada 2K — diteruskan dengan markup 0% dan failover otomatis, sehingga Anda dapat memanggil keluarga H3 melalui satu API yang kompatibel dengan OpenAI, alih-alih menghubungkan endpoint vendor yang baru berumur beberapa hari. Karena tidak ada satu penyedia pun yang menghosting semua model, pola praktisnya adalah menjalankan lalu lintas LLM dan agen Anda melalui satu endpoint (OrcaRouter juga membawa model teks M3 milik MiniMax sendiri) dan menggunakan model video terbaik per proyek secara langsung. MiniMax H3 Max belum dirutekan di OrcaRouter — untuk saat ini dilayani melalui saluran pihak ketiga — jadi jika Anda membuat prototipe dengannya, kebiasaan failover akan terbayar: coba model yang baru berumur beberapa hari tanpa mempertaruhkan pipeline produksi padanya.

Penyajian real-time: video lebih cepat daripada pemutaran
Perkembangan di balik pembaruan ini berada di sisi self-hosting. Checkpoint dasar sumber terbuka MiniMax H3 adalah transformer padat 33B, dan menghasilkan klip dengan cara standar berarti menjalankan sekitar 49 forward diffusion-transformer melalui jadwal denoising yang panjang. FastVideo, proyek sumber terbuka untuk pelatihan dan inferensi video, menerbitkan model siswa terdistilasi dari H3-Base bernama FastH3: model empat langkah (bergaya DMD2) yang menggunakan kembali text encoder milik H3, VAE video, VAE audio, tokenizer, dan scheduler, tetapi memangkas loop denoising menjadi empat forward transformer pada lima posisi sigma. vLLM-Omni, runtime penyajian multimodal, menggabungkan adaptor FastH3 saat dimuat (pull request #6714) dan mengeksposnya melalui endpoint /v1/videos yang kompatibel dengan OpenAI, di samping dukungan base-H3 yang ada sebelumnya.
Angka utamanya diukur pada perangkat keras berskala besar. Pada server 8× NVIDIA B300 dengan resolusi 1344×768 dan 24 fps, tim vLLM-Omni melaporkan MP4 lengkap berdurasi 10,1 detik — video dan audio yang tersinkronisasi — yang dirender end-to-end dalam sekitar 8,7 detik, lebih cepat daripada durasi pemutarannya. Ini adalah benchmark yang dilaporkan tim dan dipublikasikan pada 1 September 2026, serta belum direproduksi secara independen; tim tersebut sendiri mencatat bahwa paket benchmark mentahnya masih menunggu publikasi dan tidak membuat klaim paritas kualitas antara base dan FastH3. Pada perangkat keras yang lebih sederhana, angkanya tidak terlalu dramatis — resep komunitas juga mencakup pengaturan 2× RTX 5090 dan GPU tunggal — dan FastH3 v1 hanya mendukung text-to-video-audio (T2VA), pada resolusi 1344×768, bukan 2K yang masih berada di sisi API.
Bagi pembaca, ini mengubah apa yang “self-hosting H3” bisa berarti. Sebelumnya, bobot dasar yang terbuka berjalan tetapi lambat — cocok untuk pekerjaan batch, tidak untuk apa pun yang interaktif. Dengan FastH3 di vLLM-Omni, pipeline H3 on-premises dapat memproses klip sepuluh detik dalam waktu yang jauh lebih singkat dari durasi klip tersebut, yang merupakan ambang batas di mana putaran produk real-time — pravisualisasi langsung, iterasi bidikan cepat, video yang digerakkan agen — menjadi praktis. Jika Anda lebih memilih tidak menjalankan server delapan GPU, jalur terkelola tidak berubah: MiniMax H3 berada di OrcaRouter dengan harga daftar penyedia, diteruskan dengan markup 0% dan failover otomatis, sehingga Anda dapat memanggil keluarga H3 melalui satu API yang kompatibel dengan OpenAI tanpa memiliki perangkat kerasnya.
Tiga skenario di mana H3 bersinar
1. Film pendek yang konsisten dalam karakter dan gaya.
Omni-reference (hingga 9 gambar, 3 klip, 3 audio) dirancang untuk menjaga konsistensi karakter, tampilan, dan suara di berbagai pengambilan gambar — ideal untuk narasi pendek dan konten episodik.
2. Kreatif sosial dan iklan dengan suara
Dialog yang disinkronkan dalam satu langkah, efek suara, dan suasana, serta rasio aspek yang fleksibel (9:16 hingga 21:9) cocok untuk alur kerja sosial dan periklanan cepat yang membutuhkan audio jadi, bukan hanya visual.
3. Pengeditan kreatif iteratif
Pengeditan berbasis instruksi memungkinkan tim untuk menyempurnakan klip secara deskriptif alih-alih membuat ulang, yang mempercepat produksi yang memerlukan banyak revisi.

FAQ
Apa itu MiniMax H3?
H3 adalah Hailuo 3.0, model generasi video AI terbaru dari MiniMax, yang diperkenalkan di WAIC 2026 (17 Juli 2026) dan dirilis pada 31 Juli 2026. Model ini menghasilkan video 2K asli, 24fps, dengan audio yang tersinkronisasi, dari teks atau gambar, dengan kontrol omni-reference dan pengeditan berbasis instruksi.
Apakah H3 sama dengan MiniMax M3?
Tidak. M3 adalah LLM teks/agentik milik MiniMax; H3 (Hailuo 3.0) adalah model generasi videonya. Keduanya diluncurkan pada acara yang sama, tetapi memiliki fungsi yang berbeda.
Di mana saya bisa menggunakan H3 sekarang?
Empat tempat: platform Hailuo dari MiniMax (produk lengkap), AI Gateway Vercel (keduanya H3 dan MiniMax H3 Max, dengan diskon peluncuran 50% hingga 13 September), Luma Agents (diumumkan pada 6 Agustus 2026 — hingga 15 detik video 2K dengan suara stereo asli, syarat akses masih belum jelas), dan self-hosted melalui bobot H3-Base yang terbuka di Hugging Face dan ModelScope — yang, sejak 1 September, dapat disajikan dengan kecepatan lebih cepat dari pemutaran melalui vLLM-Omni dengan FastH3 milik FastVideo (MP4 video-dan-audio berdurasi 10,1 detik dalam sekitar 8,7 detik pada 8× B300, menurut tim vLLM-Omni). Model dasar juga dirutekan di OrcaRouter dengan harga daftar penyedia.
Berapa lama dan berapa resolusi klip H3?
Native 2K pada 24fps, 5–15 detik per generasi, dapat diperpanjang hingga sekitar 30 detik, dalam rasio aspek dari 21:9 hingga 9:16.
Apa itu omni-reference?
Sistem kontrol yang menerima hingga 9 gambar referensi, 3 klip video, dan 3 klip audio sekaligus untuk menjaga konsistensi gaya, karakter, gerakan, dan suara.
Apakah H3 lebih baik daripada Kling 3.0 atau Veo 3.1?
Tergantung pada sumbunya. Kling 3.0 menawarkan 4K asli dan memimpin di beberapa arena; Veo 3.1 kuat pada dialog 48kHz. H3 menekankan kontrol referensi-omni, audio sekali lintas, penyuntingan, dan harga. H3 memiliki skor awal Artificial Analysis arena (sekitar 1.184 image-to-video dan 1.226 text-to-video dengan audio per akhir Agustus) yang akan berubah seiring akumulasi suara — uji pada prompt Anda sendiri.
Apakah H3 open-weight?
Sebagian. MiniMax merilis bobot dasar H3 sebagai sumber terbuka pada 3 Agustus 2026 — sebuah transformer 33B yang dirilis di Hugging Face dan ModelScope di bawah Lisensi Komunitas MiniMax H3, dengan checkpoint FL2VA dan Ref2VA. Sesuai ketentuan lisensi MiniMax, rilis ini membatasi wilayah penerapan dan berlaku juga pada keluaran yang dihasilkan, dengan kewajiban atribusi. Dua modul yang melengkapi pengalaman unggulan — H3-Context-IR (pra-pemrosesan prompt) dan H3-Regenerate-2K (upscale 2K) — tidak termasuk dalam rilis terbuka dan hanya tersedia melalui API. Sejak 1 September, bobot dasar terbuka tersebut juga dapat dilayani untuk generasi real-time melalui vLLM-Omni dan FastH3 milik FastVideo (FastH3 v1 hanya mencakup text-to-video-audio). Jadi ya, untuk model dasarnya, dengan catatan.
Intinya
MiniMax H3 (Hailuo 3.0) merupakan lompatan besar bagi lini video MiniMax: native 2K, audio tersinkronisasi sekali proses, kontrol omni-reference yang luas, dan penyuntingan berbasis instruksi, dengan harga yang terjangkau. Sejak diluncurkan, aksesnya juga menjadi jauh lebih mudah — ia dirutekan di OrcaRouter dengan harga sesuai daftar penyedia, berjalan di dalam Luma Agents, bobot dasarnya terbuka untuk self-hosting (dan sejak 1 September cukup cepat untuk merender klip 10,1 detik lebih cepat daripada durasi putarnya, melalui vLLM-Omni dan FastH3 dari FastVideo), serta H3 dan MiniMax H3 Max kini tersedia di AI Gateway milik Vercel dengan diskon peluncuran 50% selama dua minggu. Ia tidak otomatis melampaui resolusi para pesaing yang mengusung native 4K, dan skor awal di arena-nya juga masih terus menguat — tetapi dari sisi kontrol, audio, dan kecepatan iterasi, ia sangat menarik. Bandingkan H3 dengan Kling 3.0, Veo 3.1, Seedance 2.0, dan lainnya menggunakan footage Anda sendiri, serta pertahankan tumpukan model Anda yang lebih luas agar tetap netral terhadap vendor melalui satu endpoint seperti OrcaRouter.
