Cara Menggunakan MiniMax H3-1
Guides & Insights

Cara Menggunakan MiniMax H3: Prompt, Menjalankan Lokal, dan Audio yang Nggak Sampah

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 4 Agustus, Simon Willison mengunduh sekitar 115 GB bobot, mengarahkan port MLX tidak resmi dari MiniMax H3 ke M5 Max MacBook Pro miliknya, dan meminta seekor sigung berwarna pelangi yang melompati batang kayu berlumut di supermarket. Kurang dari 45 menit kemudian, ia mendapatkan klip yang ia gambarkan sebagai benar-benar mengesankan — dengan trek audio yang ia sebut aneh, seperti sampah yang mirip ucapan. Diagnosisnya sendiri adalah bagian yang berguna: ia tidak memberikan arahan audio apa pun kepada model, dan tidak membaca panduan prompt terlebih dahulu. Itulah ringkasan terpendek tentang bagaimana rasanya mulai menggunakan H3, yang juga dijual sebagai Hailuo 3.0. Gambarnya muncul kurang lebih secara gratis. Segala hal lain — suara, pengaturan waktu bidikan, resolusi 2K, karakter yang harus bertahan empat bidikan berturut-turut — harus Anda minta secara eksplisit, dalam format yang lebih ketat daripada hampir semua model video lain yang digunakan saat ini.

Ini adalah panduan penggunaan, bukan liputan peluncuran. Ada tiga tingkat sumber yang digunakan di dalamnya, dan setiap tingkat selalu diberi label: dokumentasi perusahaan sendiri (kartu model, dua panduan penulisan prompt yang disertakan dalam repositori, dokumentasi API platform); temuan komunitas dari orang-orang yang benar-benar telah menjalankannya — para pemelihara ComfyUI, penguji benchmark independen, dokumentasi penjual ulang, dan utas diskusi Hugging Face, semuanya bertanggal antara 31 Juli dan 5 Agustus 2026; serta sejumlah kecil tempat di mana kami sendiri membaca file primer dan menyatakannya demikian. Angka komunitas adalah laporan tunggal pada perangkat keras yang tidak terkontrol kecuali dinyatakan lain. Jika para praktisi berselisih pendapat satu sama lain, perbedaan pendapat tersebut dilaporkan, bukan diselesaikan.

Sebelum hal lainnya: Anda mungkin tidak menjalankan seluruh model.

Sebagian besar kebingungan pada minggu pertama H3 berakar pada satu fakta struktural yang dikaburkan oleh materi pemasaran. H3 bukanlah satu model tunggal. Menurut kartu modelnya, ini adalah sistem tiga bagian, dan hanya bagian tengahnya yang dirilis sebagai open-source:

H3-Context-IR — pemroses instruksi multimodal. Ia membaca teks, gambar, audio, dan video Anda, menalar bagaimana semuanya saling terkait, dan menghasilkan representasi terstruktur yang diperkaya secara semantik dari apa yang Anda minta. Hanya API yang dihosting. Ia diekspos sebagai tipe tugas tersendiri yang mengembalikan prompt yang diperkaya dan tanpa video sama sekali.

H3-Base — model generasi 33B-parameter yang benar-benar menghasilkan frame dan suara. Ini adalah bagian open-weights.

H3-Regenerate-2K — tahap regenerasi dalam konteks yang meningkatkan hasil 768p menjadi 2K. Hanya API yang di-hosting.

Dua konsekuensi langsung menyusul, dan keduanya menentukan seluruh alur kerja Anda. Pertama, generasi lokal adalah batas 768p. Kanvas asli H3 adalah tepi pendek 768 piksel, dibatasi pada 768×1344 — kira-kira 1344×768 untuk 16:9. Jika keluaran ComfyUI Anda bukan 2K, tidak ada yang rusak; paket yang Anda unduh adalah H3-Base, dan modul upscaling tidak ada di dalamnya. Kedua, API yang dihosting akan memperbaiki prompt yang berantakan, sedangkan instalasi lokal Anda tidak. Semua yang Context-IR lakukan untuk panggilan API berbayar — menyimpulkan struktur, menentukan referensi mana yang dimaksud, mengisi bagian-bagian yang Anda biarkan samar — adalah langkah yang kini Anda lakukan secara manual, atau dengan model lain, sebelum H3-Base melihat kata-kata Anda. Ketidaksetaraan tunggal itu menjelaskan sebagian besar laporan tentang "prompt yang sama berfungsi di Hailuo tetapi tampak rusak di ComfyUI."

How to Use MiniMax H3-2

Yang perlu dicatat dari repositori itu sendiri: bobotnya membawa tag minimax-h3-community-license-agreement alih-alih Apache atau MIT (lebih lanjut di bawah, karena bagian inilah yang menentukan apakah Anda dapat merilisnya sama sekali), model ini tercantum dengan 33 miliar parameter dalam F32/BF16, dan hingga saat ini hanya satu penyedia inferensi — fal — yang tercantum sebagai penyedianya. Dua puluh tiga model fine-tune, dua puluh kuantisasi, dan tiga puluh satu Spaces sudah ada di atasnya, yang merupakan sinyal yang cukup jelas tentang seberapa cepat komunitas bergerak.

Format prompt: blok bidikan, bukan timecode.

Di sinilah komunitas dan dokumentasi secara terbuka bertentangan, dan hal ini lebih penting daripada hal lainnya dalam artikel ini.

Template yang menyebar paling cepat — melalui Reddit, lalu ke beberapa panduan yang diterbitkan — memotong klip menjadi segmen-segmen kode waktu: [0s-2s], [2s-5s], dan seterusnya, diikuti oleh struktur enam blok yang terdiri dari kontrak gaya, linimasa, kamera, audio, teks yang ditulis lengkap, dan daftar negatif. Ini direkayasa balik dengan membaca 45 contoh prompt yang disertakan perusahaan, dan itu bukan omong kosong: contoh-contoh itu benar-benar merupakan daftar pengambilan gambar dengan lembar isyarat suara terlampir, dengan panjang median sekitar 130 karakter Tionghoa dan yang terpanjang mencapai 657 dan 858 karakter.

Tetapi pedoman milik perusahaan sendiri VIDEO_PROMPT_WRITING_GUIDE_base_en.md, yang berada di folder docs repositori, menetapkan hal yang berbeda. Pedoman ini mengorganisasi berdasarkan blok bidikan, bukan berdasarkan rentang waktu. Kami membacanya langsung; struktur yang diminta adalah:

Instruksi — aturan penyelarasan gambar, digunakan untuk mode keyframe (I2VA, FL2VA, L2VA) dan dihilangkan untuk teks-ke-video murni.

deskripsi multimodal terintegrasi — bagian utama, dibagi menjadi [Shot 1], [Shot 2], dan seterusnya.

lanskap suara keseluruhan — satu hingga empat kalimat suara diegetik.

non_diegetic_music — satu hingga tiga kalimat tentang skor.

Di dalamnya, konvensi-konvensinya cukup spesifik untuk dapat diperiksa. [Shot 1] tidak memiliki timestamp sama sekali — pengambilan gambar berikutnya dibuka dengan cut absolut, dirumuskan seperti "Pada 00:03.500, kamera beralih ke…". Pergerakan kamera ditulis sebagai jenis gerakan plus amplitudo dan kecepatan, dirangkai dalam bahasa Inggris natural daripada ditumpuk sebagai label: push-in lambat dengan amplitudo kecil, bukan kamera: dolly-in, lambat. Pergerakan yang tersedia adalah set yang umum — zoom, pan, tilt, tracking, arc, POV, dan shake dalam varian ringan atau kuat. Dialog dibungkus dengan tag: <d>[English] Get in the car.</d>, dengan tanda baca dipertahankan persis dan tidak pernah diterjemahkan atau diparafrasakan. Pembicara mendapatkan ID yang stabil — (S1), (S2), dan (S1,S2) untuk baris bersama — dengan usia, jenis kelamin, timbre, dan aksen yang dijelaskan pada kemunculan pertama. Voiceover ditandai sebagai baris off-screen dengan catatan eksplisit bahwa bibir tetap tertutup, yaitu cara menghentikan model agar tidak melakukan lip-sync narasi pada wajah. Percakapan cross-cut menggunakan <scenetrans> marker ditambah pernyataan kontinuitas.

Larangan eksplisit dalam panduan ini sama informatifnya dengan aturan-aturannya: jangan beri cap waktu pada bidikan pertama, jangan ulangi dialog atau nyanyian atau musik di layar di dalam overall_soundscape, jangan gunakan kata-kata suasana hati yang abstrak dalam non_diegetic_music, dan jangan pernah menulis ulang satu baris dialog. Dan satu hal yang mencolok ketiadaannya — panduan resmi sama sekali tidak memiliki bagian prompt negatif, yang berarti daftar "transisi terlarang" dalam template komunitas yang populer adalah kreasi komunitas, bukan fitur yang terdokumentasi.

Seberapa serius konflik ini perlu ditanggapi? Dalam diskusi Hugging Face di repositori H3, seorang anggota komunitas mengunggah struktur bergaya timecode sebagai panduan, dan praktisi lain membalas dengan blak-blakan bahwa mereka pernah menggunakan struktur serupa, bahwa struktur itu sepenuhnya salah, dan orang-orang seharusnya membaca manual yang disertakan sebagai gantinya. Itu adalah satu orang yang berkontradiksi dengan orang lain, bukan keputusan maintainer. Pembacaan kami atas bukti: keduanya berfungsi melalui API yang dihosting, karena Context-IR menormalkan apa pun yang Anda kirimkan; hanya format yang terdokumentasi yang dapat diandalkan untuk digunakan langsung dengan H3-Base. Jika Anda menjalankan bobot lokal, ikuti file di repositori. Jika Anda menggunakan API dan prompt timecode memberi Anda klip-klip yang bagus, preprocessor-lah yang melakukan pekerjaan itu untuk Anda, dan Anda tidak seharusnya menyimpulkan bahwa format itulah yang berjasa.

Menyusun brief santai ke dalam dialek H3

Ambil prompt dua belas kata Willison sebagai masukan — seekor sigung berwarna pelangi yang melompati batang kayu berlumut di supermarket. Ditulis dengan cara yang terdokumentasi, itu menjadi kira-kira: [Shot 1] blok yang dibuka dengan menyebutkan gaya (live-action, handheld, diterangi lampu neon) dan bingkai (lorong supermarket, batang kayu berlumut melintang di linoleum, rak-rak yang menjauh), kemudian subjek dan aksi dalam urutan fisik — dua langkah menapak, satu jongkok, lompatan, pendaratan — dengan kamera sebagai gerakan tracking lambat beramplitudo rendah yang berakhir di sisi jauh batang kayu; overall_soundscape berupa cakar di linoleum, gesekan lembap batang kayu, dengung mesin pendingin, dan roda troli dari kejauhan; dan non_diegetic_music berupa baris isyarat senar yang pendek, ringan, dan dipetik tanpa vokal. Tidak ada satu pun di dalamnya yang merupakan kejeniusan kreatif. Itu adalah ide yang sama, dengan keempat hal yang diminta H3 benar-benar disediakan — dan itulah perbedaan antara room tone yang tidak diminta dan soundtrack yang Anda rancang.

Langkah ini bersifat mekanis, berulang, dan kurang tepat jika dikerjakan manusia, justru itulah sebabnya perusahaan mengirimkan alat untuk itu yang hampir tidak ada pemberitaan yang membahasnya. Repositori tersebut berisi direktori skills untuk sembilan keterampilan agen, dan yang pertama — h3-prompt-writing — melakukan hal ini dengan tepat: ia menerima permintaan dan menulis prompt H3 terstruktur untuk kelima mode generasi, lengkap dengan bagian soundscape dan musik. Delapan lainnya adalah resep genre (iklan produk, animasi pendek 3D, penjelas papercraft, subtitle video musik, intro game kooperatif, hibrida live-action gambar tangan, dan sebagainya) yang membungkus format yang sama dalam sebuah alur kerja.

Menjalankan keterampilan itu membutuhkan model teks, bukan model video, dan di sinilah router benar-benar berguna, bukan sekadar colokan. LLM milik perusahaan itu sendiri, MiniMax M3, adalah pilihan yang masuk akal untuk pekerjaan ini dan tersedia di OrcaRouter dengan harga $0,30 per juta token masukan dan $1,20 per juta token keluaran — harga daftar penyedia, karena kami meneruskannya dengan markup 0% — dengan jendela konteks 1M token dan, yang tidak biasa, video sebagai jenis input yang diterima. Detail terakhir itulah yang membuatnya cocok: Anda dapat memberikan panduan prompt resmi, brief Anda, dan klip referensi aktual dalam satu panggilan, dan mendapatkan kembali blok [Shot N] yang menjelaskannya. Menyusun prompt hanya membutuhkan sebagian kecil sen dibandingkan dengan generasi video yang ditagih per detik, jadi tidak ada alasan untuk menulisnya secara manual. Dua catatan jujur: Generasi video H3 sendiri tidak berjalan di OrcaRouter — klip-klip tersebut berasal dari platform perusahaan, fal, atau GPU Anda sendiri — dan langkah kompilasi ini adalah kemudahan, bukan jaminan kualitas. Yang dibeli router untuk Anda di sini adalah bahwa separuh teks dari pipeline berada di belakang satu kunci dengan failover otomatis, sehingga pemadaman penyedia di tengah batch tidak membuat antrean render terjebak, dan mengganti M3 dengan model yang berbeda untuk membandingkan prompt yang dikompilasi hanyalah perubahan string, bukan kontrak baru.

How to Use MiniMax H3-3

Audio adalah tempat semua orang kalah di hari pertama.

Mode kegagalan yang paling banyak terkonfirmasi di minggu pertama adalah yang dialami Willison: biarkan suara tidak ditentukan dan H3 akan menciptakan sesuatu dengan buruk. Ia mendapatkan noise mirip ucapan dari prompt tanpa arahan audio. Ulasan rekayasa balik dari contoh-contoh resmi melaporkan kelas kegagalan yang sama dalam bentuk yang lebih ringan — hilangkan blok audio dan model menghasilkan room tone yang tidak diminta — dan menyebut ini sebagai ketiadaan, bukan kesalahan, yang merupakan cara yang tepat untuk memikirkan model audio-video gabungan. Model selalu menghasilkan soundtrack. Satu-satunya pilihan Anda adalah apakah Anda menentukannya.

Menggabungkan petunjuk dalam panduan prompt resmi dengan apa yang dilaporkan dokumentasi reseller dan para peninjau sebagai yang benar-benar berhasil:

Dialog adalah hal yang paling sulit untuk diminta. Batasi baris ucapan hingga satu atau dua kalimat per lima detik klip. Baris yang terlalu panjang menghasilkan pengucapan yang terburu-buru, audio yang melewati bingkai terakhir, atau sinkronisasi bibir yang kaku — dilaporkan secara konsisten oleh para peninjau.

Jelaskan pembicara sebelum baris, beserta penyampaiannya. Usia, jenis kelamin, timbre, dan aksen pada penampilan pertama sesuai panduan resmi; catatan penyampaian yang sederhana dan langsung (dengan jelas, hangat, datar) alih-alih arahan performa yang rumit, yang dilaporkan dapat menurunkan sinkronisasi.

Kaitkan setiap efek pada peristiwa yang terlihat. "Letupan gabus tepat saat gabus melayang" daripada "suara: letupan". Kata-kata saat, ketika dan lalu itulah yang membawa sinkronisasi.

Sebutkan musik secara singkat berdasarkan genre, tempo, suasana, dan instrumentasi — jangan pernah berdasarkan artis atau lagu. Tambahkan "no vocals" saat gambar harus menjadi yang utama; ini adalah cara terdokumentasi untuk menjaga campuran tetap bersih.

Tumpuk suasana dalam satu klausa. Hujan di kaca, gumaman percakapan yang rendah, denting cangkir sesekali, jazz latar yang lembut — ditumpuk dalam satu kalimat, bukan dirinci.

Jangan mengulang dialog di bagian soundscape. Larangan eksplisit dalam panduan resmi; bagian-bagian tersebut dimaksudkan untuk saling terpisah, dan mengulang baris di sana adalah cara untuk mendapatkannya dua kali.

Jika sebuah kata harus terbaca di layar, ketik kata tersebut dalam tanda kutip. Para peninjau melaporkan bahwa string yang spesifik dirender dengan bersih, sementara permintaan yang samar ("elemen HUD", "sebuah tanda") menghasilkan noise berbentuk huruf.

Di mana audio benar-benar unggul, menurut banyak peninjau, adalah suara fisik yang konkret — foley dan efek yang terkait dengan sesuatu yang terlihat — serta ambience. Audio tersebut lebih lemah pada permintaan abstrak atau atmosferik. Adegan dengan banyak pembicara sering kali memerlukan penyuntingan agar urutan pembicara benar, dan kualitas pelafalan bervariasi tergantung bahasa, jadi uji bahasa target Anda pada klip sekali pakai sebelum mengikatkan proyek padanya. Beberapa peninjau juga mencatat batas yang jujur: suaranya cukup baik untuk distribusi media sosial dan umumnya tidak cukup baik untuk dirilis sebagai campuran siaran atau iklan berbayar tanpa penggantian. Tidak satu pun dari itu adalah arahan vendor; itulah yang dilaporkan para praktisi.

Referensi: beri setiap file sebuah pekerjaan

Sistem referensi H3 adalah pembeda terkuatnya dan tempat di mana kesalahan pengaturan paling sering terjadi. Batas yang didokumentasikan, dari dokumentasi API platform: hingga 9 gambar, 3 klip video, dan 3 klip audio, dengan total maksimal 12 file, dengan setiap video atau audio referensi berdurasi antara 2 dan 15 detik, dan total durasi semuanya tidak melebihi 15 detik. Referensi-ke-video memerlukan setidaknya satu gambar atau video; audio saja tidak diterima.

Teknik yang disepakati oleh panduan referensi resmi dan laporan komunitas adalah denganmemberi tag pada setiap input dan menetapkan tugas padanya. Rujuk berdasarkan tag sesuai urutan persis file dilampirkan — <Picture 1>, <Video 1>, <Audio 1> — lalu nyatakan dalam perintah referensi mana yang mengendalikan properti mana: identitas, gaya, gerakan, kamera, atau suara. Contoh perintah resmi dimulai persis seperti ini, menyatakan bahwa gambar satu adalah referensi suasana dan gaya keseluruhan, dan gambar dua adalah karakter utama. Para praktisi melaporkan bahwa penugasan eksplisit bekerja jauh lebih baik daripada sekadar membuang sembilan gambar dan berharap.

Dua detail yang membuat orang kehilangan render:

<Picture 1> bukan mood board — ini adalah frame pertama yang sebenarnya pada detik 0.000, dan itu milik [Shot 1]. Jelaskan apa yang ada di dalamnya (gaya, subjek, komposisi, jangkar adegan) sebelum menjelaskan aksi yang menyusulnya. Perlakukan sebagai gambar diam yang sedang Anda animasikan, bukan petunjuk.

Ada dua checkpoint terpisah, dan menggunakan yang salah akan gagal secara diam-diam. fl2va menangani teks-ke-video dan pekerjaan bingkai pertama/terakhir; ref2va menangani referensi-ke-video. Ini adalah error ComfyUI yang paling sering dilaporkan: graf R2V berjalan dengan model FL2VA yang masih terpilih. Perlu diketahui juga bahwa seorang komentator di pengumuman ComfyUI menunjukkan bahwa template R2V yang disertakan hanya mengekspos dua slot referensi gambar meskipun modelnya menerima sembilan — keterbatasan template, bukan keterbatasan model.

Di sisi hosted, dua catatan praktisi lagi dari dokumentasi reseller: rasio parameter wajib pada endpoint ref2va dan tidak boleh dibiarkan sebagai "adaptive", dan pekerjaan yang tumpang tindih mengembalikan 429 untuk konkurensi tugas daripada mengantre — jadi jalankan secara berurutan, atau buat antrean Anda sendiri. Secara lokal, ref_image_size defaultnya adalah match, yang lebih cepat; max mempertahankan tepi pendek hingga 2048 piksel pada referensi dan memakan waktu.

Berapa biaya sebenarnya dari eksekusi lokal dalam waktu jam dinding

Mengunduh repositori resmi lengkap berukuran 498 GB, dan cermin yang dikemas ulang ComfyUI berukuran 343 GB. Anda tidak perlu mengunduh keduanya secara lengkap. Empat file yang dicantumkan dalam tutorial ComfyUI sendiri untuk teks-ke-video dan gambar-ke-video berjumlah sekitar 42.5 GB:

Model difusiminimax_h3_fl2va_pruned_int8_convrot.safetensors, 20.97 GB, ke dalam models/diffusion_models.

Pengekode teksqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors, 15.69 GB, ke dalam models/text_encoders.

Video VAEminimax_h3_video_vae_fp16.safetensors, 5.21 GB, ke dalam models/vae.

Audio VAEminimax_h3_audio_vae_fp32.safetensors, 0.61 GB, juga ke dalam models/vae.

Tambahkan untuk referensi-ke-videominimax_h3_ref2va_pruned_int8_convrot.safetensors, lagi 20,97 GB.

Angka 42.5 GB itu bukan ukuran VRAM — melainkan disk, dan bagian-bagiannya dialirkan (streamed) serta di-offload. Alasan model ini bisa muat di kartu grafis kelas konsumen adalah trik rekayasa yang didokumentasikan ComfyUI: sekitar 40% parameter berada di cabang modulasi AdaLN yang keluarannya dapat dihitung lebih dahulu dan diganti dengan tabel pencarian (lookup table) yang setara secara fungsional, sehingga model yang dimuat turun dari 33.12B menjadi sekitar 20.11B — menurut ComfyUI, tanpa kehilangan kualitas. Dalam presisi penuh, ukurannya akan menjadi 123.6 GB. Checkpoint int8 yang tidak dipangkas (masing-masing 34.04 GB) dan checkpoint bf16 (masing-masing 66.28 GB) tersedia jika Anda melakukan fine-tuning atau mengejar beberapa persen terakhir fidelitas.

ComfyUI 0.30.0 atau lebih baru diperlukan, dan aplikasi ini menyediakan tiga template: T2V, I2V, dan R2V. Dasar yang disepakati setiap panduan dan pengelola untuk percobaan pertama memang sengaja dibuat kecil: 16:9 pada 0.4 MP (864×480), 5 detik, 20 langkah, sampler res_multistep dengan scheduler simple, denoise 1.0, batch 1. Dapatkan satu MP4 yang berisi video dan audio stereo sebelum Anda mengubah resolusi atau durasi. Satu keanehan aritmetika yang perlu diperhatikan: durasi terpaku pada grid 17k+5 frame, sehingga permintaan 5 detik menjadi 124 frame — sekitar 5.17 detik pada 24 fps — dan permintaan 10 detik menjadi 243 frame, atau 10.125 detik. Permintaan dalam rentang 5–15 detik adalah zona yang lebih aman.

How to Use MiniMax H3-4

Berapa biaya yang dibutuhkan dalam waktu nyata, dari laporan komunitas (semua sekali jalan, tidak terkontrol, dengan pengaturan berbeda — bagan di atas mencetak setiap konfigurasi di samping batangnya): RTX 3060 12 GB dengan RAM sistem 32 GB dan NVMe cepat menyelesaikan baseline 864×480 / 124 frame / 20 langkah dalam waktu di bawah sembilan menit menggunakan offload dinamis. Laptop RTX 4090 16 GB dengan SageAttention aktif melakukan 960×540, 5 detik, 20 langkah dalam 182 detik. Build NVFP4 pada satu RTX 5090 menghasilkan klip 864×480 243 frame (10,1 detik) pada 10 langkah dalam 175 detik, memuncak pada 26.9 GiB VRAM dengan hanya 31.7 GB file di disk. Referensi cookbook SGLang — 1344×768, 124 frame, 50 langkah di dua RTX 5090 dengan offload per lapisan — memakan waktu 559.67 detik. Dan jalur Apple Silicon, melalui port MLX tidak resmi, memakan waktu di bawah 45 menit untuk satu klip.

Catatan praktis yang disarikan dari laporan-laporan tersebut:

RAM sistem dan kecepatan disk adalah penopang beban, bukan opsional.Pada kartu 12 GB, file yang dipilih melebihi VRAM secara desain, sehingga jalur offload berjalan melalui RAM lalu SSD. RAM 32 GB muncul di kedua laporan low-VRAM yang berhasil. Tidak ada hasil 8 GB yang terverifikasi.

SageAttention adalah satu-satunya percepatan gratis — sekitar 2× per ComfyUI, lebih kecil jika proses Anda didominasi oleh lalu lintas offload. Pasang wheel yang sesuai dengan build PyTorch dan CUDA Anda serta ComfyUI-KJNodes, lalu sisipkan Patch Sage Attention KJ di antara pemuat UNET dan guider, lalu atur ke auto. Harapkan peringatan bahwa beberapa lapisan H3 tidak FP16/BF16; fallback tersebut terdokumentasi dan normal.

Jumlah langkah bisa dinegosiasikan.Benchmark 5090 dijalankan dengan 10 langkah dan baseline ComfyUI berjalan dengan 20 langkah, sementara konfigurasi referensi SGLang menggunakan 50 langkah. Belum ada yang mempublikasikan kurva kualitas-per-langkah, jadi temukan batas minimum Anda sendiri sebelum berasumsi bahwa Anda memerlukan 50 langkah.

Ubah satu variabel pada satu waktu untuk keluar dari OOM. Prosedur pemulihan yang terdokumentasi adalah turun kembali ke 0,4 MP, 5 detik, batch 1, dan memutar satu kenop per percobaan.

Audio senyap berarti VAE audio tidak terhubung ke node keluaran video. Ini adalah kegagalan yang berbeda dari audio yang buruk, dan mudah disalahartikan sebagai model yang menolak menghasilkan suara.

Apple Silicon tidak resmi. Rute Willison adalah PipeNetwork/minimax-h3-mlx, sebuah port komunitas, dijalankan melalui uv terhadap berkas persyaratan MLX. Materi perusahaan sendiri menyebut SGLang, vLLM, Diffusers, dan ComfyUI, dengan penerapan tipikal empat GPU dalam BF16, dan tidak menyebut Metal atau MPS. Perlakukan dukungan Mac sebagai yang dipelihara komunitas.

Lokal versus di-hosting, dengan angka-angkanya

Karena modul 2K dan prapemroses prompt hanya di-hosting, ini sebenarnya bukan pilihan salah satu/atau. Pola yang didorong oleh arsitektur ini adalah: lakukan iterasi secara lokal pada 768p di mana setiap percobaan menghabiskan listrik dan tiga menit, lalu beli hasil akhirnya. Biaya per detik tidak masalah untuk hasil yang kamu simpan, tetapi merugikan untuk empat puluh yang kamu buang.

Soal harga, berhati-hatilah, karena harganya bervariasi sekitar 2× tergantung dari siapa Anda membeli dan blog vendor tersebut sendiri tidak mencantumkan angka dolar — hanya bahwa 2K berharga kurang dari sepertiga harga model mainstream dan 768p di bawah setengah harga 720p pesaing. Yang dipublikasikan secara konkret: fal, satu-satunya penyedia inferensi yang saat ini terdaftar di repositori Hugging Face, mengenakan biaya $0.16 per detik pada 768p dan $0.26 per detik pada 2K. Pelacak sekunder melaporkan harga yang dicantumkan perusahaan sendiri jauh lebih rendah — sekitar $0.09–$0.10 per detik pada 768p dan $0.13–$0.14 per detik pada 2K — dan mereka tidak sepakat satu sama lain hingga ke sen, jadi anggap angka-angka itu sebagai indikasi dan periksa halaman harga platform sebelum Anda menyusun anggaran. Juga anggarkan fakta bahwa video referensi ditagih berdasarkan durasinya sendiri serta keluaran yang dihasilkan.

Jalankan dengan angka yang sebenarnya. Seratus klip yang dipakai, masing-masing delapan detik, berarti 800 detik yang dihasilkan: sekitar $112 dengan tarif 2K $0,14, kurang lebih $208 dengan tarif fal $0,26, dan sekitar $76 jika Anda mengirimkan dalam 768p dengan harga daftar terendah. Empat puluh klip gagal per klip yang dipakai itulah yang menentukan tagihan, dan itulah yang sebaiknya dihasilkan secara lokal. Ini juga alasan untuk menjaga harga yang Anda bandingkan tetap jujur — di OrcaRouter, sisi teks dari alur kerja itu diteruskan sesuai daftar harga penyedia dengan markup 0%, sehingga ketika vendor menurunkan harga, harga itu langsung berlaku pada hari yang sama, bukan setelah perhitungan ulang margin. Sekali lagi, pembuatan video bukan layanan kami; intinya hanyalah bahwa langkah kompilasi tidak seharusnya menjadi pos biaya yang perlu Anda pikirkan.

Baca lisensi sebelum Anda membangun produk di atas ini.

Ini adalah bagian yang paling sering dilewatkan oleh panduan "cara menggunakan", dan bagi banyak pembaca, ini adalah satu-satunya bagian yang mengubah keputusan. Kami membaca file LICENSE langsung di repositori. Bobot model dirilis di bawah Perjanjian Lisensi Komunitas H3, bukan lisensi sumber terbuka, dan berisi ketentuan yang cukup tidak biasa untuk dikutip pada intinya:

Wilayah. Lisensi ini mendefinisikan "Wilayah yang Berlaku" sebagai seluruh dunia kecuali Uni Eropa, Britania Raya, Republik Korea, dan Amerika Serikat. Dibaca secara harfiah, ini mengecualikan sebagian besar orang yang saat ini memposting hasil generasi lokal — dan pembatasan tersebut ditulis untuk menjangkau keluaran, bukan hanya bobotnya.

Atribusi.Penggunaan komersial mewajibkan menampilkan "H3" pada antarmuka produk; lisensi juga menganjurkan pemberitahuan "Powered by H3".

Ambang batas pendapatan. Organisasi yang memperoleh pendapatan lebih dari $20 juta per tahun dari produk atau layanan yang dibangun di atasnya harus mendapatkan otorisasi tertulis terpisah dari perusahaan.

Tanpa distilasi. Anda tidak boleh menggunakan H3 atau keluarannya untuk meningkatkan model AI lain apa pun, kecuali turunan H3. Itu mengesampingkan praktik standar data sintetis.

Hukum yang berlaku. Hong Kong SAR, dengan yurisdiksi eksklusif di pengadilan Hong Kong.

Satu komponen yang benar-benar terbuka. Encoder teks Qwen3-VL-32B berlisensi Apache 2.0; pembatasan di atas berlaku untuk bobot H3.

Kami bukan pengacara Anda dan ini bukan nasihat hukum — bacalah lisensi dan dokumen Q&A yang disertakan perusahaan di sampingnya, dan jika Anda membangun secara komersial di wilayah yang dikecualikan, dapatkan penasihat hukum daripada mengandalkan bacaan blog. Percabangan praktisnya: API yang di-hosting adalah transaksi berbeda dengan ketentuan berbeda dari lisensi komunitas untuk bobot, jadi jika lisensi lokal tidak cocok untuk Anda, jalur API mungkin masih tersedia. Periksa ketentuan platform mana pun tempat Anda membeli.

Rencana pengujian minggu pertama

Lima kali percobaan, dalam urutan ini, sudah cukup untuk mengetahui apakah H3 cocok untuk pipeline Anda:

Percobaan 1 — buktikan perpipaan. Templat T2V, 864×480, 5 detik, 20 langkah, res_multistep/simple Kriteria sukses adalah MP4 dengan audio stereo di dalamnya, bukan klip yang bagus.

Uji Coba 2 — buktikan bahwa format itu penting. Subjek yang sama dua kali: sekali sebagai deskripsi longgar satu baris, sekali ditulis sebagai [Shot 1] ditambah overall_soundscape ditambah non_diegetic_music. Jika yang kedua tidak jelas lebih baik terhadap H3-Base, ada yang salah dengan pengaturanmu.

Run 3 — satu baris dialog. Satu pembicara, satu kalimat, cara penyampaian dijelaskan, lima detik. Ini adalah penilaian tercepat untuk mengetahui apakah audio cukup baik untuk penggunaan Anda, dan bagaimana pelafalan bahasa target Anda.

Run 4 — disiplin referensi. R2V dengan ref2va checkpoint, dua atau tiga referensi, masing-masing diberi tag secara eksplisit dan diberi tugas, dengan <Picture 1> digambarkan sebagai frame pertama yang sebenarnya. Kemudian langgar dengan sengaja: lampirkan referensi yang sama tanpa penugasan dan bandingkan.

Run 5 — penyelesaiannya. Bawa prompt lokal 768p terbaik Anda ke API yang dihosting pada 2K dan lihat apa yang ditambahkan oleh Context-IR dan proses regenerasi. Delta itulah yang Anda beli dengan harga per detik, dan itu adalah satu-satunya cara untuk menetapkan harga alur kerja hibrida secara jujur.

FAQ

Bisakah saya mendapatkan 2K dari bobot lokal?

Tidak. Paket terbuka adalah H3-Base, yang kanvas aslinya memiliki tepi pendek 768 piksel (hingga 768×1344). 2K berasal dari H3-Regenerate-2K, modul regenerasi dalam-konteks terpisah yang dipertahankan perusahaan pada API yang dihosting. Anda dapat memperbesar secara lokal dengan upscaler tujuan umum apa pun, tetapi itu adalah operasi yang berbeda dari proses regenerasi H3 sendiri dan tidak akan cocok dengannya.

Mengapa prompt yang sama berperilaku berbeda pada API dan di ComfyUI?

Karena API menjalankan H3-Context-IR terlebih dahulu. Ia membaca teks dan referensi Anda, menalar bagaimana keduanya berhubungan, lalu memberikan instruksi terstruktur dan diperkaya kepada H3-Base. Secara lokal tidak ada tahap seperti itu — H3-Base menerima kata-kata mentah Anda. Prompt yang samar yang menghasilkan klip yang kompeten melalui API sebenarnya diselamatkan oleh pemroses awal yang tidak Anda pasang, itulah sebabnya format prompt yang terdokumentasi jauh lebih penting bagi pengguna lokal daripada bagi pengguna API.

Apakah templat timecode [0s-2s] salah?

Ini bukan yang diminta oleh panduan yang disertakan. Panduan perusahaan VIDEO_PROMPT_WRITING_GUIDE_base_en.md disusun dalam blok [Shot N], memberi Shot 1 tanpa stempel waktu, dan menyatakan potongan berikutnya sebagai waktu absolut ("Pada 00:03.500, kamera beralih ke…"). Panduan ini juga tidak memiliki bagian negative-prompt, sehingga daftar "transisi terlarang" dalam template populer adalah tambahan komunitas. Meski demikian, para praktisi melaporkan hasil API yang baik dengan format timecode — kemungkinan karena Context-IR menormalkannya. Penafsiran kami: gunakan format yang terdokumentasi pada bobot lokal, dan jangan mengaitkan tanda kurung timecode dengan hasil API yang mungkin telah diperoleh preprocessor.

Bisakah perusahaan di AS atau UE menggunakan open weights secara komersial?

Teks lisensi yang kami baca mengecualikan UE, Inggris, Korea Selatan, dan AS dari Wilayah yang Berlaku (Applicable Territory), dan pengecualian tersebut dirumuskan untuk mencakup output maupun bobot. Itu merupakan hambatan serius untuk penerapan komersial di tempat-tempat tersebut, dan ini adalah persoalan hukum, bukan teknis — bacalah sendiri lisensi dan file Q&A-nya, lalu mintalah nasihat. API yang di-hosting diatur oleh ketentuan platform itu sendiri, bukan lisensi komunitas, jadi sebaiknya dievaluasi secara terpisah dan tidak dianggap sama-sama dibatasi.

Apa yang perlu diperiksa sebelum melakukan commit

H3 menawarkan nilai yang luar biasa baik untuk bentuk pekerjaan tertentu: klip pendek, berdesain suara matang, dan konsisten terhadap referensi, di mana Anda bersedia menulis daftar shot yang sungguhan. Ia luar biasa menuntut soal cara Anda bertanya. Tiga hal yang perlu Anda verifikasi sendiri, karena itulah yang paling cepat berubah: apakah lebih banyak penyedia inferensi muncul di samping fal (yang akan menurunkan harga per detik), apakah template ComfyUI R2V bertambah dari dua slot referensi menjadi sembilan slot milik model, dan apakah kebiasaan timecode komunitas atau format shot-block yang terdokumentasi yang menang setelah seseorang melakukan perbandingan terkontrol terhadap bobot lokal. Belum ada yang memublikasikan perbandingan itu. Sampai mereka melakukannya, manual di repositori adalah taruhan yang lebih baik — dan manual itu ada di unduhan yang sama yang sudah memakan 42 GB.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube