Kartu judul yang dihasilkan bertuliskan 'Vidu Q4 Preview vs MiniMax H3' dengan subjudul 'Terpaut enam belas Elo, terpaut tiga papan peringkat' dan tiga kotak statistik bertuliskan '1.195 MiniMax H3 Max', '1.181 MiniMax H3', dan '1.179 Vidu Q4 Preview', masing-masing diberi keterangan 'Elo gambar-ke-video'. Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Guides & Insights

Vidu Q4 Preview vs MiniMax H3: Puncak Papan Peringkat Seri, dan Hanya Satu dari Mereka yang Ada di Tiga Papan

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Papan image-to-video di Artificial Analysis, dibaca 8 Oktober 2026, menempatkan MiniMax H3 Maxdi peringkat pertama dengan 1.195 Elo, MiniMax H3di peringkat kedua dengan 1.181, dan Vidu Q4 Previewdi peringkat ketiga dengan 1.179. Enam belas poin memisahkan peringkat pertama dari peringkat ketiga, pada interval sekitar ±10 dan ±11, dengan masing-masing 5.894, 7.284, dan 5.543 suara. Itu adalah hasil seri statistik yang didandani sebagai podium, dan halaman mana pun yang dibuka dengan mendeklarasikan pemenang di papan ini sedang membaca kebisingan.

Jadi, pertanyaan yang menarik bukanlah model mana dari kedua model ini yang lebih baik. Melainkan apa yang terjadi pada perbandingan tersebut begitu Anda keluar dari satu papan tempat keduanya muncul — karena MiniMax H3 dirilis pada 31 Juli 2026 sebagai model omni-modal yang membaca referensi teks, gambar, video, dan audio sebagai satu konteks, dan Vidu Q4 Preview hadir pada 7 Oktober 2026 dengan dua mode input dan dua endpoint API. Salah satunya diukur di tiga tempat. Yang lainnya diukur di satu tempat.

Apa arti dan tidaknya hasil imbang tiga arah

Baik entri MiniMax maupun build Vidu berada di dalam interval satu sama lain, sehingga pernyataan yang jujur adalah bahwa tiga model gambar-ke-video teratas tidak dapat dibedakan berdasarkan preferensi manusia pada ukuran sampel saat ini. Dua detail membuat hasil seri itu tidak sebaik kedengarannya bagi semua pihak.

Yang pertama adalah usia. Suara MiniMax H3 berasal dari Juli 2026 dan H3 Max dari Agustus; suara Vidu Q4 Preview dari Oktober. Kumpulan suara yang lebih besar dan lebih lama diukur terhadap arena kompetitif yang berbeda dan kumpulan lawan yang berbeda, yang berdampak dua arah: lebih terukur, dan menyangkut pertanyaan yang sedikit berbeda. Selisih 16 poin ke arah mana pun di sini bukanlah bukti.

Yang kedua adalah kolom harga. Artificial Analysis mencatat MiniMax H3 pada $7,80 per menit dan H3 Max pada $4,80 per menit di papan ini. Vidu Q4 Preview tercatat pada $7,20. Jika dibaca sebagai peringkat, H3 Max tampak seperti pilihan paling bernilai di antara ketiganya — tetapi tarif vendor yang mendasarinya menjelaskan label tersebut, bukan bertentangan dengannya. Kami mencantumkan MiniMax-H3 pada $0,08 per detik di 768P dan $0,13 per detik di 2K pada kartu model kami sendiri, yang berarti $4,80 dan $7,80 per menit. Dua angka MiniMax di papan tersebut adalah model yang sama dengan harga pada dua tingkat resolusi, bukan tier premium dan tier murah. Kolom per menit pada papan preferensi berguna untuk orde besaran dan berbahaya untuk hal yang lebih rinci.

Di mana MiniMax H3 muncul dan Vidu Q4 Preview tidak

Ini adalah bagian dari pertarungan yang tetap bertahan saat seri, dan ini merupakan perbedaan struktural, bukan perbedaan kualitas.

MiniMax H3 (768p) berada di peringkat keempat pada papan text-to-video dengan 1.137 Elo dari 8.315 suara, dengan H3 Max di peringkat kelima dengan 1.130 dari 5.719. Model ini kembali berada di peringkat keempat pada papan penyuntingan video dengan 1.119 dari 7.023 suara, pada papan yang memberi peringkat model berdasarkan penyuntingan video dari instruksi teks dengan audio yang tetap dipertahankan. Vidu Q4 Preview tidak muncul di keduanya.

Ketidakhadiran itu bukanlah celah pengukuran — itulah wujud produknya. API Vidu Q4 Preview mendokumentasikan dua endpoint, /ent/v2/img2video dan /ent/v2/reference2video, dan halaman produk mencantumkan dua mode, Image-to-Video dan Reference-to-Video. Tidak ada jalur text-to-video dalam dokumentasi. Tidak ada jalur penyuntingan video juga, yang berarti model tidak dapat mengambil klip yang sudah ada dan mengubah sesuatu di dalamnya. MiniMax H3 melakukan keduanya, dan kerangka omni-modal-nya — referensi teks, gambar, video, dan audio dalam satu konteks — adalah alasan ia mampu melakukannya.

Perlu ketelitian soal sisi audio, karena kedua model ini menangani audio native dan keduanya bukan hal yang sama. Vidu Q4 Preview menghasilkan audio dan video secara bersamaan, dengan parameter {{2}}audio{{/2}} di endpoint image-to-video yang menghasilkan video berisi dialog dan efek suara, serta menerima hingga tiga klip audio referensi untuk menjaga konsistensi suara karakter.audioMiniMax H3 menghasilkan audio stereo native dan menerima audio sebagai modalitas input bersama gambar dan video. Kasus penggunaan suara referensi adalah kekuatan spesifik Vidu; kasus penggunaan referensi-segalanya adalah milik MiniMax.

Aritmetika per detik, tingkat demi tingkat

Kedua model menagih per detik keluaran yang dihasilkan, yang menjadikan ini perbandingan langka di mana kartu tarif dapat disandingkan satu sama lain tanpa konversi.

• 540p — khusus Vidu Q4 Preview: 9 kredit per detik, sekitar $0.045 pada tarif kredit standar $0.005 yang dipublikasikan platform

• 720P / 768P — Vidu Q4 Preview 19 kredit per detik, sekitar $0,095 vs MiniMax-H3 $0,08 per detik

• 1080p — Vidu Q4 Preview 24 kredit per detik, sekitar $0.12 vs MiniMax-H3 tanpa tier 1080p yang dipublikasikan

• 2K — Vidu Q4 Preview 38 kredit per detik, sekitar $0,19 vs MiniMax-H3 $0,13 per detik

• 4K — hanya Vidu Q4 Preview: 78 kredit per detik, sekitar $0,39

Pola yang muncul dari itu bukanlah "salah satu lebih murah." Batas bawah Vidu Q4 Preview memang benar-benar lebih rendah — tier 540p-nya adalah tier blocking yang harganya tepat untuk apa yang memang digunakan, yakni membuktikan sebuah komposisi sebelum membayar render resolusi penuh, dan tidak ada apa pun di kartu tarif MiniMax yang memainkan peran itu. MiniMax H3 lebih murah di 2K, tier teratas yang dimiliki kedua model, sekitar sepertiga. Dan tier 4K milik Vidu adalah satu-satunya tier generasi 4K dalam perbandingan ini, dengan harga yang mencerminkan hal itu.

Angka peluncuran $0,014 per detik yang menyertai pengumuman Vidu adalah tier 540p pada tarif kredit diskon, bukan tarif umum. Platform Shengshu saat ini menjalankan diskon paket waktu terbatas hingga 30% untuk bundel kredit, yang menurunkan setiap tier secara bersamaan alih-alih mengubah bentuk kurvanya. Perlakukan kurva tarif daftar sebagai pembanding dan diskon sebagai pengimbang sementara.

Di sisi kami: kami merutekan MiniMax-H3. Ini sudah aktif di API model publik di minimax/minimax-h3, ditagih per detik keluaran yang dihasilkan pada tarif daftar vendor yang diteruskan tanpa tambahan apa pun, dapat dipanggil pada endpoint yang kompatibel dengan OpenAI yang sama seperti setiap model teks yang kami layani. Vidu Q4 Preview bukan rute OrcaRouter, dan halaman ini tidak mengklaim sebaliknya — model video yang kami layani memang berada pada satu kunci dan satu bentuk permintaan di samping model bahasa, yang merupakan pengaturan yang membuat membandingkan beberapa di antaranya menjadi murah. Satu konsekuensi praktis dari penetapan harga pass-through: ketika vendor mengubah tarif per detik, perubahan itu terlihat pada rute pada hari yang sama alih-alih saat perpanjangan kontrak.

Apa manfaat "omni-modal" dalam permintaan yang sebenarnya

Konteks terpadu MiniMax H3 mudah dibaca sebagai daftar fitur dan luput sebagai perbedaan rekayasa. Model yang menerima video sebagai referensi masukan dapat diarahkan ke shot yang sudah ada dan diminta untuk melanjutkan, memperpanjang, atau mengubah gayanya; model tanpa masukan video tidak bisa. Itulah mekanisme di balik kehadiran H3 di papan penyuntingan, dan itu juga sebabnya rentang keluaran 4–15 detik model ini bukanlah batasan sebesar yang tampak dari angkanya — perpanjangan multi-turn adalah cara normal untuk membangun sekuens yang lebih panjang darinya.

Batas 16 detik Vidu Q4 Preview juga berlaku per generasi, dan mode Reference-to-Video-nya dirancang untuk penceritaan multi-shot dalam jendela waktu tersebut, dengan dokumentasi yang menjelaskan peralihan kamera cerdas dan konsistensi di berbagai posisi kamera. Yang tidak dimilikinya adalah jalur untuk menerima klip yang sudah Anda rekam dan memodifikasinya. Jika alur kerja Anda dimulai dari rekaman, bukan dari gambar diam atau kumpulan referensi, salah satu dari dua model ini tidak tersedia bagi Anda, dan tidak ada angka Elo yang dapat menutupinya.

Yang mana, berdasarkan pekerjaan

Pilih MiniMax H3 ketika masukannya adalah apa pun selain gambar atau kumpulan referensi. Teks-ke-video, penyuntingan video-ke-video, masukan audio, perpanjangan multi-turn lebih dari lima belas detik, atau pipeline di mana model perlu menangani kasus penggunaan yang setara dengan tiga papan peringkat berbeda — itulah wilayah H3, dan H3 adalah satu-satunya di antara keduanya yang memilikinya. Tarif 2K-nya juga merupakan yang lebih murah di antara keduanya pada tingkat teratas yang sama-sama mereka miliki.

Ambil Vidu Q4 Preview ketika tugasnya adalah konsistensi para pemeran dan suara, atau ketika Anda membutuhkan tingkat generasi 4K, atau ketika Anda menginginkan pass blocking 540p yang murah untuk mengiterasi sebuah shot sebelum berkomitmen. Lima belas referensi gambar dan tiga referensi audio merupakan anggaran referensi terpublikasi yang lebih besar daripada yang didokumentasikan oleh MiniMax, dan tidak ada model lain dalam perbandingan ini yang menghasilkan secara native pada 4K. Trade-off untuk itu adalah kumpulan mode yang lebih sempit.

Apa yang akan mengubah ini: rilis Vidu Q4 penuh yang menambahkan endpoint text-to-video akan menempatkan kedua model di papan yang sama dan mengubah ini menjadi kontes langsung. AA-Video-I2V v2.0, yang diumumkan akan hadir dengan 1080p di seluruhnya dan taksonomi kapabilitas yang direvisi, akan menggantikan perolehan suara di puncak papan alih-alih mengurutkannya kembali — dan ini akan menyelesaikan apakah seri tiga arah saat ini adalah seri atau batas pengukuran. Sampai saat itu, angka yang perlu diingat adalah enam belas, dengan nama papan dan tanggal di sampingnya.

Satu hal yang layak diambil dari podium itu sendiri: tempat pertama yang berada enam belas Elo di atas tempat ketiga, dengan interval selebar itu, bukanlah sebuah peringkat. Itu adalah tiga model yang tidak dapat dibedakan oleh pemilih manusia, dan keputusan di antara mereka harus berasal dari segala hal lain di halaman ini.

A generated two-column scoreboard titled 'Vidu Q4 Preview vs MiniMax H3 - the scoreboard'. The left column reads: Image-to-video Elo 1,179 (3rd); Text-to-video not present; Video editing not present; Max resolution 4K generation tier; Clip length 1-16 seconds; Price at 2K about 0.19 USD per second. The right column reads: Image-to-video Elo 1,181 (2nd); Text-to-video 4th, 1,137; Video editing 4th, 1,119; Max resolution 2K; Clip length 4-15 seconds; Price at 2K 0.13 USD per second. A footer reads 'All Elo and rank figures per Artificial Analysis, 8 Oct 2026; prices per vendor rate cards.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the OrcaRouter model page for minimax/minimax-h3, showing MiniMax-H3 described as MiniMax's omni-modal video generation model and the Hailuo 3 generation, released July 31, 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio, billed per second of generated output at $0.08/s at 768P and $0.13/s at 2K, with an OpenAI-compatible code sample and a per-second price of $0.0800.