Kartu judul yang dihasilkan bertuliskan 'Kandinsky 6.0 Video vs Grok Imagine Video' dengan subjudul 'Papan peringkat berbalik', di atas baris ikon berlabel 'Pembuatan Video', 'Audio Tersinkronisasi' dan 'Penyebaran Bobot Terbuka'. Logo OrcaRouter berada di sudut kanan bawah.
Guides & Insights

Kandinsky 6.0 Video vs Grok Imagine Video: Papan Peringkat Berbalik

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada Januari 2026, ketika Grok Imagine Video diluncurkan, model itu memuncaki arena video Artificial Analysis di kedua mode. Hari ini papan yang sama menempatkan build terkininya di peringkat kesebelas atau kedua belas untuk text-to-video. Itu bukan skandal dan bukan kegagalan — itulah yang terjadi pada kategori yang bergerak cepat dalam sembilan bulan, dan itulah alasan jujur untuk membandingkan model generasi xAI dengan Kandinsky 6.0 Video saat ini juga. Salah satunya adalah layanan yang dioptimalkan untuk seberapa cepat Anda bisa menghasilkan klip berikutnya; yang lain adalah checkpoint berlisensi MIT, 29B parameter pada ukuran Pro dan 3B pada Lite, yang dirilis oleh Kandinsky Lab milik Sber pada pekan pertama Oktober 2026, menghasilkan video lima detik dengan audio 44 kHz tersinkronisasi dan lip-sync. Pertanyaan yang menarik bukanlah mana yang unggul di sebuah papan peringkat — melainkan apa yang secara struktural mampu dilakukan masing-masing berikutnya.

Papan yang bergerak di bawahnya

Grok Imagine Video adalah model generasi xAI, pertama dirilis pada 29 Januari 2026 dan stabil pada versi 1.5 sejak 16 Juni. Di papan peringkat teks-ke-video Artificial Analysis, build 1.5-nya berada di peringkat 11–12 dengan Elo 1.045 (±9) dari 4.056 suara, tercatat $15,00 per menit. Build aslinya tidak ada di papan itu.

Image-to-video adalah area di mana keluarga ini lebih kuat, dan di mana kedua build ini berbeda dengan cara yang patut dicermati dengan saksama:

• grok-imagine-video-1.5 — peringkat 7–9, Elo 1.098 (±8), 5.267 suara, $8,40/menit.

• grok-imagine-video (versi Januari) — peringkat 12–17, Elo 1.072 (±7), 14.371 suara, $4,20/menit.

• Sebagai gambaran, puncak papan I2V itu — MiniMax H3 Max — berada di Elo 1.195 (±9) dengan 5.894 suara, dan Wan 3.0 berada di peringkat keenam dengan 1.164.

Dua tafsiran berikut ini, dan keduanya benar. Build terbaru xAI benar-benar unggul dari pendahulunya sendiri pada image-to-video, sebesar 26 Elo, dan biayanya dua kali lebih mahal per menit untuk menjadi seperti itu. Dan kisah minggu peluncuran — sebuah model yang tiba di puncak — tidak bertahan: bidangnya bergerak, arena mengumpulkan puluhan ribu suara di selusin sistem yang lebih baru, dan posisi pertengahan tabel adalah tempat di mana sembilan bulan kompetisi menempatkan generator cepat serbaguna.

Kandinsky 6.0 Video tidak memiliki Elo di papan mana pun. Buktinya adalah uji VABench dan evaluasi manusia yang dijalankan laboratorium, keduanya diterbitkan oleh Sber, tidak ada yang direproduksi di luar lembaga itu. Menempatkan model terbuka yang belum diaudit di samping model komersial yang telah dinilai adalah justru perbandingan yang perlu ditangani dengan hati-hati: posisi model yang telah dinilai itu nyata dan tidak menyanjung, sedangkan posisi model yang belum dinilai tidak diketahui. "Tidak diketahui" bukanlah "lebih baik".

Dua jenis cepat, dan hanya satu di antaranya yang diukur dalam detik

Tujuan desain Grok Imagine Video adalah throughput per kreator. Fitur ini terhubung ke X, mengembalikan klip jadi dengan suara, dan rangkaian fiturnya seperti daftar hal yang benar-benar dilakukan orang di feed: berbagai rasio aspek, gerakan kamera, penambahan, penghapusan, dan penukaran objek, transfer gaya, generasi terkondisi referensi dari beberapa gambar untuk konsistensi karakter, audio native dengan dialog, efek, dan musik. Durasi klip mencapai lima belas detik, resolusinya maksimal 1080p. Seluruh produk dirancang agar percobaan kedua hanya memakan waktu beberapa menit dan beberapa sen.

Kandinsky 6.0 Video cepat dalam arti yang berbeda — bukan per percobaan, melainkan per unit kepemilikan. Tidak ada bagian darinya yang instan. Waktu kerja repositori itu sendiri untuk model non-terdistilasi, setelah pemanasan dan tidak termasuk pemuatan bobot serta pengodean MP4, menempatkan klip Pro Full HD lima detik pada sekitar 402 detik di H100, 854 di RTX 5090, 1.247 di RTX 4090 dan 3.530 di RTX 5060 Ti. Lite Full HD adalah 284 detik di H100. Alat yang membuatnya bisa ditanggung adalah checkpoint terdistilasi, yang oleh makalah diukur setara dengan model penuh — lebih disukai atau imbang pada mayoritas kriteria, preferensi rata-rata 51% berbanding 49%, tidak ada perbedaan individual yang mencapai signifikansi. Yang Anda dapatkan sebagai imbalan atas render yang lambat adalah model di disk Anda sendiri tanpa meteran per klip yang berjalan sama sekali.

Itulah bentuk sebenarnya dari pertarungan ini. Grok Imagine Video mengoptimalkan biaya percobaan kesepuluh. Kandinsky 6.0 Video mengoptimalkan biaya percobaan ke-10.000, dan menagihmu dalam hal perangkat keras dan kesabaran untuk percobaan pertama.

Keduanya menghasilkan audio — dan keduanya bukan klaim yang sama.

Inilah sumbu di mana perbandingan yang malas akan bilang "seri" dan keliru.

Grok Imagine Video menghasilkan audio native dengan dialog, efek, dan musik sebagai salah satu dari banyak fiturnya. Ini adalah generator serbaguna yang kebetulan menyertakan suara.

Kandinsky 6.0 Video dibangun di sekitar suara. Arsitekturnya adalah CrossDiT dua-aliran yang memasangkan aliran video yang diinisialisasi dari Kandinsky 5.0 Video dengan aliran audio yang dilatih dari awal pada korpora audio besar, digabungkan oleh cross-attention dua arah dan dilatih secara bersama-sama. Outputnya 44 kHz dengan lip-sync eksplisit, dan tahap reinforcement-learning pada makalah ini dilaporkan memangkas word error rate dari ucapan yang dihasilkan sebesar 47% — diukur dengan Whisper-large-v3, yang merupakan salah satu model reward RL, sebuah detail yang penting karena makalah ini melaporkan WER kedua yang tidak dapat dibandingkan di samping VABench dengan menggunakan Qwen3-ASR-1.7B. Ucapan adalah hal yang digunakan untuk post-training model ini.

Sebaliknya, studi Sber sendiri bersikap terbuka tentang di mana ia kalah. Dalam evaluasi berdampingan yang dilakukan laboratorium tersebut, MiniMax H3 dan Dreamina Seedance 2.0 lebih disukai pada kriteria visual dengan selisih yang signifikan, dan model ini digambarkan sebagai kompetitif, bukan unggul. Klaim yang layak ditanggapi dengan serius justru lebih sempit dan lebih berguna: dibandingkan Kling 2.6 and Veo 3.1 Fast, hasilnya saling unggul dari satu kriteria ke kriteria lain, dan Kandinsky 6.0 Video tetap kompetitif pada kualitas bicara serta sinkronisasi audio-video, di mana sebagian besar perbandingannya berakhir seri.

Lima belas detik melawan lima, dan berapa biaya untuk mencapai masing-masing.

• Klip maksimum — Grok Imagine Video: hingga 15 detik. Kandinsky 6.0 Video: 5 detik tetap, 121 frame pada 24 fps, tidak ada mode perpanjangan dalam rilis ini.

• Resolusi — Grok Imagine Video: hingga 1080p. Kandinsky 6.0 Video: SD, HD, dan Full HD melalui model super-resolution khusus, peningkatan skala x2, x4, atau x2.25 untuk klip lima detik.

• Input referensi — Grok Imagine Video: generasi yang dikondisikan oleh referensi dari beberapa gambar untuk konsistensi karakter, plus penambahan/penghapusan/penukaran objek. Kandinsky 6.0 Video: satu gambar, diterapkan sebagai frame ekor yang dimasker.

• Harga — Grok Imagine Video: per detik keluaran, dari ujung bawah rentang hingga $0.30/dtk pada 1080p, dengan biaya tambahan per input gambar; akses gratis berada di balik tingkat langganan X. Kandinsky 6.0 Video: tidak ada — tidak ada layanan, tidak ada tarif, hanya waktu GPU yang Anda sediakan.

• Bobot — Grok Imagine Video: tidak. Kandinsky 6.0 Video: MIT, Pro dan Lite, dengan integrasi diffusers.

Premi untuk build Grok yang lebih baru adalah angka yang perlu dilingkari. Beralih dari build Januari ke 1.5 membutuhkan biaya dua kali lebih besar per menit di papan image-to-video dan menghasilkan 26 Elo. Itu adalah peningkatan nyata dengan harga nyata, dan itulah pertukaran yang sama yang diminta setiap vendor video agar dilakukan para pembeli saat ini.

Di mana router cocok, dan di mana tidak

OrcaRouter tidak menyediakan Grok Imagine Video atau Kandinsky 6.0 Video, dan tidak ada apa pun di sini yang mengklaim sebaliknya: Kandinsky tersedia untuk Anda unduh dan jalankan sendiri, sedangkan Grok Imagine Video diakses melalui platform milik xAI sendiri. Yang dibutuhkan oleh pipeline yang dibangun di atas salah satu model tersebut dari sebuah router adalah teks yang mengelilingi proses render — daftar shot, perluasan prompt yang mengubah sebuah ide menjadi caption panjang atau pendek yang menjadi data pelatihan model-model ini, pekerjaan captioning dan transkripsi, serta ringkasan tinjauan yang menentukan generasi mana yang disimpan. Semuanya berjalan pada satu endpoint yang kompatibel dengan OpenAI di lebih dari 200 model teks dengan harga daftar penyedia dan markup 0%, sehingga potongan vendor langsung aktif pada kunci yang sama di hari perilisannya, dengan failover otomatis sehingga panggilan yang gagal di tengah antrean render dialihkan alih-alih membuat batch terhenti. Orkestrasi di sekitar model video adalah masalah perutean bahkan ketika model video itu sendiri tidak dapat dirutekan, yang merupakan kondisi kedua model ini saat ini.

Yang mana, dan untuk apa

Pilihlah Grok Imagine Video ketika pekerjaannya bersifat volume: klip media sosial, iterasi cepat, sebuah shot yang akan Anda regenerasi enam kali sebelum hasilnya benar, dan tenggat waktu yang tidak bisa diperpanjang. Harga per percobaannya adalah produknya, dan fakta bahwa kini ia berada di papan tengah alih-alih di puncak adalah biaya normal dari kategori yang bergerak secepat ini.

Gunakan Kandinsky 6.0 Video ketika pekerjaannya adalah pipeline: unit lima detik tetap yang dapat Anda batch, proses image-to-video di mana kesetiaan pada still yang diberikan adalah yang penting, ucapan yang Anda ingin dapat dipahami, dan hasil akhir yang lebih Anda pilih untuk tidak disewa. Anggarkan untuk render, perkirakan proses yang lambat pada apa pun kelas konsumen, dan anggap setiap angka kualitas dalam tulisan ini sebagai milik Sber sendiri sampai seseorang di luar lab menilainya.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

Yang membuat pasangan ini layak ditonton adalah mana yang mampu menyerap kuartal buruk. Jika Grok Imagine Video terus merosot di arena, jawabannya adalah model yang lebih baik dan harga baru — begitulah cara kategori ini bekerja dan xAI telah menunjukkan bahwa mereka akan merilisnya. Jika Kandinsky 6.0 Video ternyata berada di papan tengah setelah dinilai, checkpoint-nya tetap ada, tetap berjalan, dan tetap dapat di-fine-tune; tidak ada yang berubah dari lisensinya seiring dengan angka tersebut. Itu adalah jenis daya tahan yang berbeda, dan hanya salah satunya yang diukur oleh Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.