Kartu judul untuk Odyssey-3 vs Kandinsky 6.0 Video, dengan panel kiri berjudul Odyssey-3 yang membaca lingkungan interaktif, pratinjau riset yang dibuka 8 Okt 2026, 832x480 atau 1280x720 Pro, tanpa bobot dan tanpa harga; dan panel kanan berjudul Kandinsky 6.0 Video yang membaca bobot terbuka pada 6 Okt 2026 di bawah lisensi MIT, klip 5 detik dengan audio 44 kHz, Full HD 1920x1080, Physics-IQ tidak dikirim.
Guides & Insights

Odyssey-3 vs Kandinsky 6.0 Video: Bobot Terbuka dan Audio Berhadapan dengan Pratinjau Interaktif Tertutup

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kandinsky 6.0 Video hadir pada 6 Oktober 2026 dengan hal yang jarang didapat rilis model terbuka pada hari pertama: dukungan di Diffusers, ComfyUI, vLLM-Omni, SGLang, dan FastVideo, semuanya didokumentasikan dalam log pembaruan repositori itu sendiri, bersama laporan arXiv yang dikirimkan pada 4 Oktober dan checkpoint berlisensi MIT di Hugging Face. Odyssey-3 hadir dua hari kemudian, pada 8 Oktober, sebagai pratinjau riset publik dari transformer difusi autoregresif yang membangun lingkungan dari prompt dan memprediksi perubahan secara real time saat Anda bergerak di dalamnya. Yang satu adalah model dengan 29 miliar parameter yang dapat Anda unduh dan jalankan di GPU Anda sendiri malam ini. Yang lain adalah sistem interaktif yang hanya bisa Anda akses melalui pratinjau browser Odyssey dan formulir kontak. Keduanya adalah dua kutub dari apa yang dimaksud dengan "model video" pada minggu yang sama di Oktober 2026, dan pilihan di antara keduanya lebih mengenai siapa yang memegang bobotnya daripada mengenai benchmark.

Mereka juga menginginkan hal yang berbeda darimu. Kandinsky 6.0 Video adalah model generasi: prompt masuk, keluar klip lima detik dengan audio tersinkronisasi. Odyssey-3 adalah model prediksi: bertindaklah, dan lihat dunia merespons. Keduanya tidak saling menggantikan, dan fakta bahwa keduanya dirilis terpisah 48 jam adalah konteks paling berguna yang dimiliki keduanya.

Dua arsitektur tersebut, dalam istilah para vendor sendiri

Kandinsky 6.0 Video adalah keluarga model difusi fondasi untuk generasi audio-video tersinkronisasi, yang terdiri atas Kandinsky 6.0 Video Lite dengan 3B parameter dan Kandinsky 6.0 Video Pro dengan 29B. Keduanya menghasilkan klip berdurasi lima detik dengan audio 44 kHz tersinkronisasi, termasuk lip-sync, dalam mode teks-ke-audio-video dan gambar-ke-audio-video, serta model super-resolusi plug-in meningkatkan keluarannya menjadi Full HD 1920×1080. Tekniknya adalah CrossDiT aliran ganda yang menghubungkan aliran video yang telah dilatih sebelumnya ke aliran audio yang baru dilatih melalui cross-attention dua arah, sehingga kedua modalitas selaras dalam waktu dan semantik, bukan dihasilkan secara terpisah lalu digabungkan. Resep pelatihannya bersifat berkelanjutan: aliran audio dilatih dari awal pada korpus audio berskala besar, lalu kedua aliran dilatih bersama-sama pada data audio-video berpasangan sambil mempertahankan fidelitas unimodal, diikuti dengan fine-tuning terawasi, pasca-pelatihan pembelajaran penguatan, dan distilasi.

Odyssey-3 adalah transformer difusi autoregresif yang dijelaskan oleh Odyssey sebagai model difusi video multi-langkah yang diperluas melalui teacher forcing dan causal masking, dilatih untuk melanjutkan dari observasi sebelumnya dan memprediksi keadaan mendatang yang dikondisikan pada input aksi, lalu didistilasi dengan pencocokan distribusi dan distilasi adversarial menjadi varian beberapa langkah yang cukup cepat untuk diinteraksikan. Model ini berjalan pada 832×480, dengan Odyssey-3 Pro pada 1280×720, tidak menghasilkan audio, dan tujuan utamanya adalah agar outputnya bergantung pada apa yang Anda lakukan sesaat sebelumnya.

Dukungan sejak hari pertama adalah pembeda yang tidak diukur siapa pun

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Baca lagi log pembaruan Kandinsky 6.0, karena ini adalah fakta paling konkret dalam perbandingan ini. Pada 6 Oktober proyek mencatat ketersediaan di Diffusers, registri node ComfyUI, vLLM-Omni, SGLang, dan FastVideo, serta sebuah Hugging Face Space untuk model Pro yang telah didistilasi. Itu berarti lima stack inferensi independen dalam satu hari. Bagi siapa pun yang telah menunggu berbulan-bulan agar sebuah checkpoint mencapai framework serving, angka itulah yang menentukan apakah model tersebut dapat digunakan.

Sekarang, bandingkan dengan narasi akses Odyssey-3. Pratinjau ini berjalan di experience.odyssey.systems dengan navigasi orang pertama, navigasi orang ketiga, dan pergerakan kamera independen. Akses API berupa formulir kontak. Tidak ada halaman harga, tidak ada dokumentasi batas laju, dan tidak ada kunci akses mandiri. Ketentuan API situs itu terakhir diperbarui 2026-01-22 dan masih mengatur "prototipe Odyssey-2 API" — permukaan komersialnya belum ditulis ulang untuk model yang dirilis bulan ini.

• Di mana ini berjalan — GPU Anda sendiri, dengan bobot dan kode berlisensi MIT, dibandingkan dengan server Odyssey saja.

• Bagaimana Anda mengintegrasikannya — pipeline Diffusers, node ComfyUI, vLLM-Omni, SGLang, FastAPI, terhadap pratinjau browser dan formulir kontak.

• Apa yang dapat Anda periksa — arsitektur, resep pelatihan, dan ukuran checkpoint dalam laporan publik, dibandingkan dengan deskripsi vendor tentang pipeline pelatihan tanpa bobot dan tanpa paper.

• Apa yang dapat Anda modifikasi — fine-tune, LoRA, kuantisasi, dan distilasi, yang semuanya sudah diterbitkan komunitas di Hugging Face sehari setelah rilis, dibandingkan dengan tidak ada apa pun sama sekali.

Dimensi demi dimensi

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• Keluaran — klip lima detik dengan audio 44 kHz tersinkronisasi untuk kedua tingkat Kandinsky, dibandingkan dengan lingkungan interaktif tanpa audio untuk Odyssey-3.

• Resolusi — Full HD 1920×1080 melalui model super-resolusi plug-in untuk Kandinsky 6.0 Video, dibandingkan dengan 832×480 untuk Odyssey-3 dan 1280×720 untuk Odyssey-3 Pro.

• Modalitas yang tersedia — teks dan gambar untuk Kandinsky, dalam mode teks-ke-audio-video dan gambar-ke-audio-video; sebuah prompt plus input kontrol langsung untuk Odyssey-3.

• Parameter — 3B dan 29B dipublikasikan untuk tier Lite dan Pro, sedangkan untuk kedua tier Odyssey-3 tidak diungkapkan.

• Perangkat keras — GPU NVIDIA dan Python 3.13 atau 3.14, dengan preset yang telah disertakan untuk kartu kelas H100/H200 hingga RTX 5090 untuk Kandinsky; peramban untuk Odyssey-3.

• Harga — $0 per klip untuk Kandinsky 6.0 Video jika Anda memiliki GPU, dibandingkan dengan tidak adanya harga yang dipublikasikan dalam bentuk apa pun untuk Odyssey-3. Estimasi biaya ternormalisasi papan untuk Odyssey-3 dan Odyssey-3 Pro adalah $0,139 dan $0,267 per video yang dihasilkan, tidak termasuk penanganan prompt.

• Penilaian pihak ketiga — tidak satu pun generasi milik model itu sendiri yang berada dalam adu langsung independen. Laporan Kandinsky mengandalkan evaluasi manusia secara berdampingan terhadap pendahulunya; angka Odyssey-3 berasal dari pengajuan benchmark ditambah evaluasi yang dijalankan vendor.

• Lisensi — MIT untuk Kandinsky 6.0 Video, dibandingkan dengan tidak adanya lisensi yang diterbitkan karena tidak ada bobot untuk dilisensikan.

Apa yang dapat dan tidak dapat dikatakan oleh tolok ukur

Kandinsky 6.0 Video tidak muncul di Physics-IQ Verified, papan Anates Labs dan DeepMind yang menilai kelanjutan eksperimen fisik nyata pada 41 model. Mitra head-to-head Odyssey-3 di sini juga tidak, karena papan tersebut menilai model yang menghasilkan klip dan keduanya melakukannya. Yang memang ada di papan tersebut adalah lini model dunia Kandinsky yang lebih awal, Kandinsky-WM 1.0, pada peringkat 20 dan −8.02 pp terhadap rata-rata track — keluarga yang berbeda, tujuan yang berbeda, dan satu-satunya entri Kandinsky di papan tersebut.

Baris-baris Odyssey-3, sebagai kontras: peringkat 8 pada +2,15 pp untuk prompt milik benchmark itu sendiri dan $0,129 per video, serta peringkat 3 pada +9,99 pp untuk prompt khusus, dengan Odyssey-3 Pro berada di peringkat kedua secara keseluruhan pada +11,15 pp. Angka-angka itu lebih baik daripada angka apa pun yang dimiliki lini Kandinsky pada tes tertentu itu, dan angka-angka itu juga mengukur kemampuan yang berbeda — Odyssey-3 dinilai berdasarkan apa yang diprediksinya setelah gangguan, yang merupakan hal yang sama dengan yang dijajakan pratinjaunya.

Bukti Kandinsky sendiri adalah evaluasi manusia dalam laporan teknis: Kandinsky 6.0 Video Pro jelas mengungguli pendahulunya, Kandinsky 5.0 Video Pro, dan tetap kompetitif dengan model generasi audio-video terkemuka, terutama pada kualitas ucapan. Itu adalah perbandingan berdampingan yang dijalankan vendor, dan itu adalah jenis klaim yang dapat diperiksa terhadap checkpoint yang dirilis oleh siapa pun yang memiliki 5090 dan waktu satu sore. Klaim setara Odyssey-3 tidak dapat diperiksa oleh siapa pun tanpa kunci API.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Menjangkau mereka

OrcaRouter tidak meng-host kedua model tersebut, dan tidak akan pernah menyiratkan sebaliknya: Odyssey-3 tidak memiliki tarif yang dipublikasikan untuk siapa pun untuk merutekannya, dan Kandinsky 6.0 Video adalah open weights, yang berarti cara yang benar untuk menjalankannya adalah setup repositori itu sendiri di GPU Anda sendiri, bukan endpoint yang dihosting.

Di mana satu kunci OrcaRouter cocok adalah lapisan di sekitar eksperimen. Repositori Kandinsky mengasumsikan Anda menyediakan GPU, lingkungan, dan perbandingan; yang tidak disediakannya adalah cara untuk memanggil model yang ingin Anda jadikan tolok ukur. Lebih dari 200 model berada di balik satu kunci OrcaRouter dengan harga daftar penyedia dan markup 0% — termasuk minimax/minimax-h3, model video berbobot terbuka yang dirilis M​iniMax pada 31 Juli 2026, dengan $0,08 per detik output 768P — sehingga perubahan harga vendor masuk ke faktur Anda pada hari yang sama, failover otomatis menjaga agar rangkaian evaluasi tidak mati akibat jam buruk salah satu upstream, dan DSL routing memungkinkan Anda menempatkan model video terkelola dan model visi di balik satu antarmuka ketika pekerjaannya adalah menghasilkan lalu menilai. Anda tetap mengkloning repo dan menjalankan penyiapan sendiri. Anda hanya tidak perlu membangun separuh bagian lain dari rig tersebut.

Yang mana yang sebenarnya kamu inginkan?

Jika Anda membutuhkan keluaran yang bisa Anda miliki — ketentuan komersial yang bisa Anda baca, bobot yang bisa Anda fine-tune, pipeline yang berjalan tanpa API pihak lain harus aktif — Kandinsky 6.0 Video adalah jawabannya, dan dukungan framework sejak hari pertama berarti Anda tidak bertaruh pada artefak riset. Jika Anda membutuhkan suara pada video, hanya ini satu-satunya dari keduanya yang menghasilkan suara.

Jika masalahnya adalah prediksi dan bukan produksi — sebuah kebijakan yang harus bereaksi, lingkungan pelatihan, apa pun yang keadaan berikutnya bergantung pada tindakan terakhir — Odyssey-3 adalah satu-satunya dari keduanya yang melakukannya, dan itu juga yang tidak dapat Anda beli. Itulah bentuk jujur dari pertarungan ini pada minggu saat keduanya diluncurkan: model terbuka yang dapat Anda unduh dan model interaktif yang hanya dapat Anda coba, dengan bukti tolok ukur yang mendukung model tertutup dan bukti praktis yang mendukung model terbuka.