Kartu judul yang dihasilkan bertuliskan 'Video Kandinsky 6.0 Kini Hadir di vLLM-Omni' dengan subjudul 'Sebuah checkpoint menjadi layanan', di atas baris ikon berlabel 'Pembuatan Video', 'Audio Tersinkronisasi', dan 'Deployment Open-Weight'. Logo OrcaRouter berada di sudut kanan bawah.
Engineering & Research

Kandinsky 6.0 Video Hadir di vLLM-Omni: Apa yang Ditambahkan Lapisan Serving pada Model Terbuka

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Permintaan tarik #8537 digabungkan ke vLLM-Omni pada 07:55 UTC pagi ini, dan hal itu melakukan tepat satu hal: membuat Kandinsky 6.0 Video dapat dilayani. Model itu sendiri datang dari Kandinsky Lab milik Sber pada hari yang sama sebagai sepasang — Kandinsky 6.0 Video Pro dengan 29B parameter dan Kandinsky 6.0 Video Lite dengan 3B — menghasilkan klip berdurasi lima detik dengan audio 44 kHz yang tersinkronisasi, termasuk lip-sync, dari prompt teks atau gambar referensi, dengan kode, bobot, dan integrasi diffusers semuanya di bawah MIT. Yang belum dimilikinya hingga pagi ini adalah cara untuk menjalankannya di dalam server inferensi alih-alih baris perintah sekali jalan.

Perbedaan itu lebih bernilai daripada kedengarannya, dan itulah alasan ini menjadi cerita tersendiri di luar rilis tersebut. Checkpoint terbuka yang dapat Anda jalankan di kartu Anda sendiri adalah artefak riset; checkpoint terbuka dengan pipeline sisi server, titik masuk bersama, dan resep penyajian adalah sesuatu yang dapat Anda letakkan di belakang antrean. Rilis minggu ini memberi Anda yang pertama. Merge hari ini adalah awal dari yang kedua.

Apa yang sebenarnya bergabung

PR ini menambahkan teks-ke-video-dan-audio serta gambar-ke-video-dan-audio ke vLLM-Omni dari checkpoint kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Pilihan-pilihan rekayasanya adalah bagian yang menarik, karena itu memberi tahu Anda seperti apa arsitektur tersebut sebenarnya ketika pihak selain penulisnya harus menyajikannya.

• Satu DiT menghilangkan noise pada kedua modalitas. Pipeline ini terdaftar sebagai Kandinsky6TI2VAPipeline, dan latent video serta latent audio di-denoise secara bersama oleh satu transformer, bukan oleh dua model yang dijalankan secara berurutan. Hal itu mencerminkan CrossDiT dual-stream dalam makalah, di mana aliran video yang telah dilatih sebelumnya dan aliran audio yang dilatih dari awal dihubungkan oleh cross-attention dua arah.

• Bobot dimuat folder demi folder. Checkpoint Hub dibaca sebagai transformer/, vae/, text_encoder/, text_encoder_2/ dan audio_vae/. Nama internal checkpoint yang dipublikasikan — videoT dan audioT — dipetakan ke video_dec_block dan audio_dec_block saat pemuatan, yang merupakan jenis detail yang bisa menghabiskan waktu sehari jika Anda menemukannya sendiri.

• Audio aktif secara default. Pipeline ini menghasilkan AAC 44,1 kHz alih-alih memperlakukan suara sebagai flag opt-in, sehingga permintaan tanpa parameter audio tetap dibalas dengan ucapan, musik, atau ambiens yang tersinkronisasi.

• Input gambar adalah frame tail yang di-mask, bukan mode terpisah. Pengondisian gambar referensi diterapkan melalui masking, yang memungkinkan pipeline yang sama melayani T2AV dan I2AV tanpa percabangan.

Uji asap dari pengaju adalah batas bawah yang berguna: satu NVIDIA H100 80GB dengan FlashAttention-3, CPU offload aktif, 864×480, 125 frame, 50 langkah, CFG 5.0, seed 42. Itu adalah klip 5 detik pada sedikit di bawah HD, bukan render Full HD, dan PR tersebut tidak mengklaim sebaliknya.

Checkpoint bukanlah sebuah layanan

Alasan untuk peduli tentang merge seperti ini adalah apa yang dihapusnya dari daftar Anda. Menjalankan implementasi referensi berarti mengkloning repositori, menjalankan just setup, membiarkannya mengompilasi SageAttention pada apa pun di bawah Hopper, mengunduh checkpoint ke direktori cache, dan memanggil perintah generate yang outputnya mendarat di folder bertimestamp. Itu tidak masalah untuk sekadar melihat, tetapi janggal untuk sebuah produk.

vLLM-Omni memberi Anda model di dalam proses serving, dengan titik masuk inferensi offline yang sama seperti yang digunakan proyek untuk model difusinya yang lain (examples/offline_inference/text_to_video/text_to_video.py dan pasangan image-to-video-nya) serta resep serving di recipes/Kandinsky/Kandinsky6-TI2VA.md. Ada dua konsekuensi praktis. Kisah deployment Anda menjadi kontainer yang berbicara melalui antarmuka HTTP, bukan skrip yang Anda gembalakan, dan model itu tidak lagi menjadi kasus khusus di stack Anda — ia berada di samping apa pun yang lain Anda jalankan di server tersebut.

Perhatikan apa yang ini bukan. Ini bukan endpoint yang di-hosting, ini bukan harga, dan ini bukan pengukuran kualitas independen. Ini satu tempat lagi di mana model dapat dijalankan, yang dikontribusikan oleh seseorang dari luar lab, tiga hari setelah bobot-bobot itu muncul.

Berapa biaya klip lima detik dalam waktu nyata, pada kartu sungguhan

Tabel milik repositori itu sendiri adalah titik awal yang jujur. Ini adalah waktu kerja model dasar non-distilled untuk satu klip 5 detik setelah warmup, dengan pemuatan bobot dan pengodean MP4 tidak disertakan. Full HD di sini berarti proses super-resolution juga berjalan.

• Full HD (Pro) — 402 detik pada H100, 765 detik pada RTX PRO 6000, 854 detik pada RTX 5090, 1.106 detik pada A100 80GB, 1.247 detik pada RTX 4090, dan 3.530 detik pada RTX 5060 Ti.

• Full HD (Lite) — 284 detik pada H100, 387 detik pada RTX PRO 6000, 406 detik pada RTX 5090, 664 detik pada A100 80GB, 578 detik pada RTX 4090, dan 1.774 detik pada RTX 5060 Ti.

• SD (Pro) — 356 s pada H100 versus 936 s pada RTX 4090, yakni saat penalti kartu konsumen paling kecil dan sisi ekonominya paling tidak buruk.

Bentuk tabel itu lebih penting daripada sel mana pun. H100 kira-kira tiga kali lebih cepat daripada 4090 pada Pro Full HD, dan kira-kira enam kali lebih cepat daripada 5060 Ti pada pekerjaan yang sama — tetapi tahap SR memakan biaya yang sama pada kedua ukuran model, sekitar 64 detik pada HD dan sekitar 96 detik pada Full HD dengan 5090. Lite tidak memberi Anda proses super-resolution yang lebih singkat, karena model SR dilatih secara terpisah dan tidak peduli model dasar mana yang menyuplainya.

Jalur 16 GB, dan satu pengaturan yang mengubah gambar Anda

Memori teralokasi puncak dalam sekali eksekusi Pro SD mencapai 72,8 GiB, yang melampaui setiap kartu konsumen. Repositori ini menjawabnya dengan block offloading — hanya dua blok transformer yang berada di GPU pada satu waktu, sisanya dialirkan dari memori host — ditambah tiga preset untuk kartu 32 GB, 24 GB, dan 16 GB. Preset 32 dan 24 GB identik, karena di atas 24 GB, ruang cadangan ekstra tidak menghasilkan peningkatan kecepatan.

Peringatan itu terkubur dan layak diulang: pada preset 16 GB, encoder teks dikuantisasi ke NF4, dan paper tersebut secara eksplisit menyatakan bahwa ini adalah satu-satunya perubahan preset yang mengubah klip itu sendiri. Representasi tekstual yang berbeda menghasilkan video yang berbeda. Semua hal lainnya — panjang segmen, strip spasial, offloading — mengubah keluaran pada tingkat derau pembulatan, sekitar 12% piksel berbeda sebesar satu tingkat kecerahan pada sekitar 57 dB PSNR. Jika Anda mereproduksi hasil orang lain pada kartu 16 GB dan hasilnya tidak cocok, itulah hal pertama yang perlu diperiksa.

Tiga hal yang tidak diselesaikan oleh catatan rilis

• Lima detik adalah batas atas, bukan nilai default. Model ini dilatih pada 121 frame dan 24 fps, dan baik makalah maupun resep penyajiannya dibangun di sekitar itu. Tidak ada mode ekstensi dalam rilis ini. Apa pun yang lebih panjang adalah masalah penggabungan (stitching) yang harus Anda tangani sendiri.

• Checkpoint hasil distilasi itulah yang akan benar-benar Anda layani, dan model itu diukur pada paritas. Ablasi dalam makalah tersebut menunjukkan model hasil distilasi lebih disukai atau setara pada mayoritas kriteria, tanpa perbedaan individual yang mencapai signifikansi, dengan preferensi rata-rata 51% berbanding 49%. Itulah trade-off yang Anda terima demi kecepatan.

• Ada dua angka word-error-rate dalam makalah ini dan keduanya tidak dapat dibandingkan. Pengurangan 47% pada WER ucapan yang dihasilkan yang menyertai tahap pembelajaran penguatan dinilai dengan Whisper-large-v3, salah satu model reward RL; WER yang dilaporkan bersama VABench menggunakan Qwen3-ASR-1.7B pada subset ucapan. Penulisnya sendiri mengatakan demikian. Mengutip salah satunya sebagai yang lain adalah kesalahan yang paling mudah dilakukan pada rilis ini.

Di mana router berada dalam tumpukan seperti ini

OrcaRouter tidak melayani Kandinsky 6.0 Video, dan tidak ada apa pun di sini yang boleh dibaca sebagai klaim bahwa ia melayaninya — model itu bisa Anda jalankan sendiri dari Hub, atau diakses melalui antarmuka milik lab tersebut. Yang dibutuhkan pipeline seperti ini dari sebuah router adalah teks di sekitarnya. Proses perluasan prompt yang mengubah deskripsi bidikan menjadi takarir panjang, sedang, atau pendek yang dipakai saat model dilatih, pekerjaan takarir dan transkrip yang menyuplai proses gambar-ke-video, ringkasan tinjauan yang menentukan dari empat hasil generasi mana yang disimpan: semua itu adalah panggilan teks biasa, dan semuanya berjalan pada satu endpoint yang kompatibel dengan OpenAI di lebih dari 200 model dengan harga daftar dari penyedia diteruskan apa adanya tanpa markup 0%, sehingga perubahan harga vendor langsung berlaku pada hari yang sama. Failover otomatis lebih penting dari biasanya di sini, karena render lima menit yang mati di tahap takarir seharusnya dialihkan ulang, bukan memulai ulang pekerjaan itu.

Hal berikutnya yang perlu diperhatikan bukanlah merger lain, melainkan sebuah angka. Kandinsky 6.0 Video Pro memiliki hasil yang dilaporkan vendor pada VABench dan evaluasi manusia yang dijalankan laboratorium terhadap Kling 2.6, Veo 3.1 Fast, MiniMax H3, dan Seedance 2.0 — serta belum ada skor arena independen. Saat skor itu muncul, klaim open-weights berhenti menjadi argumen tentang akses dan mulai menjadi argumen tentang kualitas, yakni perbandingan yang menentukan apakah ini model yang diunduh tim atau model yang mereka kagumi.

A generated scoreboard titled 'Kandinsky 6.0 Video — the scoreboard' with a single column of six rows: 'Sizes: Pro 29B, Lite 3B', 'Clip length: 5s fixed', 'Audio: 44 kHz lip-sync', 'Resolution: Full HD plus SR', 'Licence: MIT' and 'Serving: vLLM-Omni day 0'. A footer reads 'All figures vendor-reported; no independent Elo yet. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the GitHub repository page for kandinskylab/kandinsky-6, showing 11 commits, 35 stars and 4 forks, an MIT license badge, and a README titled 'Kandinsky 6.0: A family of diffusion models for Video + Audio Generation' with badges for KANDINSKYLAB, REPORT, DIFFUSERS and COMFYUI; recent commits include 'README update', 'Added source code', 'Some improvements for just generate' and 'Keep ComfyUI user documentation in README'.

Repositori ini juga menyertakan dua node ComfyUI — kandinsky6 dan kandinsky6-sr — yang dapat dipasang melalui ComfyUI Manager, serta dua Hugging Face Spaces: satu untuk checkpoint distilasi Pro dan satu untuk demo super-resolusi video. Di antara CLI, node ComfyUI, bundel diffusers, dan kini pipeline vLLM-Omni, cakupan penerapannya pada hari ketiga lebih luas daripada yang mampu dicapai sebagian besar model video terbuka dalam satu kuartal. Keluasan itulah berita utama minggu ini: Sber merilis sebuah keluarga model, bukan sekadar makalah dengan demo yang dilampirkan.

A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.