
Kandinsky 6.0 Video sbarca in vLLM-Omni: cosa aggiunge un livello di serving a un modello aperto
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
La pull request #8537 è stata unita in vLLM-Omni alle 07:55 UTC di questa mattina, e fa esattamente una cosa: rende Kandinsky 6.0 Video servibile. Il modello stesso è arrivato dal Kandinsky Lab di Sber lo stesso giorno come coppia — Kandinsky 6.0 Video Pro con 29B parametri e Kandinsky 6.0 Video Lite con 3B — generando clip di cinque secondi con audio sincronizzato a 44 kHz, incluso il lip-sync, da un prompt testuale o un'immagine di riferimento, con codice, pesi e integrazione diffusers tutto sotto MIT. Ciò che non aveva fino a questa mattina era un modo per eseguirlo all'interno di un server di inferenza invece che da una riga di comando one-shot.
Questa distinzione vale più di quanto sembri, ed è il motivo per cui questa è una storia separata dalla release. Un checkpoint aperto che puoi eseguire sulla tua scheda è un artefatto di ricerca; un checkpoint aperto con una pipeline lato server, punti di ingresso condivisi e una ricetta di serving è qualcosa che puoi mettere dietro una coda. La release di questa settimana ti ha dato il primo. Il merge di oggi è l'inizio del secondo.
Cosa è stato effettivamente unito
La PR aggiunge la generazione da testo a video e audio e da immagine a video e audio a vLLM-Omni dal checkpoint kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Le scelte ingegneristiche sono la parte interessante, perché ti dicono che aspetto ha davvero l'architettura quando qualcuno diverso dagli autori deve servirla.
• Un DiT esegue il denoising di entrambe le modalità. La pipeline è registrata come Kandinsky6TI2VAPipeline, e i latent video e i latent audio vengono denoisati congiuntamente da un singolo transformer anziché da due modelli eseguiti in sequenza. Ciò rispecchia il CrossDiT a doppio flusso del paper, dove uno stream video pre-addestrato e uno stream audio creato da zero sono collegati tramite cross-attenzione bidirezionale.
• I pesi vengono caricati cartella per cartella. Il checkpoint dell'Hub viene letto come transformer/, vae/, text_encoder/, text_encoder_2/ e audio_vae/. I nomi interni del checkpoint pubblicato — videoT e audioT — vengono mappati su video_dec_block e audio_dec_block al momento del caricamento, che è il genere di dettaglio che ti fa perdere una giornata se lo scopri da solo.
• L'audio è attivo per impostazione predefinita. La pipeline emette AAC a 44,1 kHz invece di trattare il suono come un flag opt-in, quindi una richiesta senza parametri audio viene comunque restituita con parlato, musica o ambienza sincronizzati.
• Un input immagine è un frame di coda mascherato, non una modalità separata. Il condizionamento tramite immagine di riferimento viene applicato mediante mascheramento, ed è così che la stessa pipeline serve sia T2AV sia I2AV senza branching.
Lo smoke test del proponente è un utile livello minimo di riferimento: una singola NVIDIA H100 80GB con FlashAttention-3, CPU offload attivo, 864×480, 125 frame, 50 step, CFG 5.0, seed 42. Si tratta di una clip di 5 secondi a poco meno di HD, non di un rendering Full HD, e la PR non sostiene il contrario.
Un checkpoint non è un servizio
Il motivo per cui vale la pena interessarsi a un merge come questo è ciò che elimina dalla tua lista. Eseguire l'implementazione di riferimento significa clonare il repository, eseguire just setup, lasciargli compilare SageAttention su qualsiasi cosa al di sotto di Hopper, scaricare il checkpoint in una directory di cache e invocare un comando generate il cui output finisce in una cartella con timestamp. Va bene per un primo sguardo, ma è scomodo per un prodotto.
vLLM-Omni ti offre il modello all'interno di un processo di serving, con gli stessi punti di ingresso per l'inferenza offline che il progetto usa per gli altri suoi modelli di diffusione (examples/offline_inference/text_to_video/text_to_video.py e il suo corrispettivo image-to-video) e una ricetta di serving in recipes/Kandinsky/Kandinsky6-TI2VA.md. Ne derivano due conseguenze pratiche. La tua strategia di deployment diventa un container che parla un'interfaccia HTTP invece di uno script da governare, e il modello smette di essere un caso speciale nel tuo stack: si affianca a qualunque altra cosa tu esegua in quel server.
Nota cosa questo non è. Non è un endpoint ospitato, non è un prezzo e non è una misura indipendente della qualità. È un altro luogo in cui il modello può essere eseguito, contribuito da qualcuno esterno al laboratorio, tre giorni dopo la comparsa dei pesi.
Quanto costa, in tempo reale, una clip di cinque secondi su schede reali
La tabella del repository stesso è il punto di partenza onesto. Questi sono i tempi di lavoro del modello base non distillato per una singola clip di 5 secondi dopo il riscaldamento, escludendo il caricamento dei pesi e la codifica MP4. Full HD qui significa che è in esecuzione anche il passaggio di super-risoluzione.
• Full HD (Pro) — 402 s su una H100, 765 s su una RTX PRO 6000, 854 s su una RTX 5090, 1.106 s su una A100 80GB, 1.247 s su una RTX 4090 e 3.530 s su una RTX 5060 Ti.
• Full HD (Lite) — 284 s su una H100, 387 s su una RTX PRO 6000, 406 s su una RTX 5090, 664 s su una A100 80GB, 578 s su una RTX 4090 e 1.774 s su una RTX 5060 Ti.
• SD (Pro) — 356 s su una H100 contro 936 s su una RTX 4090, che è il caso in cui la penalità delle schede consumer è minima e l'economia è meno sfavorevole.
La forma di quella tabella conta più di qualsiasi singola cella. Un H100 è all'incirca tre volte più veloce di una 4090 su Pro Full HD, e all'incirca sei volte più veloce di una 5060 Ti sullo stesso lavoro — ma lo stadio SR ha lo stesso costo su entrambe le dimensioni del modello, circa 64 secondi in HD e circa 96 secondi in Full HD su una 5090. Lite non ti offre un passaggio di super-risoluzione più breve, perché il modello SR è addestrato separatamente e non gli importa quale modello base lo abbia alimentato.
Il percorso da 16 GB, e l'unica impostazione che cambia la tua immagine
La memoria di picco allocata in un'esecuzione su Pro SD raggiunge i 72,8 GiB, una quantità superiore a quella di qualsiasi scheda consumer. Il repository risponde con l'offloading dei blocchi — solo due blocchi transformer residenti sulla GPU alla volta, mentre il resto viene trasmesso in streaming dalla memoria host — più tre preset per schede da 32 GB, 24 GB e 16 GB. I preset da 32 e 24 GB sono identici, perché al di sopra dei 24 GB il margine extra non si traduce in maggiore velocità.
L'avvertenza è nascosta e vale la pena ripeterla: sul preset da 16 GB il text encoder è quantizzato a NF4, e l'articolo è esplicito sul fatto che questo è l'unico cambiamento del preset che altera la clip stessa. Una diversa rappresentazione testuale produce un video diverso. Tutto il resto — lunghezza dei segmenti, strisce spaziali, offloading — cambia l'output a livello di rumore di arrotondamento, circa il 12% dei pixel differisce di un livello di luminosità a circa 57 dB di PSNR. Se stai riproducendo il risultato di qualcun altro su una scheda da 16 GB e non corrisponde, è la prima cosa da controllare.
Tre cose che le note di rilascio non chiariscono
• Cinque secondi sono il tetto massimo, non un valore predefinito. Il modello è stato addestrato con 121 frame e 24 fps, e sia il paper sia la ricetta di serving sono costruiti attorno a questo. Nella release non esiste una modalità di estensione. Qualsiasi cosa più lunga è un problema di stitching che devi risolvere tu.
Il checkpoint distillato è quello che servirai effettivamente, ed è stato misurato alla pari. L'ablation del paper colloca il modello distillato come preferito o a pari merito sulla maggior parte dei criteri, senza che alcuna differenza individuale raggiunga la significatività, con una preferenza media del 51% contro il 49%. Questo è il compromesso che accetti in cambio della velocità.
• Ci sono due numeri di WER (word error rate) nell'articolo e non sono confrontabili. La riduzione del 47% nel WER del parlato generato che accompagna la fase di apprendimento per rinforzo è valutata con Whisper-large-v3, uno dei modelli di ricompensa RL; il WER riportato insieme a VABench utilizza Qwen3-ASR-1.7B sul sottoinsieme vocale. Gli autori stessi lo dicono. Citare uno come se fosse l'altro è l'errore più facile da commettere con questa versione.
Dove si colloca un router in uno stack come questo
OrcaRouter non serve Kandinsky 6.0 Video, e nulla di quanto scritto qui va inteso come un'affermazione in tal senso: il modello puoi eseguirlo tu dall'Hub, oppure è raggiungibile attraverso le superfici proprie del lab. Ciò di cui una pipeline come questa ha bisogno da un router è il testo che le sta attorno. La passata di espansione del prompt che trasforma la descrizione di un'inquadratura nella didascalia lunga, media o breve su cui il modello è stato addestrato, il lavoro su didascalie e trascrizioni che alimenta una passata image-to-video, i riepiloghi di revisione che decidono quale di quattro generazioni conservare: quelle sono normali chiamate di testo, e girano su un unico endpoint compatibile con OpenAI attraverso oltre 200 modelli con i prezzi di listino dei fornitori passati con markup 0%, così un cambio di prezzo di un fornitore è attivo lo stesso giorno. Il failover automatico conta più del solito, qui, perché un render di cinque minuti che muore in fase di didascalia dovrebbe essere reindirizzato anziché far ripartire il lavoro.
La prossima cosa da tenere d'occhio non è un altro merge ma un numero. Kandinsky 6.0 Video Pro ha risultati dichiarati dal fornitore su VABench e una valutazione umana eseguita in laboratorio contro Kling 2.6, Veo 3.1 Fast, MiniMax H3 e Seedance 2.0 — e ancora nessun punteggio indipendente in arena. Quando ne apparirà uno, la rivendicazione dei pesi aperti smetterà di essere un argomento sull'accesso e comincerà a essere un argomento sulla qualità, che è il confronto che decide se questo è un modello che i team scaricano o un modello che ammirano.


Il repository include anche due nodi ComfyUI — kandinsky6 e kandinsky6-sr — installabili tramite ComfyUI Manager, e due Hugging Face Spaces: uno per il checkpoint Pro distill e uno per la demo di super-risoluzione video. Tra la CLI, i nodi ComfyUI, il bundle diffusers e ora una pipeline vLLM-Omni, la superficie di deployment al terzo giorno è più ampia di quanto la maggior parte dei modelli video aperti riesca a gestire in un trimestre. Questa ampiezza è la vera storia della settimana: Sber ha rilasciato una famiglia, non un paper con una demo allegata.

