
Kandinsky 6.0 Video lanseras i vLLM-Omni: Vad ett serving-lager tillför en öppen modell
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 150 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Pull request #8537 slogs samman in i vLLM-Omni kl. 07:55 UTC i morse, och den gör exakt en sak: den gör det möjligt att köra Kandinsky 6.0 Video som en tjänst. Själva modellen kom från Sbers Kandinsky Lab samma dag i form av ett par – Kandinsky 6.0 Video Pro med 29B parametrar och Kandinsky 6.0 Video Lite med 3B – som genererar fem sekunder långa klipp med synkroniserat 44 kHz-ljud, läppsynk inkluderad, från en textprompt eller en referensbild, med kod, vikter och diffusers-integration allt under MIT. Det den inte hade förrän i morse var ett sätt att köra den i en inferensserver i stället för på en engångskommandorad.
Den skillnaden är värd mer än den låter, och det är anledningen till att detta är en separat historia från släppet. En öppen checkpoint som du kan köra på ditt eget kort är en forskningsartefakt; en öppen checkpoint med en pipeline på serversidan, delade ingångspunkter och ett serveringsrecept är något du kan lägga bakom en kö. Veckans släpp gav dig den första. Dagens merge är början på den andra.
Vad slogs faktiskt samman?
PR:en lägger till text-till-video-och-ljud och bild-till-video-och-ljud i vLLM-Omni från checkpointen kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. De tekniska valen är den intressanta delen, eftersom de visar hur arkitekturen egentligen ser ut när någon annan än författarna måste servera den.
• En enda DiT avbrusar båda modaliteterna. Pipeline är registrerad som Kandinsky6TI2VAPipeline, och video-latenter och audio-latenter avbrusas gemensamt av en enda transformer i stället för av två modeller som körs i sekvens. Det speglar artikelns tvåströms-CrossDiT, där en förtränad videoström och en audiostream tränad från grunden kopplas samman genom dubbelriktad korsuppmärksamhet.
• Vikter laddas mapp för mapp. Hub-checkpointen läses som transformer/, vae/, text_encoder/, text_encoder_2/ och audio_vae/. Den publicerade checkpointens interna namn – videoT och audioT – mappas till video_dec_block och audio_dec_block vid laddning, vilket är en sådan detalj som slukar en dag om du upptäcker den själv.
• Ljud är på som standard. Pipelinen sänder ut 44,1 kHz AAC i stället för att behandla ljud som en opt-in-flagga, så en begäran utan ljudparametrar returneras fortfarande med synkroniserat tal, musik eller omgivningsljud.
• En bildinmatning är en maskad slutbildruta, inte en separat. Referensbildskonditionering tillämpas genom maskning, vilket är hur samma pipeline kan hantera både T2AV och I2AV utan förgrening.
Inlämnarens smoke-test är en användbar nedre gräns: ett enda NVIDIA H100 80GB med FlashAttention-3, CPU-offload på, 864×480, 125 bildrutor, 50 steg, CFG 5.0, seed 42. Det är ett 5-sekundersklipp strax under HD, inte en Full HD-rendering, och PR:en gör inget annat anspråk.
En kontrollpunkt är inte en tjänst
Anledningen till att bry sig om en merge som den här är vad den tar bort från din lista. Att köra referensimplementationen innebär att klona repot, köra just setup, låta den kompilera SageAttention på allt under Hopper, ladda ner checkpointen till en cachekatalog och anropa ett generate-kommando vars utdata hamnar i en tidsstämplad mapp. Det är okej för en första titt och besvärligt för en produkt.
vLLM-Omni ger dig modellen inuti en serveringsprocess, med samma ingångspunkter för offline-inferens som projektet använder för sina andra diffusionsmodeller (examples/offline_inference/text_to_video/text_to_video.py och dess motsvarighet för bild-till-video) och ett serveringsrecept på recipes/Kandinsky/Kandinsky6-TI2VA.md. Två praktiska konsekvenser följer. Din driftsättningshistoria blir en container som exponerar ett HTTP-gränssnitt i stället för ett skript som du vallar, och modellen slutar vara ett specialfall i din stack – den sitter bredvid allt annat du kör i den servern.
Notera vad detta inte är. Det är inte en hostad slutpunkt, det är inte ett pris, och det är inte en oberoende kvalitetsmätning. Det är ännu en plats där modellen kan köras, som någon utanför labbet har bidragit med, tre dagar efter att vikterna dök upp.
Vad ett femsekundersklipp kostar i väggklockstid, på riktiga kort
Repositoriets egen tabell är den ärliga utgångspunkten. Detta är den icke-destillerade basmodellens körtider för ett enskilt 5-sekundersklipp efter uppvärmning, där viktinläsning och MP4-kodning är exkluderade. Full HD innebär här att superupplösningspasset också körs.
• Full HD (Pro) — 402 s på ett H100, 765 s på ett RTX PRO 6000, 854 s på ett RTX 5090, 1 106 s på ett A100 80GB, 1 247 s på ett RTX 4090 och 3 530 s på ett RTX 5060 Ti.
• Full HD (Lite) — 284 s på ett H100, 387 s på ett RTX PRO 6000, 406 s på ett RTX 5090, 664 s på ett A100 80GB, 578 s på ett RTX 4090 och 1 774 s på ett RTX 5060 Ti.
• SD (Pro) — 356 s på ett H100 mot 936 s på ett RTX 4090, vilket är där straffet för konsumentkort är som minst och ekonomin är som minst dålig.
Formen på den tabellen spelar större roll än någon enskild cell. En H100 är ungefär tre gånger snabbare än ett 4090 på Pro Full HD, och ungefär sex gånger snabbare än ett 5060 Ti i samma jobb — men SR-steget kostar lika mycket oavsett modellstorlek, cirka 64 sekunder vid HD och cirka 96 sekunder vid Full HD på en 5090. Lite ger dig inte ett kortare superupplösningspass, eftersom SR-modellen tränas separat och inte bryr sig om vilken basmodell som matade den.
16 GB-vägen, och den enda inställningen som förändrar din bild
Högsta allokerade minne vid en Pro SD-körning når 72,8 GiB, vilket är bortom alla konsumentkort. Repositoriet svarar med blockavlastning – endast två transformerblock finns kvar på GPU:n åt gången, resten strömmas från värdminnet – plus tre förinställningar för 32 GB-, 24 GB- och 16 GB-kort. Förinställningarna för 32 och 24 GB är identiska, eftersom det extra utrymmet över 24 GB inte omvandlas till hastighet.
Förbehållet är begravt och värt att upprepa: på förinställningen för 16 GB är textkodaren kvantiserad till NF4, och artikeln är tydlig med att detta är den enda ändringen i förinställningen som förändrar själva klippet. En annan textuell representation ger en annan video. Allt annat – segmentlängd, rumsliga remsor, avlastning – förändrar utdata på nivån för avrundningsbrus, omkring 12 % av pixlarna skiljer sig med en ljusstyrkenivå vid ungefär 57 dB PSNR. Om du återskapar någon annans resultat på ett 16 GB-kort och det inte stämmer, är det första du bör kontrollera.
Tre saker som versionsanteckningarna inte avgör
• Fem sekunder är taket, inte ett standardvärde. Modellen tränades på 121 bildrutor och 24 fps, och både artikeln och serveringsreceptet är byggda kring det. Det finns inget förlängningsläge i släppet. Allt längre är ett skarvningsproblem som du själv ansvarar för.
• Den destillerade checkpointen är den du faktiskt kommer att serva, och den uppmättes vid paritet. Artikelns ablation visar att den destillerade modellen föredrogs eller var lika på majoriteten av kriterierna, utan att någon enskild skillnad nådde signifikans, vid en genomsnittlig preferens på 51 % mot 49 %. Det är avvägningen du tar på dig för snabbheten.
• Det finns två siffror för word error rate i artikeln och de är inte jämförbara. Den 47-procentiga minskningen av WER för genererat tal som åtföljer förstärkningsinlärningssteget mäts med Whisper-large-v3, en av RL-belöningsmodellerna; den WER som rapporteras tillsammans med VABench använder Qwen3-ASR-1.7B på tal-delmängden. Det säger författarna själva. Att citera den ena som den andra är det lättaste misstaget att göra med den här utgåvan.
Var en router befinner sig i en stack som den här
OrcaRouter levererar inte Kandinsky 6.0 Video, och inget här bör tolkas som ett påstående att den gör det – modellen är din att köra från Hub, eller nås via labbets egna gränssnitt. Det en pipeline som denna behöver från en router är texten runt omkring. Promptexpansionen som omvandlar en beskrivning av en tagning till den långa, medellånga eller korta bildtext som modellen tränades på, arbetet med bildtexter och transkriptioner som matar en bild-till-video-körning, sammanfattningarna från granskningen som avgör vilken av de fyra genereringarna som ska behållas: det är vanliga textanrop, och de körs på en enda OpenAI-kompatibel endpoint över 200+ modeller med leverantörers listpriser vidarebefordrade med 0 % påslag, så en prisändring från en leverantör slår igenom samma dag. Automatisk failover är viktigare än vanligt här, eftersom en femminutersrendering som dör i bildtextsteget bör dirigeras om snarare än att jobbet startas om.
Det nästa man bör hålla ögonen på är inte ännu en sammanslagning utan en siffra. Kandinsky 6.0 Video Pro har leverantörsrapporterade resultat på VABench och en labbgenomförd mänsklig utvärdering mot Kling 2.6, Veo 3.1 Fast, MiniMax H3 och Seedance 2.0 — och ännu inget oberoende arenapoäng. När ett sådant dyker upp upphör påståendet om öppna vikter att vara ett argument om tillgång och blir i stället ett argument om kvalitet, vilket är den jämförelse som avgör om detta är en modell som team laddar ner eller en modell de beundrar.


Repositoriet levererar också två ComfyUI-noder — kandinsky6 och kandinsky6-sr — som kan installeras via ComfyUI Manager, samt två Hugging Face Spaces: en för Pro-distill-checkpointen och en för demon för video-superupplösning. Mellan CLI:t, ComfyUI-noderna, diffusers-paketet och nu en vLLM-Omni-pipeline är deployeringsytan bredare på dag tre än vad de flesta öppna videomodeller klarar under ett kvartal. Den bredden är veckans egentliga historia: Sber släppte en familj, inte en artikel med en demo bifogad.

