
Kandinsky 6.0 Video trafia do vLLM-Omni: co warstwa serwowania wnosi do otwartego modelu
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Pull request #8537 został zmergowany do vLLM-Omni o 07:55 UTC dziś rano i robi dokładnie jedną rzecz: sprawia, że Kandinsky 6.0 Video można serwować. Sam model pojawił się z Kandinsky Lab firmy Sber tego samego dnia jako para — Kandinsky 6.0 Video Pro o 29 mld parametrów i Kandinsky 6.0 Video Lite o 3 mld — generujące pięciosekundowe klipy ze zsynchronizowanym dźwiękiem 44 kHz, z lip-syncem, na podstawie promptu tekstowego lub obrazu referencyjnego, a kod, wagi i integracja z diffusers — wszystko na licencji MIT. To, czego brakowało mu do dziś rano, to możliwość uruchomienia go wewnątrz serwera inferencyjnego zamiast jednorazowego wiersza poleceń.
Ta różnica znaczy więcej, niż się wydaje, i właśnie dlatego to osobna historia, a nie część wydania. Otwarty checkpoint, który możesz uruchomić na własnej karcie, to artefakt badawczy; otwarty checkpoint z pipeline'em po stronie serwera, wspólnymi punktami wejścia i przepisem na serwowanie to coś, co możesz postawić za kolejką. Wydanie z tego tygodnia dało ci to pierwsze. Dzisiejszy merge to początek drugiego.
Co tak naprawdę się połączyło?
Ten PR dodaje tekst-na-wideo-i-audio oraz obraz-na-wideo-i-audio do vLLM-Omni z checkpointu kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Interesującą częścią są wybory inżynieryjne, ponieważ mówią one, jak naprawdę wygląda architektura, gdy musi ją obsługiwać ktoś inny niż autorzy.
• Jeden DiT odszumia obie modalności. Pipeline jest zarejestrowany jako Kandinsky6TI2VAPipeline, a latenty wideo i latenty audio są odszumiane łącznie przez pojedynczy transformer, a nie przez dwa modele uruchamiane sekwencyjnie. Odzwierciedla to dwustrumieniowy CrossDiT z artykułu, w którym wstępnie wytrenowany strumień wideo i strumień audio tworzony od zera są połączone dwukierunkową uwagą krzyżową.
• Wagi ładują się folder po folderze. Checkpoint z Huba jest odczytywany jako transformer/, vae/, text_encoder/, text_encoder_2/ i audio_vae/. Wewnętrzne nazwy opublikowanego checkpointu — videoT i audioT — są mapowane na video_dec_block i audio_dec_block w czasie ładowania, co jest takim szczegółem, który potrafi zjeść cały dzień, jeśli odkryjesz go samodzielnie.
• Dźwięk jest domyślnie włączony. Potok generuje AAC 44,1 kHz, zamiast traktować dźwięk jako flagę wymagającą jawnego włączenia, więc żądanie bez parametrów audio nadal zwraca zsynchronizowaną mowę, muzykę lub dźwięk otoczenia.
• Wejście obrazowe to zamaskowana ramka końcowa, a nie osobny tryb. Warunkowanie na obrazie referencyjnym odbywa się poprzez maskowanie — dzięki temu ten sam potok obsługuje zarówno T2AV, jak i I2AV bez rozgałęziania.
Test dymny zgłaszającego to użyteczne minimum: pojedynczy NVIDIA H100 80GB z FlashAttention-3, włączonym CPU offload, 864×480, 125 klatek, 50 kroków, CFG 5.0, seed 42. To 5-sekundowy klip w rozdzielczości tuż poniżej HD, a nie render Full HD, i PR nie twierdzi inaczej.
Checkpoint nie jest usługą
Powód, dla którego warto przejmować się takim merge'em, to to, co usuwa z twojej listy. Uruchomienie implementacji referencyjnej oznacza sklonowanie repozytorium, uruchomienie wyłącznie setupu, pozwolenie mu skompilować SageAttention na wszystkim poniżej Hoppera, pobranie checkpointu do katalogu cache i wywołanie polecenia generate, którego wynik trafia do folderu z sygnaturą czasu. To jest w porządku przy pierwszym spojrzeniu, ale niezręczne w przypadku produktu.
vLLM-Omni udostępnia model w procesie serwowania, z tymi samymi punktami wejścia do wnioskowania offline, których projekt używa dla swoich pozostałych modeli dyfuzyjnych (examples/offline_inference/text_to_video/text_to_video.py oraz jego odpowiednik do obrazu-na-wideo) i przepisem serwowania w recipes/Kandinsky/Kandinsky6-TI2VA.md. Wynikają z tego dwie praktyczne konsekwencje. Twoja historia wdrożenia staje się kontenerem, który mówi przez interfejs HTTP, a nie skryptem, który nadzorujesz, a model przestaje być specjalnym przypadkiem w twoim stacku — stoi obok wszystkiego innego, co uruchamiasz na tym serwerze.
Zauważ, czym to nie jest. To nie jest hostowany endpoint, to nie jest cena i to nie jest niezależny pomiar jakości. To jeszcze jedno miejsce, w którym model może działać, wniesione przez kogoś spoza laboratorium, trzy dni po tym, jak pojawiły się wagi.
Ile czasu zegarowego kosztuje pięciosekundowy klip na prawdziwych kartach
Własna tabela repozytorium jest uczciwym punktem wyjścia. To czasy działania niedestylowanego modelu bazowego dla pojedynczego 5-sekundowego klipu po rozgrzewce, z wyłączeniem wczytywania wag i kodowania MP4. Full HD oznacza tutaj, że przebieg superrozdzielczości również jest uruchomiony.
• Full HD (Pro) — 402 s na H100, 765 s na RTX PRO 6000, 854 s na RTX 5090, 1 106 s na A100 80GB, 1 247 s na RTX 4090 i 3 530 s na RTX 5060 Ti.
• Full HD (Lite) — 284 s na H100, 387 s na RTX PRO 6000, 406 s na RTX 5090, 664 s na A100 80GB, 578 s na RTX 4090 i 1 774 s na RTX 5060 Ti.
• SD (Pro) — 356 s na H100 w porównaniu z 936 s na RTX 4090, gdzie kara za korzystanie z karty konsumenckiej jest najmniejsza, a opłacalność najmniej zła.
Kształt tej tabeli ma większe znaczenie niż jakakolwiek pojedyncza komórka. H100 jest około trzykrotnie szybszy od 4090 w Pro Full HD i około sześciokrotnie szybszy od 5060 Ti w tym samym zadaniu — ale etap SR ma taki sam koszt przy obu rozmiarach modelu: około 64 sekundy w HD i około 96 sekund w Full HD na 5090. Lite nie zapewnia krótszego przebiegu superrozdzielczości, ponieważ model SR jest trenowany osobno i nie ma znaczenia, który model bazowy go zasilał.
Ścieżka 16 GB i to jedno ustawienie, które zmienia twój obraz
Szczytowa przydzielona pamięć podczas uruchomienia Pro SD osiąga 72,8 GiB, co przekracza możliwości każdej karty konsumenckiej. Repozytorium odpowiada offloadingiem bloków — tylko dwa bloki transformera przebywają na GPU jednocześnie, a reszta jest strumieniowana z pamięci hosta — plus trzy presety dla kart 32 GB, 24 GB i 16 GB. Presety 32 GB i 24 GB są identyczne, ponieważ powyżej 24 GB dodatkowy zapas nie przekłada się na szybkość.
Zastrzeżenie jest ukryte i warte powtórzenia: w presecie 16 GB koder tekstu jest skwantyzowany do NF4, a w pracy wyraźnie napisano, że to jedyna zmiana w presecie, która zmienia sam CLIP. Inna reprezentacja tekstowa daje inny film. Wszystko inne — długość segmentu, przestrzenne paski, offloading — zmienia wynik na poziomie szumu zaokrągleń: około 12% pikseli różni się o jeden poziom jasności przy około 57 dB PSNR. Jeśli odtwarzasz czyjś wynik na karcie 16 GB i nie zgadza się, to pierwsza rzecz do sprawdzenia.
Trzy rzeczy, których informacje o wydaniu nie rozstrzygają
• Pięć sekund to górna granica, a nie wartość domyślna. Model był trenowany na 121 klatkach przy 24 fps i zarówno artykuł, jak i przepis na serwowanie są wokół tego zbudowane. W wydaniu nie ma trybu przedłużania. Wszystko dłuższe to problem ze sklejaniem, którym musisz zająć się sam.
• Destylowany checkpoint to ten, który faktycznie będziesz serwować, a został zmierzony jako równoważny. Ablacja w artykule wskazuje, że model destylowany jest preferowany lub ex aequo w większości kryteriów, przy czym żadna pojedyncza różnica nie osiąga istotności, przy średniej preferencji 51% do 49%. To kompromis, na który się godzisz w zamian za szybkość.
• W artykule podano dwie wartości współczynnika błędów słów i nie są one porównywalne. 47-procentowa redukcja WER generowanej mowy, towarzysząca etapowi uczenia ze wzmocnieniem, jest mierzona za pomocą Whisper-large-v3, jednego z modeli nagrody RL; WER podawany obok VABench opiera się na Qwen3-ASR-1.7B w podzbiorze mowy. Sami autorzy tak twierdzą. Cytowanie jednej wartości jako drugiej to najłatwiejszy błąd, jaki można popełnić przy tym wydaniu.
Gdzie w takim stosie znajduje się router
OrcaRouter nie obsługuje Kandinsky 6.0 Video i nic tutaj nie powinno być odczytywane jako twierdzenie, że tak jest — model możesz uruchomić samodzielnie z Hub lub jest dostępny przez własne powierzchnie laboratorium. To, czego pipeline taki jak ten potrzebuje od routera, to otaczający go tekst. Przebieg rozszerzania promptu, który zamienia opis ujęcia na długi, średni lub krótki caption, na którym model był trenowany, prace nad captionami i transkrypcją zasilające przebieg image-to-video, podsumowania przeglądów decydujące o tym, którą z czterech generacji zachować: to zwykłe wywołania tekstowe i działają one na jednym punkcie końcowym zgodnym z OpenAI w ponad 200 modelach, z cenami katalogowymi dostawców przekazywanymi przy 0% marży, więc zmiana ceny przez dostawcę jest widoczna tego samego dnia. Automatyczne przełączanie awaryjne ma tutaj większe znaczenie niż zwykle, ponieważ pięciominutowy render, który padnie na etapie tworzenia captionu, powinien zostać przekierowany, a nie uruchamiany od nowa.
Następną rzeczą, na którą warto zwrócić uwagę, nie jest kolejna fuzja, lecz liczba. Kandinsky 6.0 Video Pro ma wyniki raportowane przez producenta na VABench oraz przeprowadzoną w laboratorium ocenę ludzką w porównaniu z Kling 2.6, Veo 3.1 Fast, MiniMax H3 i Seedance 2.0 — a wciąż brak niezależnego wyniku z areny. Kiedy taki się pojawi, twierdzenie o otwartych wagach przestaje być argumentem o dostęp, a zaczyna być argumentem o jakość, a to porównanie, które rozstrzyga, czy to model, który zespoły pobierają, czy model, który podziwiają.


Repozytorium dostarcza również dwa węzły ComfyUI — kandinsky6 i kandinsky6-sr — instalowalne przez ComfyUI Manager, oraz dwa Hugging Face Spaces: jeden dla checkpointu destylacyjnego Pro, a drugi dla demo superrozdzielczości wideo. Pomiędzy CLI, węzłami ComfyUI, pakietem diffusers i teraz potokiem vLLM-Omni powierzchnia wdrożeniowa trzeciego dnia jest szersza, niż większość otwartych modeli wideo osiąga w ciągu kwartału. Ta rozległość jest prawdziwą historią tygodnia: Sber wypuścił rodzinę modeli, a nie artykuł z dołączonym demem.

