
Kandinsky 6.0 Video kommt zu vLLM-Omni: Was eine Serving-Schicht zu einem offenen Modell hinzufügt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Pull-Request Nr. 8537 wurde heute Morgen um 07:55 UTC in vLLM-Omni gemergt, und er bewirkt genau eine Sache: Er macht Kandinsky 6.0 Video servierbar. Das Modell selbst kam am selben Tag von Sbers Kandinsky Lab als Paar an – Kandinsky 6.0 Video Pro mit 29 Mrd. Parametern und Kandinsky 6.0 Video Lite mit 3 Mrd. – und erzeugt fünf Sekunden lange Clips mit synchronisiertem 44-kHz-Audio, inklusive Lip-Sync, ausgehend von einem Text-Prompt oder einem Referenzbild, wobei Code, Gewichte und Diffusers-Integration allesamt unter MIT stehen. Was ihm bis zu diesem Morgen fehlte, war eine Möglichkeit, es in einem Inferenzserver auszuführen statt über eine einmalige Kommandozeile.
Diese Unterscheidung ist mehr wert, als sie klingt, und sie ist der Grund, warum dies eine separate Story ist. Ein offener Checkpoint, den Sie auf Ihrer eigenen Karte ausführen können, ist das eine; ein offener Checkpoint mit einem gemeinsamen Einstiegspunkt und einem Serving-Rezept ist etwas, das Sie in eine Pipeline einbauen können. Das Release dieser Woche hat Ihnen das Erste geliefert. Der heutige Merge ist der Anfang des Zweiten.
Was tatsächlich zusammengeführt wurde
Der PR ergänzt vLLM-Omni um Text-zu-Video-und-Audio und Bild-zu-Video-und-Audio aus dem Checkpoint kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Die technischen Entscheidungen sind der interessante Teil, denn sie verraten, wie die Architektur wirklich aussieht, wenn jemand anderes als die Autoren sie betreiben muss.
• Ein DiT entrauscht beide Modalitäten. Die Pipeline ist als Kandinsky6TI2VAPipeline registriert, und Video-Latents und Audio-Latents werden gemeinsam von einem einzigen Transformer entrauscht statt von zwei nacheinander ausgeführten Modellen. Das entspricht dem Dual-Stream-CrossDiT aus dem Paper, bei dem ein vortrainierter Video-Stream und ein von Grund auf trainierter Audio-Stream durch bidirektionale Cross-Attention verbunden sind.
• Gewichte werden Ordner für Ordner geladen. Der Hub-Checkpoint wird als transformer/, vae/, text_encoder/, text_encoder_2/ und audio_vae/ gelesen. Die internen Namen des veröffentlichten Checkpoints – videoT und audioT – werden beim Laden auf video_dec_block und audio_dec_block abgebildet, genau die Sorte Detail, die einen ganzen Tag frisst, wenn man selbst darauf stößt.
• Audio ist standardmäßig eingeschaltet. Die Pipeline gibt 44,1 kHz AAC aus, anstatt Ton als Opt-in-Flag zu behandeln, sodass eine Anfrage ohne Audio-Parameter trotzdem mit synchronisierter Sprache, Musik oder Atmosphäre zurückkommt.
• Ein Bildeingang ist ein maskiertes Tail-Frame, kein separater Modus. Referenzbild-Konditionierung wird durch Maskierung angewendet, wodurch dieselbe Pipeline sowohl T2AV als auch I2AV ohne Verzweigung bedienen kann.
Der Smoke-Test des Einreichers ist eine nützliche Untergrenze: eine einzelne NVIDIA H100 80GB mit FlashAttention-3, aktiviertem CPU-Offload, 864×480, 125 Frames, 50 Schritte, CFG 5.0, Seed 42. Das ist ein 5-Sekunden-Clip bei knapp unter HD, kein Full-HD-Render, und der PR behauptet auch nichts anderes.
Ein Checkpoint ist kein Service
Der Grund, sich für einen Merge wie diesen zu interessieren, ist, was er von deiner Liste streicht. Die Referenzimplementierung auszuführen bedeutet, das Repository zu klonen, nur das Setup laufen zu lassen, es SageAttention auf allem unterhalb von Hopper kompilieren zu lassen, den Checkpoint in ein Cache-Verzeichnis herunterzuladen und einen generate-Befehl aufzurufen, dessen Ausgabe in einem mit Zeitstempel versehenen Ordner landet. Für einen ersten Blick ist das in Ordnung, für ein Produkt ist es unhandlich.
vLLM-Omni stellt Ihnen das Modell innerhalb eines Serving-Prozesses bereit, mit denselben Offline-Inferenz-Einstiegspunkten, die das Projekt für seine anderen Diffusionsmodelle verwendet (examples/offline_inference/text_to_video/text_to_video.py und sein Image-to-Video-Pendant), sowie einem Serving-Rezept unter recipes/Kandinsky/Kandinsky6-TI2VA.md. Daraus ergeben sich zwei praktische Konsequenzen. Ihr Deployment wird zu einem Container, der eine HTTP-Schnittstelle spricht, statt zu einem Skript, das Sie betreuen, und das Modell ist in Ihrem Stack kein Sonderfall mehr — es steht neben allem anderen, was Sie in diesem Server betreiben.
Beachten Sie, was das nicht ist. Es ist kein gehosteter Endpunkt, es ist kein Preis, und es ist keine unabhängige Qualitätsmessung. Es ist ein weiterer Ort, an dem das Modell laufen kann, beigesteuert von jemandem außerhalb des Labors, drei Tage nach dem Erscheinen der Gewichte.
Was ein Fünf-Sekunden-Clip in Wall-Clock-Zeit auf echten Karten kostet
Die eigene Tabelle des Repositorys ist der ehrliche Ausgangspunkt. Dies sind die Laufzeiten des nicht destillierten Basismodells für einen einzelnen 5-Sekunden-Clip nach dem Warmup, wobei das Laden der Gewichte und die MP4-Kodierung nicht berücksichtigt sind. Full HD bedeutet hier, dass der Super-Resolution-Durchlauf ebenfalls läuft.
• Full HD (Pro) — 402 s auf einer H100, 765 s auf einer RTX PRO 6000, 854 s auf einer RTX 5090, 1.106 s auf einer A100 80GB, 1.247 s auf einer RTX 4090 und 3.530 s auf einer RTX 5060 Ti.
• Full HD (Lite) — 284 s auf einer H100, 387 s auf einer RTX PRO 6000, 406 s auf einer RTX 5090, 664 s auf einer A100 80GB, 578 s auf einer RTX 4090 und 1.774 s auf einer RTX 5060 Ti.
• SD (Pro) — 356 s auf einer H100 gegenüber 936 s auf einer RTX 4090, wobei der Nachteil von Consumer-Karten dort am geringsten und die Wirtschaftlichkeit am wenigsten schlecht ist.
Die Form dieser Tabelle ist wichtiger als jede einzelne Zelle. Eine H100 ist bei Pro Full HD etwa dreimal schneller als eine 4090 und bei derselben Aufgabe etwa sechsmal schneller als eine 5060 Ti – doch die SR-Phase kostet bei beiden Modellgrößen gleich viel, etwa 64 Sekunden bei HD und etwa 96 Sekunden bei Full HD auf einer 5090. Lite verschafft Ihnen keinen kürzeren Super-Resolution-Durchlauf, denn das SR-Modell wird separat trainiert und es ist ihm egal, welches Basismodell es versorgt hat.
Der 16-GB-Weg und die eine Einstellung, die dein Bild verändert
Der Spitzenwert des zugewiesenen Speichers bei einem Pro-SD-Lauf erreicht 72,8 GiB, was über jede Consumer-Karte hinausgeht. Das Repository antwortet mit Block-Offloading – jeweils nur zwei Transformer-Blöcke gleichzeitig auf der GPU resident, der Rest wird aus dem Host-Speicher gestreamt – plus drei Presets für 32-GB-, 24-GB- und 16-GB-Karten. Die 32- und 24-GB-Presets sind identisch, denn oberhalb von 24 GB schlägt sich der zusätzliche Spielraum nicht in Geschwindigkeit nieder.
Der Vorbehalt ist versteckt und es lohnt sich, ihn zu wiederholen: Beim 16-GB-Preset wird der Text-Encoder auf NF4 quantisiert, und das Paper stellt ausdrücklich klar, dass dies die einzige Preset-Änderung ist, die den Clip selbst verändert. Eine andere textuelle Darstellung erzeugt ein anderes Video. Alles andere — Segmentlänge, räumliche Streifen, Offloading — verändert die Ausgabe nur auf dem Niveau von Rundungsrauschen: etwa 12 % der Pixel unterscheiden sich um eine Helligkeitsstufe bei ungefähr 57 dB PSNR. Wenn Sie ein Ergebnis von jemand anderem auf einer 16-GB-Karte reproduzieren und es nicht übereinstimmt, ist das das Erste, was Sie überprüfen sollten.
Drei Punkte, die die Versionshinweise nicht klären
• Fünf Sekunden sind die Obergrenze, nicht der Standard. Das Modell wurde mit 121 Frames und 24 fps trainiert, und sowohl das Paper als auch das Serving-Rezept sind darauf ausgelegt. In diesem Release gibt es keinen Erweiterungsmodus. Alles Längere ist ein Stitching-Problem, das du selbst verantwortest.
• Der destillierte Checkpoint ist der, den du tatsächlich bereitstellen wirst, und er wurde als gleichwertig gemessen. Die Ablation im Paper stuft das destillierte Modell bei der Mehrheit der Kriterien als bevorzugt oder gleichauf ein, wobei kein einzelner Unterschied statistische Signifikanz erreicht, bei einer mittleren Präferenz von 51 % zu 49 %. Das ist der Kompromiss, den du für die Geschwindigkeit eingehst.
• Im Paper gibt es zwei Wortfehlerraten-Werte, und sie sind nicht vergleichbar. Die 47-prozentige Reduktion der WER für generierte Sprache, die mit der Reinforcement-Learning-Phase einhergeht, wird mit Whisper-large-v3 bewertet, einem der RL-Belohnungsmodelle; die zusammen mit VABench angegebene WER verwendet Qwen3-ASR-1.7B auf dem Sprach-Subset. Das sagen die Autoren selbst. Den einen Wert als den anderen zu zitieren, ist der leichteste Fehler, den man bei dieser Veröffentlichung machen kann.
Wo ein Router in einem solchen Stack sitzt
OrcaRouter bietet Kandinsky 6.0 Video nicht an, und nichts hier sollte als Behauptung gelesen werden, dass es das tut — das Modell können Sie selbst vom Hub aus betreiben, oder es ist über die eigenen Oberflächen des Labs erreichbar. Was eine Pipeline wie diese von einem Router braucht, ist der Text drumherum. Der Prompt-Expansion-Durchlauf, der aus einer Shot-Beschreibung die lange, mittlere oder kurze Caption macht, auf die das Modell trainiert wurde, die Caption- und Transkript-Arbeit, die einen Image-to-Video-Durchlauf speist, die Review-Zusammenfassungen, die entscheiden, welche von vier Generierungen behalten wird: Das sind ganz normale Textaufrufe, und sie laufen über einen OpenAI-kompatiblen Endpoint über mehr als 200 Modelle hinweg mit Anbieter-Listenpreisen, die mit 0 % Aufschlag durchgereicht werden, sodass eine Preisänderung eines Anbieters noch am selben Tag live ist. Automatisches Failover ist hier wichtiger als sonst, denn ein fünfminütiger Render, der in der Caption-Phase abstürzt, sollte umgeleitet werden, statt den Job neu zu starten.
Das nächste, worauf man achten sollte, ist nicht eine weitere Fusion, sondern eine Zahl. Kandinsky 6.0 Video Pro hat vom Anbieter gemeldete Ergebnisse auf VABench und eine im Labor durchgeführte menschliche Bewertung gegen Kling 2.6, Veo 3.1 Fast, MiniMax H3 und Seedance 2.0 – aber noch keinen unabhängigen Arena-Score. Wenn einer auftaucht, hört die Open-Weights-Behauptung auf, ein Argument über Zugang zu sein, und wird zu einem Argument über Qualität – der Vergleich, der entscheidet, ob dies ein Modell ist, das Teams herunterladen, oder eines, das sie bewundern.


Das Repository liefert außerdem zwei ComfyUI-Nodes — kandinsky6 und kandinsky6-sr —, installierbar über den ComfyUI Manager, sowie zwei Hugging Face Spaces: eines für den Pro-Distill-Checkpoint und eines für die Video-Super-Resolution-Demo. Zwischen dem CLI, den ComfyUI-Nodes, dem Diffusers-Bundle und jetzt einer vLLM-Omni-Pipeline ist die Deployment-Oberfläche an Tag drei breiter, als es die meisten offenen Videomodelle in einem Quartal schaffen. Diese Breite ist die eigentliche Geschichte der Woche: Sber hat eine Familie veröffentlicht, nicht ein Paper mit angehängter Demo.

