
Kandinsky 6.0 Video débarque dans vLLM-Omni : ce qu'une couche de service apporte à un modèle ouvert
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 150 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La pull request #8537 a été fusionnée dans vLLM-Omni à 07:55 UTC ce matin, et elle fait exactement une chose : elle rend Kandinsky 6.0 Videodéployable en tant que service. Le modèle lui-même est arrivé du Kandinsky Lab de Sber le jour même, en duo — Kandinsky 6.0 Video Pro avec ses 29 milliards de paramètres et Kandinsky 6.0 Video Lite avec ses 3 milliards — générant des clips de cinq secondes avec un audio synchronisé en 44 kHz, lip-sync inclus, à partir d'un prompt texte ou d'une image de référence, avec le code, les poids et l'intégration diffusers, le tout sous licence MIT. Ce dont il ne disposait pas avant ce matin, c'était d'un moyen de l'exécuter au sein d'un serveur d'inférence plutôt qu'en ligne de commande à usage unique.
Cette distinction vaut plus qu’elle n’en a l’air, et c’est la raison pour laquelle il s’agit d’une histoire distincte de la release. Un checkpoint ouvert que vous pouvez exécuter sur votre propre carte est un artefact de recherche ; un checkpoint ouvert avec un pipeline côté serveur, des points d’entrée partagés et une recette de serving est quelque chose que vous pouvez mettre derrière une file d’attente. La release de cette semaine vous a donné le premier. Le merge d’aujourd’hui est le début du second.
Qu'est-ce qui a réellement fusionné ?
La PR ajoute la génération texte-vers-vidéo-et-audio et image-vers-vidéo-et-audio à vLLM-Omni à partir du checkpoint kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. Les choix d’ingénierie sont la partie intéressante, car ils vous disent à quoi ressemble vraiment l’architecture quand quelqu’un d’autre que les auteurs doit la servir.
• Un seul DiT débruit les deux modalités. Le pipeline est enregistré sous le nom Kandinsky6TI2VAPipeline, et les latents vidéo et audio sont débruités conjointement par un seul transformer plutôt que par deux modèles exécutés en séquence. Cela reflète le CrossDiT à double flux de l’article, où un flux vidéo pré-entraîné et un flux audio entraîné à partir de zéro sont reliés par une attention croisée bidirectionnelle.
• Les poids se chargent dossier par dossier. Le checkpoint du Hub est lu sous la forme transformer/, vae/, text_encoder/, text_encoder_2/ et audio_vae/. Les noms internes du checkpoint publié — videoT et audioT — sont mappés sur video_dec_block et audio_dec_block au moment du chargement, le genre de détail qui vous coûte une journée si vous le découvrez par vous-même.
• L'audio est activé par défaut. Le pipeline émet de l'AAC à 44,1 kHz au lieu de considérer le son comme une option à activer ; ainsi, une requête sans paramètre audio renvoie tout de même de la parole, de la musique ou une ambiance synchronisées.
• Une entrée image correspond à une frame de queue masquée, et non à un mode distinct. Le conditionnement par image de référence est appliqué via un masquage, ce qui permet au même pipeline de traiter à la fois T2AV et I2AV sans branchement.
Le test de fumée du soumetteur constitue un plancher utile : un seul NVIDIA H100 80GB avec FlashAttention-3, déchargement CPU activé, 864×480, 125 images, 50 étapes, CFG 5.0, seed 42. Il s'agit d'un clip de 5 secondes d'une définition juste en dessous de la HD, et non d'un rendu Full HD, et la PR ne prétend pas le contraire.
Un point de contrôle n'est pas un service
La raison de s’intéresser à une fusion comme celle-ci, c’est ce qu’elle retire de votre liste. Exécuter l’implémentation de référence suppose de cloner le dépôt, de lancer just setup, de le laisser compiler SageAttention sur tout ce qui est en dessous de Hopper, de télécharger le checkpoint dans un répertoire de cache et d’invoquer une commande generate dont la sortie atterrit dans un dossier horodaté. C’est très bien pour un premier coup d’œil, mais peu pratique pour un produit.
vLLM-Omni vous donne le modèle à l’intérieur d’un processus de serving, avec les mêmes points d’entrée d’inférence hors ligne que le projet utilise pour ses autres modèles de diffusion (examples/offline_inference/text_to_video/text_to_video.py et son équivalent image-to-video) et une recette de serving à recipes/Kandinsky/Kandinsky6-TI2VA.md. Deux conséquences pratiques en découlent. Votre déploiement devient un conteneur qui parle une interface HTTP plutôt qu’un script que vous pilotez, et le modèle cesse d’être un cas particulier dans votre stack — il se place à côté de tout ce que vous exécutez d’autre dans ce serveur.
Notez ce que ce n’est pas. Ce n’est pas un point de terminaison hébergé, ce n’est pas un prix, et ce n’est pas une mesure indépendante de la qualité. C’est un endroit de plus où le modèle peut s’exécuter, apporté par quelqu’un d’extérieur au laboratoire, trois jours après l’apparition des poids.
Ce que coûte un clip de cinq secondes en temps d’horloge, sur de vraies cartes
Le tableau propre du dépôt est le point de départ honnête. Voici les temps d’exécution du modèle de base non distillé pour un seul clip de 5 secondes après échauffement, hors chargement des poids et encodage MP4. Ici, Full HD signifie que la passe de super-résolution est également exécutée.
• Full HD (Pro) — 402 s sur un H100, 765 s sur un RTX PRO 6000, 854 s sur un RTX 5090, 1 106 s sur un A100 80GB, 1 247 s sur un RTX 4090 et 3 530 s sur un RTX 5060 Ti.
• Full HD (Lite) — 284 s sur un H100, 387 s sur une RTX PRO 6000, 406 s sur une RTX 5090, 664 s sur un A100 80GB, 578 s sur une RTX 4090, et 1 774 s sur une RTX 5060 Ti.
• SD (Pro) — 356 s sur un H100 contre 936 s sur une RTX 4090, là où la pénalité des cartes grand public est la plus faible et l’équation économique la moins mauvaise.
La structure de ce tableau compte davantage que n’importe quelle cellule prise isolément. Un H100 est environ trois fois plus rapide qu’une 4090 sur Pro Full HD, et environ six fois plus rapide qu’une 5060 Ti sur la même tâche — mais l’étape SR coûte autant quelle que soit la taille du modèle, environ 64 secondes en HD et environ 96 secondes en Full HD sur une 5090. Lite ne vous permet pas d’obtenir une passe de super-résolution plus courte, car le modèle SR est entraîné séparément et ne se soucie pas du modèle de base qui l’a alimenté.
La voie des 16 Go, et le seul réglage qui change votre image
Le pic de mémoire allouée lors d'une exécution sur Pro SD atteint 72,8 Gio, ce qui dépasse les capacités de toutes les cartes grand public. Le dépôt répond par un déchargement par blocs — avec seulement deux blocs Transformer résidents sur le GPU à la fois, le reste étant transféré en flux depuis la mémoire hôte — ainsi que trois préréglages pour les cartes de 32 Go, 24 Go et 16 Go. Les préréglages de 32 et 24 Go sont identiques, car au-delà de 24 Go, l'espace mémoire supplémentaire ne se traduit pas par un gain de vitesse.
La mise en garde est enfouie et mérite d’être répétée : sur le préréglage 16 Go, l’encodeur de texte est quantifié en NF4, et l’article est explicite : c’est le seul changement de préréglage qui modifie l’encodeur de texte lui-même. Une représentation textuelle différente produit une vidéo différente. Tout le reste — longueur des segments, bandes spatiales, déport — ne modifie la sortie qu’au niveau du bruit d’arrondi, avec environ 12 % des pixels qui diffèrent d’un niveau de luminosité à environ 57 dB PSNR. Si vous reproduisez le résultat de quelqu’un d’autre sur une carte de 16 Go et qu’il ne correspond pas, c’est la première chose à vérifier.
Trois choses que les notes de version ne règlent pas
• Cinq secondes, c'est le plafond, pas une valeur par défaut. Le modèle a été entraîné sur 121 images et 24 ips, et tant l'article que la recette de mise en service sont construits autour de cela. Il n'existe pas de mode d'extension dans cette version. Toute durée plus longue est un problème d'assemblage qui vous incombe.
• Le checkpoint distillé est ce que vous allez réellement servir, et il a été mesuré à parité. L'étude d'ablation de l'article place le modèle distillé comme préféré ou à égalité sur la majorité des critères, sans qu'aucune différence individuelle n'atteigne le seuil de signification, avec une préférence moyenne de 51 % contre 49 %. C'est le compromis que vous acceptez pour la vitesse.
• Il y a deux chiffres de taux d’erreur sur les mots dans l’article, et ils ne sont pas comparables. La réduction de 47 % du WER de parole générée qui accompagne l’étape d’apprentissage par renforcement est évaluée avec Whisper-large-v3, l’un des modèles de récompense RL ; le WER rapporté aux côtés de VABench utilise Qwen3-ASR-1.7B sur le sous-ensemble parole. Les auteurs le disent eux-mêmes. Citer l’un pour l’autre est l’erreur la plus facile à commettre avec cette version.
Où se situe un routeur dans une pile comme celle-ci
OrcaRouter ne diffuse pas Kandinsky 6.0 Video, et rien ici ne doit être interprété comme affirmant le contraire — le modèle est à vous de l'exécuter depuis le Hub, ou accessible via les propres interfaces du laboratoire. Ce dont un pipeline comme celui-ci a besoin de la part d'un routeur, c'est le texte qui l'entoure. La passe d'expansion de prompt qui transforme une description de plan en la légende longue, moyenne ou courte sur laquelle le modèle a été entraîné, le travail de légendage et de transcription qui alimente une passe image-vers-vidéo, les synthèses de revue qui décident laquelle de quatre générations conserver : ce sont des appels texte ordinaires, et ils s'exécutent sur un point de terminaison compatible OpenAI sur plus de 200 modèles avec les prix catalogue des fournisseurs répercutés à 0 % de marge, de sorte qu'un changement de prix d'un fournisseur est effectif le jour même. Le basculement automatique en cas de défaillance compte plus que d'habitude ici, car un rendu de cinq minutes qui échoue à l'étape de légendage devrait être réacheminé plutôt que de redémarrer la tâche.
La prochaine chose à surveiller n’est pas une nouvelle fusion, mais un chiffre. Kandinsky 6.0 Video Pro dispose de résultats rapportés par son fournisseur sur VABench et d’une évaluation humaine menée en laboratoire face à Kling 2.6, Veo 3.1 Fast, MiniMax H3 et Seedance 2.0 — et encore aucun score d’arène indépendant. Quand il en apparaîtra un, l’argument des poids ouverts cessera d’être un argument sur l’accès pour devenir un argument sur la qualité, et c’est cette comparaison qui déterminera si c’est un modèle que les équipes téléchargent ou un modèle qu’elles admirent.


Le dépôt fournit également deux nœuds ComfyUI — kandinsky6 et kandinsky6-sr — installables via ComfyUI Manager, ainsi que deux Spaces Hugging Face : l'un pour le checkpoint distillé Pro et l'autre pour la démo de super-résolution vidéo. Entre la CLI, les nœuds ComfyUI, le bundle diffusers et désormais un pipeline vLLM-Omni, la surface de déploiement est plus étendue au troisième jour que ce que la plupart des modèles vidéo ouverts parviennent à couvrir en un trimestre. Cette étendue constitue la véritable histoire de la semaine : Sber a publié une famille, et non un article accompagné d'une démo.

