Carton-titre pour un article comparant Kandinsky 6.0 Video et son adversaire nommé, sous-titré « La version de l'article n'est pas la version que vous achetez », avec trois libellés d'appui tirés des preuves de l'article lui-même.
Engineering & Research

Kandinsky 6.0 Video vs Seedance 2.5 : la version de l’article n’est pas celle que vous achetez

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La phrase la plus citée dans cette confrontation est une comparaison avec le mauvais modèle. Le rapport technique de Kandinsky 6.0 Video, publié le 6 octobre 2026 en même temps que la diffusion des poids sous licence MIT, se compare à Dreamina Seedance 2.0 — la génération précédente. Seedance 2.5, le modèle vidéo et audio actuel de ByteDance, est commercialisé depuis le 31 juillet 2026 et c'est celui qui est en vente. Ainsi, lorsque le rapport conclut que Seedance « est préféré sur les critères visuels, avec des écarts statistiquement significatifs en matière de qualité visuelle globale, d'artefacts, de réalisme du mouvement et de suivi des instructions visuelles », il décrit une version qu'il est impossible de licencier aujourd'hui, évaluée par le laboratoire qui a rédigé Kandinsky 6.0 Video. Les deux parties de cette phrase comptent, et ni l'une ni l'autre n'est une raison d'ignorer la comparaison — l'écart de version fixe un plancher à ce qu'elle peut vous apprendre, et le cadrage vous indique à qui faire confiance, et pour quoi.

Qu'est-ce qui a changé entre les deux versions de Seedance

Le passage de la 2.0 à la 2.5 n'est pas un simple repeint, et c'est précisément pourquoi la substitution n'est pas cosmétique. Seedance 2.5 génère jusqu'à trente secondes en une seule passe — six fois l'enveloppe du modèle évoqué dans le rapport, et six fois les cinq secondes fixes de Kandinsky 6.0 Video. Il ajoute un ciblage au niveau de l'horodatage et des retouches après génération au niveau des régions, ce qui signifie qu'une modification peut être appliquée à une fenêtre du clip ou à une partie de l'image plutôt qu'en régénérant l'ensemble. Il lit du texte aux côtés d'environ trente images, dix vidéos et dix clips audio comme matériel de référence en une seule requête, contre une unique image de fin masquée pour Kandinsky 6.0 Video. Et il produit un audio synchronisé avec des dialogues, ce qui est la seule raison pour laquelle ce duo figure dans le même article.

Chacun de ces éléments est une capacité que l’évaluation du rapport n’a pas testée. Le résultat des critères visuels vous indique donc que Kandinsky 6.0 Video arrivait derrière la génération précédente de Seedance sur la qualité visuelle globale, les artefacts, le réalisme du mouvement et le suivi du prompt. Il ne vous dit pas ce que ferait la version actuelle, et l’hypothèse honnête est qu’une génération plus récente ne se dégrade pas sur les axes que ses propres notes de version mettent en avant.

Ce que l'évaluation propre au rapport établit et n'établit pas

La méthode est divulguée de manière suffisamment détaillée pour être évaluée. Des paires côte à côte générées à partir du même prompt par deux modèles, les deux clips étant anonymisés, les positions gauche/droite randomisées pour chaque tâche, l'ordre des tâches mélangé, l'audio d'abord désactivé pour les questions visuelles puis activé pour celles audio, une option d'égalité symétrique et une option N/A explicite lorsqu'un critère ne peut pas être jugé, une agrégation par vote majoritaire entre les annotateurs, et environ 200 comparaisons par paires ou plus pour chaque critère évalué.

Sur cette méthode, le résultat de Seedance 2.0 se divise d’une manière qui paraîtra familière à quiconque a lu la comparaison avec Kling du même rapport. Les critères visuels reviennent à Seedance avec des écarts qui franchissent le seuil de signification. Le domaine audio est bien plus serré : la synchronisation audio-vidéo avoisine la parité, et la qualité de la parole favorise Kandinsky 6.0 Video Pro. Entre ces deux constats se joue toute la décision, car cela signifie que le tout dernier checkpoint ouvert audio-vidéo est mesurablement en retrait sur l’apparence d’un clip et mesurablement en avance sur la façon dont la parole y sonne.

Les limites en la matière sont les limites habituelles et aucune d’elles ne lui est rédhibitoire. Elle a été menée par les auteurs de Kandinsky sur des prompts de leur choix avec des annotateurs qu’ils ont recrutés. Aucune arène aveugle publique n’évalue du tout Kandinsky 6.0 Video, donc rien d’externe n’a testé si les prompts d’un inconnu reproduisent la répartition. Le rapport divulgue aussi le plafond par rapport auquel il mesure : des clips allant jusqu’à cinq secondes, une génération de base en résolution SD, la Full HD étant atteinte via une étape de super-résolution, et un écart subsistant avec les systèmes propriétaires les plus performants en qualité visuelle et en qualité audio globale.

Trois lacunes structurelles qu’aucun benchmark ne capturerait

La durée est le premier critère, et le plus brutal. Kandinsky 6.0 Video est entraîné et évalué à 121 images, effectue l’inférence à 121 images, soit 5 secondes à 24 images/s, et est livré sans mode d’extension — une pièce de trente secondes représente six générations, cinq raccords et un risque de continuité qui vous incombe. Seedance 2.5 réalise trente secondes en une seule passe. Pour un simple échange de dialogue, une démonstration produit ou tout autre cas où le raccord serait visible, ce n’est pas une différence de benchmark ; c’est une différence entre un rendu unique et une étape d’assemblage.

Le second est le conditionnement par référence, et l'asymétrie est flagrante. Kandinsky 6.0 Video prend une image de référence et l'applique comme image de fin masquée — une image clé vers laquelle interpoler. Seedance 2.5 prend un ensemble de travail d'environ trente images, dix clips vidéo et dix clips audio comme un seul contexte. La cohérence des personnages sur toute une séquence, le transfert de style à partir d'une planche d'ambiance, une performance reprise d'un clip existant : voilà des charges de travail que le nombre de références rend possibles et que le mode à image unique n'essaie même pas d'aborder.

Le troisième est la possibilité de modification, et c'est celui qui change un flux de travail plutôt qu'un plan unique. La modification au niveau de la région et de l'horodatage signifie qu'une fenêtre défectueuse de trois secondes est réparée sur place. Kandinsky 6.0 Video n'a pas de surface d'édition — cinq mauvaises secondes sont régénérées, et si elles étaient jointes à quatre autres, les jointures sont également reconsidérées. Les équipes qui évaluent le coût d'une habitude de re-rendu devraient intégrer cette différence dans le choix du modèle plutôt que de la découvrir.

• Durée — Kandinsky 6.0 Video : 5 s fixes, 121 images à 24 fps, pas de mode d'extension. Seedance 2.5 : jusqu'à 30 s en une seule passe.

• Conditionnement de référence — Kandinsky 6.0 Video : une image, appliquée comme image de fin masquée. Seedance 2.5 : environ trente images, dix vidéos et dix clips audio par requête.

• Montage — Kandinsky 6.0 Video : aucun ; régénérer et réassembler. Seedance 2.5 : ciblage au niveau des horodatages et modifications post-génération au niveau des régions.

• Résolution — Kandinsky 6.0 Video : SD en 512×768, Full HD 1920×1080 grâce à une étape de super-résolution intégrée. Seedance 2.5 : selon le mode, avec le prix par clip défini par la résolution que vous choisissez.

• Audio — Kandinsky 6.0 Video : 44 kHz avec synchronisation labiale, généré conjointement avec l'image. Seedance 2.5 : audio synchronisé incluant les dialogues, généré avec la vidéo.

• Poids — Kandinsky 6.0 Video : MIT, Lite 3B et Pro 29B, avec code et intégration diffusers. Seedance 2.5 : non.

Deux mètres qui ne se convertissent pas l'un en l'autre

Seedance 2.5 est facturé en tokens, ce qui revient à environ 0,51 $ pour un clip de cinq secondes en 480p et à environ 1,16 $ en 720p. La raison de le formuler ainsi plutôt que sous forme de tarif à la seconde est que le nombre de tokens évolue avec la durée de la vidéo, donc une génération de trente secondes représente six fois les tokens d'une génération de cinq secondes à {{1}}c'est{{/1}}, et les opérations de montage sont facturées en fonction de ce qu'elles touchent. Un pipeline qui {{2}}trouvera le compteur{{/2}} à cette habitude.

Kandinsky 6.0 Video n'a pas de compteur, car il n'y a rien à acheter. Son coût, c'est une machine et une horloge, et le rapport fournit l'horloge : environ 402 secondes de temps de travail sur un H100 pour un clip Pro Full HD de cinq secondes, 854 sur une RTX 5090, 1 247 sur une RTX 4090, un délestage de blocs requis en dessous d'une allocation de pointe de 72,8 GiB, et un préréglage de 16 Go de VRAM qui quantifie l'encodeur de texte en NF4 — le seul changement de préréglage qui, selon le rapport, modifie le clip lui-même. Le checkpoint distillé, mesuré à parité avec le modèle complet à une préférence moyenne de 51 % contre 49 %, sans qu'aucun critère n'atteigne la signification statistique, est celui qui rend ces chiffres exploitables.

• Coût par cinq secondes — Kandinsky 6.0 Video : pas de tarif public ; de six à vingt et une minutes d'un GPU selon la carte. Seedance 2.5 : environ 0,51 $ en 480p et 1,16 $ en 720p en jetons.

Rien dans ces deux lignes n’est commensurable, et la tentative habituelle de les réduire à un chiffre unique — diviser un tarif horaire de GPU par des clips de cinq secondes — présuppose silencieusement une utilisation à plein régime, aucun temps d’inactivité et une carte que vous possédez déjà. La comparaison plus utile est qualitative : le coût de Seedance 2.5 évolue avec ce que vous générez et disparaît lorsque vous arrêtez ; le coût de Kandinsky 6.0 Video est engagé, que vous génériez ou non.

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

Où chacun est joignable

Aucun des deux modèles n'est sur OrcaRouter, et aucune de ces deux affirmations n'est formulée. On accède à Seedance 2.5 via les plateformes propres du fournisseur et plusieurs services tiers ; Kandinsky 6.0 Video est un checkpoint que vous téléchargez sous licence MIT et exécutez sur votre propre matériel. Toute page qui vous dit que les deux sont accessibles en un seul appel API sur une plateforme multi-modèles décrit d'autres modèles.

La raison pour laquelle une couche de routage vaut encore la peine d'être mentionnée dans un pipeline Kandinsky ou Seedance, c'est que ces systèmes sont essentiellement du texte en nombre d'appels et de la vidéo en coût. L'expansion de prompt transforme une note de plan en la longue légende structurée qu'attend un modèle T2AV. Le dialogue est ébauché avant qu'une passe de synchronisation labiale ne s'y essaie, et réécrit lorsque la passe le déforme. Six générations candidates du même moment sont examinées et une est sélectionnée — un jugement textuel sur un artefact vidéo, ce qui est le moyen le moins coûteux d'effectuer correctement l'appel coûteux. Sur un point de terminaison unique compatible OpenAI couvrant plus de 200 modèles aux prix catalogue des fournisseurs, répercutés avec 0 % de marge, ces appels coûtent ce que facture le fournisseur, pas plus, y compris le lendemain d'une modification de tarifs par un fournisseur. Le DSL de routage mérite sa place lorsque le relecteur économique et le relecteur méticuleux doivent être des modèles différents au même point d'appel, et le basculement automatique la mérite parce qu'une légende qui échoue pendant le rendu du quatrième clip sur six doit être réacheminée plutôt que de mettre fin à la session.

Qu'est-ce qui pourrait faire bouger ce duel ?

L’écart de version est toute l’histoire et aussi le chemin le plus court pour le résoudre. Une exécution de Seedance 2.5 face à Kandinsky 6.0 Video permettrait de trancher si les pertes sur les critères visuels que le rapport enregistre face à 2.0 se sont creusées, réduites ou inversées — le rapport ne peut pas répondre à cela, et ses auteurs n’avaient aucun moyen de le faire. Pour l’instant, la position défendable est plus étroite que ce que le marketing de l’un ou l’autre camp souhaite : d’après les preuves publiées par le laboratoire du modèle lui-même, Seedance est en avance sur l’apparence du clip et Kandinsky 6.0 Video est en avance sur la façon dont la parole y sonne, et la version de Seedance sur laquelle repose cette affirmation a une génération de retard sur celle que vous achèteriez.

Choisissez en conséquence. Si le travail est long, riche en références ou piloté par le montage, les écarts structurels tranchent avant même que la qualité n’entre en jeu. S’il s’agit d’un plan parlé de cinq minutes où le dialogue doit sonner juste du premier coup, l’avantage mesuré de Kandinsky 6.0 Video porte exactement sur ce critère — et la licence MIT signifie que la réponse ne dépend de la feuille de route de personne. Ce qu’il faut surveiller n’est pas un classement. C’est rejouer une comparaison que le rapport n’a jamais pu effectuer.

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

La façon la moins coûteuse de passer l'appel coûteux correctement : un DSL de routage qui permute le relecteur à chaque étape, avec basculement automatique pour qu'une légende morte ne coûte pas le clip.