Titelkaart voor een artikel dat Kandinsky 6.0 Video en zijn met naam genoemde tegenstander vergelijkt, met als ondertitel “De versie in het paper is niet de versie die je koopt”, met drie ondersteunende labels ontleend aan het eigen bewijsmateriaal van het artikel.
Engineering & Research

Kandinsky 6.0 Video vs Seedance 2.5: De versie in de paper is niet de versie die je koopt

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De meest geciteerde zin in deze confrontatie is een vergelijking met het verkeerde model. Het technische rapport van Kandinsky 6.0 Video, gepubliceerd op 6 oktober 2026 met de MIT-release van de gewichten, benchmarkt tegen Dreamina Seedance 2.0 — de vorige generatie. Seedance 2.5, ByteDances huidige video-en-audiomodel, wordt sinds 31 juli 2026 uitgeleverd en is het model dat te koop is. Dus wanneer het rapport concludeert dat Seedance "de voorkeur krijgt op de visuele criteria, met statistisch significante marges op algemene visuele kwaliteit, artefacten, bewegingsrealisme en het volgen van visuele prompts", beschrijft het een build die je vandaag niet kunt licentiëren, geëvalueerd door het lab dat Kandinsky 6.0 Video heeft geschreven. Beide helften van die zin doen ertoe, en geen van beide is een reden om de vergelijking te negeren — de versiekloof stelt een ondergrens aan hoeveel die je kan vertellen, en de inkleding vertelt je wie je waarvoor kunt vertrouwen.

Wat is er veranderd tussen de twee Seedance-versies?

De stap van 2.0 naar 2.5 is geen repaint, en dat is precies waarom de vervanging niet cosmetisch is. Seedance 2.5 genereert tot dertig seconden in één enkele pass — zes keer het bereik van het model in het rapport, en zes keer de vaste vijf van Kandinsky 6.0 Video. Het voegt targeting op timestampniveau en bewerkingen na generatie op regioniveau toe, wat betekent dat een wijziging kan worden toegepast op een venster van de clip of een deel van het frame in plaats van door het geheel opnieuw te genereren. Het leest tekst samen met ongeveer dertig afbeeldingen, tien video's en tien audioclips als referentiemateriaal in één verzoek, tegenover het enkele gemaskeerde staartframe van Kandinsky 6.0 Video. En het produceert gesynchroniseerde audio met dialoog, wat de enige reden is dat dit paar überhaupt in hetzelfde artikel thuishoort.

Elk daarvan is een capaciteit die de evaluatie in het rapport niet heeft getest. Het resultaat op de visuele criteria vertelt je dus dat Kandinsky 6.0 Video achterbleef bij de vorige generatie van Seedance op het gebied van algehele visuele kwaliteit, artefacten, realisme van beweging en het volgen van prompts. Het vertelt je niet wat de huidige build zou doen, en de eerlijke aanname is dat een nieuwere generatie niet slechter wordt op de assen die de eigen release notes benadrukken.

Wat de eigen evaluatie van het rapport wel en niet vaststelt

De methode wordt grondig genoeg uiteengezet om te kunnen worden afgewogen. Zij-aan-zij-paren die door twee modellen op basis van dezelfde prompt zijn gegenereerd, beide clips geanonimiseerd, links/rechts-posities per taak gerandomiseerd, taakvolgorde geschud, audio eerst uitgeschakeld voor de visuele vragen en daarna ingeschakeld voor de audiovragen, een symmetrische gelijkspeloptie en een expliciete N/A-optie waar een criterium niet kan worden beoordeeld, aggregatie op basis van meerderheidsstemming over annotatoren, en ongeveer 200 of meer paarsgewijze vergelijkingen voor elk geëvalueerd criterium.

Bij die methode valt het resultaat van Seedance 2.0 uiteen op een manier die bekend zal voorkomen bij iedereen die de Kling-vergelijking uit hetzelfde rapport heeft gelezen. De visuele criteria gaan naar Seedance, met marges die de significantiedrempel ruimschoots overschrijden. Het audiodomein ligt veel dichter bij elkaar: audio-videosynchronisatie komt bijna op gelijke hoogte, en de spraakkwaliteit valt in het voordeel van Kandinsky 6.0 Video Pro uit. Tussen die twee uitspraken ligt de hele beslissing, want dat betekent dat het nieuwste open audio-videocheckpoint meetbaar achterloopt op hoe een clip eruitziet en meetbaar voorloopt op hoe de spraak erin klinkt.

De beperkingen van dat resultaat zijn de gebruikelijke, en geen ervan is fataal voor het resultaat. Het werd uitgevoerd door de auteurs van Kandinsky, op prompts van hun eigen keuze en met door hen geworven annotatoren. Geen enkele openbare blinde arena beoordeelt Kandinsky 6.0 Video helemaal, dus niets externs heeft getest of de prompts van een buitenstaander de splitsing reproduceren. Het rapport onthult ook het plafond waartegen het meet: clips van maximaal vijf seconden, basisgeneratie op SD-resolutie, waarbij Full HD wordt bereikt via een superresolutiestap, en een resterende kloof met de sterkste propriëtaire systemen qua visuele kwaliteit en algehele audiokwaliteit.

Drie structurele hiaten die geen enkele marker vastlegt.

Duur is de eerste en meest onverbloemde factor. Kandinsky 6.0 Video is getraind en geëvalueerd op 121 frames, draait inferentie op 121 frames, 5 seconden bij 24 fps, en wordt geleverd zonder extensiemodus — een fragment van dertig seconden is zes generaties, vijf samenvoegingen, en continuïteitsrisico dat u zelf draagt. Seedance 2.5 doet dertig seconden in één keer. Voor een enkele dialooguitwisseling, een productwalkthrough, of iets waarbij de voeg zichtbaar zou zijn, is dat geen benchmarkverschil; het is een verschil in of de klus één render of een assemblagestap is.

De tweede is referentieconditionering, en de asymmetrie is schril. Kandinsky 6.0 Video neemt één referentieafbeelding en past die toe als een gemaskeerd eindframe — een keyframe om naartoe te interpoleren. Seedance 2.5 neemt een werkset van ongeveer dertig afbeeldingen, tien videoclips en tien audioclips als één context. Personageconsistentie binnen een sequentie, stijloverdracht vanaf een moodboard, een performance die uit een bestaande clip wordt meegenomen: dat zijn workloads die het aantal referenties mogelijk maakt en die de singleframemodus niet eens probeert.

Het derde is bewerkbaarheid, en dat is degene die een workflow verandert in plaats van een enkele opname. Bewerking op regio- en tijdstempelniveau betekent dat een gebrekkig venster van drie seconden ter plaatse wordt gerepareerd. Kandinsky 6.0 Video heeft geen bewerkingsoppervlak — een slechte vijf seconden wordt opnieuw gegenereerd, en als die aan vier andere was gekoppeld, worden de koppelingen ook heroverwogen. Teams die een gewoonte van herrenderen beprijzen, zouden dat verschil in de modelkeuze moeten beprijzen in plaats van er pas achter te komen.

• Duur — Kandinsky 6.0 Video: 5 s vast, 121 frames bij 24 fps, geen verlengingsmodus. Seedance 2.5: tot 30 s in één enkele doorgang.

• Referentieconditionering — Kandinsky 6.0 Video: één afbeelding, toegepast als een gemaskeerd staartframe. Seedance 2.5: ongeveer dertig afbeeldingen, tien video's en tien audioclips per verzoek.

• Bewerken — Kandinsky 6.0 Video: geen; opnieuw genereren en opnieuw samenvoegen. Seedance 2.5: targeting op tijdstempel-niveau en bewerkingen na generatie op regioniveau.

• Resolutie — Kandinsky 6.0 Video: SD op 512×768, Full HD 1920×1080 via een ingebouwde superresolutiefase. Seedance 2.5: afhankelijk van de modus, waarbij de prijs per clip wordt bepaald door de resolutie die je kiest.

• Audio — Kandinsky 6.0 Video: 44 kHz met lipsynchronisatie, samen met het beeld gegenereerd. Seedance 2.5: gesynchroniseerde audio inclusief dialoog, gegenereerd met de video.

• Gewichten — Kandinsky 6.0 Video: MIT, Lite 3B en Pro 29B, met code en diffusers-integratie. Seedance 2.5: nee.

Twee meters die niet in elkaar om te rekenen zijn

Seedance 2.5 wordt afgerekend in tokens, wat neerkomt op ongeveer $0,51 voor een clip van vijf seconden bij 480p en ongeveer $1,16 bij 720p. De reden om het zo te formuleren in plaats van als een tarief per seconde, is dat het aantal tokens meeschaalt met het beeldmateriaal, dus een generatie van dertig seconden is niet dertig seconden tegen een vast tarief — het zijn zes keer zoveel tokens als een van vijf seconden bij dezelfde instellingen, en de bewerkingshandelingen worden geprijsd op basis van wat ze aanraken. Een pipeline die gewoonlijk opnieuw genereert, zal merken dat de meter op die gewoonte reageert.

Kandinsky 6.0 Video heeft geen meter, want er is niets te koop. De kosten bestaan uit een machine en een klok, en het rapport levert de klok: ongeveer 402 seconden werktijd op een H100 voor een Pro Full HD-clip van vijf seconden, 854 op een RTX 5090, 1.247 op een RTX 4090, block-offloading vereist onder een piekallocatie van 72,8 GiB, en een 16 GB VRAM-preset die de tekstencoder naar NF4 kwantiseert — de enige presetwijziging die volgens het rapport de clip zelf verandert. De gedistilleerde checkpoint, gemeten op gelijke voet met het volledige model bij een gemiddelde voorkeur van 51% tegen 49%, zonder dat enig criterium statistische significantie bereikt, is wat die cijfers werkbaar maakt.

• Kosten per vijf seconden — Kandinsky 6.0 Video: geen lijstprijs; zes tot eenentwintig minuten van één GPU, afhankelijk van de kaart. Seedance 2.5: ongeveer $0,51 bij 480p en $1,16 bij 720p in tokens.

Niets in die twee regels is met elkaar te vergelijken, en de gebruikelijke poging om ze tot één getal te herleiden — een GPU-uurtarief delen door clips van vijf seconden — gaat stilzwijgend uit van volledige benutting, nul idle-tijd en een kaart die je al bezit. De nuttigere vergelijking is kwalitatief: de kosten van Seedance 2.5 schalen met hoeveel je genereert en verdwijnen wanneer je stopt; de kosten van Kandinsky 6.0 Video worden gemaakt of je nu wel of niet genereert.

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

Waar elk van hen bereikbaar is

Geen van beide modellen staat op OrcaRouter, en geen van beide beweringen wordt gedaan. Seedance 2.5 is bereikbaar via de eigen platforms van de leverancier en verschillende diensten van derden; Kandinsky 6.0 Video is een checkpoint die je onder MIT downloadt en op je eigen hardware draait. Elke pagina die je vertelt dat beide op een multimodelplatform met één API-aanroep te bereiken zijn, beschrijft andere modellen.

De reden dat een routeringslaag nog steeds het vermelden waard is in een Kandinsky- of Seedance-pipeline, is dat het bij deze systemen qua aantal aanroepen vooral om tekst gaat en qua kosten vooral om video. Promptuitbreiding verandert een shotnotitie in de lange, gestructureerde caption die een T2AV-model verwacht. Dialoog wordt opgesteld voordat een lip-sync-pass het probeert, en wordt herschreven wanneer die pass het verknoeit. Zes kandidaatgeneraties van dezelfde beat worden beoordeeld en één geselecteerd — een tekstueel oordeel over een video-artefact, wat de goedkoopste manier is om de dure beslissing juist te nemen. Op een enkel OpenAI-compatibel endpoint voor meer dan 200 modellen tegen de lijstprijzen van de provider, doorgegeven met 0% opslag, kosten die aanroepen wat de provider in rekening brengt en niet meer, ook op de dag nadat een leverancier zijn tarieven wijzigt. De routerings-DSL verdient zijn plek wanneer de goedkope reviewer en de zorgvuldige reviewer op hetzelfde aanroeppunt verschillende modellen zouden moeten zijn, en automatische failover verdient die plek omdat een caption die sterft terwijl clip vier van zes wordt gerenderd moet omleiden in plaats van de sessie te beëindigen.

Wat zou deze confrontatie kunnen veranderen?

De versiekloof is het hele verhaal en ook het kortste pad om die te dichten. Een testrun met Seedance 2.5 tegen Kandinsky 6.0 Video zou uitmaken of de verliezen op visuele criteria die het rapport bij 2.0 registreert, zijn toegenomen, afgenomen of omgeslagen — het rapport kan dat niet beantwoorden, en zijn auteurs konden dat onmogelijk. Voorlopig is de verdedigbare positie beperkter dan de marketing van beide kanten wil: op basis van het bewijs dat het eigen laboratorium van het model heeft gepubliceerd, loopt Seedance voor op hoe de clip eruitziet en loopt Kandinsky 6.0 Video voor op hoe de spraak erin klinkt, en de versie van Seedance waarop die bewering berust, loopt één generatie achter op de versie die je zou kopen.

Kies dienovereenkomstig. Als het werk lang, referentie-intensief of montagegedreven is, beslissen de structurele hiaten erover voordat kwaliteit in beeld komt. Als het werk een talking shot van vijf seconden is waarin de dialoog in één keer goed moet klinken, ligt de gemeten voorsprong van Kandinsky 6.0 Video precies op dat criterium — en de MIT-licentie betekent dat het antwoord niet afhangt van iemands roadmap. Waar je op moet letten is geen leaderboard. Het is een herhaling van een vergelijking die het rapport nooit heeft kunnen uitvoeren.

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

Goedkoopste manier om de dure call correct uit te voeren: een routing-DSL die de reviewer per fase verwisselt, met automatische failover zodat een uitgevallen ondertiteling de clip niet duur komt te staan.