Titelkort för en artikel om Kandinsky 6.0 Video och dess namngivna motståndare, med undertiteln ”Versionen i artikeln är inte den version du köper”, med tre stödjande etiketter hämtade från artikelns egen bevisning.
Engineering & Research

Kandinsky 6.0 Video vs Seedance 2.5: Versionen i artikeln är inte den version du köper

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den mest citerade meningen i den här jämförelsen är en jämförelse mot fel modell. Den tekniska rapporten för Kandinsky 6.0 Video, publicerad den 6 oktober 2026 i samband med att vikterna släpptes under MIT-licens, benchmarkar mot Dreamina Seedance 2.0 — den tidigare generationen. Seedance 2.5, ByteDances nuvarande video- och ljudmodell, har funnits tillgänglig sedan den 31 juli 2026 och är den som säljs. Så när rapporten drar slutsatsen att Seedance ”föredras enligt de visuella kriterierna, med statistiskt signifikanta marginaler för övergripande visuell kvalitet, artefakter, rörelserealism och visuell promptföljning”, beskriver den en version du inte kan licensiera i dag, utvärderad av labbet som skrev Kandinsky 6.0 Video. Båda halvorna av den meningen spelar roll, och ingen av dem är ett skäl att ignorera jämförelsen — versionsgapet sätter en nedre gräns för hur mycket den kan säga dig, och inramningen säger dig vem du ska lita på för vad.

Vad ändrades mellan de två Seedance-versionerna?

Steget från 2.0 till 2.5 är inte en ommålning, vilket är precis varför utbytet inte är kosmetiskt. Seedance 2.5 genererar upp till trettio sekunder i en enda omgång – sex gånger omfånget för modellen i rapporten, och sex gånger Kandinsky 6.0 Videos fasta fem. Den lägger till målstyrning på tidsstämpelnivå och redigeringar efter generering på regionsnivå, vilket innebär att en ändring kan tillämpas på ett fönster av klippet eller en del av bildrutan i stället för genom att regenerera hela. Den läser text tillsammans med ungefär trettio bilder, tio videor och tio ljudklipp som referensmaterial i en och samma begäran, mot Kandinsky 6.0 Videos enda maskerade slutbildruta. Och den producerar synkroniserat ljud med dialog, vilket är det enda skälet till att detta par överhuvudtaget hör hemma i samma artikel.

Var och en av dessa är en förmåga som rapportens utvärdering inte testade. Resultatet för de visuella kriterierna säger dig därför att Kandinsky 6.0 Video låg efter Seedances föregående generation när det gäller övergripande visuell kvalitet, artefakter, rörelserealism och promptföljsamhet. Det säger dig inte vad det aktuella bygget skulle göra, och det rimliga antagandet är att en nyare generation inte blir sämre på de axlar som dess egna versionsanteckningar betonar.

Vad rapportens egen utvärdering fastställer och inte fastställer

Metoden redovisas tillräckligt grundligt för att kunna vägas. Sida-vid-sida-par genererade från samma prompt av två modeller, båda klippen anonymiserade, vänster-/högerpositioner randomiserade per uppgift, uppgiftsordningen slumpad, ljudet först inaktiverat för de visuella frågorna och sedan aktiverat för ljudfrågorna, ett symmetriskt alternativ för oavgjort och ett explicit N/A-alternativ där ett kriterium inte kan bedömas, aggregering genom majoritetsröstning över annotatörer, och ungefär 200 eller fler parvisa jämförelser för varje utvärderat kriterium.

Med den metoden delar Seedance 2.0-resultatet upp sig på ett sätt som kommer att verka bekant för alla som har läst samma rapports Kling-jämförelse. De visuella kriterierna går till Seedance med marginaler som klarar signifikansnivån. Ljudområdet är mycket jämnare: ljud- och videosynkroniseringen ligger nära jämbördighet, och talskvaliteten talar för Kandinsky 6.0 Video Pro. Mellan dessa båda påståenden ligger hela beslutet, för det innebär att den nyaste öppna checkpointen för ljud och video är mätbart sämre på hur ett klipp ser ut och mätbart bättre på hur talet i det låter.

Begränsningarna i det resultatet är de vanliga och ingen av dem är ödesdiger för det. Det kördes av Kandinskys upphovspersoner med promptar de själva valt och med annotatörer som de rekryterat. Ingen offentlig blind arena betygsätter Kandinsky 6.0 Video över huvud taget, så inget externt har testat huruvida en utomståendes promptar återskapar uppdelningen. Rapporten redovisar också taket som den mäter mot: klipp på upp till fem sekunder, basgenerering i SD-upplösning med Full HD som uppnås via ett superupplösningssteg, och ett kvarstående gap till de starkaste proprietära systemen i visuell kvalitet och övergripande ljudkvalitet.

Tre strukturella luckor som ingen benchmark skulle fånga

Varaktighet är det första och mest obevekliga. Kandinsky 6.0 Video tränas och utvärderas vid 121 bildrutor, kör inferens vid 121 bildrutor, 5 sekunder vid 24 fps, och levereras utan förlängningsläge — ett trettio sekunder långt stycke är sex genereringar, fem sammanfogningar och en kontinuitetsrisk som du själv äger. Seedance 2.5 gör trettio sekunder i en enda körning. För ett enda dialogutbyte, en produktgenomgång eller något där sammanfogningen skulle synas, är det inte en skillnad i benchmark; det är en skillnad i huruvida jobbet är en rendering eller ett monteringssteg.

Det andra är referensbetingning, och asymmetrin är påtaglig. Kandinsky 6.0 Video tar en referensbild och tillämpar den som en maskerad slutbildruta – en nyckelbild att interpolera mot. Seedance 2.5 tar en arbetsuppsättning på ungefär trettio bilder, tio videoklipp och tio ljudklipp som en kontext. Karaktärskonsistens över en sekvens, stilöverföring från en moodboard, en prestation som förs in från ett befintligt klipp: det är arbetsbelastningar som antalet referenser möjliggör och som enbildsläget inte försöker sig på.

Den tredje är redigerbarhet, och det är den som förändrar ett arbetsflöde snarare än en enskild tagning. Redigering på regionnivå och tidsstämpelnivå gör att ett bristfälligt fönster på tre sekunder kan lagas på plats. Kandinsky 6.0 Video har ingen redigeringsyta — en dålig femsekunderssekvens genereras om, och om den har fogats samman med fyra andra omprövas även fogarna. Team som räknar med en vana att rendera om bör räkna in den skillnaden i modellvalet i stället för att upptäcka den.

• Längd — Kandinsky 6.0 Video: 5 s fast, 121 bildrutor vid 24 fps, inget förlängningsläge. Seedance 2.5: upp till 30 s i en enda körning.

• Referenskonditionering — Kandinsky 6.0 Video: en bild, applicerad som en maskerad slutbildruta. Seedance 2.5: ungefär trettio bilder, tio videor och tio ljudklipp per begäran.

• Redigering — Kandinsky 6.0 Video: ingen; återgenerera och sammanfoga på nytt. Seedance 2.5: målstyrning på tidsstämpelnivå och redigeringar på regionsnivå efter generering.

• Upplösning — Kandinsky 6.0 Video: SD vid 512×768, Full HD 1920×1080 via ett inbyggt superupplösningssteg. Seedance 2.5: lägesberoende, med priset per klipp bestämt av upplösningen du väljer.

• Ljud — Kandinsky 6.0 Video: 44 kHz med läppsynk, genererat tillsammans med bilden. Seedance 2.5: synkroniserat ljud inklusive dialog, genererat med videon.

• Vikter — Kandinsky 6.0 Video: MIT, Lite 3B och Pro 29B, med kod och diffusers-integration. Seedance 2.5: nej.

Två meter som inte omvandlas till varandra

Seedance 2.5 mäts i tokens, vilket landar på ungefär 0,51 USD för ett fem sekunder långt klipp i 480p och ungefär 1,16 USD i 720p. Anledningen till att uttrycka det så i stället för som en taxa per sekund är att antalet tokens skalar med materialet, så en generering på trettio sekunder är inte trettio sekunder till en fast taxa – den är sex gånger så många tokens som en på fem sekunder med samma inställningar, och redigeringsoperationer prissätts efter vad de rör vid. En pipeline som vanemässigt genererar om kommer att märka att mätaren svarar på den vanan.

Kandinsky 6.0 Video har ingen mätare eftersom det inte finns något att köpa. Dess kostnad är en maskin och en klocka, och rapporten tillhandahåller klockan: ungefär 402 sekunders arbetstid på en H100 för ett Pro Full HD-klipp på fem sekunder, 854 på en RTX 5090, 1 247 på en RTX 4090, block offloading krävs vid en toppallokering under 72,8 GiB, och en förinställning för 16 GB VRAM som kvantiserar textkodaren till NF4 – den enda förinställningsändring som rapporten säger ändrar själva klippet. Den destillerade checkpointen, uppmätt i paritet med den fullständiga modellen vid en genomsnittlig preferens på 51 % mot 49 % utan att något kriterium når statistisk signifikans, är den som gör dessa siffror genomförbara.

• Kostnad per fem sekunder — Kandinsky 6.0 Video: inget listpris; sex till tjugoen minuter av en GPU beroende på kortet. Seedance 2.5: ungefär $0,51 vid 480p och $1,16 vid 720p i tokens.

Ingenting i de två raderna är jämförbart, och det vanliga försöket att reducera dem till en enda siffra — att dividera ett GPU-timpris med femsekundersklipp — förutsätter i tysthet fullt utnyttjande, noll tomgångstid och ett grafikkort du redan äger. Den mer användbara jämförelsen är kvalitativ: Seedance 2.5:s kostnad skalar med hur mycket du genererar och försvinner när du slutar; Kandinsky 6.0 Videos kostnad uppstår oavsett om du genererar eller inte.

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

Där var och en kan nås

Ingen av modellerna finns på OrcaRouter, och inget av dessa påståenden framförs. Seedance 2.5 nås via leverantörens egna plattformar och flera tredjepartstjänster; Kandinsky 6.0 Video är en checkpoint som du laddar ner under MIT-licens och kör på din egen hårdvara. Varje sida som säger att båda bara är ett API-anrop bort på en plattform med flera modeller beskriver olika modeller.

Anledningen till att ett routningslager fortfarande är värt att nämna i en Kandinsky- eller Seedance-pipeline är att dessa system till största delen är text sett till antal anrop och video sett till kostnad. Prompt-expansion förvandlar en tagninganteckning till den långa strukturerade bildtext som en T2AV-modell förväntar sig. Dialog skrivs som utkast innan en lip-sync-körning försöker sig på den, och skrivs om när körningen förvanskar den. Sex kandidatgenereringar av samma beat granskas och en väljs – en textbedömning av en videoartefakt, vilket är det billigaste sättet att fatta det dyra beslutet korrekt. På en enda OpenAI-kompatibel endpoint över 200+ modeller till leverantörens listpriser som förs vidare med 0 % påslag, kostar dessa anrop vad leverantören tar och inte mer, även dagen efter att en leverantör ändrar sina priser. Routnings-DSL:en förtjänar sin plats när den billiga granskaren och den noggranna granskaren bör vara olika modeller på samma anropsställe, och automatisk failover förtjänar den eftersom en bildtext som dör medan klipp fyra av sex renderas bör dirigeras om i stället för att avsluta sessionen.

Vad skulle förändra den här matchningen

Versionsglappet är hela historien och också den kortaste vägen till att lösa det. En körning med Seedance 2.5 mot Kandinsky 6.0 Video skulle avgöra om de förluster på de visuella kriterierna som rapporten noterar gentemot 2.0 har vidgats, krympt eller vänts — det kan rapporten inte svara på, och det hade dess författare ingen möjlighet att göra. För närvarande är den försvarbara positionen snävare än vad båda sidornas marknadsföring vill: enligt de bevis som modellens eget laboratorium har publicerat ligger Seedance före i hur klippet ser ut och Kandinsky 6.0 Video före i hur talet i det låter, och den version av Seedance som påståendet vilar på är en generation bakom den du skulle köpa.

Välj utifrån det. Om arbetet är långt, referenstungt eller redigeringsdrivet avgör de strukturella luckorna saken innan kvaliteten ens kommer in i rummet. Om arbetet är en femsekundig pratande tagning där dialogen måste låta rätt första gången, ligger den uppmätta fördelen med Kandinsky 6.0 Video just på det kriteriet – och MIT-licensen innebär att svaret inte beror på någons färdplan. Det man ska hålla koll på är inte en topplista. Det är en ny körning av en jämförelse som rapporten aldrig kunde genomföra.

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

Billigaste sättet att göra det dyra anropet korrekt: ett routing-DSL som byter ut granskaren per steg, med automatisk failover så att en död undertext inte kostar klippet.