Titelkarte für einen Artikel, der Kandinsky 6.0 Video und seinen namentlich genannten Gegner vergleicht, mit dem Untertitel „Die Version im Paper ist nicht die Version, die man kauft“, mit drei unterstützenden Beschriftungen aus den Belegen des Artikels selbst.
Engineering & Research

Kandinsky 6.0 Video vs. Seedance 2.5: Die Version im Paper ist nicht die Version, die Sie kaufen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der meistzitierte Satz in diesem Vergleich ist ein Vergleich gegen das falsche Modell. Der technische Bericht zu Kandinsky 6.0 Video, veröffentlicht am 6. Oktober 2026 zusammen mit der MIT-Veröffentlichung der Gewichte, vergleicht gegen Dreamina Seedance 2.0 — die vorherige Generation. Seedance 2.5, ByteDances aktuelles Video-und-Audio-Modell, ist seit dem 31. Juli 2026 im Einsatz und dasjenige, das verkauft wird. Wenn der Bericht also zu dem Schluss kommt, Seedance werde „bei den visuellen Kriterien bevorzugt, mit statistisch signifikanten Vorsprüngen bei der allgemeinen visuellen Qualität, bei Artefakten, beim Bewegungsrealismus und beim Befolgen visueller Prompts", dann beschreibt er einen Build, den man heute nicht lizenzieren kann, bewertet von dem Labor, das Kandinsky 6.0 Video geschrieben hat. Beide Hälften dieses Satzes sind wichtig, und keine von beiden ist ein Grund, den Vergleich zu ignorieren — die Versionslücke setzt eine Untergrenze dafür, wie viel er einem sagen kann, und die Art der Darstellung verrät einem, wem man wofür trauen sollte.

Was hat sich zwischen den beiden Seedance-Versionen geändert?

Der Schritt von 2.0 zu 2.5 ist kein Repaint, und genau deshalb ist die Ersetzung nicht kosmetisch. Seedance 2.5 generiert bis zu dreißig Sekunden in einem einzigen Durchgang — sechsmal das Zeitfenster des im Bericht genannten Modells und sechsmal die festen fünf Sekunden von Kandinsky 6.0 Video. Es fügt zeitstempelgenaues Targeting und Bearbeitungen auf Regionenebene nach der Generierung hinzu, das heißt, eine Änderung kann auf ein Fenster des Clips oder einen Teil des Frames angewendet werden, statt das Ganze neu zu generieren. Es liest Text zusammen mit ungefähr dreißig Bildern, zehn Videos und zehn Audioclips als Referenzmaterial in einer Ausführungsform ein, gegenüber dem einzelnen maskierten Endframe von Kandinsky 6.0 Video. Und es erzeugt synchronisiertes Audio mit Dialogen, was der einzige Grund ist, warum dieses Paar überhaupt in denselben Artikel gehört.

Jedes einzelne davon ist eine Fähigkeit, die die Bewertung des Berichts nicht getestet hat. Das Ergebnis der visuellen Kriterien sagt Ihnen daher, dass Kandinsky 6.0 Video gegenüber der vorherigen Generation von Seedance bei der allgemeinen visuellen Qualität, Artefakten, Bewegungsrealismus und Prompt-Befolgung zurücklag. Es sagt Ihnen nicht, was der aktuelle Build leisten würde, und die ehrliche Annahme ist, dass eine neuere Generation auf den Achsen, die ihre eigenen Versionshinweise betonen, nicht schlechter wird.

Was die eigene Bewertung des Berichts belegt und was nicht

Die Methode ist ausführlich genug offengelegt, um abgewogen werden zu können. Side-by-Side-Paare, die von zwei Modellen aus demselben Prompt generiert wurden, beide Clips anonymisiert, die Links-/Rechts-Positionen pro Aufgabe randomisiert, die Aufgabenreihenfolge gemischt, Audio zunächst für die visuellen Fragen deaktiviert und dann für die Audiofragen aktiviert, eine symmetrische Gleichstandsoption und eine explizite N/A-Option, wo ein Kriterium nicht beurteilt werden kann, Aggregation mittels Mehrheitsvotum über Annotatoren hinweg und ungefähr 200 oder mehr paarweise Vergleiche für jedes bewertete Kriterium.

Bei dieser Methode teilt sich das Ergebnis von Seedance 2.0 auf eine Weise auf, die jedem bekannt vorkommen wird, der den Kling-Vergleich desselben Berichts gelesen hat. Die visuellen Kriterien gehen mit Abständen an Seedance, die die Signifikanzschwelle überschreiten. Im Audiobereich liegen die Ergebnisse deutlich näher beieinander: Die Audio-Video-Synchronisation liegt nahezu gleichauf, und bei der Sprachqualität liegt Kandinsky 6.0 Video Pro vorn. Zwischen diesen beiden Aussagen liegt die gesamte Entscheidung, denn sie bedeutet, dass der neueste offene Audio-Video-Checkpoint messbar hinter dem zurückliegt, wie ein Clip aussieht, und messbar voraus ist, wenn es um den Klang der darin enthaltenen Sprache geht.

Die Einschränkungen dieses Ergebnisses sind die üblichen, und keine davon ist für es fatal. Es wurde von Kandinskys Autoren mit selbst gewählten Prompts und von ihnen rekrutierten Annotatoren durchgeführt. Keine öffentliche Blind-Arena bewertet Kandinsky 6.0 Video überhaupt, daher hat nichts Externes getestet, ob die Prompts eines Außenstehenden die Aufteilung reproduzieren. Der Bericht offenbart außerdem die Obergrenze, gegen die gemessen wird: Clips von bis zu fünf Sekunden, Basisgenerierung in SD-Auflösung, wobei Full HD über eine Super-Resolution-Stufe erreicht wird, und eine verbleibende Lücke zu den stärksten proprietären Systemen bei visueller Qualität und Gesamt-Audioqualität.

Drei strukturelle Lücken, die kein Benchmark erfassen würde

Die Dauer ist der erste und der unverblümteste Punkt. Kandinsky 6.0 Video wird mit 121 Frames trainiert und evaluiert, führt die Inferenz mit 121 Frames aus – 5 Sekunden bei 24 fps – und kommt ohne Erweiterungsmodus: Ein dreißigsekündiges Stück sind sechs Generierungen, fünf Übergänge und ein Kontinuitätsrisiko, das man selbst trägt. Seedance 2.5 schafft dreißig Sekunden in einem Durchgang. Bei einem einzelnen Dialogaustausch, einem Produkt-Rundgang oder allem, wo die Nahtstelle sichtbar wäre, ist das kein Benchmark-Unterschied; es ist ein Unterschied darin, ob die Aufgabe ein einzelner Render oder ein Montageschritt ist.

Das zweite ist Referenzkonditionierung, und die Asymmetrie ist eklatant. Kandinsky 6.0 Video nimmt ein Referenzbild und wendet es als maskiertes Endframe an – ein Keyframe, auf den hin interpoliert wird. Seedance 2.5 nimmt einen Arbeitssatz von rund dreißig Bildern, zehn Videoclips und zehn Audioclips als einen einzigen Kontext. Figurenkonsistenz über eine Sequenz hinweg, Stilübertragung von einem Moodboard, eine aus einem vorhandenen Clip übernommene Performance: Das sind Arbeitslasten, die die Referenzanzahl ermöglicht und die der Einzelbildmodus gar nicht erst versucht.

Der dritte Punkt ist die Editierbarkeit, und sie ist der Faktor, der eher einen Workflow als eine einzelne Aufnahme verändert. Bearbeitung auf Regions- und Zeitstempel-Ebene bedeutet, dass ein fehlerhaftes Drei-Sekunden-Fenster an Ort und Stelle repariert wird. Kandinsky 6.0 Video hat keine Bearbeitungsoberfläche – ein schlechter Fünf-Sekunden-Abschnitt wird neu generiert, und wenn er mit vier anderen zusammengefügt wurde, werden auch die Verbindungen neu überdacht. Teams, die eine Re-Render-Routine einkalkulieren, sollten diesen Unterschied in die Modellwahl einpreisen, statt ihn erst zu entdecken.

• Dauer — Kandinsky 6.0 Video: fest 5 s, 121 Einzelbilder bei 24 fps, kein Erweiterungsmodus. Seedance 2.5: bis zu 30 s in einem einzigen Durchgang.

• Referenzkonditionierung — Kandinsky 6.0 Video: ein Bild, angewendet als maskiertes Endframe. Seedance 2.5: etwa dreißig Bilder, zehn Videos und zehn Audioclips pro Anfrage.

• Bearbeitung — Kandinsky 6.0 Video: keine; neu generieren und wieder zusammenfügen. Seedance 2.5: Ansteuerung auf Zeitstempel-Ebene und regionale Bearbeitungen nach der Generierung.

• Auflösung — Kandinsky 6.0 Video: SD bei 512×768, Full HD 1920×1080 durch eine integrierte Super-Resolution-Stufe. Seedance 2.5: modusabhängig, wobei der Preis pro Clip durch die gewählte Auflösung bestimmt wird.

• Audio — Kandinsky 6.0 Video: 44 kHz mit Lip-Sync, gemeinsam mit dem Bild generiert. Seedance 2.5: synchronisiertes Audio einschließlich Dialog, mit dem Video generiert.

• Gewichte — Kandinsky 6.0 Video: MIT, Lite 3B und Pro 29B, mit Code- und Diffusers-Integration. Seedance 2.5: nein.

Zwei Meter, die sich nicht ineinander umrechnen lassen

Seedance 2.5 wird in Tokens abgerechnet, was bei einem fünfsekündigen Clip in 480p bei etwa 0,51 $ und in 720p bei etwa 1,16 $ liegt. Der Grund, es so statt als Sekundenpreis anzugeben, ist, dass die Token-Anzahl mit dem Material skaliert: Eine dreißigsekündige Generierung sind also nicht dreißig Sekunden zu einem festen Satz – sie umfasst sechsmal so viele Tokens wie eine fünfsekündige bei denselben Einstellungen, und Bearbeitungsvorgänge werden danach bepreist, was sie berühren. Eine Pipeline, die gewohnheitsmäßig neu generiert, wird feststellen, dass die Abrechnung auf diese Gewohnheit reagiert.

Kandinsky 6.0 Video hat keinen Zähler, weil es nichts zu kaufen gibt. Seine Kosten sind eine Maschine und eine Uhr, und der Bericht liefert die Uhr: ungefähr 402 Sekunden Arbeitszeit auf einer H100 für einen Fünf-Sekunden-Clip in Pro Full HD, 854 auf einer RTX 5090, 1.247 auf einer RTX 4090, Block-Offloading erforderlich unterhalb einer Spitzenallokation von 72,8 GiB, und ein 16-GB-VRAM-Preset, das den Textencoder auf NF4 quantisiert — die einzige Preset-Änderung, die laut Bericht den Clip selbst verändert. Der destillierte Checkpoint, der bei Gleichstand mit dem vollständigen Modell bei einer mittleren Präferenz von 51 % zu 49 % gemessen wurde, wobei kein Kriterium statistische Signifikanz erreichte, ist derjenige, der diese Zahlen praktikabel macht.

• Kosten pro fünf Sekunden — Kandinsky 6.0 Video: kein Listenpreis; sechs bis einundzwanzig Minuten einer GPU, je nach Karte. Seedance 2.5: rund $0.51 bei 480p und $1.16 bei 720p in Tokens.

Nichts in diesen beiden Zeilen ist miteinander vergleichbar, und der übliche Versuch, sie auf eine einzige Zahl zu reduzieren – indem man einen GPU-Stundensatz durch eine einzelne Zahl teilt – setzt stillschweigend Vollauslastung, keine Leerlaufzeiten und eine Karte voraus, die Sie bereits besitzen. Der nützlichere Vergleich ist qualitativ: Die Kosten von Seedance 2.5 skalieren mit der Menge, die Sie generieren, und verschwinden, wenn Sie aufhören; die Kosten von Kandinsky 2.5 Video fallen an, ob Sie generieren oder nicht.

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

Wo jedes Einzelne erreichbar ist

Keines der beiden Modelle ist auf OrcaRouter vertreten, und keine der beiden Behauptungen wird aufgestellt. Seedance 2.5 erreicht man über die eigenen Plattformen des Anbieters und mehrere Drittanbieter-Dienste; Kandinsky 6.0 Video ist ein Checkpoint, den man unter MIT herunterlädt und auf der eigenen Hardware ausführt. Jede Seite, die behauptet, beide seien auf einer Multi-Modell-Plattform nur einen API-Aufruf entfernt, beschreibt unterschiedliche Modelle.

Der Grund, warum eine Routing-Schicht in einer Kandinsky- oder Seedance-Pipeline immer noch erwähnenswert ist, liegt darin, dass diese Systeme gemessen an der Aufrufzahl überwiegend Text und gemessen an den Kosten überwiegend Video sind. Prompt-Erweiterung verwandelt eine Shot-Notiz in die lange strukturierte Bildbeschreibung, die ein T2AV-Modell erwartet. Dialog wird entworfen, bevor ein Lip-Sync-Durchlauf ihn versucht, und neu geschrieben, wenn der Durchlauf ihn verunstaltet. Sechs Kandidatengenerierungen desselben Beats werden geprüft und eine ausgewählt – ein Texturteil über ein Videoartefakt, was der günstigste Weg ist, die teure Entscheidung richtig zu treffen. Auf einem einzigen OpenAI-kompatiblen Endpunkt über 200+ Modelle zu Anbieter-Listenpreisen, die mit 0 % Aufschlag durchgereicht werden kosten diese Aufrufe genau das, was der Anbieter verlangt, und nicht mehr – auch am Tag, nachdem ein Anbieter seine Preise ändert. Die Routing-DSL verdient ihren Platz, wenn der günstige Prüfer und der sorgfältige Prüfer am selben Aufrufort unterschiedliche Modelle sein sollten, und automatisches Failover verdient ihn, weil eine Bildbeschreibung, die stirbt, während Clip vier von sechs gerendert wird, neu geroutet werden sollte, statt die Sitzung zu beenden.

Was würde dieses Matchup verändern

Die Versionslücke ist die ganze Geschichte – und zugleich der kürzeste Weg, sie zu schließen. Ein Testlauf von Seedance 2.5 gegen Kandinsky 6.0 Video würde klären, ob die im Bericht gegenüber 2.0 verzeichneten Verluste bei den visuellen Kriterien größer geworden, kleiner geworden oder umgekehrt sind – der Bericht kann das nicht beantworten, und seine Autoren hatten keine Möglichkeit dazu. Vorerst ist die vertretbare Position enger, als es das Marketing beider Seiten wahrhaben will: Nach den vom eigenen Labor des Modells veröffentlichten Belegen liegt Seedance beim Aussehen des Clips vorn, und Kandinsky 6.0 Video liegt beim Klang der darin gesprochenen Sprache vorn; und die Version von Seedance, auf die sich diese Aussage stützt, ist eine Generation hinter der, die man kaufen würde.

Wählen Sie entsprechend. Ist die Arbeit lang, referenzlastig oder schnittgetrieben, entscheiden die strukturellen Lücken darüber, bevor die Qualität überhaupt ins Spiel kommt. Handelt es sich um eine fünfsekündige Sprechaufnahme, bei der der Dialog beim ersten Mal stimmen muss, liegt der messbare Vorteil von Kandinsky 6.0 Video genau bei diesem Kriterium – und die MIT-Lizenz bedeutet, dass die Antwort nicht von irgendjemandes Roadmap abhängt. Worauf man achten muss, ist keine Bestenliste. Es ist ein erneuter Durchlauf eines Vergleichs, den der Bericht nie durchführen konnte.

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

Günstigste Möglichkeit, den teuren Call korrekt durchzuführen: eine Routing-DSL, die den Reviewer pro Stage austauscht, mit automatischem Failover, damit eine tote Caption den Clip nicht kostet.