
Kandinsky 6.0 Video kontra Seedance 2.5: Wersja w artykule to nie wersja, którą kupujesz
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Najczęściej cytowane zdanie w tym zestawieniu to porównanie z niewłaściwym modelem. Raport techniczny Kandinsky 6.0 Video, opublikowany 6 października 2026 r. wraz z udostępnieniem wag na licencji MIT, porównuje z modelem Dreamina Seedance 2.0 — poprzednia generacja. Seedance 2.5, obecny model wideo i audio firmy ByteDance, jest dostępny od 31 lipca 2026 r. i to właśnie ten model jest w sprzedaży. Kiedy więc raport stwierdza, że Seedance „jest preferowany pod względem kryteriów wizualnych, z istotnymi statystycznie przewagami w zakresie ogólnej jakości wizualnej, artefaktów, realizmu ruchu i podążania za promptem wizualnym”, opisuje wersję, której nie można dziś licencjonować, ocenioną przez laboratorium, które napisało Kandinsky 6.0 Video. Obie części tego zdania mają znaczenie i żadna z nich nie jest powodem, by ignorować to porównanie — różnica wersji wyznacza dolną granicę tego, ile może ci ono powiedzieć, a sposób przedstawienia mówi, komu w czym ufać.
Co się zmieniło między dwiema wersjami Seedance
Przejście z 2.0 do 2.5 nie jest przemalowaniem, i właśnie dlatego ta zamiana nie ma charakteru kosmetycznego. Seedance 2.5 generuje do trzydziestu sekund w jednym przebiegu — sześć razy więcej niż zakres modelu z raportu i sześć razy więcej niż stałe pięć sekund Kandinsky 6.0 Video. Dodaje targetowanie na poziomie znaczników czasu i edycje po wygenerowaniu na poziomie regionów, co oznacza, że zmianę można zastosować do okna klipu lub części kadru, zamiast regenerować całość. Odczytuje tekst wraz z około trzydziestoma obrazami, dziesięcioma filmami i dziesięcioma klipami audio jako materiał referencyjny w jednym żądaniu, w porównaniu z pojedynczą zamaskowaną klatką końcową Kandinsky 6.0 Video. I generuje zsynchronizowany dźwięk z dialogiem, co jest jedynym powodem, dla którego ta para w ogóle trafia do tego samego artykułu.
Każdy z tych punktów to zastrzeżenie, którego ocena w raporcie nie sprawdziła. Wynik dla kryteriów wizualnych mówi zatem, że Kandinsky 6.0 ustępował poprzedniej generacji Seedance pod względem jakości wizualnej, artefaktów, realizmu ruchu i podążania za promptem. Nie mówi, jak poradziłaby sobie obecna wersja, a uczciwym założeniem jest, że nowsza generacja nie wypada gorzej w obszarach, które podkreślają jej własne informacje o wydaniu.
Co własna ewaluacja raportu ustala, a czego nie ustala
Metoda jest ujawniona wystarczająco dokładnie, aby można ją było ocenić. Pary porównywane obok siebie generowane na podstawie tego samego promptu przez dwa modele, oba klipy zanonimizowane, pozycje lewa/prawa losowane dla każdego zadania, kolejność zadań przetasowana, dźwięk najpierw wyłączony przy pytaniach wizualnych, a następnie włączony przy pytaniach audio, symetryczna opcja remisu i jawna opcja N/A, gdy kryterium nie można ocenić, agregacja większością głosów wśród adnotatorów oraz około 200 lub więcej porównań parami dla każdego ocenianego kryterium.
W przypadku tej metody wynik Seedance 2.0 dzieli się w sposób, który będzie znajomy każdemu, kto czytał porównanie z Klingiem z tego samego raportu. Kryteria wizualne przypadają Seedance z marginesami, które przekraczają próg istotności. W domenie audio jest znacznie bliżej: synchronizacja audio-wideo wypada niemal na równi, a jakość mowy przemawia za Kandinsky 6.0 Video Pro. Między tymi dwoma stwierdzeniami kryje się cała decyzja, ponieważ oznacza to, że najnowszy otwarty checkpoint audio-wideo mierzalnie ustępuje pod względem wyglądu klipu, a mierzalnie wyprzedza pod względem brzmienia mowy w nim.
Ograniczenia tego wyniku są zwyczajne i żadne z nich nie jest dla niego fatalne. Został on przeprowadzony przez autorów Kandinsky'ego na wybranych przez nich promptach, z anotatorami, których sami zrekrutowali. Żadna publiczna ślepa arena w ogóle nie ocenia Kandinsky 6.0 Video, więc nic zewnętrznego nie sprawdziło, czy prompty osoby postronnej odtworzą ten podział. Raport ujawnia również pułap, względem którego dokonuje pomiaru: klipy o długości do pięciu sekund, generowanie bazowe w rozdzielczości SD, przy czym Full HD jest osiągane na etapie superrozdzielczości, oraz pozostająca luka do najsilniejszych systemów własnościowych pod względem jakości wizualnej i ogólnej jakości dźwięku.
Trzy luki strukturalne, których nie wychwyciłby żaden benchmark
Czas trwania jest kryterium pierwszym i najbardziej bezpośrednim. Kandinsky 6.0 Video jest trenowany i oceniany na 121 klatkach, wnioskowanie prowadzi na 121 klatkach, czyli 5 sekundach przy 24 fps, i nie oferuje żadnego trybu przedłużania — trzydziestosekundowy materiał to sześć generacji, pięć łączeń i ryzyko utraty ciągłości, które bierzesz na siebie. Seedance 2.5 robi trzydzieści sekund w jednym przebiegu. W przypadku pojedynczej wymiany dialogu, prezentacji produktu czy czegokolwiek, gdzie łączenie byłoby widoczne, to nie jest różnica w benchmarku; to różnica w tym, czy zadanie to jeden render, czy dodatkowy etap montażu.
Drugi element to warunkowanie referencyjne, a asymetria jest uderzająca. Kandinsky 6.0 Video przyjmuje jeden obraz referencyjny i stosuje go jako zamaskowaną klatkę końcową — klatkę kluczową, do której ma interpolować. Seedance 2.5 przyjmuje zestaw roboczy około trzydziestu obrazów, dziesięciu klipów wideo i dziesięciu klipów audio jako jeden kontekst. Spójność postaci w sekwencji, transfer stylu z tablicy nastroju, występ przeniesiony z istniejącego klipu: to zadania, które umożliwia liczba referencji, a których tryb pojedynczej klatki nawet nie próbuje.
Trzecia to możliwość edycji i to ona zmienia sposób pracy, a nie pojedyncze ujęcie. Edycja na poziomie regionów i znaczników czasu oznacza, że wadliwe trzysekundowe okno jest naprawiane w miejscu. Kandinsky 6.0 Video nie ma powierzchni edycyjnej — złe pięć sekund jest generowane od nowa, a jeśli zostało połączone z czterema innymi, połączenia również są rozpatrywane od nowa. Zespoły, które kalkulują nawyk ponownego renderowania, powinny wliczyć tę różnicę w wybór modelu, zamiast odkrywać ją po fakcie.
• Czas trwania — Kandinsky 6.0 Video: stałe 5 s, 121 klatek przy 24 fps, brak trybu przedłużania. Seedance 2.5: do 30 s w jednym przebiegu.
• Warunkowanie referencyjne — Kandinsky 6.0 Video: jeden obraz, stosowany jako maskowana klatka końcowa. Seedance 2.5: około trzydziestu obrazów, dziesięciu filmów i dziesięciu klipów audio na żądanie.
• Edycja — Kandinsky 6.0 Video: brak; regeneracja i ponowne łączenie. Seedance 2.5: precyzyjne wskazywanie na poziomie znaczników czasu i edycje na poziomie regionów po wygenerowaniu.
• Rozdzielczość — Kandinsky 6.0 Video: SD przy 512×768, Full HD 1920×1080 dzięki wbudowanemu etapowi superrozdzielczości. Seedance 2.5: zależnie od trybu, a cena za klip jest ustalana na podstawie wybranej rozdzielczości.
• Dźwięk — Kandinsky 6.0 Video: 44 kHz z synchronizacją ust, generowany łącznie z obrazem. Seedance 2.5: zsynchronizowany dźwięk, w tym dialogi, generowany razem z wideo.
• Wagi — Kandinsky 6.0 Video: MIT, Lite 3B i Pro 29B, z kodem i integracją z diffusers. Seedance 2.5: nie.
Dwa mierniki, które nie przeliczają się wzajemnie
Seedance 2.5 jest rozliczany w tokenach, co daje około 0,51 USD za pięciosekundowy klip w rozdzielczości 480p i około 1,16 USD w rozdzielczości 720p. Powód, dla którego podajemy to w ten sposób, a nie jako stawkę za sekundę, jest taki, że liczba tokenów skaluje się z materiałem, więc trzydziestosekundowe generowanie to nie trzydzieści sekund po stałej stawce — to sześć razy więcej tokenów niż w przypadku pięciosekundowego przy tych samych ustawieniach, a operacje edycyjne są wyceniane na podstawie tego, czego dotyczą. Potok, który rutynowo generuje od nowa, przekona się, że licznik reaguje na ten nawyk.
Kandinsky 6.0 Video nie ma licznika, ponieważ nie ma czego kupować. Jego koszt to maszyna i zegar, a raport dostarcza wskazań zegara: około 402 sekund czasu pracy na H100 dla pięciosekundowego klipu Pro Full HD, 854 na RTX 5090, 1247 na RTX 4090, wymagane odciążanie bloków poniżej szczytowej alokacji 72,8 GiB oraz ustawienie 16 GB VRAM, które kwantyzuje enkoder tekstu do NF4 — jedyna zmiana ustawienia, która według raportu zmienia sam klip. Destylowany checkpoint, zmierzony jako równoważny z pełnym modelem przy średniej preferencji 51% do 49%, bez żadnego kryterium osiągającego istotność statystyczną, to ten, który sprawia, że te liczby stają się wykonalne.
• Koszt za pięć sekund — Kandinsky 6.0 Video: brak ceny katalogowej; od sześciu do dwudziestu jeden minut pracy jednego GPU w zależności od karty. Seedance 2.5: około 0,51 USD przy 480p i 1,16 USD przy 720p w tokenach.
Nic w tych dwóch pozycjach nie jest współmierne, a typowa próba sprowadzenia ich do jednej liczby — podzielenia stawki za godzinę GPU przez pięciosekundowe klipy — po cichu zakłada pełne wykorzystanie, zerowy czas bezczynności i kartę, którą już posiadasz. Użyteczniejsze jest porównanie jakościowe: koszt Seedance 2.5 skaluje się z tym, ile generujesz, i znika, gdy przestajesz; koszt Kandinsky 6.0 Video ponosisz niezależnie od tego, czy generujesz, czy nie.

Gdzie każdy z nich jest osiągalny
Żaden z tych modeli nie znajduje się na OrcaRouter i żadne z tych twierdzeń nie jest wysuwane. Seedance 2.5 jest dostępny przez własne platformy dostawcy oraz kilka usług podmiotów trzecich; Kandinsky 6.0 Video to checkpoint, który pobierasz na licencji MIT i uruchamiasz na własnym sprzęcie. Każda strona, która twierdzi, że oba modele są dostępne za jednym wywołaniem API na platformie wielomodelowej, opisuje inne modele.
Powód, dla którego warto jeszcze wspomnieć o warstwie routingu w pipeline Kandinsky lub Seedance, jest taki, że w tych systemach dominuje tekst pod względem liczby wywołań, a wideo pod względem kosztu. Rozszerzanie promptu zamienia notatkę o ujęciu w długi, ustrukturyzowany opis, jakiego oczekuje model T2AV. Dialog jest szkicowany, zanim podejdzie do niego etap synchronizacji ust, i jest przepisywany, gdy ten etap go zniekształci. Sześć kandydujących generacji tego samego beatu jest przeglądanych i jedna zostaje wybrana — tekstowa ocena artefaktu wideo, czyli najtańszy sposób, by poprawnie podjąć tę kosztowną decyzję. W przypadku pojedynczego endpointu kompatybilnego z OpenAI obejmującego ponad 200 modeli, po cenach katalogowych dostawcy przekazywanych dalej z marżą 0%, te wywołania kosztują tyle, ile pobiera dostawca, i ani grosza więcej, także nazajutrz po zmianie stawek przez dostawcę. DSL routingu zasługuje na swoje miejsce, gdy tani recenzent i uważny recenzent powinni być różnymi modelami w tym samym miejscu wywołania, a automatyczne przełączanie awaryjne zasługuje na nie, ponieważ opis, który padnie podczas renderowania czwartego z sześciu klipów, powinien zostać przekierowany, a nie zakończyć sesję.
Co wpłynęłoby na ten pojedynek?
Różnica wersji to cała historia, a zarazem najkrótsza droga do jej rozwiązania. Test Seedance 2.5 przeciwko Kandinsky 6.0 Video rozstrzygnąłby, czy straty w kryteriach wizualnych, które raport odnotowuje wobec 2.0, zwiększyły się, zmniejszyły czy odwróciły — raport nie może na to odpowiedzieć, a jego autorzy nie mieli takiej możliwości. Na razie możliwe do obrony stanowisko jest węższe, niż chciałby marketing którejkolwiek ze stron: na podstawie dowodów opublikowanych przez laboratorium samego modelu Seedance ma przewagę w tym, jak wygląda klip, a Kandinsky 6.0 Video ma przewagę w tym, jak brzmi w nim mowa, a wersja Seedance, na której opiera się to twierdzenie, jest o jedno pokolenie starsza od tej, którą można kupić.
Wybierz odpowiednio. Jeśli praca jest długa, pełna odniesień lub oparta na montażu, luki strukturalne rozstrzygają sprawę, zanim jakość w ogóle się pojawi. Jeśli praca to pięciosekundowe ujęcie z dialogiem, w którym dialog musi zabrzmieć dobrze za pierwszym razem, zmierzona przewaga Kandinsky 6.0 Video dotyczy dokładnie tego kryterium — a licencja MIT oznacza, że odpowiedź nie zależy od niczyjej mapy drogowej. To, na co trzeba uważać, to nie ranking. To powtórka porównania, którego raport nigdy nie był w stanie przeprowadzić.


Najtańszy sposób na poprawne wykonanie drogiego wywołania: DSL routingu, który podmienia recenzenta na każdym etapie, z automatycznym przełączaniem awaryjnym, dzięki czemu niedziałający podpis nie powoduje utraty klipu.
