Wygenerowana karta tytułowa z napisem „Kandinsky 6.0 Video vs Alibaba Wan 2.7” i podtytułem „Otwarte wagi kontra zestaw czterech modeli”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Kandinsky 6.0 Video kontra Alibaba Wan 2.7: Otwarte wagi przeciwko zestawowi czterech modeli

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Kandinsky 6.0 Videodaje ci checkpoint z 29 mld parametrów do pobrania, a w zamian pięciosekundowy klip. Wan 2.7daje ci cztery warianty pod konkretne zadania, klipy o długości do piętnastu sekund i rozliczenie za sekundę. Te dwa zdania to całe porównanie, a powód, dla którego warto je zapisać, jest taki, że większość stron zestawiających je bezpośrednio porównuje je pod kątem jakości wizualnej, gdzie żaden z nich nie ma niezależnego wyniku, który by rozstrzygnął sprawę — i pomija oś, na której faktycznie się różnią, czyli to, co każdy z nich oczekuje, że wniesiesz.

Kandinsky Lab firmy Sber udostępniło Kandinsky 6.0 Video jako open source w pierwszym tygodniu października 2026 na licencji MIT, w dwóch rozmiarach — Pro z 29B i Lite z 3B — wraz z kodem, checkpointami i integracją z diffusers. Wan 2.7 firmy Alibaba został wydany 3 kwietnia 2026 jako zestaw: text-to-video, image-to-video, reference-to-video i video-edit, rozliczany za sekundę wygenerowanego wideo. Jeden z nich to model, który uruchamiasz; drugi to usługa, którą kupujesz. Ciekawe pytanie nie brzmi, który jest lepszy, lecz który ma odpowiedni kształt dla tej pracy.

Jedyna oś, w której można je bezpośrednio porównać

Oba modele generują wideo z dźwiękiem, a nie wideo, do którego dźwięk dodaje się dopiero później. To rzadsze, niż się wydaje, i właśnie dlatego te dwa modele w ogóle wymienia się razem — większość branży nadal tworzy niemy plik MP4, a dźwięk dodaje dopiero w osobnym przebiegu.

Kandinsky 6.0 Video robi to za pomocą dwustrumieniowego CrossDiT: strumienia wideo inicjalizowanego z checkpointu Kandinsky 5.0 Video, strumienia audio trenowanego od zera na dużych korpusach audio oraz dwukierunkowej uwagi krzyżowej łączącej je, trenowanych wspólnie po ciągłym etapie wstępnego trenowania. Na wyjściu otrzymujemy dźwięk 44 kHz z synchronizacją ust, na podstawie podpowiedzi tekstowej (T2AV) lub obrazu referencyjnego (I2AV).

Wan 2.7 również generuje natywne audio, nie publikując mechanizmu z taką samą szczegółowością. W swojej własnej dokumentacji jako dwa obszary wciąż wymagające dopracowania wymienia jakość dźwięku i dokładność tekstu na ekranie — zastrzeżenie dotyczące wierności, które warto mieć na uwadze, bo mówi to sam dostawca, a nie zgadujący recenzent.

Na tym podobieństwo się kończy. Wszystko poniżej tej linii to rozbieżność, a nie ranking.

Pięć sekund przeciw piętnastu, i co to robi z

Kandinsky 6.0 Video jest trenowany na 121 klatkach, 24 fps — pięć sekund — a wydanie nie zawiera trybu przedłużania. Artykuł, przepis na serwowanie włączony do vLLM-Omni oraz tabela wydajności repozytorium są zbudowane wokół tej jednej długości klipu. Trzydziestosekundowy materiał to sześć generacji i pięć łączeń, a ukrycie łączeń należy do ciebie.

Wan 2.7 obejmuje od dwóch do piętnastu sekund w jednym generowaniu, ustalanych osobno dla każdego żądania. W przypadku klipu z mówiącą głową, wstawki produktowej lub pojedynczego ruchu kamery ta różnica nie jest udogodnieniem — to różnica między jednym renderowaniem a krokiem montażu. W przypadku czegokolwiek budowanego ujęcie po ujęciu pięć sekund to normalna jednostka pracy, a ta różnica w większości zanika.

• Maks. klip — Kandinsky 6.0 Video: 5 s, stały, 121 klatek przy 24 fps. Wan 2.7: 2–15 s, ustawiane na życzenie.

• Rozdzielczość — Kandinsky 6.0 Video: SD, HD i Full HD (1920×1080) dzięki osobnemu modelowi superrozdzielczości. Wan 2.7: do 1080p.

• Warunkowanie referencyjne — Kandinsky 6.0 Video: jeden obraz, zastosowany jako zamaskowana klatka końcowa. Wan 2.7: do pięciu obrazów podmiotu i pięć klipów referencyjnych, dziesięć zasobów na żądanie.

• Zadania — Kandinsky 6.0 Video: T2AV i I2AV. Wan 2.7: tekst-na-wideo, obraz-na-wideo, odniesienie-na-wideo i edycja wideo jako osobne warianty z osobnym rozliczaniem.

• Wagi — Kandinsky 6.0 Video: MIT, do pobrania, Pro i Lite. Wan 2.7: nie.

Cztery zadania kontra dwa tryby

Liczba zadań to ta część Wan 2.7, która bywa niedoceniana w tabelach porównawczych, ponieważ nie jest twierdzeniem o jakości — to twierdzenie o zakresie. Edycja istniejącego materiału na podstawie instrukcji, w której opisujesz zmianę i otrzymujesz to samo ujęcie z powrotem z zastosowaną zmianą, to zadanie, którego Kandinsky 6.0 Video w ogóle nie podejmuje. Generowanie wideo na podstawie referencji, w którym dostarczony występ steruje wygenerowaną postacią, również wykracza poza jego dwa tryby.

Jego rozliczanie odzwierciedla zakres. Warianty tekst-na-wideo i obraz-na-wideo Wan 2.7 rozliczane są wyłącznie na podstawie czasu trwania wyniku — 0,10 USD/s przy 720p i 0,15 USD/s przy 1080p na międzynarodowych endpointach w Singapurze, przy czym Pekin i Tokio podają 0,086 USD/s i 0,143 USD/s za tę samą pracę. Wariant referencja-na-wideo rozlicza również wejściowe wideo, z limitem pięciu sekund, więc pięciosekundowa referencja sterująca piętnastosekundowym generowaniem jest rozliczana za dwadzieścia sekund pracy. Wariant edycji wideo rozlicza wyłącznie wynik i traktuje wejściowy materiał jako darmowy — co jest najkorzystniejszą stawką w rodzinie i powodem, dla którego edycja jest w 2.7 naprawdę tania.

Obok tych liczb należą się dwa fakty dotyczące cyklu życia. Alibaba przyznała ograniczoną czasowo 30-procentową zniżkę startową na swoich platformach Bailian i Qwen Cloud, a wygasła ona 23 września 2026 r. Osobno, zawiadomienie o wycofaniu Alibaba Cloud Model Studio (ID 118434) wyłącza kilka starszych modeli 10 października 2026 r., a wan2.7-r2v i wan2.7-image znajdują się na tej liście. To dotyczy poziomu wariantu, a nie wyłączenia całej generacji — wan2.7-t2v i wan2.7-i2v pozostają na liście z aktualnymi stawkami — ale jeśli reference-to-video było powodem, dla którego przyglądałeś się wersji 2.7, ta ścieżka ma przed sobą jeszcze cztery dni.

Co niezależne rady pokazują, a czego nie pokazują

To jest sekcja, w której większość porównań tych dwóch modeli po cichu oszukuje, więc warto być precyzyjnym co do tego, co istnieje.

Wan 2.7 ma niezależne wyniki w trzech osobnych rankingach wideo Artificial Analysis, które nie są ze sobą zgodne, ponieważ mierzą różne rzeczy:

• Tekst na wideo — Wan2.7-260612 (wydanie czerwcowe) plasuje się na 13.–14. miejscu z wynikiem Elo 1 030 (±9) po 5 571 głosach, w cenie $9,00/min.

• Obraz do wideo — Wan 2.7 (wersja kwietniowa) zajmuje 12. miejsce z wynikiem Elo 1 077 (±8) przy 4 571 głosach, w cenie 9,00 USD/min.

• Edycja wideo — Wan 2.7 zajmuje 5. miejsce z wynikiem Elo 1 077 (±5) przy 17 988 głosach, w cenie 16,90 USD/min.

Przeczytaj te trzy razem, a użytecznym wnioskiem nie jest to, że „Wan 2.7 jest dwunasty w kategorii wideo”. Jest nim to, że model jest znacznie silniejszy w edycji niż w generowaniu – na rankingach zbudowanych dla każdej z tych kategorii – oraz to, że przytaczanie na jego temat pojedynczej liczby jest błędem w obie strony.

Kandinsky 6.0 Video nie ma wyniku w żadnym z nich. Jego opublikowane dowody pochodzą od dostawcy i warto dokładnie powiedzieć, czym są: przeprowadzony test VABench, w którym laboratorium podaje, że Pro prowadzi pod względem jakości mowy, estetyki audio, dopasowania tekstu do wideo i audio do wideo, dokładności synchronizacji ust, desynchronizacji i realizmu wizualnego wśród trzech ocenianych systemów — pozostałe dwa to jego własny model Lite i LTX 2.5 — oraz przeprowadzona przez laboratorium porównawcza ocena ludzka z około 200 lub większą liczbą porównań parami na kryterium, w której Pro jest konkurencyjny wobec Kling 2.6 i Veo 3.1 Fast, ustępuje MiniMax H3 i Dreamina Seedance 2.0 w kryteriach wizualnych, a pozostaje konkurencyjny pod względem jakości mowy i synchronizacji audio-wideo. Nic z tego nie zostało odtworzone poza Sber i nic z tego nie jest rankingiem Elo na ślepej publicznej tablicy. Właściwa interpretacja to „obiecujące i niesprawdzone”, a nie „dorównuje Veo”.

Ile kosztuje każdy z nich, podane w terminach, którymi posługuje się każda ze stron

Tych dwóch modeli cenowych nie można sprowadzić do jednej liczby, a udawanie, że jest inaczej, to właśnie sposób, w jaki zespoły podejmują błędną decyzję.

Wan 2.7 to stawka za sekundę. Piętnastosekundowy klip 1080p kosztuje około 2,25 USD. Trzydziestosekundowy materiał to dwie generacje plus edycja — 4,50 USD za samo generowanie plus Twój czas montażu, albo mniej, jeśli pracę wykonuje wariant edycyjny, ponieważ nie nalicza opłaty za dane wejściowe.

Kandinsky 6.0 Video nie ma żadnej stawki, ponieważ nie ma usługi, którą można kupić. Ma natomiast koszt godziny GPU, który sam podajesz. Liczby z samego repozytorium wyznaczają dolną granicę: pięciosekundowy klip Pro Full HD to około 402 sekund czasu pracy na H100 po rozgrzewce, 854 na RTX 5090 i 1247 na RTX 4090. Dystylowany checkpoint — który w pracy zmierzono jako równoważny z pełnym modelem, przy średniej preferencji 51% wobec 49% i bez żadnego kryterium osiągającego istotność — to ten, który faktycznie serwowałbyś. Wszystko poniżej 72,8 GiB szczytowej alokacji wymaga odciążania bloków, a preset 16 GB kwantyzuje enkoder tekstu do NF4, co — jak potwierdza praca — jest jedyną zmianą presetu, która zmienia sam klip.

Mówiąc wprost: koszt Wan 2.7 to pozycja na fakturze, którą można prognozować. Kandinsky 6.0 Video to coś, co posiadasz na własność, render, który na każde pięć sekund zajmuje minuty, oraz opcja — nie obowiązek — dostrojenia.

Gdzie w tym znajduje się router

OrcaRouter nie obsługuje ani Kandinsky 6.0 Video, ani Alibaba Wan 2.7 — i żadne takie twierdzenie nie jest tu stawiane. Kandinsky możesz pobrać i uruchomić samodzielnie; Wan 2.7 jest dostępny przez własne platformy Alibaba. To, czego pipeline zbudowany na którymkolwiek z tych modeli potrzebuje od routera, to warstwa tekstowa otaczająca render: rozszerzanie promptu, które zamienia opis ujęcia w długi lub krótki podpis, na którym te modele były trenowane, praca nad podpisami i dialogami zasilająca przebieg image-to-video oraz podsumowania przeglądu, które decydują, która z kilku generacji jest tą właściwą. To zwykłe wywołania tekstowe i działają na jednym endpointcie zgodnym z OpenAI w ponad 200 modelach z cenami katalogowymi dostawców przekazywanymi przy 0% narzutu, więc obniżka u dostawcy obowiązuje tego samego dnia, a nie po cyklu kontraktowym. Automatyczne przełączanie awaryjne jest tu warte więcej niż w obciążeniu czatu, ponieważ wywołanie podpisu, które zawiedzie w czwartej minucie sesji Q&A, powinno zostać przekierowane, a nie spowodować utratę renderu.

Decyzja — każda w jednej linii

Jeśli efektem końcowym ma być gotowy klip z dźwiękiem, a wolisz nie mieć własnego GPU, Wan 2.7 jest jedynym z tych dwóch, który ci to oferuje, a jego wariant do edycji jest, na podstawie dostępnych dowodów, najmocniejszym elementem w rodzinie. Sprawdź wycofanie zaplanowane na 10 października, zanim zdecydujesz się na reference-to-video.

Jeśli produktem końcowym jest pipeline, który kontrolujesz, jeśli pięciosekundowe jednostki pasują do twojej listy ujęć i jeśli chcesz dostroić model lub uruchamiać go offline, Kandinsky 6.0 Video jest jedynym z tych dwóch, który na to pozwala — kosztem renderowania, które jest wolne na sprzęcie konsumenckim, oraz deklaracji jakości, która wciąż pochodzi wyłącznie od samego laboratorium. Wydarzenie, które warto obserwować po tej stronie, jest proste: Elo.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

Warto nazwać jedną asymetrię przed zakończeniem, ponieważ przetrwa ona oba modele. Pułap Wan 2.7 jest kontraktowo i technicznie w gestii Alibaba — gdy warianty pakietu zostaną wycofane lub wycenione na nowo, twój pipeline dziedziczy tę decyzję. Pułap Kandinsky 6.0 Video to twój własny sprzęt, a licencja MIT oznacza, że fork może przetrwać plan rozwoju laboratorium. Zespoły, które sparzyły się, gdy model zniknął z katalogu, zwykle rok później przywiązują większą wagę do tej różnicy niż w dniu, w którym dokonały wyboru.

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.