Wygenerowana plansza tytułowa z napisem „Kandinsky 6.0 Video vs Grok Imagine Video” i podtytułem „Ranking się odwrócił”, nad rzędem ikon z etykietami „Generowanie wideo”, „Synchronizowane audio” i „Wdrażanie modeli z otwartymi wagami”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Kandinsky 6.0 Video kontra Grok Imagine Video: Tabela liderów się odwróciła

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

W styczniu 2026 r., kiedy Grok Imagine Video zadebiutował, zajął pierwsze miejsce w Artificial Analysis video arena w obu trybach. Dziś ten sam ranking umieszcza jego obecny build na jedenastym lub dwunastym miejscu w kategorii tekst-na-wideo. To nie skandal i nie porażka — to po prostu to, co dzieje się z szybko rozwijającą się kategorią w ciągu dziewięciu miesięcy, i to uczciwy powód, by porównać model generacyjny xAI z Kandinsky 6.0 Video właśnie teraz. Jedno z nich to usługa zoptymalizowana pod kątem tego, jak szybko można wygenerować kolejny klip; drugie to checkpoint na licencji MIT, 29 mld parametrów w wersji Pro i 3 mld w wersji Lite, wydany przez Kandinsky Lab firmy Sber w pierwszym tygodniu października 2026 r., generujący pięć sekund wideo z zsynchronizowanym dźwiękiem 44 kHz i synchronizacją ust. Nie chodzi o to, które z nich jest wyżej w rankingu — chodzi o to, co każde z nich jest strukturalnie w stanie zrobić dalej.

Deska, która przesunęła się pod nim.

Grok Imagine Video to model generowania xAI, po raz pierwszy wydany 29 stycznia 2026 r., a od 16 czerwca stabilny w wersji 1.5. W rankingu text-to-video Artificial Analysis jego wersja 1.5 zajmuje 11.–12. miejsce z wynikiem Elo 1 045 (±9) przy 4 056 głosach, z ceną 15,00 USD za minutę. Pierwotna wersja nie znajduje się na tej tablicy.

Obraz-do-wideo to obszar, w którym rodzina wypada mocniej i w którym obie wersje różnią się w sposób wart uważnego przeanalizowania:

• grok-imagine-video-1.5 — 7.–9. miejsce, Elo 1 098 (±8), 5 267 głosów, 8,40 USD/min.

• grok-imagine-video (wersja ze stycznia) — 12.–17. miejsce, Elo 1 072 (±7), 14 371 głosów, 4,20 USD/min.

• Dla porównania, szczyt tej tablicy I2V — MiniMax H3 Max — znajduje się na poziomie Elo 1 195 (±9) przy 5 894 głosach, a Wan 3.0 jest szósty z 1 164.

Poniżej następują dwa odczytania i oba są prawdziwe. Nowsza wersja xAI jest naprawdę o 26 punktów Elo przed swoim poprzednikiem w generowaniu wideo z obrazu, a aby taka być, kosztuje dwa razy więcej za minutę. A historia z tygodnia premiery — model, który dotarł na szczyt — nie utrzymała się: konkurencja ruszyła do przodu, arena zgromadziła dziesiątki tysięcy głosów w ramach kilkunastu nowszych systemów, a środkowa pozycja w tabeli to miejsce, w którym dziewięć miesięcy rywalizacji stawia szybki generator ogólnego przeznaczenia.

Kandinsky 6.0 Video nie ma oceny Elo na żadnej liście rankingowej. Jego dowodami są przeprowadzony test VABench i ocena ludzka przeprowadzona w laboratorium, oba opublikowane przez Sber, żadnego z nich nie odtworzono poza nim. Umieszczanie niezaudytowanego otwartego modelu obok ocenionego komercyjnego modelu to dokładnie takie porównanie, które należy traktować ostrożnie: pozycja ocenionego modelu jest realna i niepochlebna, a pozycja modelu bez wyniku jest nieznana. „Nieznane” nie znaczy „lepsze”.

Dwa rodzaje szybkości, a tylko jeden z nich mierzy się w sekundach.

Celem projektowym Grok Imagine Video jest przepustowość w przeliczeniu na twórcę. Jest wpięty w X, zwraca gotowy klip z dźwiękiem, a jego zestaw funkcji czyta się jak lista rzeczy, które ludzie faktycznie robią w feedzie: wiele proporcji obrazu, ruch kamery, dodawanie, usuwanie i podmiana obiektów, transfer stylu, generowanie warunkowane referencjami z kilku obrazów na potrzeby spójności postaci, natywne audio z dialogami, efektami i muzyką. Długość klipu wynosi do piętnastu sekund, a rozdzielczość sięga maksymalnie 1080p. Cały produkt został zbudowany tak, aby druga próba kosztowała cię kilka minut i kilka centów.

Kandinsky 6.0 Video jest szybki w innym sensie — nie na próbę, ale w przeliczeniu na jednostkę posiadania. Nic w nim nie jest natychmiastowe. Własne czasy działania repozytorium dla modelu niedestylowanego, po rozgrzewce i z wyłączeniem ładowania wag oraz kodowania MP4, plasują pięciosekundowy klip Pro Full HD na około 402 sekundy na H100, 854 sekundy na RTX 5090, 1 247 sekund na RTX 4090 i 3 530 sekund na RTX 5060 Ti. Lite Full HD to 284 sekundy na H100. Narzędziem, które to czyni znośnym, jest destylowany checkpoint, który w pracy zmierzono jako równy pełnemu modelowi — preferowany lub ex aequo w większości kryteriów, średnia preferencja 51% do 49%, żadna pojedyncza różnica nie osiągnęła istotności. W zamian za powolne renderowanie otrzymujesz model na własnym dysku, przy którym nie działa żaden licznik na klip.

Taki jest prawdziwy kształt tego starcia. Grok Imagine Video optymalizuje koszt dziesiątej próby. Kandinsky 6.0 Video optymalizuje koszt dziesięciotysięcznej, a za pierwszą każe ci zapłacić sprzętem i cierpliwością.

Oba generują dźwięk — i nie są tym samym twierdzeniem.

To jest ta oś, na której leniwe porównanie powiedziałoby „remis" i byłoby w błędzie.

Grok Imagine Video generuje natywne audio z dialogami, efektami i muzyką jako jedną z wielu funkcji. To generator ogólnego przeznaczenia, który akurat zawiera dźwięk.

Kandinsky 6.0 Video jest zbudowany wokół dźwięku. Architektura to dwustrumieniowy CrossDiT łączący strumień wideo inicjalizowany z Kandinsky 5.0 Video ze strumieniem audio trenowanym od zera na dużych korpusach audio, połączone za pomocą dwukierunkowej uwagi krzyżowej i trenowane łącznie. Wyjście ma 44 kHz i jawną synchronizację ust, a etap uczenia ze wzmocnieniem opisany w artykule ma według doniesień obniżać współczynnik błędów słów generowanej mowy o 47% — mierzony za pomocą Whisper-large-v3, który jest jednym z modeli nagrody RL; to szczegół, który ma znaczenie, ponieważ artykuł podaje drugi, nieporównywalny WER obok VABench przy użyciu Qwen3-ASR-1.7B. Mowa jest tym, na czym model był douczany.

Natomiast własne badanie Sbera jest szczere co do tego, gdzie przegrywa. W bezpośredniej ocenie porównawczej laboratorium MiniMax H3 i Dreamina Seedance 2.0 są preferowane pod względem kryteriów wizualnych z znaczącą przewagą, a model opisuje się jako konkurencyjny, a nie wyprzedzający. Twierdzenie, które warto potraktować poważnie, jest węższe i bardziej użyteczne: w starciu z Kling 2.6 i Veo 3.1 Fast wyniki przeplatają się kryterium po kryterium, a Kandinsky 6.0 Video pozostaje konkurencyjny pod względem jakości mowy i synchronizacji audio-wideo, gdzie duża część porównań kończy się remisem.

Piętnaście sekund kontra pięć — i ile kosztuje osiągnięcie każdego z nich.

• Maks. długość klipu — Grok Imagine Video: do 15 s. Kandinsky 6.0 Video: stałe 5 s, 121 klatek przy 24 fps, brak trybu przedłużania w tym wydaniu.

• Rozdzielczość — Grok Imagine Video: do 1080p. Kandinsky 6.0 Video: SD, HD i Full HD dzięki dedykowanemu modelowi superrozdzielczości, skalowanie x2, x4 lub x2,25 pięciosekundowych klipów.

• Wejście referencyjne — Grok Imagine Video: generowanie warunkowane referencjami z kilku obrazów w celu zachowania spójności postaci, a także dodawanie/usuwanie/zamiana obiektów. Kandinsky 6.0 Video: jeden obraz, stosowany jako zamaskowana klatka końcowa.

• Cennik — Grok Imagine Video: za sekundę materiału wyjściowego, od dolnej granicy przedziału aż do 0,30 USD/s przy 1080p, z dodatkową opłatą za każdy obraz wejściowy; darmowy dostęp jest dostępny dopiero w ramach poziomów subskrypcji X. Kandinsky 6.0 Video: brak — żadnej usługi, żadnej stawki, tylko czas GPU, który sam zapewniasz.

• Wagi — Grok Imagine Video: nie. Kandinsky 6.0 Video: MIT, Pro i Lite, z integracją diffusers.

Premia za nowszą wersję Groka to liczba, którą trzeba zakreślić. Przejście ze styczniowej wersji do 1.5 kosztuje dwa razy więcej za minutę w rankingu obraz-do-wideo i daje 26 punktów Elo. To realna poprawa za realną cenę i ten sam kompromis, którego każdy dostawca wideo oczekuje teraz od nabywców.

Gdzie router pasuje, a gdzie nie

OrcaRouter nie obsługuje Grok Imagine Video ani Kandinsky 6.0 Video i nic tutaj nie twierdzi inaczej: Kandinsky możesz pobrać i uruchomić samodzielnie, a Grok Imagine Video jest dostępny przez własne kanały xAI. To, czego rozwiązanie zbudowane na którymkolwiek z tych modeli potrzebuje od routera, to tekst otaczający render — lista ujęć, rozbudowa promptu, która zamienia pomysł w długi lub krótki podpis, na jakich te modele były trenowane, prace nad podpisywaniem i transkrypcją oraz podsumowania przeglądów, które decydują, która generacja zostanie zachowana. Działają one na jednym punkcie końcowym zgodnym z OpenAI w ramach ponad 200 modeli tekstowych w cenie katalogowej dostawcy z 0% marży, więc nowe wydanie od dostawcy działa na tym samym kluczu w dniu, w którym się pojawi, z automatycznym przełączaniem awaryjnym, dzięki czemu nieudane wywołanie w środku kolejki renderów zostanie przekierowane, zamiast zatrzymać całą partię. Orkiestracja wokół modelu wideo to problem routingu, nawet gdy sam model wideo nie podlega routingowi, co ma miejsce w przypadku obu tych modeli.

Który, i po co?

Sięgaj po Grok Imagine Video, gdy praca opiera się na wolumenie: klipy do social mediów, szybkie iteracje, ujęcie, które wygenerujesz ponownie sześć razy, zanim będzie dobre, i termin, który się nie rozciągnie. Cena za próbę jest tu produktem, a to, że plasuje się teraz w środku stawki, a nie na szczycie, to normalny koszt kategorii, która rozwija się tak szybko.

Sięgaj po Kandinsky 6.0 Video, gdy praca ma charakter potoku: stała pięciosekundowa jednostka, którą można przetwarzać wsadowo, przebieg konwersji obrazu na wideo, w którym liczy się wierność dostarczonemu obrazowi nieruchomemu, mowa, która ma być zrozumiała, oraz materiał końcowy, którego wolisz nie wynajmować. Zaplanuj budżet na renderowanie, spodziewaj się powolnego renderu na sprzęcie klasy konsumenckiej, a każdy wskaźnik jakości podany w tym tekście traktuj jako własny Sbera, dopóki ktoś spoza laboratorium go nie oceni.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

To, co czyni tę parę wartą uwagi, to to, która z nich potrafi przetrwać słaby kwartał. Jeśli Grok Imagine Video spadnie jeszcze niżej w arenie, odpowiedzią jest lepszy model i nowa cena — tak działa ta kategoria, a xAI już pokazało, że taki wypuści. Jeśli Kandinsky 6.0 Video okaże się po ocenieniu plasować w środku tabeli, checkpoint nadal istnieje, nadal działa i nadal można go dostrajać; licencja nie zmienia się wraz z tą liczbą. To różne rodzaje trwałości i tylko jeden z nich jest mierzony przez Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.