
Kandinsky 6.0 Video kontra Grok Imagine Video: Tabela liderów się odwróciła
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
W styczniu 2026 r., kiedy Grok Imagine Video zadebiutował, zajął pierwsze miejsce w Artificial Analysis video arena w obu trybach. Dziś ten sam ranking umieszcza jego obecny build na jedenastym lub dwunastym miejscu w kategorii tekst-na-wideo. To nie skandal i nie porażka — to po prostu to, co dzieje się z szybko rozwijającą się kategorią w ciągu dziewięciu miesięcy, i to uczciwy powód, by porównać model generacyjny xAI z Kandinsky 6.0 Video właśnie teraz. Jedno z nich to usługa zoptymalizowana pod kątem tego, jak szybko można wygenerować kolejny klip; drugie to checkpoint na licencji MIT, 29 mld parametrów w wersji Pro i 3 mld w wersji Lite, wydany przez Kandinsky Lab firmy Sber w pierwszym tygodniu października 2026 r., generujący pięć sekund wideo z zsynchronizowanym dźwiękiem 44 kHz i synchronizacją ust. Nie chodzi o to, które z nich jest wyżej w rankingu — chodzi o to, co każde z nich jest strukturalnie w stanie zrobić dalej.
Deska, która przesunęła się pod nim.
Grok Imagine Video to model generowania xAI, po raz pierwszy wydany 29 stycznia 2026 r., a od 16 czerwca stabilny w wersji 1.5. W rankingu text-to-video Artificial Analysis jego wersja 1.5 zajmuje 11.–12. miejsce z wynikiem Elo 1 045 (±9) przy 4 056 głosach, z ceną 15,00 USD za minutę. Pierwotna wersja nie znajduje się na tej tablicy.
Obraz-do-wideo to obszar, w którym rodzina wypada mocniej i w którym obie wersje różnią się w sposób wart uważnego przeanalizowania:
• grok-imagine-video-1.5 — 7.–9. miejsce, Elo 1 098 (±8), 5 267 głosów, 8,40 USD/min.
• grok-imagine-video (wersja ze stycznia) — 12.–17. miejsce, Elo 1 072 (±7), 14 371 głosów, 4,20 USD/min.
• Dla porównania, szczyt tej tablicy I2V — MiniMax H3 Max — znajduje się na poziomie Elo 1 195 (±9) przy 5 894 głosach, a Wan 3.0 jest szósty z 1 164.
Poniżej następują dwa odczytania i oba są prawdziwe. Nowsza wersja xAI jest naprawdę o 26 punktów Elo przed swoim poprzednikiem w generowaniu wideo z obrazu, a aby taka być, kosztuje dwa razy więcej za minutę. A historia z tygodnia premiery — model, który dotarł na szczyt — nie utrzymała się: konkurencja ruszyła do przodu, arena zgromadziła dziesiątki tysięcy głosów w ramach kilkunastu nowszych systemów, a środkowa pozycja w tabeli to miejsce, w którym dziewięć miesięcy rywalizacji stawia szybki generator ogólnego przeznaczenia.
Kandinsky 6.0 Video nie ma oceny Elo na żadnej liście rankingowej. Jego dowodami są przeprowadzony test VABench i ocena ludzka przeprowadzona w laboratorium, oba opublikowane przez Sber, żadnego z nich nie odtworzono poza nim. Umieszczanie niezaudytowanego otwartego modelu obok ocenionego komercyjnego modelu to dokładnie takie porównanie, które należy traktować ostrożnie: pozycja ocenionego modelu jest realna i niepochlebna, a pozycja modelu bez wyniku jest nieznana. „Nieznane” nie znaczy „lepsze”.
Dwa rodzaje szybkości, a tylko jeden z nich mierzy się w sekundach.
Celem projektowym Grok Imagine Video jest przepustowość w przeliczeniu na twórcę. Jest wpięty w X, zwraca gotowy klip z dźwiękiem, a jego zestaw funkcji czyta się jak lista rzeczy, które ludzie faktycznie robią w feedzie: wiele proporcji obrazu, ruch kamery, dodawanie, usuwanie i podmiana obiektów, transfer stylu, generowanie warunkowane referencjami z kilku obrazów na potrzeby spójności postaci, natywne audio z dialogami, efektami i muzyką. Długość klipu wynosi do piętnastu sekund, a rozdzielczość sięga maksymalnie 1080p. Cały produkt został zbudowany tak, aby druga próba kosztowała cię kilka minut i kilka centów.
Kandinsky 6.0 Video jest szybki w innym sensie — nie na próbę, ale w przeliczeniu na jednostkę posiadania. Nic w nim nie jest natychmiastowe. Własne czasy działania repozytorium dla modelu niedestylowanego, po rozgrzewce i z wyłączeniem ładowania wag oraz kodowania MP4, plasują pięciosekundowy klip Pro Full HD na około 402 sekundy na H100, 854 sekundy na RTX 5090, 1 247 sekund na RTX 4090 i 3 530 sekund na RTX 5060 Ti. Lite Full HD to 284 sekundy na H100. Narzędziem, które to czyni znośnym, jest destylowany checkpoint, który w pracy zmierzono jako równy pełnemu modelowi — preferowany lub ex aequo w większości kryteriów, średnia preferencja 51% do 49%, żadna pojedyncza różnica nie osiągnęła istotności. W zamian za powolne renderowanie otrzymujesz model na własnym dysku, przy którym nie działa żaden licznik na klip.
Taki jest prawdziwy kształt tego starcia. Grok Imagine Video optymalizuje koszt dziesiątej próby. Kandinsky 6.0 Video optymalizuje koszt dziesięciotysięcznej, a za pierwszą każe ci zapłacić sprzętem i cierpliwością.
Oba generują dźwięk — i nie są tym samym twierdzeniem.
To jest ta oś, na której leniwe porównanie powiedziałoby „remis" i byłoby w błędzie.
Grok Imagine Video generuje natywne audio z dialogami, efektami i muzyką jako jedną z wielu funkcji. To generator ogólnego przeznaczenia, który akurat zawiera dźwięk.
Kandinsky 6.0 Video jest zbudowany wokół dźwięku. Architektura to dwustrumieniowy CrossDiT łączący strumień wideo inicjalizowany z Kandinsky 5.0 Video ze strumieniem audio trenowanym od zera na dużych korpusach audio, połączone za pomocą dwukierunkowej uwagi krzyżowej i trenowane łącznie. Wyjście ma 44 kHz i jawną synchronizację ust, a etap uczenia ze wzmocnieniem opisany w artykule ma według doniesień obniżać współczynnik błędów słów generowanej mowy o 47% — mierzony za pomocą Whisper-large-v3, który jest jednym z modeli nagrody RL; to szczegół, który ma znaczenie, ponieważ artykuł podaje drugi, nieporównywalny WER obok VABench przy użyciu Qwen3-ASR-1.7B. Mowa jest tym, na czym model był douczany.
Natomiast własne badanie Sbera jest szczere co do tego, gdzie przegrywa. W bezpośredniej ocenie porównawczej laboratorium MiniMax H3 i Dreamina Seedance 2.0 są preferowane pod względem kryteriów wizualnych z znaczącą przewagą, a model opisuje się jako konkurencyjny, a nie wyprzedzający. Twierdzenie, które warto potraktować poważnie, jest węższe i bardziej użyteczne: w starciu z Kling 2.6 i Veo 3.1 Fast wyniki przeplatają się kryterium po kryterium, a Kandinsky 6.0 Video pozostaje konkurencyjny pod względem jakości mowy i synchronizacji audio-wideo, gdzie duża część porównań kończy się remisem.
Piętnaście sekund kontra pięć — i ile kosztuje osiągnięcie każdego z nich.
• Maks. długość klipu — Grok Imagine Video: do 15 s. Kandinsky 6.0 Video: stałe 5 s, 121 klatek przy 24 fps, brak trybu przedłużania w tym wydaniu.
• Rozdzielczość — Grok Imagine Video: do 1080p. Kandinsky 6.0 Video: SD, HD i Full HD dzięki dedykowanemu modelowi superrozdzielczości, skalowanie x2, x4 lub x2,25 pięciosekundowych klipów.
• Wejście referencyjne — Grok Imagine Video: generowanie warunkowane referencjami z kilku obrazów w celu zachowania spójności postaci, a także dodawanie/usuwanie/zamiana obiektów. Kandinsky 6.0 Video: jeden obraz, stosowany jako zamaskowana klatka końcowa.
• Cennik — Grok Imagine Video: za sekundę materiału wyjściowego, od dolnej granicy przedziału aż do 0,30 USD/s przy 1080p, z dodatkową opłatą za każdy obraz wejściowy; darmowy dostęp jest dostępny dopiero w ramach poziomów subskrypcji X. Kandinsky 6.0 Video: brak — żadnej usługi, żadnej stawki, tylko czas GPU, który sam zapewniasz.
• Wagi — Grok Imagine Video: nie. Kandinsky 6.0 Video: MIT, Pro i Lite, z integracją diffusers.
Premia za nowszą wersję Groka to liczba, którą trzeba zakreślić. Przejście ze styczniowej wersji do 1.5 kosztuje dwa razy więcej za minutę w rankingu obraz-do-wideo i daje 26 punktów Elo. To realna poprawa za realną cenę i ten sam kompromis, którego każdy dostawca wideo oczekuje teraz od nabywców.
Gdzie router pasuje, a gdzie nie
OrcaRouter nie obsługuje Grok Imagine Video ani Kandinsky 6.0 Video i nic tutaj nie twierdzi inaczej: Kandinsky możesz pobrać i uruchomić samodzielnie, a Grok Imagine Video jest dostępny przez własne kanały xAI. To, czego rozwiązanie zbudowane na którymkolwiek z tych modeli potrzebuje od routera, to tekst otaczający render — lista ujęć, rozbudowa promptu, która zamienia pomysł w długi lub krótki podpis, na jakich te modele były trenowane, prace nad podpisywaniem i transkrypcją oraz podsumowania przeglądów, które decydują, która generacja zostanie zachowana. Działają one na jednym punkcie końcowym zgodnym z OpenAI w ramach ponad 200 modeli tekstowych w cenie katalogowej dostawcy z 0% marży, więc nowe wydanie od dostawcy działa na tym samym kluczu w dniu, w którym się pojawi, z automatycznym przełączaniem awaryjnym, dzięki czemu nieudane wywołanie w środku kolejki renderów zostanie przekierowane, zamiast zatrzymać całą partię. Orkiestracja wokół modelu wideo to problem routingu, nawet gdy sam model wideo nie podlega routingowi, co ma miejsce w przypadku obu tych modeli.
Który, i po co?
Sięgaj po Grok Imagine Video, gdy praca opiera się na wolumenie: klipy do social mediów, szybkie iteracje, ujęcie, które wygenerujesz ponownie sześć razy, zanim będzie dobre, i termin, który się nie rozciągnie. Cena za próbę jest tu produktem, a to, że plasuje się teraz w środku stawki, a nie na szczycie, to normalny koszt kategorii, która rozwija się tak szybko.
Sięgaj po Kandinsky 6.0 Video, gdy praca ma charakter potoku: stała pięciosekundowa jednostka, którą można przetwarzać wsadowo, przebieg konwersji obrazu na wideo, w którym liczy się wierność dostarczonemu obrazowi nieruchomemu, mowa, która ma być zrozumiała, oraz materiał końcowy, którego wolisz nie wynajmować. Zaplanuj budżet na renderowanie, spodziewaj się powolnego renderu na sprzęcie klasy konsumenckiej, a każdy wskaźnik jakości podany w tym tekście traktuj jako własny Sbera, dopóki ktoś spoza laboratorium go nie oceni.


To, co czyni tę parę wartą uwagi, to to, która z nich potrafi przetrwać słaby kwartał. Jeśli Grok Imagine Video spadnie jeszcze niżej w arenie, odpowiedzią jest lepszy model i nowa cena — tak działa ta kategoria, a xAI już pokazało, że taki wypuści. Jeśli Kandinsky 6.0 Video okaże się po ocenieniu plasować w środku tabeli, checkpoint nadal istnieje, nadal działa i nadal można go dostrajać; licencja nie zmienia się wraz z tą liczbą. To różne rodzaje trwałości i tylko jeden z nich jest mierzony przez Elo.

