
Kandinsky 6.0 Video kontra Hailuo 2.3: cennik kontra pobranie
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Zacznijmy od arytmetyki, bo to jedyne miejsce, w którym te dwa rozwiązania się pokrywają. Sześciosekundowy niemy klip 1080p z Hailuo 2.3, budżetowego modelu wideo z kwietnia 2026, kosztuje katalogowo kilka centów za sekundę — około $0.48 za klip. Pięciosekundowy klip ze zsynchronizowanym dźwiękiem 44 kHz i lip-syncem z Kandinsky 6.0 Video, który Kandinsky Lab od Sbera udostępnił na licencji MIT w pierwszym tygodniu października 2026, nie kosztuje nic za klip i zajmuje około siedmiu minut czasu H100 w Full HD. To całe starcie w dwóch zdaniach, a decyzja, którą z niego płynie, nie brzmi „który jest lepszy” — chodzi o to, który licznik wolisz uruchomić: fakturę naliczaną za sekundę czy własny sprzęt.
Wszystko inne wynika z tego podziału, a większość stron porównawczych rozumie to odwrotnie, traktując je jako ten sam rodzaj produktu w różnych przedziałach cenowych. Tak nie jest. Hailuo 2.3 to usługa z briefem stylisty i bez dźwięku; Kandinsky 6.0 Video to rodzina checkpointów w dwóch rozmiarach — Pro z 29B i Lite z 3B — z dźwiękiem jako jej centralną cechą architektoniczną.
W czym ten tani jest tak naprawdę dobry
Reputacja Hailuo 2.3 jest zasłużona i konkretna. Dobrze radzi sobie z kinowym ruchem kamery, ruchem człowieka i mikroekspresjami, a w przypadku treści stylizowanych i anime jest mocniejszy, niż sugerowałaby jego cena. Generuje wideo z tekstu i wideo z obrazu w rozdzielczości do 1080p. MiniMax nie reklamuje go jako modelu fotorealistycznego i nim nie jest — to stylista z dobrym okiem do ruchu.
Jego ograniczenia są równie konkretne i właśnie dlatego to porównanie jest krótkie.
• Brak natywnego dźwięku. Hailuo 2.3 generuje nieme wyjście, a wcześniejsza generacja Hailuo, która miała dźwięk, nie jest przenoszona do tej wersji. Do każdego klipu trzeba dodać dźwięk na dalszym etapie.
• Limit długości klipu wynosi sześć sekund przy 1080p i dziesięć sekund przy 768p, bez kontroli klatki końcowej — przez co klipy nie łączą się płynnie w sekwencję.
• Nie ma go w obecnych niezależnych rankingach. Hailuo 2.3 nie pojawia się w rankingach Artificial Analysis dla generowania wideo z tekstu, z obrazu ani edycji wideo w takim kształcie, w jakim są one publikowane dzisiaj, więc nie ma publicznego Elo, z którym można by cokolwiek porównywać. Starsze wzmianki o tym, że plasował się w okolicach drugiej połowy trzeciej dziesiątki na arenie wideo, nie zgadzają się z obecnie publikowanymi rankingami i należy je traktować jako nieaktualny zrzut, a nie bieżącą pozycję.
Cennik jest podawany w dwóch walutach przez dwa różne podmioty i oba są warte poznania. Własne API MiniMax sprzedaje przedpłacone pakiety punktów, gdzie sześciosekundowy standardowy klip 768p zużywa jeden punkt, a dziesięciosekundowy klip 768p lub sześciosekundowy 1080p zużywa dwa — a szybszy wariant Hailuo-2.3-Fast redukuje je do około 0,7 oraz od 1,1 do 1,3 punktu. Zewnętrzne trackery podają bardziej wyrównaną stawkę w okolicach 0,067 do 0,082 USD za sekundę, jeden z nich po 0,0817 USD/s, podając „do 1080p, maks. 10 s na klip, wyjście bez dźwięku” i około 147 USD miesięcznie za trzysta sześciosekundowych klipów. Niezależnie od wybranej drogi rząd wielkości jest taki sam i to najtańsza generacja w tej kategorii.
Problem z decydowaniem się na zastąpioną generację
Istnieje fakt dotyczący cyklu życia Hailuo 2.3, który ma większe znaczenie niż jakakolwiek specyfikacja, i nie jest to krytyka modelu. MiniMax poszedł dalej. Jego następca, MiniMax H3 — generacja Hailuo 3 — został wydany 31 lipca 2026 r. i jest produktem zupełnie innej klasy: model omnimodalny, który odczytuje odniesienia tekstowe, obrazowe, wideo i audio jako jeden kontekst, generuje klipy trwające od czterech do piętnastu sekund w rozdzielczości 768p lub 2K z natywnym dźwiękiem stereo, rozliczany za sekundę wyniku.
To nie jest twierdzenie dostawcy. Znajduje się to na niezależnych forach, a umiejscowienie jest mocne:
• Tekst na wideo — MiniMax H3 (768p) 4. miejsce z wynikiem Elo 1 137 (±9) przy ponad 8 315 głosach, za 4,80 USD/min.
• Obraz na wideo — MiniMax H3 na 2. miejscu z wynikiem Elo 1 181 (±8) na podstawie ponad 7 284 głosów, w cenie 7,80 USD/min.
• Edycja wideo — MiniMax H3 na 2. miejscu z wynikiem Elo 1 132 (±6) przy ponad 12 043 głosach, w cenie 7,80 USD/min.
Uczciwe ujęcie zakupu Hailuo 2.3 w październiku 2026 r. jest więc takie: kupujesz poziom budżetowy rodziny, której flagowa generacja należy do pierwszej piątki w obu trybach generowania, ma audio, którego brakuje w 2.3, i kosztuje być może pięć do dziesięciu razy więcej za sekundę. To obronna decyzja w przypadku prac stylizacyjnych o dużej skali — dokładnie do tego służy poziom budżetowy — ale powinna to być decyzja świadoma, a nie domyślna. Każdy, kto dziś ocenia 2.3, powinien najpierw porównać ceny H3 z jego ceną, ponieważ różnica między nimi nie jest przyrostowa.
Pięć sekund kontra sześć i dlaczego różnica jest mniejsza, niż się wydaje
Jeśli chodzi o długość, Kandinsky 6.0 Video nie wygrywa. Jest trenowany na 121 klatkach przy 24 fps — pięć sekund — a w wydaniu nie ma trybu przedłużania. Hailuo 2.3 daje sześć sekund w 1080p. Żadne z nich nie wystarcza na ciągłą scenę, a oba oznaczają, że trzydziestosekundowy materiał to pięć lub sześć generacji plus łączenia.
Luki, które mają znaczenie, są gdzie indziej.
• Dźwięk — Kandinsky 6.0 Video: 44 kHz z synchronizacją ust, tworzony razem z obrazem, zawsze włączony. Hailuo 2.3: brak, z założenia.
• Rozdzielczość — Kandinsky 6.0 Video: SD, HD i Full HD dzięki dedykowanemu modelowi superrozdzielczości, skalowanie w górę pięciosekundowych klipów x2, x4 lub x2,25. Hailuo 2.3: do 1080p, bez etapu SR.
• Warunkowanie — Kandinsky 6.0 Video: tekst-na-audio-wideo i obraz-na-audio-wideo, jeden obraz referencyjny zastosowany jako maskowana klatka końcowa. Hailuo 2.3: tekst-na-wideo i obraz-na-wideo, bez kontroli klatki końcowej.
• Wagi — Kandinsky 6.0 Video, Pro i Lite, z image-to-video i — od dzisiaj rano — pipeline vLLM-Omni. Hailuo 2.3 nie został wydany.
• Cennik — Hailuo 2.3: za sekundę lub punkty odliczane od przedpłaconego pakietu, z tańszym wariantem Fast. Kandinsky 6.0 Video: brak jakiejkolwiek stawki; GPU zapewniasz sam.
Co mówią własne dowody dostawcy, a czego nie mogą
Sprawa jakości Kandinsky 6.0 Video nie została poddana audytowi i tak należy ją opisywać. Sber podaje wyniki VABench, w których Pro prowadzi pod względem jakości mowy, estetyki dźwięku, dopasowania tekstu do wideo i dźwięku do wideo, dokładności synchronizacji ust, desynchronizacji oraz realizmu wizualnego wśród trzech ocenianych systemów — swojego własnego modelu Lite i LTX 2.5. Podaje również wyniki przeprowadzonej w laboratorium bezpośredniej oceny ludzkiej, obejmującej około 200 lub więcej porównań parami na kryterium, w której model jest konkurencyjny wobec Kling 2.6 i Veo 3.1 Fast, ustępuje MiniMax H3 i Dreamina Seedance 2.0 w kryteriach wizualnych oraz pozostaje konkurencyjny pod względem jakości mowy i synchronizacji dźwięku z wideo. Nie istnieje publiczne Elo w testach ślepych ani zewnętrzne odtworzenie wyników.
Dowody w przypadku Hailuo 2.3 mają odwrotny kształt: jest szeroko stosowany, ma publicznie podaną cenę, ale obecnie nie ma go w niezależnych rankingach wideo, więc nie można go też umieścić na tle obecnej stawki. Żaden z modeli nie ma tego, czego kupujący chciałby najbardziej — a w przypadku Hailuo ma to jego własny następca. To właśnie ta asymetria warta jest nazwania: rodzina jednego modelu została już oceniona i sklasyfikowana, a rodzina drugiego nie została oceniona w ogóle.
Co zatem pozostaje, to przepaść audio, i jest to prawdziwa przepaść, a nie linia na liście funkcji. Cisza Hailuo 2.3 upraszcza jedną rzecz — nie ma ścieżki dźwiękowej do zachowania, gdy przekazujesz klip do masteringu — i komplikuje inną: każdy talking-head, każdy spot produktowy z narracją, każdy klip, w którym efekt dźwiękowy musi trafić w akcję, to teraz dwie generacje plus krok wyrównania, który należy do ciebie. Cała architektura Kandinsky 6.0 Video jest ukierunkowana na ten problem: dwuprzepływowy CrossDiT łączący strumień wideo ze strumieniem audio od podstaw w dwukierunkowej uwadze krzyżowej, z etapem uczenia ze wzmocnieniem, który według artykułu zmniejsza współczynnik błędów słów generowanej mowy o 47% — mierzony za pomocą Whisper-large-v3, jednego z modeli nagrody RL, i nieporównywalny z osobnym współczynnikiem błędów słów Qwen3-ASR-1.7B, który artykuł podaje obok VABench.
Gdzie router pasuje, a gdzie nie
OrcaRouter nie obsługuje Kandinsky 6.0 Video ani Hailuo 2.3, a żadne takie twierdzenie nie jest tu wysuwane — Kandinsky możesz pobrać i uruchomić samodzielnie, a Hailuo 2.3 jest dostępny przez własne API MiniMax i system punktów. To, czego pipeline zbudowany na którymkolwiek z nich potrzebuje od routera, to tekst wokół renderu: lista ujęć, rozwijanie promptu, które zamienia brief w długi lub krótki opis, na którym te modele były trenowane, praca nad opisami i dialogami oraz podsumowania przeglądów, które decydują, która generacja zostanie zachowana. To zwykłe wywołania tekstowe i działają w ramach jednego endpointu zgodnego z OpenAI, obejmującego ponad 200 modeli po cenie katalogowej dostawcy z 0% marży, więc zmiana ceny dostawcy jest aktywna na tym samym kluczu w dniu, w którym zostaje wprowadzona, z automatycznym przełączaniem awaryjnym, dzięki czemu nieudane wywołanie w trakcie renderu zostaje przekierowane zamiast utraty całej partii. Warstwa orkiestracji wokół modelu wideo jest problemem routingu nawet wtedy, gdy sam model wideo nie podlega routingowi — co ma dziś miejsce w przypadku obu tych modeli.
Który wybrać
Wybierz Hailuo 2.3, gdy zadanie wymaga wolumenu, estetyka jest stylizowana lub animowana, efekt końcowy jest niemy, a rozliczenie za klip to ograniczenie, które ma znaczenie. To najtańsza kompetentna generacja w tej kategorii i tak jest wyceniona. Zanim podejmiesz decyzję, sprawdź cenę MiniMax H3 obok niego, ponieważ flagowa generacja tej samej rodziny jest oceniana w pierwszej piątce w obu trybach i ma dźwięk, którego 2.3 nigdy nie miała.
Wybierz Kandinsky 6.0 Video, gdy dostarczany materiał wymaga dźwięku, gdy pięciosekundowe jednostki pasują do twojej listy ujęć, gdy wymogiem jest wierność przekształcania obrazu w wideo względem dostarczonej stopklatki oraz gdy posiadanie modelu liczy się bardziej niż wynajmowanie go. Podchodź do tego z kosztami podanymi wprost: brak stawki, limit pięciu sekund, render Full HD, który trwa około 402 sekund na H100 i 854 na RTX 5090 dla modelu Pro, wymagane odciążanie bloków poniżej 72,8 GiB szczytowej alokacji oraz twierdzenie o jakości, które jest w całości własnością Sber, dopóki ktoś spoza laboratorium go nie oceni.


Pytanie ukryte pod dwiema listami cenowymi jest tym, które w tym kwartale decyduje o wielu elementach infrastruktury wideo. Hailuo 2.3 rozlicza cię za sekundę i daje plik; Kandinsky 6.0 Video rozlicza cię za GPU i daje licencję. Dla zespołu generującego sto klipów miesięcznie faktura wygrywa na każdej osi, którą mierzy arkusz kalkulacyjny. Dla zespołu, który zamierza dostrajać model, działać offline lub nadal używać tego samego modelu po premierze następnej generacji, pobranie wygrywa na tej jednej osi, której arkusz kalkulacyjny nie widzi.

