
Kandinsky 6.0 Video vs Google Veo 3.1: Trzy poziomy kontra dwa rozmiary
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Otwórz raport techniczny Sbera dotyczący Kandinsky 6.0 Video i znajdź sekcję bezpośredniego porównania, a zauważysz coś, co umyka stronom porównawczym: przeciwnikiem nie jest Veo 3.1. To Veo 3.1 Fast. Sber przeprowadził swoją ocenę ludzką względem środkowego z trzech poziomów Veo, a ten jeden wybór mówi o tym starciu więcej niż jakiekolwiek zawarte w nim twierdzenie o jakości. Veo 3.1 jest ogólnie dostępny od 17 listopada 2025 r. w trzech poziomach usług; Kandinsky 6.0 Video pojawił się w pierwszym tygodniu października 2026 r. w dwóch rozmiarach do pobrania, Pro o 29B i Lite o 3B, na licencji MIT. Jedno z nich to usługa, którą kupujesz na sekundy, drugie to checkpoint, który uruchamiasz — i to pytanie o poziom, a nie o jakość, jest tym, gdzie w rzeczywistości kryje się decyzja.
Veo 3.1 to trzy produkty pod jedną nazwą
Model firmy Google jest ogólnodostępny w wersjach Standard, Fast i Lite; wszystkie trzy generują tę samą rodzinę formatów: 720p, 1080p i natywne 4K przy 24 fps, natywne czasy trwania 4, 6 lub 8 sekund, przy czym dłuższe wyniki są raportowane w 1080p, a łańcuchowe rozszerzanie sceny wykracza poza ten zakres, do trzech obrazów referencyjnych dla spójności postaci i sceny, a także kontrolki seed i negatywnego promptu. Dane wyjściowe zawierają metadane pochodzenia SynthID i C2PA.
To, co odróżnia poziomy, to cena i szybkość, a niezależny ranking mówi coś niewygodnego o tej różnicy. Na tabeli liderów tekstu na wideo Artificial Analysis trzy z nich mieszczą się w obrębie 14 punktów Elo od siebie — Veo 3.1 z 962 (±10) przy 2 998 głosach, Veo 3.1 Fast z 961 (±10) przy 4 325, Veo 3.1 Lite z 948 (±10) przy 2 903 — podczas gdy ich podane stawki wynoszą 24,00, 7,20 i 4,80 USD za minutę. Czytając to razem, arena mówi, że nie potrafi wiarygodnie odróżnić tych poziomów na podstawie preferencji. To nie znaczy, że poziomy są identyczne; znaczy to, że prawdziwym pytaniem kupującego jest, który poziom spełnia jego wymagania, bo ranking preferencji mu tego nie odpowie.
Kandinsky 6.0 Video przyjmuje odwrotne podejście do wariantowania. Dostępne są dwa rozmiary — Pro z 29B i Lite z 3B — współdzielące jedną architekturę i jeden stały format wyjściowy: 5 sekund, 121 klatek przy 24 fps, zsynchronizowany dźwięk 44 kHz z lip-sync, z tekstu lub obrazu referencyjnego, z osobnym modelem superrozdzielczości podnoszącym wynik do Full HD. Nie ma wariantu Fast ani trybu przedłużania. Wybierasz rozmiar i GPU.
Co tak naprawdę twierdzi własna ocena laboratorium
To jedyne dane z bezpośredniego porównania tych dwóch systemów, jakie istnieją, i są one raportowane przez dostawcę po obu stronach ukośnika — Sber przeprowadził to porównanie, Sber je opublikował, a nikt spoza firmy Sber ich nie odtworzył. Dokładne przedstawienie ich ma większe znaczenie niż przedstawienie ich w korzystnym świetle.
W trybie tekst-na-audio-wideo raport wskazuje, że Kandinsky 6.0 Video Pro jest preferowany pod względem artefaktów i ruchu kamery, z istotnymi statystycznie przewagami, i nieznacznie wyprzedza pod względem realizmu ruchu w zestawieniu zdominowanym przez remisy. Veo 3.1 Fast prowadzi pod względem podążania za promptami wizualnymi, jakości mowy, synchronizacji audio-wideo, ogólnej jakości dźwięku, podążania za promptami dźwiękowymi i rozwiązywania zadań użytkownika; wszystkie te przewagi oprócz mowy osiągają istotność statystyczną. Ogólna jakość wizualna jest niemal równa, z niewielką przewagą Veo.
W przypadku image-to-video wzorzec odwraca się w połowie wizualnej. Kandinsky 6.0 Video Pro jest preferowany pod względem ogólnej jakości wizualnej, zgodności z obrazem referencyjnym, artefaktów i ruchu kamery — wszystkie te różnice są istotne. Veo 3.1 Fast nadal prowadzi pod względem podążania za promptem wizualnym, synchronizacji audio i wideo, ogólnej jakości dźwięku, podążania za promptem dźwiękowym i rozwiązywania zadań użytkownika — również istotnie. Realizm ruchu i jakość mowy wypadają niemal na równi.
Z tego wynikają dwie rzeczy. Wynik dla obrazu do wideo to autentyczne ustalenie: preferowanie otwartego modelu pod względem zgodności z obrazem referencyjnym i ogólnej jakości wizualnej w porównaniu z klasą Google, w badaniu samego laboratorium, to realne twierdzenie warte rozważenia. A wynik dla dźwięku to obszar, w którym Veo utrzymuje prowadzenie niezależnie od trybu — co prowadzi nas do flagi, o której nikt nie wspomina.
Flaga audio, która decyduje, czy ta ocena jest sprawiedliwa
Veo 3.1 generuje natywne stereofoniczne audio 48 kHz — dialogi, dźwięki otoczenia, foley — jednocześnie z obrazem. To jedna z najmocniejszych cech modelu. W API jednak parametr audio jest domyślnie wyłączony, a generowanie bez dźwięku jest wyceniane niżej niż generowanie z dźwiękiem: około 0,20 USD za sekundę bez dźwięku w porównaniu z około 0,40 USD za sekundę z dźwiękiem na opublikowanym przez Google poziomie Standard.
Kandinsky 6.0 Video nie ma takiego przełącznika. Dźwięk jest częścią wyjścia, a potok obsługi włączony do vLLM-Omni domyślnie emituje AAC 44,1 kHz. Zatem oba modele nie mają takich samych ustawień domyślnych: jeden jest nastawiony na dźwięk, drugi domyślnie milczy, a dźwięk jest ulepszeniem.
Ta asymetria ma konkretny koszt w porównaniach. Każde bezpośrednie starcie, które stawia cichego Veo 3.1 przeciwko konkurentowi, który zawsze jest wyposażony w dźwięk, a następnie ocenia tę parę na liście rankingowej uwzględniającej dźwięk, postawiło Veo w niekorzystnej sytuacji przez przypadek domyślnego ustawienia. Czytając powyższe liczby Sber — lub kogokolwiek innego — pierwsze pytanie, jakie należy zadać, brzmi: czy po stronie Veo włączono dźwięk. Drugie to, jaka była różnica w cenie, ponieważ w planie Standard włączenie dźwięku podwaja cenę.
Pięć sekund kontra osiem, a 1080p kontra natywne 4K
Luka w formacie to miejsce, w którym widoczne są założenia projektowe obu modeli.
• Długość klipu — Kandinsky 6.0 Video: stałe 5 s, 121 klatek przy 24 fps, bez przedłużania. Veo 3.1: natywnie 4, 6 lub 8 s, dłużej przy 1080p, a powyżej tego łańcuchowe przedłużanie scen.
• Rozdzielczość — Kandinsky 6.0 Video: SD, HD i Full HD (1920×1080) dzięki obróbce w superrozdzielczości. Veo 3.1: 720p, 1080p i natywne 4K.
• Pochodzenie — Kandinsky 6.0 Video: nie podano w informacji o wydaniu. Veo 3.1: metadane SynthID i C2PA na wyjściu.
• Dane wejściowe referencyjne — Kandinsky 6.0 Video: jeden obraz, stosowany jako zamaskowana klatka końcowa. Veo 3.1: do trzech obrazów referencyjnych oraz ziarno i negatywny prompt.
• Format — Kandian 6.0 Video: 44,1 kHz AAC z obrazem, zawsze włączone. Veo 3.1: 48 kHz stereo, opcjonalnie, w dwóch wariantach cenowych.
Pozycja dotycząca pochodzenia jest tą, która ma konsekwencje w procesie zakupowym. Jeśli Twój materiał końcowy musi być identyfikowalny — prace brandingowe, materiały do emisji, cokolwiek, na co spojrzy dział prawny — Veo 3.1 dołącza metadane informujące, że materiał wideo został wygenerowany, a Kandinsky 6.0 Video nie. To nie jest różnica w jakości i żaden benchmark jej nie pokaże, ale to właśnie taki wymóg, który sam w sobie przesądza o wyborze dostawcy, a model otwarty bez niego nie jest zamiennikiem typu drop-in dla zespołu, który go potrzebuje.
Linia 4K ma znaczenie w taki sam sposób i z tego samego powodu. Full HD w Kandinsky 6.0 Video jest prawdziwe — istnieje dedykowany model SR, a pakiet SR z repozytorium obsługuje skalowanie x2, x4 i x2,25 pięciosekundowych klipów — ale osiąga górny limit tam, gdzie natywna ścieżka Veo 3.1 zaczyna się na swoim górnym końcu. W przypadku pracy z dużymi ekranami ten pułap nie podlega negocjacjom.
Ile kosztuje klip po każdej stronie
Veo 3.1 jest rozliczany za sekundę. W planie Standard pięciosekundowy klip 1080p z dźwiękiem kosztuje około 2,00 USD, a ten sam klip bez dźwięku około 1,00 USD; Fast i Lite plasują się poniżej, a ponieważ ich wyniki w Arena mieszczą się w przedziale ufności wyników Standardu, na podstawie dowodów trudno mieć argumenty przeciw tańszym planom.
Kandinsky 6.0 Video nie ma faktury. Ma czas GPU. Dane repozytorium dla modelu niedestylowanego, mierzone po rozgrzewce, z wyłączeniem ładowania wag i kodowania MP4, wskazują, że pięciosekundowy klip Pro Full HD zajmuje około 402 sekund na H100, 854 sekundy na RTX 5090, 1 247 sekund na RTX 4090 i 3 530 sekund na RTX 5060 Ti. Lite Full HD to 284 sekundy na H100. Szczytowa alokacja w uruchomieniu Pro SD sięga 72,8 GiB, więc wszystko poniżej tego wymaga block offloadingu — a preset 16 GB kwantyzuje enkoder tekstu do NF4, co jest jedyną zmianą presetu, którą praca potwierdza jako zmieniającą sam klip, a nie wprowadzającą szum na poziomie zaokrągleń.
Te dwie struktury kosztów nie da się porównać. Jedna to rachunek, który prognozujesz za każdą ukończoną sekundę; druga to maszyna, którą kupujesz, render mierzony w minutach i możliwość dostrajania — której Veo 3.1 nie oferuje na żadnym poziomie.
Kwestia poziomu to kwestia routingu
OrcaRouter nie obsługuje ani Google Veo 3.1, ani Kandinsky 6.0 Video i nic takiego nie jest tu sugerowane — Veo 3.1 jest dostępny przez własne interfejsy Google, a Kandinsky możesz pobrać samodzielnie. Warto jednak nazwać strukturę decyzji dotyczącej Veo, bo to dokładnie ten problem, który nasza warstwa routingu ma rozwiązać po stronie tekstu: trzy poziomy, których niezależne wyniki są nieodróżnialne, a których ceny różnią się pięciokrotnie, to dokładnie ten przypadek, w którym „kieruj do taniego i eskaluj tylko wtedy, gdy poprzeczka nie została przekroczona" bije „standaryzuj na flagowcu". Adaptacyjny routing OrcaRoutera i DSL routingu wyrażają to jako skonfigurowaną politykę dla ponad 200 modeli tekstowych na jednym endpointcie zgodnym z OpenAI, w cenie katalogowej dostawcy z 0% marży, z automatycznym przełączaniem awaryjnym, gdy trasa przestaje działać. Ten sam instynkt zastosowany do wydatków na wideo — domyślnie Fast, Standard dla ujęć, które mają znaczenie — to decyzja zakupowa, którą możesz podjąć już dziś, bez żadnego routera.
Który, dla kogo
Wybierz Veo 3.1, jeśli materiał końcowy wymaga poważnego potraktowania dźwięku, jeśli potrzebuje 4K lub klipu dłuższego niż pięć sekund albo jeśli ktoś na dalszym etapie wymaga metadanych pochodzenia. Wybierz poziom świadomie, zamiast domyślnie wybierać Standard, i zaplanuj w budżecie opcję audio, zamiast odkrywać ją na fakturze.
Wybierz Kandinsky 6.0 Video, jeśli chcesz wagi, jeśli pięć sekund pasuje do twojej jednostki pracy i jeśli zadaniem jest wierność konwersji obrazu na wideo względem dostarczonego zdjęcia — jedyny wymiar, w którym własne badanie laboratorium stawia go przed poziomem Veo o znaczących marginesach. Wchodź w to ze świadomością, że dźwięk jest zawsze włączony, pochodzenie jest nieobecne, a twierdzenie o jakości opiera się wyłącznie na raporcie napisanym przez jego autora.


Asymetria, której należy się trzymać, polega na tym, że Veo 3.1 jest w produkcji od jedenastu miesięcy i zgromadził dzięki temu coś, czego model otwarty wydany w tym miesiącu nie może: zmapowany zestaw trybów awarii, które jego użytkownicy już opublikowali, oraz krzywą cenową, którą zespół finansowy może modelować. Z drugiej strony licencja MIT Kandinsky'ego oznacza, że model na twoim dysku nie zależy od niczyjej roadmapy. To, które z nich jest warte więcej, nie jest pytaniem o benchmark.

