
Vidu Q4 Preview kontra Seedance 2.5: Budżet referencyjny to nie prawdziwa różnica
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Opublikowane budżety referencyjne wyglądają na jednoznaczne zwycięstwoSeedance 2.5: do 30 obrazów, 10 filmów i 10 klipów audio w porównaniu zVidu Q4 Preview, który oferuje 15 obrazów i 3 klipy audio. To dwa razy więcej obrazów i trzy razy więcej audio, a samo w sobie rozstrzygnęłoby tę kwestię. Tak się jednak nie dzieje, bo liczba, która ma znaczenie, to nie liczba elementów — to druga modalność. Seedance 2.5 akceptuje wideo jako referencję wejściową. Vidu Q4 Preview akceptuje obrazy i audio, a nie ma udokumentowanej ścieżki, by wprowadzić istniejący klip.
Seedance 2.5 został uruchomiony 31 lipca 2026 r. jako długoformatowa propozycja ByteDance, generując 30-sekundowy klip w pojedynczym przebiegu z wieloturym rozszerzaniem dla dłuższych sekwencji. Vidu Q4 Preview został uruchomiony 7 października 2026 r. przez Shengshu Technology jako zapowiedź flagowego modelu nowej generacji, z dwoma trybami — Image-to-Video i Reference-to-Video — oraz dwoma udokumentowanymi punktami końcowymi API. Oba są modelami mocno opartymi na referencjach. Zostały zbudowane, aby obsługiwać różne rzeczy.
Co każda modalność wejściowa faktycznie odblokowuje
Model, który przyjmuje obrazy jako referencje, potrafi utrzymać obsadę i ujęcie. Dokumentacja Vidu Q4 opisuje łączenie od 1 do 15 obrazów w obrębie postaci, scen i stylu, dzięki czemu obiekty pozostają spójne w materiale składającym się z wielu ujęć, z maksymalnie 3 referencjami audio w formacie mp3 trwającymi od 3 do 12 sekund, które klonują głos i zachowują spójny sposób mówienia. Piętnaście miejsc na kostiumy, rekwizyty i oświetlenie w obrębie jednej sceny to spójny budżet i właśnie dlatego model ten zajmuje ex aequo pierwsze miejsce w rankingu preferencji dla generowania wideo z obrazu.
Model, który dodatkowo przyjmuje wideo jako referencję, można wskazać na materiał filmowy. To, że Seedance 2.5 przyjmuje do 10 wejść wideo obok 30 obrazów i 10 klipów audio, oznacza, że zestaw referencyjny może obejmować ruch, tempo i zachowanie kamery zaczerpnięte z istniejącego klipu, a nie opisane w prompcie. To inna zdolność, a nie większa wersja tej samej, i to właśnie sprawia, że Seedance 2.5 trafia na tablicę edycji wideo Artificial Analysis — na drugie miejsce, z 1161 Elo przy 5162 głosach według odczytu z 8 października 2026 — edytując wideo na podstawie instrukcji tekstowej z zachowanym dźwiękiem. Vidu Q4 Preview nie znajduje się na tej tablicy, a powodem jest jego lista endpointów, nie jego wynik.
Praktyczny kontrast:
• Referencje obrazów — Vidu Q4 Preview do 15 vs Seedance 2.5 do 30
• Odniesienia wideo — Vidu Q4 Preview: brak udokumentowanych vs Seedance 2.5: do 10
• Referencje audio — Vidu Q4 Preview: do 3 klipów MP3 o długości 3–12 sekund vs Seedance 2.5: do 10 klipów
• Długość pojedynczego przebiegu — Vidu Q4 Preview 3–16 sekund w trybie Image-to-Video, 1–16 sekund w trybie Reference-to-Video, a Seedance 2.5 30 sekund w jednym przebiegu, z wieloturnowym przedłużaniem poza ten zakres
• Tryby — Vidu Q4 Preview: obraz do wideo i referencja do wideo kontra Seedance 2.5: tekst do wideo, referencja do wideo i wideo na wejściu, z opcją edycji w planach
• Rozdzielczość wyjściowa — Vidu Q4 Preview od 540p do 4K jako płatne poziomy generowania, 2K i 4K w kolorze 10-bitowym w porównaniu z Seedance 2.5 480p i 720p u hostów, które publikują jego ustawienia, przy czym wyższe poziomy osiągają rozdzielczość docelową poprzez skalowanie w górę
Zestaw je obok siebie, a modele nie konkurują o ten sam brief. Piętnastoreferencyjne ujęcie 4K trwające szesnaście sekund oraz trzydziestoreferencyjne ujęcie 720p trwające trzydzieści sekund z wejściem wideo to odpowiedzi na dwa różne pytania produkcyjne.
Jednostki cenowe nie konwertują się i to cała historia.
To tutaj większość porównań tych dwóch się myli, a wina leży w jednostce, a nie w arytmetyce.
Seedance 2.5 nie jest sprzedawany przez swojego dostawcę w rozliczeniu za sekundę. ByteDance rozlicza model w tokenach wideo według oficjalnego cennika, publikowanego przez Volcano Engine Ark w Chinach i BytePlus ModelArk na arenie międzynarodowej. Koszt klipu zależy od rozdzielczości, czasu trwania i rzeczywistego zużycia tokenów, więc stawka za sekundę jest ważna tylko dla jednej rozdzielczości i jednego czasu trwania — a nieudane ujęcia są rozliczane tak samo jak udane. Zewnętrzni dostawcy udostępniający Seedance 2.5 doliczają własną marżę i publikują własną stawkę za sekundę lub za klip, dlatego tuzin stron podaje tuzin różnych liczb i żadna z nich nie jest liczbą dostawcy.
Vidu Q4 Preview jest wyceniany w inny sposób: stała stawka kredytowa za sekundę, która zmienia się tylko w zależności od wybranego poziomu rozdzielczości, publikowana jawnie przez Shengshu. Dziewięć kredytów na sekundę przy 540p, 19 przy 720p, 24 przy 1080p, 38 przy 2K, 78 przy 4K, w stosunku do podanej platformowej stawki kredytowej wynoszącej 0,005 USD, z obecnie obowiązującymi ograniczonymi czasowo rabatami na pakiety do 30%. Przy stawce katalogowej krzywa przebiega od około 0,045 USD za sekundę przy 540p do około 0,39 USD przy 4K. Liczba 0,014 USD za sekundę z ogłoszenia o premierze to poziom 540p z zastosowanym rabatem.
Co oznacza, że dwóch cenników nie da się porównać pozycja po pozycji, a każda strona, która to robi, porównuje otwarty cennik dostawcy z marżą hosta. Porównać można to, co dostawca publikuje o kształcie każdego z nich: koszt Vidu skaluje się wraz z rozdzielczością i czasem trwania i jest znany, zanim naciśniesz „generuj”; Seedance rozlicza się w tokenach, a więc zależy od tego, jak model zdecyduje się wydać tokeny na Twój prompt. Jeden jest przewidywalny, drugi rozliczany według zużycia. Żaden nie jest zły, ale pasują do różnych nabywców — a ten drugi z dwóch jest groźniejszy przy planowaniu budżetu, bo wariancja leży po stronie dostawcy.
Na niezależnej tablicy zarejestrowane wartości na minutę warto odczytywać wyłącznie jako rząd wielkości. Artificial Analysis odnotowuje Vidu Q4 Preview na poziomie 7,20 USD za minutę w tablicy obraz–wideo, a Dreamina Seedance 2.5 na poziomie 34,12 USD za minutę w tekst–wideo i 40,82 USD w edycji. Te kolumny to koszt jednej minuty materiału wyjściowego 1080p przy domyślnych ustawieniach każdego modelu — a Seedance 2.5 domyślnie używa dłuższej, cięższej konfiguracji, dla której jego cennik podaje stawkę, podczas gdy domyślnym ustawieniem Vidu Q4 Preview jest klip z pojedynczego generowania. Mierzą one różne domyślne zachowania, a nie cztero- do pięciokrotną różnicę w wydajności.
Szesnaście sekund przeciw trzydziestu to prawdziwa różnica
Istnieje jedno porównanie, które rzeczywiście wytrzymuje problem jednostek — i jest nim długość. Trzydzieści sekund w jednym przebiegu to niemal dwa razy więcej niż szesnastosekundowy limit Vidu Q4 Preview, a wieloetapowe przedłużanie w Seedance 2.5 sprawia, że sekwencję można budować dalej, poza tę granicę. W przypadku pracy narracyjnej — sceny z łukiem narracyjnym, reklamy z zawiązaniem akcji i puentą — różnica między szesnastoma a trzydziestoma sekundami to różnica między ujęciem a sceną.
W drugą stronę działa to na tanim końcu skali. Vidu Q4 Preview generuje już od trzech sekund, a jego poziom 540p jest wyceniony na około jedną trzecią własnej stawki 720p, co sprawia, że wstępne zablokowanie kompozycji jest tanie, zanim zdecydujemy się na render w pełnej rozdzielczości. Nic w opublikowanej strukturze cen Seedance 2.5 nie pełni tej roli: jego podstawowy poziom 480p kosztuje mniej niż 720p, ale rozliczenia samego dostawcy opierają się na tokenach, więc krótki test w niskiej rozdzielczości nie ma przejrzystej, opublikowanej ceny, na której można by oprzeć planowanie.
Który, na podstawie briefu?
Sięgnij po Seedance 2.5, gdy zadanie obejmuje materiał filmowy, który już masz. Jeśli praca polega na wydłużaniu, zmianie stylu lub ponownym montażu istniejącego klipu albo jeśli zestaw referencyjny musi przenosić ruch, a nie tylko wygląd, decydującą możliwością jest wejście wideo i nie można w to miejsce podstawić Vidu Q4 Preview. Dodaj trzydziestosekundowy pojedynczy przebieg, a sprawa staje się prosta w przypadku pracy narracyjnej i reklamowej z dłuższym łukiem.
Wybierz Vidu Q Preview, gdy zadanie wymaga obsady, która musi zachować spójność, oraz specyfikacji dostawy wykraczającej poza 720p. Natywne generowanie w 2K i 4K przy 10-bitowej głębi kolorów to coś, czego Seedance 2.5 nie udostępnia na poziomie producenta, a cena za sekundę sprawia, że ujęcie w 4K to ilość, którą naprawdę można zaplanować w budżecie, a nie mierzona niewiadoma. Piętnaście referencji obrazowych i trzy referencje głosowe wystarczą dla obsady w pojedynczej scenie, a poziom 540p do blockingu sprawia, że iteracja jest tania.
Co mogłoby to zmienić: pełne wydanie Vidu Q4, które dodaje modalność wejścia wideo, zniosłoby różnicę strukturalną i uczyniłoby te dwa modele bezpośrednimi konkurentami, a własne materiały Shengshu mówią, że wersja zapoznawcza istnieje właśnie po to, by zbierać opinie kształtujące finalną wersję. Z drugiej strony, jeśli ByteDance opublikuje przykładową tabelę stawek za tokeny dla większej liczby ustawień, asymetria między rozliczaniem za zużycie a przewidywalnością stanie się znacznie łatwiejsza do obejścia. Dopóki nie nastąpi jedno lub drugie, właściwe odczytanie „30 referencji kontra 15” jest takie, że jeden z tych modeli przyjmuje wideo na wejściu, a drugi nie.
Jeden klucz do modeli wideo, które faktycznie możesz wywołać
OrcaRouter umieszcza modele wideo i językowe za jednym punktem końcowym zgodnym z OpenAI, na jednym kluczu, w cenach listowych dostawcy przekazywanych bez doliczania marży, dzięki czemu zmiana stawek dostawcy wchodzi w życie tego samego dnia, a nie przy odnowieniu. Vidu Q4 Preview i Seedance 2.5 nie są obecnie trasami OrcaRouter, a ta strona nie sugeruje inaczej. Trasy wideo, które obsługujemy — Kling 3.0 oraz jego warianty Turbo i v2.6, które są wśród nich — znajdują się obok modeli językowych na tym samym punkcie końcowym i przy tym samym kształcie żądania, z automatycznym przełączaniem awaryjnym między trasami, a nie osobną umową dla każdego modelu.
To właśnie ta struktura sprawia, że takie porównanie da się doprowadzić do końca: przetestuj kandydatów na własnym briefie, przy własnych ustawieniach, i pozwól, aby decydował wskaźnik akceptacji, a nie dwie karty stawek w różnych jednostkach.



