
Vidu Q4 Preview vs Alibaba Wan 2.7: Dwa tryby kontra cztery i jedna tablica, na której to się liczy
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Oto całość w jednej linii: Vidu Q4 Preview pokonuje Alibaba Wan 2.7 o 102 punkty Elo w rankingu Artificial Analysis image-to-video i nie można go wystawić przeciwko niemu w kategorii text-to-video ani edycji wideo, ponieważ Vidu Q4 Preview nie obsługuje żadnej z tych funkcji.
Oba modele zadebiutowały w 2026 roku i oba generują wideo z dźwiękiem. Vidu Q4 Preview pojawił się 7 października 2026 roku od Shengshu Technology jako pierwsza publiczna wersja zapowiadająca pełny model Q4, w dwóch trybach — Image-to-Video i Reference-to-Video. Alibaba Wan 2.7 trafił na rynek w kwietniu 2026 roku jako zestaw czterech wariantów: text-to-video, image-to-video, reference-to-video oraz edycja wideo, rozliczany za sekundę wygenerowanego wideo. Zatem element rozstrzygający w większości bezpośrednich porównań — wynik — istnieje tylko na jednej z osi, a uczciwy sposób oceny tych dwóch modeli polega na tym, aby zacząć od pytania, których osi tak naprawdę potrzebujesz.
Tablica wyników, z pozostawionymi widocznymi lukami
Artificial Analysis prowadzi trzy osobne rankingi wideo. Każdy ma własną skalę Elo i własną pulę głosów, więc wynik z jednego nie przenosi się na inny. Odczyt z 8 października 2026 r., ponownie z zachowanym dźwiękiem:
• Obraz do wideo (AA-Video-I2V v1.0) — Vidu Q4 Preview 3., 1 179 ±10, 5 543 próbki, paź 2026, 7,20 USD/min; Alibaba Wan 2.7 13., 1 077 ±8, 4 571 próbek, kwi 2026, 9,00 USD/min
• Tekst na wideo (AA-Video-T2V v2.0) — Vidu Q4 Preview nie występuje; Wan2.7-260612 13.–14., 1 030 ±9, 5 571 próbek, cze 2026, 9,00 USD/min
• Edycja wideo (AA-Video-Editing v1.1) — Vidu Q4 Preview nie występuje; Wan 2.7 na 7. miejscu, 1 074, 20 021 próbek, kwi 2026, 16,90 USD/min
Z tej tabeli wynikają dwie rzeczy. Wan 2.7 jest lepszy z tych dwóch, i to z dużą przewagą — jako jedyny z nich został oceniony we wszystkich trzech rankingach, a jego wynik w edycji ma największą liczbę głosów spośród wszystkich wyników Wan 2.7 gdziekolwiek — dwadzieścia tysięcy próbek. A na jedynej osi, na której się spotykają, Vidu Q4 Preview wygrywa o 102 punkty Elo, co odpowiada mniej więcej pięciokrotności szerokości przedziału ufności każdego z modeli.
Różnica 102 punktów to nie byle jaki wynik. Dla porównania: cały rozrzut w pierwszej szóstce rankingu image-to-video wynosi 21 Elo. Vidu Q4 Preview nie wyprzedza Wan 2.7 w image-to-video tylko nieznacznie — to zupełnie inna klasa, a przy tym kosztuje o 1,80 USD za minutę mniej i jest nowszym wydaniem. Jeśli image-to-video to twoje główne obciążenie, wybór jest oczywisty, a niezależny ranking jest powodem, dla którego nie ma tu wątpliwości.

Gdzie Wan 2.7 jest jedynym z dwóch, który się pojawia
Własna dokumentacja Wan 2.7 wskazuje dwie dziedziny, które wciąż wymagają pracy: jakość dźwięku i dokładność tekstu na ekranie. To ocena dostawcy, a nie recenzenta, i warto ją uwzględnić w każdym porównaniu, ponieważ oba modele głoszą to samo sztandarowe twierdzenie — natywny dźwięk generowany wraz z obrazem, a nie doczepiany później.
Różnica tkwi w tym, co dzieje się domyślnie. Endpoint zamiany obrazu na wideo w Vidu Q4 Preview zawiera parametr audio, którego domyślna wartość to true: dźwięk masz domyślnie, chyba że go wyłączysz, a właśnie wyłączenie go daje klip bez dźwięku. Wan 2.7 nie dokumentuje tego samego przełącznika w tym samym miejscu. Jeśli cichy wynik ma znaczenie dla Twojego potoku — a ma, dla wszystkiego, co planujesz osobno udźwiękowić lub zdubbingować na inny język — ta asymetria zmienia to, jak wygląda Twój pierwszy etap integracji.
Na tablicy edycji siódme miejsce Wan 2.7 — 1 074 na 20 021 próbek — to najsilniejszy pojedynczy wynik, jaki którykolwiek z tych dwóch modeli osiąga na dowolnej tablicy pod względem liczby głosów. Dwadzieścia tysięcy głosów to pomiar, za którym stoi realna waga, a na tej tablicy nie pojawia się żaden model Vidu, który można by z nim porównać. Jeśli Twoja praca polega na zmianie tempa lub stylu istniejącego materiału, a nie na generowaniu nowych ujęć, Wan 2.7 jest jedynym z tych dwóch, który się nadaje.

Luka w specyfikacji po stronie generowania
Tam, gdzie się pokrywają, te dwie rzeczy różnią się pod niemal każdym względem, a różnice nie są symetryczne na korzyść Wana.
• Maksymalna rozdzielczość — Vidu Q4 Preview 4K (2K i 4K przy 10-bitowej głębi kolorów) vs Wan 2.7 do 1080p
Maksymalna długość klipu — Vidu Q4 Preview 16 s (Image-to-Video 3–16 s, Reference-to-Video 1–16 s) vs Wan 2.7 do 15 s
• Obrazy referencyjne — Vidu Q4 Preview do 15 w jednym ustawieniu vs Wan 2.7 do dziesięciu zasobów
• Audio referencyjne — Vidu Q4 Preview do 3 klipów dla spójności głosu w porównaniu z brakiem tak szczegółowych informacji opublikowanych przez Alibaba
• Zakres zadań — Vidu Q4 Preview dwa tryby (obraz do wideo, referencja do wideo) vs Wan 2.7 cztery warianty (dodające tekst do wideo i edycję wideo)
• Publikowana stawka cennikowa — Vidu Q4 Preview od 0,014 USD/s w promocji; zmierzone 7,20 USD/min na niezależnej tablicy wyników w porównaniu z Wan 2.7 0,10–0,15 USD/s w zależności od wariantu, zmierzone 9,00 USD/min
Kwestia rozdzielczości jest tą, którą należy rozważyć ze szczególną ostrożnością. Wyjście 4K w 10 bitach to realna różnica w gotowym materiale dla każdego, kto kończy pracę z myślą o ekranie lub dużym wyświetlaczu, a Wan 2.7 nie oferuje tej funkcji w żadnym wariancie. Ale 4K to także obszar, w którym cennik za sekundę zwykle przestaje wyglądać jak reklamowane minimum, a materiały premierowe samego Vidu zawierają zastrzeżenie, że ostateczne ceny, obsługiwane rozdzielczości, dostępność funkcji i warunki użytkowania różnią się w zależności od planu i regionu.

Który, według obciążenia?
Jeśli animujesz statyczne obrazy — zdjęcia produktowe, kadry referencyjne postaci, storyboardy — Vidu Q4 Preview jest lepszym modelem na podstawie jedynych dostępnych niezależnych dowodów, przy niższej zmierzonej stawce. To prosty przypadek.
Jeśli potrzebujesz jednego kontraktu obejmującego konwersję tekstu na wideo, obrazu na wideo i edycję, Wan 2.7 jest jedynym z dwóch, który odpowiada, i robi to z wynikiem edycji na siódmym miejscu opartym na największej liczbie głosów, jaką ma którykolwiek z modeli. Konsolidacja u jednego dostawcy to prawdziwa korzyść i to porównanie nie udaje, że jest inaczej.
Jeśli potrzebujesz obu, koszt utrzymywania dwóch dostawców to zwykle nie licencja — to druga integracja, drugi klucz, drugi zestaw semantyki ponawiania i drugi schemat, który trzeba utrzymywać w aktualnej wersji. OrcaRouter sprowadza to do jednego: jeden endpoint zgodny z OpenAI dla ponad 200 modeli, ceny katalogowe dostawców przekazywane bez doliczania marży oraz automatyczne przełączanie awaryjne między dostawcami. Jeśli chodzi konkretnie o wideo, udostępniamy MiniMax H3, czyli model obecnie zajmujący pierwsze i drugie miejsce na powyższej tablicy rankingowej image-to-video — dostępny przez ten sam endpoint i ten sam klucz co modele tekstowe. Ani Vidu Q4 Preview, ani Alibaba Wan 2.7 nie są dziś trasą w OrcaRouter i tej strony nie należy odczytywać jako sugerującej inaczej; możemy natomiast utrzymać resztę obciążenia na jednej integracji, dzięki czemu eksperyment z wideo jest pozycją w kosztorysie, a nie całym projektem.
Co by to zmieniło
Vidu Q4 Preview to wersja zapoznawcza. Ceny mają charakter promocyjny, a według samego dostawcy kompilacja wyprzedza pełne wydanie Q4; dokumentacja API wciąż zawiera błędnie zapisany alias modelu obok poprawnego. Liczą się dwa scenariusze: jeśli pełne wydanie Q4 doda text-to-video, osie się scalają i staje się to bezpośrednim porównaniem na trzech tablicach zamiast na jednej; jeśli nie, podział pozostaje taki, jaki jest, a wybór sprowadza się wyłącznie do kształtu obciążenia.
Z drugiej strony próbki Wan 2.7 na tablicy obraz-do-wideo są o pięć miesięcy starsze niż próbki Vidu, a jest ich około tysiąca mniej. Oba te przedziały ulegną zwężeniu. Żadnej z rang tych modeli nie należy uznawać za stałą poza datą wydrukowaną obok niej.
Wąska odpowiedź: dzielą dokładnie jedną oś konkurencji, Vidu Q4 Preview wyraźnie na niej prowadzi przy niższej mierzonej stawce, a Wan 2.7 domyślnie wygrywa wszędzie tam, gdzie Vidu nie konkuruje. Szeroka odpowiedź brzmi: dwutrybowy model podglądowy i zestaw czterech wariantów nie są tak naprawdę alternatywami dla siebie — są alternatywami dla różnych zadań, a użyteczna część tego porównania polega na wiedzy, jakie zadanie masz.
