
Odyssey-3 vs Google Veo 3.1: Fizyka z pogranicza kontra dziesięć miesięcy produkcji
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Porównanie Odyssey-3 i Veo 3.1 to tak naprawdę porównanie dwóch dat. Veo 3.1 jest ogólnodostępny od 17 listopada 2025 r. — dziesięć miesięcy użytkowania produkcyjnego, opublikowany cennik za sekundę, natywne 4K i stos serwowania, który co najmniej raz przeszedł przegląd korporacyjny. Odyssey-3 został zaprezentowany w wersji zapoznawczej przez Odyssey 15 września 2026 r., nie ma opublikowanej ceny, dokumentacji API, niezależnego benchmarku, a jego okno wydania to „nadchodzące tygodnie”. Nadal warto stawiać je obok siebie, ponieważ powód, dla którego wymienia się je razem, jest realny: Veo 3.1 renderuje piękne wideo, a Odyssey-3 próbuje symulować świat, który zachowuje się poprawnie pod kontrolą. To dwa różne produkty, które zespoły wciąż mieszają pod słowem „wideo”, a różnica między nimi jest dokładnie miejscem, w którym mieści się decyzja zakupowa.
Co daje ci dziesięć miesięcy dostarczania
Przewaga Veo 3.1 to nie funkcja, lecz upływ czasu. Model trafił w ręce płacących klientów w październiku 2025 r. jako wersja preview, a 17 listopada jako produkt GA; 31 marca 2026 r. dodano pakiet Lite, a 2 kwietnia pakiet bezpłatny. Ta historia daje to, czego wersja preview dać nie może: udokumentowaną powierzchnię API, ustalony zestaw trybów awarii, które praktycy już zmapowali, oraz krzywą kosztów, którą zespół finansowy może modelować.
Karta specyfikacji odzwierciedla tę samą dojrzałość. Veo 3.1 generuje obraz w 720p, 1080p i natywnym 4K, przy 24 klatkach na sekundę, w natywnych czasach trwania 4, 6 lub 8 sekund, a dłuższe wyniki są podawane w 1080p, z łańcuchowym rozszerzaniem sceny poza tym. Przyjmuje do trzech obrazów referencyjnych na potrzeby spójności postaci i sceny, a także kontrolę seeda i promptu negatywnego. Dane wyjściowe zawierają metadane pochodzenia SynthID i C2PA. W przypadku pracy na potrzeby marki, transmisji lub dużego ekranu natywna ścieżka 4K jest jedyną możliwością, której większość konkurencji po prostu nie ma — i to dlatego Veo 3.1 wciąż wygrywa projekty, których nie wygrywa ceną.

Domyślne ustawienie dźwięku, które po cichu wypacza każde porównanie
Veo 3.1 generuje natywne audio stereo 48 kHz — dialogi, dźwięki otoczenia, foley — wspólnie z obrazem, co jest naprawdę jedną z jego najmocniejszych cech. W API parametr audio jest jednak domyślnie wyłączony, a generowanie bez dźwięku jest wyceniane niżej niż generowanie z dźwiękiem. W opublikowanej przez Google warstwie Standard przekłada się to na około 0,20 USD za sekundę bez dźwięku w porównaniu z około 0,40 USD za sekundę z dźwiękiem. Wynikają z tego dwie konsekwencje. Po pierwsze, efektywna cena klipu Veo zależy wyłącznie od flagi, której większość ludzi nigdy nie zmienia, więc wartości „0,20 USD na sekundę” i „0,40 USD na sekundę” mogą być jednocześnie poprawne dla tego samego modelu. Po drugie — i to bardziej subtelnie — oznacza to, że wiele testów bezpośredniego porównania, które czytałeś, wystawiało cichego Veo 3.1 przeciwko konkurentom, których dźwięk jest zawsze włączony, a następnie oceniało je w rankingu uwzględniającym dźwięk. Jeśli Twój materiał wyjściowy wymaga dźwięku, uczciwą liczbą, według której należy planować, jest ta z włączonym dźwiękiem.
Co tak naprawdę twierdzi Odyssey-3
Odyssey-3 nie jest lepszym generatorem wideo i nie twierdzi, że nim jest. To autoregresyjny transformer dyfuzyjny trenowany na wizualnej obserwacji świata, a zdolnością w centrum ogłoszenia jest dekoder akcji — „wyuczony komponent wyjściowy dołączony do modelu świata”, który przekształca wewnętrzną reprezentację sceny modelu w polecenia silnikowe dla konkretnego sprzętu. Odyssey podaje, że kontroluje nim ramiona robotów na podstawie dziesiątek godzin demonstracji, steruje w czasie rzeczywistym politykami humanoidalnymi zbudowanymi przy użyciu Flexion, generuje waypointy jazdy w pętli zamkniętej z zamrożonego backbone’u trenowanego na 20 godzinach danych symulowanych, lata dronami w pomieszczeniach wokół przeszkód oraz gra w Grand Theft Auto V z transferem do Red Dead Redemption 2 i Sleeping Dogs bez dodatkowego trenowania polityki w tych tytułach. Jedyną podaną liczbą porównawczą jest to, że polityki jazdy trenowane w symulacji pokonywały około 77% takiego dystansu między interwencjami kierowcy bezpieczeństwa, jak polityki trenowane na prawdziwych nagraniach.
Zauważ, jakiego rodzaju to są twierdzenia. Żadne z nich nie dotyczy tego, jak wygląda wynik. Każde z nich dotyczy tego, co program działający na dalszym etapie przetwarzania niż model może z nim zrobić.
Wymiary, które się nie nakładają
• Wyjście — Google Veo 3.1: wyrenderowany klip, do natywnego 4K, z opcjonalnym dźwiękiem stereo 48 kHz. Odyssey-3: symulowany stan świata oraz akcje motoryczne za pośrednictwem dekodera akcji.
• Konsument — Google Veo 3.1: przeglądarka lub edytor. Odyssey-3: kontroler robota, polityka jazdy albo pętla treningowa.
• Długość klipu — Google Veo 3.1: natywnie 4/6/8 s, dłużej przy 1080p, dalsze łańcuchy przedłużeń. Odyssey-3: ciągłe generowanie, brak koncepcji klipu.
• Cena — Google Veo 3.1: ~0,20 USD/s bez dźwięku, ~0,40 USD/s z dźwiękiem w wariancie Standard; warianty Fast i Lite poniżej tego. Odyssey-3: brak opublikowanych danych.
• Dostępność — Google Veo 3.1: GA od 2025-11-17. Odyssey-3: pokazany w podglądzie 2026-09-15, publicznie „w nadchodzących tygodniach”.
• Dowody — Google Veo 3.1: dziesięć miesięcy użytkowania produkcyjnego i niezależna pozycja w rankingu. Odyssey-3: prezentacje dostawcy, brak tabeli wyników, brak raportu technicznego.
Gdzie fizyczne twierdzenie faktycznie się sprawdza — a gdzie nie
Kuszące jest założenie, że model z lepszym odwzorowaniem fizyki tworzy lepsze wideo, ale nie to sprzedaje Odyssey. Problemem zespołu wideo prawie nigdy nie jest to, że świat w klipie jest fizycznie niespójny — chodzi o to, że ujęcie musi być w 4K, albo postać musi wyglądać tak samo w trzech różnych ustawieniach, albo do gotowego materiału trzeba dołączyć metadane pochodzenia, zanim dział prawny wyrazi zgodę. Veo 3.1 odpowiada na te pytania już dziś. Symulator dokładny pod względem fizyki odpowiada na inne pytanie: czy mogę tu wytrenować coś, co będzie działać tam. Jeśli niczego nie trenujesz, dokładność fizyczna Odyssey-3 to funkcja bez nabywcy w twoim procesie pracy.
Tam, gdzie te dwa naprawdę się zbiegają, jest prewizualizacja. Reżyser, który chce interaktywnie eksplorować przestrzeń — przeprowadzić kamerę przez plan filmowy, zmienić decyzję inscenizacyjną, zobaczyć jej skutek — chce dokładnie tego, co zapewnia model świata, a czego nie może dać wyrenderowany klip, ponieważ klip zostaje ustalony w momencie wygenerowania. To realny przypadek użycia, a także taki, w którym niepublikowany podgląd nie jest jeszcze opcją.
Uruchamianie tego na produkcji bez stawiania na jeden endpoint
Powód, dla którego zespoły produkcyjne dbają o architekturę wokół modelu, jest taki, że potok wideo rzadko sprowadza się do jednego wywołania. Model promptów tworzy wstępną listę ujęć, model obrazu generuje klatkę początkową, model wizyjny sprawdza wynik pod kątem zgodności z briefem, a model transkrypcji obsługuje lektora. Każdy z nich jest zależnością, która może zawieść o 2 w nocy, a każdy stanowi osobną integrację, jeśli kupujesz je osobno. Umieszczenie tej warstwy na jednym API obejmującym ponad 200 modeli w cenie katalogowej dostawcy z 0% narzutu redukuje liczbę integracji, a automatyczne przełączanie awaryjne oznacza, że awaria modelu promptów skutkuje przekierowaniem, a nie zablokowaniem kolejki renderowania. DSL routingu ma tu większe znaczenie niż w przepływie pracy z jednym modelem, ponieważ to właśnie łączenie kilku modeli w jedno wywołanie pozwala wieloetapowemu potokowi zawodzić w kontrolowany sposób etap po etapie, a nie jako całość. Dla jasności co do zakresu: OrcaRouter nie obsługuje Google Veo 3.1 ani Odyssey-3 i żaden z tych modeli nie jest przez niego dostępny.

Kto powinien działać teraz, a kto powinien poczekać?
Jeśli twój termin przypada w tym kwartale, a twoim rezultatem jest plik, Google Veo 3.1 to wybór, który da się obronić, a cena — około 0,40 USD za sekundę przy 1080p z dźwiękiem, mniej w poziomach Fast i Lite — to koszt modelu, który jest w produkcji na tyle długo, że stał się nudny. Uwzględnij w budżecie flagę audio świadomie, zamiast odkrywać ją później.
Jeśli twoim problemem jest polityka, która musi działać na sprzęcie, Odyssey-3 jest skierowany do ciebie i wciąż nie ma nic do kupienia. Poczekaj na trzy rzeczy: opublikowaną cenę, datę premiery, która jest datą, a nie oknem czasowym, oraz jedną niezależną liczbę. Wskaźnik 77% sim-to-real jest własnym wynikiem Odyssey i dopóki ktoś spoza firmy go nie powtórzy, właściwą postawą jest zainteresowanie, a nie planowanie. W międzyczasie otaczający stos technologiczny to część, którą możesz zbudować, a zbudowanie go tak, aby można było później wstawić nowy model, to najtańsza pozycja do utrzymania.

