Plansza tytułowa dla Odyssey-3, z podtytułem „Interaktywny model świata Odyssey, publiczny podgląd badań otwarty 8 października 2026”, dwa panele statystyk: Odyssey-3 w 832x480 i 66,1 w ścieżce wideo-do-wideo, znormalizowany koszt 0,267 USD za film. A Odyssey-3 Pro w 1280x720 w warstwie Pro, Physics-IQ +11,15 p.p. pozycja 02 i 66,1 w ścieżce wideo-do-wideo, znormalizowany koszt 0,267 USD za film.
Guides & Insights

Odyssey-3: Nowy model świata Odyssey zdobywa koronę Physics-IQ i otwiera publiczny podgląd

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Odyssey-3 Pro uzyskał wynik 66,1 w ścieżce wideo-do-wideo Physics-IQ Verified, a Odyssey opublikowała tę liczbę 8 października 2026 r. obok rzeczy, która faktycznie ma znaczenie dla dewelopera: publicznego podglądu badawczego Odyssey-3, autoregresyjnego transformatora dyfuzyjnego zbudowanego do generowania środowiska na podstawie promptu, a następnie do nieustannego przewidywania go w czasie rzeczywistym, gdy ktoś po nim chodzi, porusza kamerę lub wyzwala zdarzenie. Odyssey-3 to model; Odyssey-3 Pro to jego wariant 720p, działający w rozdzielczości 1280×720 w porównaniu z 832×480 w modelu podstawowym. Oba zostają udostępnione tego samego dnia, w podglądzie, którym możesz sam pokierować pod adresem experience.odyssey.systems, z osobną ścieżką kontaktu w sprawie dostępu API.

To zestawienie sprawia, że to coś więcej niż wpis o benchmarku. Interaktywne modele świata od dwóch lat mają status demówek; te, które generują kilka klatek wiarygodnego ruchu na ustalonej trajektorii, nie są tym samym artefaktem co model, który utrzymuje spójność swoich przewidywań po tym, jak szturchniesz kontrolki. Odyssey twierdzi to drugie i pozwala każdemu przetestować to twierdzenie.

Co zostało wydane, dokładnie

Dwa punkty kontrolne, jedna architektura, brak wag.

• Odyssey-3, wariant 480p, rozdzielczość wyjściowa 832×480, 16 fps w środowisku testowym benchmarku, w kolumnie znormalizowanego kosztu rankingu podano $0.139 za wygenerowane wideo.

• Odyssey-3 Pro — poziom 720p, 1280×720, wyceniony na 0,267 USD za wideo na tej samej podstawie.

• Dostęp — podgląd badawczy w przeglądarce z nawigacją pierwszoosobową, nawigacją trzecioosobową i niezależnym ruchem kamery. Dostęp do API to formularz kontaktowy, a nie klucz samoobsługowy.

• Otwartość — brak. Nie opublikowano wag, licencji ani ceny za token. Strona warunków API w tej samej witrynie została ostatnio zaktualizowana 2026-01-22 i nadal reguluje „prototyp Odyssey-2 API”, co pokazuje, jak nowa jest warstwa komercyjna.

Architektura jest opisana we własnym materiale Odyssey jako wieloetapowy transformer dyfuzyjny do wideo, rozszerzony autoregresyjnie poprzez teacher forcing i maskowanie przyczynowe, z potreningowym pipeline'em, który łączy dopasowanie rozkładu i destylację adwersarialną w kilkustopniowy wariant destylowany — część, która w ogóle umożliwia interakcję w czasie rzeczywistym. Dyfuzja daje wierność; autoregresja daje model, który przetrwa sekwencję akcji; destylacja daje szybkość zegara. Wszystkie trzy są elementami nośnymi, a wszystkie trzy są relacją dostawcy o jego własnym systemie, a nie niezależną.

Benchmark odczytywany tak, jak faktycznie odczytuje go zarząd

The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.

Physics-IQ Verified jest prowadzony przez Anates Labs we współpracy z DeepMind i jest to wyjątkowo niewygodny do manipulowania benchmark: pokazuje modelom wideo z rzeczywistych eksperymentów fizycznych — dynamika płynów, optyka, mechanika ciała stałego, magnetyzm, termodynamika — i ocenia kontynuację względem tego, co faktycznie się wydarzyło. Obecnie klasyfikuje 41 modeli z 16 laboratoriów. Wynik 66,1 Odyssey-3 Pro to najwyższy surowy wynik na ścieżce wideo-do-wideo, którą raportuje Odyssey, a kolumna poprawy netto na tej samej tablicy, która mierzy zysk względem średniej ścieżki w punktach procentowych, opowiada nieco inną historię:

• Poprawa netto względem średniej dla ścieżki — FLUX 3 [large] prowadzi z wynikiem +12,27 p.p.; Odyssey-3 Pro jest drugi z +11,15 p.p.; Odyssey-3 jest trzeci z +9,99 p.p.

• Koszt na wygenerowane wideo — Odyssey-3 Pro 0,267 USD, Odyssey-3 0,139 USD, w porównaniu z FLUX 3 [large] przy 0,868 USD i Seedance 2.5 przy 2,838 USD. (Koszty są znormalizowane do 24 fps i wyjścia o szerokości 1280, gdzie tabela wyników na to pozwala, dzięki czemu są porównywalne między modelami, które nie mają tej samej liczby klatek na sekundę.)

• Przywództwo w podmetrykach — Odyssey-3 zajmuje pierwsze miejsce w podmetryce czasoprzestrzennej z wynikiem 44,70, wyprzedzając Odyssey-3 Pro z wynikiem 42,97; FLUX 3 [large] prowadzi w podmetryce przestrzennej z wynikiem 64,36 i w ważonej podmetryce przestrzennej z 53,25, a dwa wpisy Odyssey zajmują drugie i czwarte miejsce w podmetryce przestrzennej.

Uczciwa interpretacja nie brzmi więc: „Odyssey-3 to najlepszy model wideo na świecie”. Brzmi ona: model świata zbudowany do interakcji znalazł się blisko szczytu rankingu wiarygodności fizycznej, który wcześniej był domeną generatorów filmowych, i dokonał tego przy mniej więcej jednej trzeciej znormalizowanego kosztu FLUX 3. Odrębna deklaracja Odyssey — 54,7 dla Odyssey-3 Pro w torze obraz-do-wideo, best-of-8 — znajduje się w tym samym rankingu i obowiązuje tu to samo zastrzeżenie: to samodzielnie zgłoszone konfiguracje, a ranking miesza wpisy zgłoszone z niestandardowymi promptami oraz wpisy uruchomione na własnych promptach benchmarku. Odyssey pojawia się w obu kolumnach, co jest nietypowo przejrzyste i oznacza też, że dwa wiersze Odyssey nie mierzą tego samego.

Single-column scoreboard headed “Odyssey-3 — the scoreboard” with six rows: Access — browser preview plus contact form; Sizes — 832x480, 1280x720 Pro; Independent scoring — none yet; Physics-IQ, custom prompts — +9.99 pp base, +11.15 pp Pro; Physics-IQ, board prompts — +2.15 pp, rank 08; Published price — none. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Physics-IQ Verified board read Oct 9 2026”.

Dlaczego „model świata" nie jest synonimem „modelu wideo"

Ta różnica stanowi cały argument za produktem, więc warto ją wyrazić wprost. Generator klipów pobiera prompt i zwraca stały obiekt; wynik jest taki sam dla każdego, kto o niego poprosi. Odyssey-3 pobiera prompt i zwraca system, w którym działasz — tryby kamery pierwszoosobowej i trzecioosobowej w podglądzie oraz jego zdolność do przyjmowania zdarzenia w trakcie generowania są mechanizmem, dzięki któremu przewiduje, co wydarzy się dalej na podstawie tego, co właśnie zrobiłeś, a nie tego, co mówił prompt.

To właśnie ta właściwość sprawia, że wyniki dotyczące systemów fizycznych w materiałach premierowych Odyssey wyglądają tak, jak wyglądają. Firma raportuje, że dekoder akcji dołączony do zamrożonego modelu świata, wytrenowany na dziesiątkach godzin demonstracji z robotami, generował zachowania naprawcze, których nigdy nie było w demonstracjach — zmieniał orientację chwytaka po nieudanym chwycie, podnosił przedmiot upuszczony w nietypowej orientacji. Raportuje, że polityka humanoida zbudowana przez Flexion na bazie Odyssey-3 z dziesiątkami godzin danych z teleoperacji nadal wykonywała zadania przy zmianach oświetlenia, które łamały bazowe modele VLA, z którymi ją porównywano. Raportuje, że polityka jazdy wytrenowana na 20 godzinach danych symulowanych jeździła w zamkniętej pętli po rzeczywistych drogach, przejeżdżając między interwencjami kierowcy bezpieczeństwa około 77% dystansu, jaki przejeżdżała polityka wytrenowana na prawdziwych nagraniach. Raportuje nawigację dronem na podstawie symulowanych danych lotu oraz rozgrywkę w GTA V, która bez dalszego treningu przeniosła poruszanie się do Red Dead Redemption 2, a jazdę na motocyklu do Sleeping Dogs.

Każdy z tych wyników został zgłoszony przez dostawcę i nie ma niezależnej replikacji, a dwa z nich Odyssey wyraźnie przedstawia jako obserwacje jakościowe, a nie pomiary. Ale to właściwy rodzaj dowodów na tę tezę: interesujące nie jest to, że model potrafi wykonać zadanie, do którego został wytrenowany. Chodzi o to, że zamrożony backbone plus mały adapter uzyskuje znaczące zachowanie z kilkudziesięciu godzin danych i czasami generalizuje poza ten zakres.

Co jest wciąż nieudowodnione?

Odyssey's own launch post, “Meet Odyssey-3: Our Most Powerful Foundation World Model”, dated October 8 2026 and credited to Oliver Cameron and other authors, with the Odyssey site navigation (About, News, Careers, Contact) and the opening line “Today we're launching Odyssey-3, our most powerful foundation world model yet.”

Trzy rzeczy, i nie są małe.

Po pierwsze, żaden niezależny ewaluator nie przeprowadził testów Odyssey-3. Wpis dotyczący Physics-IQ to zgłoszenie, a drugie źródło punktacji w opracowaniu samego Odyssey — WorldMark, w którym Odyssey-3 zajmuje pierwsze miejsce w trzech z czterech podziałów — to ocena dostawcy wykorzystująca własne podpisy benchmarku i, jak to ujmuje Odyssey, „średnią z jego 13 raportowanych wyników metryk”. To firma oceniająca samą siebie na cudzym zbiorze danych. To więcej, niż oferuje większość premier. To nie jest strona trzecia.

Po drugie, jedyny podział, w którym Odyssey-3 nie wygrywa w tej ewaluacji, to ten, który jest najbliższy twierdzeniu marketingowemu. W rzeczywistych środowiskach pierwszoosobowych plasuje się na trzecim miejscu z wynikiem 80,6, za Lyra 2.0 z 84,4 i AlayaWorld z 83,0. Przewaga modelu w tej samej ewaluacji koncentruje się w środowiskach stylizowanych i trzecioosobowych — 77,2 w pierwszoosobowych stylizowanych, 79,0 w rzeczywistych trzecioosobowych, 76,3 w trzecioosobowych stylizowanych. Jeśli tworzysz rozwiązania do fotorealistycznego ucieleśnienia w pierwszej osobie, rankingiem, który powinien cię interesować, jest ten, w którym Odyssey-3 nie jest na szczycie.

Po trzecie, dostępność. „Research preview” naprawdę robi tu robotę. Nie ma strony z cennikiem, dokumentacji limitów zapytań ani klucza samoobsługowego. Jeśli chcesz to mieć w produkcie, trafiasz do kolejki.

Porównywanie go bez drugiej umowy

Oto praktyczny problem z premierą taką jak ta: Odyssey-3 jest najciekawszą rzeczą w generowaniu wideo w tym tygodniu, a mimo to nadal nie można jej wywołać. Modele, z którymi faktycznie porównałbyś ją w benchmarkach, to zupełnie inna historia.

OrcaRouter nie hostuje Odyssey-3, a nawet gdyby to robił, nie ma opublikowanej ceny, którą można by przekazać. To, do czego jeden klucz daje dostęp, to reszta zestawu porównawczego — minimax/minimax-h3 w cenie 0,08 USD za sekundę generowanego wideo przy 768P, linia wideo K​ling i ponad 200 modeli za jednym punktem końcowym — w cenie katalogowej dostawcy z 0% marży, więc zmiana ceny u dostawcy pojawia się na fakturze tego samego dnia, a nie dopiero przy kolejnym odnowieniu. Automatyczne przełączanie awaryjne między dostawcami sprawia, że przebieg ewaluacji nie ginie tylko dlatego, że jednemu z dostawców przytrafił się słabszy dzień, a DSL routingu pozwala umieścić kilka modeli za jednym interfejsem, dzięki czemu bezpośrednie porównanie to zmiana konfiguracji, a nie druga integracja. Jeśli Odyssey udostępni samoobsługowe API, to właśnie w taki kształt chcesz je wpiąć.

Co by to rozstrzygnęło

Niezależny przebieg Odyssey-3 na stanowisku testowym, którego nie wybrał. Kilkunastu praktyków z dostępem przedpremierowym opisujących, gdzie środowisko się trzyma po minucie agresywnego operowania kamerą, a gdzie nie. Cena. Każda z tych rzeczy sprawia, że to, co było mocnym startem, staje się punktem odniesienia.

To, co już jest prawdą, jest węższe i wciąż godne uwagi: w jednym publicznym rankingu, który mierzy, czy model generatywny rozumie fizykę, a nie czy dobrze wypada na zdjęciach, model, którego celem jest interakcja, zajmuje drugie i trzecie miejsce, przy znormalizowanym koszcie niższym niż model z pierwszego miejsca.