
Odyssey-3: Nowy model świata Odyssey zdobywa koronę Physics-IQ i otwiera publiczny podgląd
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Odyssey-3 Pro uzyskał wynik 66,1 w ścieżce wideo-do-wideo Physics-IQ Verified, a Odyssey opublikowała tę liczbę 8 października 2026 r. obok rzeczy, która faktycznie ma znaczenie dla dewelopera: publicznego podglądu badawczego Odyssey-3, autoregresyjnego transformatora dyfuzyjnego zbudowanego do generowania środowiska na podstawie promptu, a następnie do nieustannego przewidywania go w czasie rzeczywistym, gdy ktoś po nim chodzi, porusza kamerę lub wyzwala zdarzenie. Odyssey-3 to model; Odyssey-3 Pro to jego wariant 720p, działający w rozdzielczości 1280×720 w porównaniu z 832×480 w modelu podstawowym. Oba zostają udostępnione tego samego dnia, w podglądzie, którym możesz sam pokierować pod adresem experience.odyssey.systems, z osobną ścieżką kontaktu w sprawie dostępu API.
To zestawienie sprawia, że to coś więcej niż wpis o benchmarku. Interaktywne modele świata od dwóch lat mają status demówek; te, które generują kilka klatek wiarygodnego ruchu na ustalonej trajektorii, nie są tym samym artefaktem co model, który utrzymuje spójność swoich przewidywań po tym, jak szturchniesz kontrolki. Odyssey twierdzi to drugie i pozwala każdemu przetestować to twierdzenie.
Co zostało wydane, dokładnie
Dwa punkty kontrolne, jedna architektura, brak wag.
• Odyssey-3, wariant 480p, rozdzielczość wyjściowa 832×480, 16 fps w środowisku testowym benchmarku, w kolumnie znormalizowanego kosztu rankingu podano $0.139 za wygenerowane wideo.
• Odyssey-3 Pro — poziom 720p, 1280×720, wyceniony na 0,267 USD za wideo na tej samej podstawie.
• Dostęp — podgląd badawczy w przeglądarce z nawigacją pierwszoosobową, nawigacją trzecioosobową i niezależnym ruchem kamery. Dostęp do API to formularz kontaktowy, a nie klucz samoobsługowy.
• Otwartość — brak. Nie opublikowano wag, licencji ani ceny za token. Strona warunków API w tej samej witrynie została ostatnio zaktualizowana 2026-01-22 i nadal reguluje „prototyp Odyssey-2 API”, co pokazuje, jak nowa jest warstwa komercyjna.
Architektura jest opisana we własnym materiale Odyssey jako wieloetapowy transformer dyfuzyjny do wideo, rozszerzony autoregresyjnie poprzez teacher forcing i maskowanie przyczynowe, z potreningowym pipeline'em, który łączy dopasowanie rozkładu i destylację adwersarialną w kilkustopniowy wariant destylowany — część, która w ogóle umożliwia interakcję w czasie rzeczywistym. Dyfuzja daje wierność; autoregresja daje model, który przetrwa sekwencję akcji; destylacja daje szybkość zegara. Wszystkie trzy są elementami nośnymi, a wszystkie trzy są relacją dostawcy o jego własnym systemie, a nie niezależną.
Benchmark odczytywany tak, jak faktycznie odczytuje go zarząd
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
Physics-IQ Verified jest prowadzony przez Anates Labs we współpracy z DeepMind i jest to wyjątkowo niewygodny do manipulowania benchmark: pokazuje modelom wideo z rzeczywistych eksperymentów fizycznych — dynamika płynów, optyka, mechanika ciała stałego, magnetyzm, termodynamika — i ocenia kontynuację względem tego, co faktycznie się wydarzyło. Obecnie klasyfikuje 41 modeli z 16 laboratoriów. Wynik 66,1 Odyssey-3 Pro to najwyższy surowy wynik na ścieżce wideo-do-wideo, którą raportuje Odyssey, a kolumna poprawy netto na tej samej tablicy, która mierzy zysk względem średniej ścieżki w punktach procentowych, opowiada nieco inną historię:
• Poprawa netto względem średniej dla ścieżki — FLUX 3 [large] prowadzi z wynikiem +12,27 p.p.; Odyssey-3 Pro jest drugi z +11,15 p.p.; Odyssey-3 jest trzeci z +9,99 p.p.
• Koszt na wygenerowane wideo — Odyssey-3 Pro 0,267 USD, Odyssey-3 0,139 USD, w porównaniu z FLUX 3 [large] przy 0,868 USD i Seedance 2.5 przy 2,838 USD. (Koszty są znormalizowane do 24 fps i wyjścia o szerokości 1280, gdzie tabela wyników na to pozwala, dzięki czemu są porównywalne między modelami, które nie mają tej samej liczby klatek na sekundę.)
• Przywództwo w podmetrykach — Odyssey-3 zajmuje pierwsze miejsce w podmetryce czasoprzestrzennej z wynikiem 44,70, wyprzedzając Odyssey-3 Pro z wynikiem 42,97; FLUX 3 [large] prowadzi w podmetryce przestrzennej z wynikiem 64,36 i w ważonej podmetryce przestrzennej z 53,25, a dwa wpisy Odyssey zajmują drugie i czwarte miejsce w podmetryce przestrzennej.
Uczciwa interpretacja nie brzmi więc: „Odyssey-3 to najlepszy model wideo na świecie”. Brzmi ona: model świata zbudowany do interakcji znalazł się blisko szczytu rankingu wiarygodności fizycznej, który wcześniej był domeną generatorów filmowych, i dokonał tego przy mniej więcej jednej trzeciej znormalizowanego kosztu FLUX 3. Odrębna deklaracja Odyssey — 54,7 dla Odyssey-3 Pro w torze obraz-do-wideo, best-of-8 — znajduje się w tym samym rankingu i obowiązuje tu to samo zastrzeżenie: to samodzielnie zgłoszone konfiguracje, a ranking miesza wpisy zgłoszone z niestandardowymi promptami oraz wpisy uruchomione na własnych promptach benchmarku. Odyssey pojawia się w obu kolumnach, co jest nietypowo przejrzyste i oznacza też, że dwa wiersze Odyssey nie mierzą tego samego.

Dlaczego „model świata" nie jest synonimem „modelu wideo"
Ta różnica stanowi cały argument za produktem, więc warto ją wyrazić wprost. Generator klipów pobiera prompt i zwraca stały obiekt; wynik jest taki sam dla każdego, kto o niego poprosi. Odyssey-3 pobiera prompt i zwraca system, w którym działasz — tryby kamery pierwszoosobowej i trzecioosobowej w podglądzie oraz jego zdolność do przyjmowania zdarzenia w trakcie generowania są mechanizmem, dzięki któremu przewiduje, co wydarzy się dalej na podstawie tego, co właśnie zrobiłeś, a nie tego, co mówił prompt.
To właśnie ta właściwość sprawia, że wyniki dotyczące systemów fizycznych w materiałach premierowych Odyssey wyglądają tak, jak wyglądają. Firma raportuje, że dekoder akcji dołączony do zamrożonego modelu świata, wytrenowany na dziesiątkach godzin demonstracji z robotami, generował zachowania naprawcze, których nigdy nie było w demonstracjach — zmieniał orientację chwytaka po nieudanym chwycie, podnosił przedmiot upuszczony w nietypowej orientacji. Raportuje, że polityka humanoida zbudowana przez Flexion na bazie Odyssey-3 z dziesiątkami godzin danych z teleoperacji nadal wykonywała zadania przy zmianach oświetlenia, które łamały bazowe modele VLA, z którymi ją porównywano. Raportuje, że polityka jazdy wytrenowana na 20 godzinach danych symulowanych jeździła w zamkniętej pętli po rzeczywistych drogach, przejeżdżając między interwencjami kierowcy bezpieczeństwa około 77% dystansu, jaki przejeżdżała polityka wytrenowana na prawdziwych nagraniach. Raportuje nawigację dronem na podstawie symulowanych danych lotu oraz rozgrywkę w GTA V, która bez dalszego treningu przeniosła poruszanie się do Red Dead Redemption 2, a jazdę na motocyklu do Sleeping Dogs.
Każdy z tych wyników został zgłoszony przez dostawcę i nie ma niezależnej replikacji, a dwa z nich Odyssey wyraźnie przedstawia jako obserwacje jakościowe, a nie pomiary. Ale to właściwy rodzaj dowodów na tę tezę: interesujące nie jest to, że model potrafi wykonać zadanie, do którego został wytrenowany. Chodzi o to, że zamrożony backbone plus mały adapter uzyskuje znaczące zachowanie z kilkudziesięciu godzin danych i czasami generalizuje poza ten zakres.
Co jest wciąż nieudowodnione?

Trzy rzeczy, i nie są małe.
Po pierwsze, żaden niezależny ewaluator nie przeprowadził testów Odyssey-3. Wpis dotyczący Physics-IQ to zgłoszenie, a drugie źródło punktacji w opracowaniu samego Odyssey — WorldMark, w którym Odyssey-3 zajmuje pierwsze miejsce w trzech z czterech podziałów — to ocena dostawcy wykorzystująca własne podpisy benchmarku i, jak to ujmuje Odyssey, „średnią z jego 13 raportowanych wyników metryk”. To firma oceniająca samą siebie na cudzym zbiorze danych. To więcej, niż oferuje większość premier. To nie jest strona trzecia.
Po drugie, jedyny podział, w którym Odyssey-3 nie wygrywa w tej ewaluacji, to ten, który jest najbliższy twierdzeniu marketingowemu. W rzeczywistych środowiskach pierwszoosobowych plasuje się na trzecim miejscu z wynikiem 80,6, za Lyra 2.0 z 84,4 i AlayaWorld z 83,0. Przewaga modelu w tej samej ewaluacji koncentruje się w środowiskach stylizowanych i trzecioosobowych — 77,2 w pierwszoosobowych stylizowanych, 79,0 w rzeczywistych trzecioosobowych, 76,3 w trzecioosobowych stylizowanych. Jeśli tworzysz rozwiązania do fotorealistycznego ucieleśnienia w pierwszej osobie, rankingiem, który powinien cię interesować, jest ten, w którym Odyssey-3 nie jest na szczycie.
Po trzecie, dostępność. „Research preview” naprawdę robi tu robotę. Nie ma strony z cennikiem, dokumentacji limitów zapytań ani klucza samoobsługowego. Jeśli chcesz to mieć w produkcie, trafiasz do kolejki.
Porównywanie go bez drugiej umowy
Oto praktyczny problem z premierą taką jak ta: Odyssey-3 jest najciekawszą rzeczą w generowaniu wideo w tym tygodniu, a mimo to nadal nie można jej wywołać. Modele, z którymi faktycznie porównałbyś ją w benchmarkach, to zupełnie inna historia.
OrcaRouter nie hostuje Odyssey-3, a nawet gdyby to robił, nie ma opublikowanej ceny, którą można by przekazać. To, do czego jeden klucz daje dostęp, to reszta zestawu porównawczego — minimax/minimax-h3 w cenie 0,08 USD za sekundę generowanego wideo przy 768P, linia wideo Kling i ponad 200 modeli za jednym punktem końcowym — w cenie katalogowej dostawcy z 0% marży, więc zmiana ceny u dostawcy pojawia się na fakturze tego samego dnia, a nie dopiero przy kolejnym odnowieniu. Automatyczne przełączanie awaryjne między dostawcami sprawia, że przebieg ewaluacji nie ginie tylko dlatego, że jednemu z dostawców przytrafił się słabszy dzień, a DSL routingu pozwala umieścić kilka modeli za jednym interfejsem, dzięki czemu bezpośrednie porównanie to zmiana konfiguracji, a nie druga integracja. Jeśli Odyssey udostępni samoobsługowe API, to właśnie w taki kształt chcesz je wpiąć.
Co by to rozstrzygnęło
Niezależny przebieg Odyssey-3 na stanowisku testowym, którego nie wybrał. Kilkunastu praktyków z dostępem przedpremierowym opisujących, gdzie środowisko się trzyma po minucie agresywnego operowania kamerą, a gdzie nie. Cena. Każda z tych rzeczy sprawia, że to, co było mocnym startem, staje się punktem odniesienia.
To, co już jest prawdą, jest węższe i wciąż godne uwagi: w jednym publicznym rankingu, który mierzy, czy model generatywny rozumie fizykę, a nie czy dobrze wypada na zdjęciach, model, którego celem jest interakcja, zajmuje drugie i trzecie miejsce, przy znormalizowanym koszcie niższym niż model z pierwszego miejsca.
