Karta tytułowa dla Odyssey-3 vs Wan 3.0, pokazująca Odyssey-3 jako podgląd badawczy z 8 października 2026 r., bez publikowanej ceny ani API oraz ze zweryfikowaną przez Physics-IQ poprawą netto o +11,15 pp na pozycji 02, w zestawieniu z Wan 3.0, będącym API rozliczanym za zużycie, ogólnie dostępnym od 24 sierpnia 2026 r. po 0,6 juana za sekundę dla 720p.
Guides & Insights

Odyssey-3 kontra Wan 3.0: model świata spotyka fabrykę wideo

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Odyssey-3 and Wan 3.0 both get filed under "video model," and that shared label is carrying more weight than it can bear. Odyssey-3 is a learned dynamical system — a simulator that builds an environment from a prompt and predicts how that environment changes as someone moves through it or triggers an event — released by Odyssey on 8 October 2026 as a research preview. Wan 3.0 is a production video generator from A​libaba Cloud, generally available since its 24 August 2026 launch, billed by the second, and already scored on two independent leaderboards. One of these wants to be a place you put a camera. The other wants to be the thing that renders the footage you publish.

Put the two launch pages side by side and the split is immediate. Odyssey leads with physical accuracy — how well its model understands what objects do when they meet. A​libaba leads with throughput, duration and reference control: 30-second takes, native audio, up to ten images and five videos supplied per generation. Neither is a worse version of the other. They are answers to different questions, and the answers change what a team should do this week.

Jedna uwaga porządkująca przed liczbami. Większość danych liczbowych w tym artykule pochodzi z materiałów premierowych samych dostawców i nie została odtworzona przez nikogo spoza tych laboratoriów. Gdy liczba pochodzi z niezależnego gremium, a nie ze strony prasowej, tekst to zaznacza. To rozróżnienie ma tu większe znaczenie niż zwykle, ponieważ oba modele publikują skrajnie różne ilości weryfikowalnych informacji — jeden sprzedaje za sekundę przez otwarte API, drugi nie opublikował żadnej ceny.

Czym każdy z nich właściwie jest

Własny opis Odyssey-3 autorstwa Odyssey jest nietypowo konkretny jak na wpis o premierze i wart zacytowania, a nie upraszczania: to „wyuczony układ dynamiczny, zaimplementowany jako autoregresyjny transformator dyfuzyjny, który przewiduje, jak obiekty poruszają się i wchodzą w interakcje w przestrzeni oraz jak sytuacje rozwijają się w czasie”. To, co zwraca, nie jest klipem w zwykłym sensie. To stan, który wciąż ewoluuje, gdy jest sterowany. Model jest dostępny w dwóch rozmiarach — Odyssey-3 w 832×480 i Odyssey-3 Pro w 1280×720 — a Odyssey twierdzi, że jego wersja zapoznawcza obsługuje nawigację z perspektywy pierwszej i trzeciej osoby wraz z niezależnym ruchem kamery. Ta kompilacja zawiera również wariant destylowany o kilku krokach, powstały w wyniku połączenia dopasowywania rozkładu i destylacji adwersarialnej, który dostawca opisuje jako interaktywny w czasie rzeczywistym.

Wan 3.0 is a generator on the established model: a prompt and one or more references go in, a finished piece of video comes out. A​libaba's headline capabilities are a 30-second single-run generation, native audio, and reference inputs spanning text, image, video and audio — plus documents in doc, xls, ppt, pdf, md, txt, key, pages and numbers formats, up to 100 MB and 50 pages. Editing is instruction-based, meaning a generation can be modified in visuals, plot or dialogue without regenerating from scratch. A​libaba also states plainly that audio quality and on-screen text accuracy still need work, which is a rarer admission in a launch post than it should be and a useful one to have on the record.

• Czym jest wynik — symulowane środowisko, w którym działasz (Odyssey-3), kontra wyrenderowany klip, który publikujesz (Wan 3.0) • Reklamowane rozmiary — 832×480 lub 1280×720 na Odyssey-3 Pro, kontra 480p, 720p i 1080p • Czas trwania pojedynczego uruchomienia — tak długo, jak środowisko jest nadal napędzane, kontra 30 sekund na generację • Audio — nie jest główną możliwością w żadnym z tych rozmiarów, kontra natywne audio z ograniczeniami jakości oznaczonymi przez dostawcę • Dane wejściowe — prompt definiujący środowisko, kontra tekst, obraz, wideo, audio i dokumenty do 100 MB i 50 stron • Model edycji — zmiana stanu i ponowna symulacja, kontra edycje ukończonej generacji na podstawie instrukcji • Udokumentowane API — brak opublikowanego, kontra otwarte i rozliczane od 24 sierpnia 2026 • Opublikowana cena — brak, kontra 0,3 / 0,6 / 1,2 juana za sekundę przy 480p / 720p / 1080p

Ile kosztuje jedna sekunda wyniku i dlaczego jednostki się nie zgadzają

Wan 3.0 is priced in the most legible unit available to a buyer: time. A​libaba's rates are 0.3 yuan (about $0.05) per second of generated video at 480p, 0.6 yuan (about $0.10) at 720p, and 1.2 yuan (about $0.20) at 1080p. A full 30-second run therefore lands near 9 yuan ($1.50) at 480p, 18 yuan ($3.00) at 720p, or 36 yuan ($6.00) at 1080p. Those are the August launch rates; the launch promotion that cut them by 30% ran only through 23 September, so the numbers above are the ones a buyer meets today. Providers that resell Wan 3.0 typically quote per-minute figures instead, which is worth checking against the per-second arithmetic before any budget is signed off.

Odyssey-3 nie ma porównywalnej liczby, ponieważ Odyssey nie opublikował ceny, cennika stawek, licencji ani dokumentacji API. Zamiast tego istnieje wartość kosztowa w benchmarku firmy trzeciej, obliczona na podstawie założenia, które dostawca otwarcie podaje: 1 USD za godzinę GPU MI355X. Na tej podstawie Physics-IQ Verified podaje Odyssey-3 Pro na 0,267 USD za wygenerowane wideo, a Odyssey-3 na 0,139 USD, przy czym obie wartości są znormalizowane do 24 FPS i wyjścia o szerokości 1280. To samo zestawienie osobno odnotowuje, że przepisywanie promptów przez API Odyssey szacuje się na 0,01 USD za przesłane wideo. Przeczytaj to uważnie — to podstawa modelowania, a nie cena. Mówi, ile kosztowałaby symulacja przy założonej przez dostawcę stawce za sprzęt, a nie ile Odyssey wystawi na fakturze.

Te dwa fakty wskazują kupującemu przeciwne kierunki. Wan 3.0 to rozliczana pozycja, której kwotę można obliczyć, zanim cokolwiek zostanie wyrenderowane. Odyssey-2 ma modelowany koszt na wideo, ale nie ma faktury, do której można by go przypiąć — a to dokładnie ten etap, na którym zatrzymuje się rozmowa o zakupie. Aby porównanie było uczciwe, czytelnik musi utrzymać obie połowy: realną stawkę z realnym rachunkiem i szacunkową stawkę, za którą jeszcze nic nie stoi.

Two-column scoreboard comparing Odyssey-3 and Wan 3.0 across six dimensions: what you get, advertised sizes, single-run length, published price, documented API, and Physics-IQ Verified. Odyssey-3 returns a simulated environment, ships at 832x480 or 1280x720 on Odyssey-3 Pro, runs as long as it is driven, has no published price or documented API, and scores +11.15 pp at rank 02 on Physics-IQ Verified; Wan 3.0 returns a rendered clip, ships at 480p, 720p and 1080p, renders 30 seconds per run, costs 0.3 / 0.6 / 1.2 yuan a second, has been open and metered since 24 August 2026, and is not listed on that board.

Jedyna tablica wyników, którą dzielą, i nazwisko, którego na niej brakuje

Physics-IQ Verified, dynamiczny ranking od Anates Labs i DeepMind pokazujący, jak dobrze modele wideo radzą sobie z zasadami fizyki, to jedyny niezależny ranking wspólny dla tej pary — i to właśnie tutaj porównanie staje się naprawdę interesujące, ponieważ to także tutaj się załamuje.

Post premierowy Odyssey stwierdza, że Odyssey-3 Pro „wyznacza nowy stan sztuki w benchmarku Physics-IQ Verified i zajmuje 1. miejsce w 3 z 4 kategorii WorldMark”. Ta połowa dotycząca WorldMark zgadza się z liczbami publikowanymi przez Odyssey: pierwsze miejsce w First-Person Stylized (77.2), Third-Person Real (79.0) i Third-Person Stylized (76.3), przy czym First-Person Real jest drugie z wynikiem 80.6, za AlayaWorld z 83.0 i Lyra 2.0 z 84.4. Każda z tych wartości to figura raportowana przez dostawcę, pochodząca z własnego przebiegu ewaluacyjnego Odyssey.

Część dotycząca najnowocześniejszych rozwiązań to miejsce, w którym czytelnik powinien zwolnić. W obecnie dostępnej wersji tablicy Physics-IQ Verified, uszeregowanej według poprawy netto w punktach procentowych powyżej średniej dla toru, FLUX 3 [large] od Black Forest Labs zajmuje pozycję 01 z +12,27 pp. Odyssey-3 Pro zajmuje pozycję 02 z +11,15 pp, a Odyssey-3 pozycję 03 z +9,99 pp. Tak więc „nowy stan sztuki” dostawcy to — na tablicy, którą sam dostawca cytuje — drugie miejsce; albo dlatego, że twierdzenie powstało przed aktualizacją tablicy, albo dlatego, że obejmuje węższy zakres, niż sugeruje to zdanie. Tak czy inaczej, uczciwa interpretacja jest taka, że Odyssey-3 Pro to model fizyczny z czołowej trójki, a nie zdecydowany lider. FLUX 3 [large] ma także znacznie wyższy koszt na wideo: 0,868 USD wobec 0,267 USD w przypadku Odyssey-3 Pro, co jest kompromisem, który widok kosztów tablicy ma na celu ujawnić.

Odyssey rzeczywiście zajmuje jedno bezsprzeczne pierwsze miejsce w rozbiciu na podmetryki: Spatiotemporal, z wynikiem 44,70, przed Odyssey-3 Pro z 42,97 i Physis-Lang (Cosmos3 Super) z 41,57. W podmetryce Spatial plasuje się na czwartym miejscu (59,17), za FLUX 3 (64,36), Odyssey-3 Pro (61,78) i Physis-Lang (59,87); w Weighted Spatial i MSE plasuje się odpowiednio na czwartym i trzecim miejscu. Ten wzorzec — bezsprzeczne przewodzenie pod względem tego, jak dobrze ruch zachowuje spójność w czasie, druga liga pod względem wierności przestrzennej pojedynczej klatki — to spójna sygnatura modelu zbudowanego do symulowania ewolucji, a nie do renderowania pięknego nieruchomego obrazu.

Teraz brakująca nazwa. Wan 3.0 w ogóle nie pojawia się na Physics-IQ Verified. Jedyne wpisy Wan to Wan 2.2 14B na miejscu 17, −6,64 pp, oraz Wan 2.2 5B na miejscu 22, −11,13 pp — oba poniżej średniej ścieżki, oba open-source, oba o generację w tyle. Własna nota zakresu tablicy mówi, że ranking „obejmuje modele poddane benchmarkom oraz modele znane z preprintów lub ogłoszeń, nawet jeśli publiczny dostęp jest niedostępny lub data premiery nie jest potwierdzona”, więc nieobecność Wan 3.0 nie jest dowodem, że wypada źle. Jest dowodem, że nikt go nie zmierzył na tej osi. Praktyczna konsekwencja jest bezpośrednia: każde twierdzenie, że Odyssey-3 bije Wan 3.0 pod względem wiarygodności fizycznej, jest niezweryfikowane w obu kierunkach, a każde twierdzenie, że tak nie jest, jest równie niezweryfikowane. Niezależny dorobek Wan 3.0 znajduje się gdzie indziej — zajął #2 ogólnie na OpenArt Arena i #1 w Video Editing with Audio na Artificial Analysis — na tablicach, które mierzą postrzeganą jakość i jakość edycji, a nie fizykę.

Co możesz dziś nazwać, a o co możesz tylko zapytać

Wan 3.0 has been callable since 24 August 2026, when A​libaba Cloud's launch turned the metered, application-gated beta into a fully open API. The model is reachable through the vendor's own API and several third-party platforms, all of them metered, with the per-second rates above. If a team needs generated video this afternoon, that is a real option and it comes with a bill.

Odyssey-3 nie oferuje tego. Strona Odyssey mówi, że podgląd badawczy jest „dostępny już teraz”, i zaprasza twórców fizycznej AI do kontaktu — co opisuje demo i rozmowę, a nie punkt końcowy za kluczem. Nie ma podanej ceny, licencji, dokumentacji API ani — jak pokazuje powyższa sekcja — niezależnej oceny. Programista czytający wpis o premierze nie może dziś obliczyć, ile kosztowałoby wdrożenie produkcyjne na Odyssey-3 ani sprawdzić, czy twierdzenia fizyczne się utrzymują poza własnym środowiskiem testowym dostawcy. To normalne w przypadku modelu świata z dnia premiery i jednocześnie najważniejszy fakt w tym porównaniu.

Ponieważ żaden z tych modeli nie znajduje się w naszym katalogu — lista modeli OrcaRouter nie zawiera ani Odyssey-3, ani Wan 3.0 — użytecznym punktem routingu jest warstwa, która znajduje się ponad nimi. Prawdopodobnie pipeline wideo nie wywołuje jednego modelu. Wywołuje model przepisujący prompty, model wideo, czasem model audio, i wywołuje je wszystkie ponownie za każdym razem, gdy dostawca zmieni cenę lub limit szybkości. W OrcaRouter stoją one za jednym API obejmującym ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, więc obniżka ceny za sekundę od dostawcy wideo jest tu aktywna tego samego dnia, zamiast czekać na zmianę konfiguracji, a automatyczne przełączanie awaryjne oznacza, że awaria jednego modelu nie zatrzymuje kolejki renderowania. Modele wideo, które obsługujemy — MiniMax H3, Kling 3.0, Kling Video O1 i inne — są na tym samym kluczu, co sprawia, że podmiana jest tania, gdy w końcu pojawi się wersja zapoznawcza Wan 3.0 lub wersja próbna Odyssey-3.

Capture of Odyssey's own 'Meet Odyssey-3' launch page, dated October 8th 2026, describing Odyssey-3 as a learned dynamical system implemented as an autoregressive diffusion transformer and inviting physical-AI developers to get in touch about the research preview.

Który z nich należy do twojego stacka?

Wybór nie jest trudny, ponieważ to, co oba wytwarzają, w ogóle się nie pokrywa. Uczciwa zasada decyzyjna dotyczy artefaktu, którego potrzebujesz na końcu.

Wybierz Wan 3.0, jeśli produktem końcowym jest materiał wideo, który ktoś ogląda: reklama, wstawka ujęciowa, wersja na media społecznościowe, segment szkoleniowy. Trzydzieści sekund na jedno uruchomienie z natywnym dźwiękiem, kontrola referencji w zakresie obrazów, wideo i audio, edycja oparta na instrukcjach oraz dokumenty jako dane wejściowe to lista funkcji produkcyjnych, a API rozliczane za zużycie oznacza, że koszt testu jest znany z góry. To generowanie, nie symulacja — zadanie modelu kończy się wraz z klipem. Budżet planuj na podstawie stawek dostawcy za sekundę, a własne zastrzeżenia dostawcy dotyczące audio i tekstu na ekranie traktuj jako ograniczenia projektowe, a nie przypisy.

Wybierz Odyssey-3, gdy możesz go dostać, jeśli efektem końcowym ma być zachowanie, a nie plik: środowisko, w którym uczy się polityka, scena, której reakcja na działanie musi pozostać spójna przez długi rollout, zadanie nawigacji lub manipulacji, w którym kamera jest częścią problemu. To tam tak naprawdę liczą się bezwzględne pierwsze miejsce w wiarygodności czasoprzestrzennej i modelowany koszt 0,139–0,267 USD za wideo. Brakuje jednak wszystkiego, czego zespół produkcyjny potrzebuje, by podjąć decyzję — ceny, licencji, endpointu i niezależnego pomiaru — a żadnej z tych rzeczy nie zastąpi demo.

Rzecz, której trzeba wypatrywać, jest konkretna i bliska. Jeśli Wan 3.0 pojawi się w Physics-IQ Verified, pytanie o fizykę stanie się rozstrzygalne w jedną stronę. Jeśli Odyssey opublikuje cennik albo API, pytanie o koszt rozstrzygnie się w drugą stronę. Dopóki jedno z tego się nie zdarzy, to porównanie ma dziwny kształt: system produkcyjny z opublikowaną ceną i bez wyniku z fizyki obok symulatora z opublikowanymi wynikami z fizyki i bez ceny. Każdy, kto mówi ci dziś, który jest lepszy, zgaduje co do co najmniej jednej z tych dwóch liczb.

Capture of the Physics-IQ Verified leaderboard from Anates Labs and DeepMind, ranked by net improvement in percentage points above the track mean, showing FLUX 3 [large] first at +12.27 pp, Odyssey-3 Pro second at +11.15 pp and Odyssey-3 third at +9.99 pp, with Wan 2.2 14B at rank 17 and Wan 2.2 5B at rank 22 and no entry for Wan 3.0.