Plansza tytułowa do artykułu porównującego Odyssey-3 i Seedance 2.5, z podtytułem „Sekundy materiału wideo kontra godziny symulacji”, oraz trzema chipami statystyk o treści „30 s generowania w jednym przebiegu”, „~1,16 USD za 5-sekundowy klip w 720p” i „Odyssey-3: brak jednostki sprzedaży”.
Guides & Insights

Odyssey-3 kontra Seedance 2.5: Sekundy materiału filmowego kontra godziny symulacji

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zapytaj, ile kosztuje Seedance 2.5, a otrzymasz odpowiedź w dolarach za sekundę. Zapytaj, ile kosztuje Odyssey-3, a nie otrzymasz niczego w ogóle — żadnego cennika, żadnego endpointu, żadnej licencji, bo ogłoszony 15 września 2026 roku model nie został jeszcze wydany, a jego twórca obiecał go publicznie jedynie „w nadchodzących tygodniach". Ta luka wygląda jak różnica w dojrzałości, a w większości jest różnicą kategorii. Wydany 31 lipca 2026 roku przez zespół Seed firmy ByteDance Seedance 2.5 to silnik produkcyjny sprzedawany za sekundę gotowego materiału ludziom, którzy tego materiału potrzebują. Odyssey-3 to model świata z interfejsem akcji, a odbiorca, do którego jest kierowany, nie chce wcale materiału — chce środowiska, które reaguje prawidłowo, gdy coś działa w jego wnętrzu. Oba rozwiązania są kierowane na część tych samych problemów, w tym na dane dla robotów i dla jazdy autonomicznej, i właśnie dlatego warto starannie nakreślić tę różnicę.

Seedance 2.5 to silnik produkcyjny, a pokazują to partnerzy premiery.

Główną możliwością jest czas trwania. Seedance 2.5 generuje trzydzieści sekund w jednym przebiegu, dwukrotnie więcej niż piętnaście jego poprzednika, z wieloetapowym rozszerzaniem dla dłuższych sekwencji oraz, jak podano, trybem beta ultra-długim, sięgającym jeszcze dalej. To samo w sobie zmienia przeznaczenie modelu: trzydzieści sekund to scena, a nie ujęcie, a marketing ByteDance opiera się na określeniu "jedno ujęcie" właśnie z tego powodu.

Wokół czasu trwania skupiają się funkcje, które sprawiają, że generacja jest użyteczna w prawdziwym montażu. Model obsługuje intensywne odwołania multimodalne — doniesienia mówią o nawet trzydziestu obrazach, dziesięciu klipach wideo i dziesięciu klipach audio na generację, przy czym referencyjne wideo i audio są ograniczone do około trzydziestu sekund każde, a referencje wyłącznie audio są nowością w tej wersji. Dostępne są nowe tryby referencji dla renderów white-model lub clay, ujęć na green screenie, referencji ruchu i kreatywnych. Kontrola odbywa się na poziomie znaczników czasu, pozwalając promptowi celować w narrację, kamerę lub ruch w określonym zakresie czasowym, a edycja na poziomie regionów po wygenerowaniu zachowuje ciągłość, zamiast wymuszać ponowne losowanie. Audio i wideo są generowane łącznie w jednym przebiegu, więc synchronizacja ust podąża za cytowanym dialogiem, a natywnie obsługiwanych jest ponad dziesięć języków.

Lista wdrożeń jest tu wymowna. W dniu premiery XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei i Qiongche Intelligence potwierdziły partnerstwa, a podane przypadki użycia obejmują wszystko od danych treningowych dla embodied AI i przypadków brzegowych jazdy autonomicznej po przemysłowe filmy szkoleniowe SOP, edukację i reklamę e-commerce. Część z tego to praca twórcza. Część to generowanie danych dla systemów, które później będą działać w świecie — i właśnie ta część pokrywa się z Odyssey-3.

Ile kosztuje sekunda Seedance 2.5

Cennik jest publikowany i rozliczany w tokenach, a nie w sekundach, co tworzy etap przeliczeniowy, który warto wykonać, zanim podejmiesz decyzję. Wartości podane dla punktu końcowego ModelArk to 10,70 USD za milion tokenów bez wejścia wideo i 6,40 USD za milion tokenów, gdy wejście wideo jest uwzględnione. W praktyce daje to około 0,51 USD za pięciosekundowy klip 16:9 w rozdzielczości 480p i około 1,16 USD za ten sam klip w rozdzielczości 720p. Są to ceny publikowane przez dostawcę w momencie premiery; traktuj je jako aktualny cennik, a nie jako zmierzony koszt na dostarczony element, ponieważ zarówno rozdzielczość, jak i czas trwania skalują ten koszt.

Dostępność ma realne granice. Dostęp konsumencki odbywa się przez własne aplikacje ByteDance, natomiast dostęp przez API dzieli się między Volcano Engine Ark w Chinach a BytePlus ModelArk na arenie międzynarodowej. Co najmniej jeden dystrybutor twierdzi, że model nie jest dostępny w Stanach Zjednoczonych, a źródła nie są zgodne co do tego, czy obsługiwane rozdzielczości kończą się na 720p, czy sięgają 1080p — rozbieżność, którą warto rozstrzygnąć na podstawie dokumentacji samego dostawcy, zanim zaczniesz projektować pod konkretną rozdzielczość.

To jest ten typ modelu, w którym warstwa routingu zasługuje na swoje miejsce z konkretnego powodu: stawki się zmieniają. Cena wideo za token, która zmieniła się raz przy premierze, zmieni się ponownie, a różnica między modelem kosztów opartym na dzisiejszej liczbie a tym opartym na liczbie z poprzedniego kwartału to różnica między marżą a niespodzianką. OrcaRouter przekazuje cenę katalogową dostawcy z 0% narzutu, więc obniżka u dostawcy obowiązuje po naszej stronie tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy, a automatyczne przełączanie awaryjne utrzymuje kolejkę generowania w ruchu, gdy jeden z endpointów dostawcy zaczyna działać gorzej — przy obciążeniach wideo to kwestia harmonogramowania, a nie rozważań teoretycznych. Sam Seedance 2.5 nie jest routowany przez OrcaRouter; jest udostępniany przez własne platformy ByteDance i jej endpointy ModelArk.

Two-column scoreboard for Odyssey-3 and Seedance 2.5 across six shared dimensions — unit of sale, what you get, inputs, editing control, availability and partners. Seedance 2.5 reads tokens at roughly $0.51 per 5s at 480p, finished footage up to 30s, shipping since 31 Jul 2026; Odyssey-3 reads not published, next world state plus actions, announced 15 Sep 2026, Flexion on humanoids.

Odyssey-3 nie jest sprzedawany na sekundy

Odyssey-3 nie ma jeszcze jednostki sprzedaży i o to właśnie chodzi. Opisuje się go jako fundamentalny model świata, który może zasilać roboty, prowadzić samochody, trenować AI, pilotować drony i grać w gry wideo — autoregresyjny transformator dyfuzyjny trenowany na dużym zbiorze obserwacji wizualnych, co według jego twórcy daje wyuczone rozumienie fizyki, dynamiki, związków przyczynowo-skutkowych i ludzkich zachowań. Adaptacja do nowego zadania odbywa się przez trenowanie dekodera akcji na parach obserwacja-akcja i utrzymywanie wstępnie wytrenowanego modelu świata w stanie zamrożonym, tak że niewielka polityka odczytuje zamrożoną reprezentację i emituje polecenia silnikowe.

Demonstracje — wszystkie zgłoszone przez dostawców, żadna niezależnie nie odtworzona — obejmują sześć realizacji: ramiona robotyczne na podstawie dziesiątek godzin demonstracji, w tym zachowania odzyskiwania, których nie było w danych; polityki humanoidalne zbudowane przy użyciu Flexion na podstawie dziesiątek godzin teleoperacji, o których Odyssey twierdzi, że generalizują lepiej niż bazowe modele VLA, względem których je testowano, nie publikując przy tym żadnych liczb; jazdę w pętli zamkniętej w Indiach na podstawie dwudziestu godzin danych symulowanych; lot drona w pomieszczeniach na podstawie danych symulowanych; polityki z Grand Theft Auto V, które przeniosły się do Red Dead Redemption 2 i Sleeping Dogs bez dodatkowego treningu, przy czym około dwóch godzin nagrań z GTA dało animację jazdy konnej w RDR2; oraz generowanie środowisk do trenowania innych AI w ramach prac PROWL.

Jedyną twardą liczbą jest 77% — polityki jazdy trenowane w symulacji pokonywały między interwencjami kierowcy bezpieczeństwa około 77% dystansu, jaki pokonywały polityki trenowane na prawdziwych nagraniach. To dane od dostawcy, za którymi nie stoją żaden raport techniczny ani zewnętrzna weryfikacja.

Screenshot of Odyssey's “Introducing Odyssey-3: A General-Purpose Physical Intelligence” page, dated September 15th, 2026, showing the model subtitle “Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games” and the authors Oliver Cameron and Jeff Hawke.

Jednostka sprzedaży decyduje o tym, co jest optymalizowane

Gdy zaczniesz postrzegać oba modele jako mierniki, a nie jako możliwości, ich różnice przestają wyglądać tak, jakby jeden wyprzedzał drugi.

Model rozliczany za sekundę wyniku jest optymalizowany pod kątem wyniku, który zadowala widza. To nie jest niższa ambicja; to inny cel z własnymi trudnymi problemami. Seedance 2.5 tworzący trzydzieści spójnych sekund ze zsynchronizowanym dialogiem i kontrolą na poziomie znaczników czasu to naprawdę trudny rezultat, a tryby awarii, według których się go ocenia — dryfująca twarz postaci, cięcie, które nie trafia, kwestia dialogowa poza synchronizacją — to te, które zauważyłaby osoba na stanowisku montażowym.

Model, którego zadaniem jest przewidywanie, co stanie się dalej, gdy kontroler podejmuje działanie, jest optymalizowany pod kątem czegoś, czego widz nigdy nie sprawdzi: tego, czy dynamika wytrzymuje próbę w sekwencji decyzji, w tym decyzji, których nikt nie zademonstrował. Dlatego Odyssey raportuje zachowania odzyskiwania wyłaniające się z dziesiątek godzin danych, zamiast raportować wierność, i dlatego jego jedyne twierdzenie ilościowe jest mierzone w interwencjach kierowcy bezpieczeństwa, a nie w jakości wizualnej. Renderer może się mylić w sposób, który publiczność wybacza. Symulator może się mylić w sposób, na który kontroler reaguje, a drugi rodzaj błędu kumuluje się w trakcie rolloutu.

Nakładanie się deklarowanych przypadków użycia — danych treningowych dla robotów, przypadków brzegowych jazdy autonomicznej — to punkt, w którym oba się stykają, i jest to prawdziwa rywalizacja o budżet, a nie o pozycję w benchmarku. Pytanie, przed którym faktycznie stoi zespół robotyki, brzmi: czy kupić wyrenderowane sekundy wiarygodnego świata, czy kupić model dynamiki z interfejsem akcji — a odpowiedź zależy od tego, czy odbiorcą końcowym jest człowiek oceniający, czy pętla treningowa.

Obok siebie

Jednostka sprzedaży — Seedance 2.5: tokeny, co przekłada się na około 0,51 USD za 5-sekundowy klip przy 480p i 1,16 USD przy 720p. Odyssey-3: brak opublikowanych danych.

Co otrzymujesz na jednostkę — Seedance 2.5: gotowy materiał filmowy, do 30 s w jednym przebiegu, ze zsynchronizowanym dźwiękiem i dialogami. Odyssey-3: przewidywany następny stan świata oraz działania silnikowe dla podłączonego sprzętu.

Dane wejściowe — Seedance 2.5: tekst plus do ok. 30 obrazów, 10 wideo i 10 klipów audio. Odyssey-3: dekoder akcji trenowany na parach obserwacja–akcja, na zamrożonym backbone.

Kontrola edycji — Seedance 2.5: precyzyjne wskazywanie na poziomie znaczników czasu oraz edycje po wygenerowaniu na poziomie regionów. Odyssey-3: nie dotyczy; brak powierzchni edycji.

Zadeklarowani partnerzy — Seedance 2.5: XCMG, XPeng i trzy inne firmy na premierze. Odyssey-3: Flexion w zakresie polityk dotyczących humanoidów; nie ogłoszono żadnych klientów komercyjnych.

Dostępność — Seedance 2.5: dostępny od 31 lipca 2026 r., z zastrzeżeniem ograniczeń regionalnych. Odyssey-3: ogłoszony 15 września 2026 r., publiczna premiera „w nadchodzących tygodniach”, bez daty i bez ceny.

Który z nich należy do twojego stacka?

Jeśli rezultatem ma być wideo, które ktoś obejrzy, Seedance 2.5 jest produktem dostępnym w sprzedaży z opublikowaną ceną i szerokim zestawem funkcji, a decyzja to zwykły wybór między zbudowaniem a kupnem — z dwoma zastrzeżeniami, które warto najpierw sprawdzić: czy potrzebne rozdzielczości są rzeczywiście dostępne w punkcie końcowym, do którego możesz dotrzeć, oraz czy Twój region jest w ogóle obsługiwany. Jego dłuższy czas pojedynczego przebiegu i kontrola znaczników czasu to funkcje, które najbardziej zmieniają przepływ pracy, ponieważ eliminują etapy sklejania, a nie poprawiają pojedynczej klatki.

Jeśli produktem ma być wytrenowana polityka lub kontroler, Seedance 2.5 nie jest substytutem, niezależnie od tego, jak dobrze wygląda materiał filmowy, a Odyssey-3 jest wycelowany w twój problem, choć nie ma czego kupić. Twierdzenie, które warto śledzić, dotyczy zamrożonego backbone'u: jeden wstępnie wytrenowany model obsługujący ramiona, humanoidy, samochód, drona i trzy gry za pomocą małego dekodera to stwierdzenie o tym, jak dużo rozumienia fizyki przenosi się między ucieleśnieniami, a jeśli się potwierdzi, zmienia to, co zespół robotyki musi zbierać. Nie zostało ono przetestowane przez nikogo spoza Odyssey i nie ma raportu technicznego, licencji ani ceny.

To, na co warto patrzeć, jest nieefektowne: dla Seedance 2.5 – ustabilizowana cena i jasne oświadczenie o dostępności regionalnej; dla Odyssey-3 – repozytorium, licencja i strona trzecia odtwarzająca 77%. Dopóki druga lista nie istnieje, różnica między tymi dwoma modelami nie polega na jakości. Polega ona na tym, że jeden z nich jest produktem, a drugi argumentem.

Infographic titled “What One Unit Buys” contrasting Seedance 2.5, billed per token, with a 5s clip costing about $0.51 at 480p and about $1.16 at 720p and up to 30s in a single pass, against Odyssey-3, which has no published price and reaches robot arms, humanoids, a car and a drone through a frozen backbone plus action decoder across six embodiments with no third-party runs.

OrcaRouter udostępnia ponad 200 modeli za pomocą jednego klucza API, więc model wideo, który wybierzesz, nie jest jedynym, który możesz wywołać.