Wygenerowana infografika dwukartowa zatytułowana „Symulator vs Renderer”. Lewa karta z nagłówkiem Odyssey-3 głosi „świat, w którym możesz działać”, z wierszami dla wyjścia (stan świata + akcje), konsumenta (polityki robotów i jazdy) oraz ceny (niepublikowana). Prawa karta z nagłówkiem FLUX 3 Video głosi „plik, który możesz obejrzeć”, z wierszami dla wyjścia (1080p SDR MP4), konsumenta (widzowie i montażyści) oraz ceny ($0.06-$0.29 za sekundę).
Guides & Insights

Odyssey-3 vs FLUX 3 Video: Symulator i renderer to nie to samo narzędzie

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Odyssey-3 i FLUX 3 Video są porównywane, ponieważ oba generują wideo świata, który nie istnieje, i na tym mniej więcej kończy się ich podobieństwo. FLUX 3 Video to model generatywny Black Forest Labs, powszechnie dostępny od 4 sierpnia 2026 r., który przekształca prompt lub klatkę początkową w maksymalnie dwadzieścia sekund materiału MP4 1080p SDR z natywnym audio, rozliczany za każdą sekundę wyniku. Odyssey-3 to bazowy model świata Odyssey, zaprezentowany 15 września 2026 r. i jeszcze publicznie niedostępny, który symuluje, jak scena ewoluuje pod wpływem działań, oraz dołącza wyuczony dekoder, aby przekształcić tę symulację w polecenia sterujące silnikami ramienia robota, humanoida, samochodu lub drona. Jeden jest rendererem: generuje obserwacje do oglądania przez człowieka. Drugi jest symulatorem: generuje stan, na którym program może działać. Porównywanie ich bezpośrednio i tak jest przydatne — nie po to, by wyłonić zwycięzcę, ale dlatego, że dwie rzeczy, które generują, to dwa różne elementy, które wiele zespołów próbuje obecnie kupić w ramach jednej pozycji budżetowej.

Różnica polega na tym, co wychodzi z modelu

Najczystszym sposobem utrzymania tego rozróżnienia jest taksonomia modeli świata opublikowana przez World Labs, która porządkuje systemy według tego, którą część pętli percepcja–działanie wyprowadzają na wyjście. Renderer wyprowadza obserwacje — piksele, dla ludzkich oczu, oceniane pod kątem wierności wizualnej. Symulator wyprowadza stan — reprezentację świata wystarczająco wierną geometrycznie i fizycznie, aby zarówno ludzie, jak i programy mogły na niej obliczać. Planer wyprowadza działania. FLUX 3 Video jest bez wątpienia rendererem, i to znakomitym. Odyssey-3 celuje w kolumnę symulatora, mając jedną nogę w kolumnie planera, ponieważ to dekoder działań pozwala symulacji sterować sprzętem.

To nie jest różnica marketingowa i ma praktyczny test. Wyrenderuj pokój za pomocą modelu wideo, wyjdź swoim punktem widzenia poza niego i odwróć się: meble mogą nie być tam, gdzie je zostawiłeś, ponieważ model przewidywał klatka po klatce i nigdy nie utrzymywał trwałego świata. Zadaj symulatorowi to samo pytanie, a odpowiedź powinna być stabilna, ponieważ istotą modelu jest stan leżący u podstaw klatek. Własne ogłoszenie Odyssey opiera się na tym — powód, dla którego buduje się model dynamiki, a nie generator wideo, jest taki, że politykę trenowaną w jego wnętrzu można oceniać i ulepszać, a nie tylko obserwować.

A generated two-column scoreboard for Odyssey-3 vs FLUX 3 Video using the same six dimension labels on both sides: output, consumer, max length, audio, price and availability. Odyssey-3 reads world state + actions, robot and driving policies, continuous rollout, none, not published, preview only. FLUX 3 Video reads 1080p SDR MP4, viewers and editors, 20s single pass, native, $0.06-$0.29 per second, GA 2026-08-04. The footer reads "Odyssey-3 vendor-reported and unreleased; FLUX 3 Video specs per Black Forest Labs."

FLUX 3 Video, konkretnie

Black Forest Labs wypuściło FLUX 3 Video 4 sierpnia 2026 r., a jego karta specyfikacji jest ukierunkowana na wyniki produkcyjne, a nie na symulację. Generuje do dwudziestu sekund w jednym przebiegu przy maksymalnie 1080p, w SDR, jako MP4, z natywnym dźwiękiem generowanym równolegle z obrazem. Ceny są naliczane za sekundę wygenerowanego wideo: poziom szkicowy 720p po 0,06 USD za sekundę, standardowy poziom 720p po 0,17 USD, a 1080p po 0,29 USD, przy czym prace wideo-do-wideo są wyceniane powyżej tych stawek. To są dane dostawcy.

Jedyną liczbą benchmarkową, jaką Black Forest Labs do niego przypisało, jest wewnętrzne Elo 1 135 dla text-to-video, czyli ocena przeprowadzona przez dostawcę, której nikt niezależnie nie odtworzył — FLUX 3 Video nie pojawia się obecnie w niezależnych rankingach wideo. Traktuj ten ranking jako twierdzenie. Nie podlega natomiast wątpliwości dostarczenie: wycenione, udokumentowane API rozliczane za sekundę, które zwraca plik — już dziś.

Konkretnie Odyssey-3

Odyssey-3 to zapowiedź z architekturą i bez ceny. To autoregresyjny transformer dyfuzyjny trenowany na obserwacjach wizualnych, a jego wyróżniającą cechą jest dekoder akcji — „wyuczony komponent wyjściowy dołączony do modelu świata”, według Odyssey, trenowany na parach obserwacja-akcja, aby przełożyć wewnętrzną reprezentację modelu na akcje potrzebne konkretnemu urządzeniu. Odyssey donosi o sterowaniu ramionami robotów na podstawie dziesiątek godzin demonstracji, o politykach humanoidalnych zbudowanych z Flexion w czasie rzeczywistym, o jeździe w pętli zamkniętej na podstawie 20 godzin symulowanych danych, o locie drona wewnątrz pomieszczeń z omijaniem przeszkód oraz o wydłużonej grze w Grand Theft Auto V z transferem do Red Dead Redemption 2 i Sleeping Dogs bez dodatkowego treningu polityki w tych tytułach. Firma podaje również jedną liczbę porównawczą: polityki jazdy trenowane na symulacji pokonywały około 77% takiego dystansu między interwencjami kierowcy bezpieczeństwa, jak polityki trenowane na prawdziwych nagraniach. Nie ma niezależnych testów porównawczych, raportu technicznego dla Odyssey-3 ani daty premiery poza „najbliższymi tygodniami”. Każda liczba pochodzi od samej Odyssey.

Kontrast, wymiar po wymiarze

Co generuje — FLUX 3 Video: plik MP4 z pikselami. Odyssey-3: symulowany stan świata oraz akcje ruchowe przez dekoder akcji.

Kto z niego korzysta — FLUX 3 Video: osoba oglądająca lub montażysta kończący montaż. Odyssey-3: kontroler robota, polityka jazdy lub trenowany agent RL.

Maksymalne parametry wyjściowe — FLUX 3 Video: do 20 s w jednym przebiegu, do 1080p SDR, natywne audio. Odyssey-3: ciągłe generowanie tak długo, jak długo utrzymuje się symulacja, z dowolną liczbą klatek na sekundę, jakiej wymaga wdrożenie.

Cena — FLUX 3 Video: 0,06 USD/s szkic 720p, 0,17 USD/s 720p, 0,29 USD/s 1080p (dostawca). Odyssey-3: nie opublikowano.

Dostępność — FLUX 3 Video: ogólnie dostępny od 2026-08-04. Odyssey-3: zapowiedź, publicznie „w nadchodzących tygodniach”.

Benchmarki — FLUX 3 Video: Elo 1,135 w T2V od producenta, niepowtórzone, nieobecne w niezależnych zestawieniach. Odyssey-3: brak tabeli benchmarków, jedna wartość sim-to-real od producenta.

Asymetria cen to uczciwy nagłówek

Jedno z nich ma cenę, a drugie nie, i ten jeden fakt mówi ci więcej o wyborze między nimi niż jakiekolwiek twierdzenie o możliwościach. FLUX 3 Video ma naliczany koszt za sekundę wyniku, więc zespół może obliczyć koszt stu klipów przed wygenerowaniem pierwszego. Odyssey-3 nie ma podanej ceny, API ani daty, więc koszt korzystania z niego jest obecnie niepoznawalny — podobnie jak kształt rachunku. Modele świata tego rodzaju, jakie opisuje Odyssey, są zwykle rozliczane zupełnie inaczej niż generowanie wideo: nie za sekundę pięknych pikseli, lecz za godzinę symulacji, ponieważ odbiorcą jest pętla treningowa, która może działać przez miliony kroków. Porównywanie 0,29 USD za sekundę z niczym nie jest porównaniem, a każda strona, która przedstawia to jako porównanie, wypełnia lukę domysłem.

Gdzie faktycznie by się spotkali

Te dwa rozwiązania nie są zamiennikami, a ciekawsze pytanie brzmi, czy się komponują. FLUX 3 Video jest lepszym narzędziem do wszystkiego, gdzie produktem końcowym jest plik, który ogląda człowiek: ujęcie produktowe, wariant reklamy, skrót na social media, prewizualizacja. Odyssey-3, jeśli dowiezie, jest lepszym narzędziem do wszystkiego, gdzie produktem końcowym jest polityka, która musi działać w świecie fizycznym, albo scena, na temat której program musi prowadzić rozumowanie. W pipeline filmowym lub growym sensowny układ nie polega na wyborze albo-albo — model świata generuje interaktywne środowisko, a renderer tworzy dopracowane klatki, które opuszczają budynek.

Na tę kompozycję istnieje dziś realne ograniczenie i jest nim SDR. FLUX 3 Video wyprowadza pliki MP4 w SDR. Odyssey-3 generuje symulowane środowisko, a nie plik po gradingu. Żadne z nich nie jest narzędziem do finalizacji w HDR, więc potok produkcyjny kończący się materiałem do emisji lub dystrybucji kinowej wciąż wymaga etapu masteringu po obu z nich.

Routing, a także co obejmuje, a czego nie obejmuje w tym miejscu

Żaden z tych modeli nie jest dziś trasowalny przez OrcaRouter. FLUX 3 Video jest dostarczany z własnego API Black Forest Labs oraz z kilku platform firm trzecich; Odyssey-3 nie jest dostępny od nikogo, ponieważ nie został wydany. Warstwa routingu zasługuje na swoje miejsce w takim potoku na poziomie powyżej modelu wideo — modelu językowego, który szkicuje listę ujęć, modelu wizyjnego, który sprawdza wygenerowaną klatkę z briefem, modelu transkrypcji, który zamienia nagrany voiceover na napisy. To zwykłe routowane obciążenia, a działają na jednym API obejmującym ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, więc obniżka ceny u dostawcy trafia na Twój rachunek tego samego dnia, a nie przy kolejnym odnowieniu umowy. DSL routingu to element, który ma znaczenie w wieloetapowym potoku: kilka modeli złożonych w jedno wywołanie, z automatycznym przełączaniem awaryjnym, gdy dostawca zaczyna działać gorzej, dzięki czemu etap renderowania nie zawodzi, bo punkt końcowy modelu do promptów ma zły dzień. Nic z tego nie hostuje FLUX 3 Video ani Odyssey-3, i ten artykuł nie twierdzi inaczej.

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

Który, dla kogo

Jeśli twoim rezultatem jest plik — klip, skrócona wersja, prewizualizacja — FLUX 3 Video jest tym, który możesz kupić już dziś, po opublikowanej cenie za sekundę, z natywnym dźwiękiem i dwudziestosekundowym wyjściem w jednym przebiegu, a twierdzenie dostawcy o Elo jest rozsądnym bonusem, a nie powodem, by go wybrać. Jeśli twoim rezultatem jest kontroler, który musi działać na sprzęcie, Odyssey-3 jest tym, który odpowiada na twój problem, a uczciwa rada brzmi: poczekaj — nie ma jeszcze ceny, daty ani niezależnego wyniku, a wynik 77% w przejściu z symulacji do rzeczywistości pochodzi od samego Odyssey i nie został powtórzony.

Na co warto patrzeć, to nie to, który model wygrywa, bo one się nie ścigają. Chodzi o to, czy dekoder akcji Odyssey-3 generalizuje się między sześcioma ucieleśnieniami wymienionymi w ogłoszeniu, gdy zewnętrzne grupy będą mogły go uruchomić. To teza z największym potencjałem, jeśli się utrzyma, a obecne dowody na jej poparcie to lista demonstracji, a nie pomiar.

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.