Wygenerowana karta hero dla „Agora-2: Odyssey's Playable World Model Runs 20 Participants on Four GPUs”. U góry znajdują się trzy płaskie ikony liniowe — globus z ludźmi, sieć węzłów i chip z etykietą GPU — nad tytułem, a pod nim podtytuł „Każda klatka pochodzi z modelu”. Na dole znajdują się trzy zaokrąglone plakietki z faktami: „20 uczestników”, „model symulacyjny o 4 457 777 parametrach” i „renderer o ~1 mld parametrów”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Engineering & Research

Agora-2: Grywalny model świata Odyssey obsługuje 20 uczestników na czterech GPU

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Agora-2 umieszcza dwudziestu uczestników w jednej symulacji i nazywa ją grywalnym podglądem badawczym. Odyssey opublikowało ją 21 września 2026 r. w poście zatytułowanym „Przedstawiamy Agora-2: Rozwijanie wieloagentowej symulacji świata”, podpisanym przez Olivera Camerona, a liczbą, która krąży, jest dwadzieścia. Liczbą, która ma znaczenie, jest podział wewnątrz niej. Sesja obsługuje maksymalnie czterech jednoczesnych ludzkich kontrolerów obok szesnastu autonomicznych bytów, a nie są to uczestnicy tego samego rodzaju — cztery osoby wpisujące polecenia ruchu, szesnaście polityk, które je wykonują. Odyssey samo wytrenowało te polityki, na etapach gry, na których również trenowało: w pracy czytamy, że świat jest uczony na podstawie nagrań z Diablo II.

To rozróżnienie między kontrolowanymi a symulowanymi uczestnikami jest tym, w czym tkwi niemal wszystko, co interesujące w Agora-2. To także miejsce, w którym większość relacji ulegnie rozmyciu, ponieważ „20 graczy” to zgrabniejsze zdanie niż „czterech graczy i szesnastu wyuczonych agentów współdzielących stan, który przetrwa poza ekranem”. To, co udostępnia Odyssey, nie jest generatorem wideo z doczepionym trybem wieloosobowym. To bliższe serwerowi gry, którego fizyka, animacja i renderowanie zostały zastąpione przez wyuczone komponenty, a którego jedynym prawdziwym źródłem treści jest zestaw danych zarejestrowanej rozgrywki.

Dwadzieścioro uczestników to czworo ludzi i szesnaście polityk

Odyssey wyraźnie stwierdza, że Agora-2 obsługuje pięciokrotnie więcej uczestników niż Agora-1 i że przeszła od symulowania pojedynczego środowiska do symulowania wielu środowisk z zachowaniem o dłuższym horyzoncie. Struktura pojedynczej sesji wygląda następująco:

• Osoby sterujące — do 4 jednocześnie, każda z nich przekazuje dane wejściowe dotyczące ruchu i akcji

• Autonomiczne byty — 16 na sesję, kierowane wyuczonymi politykami potworów i towarzyszy, a nie przez graczy

• Łączna liczba uczestników — 20 w jednym wspólnym stanie świata, co jest liczbą, którą Odyssey wysuwa na pierwszy plan

• Środowiska — wiele, w porównaniu z pojedynczym środowiskiem, które mogła symulować Agora-1

• Podstawa treści — nagrania z Diablo II, więc świat, zasoby i reguły są w całości dziedziczone z jednego nagranego korpusu

• Forma wydania — grywalna wersja zapoznawcza do celów badawczych, a nie produkt, bez wag, bez licencji i bez ceny.

Autonomiczna szesnastka nie jest dekoracją. Raport Odyssey opisuje trenowanie osobnych polityk potworów i towarzyszy, a liczby w ewaluacji są konkretne: 23 771 przykładów polityki potworów z końcowego etapu, pochodzących od bazowego nauczyciela oraz danych dotyczących odzyskiwania i retencji, i 128 005 przykładów dla polityki towarzysza, ocenianych odpowiednio na 252 epizodach ewaluacyjnych i 24 przypadkach ewaluacyjnych. To właśnie te polityki sprawiają, że sesja dla czterech osób wydaje się zapełniona. Są też powodem, dla którego liczba uczestników jest decyzją projektową, a nie twierdzeniem o pojemności — szesnaście to liczba agentów, których serwer świata został wytrenowany do obsługi wraz z czterema ludźmi, a nie liczba, którą teoretycznie mógłby pomieścić.

Architektura to jeden mały model i jeden duży.

Agora-2 rozdziela to, co decyduje o tym, co się dzieje, od tego, co decyduje o tym, jak to wygląda, a różnica rozmiarów między nimi to najbardziej uderzająca liczba w artykule. Model symulacyjny ma 4 457 777 parametrów — około 4,46 mln — cztery warstwy, szerokość 256, cztery głowice, czterokrokowe okno historii, czternaście gałęzi ruchu i osobną głowicę do orientacji. Renderer to transformer z dopasowaniem przepływu o około miliardzie parametrów, szesnaście bloków o szerokości 2 048, z których pięć wykorzystuje przyczynową uwagę czasową, uruchamiany na pięć kroków solvera na aktualizację.

Renderer jest warunkowany 342-tokenowym prefiksem, a nie surowym światem:

• Mapa — 144 tokeny, lokalna siatka kafelków 12×12 wokół punktu widzenia

• Encje — 36 tokenów, cztery dla uczestników kontrolowanych przez użytkownika i 32 dla pozostałych slotów encji

• Efekty przejściowe — 160 tokenów na efekty, które nie są ani mapą, ani encją

• Widok i lista uczestników — po jednym tokenie dla akcji kamery i listy uczestników sesji

• Na aktualizację — 300 tokenów obrazu zwracających uwagę na te 342 tokeny warunkujące

• Kodek — latent oparty na RAE przy 2 klatkach do 15×20×32, następnie x264 CRF 18 lub NVENC QP 18 na wyjściu

Odyssey podaje powód, dla którego warunkowanie ma taką strukturę: wyuczony świat musi utrzymywać właściwości encji w stanie, który trwa dłużej niż jakakolwiek konkretna kamera. Wpis ujmuje to wprost — ponieważ właściwości encji są zachowywane niezależnie od jakiegokolwiek konkretnego widoku, pozostają dostępne, gdy encja jest poza kadrem. To zdanie odróżnia Agora-2 od modelu wideo. Generator, który warunkuje wyłącznie na ostatnich klatkach, gubi potwora w momencie, gdy się od niego odwrócisz; model świata, który utrzymuje jawny stan, nie gubi go.

A screenshot of Odyssey's Agora-2 announcement page showing the Odyssey navigation bar and an 'Agora-2' button above a wide three-panel still of rendered gameplay, the headline 'Introducing Agora-2: Advancing Multi-Agent World Simulation', the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', the byline Oliver Cameron on the left with the date 'September 21st, 2026' on the right, and the opening paragraphs describing a playable research preview.

Cztery GPU dają czterech graczy

Plan obsługi zawarty w raporcie jest najmniej nagłośnioną częścią Agora-2 i najbardziej przydatną dla każdego, kto szacuje, ile kosztowałby taki świat. Konfiguracja Odyssey dla sesji czteroosobowej to cztery karty NVIDIA RTX PRO 4500: po jednym rendererze na GPU, przy czym jedno z tych GPU obsługuje również model symulacji i politykę agenta. Deklarowane wartości docelowe to piętnaście aktualizacji latentnych na sekundę przy trzydziestu wyświetlanych klatkach na sekundę.

Dwie liczby w załączniku nadają tej konfiguracji konkretny wymiar. Przy 165 watach zespół zmierzył redukcję czasu wnioskowania o 9,9% wynikającą ze zmiany w rendererze — z 62,92 milisekundy do 56,69 milisekundy w przypadku 3200 wywołań na implementację. A trening renderera był równie konkretny: sześćdziesiąt tysięcy aktualizacji na 4 232 000 segmentów, po których nastąpiło kolejne sześćdziesiąt tysięcy na 4 332 800 segmentów, AdamW ze współczynnikiem uczenia 1e-4, batch 128, EMA 0,9999, przeprowadzony na 32 GPU B200. Ten korpus jest rozpisany na pozycje — 1 200 000 segmentów walki z pełnym składem, 2 016 000 stratyfikowanych segmentów zdolności specjalnych, 504 000 segmentów przechodzenia przez zwłoki, 512 000 segmentów ruchu bez autonomicznych jednostek i 100 800 segmentów cyklu życia portalu bossa.

Przeczytaj te dwa akapity razem, a kształt produktu stanie się jasny. Renderer to ta droższa połowa — o trzy rzędy wielkości więcej parametrów, jeden GPU na każdego równoczesnego widza podczas serwowania i trzydzieści dwa B200 w treningu. Model symulacji — część, która faktycznie decyduje o tym, co dzieje się w świecie — ma cztery i pół miliona parametrów, czyli mniej niż większość tabel embeddingów. Agora-2 to problem renderowania przebrany za silnik gry.

Opublikowane liczby – i to jedno, czego nie pokazują

Wyniki ilościowe raportu są, w ujęciu samego Odyssey, ablacjami własnych wyborów projektowych, a nie konkurencyjnymi wynikami benchmarków, i tak należy je odczytywać:

• Ustrukturyzowany prefiks vs baseline VAE — 0,001279 błędu średniokwadratowego i 30,11 dB PSNR wobec 0,010272 i 20,67 dB, zysk 9,44 dB, na podstawie 90 sparowanych ewaluacji z 30 klipów i 3 ziaren

• Uwaga renderera — 20,09 milisekundy na dwuklatkową aktualizację denoisera ze strukturalnym prefiksem wobec 37,06 przy cross-attention i 18,82 przy pooled AdaLN, redukcja denoisera o 45,8% i o 34,1% w rdzeniu

• Dropout historii na poziomie 50% — błąd strumieniowania 0,05695 i błąd zimnego startu 0,19535 w porównaniu z 0,06041 i 0,21082 przy braku dropoutu, przy nieco gorszej wierności perturbacji mapy

• Dokładność symulacji — 85,17% w przewidywaniu gałęzi ruchu, 68,17% w trudniejszym podzbiorze zablokowanych przykładów i 95,84% w trybie animacji, przy przewidywanych przełączeniach trybu na poziomie 7,49% wobec 3,54% zarejestrowanych

Każda z tych wartości jest mierzona względem innej konfiguracji Agora-2. Żadna z nich nie jest porównaniem z wdrożonym systemem i żadna nie opisuje rozgrywki na żywo. Sekcja 8 raportu otwarcie przyznaje tę lukę. Transfer do nowych zasobów, reguł lub środowisk pozostaje nieprzetestowany. Błędy się kumulują. Niezależnie generowane obrazy wciąż mogą się różnić pod względem wyglądu, widoczności lub czasu wystąpienia zdarzeń. A oto zdanie warte zacytowania w całości: utrzymywana liczba klatek na sekundę oraz opóźnienie od wejścia do wyświetlenia podczas wieloagentowej interakcji na żywo nie zostały ocenione ilościowo. Piętnaście aktualizacji na sekundę i trzydzieści klatek na sekundę podane powyżej to wartości docelowe, a nie pomiary.

A generated scoreboard titled 'Agora-2 — what the report actually reports' listing six rows: participants — 4 human controllers plus 16 autonomous entities; simulation model — 4,457,777 parameters; renderer — about one billion parameters, five solver steps; serving — 4x RTX PRO 4500 per four-player session; targets — 15 latent updates and 30 displayed frames per second; live latency evaluation — none published. A footer reads 'All figures reported by Odyssey; none independently reproduced.'

Gdzie znajduje się podgląd i czego nie obejmuje

Grywalny podgląd znajduje się na własnej stronie Odyssey, do której prowadzi adres demonstracyjny agora.odyssey.ml, przekierowujący do agora.odyssey.systems. Raport techniczny to PDF podlinkowany w tym samym ogłoszeniu. To, co nie zostało opublikowane, jest równie godne uwagi jak to, co zostało: brak wag modelu, brak repozytorium, brak licencji, brak API wnioskowania i brak ceny. Odyssey opisuje wydanie jako podgląd badawczy i traktuje trajektorię w kierunku interakcji wieloagentowej wewnątrz swoich fundamentalnych modeli świata jako przyszłą pracę, przy czym PROWL wymieniono jako wątek badawczy, który rozwija, a Odyssey-3 nazwano ostatecznym celem.

To ma znaczenie dla każdego, kto planuje budować w oparciu o Agora-2, ponieważ praktyczna odpowiedź jest dziś taka, że nie można — ani przez nas, ani przez niczyj inny hostowany endpoint. OrcaRouter nie obsługuje Agora-2, Agora-1 ani Odyssey-3; tych tras modeli nie ma w naszym katalogu. To, co oferuje nasza platforma, to reszta projektu, która może otaczać wyuczony świat: jeden endpoint obejmujący ponad 200 modeli, wyceniony według cennika każdego dostawcy, bez marży, więc gdy dostawca obniży cenę, zmiana jest tu widoczna tego samego dnia, oraz warstwa routingu, która automatycznie przekierowuje żądanie, gdy dostawca zawodzi. Jeśli ostatecznie użyjesz modelu do generowania układów poziomów, pisania kodu polityki lub opisywania nagranej rozgrywki, to jest ta część, w której faktycznie możemy pomóc.

Co obejrzeć

Agora-2 to prawdziwy wynik z prawdziwym zastrzeżeniem, a te dwie rzeczy łatwo pomylić. Wynikiem jest to, że współdzielony, trwały świat obejmujący wiele środowisk można symulować i renderować dla dwudziestu uczestników na podstawie korpusu zarejestrowanej rozgrywki, oraz to, że Odyssey może wskazać konkretne decyzje projektowe — jawny stan, ustrukturyzowany prefiks warunkujący, niewielki model symulacji — które sprawiły, że to zadziałało. Zastrzeżenie jest takie, że sekcja 8 samego artykułu wymienia opóźnienie na żywo, utrzymywaną liczbę klatek na sekundę, transfer między środowiskami i akumulację błędów jako niepoddane ocenie. Dopóki ktoś nie opublikuje zapisu liczby klatek na sekundę z prawdziwej sesji czterech graczy, uczciwym podsumowaniem jest to, że Agora-2 dowodzi słuszności architektury, a doświadczenie pozostawia niezmierzone.

Druga rzecz, na którą warto zwrócić uwagę, to kierunek rozwoju. W sposobie, w jaki Odyssey sam to ujmuje, Agora-2 jest krokiem na drodze do umieszczenia interakcji wieloagentowej wewnątrz fundamentalnego modelu świata, przy czym PROWL to rozszerzenie badawcze, a Odyssey-3 to nazwany cel. Jeśli tak się stanie, interesujące pytanie przestaje brzmieć, czy model świata może pomieścić dwudziestu uczestników, a zaczyna brzmieć, czy model świata może przenieść ich do świata, na którym nigdy nie był trenowany — co jest dokładnie pytaniem o transfer, na które obecny raport odmawia odpowiedzi.

A screenshot of Odyssey's Agora-2 announcement page scrolled into the body of the post, showing the paragraph describing Agora-2 as a learned game engine, the 'Experience Agora-2' and 'Read Technical Report' buttons, the 'Going forward' paragraph, two side-by-side gameplay panels captioned '2 humans battling RL-trained agents inside Agora-2, all in real time', and the section heading 'A World Simulation That Humans and Agents Can Share' with its opening paragraph explaining that Agora-2 maintains an explicit shared state that accounts for multiple participants' actions and their effects on one another.