Eine generierte Hero-Karte für „Agora-2: Odyssey's Playable World Model lässt 20 Teilnehmer auf vier GPUs laufen“. Drei flache Linien-Icons stehen oben über dem Titel – ein Globus mit Menschen, ein Knotennetzwerk und ein mit GPU beschrifteter Chip –, darunter der Untertitel „Jeder Frame kommt aus dem Modell“. Drei abgerundete Fakten-Pillen am unteren Rand zeigen „20 Teilnehmer“, „4.457.777-Parameter-Simulationsmodell“ und „~1B-Parameter-Renderer“. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Engineering & Research

Agora-2: Odysseys spielbares Weltmodell läuft mit 20 Teilnehmern auf vier GPUs

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Agora-2 bringt zwanzig Teilnehmende in einer einzigen Simulation unter und nennt es eine spielbare Forschungsvorschau. Odyssey veröffentlichte es am 21. September 2026 in einem Beitrag mit dem Titel „Introducing Agora-2: Advancing Multi-Agent World Simulation“, unterzeichnet von Oliver Cameron, und die Zahl, die die Runde macht, ist die Zwanzig. Die Zahl, auf die es ankommt, ist die Aufteilung darin. Eine Sitzung unterstützt bis zu vier gleichzeitige menschliche Steuernde neben sechzehn autonomen Entitäten – und dabei handelt es sich nicht um dieselbe Art von Teilnehmenden: vier Personen, die Bewegungsbefehle eingeben, sechzehn Policies, die sie ausführen. Odyssey trainierte die Policies selbst, auf Leveln eines Spiels, auf das es ebenfalls trainiert wurde: Das Paper sagt, die Welt werde aus Aufnahmen von Diablo II gelernt.

In dieser Unterscheidung zwischen gesteuerten und simulierten Teilnehmern steckt fast alles Interessante an Agora-2. Sie ist auch der Punkt, an dem die meiste Berichterstattung unscharf werden wird, denn „20 Spieler“ ist ein prägnanterer Satz als „vier Spieler und sechzehn gelernte Agenten, die sich einen Zustand teilen, der außerhalb des Bildschirms fortbesteht“. Was Odyssey ausliefert, ist kein Videogenerator mit nachträglich angeflanschtem Mehrspielermodus. Es ist eher ein Spielserver, dessen Physik, Animation und Rendering allesamt durch gelernte Komponenten ersetzt wurden und dessen einzige echte Inhaltsquelle ein Datensatz aufgezeichneter Spielabläufe ist.

Zwanzig Teilnehmende sind vier Personen und sechzehn Richtlinien.

Odyssey stellt ausdrücklich fest, dass Agora-2 fünfmal so viele Teilnehmer unterstützt wie Agora-1 und dass man von der Simulation einer einzelnen Umgebung zur Simulation mehrerer Umgebungen mit Verhalten über längere Zeithorizonte übergegangen ist. Der Aufbau pro Sitzung sieht wie folgt aus:

• Menschliche Controller – bis zu 4 gleichzeitig, jeder liefert Eingaben für Bewegung und Aktion

• Autonome Entitäten — 16 pro Sitzung, gesteuert durch erlernte Monster- und Begleiter-Policies statt durch Spieler

• Teilnehmer insgesamt — 20 in einem gemeinsamen Weltzustand, mit dieser Zahl wirbt Odyssey

• Umgebungen — mehrere, statt nur der einen Umgebung, die Agora-1 simulieren konnte

• Inhaltsbasis — Aufnahmen von Diablo II, sodass die Welt, die Assets und die Regeln alle aus einem aufgezeichneten Korpus stammen

• Veröffentlichungsform – eine spielbare Forschungsvorschau, kein Produkt, ohne Gewichte, ohne Lizenz und ohne Preis

Die autonomen Sechzehn sind keine Dekoration. Odysseys Bericht beschreibt das Training getrennter Monster- und Begleiter-Policies, und die Evaluierungszahlen sind konkret: 23.771 Beispiele für die Monster-Policy aus der Endphase, die aus einem Basis-Lehrer sowie Wiederherstellungs- und Retention-Daten stammen, und 128.005 Beispiele für die Begleiter-Policy, bewertet anhand von 252 Evaluierungsepisoden bzw. 24 Evaluierungsfällen. Diese Policies sind es, die eine Sitzung mit vier Personen bevölkert wirken lassen. Sie sind auch der Grund, warum die Teilnehmerzahl eine Designentscheidung und keine Kapazitätsaussage ist – sechzehn ist die Anzahl an Agenten, die der Welt-Server darauf trainiert wurde, neben vier Menschen zu tragen, nicht die Anzahl, die er theoretisch halten könnte.

Die Architektur besteht aus einem kleinen Modell und einem großen.

Agora-2 trennt das, was entscheidet, was passiert, von dem, was entscheidet, wie es aussieht, und die Größenlücke zwischen beiden ist die auffälligste Zahl in dem Paper. Das Simulationsmodell hat 4.457.777 Parameter – rund 4,46 Millionen, vier Schichten breit, Breite 256, vier Heads, ein vierstufiges Verlaufsfenster, vierzehn Bewegungszweige und einen separaten Head für die Blickrichtung. Der Renderer ist ein Flow-Matching-Transformer mit etwa einer Milliarde Parametern, sechzehn Blöcke bei Breite 2.048, von denen fünf kausale zeitliche Attention tragen, ausgeführt mit fünf Solver-Schritten pro Update.

Der Renderer ist auf einen 342-Token-Präfix konditioniert statt auf die rohe Welt:

• Karte — 144 Tokens, ein lokales 12×12-Kachelraster um den Betrachtungspunkt

• Entitäten — 36 Tokens, vier für benutzergesteuerte Teilnehmer und 32 für andere Entitäts-Slots

• Transient — 160 Tokens für Effekte, die weder noch Entität sind

• Anzeigen und Teilnehmerliste — je ein Token für die Kameraaktion und die Sitzungsliste

• Pro Update — 300 Bild-Tokens, die über diese 342 Conditioning-Tokens attendieren

• Codec — ein RAE-basiertes Latent mit 2 Frames in 15×20×32, dann x264 CRF 18 oder NVENC QP 18 beim Ausgang

Odyssey nennt den Grund, warum die Konditionierung so strukturiert ist: Eine gelernte Welt muss Entitätseigenschaften in einem Zustand halten, der jede einzelne Kamera überdauert. Der Beitrag sagt es unverblümt – weil Entitätseigenschaften unabhängig von einer bestimmten Ansicht erhalten bleiben, sind sie verfügbar, wenn eine Entität außerhalb des Bildes ist. Das ist der Satz, der Agora-2 von einem Videomodell unterscheidet. Ein Generator, der nur auf aktuelle Frames konditioniert wird, verliert das Monster in dem Moment, in dem man sich von ihm abwendet; ein Weltmodell, das einen expliziten Zustand beibehält, nicht.

A screenshot of Odyssey's Agora-2 announcement page showing the Odyssey navigation bar and an 'Agora-2' button above a wide three-panel still of rendered gameplay, the headline 'Introducing Agora-2: Advancing Multi-Agent World Simulation', the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', the byline Oliver Cameron on the left with the date 'September 21st, 2026' on the right, and the opening paragraphs describing a playable research preview.

Vier GPUs kaufen vier Spieler

Der Serving-Plan im Bericht ist der am wenigsten bekannt gemachte Teil von Agora-2 und der nützlichste für alle, die abschätzen möchten, was eine Welt wie diese kosten würde. Odysseys Konfiguration für eine Sitzung mit vier Spielern besteht aus vier NVIDIA RTX PRO 4500 Karten: ein Renderer pro GPU, wobei eine dieser GPUs auch das Simulationsmodell und die Agenten-Policy hostet. Die angegebenen Zielwerte sind fünfzehn latente Updates pro Sekunde bei dreißig angezeigten Bildern pro Sekunde.

Zwei Zahlen im Anhang machen diese Konfiguration konkret. Bei 165 Watt maß das Team eine Inferenzreduktion von 9,9 % durch eine Änderung am Renderer – von 62,92 Millisekunden auf 56,69 Millisekunden bei 3.200 Aufrufen pro Implementierung. Und das Training des Renderers war ebenso spezifisch: sechzigtausend Updates auf 4.232.000 Segmenten, gefolgt von weiteren sechzigtausend auf 4.332.800 Segmenten, AdamW mit einer Lernrate von 1e-4, Batch 128, EMA 0,9999, ausgeführt auf 32 B200 GPUs. Dieser Korpus ist aufgeschlüsselt – 1.200.000 Kampfsegmente mit vollständigem Roster, 2.016.000 stratifizierte Spezialfähigkeitssegmente, 504.000 Leichendurchquerungssegmente, 512.000 Bewegungssegmente ohne autonome Entitäten und 100.800 Boss-Portal-Lebenszyklussegmente.

Wenn man diese beiden Absätze zusammen liest, wird die Gestalt des Produkts klar. Der Renderer ist die teure Hälfte – um drei Größenordnungen bei den Parametern, eine GPU pro gleichzeitigem Zuschauer im Serving und zweiunddreißig B200s im Training. Das Simulationsmodell – der Teil, der tatsächlich entscheidet, was in der Welt passiert – umfasst viereinhalb Millionen Parameter, weniger als die meisten Embedding-Tabellen. Agora-2 ist ein Rendering-Problem in einem Game-Engine-Kostüm.

Die veröffentlichten Zahlen – und die eine Sache, die sie nicht zeigen

Die quantitativen Ergebnisse des Berichts sind, nach Odysseys eigener Darstellung, Ablationen seiner eigenen Designentscheidungen und keine wettbewerbsfähigen Benchmark-Werte, und sie sollten auch so gelesen werden:

• Strukturiertes Präfix vs. eine VAE-Baseline — 0,001279 mittlerer quadratischer Fehler und 30,11 dB PSNR gegenüber 0,010272 und 20,67 dB, ein Gewinn von 9,44 dB, über 90 gepaarte Auswertungen aus 30 Clips und 3 Seeds

• Renderer-Attention — 20,09 Millisekunden pro Zwei-Frame-Denoiser-Update mit dem strukturierten Präfix gegenüber 37,06 mit Cross-Attention und 18,82 mit gepooltem AdaLN, eine Reduktion des Denoisers um 45,8 % und um 34,1 % beim Kern

• History-Dropout bei 50 % — 0,05695 Streaming-Fehler und 0,19535 Kaltstart gegenüber 0,06041 und 0,21082 ohne Dropout, bei etwas schlechterer Wiedergabetreue der Kartenperturbation

• Simulationsgenauigkeit — 85,17 % bei der Bewegungszweigvorhersage, 68,17 % bei der schwierigeren Teilmenge blockierter Beispiele und 95,84 % im Animationsmodus, mit vorhergesagten Moduswechseln bei 7,49 % gegenüber 3,54 % aufgezeichneten

Jede dieser Zahlen wird anhand einer anderen Konfiguration von Agora-2 gemessen. Keine davon ist ein Vergleich mit einem ausgelieferten System, und keine beschreibt Live-Spiel. Abschnitt 8 des Berichts ist offen über diese Lücke. Der Transfer auf neue Assets, Regeln oder Umgebungen bleibt ungetestet. Fehler summieren sich. Unabhängig erzeugte Bilder können weiterhin in Aussehen, Sichtbarkeit oder Ereigniszeitpunkt voneinander abweichen. Und der Satz, der es verdient, vollständig zitiert zu werden: Eine dauerhaft aufrechterhaltene Bildrate und die Eingabe-zu-Anzeige-Latenz während der Live-Interaktion mehrerer Agenten wurden nicht quantitativ bewertet. Die oben genannten fünfzehn Aktualisierungen pro Sekunde und dreißig Bilder pro Sekunde sind Ziele, keine Messungen.

A generated scoreboard titled 'Agora-2 — what the report actually reports' listing six rows: participants — 4 human controllers plus 16 autonomous entities; simulation model — 4,457,777 parameters; renderer — about one billion parameters, five solver steps; serving — 4x RTX PRO 4500 per four-player session; targets — 15 latent updates and 30 displayed frames per second; live latency evaluation — none published. A footer reads 'All figures reported by Odyssey; none independently reproduced.'

Wo die Vorschau zu finden ist und was sie nicht enthält

Die spielbare Vorschau befindet sich auf Odysseys eigener Website, erreichbar über die Demo-Adresse agora.odyssey.ml, die auf agora.odyssey.systems weiterleitet. Der technische Bericht ist das in derselben Ankündigung verlinkte PDF. Was nicht veröffentlicht ist, ist ebenso bemerkenswert wie das, was veröffentlicht ist: keine Modellgewichte, kein Repository, keine Lizenz, keine Inferenz-API und kein Preis. Odyssey beschreibt die Veröffentlichung als Forschungsvorschau und behandelt die Entwicklung hin zu Multi-Agenten-Interaktion innerhalb seiner grundlegenden Weltmodelle als zukünftige Arbeit, wobei PROWL als der Forschungsstrang aufgeführt wird, den es ausbaut, und Odyssey-3 als das letztendliche Ziel genannt wird.

Das ist für alle relevant, die planen, gegen Agora-2 zu entwickeln, denn die praktische Antwort lautet heute: Das geht nicht – weder über uns noch über den gehosteten Endpunkt irgendeines anderen Anbieters. OrcaRouter bedient Agora-2, Agora-1 oder Odyssey-3 nicht; diese Modellrouten existieren in unserem Katalog nicht. Was unsere Plattform dagegen bietet, ist der Rest eines Builds, der rund um eine erlernte Welt entstehen könnte: einen einzigen Endpunkt für über 200 Modelle, abgerechnet zum Listenpreis des jeweiligen Anbieters ohne Aufschlag, sodass eine Preisänderung eines Anbieters noch am selben Tag hier live ist, und eine Routing-Schicht, die eine Anfrage automatisch umleitet, wenn ein Anbieter beeinträchtigt ist. Wenn Sie am Ende ein Modell nutzen, um Level-Layouts zu generieren, Policy-Code zu schreiben oder aufgezeichnetes Gameplay zu untertiteln, ist das der Bereich, bei dem wir tatsächlich helfen können.

Was zu sehen

Agora-2 ist ein echtes Ergebnis mit einem echten Vorbehalt, und die beiden sind leicht zu verwechseln. Das Ergebnis ist, dass eine gemeinsame, persistente Multi-Umgebungs-Welt für zwanzig Teilnehmer aus einem Korpus aufgezeichneter Spielzüge simuliert und gerendert werden kann und dass Odyssey auf die spezifischen Designentscheidungen verweisen kann – expliziter Zustand, ein strukturiertes Konditionierungspräfix, ein winziges Simulationsmodell –, die es zum Funktionieren brachten. Der Vorbehalt ist, dass Abschnitt 8 des Papers selbst Live-Latenz, anhaltende Bildrate, umgebungsübergreifenden Transfer und Fehlerakkumulation als nicht bewertet auflistet. Bis jemand eine Bildraten-Aufzeichnung aus einer echten Vier-Spieler-Sitzung veröffentlicht, lautet die ehrliche Zusammenfassung, dass Agora-2 die Architektur beweist und die Erfahrung ungemessen lässt.

Der zweite Punkt, auf den man achten sollte, ist die Stoßrichtung. Die eigene Einordnung von Odyssey stellt Agora-2 als einen Schritt auf dem Weg dar, Multi-Agent-Interaktion in ein fundamentales Weltmodell einzubetten, mit PROWL als der Forschungserweiterung und Odyssey-3 als dem benannten Ziel. Wenn das geschieht, ist die interessante Frage nicht mehr, ob ein Weltmodell zwanzig Teilnehmer tragen kann, sondern ob ein Weltmodell sie in eine Welt tragen kann, auf die es nie trainiert wurde – und genau das ist die Transferfrage, deren Beantwortung der aktuelle Bericht ablehnt.

A screenshot of Odyssey's Agora-2 announcement page scrolled into the body of the post, showing the paragraph describing Agora-2 as a learned game engine, the 'Experience Agora-2' and 'Read Technical Report' buttons, the 'Going forward' paragraph, two side-by-side gameplay panels captioned '2 humans battling RL-trained agents inside Agora-2, all in real time', and the section heading 'A World Simulation That Humans and Agents Can Share' with its opening paragraph explaining that Agora-2 maintains an explicit shared state that accounts for multiple participants' actions and their effects on one another.