Een gegenereerde hero-kaart voor 'Agora-2: Odyssey's speelbare wereldmodel laat 20 deelnemers draaien op vier GPU's'. Drie platte lijniconen staan bovenaan naast elkaar — een globe met mensen, een knooppuntnetwerk en een chip met het label GPU — boven de titel, met daaronder de ondertitel 'Elk frame komt uit het model'. Drie afgeronde fact-pills onderaan vermelden '20 deelnemers', 'simulatiemodel met 4.457.777 parameters' en 'renderer met ~1 miljard parameters'. Het OrcaRouter-logo is in de rechteronderhoek samengesteld.
Engineering & Research

Agora-2: Odyssey's speelbaar wereldmodel draait 20 deelnemers op vier GPU's

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Agora-2 plaatst twintig deelnemers in één simulatie en noemt het een speelbare onderzoekspreview. Odyssey publiceerde het op 21 september 2026 in een bericht getiteld "Introducing Agora-2: Advancing Multi-Agent World Simulation", ondertekend door Oliver Cameron, en het getal dat rondgaat is twintig. Het getal dat ertoe doet, is de splitsing daarbinnen. Een sessie ondersteunt tot vier gelijktijdige menselijke bestuurders naast zestien autonome entiteiten, en dat zijn niet hetzelfde soort deelnemers — vier mensen die bewegingscommando's typen, zestien policies die ze uitvoeren. Odyssey trainde de policies zelf, op levels van een spel waarop het ook trainde: de paper zegt dat de wereld wordt geleerd uit opnamen van Diablo II.

Dat onderscheid tussen gecontroleerde en gesimuleerde deelnemers is waar bijna alles wat interessant is aan Agora-2 zich afspeelt. Het is ook waar de meeste verslaggeving zal vertroebelen, omdat "20 spelers" een schonere zin is dan "vier spelers en zestien geleerde agenten die een toestand delen die buiten beeld blijft voortbestaan." Wat Odyssey uitbrengt is niet een videogenerator met multiplayer eraan vastgeschroefd. Het lijkt het meest op een gameserver waarvan de physics, animatie en rendering allemaal zijn vervangen door geleerde componenten, en waarvan de enige echte contentbron een dataset van opgenomen spel is.

Twintig deelnemers is vier mensen en zestien polissen

Odyssey geeft expliciet aan dat Agora-2 vijf keer zoveel deelnemers ondersteunt als Agora-1 en dat het is overgestapt van het simuleren van één omgeving naar het simuleren van meerdere omgevingen met gedrag op langere termijn. De vorm per sessie ziet er als volgt uit:

• Menselijke bestuurders — tot 4 gelijktijdig, die elk bewegings- en actie-invoer leveren

• Autonome entiteiten — 16 per sessie, aangestuurd door geleerde monster- en metgezelbeleid in plaats van door spelers

• Totaal aantal deelnemers — 20 in één gedeelde wereldtoestand, het cijfer dat Odyssey vooropstelt.

• Omgevingen — meerdere, tegenover de enkele omgeving die Agora-1 kon simuleren

• Inhoudelijke basis — captures van Diablo II, dus de wereld, de assets en de regels zijn allemaal overgenomen uit één opgenomen corpus

• Releasevorm — een speelbare onderzoekspreview, geen product, zonder gewichten, zonder licentie en zonder prijs

De autonome zestien zijn geen decoratie. Het rapport van Odyssey beschrijft het trainen van afzonderlijke monster- en metgezelpolicy's, en de evaluatieaantallen zijn specifiek: 23.771 voorbeelden van monsterpolicy's in de eindfase, afkomstig van een basisteacher plus herstel- en retentiedata, en 128.005 voorbeelden voor de metgezelpolicy, respectievelijk beoordeeld aan de hand van 252 evaluatie-episodes en 24 evaluatiecases. Die policy's zorgen ervoor dat een sessie met vier personen bevolkt aanvoelt. Ze zijn ook de reden dat het aantal deelnemers een ontwerpkeuze is en geen capaciteitsclaim — zestien is het aantal agents dat de wereldserver getraind is om naast vier mensen te laten meedraaien, niet het aantal dat hij theoretisch zou kunnen herbergen.

De architectuur is één klein model en één groot model.

Agora-2 scheidt het ding dat bepaalt wat er gebeurt van het ding dat bepaalt hoe het eruitziet, en het grootteverschil tussen hen is het meest opvallende getal in het paper. Het simulatiemodel heeft 4.457.777 parameters — ongeveer 4,46 miljoen, vier lagen breed, breedte 256, vier heads, een geschiedenisvenster van vier stappen, veertien bewegingsvertakkingen en een aparte head voor facing. De renderer is een flow-matching transformer van ongeveer een miljard parameters, zestien blokken met een breedte van 2.048, waarvan vijf causale temporele aandacht hebben, uitgevoerd voor vijf solverstappen per update.

De renderer is geconditioneerd op een prefix van 342 tokens in plaats van op de ruwe wereld:

• Kaart — 144 tokens, een lokaal 12×12-tegelraster rond het gezichtspunt

• Entiteiten — 36 tokens, vier voor door gebruikers bestuurde deelnemers en 32 voor andere entiteitsslots

• Tijdelijke effecten — 160 tokens voor effecten die noch map noch entity zijn

• Bekijken en rooster — één token elk voor de camera-actie en het sessierooster

Per update — 300 afbeeldingstokens die aandacht besteden aan die 342 conditioneringstokens

• Codec — een op RAE gebaseerde latente met 2 frames in 15×20×32, en dan x264 CRF 18 of NVENC QP 18 bij de uitvoer

Odyssey noemt de reden waarom de conditionering op deze manier is gestructureerd: een geleerde wereld moet entiteitseigenschappen in een toestand houden die elke specifieke camera overleeft. De post zegt het ronduit: omdat entiteitseigenschappen onafhankelijk van een bepaalde weergave behouden blijven, zijn ze beschikbaar wanneer een entiteit buiten beeld is. Dat is de zin die Agora-2 onderscheidt van een videomodel. Een generator die alleen op recente frames conditioneert, verliest het monster op het moment dat je ervan wegkijkt; een wereldmodel dat een expliciete toestand bijhoudt, niet.

A screenshot of Odyssey's Agora-2 announcement page showing the Odyssey navigation bar and an 'Agora-2' button above a wide three-panel still of rendered gameplay, the headline 'Introducing Agora-2: Advancing Multi-Agent World Simulation', the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', the byline Oliver Cameron on the left with the date 'September 21st, 2026' on the right, and the opening paragraphs describing a playable research preview.

Vier GPU's kopen vier spelers

Het servingplan in het rapport is het minst bekendgemaakte onderdeel van Agora-2 en het nuttigst voor iedereen die wil inschatten wat een wereld als deze zou kosten. De configuratie van Odyssey voor een sessie met vier spelers bestaat uit vier NVIDIA RTX PRO 4500-kaarten: één renderer per GPU, waarbij een van die GPU's ook het simulatiemodel en het agentbeleid huisvest. De opgegeven doelstellingen zijn vijftien latente updates per seconde met dertig weergegeven frames per seconde.

Twee getallen in de bijlage maken die configuratie concreet. Bij 165 watt mat het team een inferentiereductie van 9,9% door een wijziging aan de renderer — van 62,92 milliseconden naar 56,69 milliseconden over 3.200 aanroepen per implementatie. En de training van de renderer was even specifiek: zestigduizend updates op 4.232.000 segmenten, gevolgd door nog eens zestigduizend op 4.332.800 segmenten, AdamW met een leersnelheid van 1e-4, batch 128, EMA 0,9999, uitgevoerd op 32 B200 GPU's. Dat corpus is uitgesplitst — 1.200.000 gevechtssegmenten met volledige selectie, 2.016.000 gestratificeerde segmenten met speciale vaardigheden, 504.000 segmenten voor het doorkruisen van lijken, 512.000 bewegingssegmenten zonder autonome entiteiten, en 100.800 segmenten voor de levenscyclus van boss-portalen.

Lees die twee alinea's samen en de vorm van het product is duidelijk. De renderer is de dure helft: qua parameters drie orden van grootte, bij serving één GPU per gelijktijdige kijker, en tijdens training tweeëndertig B200s. Het simulatiemodel — het deel dat daadwerkelijk bepaalt wat er in de wereld gebeurt — heeft vierenhalf miljoen parameters, wat kleiner is dan de meeste embeddingtabellen. Agora-2 is een renderingprobleem in een game-engine-kostuum.

De gepubliceerde cijfers, en het ene ding dat ze niet laten zien

De kwantitatieve resultaten van het rapport zijn, volgens Odyssey's eigen framing, ablaties van zijn eigen ontwerpkeuzes in plaats van competitieve benchmarkscores, en ze moeten ook zo worden gelezen:

• Gestructureerde prefix versus een VAE-baseline — 0,001279 gemiddelde kwadratische fout en 30,11 dB PSNR tegenover 0,010272 en 20,67 dB, een winst van 9,44 dB, over 90 gepaarde evaluaties uit 30 clips en 3 seeds

• Renderer-aandacht — 20,09 milliseconden per denoiser-update van twee frames met de gestructureerde prefix, tegenover 37,06 met cross-attention en 18,82 met gepoolde AdaLN: een reductie van 45,8% op de denoiser en 34,1% op de core

• History-dropout van 50% — 0,05695 streaming-fout en 0,19535 cold-start tegenover 0,06041 en 0,21082 zonder dropout, bij een iets slechtere kaartperturbatietrouw

Simulatienauwkeurigheid — 85,17% bij het voorspellen van bewegingsvertakkingen, 68,17% op de moeilijkere subset met geblokkeerde voorbeelden, en 95,84% in animatiemodus, met voorspelde moduswisselingen van 7,49% tegenover 3,54% geregistreerd

Elk van die cijfers is gemeten ten opzichte van een andere configuratie van Agora-2. Geen ervan is een vergelijking met een uitgebracht systeem, en geen ervan beschrijft live gameplay. Sectie 8 van het rapport is openhartig over de kloof. Overdracht naar nieuwe assets, regels of omgevingen blijft ongetest. Fouten stapelen zich op. Onafhankelijk gegenereerde beelden kunnen nog steeds van elkaar afwijken qua uiterlijk, zichtbaarheid of timing van gebeurtenissen. En de zin die het waard is om volledig te citeren: aanhoudende framesnelheid en input-naar-weergave-latentie tijdens live multi-agentinteractie zijn niet kwantitatief geëvalueerd. De vijftien updates per seconde en dertig frames per seconde hierboven zijn streefwaarden, geen metingen.

A generated scoreboard titled 'Agora-2 — what the report actually reports' listing six rows: participants — 4 human controllers plus 16 autonomous entities; simulation model — 4,457,777 parameters; renderer — about one billion parameters, five solver steps; serving — 4x RTX PRO 4500 per four-player session; targets — 15 latent updates and 30 displayed frames per second; live latency evaluation — none published. A footer reads 'All figures reported by Odyssey; none independently reproduced.'

Waar de preview zich bevindt, en wat deze niet bevat

De speelbare preview staat op de eigen site van Odyssey, bereikbaar via het demo-adres agora.odyssey.ml, dat doorverwijst naar agora.odyssey.systems. Het technische rapport is de PDF waarnaar in dezelfde aankondiging wordt gelinkt. Wat niet is gepubliceerd is even opmerkelijk als wat wel is: geen modelgewichten, geen repository, geen licentie, geen inferentie-API en geen prijs. Odyssey beschrijft de release als een onderzoekspreview en beschouwt het traject naar multi-agentinteractie binnen zijn fundamentele wereldmodellen als toekomstig werk, waarbij PROWL wordt genoemd als de onderzoekslijn die het uitbreidt en Odyssey-3 als de uiteindelijke bestemming.

Dat is belangrijk voor iedereen die van plan is om op Agora-2 te bouwen, want het praktische antwoord vandaag is dat het niet kan — niet via ons en niet via het gehoste endpoint van iemand anders. OrcaRouter bedient Agora-2, Agora-1 of Odyssey-3 niet; die modelroutes bestaan niet in onze catalogus. Wat ons platform wél biedt, is de rest van een build die rond een aangeleerde wereld zou kunnen zitten: één endpoint dat 200+ modellen dekt, geprijsd tegen het lijsttarief van elke provider, zonder markup, dus wanneer een leverancier een prijs verlaagt, is de wijziging hier dezelfde dag live, en een routeringslaag die een verzoek automatisch laat uitwijken wanneer een provider degradeert. Als je uiteindelijk een model gebruikt om levelindelingen te genereren, beleidscode te schrijven of opgenomen gameplay te ondertitelen, is dat het deel waarbij we daadwerkelijk kunnen helpen.

Wat te kijken

Agora-2 is een echt resultaat met een echte kanttekening, en de twee zijn gemakkelijk te verwarren. Het resultaat is dat een gedeelde, persistente wereld met meerdere omgevingen kan worden gesimuleerd en gerenderd voor twintig deelnemers op basis van een corpus van opgenomen spel, en dat Odyssey kan wijzen op de specifieke ontwerpbeslissingen — expliciete toestand, een gestructureerde conditioneringsprefix, een klein simulatiemodel — die het mogelijk maakten. De kanttekening is dat sectie 8 van het artikel zelf live-latentie, aanhoudende framerate, overdracht tussen omgevingen en foutaccumulatie als niet-geëvalueerd noemt. Totdat iemand een framerate-trace van een echte sessie met vier spelers publiceert, is de eerlijke samenvatting dat Agora-2 de architectuur bewijst en de ervaring ongemeten laat.

Het tweede punt is de reisrichting. Odyssey zelf positioneert Agora-2 als een stap op weg naar het onderbrengen van multi-agent-interactie in een fundamenteel wereldmodel, met PROWL als de onderzoeksuitbreiding en Odyssey als het genoemde doel. Als dat gebeurt, houdt de interessante vraag op te zijn of een wereldmodel twintig deelnemers kan dragen, en wordt het de vraag of een wereldmodel hen kan meenemen naar een wereld waarin het nooit is getraind — precies de transfervraag die het huidige rapport weigert te beantwoorden.

A screenshot of Odyssey's Agora-2 announcement page scrolled into the body of the post, showing the paragraph describing Agora-2 as a learned game engine, the 'Experience Agora-2' and 'Read Technical Report' buttons, the 'Going forward' paragraph, two side-by-side gameplay panels captioned '2 humans battling RL-trained agents inside Agora-2, all in real time', and the section heading 'A World Simulation That Humans and Agents Can Share' with its opening paragraph explaining that Agora-2 maintains an explicit shared state that accounts for multiple participants' actions and their effects on one another.