Una hero card generata per 'Agora-2: Odyssey's Playable World Model esegue 20 partecipanti su quattro GPU'. Tre icone a linee piatte sono disposte lungo la parte superiore — un globo con persone, una rete di nodi e un chip etichettato GPU — sopra il titolo, con il sottotitolo 'Ogni fotogramma proviene dal modello' sotto di esso. Tre pillole informative arrotondate lungo la parte inferiore riportano '20 partecipanti', 'modello di simulazione con 4.457.777 parametri' e 'renderer con ~1 miliardo di parametri'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Engineering & Research

Agora-2: il modello di mondo giocabile di Odyssey esegue 20 partecipanti su quattro GPU

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Agora-2 mette venti partecipanti in un'unica simulazione e la definisce un'anteprima di ricerca giocabile. Odyssey l'ha pubblicato il 21 settembre 2026 in un post intitolato "Introduzione ad Agora-2: Progressi nella simulazione multi-agente del mondo", firmato da Oliver Cameron, e il numero che circola è il venti. Il numero che conta è la suddivisione al suo interno. Una sessione supporta fino a quattro controllori umani simultanei accanto a sedici entità autonome, e non sono lo stesso tipo di partecipante: quattro persone che digitano comandi di movimento, sedici policy che li eseguono. Odyssey ha addestrato le policy da sé, su livelli di un gioco su cui è stato addestrato anche il mondo: il paper afferma che il mondo viene appreso da catture di Diablo II.

Quella distinzione tra partecipanti controllati e simulati è dove vive quasi tutto ciò che di interessante c'è in Agora-2. È anche il punto in cui la maggior parte della copertura diventerà confusa, perché "20 giocatori" è una frase più pulita di "quattro giocatori e sedici agenti addestrati che condividono uno stato che sopravvive fuori schermo". Ciò che Odyssey sta distribuendo non è un generatore video con il multiplayer imbullonato sopra. È più simile a un server di gioco le cui fisica, animazione e rendering sono stati tutti sostituiti da componenti addestrati, e la cui unica vera fonte di contenuti è un dataset di partite registrate.

Venti partecipanti corrispondono a quattro persone e sedici politiche

Odyssey afferma esplicitamente che Agora-2 supporta cinque volte il numero di partecipanti di Agora-1 e che è passato dalla simulazione di un singolo ambiente alla simulazione di più ambienti con un comportamento a lungo orizzonte. La struttura per sessione si presenta così:

• Controller umani — fino a 4 simultanei, ognuno fornisce input di movimento e azione

• Entità autonome — 16 per sessione, guidate da policy apprese per mostri e compagni anziché dai giocatori

• Partecipanti totali — 20 in un unico stato del mondo condiviso, che è il dato con cui Odyssey apre

• Ambienti — molteplici, in aumento rispetto al singolo ambiente che Agora-1 era in grado di simulare

• Base dei contenuti — catture di Diablo II, quindi il mondo, gli asset e le regole sono tutti ereditati da un unico corpus registrato

• Forma di rilascio — un'anteprima di ricerca giocabile, non un prodotto, senza pesi, senza licenza e senza prezzo

I sedici autonomi non sono decorazione. Il rapporto di Odyssey descrive l'addestramento di politiche separate per mostri e compagni, e i conteggi di valutazione sono specifici: 23.771 esempi di politica per mostri della fase finale, tratti da un insegnante di base più dati di recupero e mantenimento, e 128.005 esempi per la politica dei compagni, valutati rispettivamente rispetto a 252 episodi di valutazione e 24 casi di valutazione. Sono queste politiche a far sembrare popolata una sessione da quattro persone. Sono anche il motivo per cui il numero di partecipanti è una scelta progettuale anziché una dichiarazione di capacità: sedici è il numero di agenti che il server del mondo è stato addestrato a supportare insieme a quattro umani, non quanti ne potrebbe teoricamente ospitare.

L'architettura è un modello piccolo e uno grande

Agora-2 separa la cosa che decide cosa succede dalla cosa che decide che aspetto ha, e il divario di dimensioni tra loro è il numero più sorprendente del paper. Il modello di simulazione ha 4.457.777 parametri — circa 4,46 milioni, quattro strati, larghezza 256, quattro teste, una finestra di cronologia di quattro passi, quattordici rami di movimento e una testa separata per l'orientamento. Il renderer è un transformer flow-matching di circa un miliardo di parametri, sedici blocchi a larghezza 2.048, cinque dei quali con attenzione temporale causale, eseguito per cinque passi del solver per aggiornamento.

Il renderer è condizionato da un prefisso di 342 token anziché dal mondo grezzo:

• Mappa — 144 token, una griglia locale di tile 12×12 attorno al punto di vista

• Entità — 36 token, quattro per i partecipanti controllati dall'utente e 32 per gli altri slot di entità

• Effetti transitori — 160 token per effetti che non sono né mappa né entità

• Visualizza ed elenco — un token ciascuno per l'azione della fotocamera e l'elenco della sessione

• Per aggiornamento — 300 token immagine che applicano attenzione su quei 342 token di condizionamento

• Codec — un latente basato su RAE a 2 frame in 15×20×32, poi x264 CRF 18 o NVENC QP 18 in uscita

Odyssey indica il motivo per cui il condizionamento è strutturato in questo modo: un mondo appreso deve mantenere le proprietà delle entità in uno stato che sopravvive a una particolare camera. Il post lo dice chiaramente: poiché le proprietà delle entità sono conservate indipendentemente da qualsiasi vista particolare, restano disponibili quando un'entità è fuori dall'inquadratura. Questa è la frase che distingue Agora-2 da un modello video. Un generatore che si condiziona solo sui fotogrammi recenti perde il mostro nel momento in cui distogli lo sguardo da esso; un modello del mondo che mantiene uno stato esplicito no.

A screenshot of Odyssey's Agora-2 announcement page showing the Odyssey navigation bar and an 'Agora-2' button above a wide three-panel still of rendered gameplay, the headline 'Introducing Agora-2: Advancing Multi-Agent World Simulation', the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', the byline Oliver Cameron on the left with the date 'September 21st, 2026' on the right, and the opening paragraphs describing a playable research preview.

Quattro GPU comprano quattro giocatori

Il piano di serving nel report è la parte meno pubblicizzata di Agora-2 e la più utile per chiunque voglia stimare quanto costerebbe un mondo come questo. La configurazione di Odyssey per una sessione a quattro giocatori prevede quattro schede NVIDIA RTX PRO 4500: un renderer per GPU, con una di quelle GPU che ospita anche il modello di simulazione e la policy dell'agente. Gli obiettivi dichiarati sono quindici aggiornamenti latenti al secondo con trenta fotogrammi visualizzati al secondo.

Due numeri nell'appendice rendono concreta quella configurazione. A 165 watt, il team ha misurato una riduzione dell'inferenza del 9,9% grazie a una modifica al renderer — da 62,92 millisecondi a 56,69 millisecondi su 3.200 chiamate per implementazione. E l'addestramento del renderer era altrettanto specifico: sessantamila aggiornamenti su 4.232.000 segmenti seguiti da altri sessantamila su 4.332.800 segmenti, AdamW con un learning rate di 1e-4, batch 128, EMA 0,9999, eseguito su 32 GPU B200. Quel corpus è dettagliato voce per voce — 1.200.000 segmenti di combattimento con roster completo, 2.016.000 segmenti stratificati di abilità speciali, 504.000 segmenti di attraversamento dei cadaveri, 512.000 segmenti di movimento senza entità autonome e 100.800 segmenti del ciclo di vita del portale del boss.

Leggi quei due paragrafi insieme e la forma del prodotto è chiara. Il renderer è la metà costosa di tre ordini di grandezza nei parametri, una GPU per ogni spettatore simultaneo in serving, e trentadue B200 in addestramento. Il modello di simulazione — la parte che decide davvero ciò che accade nel mondo — ha quattro milioni e mezzo di parametri, meno della maggior parte delle tabelle di embedding. Agora-2 è un problema di rendering travestito da motore di gioco.

I numeri pubblicati, e l'unica cosa che non mostrano

I risultati quantitativi del report sono, secondo l'inquadramento dato da Odyssey stessa, ablazioni delle sue stesse scelte progettuali anziché punteggi competitivi di benchmark, e dovrebbero essere letti in questo modo:

• Prefisso strutturato rispetto a una baseline VAE — errore quadratico medio 0,001279 e PSNR 30,11 dB contro 0,010272 e 20,67 dB, un guadagno di 9,44 dB, su 90 valutazioni appaiate da 30 clip e 3 seed

• Attenzione del renderer — 20,09 millisecondi per aggiornamento del denoiser a due frame con il prefisso strutturato, contro 37,06 con cross-attention e 18,82 con AdaLN pooled, una riduzione del 45,8% sul denoiser e del 34,1% sul core

• Dropout della cronologia al 50% — errore di streaming 0.05695 e avvio a freddo 0.19535 rispetto a 0.06041 e 0.21082 senza dropout, con una fedeltà alla perturbazione della mappa leggermente peggiore

• Precisione della simulazione — 85,17% sulla previsione del ramo di movimento, 68,17% sul sottoinsieme più difficile di esempi bloccati, e 95,84% in modalità animazione, con cambi di modalità previsti al 7,49% rispetto al 3,54% registrato

Ognuno di quei valori è misurato rispetto a un’altra configurazione di Agora-2. Nessuno di essi è un confronto con un sistema rilasciato, e nessuno di essi descrive il gioco in tempo reale. La Sezione 8 del rapporto è sincera riguardo al divario. Il trasferimento a nuovi asset, regole o ambienti rimane non testato. Gli errori si accumulano. Le immagini generate in modo indipendente possono ancora discordare nell’aspetto, nella visibilità o nella temporizzazione degli eventi. E la frase che vale la pena citare per intero: il frame rate sostenuto e la latenza dall’input alla visualizzazione durante l’interazione in tempo reale tra più agenti non sono stati valutati quantitativamente. I quindici aggiornamenti al secondo e i trenta fotogrammi al secondo sopra indicati sono obiettivi, non misurazioni.

A generated scoreboard titled 'Agora-2 — what the report actually reports' listing six rows: participants — 4 human controllers plus 16 autonomous entities; simulation model — 4,457,777 parameters; renderer — about one billion parameters, five solver steps; serving — 4x RTX PRO 4500 per four-player session; targets — 15 latent updates and 30 displayed frames per second; live latency evaluation — none published. A footer reads 'All figures reported by Odyssey; none independently reproduced.'

Dove si trova l'anteprima e cosa non include

L'anteprima giocabile si trova sul sito di Odyssey, raggiungibile tramite l'indirizzo demo agora.odyssey.ml, che reindirizza a agora.odyssey.systems. Il rapporto tecnico è il PDF collegato dallo stesso annuncio. Ciò che non è pubblicato è tanto notevole quanto ciò che lo è: nessun peso del modello, nessun repository, nessuna licenza, nessuna API di inferenza e nessun prezzo. Odyssey descrive il rilascio come un'anteprima di ricerca e considera il percorso verso l'interazione multi-agente all'interno dei suoi modelli fondazionali del mondo come lavoro futuro, con PROWL elencato come il filone di ricerca che sta ampliando e Odyssey-3 indicato come la destinazione finale.

Questo è importante per chiunque stia pianificando di sviluppare su Agora-2, perché la risposta pratica oggi è che non è possibile — né tramite noi né tramite l'endpoint ospitato di chiunque altro. OrcaRouter non serve Agora-2, Agora-1 o Odyssey-3; quelle rotte dei modelli non esistono nel nostro catalogo. Ciò che la nostra piattaforma offre è il resto di una build che potrebbe ruotare attorno a un mondo appreso: un unico endpoint che copre oltre 200 modelli, al prezzo di listino di ciascun provider e senza alcun ricarico, così quando un fornitore abbassa un prezzo la modifica è già attiva qui lo stesso giorno, e un livello di routing che reindirizza automaticamente una richiesta quando un provider peggiora. Se poi finisci per usare un modello per generare layout di livelli, scrivere codice di policy o sottotitolare gameplay registrato, questa è la parte in cui possiamo davvero aiutarti.

Cosa guardare

Agora-2 è un risultato reale con un'avvertenza reale, ed è facile confondere le due cose. Il risultato è che un mondo condiviso, persistente e multi-ambiente può essere simulato e renderizzato per venti partecipanti a partire da un corpus di partite registrate, e che Odyssey può indicare le specifiche decisioni progettuali — stato esplicito, un prefisso di condizionamento strutturato, un modello di simulazione minuscolo — che l'hanno reso possibile. L'avvertenza è che la sezione 8 del paper stesso elenca latenza in tempo reale, frame rate sostenuto, trasferimento tra ambienti e accumulo di errori come non valutati. Finché qualcuno non pubblica una traccia del frame rate di una vera sessione a quattro giocatori, il riassunto onesto è che Agora-2 dimostra l'architettura e lascia l'esperienza non misurata.

La seconda cosa da tenere d'occhio è la direzione di marcia. L'impostazione stessa di Odyssey colloca Agora-2 come un passo verso l'inserimento dell'interazione multi-agente all'interno di un modello fondazionale del mondo, con PROWL come espansione della ricerca e Odyssey-3 come obiettivo dichiarato. Se ciò accadrà, la domanda interessante smetterà di essere se un modello del mondo possa sostenere venti partecipanti e diventerà se un modello del mondo possa portarli in un mondo su cui non è mai stato addestrato — che è precisamente la questione di trasferimento a cui il rapporto attuale si astiene dal rispondere.

A screenshot of Odyssey's Agora-2 announcement page scrolled into the body of the post, showing the paragraph describing Agora-2 as a learned game engine, the 'Experience Agora-2' and 'Read Technical Report' buttons, the 'Going forward' paragraph, two side-by-side gameplay panels captioned '2 humans battling RL-trained agents inside Agora-2, all in real time', and the section heading 'A World Simulation That Humans and Agents Can Share' with its opening paragraph explaining that Agora-2 maintains an explicit shared state that accounts for multiple participants' actions and their effects on one another.