Une carte hero générée pour « Agora-2 : Odyssey's Playable World Model fait tourner 20 participants sur quatre GPU ». Trois icônes linéaires plates sont alignées en haut — un globe avec des personnes, un réseau de nœuds et une puce étiquetée GPU — au-dessus du titre, avec le sous-titre « Chaque image provient du modèle » en dessous. Trois pastilles d'informations arrondies en bas affichent « 20 participants », « modèle de simulation à 4 457 777 paramètres » et « moteur de rendu à ~1 Md de paramètres ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Engineering & Research

Agora-2 : le modèle de monde jouable d'Odyssey fait tourner 20 participants sur quatre GPU

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Agora-2 place vingt participants dans une seule simulation et la présente comme un aperçu de recherche jouable. Odyssey l'a publié le 21 septembre 2026 dans un article intitulé « Agora-2: Advancing Multi-Agent World Simulation », signé par Oliver Cameron, et le nombre qui circule est vingt. Le nombre qui compte, c'est la répartition qu'il contient. Une session prend en charge jusqu'à quatre contrôleurs humains simultanés aux côtés de seize entités autonomes, et ce ne sont pas des participants du même genre — quatre personnes qui tapent des commandes de déplacement, seize politiques en cours d'exécution. Odyssey a entraîné les politiques lui-même, sur des niveaux d'un jeu sur lequel il s'est également entraîné : l'article indique que le monde est appris à partir de captures de Diablo II.

C’est dans cette distinction entre participants contrôlés et simulés que réside presque tout ce qui est intéressant dans Agora-2. C’est aussi là que la plupart de la couverture médiatique s’embrouillera, car « 20 joueurs » est une phrase plus nette que « quatre joueurs et seize agents entraînés partageant un état qui persiste hors écran ». Ce qu’Odyssey livre n’est pas un générateur vidéo auquel on a greffé du multijoueur. Il s’apparente davantage à un serveur de jeu dont la physique, l’animation et le rendu ont tous été remplacés par des composants appris, et dont la seule véritable source de contenu est un jeu de données de parties enregistrées.

Vingt participants, c'est quatre personnes et seize politiques.

Odyssey est explicite sur le fait qu’Agora-2 prend en charge cinq fois plus de participants qu’Agora-1 et qu’il est passé de la simulation d’un seul environnement à la simulation de plusieurs environnements avec un comportement à plus long terme. La structure par session se présente comme suit :

• Contrôleurs humains — jusqu’à 4 simultanés, chacun fournissant les entrées de déplacement et d’action

• Entités autonomes — 16 par session, pilotées par des politiques de monstres et de compagnons apprises plutôt que par les joueurs

• Participants au total — 20 dans un même état de monde partagé, ce qui est le chiffre qu’Odyssey met en avant

• Environnements — multiples, alors qu’Agora-1 ne pouvait en simuler qu’un seul

• Base de contenu — captures de Diablo II, donc le monde, les assets et les règles sont tous hérités d’un corpus enregistré

• Format de publication — un aperçu de recherche jouable, pas un produit, sans poids, sans licence ni prix

Les seize agents autonomes ne sont pas là pour décorer. Le rapport d’Odyssey décrit l’entraînement de politiques distinctes pour les monstres et les compagnons, et les chiffres de l’évaluation sont précis : 23 771 exemples de politique de monstre de phase finale tirés d’un enseignant de base, plus des données de récupération et de rétention, et 128 005 exemples pour la politique de compagnon, évalués respectivement sur 252 épisodes d’évaluation et 24 cas d’évaluation. Ce sont ces politiques qui donnent à une session à quatre personnes l’impression d’être peuplée. Elles sont aussi la raison pour laquelle le nombre de participants relève d’un choix de conception plutôt que d’une affirmation de capacité — seize est le nombre d’agents que le serveur de monde a été entraîné à prendre en charge aux côtés de quatre humains, et non le nombre qu’il pourrait théoriquement contenir.

L’architecture est composée d’un petit modèle et d’un grand.

Agora-2 sépare ce qui décide de ce qui se passe de ce qui décide de son apparence, et l'écart de taille entre les deux est le chiffre le plus frappant de l'article. Le modèle de simulation compte 4 457 777 paramètres — environ 4,46 million, quatre couches d'épaisseur, une largeur de 256, quatre têtes, une fenêtre d'historique de quatre pas, quatorze branches de mouvement et une tête distincte pour l'orientation. Le moteur de rendu est un transformer de flow matching d'environ un milliard de paramètres, seize blocs d'une largeur de 2 048, dont cinq portent une attention temporelle causale, exécuté sur cinq étapes de solveur par mise à jour.

Le moteur de rendu est conditionné sur un préfixe de 342 tokens plutôt que sur le monde brut :

• Carte — 144 jetons, une grille de tuiles locale 12×12 autour du point de vue

• Entités — 36 jetons, quatre pour les participants contrôlés par l'utilisateur et 32 pour les emplacements d'autres entités

• Effets transitoires — 160 tokens pour les effets qui ne sont ni une carte ni une entité

• Voir et liste des participants — un jeton chacun pour l'action de la caméra et la liste des participants à la session

Par mise à jour — 300 jetons d’image qui prêtent attention à ces 342 jetons de conditionnement

• Codec — un latent basé sur RAE à 2 images en 15×20×32, puis x264 CRF 18 ou NVENC QP 18 en sortie

Odyssey énonce la raison pour laquelle le conditionnement est structuré de cette façon : un monde appris doit conserver les propriétés des entités dans un état qui survit à toute caméra particulière. Le post le formule sans détour — parce que les propriétés des entités sont conservées indépendamment de toute vue particulière, elles restent disponibles lorsqu'une entité est hors cadre. C'est la phrase qui sépare Agora-2 d'un modèle vidéo. Un générateur qui n'est conditionné que par les images récentes perd le monstre dès qu'on se détourne de lui ; un modèle du monde qui maintient un état explicite, lui, ne le perd pas.

A screenshot of Odyssey's Agora-2 announcement page showing the Odyssey navigation bar and an 'Agora-2' button above a wide three-panel still of rendered gameplay, the headline 'Introducing Agora-2: Advancing Multi-Agent World Simulation', the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', the byline Oliver Cameron on the left with the date 'September 21st, 2026' on the right, and the opening paragraphs describing a playable research preview.

Quatre GPU achètent quatre joueurs

Le plan de service dans le rapport est la partie la moins publicisée d’Agora-2 et la plus utile pour quiconque cherche à estimer ce que coûterait un monde comme celui-ci. La configuration d’Odyssey pour une session à quatre joueurs est de quatre cartes NVIDIA RTX PRO 4500 : un moteur de rendu par GPU, l’un de ces GPU hébergeant aussi le modèle de simulation et la politique d’agent. Les objectifs annoncés sont de quinze mises à jour latentes par seconde, avec trente images affichées par seconde.

Deux chiffres dans l’annexe rendent cette configuration concrète. À 165 watts, l’équipe a mesuré une réduction du temps d’inférence de 9,9 % due à une modification du moteur de rendu — de 62,92 millisecondes à 56,69 millisecondes sur 3 200 appels par implémentation. Et l’entraînement du moteur de rendu était tout aussi précis : soixante mille mises à jour sur 4 232 000 segments, suivies de soixante mille autres sur 4 332 800 segments, AdamW avec un taux d’apprentissage de 1e-4, batch 128, EMA 0,9999, exécuté sur 32 GPU B200. Ce corpus est détaillé — 1 200 000 segments de combat à effectif complet, 2 016 000 segments stratifiés de capacités spéciales, 504 000 segments de traversée de cadavres, 512 000 segments de déplacement sans entités autonomes, et 100 800 segments de cycle de vie de portail de boss.

Lisez ces deux paragraphes ensemble et la forme du produit est claire. Le moteur de rendu est la moitié coûteuse : trois ordres de grandeur de plus en paramètres, un GPU par spectateur simultané en serving, et trente-deux B200 en entraînement. Le modèle de simulation — la partie qui décide réellement de ce qui se passe dans le monde — compte quatre millions et demi de paramètres, soit moins que la plupart des tables d'embedding. Agora-2 est un problème de rendu qui porte le costume d'un moteur de jeu.

Les chiffres publiés, et la seule chose qu’ils ne montrent pas

Les résultats quantitatifs du rapport sont, selon la propre formulation d’Odyssey, des ablations de ses propres choix de conception plutôt que des scores de benchmark compétitifs, et ils doivent être lus comme tels :

• Préfixe structuré vs une référence VAE — 0,001279 d'erreur quadratique moyenne et 30,11 dB de PSNR contre 0,010272 et 20,67 dB, un gain de 9,44 dB, sur 90 évaluations appariées issues de 30 clips et 3 graines

Attention du moteur de rendu — 20,09 millisecondes par mise à jour du débruiteur sur deux images avec le préfixe structuré, contre 37,06 avec l'attention croisée et 18,82 avec AdaLN regroupé, soit une réduction de 45,8 % du débruiteur et de 34,1 % sur le cœur

• Dropout d'historique à 50 % — 0,05695 d'erreur de streaming et 0,19535 de démarrage à froid contre 0,06041 et 0,21082 sans dropout, avec une fidélité de perturbation de carte légèrement moins bonne

• Précision de la simulation — 85,17 % pour la prédiction des branches de mouvement, 68,17 % sur le sous-ensemble plus difficile d’exemples bloqués, et 95,84 % en mode animation, avec des changements de mode prédits à 7,49 % contre 3,54 % enregistrés

Chacun de ces chiffres est mesuré par rapport à une autre configuration d’Agora-2. Aucun d’entre eux n’est une comparaison avec un système livré, et aucun ne décrit de jeu en direct. La section 8 du rapport est franche sur cet écart. Le transfert vers de nouveaux actifs, règles ou environnements reste non testé. Les erreurs s’accumulent. Des images générées indépendamment peuvent encore diverger en apparence, en visibilité ou en timing des événements. Et la phrase qui mérite d’être citée intégralement : la fréquence d’images soutenue et la latence entre l’entrée et l’affichage pendant une interaction multi-agents en direct n’ont pas été évaluées quantitativement. Les quinze mises à jour par seconde et les trente images par seconde ci-dessus sont des objectifs, pas des mesures.

A generated scoreboard titled 'Agora-2 — what the report actually reports' listing six rows: participants — 4 human controllers plus 16 autonomous entities; simulation model — 4,457,777 parameters; renderer — about one billion parameters, five solver steps; serving — 4x RTX PRO 4500 per four-player session; targets — 15 latent updates and 30 displayed frames per second; live latency evaluation — none published. A footer reads 'All figures reported by Odyssey; none independently reproduced.'

Où se trouve l’aperçu, et ce qu’il n’inclut pas

L'aperçu jouable se trouve sur le site d'Odyssey, accessible via l'adresse de démonstration agora.odyssey.ml, qui redirige vers agora.odyssey.systems. Le rapport technique est le PDF lié depuis la même annonce. Ce qui n'est pas publié est tout aussi notable que ce qui l'est : aucun poids de modèle, aucun dépôt, aucune licence, aucune API d'inférence et aucun prix. Odyssey décrit la publication comme un aperçu de recherche et considère la trajectoire vers l'interaction multi-agents au sein de ses modèles de monde fondamentaux comme des travaux futurs, PROWL étant cité comme le fil de recherche qu'Odyssey développe et Odyssey-3 comme la destination finale.

Cela compte pour quiconque envisage de développer sur Agora-2, car la réponse pratique aujourd'hui est que c'est impossible — ni par notre intermédiaire, ni via le point de terminaison hébergé de qui que ce soit d'autre. OrcaRouter ne sert pas Agora-2, Agora-1 ni Odyssey-3 ; ces routes de modèles n'existent pas dans notre catalogue. Ce que notre plateforme propose, c'est le reste d'une architecture qui pourrait graviter autour d'un monde appris : un point de terminaison unique couvrant plus de 200 modèles, facturé au tarif catalogue de chaque fournisseur, sans aucune marge, de sorte que lorsqu'un fournisseur baisse un prix, le changement est effectif ici le jour même, et une couche de routage qui bascule automatiquement une requête en cas de dégradation d'un fournisseur. Si vous finissez par utiliser un modèle pour générer des niveaux, écrire du code de politique ou légender des séquences de jeu enregistrées, c'est la partie pour laquelle nous pouvons réellement vous aider.

Que regarder

Agora-2 est un résultat réel avec une réserve bien réelle, et il est facile de confondre les deux. Le résultat, c'est qu'un monde partagé, persistant et multi-environnements peut être simulé et rendu pour vingt participants à partir d'un corpus de parties enregistrées, et qu'Odyssey peut pointer les décisions de conception précises — état explicite, préfixe de conditionnement structuré, modèle de simulation minuscule — qui l'ont rendu possible. La réserve, c'est que la section 8 de l'article lui-même classe la latence en direct, la fréquence d'images soutenue, le transfert entre environnements et l'accumulation d'erreurs comme non évalués. Tant que personne ne publie une trace de fréquence d'images issue d'une véritable session à quatre joueurs, le résumé honnête est qu'Agora-2 prouve l'architecture et laisse l'expérience non mesurée.

La deuxième chose à surveiller, c’est la direction que prend l’évolution. Le cadrage propre à Odyssey présente Agora-2 comme une étape vers l’intégration de l’interaction multi-agents dans un modèle du monde fondationnel, avec PROWL comme prolongement de recherche et Odyssey-3 comme cible nommée. Si cela se produit, la question intéressante cesse d’être de savoir si un modèle du monde peut supporter vingt participants ; elle devient de savoir s’il peut les transporter dans un monde sur lequel il n’a jamais été entraîné — ce qui est précisément la question du transfert à laquelle le rapport actuel refuse de répondre.

A screenshot of Odyssey's Agora-2 announcement page scrolled into the body of the post, showing the paragraph describing Agora-2 as a learned game engine, the 'Experience Agora-2' and 'Read Technical Report' buttons, the 'Going forward' paragraph, two side-by-side gameplay panels captioned '2 humans battling RL-trained agents inside Agora-2, all in real time', and the section heading 'A World Simulation That Humans and Agents Can Share' with its opening paragraph explaining that Agora-2 maintains an explicit shared state that accounts for multiple participants' actions and their effects on one another.