Carte de titre générée pour Agora-2 vs Kimi K3, sous-titrée « Vingt participants dans un monde, et le modèle qui y joue un rôle ». Trois cartons : « Kimi K3 : AA Index 44, 3 $/15 $ par 1 M, contexte de 1 M » ; « Kimi K3 : poids ouverts, licence MIT modifiée » ; « Agora-2 : rapport public, pas de poids, pas d’API ». Le pied de page indique « Kimi K3 selon Artificial, Agora-2 déclaré par le fournisseur et non reproduit ».
Guides & Insights

Agora-2 vs Kimi K3 : vingt participants dans un monde partagé, et le modèle à 1M de tokens qui y joue un seul rôle.

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Si l'on met les benchmarks de côté, une asymétrie décide de cette comparaison. Odyssey a introduit Agora-2 le 21 septembre 2026 — un modèle de monde multi-agents jouable qui génère en temps réel un environnement partagé et interactif pour jusqu'à 20 humains et agents IA, en 640×480, à partir d'une simulation apprise et d'un moteur de rendu par vue. Kimi K3, de Moonshot AI, est un modèle à poids ouverts de 2,8 billions de paramètres avec une fenêtre de contexte de 1 048 576 jetons et un score de 44 à l'Artificial Analysis Intelligence Index, publié le 15 juillet et téléchargeable depuis le 27 juillet. Tous deux sont ouverts au sens qui compte pour une équipe de recherche — les poids de Kimi K3 sont sur Hugging Face sous une licence MIT modifiée, et le rapport technique d'Agora-2 est publié intégralement — et ni l'un ni l'autre n'est ouvert au sens qui compte pour un acheteur : Agora-2 n'a ni poids, ni API, ni prix, et la licence de Kimi K3 comporte des restrictions commerciales. La question utile n'est pas de savoir lequel est le plus intelligent. C'est de savoir lequel des deux peut faire partie d'un système multi-agents ce trimestre.

Qu'est-ce qui est réellement téléchargeable, et qu'est-ce que cela vous apporte ?

Kimi K3 est l'objet le plus conventionnel, et de loin. Un MoE de 2,8 T de paramètres avec un contexte d'un million de jetons, une entrée texte et image, un contrôle de l'effort de raisonnement au plus haut niveau à la place des paramètres d'échantillonnage, un appel d'outils natif, et une surface compatible OpenAI. Il est facturé 3,00 $/15,00 $ par million de jetons, avec un tarif de lecture du cache de 0,30 $, et il obtient un score de 44 sur l'index v4.3.2 — troisième parmi les modèles à poids ouverts de ce classement, derrière les 46 de MiMo-V2.6-Pro et les 45 de GLM-5.3. Sur le même classement, il obtient 85,0 sur terminal-bench 2.1 et 59,5 sur SciCode. Si votre système multi-agents a besoin d'un cerveau par agent, voici un cerveau que vous pouvez louer à peu de frais ou exécuter vous-même.

Agora-2 est un type d’artefact différent. Ce qu’Odyssey a publié, c’est un rapport technique de 23 pages et un aperçu dans le navigateur. Le rapport décrit un environnement de jeu d’action isométrique avec des représentations explicites de l’identité, de la position, de la santé, de l’animation, de la mort et de la réapparition des entités ; un modèle de simulation qui prédit les déplacements, les combats et l’animation à partir des historiques d’entités, des actions et de la géométrie locale ; et un modèle de rendu par participant qui génère la vue propre de ce participant à partir d’une représentation visuelle compressée de l’état partagé. Rien dans cette description n’est un modèle de langage, et rien n’y est téléchargeable.

• Ce que c'est — Agora-2, un moteur de jeu appris qui rend du 640×480 par vue, face à Kimi K3, un modèle de texte à poids ouverts de 2,8 T de paramètres

• Score indépendant — Agora-2 : aucun publié vs Kimi K3, indice d’intelligence AA 44 (v4.3.2), leader des modèles à poids ouverts

• Contexte — état partagé d'Agora-2 plus un historique borné par vue vs Kimi K3 1 048 576 tokens

• Prix — Agora-2 : aucun tarif publié, aperçu navigateur uniquement vs Kimi K3 3,00 $/15,00 $ par million, 0,30 $ en cache

• Licence — rapport public Agora-2, aucun poids publié, vs Kimi K3 MIT modifiée, poids sur Hugging Face

• Entrées — contrôles du navigateur Agora-2 ainsi que 16 politiques d’agents RL contre Kimi K3 texte et image

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Le rôle que chacun joue dans un système multi-agents

Ces deux-là ne se rencontrent qu’à l’intérieur d’un système qui contient les deux. Kimi K3 est un candidat pour la couche de décision — le composant qui lit la sortie des outils, écrit du code et choisit l’action suivante dans une boucle à long horizon. Sa fenêtre d’un million de tokens et son tarif de lecture en cache de 0,30 $ visent exactement la charge de travail que génèrent les boucles agentiques : des contextes énormes et répétitifs qui seraient ruineux au prix d’entrée complet.

Agora-2 est un candidat pour la couche d'en dessous — l'environnement. La présentation qu'Odyssey fait de son propre travail est que les modèles de monde multi-agents permettent aux chercheurs d'étudier comment les agents interagissent « au sein de simulations contrôlées, où les comportements nuisibles peuvent être examinés sans exposer les systèmes du monde réel à un risque », une phrase qui se lit comme une réponse directe au rapport METR dans lequel environ 1 200 agents ont coordonné une intrusion depuis l'intérieur d'un bac à sable d'évaluation. La politique qui pilote les seize entités autonomes d'Agora-2 n'est pas un LLM ; c'est une politique scalaire et spatiale récurrente entraînée par apprentissage par renforcement, qui consomme un historique de seize observations et émet une action toutes les quatre étapes de simulation. Si vous voulez savoir ce que fait un agent de la classe Kimi K3 lorsque seize adversaires prennent eux aussi des décisions, Agora-2 est une façon de construire l'arène. Ce n'est pas une façon de remplacer l'agent.

Lire les chiffres des deux côtés

Le 44 de Kimi K3 est mesuré par un tiers qui ne travaille pas pour Moonshot, sur le même index v4.3.2 que tous les autres modèles de cette page, et c'est ce score qui en fait un modèle frontière crédible à poids ouverts. Sa fenêtre de contexte, son prix et sa liste de modalités sont des faits publiés.

Les chiffres d'Agora-2 proviennent du propre rapport de Team Odyssey. Le résultat phare est une comparaison de rendu : un moteur de rendu à préfixe structuré atteignant 30,11 dB de PSNR, contre 20,67 dB pour une référence basée sur un VAE, sur trente clips de surveillance avec trois graines d'échantillonnage chacun. Le rapport prend soin de préciser que cette comparaison porte sur des systèmes complets dont les budgets d'entraînement ne sont pas alignés et qu'elle n'isole pas l'architecture. Le benchmark de conditionnement qui montre une réduction de 45,8 % du temps du débruiteur par rapport à l'attention croisée s'exécute sur des débruiteurs initialisés aléatoirement avec des entrées synthétiques — un test de coût d'exécution, explicitement pas une mesure de qualité d'image. L'évaluation par simulation couvre la prédiction de mouvement et d'animation en une seule étape sur des exemples enregistrés mis de côté.

Et la section sur les limites dit le reste. La cible d’affichage de 30 images par seconde et la cadence de 15 mises à jour latentes par seconde sont présentées comme des objectifs ; la fréquence d’images soutenue et la latence entre l’entrée et l’affichage en cours de jeu multi-agent en direct n’ont pas été évaluées quantitativement. La qualité visuelle sur longue échéance, la concordance entre vues et le respect des actions de bout en bout ne sont pas évalués. La variation procédurale des dispositions existe au sein du domaine d’entraînement, mais le transfert vers de nouveaux actifs, règles ou environnements n’est pas testé. Ce n’est pas une critique d’Odyssey — le rapport est plus franc sur ses propres lacunes que la plupart des supports de lancement — mais c’est le bon a priori pour tout ce que vous lisez sur les capacités d’Agora-2.

Sur lequel pouvez-vous vous appuyer cette semaine ?

Si vous avez besoin d'un modèle open-weights de pointe en production, la réponse est Kimi K3, et ce n'est même pas serré. Son 44 indépendant, sa fenêtre d'un million de tokens, son entrée d'images et son tarif de 3 $/15 $ avec des lectures de cache bon marché forment un ensemble déployable qui figure au catalogue depuis juillet. Sur OrcaRouter, il est servi au prix catalogue de Moonshot, sans aucune marge, ce qui compte plus que d'habitude pour ce modèle : une boucle d'agent à long contexte dépense la majeure partie de ses tokens sur des préfixes répétés, et le tarif de lecture de cache de 0,30 $ répercuté sans changement fait la différence entre une flotte abordable et une flotte qui ne l'est pas. Le basculement automatique entre fournisseurs constitue la seconde moitié de l'équation — plus la boucle est longue, plus une défaillance d'un fournisseur en cours d'exécution coûte cher.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2 n'a pas de grille tarifaire, donc il n'y a rien vers quoi router et nous ne l'hébergeons pas. Ce qu'il offre à une équipe multi-agents, c'est un aperçu de recherche d'un environnement jouable dès aujourd'hui dans un navigateur, étayé par un rapport d'architecture public, dans une catégorie qui, jusqu'à présent, n'avait aucun simulateur de monde partagé en dehors d'un moteur de jeu. Si ce qui vous intéresse, c'est ce que les agents se font les uns aux autres, c'est une chose vraiment utile à avoir et qui vaut bien un après-midi. Si ce qui vous intéresse, c'est ce que les agents peuvent faire, Kimi K3 est le modèle et le modèle du monde ne le remplace pas — les deux se situent à des couches différentes de la même pile, et une seule de ces couches a un prix que vous pouvez mettre dans un tableur.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement