Carton-titre généré pour Agora-2 vs MiniMax M3, sous-titré « Un GPU par participant, ou treize cents par million de jetons ». Trois cartons : « MiniMax M3 : 0,30 $/1,20 $ par 1M, 0,06 $ en cache » ; « MiniMax M3 : indice AA 29, contexte de 1M, poids ouverts » ; « Agora-2 : un RTX PRO 4500 par vue, aucun prix publié ». Le pied de page indique « MiniMax M3 selon Artificial Analysis ; Agora-2 déclaré par le fournisseur et non reproduit. »
Guides & Insights

Agora-2 vs MiniMax M3 : un GPU par participant, ou treize cents par million de jetons

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux façons de faire tourner une foule d'agents, facturées dans deux monnaies différentes. MiniMax M3 coûte 0,30 $ par million de jetons d'entrée et 1,20 $ par million de jetons de sortie — un tarif qui fait d'une expérience à mille agents une simple ligne budgétaire plutôt qu'une levée de fonds. Agora-2, le modèle de monde multi-agents Odyssey présenté en avant-première le 21 septembre 2026, coûte un NVIDIA RTX PRO 4500 par vue de participant : une session à quatre joueurs tourne sur quatre GPU, avec un modèle de rendu par carte générant la perspective 640×480 de ce joueur, et l'une de ces quatre cartes portant aussi la simulation partagée et les seize politiques d'agents autonomes. Le chiffre de MiniMax M3 est par jeton et évolue selon la quantité de réflexion de vos agents. Le chiffre d'Agora-2 est par paire d'yeux et évolue selon le nombre de participants simultanés que vous placez dans le monde. Les comparer, c'est comparer un budget de raisonnement à un budget de rendu, et pour quiconque prévoit une étude multi-agents en 2026, cela s'avère être la chose utile à faire.

Le côté jeton du registre

MiniMax M3 est le modèle phare à poids ouverts de MiniMax, publié le 31 mai 2026 : un mélange d’experts parcimonieux de 428 milliards de paramètres, dont environ 23 milliards de paramètres actifs par token, une fenêtre de contexte de 1 048 576 tokens dont MiniMax garantit 512 K utilisables, une entrée texte, image et vidéo, et un score de 29 sur l’Artificial Analysis Intelligence Index v4.3.2. Il annonce 83,5 sur BrowseComp et 76,1 sur BankerToolBench selon les chiffres du fournisseur — les propres chiffres de MiniMax, non reproduits ici — et Artificial Analysis le mesure à 145 tokens de sortie par seconde, soit le dixième modèle le plus rapide de ce classement.

Le chiffre pertinent pour les flottes d'agents, toutefois, est le tarif de lecture du cache : 0,06 $ par million de tokens mis en cache, soit un cinquième du prix d'entrée. Les boucles d'agents sont dominées par le préfixe — le même prompt système, les mêmes schémas d'outils, le même historique qui s'accumule, renvoyés à chaque tour — de sorte que le coût effectif d'une boucle est bien plus proche de 0,06 $ que de 0,30 $ pour l'essentiel de ses tokens. C'est cette arithmétique qui fait qu'une exécution de 1 200 agents, du type de celle que METR a documentée dans l'évaluation ExploitGym d'OpenAI de juillet 2026, est quelque chose qu'un groupe de recherche peut réellement reproduire plutôt que simplement lire.

La part GPU du grand livre

La structure de coûts d’Agora-2 est dévoilée dans sa propre annexe de mise en œuvre, et elle est d’une concrétude rafraîchissante. Une RTX PRO 4500 Blackwell Server Edition par vue. Quatre pour une session à quatre joueurs. Ces cartes génèrent la vue de chaque participant avec pour cible quinze mises à jour latentes et trente images affichées par seconde en 640×480, et la simulation progresse sur un tick de 30 Hz. Le rapport donne également l’échelle d’entraînement pour le travail connexe : un lot global effectif de 128 réparti sur 32 GPU B200.

Traduit dans la même unité que MiniMax M3, cela représente un GPU de centre de données par participant simultané, plus la simulation partagée embarquée sur l’un d’eux. C’est un coût fixe qui ne se soucie pas du temps que vos agents délibèrent et qui ne baisse pas lorsqu’ils se taisent. Deux conséquences en découlent, et elles pointent dans des directions opposées. Avec un faible nombre de participants et un raisonnement intensif par agent, le modèle à jetons est évidemment moins cher — vous payez quelques centimes pour la réflexion et rien pour le deuxième agent dans la salle. Avec un grand nombre de participants et une interaction dense, l’arithmétique s’inverse : vingt participants simultanés dans un monde partagé, c’est vingt GPU, un nombre qui n’augmente pas avec le nombre de jetons que chacun dépense.

• Unité de coût — Agora-2 : un RTX PRO 4500 par vue de participant contre MiniMax M3 : $0.30/$1.20 par million de tokens

• Lectures du cache — Agora-2 non applicable, aucune facturation de jetons contrairement à MiniMax M3, 0,06 $ par million en cache

• Score indépendant — Agora-2 : aucun résultat publié vs MiniMax M3 AA Intelligence Index 29 (v4.3.2)

• Contexte — état partagé Agora-2 plus historique borné par vue vs MiniMax M3 avec 1 048 576 tokens, 512 K garantis

• Sortie — vidéo Agora-2 640×480 à une cible de 30 fps vs texte MiniMax M3

• Accès — Aperçu navigateur d’Agora-2, aucune API, aucun poids vs MiniMax M3, poids ouverts, licence communautaire, API

Generated two-column scoreboard for Agora-2 and MiniMax M3 on unit of cost, cache reads, independent score, context, output and access: Agora-2 one RTX PRO 4500 per view, cache reads not applicable, none published, shared state plus bounded history, 640x480 video at a 30 fps target, browser preview with no API or weights; MiniMax M3 $0.30/$1.20 per 1M tokens, $0.06 per 1M cached, AA Index 29, 1,048,576 tokens with 512K guaranteed, text output, open weights under a community licence with an API. Footer reads 'MiniMax M3 per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Pourquoi les deux coûts ne sont pas des substituts

Il est tentant de lire cela comme un choix binaire, et ce n’en est pas un. MiniMax M3 est un cerveau de politique : il lit une situation partiellement observée, raisonne, appelle des outils et émet une action. Agora-2 est un environnement dans lequel les actions ont des conséquences visibles par les autres participants — un modèle de simulation qui prédit comment les actions combinées modifient l’état partagé, un serveur de monde qui les applique, et des moteurs de rendu par vue afin que chaque participant voie le même monde depuis sa propre perspective. Les seize entités autonomes d’Odyssey ne sont pilotées par aucun modèle de langage ; ce sont des politiques scalaires et spatiales récurrentes entraînées par apprentissage par renforcement, consommant un historique de seize observations et agissant toutes les quatre ticks de simulation. Ce choix de conception est l’indice. À trente ticks par seconde, décider quoi faire est un problème de contrôle, et les problèmes de contrôle se résolvent en entraînant une petite politique plutôt qu’en appelant une API.

Ainsi, pour une équipe qui planifie un travail multi-agents, la présentation honnête est la suivante : ces éléments se situent à des couches différentes et il faut un budget pour chacun. La couche de raisonnement est peu coûteuse et élastique, et vous pouvez faire jouer la concurrence. La couche d’environnement, si vous voulez autre chose qu’un moteur de jeu, est actuellement une préversion de recherche avec une empreinte de type GPU et aucune API publiée. Ces deux faits sont suffisamment récents — M3 depuis mai, Agora-2 depuis septembre — pour que presque personne n’ait encore de modèle de coûts pour la combinaison.

Qu'est-ce qui est vérifié et qu'est-ce qui est une cible ?

Le score indépendant, la fenêtre de contexte, les modalités et le prix de MiniMax M3 sont des faits publiés, vérifiables aujourd'hui. Ses chiffres pour BrowseComp et BankerToolBench sont rapportés par le fournisseur et doivent être signalés comme tels chaque fois que vous les citez.

Les chiffres d'Agora-2 proviennent entièrement du rapport technique de Team Odyssey et n'ont été reproduits par personne en dehors de l'entreprise. Son résultat de rendu — 30,11 dB de PSNR pour le moteur de rendu à préfixe structuré contre 20,67 dB pour une référence VAE sur trente clips de surveillance — est une comparaison de systèmes complets aux budgets d'entraînement non appariés, comme le note le rapport lui-même. Sa réduction de 45,8 % du temps de débruitage par rapport à l'attention croisée provient de débruiteurs initialisés aléatoirement sur des entrées synthétiques et mesure le coût d'exécution plutôt que la qualité d'image. Et sa section sur les limites indique clairement que les débits de quinze mises à jour par seconde et de trente images par seconde sont des objectifs ; que le débit d'images soutenu et la latence entrée-affichage lors d'une interaction multi-agents en direct « n'ont pas été évalués quantitativement » ; que la qualité visuelle sur longue durée, la cohérence entre vues et la conformité des actions de bout en bout restent non évaluées ; que l'environnement nécessite un moteur instrumenté avec une géométrie explicite et un vocabulaire d'apparence fixe ; et que le transfert au-delà du domaine d'entraînement n'est pas testé. Quiconque construit un modèle de coût sur un GPU par vue devrait lire cette section en premier, car le débit par GPU est exactement ce qui n'a pas été mesuré.

L'appel

Si vous construisez des flottes d'agents — de nombreux modèles, de longues boucles, des appels d'outils, aucun rendu — MiniMax M3 est la façon crédible la moins chère de le faire à grande échelle, et le tarif de lecture du cache est le chiffre qui détermine votre facture. Il est routé sur OrcaRouter au prix catalogue de MiniMax, sans marge, donc le tarif en cache de 0,06 $ est ce que vous payez, avec un basculement entre fournisseurs si un point de terminaison se dégrade en cours d'exécution. Pour les flottes en particulier, le pass-through compte plus que d'habitude : une marge de revendeur sur les jetons en cache est une marge multipliée par chaque tour de chaque agent.

Screenshot of the OrcaRouter model page for MiniMax M3 (model ID minimax/minimax-m3), showing a 1,048,576-token context window, 512K maximum output, text, image and video input, and pricing of $0.30 input and $1.20 output per million tokens.

Agora-2 n’est pas quelque chose vers quoi l’on peut router — il n’y a pas d’API, pas de prix et pas de poids, seulement l’aperçu navigateur d’Odyssey — et nous ne l’hébergeons pas. Ce qu’il est, c’est le premier simulateur de monde partagé conçu spécifiquement pour que de nombreux participants, humains et synthétiques, puissent être observés en train d’interagir dans des conditions contrôlées, et le rapport qui se trouve en dessous est d’une franchise inhabituelle quant à la distance qui le sépare actuellement d’un produit. Si votre problème est le raisonnement à grande échelle, MiniMax M3 est disponible dès maintenant et bon marché. Si votre problème est ce qui se passe lorsque mille de ces raisonneurs partagent un monde, Odyssey a construit l’arène et a laissé à quelqu’un d’autre le soin d’exécuter les mesures difficiles.