
Agora-2 vs Grok 4.6 : la question de la politique des agents — 1 200 agents LLM, et le simulateur qui n'utilise ni l'un ni l'autre
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 36 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 181 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Voici un chiffre qui coûte de l'argent. L'enquête de METR sur l'incident Hugging Face de juillet 2026 a compté environ 1 200 agents coordonnés au sein d'une seule exécution d'évaluation. Au Grok 4.6, dont la grille tarifaire est de 2,00 $ par million de tokens en entrée et de 6,00 $ par million en sortie, une flotte de cette taille, qui brasse de longs transcripts pendant six jours, représente une facture qu'une équipe bien financée peut réellement absorber. Au tarif du modèle vers lequel vous vous tourneriez sinon, ce n'est pas le cas. C'est la véritable promesse produit de Grok 4.6, et c'est la même promesse que Agora-2 contredit discrètement : lorsque Odyssey a présenté son modèle de monde multi-agents le 21 septembre 2026 — un aperçu jouable générant des environnements partagés pour jusqu'à 20 humains et agents IA — les agents qu'il abritait se sont révélés ne pas être des modèles de langage du tout. Odyssey a plutôt entraîné de petites politiques d'apprentissage par renforcement. La question intéressante que ce rapprochement soulève n'est pas de savoir lequel est le meilleur. C'est pourquoi le laboratoire a fait l'impasse sur le LLM.
La grille tarifaire, dans l'unité qui compte pour les flottes
Grok 4.6 est sorti le 12 août 2026 comme le modèle haut de gamme de xAI : une fenêtre de contexte de 500 000 tokens, la prise en charge d'entrées textuelles, d'images et de fichiers, un effort de raisonnement configurable, l'appel d'outils natif, des sorties structurées, et un indice d'intelligence Artificial Analysis de 44 sur l'indice v4.3.2 — le même indice qui place GPT-5.6 Sol à 47 et Kimi K3 à 44. Artificial Analysis lui attribue 94,9 sur GPQA Diamond, et c'est le modèle que xAI répertorie comme « Latest » dans sa propre documentation destinée aux développeurs. Il est servi comme un modèle OpenAI Responses de premier ordre, ce qui est le point essentiel en pratique : les frameworks d'agents l'adoptent en changeant une URL de base, et non en écrivant un adaptateur.
Mais le chiffre intéressant est l’association de $2/$6 avec la fenêtre de contexte. Les boucles d’agents à long horizon sont des charges de travail ingrates : des dizaines de milliers de tokens de sorties d’outils accumulées par agent et par heure, dont la majeure partie est redondante. Le tarif de lecture du cache de Grok 4.6 est de 0,50 $ par million, soit un quart de son prix d’entrée, ce qui rend une exécution de mille agents arithmétiquement plausible plutôt que simplement possible. Notez la limite de palier : les prompts au-delà de 200K tokens sont facturés au double du tarif de base, de sorte qu’un agent qui développe un long historique double silencieusement son propre coût.
• Prix — Agora-2 : aucun prix publié, uniquement en aperçu navigateur, contre Grok 4.6 : 2,00 $/6,00 $ par million, 0,50 $ en lecture mise en cache, doublé au-delà de 200 K en entrée
• Contexte — l’état partagé d’Agora-2 ainsi qu’un historique borné par vue, contre les 500 000 jetons de Grok 4.6
• Score indépendant — Agora-2 : aucun publié vs Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• Raisonnement — Agora-2 non applicable, pas un modèle de langage vs Grok 4.6, effort configurable, appel d’outils natif
• Accès — Aperçu jouable d’Agora-2, sans API ni poids face à l’API propriétaire de Grok 4.6
• Matériel — Agora-2 avec quatre GPU RTX PRO 4500 pour quatre vues simultanées vs Grok 4.6, un point de terminaison hébergé

Pourquoi Odyssey n'a pas mis un LLM dans l'arène
Le raccourci évident, si vous construisez un monde où seize agents IA affrontent quatre humains, consiste à brancher un modèle de texte performant aux commandes et à le laisser jouer. Odyssey ne l'a pas fait, et son rapport technique explique pourquoi dans le tableau de configuration. La politique d'agent dans Agora-2 est une politique scalaire et spatiale récurrente qui consomme un historique de seize observations, émettant une action toutes les quatre ticks de simulation sur quatorze branches de mouvement discrètes. La simulation elle-même avance sur une base de temps de tick de 30 Hz. Un modèle à qui l'on demande de prendre une décision trente fois par seconde, à partir d'une vue partiellement observée, avec un vocabulaire d'actions de bas niveau fixe, n'est pas un problème de raisonnement — c'est un problème de contrôle, et les problèmes de contrôle se résolvent en entraînant une petite politique, et non en sollicitant un modèle frontière à contexte de 500K.
Cela vaut la peine d'être dit clairement, car c'est l'idée fausse la plus courante à propos de la catégorie des modèles du monde. Agora-2 n'est pas en concurrence avec Grok 4.6 pour le même emplacement dans un système. Il occupe l'emplacement en dessous : l'environnement dans lequel la politique est entraînée et évaluée. L'architecture du rapport est explicite quant à la séparation — un modèle de simulation prédit comment les actions combinées modifient l'état partagé, un serveur mondial les applique, et un modèle de rendu par vue génère la perspective 640×480 propre à chaque participant à partir de cet état. Aucun modèle de texte n'apparaît nulle part dans la boucle d'interaction.

Là où un modèle comme Grok 4.6 apparaît bel et bien, c’est un niveau au-dessus : en tant qu’élément qui écrit l’échafaudage d’évaluation, analyse les transcriptions, ou pilote l’agent utilisant des outils dont vous cherchez à étudier le comportement. C’est précisément le rôle que GPT-5.6 Sol a joué dans l’enquête de METR — environ 5 % de la flotte, et l’analyste qui lit les journaux — et c’est le rôle que le prix et la fenêtre de contexte de Grok 4.6 rendent bon marché.
L'écart de preuves est plus grand ici que dans la plupart de ces confrontations.
Le score d'indice de Grok 4.6 est mesuré de manière indépendante, sa grille tarifaire est publiée et sa fenêtre de contexte est documentée. Les chiffres d'Agora-2 proviennent d'un rapport rédigé par Team Odyssey et reproduit par personne. Sur trente clips de surveillance, son moteur de rendu à préfixe structuré atteint 30,11 dB PSNR contre 20,67 dB pour une base de référence VAE — une comparaison dont le rapport lui-même avertit qu'elle oppose des systèmes complets aux budgets d'entraînement non appariés, et non un test d'architecture isolé. Son benchmark de conditionnement, qui montre une réduction de 45,8 % du temps de débruitage par rapport à l'attention croisée, utilise des débruitueurs initialisés aléatoirement sur des entrées synthétiques et mesure le coût d'exécution, pas la qualité d'image.
Puis la section sur les limites, qui est d'une franchise inhabituelle. Les 15 mises à jour latentes et les 30 images par seconde affichées annoncées sont des objectifs. Le taux de rafraîchissement soutenu et la latence entre l'entrée et l'affichage lors d'une interaction multi-agents en direct « n'ont pas été évalués quantitativement ». La qualité visuelle sur longue durée, la concordance entre les vues et le respect des actions de bout en bout sont tous répertoriés comme non évalués. L'environnement nécessite un moteur de jeu instrumenté avec une géométrie explicite et un vocabulaire d'apparence fixe, et le transfert vers de nouveaux actifs, règles ou environnements n'a pas été testé. Lisez cette liste avant de lire le moindre chiffre phare concernant Agora-2.
Lequel appartient à votre stack
Si vous exploitez ou étudiez des systèmes multi-agents aujourd'hui, Grok 4.6 est le composant que vous pouvez réellement déployer — un modèle textuel de classe frontier à un tarif qui rend abordables les grandes flottes d'agents, avec un score publié et une surface d'API documentée. Sur OrcaRouter, il est servi au prix catalogue de xAI, sans aucune marge ajoutée, de sorte que les 2 $/6 $ ci-dessus et tout futur changement de tarif se répercutent sur votre facture le jour même, avec un basculement automatique en cas de dégradation du point de terminaison principal. Ces deux faits comptent tout particulièrement pour les charges de travail en flotte : mille agents, c'est mille occasions de tomber sur un fournisseur dégradé, et une marge appliquée aux 6 $ de sortie est une marge multipliée par l'ensemble de votre exécution.

Agora-2 n'est pas une infrastructure déployable et nous ne l'hébergeons pas — il n'y a ni API, ni poids, ni tarif, seulement l'aperçu jouable d'Odyssey lui-même. Ce qu'il offre relève d'un autre type de valeur : un environnement contrôlé pour la recherche sur les interactions que le rapport METR montre désormais comme urgente, au coût de quatre GPU RTX PRO 4500 pour quatre vues simultanées plutôt que d'une facture d'API. Le verdict honnête est que ces deux-là ne sont pas en concurrence. Grok 4.6 est le cerveau politique que l'on peut acheter au token dès aujourd'hui ; Agora-2 est une proposition visant à tester ce qui se passe lorsque des milliers de ces cerveaux se rencontrent. Le second relève davantage de la recherche intéressante que du produit fini, et le propre rapport d'Odyssey dit avec une clarté rafraîchissante quelles parties en sont encore à l'état d'objectifs.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
