Gegenereerde titelkaart voor Agora-2 vs. MiniMax M3, met ondertitel 'Eén GPU per deelnemer, of dertien cent per miljoen tokens'. Drie kaarten: 'MiniMax M3: $ 0,30/$ 1,20 per 1 mln., $ 0,06 gecachet'; 'MiniMax M3: AA-index 29, 1 mln. context, open gewichten'; 'Agora-2: één RTX PRO 4500 per weergave, geen gepubliceerde prijs'. Voettekst luidt 'MiniMax M3 volgens Artificial Analysis; Agora-2 door leverancier gerapporteerd en niet gereproduceerd.'
Guides & Insights

Agora-2 vs MiniMax M3: Eén GPU per deelnemer, of dertien cent per miljoen tokens

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee manieren om een menigte agenten te runnen, geprijsd in twee verschillende valuta's. MiniMax M3 kost $0,30 per miljoen inputtokens en $1,20 per miljoen outputtokens — een tarief dat van een experiment met duizend agenten een regelpost maakt in plaats van een financieringsronde. Agora-2, het multi-agentwereldmodel Odyssey dat op 21 september 2026 werd gepreviewd, kost één NVIDIA RTX PRO 4500 per deelnemersweergave: een sessie met vier spelers draait op vier GPU's, waarbij één renderingmodel per kaart het 640×480-perspectief van die speler genereert, en één van die vier kaarten ook de gedeelde simulatie en de beleidsregels van de zestien autonome agenten draagt. Het MiniMax M3-getal is per token en schaalt met hoeveel je agenten nadenken. Het Agora-2-getal is per oogbal en schaalt met hoeveel gelijktijdige deelnemers je in de wereld zet. Het vergelijken ervan is een redeneerbudget met een renderingbudget vergelijken, en voor iedereen die in 2026 een multi-agentstudie plant, blijkt dat het nuttige ding te zijn om te doen.

De token-kant van het grootboek

MiniMax M3 is het open-weight vlaggenschip van MiniMax, uitgebracht op 31 mei 2026: een sparse mixture-of-experts met 428 miljard parameters, waarvan ongeveer 23 miljard parameters actief zijn per token, een contextvenster van 1.048.576 tokens waarvan MiniMax garandeert dat 512K bruikbaar is, tekst-, beeld- en video-invoer, en een score van 29 op de Artificial Analysis Intelligence Index v4.3.2. Het rapporteert 83,5 op BrowseComp en 76,1 op BankerToolBench in leverancierscijfers — de eigen cijfers van MiniMax, hier niet gereproduceerd — en Artificial Analysis meet het op 145 uitvoertokens per seconde, het tiende snelste model op die lijst.

Het relevante getal voor agentvloten is echter het cache-leestarief: $0,06 per miljoen gecachte tokens, een vijfde van de inputprijs. Agentloops zijn prefix-gedomineerd — dezelfde systeemprompt, dezelfde tool-schema's, dezelfde accumulerende geschiedenis, die elke beurt opnieuw worden verzonden — dus de effectieve kosten van een loop liggen voor het grootste deel van zijn tokens veel dichter bij $0,06 dan bij $0,30. Dat is de rekensom die ervoor zorgt dat een run met 1.200 agents, van het soort dat METR documenteerde in de ExploitGym-evaluatie van OpenAI uit juli 2026, iets is dat een onderzoeksgroep daadwerkelijk kan reproduceren in plaats van er alleen maar over te lezen.

De GPU-kant van het grootboek

De kostenstructuur van Agora-2 wordt uiteengezet in de eigen implementatiebijlage, en die is verfrissend concreet. Eén RTX PRO 4500 Blackwell Server Edition per weergave. Vier voor een sessie met vier spelers. Die kaarten genereren de weergave van elke deelnemer met een doel van vijftien latente updates en dertig weergegeven frames per seconde bij 640×480, en de simulatie vordert met een tick van 30 Hz. Het rapport geeft ook de trainingsschaal voor het omringende werk: een effectieve globale batch van 128 over 32 B200 GPU's.

Vertaald naar dezelfde eenheid als MiniMax M3, dat wil zeggen één datacenter-GPU per gelijktijdige deelnemer, plus de gedeelde simulatie die op een van hen meelift. Het is een vaste kostenpost die er niet om maalt hoelang je agenten beraadslagen en die niet daalt wanneer ze stil worden. Daaruit volgen twee gevolgen, en die wijzen in tegengestelde richtingen. Bij lage aantallen deelnemers met veel redeneerwerk per agent is het tokenmodel duidelijk goedkoper — je betaalt centen voor het denken en niets voor de tweede agent in de ruimte. Bij hoge aantallen deelnemers met intensieve interactie keert de rekensom om: twintig gelijktijdige deelnemers in een gedeelde wereld zijn twintig GPU's, een aantal dat niet groeit met het aantal tokens dat elk van hen verbruikt.

• Kosteneenheid — Agora-2 één RTX PRO 4500 per deelnemersweergave vs. MiniMax M3 $0,30/$1,20 per 1 miljoen tokens

• Cache-leesbewerkingen — Agora-2 niet van toepassing, geen tokenfacturering vs. MiniMax M3 $0,06 per 1 mln. gecachte tokens

• Onafhankelijke score — Agora-2: niet gepubliceerd vs MiniMax M3 AA Intelligence Index 29 (v4.3.2)

• Context — Agora-2 gedeelde status plus begrensde geschiedenis per weergave versus MiniMax M3 1.048.576 tokens, 512K gegarandeerd

• Uitvoer — Agora-2 640×480-video met een streefwaarde van 30 fps versus MiniMax M3-tekst

• Toegang — Agora-2 browserpreview, geen API, geen gewichten vs MiniMax M3 open gewichten, communitylicentie, API

Generated two-column scoreboard for Agora-2 and MiniMax M3 on unit of cost, cache reads, independent score, context, output and access: Agora-2 one RTX PRO 4500 per view, cache reads not applicable, none published, shared state plus bounded history, 640x480 video at a 30 fps target, browser preview with no API or weights; MiniMax M3 $0.30/$1.20 per 1M tokens, $0.06 per 1M cached, AA Index 29, 1,048,576 tokens with 512K guaranteed, text output, open weights under a community licence with an API. Footer reads 'MiniMax M3 per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Waarom de twee kosten geen substituten zijn

Het is verleidelijk om dit als een of/of te lezen, en dat is het niet. MiniMax M3 is een beleidsbrein: het leest een gedeeltelijk geobserveerde situatie, redeneert, roept tools aan en genereert een actie. Agora-2 is een omgeving waarin acties gevolgen hebben die zichtbaar zijn voor andere deelnemers — een simulatiemodel dat voorspelt hoe gecombineerde acties de gedeelde toestand veranderen, een wereldserver die ze toepast, en renderers per weergave zodat elke deelnemer dezelfde wereld vanuit zijn eigen perspectief ziet. De zestien autonome entiteiten van Odyssey worden niet aangestuurd door een taalmodel; het zijn recurrente scalaire en ruimtelijke policies, getraind met reinforcement learning, die een geschiedenis van zestien observaties consumeren en elke vier simulatietikken handelen. Die ontwerpkeuze is de aanwijzing. Bij dertig tikken per seconde is beslissen wat te doen een regelprobleem, en regelproblemen worden opgelost door een kleine policy te trainen in plaats van een API aan te roepen.

De eerlijke framing voor een team dat multi-agentwerk plant, is dat deze op verschillende lagen liggen en dat je voor elk een budget nodig hebt. De redeneerlaag is goedkoop en elastisch, en je kunt er zelf een aanbieder voor kiezen. De omgevingslaag is, als je iets anders dan een game-engine wilt, op dit moment een onderzoekspreview met een GPU-vormige voetafdruk en geen gepubliceerde API. Beide feiten zijn zo nieuw — M3 sinds mei, Agora-2 sinds september — dat bijna niemand al een kostenmodel heeft voor de combinatie.

Wat is geverifieerd en wat is een doelwit

De onafhankelijke score, het contextvenster, de modaliteiten en de prijs van MiniMax M3 zijn gepubliceerde feiten die vandaag controleerbaar zijn. De cijfers van BrowseComp en BankerToolBench zijn door de leverancier gerapporteerd en moeten als zodanig worden aangeduid telkens wanneer u ze citeert.

De cijfers van Agora-2 komen volledig uit het technische rapport van Team Odyssey en zijn door niemand buiten het bedrijf gereproduceerd. Het renderresultaat — 30,11 dB PSNR voor de structured-prefix-renderer tegenover 20,67 dB voor een VAE-baseline op dertig monitoringclips — is een vergelijking van complete systemen met niet op elkaar afgestemde trainingsbudgetten, zoals het rapport zelf opmerkt. De vermindering van 45,8% in denoiser-tijd ten opzichte van cross-attentie komt van willekeurig geïnitialiseerde denoisers op synthetische inputs en meet uitvoeringskosten in plaats van beeldkwaliteit. En de sectie met beperkingen stelt ronduit dat de snelheden van vijftien updates per seconde en dertig frames per seconde doelen zijn; dat aanhoudende framesnelheid en latentie van invoer naar weergave tijdens live multi-agentinteractie "niet kwantitatief zijn geëvalueerd"; dat visuele kwaliteit over lange termijn, overeenstemming tussen aanzichten en end-to-end naleving van acties ongeëvalueerd blijven; dat de omgeving een geïnstrumenteerde engine nodig heeft met expliciete geometrie en een vaste vocabulaire voor het uiterlijk; en dat overdracht buiten het trainingsdomein ongetest is. Iedereen die een kostenmodel bouwt op één GPU per aanzicht, moet die sectie eerst lezen, want de doorvoer per GPU is precies wat niet is gemeten.

De oproep

Als je agentfleets bouwt — veel modellen, lange loops, tool calls, geen rendering — is MiniMax M3 de goedkoopste geloofwaardige manier om dit op schaal te doen, en het tarief voor cache-lezen is het getal dat je factuur bepaalt.Het wordt gerouteerd op OrcaRouter tegen MiniMax' eigen lijstprijs zonder markup, dus het gecachte tarief van $0,06 is wat je betaalt, met failover tussen providers als een endpoint halverwege een run degradeert. Voor fleets in het bijzonder is de pass-through belangrijker dan gewoonlijk: een resellermarge op gecachte tokens is een marge die met elke turn van elke agent wordt vermenigvuldigd.

Screenshot of the OrcaRouter model page for MiniMax M3 (model ID minimax/minimax-m3), showing a 1,048,576-token context window, 512K maximum output, text, image and video input, and pricing of $0.30 input and $1.20 output per million tokens.

Agora-2 is niet iets waar je naartoe kunt routeren — er is geen API, geen prijs en geen gewichten, alleen Odyssey's browserpreview — en wij hosten het niet. Wat het wel is, is de eerste gedeeldewereldsimulator die specifiek is gebouwd zodat veel deelnemers, menselijk en synthetisch, onder gecontroleerde omstandigheden kunnen worden geobserveerd terwijl ze met elkaar interacteren, en het rapport eronder is ongewoon openhartig over hoe ver het momenteel van een product af staat. Als jouw probleem grootschalig redeneren is, is MiniMax M3 nu beschikbaar en goedkoop. Als jouw probleem is wat er gebeurt wanneer duizend van die redeneerders een wereld delen, heeft Odyssey de arena gebouwd en de moeilijke metingen aan iemand anders overgelaten om uit te voeren.