
Agora-2 vs MiniMax M3: En GPU per deltagare, eller tretton cent per miljon tokens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 36 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 181 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Två sätt att köra en skara agenter, prissatta i två olika valutor. MiniMax M3 kostar 0,30 dollar per miljon inputtokens och 1,20 dollar per miljon output – en taxa som gör ett experiment med tusen agenter till en rad i budgeten snarare än en finansieringsrunda. Agora-2, multiagentvärldsmodellen som Odyssey förhandsvisade den 21 september 2026, kostar ett NVIDIA RTX PRO 4500 per deltagarvy: en session med fyra spelare körs på fyra GPU:er, där en renderingsmodell per kort genererar den spelarens 640×480-perspektiv, och ett av de fyra korten bär dessutom den delade simuleringen och de sexton autonoma agentpolicyna. Siffran för MiniMax M3 är per token och skalar med hur mycket dina agenter tänker. Siffran för Agora-2 är per öga och skalar med hur många samtidiga deltagare du sätter in i världen. Att jämföra dem är att jämföra en resonemangsbudget med en renderingsbudget, och för den som planerar en multiagentstudie 2026 visar det sig vara precis det man bör göra.
Tokensidan av liggaren
MiniMax M3 är MiniMax flaggskeppsmodell med öppna vikter, släppt den 31 maj 2026: en gles mixture-of-experts-modell med 428 miljarder parametrar, varav ungefär 23 miljarder är aktiva per token, ett kontextfönster på 1 048 576 token där MiniMax garanterar 512K användbara, text-, bild- och videoindata samt en poäng på 29 på Artificial Analysis Intelligence Index v4.3.2. Den rapporterar 83,5 på BrowseComp och 76,1 på BankerToolBench enligt leverantörens siffror – MiniMaxs egna siffror, inte reproducerade här – och Artificial Analysis mäter den till 145 utdatatoken per sekund, den tionde snabbaste modellen på den listan.
Den relevanta siffran för agentflottor är dock cache-läsningsavgiften: $0,06 per miljon cachade tokens, en femtedel av indatapriset. Agentloopar domineras av prefix — samma systemprompt, samma verktygsscheman, samma ackumulerande historik, som skickas om varje tur — så den effektiva kostnaden för en loop ligger långt närmare $0,06 än $0,30 för merparten av dess tokens. Det är den aritmetiken som gör en körning med 1 200 agenter, av det slag som METR dokumenterade i OpenAIs ExploitGym-utvärdering i juli 2026, till något en forskargrupp faktiskt kan reproducera i stället för att bara läsa om.
GPU-sidan av liggaren
Agora-2:s kostnadsstruktur redovisas i dess egen implementeringsbilaga, och den är befriande konkret. Ett RTX PRO 4500 Blackwell Server Edition per vy. Fyra för en session med fyra spelare. Dessa kort genererar varje deltagares vy med ett mål på femton latenta uppdateringar och trettio visade bildrutor per sekund vid 640×480, och simuleringen fortskrider i en takt på 30 Hz. Rapporten anger också träningsskalan för det kringliggande arbetet: en effektiv global batchstorlek på 128 fördelat över 32 B200-GPU:er.
Omräknat till samma enhet som MiniMax M3, det vill säga en datacenter-GPU per samtidig deltagare, plus den delade simuleringen som får hänga med på en av dem. Det är en fast kostnad som inte bryr sig om hur länge dina agenter överlägger och som inte sjunker när de tystnar. Två konsekvenser följer, och de pekar i motsatta riktningar. Vid lågt deltagarantal med tungt resonerande per agent är tokenmodellen uppenbart billigare – du betalar cent för tänkandet och ingenting för den andra agenten i rummet. Vid högt deltagarantal med tät interaktion vänds räkningen: tjugo samtidiga deltagare i en delad värld är tjugo GPU:er, en siffra som inte växer med antalet tokens som var och en gör av med.
• Kostnadsenhet — Agora-2 en RTX PRO 4500 per deltagarvy jämfört med MiniMax M3 $0,30/$1,20 per 1 miljon tokens
• Cache-läsningar — Agora-2 ej tillämpligt, ingen tokenfakturering vs MiniMax M3 $0,06 per 1M cachade
• Oberoende poäng — Agora-2: ingen publicerad vs MiniMax M3 AA Intelligence Index 29 (v4.3.2)
• Kontext — Agora-2 delat tillstånd plus avgränsad historik per vy mot MiniMax M3 1 048 576 tokens, 512K garanterade
• Utdata — Agora-2-video i 640×480 med ett mål på 30 fps jämfört med MiniMax M3-text
• Åtkomst — Agora-2 webbläsarförhandsvisning, inget API, inga vikter vs MiniMax M3 öppna vikter, community-licens, API


Varför de två kostnaderna inte är substitut
Det är frestande att läsa detta som ett antingen/eller, och det är det inte. MiniMax M3 är en policyhjärna: den läser en delvis observerad situation, resonerar, anropar verktyg och avger handlingar. Agora är en miljö där handlingar får konsekvenser som är synliga för andra deltagare — en simuleringsmodell som förutsäger hur kombinerade handlingar förändrar delat tillstånd, en världsserver som tillämpar dem, och renderare per vy så att varje deltagare ser samma värld från sitt eget perspektiv. Odysseys sexton autonoma entiteter drivs inte av någon språkmodell; de är återkommande skalära och rumsliga policyer tränade med förstärkningsinlärning, som konsumerar en historik med sexton observationer och agerar var fjärde simuleringstakt. Det designvalet är avslöjandet. Vid trettio tickar per sekund är det ett reglerproblem att bestämma vad man ska göra, och reglerproblem löses genom att träna en liten policy snarare än genom att anropa ett API.
Så den ärliga formuleringen för ett team som planerar multiagentarbete är att dessa ligger på olika lager och att du behöver en budget för vart och ett. Resoneringslagret är billigt och elastiskt och du kan shoppa runt efter det. Miljölagret, om du vill ha något annat än en spelmotor, är för närvarande en forskningsförhandsvisning med ett GPU-format fotavtryck och inget publicerat API. Båda fakta är nya nog – M3 sedan maj, Agora-2 sedan september – att nästan ingen har en kostnadsmodell för kombinationen ännu.
Vad är verifierat och vad är ett mål
MiniMax M3:s oberoende poäng, kontextfönster, modaliteter och pris är publicerade fakta som går att kontrollera idag. Dess siffror för BrowseComp och BankerToolBench är leverantörsrapporterade och bör märkas som sådana varje gång du citerar dem.
Agora-2:s siffror kommer helt och hållet från Team Odysseys tekniska rapport och har inte reproducerats av någon utanför företaget. Dess renderingsresultat – 30,11 dB PSNR för structured-prefix-rendereraren mot 20,67 dB för en VAE-baslinje på trettio övervakningsklipp – är en jämförelse av kompletta system med icke matchade träningsbudgetar, vilket rapporten själv noterar. Dess minskning av denoiser-tiden med 45,8 % jämfört med cross-attention kommer från slumpmässigt initierade denoisers på syntetiska indata och mäter exekveringskostnad snarare än bildkvalitet. Och dess avsnitt om begränsningar säger uttryckligen att målen är femton uppdateringar per sekund och trettio bildrutor per sekund; att uthållig bildfrekvens och latens från indata till skärm under interaktion i realtid mellan flera agenter ”har inte utvärderats kvantitativt”; att långsiktig visuell kvalitet, samstämmighet mellan vyer och end-to-end-handlingsföljsamhet fortfarande inte har utvärderats; att miljön behöver en instrumenterad motor med explicit geometri och ett fast utseendeordförråd; och att överföring bortom träningsdomänen är otestad. Den som bygger en kostnadsmodell på en GPU per vy bör läsa det avsnittet först, eftersom genomströmningen per GPU är exakt det som inte har mätts.
Samtalet
Om du bygger agentflottor – många modeller, långa loopar, verktygsanrop, ingen rendering – är MiniMax M3 det billigaste trovärdiga sättet att göra det i skala, och cache-läsningspriset är siffran som avgör din faktura. Den routas på OrcaRouter till MiniMax eget listpris utan påslag, så det cachade priset på $0.06 är vad du betalar, med failover mellan leverantörer om en endpoint försämras mitt i en körning. För flottor specifikt spelar vidarebefordran av priset större roll än vanligt: en återförsäljarmarginal på cachade tokens är en marginal som multipliceras med varje tur av varje agent.

Agora-2 är inte något du kan routa till — det finns inget API, inget pris och inga vikter, bara Odysseys förhandsvisning i webbläsaren — och vi hostar det inte. Vad det är, är den första simulatorn för en delad värld som byggts specifikt för att många deltagare, mänskliga och syntetiska, ska kunna ses interagera under kontrollerade förhållanden, och rapporten bakom den är ovanligt uppriktig om hur långt den för närvarande är från en produkt. Om ditt problem är resonemang i stor skala finns MiniMax M3 nu och är billig. Om ditt problem är vad som händer när tusen av dessa resonörer delar en värld, har Odyssey byggt arenan och lämnat de svåra mätningarna till någon annan att utföra.
