
Agora-2 vs MiniMax M3: Una GPU per partecipante, o tredici centesimi per milione di token
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 36 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 181 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Due modi per far girare una moltitudine di agenti, con prezzi in due valute diverse. MiniMax M3 costa 0,30 $ per milione di token in input e 1,20 $ per milione in output — una tariffa che rende un esperimento con mille agenti una voce di bilancio anziché un giro di finanziamento. Agora-2, il world model multi-agente Odyssey presentato in anteprima il 21 settembre 2026, costa una NVIDIA RTX PRO 4500 per ogni punto di vista di un partecipante: una sessione a quattro giocatori gira su quattro GPU, con un modello di rendering per scheda che genera la prospettiva 640×480 di quel giocatore, e una di quelle quattro schede che porta anche la simulazione condivisa e le sedici policy di agenti autonomi. Il numero di MiniMax M3 è per token e scala con quanto pensano i tuoi agenti. Il numero di Agora-2 è per occhio e scala con quanti partecipanti simultanei metti nel mondo. Confrontarli significa confrontare un budget di ragionamento con un budget di rendering, e per chiunque pianifichi uno studio multi-agente nel 2026, si scopre che è proprio la cosa utile da fare.
Il lato token del registro
MiniMax M3 è il modello di punta open-weight di MiniMax, rilasciato il 31 maggio 2026: un mixture-of-experts sparse da 428 miliardi di parametri con circa 23 miliardi di parametri attivi per token, una finestra di contesto di 1.048.576 token di cui MiniMax garantisce 512K utilizzabili, input di testo, immagini e video, e un punteggio di 29 sull'Artificial Analysis Intelligence Index v4.3.2. Riporta 83,5 su BrowseComp e 76,1 su BankerToolBench secondo i dati del fornitore — numeri di MiniMax stesso, non riprodotti qui — e Artificial Analysis lo misura a 145 token di output al secondo, il decimo modello più veloce di quella classifica.
Il numero rilevante per le flotte di agenti, però, è il tasso di lettura della cache: 0,06 $ per milione di token in cache, un quinto del prezzo di input. I cicli degli agenti sono dominati dal prefisso — lo stesso prompt di sistema, gli stessi schemi degli strumenti, la stessa cronologia che si accumula, reinviati a ogni turno — quindi il costo effettivo di un ciclo è molto più vicino a 0,06 $ che a 0,30 $ per la maggior parte dei suoi token. È questa l'aritmetica che rende un'esecuzione di 1.200 agenti, del tipo che METR ha documentato all'interno della valutazione ExploitGym di OpenAI del luglio 2026, qualcosa che un gruppo di ricerca può effettivamente riprodurre anziché limitarsi a leggerne.
Il lato GPU del registro
La struttura dei costi di Agora-2 è divulgata nella sua stessa appendice implementativa, ed è piacevolmente concreta. Una RTX PRO 4500 Blackwell Server Edition per vista. Quattro per una sessione a quattro giocatori. Quelle schede generano la vista di ciascun partecipante puntando a quindici aggiornamenti latenti e trenta fotogrammi visualizzati al secondo a 640×480, e la simulazione avanza con un tick a 30 Hz. Il rapporto fornisce anche la scala di addestramento per il lavoro circostante: un batch globale effettivo di 128 distribuito su 32 GPU B200.
Tradotto nella stessa unità di MiniMax M3, ovvero una GPU da data center per partecipante concorrente, più la simulazione condivisa che viaggia su una di esse. È un costo fisso a cui non importa quanto a lungo i tuoi agenti deliberino e non cala quando tacciono. Ne derivano due conseguenze, e puntano in direzioni opposte. Con un numero basso di partecipanti e un ragionamento intenso per agente, il modello a token è ovviamente più economico — paghi centesimi per il pensiero e nulla per il secondo agente nella stanza. Con un numero elevato di partecipanti e un'interazione densa, l'aritmetica si inverte: venti partecipanti concorrenti in un mondo condiviso sono venti GPU, un numero che non cresce con il numero di token spesi da ciascuno.
• Unità di costo — Agora-2 una RTX PRO 4500 per visualizzazione partecipante rispetto a MiniMax M3 $0.30/$1.20 per 1M token
• Letture cache — Agora-2 non applicabile, nessun addebito per token rispetto a MiniMax M3 $0,06 per 1M in cache
• Punteggio indipendente — Agora-2 nessuno pubblicato vs MiniMax M3 AA Intelligence Index 29 (v4.3.2)
• Contesto — stato condiviso di Agora-2 più cronologia limitata per vista rispetto a MiniMax M3 1.048.576 token, 512K garantiti
• Output — video Agora-2 640×480 a un target di 30 fps rispetto al testo di MiniMax M3
• Accesso — Anteprima browser di Agora-2, nessuna API, nessun peso vs pesi aperti di MiniMax M3, licenza community, API


Perché i due costi non sono sostituti
Viene la tentazione di leggerlo come un aut aut, e non lo è. MiniMax M3 è un cervello di policy: legge una situazione parzialmente osservata, ragiona, chiama strumenti ed emette un'azione. Agora-2 è un ambiente in cui le azioni hanno conseguenze visibili agli altri partecipanti: un modello di simulazione che prevede come le azioni combinate modificano lo stato condiviso, un world server che le applica e renderer per vista, così che ogni partecipante veda lo stesso mondo dalla propria prospettiva. Le sedici entità autonome di Odyssey non sono guidate da alcun modello linguistico; sono policy ricorrenti scalari e spaziali addestrate con l'apprendimento per rinforzo, che consumano una cronologia di sedici osservazioni e agiscono ogni quattro tick di simulazione. Questa scelta progettuale è l'indizio rivelatore. A trenta tick al secondo, decidere cosa fare è un problema di controllo, e i problemi di controllo si risolvono addestrando una piccola policy invece di chiamare un'API.
Quindi, la descrizione onesta per un team che pianifica lavoro multi-agente è che questi risiedono a livelli diversi e serve un budget per ciascuno. Il livello di ragionamento è economico ed elastico e puoi sceglierlo sul mercato. Il livello ambientale, se vuoi qualcosa di diverso da un motore di gioco, è attualmente un'anteprima di ricerca con un'impronta che richiede GPU e nessuna API pubblicata. Entrambi i fatti sono abbastanza recenti — M3 da maggio, Agora-2 da settembre — che quasi nessuno ha ancora un modello di costo per la combinazione.
Che cosa è verificato e che cosa è un obiettivo
Il punteggio indipendente, la finestra di contesto, le modalità e il prezzo di MiniMax M3 sono fatti pubblicati, verificabili oggi. Le sue cifre per BrowseComp e BankerToolBench sono riportate dal fornitore e vanno etichettate come tali ogni volta che le citi.
I numeri di Agora-2 provengono interamente dal rapporto tecnico di Team Odyssey e non sono stati riprodotti da nessuno al di fuori dell'azienda. Il suo risultato di rendering — 30,11 dB PSNR per il renderer con prefisso strutturato contro 20,67 dB per una baseline VAE su trenta clip di monitoraggio — è un confronto tra sistemi completi con budget di addestramento non equivalenti, come osserva il rapporto stesso. La sua riduzione del 45,8% del tempo del denoiser rispetto alla cross-attention deriva da denoiser inizializzati casualmente su input sintetici e misura il costo di esecuzione anziché la qualità dell'immagine. E la sua sezione sui limiti afferma chiaramente che i valori di quindici aggiornamenti al secondo e trenta fotogrammi al secondo sono obiettivi; che la frequenza dei fotogrammi sostenuta e la latenza dall'input alla visualizzazione durante l'interazione multi-agente dal vivo "non sono state valutate quantitativamente"; che la qualità visiva a lungo orizzonte, la concordanza tra viste e l'aderenza delle azioni end-to-end restano non valutate; che l'ambiente necessita di un motore strumentato con geometria esplicita e un vocabolario fisso dell'aspetto; e che il transfer oltre il dominio di addestramento non è testato. Chiunque costruisca un modello di costo su una GPU per vista dovrebbe leggere prima quella sezione, perché il throughput per GPU è esattamente ciò che non è stato misurato.
La chiamata
Se stai costruendo flotte di agenti — molti modelli, loop lunghi, chiamate a strumenti, nessun rendering — MiniMax M3 è il modo più economico e credibile per farlo su larga scala, e la tariffa di lettura della cache è il numero che decide la tua fattura. Su OrcaRouter è instradato al prezzo di listino di MiniMax, senza alcun ricarico, quindi la tariffa in cache di $0,06 è quella che paghi, con failover tra provider se un endpoint si degrada durante l'esecuzione. Proprio per le flotte, il pass-through conta più del solito: un margine del rivenditore sui token in cache è un margine moltiplicato per ogni turno di ogni agente.

Agora-2 non è qualcosa verso cui puoi instradare — non c'è alcuna API, né prezzo né pesi, solo l'anteprima browser di Odyssey — e noi non lo ospitiamo. Quello che è, è il primo simulatore a mondo condiviso costruito specificamente affinché molti partecipanti, umani e sintetici, possano essere osservati mentre interagiscono in condizioni controllate, e il report che vi sta sotto è insolitamente schietto su quanto sia attualmente lontano dall'essere un prodotto. Se il tuo problema è il ragionamento su larga scala, MiniMax M3 è disponibile ora ed è economico. Se il tuo problema è cosa succede quando mille di quei ragionatori condividono un mondo, Odyssey ha costruito l'arena e ha lasciato le misurazioni difficili da eseguire a qualcun altro.
