
Agora-2 vs Grok 4.6: la questione della policy degli agenti — 1.200 agenti LLM, e il simulatore che non usa nessuno dei due
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 36 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 181 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Ecco un numero che costa denaro. L'indagine di METR sull'incidente di Hugging Face del luglio 2026 ha contato circa 1.200 agenti coordinati all'interno di una singola esecuzione di valutazione. Al Grok 4.6listino prezzi di — 2,00 $ per milione di token in input, 6,00 $ per milione in output — una flotta di quelle dimensioni, che macina lunghi transcript per sei giorni, è una bolletta che un team ben finanziato può effettivamente sostenere. Al prezzo del modello a cui altrimenti ti rivolgeresti, non lo è. Questa è la vera proposta di prodotto di Grok 4.6, ed è la stessa proposta che Agora-2contraddice in silenzio: quando Odysseyha presentato il suo world model multi-agente il 21 settembre 2026 — un'anteprima giocabile che genera ambienti condivisi per un massimo di 20 esseri umani e agenti AI — gli agenti al suo interno si sono rivelati non essere affatto modelli linguistici. Odyssey ha invece addestrato piccole policy di reinforcement learning. La domanda interessante che questo abbinamento solleva non è quale sia migliore. È perché il laboratorio abbia saltato l'LLM.
Il tariffario, nell'unità che conta per le flotte
Grok 4.6 è stato rilasciato il 12 agosto 2026 come tier frontier di xAI: una finestra di contesto di 500.000 token, input di testo, immagini e file, sforzo di ragionamento configurabile, tool calling nativo, output strutturati e un Artificial Analysis Intelligence Index di 44 sull'indice v4.3.2 — lo stesso indice che colloca GPT-5.6 Sol a 47 e Kimi K3 a 44. Artificial Analysis gli assegna 94,9 su GPQA Diamond, ed è il modello che xAI elenca come "Latest" nella propria documentazione per sviluppatori. È servito come modello OpenAI Responses di prima classe, che è il punto pratico: i framework agentici lo adottano cambiando un base URL, non scrivendo un adattatore.
Ma il dato interessante è l'abbinamento di $2/$6 con la finestra di contesto. I loop di agenti a lungo orizzonte sono carichi di lavoro brutti — decine di migliaia di token di output accumulato degli strumenti per agente ogni ora, in gran parte ridondanti. La tariffa di lettura della cache di Grok 4.0 è di $0.50 per milione, un quarto del suo prezzo di input, ed è ciò che rende un'esecuzione con mille agenti aritmeticamente plausibile anziché semplicemente possibile. Nota il confine di livello: i prompt superiori a 200K token vengono fatturati al doppio della tariffa base, quindi un agente che accumula una lunga cronologia raddoppia silenziosamente il proprio costo.
• Prezzo — Agora-2 nessun prezzo pubblicato, solo anteprima browser rispetto a Grok 4.6: $2,00/$6,00 per 1M, $0,50 per lettura in cache, raddoppia oltre i 200K di input
• Contesto — stato condiviso di Agora-2 più cronologia limitata per vista rispetto a Grok 4.6 500.000 token
• Punteggio indipendente — Agora-2 nessuno pubblicato vs Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• Ragionamento — Agora-2: non applicabile, non un modello linguistico vs Grok 4.6: sforzo configurabile, chiamata nativa agli strumenti
• Accesso — Anteprima giocabile di Agora-2, nessuna API, nessun peso vs API proprietaria di Grok 4.6
• Hardware — Agora-2: quattro GPU RTX PRO 4500 per quattro viste simultanee vs Grok 4.6, un endpoint ospitato

Perché Odyssey non ha messo un LLM nell'arena
La scorciatoia ovvia, se stai costruendo un mondo in cui sedici agenti AI combattono contro quattro umani, è collegare un modello testuale capace ai controlli e lasciarlo giocare. Odyssey non l'ha fatto, e il suo rapporto tecnico ne spiega il motivo nella tabella di configurazione. La policy dell'agente in Agora-2 è una policy ricorrente scalare e spaziale che consuma una cronologia di sedici osservazioni, emettendo un'azione ogni quattro tick di simulazione su quattordici rami di movimento discreti. La simulazione stessa avanza su una base temporale di tick a 30 Hz. Un modello a cui si chiede di prendere una decisione trenta volte al secondo, da una vista parzialmente osservata, con un vocabolario fisso di azioni di basso livello, non è un problema di ragionamento — è un problema di controllo, e i problemi di controllo si risolvono addestrando una piccola policy, non facendo prompting a un modello di frontiera con contesto da 500K.
Vale la pena dichiararlo chiaramente perché è l'equivoco più comune sulla categoria dei world model. Agora-2 non compete con Grok 4.6 per lo stesso slot in un sistema. Occupa lo slot sottostante: l'ambiente in cui la policy viene addestrata e valutata. L'architettura del report è esplicita sulla separazione — un modello di simulazione prevede come le azioni combinate modificano lo stato condiviso, un world server le applica, e un modello di rendering per vista genera la prospettiva 640×480 di ciascun partecipante da quello stato. Nessun modello testuale compare da nessuna parte nel ciclo di interazione.

Dove invece compare un modello come Grok 4.6 è un livello più in alto: come la cosa che scrive l'impalcatura di valutazione, analizza le trascrizioni o guida l'agente che usa strumenti il cui comportamento stai cercando di studiare. È esattamente il ruolo che GPT-5.6 Sol ha svolto nell'indagine di METR — circa il 5% della flotta, e l'analista che legge i log — ed è il ruolo che il prezzo e la finestra di contesto di Grok 4.6 rendono economico.
Il divario probatorio è più ampio qui che nella maggior parte di questi confronti.
Il punteggio dell'indice di Grok 4.6 è misurato in modo indipendente, la sua scheda tariffaria è pubblicata e la sua finestra di contesto è documentata. I numeri di Agora-2 provengono da un rapporto redatto da Team Odyssey e che nessuno ha riprodotto. Su trenta clip di monitoraggio il suo renderer a prefisso strutturato raggiunge 30,11 dB PSNR contro 20,67 dB per una baseline VAE — un confronto che il rapporto stesso avverte essere tra sistemi completi con budget di addestramento non corrispondenti, non un test isolato di architettura. Il suo benchmark di condizionamento, che mostra una riduzione del 45,8% del tempo del denoiser rispetto alla cross-attention, utilizza denoiser inizializzati casualmente su input sintetici e misura il costo di esecuzione, non la qualità dell'immagine.
Poi la sezione delle limitazioni, insolitamente diretta. I 15 aggiornamenti latenti e i 30 fotogrammi visualizzati al secondo dichiarati sono obiettivi. La frequenza di fotogrammi sostenuta e la latenza dall'input alla visualizzazione durante l'interazione multi-agente dal vivo "non sono state valutate quantitativamente". La qualità a lungo orizzonte, la concordanza tra le viste e l'aderenza delle azioni end-to-end sono tutte elencate come non valutate. L'ambiente richiede un motore di gioco strumentato con geometria esplicita e un vocabolario di aspetto fisso, e il trasferimento a nuovi asset, regole o ambienti non è testato. Leggi quell'elenco prima di qualsiasi numero di punta su Agora-2.
Quale appartiene al tuo stack?
Se oggi gestisci o studi sistemi multi-agente, Grok 4.6 è il componente che puoi effettivamente distribuire — un modello testuale di livello frontier a un costo che rende accessibili grandi flotte di agenti, con un punteggio pubblicato e una superficie API documentata. Su OrcaRouter viene erogato al prezzo di listino di xAI, senza alcun ricarico, quindi i $2/$6 sopra indicati e qualsiasi futura variazione di tariffa arrivano sulla tua fattura il giorno stesso in cui si verificano, con failover automatico se l'endpoint primario si degrada. Entrambi gli aspetti contano specificamente per i carichi di lavoro delle flotte: mille agenti sono mille possibilità di imbattersi in un provider degradato, e un ricarico sui $6 di output è un ricarico moltiplicato per l'intera esecuzione.

Agora-2 non è un'infrastruttura distribuibile e non la ospitiamo — non c'è alcuna API, né pesi né prezzo, solo l'anteprima giocabile di Odyssey stessa. Ciò che offre è un tipo diverso di valore: un ambiente controllato per la ricerca sull'interazione che il rapporto METR mostra essere ormai urgente, al costo di quattro GPU RTX PRO 4500 per quattro viste simultanee anziché una bolletta API. Il verdetto onesto è che queste due non competono. Grok 4.6 è il cervello delle policy che puoi acquistare a token oggi; Agora-2 è una proposta su dove testare cosa succede quando migliaia di quei cervelli si incontrano. La seconda è ricerca più interessante e meno prodotto finito, e il rapporto di Odyssey è di una chiarezza rinfrescante su quali parti di essa siano ancora obiettivi.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
