Titolo generato per Agora-2 vs Grok 4.6, con sottotitolo '1.200 agenti LLM e il simulatore che non ne usa nessuno'. Tre schede: 'Grok 4.6: AA Index 44, 2 $/6 $ per 1M, 0,50 $ in cache'; 'Agora-2: 16 policy di agenti RL, nessun LLM nel loop'; 'Agora-2: tick a 30 Hz, 4 GPU RTX PRO 4500 per sessione'. In calce si legge 'I dati di Agora-2 provengono dal report di Odyssey stesso, non replicati; Grok 4.6 secondo Artificial Analysis'.
Guides & Insights

Agora-2 vs Grok 4.6: la questione della policy degli agenti — 1.200 agenti LLM, e il simulatore che non usa nessuno dei due

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ecco un numero che costa denaro. L'indagine di METR sull'incidente di Hugging Face del luglio 2026 ha contato circa 1.200 agenti coordinati all'interno di una singola esecuzione di valutazione. Al Grok 4.6listino prezzi di — 2,00 $ per milione di token in input, 6,00 $ per milione in output — una flotta di quelle dimensioni, che macina lunghi transcript per sei giorni, è una bolletta che un team ben finanziato può effettivamente sostenere. Al prezzo del modello a cui altrimenti ti rivolgeresti, non lo è. Questa è la vera proposta di prodotto di Grok 4.6, ed è la stessa proposta che Agora-2contraddice in silenzio: quando Odysseyha presentato il suo world model multi-agente il 21 settembre 2026 — un'anteprima giocabile che genera ambienti condivisi per un massimo di 20 esseri umani e agenti AI — gli agenti al suo interno si sono rivelati non essere affatto modelli linguistici. Odyssey ha invece addestrato piccole policy di reinforcement learning. La domanda interessante che questo abbinamento solleva non è quale sia migliore. È perché il laboratorio abbia saltato l'LLM.

Il tariffario, nell'unità che conta per le flotte

Grok 4.6 è stato rilasciato il 12 agosto 2026 come tier frontier di xAI: una finestra di contesto di 500.000 token, input di testo, immagini e file, sforzo di ragionamento configurabile, tool calling nativo, output strutturati e un Artificial Analysis Intelligence Index di 44 sull'indice v4.3.2 — lo stesso indice che colloca GPT-5.6 Sol a 47 e Kimi K3 a 44. Artificial Analysis gli assegna 94,9 su GPQA Diamond, ed è il modello che xAI elenca come "Latest" nella propria documentazione per sviluppatori. È servito come modello OpenAI Responses di prima classe, che è il punto pratico: i framework agentici lo adottano cambiando un base URL, non scrivendo un adattatore.

Ma il dato interessante è l'abbinamento di $2/$6 con la finestra di contesto. I loop di agenti a lungo orizzonte sono carichi di lavoro brutti — decine di migliaia di token di output accumulato degli strumenti per agente ogni ora, in gran parte ridondanti. La tariffa di lettura della cache di Grok 4.0 è di $0.50 per milione, un quarto del suo prezzo di input, ed è ciò che rende un'esecuzione con mille agenti aritmeticamente plausibile anziché semplicemente possibile. Nota il confine di livello: i prompt superiori a 200K token vengono fatturati al doppio della tariffa base, quindi un agente che accumula una lunga cronologia raddoppia silenziosamente il proprio costo.

• Prezzo — Agora-2 nessun prezzo pubblicato, solo anteprima browser rispetto a Grok 4.6: $2,00/$6,00 per 1M, $0,50 per lettura in cache, raddoppia oltre i 200K di input

• Contesto — stato condiviso di Agora-2 più cronologia limitata per vista rispetto a Grok 4.6 500.000 token

• Punteggio indipendente — Agora-2 nessuno pubblicato vs Grok 4.6 AA Intelligence Index 44 (v4.3.2)

• Ragionamento — Agora-2: non applicabile, non un modello linguistico vs Grok 4.6: sforzo configurabile, chiamata nativa agli strumenti

• Accesso — Anteprima giocabile di Agora-2, nessuna API, nessun peso vs API proprietaria di Grok 4.6

• Hardware — Agora-2: quattro GPU RTX PRO 4500 per quattro viste simultanee vs Grok 4.6, un endpoint ospitato

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Perché Odyssey non ha messo un LLM nell'arena

La scorciatoia ovvia, se stai costruendo un mondo in cui sedici agenti AI combattono contro quattro umani, è collegare un modello testuale capace ai controlli e lasciarlo giocare. Odyssey non l'ha fatto, e il suo rapporto tecnico ne spiega il motivo nella tabella di configurazione. La policy dell'agente in Agora-2 è una policy ricorrente scalare e spaziale che consuma una cronologia di sedici osservazioni, emettendo un'azione ogni quattro tick di simulazione su quattordici rami di movimento discreti. La simulazione stessa avanza su una base temporale di tick a 30 Hz. Un modello a cui si chiede di prendere una decisione trenta volte al secondo, da una vista parzialmente osservata, con un vocabolario fisso di azioni di basso livello, non è un problema di ragionamento — è un problema di controllo, e i problemi di controllo si risolvono addestrando una piccola policy, non facendo prompting a un modello di frontiera con contesto da 500K.

Vale la pena dichiararlo chiaramente perché è l'equivoco più comune sulla categoria dei world model. Agora-2 non compete con Grok 4.6 per lo stesso slot in un sistema. Occupa lo slot sottostante: l'ambiente in cui la policy viene addestrata e valutata. L'architettura del report è esplicita sulla separazione — un modello di simulazione prevede come le azioni combinate modificano lo stato condiviso, un world server le applica, e un modello di rendering per vista genera la prospettiva 640×480 di ciascun partecipante da quello stato. Nessun modello testuale compare da nessuna parte nel ciclo di interazione.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Dove invece compare un modello come Grok 4.6 è un livello più in alto: come la cosa che scrive l'impalcatura di valutazione, analizza le trascrizioni o guida l'agente che usa strumenti il cui comportamento stai cercando di studiare. È esattamente il ruolo che GPT-5.6 Sol ha svolto nell'indagine di METR — circa il 5% della flotta, e l'analista che legge i log — ed è il ruolo che il prezzo e la finestra di contesto di Grok 4.6 rendono economico.

Il divario probatorio è più ampio qui che nella maggior parte di questi confronti.

Il punteggio dell'indice di Grok 4.6 è misurato in modo indipendente, la sua scheda tariffaria è pubblicata e la sua finestra di contesto è documentata. I numeri di Agora-2 provengono da un rapporto redatto da Team Odyssey e che nessuno ha riprodotto. Su trenta clip di monitoraggio il suo renderer a prefisso strutturato raggiunge 30,11 dB PSNR contro 20,67 dB per una baseline VAE — un confronto che il rapporto stesso avverte essere tra sistemi completi con budget di addestramento non corrispondenti, non un test isolato di architettura. Il suo benchmark di condizionamento, che mostra una riduzione del 45,8% del tempo del denoiser rispetto alla cross-attention, utilizza denoiser inizializzati casualmente su input sintetici e misura il costo di esecuzione, non la qualità dell'immagine.

Poi la sezione delle limitazioni, insolitamente diretta. I 15 aggiornamenti latenti e i 30 fotogrammi visualizzati al secondo dichiarati sono obiettivi. La frequenza di fotogrammi sostenuta e la latenza dall'input alla visualizzazione durante l'interazione multi-agente dal vivo "non sono state valutate quantitativamente". La qualità a lungo orizzonte, la concordanza tra le viste e l'aderenza delle azioni end-to-end sono tutte elencate come non valutate. L'ambiente richiede un motore di gioco strumentato con geometria esplicita e un vocabolario di aspetto fisso, e il trasferimento a nuovi asset, regole o ambienti non è testato. Leggi quell'elenco prima di qualsiasi numero di punta su Agora-2.

Quale appartiene al tuo stack?

Se oggi gestisci o studi sistemi multi-agente, Grok 4.6 è il componente che puoi effettivamente distribuire — un modello testuale di livello frontier a un costo che rende accessibili grandi flotte di agenti, con un punteggio pubblicato e una superficie API documentata. Su OrcaRouter viene erogato al prezzo di listino di xAI, senza alcun ricarico, quindi i $2/$6 sopra indicati e qualsiasi futura variazione di tariffa arrivano sulla tua fattura il giorno stesso in cui si verificano, con failover automatico se l'endpoint primario si degrada. Entrambi gli aspetti contano specificamente per i carichi di lavoro delle flotte: mille agenti sono mille possibilità di imbattersi in un provider degradato, e un ricarico sui $6 di output è un ricarico moltiplicato per l'intera esecuzione.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 non è un'infrastruttura distribuibile e non la ospitiamo — non c'è alcuna API, né pesi né prezzo, solo l'anteprima giocabile di Odyssey stessa. Ciò che offre è un tipo diverso di valore: un ambiente controllato per la ricerca sull'interazione che il rapporto METR mostra essere ormai urgente, al costo di quattro GPU RTX PRO 4500 per quattro viste simultanee anziché una bolletta API. Il verdetto onesto è che queste due non competono. Grok 4.6 è il cervello delle policy che puoi acquistare a token oggi; Agora-2 è una proposta su dove testare cosa succede quando migliaia di quei cervelli si incontrano. La seconda è ricerca più interessante e meno prodotto finito, e il rapporto di Odyssey è di una chiarezza rinfrescante su quali parti di essa siano ancora obiettivi.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno