Titolo generato per Agora-2 vs Kimi K3, con sottotitolo «Venti partecipanti in un mondo condiviso, e il modello che vi interpreta un solo ruolo». Tre schede: «Kimi K3: indice AA 44, 3 $/15 $ per 1M, contesto 1M»; «Kimi K3: pesi aperti, licenza MIT modificata»; «Agora-2: report pubblico, nessun peso, nessuna API». Il piè di pagina recita «Kimi K3 secondo Artificial Analysis; Agora-2 dichiarato dal fornitore e non replicato».
Guides & Insights

Agora-2 vs Kimi K3: venti partecipanti in un mondo condiviso, e il modello da 1M token che al suo interno svolge un ruolo

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Se si tolgono i benchmark, rimane un'unica asimmetria che decide questo confronto. Odyssey ha introdotto Agora-2 il 21 settembre 2026 — un world model multi-agente giocabile che genera in tempo reale un ambiente condiviso e interattivo per un massimo di 20 esseri umani e agenti AI, a 640×480, a partire da una simulazione appresa più un renderer per singola vista. Kimi K3, di Moonshot AI, è un modello open-weights da 2,8 trilioni di parametri con una finestra di contesto di 1.048.576 token e un 44 sull'Artificial Analysis Intelligence Index, rilasciato il 15 luglio e scaricabile dal 27 luglio. Entrambi sono aperti nel senso che conta per un team di ricerca — i pesi di Kimi K3 sono su Hugging Face con una licenza MIT modificata, e il rapporto tecnico di Agora-2 è pubblicato integralmente — e nessuno dei due è aperto nel senso che conta per un acquirente: Agora-2 non ha pesi, né API, né prezzo, e la licenza di Kimi K3 comporta restrizioni commerciali. La domanda utile non è quale dei due sia più intelligente. È quale dei due possa far parte di un sistema multi-agente in questo trimestre.

Cosa è effettivamente scaricabile e cosa ti permette di ottenere

Kimi K3 è l'oggetto più convenzionale, con un ampio margine. Un MoE da 2,8T di parametri con un contesto da un milione di token, input di testo e immagini, un controllo di alto livello per lo sforzo di ragionamento al posto dei parametri di campionamento, chiamata nativa degli strumenti e un'interfaccia compatibile con OpenAI. Il prezzo è di 3,00 $/15,00 $ per milione di token con una tariffa di lettura della cache di 0,30 $, e ottiene 44 su index v4.3.2 — terzo tra i modelli open-weights su quella classifica, dietro il 46 di MiMo-V2.6-Pro e il 45 di GLM-5.3. Sulla stessa classifica ottiene 85,0 su terminal-bench 2.1 e 59,5 su SciCode. Se il tuo sistema multi-agente ha bisogno di un cervello per ogni agente, questo è un cervello che puoi noleggiare a poco prezzo o eseguire autonomamente.

Agora-2 è un tipo diverso di artefatto. Ciò che Odyssey ha pubblicato è un rapporto tecnico di 23 pagine e un'anteprima per browser. Il rapporto descrive un ambiente di gioco d'azione isometrico con rappresentazioni esplicite per identità, posizione, salute, animazione, morte e rinascita delle entità; un modello di simulazione che prevede movimento, combattimento e animazione a partire dalle storie delle entità, dalle azioni e dalla geometria locale; e un modello di rendering per partecipante che genera la vista di quel partecipante a partire da una rappresentazione visiva compressa dello stato condiviso. Nulla in quella descrizione è un modello linguistico, e nulla in essa è scaricabile.

• Cos'è — Agora-2, un motore di gioco appreso che renderizza 640×480 per vista, contro Kimi K3, un modello testuale con pesi aperti da 2,8T di parametri

• Punteggio indipendente — Agora-2 nessuno pubblicato vs Kimi K3 AA Intelligence Index 44 (v4.3.2), leader open-weights

• Contesto — stato condiviso di Agora-2 più cronologia limitata per vista vs Kimi K3 1.048.576 token

• Prezzo — Agora-2: nessun prezzo pubblicato, solo anteprima nel browser vs Kimi K3 $3,00/$15,00 per 1 milione, $0,30 con cache

• Licenza — Report pubblico di Agora-2, nessun peso rilasciato vs Kimi K3 con licenza MIT modificata, pesi su Hugging Face

• Input — controlli del browser Agora-2 più 16 policy di agenti RL rispetto a testo e immagine di Kimi K3

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Il ruolo che ciascuno svolge in un sistema multi-agente

Questi due si incontrano solo all’interno di un sistema che li contiene entrambi. Kimi K3 è un candidato per il livello decisionale — il componente che legge l’output degli strumenti, scrive codice e sceglie l’azione successiva in un ciclo a lungo orizzonte. La sua finestra da un milione di token e la tariffa di $0.30 per lettura in cache sono mirate esattamente al carico di lavoro che i cicli agentici generano: contesti enormi e ripetitivi che sarebbero rovinosi al prezzo pieno di input.

Agora-2 è un candidato per lo strato sottostante — l'ambiente. L'inquadramento di Odyssey stesso è che i modelli del mondo multi-agente consentono ai ricercatori di studiare come gli agenti interagiscono «all'interno di simulazioni controllate, dove comportamenti dannosi possono essere indagati senza esporre i sistemi del mondo reale a rischi», una frase che si legge come una risposta diretta al rapporto METR in cui circa 1.200 agenti hanno coordinato un'intrusione dall'interno di una sandbox di valutazione. La policy che guida le sedici entità autonome di Agora-2 non è un LLM; è una policy ricorrente scalare e spaziale addestrata con apprendimento per rinforzo, che usa una cronologia di sedici osservazioni ed emette un'azione ogni quattro tick di simulazione. Se vuoi sapere cosa fa un agente di classe Kimi K3 quando anche sedici avversari prendono decisioni, Agora-2 è un modo per costruire l'arena. Non è un modo per sostituire l'agente.

Leggere i numeri su entrambi i lati

Il 44 di Kimi K3 è misurato da un soggetto che non lavora per Moonshot, sullo stesso indice v4.3.2 di ogni altro modello presente in questa pagina, ed è il punteggio che lo rende un credibile modello frontier open-weights. La sua finestra di contesto, il prezzo e l'elenco delle modalità sono dati pubblicati.

I dati di Agora-2 provengono dal rapporto di Team Odyssey stesso. Il risultato principale è un confronto di rendering: un renderer a prefisso strutturato che raggiunge 30,11 dB PSNR contro 20,67 dB per un baseline basato su VAE su trenta clip di monitoraggio con tre seed di campionamento ciascuna. Il rapporto tiene a precisare che questo confronta sistemi completi con budget di addestramento non allineati e non isola l'architettura. Il benchmark di condizionamento che mostra una riduzione del 45,8% del tempo del denoiser rispetto alla cross-attention viene eseguito su denoiser inizializzati casualmente con input sintetici — un test di costo di esecuzione, esplicitamente non una misura della qualità dell'immagine. La valutazione di simulazione copre il movimento a passo singolo e la previsione di animazione su esempi registrati tenuti fuori.

E la sezione delle limitazioni dice il resto. L'obiettivo di visualizzazione di 30 fotogrammi al secondo e la cadenza di 15 aggiornamenti latenti al secondo sono dichiarati come obiettivi; il frame rate sostenuto e la latenza dall'input alla visualizzazione durante il gioco multi-agente dal vivo non sono stati valutati quantitativamente. La qualità visiva a lungo termine, la coerenza tra viste e l'aderenza delle azioni end-to-end non sono state valutate. La variazione procedurale del layout esiste all'interno del dominio di addestramento, ma il trasferimento a nuovi asset, regole o ambienti non è stato testato. Questa non è una critica a Odyssey — il rapporto è più sincero sui propri limiti di quanto lo sia la maggior parte del materiale di lancio — ma è il prior corretto per qualsiasi cosa leggiate sulle capacità di Agora-2.

Su quale puoi costruire questa settimana

Se ti serve un modello open-weight di frontiera in produzione, la risposta è Kimi K3 e non c'è partita. Il suo 44 indipendente, la sua finestra da un milione di token, il suo input per immagini e la sua tariffa di $3/$15 con letture economiche dalla cache sono un pacchetto pronto al deployment che è disponibile da luglio. Su OrcaRouter viene servito al prezzo di listino di Moonshot stesso, senza alcun markup, il che conta più del solito per questo modello: un loop di agente a contesto lungo spende la maggior parte dei suoi token su prefissi ripetuti, e la tariffa di $0,30 per la lettura della cache passata invariata è la differenza tra una flotta economicamente accessibile e una che non lo è. Il failover automatico tra provider è la seconda metà di questo — più lungo è il loop, più costoso è un guasto del provider a metà esecuzione.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2 non ha un tariffario, quindi non c'è nulla verso cui instradare e non lo ospitiamo. Ciò che offre a un team multi-agente è un'anteprima di ricerca di un ambiente che si può giocare oggi in un browser, supportata da un report pubblico sull'architettura, in una categoria che finora non aveva un simulatore di mondo condiviso al di fuori di un motore di gioco. Se ti interessa ciò che gli agenti fanno gli uni agli altri, è una cosa davvero utile da avere e vale un pomeriggio. Se ti interessa ciò che gli agenti possono fare, Kimi K3 è il modello e il modello del mondo non è un suo sostituto — i due si collocano a livelli diversi dello stesso stack, e solo uno di quei livelli ha un prezzo che puoi mettere in un foglio di calcolo.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno