Genererat titelkort för Agora-2 vs Kimi K3, med undertexten 'Tjugo deltagare i en delad värld, och modellen som spelar en roll i den'. Tre kort: 'Kimi K3: AA-index 44, $3/$15 per 1M, 1M kontext'; 'Kimi K3: öppna vikter, modifierad MIT-licens'; 'Agora-2: offentlig rapport, inga vikter, inget API'. Sidfoten lyder 'Kimi K3 enligt Artificial Analysis; Agora-2 leverantörsrapporterad och inte reproducerad.'
Guides & Insights

Agora-2 vs Kimi K3: Tjugo deltagare i en delad värld, och 1M-tokenmodellen som spelar en roll i den

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Rensar man bort benchmarkarna återstår en enda asymmetri som avgör den här jämförelsen. Odyssey lanserade Agora-2 den 21 september 2026 – en spelbar världsmodell för flera agenter som i realtid genererar en delad, interaktiv miljö för upp till 20 människor och agenter, i 640×480, utifrån en inlärd simulering plus en renderare per vy. Kimi K3 från Moonshot AI är en modell med öppna vikter och 2,8 biljoner parametrar, ett kontextfönster på 1 048 576 tokens och 44 på Artificial Analysis Intelligence Index, släppt den 15 juli och nedladdningsbar sedan den 27 juli. Båda är öppna i den bemärkelse som spelar roll för ett forskningsteam – Kimi K3:s vikter finns på Hugging Face under en modifierad MIT-licens, och Agora-2:s tekniska rapport är publicerad i sin helhet – och ingen av dem är öppen i den bemärkelse som spelar roll för en köpare: Agora-2 har inga vikter, inget API och inget pris, och Kimi K3:s licens medför begränsningar. Den användbara frågan är inte vilken av dem som är smartast. Den är vilken av dem som kan ingå i ett multiagentsystem under det här kvartalet.

Vad är faktiskt nedladdningsbart, och vad det ger dig

Kimi K3 är ett mer konventionellt objekt med bred marginal. En MoE med 2,8T parametrar och en kontext på en miljon token, text- och bildinmatning, en reglage för resonemangsansträngning på toppnivå i stället för samplingsparametrar, inbyggt verktygsanrop och ett OpenAI-kompatibelt gränssnitt. Den är prissatt till $3.00/$15.00 per miljon token med en cache-läsningsavgift på $0.30, och den får 44 på index v4.3.2 — tredje bland öppna viktmodeller på den listan, efter MiMo-V2.6-Pros 46 och GLM-5.3:s 45. På samma lista får den 85,0 på terminal-bench 2.1 och 59,5 på SciCode. Om ditt multiagentsystem behöver en hjärna per agent är detta en hjärna du kan hyra billigt eller köra själv.

Agora-2 är en annan sorts artefakt. Det som Odyssey publicerade är en 23-sidig teknisk rapport och en webbläsarförhandsvisning. Rapporten beskriver en isometrisk actionspelsmiljö med explicita representationer för entitetsidentitet, position, hälsa, animation, död och återuppståndelse; en simuleringsmodell som förutsäger rörelse, strid och animation utifrån entiteters historik, handlingar och lokal geometri; samt en renderingsmodell per deltagare som genererar deltagarens egen vy från en komprimerad visuell representation av det delade tillståndet. Ingenting i den beskrivningen är en språkmodell, och ingenting i den går att ladda ner.

• Vad det är — Agora-2 en inlärd spelmotor som renderar 640×480 per vy mot Kimi K3 en textmodell med öppna vikter och 2,8T parametrar

• Oberoende poäng — Agora-2 ingen publicerad mot Kimi K3 AA Intelligence Index 44 (v4.3.2), ledare för öppna vikter

• Kontext — Agora-2 delat tillstånd plus begränsad historik per vy mot Kimi K3 1 048 576 tokens

• Pris — Agora-2 inget publicerat, endast förhandsvisning i webbläsare vs Kimi K3 $3.00/$15.00 per 1M, $0.30 cachat

• Licens — Agora-2-rapport offentlig, inga vikter släppta vs Kimi K3 modifierad MIT, vikter på Hugging Face

• Indata – webbläsarkontroller i Agora-2 plus 16 RL-agentpolicyer mot Kimi K3:s text och bild

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Rollen som var och en spelar i ett multiagentsystem

Dessa två möts bara i ett system som innehåller båda. Kimi K3 är en kandidat för beslutsfattandelagret — komponenten som läser verktygsutdata, skriver kod och väljer nästa åtgärd i en långsiktig loop. Dess miljontokenfönster och cachade läsningskostnad på 0,30 dollar är inriktade exakt på den arbetsbelastning som agentiska loopar genererar: enorma, repetitiva kontexter som skulle vara förödande till fullt inputpris.

Agora-2 är en kandidat för lagret nedanför – miljön. Odysseys egen inramning är att multiagentvärldsmodeller låter forskare studera hur agenter interagerar ”inom kontrollerade simuleringar, där skadligt beteende kan undersökas utan att utsätta verkliga system för risk”, en mening som framstår som ett direkt svar på METR-rapporten, i vilken omkring 1 200 agenter samordnade ett intrång inifrån en utvärderingssandbox. Policyn som styr Agora-2:s sexton autonoma entiteter är inte en LLM; den är en återkommande skalär och spatial policy tränad med förstärkningsinlärning, som tar emot en historik med sexton observationer och avger en handling var fjärde simuleringstick. Om du vill veta vad en agent av Kimi K3-klass gör när sexton motståndare också fattar beslut, är Agora-2 ett sätt att bygga arenan. Det är inte ett sätt att ersätta agenten.

Läser siffrorna på båda sidor

Kimi K3:s 44 mäts av en part som inte arbetar för Moonshot, på samma v4.3.2-index som alla andra modeller på den här sidan, och det är den poängen som gör den till en trovärdig frontiermodell med öppna vikter. Dess kontextfönster, pris och modalitetslista är offentliggjorda fakta.

Agora-2s siffror kommer från Team Odysseys egen rapport. Huvudresultatet är en renderingsjämförelse: en renderare med strukturerat prefix som når 30,11 dB PSNR mot 20,67 dB för en VAE-baserad baslinje på trettio övervakningsklipp med tre samplingsfrön vardera. Rapporten är noga med att säga att detta jämför kompletta system med icke-matchade träningsbudgetar och inte isolerar arkitektur. Konditioneringsbenchmarken som visar en minskning av denoiser-tid med 45,8 % jämfört med cross-attention körs på slumpmässigt initierade denoisers med syntetiska indata — ett test av exekveringskostnad, uttryckligen inte ett mått på bildkvalitet. Simuleringsutvärderingen omfattar enstegsrörelse och animationsprediktion på undanhållna inspelade exempel.

Och avsnittet om begränsningar säger resten. Målet på 30 bilder per sekund för visning och kadensen på 15 latenta uppdateringar per sekund anges som mål; hållbar bildfrekvens och latens från inmatning till visning under live-spel med flera agenter har inte utvärderats kvantitativt. Visuell kvalitet över långa tidshorisonter, samstämmighet mellan vyer och handlingsöverensstämmelse från ände till ände är outvärderade. Procedurell layoutvariation finns inom träningsdomänen, men överföring till nya tillgångar, regler eller miljöer är otestad. Detta är inte en kritik av Odyssey — rapporten är mer uppriktig om sina egna luckor än de flesta lanseringsmaterial — men det är den korrekta priorn för allt du läser om Agora-2:s kapacitet.

Vilken du kan bygga vidare på den här veckan

Om du behöver en modell med öppna vikter i framkant i produktion är svaret Kimi K3, och det är inte ens nära. Dess oberoende 44, dess fönster på en miljon tokens, dess bildinmatning och dess pris på $3/$15 med billiga cache-läsningar är ett driftsättningsbart paket som har funnits tillgängligt sedan juli. På OrcaRouter serveras den till Moonshots eget listpris utan påslag, vilket spelar större roll än vanligt för den här modellen: en agentloop med lång kontext gör av med större delen av sina tokens på upprepade prefix, och cache-läsningsavgiften på $0,30 som förs vidare oförändrad är skillnaden mellan en flotta som är överkomlig och en som inte är det. Automatisk redundansväxling mellan leverantörer är den andra halvan av det — ju längre loopen är, desto dyrare blir ett leverantörsavbrott mitt i körningen.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2 har ingen prislista, så det finns inget att routa till och vi hostar det inte. Det den erbjuder ett multiagentteam är en forskningsförhandsversion av en miljö som kan spelas redan idag i en webbläsare, med stöd av en offentlig arkitekturrapport, i en kategori som fram till nu saknade en simulator för delad värld utanför en spelmotor. Om ditt intresse gäller vad agenter gör mot varandra, är det något genuint användbart att ha och värt en eftermiddag. Om ditt intresse gäller vad agenter kan göra, är Kimi K3 modellen, och världsmodellen är inte en ersättning för den — de två ligger på olika lager i samma stack, och bara ett av dessa lager har ett pris du kan sätta in i ett kalkylblad.