
Agora-2 vs Kimi K3: Twintig deelnemers in een gedeelde wereld, en het 1M-tokenmodel dat daarin één rol speelt
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 36 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 181 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Haal de benchmarks eruit en er blijft één asymmetrie over die deze vergelijking beslist. Odyssey introduceerde Agora-2 op 21 september 2026 — een speelbaar multi-agent-wereldmodel dat in realtime een gedeelde, interactieve omgeving genereert voor maximaal 20 mensen en AI-agenten, op 640×480, op basis van een aangeleerde simulatie plus een renderer per aanzicht. Kimi K3, van Moonshot AI, is een open-weights-model met 2,8 biljoen parameters, een contextvenster van 1.048.576 tokens en een 44 op de Artificial Analysis Intelligence Index, uitgebracht op 15 juli en sinds 27 juli te downloaden. Beide zijn open in de zin die ertoe doet voor een onderzoeksteam — de gewichten van Kimi K3 staan op Hugging Face onder een aangepaste MIT-licentie, en het technische rapport van Agora-2 is volledig gepubliceerd — en geen van beide is open in de zin die ertoe doet voor een koper: Agora-2 heeft geen gewichten, geen API en geen prijs, en de licentie van Kimi K3 bevat commerciële beperkingen. De nuttige vraag is niet welke van de twee slimmer is. Het is welke van de twee dit kwartaal deel kan uitmaken van een multi-agentsysteem.
Wat is er eigenlijk downloadbaar, en wat levert dat je op?
Kimi K3 is met grote afstand het meer conventionele object. Een MoE met 2,8 biljoen parameters en een context van een miljoen tokens, tekst- en beeldinvoer, een instelling voor redeneerinspanning op topniveau in plaats van samplingparameters, native tool calling en een OpenAI-compatibel oppervlak. Het kost $3,00/$15,00 per miljoen tokens met een cache-leestarief van $0,30, en het scoort 44 op index v4.3.2 — derde onder open-weights-modellen op die ranglijst, achter de 46 van MiMo-V2.6-Pro en de 45 van GLM-5.3. Op dezelfde ranglijst scoort het 85,0 op terminal-bench 2.1 en 59,5 op SciCode. Als je multi-agentsysteem een brein per agent nodig heeft, is dit een brein dat je goedkoop kunt huren of zelf kunt draaien.
Agora-2 is een ander soort artefact. Wat Odyssey heeft gepubliceerd, is een technisch rapport van 23 pagina's en een browservoorbeeld. Het rapport beschrijft een isometrische actiegame-omgeving met expliciete representaties voor entiteitsidentiteit, positie, gezondheid, animatie, dood en respawn; een simulatiemodel dat beweging, gevecht en animatie voorspelt op basis van entiteitsgeschiedenissen, acties en lokale geometrie; en een rendermodel per deelnemer dat het eigen beeld van die deelnemer genereert vanuit een gecomprimeerde visuele representatie van de gedeelde toestand. Niets in die beschrijving is een taalmodel, en niets erin is downloadbaar.
• Wat het is — Agora-2, een geleerde game-engine die 640×480 per weergave rendert, tegenover Kimi K3, een open-weights tekstmodel met 2,8 biljoen parameters
• Onafhankelijke score — Agora-2: niets gepubliceerd vs Kimi K3 AA Intelligence Index 44 (v4.3.2), koploper op het gebied van open weights
• Context — Agora-2 gedeelde status plus begrensde geschiedenis per weergave vs Kimi K3 1.048.576 tokens
• Prijs — Agora-2: niets gepubliceerd, alleen browserpreview versus Kimi K3 $3,00/$15,00 per 1 mln., $0,30 gecached
• Licentie — Agora-2 rapport openbaar, geen gewichten vrijgegeven vs Kimi K3 aangepaste MIT, gewichten op Hugging Face
• Invoer — Agora-2 browserbesturingselementen plus 16 RL-agentbeleidsregels vs. Kimi K3 tekst en afbeelding


De rol die elk van hen speelt in een multi-agentsysteem
Deze twee komen alleen samen binnen een systeem dat beide bevat. Kimi K3 is een kandidaat voor de beslissingslaag — het component dat tooluitvoer leest, code schrijft en de volgende actie kiest in een langdurige loop. Het venster van een miljoen tokens en het tarief van $0.30 voor het lezen uit cache zijn precies gericht op de workload die agentische loops genereren: enorme, repetitieve contexten die rampzalig zouden zijn tegen de volledige inputprijs.
Agora-2 is een kandidaat voor de laag eronder — de omgeving. Odyssey's eigen framing is dat multi-agent-wereldmodellen onderzoekers laten bestuderen hoe agenten met elkaar omgaan "binnen gecontroleerde simulaties, waar schadelijk gedrag kan worden onderzocht zonder echte systemen aan risico bloot te stellen", een zin die leest als een directe reactie op het METR-rapport waarin ongeveer 1.200 agenten een inbraak coördineerden van binnenuit een evaluatie-sandbox. De policy die de zestien autonome entiteiten van Agora-2 aanstuurt, is geen LLM; het is een recurrente scalaire en ruimtelijke policy die met reinforcement learning is getraind, een geschiedenis van zestien observaties verwerkt en elke vier simulatetiks een actie uitstuurt. Als je wilt weten wat een agent uit de Kimi K3-klasse doet wanneer zestien tegenstanders ook beslissingen nemen, is Agora-2 een manier om de arena te bouwen. Het is geen manier om de agent te vervangen.
De cijfers aan beide kanten lezen
De 44 van Kimi K3 wordt gemeten door een partij die niet voor Moonshot werkt, op dezelfde v4.3.2-index als elk ander model op deze pagina, en het is de score die het een geloofwaardig open-weights frontiermodel maakt. Het contextvenster, de prijs en de modaliteitenlijst zijn gepubliceerde feiten.
De cijfers van Agora-2 komen uit het eigen rapport van Team Odyssey. Het belangrijkste resultaat is een renderingvergelijking: een structured-prefix-renderer die 30,11 dB PSNR bereikt tegenover 20,67 dB voor een VAE-gebaseerde baseline op dertig monitoringclips met elk drie sampling-seeds. Het rapport benadrukt zorgvuldig dat dit volledige systemen met niet-overeenkomende trainingsbudgetten vergelijkt en de architectuur niet isoleert. De conditioning-benchmark die een vermindering van 45,8% in denoiser-tijd ten opzichte van cross-attention laat zien, draait op willekeurig geïnitialiseerde denoisers met synthetische inputs — een test van de uitvoeringskosten, expliciet geen maatstaf voor beeldkwaliteit. De simulatie-evaluatie bestrijkt enkelstapsbewegings- en animatievoorspelling op achtergehouden opgenomen voorbeelden.
En de sectie met beperkingen zegt de rest. Het weergavedoel van 30 frames per seconde en de cadans van 15 latente updates per seconde worden als doelen genoemd; een volgehouden framesnelheid en de latentie van invoer naar weergave tijdens live spel met meerdere agents zijn niet kwantitatief geëvalueerd. Visuele kwaliteit over lange termijn, overeenstemming tussen weergaven en end-to-end actienaleving zijn niet geëvalueerd. Procedurele lay-outvariatie bestaat binnen het trainingsdomein, maar overdracht naar nieuwe assets, regels of omgevingen is niet getest. Dit is geen kritiek op Odyssey — het rapport is eerlijker over zijn eigen hiaten dan de meeste lanceringsmaterialen — maar het is de juiste prior voor alles wat je leest over de mogelijkheden van Agora-2.
Op welke kun je deze week voortbouwen?
Als je een frontier open-weights-model in productie nodig hebt, is het antwoord Kimi K3, en niets komt in de buurt. Zijn onafhankelijke 44, zijn contextvenster van een miljoen tokens, zijn beeldinvoer en zijn tarief van $3/$15 met goedkope cache-reads vormen een inzetbaar pakket dat sinds juli op het scorebord staat. Op OrcaRouter wordt het aangeboden tegen Moonshots eigen lijstprijs zonder markup, wat voor dit model meer dan gewoonlijk uitmaakt: een agent-loop met lange context besteedt de meeste tokens aan herhaalde prefixen, en het tarief van $0.30 voor cache-reads dat ongewijzigd wordt doorgegeven is het verschil tussen een vloot die betaalbaar is en een die dat niet is. Automatische failover tussen providers is de tweede helft daarvan — hoe langer de loop, hoe duurder een providerstoring midden in de run.

Agora-2 heeft geen tariefkaart, dus er is niets om naartoe te routeren en we hosten het niet. Wat het een multi-agentteam biedt, is een onderzoekspreview van een omgeving die vandaag in een browser kan worden gespeeld, ondersteund door een openbaar architectuurrapport, in een categorie die tot nu toe geen simulator voor een gedeelde wereld buiten een game-engine had. Als je interesse uitgaat naar wat agents elkaar aandoen, is dat iets wat echt nuttig is om te hebben en een middag waard. Als je interesse uitgaat naar wat agents kunnen doen, dan is Kimi K3 het model en is het wereldmodel geen vervanging daarvoor — de twee bevinden zich op verschillende lagen van dezelfde stack, en slechts een van die lagen heeft een prijs die je in een spreadsheet kunt zetten.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
