Gegenereerde titelkaart voor Agora-2 vs Grok 4.6, met ondertitel '1.200 LLM-agenten, en de simulator die geen van beide gebruikt'. Drie kaarten: 'Grok 4.6: AA Index 44, $2/$6 per 1M, $0.50 gecachet'; 'Agora-2: 16 RL-agentpolicy's, geen LLM in de lus'; 'Agora-2: 30 Hz-tick, 4 RTX PRO 4500 GPU's per sessie'. In de voettekst staat 'Agora-2-cijfers uit Odyssey's eigen rapport, niet gereproduceerd; Grok 4.6 volgens Artificial Analysis.'
Guides & Insights

Agora-2 vs Grok 4.6: De vraag over agentbeleid — 1.200 LLM-agenten, en de simulator die geen van beide gebruikt

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Hier is een getal dat geld kost. Het onderzoek van METR naar het Hugging Face-incident van juli 2026 telde ongeveer 1.200 gecoördineerde agents binnen één enkele evaluatierun. Bij het tarievenkaartje van Grok 4.6 — $2,00 per miljoen inputtokens, $6,00 per miljoen output — is een vloot van die omvang, die zes dagen lang lange transcripten staat te verwerken, een rekening die een goed gefinancierd team daadwerkelijk kan dragen. Tegen de prijs van het model waarnaar je anders zou grijpen, is dat niet het geval. Dat is de echte productbelofte van Grok 4.6, en het is dezelfde belofte die Agora-2 stilletjes tegenspreekt: toen Odyssey op 21 september 2026 zijn multi-agentwereldmodel introduceerde — een speelbare preview die gedeelde omgevingen genereert voor maximaal 20 mensen en AI-agents — bleken de agents daarin helemaal geen taalmodellen te zijn. Odyssey trainde in plaats daarvan kleine reinforcement-learning-policies. De interessante vraag die deze combinatie oproept is niet welke beter is. Het is waarom het lab de LLM oversloeg.

De tariefkaart, in de eenheid die voor wagenparken telt.

Grok 4.6 werd uitgebracht op 12 augustus 2026 als xAI's frontier-tier: een contextvenster van 500.000 tokens, tekst-, afbeeldings- en bestandsinvoer, configureerbare reasoning-inspanning, native tool calling, gestructureerde uitvoer, en een Artificial Analysis Intelligence Index van 44 op index v4.3.2 — dezelfde index die GPT-5.6 Sol op 47 en Kimi K3 op 44 plaatst. Artificial Analysis geeft het een score van 94,9 op GPQA Diamond, en het is het model dat xAI als "Latest" vermeldt in zijn eigen ontwikkelaarsdocumentatie. Het wordt aangeboden als een first-class OpenAI Responses-model, wat het praktische punt is: agent-frameworks nemen het over door een basis-URL te wijzigen, niet door een adapter te schrijven.

Maar het interessante cijfer is de combinatie van $2/$6 met het contextvenster. Langdurige agent-loops zijn lelijke workloads — tienduizenden tokens aan verzamelde tool-output per agent per uur, waarvan het meeste redundant. Het tarief voor cache-lezen van Grok 4.6 is $0,50 per miljoen, een kwart van de inputprijs, en dat is wat een run met duizend agents rekenkundig aannemelijk maakt in plaats van slechts mogelijk. Let op de tiergrens: prompts boven 200K tokens worden tegen het dubbele van het basistarief gefactureerd, dus een agent die een lange geschiedenis opbouwt, verdubbelt stilletjes zijn eigen kosten.

• Prijs — Agora-2 geen gepubliceerde prijs, alleen browserpreview vs Grok 4.6 $2,00/$6,00 per 1M, $0,50 voor cache-read, verdubbelt boven 200K input

• Context — gedeelde status van Agora-2 plus begrensde geschiedenis per weergave vs. Grok 4.6 500.000 tokens

• Onafhankelijke score — Agora-2 niets gepubliceerd vs Grok 4.6 AA Intelligence Index 44 (v4.3.2)

• Redeneren — Agora-2 niet van toepassing, geen taalmodel vs. Grok 4.6: configureerbare inspanning, native tool-aanroepen

• Toegang — Agora-2 speelbare preview, geen API, geen gewichten vs Grok 4.6 propriëtaire API

• Hardware — Agora-2 vier RTX PRO 4500 GPU's voor vier gelijktijdige weergaven vs Grok 4.6, een gehoste endpoint

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Waarom Odyssey geen LLM in de arena plaatste

De voor de hand liggende sluiproute, als je een wereld bouwt waarin zestien AI-agenten tegen vier mensen vechten, is een capabel tekstmodel aan de besturing koppelen en het laten spelen. Odyssey deed dat niet, en in het technische rapport staat waarom, in de configuratietabel. Het agentbeleid in Agora-2 is een recurrent scalar- en ruimtelijk beleid dat een geschiedenis van zestien observaties gebruikt en elke vier simulatietikken een actie uitstuurt over veertien discrete bewegingstakken. De simulatie zelf loopt op een tick-tijdbasis van 30 Hz. Een model dat dertig keer per seconde een beslissing moet nemen, vanuit een gedeeltelijk waargenomen beeld, met een vaste actievocabulaire op laag niveau, is geen redeneerprobleem — het is een regelprobleem, en regelproblemen los je op door een klein beleid te trainen, niet door een frontier-model met 500K context te prompten.

Dit is de moeite waard om duidelijk te stellen, omdat het de meest voorkomende misvatting over de wereldmodelcategorie is. Agora-2 concurreert niet met Grok 4.6 om dezelfde plek in een systeem. Het bezet de plek eronder: de omgeving waarin het beleid wordt getraind en geëvalueerd. De architectuur in het rapport is expliciet over de splitsing — een simulatiemodel voorspelt hoe gecombineerde acties de gedeelde toestand veranderen, een wereldserver past ze toe, en een per-view-rendermodel genereert het eigen 640×480-perspectief van elke deelnemer vanuit die toestand. Er komt nergens in de interactielus een tekstmodel voor.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Waar een model als Grok 4.6 wél opduikt, is een niveau hoger: als datgene wat de evaluatie-scaffolding schrijft, de transcripten analyseert of de tool-gebruikende agent aanstuurt wiens gedrag je probeert te bestuderen. Dat is precies de rol die GPT-5.6 Sol speelde in het onderzoek van METR — ongeveer 5% van de vloot, en de analist die de logs leest, en het is de rol die de prijs en het contextvenster van Grok 4.6 goedkoop maken.

De bewijskloof is hier groter dan bij de meeste van deze confrontaties

De indexscore van Grok 4.6 is onafhankelijk gemeten, de tarievenkaart is gepubliceerd en het contextvenster is gedocumenteerd. De cijfers van Agora-2 komen uit een rapport dat is opgesteld door Team Odyssey en door niemand is gereproduceerd. Op dertig monitoringclips bereikt de structured-prefix-renderer ervan 30,11 dB PSNR tegenover 20,67 dB voor een VAE-baseline — een vergelijking waarvan het rapport zelf waarschuwt dat die tussen complete systemen met niet-gematchte trainingsbudgetten gaat, niet om een geïsoleerde architectuurtest. De conditioneringsbenchmark ervan, die een reductie van de denoiser-tijd met 45,8% ten opzichte van cross-attention laat zien, gebruikt willekeurig geïnitialiseerde denoisers op synthetische inputs en meet uitvoeringskosten, niet de beeldkwaliteit.

Dan de sectie met beperkingen, die ongewoon direct is. De genoemde 15 latente updates en 30 weergegeven frames per seconde zijn doelstellingen. Volgehouden framesnelheid en latentie van invoer naar weergave tijdens live multi-agent-interactie "zijn niet kwantitatief geëvalueerd." Visuele kwaliteit op lange termijn, overeenstemming tussen weergaven en end-to-end actienaleving worden allemaal als niet-geëvalueerd genoemd. De omgeving vereist een geïnstrumenteerde game-engine met expliciete geometrie en een vaste uiterlijkvocabulaire, en overdracht naar nieuwe assets, regels of omgevingen is niet getest. Lees die lijst voordat je een topcijfer over Agora-2 leest.

Welke hoort thuis in jouw stack?

Als je vandaag multi-agentsystemen draait of bestudeert, is Grok 4.6 de component die je daadwerkelijk kunt inzetten — een tekstmodel van frontier-klasse tegen een tarief dat grote agentfleets betaalbaar maakt, met een gepubliceerde score en een gedocumenteerd API-oppervlak. Op OrcaRouter wordt het aangeboden tegen xAI's eigen lijstprijs zonder enige opslag, dus de $2/$6 hierboven en elke toekomstige tariefwijziging worden op de dag dat ze plaatsvinden op je factuur doorberekend, met automatische failover als het primaire eindpunt degradeert. Beide feiten zijn specifiek van belang voor fleetworkloads: duizend agents zijn duizend kansen om een gedegradeerde provider te treffen, en een opslag bovenop de $6-output is een opslag die wordt vermenigvuldigd met je hele run.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 is geen inzetbare infrastructuur en wij hosten het niet — er is geen API, geen gewichten en geen prijs, alleen Odyssey's eigen speelbare preview. Wat het biedt is een ander soort waarde: een gecontroleerde omgeving voor het interactieonderzoek dat volgens het METR-rapport nu urgent is, tegen een kostenpost van vier RTX PRO 4500 GPU's voor vier gelijktijdige weergaven in plaats van een API-rekening. Het eerlijke oordeel is dat deze twee niet concurreren. Grok 4.6 is het beleidsbrein dat je vandaag per token kunt kopen; Agora-2 is een voorstel voor waar je moet testen wat er gebeurt wanneer duizenden van die breinen samenkomen. Het tweede is interessanter onderzoek en minder een afgerond product, en Odyssey's eigen rapport is verfrissend duidelijk over welke onderdelen ervan nog doelstellingen zijn.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt