Genererad titelbild för Agora-2 vs Grok 4.6, med undertexten '1 200 LLM-agenter, och simulatorn som inte använder någon av dem'. Tre kort: 'Grok 4.6: AA-index 44, 2/6 USD per 1 miljon, 0,50 USD cachat'; 'Agora-2: 16 RL-agentpolicyer, ingen LLM i loopen'; 'Agora-2: 30 Hz tick, 4 RTX PRO 4500-GPU:er per session'. Sidfoten lyder 'Agora-2-siffror från Odysseys egen rapport, ej reproducerade; Grok 4.6 enligt Artificial Analysis.'
Guides & Insights

Agora-2 vs Grok 4.6: Agentpolicyfrågan — 1 200 LLM-agenter, och simulatorn som inte använder någon av dem

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Här är en siffra som kostar pengar. METR:s utredning av Hugging Face-incidenten i juli 2026 räknade ungefär 1 200 koordinerade agenter i en enda utvärderingskörning. Enligt Grok 4.6s prislista — 2,00 $ per miljon indatatokens, 6,00 $ per miljon utdatatokens — en flotta av den storleken, som bearbetar långa transkript i sex dagar, är en räkning som ett välfinansierat team faktiskt kan absorbera. Till priset för den modell du annars skulle välja, är det inte. Det är Grok 4.6:s verkliga produktpåstående, och det är samma påstående Agora-2 i tysthet motsäger: när Odyssey introducerade sin multiagentvärldsmodell den 21 september 2026 — en spelbar förhandsvisning som genererar delade miljöer för upp till 20 människor och AI-agenter — visade det sig att agenterna inuti den inte alls var språkmodeller. Odyssey tränade istället små förstärkningsinlärningspolicyer. Den intressanta frågan som detta par väcker är inte vilken som är bättre. Det är varför labbet hoppade över LLM:en.

Prislistan, i den enhet som är viktig för fordonsflottor

Grok 4.6 lanserades den 12 augusti 2026 som xAI:s frontier-nivå: ett kontextfönster på 500 000 tokens, text-, bild- och filinmatning, konfigurerbar resonemangsinsats, inbyggt verktygsanrop, strukturerade utdata och ett Artificial Analysis Intelligence Index på 44 i index v4.3.2 – samma index som placerar GPT-5.6 Sol på 47 och Kimi K3 på 44. Artificial Analysis ger den 94,9 på GPQA Diamond, och det är modellen som xAI listar som "Latest" i sin egen utvecklardokumentation. Den tillhandahålls som en förstklassig OpenAI Responses-modell, vilket är den praktiska poängen: agentramverk införlivar den genom att ändra en bas-URL, inte genom att skriva en adapter.

Men den intressanta siffran är kombinationen av $2/$6 med kontextfönstret. Långsiktiga agentloopar är otympliga arbetsbelastningar — tiotusentals tokens ackumulerad verktygsutdata per agent och timme, varav det mesta är redundant. Grok 4.6:s cache-läsningstaxa är $0.50 per miljon, en fjärdedel av dess indatapris, vilket är det som gör en körning med tusen agenter aritmetiskt rimlig snarare än bara möjlig. Notera nivågränsen: prompter över 200K tokens debiteras med dubbelt baspris, så en agent som bygger upp en lång historik tyst fördubblar sin egen kostnad.

• Pris — Agora-2 inget offentliggjort pris, endast förhandsvisning i webbläsare jämfört med Grok 4.6 $2,00/$6,00 per 1M, $0,50 för cachad läsning, dubblas vid över 200K indata

• Kontext — Agora-2 delat tillstånd plus begränsad historik per vy jämfört med Grok 4.6 500 000 tokens

• Oberoende poäng — Agora-2: ingen publicerad jämfört med Grok 4.6 AA Intelligence Index 44 (v4.3.2)

• Resonerande — Agora-2 ej tillämpligt, inte en språkmodell vs Grok 4. konfigurerbar ansträngning, inbyggt verktygsanrop

• Åtkomst — Agora-2 spelbar förhandsvisning, inget API, inga vikter vs Grok 4.6 proprietärt API

• Hårdvara — Agora-2 fyra RTX PRO 4500 GPU:er för fyra samtidiga vyer mot Grok 4.6, en hostad endpoint

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Varför Odyssey inte satte en LLM i arenan

Den uppenbara genvägen, om du bygger en värld där sexton AI-agenter slåss mot fyra människor, är att koppla en kapabel textmodell till reglagen och låta den spela. Odyssey gjorde inte det, och dess tekniska rapport förklarar varför i konfigurationstabellen. Agentpolicyn i Agora-2 är en återkommande skalär- och spatialpolicy som konsumerar en historik med sexton observationer och avger en åtgärd var fjärde simuleringstakt över fjorton diskreta rörelsegrenar. Själva simuleringen avancerar på en ticktidsbas om 30 Hz. En modell som ombeds fatta ett beslut trettio gånger i sekunden, utifrån en partiellt observerad vy, med ett fast aktionsvokabulär på låg nivå, är inte ett resonemangsproblem – det är ett reglerproblem, och reglerproblem löses genom att träna en liten policy, inte genom att prompta en frontiermodell med 500K kontext.

Detta är värt att säga tydligt, eftersom det är den vanligaste missuppfattningen om kategorin världsmodeller. Agora-2 konkurrerar inte med Grok 4.6 om samma plats i ett system. Den intar platsen under: den miljö som policyn tränas och utvärderas i. Rapportens arkitektur är tydlig med uppdelningen – en simuleringsmodell förutsäger hur kombinerade handlingar förändrar delat tillstånd, en världsserver tillämpar dem, och en renderingsmodell per vy genererar varje deltagares egen 640×480-perspektiv utifrån detta tillstånd. Ingen textmodell förekommer någonstans i interaktionsloopen.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Där en modell som Grok 4.6 faktiskt förekommer, är det en nivå upp: som det som skriver utvärderingsscaffoldingen, analyserar transkripten eller driver den verktygsanvändande agenten vars beteende du försöker studera. Det är precis den roll som GPT-5.6 Sol spelade i METR:s undersökning — omkring 5 % av flottan, och analytikern som läser loggarna — och det är den roll som Grok 4.6:s pris och kontextfönster gör billig.

Bevisgapet är bredare här än i de flesta av dessa matchningar

Grok 4.6:s indexpoäng är oberoende uppmätt, dess prislista är publicerad och dess kontextfönster är dokumenterat. Agora-2:s siffror kommer från en rapport författad av Team Odyssey och som ingen har reproducerat. På trettio övervakningsklipp når dess strukturerade prefix-renderare 30,11 dB PSNR mot 20,67 dB för en VAE-baslinje — en jämförelse som rapporten själv varnar för är mellan kompletta system med icke matchade träningsbudgetar, inte ett isolerat arkitekturtest. Dess conditioning-benchmark, som visar en minskning av denoiser-tiden med 45,8 % jämfört med cross-attention, använder slumpmässigt initierade denoisers på syntetiska indata och mäter exekveringskostnad, inte bildkvalitet.

Sedan kommer avsnittet om begränsningar, som är ovanligt direkt. De angivna 15 latenta uppdateringarna och 30 visade bildrutor per sekund är mål. Ihållande bildfrekvens och latens från inmatning till visning under live-interaktion mellan flera agenter "har inte utvärderats kvantitativt". Visuell kvalitet över långa tidshorisonter, överensstämmelse mellan vyer och åtgärdsefterlevnad i hela kedjan listas alla som icke utvärderade. Miljön kräver en instrumenterad spelmotor med explicit geometri och en fast utseendevokabulär, och överföring till nya tillgångar, regler eller miljöer är otestad. Läs den listan innan du läser någon rubriksiffra om Agora-2.

Vilken hör hemma i din stack?

Om du kör eller studerar multiagentsystem i dag är Grok 4.6 komponenten du faktiskt kan driftsätta – en textmodell i frontier-klass till en kostnad som gör stora agentflottor överkomliga, med en publicerad poäng och en dokumenterad API-yta. På OrcaRouter serveras den till xAI:s eget listpris utan påslag, så $2/$6 ovan och eventuella framtida prisändringar når din faktura samma dag de inträffar, med automatisk failover om den primära slutpunkten degraderas. Båda dessa fakta är särskilt viktiga för arbetsbelastningar med agentflottor: tusen agenter är tusen chanser att stöta på en degraderad leverantör, och ett påslag ovanpå $6-utdata är ett påslag multiplicerat med hela din körning.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 är inte driftsättningsbar infrastruktur och vi hostar den inte – det finns inget API, inga vikter och inget pris, bara Odysseys egen spelbara förhandsvisning. Det den erbjuder är ett annat slags värde: en kontrollerad miljö för den interaktionsforskning som METR-rapporten visar nu är akut, till en kostnad av fyra RTX PRO 4500-GPU:er för fyra samtidiga vyer i stället för en API-räkning. Den ärliga domen är att dessa två inte konkurrerar. Grok 4.6 är den policyhjärna du kan köpa per token i dag; Agora-2 är ett förslag på var man kan testa vad som händer när tusentals av dessa hjärnor möts. Det andra är mer intressant forskning och mindre färdig produkt, och Odysseys egen rapport är uppfriskande tydlig med vilka delar av den som fortfarande är mål.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen