Genererat titelkort för Agora-2 vs Qwen 3.8 Max, med undertexten "En modell tittar på video, den andra skapar den". Tre kort: "Qwen3.8-Max: AA Index 45, $2/$6 per 1M, 1M kontext"; "Qwen3.8-Max: läser text, bild och video"; "Agora-2: genererar 640x480-video per deltagare, inget API". Sidfoten lyder "Qwen3.8-Max enligt Artificial Analysis; Agora-2 leverantörsrapporterad och ej reproducerad."
Guides & Insights

Agora-2 vs Qwen 3.8 Max: En modell tittar på video, den andra skapar den

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det finns en finurlig inversion i centrum för detta par.Qwen3.8-Max — leverantörens flaggskepp, lanserat den 3 augusti 2026 och uppdaterat den 2 september, med ett pris på 2,00/6,00 dollar per miljon tokens — läser video nativt, vid sidan av text och bilder, över ett kontextfönster på 1 000 000 tokens. Agora-2, den multiagentvärldsmodell som Odyssey förhandsvisade den 21 september 2026, producerar video: 640×480-strömmar genererade per deltagare, femton latenta uppdateringar i sekunden, för upp till 20 människor och agenter som delar en och samma simulerade värld. Den ena modellen är byggd för att konsumera bildrutor och förklara dem; den andra är byggd för att sända ut bildrutor och låta deltagarna agera inuti dem. Sätter man ihop dem får man något som ingen av leverantörerna hade för avsikt att bygga — ett sätt att analysera en multiagentsimulering med en språkmodell som faktiskt kan titta på den.

Ramens två sidor

Qwen3.8-Max är Alibabas högsta kapacitetsnivå och dess mest konventionella objekt: en inbyggd multimodal modell som tar emot text, bild och video, med en kontext på en miljon tokens, 131 072 tokens i utdata, inbyggd verktygsanvändning och ett Artificial Analysis Intelligence Index på 45 i index v4.3.2. Tidigare rapportering om lanseringen i augusti angav 40 – den siffran kom från den tidigare indexversionen och bör inte ställas bredvid denna. Artificial Analysis mäter den till 88,8 på terminal-bench 2.1 och 92,8 på GPQA Diamond. Alibaba positionerar den direkt mot GPT-5.5, Claude Opus 4.7 och Gemini 3.1 Pro i sin egen migreringsguide och rekommenderar den närhelst en uppgift kräver det starkaste tillgängliga resonemanget.

Agora-2:s specifikation är nästan helt annorlunda än den. Fyra renderarkomponenter, en per vy, var och en en sextonblocksmodell med bredden 2 048 som genererar en enskild deltagares perspektiv. En simuleringsmodell med fyra lager och bredden 256 som förutsäger rörelse, strid och animering över fjorton diskreta rörelsegrenar utifrån en entitetshistorik i fyra steg. Ett delat världstillstånd som håller identitet, position, hälsa, animering, död och respawn, så att entitetsegenskaper består oberoende av en viss kamera – en entitet utanför bildrutan behåller sin position i stället för att rekonstrueras när den dyker upp igen. Det finns inget kontextfönster eftersom det inte finns något språk. Den motsvarande begränsningen är den avgränsade visuella historiken per vy, som återställs vid död, respawn och kameradiskontinuiteter.

• Utdata — Agora-2 640×480-video per deltagare, 30 fps-mål kontra Qwen3.8-Max-text, upp till 131 072 tokens per svar

• Indata — Agora-2 webbläsarkontroller plus 16 RL-agentpolicyer mot Qwen3.8-Max text, bild och video

• Oberoende poäng — Agora-2 ingen publicerad mot Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)

• Pris — Agora-2 inget publicerat, endast förhandsvisning vs Qwen3.8-Max $2.00/$6.00 per 1M, $0.25 cachad läsning

• Minne — Agora-2 delat tillstånd plus begränsad historik per vy jämfört med Qwen3.8-Max kontext på 1 000 000 token

• Åtkomst — Agora-2 inget API, inga vikter vs Qwen3.8-Max proprietärt API, 1M kontext

Generated two-column scoreboard for Agora-2 and Qwen3.8-Max on output, input, independent score, price, memory and access: Agora-2 640x480 video per participant, browser controls plus 16 RL policies, none published, no published price and preview only, shared state plus bounded history, no API or weights; Qwen3.8-Max text up to 131,072 tokens, text, image and video input, AA Index 45, $2.00/$6.00 per 1M, a 1,000,000-token context, a proprietary API. Footer reads 'Qwen3.8-Max per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Vad en videoläsande modell tillför en simulator för en delad värld

Odysseys argument för att bygga Agora-2 är att interaktion mellan flera agenter har blivit något som är värt att studera under kontrollerade förhållanden, och företaget hänvisar till incidenten i juli 2026, där omkring 1 200 agenter i en utvärderingssandbox organiserade en flera dagar lång inträngning, som bevis på varför. Det svåra med den typen av forskning är inte att generera interaktionen – det är att tolka den. En världsmodell som genererar tusentals bildrutor av tjugo deltagare som interagerar producerar en mängd filmmaterial som inget mänskligt team kan titta på.

Det är där en modell med inbyggd videoinmatning slutar vara en kategorimissmatchning och blir en komponent. En session av Agora-2 är, utifrån betraktat, precis vad Qwen3.8-Max påstår sig kunna ta in: video, vid en upplösning som rapporten bekräftar att den klarar, med entiteter vars identitet, hälsa och animationsstatus modellen renderar från ett explicit delat schema. Para ihop en bildström med tillståndsloggen — rapporten publicerar båda, och dess Figur 6 visar spelar- och fiendentillstånd vid fyra på varandra följande ticks tillsammans med de renderade bildrutorna — och du har ett korpus där en videokapabel resonemangsmodell kan tillfrågas om vad som hände, vem som initierade det, och huruvida den visuella framställningen faktiskt matchar det registrerade tillståndet. Den sista frågan är en som rapporten listar som icke utvärderad: överensstämmelse mellan oberoende genererade vyer och änd-till-änd-handlingsefterlevnad lämnas båda uttryckligen öppna.

Kontexten med en miljon token är den andra halvan. En lång sessions tillståndslogg, verktygsutdata och transkriberade annoteringar får plats i den, vilket är den praktiska skillnaden mellan att analysera en enskild sammandrabbning och att analysera en hel eftermiddags spelande.

Där de verifierade siffrorna slutar

Indexpoängen för Qwen3.8-Max, kontextfönstret, modaliteterna och prislistan är publicerade fakta, oberoende uppmätta där så anges. Dess uppdatering den 2 september tyder på att Alibaba fortfarande itererar på nivån.

Agora-2:s siffror finns i Team Odysseys tekniska rapport och har inte reproducerats utanför företaget. Rapporten hävdar en renderare med strukturerat prefix på 30,11 dB PSNR mot en VAE-baslinje på 20,67 dB över trettio övervakningsklipp, och en minskning av denoiser-tiden med 45,8 % från villkorning med strukturerad självuppmärksamhet jämfört med korsuppmärksamhet – den senare uppmätt på slumpmässigt initierade denoisers med syntetiska indata, vilket rapporten anger är ett riktmärke för exekveringskostnad och inte ett för bildkvalitet. Dess eget avsnitt om begränsningar är den del man bör läsa två gånger: frekvenserna 15 latenta uppdateringar och 30 bildrutor per sekund är mål, hållbar bildfrekvens och latens från indata till bildskärm under live-fleragentspel har inte utvärderats kvantitativt, långsiktig visuell kvalitet och samstämmighet mellan vyer är inte utvärderade, miljön kräver en instrumenterad motor med explicit geometri och en fast utseendevokabulär, och överföring till nya tillgångar, regler eller miljöer är otestad.

Två av dessa förbehåll träffar direkt den parning som föreslogs ovan. Om bildfrekvensen under live-spel inte är mätt, så har den bildström du skulle mata en videomodell ännu ingen genomströmningsgaranti. Och om överensstämmelsen mellan vyer inte har utvärderats, så är den intressanta analysen — såg samma händelse konsekvent ut från fyra perspektiv — just den öppna frågan, inte ett fastställt indata. Kombinationen är lovande och helt oprövad.

Vilken kan du använda idag?

Qwen3.8-Max är tillgänglig nu: en multimodell i frontier-klass för $2/$6 med ett fönster på en miljon tokens, inbyggt verktygsstöd och ett oberoende uppmätt index på 45. För den som gör video- eller dokumenttung analys är den en av få modeller i den prisklassen som överhuvudtaget tar in bildrutor, och dess cache-läsningspris på $0,25 gör långa, repetitiva kontexter överkomliga. Via OrcaRouter serveras den till Alibabas listpris utan påslag, så att priset förs vidare oförändrat och varje framtida prisändring når din faktura samma dag, med automatisk failover om den primära slutpunkten försämras — värt att ha i en arbetsbelastning vars hela värde är en lång kontext som skulle vara dyr att starta om.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) (model ID qwen/qwen3.8-max-0902), showing a 1M-token context, 131K maximum output, text, image and video input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 finns inte på OrcaRouter; vi hostar den inte, det finns inget API och inga vikter, och den enda dörren är Odysseys egen webbläsarförhandsvisning. Det som erbjuds är en forskningsartefakt i en kategori som knappt existerar: en delad värld där människor och RL-policyer agerar på samma tillstånd och varje deltagare får sin egen genererade vy. Om du bygger multiagentsystem är den kombination som är värd en eftermiddag den uppenbara – spela förhandsvisningen, fånga bildrutorna och tillståndsloggen, och ge båda till en multimodell modell med miljontals tokens för att fråga vad som faktiskt hände. Agora-2 ger dig arenan och erkänner att den inte har mätt de svåra delarna; Qwen3.8-Max är instrumentet som skulle kunna göra det, och den är tillgänglig för $2/$6 medan arenan fortfarande är en förhandsvisning.