
Agora-2 vs Qwen 3.8 Max: Het ene model bekijkt video, het andere maakt die
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 36 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 181 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Er schuilt een fraaie inversie in het hart van deze combinatie. Qwen3.8-Max — het vlaggenschip van de leverancier, gelanceerd op 3 augustus 2026 en vernieuwd op 2 september, geprijsd op $2.00/$6.00 per miljoen tokens — leest video native, naast tekst en afbeeldingen, met een contextvenster van 1,000,000 tokens. Agora-2, het multi-agent-wereldmodel dat Odyssey op 21 september 2026 previewde, produceert video: per deelnemer worden 640×480-streams gegenereerd, vijftien latente updates per seconde, voor maximaal 20 mensen en agents die één gesimuleerde wereld delen. Het ene model is gebouwd om frames te consumeren en ze te verklaren; het andere is gebouwd om frames uit te sturen en deelnemers erbinnen te laten handelen. Zet je ze samen, dan krijg je iets wat geen van beide leveranciers van plan was te bouwen — een manier om een multi-agentsimulatie te analyseren met een taalmodel dat er daadwerkelijk naar kan kijken.
De twee zijden van het frame
Qwen3.8-Max is Alibaba's hoogste capaciteitsniveau en zijn meest conventionele object: een native multimodaal model dat tekst, beeld en video accepteert, met een context van een miljoen tokens, 131.072 tokens aan uitvoer, native toolgebruik, en een Artificial Analysis Intelligence Index van 45 op index v4.3.2. Eerdere berichtgeving over de augustuslancering noemde 40 — dat cijfer kwam uit de vorige indexrevisie en moet niet naast deze worden gelegd. Artificial Analysis meet het op terminal-bench 2.1 en 92,8 op GPQA Diamond. Alibaba positioneert het rechtstreeks tegenover GPT-5.5, Claude Opus 4.7 en Gemini 3.1 Pro in zijn eigen migratiegids, en beveelt het aan wanneer een taak het sterkste beschikbare redeneervermogen vereist.
De specificatie van Agora-2 is bijna volledig anders dan dat. Vier renderercomponenten, één per view, elk een model van zestien blokken met een breedte van 2.048 dat het perspectief van één deelnemer genereert. Een simulatiemodel van vier lagen en een breedte van 256 dat beweging, gevecht en animatie voorspelt over veertien discrete bewegingsvertakkingen op basis van een entiteitsgeschiedenis van vier stappen. Een gedeelde wereldtoestand die identiteit, positie, gezondheid, animatie, dood en respawn bevat, zodat entiteitseigenschappen onafhankelijk van een bepaalde camera blijven bestaan — een entiteit buiten beeld behoudt haar positie in plaats van opnieuw te worden gereconstrueerd wanneer ze weer verschijnt. Er is geen contextvenster omdat er geen taal is. De equivalente beperking is de begrensde visuele geschiedenis per view, die wordt gereset bij dood, respawn en camera-discontinuïteiten.
• Uitvoer — Agora-2 640×480 video per deelnemer, 30 fps-doel vs. Qwen3.8-Max tekst, tot 131.072 tokens per antwoord
• Input — Agora-2 browserbesturingselementen plus 16 RL-agentbeleidsregels vs Qwen3.8-Max tekst, afbeelding en video
• Onafhankelijke score — Agora-2 niets gepubliceerd vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)
• Prijs — Agora-2: niets gepubliceerd, alleen preview vs Qwen3.8-Max $2,00/$6,00 per 1 mln., $0,25 voor cached read
• Geheugen — Agora-2 gedeelde toestand plus begrensde geschiedenis per weergave versus Qwen3.8-Max met een context van 1.000.000 tokens
• Toegang — Agora-2 geen API, geen gewichten vs Qwen3.8-Max propriëtaire API, 1M context


Wat een videolezend model toevoegt aan een simulator van een gedeelde wereld
Odyssey's argument om Agora-2 te bouwen is dat multi-agentinteractie iets is geworden dat het bestuderen waard is onder gecontroleerde omstandigheden, en het bedrijf haalt het incident van juli 2026 aan, waarbij ongeveer 1.200 agents in een evaluatiesandbox een meerdaagse intrusie organiseerden, als bewijs waarom. Het moeilijke deel van dat soort onderzoek is niet het genereren van de interactie — het is het interpreteren ervan. Een wereldmodel dat duizenden frames van twintig deelnemers die met elkaar interacteren produceert, levert een hoeveelheid beeldmateriaal op die geen enkel menselijk team kan bekijken.
Dat is waar een model met native video-invoer ophoudt een categoriefout te zijn en een component wordt. Een sessie van Agora-2 is, van buitenaf bezien, precies wat Qwen3.8-Max beweert te kunnen opnemen: video, op een resolutie waarvan het rapport bevestigt dat het model die aankan, met entiteiten waarvan identiteit, gezondheid en animatiestatus het model weergeeft op basis van een expliciet gedeeld schema. Combineer een framestroom met het statuslog — het rapport publiceert beide, en figuur 6 toont de status van speler en vijand bij vier opeenvolgende ticks naast de gerenderde frames — en je hebt een corpus waarin aan een redeneermodel met videocapaciteit kan worden gevraagd wat er is gebeurd, wie het heeft geïnitieerd, en of de visuele weergave daadwerkelijk overeenkomt met de geregistreerde status. Die laatste vraag is er een die het rapport als niet-geëvalueerd vermeldt: overeenstemming tussen onafhankelijk gegenereerde weergaven en end-to-end actienaleving worden beide expliciet opengelaten.
De context van een miljoen tokens is de andere helft. Het statuslogboek van een lange sessie, uitvoer van hulpmiddelen en getranscribeerde annotaties passen erin, wat in de praktijk het verschil maakt tussen het analyseren van één ontmoeting en het analyseren van een middag spelen.
Waar de geverifieerde cijfers stoppen
De indexscore, het contextvenster, de modaliteiten en de tariefkaart van Qwen3.8-Max zijn gepubliceerde feiten, onafhankelijk gemeten waar vermeld. De refresh van 2 september suggereert dat Alibaba nog steeds aan de tier werkt.
De cijfers van Agora-2 staan in het technische rapport van Team Odyssey en worden buiten het bedrijf niet gereproduceerd. Het rapport claimt een structured-prefix-renderer met 30,11 dB PSNR tegenover een VAE-baseline van 20,67 dB over dertig monitoringclips, en een vermindering van de denoisertijd met 45,8% door structured self-attention-conditionering versus cross-attention — het laatste gemeten op willekeurig geïnitialiseerde denoisers met synthetische inputs, waarvan het rapport aangeeft dat het een benchmark voor uitvoeringskosten is en niet voor beeldkwaliteit. De eigen beperkingensectie is het deel dat je twee keer moet lezen: de 15-latent-update- en 30-frames-per-seconde-snelheden zijn doelstellingen, de aanhoudende framesnelheid en de latentie van input tot weergave tijdens live multi-agent-spel zijn niet kwantitatief geëvalueerd, visuele kwaliteit over lange horizon en overeenstemming tussen aanzichten zijn niet geëvalueerd, de omgeving vereist een geïnstrumenteerde engine met expliciete geometrie en een vaste verschijningsvocabulaire, en overdracht naar nieuwe assets, regels of omgevingen is niet getest.
Twee van die kanttekeningen raken rechtstreeks de hierboven voorgestelde koppeling. Als de framesnelheid tijdens het live spelen niet wordt gemeten, dan heeft de framestroom die je aan een videomodel zou voeren nog geen doorvoergarantie. En als overeenstemming tussen aanzichten niet geëvalueerd is, dan is de interessante analyse — zag dezelfde gebeurtenis er consistent uit vanuit vier perspectieven — precies de open vraag, niet een vaststaande input. De combinatie is veelbelovend en volledig ongetest.
Welke kun je vandaag gebruiken?
Qwen3.8-Max is nu inzetbaar: een multimodaal model van frontierklasse voor $2/$6 met een contextvenster van een miljoen tokens, native toolgebruik en een onafhankelijk gemeten index van 45. Voor wie aan video- of documentintensieve analyse doet, is het een van de weinige modellen in die prijsklasse dat überhaupt frames verwerkt, en het cache-leestarief van $0,25 maakt lange, repetitieve contexten betaalbaar. Via OrcaRouter wordt het tegen Alibaba's lijstprijs aangeboden, zonder enige opslag, zodat dat tarief ongewijzigd wordt doorgegeven en elke toekomstige prijswijziging dezelfde dag nog op uw factuur terechtkomt, met automatische failover als het primaire endpoint verslechtert — de moeite waard voor een workload waarvan de hele waarde een lange context is die duur zou zijn om opnieuw te starten.

Agora-2 staat niet op OrcaRouter; we hosten het niet, er is geen API en geen gewichten, en de enige deur is de eigen browserpreview van Odyssey. Wat het biedt is een onderzoeksartefact in een categorie die nauwelijks bestaat: een gedeelde wereld waarin mensen en RL-policies op dezelfde toestand handelen en elke deelnemer een eigen gegenereerde weergave krijgt. Als je multi-agentsystemen bouwt, is de combinatie die een middag waard is de voor de hand liggende — speel de preview, leg de frames en de toestandslog vast, en geef beide aan een multimodaal model met een miljoen tokens om te vragen wat er werkelijk is gebeurd. Agora-2 geeft je de arena en geeft toe dat het de moeilijke onderdelen niet heeft gemeten; Qwen3.8-Max is het instrument dat dit zou kunnen, en het is beschikbaar voor $2/$6 terwijl de arena nog een preview is.
