
Agora-2 vs Qwen 3.8 Max: un modello guarda i video, l'altro li crea
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 36 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 181 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
C'è un'elegante inversione al centro di questo abbinamento. Qwen3.8-Max — il modello di punta del fornitore, lanciato il 3 agosto 2026 e aggiornato il 2 settembre, al prezzo di 2,00 $/6,00 $ per milione di token — legge i video in modo nativo, insieme a testo e immagini, attraverso una finestra di contesto di 1.000.000 di token. Agora-2, il modello del mondo multi-agente Odyssey presentato in anteprima il 21 settembre 2026, produce video: flussi 640×480 generati per partecipante, quindici aggiornamenti latenti al secondo, per un massimo di 20 esseri umani e agenti che condividono un unico mondo simulato. Un modello è progettato per consumare fotogrammi e spiegarli; l'altro è progettato per emettere fotogrammi e permettere ai partecipanti di agire al loro interno. Metteteli insieme e otterrete qualcosa che nessuno dei due fornitori si era proposto di costruire — un modo per analizzare una simulazione multi-agente con un modello linguistico che può davvero guardarla.
I due lati della cornice
Qwen3.8-Max è il tier dalle capacità più elevate di Alibaba e il suo oggetto più convenzionale: un modello nativamente multimodale che accetta testo, immagini e video, con un contesto di un milione di token, 131.072 token di output, uso nativo degli strumenti e un Artificial Analysis Intelligence Index di 45 sull'indice v4.3.2. La precedente copertura del lancio di agosto citava 40 — quel dato proveniva dalla precedente revisione dell'indice e non va accostato a questo. Artificial Analysis lo misura a 88,8 su terminal-bench 2.1 e 92,8 su GPQA Diamond. Alibaba lo posiziona direttamente contro GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro nella propria guida alla migrazione, raccomandandolo ogni volta che un'attività richiede il ragionamento più potente disponibile.
La specifica di Agora-2 è quasi completamente diversa da quella. Quattro componenti di rendering, uno per vista, ciascuno un modello a sedici blocchi di larghezza 2.048 che genera la prospettiva di un singolo partecipante. Un modello di simulazione a quattro livelli e larghezza 256 che prevede movimento, combattimento e animazione attraverso quattordici rami di movimento discreti da una cronologia dell'entità a quattro fasi. Uno stato del mondo condiviso che contiene identità, posizione, salute, animazione, morte e respawn, così che le proprietà dell'entità persistano indipendentemente da qualsiasi particolare telecamera — un'entità fuori dall'inquadratura mantiene la sua posizione invece di essere ricostruita quando riappare. Non c'è una finestra di contesto perché non c'è linguaggio. Il vincolo equivalente è la cronologia visiva limitata per vista, resettata in caso di morte, respawn e discontinuità della telecamera.
• Output — video Agora-2 640×480 per partecipante, target di 30 fps vs testo Qwen3.8-Max, fino a 131.072 token per risposta
• Input — Controlli browser Agora-2 più 16 policy di agenti RL contro testo, immagine e video di Qwen3.8-Max
• Punteggio indipendente — Agora-2 nessuno pubblicato vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)
• Prezzo — Agora-2 nessuno pubblicato, solo anteprima vs Qwen3.8-Max $2,00/$6,00 per 1M, $0,25 lettura dalla cache
• Memoria — stato condiviso Agora-2 più cronologia limitata per vista rispetto al contesto da 1.000.000 di token di Qwen3.8-Max
• Accesso — Agora-2 senza API, senza pesi vs Qwen3.8-Max API proprietaria, contesto 1M


Cosa aggiunge un modello di lettura video a un simulatore a mondo condiviso.
L'argomento di Odyssey a favore della costruzione di Agora-2 è che l'interazione multi-agente è diventata qualcosa che vale la pena studiare in condizioni controllate, e l'azienda cita l'incidente di luglio 2026, in cui circa 1.200 agenti all'interno di una sandbox di valutazione hanno organizzato un'intrusione durata più giorni, come prova del perché. La parte difficile di quel tipo di ricerca non è generare l'interazione — è interpretarla. Un modello del mondo che emette migliaia di fotogrammi di venti partecipanti che interagiscono produce una quantità di filmati che nessun team umano può guardare.
Ecco dove un modello con input video nativo smette di essere un disallineamento di categoria e diventa un componente. Una sessione di Agora-2 è, dall'esterno, esattamente ciò che Qwen3.8-Max dichiara di poter acquisire: video, a una risoluzione che il report conferma essere in grado di gestire, con entità di cui il modello rende identità, stato di salute e stato di animazione a partire da uno schema condiviso esplicito. Abbina un flusso di frame al registro degli stati — il report pubblica entrambi, e la sua Figura 6 mostra lo stato del giocatore e dei nemici in quattro tick consecutivi accanto ai frame renderizzati — e ottieni un corpus in cui a un modello di ragionamento capace di video si può chiedere cosa è successo, chi lo ha avviato, e se la rappresentazione effettiva corrisponde davvero allo stato registrato. Quest'ultima domanda è una di quelle che il report elenca come non valutate: sia la concordanza tra viste generate in modo indipendente sia l'aderenza all'azione end-to-end sono esplicitamente lasciate aperte.
Il contesto da un milione di token è l'altra metà. Il log di stato di una lunga sessione, l'output degli strumenti e le annotazioni trascritte ci stanno dentro, ed è questa la differenza pratica tra l'analizzare un singolo incontro e l'analizzare un intero pomeriggio di gioco.
Dove si fermano i numeri verificati
Il punteggio dell'indice, la finestra di contesto, le modalità e il listino prezzi di Qwen3.8-Max sono dati pubblicati, misurati in modo indipendente ove indicato. Il suo aggiornamento del 2 settembre suggerisce che Alibaba stia ancora iterando sul tier.
I dati di Agora-2 si trovano nel report tecnico di Team Odyssey e non sono riprodotti al di fuori dell'azienda. Il report dichiara un renderer a prefisso strutturato a 30,11 dB PSNR contro una baseline VAE a 20,67 dB su trenta clip di monitoraggio, e una riduzione del 45,8% del tempo del denoiser dal condizionamento con self-attention strutturata rispetto alla cross-attention — quest'ultima misurata su denoiser inizializzati casualmente con input sintetici, che il report afferma essere un benchmark di costo di esecuzione e non di qualità dell'immagine. La sezione sulle limitazioni del report stesso è la parte da leggere due volte: le frequenze di 15 aggiornamenti di latenti e 30 fotogrammi al secondo sono obiettivi, il frame rate sostenuto e la latenza dall'input alla visualizzazione durante il gioco multi-agente dal vivo non sono stati valutati quantitativamente, la qualità visiva su orizzonti lunghi e la concordanza tra viste non sono state valutate, l'ambiente richiede un motore strumentato con geometria esplicita e un vocabolario di aspetto fisso, e il trasferimento a nuovi asset, regole o ambienti non è stato testato.
Due di queste avvertenze ricadono direttamente sull'abbinamento proposto sopra. Se il frame rate durante il gioco dal vivo non è misurato, allora il flusso di fotogrammi che alimenterebbe un modello video non ha ancora alcuna garanzia di throughput. E se la concordanza tra viste non è valutata, allora l'analisi interessante — lo stesso evento appariva coerente da quattro prospettive? — è precisamente la questione aperta, non un input consolidato. La combinazione è promettente e del tutto non testata.
Quale puoi usare oggi
Qwen3.8-Max è ora disponibile per il deployment: un modello multimodale di classe frontier a $2/$6 con una finestra da un milione di token, uso nativo degli strumenti e un indice misurato in modo indipendente di 45. Per chi si occupa di analisi video o di documenti in grande quantità, è uno dei pochi modelli a quel prezzo capace di acquisire i fotogrammi, e la sua tariffa di lettura della cache di $0,25 rende convenienti i contesti lunghi e ripetitivi. Tramite OrcaRouter viene servito al prezzo di listino di Alibaba senza alcun ricarico, così quella tariffa viene trasferita invariata e qualsiasi futura variazione di prezzo arriva sulla tua fattura lo stesso giorno, con failover automatico se l'endpoint primario peggiora — una cosa utile su un workload il cui intero valore sta in un contesto lungo che sarebbe costoso riavviare.

Agora-2 non è su OrcaRouter; non lo ospitiamo, non esiste un'API né dei pesi, e l'unica porta è l'anteprima nel browser di Odyssey stessa. Ciò che offre è un artefatto di ricerca in una categoria che a malapena esiste: un mondo condiviso in cui esseri umani e policy RL agiscono sullo stesso stato e ogni partecipante ottiene la propria vista generata. Se costruisci sistemi multi-agente, l'abbinamento che vale un pomeriggio è quello ovvio — gioca l'anteprima, cattura i fotogrammi e il registro di stato, e consegna entrambi a un modello multimodale da un milione di token per chiedere cosa è successo davvero. Agora-2 ti dà l'arena e ammette di non aver misurato le parti difficili; Qwen3.8-Max è lo strumento che potrebbe farlo, ed è disponibile a $2/$6 mentre l'arena è ancora un'anteprima.
