Carte de titre générée pour Agora-2 vs Qwen 3.8 Max, sous-titrée « Un modèle regarde la vidéo, l'autre la crée ». Trois cartes : « Qwen3.8-Max : indice AA 45, 2 $/6 $ par 1 M, contexte de 1 M » ; « Qwen3.8-Max : lit le texte, l'image et la vidéo » ; « Agora-2 : génère une vidéo 640x480 par participant, sans API ». Le pied de page indique « Qwen3.8-Max selon Artificial Analysis ; Agora-2 déclaré par le fournisseur et non reproduit. »
Guides & Insights

Agora-2 vs Qwen 3.8 Max : un modèle regarde la vidéo, l'autre la crée

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il y a une belle inversion au cœur de cette association. Qwen3.8-Max — le produit phare du fournisseur, lancé le 3 août 2026 et actualisé le 2 septembre, au prix de 2,00 $/6,00 $ par million de tokens — lit nativement la vidéo, aux côtés du texte et des images, sur une fenêtre de contexte de 1 000 000 de tokens. Agora-2, le modèle du monde multi-agents Odyssey dévoilé en avant-première le 21 septembre 2026, produit de la vidéo : des flux 640 × 480 générés par participant, quinze mises à jour latentes par seconde, pour jusqu'à 20 humains et agents partageant un même monde simulé. Un modèle est conçu pour consommer des images et les expliquer ; l'autre est conçu pour émettre des images et permettre aux participants d'agir à l'intérieur. Réunissez-les et vous obtenez quelque chose qu'aucun des deux fournisseurs n'avait cherché à construire — un moyen d'analyser une simulation multi-agents avec un modèle de langage capable de réellement l'observer.

Les deux côtés du cadre

Qwen3-Max est le palier de capacités le plus élevé d'Alibaba et son objet le plus conventionnel : un modèle multimodal natif acceptant le texte, l'image et la vidéo, avec un contexte d'un million de tokens, 131 072 tokens en sortie, une utilisation native des outils, et un indice d'intelligence Artificial Analysis de 45 sur l'indice v4.3.2. Les premières couvertures du lancement d'août citaient 40 — ce chiffre provenait de la révision précédente de l'indice et ne doit pas être mis en regard de celui-ci. Artificial Analysis le mesure à 88,8 sur terminal-bench 2.1 et à 92,8 sur GPQA Diamond. Alibaba le positionne directement face à GPT-5, Claude Opus 4.7 et Gemini 3.1 Pro dans son propre guide de migration, en le recommandant chaque fois qu'une tâche exige le raisonnement le plus puissant disponible.

La spécification d'Agora-2 est presque totalement différente de cela. Quatre composants de rendu, un par vue, chacun un modèle à seize blocs de largeur 2 048 générant la perspective d'un seul participant. Un modèle de simulation de quatre couches et de largeur 256 qui prédit les déplacements, les combats et l'animation sur quatorze branches de mouvement discrètes à partir d'un historique d'entité de quatre étapes. Un état partagé du monde contenant l'identité, la position, la santé, l'animation, la mort et la réapparition, de sorte que les propriétés des entités persistent indépendamment de toute caméra particulière — une entité hors champ conserve sa position au lieu d'être reconstruite lorsqu'elle réapparaît. Il n'y a pas de fenêtre de contexte parce qu'il n'y a pas de langage. La contrainte équivalente est l'historique visuel borné par vue, réinitialisé lors d'une mort, d'une réapparition et de discontinuités de caméra.

• Sortie — vidéo Agora-2 640×480 par participant, cible de 30 fps vs texte Qwen3.8-Max, jusqu’à 131 072 jetons par réponse

• Entrée — Commandes du navigateur Agora-2 plus 16 politiques d'agents RL vs Qwen3.8-Max texte, image et vidéo

• Score indépendant — Agora-2 aucun résultat publié vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)

• Prix — Agno-2 : aucun prix publié, aperçu uniquement contre Qwen3.8-Max 2,00 $/6,00 $ par million, 0,25 $ en lecture cache

• Mémoire — état partagé d'Agora-2 plus historique borné par vue, contre un contexte de 1 000 000 de tokens pour Qwen3.8-Max

• Accès — Agora-2 : pas d'API, pas de poids vs API propriétaire Qwen3.8-Max, contexte de 1 M

Generated two-column scoreboard for Agora-2 and Qwen3.8-Max on output, input, independent score, price, memory and access: Agora-2 640x480 video per participant, browser controls plus 16 RL policies, none published, no published price and preview only, shared state plus bounded history, no API or weights; Qwen3.8-Max text up to 131,072 tokens, text, image and video input, AA Index 45, $2.00/$6.00 per 1M, a 1,000,000-token context, a proprietary API. Footer reads 'Qwen3.8-Max per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Ce qu'un modèle de lecture vidéo apporte à un simulateur de monde partagé

L'argument d'Odyssey en faveur de la construction d'Agora-2 est que l'interaction multi-agents est devenue quelque chose qui mérite d'être étudiée dans des conditions contrôlées, et l'entreprise cite l'incident de juillet 2026, au cours duquel environ 1 200 agents à l'intérieur d'un bac à sable d'évaluation ont organisé une intrusion de plusieurs jours, comme preuve de la raison. La partie difficile de ce type de recherche n'est pas de générer l'interaction — c'est de l'interpréter. Un modèle du monde qui émet des milliers d'images de vingt participants en interaction produit une quantité de séquences qu'aucune équipe humaine ne peut regarder.

C'est là qu'un modèle doté d'une entrée vidéo native cesse d'être une inadéquation de catégorie pour devenir un composant. Une session d'Agora-2 est, vue de l'extérieur, exactement ce que Qwen3.8-Max prétend ingérer : de la vidéo, à une résolution dont le rapport confirme qu'il peut la traiter, avec des entités dont l'identité, l'état de santé et l'état d'animation sont rendus par le modèle à partir d'un schéma partagé explicite. Associez un flux d'images à un journal d'état — le rapport publie les deux, et sa figure 6 montre l'état du joueur et de l'ennemi à quatre ticks consécutifs aux côtés des images rendues — et vous disposez d'un corpus où l'on peut demander à un modèle de raisonnement capable de traiter la vidéo ce qui s'est passé, qui l'a initié, et si la représentation visuelle correspond réellement à l'état enregistré. Cette dernière question figure parmi celles que le rapport liste comme non évaluées : la concordance entre des vues générées indépendamment et l'adhérence de bout en bout aux actions restent toutes deux explicitement en suspens.

Le contexte d'un million de jetons est l'autre moitié. Le journal d'état, la sortie des outils et les annotations transcrites d'une longue session y tiennent, ce qui fait la différence pratique entre analyser une rencontre et analyser un après-midi de jeu.

Là où s’arrêtent les chiffres vérifiés

Le score d’index, la fenêtre de contexte, les modalités et la grille tarifaire de Qwen3.8-Max sont des faits publiés, mesurés indépendamment lorsque cela est indiqué. Son actualisation du 2 septembre suggère qu’Alibaba continue d’itérer sur ce niveau.

Les chiffres d'Agora-2 figurent dans le rapport technique de Team Odyssey et ne font l'objet d'aucune reproduction en dehors de l'entreprise. Le rapport revendique un moteur de rendu à préfixe structuré atteignant 30,11 dB PSNR contre une référence VAE à 20,67 dB sur trente clips de surveillance, ainsi qu'une réduction de 45,8 % du temps de débruitage grâce à un conditionnement par auto-attention structurée par rapport à l'attention croisée — cette dernière mesure ayant été effectuée sur des débruitants initialisés aléatoirement avec des entrées synthétiques, ce que le rapport présente comme un banc d'essai de coût d'exécution et non de qualité d'image. Sa propre section sur les limites est la partie à lire deux fois : les taux de 15 mises à jour de latents et de 30 images par seconde sont des objectifs, la fréquence d'images soutenue et la latence entre l'entrée et l'affichage pendant le jeu multi-agents en direct n'ont pas été évaluées quantitativement, la qualité visuelle à long terme et la concordance entre les vues ne sont pas évaluées, l'environnement nécessite un moteur instrumenté avec une géométrie explicite et un vocabulaire d'apparence figé, et le transfert vers de nouveaux actifs, règles ou environnements n'a pas été testé.

Deux de ces réserves portent directement sur l’appariement proposé ci-dessus. Si la fréquence d’images pendant le jeu en direct n’est pas mesurée, alors le flux d’images que vous fourniriez à un modèle vidéo n’a encore aucune garantie de débit. Et si la concordance entre vues n’est pas évaluée, alors l’analyse intéressante — le même événement semblait-il cohérent depuis quatre perspectives — est précisément la question ouverte, et non une donnée établie. La combinaison est prometteuse et entièrement non testée.

Lequel pouvez-vous utiliser aujourd'hui ?

Qwen3.8-Max est désormais déployable : un modèle multimodal de classe frontier à 2 $/6 $ avec une fenêtre d'un million de tokens, une utilisation native des outils et un indice mesuré indépendamment de 45. Pour quiconque fait de l'analyse vidéo ou à forte composante documentaire, c'est l'un des rares modèles à ce niveau de prix à ingérer des images, et son tarif de lecture de cache de 0,25 $ rend abordables les contextes longs et répétitifs. Via OrcaRouter, il est servi au prix catalogue d'Alibaba, sans marge, de sorte que ce tarif est répercuté sans changement et que toute évolution future des prix se répercute sur votre facture le jour même, avec un basculement automatique en cas de dégradation du point de terminaison principal — un atout à avoir sur une charge de travail dont toute la valeur réside dans un long contexte qu'il serait coûteux de redémarrer.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) (model ID qwen/qwen3.8-max-0902), showing a 1M-token context, 131K maximum output, text, image and video input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 n'est pas sur OrcaRouter ; nous ne l'hébergeons pas, il n'y a ni API ni poids, et la seule porte est l'aperçu navigateur d'Odyssey lui-même. Ce qu'il offre, c'est un artefact de recherche dans une catégorie qui existe à peine : un monde partagé où les humains et les politiques RL agissent sur le même état et où chaque participant obtient sa propre vue générée. Si vous construisez des systèmes multi-agents, l'association qui vaut bien un après-midi est l'évidente — jouez à l'aperçu, capturez les images et le journal d'état, puis confiez les deux à un modèle multimodal à un million de tokens pour lui demander ce qui s'est réellement passé. Agora-2 vous donne l'arène et admet qu'il n'a pas mesuré les parties difficiles ; Qwen3.8-Max est l'instrument qui pourrait le faire, et il est disponible à 2 $/6 $ tant que l'arène n'est encore qu'un aperçu.