Generierte Titelkarte für Agora-2 vs. Qwen 3.8 Max, mit dem Untertitel „Ein Modell schaut Video, das andere erstellt es“. Drei Karten: „Qwen3.8-Max: AA Index 45, 2 $/6 $ pro 1 Mio., 1 Mio. Kontext“; „Qwen3.8-Max: liest Text, Bild und Video“; „Agora-2: generiert 640x480 Video pro Teilnehmer, keine API“. In der Fußzeile steht: „Qwen3.8-Max laut Artificial Analysis; Agora-2 vom Anbieter angegeben und nicht reproduziert.“
Guides & Insights

Agora-2 vs. Qwen 3.8 Max: Das eine Modell schaut Videos, das andere erstellt sie

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Im Zentrum dieser Paarung steht eine hübsche Umkehrung. Qwen3.8-Max — das Flaggschiff des Anbieters, am 3. August 2026 eingeführt und am 2. September aktualisiert, zum Preis von 2,00/6,00 US-Dollar pro Million Token — liest Video nativ, neben Text und Bildern, über ein Kontextfenster von 1.000.000 Token. Agora-2, das Multiagenten-Weltmodell Odyssey, am 21. September 2026 vorgestellt, erzeugt Video: pro Teilnehmer generierte 640×480-Streams, fünfzehn latente Aktualisierungen pro Sekunde, für bis zu 20 Menschen und Agenten, die sich eine simulierte Welt teilen. Das eine Modell ist darauf ausgelegt, Frames zu konsumieren und sie zu erklären; das andere ist darauf ausgelegt, Frames auszugeben und Teilnehmer darin handeln zu lassen. Setzt man beide zusammen, erhält man etwas, das keiner der Anbieter bauen wollte — eine Möglichkeit, eine Multiagenten-Simulation mit einem Sprachmodell zu analysieren, das sie tatsächlich beobachten kann.

Die beiden Seiten des Rahmens

Qwen3.8-Max ist Alibabas leistungsfähigste Stufe und das konventionellste Objekt des Unternehmens: ein natives multimodales Modell, das Text, Bild und Video akzeptiert, mit einem Kontext von einer Million Token, 131.072 Token Ausgabe, nativer Tool-Nutzung und einem Artificial Analysis Intelligence Index von 45 im Index v4.3.2. Frühere Berichte über den August-Launch nannten 40 – diese Zahl stammte aus der vorherigen Index-Revision und sollte nicht neben dieser hier genannt werden. Artificial Analysis misst es mit 88,8 auf terminal-bench 2.1 und mit 92,8 auf GPQA Diamond. Alibaba positioniert es in seinem eigenen Migrationsleitfaden direkt gegen GPT-5.5, Claude Opus 4.7 und Gemini 3.1 Pro und empfiehlt es, wann immer eine Aufgabe die stärkste verfügbare Reasoning-Leistung erfordert.

Die Spezifikation von Agora-2 ist fast völlig anders als diese. Vier Renderer-Komponenten, eine pro Ansicht, jeweils ein aus sechzehn Blöcken bestehendes Modell der Breite 2.048, das die Perspektive eines einzelnen Teilnehmers erzeugt. Ein Simulationsmodell mit vier Schichten und einer Breite von 256, das Bewegung, Kampf und Animation über vierzehn diskrete Bewegungszweige anhand einer vierstufigen Entitätshistorie vorhersagt. Ein gemeinsamer Weltzustand, der Identität, Position, Gesundheit, Animation, Tod und Respawn enthält, sodass Entitätseigenschaften unabhängig von einer bestimmten Kamera erhalten bleiben — eine Entität außerhalb des Bildes behält ihre Position, statt beim Wiedererscheinen rekonstruiert zu werden. Es gibt kein Kontextfenster, weil es keine Sprache gibt. Die entsprechende Einschränkung ist die begrenzte visuelle Historie pro Ansicht, die bei Tod, Respawn und Kamera-Diskontinuitäten zurückgesetzt wird.

• Ausgabe — Agora-2 640×480 Video pro Teilnehmer, 30-fps-Ziel gegenüber Qwen3.8-Max-Text, bis zu 131.072 Token pro Antwort

• Eingabe — Agora-2-Browser-Steuerelemente plus 16 RL-Agenten-Policies vs. Qwen3.8-Max Text, Bild und Video

• Unabhängige Bewertung — Agora-2 keine veröffentlicht vs. Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)

• Preis — Agora-2: keine veröffentlicht, nur Vorschau vs. Qwen3.8-Max 2,00 $/6,00 $ pro 1 Mio., 0,25 $ pro Cache-Lesevorgang

• Gedächtnis — gemeinsam genutzter Zustand von Agora-2 plus begrenzte Historie pro Ansicht vs. 1.000.000-Token-Kontext von Qwen3.8-Max

• Zugang — Agora-2 keine API, keine Gewichte vs. Qwen3.8-Max proprietäre API, 1M Kontext

Generated two-column scoreboard for Agora-2 and Qwen3.8-Max on output, input, independent score, price, memory and access: Agora-2 640x480 video per participant, browser controls plus 16 RL policies, none published, no published price and preview only, shared state plus bounded history, no API or weights; Qwen3.8-Max text up to 131,072 tokens, text, image and video input, AA Index 45, $2.00/$6.00 per 1M, a 1,000,000-token context, a proprietary API. Footer reads 'Qwen3.8-Max per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Was ein videolesendes Modell zu einem Shared-World-Simulator beiträgt

Odysseys Argument für den Bau von Agora-2 ist, dass Multi-Agenten-Interaktion zu etwas geworden ist, das es wert ist, unter kontrollierten Bedingungen untersucht zu werden, und das Unternehmen führt den Vorfall vom Juli 2026, bei dem rund 1.200 Agenten in einer Evaluations-Sandbox einen mehrtägigen Eindringversuch organisierten, als Beleg dafür an. Das Schwierige an dieser Art von Forschung ist nicht das Erzeugen der Interaktion – es ist ihre Interpretation. Ein Weltmodell, das Tausende Frames mit zwanzig interagierenden Teilnehmern ausgibt, erzeugt eine Menge Filmmaterial, die kein menschliches Team ansehen kann.

Dort hört ein Modell mit nativem Video-Input auf, eine Kategorie-Fehlpassung zu sein, und wird zu einer Komponente. Eine Sitzung von Agora-2 ist von außen betrachtet genau das, was Qwen3.8-Max zu verarbeiten vorgibt: Video, in einer Auflösung, die der Bericht als von ihm handhabbar bestätigt, mit Entitäten, deren Identität, Gesundheit und Animationszustand das Modell aus einem expliziten gemeinsamen Schema rendert. Kombiniert man einen Frame-Stream mit dem Zustandsprotokoll – der Bericht veröffentlicht beides, und seine Abbildung 6 zeigt Spieler- und Gegnerzustand bei vier aufeinanderfolgenden Ticks neben den gerenderten Frames –, hat man einen Korpus, in dem ein videofähiges Reasoning-Modell gefragt werden kann, was passiert ist, wer es ausgelöst hat und ob die visuelle Darstellung tatsächlich mit dem aufgezeichneten Zustand übereinstimmt. Die letzte Frage ist eine, die der Bericht als unbewertet aufführt: Die Übereinstimmung zwischen unabhängig erzeugten Ansichten und die End-to-End-Aktionstreue bleiben beide ausdrücklich offen.

Der Millionen-Token-Kontext ist die andere Hälfte. Das Zustandsprotokoll einer langen Sitzung, Tool-Ausgaben und transkribierte Anmerkungen passen hinein – das ist der praktische Unterschied zwischen der Analyse einer einzelnen Begegnung und der Analyse eines ganzen Spielenachmittags.

Wo die verifizierten Zahlen enden

Qwen3.8-Max' Index-Score, Kontextfenster, Modalitäten und Rate Card sind veröffentlichte Fakten, unabhängig gemessen, wo vermerkt. Die Aktualisierung vom 2. September deutet darauf hin, dass Alibaba weiterhin an der Tarifstufe arbeitet.

Die Zahlen von Agora-2 stehen im technischen Bericht von Team Odyssey und wurden außerhalb des Unternehmens nicht reproduziert. Der Bericht behauptet einen Structured-Prefix-Renderer mit 30,11 dB PSNR gegenüber einer VAE-Baseline von 20,67 dB über dreißig Monitoring-Clips sowie eine Reduktion der Denoiser-Zeit um 45,8 % durch strukturierte Self-Attention-Konditionierung gegenüber Cross-Attention – letztere gemessen an zufällig initialisierten Denoisern mit synthetischen Eingaben, was laut Bericht ein Benchmark für Ausführungskosten und nicht für Bildqualität ist. Der eigene Abschnitt zu Einschränkungen ist der Teil, den man zweimal lesen sollte: Die Raten von 15 Latent-Updates und 30 Bildern pro Sekunde sind Ziele, die dauerhafte Bildrate und die Latenz von der Eingabe bis zur Anzeige während des Live-Multiagenten-Spiels wurden nicht quantitativ bewertet, die visuelle Qualität über lange Horizonte und die Cross-View-Übereinstimmung sind unbewertet, die Umgebung erfordert eine instrumentierte Engine mit expliziter Geometrie und einem festen Erscheinungsvokabular, und der Transfer auf neue Assets, Regeln oder Umgebungen ist ungetestet.

Zwei dieser Vorbehalte treffen direkt die oben vorgeschlagene Paarung. Wenn die Bildrate während des Live-Spiels nicht gemessen wird, dann hat der Frame-Stream, den man einem Videomodell zuführen würde, noch keine Durchsatzgarantie. Und wenn die Übereinstimmung zwischen den Ansichten nicht bewertet ist, dann ist genau die interessante Analyse – wirkte dasselbe Ereignis aus vier Perspektiven konsistent? – das noch Offene, kein feststehender Input. Die Kombination ist vielversprechend und völlig ungetestet.

Welches kannst du heute verwenden?

Qwen3.8-Max ist jetzt einsatzbereit: ein multimodales Modell der Frontier-Klasse für 2 $/6 $ mit einem Fenster von einer Million Token, nativer Tool-Nutzung und einem unabhängig gemessenen Index von 45. Für alle, die video- oder dokumentenlastige Analysen durchführen, ist es eines der wenigen Modelle in diesem Preissegment, das überhaupt Frames verarbeitet, und sein Cache-Lesetarif von 0,25 $ macht lange, repetitive Kontexte bezahlbar. Über OrcaRouter wird es zum Listenpreis von Alibaba ohne Aufschlag bereitgestellt, sodass dieser Tarif unverändert weitergegeben wird und jede künftige Preisänderung noch am selben Tag auf Ihrer Rechnung erscheint, mit automatischem Failover, falls der primäre Endpunkt beeinträchtigt wird — ein Vorteil für eine Workload, deren ganzer Wert ein langer Kontext ist, dessen Neustart teuer wäre.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) (model ID qwen/qwen3.8-max-0902), showing a 1M-token context, 131K maximum output, text, image and video input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 ist nicht auf OrcaRouter; wir hosten es nicht, es gibt keine API und keine Gewichte, und die einzige Tür ist Odysseys eigener Browser-Vorschau. Was es bietet, ist ein Forschungsartefakt in einer Kategorie, die kaum existiert: eine gemeinsame Welt, in der Menschen und RL-Policies auf denselben Zustand einwirken und jeder Teilnehmende seine eigene generierte Ansicht erhält. Wenn du Multi-Agenten-Systeme baust, ist die Paarung, die einen Nachmittag wert ist, die naheliegende – spiele die Vorschau, erfasse die Frames und das Zustandsprotokoll und übergib beides einem multimodalen Modell mit einer Million Token, um zu fragen, was tatsächlich passiert ist. Agora-2 gibt dir die Arena und gibt zu, dass es die schwierigen Teile nicht gemessen hat; Qwen3.8-Max ist das Instrument, das es könnte, und es ist für 2 $/6 $ erhältlich, während die Arena noch eine Vorschau ist.