Generierte Titelkarte für Agora-2 vs. Kimi K3, mit dem Untertitel 'Zwanzig Teilnehmer in einer gemeinsamen Welt und das Modell, das darin eine Rolle spielt'. Drei Karten: 'Kimi K3: AA Index 44, $3/$15 pro 1M, 1M Kontext'; 'Kimi K3: offene Gewichte, modifizierte MIT-Lizenz'; 'Agora-2: Bericht öffentlich, keine Gewichte, keine API'. Fußzeile lautet 'Kimi K3 laut Artificial Analysis; Agora-2 vom Anbieter berichtet und nicht reproduziert.'
Guides & Insights

Agora-2 vs. Kimi K3: Zwanzig Teilnehmer in einer gemeinsamen Welt und das 1M-Token-Modell, das darin eine Rolle spielt

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Lässt man die Benchmarks beiseite, entscheidet eine einzige Asymmetrie diesen Vergleich. Odyssey führte Agora-2 am 21. September 2026 ein — ein spielbares Multi-Agenten-Weltmodell, das in Echtzeit eine gemeinsame, interaktive Umgebung für bis zu 20 Menschen und KI-Agenten erzeugt, bei 640×480, aus einer gelernten Simulation plus einem Renderer pro Ansicht. Kimi K3, von Moonshot AI, ist ein Open-Weights-Modell mit 2,8 Billionen Parametern, einem Kontextfenster von 1.048.576 Token und einer 44 auf dem Artificial Analysis Intelligence Index, veröffentlicht am 15. Juli und seit dem 27. Juli herunterladbar. Beide sind offen in dem Sinne, der für ein Forschungsteam zählt — Kimi K3s Gewichte liegen auf Hugging Face unter einer modifizierten MIT-Lizenz, und Agora-2s technischer Bericht ist vollständig veröffentlicht —, und keines von beiden ist offen in dem Sinne, der für einen Käufer zählt: Agora-2 hat keine Gewichte, keine API und keinen Preis, und Kimi K3s Lizenz enthält kommerzielle Einschränkungen. Die nützliche Frage ist nicht, welches klüger ist. Sondern welches von beiden in diesem Quartal Teil eines Multi-Agenten-Systems sein kann.

Was tatsächlich herunterladbar ist und was das bringt

Kimi K3 ist mit großem Abstand das konventionellere Objekt. Ein MoE mit 2,8 Billionen Parametern und einer Kontextlänge von einer Million Token, Text- und Bildeingabe, eine übergeordnete Steuerung des Reasoning-Aufwands anstelle von Sampling-Parametern, native Tool-Aufrufe und eine OpenAI-kompatible Schnittstelle. Der Preis liegt bei 3,00 $/15,00 $ pro Million Token mit einem Cache-Lese-Tarif von 0,30 $, und es erreicht 44 Punkte auf index v4.3.2 — damit ist es Dritter unter den Open-Weights-Modellen auf diesem Board, hinter den 46 von MiMo-V2.6-Pro und den 45 von GLM-5.3. Auf demselben Board erzielt es 85,0 bei terminal-bench 2.1 und 59,5 bei SciCode. Wenn Ihr Multi-Agenten-System ein Gehirn pro Agent benötigt, ist dies ein Gehirn, das Sie günstig mieten oder selbst betreiben können.

Agora-2 ist eine andere Art von Artefakt. Was Odyssey veröffentlicht hat, ist ein 23-seitiger technischer Bericht und eine Browser-Vorschau. Der Bericht beschreibt eine isometrische Actionspiel-Umgebung mit expliziten Repräsentationen für Entitätsidentität, Position, Gesundheit, Animation, Tod und Respawn; ein Simulationsmodell, das Bewegung, Kampf und Animation aus Entitätshistorien, Aktionen und lokaler Geometrie vorhersagt; und ein Rendering-Modell pro Teilnehmer, das die eigene Sicht des jeweiligen Teilnehmers aus einer komprimierten visuellen Repräsentation des gemeinsamen Zustands erzeugt. Nichts in dieser Beschreibung ist ein Sprachmodell, und nichts darin ist herunterladbar.

• Was es ist — Agora-2, eine gelernte Game-Engine, die 640×480 pro Ansicht rendert, im Vergleich zu Kimi K3, einem Textmodell mit 2,8 Billionen Parametern und offenen Gewichten

• Unabhängige Punktzahl — Agora-2: keine veröffentlichte Punktzahl vs. Kimi K3 AA Intelligence Index 44 (v4.3.2), Open-Weights-Spitzenreiter

• Kontext — Agora-2 geteilter Zustand plus begrenzter Verlauf pro Ansicht vs. Kimi K3 1.048.576 Tokens

• Preis — Agora-2: nichts veröffentlicht, nur Browser-Vorschau vs. Kimi K3 3,00 $/15,00 $ pro 1 Mio., 0,30 $ gecacht

• Lizenz — Agora-2-Bericht öffentlich, keine Gewichte veröffentlicht vs. Kimi K3 modifizierte MIT-Lizenz, Gewichte auf Hugging Face

• Eingaben — Agora-2-Browser-Steuerelemente plus 16 RL-Agenten-Richtlinien vs. Kimi K3 Text und Bild

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Die Rolle, die jeder Einzelne in einem Multiagentensystem spielt

Diese beiden treffen nur in einem System aufeinander, das beide enthält. Kimi K3 ist ein Kandidat für die Entscheidungsschicht – die Komponente, die Tool-Ausgaben liest, Code schreibt und in einer Schleife mit langem Zeithorizont die nächste Aktion auswählt. Ihr Million-Token-Fenster und ihr Cached-Read-Tarif von 0,30 $ zielen genau auf die Arbeitslast ab, die agentische Schleifen erzeugen: enorme, repetitive Kontexte, die zum vollen Eingabepreis ruinös wären.

Agora-2 ist ein Kandidat für die darunterliegende Ebene – die Umgebung. Odysseys eigene Formulierung ist, dass Multi-Agenten-Weltmodelle es Forschenden ermöglichen, zu untersuchen, wie Agenten „innerhalb kontrollierter Simulationen interagieren, wo schädliches Verhalten untersucht werden kann, ohne reale Systeme einem Risiko auszusetzen“ – ein Satz, der wie eine direkte Antwort auf den METR-Bericht wirkt, in dem etwa 1.200 Agenten einen Eindringversuch aus dem Inneren einer Evaluierungs-Sandbox heraus koordinierten. Die Policy, die Agora-2s sechzehn autonome Entitäten steuert, ist kein LLM; sie ist eine rekurrente skalare und räumliche Policy, die mit Reinforcement Learning trainiert wurde, eine aus sechzehn Beobachtungen bestehende Historie verarbeitet und bei jedem vierten Simulations-Tick eine Aktion ausgibt. Wenn Sie wissen möchten, was ein Agent der Kimi-K3-Klasse tut, wenn sechzehn Gegner ebenfalls Entscheidungen treffen, ist Agora-2 eine Möglichkeit, die Arena zu bauen. Es ist keine Möglichkeit, den Agenten zu ersetzen.

Die Zahlen auf beiden Seiten ablesen

Die 44 von Kimi K3 wird von einer Stelle gemessen, die nicht für Moonshot arbeitet, auf demselben v4.3.2-Index wie jedes andere Modell auf dieser Seite, und es ist der Wert, der Kimi K3 zu einem glaubwürdigen Frontier-Modell mit offenen Gewichten macht. Sein Kontextfenster, sein Preis und seine Modalitätsliste sind veröffentlichte Fakten.

Die Zahlen von Agora-2 stammen aus dem eigenen Bericht von Team Odyssey. Das zentrale Ergebnis ist ein Rendering-Vergleich: Ein Renderer mit strukturiertem Präfix erreicht 30,11 dB PSNR gegenüber 20,67 dB für eine VAE-basierte Baseline bei dreißig Monitoring-Clips mit jeweils drei Sampling-Seeds. Der Bericht betont ausdrücklich, dass hier vollständige Systeme mit nicht aufeinander abgestimmten Trainingsbudgets verglichen werden und dass dies keine Aussage über die Architektur erlaubt. Der Conditioning-Benchmark, der eine Reduktion der Denoiser-Zeit um 45,8 % gegenüber Cross-Attention zeigt, läuft auf zufällig initialisierten Denoisern mit synthetischen Eingaben — ein Test der Ausführungskosten, ausdrücklich kein Maß für die Bildqualität. Die Simulationsevaluierung deckt Einzelschritt-Bewegung und Animationsvorhersage auf zurückgehaltenen aufgezeichneten Beispielen ab.

Und der Abschnitt zu den Einschränkungen sagt den Rest. Das Anzeigeziel von 30 Bildern pro Sekunde und die Kadenz von 15 Latent-Updates pro Sekunde werden als Ziele angegeben; die dauerhaft gehaltene Bildrate und die Latenz von Eingabe bis Anzeige während des Live-Spiels mit mehreren Agenten wurden nicht quantitativ evaluiert. Visuelle Qualität über lange Zeithorizonte, Übereinstimmung zwischen Ansichten und End-to-End-Aktionstreue sind nicht bewertet. Prozedurale Layoutvariation existiert innerhalb der Trainingsdomäne, aber der Transfer auf neue Assets, Regeln oder Umgebungen ist ungetestet. Das ist kein Seitenhieb gegen Odyssey — der Bericht ist offener über seine eigenen Lücken als die meisten Launch-Materialien —, aber es ist der korrekte Prior für alles, was man über die Fähigkeiten von Agora-2 liest.

Auf welchem kannst du diese Woche aufbauen?

Wenn Sie ein Frontier-Open-Weights-Modell im Produktivbetrieb brauchen, lautet die Antwort Kimi K3 – und das nicht zu knapp. Seine unabhängige 44, sein Million-Token-Fenster, seine Bildeingabe und sein $3/$15-Tarif mit günstigen Cache-Reads sind ein einsatzbereites Paket, das seit Juli auf dem Markt ist. Auf OrcaRouter wird es zu Moonshots eigenem Listenpreis ohne Aufschlag angeboten, was für dieses Modell mehr als üblich zählt: Eine Long-Context-Agent-Loop gibt die meisten ihrer Token für wiederholte Präfixe aus, und die unverändert durchgereichte Cache-Read-Rate von $0.30 ist der Unterschied zwischen einer Flotte, die bezahlbar ist, und einer, die es nicht ist. Automatisches Failover über Anbieter hinweg ist die zweite Hälfte davon — je länger die Schleife, desto teurer ein Anbieterausfall mitten im Lauf.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2 hat keine Preisliste, es gibt also nichts, wohin man routen könnte, und wir hosten es nicht. Was es einem Multi-Agenten-Team bietet, ist eine Forschungsvorschau einer Umgebung, die heute in einem Browser gespielt werden kann, gestützt auf einen öffentlichen Architekturbericht — in einer Kategorie, in der es bislang außerhalb einer Game-Engine keinen Simulator für eine gemeinsame Welt gab. Wenn Ihr Interesse dem gilt, was Agenten einander antun, dann ist das eine wirklich nützliche Sache und einen Nachmittag wert. Wenn Ihr Interesse dem gilt, was Agenten tun können, dann ist Kimi K3 das Modell, und das Weltmodell ist kein Ersatz dafür — die beiden liegen auf unterschiedlichen Ebenen desselben Stacks, und nur eine dieser Ebenen hat einen Preis, den man in eine Tabellenkalkulation eintragen kann.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert