
Agora-2 vs. MiniMax M3: Eine GPU pro Teilnehmer oder dreizehn Cent pro Million Tokens
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 36 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 181 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Zwei Möglichkeiten, eine Schar von Agenten laufen zu lassen, in zwei verschiedenen Währungen bepreist. MiniMax M3 kostet 0,30 US-Dollar pro Million Eingabe-Tokens und 1,20 US-Dollar pro Million Ausgabe-Tokens – ein Preis, der ein Experiment mit tausend Agenten zu einem Einzelposten statt zu einer Finanzierungsrunde macht. Agora-2, das Multiagenten-Weltmodell, das Odyssey am 21. September 2026 vorgestellt hat, kostet eine NVIDIA RTX PRO 4500 pro Teilnehmeransicht: Eine Sitzung mit vier Spielern läuft auf vier GPUs, wobei ein Rendering-Modell pro Karte die 640×480-Perspektive dieses Spielers erzeugt und eine dieser vier Karten zusätzlich die gemeinsame Simulation sowie die sechzehn autonomen Agentenrichtlinien trägt. Die Zahl für MiniMax M3 gilt pro Token und skaliert damit, wie viel Ihre Agenten denken. Die Zahl für Agora-2 gilt pro Augenpaar und skaliert damit, wie viele gleichzeitige Teilnehmer Sie in die Welt setzen. Sie zu vergleichen heißt, ein Reasoning-Budget mit einem Rendering-Budget zu vergleichen, und für jeden, der 2026 eine Multiagenten-Studie plant, erweist sich genau das als die sinnvolle Sache.
Die Token-Seite des Hauptbuchs
MiniMax M3 ist MiniMaxs Flaggschiff mit offenen Gewichten, veröffentlicht am 31. Mai 2026: ein sparse Mixture-of-Experts mit 428 Milliarden Parametern, von denen pro Token etwa 23 Milliarden Parameter aktiv sind, ein Kontextfenster von 1.048.576 Token, von denen MiniMax 512K als nutzbar garantiert, Text-, Bild- und Videoeingabe sowie einen Wert von 29 im Artificial Analysis Intelligence Index v4.3.2. In Herstellerangaben werden 83,5 bei BrowseComp und 76,1 bei BankerToolBench angegeben – MiniMaxs eigene Zahlen, hier nicht reproduziert –, und Artificial Analysis misst es mit 145 Ausgabe-Token pro Sekunde, das zehntschnellste Modell auf dieser Bestenliste.
Die relevante Zahl für Agentenflotten ist jedoch die Cache-Lese-Rate: 0,06 $ pro Million gecachter Token, ein Fünftel des Eingabepreises. Agenten-Schleifen sind präfixdominiert – wobei derselbe System-Prompt, dieselben Tool-Schemas und dieselbe sich anhäufende Historie bei jeder Runde erneut gesendet werden –, sodass die effektiven Kosten einer Schleife für den Großteil ihrer Token weit näher bei 0,06 $ als bei 0,30 $ liegen. Das ist die Arithmetik, die einen Lauf mit 1.200 Agenten, wie ihn METR in OpenAIs ExploitGym-Evaluierung vom Juli 2026 dokumentiert hat, zu etwas macht, das eine Forschungsgruppe tatsächlich reproduzieren kann, anstatt nur darüber zu lesen.
Die GPU-Seite des Kontos
Die Kostenstruktur von Agora-2 wird im eigenen Implementierungsanhang offengelegt und ist erfrischend konkret. Eine RTX PRO 4500 Blackwell Server Edition pro Ansicht. Vier für eine Sitzung mit vier Spielern. Diese Karten erzeugen die Ansicht jedes Teilnehmers mit einem Ziel von fünfzehn latenten Updates und dreißig angezeigten Frames pro Sekunde bei 640×480, und die Simulation schreitet in einem 30-Hz-Takt voran. Der Bericht gibt zudem den Trainingsumfang für die umgebende Arbeit an: eine effektive globale Batch-Größe von 128 über 32 B200 GPUs.
In dieselbe Einheit übersetzt wie MiniMax M3, das heißt eine Data-Center-GPU pro gleichzeitigem Teilnehmer, plus die geteilte Simulation, die auf einer von ihnen mitläuft. Es ist ein fester Kostenfaktor, der nicht davon abhängt, wie lange Ihre Agenten nachdenken, und der nicht sinkt, wenn sie still werden. Daraus ergeben sich zwei Konsequenzen, und sie weisen in entgegengesetzte Richtungen. Bei niedrigen Teilnehmerzahlen mit intensivem Reasoning pro Agent ist das Token-Modell offensichtlich günstiger – Sie zahlen Cents fürs Denken und nichts für den zweiten Agenten im Raum. Bei hohen Teilnehmerzahlen mit dichter Interaktion kehrt sich die Rechnung um: zwanzig gleichzeitige Teilnehmer in einer geteilten Welt sind zwanzig GPUs, eine Zahl, die nicht mit der Anzahl an Tokens wächst, die jeder Einzelne verbraucht.
• Kosteneinheit — Agora-2: eine RTX PRO 4500 pro Teilnehmeransicht vs. MiniMax M3: 0,30 $/1,20 $ pro 1 Mio. Token
• Cache-Lesevorgänge — Agora-2 nicht anwendbar, keine Token-Abrechnung vs. MiniMax M3 0,06 $ pro 1 Mio. gecachte
• Unabhängige Bewertung — Agora-2 nicht veröffentlicht vs. MiniMax M3 AA Intelligence Index 29 (v4.3.2)
• Kontext — Agora-2: gemeinsam genutzter Zustand plus begrenzte Historie pro Ansicht vs. MiniMax M3 1.048.576 Token, 512K garantiert
• Ausgabe — Agora-2 640×480-Video bei einem Ziel von 30 fps gegenüber MiniMax M3-Text
• Zugang — Agora-2 Browser-Vorschau, keine API, keine Gewichte vs. MiniMax M3 offene Gewichte, Community-Lizenz, API


Warum die beiden Kosten keine Substitute sind
Es ist verlockend, das als Entweder-oder zu lesen, und es ist keines. MiniMax M3 ist ein Policy-Gehirn: Es liest eine teilweise beobachtete Situation, schlussfolgert, ruft Tools auf und gibt eine Aktion aus. Agora-2 ist eine Umgebung, in der Handlungen Folgen haben, die für andere Teilnehmer sichtbar sind – ein Simulationsmodell, das vorhersagt, wie kombinierte Aktionen den gemeinsamen Zustand verändern, ein Weltserver, der sie anwendet, und Renderer pro Ansicht, sodass jeder Teilnehmer dieselbe Welt aus seiner eigenen Perspektive sieht. Odysseys sechzehn autonome Entitäten werden von keinem Sprachmodell gesteuert; sie sind rekurrente skalare und räumliche Policies, die mit Reinforcement Learning trainiert wurden, eine Historie aus sechzehn Beobachtungen verarbeiten und alle vier Simulations-Ticks handeln. Diese Designentscheidung ist das verräterische Zeichen. Bei dreißig Ticks pro Sekunde ist die Entscheidung, was zu tun ist, ein Regelungsproblem, und Regelungsprobleme werden gelöst, indem man eine kleine Policy trainiert, statt eine API aufzurufen.
Die ehrliche Einordnung für ein Team, das Multi-Agenten-Arbeit plant, ist also, dass diese auf verschiedenen Ebenen liegen und man für jede ein Budget braucht. Die Reasoning-Ebene ist günstig und elastisch, und man kann sie aussuchen. Die Umgebungsebene ist, wenn man etwas anderes als eine Game Engine will, derzeit eine Research Preview mit einem GPU-förmigen Fußabdruck und ohne veröffentlichte API. Beide Fakten sind so neu – M3 seit Mai, Agora-2 seit September –, dass fast niemand bereits ein Kostenmodell für die Kombination hat.
Was ist verifiziert und was ist ein Ziel?
Die unabhängige Bewertung, das Kontextfenster, die Modalitäten und der Preis von MiniMax M3 sind veröffentlichte Fakten, die heute überprüfbar sind. Seine BrowseComp- und BankerToolBench-Werte sind vom Anbieter gemeldet und sollten als solche gekennzeichnet werden, wann immer Sie sie zitieren.
Die Zahlen von Agora-2 stammen vollständig aus dem technischen Bericht von Team Odyssey und wurden von niemandem außerhalb des Unternehmens reproduziert. Sein Rendering-Ergebnis — 30,11 dB PSNR für den Structured-Prefix-Renderer gegenüber 20,67 dB für eine VAE-Baseline bei dreißig Monitoring-Clips — ist ein Vergleich vollständiger Systeme mit nicht übereinstimmenden Trainingsbudgets, wie der Bericht selbst anmerkt. Seine Reduzierung der Denoiser-Zeit um 45,8 % gegenüber Cross-Attention stammt von zufällig initialisierten Denoisern mit synthetischen Eingaben und misst Ausführungskosten statt Bildqualität. Und in seinem Abschnitt zu Einschränkungen steht unmissverständlich, dass die Raten von fünfzehn Updates pro Sekunde und dreißig Frames pro Sekunde Ziele sind; dass anhaltende Bildrate und Eingabe-zu-Anzeige-Latenz während der Live-Interaktion mehrerer Agenten „nicht quantitativ bewertet wurden“; dass visuelle Qualität über lange Horizonte, Übereinstimmung zwischen Ansichten und End-to-End-Aktionstreue weiterhin unbewertet bleiben; dass die Umgebung eine instrumentierte Engine mit expliziter Geometrie und einem festen Erscheinungsvokabular benötigt; und dass Transfer über die Trainingsdomäne hinaus ungetestet ist. Wer ein Kostenmodell auf einer GPU pro Ansicht aufbaut, sollte zuerst diesen Abschnitt lesen, denn der Durchsatz pro GPU ist genau das, was nicht gemessen wurde.
Der Anruf.
Wenn Sie Agenten-Flotten bauen – viele Modelle, lange Schleifen, Tool-Aufrufe, kein Rendering –, ist MiniMax M3 der günstigste glaubwürdige Weg, das in großem Maßstab umzusetzen, und der Cache-Lese-Tarif ist die Zahl, die Ihre Rechnung entscheidet. Es wird auf OrcaRouter zu MiniMax' eigenem Listenpreis ohne Aufschlag geroutet, sodass der gecachte Tarif von 0,06 $ genau das ist, was Sie zahlen, mit Failover über Anbieter hinweg, falls ein Endpunkt mitten im Lauf beeinträchtigt wird. Gerade bei Flotten ist die Durchreichung wichtiger als sonst: eine Wiederverkäufer-Marge auf gecachte Token ist eine Marge, multipliziert mit jedem Turn jedes Agenten.

Agora-2 ist nichts, wohin man routen kann – es gibt keine API, keinen Preis und keine Gewichte, nur Odysseys Browser-Vorschau – und wir hosten es nicht. Was es ist: der erste Shared-World-Simulator, der speziell dafür gebaut wurde, dass viele Teilnehmer, menschliche und synthetische, dabei beobachtet werden können, wie sie unter kontrollierten Bedingungen interagieren, und der darunterliegende Bericht ist ungewöhnlich offen darüber, wie weit es derzeit von einem Produkt entfernt ist. Wenn Ihr Problem Reasoning in großem Umfang ist, ist MiniMax M3 jetzt verfügbar und günstig. Wenn Ihr Problem darin besteht, was passiert, wenn tausend dieser Reasoning-Systeme sich eine Welt teilen, hat Odyssey die Arena gebaut und die schwierigen Messungen jemand anderem zum Durchführen überlassen.
