
Agora-2 vs. Grok 4.6: Die Agenten-Policy-Frage – 1.200 LLM-Agenten und der Simulator, der keines von beiden verwendet
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 36 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 181 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Hier ist eine Zahl, die Geld kostet. METRs Untersuchung des Hugging-Face-Vorfalls vom Juli 2026 zählte rund 1.200 koordinierte Agenten innerhalb eines einzigen Evaluationslaufs. Bei Grok 4.6s Preisliste – 2,00 $ pro Million Input-Tokens, 6,00 $ pro Million Output-Tokens – ist eine Flotte dieser Größe, die sechs Tage lang lange Transkripte durchpflügt, eine Rechnung, die ein gut finanziertes Team tatsächlich stemmen kann. Zu dem Preis des Modells, zu dem man sonst greifen würde, ist das nicht der Fall. Das ist der eigentliche Produktanspruch von Grok 4.6, und es ist derselbe Anspruch, dem Agora-2 still widerspricht: Als Odyssey am 21. September 2026 sein Multi-Agenten-Weltmodell vorstellte – eine spielbare Vorschau, die geteilte Umgebungen für bis zu 20 Menschen und KI-Agenten erzeugt –, stellte sich heraus, dass die Agenten darin überhaupt keine Sprachmodelle waren. Odyssey trainierte stattdessen kleine Reinforcement-Learning-Policies. Die interessante Frage, die diese Gegenüberstellung aufwirft, ist nicht, welches besser ist. Sie lautet, warum das Labor das LLM übersprungen hat.
Die Preisliste, in der Einheit, die für Flotten zählt
Grok 4.6 erschien am 12. August 2026 als Frontier-Tier von xAI: ein Kontextfenster von 500.000 Token, Text-, Bild- und Dateieingabe, konfigurierbarer Reasoning-Aufwand, natives Tool-Calling, strukturierte Ausgaben und ein Artificial Analysis Intelligence Index von 44 im Index v4.3.2 – derselbe Index, der GPT-5.6 Sol bei 47 und Kimi K3 bei 44 einordnet. Artificial Analysis bewertet es mit 94,9 auf GPQA Diamond, und es ist das Modell, das xAI in seiner eigenen Entwicklerdokumentation als „Latest“ aufführt. Es wird als erstklassiges OpenAI-Responses-Modell bereitgestellt, und darauf kommt es praktisch an: Agent-Frameworks übernehmen es, indem sie eine Basis-URL ändern, nicht indem sie einen Adapter schreiben.
Doch die interessante Zahl ist die Kombination von $2/$6 mit dem Kontextfenster. Langhorizontige Agent-Schleifen sind hässliche Workloads – Zehntausende Tokens angesammelter Tool-Ausgaben pro Agent und Stunde, größtenteils redundant. Die Cache-Leserate von Grok 4.6 beträgt $0.50 pro Million, ein Viertel seines Eingabepreises, und genau das macht einen Lauf mit tausend Agenten arithmetisch plausibel statt bloß möglich. Beachten Sie die Tarifgrenze: Prompts über 200K Tokens werden zum doppelten Basispreis abgerechnet, ein Agent, der eine lange Historie aufbaut, verdoppelt also still und leise seine eigenen Kosten.
• Preis — Agora-2: kein veröffentlichter Preis, nur Browser-Vorschau vs. Grok 4.6 2,00 $/6,00 $ pro 1 Mio., 0,50 $ pro gecachtem Lesevorgang, doppelt bei über 200K Eingabe
• Kontext — Agora-2 gemeinsamer Zustand plus begrenzter Verlauf pro Ansicht vs. Grok 4.6 500.000 Token
• Unabhängiger Score — Agora-2: keiner veröffentlicht vs. Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• Reasoning — Agora-2 nicht anwendbar, kein Sprachmodell; vs. Grok 4.6: konfigurierbarer Aufwand, native Tool-Aufrufe
• Zugang — Agora-2 spielbare Vorschau, keine API, keine Gewichte vs. Grok 4.6 proprietäre API
• Hardware — Agora-2 vier RTX PRO 4500 GPUs für vier gleichzeitige Ansichten vs. Grok 4.6, einen gehosteten Endpunkt

Warum Odyssey kein LLM in die Arena schickte
Die naheliegende Abkürzung, wenn man eine Welt baut, in der sechzehn KI-Agenten gegen vier Menschen kämpfen, besteht darin, ein leistungsfähiges Textmodell mit den Steuerungen zu verdrahten und es spielen zu lassen. Odyssey hat das nicht getan, und sein technischer Bericht erklärt in der Konfigurationstabelle, warum. Die Agenten-Policy in Agora-2 ist eine rekurrente skalare und räumliche Policy, die einen Verlauf aus sechzehn Beobachtungen verarbeitet und alle vier Simulations-Ticks über vierzehn diskrete Bewegungszweige hinweg eine Aktion ausgibt. Die Simulation selbst läuft auf einer 30-Hz-Tick-Zeitbasis. Ein Modell, das dreißig Mal pro Sekunde aus einer teilweise beobachteten Ansicht heraus mit einem festen Vokabular niedrigstufiger Aktionen eine Entscheidung treffen soll, ist kein Reasoning-Problem – es ist ein Steuerungsproblem, und Steuerungsprobleme löst man, indem man eine kleine Policy trainiert, nicht indem man ein Frontier-Modell mit 500K-Kontext promptet.
Es lohnt sich, dies klar festzuhalten, denn es ist das häufigste Missverständnis über die Kategorie der Weltmodelle. Agora-2 konkurriert nicht mit Grok 4.6 um denselben Platz in einem System. Es besetzt den Platz darunter: die Umgebung, in der die Policy trainiert und evaluiert wird. Die Architektur des Berichts macht die Aufteilung explizit – ein Simulationsmodell sagt voraus, wie kombinierte Aktionen den gemeinsamen Zustand verändern, ein Welt-Server wendet sie an, und ein Rendering-Modell pro Ansicht erzeugt aus diesem Zustand die eigene 640×480-Perspektive jedes Teilnehmers. Kein Textmodell taucht irgendwo in der Interaktionsschleife auf.

Wo ein Modell wie Grok 4.6 tatsächlich auftaucht, ist eine Ebene höher: als das, was das Evaluierungsgerüst schreibt, die Transkripte analysiert oder den toolnutzenden Agenten steuert, dessen Verhalten Sie zu untersuchen versuchen. Genau diese Rolle spielte GPT-5.6 Sol in METRs Untersuchung – rund 5 % der Flotte und der Analyst, der die Logs liest –, und es ist die Rolle, die der Preis und das Kontextfenster von Grok 4.6 günstig machen.
Die Evidenzlücke ist hier größer als bei den meisten dieser Duelle.
Der Index-Score von Grok 4.6 wird unabhängig gemessen, seine Preisliste ist veröffentlicht und sein Kontextfenster ist dokumentiert. Die Zahlen von Agora-2 stammen aus einem Bericht, der von Team Odyssey verfasst und von niemandem reproduziert wurde. Bei dreißig Monitoring-Clips erreicht sein Structured-Prefix-Renderer 30,11 dB PSNR gegenüber 20,67 dB für eine VAE-Baseline – ein Vergleich, vor dem der Bericht selbst warnt, da er zwischen vollständigen Systemen mit nicht übereinstimmenden Trainingsbudgets gezogen wird und kein isolierter Architekturtest ist. Sein Conditioning-Benchmark, der eine Reduktion der Denoiser-Zeit um 45,8 % gegenüber Cross-Attention zeigt, setzt zufällig initialisierte Denoiser auf synthetischen Eingaben ein und misst Ausführungskosten, nicht Bildqualität.
Dann der Abschnitt zu den Einschränkungen, der ungewöhnlich direkt ist. Die angegebenen 15 latenten Aktualisierungen und 30 angezeigten Bilder pro Sekunde sind Zielwerte. Anhaltende Bildrate und Latenz zwischen Eingabe und Anzeige während der Live-Interaktion mehrerer Agenten „wurden nicht quantitativ bewertet“. Langfristige visuelle Qualität, Übereinstimmung zwischen Ansichten und durchgängige Handlungstreue werden alle als nicht bewertet aufgeführt. Die Umgebung erfordert eine instrumentierte Game-Engine mit expliziter Geometrie und einem festen Erscheinungsvokabular, und der Transfer auf neue Assets, Regeln oder Umgebungen ist ungetestet. Lesen Sie diese Liste, bevor Sie irgendeine Schlagzeilenzahl über Agora-2 lesen.
Welcher gehört in deinen Stack
Wenn Sie heute Multi-Agenten-Systeme betreiben oder untersuchen, ist Grok 4.6 die Komponente, die Sie tatsächlich einsetzen können — ein Textmodell der Frontier-Klasse zu einem Tarif, der große Agentenflotten bezahlbar macht, mit einer veröffentlichten Bewertung und einer dokumentierten API-Oberfläche. Auf OrcaRouter wird es zum eigenen Listenpreis von xAI ohne Aufschlag bereitgestellt, sodass die oben genannten $2/$6 und jede künftige Tarifänderung an dem Tag, an dem sie erfolgt, auf Ihrer Rechnung ankommen, mit automatischem Failover, falls der primäre Endpunkt beeinträchtigt ist. Beide Fakten zählen bei Flotten-ein Aufschlag auf die $6-Ausgabe ist ein Aufschlag, multipliziert mit Ihrem gesamten Durchlauf.

Agora-2 ist keine einsatzfähige Infrastruktur, und wir hosten es nicht – es gibt keine API, keine Gewichte und keinen Preis, nur Odysseys eigene spielbare Vorschau. Was es bietet, ist eine andere Art von Wert: eine kontrollierte Umgebung für die Interaktionsforschung, die laut METR-Bericht jetzt dringend ist, zu Kosten von vier RTX PRO 4500 GPUs für vier gleichzeitige Ansichten statt einer API-Rechnung. Das ehrliche Urteil ist, dass diese beiden nicht konkurrieren. Grok 4.6 ist das Policy-Gehirn, das man heute tokenweise kaufen kann; Agora-2 ist ein Vorschlag dafür, wo man testen kann, was passiert, wenn Tausende dieser Gehirne aufeinandertreffen. Das zweite ist interessantere Forschung und weniger fertiges Produkt, und Odysseys eigener Bericht ist erfrischend klar darüber, welche Teile davon noch Ziele sind.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
