
Apodex 1.1, erklärt: eine 44 auf dem Intelligenz-Index, echte agentische Stärke — und ein Haken bei der Wissenszuverlässigkeit
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Apodex 1.1 ist eine Woche alt, proprietär und war bis vor dieser Woche meist eine Laborkuriosität. Dann veröffentlichte Artificial Analysis die erste unabhängige Bewertung des Modells – die erste von Apodex auf der Plattform – und die Rangliste zeigte etwas Ungewöhnliches: Apodex 1.1 erreichte 44 Punkte auf dem Artificial Analysis Intelligence Index, rangierte auf Platz 11 von 177 und erzielte dabei Agentik-Work-Werte, die jedes Modell seiner Intelligenzstufe übertrafen, darunter DeepSeek V4 Pro, Qwen3.7 Max und Kimi K2.6. Derselbe Bericht förderte eine zweite, hässlichere Zahl zutage: ein Wert für Wissenszuverlässigkeit, der schwach genug war, um die Entscheidung zu ändern, echte Arbeit damit auszuführen. Sein Open-Weights-Geschwistermodell, Apodex 1.1 Mini, ist das Modell, das die meisten Menschen tatsächlich ausführen können. Hier ist, was die Bewertung aussagt, was sie nicht aussagt und wen das betreffen sollte.
Apodex, das von Chen Tianqiao gegründete KI-Unternehmen, veröffentlichte die Familie am 24. August 2026 zusammen mit einem arXiv-Paper mit 70 Autoren, „Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). Das Flaggschiff ist proprietär – laut Bericht des Anbieters etwa 397B Parameter – und basiert auf der These, dass der eigentliche Engpass für Agenten nicht die rohe Intelligenz ist, sondern die Umgebung, in der sie arbeiten. Apodex 1.1 wurde daher darauf trainiert, direkt mit Dateien, Suche und Code über lange Zeithorizonte zu arbeiten, mit einer gemeinsamen Ausführungsumgebung („AgentOS"), die bis zu 150 parallele Sub-Agenten koordiniert und für jeden Schritt einen Herkunftsnachweis führt. Der offene Teil ist das Schwestermodell: Apodex 1.1 Mini, ein MoE der 35B-Klasse, feinabgestimmt aus Alibabas Qwen3.5-35B-A3B, veröffentlicht unter Apache-2.0 mit einer begleitenden Agenten-Ausführungsumgebung namens FrontierAgent. Das vollständige Modell erhalten Sie nur über Apodex' eigene API und die Online-Workbench; das Mini ist selbst gehostet oder nichts.
Was eine 44 auf dem Intelligenzindex bedeutet
Der Artificial Analysis Intelligence Index ist ein gewichteter Gesamtwert der Benchmark-Suite der Plattform — einschließlich agentischer Evals wie {{1}}GDPval-AA v2 und Terminal-Bench{{/1}} sowie Reasoning-, Mathematik- und Wissenskomponenten. Ein Wert von 44 platziert Apodex 1.1 auf Platz 11 von 177 Modellen, deutlich über dem Median von 18. Das bringt das Modell außerdem in eine dicht besetzte, interessante Liga: Kimi K2.6 ({{2}}45{{/2}}), MiniMax-M3 ({{2}}45{{/2}}) und Inkling ({{2}}42{{/2}}) liegen alle innerhalb von drei Punkten, und Apodex 1.1 ist das einzige Modell dieser Gruppe, dessen Name den meisten KI-Nutzern vor einer Woche noch unbekannt war. Artificial Analysis merkt an, dass die Seite die Reasoning-Version des Modells abdeckt und dass möglicherweise auch eine Variante ohne Reasoning existiert.

Der Headline-Index-Score ist nicht der Punkt, an dem dieses Modell interessant wird. Interessant ist es wegen der Lage seiner Stärken und Schwächen im Verhältnis zu diesem Wert – und genau das macht der Stufenvergleich konkret.
Wo es über seine Gewichtsklasse schlägt: Agentic- und Wissensarbeits-Evals
Bei den beiden Index-Komponenten, die reale agentische Arbeit messen, übertrifft Apodex 1.1 seine 44-Punkte-Nachbarn. Beim GDPval-AA v2 – einer Benchmark, die die Fähigkeit eines Agenten bewertet, realistische Büroaufgaben Ende-zu-Ende zu erledigen – erzielt Apodex 1.1 einen Elo von 1348 und liegt damit vor DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) und Kimi K2.6 (1202). Bei TerminalBench v2.1, das einen Agenten bei der Arbeit am Terminal testet, erreicht es 70 %, vor Kimi K2.6 (66 %) und knapp hinter Qwen3.7 Max (75 %). Das sind unabhängige, von Artificial Analysis durchgeführte Zahlen, und sie sind der stärkste Beleg in dem Bericht dafür, dass das Environment-first-Training funktioniert.
Die eigenen Benchmark-Angaben des Anbieters gehen noch weiter und sollten bis zu einer unabhängigen Reproduktion als Herstellerangaben betrachtet werden: APEX-Agents 38,5, GDPVal 78,8, SWE-bench Verified 77,7 %, Terminal-Bench 2.1 70,8 %, Humanity's Last Exam 56,1 % mit Tools, DeepSearchQA 92,4 %, FrontierFinance 54,3 und FrontierScience-Research 63,3. Was das agentische Profil glaubwürdig und nicht bloß Hype erscheinen lässt, ist die dahinterstehende Architektur: Environment-Scaling (Erweiterung der Vielfalt der ausführbaren Datei-, Such- und Code-Umgebungen, die im Training verwendet werden) und agentisches Koordinations-Scaling (Training des Modells, langfristige Aufgaben in Einzelschritte zu zerlegen, parallele Arbeit zu delegieren, asynchrone Ergebnisse zu integrieren und neu zu planen). Der Modus „Agent Team“ erzeugt bis zu 150 Sub-Agenten für Retrieval- und Synthese-Aufgaben, und ein integrierter Verifikationsschritt („Statement Review“) prüft die Schlussfolgerungen, bevor sie ausgeliefert werden. Mit anderen Worten: Dies ist ein Modell, das dazu konzipiert ist, falsch zu liegen, sich selbst zu prüfen und Dinge zu korrigieren – nicht, um Fakten aus dem Gedächtnis aufzusagen.
Die versteckten Kosten all dieser Eigenständigkeit: Weitschweifigkeit
Dieses Design taucht in der Kosteneffizienz-Tabelle von Artificial Analysis als die deutlichste Schwäche des Modells nach dem Wissen auf: Es ist sehr ausführlich. Die Ausführung des vollständigen Intelligence-Index verbrauchte 180 Millionen Ausgabe-Tokens – gegenüber einem Median von 67 Millionen – und ungefähr 17.000 Ausgabe-Tokens pro Benchmark-Aufgabe, verglichen mit etwa 9.400 für Qwen3.7 Max und 8.100 für MiniMax-M3. Insgesamt kostete die vollständige Auswertung 618,41 US-Dollar an API-Ausgaben, laut Artificial Analysis.

Die Preisgestaltung, die diese Rechnung erzeugt: 0,30 $ pro Million Eingabe-Token und 3,00 $ pro Million Ausgabe-Token – ein Cache-Treffer-Preis von 0,03 $ für zwischengespeicherte Eingaben, ein Rabatt von 90 % – was sich bei einem typischen 7:2:1-Cache/Eingabe/Ausgabe-Mix auf etwa 0,38 $ pro Million beläuft. Beide Preise pro Token liegen über den Medianen der Plattform (0,25 $ Eingabe, 0,90 $ Ausgabe). Dennoch veranschlagt die Kosten-pro-Aufgabe-Schätzung von Artificial Analysis Apodex 1.1 weiterhin auf etwa 0,05 $ pro Benchmark-Aufgabe – günstiger als Qwen3.7 Max (~0,07 $) und Kimi K2.6 (~0,06 $). Diese Abstimmung ist für die Budgetplanung wichtig: Die Token sind günstig genug, dass selbst sehr ausführliche Antworten pro Aufgabe wettbewerbsfähig bleiben – das Kostenrisiko liegt im Volumen, nicht im Preis. Wenn Sie einen langlaufenden Agenten darauf einsetzen, hängt die Rechnung davon ab, wie viel er spricht – und er spricht viel.
Ein Hinweis zur Preisgestaltung, bevor Sie Ihr Budget festlegen: $0.30/$3.00 ist die eigene Liste des Anbieters. Eine Routing-Plattform, die die Listenpreise der Anbieter ohne Aufschlag (0 %) durchreicht, berechnet genau diesen Betrag, und jede zukünftige Preissenkung von Apodex erscheint am selben Tag, an dem sie angekündigt wird.
Der Haken: eine schwache Bilanz der Wissenszuverlässigkeit
Hier ist die Zahl, die die Startberichterstattung größtenteils übersieht. Beim AA-Omniscience, dem Wissenszuverlässigkeits-Test von Artificial Analysis, erreicht Apodex 1.1 einen Wert von -21,9. Er beantwortet 87 % der Fragen, anstatt abzulehnen, hat aber nur 32 % richtig, und seine Halluzinationsrate beträgt 78,4 %. Für ein Modell, das als Schwerlast-Löser positioniert ist, ist das eine ernsthafte gespaltene Persönlichkeit: stark bei der agentischen Ausführung, schwach beim fundierten Wissen.
Die beiden Tatsachen hängen zusammen, sie widersprechen sich nicht. Agentische Benchmarks belohnen das Handeln in einer Umgebung – das Ausführen von Tool-Aufrufen, Iterieren, sich Erholen –, sodass ein Modell dort gut abschneiden kann, während es ein schwaches Erinnerungsvermögen hat, weil die Umgebung das Erinnern übernimmt. Das Design setzt es sogar voraus: Statement Review existiert, um Ausgaben zu prüfen, und die Workbench ist auf Verifikation ausgelegt, nicht darauf, dass das Modell aus dem Gedächtnis richtig liegt. Die praktische Lesart ist unmissverständlich: Setzen Sie Apodex 1.1 nicht für Aufgaben ein, die davon abhängen, dass es Fakten aus seinen eigenen Gewichten abruft. Setzen Sie es für Aufgaben mit langem Zeithorizont ein, bei denen seine Arbeit anhand von Dateien, Code und Quellen überprüft werden kann – und verifizieren Sie die Lieferung.
Das offene Geschwistermodell: Apodex 1.1 Mini und FrontierAgent
Wenn die geschlossene Tür des Flaggschiffs ein Problem ist, ist die offene Hälfte der Familie das Gegengewicht. Apodex 1.1 Mini ist eine ~35B-Gesamt-/~3B-Aktiv-MoE, feinabgestimmt auf der Basis von Qwen3.5-35B-A3B (einem Basismodell von Alibaba, das im Februar 2026 als Open Source veröffentlicht wurde), veröffentlicht unter Apache-2.0 mit einem 262K-Kontextfenster und FP8-, FP4- und GPTQ-Int4-Varianten auf Hugging Face. Der vom Anbieter gemeldete Spitzenwert liegt bei 50,2 auf FrontierFinance (erster Platz in Apodex' eigenem Vergleich) und 27,7 auf APEX-Agents bei aktiviertem Agent-Team-Harness. Und FrontierAgent – die Open-Source-Laufzeitumgebung, die damit geliefert wird – ist wirklich das interessante Artefakt: ein terminalbasiertes Harness mit ReAct- und Agent-Team-Modi, Sandbox-Dateiarbeit, Freigabestufen, Checkpoints und Traces, das mit jedem OpenAI-kompatiblen Endpoint kommunizieren kann.
Zwei Dinge sollten Sie wissen, bevor Sie selbst hosten. Erstens: Das Mini ist ein Fine-Tune, kein Frontier-Modell — seine Benchmark-Zahlen sollten Sie genauso lesen wie die Anbietertabelle des Flaggschiffs: nicht reproduzierte, mit Harness ausgestattete, vom Anbieter gewählte Vergleiche. Zweitens: Es erbt sein Verhalten vom Basismodell — wenn Sie testen möchten, ob das zugrunde liegende Qwen3.5-35B-A3B Ihre Aufgabe bereits erledigt, brauchen Sie weder eine GPU noch einen Serving-Stack, um das herauszufinden — das Basismodell ist nur einen API-Aufruf entfernt.
Wer sollte Apodex 1.1 heute nutzen?
Das Flaggschiff befindet sich in einem frühen Stadium, ist geschlossen und vorerst nur über die eigene API und die Online-Workbench des Anbieters verfügbar; Apodex zufolge wird eine breitere API-Verfügbarkeit über große Plattformen kommen, aber die Gewichte sind nicht offen. Das schränkt ein, wer bei der dieswöchigen Bestenliste aktiv werden kann: Teams, die bereits auf der Apodex-Workbench sind, oder solche, die bereit sind, sich für einen Erstanbieter-API-Schlüssel anzumelden. Das Mini ist der zugänglichere Weg, bedeutet aber Selbsthosting.

Wo das Modell seinen Platz wirklich verdient: langfristige agentische Pipelines, bei denen Ausgaben nachgelagert verifiziert werden — Forschungs-Workbenches, mehrstufige Datei- und Tool-Aufgaben, Terminal-Arbeit — und bei denen das Kostenprofil von etwa 0,05 $ pro Aufgabe trotz der Ausführlichkeit tragfähig bleibt. Wo es noch nicht hingehört: alles, was davon abhängt, dass das eigene Wissen des Modells vertrauenswürdig ist, oder ein Produktionspfad, der kein Fehlverhalten eines unbewährten, sieben Tage alten Modells verkraftet. Genau für diese Situation ist eine Routing-Schicht der richtige Wrapper. Eine API für über 200 Modelle bedeutet, dass das Basis-Modell Qwen3.5-35B-A3B bereits zum Listenpreis aufrufbar ist, ein selbst gehostetes Mini hinter demselben Router mit automatischem Failover sitzen kann und ein unzuverlässiger Neuling keinen Produktionspfad lahmlegen kann — wenn es schwächelt, wird die Anfrage stattdessen an einen gesunden Anbieter weitergeleitet.
Was als Nächstes ansehen
Diese Bewertung ist eine erste Lesart, kein Urteil. Drei Dinge werden darüber entscheiden, ob Apodex 1.1 in einem Monat noch zählt: die unabhängige Reproduktion der Agentik-Behauptungen des Anbieters (die von Artificial Analysis stammenden GDPval- und TerminalBench-Zahlen sind die einzigen, die nicht von Apodex selbst erzeugt wurden); ob sich die Wissenszuverlässigkeitslücke in einer Nicht-Reasoning-Variante oder einem Folge-Release verringert; und ob das Modell auf weiteren APIs und unabhängigen Bestenlisten auftaucht – dann wird es zum Problem eines anderen, die 44 und die -21,9 zu schlagen. Für ein sieben Tage altes Modell mit einem derart gespaltenen Profil ist das so ziemlich alles, was man verlangen kann: ein echter Agentik-Vorteil, ein ehrlicher Preis und eine Schwäche, von der man weiß, bevor man sich anmeldet.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
