
AREX-2 vs. Qwen 3.8: Das eine ist ein Substrat, auf dem das andere wahrscheinlich aufbaut
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 507 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 194 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Das Aufeinandertreffen zwischen AREX-2 und Qwen3.8-Max sieht aus wie ein direkter Kampf zwischen den Flaggschiff-Systemen zweier chinesischer Labore, und es ist keines – nicht weil AREX-2 unbewiesen ist, obwohl es das ist, sondern weil die beiden unterschiedliche Schichten desselben Stacks besetzen. Qwen3.8-Max ist seit dem 3. August 2026 live, zu 2 $ pro Million Input-Tokens und 6 $ pro Million Output mit einem Kontextfenster von 1 Mio. Tokens; seine Open-Weight-Geschwister, Qwen3.8-27B und Qwen3.8-Flash, wurden am 13. und 26. August mit veröffentlichten Benchmarks und veröffentlichten Preisen ausgeliefert. AREX-2 ist ein Repository, das BAAI am 29. September 2026 um 17:56 UTC auf Hugging Face erstellt hat und das eine .gitattributes und sonst nichts enthält. Und der Grund, warum die beiden keine Rivalen sind, liegt in der zugrunde liegenden Tatsache, die kein Anbieter laut bewirbt: Jedes AREX-Modell, das BAAI bisher ausgeliefert hat, basiert auf einem Qwen-Backbone.
Das ist keine Spekulation über AREX-2. Es ist für die Generation, die existiert, dokumentiert. AREX-Base ist ein Mixture-of-Experts-Modell mit 122 Milliarden Parametern und 10 Milliarden aktiven Parametern, das auf Qwen3.5-122B-A10B basiert, und AREX-Turbo ist ein dichtes 4B-Modell, das auf Qwen3.5-4B basiert; beide wurden am 23. Juli 2026 unter Apache 2.0 veröffentlicht. Die ehrliche Form dieses Vergleichs ist also nicht Agent gegen Flaggschiff. Sie lautet: Was bringt Ihnen das Alibaba-Substrat heute, was fügt die Agentenschicht von BAAI obendrauf hinzu, und wie viel von der zweiten Frage lässt sich beantworten, bevor BAAI eine Datei hochlädt?
Was auf der Qwen-Seite live ist und was es kostet
Die Qwen3.8-Generation ist ungewöhnlich leicht zu durchschauen, weil sie vollständig spezifiziert und öffentlich bepreist ist – in drei klar getrennten Stufen.
• Qwen3.8-Max — veröffentlicht am 3. August 2026. Ein Kontextfenster von 1 Mio. Token, native Text-, Bild- und Videoeingabe, Denkmodus, Funktionsaufrufe und strukturierte Ausgaben sowie drei Wire-Formate (OpenAI-kompatibel, Anthropic-kompatibel und natives DashScope) in fünf Regionen. 2,00 $ pro Million Eingabe-Token und 6,00 $ pro Million Ausgabe-Token, Cache-Lesevorgänge zu 0,25 $.
• Qwen3.8-27B — veröffentlicht am 13. August 2026. Dense, 27B Parameter, 256K Kontext (262.144 Positionen), Text, Bild und Video als Eingabe, Apache-2.0-Gewichte. Auf Qwens eigener Karte angegeben mit 90,3 auf LiveCodeBench v6, 89,2 auf GPQA Diamond, 84,3 auf OSWorld-Verified und 79,0 auf QwenSWEBench — vom Anbieter gemeldet, nicht unabhängig reproduziert. Eine unabhängige Messung ergibt einen Artificial Analysis Intelligence Index von 33,7 und 68,1 im AA Coding Index.
• Qwen3.8-Flash — veröffentlicht am 26. August 2026. Dasselbe 1M-Token-Fenster und derselbe multimodale Input, für 0,15 $ pro Million Eingabe-Token und 0,47 $ Ausgabe. Die günstige Stufe der Familie – und die, die hochvolumigen agentischen Traffic bezahlbar macht.
Es gibt außerdem einen nicht getaggten Qwen3.8-Eintrag: das Flaggschiff mit 2,4 Billionen Parametern, dessen Gewichte Alibaba angekündigt hat und das noch nirgends aufrufbar ist. Wenn Sie nach „Qwen 3.8“ suchen und ein einzelnes Modell erwarten, dann ist das der Grund, warum die Antwort eine Familie aus vier Modellen ist und nicht eines.

Gemessen an alledem ist die Spezifikation von AREX-2 nur eine Zeile lang: ein Repository, ein Zeitstempel und ein Name, der eine zweite Generation von etwas impliziert, das BAAI bereits einmal gebaut hat.
Das Detail, das den gesamten Vergleich neu einordnet
AREX ist kein Wettbewerber von Qwen, sondern ein Nutzer davon. Beide AREX-Modelle der ersten Generation werden auf Qwen3.5-Backbones nachtrainiert und dann in das Framework eingebettet, das sie zu Agenten statt zu Chat-Modellen macht: eine innere Schleife, die sucht, browst und Belege zu einer Kandidatenantwort zusammenführt, die einen Konfidenzwert trägt, und eine äußere Schleife, die diese Antwort anhand der ursprünglichen Constraints prüft und sie entweder akzeptiert, verfeinert oder die Trajektorie verwirft und neu beginnt. Das interessante Engineering bei AREX ist nicht das Netzwerk. Es ist die Schleife, der Mechanismus zur Kontextaktualisierung, der verifizierte Befunde, offene Kandidaten und ungelöste Constraints über einen langen Horizont hinweg auseinanderhält, und die Tool-Schnittstelle, die Suche und Browsing für das Modell als erstklassige Aktionen verfügbar macht.
Deshalb sind die eigenen veröffentlichten Zahlen der Familie – 82,5 bei BrowseComp, 85,4 bei GAIA, 71,0 bei xbench-2510, 89,9 bei DeepSearch QA und 82,0 bei WideSearch-en für die 122B Base, mit 70,7 / 81,6 / 57,0 / 78,5 / 68,5 für die 4B Turbo – nicht mit den Coding- und Agentic-Werten von Qwen3.8-27B vergleichbar, obwohl die beiden eine gemeinsame architektonische Abstammungslinie haben. Sie messen unterschiedliche Dinge. QwenSWEBench fragt, ob ein Modell ein Repository-Issue lösen kann. BrowseComp fragt, ob ein Agent eine Tatsache finden kann, die absichtlich schwer zu finden ist, über viele Suchvorgänge hinweg, ohne die Frage aus den Augen zu verlieren. Ein roher Qwen3.5-Checkpoint schneidet beim zweiten schlecht und beim ersten gut ab, was genau die Lücke ist, die das Post-Training und das Harness von BAAI schließen sollen.

Was eine zweite Generation am plausibelsten wäre
Wenn AREX-2 dem Muster folgt, ist die wahrscheinlichste Lesart – eine Schlussfolgerung, keine Tatsache – ein Forschungsagent der zweiten Generation, der auf einem neueren Qwen-Backbone nachtrainiert wurde als die 3.5-Generation, die die aktuellen AREX-Modelle verwenden. Qwen3.8-27B ist dicht, multimodal und Apache 2.0, was es zu einem natürlichen Kandidaten für einen Agenten der Qualitätsstufe macht; Qwen3.8-Flash ist günstig pro Token, was enorm wichtig ist, wenn Ihr Agent Dutzende von Aufrufen pro Anfrage macht und bei jedem Schritt einen wachsenden Kontext erneut liest.
Nichts davon ist bestätigt. Der Name enthält weder eine Größe noch ein Backbone noch ein Datum, und eine „2“ in einer Produktlinie ist eher eine Namenskonvention als eine Spezifikation. Was bestätigt ist, ist weitaus enger gefasst und sollte auch so formuliert werden: BAAI hat das Repository am 29. September 2026 erstellt, nichts hineingelegt und nichts angekündigt. Keine Gewichte, keine Model Card, keine Parameteranzahl, kein Lizenz-Tag, keine Benchmarks, kein Anbieter, der es bereitstellt. Wenn Sie diese Woche irgendwo zitierte AREX-2-Zahlen sehen, sind das keine Messungen.
Was Sie heute Nachmittag tatsächlich kaufen können
Die praktische Asymmetrie zwischen diesen beiden liegt nicht in der Qualität, sondern darin, dass die eine Seite eine Preisliste hat und die andere einen Verzeichniseintrag.
Wenn deine Arbeit agentisch ist und du das Substrat willst, auf dem die AREX-Familie aufgebaut wurde, ist das exakte Backbone aufrufbar: Qwen3.5-122B-A10B ist im Katalog von OrcaRouter für 0,115 $ pro Million Input-Tokens und 0,917 $ pro Million Output bis zu 128K Tokens verfügbar, darüber hinaus steigend auf 0,287 $ / 2,294 $, mit aktivierten Vision-, Tool- und Reasoning-Funktionen. Das ist das Modell, das AREX-Base nachtrainiert, verfügbar, ohne auf irgendetwas warten zu müssen.
Wenn Sie die aktuelle Generation möchten, sind beide offenen Qwen3.8-Stufen im Katalog: Qwen3.8-27B zu $0,33 pro Million Input-Tokens und $2,40 für Output, betrieben auf unserer eigenen Infrastruktur, weil die Gewichte offen sind und keine Anbieterkosten pro Token weitergegeben werden müssen, und Qwen3.8-Flashzu $0,15 / $0,47 für die Volumen-Stufe. Eine API deckt beide ab, der Listenpreis des Anbieters wird ohne Aufschlag pro Token weitergegeben, sodass sich die Zahl hier am selben Tag ändert, an dem Alibaba einen Preis ändert.
Und wenn AREX-2 tatsächlich ausgeliefert wird, ist der Grund, warum es hinter dieselbe Schicht gehört, struktureller und nicht werblicher Natur. Eine Agentenschleife, die zwanzig Aufrufe pro Anfrage macht, multipliziert die Ausfallrate jedes Anbieters mit zwanzig; eine Routing-Regel mit automatischem Failover, die zur Laufzeit entscheidet ist der Unterschied zwischen einem Timeout, der ein erneuter Versuch ist, und einem Timeout, der eine selbstsicher falsche Antwort ist. Dieses Argument gilt für jeden Recherche-Agenten, und es wird für AREX-2 gelten, wann immer es ein AREX-2 gibt, das geroutet werden kann.
Wer sollte handeln, und worauf?
Wenn Sie heute einen Recherche-Agenten benötigen, ist AREX-Base das AREX-Modell, das es gibt; es wurde im Juli unter Apache 2.0 veröffentlicht, und seine Agent-Benchmarks stammen vom Anbieter selbst, aber zumindest sind sie an ein herunterladbares Modell geknüpft. Wenn Sie heute multimodales Frontier-Reasoning oder agentischen Traffic mit hohem Volumen benötigen, sind die Qwen3.8-Stufen verfügbar, bepreist und teilweise unabhängig bewertet, und nichts an der Existenz von AREX-2 ändert diese Entscheidung.
Das einzige Szenario, in dem AREX-2 für eine Entscheidung, die Sie diese Woche treffen, von Bedeutung ist, ist das, in dem Sie ein Backbone für ein Fine-Tuning auswählen. Und dort ist die Antwort bereits im Katalog sichtbar: Die 3.5-Backbones, die AREX verwendete, sind weiterhin günstig und verfügbar, die 3.8-Generation ist besser und ebenfalls verfügbar, und ein AREX der zweiten Generation – wann immer es erscheint – wird mit ziemlicher Sicherheit ein Beleg dafür sein, welche Qwen-Basis BAAI für lohnenswert hält, um darauf aufzubauen, und kein Ersatz dafür.
Drei Dinge würden den Rest klären: Dateien im Baum, eine Karte mit einer Parameteranzahl und einem Basismodell-Feld sowie ein Lizenz-Tag. Das erste davon ist das entscheidende, denn bis es da ist, ist dieser Vergleich einer zwischen einer Familie mit Preisangabe und einem Platzhalter.
