
AREX-2 vs. Gemma 4 12B: Eines davon ist ein Modell
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 507 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 194 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Ein Vergleich zwischen Gemma 4 12B und AREX-2 hat eine Eigenschaft, die kein anderes Duell in diesem Blog hat: Eine der beiden Spalten ist leer, weil das Modell auf jener Seite noch nicht existiert. Gemma 4 12B ist ein ausgeliefertes Artefakt – Google DeepMind veröffentlichte es am 3. Juni 2026 als dichtes Open-Weights-Modell mit 11,95 Milliarden Parametern unter Apache 2.0, mit einer vollständigen Modellkarte, einem 256K-Token-Kontextfenster, nativer Audio- und Bildeingabe – und dreieinhalb Monaten unabhängiger Tests, die dahinter liegen. AREX-2 ist ein Hugging-Face-Repository, das BAAI am 29. September 2026 um 17:56 UTC erstellt hat und in das noch nichts eingestellt wurde: keine Gewichte, keine Karte, kein Lizenz-Tag, keine Evaluierung, keine Ankündigung.
Diese Asymmetrie ist kein Grund, den Vergleich auszulassen. Sie ist der Vergleich. Die Frage, die es zu beantworten lohnt, ist nicht, welches von beiden besser ist – das kann nichts beantworten, solange AREX-2 keine Dateien enthält –, sondern ob ein BAAI-Forschungsagent der zweiten Generation überhaupt mit einem 12B-Edge-Modell konkurrieren würde oder ob diese beiden überhaupt Positionen in einem Stack einnehmen, die sich nie berühren. Das falsch einzuschätzen ist der teure Fehler, denn es ist der Fehler, der dazu führt, dass ein Team für die falsche Sache budgetiert.
Die ausgelieferte Seite, zu ihren eigenen Bedingungen
Gemma 4 12B ist das kleinste Mitglied von Googles offener Familie der vierten Generation, und seine prägende Designentscheidung ist architektonisch: Es verzichtet vollständig auf den separaten Vision-Encoder und speist rohe Bild-Patches und Audio-Wellenformen direkt in den Transformer ein. Das ist kein Benchmark-Trick. Es ist das, was das Modell wirklich portabel macht – rund 27 GB BF16-Gewichte, die sich auf unter 7 GB quantisieren lassen, und eine Karte, die 16 GB VRAM als Deployment-Ziel nennt. Auf einem Laptop oder einer einzelnen Mittelklasse-Karte ist dies ein Modell, das man tatsächlich in der Hand halten kann.
Das Leistungsprofil ergibt sich daraus. Googles eigene Karte – vom Anbieter gemeldet und als solche zu kennzeichnen – führt für das Dokumentenverständnis DocVQA 94,9 und InfoVQA 88,4 auf, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 und LiveCodeBench v6 72,0 im Denkmodus. Artificial Analysis, unabhängig, bewertet die Reasoning-Konfiguration mit einem Intelligence Index von 14, misst sie mit 114 Tokens pro Sekunde und bepreist einen typischen bereitgestellten Aufruf mit 0,10 $ pro Million Eingabe-Tokens und 0,30 $ pro Million Ausgabe-Tokens. Unser eigener Katalogeintrag für das größere Gemma 4 31B weist 85,7 bei GPQA Diamond auf. Das ergibt das Bild eines kleinen Generalisten, der bei Dokumenten und Bildern ungewöhnlich stark, beim Reasoning vernünftig und bei schwierigen mehrstufigen Aufgaben weit von einem Frontier-Modell entfernt ist.
Seine Aufgabenbeschreibung ist daher konkret: lokale oder Single-Tenant-Inferenz, Dokumenten- und Screenshot-Verständnis, bescheidene agentische Schleifen und alles, wo die Daten das Gebäude nicht verlassen können. Es ist keine Tiefenrecherche-Engine und Google verkauft es nicht als eine.

Die andere Seite, bei der es sich um einen Namen und einen Zeitstempel handelt
Alles, was sich diese Woche über AREX-2 bestätigen lässt, passt in einen Satz. Es ist ein Repository unter der BAAI-Organisation auf Hugging Face, erstellt am 29. September 2026, das eine .gitattributes Datei und sonst nichts enthält – null Bytes gespeicherter Modelldaten, null Downloads, keine Model Card, keine Lizenzdeklaration, keine Anbieter-Bereitstellung. BAAI selbst hat nichts angekündigt.
Was es wert macht, festgehalten zu werden, ist die Familie, nach der es benannt ist. BAAIs AREX-Reihe erschien am 23. Juli 2026 mit zwei Modellen: AREX-Base, ein 122-Milliarden-Parameter-Mixture-of-Experts mit 10 Milliarden aktiven Parametern auf Basis von Qwen3.5-122B-A10B, und AREX-Turbo, ein dichtes 4B-Modell auf Basis von Qwen3.5-4B. Beide stehen unter Apache 2.0. Beide sind Deep-Research-Agenten und keine Chat-Modelle – eine innere Schleife, die Belege sammelt und eine Kandidatenantwort mit einem Konfidenzwert erzeugt, und eine äußere Schleife, die diese Antwort anhand der ursprünglichen Vorgaben prüft und die gesamte Trajektorie verfeinern oder neu starten kann. Den von BAAI veröffentlichten Zahlen zufolge erreicht AREX-Base 82,5 bei BrowseComp, 85,4 bei GAIA und 89,9 bei DeepSearch QA; AREX-Turbo erreicht 70,7, 81,6 und 78,5 bei denselben drei.
Alle diese Zahlen stammen vom Anbieter selbst, und keine davon wurde unabhängig reproduziert. Sie beziehen sich außerdem auf ein anderes Modell. AREX-2 hat keine Zahlen, und die „2“ verrät Ihnen nichts über Größe, Backbone oder Architektur – eine zweite Generation in dieser Reihe könnte ein größerer Agent, eine kleinere Destillation oder ein neu trainiertes Framework mit ausgetauschtem Backbone sein.
Treffen sich diese beiden überhaupt?
Hier zeigt sich, dass der Vergleich nützlicher ist, als er aussieht. Nimm die beiden plausiblen Lesarten dessen, was aus AREX-2 wird.
Wenn es sich um einen Forschungsagenten der zweiten Generation handelt, auch nur annähernd im Maßstab von Base, dann konkurrieren er und Gemma 4 12B nie miteinander. Ein 122B-Mixture-of-Experts, das eine Multi-Quellen-Suche antreibt, ist ein gehosteter, pro Token abgerechneter, netzwerkgebundener Dienst; Gemma 4 12B ist ein Checkpoint, den man herunterlädt und selbst ausführt. Die Entscheidung zwischen ihnen ist kein Qualitätsvergleich, sondern eine Entscheidung darüber, ob Ihre Workload eine Forschungsschleife oder ein Inferenz-Endpunkt ist.
Wenn sich AREX-2 als die kleine Stufe erweist – der Nachfolger des 4B Turbo statt des 122B Base –, dann teilen sich die beiden tatsächlich ein Regal, und der Vergleich wird zu einem echten. Diese Version von AREX-2 hätte etwa ein Drittel der Parameterzahl von Gemma 4 12B, wäre auf werkzeuggestützte Suche statt auf multimodale Breite spezialisiert und würde an BrowseComp und GAIA gemessen statt an DocVQA. Zwei kleine Modelle, das eine optimiert darauf, eine lange Recherche-Trajektorie aufrechtzuerhalten, das andere darauf, auf bescheidener Hardware zu sehen und zu lesen. Ein Team, das eine Dokumentationspipeline aufbaut, sollte sich nicht für das erste interessieren; ein Team, das einen Recherche-Agenten aufbaut, sollte sich nicht für das zweite interessieren.
• Was existiert — Gemma 4 12B ist heute mit einer vollständigen Modellkarte herunterladbar. AREX-2 ist ein Repository, in dem sich keine Dateien befinden.
• Parameter — 11,95B dense für Gemma 4 12B. Nicht angegeben und nur aus einem Produktnamen ableitbar, für AREX-2.
• Kontext — 256K Token (262.144 Positionen) für Gemma 4 12B. Unbekannt für AREX-2.
• Modalität — Text, Bild und Audio als Eingabe für Gemma 4 12B. Für AREX-2 unbekannt; die erste AREX-Generation war Text-plus-Tool-Nutzung.
• Lizenz — Apache 2.0 für Gemma 4 12B, auf der Karte angegeben. Für AREX-2 nicht angegeben; AREX-Base und AREX-Turbo waren Apache 2.0.
• Wofür es gedacht ist — einsatzfähige multimodale Inferenz auf eigener Hardware gegenüber, den Belegen der Familie nach, langhorizontiger Suche und Evidenzaggregation gegen einen gehosteten Endpunkt.

Der Teil, der tatsächlich vergleichbar ist: wo jedes Einzelne läuft
Da der Fähigkeitsvergleich nicht verfügbar ist, ist der Einsatzvergleich der ehrliche, den man anstellen kann – und er ist alles andere als knapp.
Gemma 4 12B läuft dort, wo Sie es einsetzen. Es gibt keine Preisliste, keinen Token-Zähler und keinen Anbieter zwischen Ihnen und dem Modell – die Kosten sind die Hardware und der Strom, und der Fehlerfall ist Ihre eigene Kapazitätsplanung. Als AREX-Base im Juli veröffentlicht wurde, war es dagegen ein 122B-Mixture-of-Experts: ein Modell, das Sie auf einem Cluster betreiben oder tokenweise mieten, und das 4B Turbo der Familie existiert genau deshalb, weil diese Entscheidung einen Preis hat. Wenn die zweite Generation demselben Muster folgt, wird die Ökonomie von AREX-2 eine Funktion der pro Anfrage verbrauchten Tokens, multipliziert mit der Anzahl der Suchschritte, die eine Trajektorie durchläuft, sein – eine Zahl, die für einen Deep-Research-Agenten viel größer ist als für ein dokumentenlesendes Modell, weil der Agent bei jeder Iteration einen wachsenden Kontext erneut liest.
Dort hört eine Routing-Schicht auf, eine Abstraktion zu sein, und wird zum Rechnungsposten. Wenn Sie am Ende einen Recherche-Agenten gegen ein gehostetes Modell laufen lassen und gleichzeitig ein lokales Gemma 4 12B für die Dokumentenarbeit behalten, sind das im Normalfall zwei Integrationen. Durch eine API vor über 200 Modellen — wobei der Listenpreis des Anbieters durchgereicht wird und kein Aufschlag hinzukommt, sodass eine Preisänderung eines Anbieters noch am selben Tag wirksam wird — sind sie ein Schlüssel, eine Rechnung und ein Client, und eine Failover-Regel kann eine Anfrage von einem Anbieter wegverlagern, der gerade eine schlechte Stunde hat, ohne dass Ihre Agentenschleife davon erfährt. Wir routen heute Gemma 4 26B-A4B und Gemma 4 31B; das 12B routen wir nicht, und auch nichts aus der AREX-Reihe steht in unserem Katalog. Wenn also eines von beiden das Modell ist, das Sie brauchen, stammt es aus der eigenen Distribution seines Anbieters.
Was diese Woche zu tun ist
Wenn Sie ein kompaktes multimodales Modell brauchen, das Sie selbst betreiben können, hat die Entscheidung nie auf AREX-2 gewartet. Gemma 4 12B ist ausgeliefert, dokumentiert, unabhängig bewertet und einsatzbereit, und die Vergleichsspalte auf der anderen Seite ist leer. Kaufen Sie nichts aufgrund eines reservierten Namens.
Wenn Sie einen Deep-Research-Agenten bauen und die AREX-Reihe genau das ist, was Sie eigentlich wollen, sollten Sie nicht auf den Namen achten, sondern auf den Dateibaum: ob safetensors in diesem Repository auftauchen, was auf der Model Card als Parameteranzahl steht und welches Lizenz-Tag darauf landet. Die erste Generation wurde unter Apache 2.0 veröffentlicht, und wenn die zweite das ebenfalls tut, wird die Frage zu einer Hosting-Frage statt zu einer Lizenzierungsfrage. Bis dahin ist AREX-Base das AREX-Modell, das Sie tatsächlich ausführen können, und es ist seit Juli verfügbar.
Das Einzige, was man über den Vergleich, um den es in diesem Artikel nominell geht, klar sagen sollte: Eine VS-Seite, bei der die eine Seite ein Repository-Commit und die andere ein ausgeliefertes Modell ist, ist kein Duell, sondern ein Zeitplan. Der Zeitplan besagt, dass Gemma 4 12B jetzt verfügbar ist und AREX-2 überhaupt nicht verfügbar ist.
