Eine generierte Titelkarte mit der Aufschrift „AREX-2 vs Gemma 4 12B – Eines davon ist ein Modell“, mit zwei Panels. Das linke Panel, überschrieben mit Gemma 4 12B, listet: ausgeliefert am 3. Juni 2026; 11,95B Parameter, dense; 256K Kontext, Apache 2.0; heute herunterladen. Das rechte Panel, überschrieben mit AREX-2, listet: Repo erstellt am 29. Sep. 2026; keine Gewichte hochgeladen; keine Modellkarte, kein Lizenz-Tag; nicht herunterladbar. Die Fußzeile lautet: „Eine Spalte ist ein Modell. Die andere ist ein Zeitstempel.“ Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

AREX-2 vs. Gemma 4 12B: Eines davon ist ein Modell

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ein Vergleich zwischen Gemma 4 12B und AREX-2 hat eine Eigenschaft, die kein anderes Duell in diesem Blog hat: Eine der beiden Spalten ist leer, weil das Modell auf jener Seite noch nicht existiert. Gemma 4 12B ist ein ausgeliefertes Artefakt – Google DeepMind veröffentlichte es am 3. Juni 2026 als dichtes Open-Weights-Modell mit 11,95 Milliarden Parametern unter Apache 2.0, mit einer vollständigen Modellkarte, einem 256K-Token-Kontextfenster, nativer Audio- und Bildeingabe – und dreieinhalb Monaten unabhängiger Tests, die dahinter liegen. AREX-2 ist ein Hugging-Face-Repository, das BAAI am 29. September 2026 um 17:56 UTC erstellt hat und in das noch nichts eingestellt wurde: keine Gewichte, keine Karte, kein Lizenz-Tag, keine Evaluierung, keine Ankündigung.

Diese Asymmetrie ist kein Grund, den Vergleich auszulassen. Sie ist der Vergleich. Die Frage, die es zu beantworten lohnt, ist nicht, welches von beiden besser ist – das kann nichts beantworten, solange AREX-2 keine Dateien enthält –, sondern ob ein BAAI-Forschungsagent der zweiten Generation überhaupt mit einem 12B-Edge-Modell konkurrieren würde oder ob diese beiden überhaupt Positionen in einem Stack einnehmen, die sich nie berühren. Das falsch einzuschätzen ist der teure Fehler, denn es ist der Fehler, der dazu führt, dass ein Team für die falsche Sache budgetiert.

Die ausgelieferte Seite, zu ihren eigenen Bedingungen

Gemma 4 12B ist das kleinste Mitglied von Googles offener Familie der vierten Generation, und seine prägende Designentscheidung ist architektonisch: Es verzichtet vollständig auf den separaten Vision-Encoder und speist rohe Bild-Patches und Audio-Wellenformen direkt in den Transformer ein. Das ist kein Benchmark-Trick. Es ist das, was das Modell wirklich portabel macht – rund 27 GB BF16-Gewichte, die sich auf unter 7 GB quantisieren lassen, und eine Karte, die 16 GB VRAM als Deployment-Ziel nennt. Auf einem Laptop oder einer einzelnen Mittelklasse-Karte ist dies ein Modell, das man tatsächlich in der Hand halten kann.

Das Leistungsprofil ergibt sich daraus. Googles eigene Karte – vom Anbieter gemeldet und als solche zu kennzeichnen – führt für das Dokumentenverständnis DocVQA 94,9 und InfoVQA 88,4 auf, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 und LiveCodeBench v6 72,0 im Denkmodus. Artificial Analysis, unabhängig, bewertet die Reasoning-Konfiguration mit einem Intelligence Index von 14, misst sie mit 114 Tokens pro Sekunde und bepreist einen typischen bereitgestellten Aufruf mit 0,10 $ pro Million Eingabe-Tokens und 0,30 $ pro Million Ausgabe-Tokens. Unser eigener Katalogeintrag für das größere Gemma 4 31B weist 85,7 bei GPQA Diamond auf. Das ergibt das Bild eines kleinen Generalisten, der bei Dokumenten und Bildern ungewöhnlich stark, beim Reasoning vernünftig und bei schwierigen mehrstufigen Aufgaben weit von einem Frontier-Modell entfernt ist.

Seine Aufgabenbeschreibung ist daher konkret: lokale oder Single-Tenant-Inferenz, Dokumenten- und Screenshot-Verständnis, bescheidene agentische Schleifen und alles, wo die Daten das Gebäude nicht verlassen können. Es ist keine Tiefenrecherche-Engine und Goog​le verkauft es nicht als eine.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

Die andere Seite, bei der es sich um einen Namen und einen Zeitstempel handelt

Alles, was sich diese Woche über AREX-2 bestätigen lässt, passt in einen Satz. Es ist ein Repository unter der BAAI-Organisation auf Hugging Face, erstellt am 29. September 2026, das eine .gitattributes Datei und sonst nichts enthält – null Bytes gespeicherter Modelldaten, null Downloads, keine Model Card, keine Lizenzdeklaration, keine Anbieter-Bereitstellung. BAAI selbst hat nichts angekündigt.

Was es wert macht, festgehalten zu werden, ist die Familie, nach der es benannt ist. BAAIs AREX-Reihe erschien am 23. Juli 2026 mit zwei Modellen: AREX-Base, ein 122-Milliarden-Parameter-Mixture-of-Experts mit 10 Milliarden aktiven Parametern auf Basis von Qwen3.5-122B-A10B, und AREX-Turbo, ein dichtes 4B-Modell auf Basis von Qwen3.5-4B. Beide stehen unter Apache 2.0. Beide sind Deep-Research-Agenten und keine Chat-Modelle – eine innere Schleife, die Belege sammelt und eine Kandidatenantwort mit einem Konfidenzwert erzeugt, und eine äußere Schleife, die diese Antwort anhand der ursprünglichen Vorgaben prüft und die gesamte Trajektorie verfeinern oder neu starten kann. Den von BAAI veröffentlichten Zahlen zufolge erreicht AREX-Base 82,5 bei BrowseComp, 85,4 bei GAIA und 89,9 bei DeepSearch QA; AREX-Turbo erreicht 70,7, 81,6 und 78,5 bei denselben drei.

Alle diese Zahlen stammen vom Anbieter selbst, und keine davon wurde unabhängig reproduziert. Sie beziehen sich außerdem auf ein anderes Modell. AREX-2 hat keine Zahlen, und die „2“ verrät Ihnen nichts über Größe, Backbone oder Architektur – eine zweite Generation in dieser Reihe könnte ein größerer Agent, eine kleinere Destillation oder ein neu trainiertes Framework mit ausgetauschtem Backbone sein.

Treffen sich diese beiden überhaupt?

Hier zeigt sich, dass der Vergleich nützlicher ist, als er aussieht. Nimm die beiden plausiblen Lesarten dessen, was aus AREX-2 wird.

Wenn es sich um einen Forschungsagenten der zweiten Generation handelt, auch nur annähernd im Maßstab von Base, dann konkurrieren er und Gemma 4 12B nie miteinander. Ein 122B-Mixture-of-Experts, das eine Multi-Quellen-Suche antreibt, ist ein gehosteter, pro Token abgerechneter, netzwerkgebundener Dienst; Gemma 4 12B ist ein Checkpoint, den man herunterlädt und selbst ausführt. Die Entscheidung zwischen ihnen ist kein Qualitätsvergleich, sondern eine Entscheidung darüber, ob Ihre Workload eine Forschungsschleife oder ein Inferenz-Endpunkt ist.

Wenn sich AREX-2 als die kleine Stufe erweist – der Nachfolger des 4B Turbo statt des 122B Base –, dann teilen sich die beiden tatsächlich ein Regal, und der Vergleich wird zu einem echten. Diese Version von AREX-2 hätte etwa ein Drittel der Parameterzahl von Gemma 4 12B, wäre auf werkzeuggestützte Suche statt auf multimodale Breite spezialisiert und würde an BrowseComp und GAIA gemessen statt an DocVQA. Zwei kleine Modelle, das eine optimiert darauf, eine lange Recherche-Trajektorie aufrechtzuerhalten, das andere darauf, auf bescheidener Hardware zu sehen und zu lesen. Ein Team, das eine Dokumentationspipeline aufbaut, sollte sich nicht für das erste interessieren; ein Team, das einen Recherche-Agenten aufbaut, sollte sich nicht für das zweite interessieren.

• Was existiert — Gemma 4 12B ist heute mit einer vollständigen Modellkarte herunterladbar. AREX-2 ist ein Repository, in dem sich keine Dateien befinden.

• Parameter — 11,95B dense für Gemma 4 12B. Nicht angegeben und nur aus einem Produktnamen ableitbar, für AREX-2.

• Kontext — 256K Token (262.144 Positionen) für Gemma 4 12B. Unbekannt für AREX-2.

• Modalität — Text, Bild und Audio als Eingabe für Gemma 4 12B. Für AREX-2 unbekannt; die erste AREX-Generation war Text-plus-Tool-Nutzung.

• Lizenz — Apache 2.0 für Gemma 4 12B, auf der Karte angegeben. Für AREX-2 nicht angegeben; AREX-Base und AREX-Turbo waren Apache 2.0.

• Wofür es gedacht ist — einsatzfähige multimodale Inferenz auf eigener Hardware gegenüber, den Belegen der Familie nach, langhorizontiger Suche und Evidenzaggregation gegen einen gehosteten Endpunkt.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

Der Teil, der tatsächlich vergleichbar ist: wo jedes Einzelne läuft

Da der Fähigkeitsvergleich nicht verfügbar ist, ist der Einsatzvergleich der ehrliche, den man anstellen kann – und er ist alles andere als knapp.

Gemma 4 12B läuft dort, wo Sie es einsetzen. Es gibt keine Preisliste, keinen Token-Zähler und keinen Anbieter zwischen Ihnen und dem Modell – die Kosten sind die Hardware und der Strom, und der Fehlerfall ist Ihre eigene Kapazitätsplanung. Als AREX-Base im Juli veröffentlicht wurde, war es dagegen ein 122B-Mixture-of-Experts: ein Modell, das Sie auf einem Cluster betreiben oder tokenweise mieten, und das 4B Turbo der Familie existiert genau deshalb, weil diese Entscheidung einen Preis hat. Wenn die zweite Generation demselben Muster folgt, wird die Ökonomie von AREX-2 eine Funktion der pro Anfrage verbrauchten Tokens, multipliziert mit der Anzahl der Suchschritte, die eine Trajektorie durchläuft, sein – eine Zahl, die für einen Deep-Research-Agenten viel größer ist als für ein dokumentenlesendes Modell, weil der Agent bei jeder Iteration einen wachsenden Kontext erneut liest.

Dort hört eine Routing-Schicht auf, eine Abstraktion zu sein, und wird zum Rechnungsposten. Wenn Sie am Ende einen Recherche-Agenten gegen ein gehostetes Modell laufen lassen und gleichzeitig ein lokales Gemma 4 12B für die Dokumentenarbeit behalten, sind das im Normalfall zwei Integrationen. Durch eine API vor über 200 Modellen — wobei der Listenpreis des Anbieters durchgereicht wird und kein Aufschlag hinzukommt, sodass eine Preisänderung eines Anbieters noch am selben Tag wirksam wird — sind sie ein Schlüssel, eine Rechnung und ein Client, und eine Failover-Regel kann eine Anfrage von einem Anbieter wegverlagern, der gerade eine schlechte Stunde hat, ohne dass Ihre Agentenschleife davon erfährt. Wir routen heute Gemma 4 26B-A4B und Gemma 4 31B; das 12B routen wir nicht, und auch nichts aus der AREX-Reihe steht in unserem Katalog. Wenn also eines von beiden das Modell ist, das Sie brauchen, stammt es aus der eigenen Distribution seines Anbieters.

Was diese Woche zu tun ist

Wenn Sie ein kompaktes multimodales Modell brauchen, das Sie selbst betreiben können, hat die Entscheidung nie auf AREX-2 gewartet. Gemma 4 12B ist ausgeliefert, dokumentiert, unabhängig bewertet und einsatzbereit, und die Vergleichsspalte auf der anderen Seite ist leer. Kaufen Sie nichts aufgrund eines reservierten Namens.

Wenn Sie einen Deep-Research-Agenten bauen und die AREX-Reihe genau das ist, was Sie eigentlich wollen, sollten Sie nicht auf den Namen achten, sondern auf den Dateibaum: ob safetensors in diesem Repository auftauchen, was auf der Model Card als Parameteranzahl steht und welches Lizenz-Tag darauf landet. Die erste Generation wurde unter Apache 2.0 veröffentlicht, und wenn die zweite das ebenfalls tut, wird die Frage zu einer Hosting-Frage statt zu einer Lizenzierungsfrage. Bis dahin ist AREX-Base das AREX-Modell, das Sie tatsächlich ausführen können, und es ist seit Juli verfügbar.

Das Einzige, was man über den Vergleich, um den es in diesem Artikel nominell geht, klar sagen sollte: Eine VS-Seite, bei der die eine Seite ein Repository-Commit und die andere ein ausgeliefertes Modell ist, ist kein Duell, sondern ein Zeitplan. Der Zeitplan besagt, dass Gemma 4 12B jetzt verfügbar ist und AREX-2 überhaupt nicht verfügbar ist.