
AREX-2 vs Gemma 4 12B: Een van deze is een model
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 507 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 194 tok/s
- OrcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
A comparison between Gemma 4 12B and AREX-2 has a property no other matchup on this blog has: one of the two columns is empty because the model on that side does not exist yet. Gemma 4 12B is a shipped artifact — Google DeepMind published it on June 3, 2026 as an 11.95-billion-parameter dense open-weights model under Apache 2.0, with a full model card, a 256K-token context window, native audio and image input, and three and a half months of independent testing behind it. AREX-2 is a Hugging Face repository that BAAI created on September 29, 2026 at 17:56 UTC and has not yet put anything into: no weights, no card, no licence tag, no evaluation, no announcement.
Die asymmetrie is geen reden om de vergelijking over te slaan. Het ís de vergelijking. De vraag die het beantwoorden waard is, is niet welke van deze twee beter is — niets kan dat beantwoorden totdat AREX-2 bestanden bevat — maar of een BAAI-onderzoeksagent van de tweede generatie überhaupt zou concurreren met een 12B edge-model, of dat deze twee posities innemen in een stack die elkaar nooit raken. Dat verkeerd inschatten is de dure fout, want het is de fout waardoor een team voor het verkeerde ding budgetteert.
De verzonden kant, op zijn eigen voorwaarden.
Gemma 4 12B is the small member of Google's fourth-generation open family, and its defining design choice is architectural: it drops the separate vision encoder entirely and feeds raw image patches and audio waveforms straight into the transformer. That is not a benchmark trick. It is what makes the model genuinely portable — roughly 27 GB of BF16 weights that quantise below 7 GB, and a card that names 16 GB of VRAM as the deployment target. On a laptop or a single mid-range card, this is a model you can actually hold.
The capability profile follows from that. Google's own card — vendor-reported, and worth labelling as such — lists DocVQA 94.9 and InfoVQA 88.4 for document understanding, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 and LiveCodeBench v6 72.0 in thinking mode. Artificial Analysis, which is independent, scores the reasoning configuration at an Intelligence Index of 14, measures it at 114 tokens per second, and prices a typical served call at $0.10 per million input tokens and $0.30 per million output. Our own catalogue entry for the larger Gemma 4 31B carries 85.7 on GPQA Diamond. The shape of that is a small generalist that is unusually strong on documents and images, reasonable on reasoning, and nowhere near a frontier model on hard multi-step work.
Its job description is therefore concrete: local or single-tenant inference, document and screenshot understanding, modest agentic loops, and anything where the data cannot leave the building. It is not a deep-research engine and Google does not sell it as one.

De andere kant, wat een naam en een tijdstempel is
Alles wat deze week over AREX-2 te bevestigen valt, past in één zin. Het is een repository onder de BAAI-organisatie op Hugging Face, aangemaakt op 29 september 2026, met een .gitattributes bestand en niets anders — nul bytes aan opgeslagen modelgegevens, nul downloads, geen modelkaart, geen licentieverklaring, geen provider-deployment. BAAI zelf heeft niets aangekondigd.
Wat het de moeite waard maakt om op te schrijven, is de familie waarnaar het vernoemd is. De AREX-lijn van BAAI werd op 23 juli 2026 uitgebracht met twee modellen: AREX-Base, een mixture-of-experts met 122 miljard parameters en 10 miljard actieve parameters, gebaseerd op Qwen3.5-122B-A10B, en AREX-Turbo, een dense 4B-model gebouwd op Qwen3.5-4B. Beide zijn Apache 2.0. Beide zijn deep-researchagenten in plaats van chatmodellen — een binnenste lus die bewijs verzamelt en een kandidaatantwoord met een betrouwbaarheidscijfer oplevert, en een buitenste lus die dat antwoord toetst aan de oorspronkelijke beperkingen en het hele traject kan verfijnen of opnieuw kan starten. Volgens de gepubliceerde cijfers van BAAI bereikt AREX-Base 82,5 op BrowseComp, 85,4 op GAIA en 89,9 op DeepSearch QA; AREX-Turbo bereikt 70,7, 81,6 en 78,5 op dezelfde drie.
Al die cijfers zijn van de leverancier zelf en geen enkele is onafhankelijk gereproduceerd. Ze gaan ook over een ander model. AREX-2 heeft geen cijfers, en de "2" zegt niets over grootte, backbone of architectuur — een tweede generatie in deze reeks kan een grotere agent zijn, een kleinere distillatie, of een opnieuw getraind framework waarbij de backbone is vervangen.
Ontmoeten deze twee elkaar eigenlijk wel?
Hier wordt de vergelijking nuttiger dan ze lijkt. Neem de twee plausibele lezingen van wat AREX-2 wordt.
Als het een onderzoeksagent van de tweede generatie is op ongeveer de schaal van Base, dan concurreren die en Gemma 4 12B nooit. Een mixture-of-experts van 122B die multi-source zoeken aanstuurt, is een gehoste, per-token gefactureerde, netwerkgebonden dienst; Gemma 4 12B is een checkpoint die je zelf downloadt en uitvoert. De keuze tussen hen is geen kwaliteitsvergelijking, het is een beslissing over of je workload een onderzoekslus of een inference-endpoint is.
Als AREX-2 de kleine klasse blijkt te zijn — de opvolger van de 4B Turbo in plaats van de 122B Base — dan delen de twee wél een plank, en wordt de vergelijking een echte. Die versie van AREX-2 zou ongeveer een derde van het aantal parameters van Gemma 4 12B hebben, gespecialiseerd in toolgestuurd zoeken in plaats van multimodale breedte, en zou worden gemeten op BrowseComp en GAIA in plaats van op DocVQA. Twee kleine modellen, het ene geoptimaliseerd voor het volhouden van een langdurig onderzoekstraject, het andere voor zien en lezen op bescheiden hardware. Een team dat een documentatiepijplijn bouwt, hoeft zich niet om het eerste te bekommeren; een team dat een onderzoeksagent bouwt, hoeft zich niet om het tweede te bekommeren.
• Wat bestaat — Gemma 4 12B is vandaag downloadbaar met een volledige kaart. AREX-2 is een repository zonder bestanden erin.
• Parameters — 11,95B dense voor Gemma 4 12B. Niet vermeld, en alleen afleidbaar uit een productnaam, voor AREX-2.
• Context — 256K tokens (262.144 posities) voor Gemma 4 12B. Onbekend voor AREX-2.
• Modaliteit — tekst, afbeelding en audio als invoer voor Gemma 4 12B. Onbekend voor AREX-2; de eerste AREX-generatie was tekst plus tool-gebruik.
•Licentie — Apache 2.0 voor Gemma 4 12B, vermeld op de kaart. Niet vermeld voor AREX-2; AREX-Base en AREX-Turbo waren Apache 2.0.
• Waarvoor het dient — inzetbare multimodale inferentie op je eigen hardware tegenover, op basis van het bewijs van de familie, zoekopdrachten met een lange horizon en bewijsaggregatie ten opzichte van een gehoste endpoint.

Het deel dat daadwerkelijk vergelijkbaar is: waar elk van hen draait
Aangezien de capaciteitsvergelijking niet beschikbaar is, is de inzetvergelijking de eerlijke vergelijking om te maken, en het verschil is allesbehalve klein.
Gemma 4 12B draait waar je hem plaatst. Er is geen prijskaart, geen meter per token en geen aanbieder tussen jou en het model — de kosten zijn de hardware en de elektriciteit, en de faalmodus is je eigen capaciteitsplanning. Toen AREX-Base in juli uitkwam, was het daarentegen een 122B mixture-of-experts: een model dat je op een cluster draait of per token huurt, en de eigen 4B Turbo van de familie bestaat juist omdat die keuze een prijs heeft. Als de tweede generatie dezelfde vorm volgt, zal de economie van AREX-2 een functie zijn van het aantal tokens dat per query wordt verbruikt, vermenigvuldigd met het aantal zoekstappen dat een traject neemt — een getal dat veel groter is voor een deep-researchagent dan voor een model dat documenten leest, omdat de agent bij elke iteratie een groeiende context opnieuw leest.
Dat is het punt waarop een routinglaag ophoudt een abstractie te zijn en een regelpost wordt. Als je uiteindelijk een onderzoeksagent tegen een gehost model laat draaien en daarnaast een lokale Gemma 4 12B houdt voor het documentwerk, zijn dat in het gewone geval twee integraties. Via één API vóór meer dan 200 modellen — waarbij de lijstprijs van de provider wordt doorgegeven en er geen opslag bovenop komt, zodat een prijswijziging van een leverancier dezelfde dag doorwerkt — zijn het één sleutel, één factuur en één client, en een failoverregel kan een verzoek wegverplaatsen bij een provider die een slecht uur doormaakt zonder dat je agentloop het weet. Wij routeren vandaag Gemma 4 26B-A4B en Gemma 4 31B; de 12B routeren wij niet, en niets uit de AREX-lijn staat op onze catalogus, dus als een van die twee het model is dat je nodig hebt, komt het uit de eigen distributie van de leverancier.
Wat deze week te doen
Als je een compact multimodaal model nodig hebt dat je zelf kunt draaien, heeft de beslissing nooit op AREX-2 gewacht. Gemma 4 12B is uitgebracht, gedocumenteerd, onafhankelijk beoordeeld en inzetbaar, en de vergelijkingskolom aan de andere kant is leeg. Koop niets op grond van een gereserveerde naam.
Als je een deep-researchagent bouwt en de AREX-lijn is precies wat je wilt, is het niet de naam waar je op moet letten, maar de tree: of er safetensors in die repository staan, wat er op de model card staat over het aantal parameters, en welk licentielabel erop terechtkomt. De eerste generatie werd uitgebracht onder Apache 2.0, en als de tweede dat ook doet, wordt de kwestie een hostingkwestie in plaats van een licentiekwestie. Tot die tijd is AREX-Base het AREX-model dat je daadwerkelijk kunt draaien, en het is beschikbaar sinds juli.
Het enige dat ronduit gezegd moet worden over de vergelijking waar dit artikel in naam over gaat: een VS-pagina waarvan de ene kant een repository-commit is en de andere een uitgebracht model, is geen wedstrijd maar een schema. Het schema zegt dat Gemma 4 12B nu beschikbaar is en AREX-2 helemaal niet beschikbaar is.
