
AREX-2 vs Gemma 4 12B: En av dessa är en modell
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 397 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
En jämförelse mellan Gemma 4 12B och AREX-2 har en egenskap som ingen annan matchning på den här bloggen har: en av de två kolumnerna är tom eftersom modellen på den sidan ännu inte existerar. Gemma 4 12B är en färdig artefakt – Google DeepMind publicerade den den 3 juni 2026 som en dense modell med öppna vikter och 11,95 miljarder parametrar under Apache 2.0, med ett fullständigt modellkort, ett kontextfönster på 256K-token, inbyggd ljud- och bildinmatning samt tre och en halv månads oberoende testning bakom sig. AREX-2 är ett Hugging Face-repositorium som BAAI skapade den 29 september 2026 kl. 17:56 UTC och ännu inte har lagt något i: inga vikter, inget modellkort, ingen licenstagg, ingen utvärdering, inget tillkännagivande.
Asymmetrin är inte ett skäl att hoppa över jämförelsen. Den är jämförelsen. Frågan som är värd att besvara är inte vilken av dessa som är bättre — ingenting kan besvara det förrän AREX-2 har filer i sig — utan om en andra generationens BAAI-forskningsagent ens skulle konkurrera med en 12B edge-modell från början, eller om dessa två intar positioner i en stack som aldrig möts. Att få det fel är det dyra misstaget, eftersom det är misstaget som leder ett team att budgetera för fel sak.
Den levererade sidan, på sina egna villkor
Gemma 4 12B är den lilla medlemmen i Googles fjärde generationens öppna familj, och dess definierande designval är arkitektoniskt: den överger helt den separata synkodaren och matar råa bildpatchar och ljudvågformer rakt in i transformatorn. Det är inte ett benchmarkknep. Det är vad som gör modellen genuint portabel – ungefär 27 GB BF16-vikter som kvantiseras ner till under 7 GB, och ett kort som anger 16 GB VRAM som mål för driftsättning. På en bärbar dator eller ett enda mellanklasskort är detta en modell du faktiskt kan hålla i.
Kapacitetsprofilen följer av det. Googles eget modellkort – leverantörsrapporterat och värt att märka som sådant – listar DocVQA 94,9 och InfoVQA 88,4 för dokumentförståelse, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 och LiveCodeBench v6 72,0 i tankeläge. Artificial Analysis, som är oberoende, ger den resonerande konfigurationen ett Intelligence Index på 14, mäter den till 114 tokens per sekund och prissätter ett typiskt serverat anrop till 0,10 USD per miljon indatatokens och 0,30 USD per miljon utdatatokens. Vår egen katalogpost för den större Gemma 4 31B anger 85,7 på GPQA Diamond. Det som framträder är en liten generalist som är ovanligt stark på dokument och bilder, rimlig på resonemang och inte i närheten av en frontiermodell på svårt flerstegsarbete.
Dess arbetsbeskrivning är därför konkret: lokal eller single-tenant-inferens, förståelse av dokument och skärmbilder, måttliga agentiska loopar och allt där data inte kan lämna byggnaden. Den är inte en djupforskningsmotor, och Google säljer den inte som en sådan.

Den andra sidan, som är ett namn och en tidsstämpel
Allt som kan bekräftas om AREX-2 den här veckan ryms i en mening. Det är ett arkiv under BAAI-organisationen på Hugging Face, skapat den 29 september 2026, som innehåller en .gitattributes fil och inget annat — noll byte lagrad modelldata, noll nedladdningar, inget modellkort, ingen licensdeklaration, ingen driftsättning hos leverantör. BAAI själva har inte meddelat något.
Det som gör den värd att skriva ned är familjen den är uppkallad efter. BAAI:s AREX-serie lanserades den 23 juli 2026 med två modeller: AREX-Base, en mixture-of-experts-modell med 122 miljarder parametrar och 10 miljarder aktiva parametrar baserad på Qwen3.5-122B-A10B, och AREX-Turbo, en dense 4B-modell byggd på Qwen3.5-4B. Båda är Apache 2.0. Båda är djupforskningsagenter snarare än chattmodeller – en inre slinga som samlar in bevis och producerar ett kandidatsvar med ett konfidensvärde, och en yttre slinga som kontrollerar svaret mot de ursprungliga begränsningarna och kan förfina eller starta om hela trajektorian. Enligt BAAI:s publicerade siffror når AREX-Base 82,5 på BrowseComp, 85,4 på GAIA och 89,9 på DeepSearch QA; AREX-Turbo når 70,7, 81,6 och 78,5 på samma tre.
Alla dessa siffror är leverantörens egna och ingen av dem har reproducerats oberoende. De handlar dessutom om en annan modell. AREX-2 har inga siffror, och "2" säger dig ingenting om storlek, backbone eller arkitektur — en andra generation i den här serien skulle kunna vara en större agent, en mindre destillation eller ett omtränat ramverk med utbytt backbone.
Möts dessa två ens?
Det är här jämförelsen blir mer användbar än den verkar. Ta de två rimliga tolkningarna av vad AREX-2 blir.
Om den är en forskningsagent av andra generationen och ens i närheten av Bases skala, då konkurrerar den aldrig med Gemma 4 12B. En 122B mixture-of-experts som driver flerkällssökning är en hostad tjänst med debitering per token, nätverksbunden; Gemma 4 12B är en checkpoint som du själv laddar ner och kör. Valet mellan dem är inte en kvalitetsjämförelse, det är ett beslut om huruvida din arbetsbelastning är en forskningsloop eller en inferensendpoint.
Om AREX-2 visar sig vara den lilla nivån – efterföljaren till 4B Turbo snarare än 122B Base – då delar de två faktiskt en hylla, och jämförelsen blir en riktig sådan. Den versionen av AREX-2 skulle ha ungefär en tredjedel av Gemma 4 12B:s parameterantal, specialiserad för verktygsdriven sökning snarare än multimodal bredd, och skulle mätas på BrowseComp och GAIA snarare än på DocVQA. Två små modeller, den ena optimerad för att upprätthålla en lång forskningsbana, den andra för att se och läsa på blygsam hårdvara. Ett team som bygger en dokumentationspipeline bör inte bry sig om den första; ett team som bygger en forskningsagent bör inte bry sig om den andra.
• Vad som finns — Gemma 4 12B går att ladda ner idag med ett fullständigt kort. AREX-2 är ett arkiv som inte innehåller några filer.
• Parametrar — 11,95B dense för Gemma 4 12B. Anges inte, och kan endast härledas från ett produktnamn, för AREX-2.
• Kontext — 256 000 tokens (262 144 positioner) för Gemma 4 12B. Okänt för AREX-2.
• Modalitet — text, bild och ljud som indata för Gemma 4 12B. Okänt för AREX-2; den första AREX-generationen var text plus verktygsanvändning.
• Licens — Apache 2.0 för Gemma 4 12B, anges på kortet. Anges inte för AREX-2; AREX-Base och AREX-Turbo var Apache 2.0.
• Vad det är till för — driftsättningsbar multimodalinferens på din egen hårdvara gentemot, enligt vad som framgår av familjen, långsiktig sökning och evidensaggregering mot en hostad endpoint.

Den del som faktiskt är jämförbar: var var och en körs
Eftersom förmågejämförelsen inte är tillgänglig är utplaceringsjämförelsen den ärliga jämförelsen att göra, och den är inte jämn.
Gemma 4 12B körs där du placerar den. Det finns inget prisblad, ingen mätare per token och ingen leverantör mellan dig och modellen – kostnaden är hårdvaran och elen, och felläget är din egen kapacitetsplanering. När AREX-Base lanserades i juli var det däremot en 122B mixture-of-experts: en modell som du serverar på ett kluster eller hyr per token, och familjens egen 4B Turbo finns just för att det valet har ett pris. Om den andra generationen följer samma form blir AREX-2:s ekonomi en funktion av tokens som förbrukas per fråga multiplicerat med antalet söksteg en trajektoria tar – ett tal som är mycket större för en djupforskningsagent än för en dokumentläsande modell, eftersom agenten läser om ett växande kontext vid varje iteration.
Det är där ett routinglager slutar vara en abstraktion och börjar bli en radpost. Om du till slut kör en forskningsagent mot en hostad modell medan du behåller en lokal Gemma 4 12B för dokumentarbetet, är det två integrationer i vanliga fall. Genom ett enda API framför 200+ modeller — med leverantörens listpris vidarebefordrat och inget påslag tillagt ovanpå, så att en leverantörs prisändring slår igenom samma dag — är de en nyckel, en faktura och en klient, och en failover-regel kan flytta en förfrågan från en leverantör som har en dålig timme utan att din agent-loop vet om det. Vi routar Gemma 4 26B-A4B och Gemma 4 31B idag; vi routar inte 12B, och inget från AREX-serien finns i vår katalog heller, så om någon av dessa är modellen du behöver kommer den från leverantörens egen distribution.
Vad du ska göra den här veckan
Om du behöver en kompakt multimodal modell som du kan köra själv, väntade beslutet aldrig på AREX-2. Gemma 4 12B är släppt, dokumenterad, oberoende bedömd och driftsättningsbar, och jämförelsekolumnen på andra sidan är tom. Köp inget på grundval av ett reserverat namn.
Om du bygger en djupforskningsagent och AREX-serien är det du faktiskt vill ha, är det du bör hålla ögonen på inte namnet utan trädet: om safetensors förekommer i det arkivet, vad kortet säger att parametrantalet är, och vilken licenstagga som hamnar på det. Den första generationen levererades med Apache 2.0, och om den andra gör det också, blir frågan en hostingfråga snarare än en licensfråga. Fram till dess är AREX-Base den AREX-modell du faktiskt kan köra, och den har funnits sedan juli.
Det enda som är värt att säga rent ut om den jämförelse som den här artikeln formellt handlar om: en VS-sida där den ena sidan är en commit i ett repositorium och den andra är en utsläppt modell är inte en match, det är ett schema. Schemat säger att Gemma 4 12B finns tillgänglig nu och att AREX-2 inte är tillgänglig alls.
