
AREX-2 vs Gemma 4 12B: Jeden z nich jest modelem
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 507 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 194 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Porównanie między Gemma 4 12B a AREX-2 ma właściwość, której nie ma żadne inne zestawienie na tym blogu: jedna z dwóch kolumn jest pusta, ponieważ model po tej stronie jeszcze nie istnieje. Gemma 4 12B to wydany artefakt — Google DeepMind opublikował go 3 czerwca 2026 r. jako gęsty model z otwartymi wagami o 11,95 miliarda parametrów na licencji Apache 2.0, z pełną kartą modelu, oknem kontekstu 256 tys. tokenów, natywnym wejściem audio i obrazu oraz trzema i pół miesiącami niezależnych testów za sobą. AREX-2 to repozytorium Hugging Face, które BAAI utworzyło 29 września 2026 r. o 17:56 UTC i jeszcze nic do niego nie dodało: brak wag, brak karty, brak tagu licencji, brak ewaluacji, brak ogłoszenia.
Ta asymetria nie jest powodem, by pomijać porównanie. To jest właśnie porównanie. Pytanie, na które warto odpowiedzieć, nie dotyczy tego, które z nich jest lepsze — nic nie jest w stanie na to odpowiedzieć, dopóki AREX-2 nie będzie zawierał plików — lecz tego, czy agent badawczy BAAI drugiej generacji w ogóle konkurowałby z modelem edge 12B, czy też te dwa elementy zajmują pozycje w stosie, które nigdy się nie stykają. Pomyłka w tej kwestii to kosztowny błąd, ponieważ to ten błąd sprawia, że zespół planuje budżet na niewłaściwą rzecz.
Strona wydana, na własnych warunkach
Gemma 4 12B to najmniejszy przedstawiciel czwartej generacji otwartej rodziny Google, a jej kluczowy wybór projektowy ma charakter architektoniczny: całkowicie rezygnuje z osobnego enkodera wizji i wprowadza surowe fragmenty obrazu oraz przebiegi audio bezpośrednio do transformera. To nie jest sztuczka na potrzeby benchmarków. To właśnie czyni ten model naprawdę przenośnym — około 27 GB wag BF16, które po kwantyzacji zajmują poniżej 7 GB, oraz karta, która jako cel wdrożenia wskazuje 16 GB VRAM. Na laptopie lub pojedynczej karcie średniej klasy to model, który naprawdę możesz mieć.
Profil możliwości wynika z powyższego. Własna karta Google'a — dane od dostawcy, co warto jako takie oznaczyć — podaje DocVQA 94,9 i InfoVQA 88,4 w rozumieniu dokumentów, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 oraz LiveCodeBench v6 72,0 w trybie myślenia. Niezależny Artificial Analysis ocenia konfigurację rozumowania na 14 w Intelligence Index, mierzy ją na 114 tokenów na sekundę i wycenia typowe obsłużone wywołanie na 0,10 USD za milion tokenów wejściowych i 0,30 USD za milion wyjściowych. Nasz własny wpis katalogowy dla większego Gemma 4 31B zawiera 85,7 w GPQA Diamond. Zarys tego jest taki: mały generalista, wyjątkowo mocny w dokumentach i obrazach, rozsądny w rozumowaniu i daleko mu do modelu typu frontier w trudnej pracy wieloetapowej.
Jego zakres zadań jest więc konkretny: wnioskowanie lokalne lub jednodzierżawcze, rozumienie dokumentów i zrzutów ekranu, skromne pętle agentowe oraz wszystko, gdzie dane nie mogą opuścić budynku. To nie jest silnik do głębokich badań i Google nie sprzedaje go jako takiego.

Druga strona, która jest nazwą i znacznikiem czasu
Wszystko, co w tym tygodniu można potwierdzić na temat AREX-2, mieści się w jednym zdaniu. To repozytorium w organizacji BAAI na Hugging Face, utworzone 29 września 2026 r., zawierające plik .gitattributes i nic więcej — zero bajtów przechowywanych danych modelu, zero pobrań, brak karty modelu, brak deklaracji licencji, brak wdrożenia u dostawcy. Sam BAAI niczego nie ogłosił.
To, co czyni to wartym zapisania, to rodzina, od której wzięła się nazwa. Linia AREX firmy BAAI została wydana 23 lipca 2026 r. z dwoma modelami: AREX-Base, 122-miliardowy model typu mixture-of-experts z 10 miliardami aktywnych parametrów, oparty na Qwen3.5-122B-A10B, oraz AREX-Turbo, gęsty model 4B zbudowany na Qwen3.5-4B. Oba są na licencji Apache 2.0. Oba są agentami do głębokich badań, a nie modelami czatu — wewnętrzna pętla zbiera dowody i generuje proponowaną odpowiedź ze wskaźnikiem pewności, a zewnętrzna pętla sprawdza tę odpowiedź względem pierwotnych ograniczeń i może dopracować lub zrestartować całą trajektorię. Według opublikowanych wyników BAAI, AREX-Base osiąga 82,5 w BrowseComp, 85,4 w GAIA i 89,9 w DeepSearch QA; AREX-Turbo osiąga 70,7, 81,6 i 78,5 w tych samych trzech.
Wszystkie te liczby pochodzą od samego dostawcy i żadna nie została niezależnie odtworzona. Dotyczą też innego modelu. AREX-2 nie ma żadnych liczb, a „2” nie mówi nic o rozmiarze, backbone ani architekturze — druga generacja w tej linii może być większym agentem, mniejszą destylacją albo ponownie wytrenowanym frameworkiem z wymienionym backbone.
Czy te dwa w ogóle się spotykają?
I tu właśnie porównanie staje się bardziej użyteczne, niż się wydaje. Rozważ dwa prawdopodobne odczytania tego, czym staje się AREX-2.
Jeśli jest to drugiej generacji agent badawczy w skali choćby zbliżonej do skali Base, to on i Gemma 4 12B nigdy nie konkurują. 122B mixture-of-experts napędzający wyszukiwanie z wielu źródeł to usługa hostowana, rozliczana za token i zależna od sieci; Gemma 4 12B to checkpoint, który samodzielnie pobierasz i uruchamiasz. Decyzja między nimi nie jest porównaniem jakości, lecz decyzją o tym, czy twoje obciążenie to pętla badawcza, czy punkt końcowy inferencji.
Jeśli AREX-2 okaże się tym mniejszym modelem — następcą 4B Turbo, a nie 122B Base — to oba faktycznie stoją na tej samej półce i porównanie staje się prawdziwe. Ta wersja AREX-2 miałaby około jednej trzeciej liczby parametrów Gemma 4 12B, byłaby wyspecjalizowana w wyszukiwaniu opartym na narzędziach, a nie w szerokiej multimodalności, i byłaby oceniana na BrowseComp i GAIA, a nie na DocVQA. Dwa małe modele: jeden zoptymalizowany pod utrzymywanie długiej trajektorii badawczej, drugi pod widzenie i czytanie na skromnym sprzęcie. Zespół budujący pipeline dokumentacji nie powinien interesować się pierwszym; zespół budujący agenta badawczego nie powinien interesować się drugim.
• Co istnieje — Gemma 4 12B jest dostępna do pobrania już dziś, z pełną kartą. AREX-2 to repozytorium, w którym nie ma żadnych plików.
• Parametry — 11,95B gęstych dla Gemma 4 12B. W przypadku AREX-2 nie podano tego, a można to wywnioskować wyłącznie z nazwy produktu.
• Kontekst — 256 tys. tokenów (262 144 pozycje) dla Gemma 4 12B. Nieznane dla AREX-2.
• Modalność — tekst, obraz i dźwięk na wejściu dla Gemma 4 12B. Nieznane dla AREX-2; pierwsza generacja AREX obsługiwała tekst i użycie narzędzi.
• Licencja — Apache 2.0 dla Gemma 4 12B, podano na karcie. Nie podano dla AREX-2; AREX-Base i AREX-Turbo były na licencji Apache 2.0.
• Do czego służy — wnioskowanie multimodalne możliwe do wdrożenia na własnym sprzęcie w porównaniu z, na podstawie dowodów z rodziny, długoterminowym wyszukiwaniem i agregacją dowodów wobec hostowanego punktu końcowego.

Ta część, która jest faktycznie porównywalna: gdzie każde z nich działa
Skoro porównanie możliwości jest niedostępne, uczciwym porównaniem, jakiego można dokonać, jest porównanie wdrożeń — a nie jest ono nawet bliskie.
Gemma 4 12B działa tam, gdzie ją umieścisz. Nie ma cennika, licznika zużycia tokenów ani dostawcy między tobą a modelem — kosztem jest sprzęt i energia elektryczna, a trybem awarii twoje własne planowanie przepustowości. Gdy natomiast w lipcu wydano AREX-Base, był on mieszaniną ekspertów o 122B parametrów: modelem, który obsługujesz na klastrze albo wynajmujesz za token, a własny 4B Turbo tej rodziny istnieje właśnie dlatego, że ten wybór ma swoją cenę. Jeśli druga generacja przyjmie ten sam kształt, ekonomia AREX-2 będzie funkcją liczby tokenów zużywanych na zapytanie pomnożonej przez liczbę kroków wyszukiwania wykonywanych przez trajektorię — liczby znacznie większej w przypadku agenta do głębokich badań niż modelu czytającego dokumenty, ponieważ agent ponownie odczytuje rosnący kontekst przy każdej iteracji.
To właśnie tutaj warstwa routingu przestaje być abstrakcją i staje się pozycją w rachunku. Jeśli ostatecznie będziesz uruchamiać agenta badawczego na modelu hostowanym, zachowując lokalny model Gemma 4 12B do pracy z dokumentami, w zwykłym przypadku są to dwie integracje. Dzięki jednemu API stojącemu przed ponad 200 modelami — z przekazywaną dalej ceną katalogową dostawcy i bez doliczania marży, więc zmiana ceny u dostawcy wchodzi tego samego dnia — to jeden klucz, jeden rachunek i jeden klient, a reguła przełączania awaryjnego może przenieść żądanie z dostawcy, który ma złą godzinę, bez wiedzy pętli twojego agenta. Dziś routujemy Gemma 4 26B-A4B i Gemma 4 31B; nie routujemy modelu 12B, a nic z linii AREX również nie ma w naszym katalogu, więc jeśli którykolwiek z nich jest modelem, którego potrzebujesz, pochodzi z własnej dystrybucji jego dostawcy.
Co robić w tym tygodniu
Jeśli potrzebujesz kompaktowego modelu multimodalnego, który możesz uruchomić samodzielnie, decyzja nigdy nie zależała od AREX-2. Gemma 4 12B jest już wydana, udokumentowana, niezależnie oceniona i można ją wdrożyć, a kolumna porównawcza po drugiej stronie jest pusta. Nie kupuj niczego w oparciu o zastrzeżoną nazwę.
Jeśli budujesz agenta do pogłębionych badań i to właśnie linia AREX jest tym, czego naprawdę chcesz, uważać należy nie na nazwę, lecz na drzewo: czy w tym repozytorium pojawiają się safetensors, co karta mówi o liczbie parametrów i jaki tag licencji na nim wyląduje. Pierwsza generacja została wydana na licencji Apache 2.0, a jeśli druga również, pytanie staje się pytaniem o hosting, a nie o licencjonowanie. Do tego czasu AREX-Base jest modelem AREX, który faktycznie można uruchomić, i jest dostępny od lipca.
Jedna rzecz, którą warto powiedzieć wprost o porównaniu, którego ten artykuł nominalnie dotyczy: strona VS, na której jedna strona to commit w repozytorium, a druga to wydany model, nie jest starciem — to harmonogram. Harmonogram mówi, że Gemma 4 12B jest już dostępna, a AREX-2 nie jest dostępna w ogóle.
