Wygenerowana karta tytułowa o treści „AREX-2 vs Gemma 4 12B – Jedno z nich to model”, z dwoma panelami. Lewy panel, zatytułowany Gemma 4 12B, zawiera listę: wydany 3 czerwca 2026; 11,95 mld parametrów, gęsty; kontekst 256K, Apache 2.0; pobierz już dziś. Prawy panel, zatytułowany AREX-2, zawiera listę: repozytorium utworzone 29 września 2026; nie przesłano wag; brak karty, brak tagu licencji; nie można pobrać. W stopce widnieje napis „Jedna kolumna to model. Druga to znacznik czasu.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

AREX-2 vs Gemma 4 12B: Jeden z nich jest modelem

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Porównanie między Gemma 4 12B a AREX-2 ma właściwość, której nie ma żadne inne zestawienie na tym blogu: jedna z dwóch kolumn jest pusta, ponieważ model po tej stronie jeszcze nie istnieje. Gemma 4 12B to wydany artefakt — Goog​le DeepMind opublikował go 3 czerwca 2026 r. jako gęsty model z otwartymi wagami o 11,95 miliarda parametrów na licencji Apache 2.0, z pełną kartą modelu, oknem kontekstu 256 tys. tokenów, natywnym wejściem audio i obrazu oraz trzema i pół miesiącami niezależnych testów za sobą. AREX-2 to repozytorium Hugging Face, które BAAI utworzyło 29 września 2026 r. o 17:56 UTC i jeszcze nic do niego nie dodało: brak wag, brak karty, brak tagu licencji, brak ewaluacji, brak ogłoszenia.

Ta asymetria nie jest powodem, by pomijać porównanie. To jest właśnie porównanie. Pytanie, na które warto odpowiedzieć, nie dotyczy tego, które z nich jest lepsze — nic nie jest w stanie na to odpowiedzieć, dopóki AREX-2 nie będzie zawierał plików — lecz tego, czy agent badawczy BAAI drugiej generacji w ogóle konkurowałby z modelem edge 12B, czy też te dwa elementy zajmują pozycje w stosie, które nigdy się nie stykają. Pomyłka w tej kwestii to kosztowny błąd, ponieważ to ten błąd sprawia, że zespół planuje budżet na niewłaściwą rzecz.

Strona wydana, na własnych warunkach

Gemma 4 12B to najmniejszy przedstawiciel czwartej generacji otwartej rodziny Goog​le, a jej kluczowy wybór projektowy ma charakter architektoniczny: całkowicie rezygnuje z osobnego enkodera wizji i wprowadza surowe fragmenty obrazu oraz przebiegi audio bezpośrednio do transformera. To nie jest sztuczka na potrzeby benchmarków. To właśnie czyni ten model naprawdę przenośnym — około 27 GB wag BF16, które po kwantyzacji zajmują poniżej 7 GB, oraz karta, która jako cel wdrożenia wskazuje 16 GB VRAM. Na laptopie lub pojedynczej karcie średniej klasy to model, który naprawdę możesz mieć.

Profil możliwości wynika z powyższego. Własna karta Google'a — dane od dostawcy, co warto jako takie oznaczyć — podaje DocVQA 94,9 i InfoVQA 88,4 w rozumieniu dokumentów, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 oraz LiveCodeBench v6 72,0 w trybie myślenia. Niezależny Artificial Analysis ocenia konfigurację rozumowania na 14 w Intelligence Index, mierzy ją na 114 tokenów na sekundę i wycenia typowe obsłużone wywołanie na 0,10 USD za milion tokenów wejściowych i 0,30 USD za milion wyjściowych. Nasz własny wpis katalogowy dla większego Gemma 4 31B zawiera 85,7 w GPQA Diamond. Zarys tego jest taki: mały generalista, wyjątkowo mocny w dokumentach i obrazach, rozsądny w rozumowaniu i daleko mu do modelu typu frontier w trudnej pracy wieloetapowej.

Jego zakres zadań jest więc konkretny: wnioskowanie lokalne lub jednodzierżawcze, rozumienie dokumentów i zrzutów ekranu, skromne pętle agentowe oraz wszystko, gdzie dane nie mogą opuścić budynku. To nie jest silnik do głębokich badań i Goog​le nie sprzedaje go jako takiego.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

Druga strona, która jest nazwą i znacznikiem czasu

Wszystko, co w tym tygodniu można potwierdzić na temat AREX-2, mieści się w jednym zdaniu. To repozytorium w organizacji BAAI na Hugging Face, utworzone 29 września 2026 r., zawierające plik .gitattributes i nic więcej — zero bajtów przechowywanych danych modelu, zero pobrań, brak karty modelu, brak deklaracji licencji, brak wdrożenia u dostawcy. Sam BAAI niczego nie ogłosił.

To, co czyni to wartym zapisania, to rodzina, od której wzięła się nazwa. Linia AREX firmy BAAI została wydana 23 lipca 2026 r. z dwoma modelami: AREX-Base, 122-miliardowy model typu mixture-of-experts z 10 miliardami aktywnych parametrów, oparty na Qwen3.5-122B-A10B, oraz AREX-Turbo, gęsty model 4B zbudowany na Qwen3.5-4B. Oba są na licencji Apache 2.0. Oba są agentami do głębokich badań, a nie modelami czatu — wewnętrzna pętla zbiera dowody i generuje proponowaną odpowiedź ze wskaźnikiem pewności, a zewnętrzna pętla sprawdza tę odpowiedź względem pierwotnych ograniczeń i może dopracować lub zrestartować całą trajektorię. Według opublikowanych wyników BAAI, AREX-Base osiąga 82,5 w BrowseComp, 85,4 w GAIA i 89,9 w DeepSearch QA; AREX-Turbo osiąga 70,7, 81,6 i 78,5 w tych samych trzech.

Wszystkie te liczby pochodzą od samego dostawcy i żadna nie została niezależnie odtworzona. Dotyczą też innego modelu. AREX-2 nie ma żadnych liczb, a „2” nie mówi nic o rozmiarze, backbone ani architekturze — druga generacja w tej linii może być większym agentem, mniejszą destylacją albo ponownie wytrenowanym frameworkiem z wymienionym backbone.

Czy te dwa w ogóle się spotykają?

I tu właśnie porównanie staje się bardziej użyteczne, niż się wydaje. Rozważ dwa prawdopodobne odczytania tego, czym staje się AREX-2.

Jeśli jest to drugiej generacji agent badawczy w skali choćby zbliżonej do skali Base, to on i Gemma 4 12B nigdy nie konkurują. 122B mixture-of-experts napędzający wyszukiwanie z wielu źródeł to usługa hostowana, rozliczana za token i zależna od sieci; Gemma 4 12B to checkpoint, który samodzielnie pobierasz i uruchamiasz. Decyzja między nimi nie jest porównaniem jakości, lecz decyzją o tym, czy twoje obciążenie to pętla badawcza, czy punkt końcowy inferencji.

Jeśli AREX-2 okaże się tym mniejszym modelem — następcą 4B Turbo, a nie 122B Base — to oba faktycznie stoją na tej samej półce i porównanie staje się prawdziwe. Ta wersja AREX-2 miałaby około jednej trzeciej liczby parametrów Gemma 4 12B, byłaby wyspecjalizowana w wyszukiwaniu opartym na narzędziach, a nie w szerokiej multimodalności, i byłaby oceniana na BrowseComp i GAIA, a nie na DocVQA. Dwa małe modele: jeden zoptymalizowany pod utrzymywanie długiej trajektorii badawczej, drugi pod widzenie i czytanie na skromnym sprzęcie. Zespół budujący pipeline dokumentacji nie powinien interesować się pierwszym; zespół budujący agenta badawczego nie powinien interesować się drugim.

• Co istnieje — Gemma 4 12B jest dostępna do pobrania już dziś, z pełną kartą. AREX-2 to repozytorium, w którym nie ma żadnych plików.

• Parametry — 11,95B gęstych dla Gemma 4 12B. W przypadku AREX-2 nie podano tego, a można to wywnioskować wyłącznie z nazwy produktu.

• Kontekst — 256 tys. tokenów (262 144 pozycje) dla Gemma 4 12B. Nieznane dla AREX-2.

• Modalność — tekst, obraz i dźwięk na wejściu dla Gemma 4 12B. Nieznane dla AREX-2; pierwsza generacja AREX obsługiwała tekst i użycie narzędzi.

• Licencja — Apache 2.0 dla Gemma 4 12B, podano na karcie. Nie podano dla AREX-2; AREX-Base i AREX-Turbo były na licencji Apache 2.0.

• Do czego służy — wnioskowanie multimodalne możliwe do wdrożenia na własnym sprzęcie w porównaniu z, na podstawie dowodów z rodziny, długoterminowym wyszukiwaniem i agregacją dowodów wobec hostowanego punktu końcowego.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

Ta część, która jest faktycznie porównywalna: gdzie każde z nich działa

Skoro porównanie możliwości jest niedostępne, uczciwym porównaniem, jakiego można dokonać, jest porównanie wdrożeń — a nie jest ono nawet bliskie.

Gemma 4 12B działa tam, gdzie ją umieścisz. Nie ma cennika, licznika zużycia tokenów ani dostawcy między tobą a modelem — kosztem jest sprzęt i energia elektryczna, a trybem awarii twoje własne planowanie przepustowości. Gdy natomiast w lipcu wydano AREX-Base, był on mieszaniną ekspertów o 122B parametrów: modelem, który obsługujesz na klastrze albo wynajmujesz za token, a własny 4B Turbo tej rodziny istnieje właśnie dlatego, że ten wybór ma swoją cenę. Jeśli druga generacja przyjmie ten sam kształt, ekonomia AREX-2 będzie funkcją liczby tokenów zużywanych na zapytanie pomnożonej przez liczbę kroków wyszukiwania wykonywanych przez trajektorię — liczby znacznie większej w przypadku agenta do głębokich badań niż modelu czytającego dokumenty, ponieważ agent ponownie odczytuje rosnący kontekst przy każdej iteracji.

To właśnie tutaj warstwa routingu przestaje być abstrakcją i staje się pozycją w rachunku. Jeśli ostatecznie będziesz uruchamiać agenta badawczego na modelu hostowanym, zachowując lokalny model Gemma 4 12B do pracy z dokumentami, w zwykłym przypadku są to dwie integracje. Dzięki jednemu API stojącemu przed ponad 200 modelami — z przekazywaną dalej ceną katalogową dostawcy i bez doliczania marży, więc zmiana ceny u dostawcy wchodzi tego samego dnia — to jeden klucz, jeden rachunek i jeden klient, a reguła przełączania awaryjnego może przenieść żądanie z dostawcy, który ma złą godzinę, bez wiedzy pętli twojego agenta. Dziś routujemy Gemma 4 26B-A4B i Gemma 4 31B; nie routujemy modelu 12B, a nic z linii AREX również nie ma w naszym katalogu, więc jeśli którykolwiek z nich jest modelem, którego potrzebujesz, pochodzi z własnej dystrybucji jego dostawcy.

Co robić w tym tygodniu

Jeśli potrzebujesz kompaktowego modelu multimodalnego, który możesz uruchomić samodzielnie, decyzja nigdy nie zależała od AREX-2. Gemma 4 12B jest już wydana, udokumentowana, niezależnie oceniona i można ją wdrożyć, a kolumna porównawcza po drugiej stronie jest pusta. Nie kupuj niczego w oparciu o zastrzeżoną nazwę.

Jeśli budujesz agenta do pogłębionych badań i to właśnie linia AREX jest tym, czego naprawdę chcesz, uważać należy nie na nazwę, lecz na drzewo: czy w tym repozytorium pojawiają się safetensors, co karta mówi o liczbie parametrów i jaki tag licencji na nim wyląduje. Pierwsza generacja została wydana na licencji Apache 2.0, a jeśli druga również, pytanie staje się pytaniem o hosting, a nie o licencjonowanie. Do tego czasu AREX-Base jest modelem AREX, który faktycznie można uruchomić, i jest dostępny od lipca.

Jedna rzecz, którą warto powiedzieć wprost o porównaniu, którego ten artykuł nominalnie dotyczy: strona VS, na której jedna strona to commit w repozytorium, a druga to wydany model, nie jest starciem — to harmonogram. Harmonogram mówi, że Gemma 4 12B jest już dostępna, a AREX-2 nie jest dostępna w ogóle.