{{1}}Karta bohatera dla 'MiniCPM5-2B vs Gemma 4 12B'{{/1}}, z podtytułem {{2}}'Lider rankingu sub-4B kontra multimodalny generalista Google z 12B'{{/2}}, trzema chipami {{3}}'2.5B vs 11.95B'{{/3}}, {{4}}'128K vs 256K kontekstu'{{/4}} oraz {{5}}'AA Index 17 — #1 sub-4B'{{/5}}, a u góry wstążką {{6}}'STARCIE Z OTWARTYMI WAGAMI · WRZESIEŃ 2026'{{/6}}.
Guides & Insights

MiniCPM5-2B vs Gemma 4 12B: Lider rankingów poniżej 4B kontra 12B generalista Google'a

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Materiały premierowe MiniCPM5-2B zawierają jedno zdanie, które brzmi, jakby rozstrzygało każdy spór, zanim ten w ogóle się zacznie: podczas Światowej Konferencji Sztucznej Inteligencji 19 lipca ModelBest i OpenBMB nazwały model najlepszym w rankingu Artificial Analysis w kategorii modeli poniżej 4B parametrów, a jego otwarte wagi właśnie po cichu trafiły na Hugging Face. Gemma 4 12B to odpowiedź Google z całkowicie innej klasy wagowej — gęsty multimodalny model ogólnego przeznaczenia bez enkodera, liczący 11.95B parametrów, wydany 3 czerwca, przyjmujący na wejściu tekst, obraz, audio i wideo, który ma za sobą miesiące wdrożeń społecznościowych. Porównywanie ich nie jest ćwiczeniem na kartce z danymi technicznymi; to decyzja o tym, na jakie urządzenie kierujesz swój produkt, ponieważ model, który przewodzi w swojej klasie rozmiarowej, i model, który jest po prostu większy, odpowiadają na różne pytania dotyczące sprzętu.

To właśnie timing jest powodem, dla którego to zestawienie w ogóle istnieje. MiniCPM5-2B pokazano na WAIC w lipcu jako produkt — historię o chipie w równym stopniu, co o modelu, z dziewięcioma partnerami krzemowymi od pierwszego dnia ze społeczności FlagOS — a wagi obiecano „w niedalekiej przyszłości”. Siedem tygodni później na Hugging Face pojawiło się repozytorium openbmb/MiniCPM5-2B (dziennik zmian OpenBMB datuje wydanie na 7 września), na licencji Apache-2.0, bez ograniczeń dostępu, z checkpointem BF16, plikami GGUF, MLX, GPTQ, checkpointami bazowym i SFT oraz zestawami danych treningowych w jednej kolekcji. Żadnego komunikatu prasowego, żadnego wydarzenia premierowego. W chwili pisania tego tekstu ogłoszeniem jest karta modelu, a żadne niezależne uruchomienie benchmarku nie zostało jeszcze opublikowane — wszystko, co ilościowe o wersji 2B poniżej, pochodzi albo z własnej reprodukcji ModelBest, albo ze snapshotu Artificial Analysis, który ModelBest cytuje. Gemma 4 12B trafiła natomiast na rynek zwykłą ścieżką Google i była pobierana miliony razy. Ta luka dowodowa jest częścią porównania, a nie przypisem do niego.

Co właśnie się zmieniło po każdej stronie

MiniCPM5-2B to drugi model z serii MiniCPM5, następujący po MiniCPM5-1B, który OpenBMB opublikował jako open source 19 maja. Karta modelu opisuje gęsty transformer o łącznej liczbie 2 516 756 480 parametrów (1 981 982 720 poza embeddingami — to właśnie ta liczba uzasadnia etykietę „klasy 2B”), 42 warstwy o ukrytym rozmiarze 2048, uwagę grupowaną (grouped-query attention) z 16 głowami zapytań i tylko 2 głowami KV oraz słownik o rozmiarze 130 560. To zwykła architektura LlamaForCausalLM — karta wprost stwierdza, że nie są potrzebne żadne niestandardowe jądra ani fork kodu modelu — a cały checkpoint jest dostarczany jako pojedynczy shard safetensors w formacie BF16. Ciekawym wyborem projektowym jest etap po treningu wstępnym: SFT na 400B tokenach danych związanych z głębokim myśleniem, a następnie destylacja na polityce (On-Policy Distillation), która składa szesnaście eksperckich modeli RL — w tym pięć agentowych — z powrotem w jedną małą gęstą sieć. Karta przypisuje RL + OPD średni wzrost o 10,96 punktu w zadaniach rozumowania i ogólnych oraz o 6,96 punktu w zadaniach agentowych — to wewnętrzne różnice, ale wyjaśniają one charakter tego modelu: 2B zaprojektowany jako agent działający na urządzeniu, natywnie generujący wywołania narzędzi w stylu XML.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Gemma 4 12B zajmuje inną pozycję w ofercie Google. To środkowe dziecko rodziny Gemma 4 — ponad modelami E2B i E4B nastawionymi na edge, poniżej 26B MoE i 31B frontier — i jedyny członek zbudowany w architekturze bez enkodera: surowe fragmenty obrazów i przebiegi audio są mapowane bezpośrednio do przestrzeni tokenów, dzięki czemu jeden gęsty model obsługuje tekst, obraz, audio i wideo bez potrzeby osobnej wieży enkodera. Oferuje okno kontekstowe 256K, wbudowane wywoływanie narzędzi, opcjonalny przebieg rozumowania oraz draftery predykcji wielotokenowej, które przyspieszają dekodowanie od wewnątrz punktu kontrolnego. Jest na licencji Apache-2.0, praktyczny na sprzęcie klasy 16 GB (mniej więcej 8 GB przy kwantyzacji 4-bitowej), a jego strona na Hugging Face notuje miliony pobrań miesięcznie.

Screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing Google DeepMind as author, the Apache-2.0 license tag, Transformers and Safetensors tags, 'Model size 12B params', and the opening text describing the Gemma 4 12B Unified model's native text, audio, image and video input with no separate encoders (captured September 7, 2026).

Twierdzenie o rankingu i klasa rozmiarowa, której nie obejmuje.

Nagłówek ModelBest dotyczący MiniCPM5-2B to Artificial Analysis Intelligence Index wynoszący 17 — w momencie premiery pierwszy wśród modeli poniżej 4 mld parametrów. Obok trzeba postawić dwa zastrzeżenia. Wynik odzwierciedla snapshot v4.1 serwisu AA i nie jest wprost porównywalny z wartościami indeksu z wcześniejszych snapshotów; to także wartość z chwili premiery, którą producent podał, zanim powstał jakikolwiek niezależny powtórzony pomiar. Uczciwy odczyt jest węższy, ale wciąż imponujący: w dniu premiery, według ówczesnej metodologii AA, ten model o 2,5 mld parametrów prowadził w całej swojej klasie wielkości. Gemma 4 12B nie występuje w tej klasie, a na dzisiejszych stronach Artificial Analysis osiąga wyższy indeks — około 22 dla wariantu reasoning i 13 dla modelu instruct bez reasoning, przy czym oba wyniki to „well above average” w ich grupie porównawczej. Indeksów z różnych snapshotów nie da się czysto zestawić, więc traktuj to jako kierunek, a nie precyzję: model ogólny 12B w testach wypada jako model o większych możliwościach, a model 2B jako najbardziej zdolny model w swojej klasie wielkości. To różne twierdzenia i oba mogą być prawdziwe.

Tablica wyników, uczciwie oznaczona

Przeczytaj te wiersze z myślą o źródłach danych — liczby MiniCPM5-2B pochodzą z karty modelu ModelBest, są sprzed tygodnia i nie zostały zweryfikowane; dane Gemma 4 12B są raportowane przez Google i od dawna poddawane testom społeczności:

• Rozmiar — MiniCPM5-2B: 2,52B łącznie / 1,98B poza embeddingiem, gęsty. Gemma 4 12B: 11,95B, gęsty.

• Modalność — MiniCPM5-2B: tylko tekst. Gemma 4 12B: tekst, obraz, audio i wideo na wejściu, bez enkodera.

• Kontekst — MiniCPM5-2B: 131 072 tokeny w domyślnej konfiguracji. Gemma 4 12B: natywnie 256 tys. tokenów (niektóre konfiguracje serwowania ograniczają kontekst do 128 tys.).

• Języki — MiniCPM5-2B: karta i dane skupione na angielskim i chińskim. Gemma 4 12B: 140+ języków.

Wydanie — MiniCPM5-2B: ogłoszony 19 lipca 2026 r.; wagi udostępniono po cichu 6–7 września. Gemma 4 12B: premiera 3 czerwca 2026 r. z pełną ewaluacją premierową.

• Dowody — MiniCPM5-2B: karta producenta plus AA v4.1 (Indeks 17, #1 wśród modeli poniżej 4B); brak jeszcze niezależnych testów. Gemma 4 12B: ewaluacje z premiery, miesiące wdrożeń społecznościowych i ~3,3 mln pobrań miesięcznie.

A comparison scoreboard titled 'MiniCPM5-2B vs Gemma 4 12B — the scoreboard', with left column rows 'Params: 2.52B total · 1.98B non-emb', 'Modality: Text only', 'Context: 128K (config 131,072)', 'Languages: English / Chinese', 'AA Index: 17 — #1 sub-4B at launch', 'Evidence: Vendor card · no independent run', and right column rows 'Params: 11.95B dense', 'Modality: Text + image + audio + video', 'Context: 256K native', 'Languages: 140+', 'AA Index: 22 reasoning · 13 instruct', 'Evidence: Google evals + months of use', with a footer labeling both sides' sourcing.

Powyższa tablica wyników to ten sam portret w sześciu wierszach: oba modele nie zgadzają się co do niemal każdego wymiaru, a kolumny, które decydują o wyborze — modalność, języki, klasa urządzenia — są tymi, których nie oddaje żadna średnia z benchmarków.

Tam, gdzie wygrywa 12B: rzeczy, których tekstowy 2B nie jest w stanie udawać

Zacznijmy od modalności. Gemma 4 12B natywnie przyjmuje audio, obrazy i wideo; MiniCPM5-2B jest tylko tekstowy. Każdy produkt, który transkrybuje, patrzy na ekran lub ogląda wideo, potrzebuje drugiego potoku obok 2B, a w tym momencie przewaga „małego modelu” częściowo znika. Języki to druga ściana: 140+ kontra wydanie skoncentrowane na angielskim/chińskim. Dla produktu obsługującego długi ogon języków, 2B w ogóle nie jest kandydatem. A potem są dowody. Gemma 4 12B została pobrana miliony razy, skwantowana, dostrojona i używana w produkcji przez trzy miesiące; jej tryby awarii są udokumentowane, a jej ekosystem obejmuje llama.cpp, Ollama, LM Studio, MLX, vLLM i SGLang. MiniCPM5-2B to repozytorium sprzed tygodnia, którego główne liczby — w tym prowadzone przez dostawcę 46,4 w SWE-bench Verified, co byłoby niezwykłe jak na gęsty model 2,5B, jeśli przetrwa niezależne testy — nie zostały dotknięte przez nikogo poza laboratorium. Już pod względem dojrzałości wybór nie jest bliski.

Gdzie 2B jest jedyną opcją.

Nic z tego nie ma znaczenia w klasie urządzeń, do której model 12B po prostu się nie mieści. Telefon, płyta inteligentnego kokpitu albo małe urządzenie brzegowe z kilkoma gigabajtami pamięci DRAM nie są w stanie przesunąć wag modelu 11,95B przez szynę pamięci z użyteczną prędkością — to jest dokładnie to wąskie gardło, które by go udusiło. MiniCPM5-2B powstał właśnie dla tego świata: wagi mieszczące się w pamięci urządzenia, okno 128K dla długich sesji agentów, natywne wywoływanie narzędzi zaprojektowane do pracy interaktywnej oraz adaptacja day-zero w dziewięciu rodzinach układów plus ARM. Jeśli Twoim celem jest NPU klasy telefonu albo płyta wbudowana, Gemma 4 12B nie konkuruje z MiniCPM5-2B — tam w ogóle nie da się jej wdrożyć. A jeśli Twoje urządzenie udźwignie 12B, ale tylko ledwo — laptop z 16 GB — to model 2B daje Ci zapas: mniejsze opóźnienie na token, niższy pobór mocy i możliwość uruchomienia drugiego modelu w tym samym obszarze pamięci.

Jak ustalić, które roszczenia przetrwają

Ponieważ oba modele mają otwarte wagi i można je hostować samodzielnie, uczciwym kolejnym krokiem jest pomiar na własnym sprzęcie, a nie kolejna lektura specyfikacji. Jeśli porównujesz MiniCPM5-2B z Gemmą 4 12B przy obciążeniu, które już obsługujesz, to właśnie tu warstwa routingu pokazuje swoją wartość: skierowanie ścieżki testowej na nowy, samodzielnie hostowany checkpoint przez jedno API z automatycznym przełączaniem awaryjnym sprawia, że niezweryfikowany stos może się zawiesić lub zapętlić bez wyłączania produkcji, a ceny katalogowe dostawców dla porównywanych modeli przechodzą dalej z marżą 0%. Sam model to zaledwie jednodniowe repozytorium, więc domyślnie trzeba traktować go jak eksperyment — ale ten eksperyment jest tani do uruchomienia, a dwie godziny potrzebne do odtworzenia SWE-bench lub fragmentu własnego zestawu ewaluacyjnego na modelu 2B to dokładnie ten dowód, jakiego brakuje temu zestawieniu.

Werdykt

{{1}}Wybierz model Gemma 4 12B, gdy Twój sprzęt ma odpowiedni zapas wydajności, a Twoje obciążenie nie ogranicza się do samego tekstu — produkt multimodalny, wielojęzyczna publiczność albo cokolwiek, w czym trzy miesiące sprawdzonego przez społeczność działania znaczą więcej niż tytuł lidera w rankingach.{{/1}} {{2}}Wybierz model MiniCPM5-2B, gdy Twoje urządzenie w ogóle nie udźwignie modelu 12B albo gdy działający na chipie klasy smartfonowej model 2.5B, obsługujący tekst i zorientowany na agentów, pozwoliłby Ci wypuścić produkt, który przy większym modelu jest niemożliwy.{{/2}} {{3}}Lider rankingów wśród modeli poniżej 4B to prawdziwe osiągnięcie, a wydanie go z otwartymi wagami sprawia, że można go przetestować już dziś; tyle że na podstawie dostępnych dowodów nie jest on zamiennikiem uniwersalnego modelu 12B tam, gdzie model 12B faktycznie może działać.{{/3}}