
MiniCPM5-2B kontra Granite 4.2 3B: Specjalista od rozumowania 3B kontra nowy stos agentów 2.5B
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest umieściło Granite 4.2 3B na tablicy wyników MiniCPM5-2B, zanim ktokolwiek o to poprosił. Karta modelu MiniCPM5-2B opublikowana przez OpenBMB, gdy wagi po cichu trafiły na Hugging Face, wymienia najmniejszy model rozumujący IBM wśród swoich baz porównawczych – a w tym zestawie MiniCPM5-2B osiąga średnio 53,9, podczas gdy Granite 4.2 3B notuje 42,7. To jedyna liczba bezpośredniego porównania tej pary, jaką opublikował którykolwiek z producentów, przez co naturalnie wypada od niej zacząć – i równie naturalnie zachować ostrożność. Oba modele to małe wydania open-weights na licencji Apache-2.0, przeznaczone do samodzielnego hostowania i celujące w to samo zadanie z końca 2026 roku; podchodzą do niego jednak z przeciwnych stron – jeden wyszkolony do rozumowania, drugi do działania.
Te dwie premiery mają ze sobą więcej wspólnego, niż sugerowałby marketing ich producentów. MiniCPM5-2B został zaprezentowany na Światowej Konferencji Sztucznej Inteligencji 19 lipca jako flagowy model on-device od ModelBest i OpenBMB — gęsty model klasy 2B, pozycjonowany jako baza dla agentów na telefony, komputery PC i inteligentne kokpity — a jego wagi pojawiły się 6 i 7 września bez wydarzenia premierowego, na licencji Apache-2.0, wraz z checkpointami GGUF, MLX, GPTQ, base, SFT i draft oraz danymi treningowymi, które za nimi stoją. Granite 4.2 3B to zaprojektowany przez IBM model rozumujący w rozmiarze laptopa, którego wagi trafiły do Hugging Face na początku sierpnia, a karta modelu i wpis techniczny ukazały się 25 sierpnia. Żaden z nich nie został jeszcze poddany niezależnemu benchmarkowi, dlatego poniższe etykiety źródeł mają większe znaczenie niż cyfry.
Dwa wydania, które się rymują
Granite 4.2 3B to samodzielny, gęsty model rozumowania, dotrenowany z bazy Granite-4.1-3B-Base. Ma 40 warstw z grupowaną uwagą (grouped-query attention), natywne okno kontekstu 128K, które IBM rozszerza do 512K w piątej fazie pretrenowania, oraz trzy tryby myślenia na zapytanie — domyślnie pełne myślenie, tryb niskiego wysiłku i ścieżkę bez myślenia. Jego karta modelu mówi wprost, czym nie jest: w przeciwieństwie do siostrzanych modeli Granite 4.2 8B i 30B, wersja 3B celowo pominęła wyspecjalizowany blok agentowego uczenia przez wzmacnianie, trenowany w środowiskach SWE-agent, terminala i wyszukiwania, dlatego IBM nie podaje wyniku SWE-bench i przedstawia model jako specjalistę od rozumowania, a nie agenta. Model jest udostępniany przez vLLM, SGLang, Transformers, GGUF i Ollamę (granite4.2:3b), zajmuje około 6–8 GB w bfloat16 lub poniżej 2 GB w wersji skwantowanej i nie ma hostowanego API. Jego kluczowe wyniki — AIME 2025: 78.33, GPQA: 54.80, LiveCodeBench v6: 69.71, MMLU-Pro: 67.84 — pochodzą od IBM i według stanu na dziś nie zostały niezależnie zreprodukowane.

MiniCPM5-2B to zamiast tego gotowy model zorientowany na agenta. Karta opisuje gęsty transformer o łącznej liczbie 2,52 mld parametrów (1,98 mld poza embeddingami), 42 warstwach przy ukrytym rozmiarze 2048, uwagę grupowaną (grouped-query attention) z 16 głowicami zapytań i dwiema głowicami KV oraz standardową architekturę LlamaForCausalLM bez niestandardowych jąder. Materiały z premiery podkreślały możliwości agentowe — trenowanie pośrednie agenta w skali 200 mld, duży zbiór agentowego SFT oraz dopasowanie przez RL agenta, zwieńczone destylacją On-Policy Distillation, która scala szesnaście eksperckich modeli RL z powrotem w jedną małą, gęstą sieć — a także natywną obsługę długiego kontekstu i hybrydowe tryby odpowiedzi: szybki i rozważny. Dostarczona konfiguracja ustawia okno kontekstu na 131 072 tokenów (materiały z lipca reklamowały 512K; opublikowana konfiguracja tego nie zawiera), a karta deklaruje obsługę wywołań narzędzi w stylu XML z wbudowanym parserem SGLang. We własnej tabeli ewaluacyjnej model raportuje wewnętrzną średnią 53,9 w wybranym przez dostawcę zestawie porównawczym, wynik AIME 2025/2026 na poziomie 86,5, MATH-500 94,6 oraz 46,4 w SWE-bench Verified mierzonym przez dostawcę — co byłoby niezwykłe jak na gęsty model o 2,5 mld parametrów, jeśli przetrwa niezależne testy.

Bezpośrednie porównanie, które ktoś już wydrukował.
Ponieważ tablice wyników różnych dostawców to w większości porównanie jabłek do pomarańczy, najbardziej użytecznym elementem w tym zestawieniu jest ten, który opublikowało samo ModelBest: karta MiniCPM5-2B wymienia granite-4.2-3B wśród swoich modeli referencyjnych i podaje, że MiniCPM5-2B osiąga w tym zestawie średnio 53,9 wobec 42,7 Granite'a. Odczytaj to dokładnie tak, jakim jest — jeden dostawca uruchamia oba modele na wybranym przez siebie zestawie testów, bez niezależnego powtórzenia wyników, mając wszelkie powody, by to jego własny model wypadł najlepiej. To nie jest werdykt. To, czego się z tego dowiadujesz, to że ModelBest był na tyle pewny siebie, by umieścić na swojej karcie model 3B konkurenta, a deklarowana przez niego przewaga jest największa dokładnie tam, gdzie poszły jego własne inwestycje treningowe: w wierszach dotyczących zadań agentowych i długiego kontekstu. Traktuj to jako wskazówkę kierunkową i rozważ własne deklaracje z karty IBM, zanim cokolwiek na tej podstawie przesądzisz.
Tablica wyników, uczciwie oznaczona
• Wydanie — MiniCPM5-2B: ogłoszono 19 lipca 2026 r.; wagi udostępniono 6–7 września, po cichu. Granite 4.2 3B: wagi na początku sierpnia; karta modelu i blog techniczny 25 sierpnia 2026 r.
• Rola — MiniCPM5-2B: agent na urządzeniu i nacisk na użycie narzędzi, według ModelBest. Granite 4.2 3B: specjalista od rozumowania, celowo nieagentowy według IBM.
• Rozmiar — MiniCPM5-2B: 2,52B łącznie / 1,98B poza embeddingami, 42 warstwy. Granite 4.2 3B: ~3B dense, 40 warstw.
• Kontekst — MiniCPM5-2B: 131 072 tokenów w domyślnej konfiguracji. Granite 4.2 3B: natywny kontekst 128K, z możliwością rozszerzenia do 512K.
• Trening końcowy — MiniCPM5-2B: SFT do głębokiego myślenia, wyspecjalizowane RL, destylacja on-policy. Granite 4.2 3B: SFT do rozumowania, GRPO RL i RLHF; bez bloku agentowego RL.
• Dowody — MiniCPM5-2B: twierdzenia z karty ModelBest, brak niezależnego uruchomienia. Granite 4.2 3B: twierdzenia z karty IBM, niezreplikowane; AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71.

Tablica wyników powyżej ma to samo źródło danych co tekst główny: każda liczba na niej pochodzi od dostawcy, a jedynym porównaniem w obrębie tego samego zestawu, jakie opublikował którykolwiek z dostawców, jest to na karcie samego ModelBest.
Specjalista od rozumowania a stack agentowy
Zanim przejdziemy do wyników, zdecyduj, jakiego rodzaju małego modelu wymaga Twoje zadanie, ponieważ te dwa modele odpowiadają na różne pytania. Granite 4.2 3B został zbudowany z myślą o rozumowaniu i długim kontekście na sprzęcie o ograniczonych zasobach: natywne okno kontekstu 128K rozszerzalne do 512K, trzy tryby myślenia, rozmiar, który mieści się na laptopie, i wyraźna decyzja o pominięciu treningu agentowego. Jeśli Twoje zadanie to analiza długich dokumentów, kontekst na skalę repozytorium albo niezawodne wieloetapowe rozumowanie na niewielkiej maszynie, to jest to spójne dopasowanie, a decyzja IBM, by nie przypisywać modelowi 3B właściwości agentowych, to powód, by zaufać karcie tego modelu, a nie luka w niej. MiniCPM5-2B został natomiast zbudowany pod kątem czegoś odwrotnego: zachowań agentowych i korzystania z narzędzi na urządzeniu – jego potok treningowy przypomina listę rzeczy, które Granite 4.2 3B celowo pominął. Jeśli Twoim zadaniem jest pętla agenta na urządzeniu, która wywołuje narzędzia, prowadzi długie rozmowy i przełącza się między szybkimi a rozważnymi odpowiedziami, to jest to właśnie ten stos technologiczny dla Ciebie – a wiąże się z nim dodatkowa niepewność w postaci tygodniowego checkpointu z niezweryfikowaną kartą.
Dane, które OpenBMB udostępnił, a IBM nie
Najmniej efektowna różnica to ta, która ma największe znaczenie dla zespołów chcących dostrajać modele. OpenBMB udostępniło korpusy treningowe modelu MiniCPM5-2B wraz z wagami — rodzinę UltraData, obejmującą Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math oraz agentowe zestawy SFT i RL — wszystko na licencji Apache-2.0. Dzięki temu model 2B z czarnej skrzynki staje się reprodukowalnym przepisem: możesz zobaczyć, na czym oparto agentowy post-training, i kontynuować go we własnej domenie. IBM opublikowało w open source wagi modelu Granite 4.2 3B i przedstawiło szczegółowy opis techniczny procesu jego budowy, ale nie dane treningowe. Dla organizacji, która chce posiadać model, a nie wynajmować go, ta asymetria ma realne znaczenie. Z kolei MiniCPM5-2B oferuje historię wdrożeniową, której Granite nie dorównuje przy tej wielkości modelu: adaptację od pierwszego dnia na dziewięciu rodzinach układów dzięki społeczności FlagOS firmy ModelBest — od Huawei Ascend, przez NVIDIA, po szeroki wachlarz chińskich akceleratorów, a także ARM — co jest sygnałem, że ModelBest spodziewa się, iż model 2B będzie działać gdzieś indziej niż na GPU NVIDIA.
Rzeczywistość routingu
Żaden z tych modeli nie znajduje się dziś w katalogu hostowanym, więc to porównanie dotyczy środowiska self-hosted — ale właśnie tam warstwa routingu nadal ma sens jako siatka bezpieczeństwa, a nie mechanizm dostarczania. Gdy zespół chce przetestować tygodniowy model agentowy 2B przeciwko rozumującemu modelowi 3B na obciążeniu, które już obsługuje, odwracalnym posunięciem jest skierowanie ścieżki testowej do samodzielnie hostowanej kompilacji MiniCPM5-2B przez jedno API z automatycznym przełączaniem awaryjnym, podczas gdy produkcja pozostaje na sprawdzonym modelu — nowy stos może się zatrzymać bez wyłączania niczego, a ceny katalogowe dostawcy hostowanych modeli, z którymi porównujesz, są przekazywane dalej z zerową marżą, więc test A/B pozostaje tani. Warstwa nie hostuje żadnego z tych modeli; sprawia, że eksperyment jest bezpieczny do przeprowadzenia i łatwy do odwrócenia.
Który mały model faktycznie powinieneś uruchomić
Uruchom Granite 4.2 3B, jeśli twoje zadania to rozumowanie na długim kontekście na laptopie i chcesz trzy tryby myślenia, limit 512K oraz uczciwą kartę modelu, która dokładnie mówi, do czego model 3B nie został wytrenowany. Uruchom MiniCPM5-2B, jeśli twoje zadania to interaktywny agent działający na urządzeniu i wywołujący narzędzia, w którym model 2.5B mieści się w twoim budżecie pamięci — ale zarezerwuj czas na odtworzenie jego flagowych wyników, zanim mu zaufasz, bo średnia 53.9 i wynik 46.4 na SWE-bench to na razie wyłącznie deklaracje producenta. Dwie rzeczy rozstrzygną ten pojedynek szybciej niż jakakolwiek opinia: niezależne uruchomienie MiniCPM5-2B, które potwierdzi albo obali twierdzenia o zdolnościach agentowych, oraz to, czy wyniki IBM dotyczące rozumowania przetrwają próbę reprodukcji przez społeczność. Dopóki żadna z nich nie nadejdzie, Granite 4.2 3B jest dziś bezpieczniejszym, lepiej udokumentowanym małym modelem, a MiniCPM5-2B — bardziej interesującym zakładem.
