
MiniCPM5-2B — wagi już dostępne: mały model, który zdobył koronę w kategorii sub-4B, trafia do open-source
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0455Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0247Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0157Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2646Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1541Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0547Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencja49Kod
Sam model ma siedem tygodni. MiniCPM5-2B został zaprezentowany 19 lipca podczas World Artificial Intelligence Conference 2026, gdzie ModelBest i OpenBMB okrzyknęły go najlepiej ocenianym modelem poniżej 4B parametrów w rankingu Artificial Analysis i obiecały, że wagi zostaną udostępnione „w niedalekiej przyszłości”. W ten weekend okazało się, że ta niedaleka przyszłość nadeszła bez żadnej premiery: repozytorium MiniCPM5-2B pojawiło się na Hugging Face 6 września, a dziennik zmian OpenBMB datuje wydanie na 7 września, na licencji Apache-2.0, z pełnym pakietem — wagami BF16, kwantyzacjami GGUF, MLX i GPTQ, punktami kontrolnymi base i SFT, modelem DSpark do dekodowania spekulacyjnego oraz zestawami danych treningowych.
Nie towarzyszył mu żaden komunikat prasowy ani wydarzenie premierowe. Po prostu się pojawił: pewnego dnia repozytorium na Hugging Face, następnego wpis w changelogu. To czyni z tego tekst w duchu „co wiemy na razie” — z jedną wczesną aktualizacją. Repozytorium mówi nam bardzo wiele: model jest realnie do pobrania i uruchomienia już dziś, a arkusz specyfikacji jest publiczny. Poza tym pojawił się już zewnętrzny wynik: Artificial Analysis umieszcza MiniCPM5-2B w swoim Intelligence Index v4.2 na poziomie 15, co jest najlepszym wynikiem wśród otwartych wag poniżej 4B parametrów łącznych w tym indeksie, więc ranking modeli sub-4B nie opiera się już wyłącznie na słowach producenta. Wciąż niepotwierdzone pozostają główne liczby z karty modelu, które OpenBMB odtworzyło we własnym środowisku testowym, a nikt spoza laboratorium ich nie powtórzył. Oto, co można wyczytać z repozytorium, co zostało już niezależnie zmierzone, a co wciąż wymaga weryfikacji, zanim zbudujesz na tym coś własnego.
Co właśnie się stało?
MiniCPM5-2B to drugi model z serii MiniCPM5, następujący po MiniCPM5-1B, który OpenBMB udostępnił jako open source 19 maja. Gdy 2B trafił na rynek jako produkt na WAIC, historia była opowieścią o układach scalonych w równym stopniu, co o modelu — ModelBest przedstawił go jako bazę dla agentów działających na urządzeniu dla telefonów, komputerów PC i inteligentnych kokpitów, i wymienił dziewięć układów z obsługą od pierwszego dnia dzięki społeczności FlagOS, od Huawei Ascend, przez NVIDIA, po szeroką gamę rodzimych akceleratorów. Udostępnienie open source zapowiadano jako nieuchronne. Minęło siedem tygodni.
6 września pojawiło się repozytorium openbmb/MiniCPM5-2B. W chwili pisania tych słów karta modelu jest zapowiedzią wydania i jest niezwykle kompletna jak na tak ciche udostępnienie:
• Wagi — finalny checkpoint po treningu RL + OPD w BF16, na licencji Apache-2.0 i bez ograniczeń — każdy może go pobrać.
• Checkpointy towarzyszące — MiniCPM5-2B-SFT, -Midtrain i -Base dla osób, które chcą model sprzed etapu RL/OPD, plus -GGUF, -MLX, -GPTQ oraz model draft -DSpark, wszystkie wymienione w kolekcji MiniCPM5 na Hugging Face.
• Dane — korpusy treningowe również są otwarte, opublikowane w ramach rodziny UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 oraz UltraData-RL-2609.
• Lustra — README wskazuje zarówno na Hugging Face, jak i ModelScope.
Jedna linia w karcie jest ważniejsza, niż się wydaje: „brak niestandardowych jąder, brak forków kodu modelu”. MiniCPM5-2B wykorzystuje standardową architekturę LlamaForCausalLM, więc każdy silnik, który już obsługuje modele z rodziny Llama, może go wczytać bez czekania na dedykowaną implementację.
Dlaczego model 2.5B zasługuje na drugie spojrzenie
Prezentacja na WAIC dotyczyła rankingów. ModelBest poinformował, że MiniCPM5-2B uzyskał w Artificial Analysis Intelligence Index wynik 17, co uplasowało go na pierwszym miejscu wśród modeli o liczbie parametrów poniżej 4B na liście rankingowej AA w chwili premiery. Przy tej liczbie należy dodać dwa zastrzeżenia. Po pierwsze, wyniki wskaźnika są porównywalne tylko w obrębie jednej wersji metodologii: wcześniejsze 17,9 dla MiniCPM5-1B pochodziło z poprzedniej migawki AA, więc nie stanowi dowodu, że mniejszy model „osiąga wyższe wyniki”, a zgodnie z tą samą zasadą nowszy wynik w nowszej metodologii nie jest regresją. Po drugie, wyniki AA trafiają do karty modelu, ale główna średnia w karcie to własna średnia OpenBMB, odtworzona we własnym środowisku pomiarowym OpenBMB. To rozróżnienie ma znaczenie, ponieważ AA przeszło od tego czasu na nowszą metodologię i opublikowało nowy wynik — pierwszą zewnętrzną weryfikację tej prezentacji od czasu wydania otwartych wag.
Zewnętrzna liczba pojawiła się w tym samym tygodniu co wagi. 4 września Artificial Analysis opublikowało Intelligence Index v4.2, rewizję metodologii, która zwiększa wagę prywatnych, zastrzeżonych testów do 40% i dodaje dwa nowe komponenty — AA-Briefcase, ocenę agentową, oraz GDP.pdf firmy Surge, zadanie wnioskowania o dokumentach w długim kontekście. Wpis indeksu AA dla MiniCPM5-2B ma teraz wynik v4.2 równy 15: najlepszy rezultat wśród modeli o otwartych wagach poniżej 4B parametrów łącznie i pierwszy z 47 otwartych modeli w tej klasie wielkości na liście AA. To utrzymuje model w miejscu, w którym umieściła go lipcowa zapowiedź, tym razem na metodologii trudniejszej do oszukania i z wagami, które każdy może pobrać i ponownie sprawdzić. Wynik 15 nie jest porównywalny z premierowym 17, które pochodziło z v4.1 — metodologia jest bardziej rygorystyczna, a nie model słabszy — a wynik złożony nie weryfikuje ponownie poszczególnych wierszy karty, z których większość OpenBMB odtworzyło we własnym środowisku testowym. To, co faktycznie robi, to trafia na dwie osie, pod które OpenBMB mówi, że model był optymalizowany: v4.2 kładzie większy nacisk na zadania agentowe, a śledzenie zwięzłości wypowiedzi AA pokazuje, że MiniCPM5-2B generuje 57 mln tokenów wyjściowych w zadaniach indeksu, będąc najbardziej zwięzłym modelem w swojej klasie wobec mediany 72 mln. OpenBMB podziękowało AA za przebieg testów i ujęło to dokładnie w tych kategoriach — wydajność agentowa i efektywność tokenowa przy 2.6B, jak stwierdzono, to cechy, pod które model był optymalizowany.
Zasadniczym twierdzeniem była zdolność agencyjna w małym pakiecie: natywne wywoływanie narzędzi, głębokie wyszukiwanie i generowanie kodu — trenowane od podstaw, a nie dosztukowane na końcu. Karta modelu opisuje trójstopniowy pipeline: trening bazowy, trening pośredni, a następnie post-training, na który składają się: SFT na 400 mld tokenów danych głębokiego myślenia, wyspecjalizowani nauczyciele RL oraz destylacja On-Policy (OPD), która scala szesnaście eksperckich modeli RL — pięć z nich agencyjnych — z powrotem w jedną małą, gęstą sieć. OpenBMB przypisuje etapowi RL + OPD średni wzrost o 10,96 punktu w zadaniach rozumowania i ogólnych oraz o 6,96 punktu w zadaniach agencyjnych — to wewnętrzne delty, ale wyjaśniają one nietypowy kształt tego modelu: sieć o 2,5 mld parametrów zbudowana jak model rozumowania i ukierunkowana na korzystanie z narzędzi.

Co tak naprawdę zawiera repozytorium
Specyfikacja jest jednoznaczna, ponieważ sama jest plikiem konfiguracyjnym. MiniCPM5-2B ma 2 516 756 480 parametrów, z czego 1 981 982 720 to parametry inne niż osadzenia (non-embedding) — producenci podają wartość bez osadzeń, gdy mówią o „klasie 2B”. To gęsty transformer z 42 warstwami o ukrytym rozmiarze 2048, uwagą grupowaną (grouped-query attention) z 16 głowami zapytań i zaledwie 2 głowami klucz-wartość, słownikiem obejmującym 130 560 tokenów oraz tensorami BF16. Całość jest dostarczana jako pojedynczy plik safetensors — na tyle mały, że można go pobrać na łączu laptopa i uruchomić na jednej średniej klasy karcie GPU lub na procesorze NPU klasy telefonu.
• Parametry — 2 516 756 480 łącznie; 1 981 982 720 poza embeddingami.
• Architektura — gęsty model LlamaForCausalLM, 42 warstwy, ukryty wymiar 2048, GQA 16 głów zapytań / 2 głowy KV, rozmiar słownika 130 560.
• Kontekst — skonfigurowano 131 072 tokenów (max_position_embeddings), bez skalowania RoPE w konfiguracji.
• Licencja — Apache-2.0, zarówno dla modelu, jak i opublikowanych danych treningowych.
• Format — BF16; wersje GGUF, MLX i GPTQ publikowane osobno.

Jedna liczba z lipcowej talii nie pojawia się w checkpointcie. Materiały WAIC chwaliły się oknem kontekstowym 512K tokenów; wydana konfiguracja ustawia `max_position_embeddings` na 131 072 (128K) bez wpisu `rope_scaling`. Możliwe, że liczba 512K ma zostać osiągnięta poprzez rozszerzenie w czasie wnioskowania, tak jak kilka małych modeli rozciąga swój kontekst — ale w dostarczonej wersji repozytorium dokumentuje 131 072 i to tę liczbę należy przyjąć jako bazę projektową, dopóki OpenBMB nie opublikuje przepisu na rozszerzenie.
Liczby, posortowane według tego, kto je zmierzył
Karta modelu przywiązuje dużą wagę do pochodzenia wyników, a przypisy zdecydowanie warto przeczytać. Wyniki oznaczone w niej krzyżykiem „pochodzą z oficjalnego wydania Artificial Analysis” — chodzi o wiersze takie jak GPQA-Diamond 70,2, HLE 8,9, AA-LCR 59,0, Terminal-Bench v2.1 8,6 oraz GDPval-AA v2 19,6. Cała reszta została opisana jako „odtworzona wewnętrznie”, co oznacza, że OpenBMB przeprowadziło te ewaluacje we własnym środowisku. Ta kategoria obejmuje przykuwające uwagę wyniki: wewnętrzną średnią 53,9 w zestawie porównawczym karty, AIME 2025/2026 — 86,5, MATH-500 — 94,6, LiveCodeBench v6 — 69,1, SWE-bench Verified — 46,4, BFCL v4 — 66,6, τ²-Bench Telecom — 97,1, GAIA (Text-103) — 88,7 oraz MMLU-Pro — 70,8.
Trzy rzeczy składają się na wiarygodność tych liczb. Średnia 53.9 jest wynikiem względnym, a nie bezwzględnym — karta normalizuje każdą oś radaru tak, aby najlepszy model w porównaniu osiągał 100. Zestaw porównawczy jest wybierany przez producenta: inne otwarte modele z zakresu 2B-4B, w tym Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B oraz LFM2.5-8B-A1B. W tym zestawie karta pokazuje, że MiniCPM5-2B wyraźnie dystansuje kolejnego najlepszego — Qwen3.5-4B z wynikiem 51.1 — co jest naprawdę uderzającym rezultatem jak na model o połowę mniejszy, i dokładnie takim, który wymaga niezależnej reprodukcji, zanim ktokolwiek na nim coś zbuduje. A kilka pojedynczych wierszy trudno pogodzić z marketingiem: wynik 46.4 w SWE-bench Verified dla gęstego modelu o wielkości 2.5B byłby niezwykły, gdyby udało się go zreprodukować, podczas gdy wynik HLE na poziomie 8.9 przypomina, że „lider kategorii poniżej 4B” i „frontier” to zupełnie różne ligi. Nic z tego nie jest sprzeczne z repozytorium, a zbiorczy wskaźnik AA w wersji v4.2 potwierdził od tego czasu ogólną pozycję modelu na szczycie klasy modeli o otwartych wagach poniżej 4B — ale te konkretne wiersze pochodzą od samego OpenBMB i nadal nie zostały zweryfikowane przez nikogo spoza laboratorium.
Dziś uruchamiam MiniCPM5-2B
Ze względu na standardową architekturę Llama, popularne silniki wczytują model bezpośrednio. README OpenBMB zawiera przewodniki szybkiego startu dla vLLM (0.21 lub nowszy), SGLang (0.5.16 lub nowszy) i Transformers (5.6 lub nowszy), z zalecanym próbkowaniem przy temperaturze 1.0 i top-p 0.95 oraz z włączoną opcją enable_thinking, gdy potrzebny jest przebieg rozumowania. Wersje GGUF i MLX obejmują llama.cpp, Ollama, LM Studio i Apple Silicon; karta modelu wymienia również środowisko uruchomieniowe ArcLight i typowe stosy do fine-tuningu (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).
Zanim zaczniesz, warto poznać dwa szczegóły wdrożenia. W przypadku wywoływania narzędzi i funkcji zalecanym backendem jest SGLang: model generuje wywołania narzędzi w formacie XML, a wbudowany w SGLang parser minicpm5 natywnie konwertuje je na wywołania tool_calls zgodne z OpenAI, co oznacza, że standardowe klienty wywoływania narzędzi działają bez żadnego niestandardowego shima. Model szkicowy DSpark istnieje natomiast po to, aby obniżyć koszt przebiegu rozumowania: uruchamiany w SGLang z algorytmem spekulacyjnego dekodowania DSPARK przyspiesza dekodowanie, nie zmieniając wyników modelu docelowego — a to właśnie decyduje o tym, czy pętla agenta z kontekstem 128K na laptopie jest użyteczna, czy tylko możliwa.

Jeśli wolisz ocenić partię małych otwartych modeli, zamiast ręcznie dopracowywać jeden z nich, warstwa routingu właśnie tu pokazuje swoją wartość: gdy dostawca ma w ofercie MiniCPM5-2B, router to tani sposób, by porównać go metodą A/B z Qwen3.5-2B i innymi otwartymi punktami kontrolnymi poniżej 4B w tym samym zadaniu, bez potrzeby drugiej integracji. W OrcaRouter oznacza to jedno API obejmujące ponad 200 modeli, ceny z cennika dostawcy przepuszczane dalej z zerową marżą oraz automatyczne przełączanie awaryjne, gdy nowy punkt kontrolny się zaciina lub zapętla na ścieżce produkcyjnej. Repozytorium ma zaledwie dwa dni i żadne hostowane API, które moglibyśmy wskazać, nie ma jeszcze MiniCPM5-2B w ofercie — dlatego uczciwą domyślną opcją na dziś jest potraktowanie go jako eksperymentu self-hostowanego, a nie zależności.
Kto powinien ciągnąć te ciężary?
Ściągnij je dziś, jeśli Twoja praca dotyczy agentów działających na urządzeniu, wywoływania narzędzi na brzegu sieci lub eksperymentów z kodowaniem i rozumowaniem na małych modelach, a chcesz mieć na stole najbardziej agresywnie trenowaną opcję z klasy 2B. Licencja Apache-2.0 i otwarte dane treningowe usuwają dwa powody wahania większości zespołów przed małym modelem z chińskiego laboratorium — brak ograniczeń komercyjnych i brak korpusu czarnej skrzynki. Ściągnij je z ostrożnością, jeśli wybierasz model produkcyjny na podstawie samej tabeli benchmarków: nagłówkowe wiersze karty to własne reprodukcje OpenBMB, a zbiorczy wynik AA v4.2 — jak dotąd jedyny pomiar zewnętrzny — ich nie potwierdza. Model 2.5B, który według doniesień przewyższa Qwen3.5-4B, to twierdzenie warte dwóch godzin, które zajmie ci samodzielne odtworzenie SWE-bench.
Na co zwracać uwagę dalej. Repozytorium ma zaledwie dwa dni, więc krótkoterminowe sygnały są wciąż mechaniczne: czy llama.cpp i biblioteka Ollama podchwycą plik GGUF, czy mirror ModelScope i buildy chipów FlagOS wystartują bez zakłóceń, oraz czy któreś hostowane API umieści MiniCPM5-2B w swojej ofercie — to będzie moment, w którym model przestaje być dostępny wyłącznie do samodzielnego hostowania. Istotny sygnał merytoryczny, którego brak wskazał ten tekst — niezależna ewaluacja przeprowadzona przez Artificial Analysis lub laboratorium uniwersyteckie — właśnie nadszedł w postaci wyniku indeksu v4.2. Wynik ten utrzymuje MiniCPM5-2B na pierwszym miejscu wśród modeli o otwartych wagach poniżej 4B. Nadal brakuje weryfikacji na poziomie wierszy: nikt poza OpenBMB nie odtworzył wewnętrznych liczb z karty modelu, przede wszystkim wyniku 46,4 w SWE-bench Verified i wewnętrznej średniej 53,9. Dopóki te konkretne wiersze nie zostaną ponownie uruchomione, traktuj MiniCPM5-2B tak, jak potraktowałbyś każdy model wypuszczony po cichu z imponującą kartą: jako bardzo obiecującą hipotezę, którą możesz uruchomić lokalnie jeszcze dziś wieczorem, oraz jako model, którego najbardziej uderzające liczby powinieneś zweryfikować, zanim powierzysz mu realną pracę.
