Wygenerowana główna karta tytułowa dla MiniCPM5-2B-DSpark z podtytułem „OpenBMB po cichu udostępniło wagi MiniCPM5-2B — i wypuściło mały model draftowy, aby przyspieszyć jego działanie” przedstawia telefon i laptop — każde z urządzeń wyświetla zaokrąglony chip „2B”. Mniejszy chip „Draft 0.3B” wprowadza do większego chipu siedem tokenów w postaci skierowanych do przodu strzałek. Na grafice widnieją też wskaźnik prędkości ze wskazówką skierowaną ku górze oraz ikona wyciszonego dzwonka, a w prawym dolnym rogu wkomponowano logo OrcaRouter.
Guides & Insights

MiniCPM5-2B-DSpark: OpenBMB po cichu udostępnia wagi MiniCPM5-2B z modelem wstępnym zaprojektowanym pod kątem szybkości

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Sześć tygodni temu MiniCPM5-2B był obietnicą. 19 lipca 2026 r. zaprezentowano go na konferencji WAIC w Szanghaju jako model sub-4B, który zajmował pierwsze miejsce w Artificial Analysis Index; w mapie drogowej zapowiedziano wtedy, że otwarte wagi pojawią się „wkrótce”. To „wkrótce” nadeszło w tym tygodniu — bez żadnych fanfar. 6 września 2026 r. OpenBMB wgrało na Hugging Face flagowe repozytorium MiniCPM5-2B na licencji Apache-2.0, a dwadzieścia jeden minut później — MiniCPM5-2B-DSpark, draft checkpoint o 323,8 mln parametrów, którego jedynym zadaniem jest przyspieszenie dekodowania MiniCPM5-2B w ramach algorytmu DSpark do dekodowania spekulacyjnego. 7 września 2026 r. ukazała się też wersja GPTQ. W chwili pisania tego tekstu nie ma żadnego ogłoszenia, posta o premierze ani wpisu w changelogu; premiera ujawniła się jedynie tym, że na przestrzeni jedenastu dni repozytoria po cichu stawały się publiczne.

To jest artykuł typu „co wiemy do tej pory” i sposób ujęcia ma znaczenie. MiniCPM5-2B-DSpark nie jest samodzielnym chatbotem ani nowym flagowcem — to akcelerator: mały, szybki model, który proponuje tokeny z wyprzedzeniem względem MiniCPM5-2B, a ten weryfikuje je równolegle. Bez swojego celu jest bezużyteczny, a to właśnie ten cel jest powodem, dla którego warto się nim zainteresować. Zapowiedziane przez OpenBMB na lipiec wydanie MiniCPM5-2B z otwartymi wagami jest teraz faktycznie dostępne na Hugging Face, a model-draft dostarczony wraz z nim to mechanizm, który producent zaleca do uruchomienia go z użyteczną prędkością. Wszystko, czemu poniżej nie przypisano wprost źródła, pochodzi bezpośrednio z dwóch kart modeli i ich repozytoriów.

Co wysłano i kiedy

Rodzina 2B została wypuszczona jako kroczący, nieogłoszony drop, z najnowszymi wpisami na początku:

• 2026-08-27 — Pojawiają się MiniCPM5-2B-Base i MiniCPM5-2B-SFT, surowe punkty kontrolne po wstępnym treningu i nadzorowanym dostrajaniu.

• 2026-09-01 — MiniCPM5-2B-Midtrain, etap pośredniego treningu agentowego.

• 2026-09-05 — MiniCPM5-2B-MLX i MiniCPM5-2B-GGUF, formaty Apple-Silicon i llama.cpp.

• 2026-09-06 — flagowe repozytorium MiniCPM5-2B, a dwadzieścia jeden minut później MiniCPM5-2B-DSpark.

• 2026-09-07 — MiniCPM5-2B-GPTQ, skwantowany format serwowania.

Wszystkie niosą licencję Apache-2.0, którą ModelBest zastosował dla rodziny MiniCPM5-1B już w maju, a wcześniejsze punkty kontrolne w sekwencji wciąż wykazują praktycznie zerowy sygnał społeczności — po kilka pobrań i polubień na każdy. To oznaka trwającego publikowania wag, a nie skoordynowanej premiery: artefakty pojawiają się w kolejności zależności (najpierw wersja bazowa i SFT, na końcu formaty skwantowane i draft), a żaden pojedynczy dzień nie pełni roli daty wydania.

Czym MiniCPM5-2B-DSpark naprawdę jest

Dekodowanie spekulacyjne dzieli generowanie na tani model proponujący i kosztowny weryfikator. Mały model szkicowy zgaduje kolejne kilka tokenów; duży model sprawdza wszystkie zgadywane tokeny w jednym przejściu w przód i akceptuje te, z którymi się zgadza. Gdy szkic jest dobrze skalibrowany, otrzymujemy wynik dużego modelu ułamkiem kosztów, a gdy jest błędny, marnujemy tylko jeden krok weryfikacji. DSpark to konkretna realizacja tego pomysłu, pochodząca z artykułu opublikowanego 2026-07-06 (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). Dwie decyzje projektowe go wyróżniają: łączy równoległy rdzeń proponujący (drafter) z lekkim modułem sekwencyjnym, dzięki czemu tokeny w proponowanym bloku zależą od siebie nawzajem, zamiast tracić na dokładności w kierunku końca bloku, a także dobiera rozmiar każdej weryfikacji per żądanie na podstawie estymat pewności i przepustowości silnika, zamiast zawsze weryfikować blok o stałej długości.

Opublikowany przez OpenBMB model draftowy DSpark to pięciowarstwowy Transformer o 323,8 mln parametrów w BF16 (około 648 MB). Należy do rodziny architektury Q​wen3, ale ma dodatki specyficzne dla DSpark: projektor, który odczytuje ukryte stany modelu MiniCPM5-2B z pięciu warstw modelu docelowego (1, 10, 20, 30 i 39), głowę pewności oraz małą głowę Markowa modelującą rozkład następnego tokena. Jego konfiguracja zakłada blok siedmiu tokenów na jedno przejście w przód. Przy mniej więcej jednej ósmej parametrów modelu MiniCPM5-2B (2,5 mld) jest to jeden z najmniejszych modeli draftowych wydanych dla otwartego checkpointu z głównego nurtu — co jest kluczowe w przypadku modelu zorientowanego na urządzenia brzegowe, gdzie model draftowy musi być na tyle tani, aby uruchomienie dwóch modeli na jednym urządzeniu wciąż było lepsze niż uruchomienie jednego.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, text-generation, edge-ai and custom_code, the linked arxiv papers, the MiniCPM5 target reference, and the opening card line "MiniCPM5-2B-DSpark is a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer."

Powyższe repozytorium to cała publiczna powierzchnia modelu roboczego: plik README, konfiguracja, pojedynczy plik safetensors oraz karta modelu, w której opis treningu wskazuje 1 959 525 sekwencji (7,05 mld tokenów) wygenerowanych przez MiniCPM5-2B na podstawie promptów ogólnych, matematycznych i dotyczących kodu. Model trenowany był przez sześć epok z łączonym celem obejmującym entropię krzyżową (cross-entropy), L1 oraz pewność (confidence). Punkt kontrolny (checkpoint) nie jest natomiast używany samodzielnie jako model generatywny.

Liczby opublikowane przez OpenBMB, uczciwie oznaczone

Karta modelu szkicu podaje jedną liczbę, która ma znaczenie — długość akceptacji, czyli średnią liczbę proponowanych tokenów akceptowanych przez model docelowy z każdego bloku siedmiu tokenów. Ocena została przeprowadzona na wynikach MiniCPM5-2B w trzech domenach, przy maksymalnie 4096 wygenerowanych tokenach:

• Matematyka — średnio 6.05 zaakceptowanych tokenów przy dekodowaniu zachłannym (T=0); 4.61 przy próbkowaniu T=1.0.

• Code — 6.11 dla wariantu zachłannego; 4.44 dla próbkowania.

• Ogólne — 4.16 przy dekodowaniu zachłannym; 3.10 przy próbkowaniu.

• Ogółem — 5.52 dla generowania zachłannego; 4.05 dla generowania z próbkowaniem, na maksymalnie siedem.

Liczby te są raportowane przez producenta (vendor) na karcie modelu i nie zostały niezależnie odtworzone. Opisują one również wskaźnik trafień draftu, a nie przyspieszenie wall-clock: szybkość to metryka serwowania, która zależy od kosztu przebiegu weryfikacji modelu docelowego względem przebiegu propozycji modelu draftowego, od zapełnienia batcha oraz od tego, jak scheduler pewności DSpark przycina długość weryfikacji. OpenBMB nie opublikował dla tej pary wartości tokenów na sekundę. Dla orientacji, gdzie leży sufit tej metody, artykuł DSpark podaje 60–85% szybszą generację na użytkownika przy wyrównanej przepustowości względem linii bazowej MTP-1 w systemie serwowania na żywo Deep​Seek — użyteczny punkt odniesienia dla tego, co algorytm osiągnął gdzie indziej, a nie twierdzenie o MiniCPM5-2B na Twoim sprzęcie.

A generated single-column scoreboard for MiniCPM5-2B-DSpark listing Draft params 323.8M, 5 layers; Draft tokens per forward pass 7; Target model MiniCPM5-2B, 42 layers; Greedy acceptance length 5.52 of 7; Confidence + Markov heads enabled; License Apache-2.0, with the footer "Acceptance figures from OpenBMB's model card; not independently reproduced" and the OrcaRouter logo composited in the bottom-right corner.

Tablica wyników powyżej to arkusz specyfikacji samego wydania. Wartość akceptacyjną należy odczytywać jako orientacyjną skuteczność trafień w trybie draft; mnożnik rzeczywistej przepustowości to wciąż coś, co musi zmierzyć niezależne uruchomienie SGLang.

Model przyspieszany przez szkic.

MiniCPM5-2B to gęsty Transformer o 2,5 mld parametrów — łącznie 2 516 756 480 — z 42 warstwami, 16 głowicami zapytań (query heads) i 2 głowicami KV, słownikiem liczącym 130 560 tokenów oraz oknem kontekstowym o długości 131 072 tokenów, w precyzji BF16 i o rozmiarze około 5 GB. Pod względem architektury jest to model celowo nudny: standardowy LlamaForCausalLM, bez niestandardowych kernele i bez forków kodu modelu — i właśnie dlatego tak łatwo przenosi się go na tak wiele środowisk uruchomieniowych i układów docelowych. W autorskim wewnętrznym zestawie benchmarków OpenBMB karta modelu podaje średnią 53,9 w zadaniach obejmujących rozumowanie, podążanie za instrukcjami, wiedzę, długi kontekst, korzystanie z narzędzi, kodowanie oraz zadania agenta wyszukującego — wyprzedzając w tej samej tabeli Qwen3.5-4B (51,1) i granite-4.2-3B (42,7), przy czym kilka komórek (GPQA-Diamond 70,2, HLE 8,9 oraz różne wiersze dotyczące długiego kontekstu i zadań agentowych) oznaczono jako pochodzące z Artificial Analysis, a nie zweryfikowane we własnym zakresie. Wyróżnione wyniki w poszczególnych zadaniach obejmują MATH-500 na poziomie 94,6, AIME 2025 i 2026 na poziomie 86,5, IFEval — 86,7, MMLU-Pro — 70,8 oraz SWE-bench Verified — 46,4. To liczby producenta uzyskane w zestawie samego producenta, a karta wprost wskazuje, że część wierszy pochodzi od zewnętrznych źródeł; tę mieszankę należy traktować odpowiednio.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, English, Chinese, long-context, tool-calling and edge-ai, the arxiv links, and the opening Highlights line "We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B."

Podczas lipcowej prezentacji materiały premierowe ModelBest powoływały się na Artificial Analysis Index wynoszący 17 — pierwszy wśród modeli poniżej 4B parametrów — a lipcowe relacje wspominały o oknie 512K tokenów. Checkpointy, które faktycznie trafiły do wydania, konfigurują 131 072 tokenów kontekstu. Tam, gdzie marketingowa liczba z dnia premiery różni się od konfiguracji wydanego modelu, to konfiguracja decyduje o tym, co można uruchomić, a różnicę warto poznać, zanim zaplanujesz zadanie wymagające długiego kontekstu w oparciu o tę marketingową liczbę.

Uruchamianie MiniCPM5-2B z jego draftem

Zamierzoną ścieżką jest SGLang, który obsługuje algorytm DSpark w głównym wydaniu od wersji v0.5.16 — czyli minimalnej wersji wymaganej przez kartę modelu. Pełne polecenie serwowania z karty:

python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7

Przy dekodowaniu zachłannym (T=0) weryfikacja DSpark jest bezstratna: wynik jest identyczny jak w przypadku serwowania samego MiniCPM5-2B, co sprawia, że draft jest czysto kwestią opóźnienia. Gdy próbkowanie jest włączone, DSpark w SGLang domyślnie stosuje próbkowanie tylko dla modelu docelowego, z opcjonalnym próbkowaniem z odrzucaniem. OpenBMB dokumentuje także zwykłe ładowanie przez Transformers (transformers ≥ 5.6) oraz serwowanie samego modelu docelowego przez vLLM ≥ 0.21, a także parser wywołań narzędzi minicpm5 dla obciążeń agentowych; ścieżka spekulatywna DSPARK jest natomiast specyficzna dla SGLang.

To arytmetyka sprzętowa jest tutaj kluczowa dla pary klasy edge: około 5 GB dla MiniCPM5-2B w BF16 plus mniej więcej 0,65 GB na draft. Połączenie draftu i modelu docelowego mieści się bez trudu wszędzie tam, gdzie sam model 2B był już wykonalny, i właśnie w tym tkwi cały sens wypuszczania tak małego draftu zamiast drugiego, większego modelu.

Co nie jest potwierdzone.

Nie istnieje żadne ogłoszenie, które moglibyśmy znaleźć — żaden blog OpenBMB ani ModelBest, żaden wpis w mediach społecznościowych po angielsku czy chińsku. Określenie „cicho wypuszczono" jest tu dosłowne, a jedyną publiczną powierzchnią jest kolekcja na Hugging Face.

• Brak niezależnej ewaluacji. Długości akceptacji z wersji roboczej oraz średnia 53,9 modelu MiniCPM5-2B w zestawie testów są raportowane przez producenta i nie zostały odtworzone; komórki oznaczone jako AA pochodzą co prawda od stron trzecich, lecz są to wartości migawkowe, a nie wyniki uruchomień na dokładnie tych wagach.

• Nie ma nigdzie dostępnego hostowanego API, więc wdrożenie dziś oznacza samodzielne uruchamianie punktów kontrolnych. Mirror ModelScope, obiecany w lipcowej relacji z premiery, nie był widoczny w chwili pisania tego tekstu.

Brak podanej wartości przyspieszenia względem czasu rzeczywistego dla pary DSPARK. Akceptowalna długość 5,52 to wysoki współczynnik trafień, ale „ile razy szybciej” na danym GPU to dokładnie liczba, której OpenBMB nie opublikował.

• Wspomniana wyżej niejednoznaczność okna kontekstu: materiały marketingowe podawały 512K, dostarczona konfiguracja wskazuje 131 072, a nic w repozytoriach nie łączy tych dwóch wartości.

Gdzie w stosie wypada ciche wydanie open-weight

Uczciwa ocena MiniCPM5-2B dzisiaj jest taka: to zakład — mocne liczby producenta, zero niezależnych uruchomień, brak historii serwowania oraz model szkicowy, którego rzeczywiste przyspieszenie nie zostało zmierzone. To właśnie sytuacja, dla której istnieje warstwa routingu. Zespół, który chce sprawdzić, czy wyniki małego otwartego modelu mogą zastąpić hostowany model, z którego już korzysta, może przeprowadzić to porównanie przez jedno API — OrcaRouter udostępnia ponad 200 hostowanych modeli po cenniku dostawcy bez narzutów, więc tydzień ewaluacji nic nie kosztuje, a automatyczne przełączanie awaryjne sprawia, że kilkudniowy checkpoint nigdy nie musi trzymać ścieżki produkcyjnej jako zakładnika, dopóki nie udowodni swojej wartości. Nic z tego nie wymaga, by MiniCPM5-2B był gdziekolwiek hostowany; to siatka bezpieczeństwa wokół modeli, na których już polegasz, podczas gdy decydujesz, czy samodzielnie hostowany model 2B jest wart GPU.

Zwróć uwagę, w kolejności ważności, na: niezależny przebieg SGLang DSPARK, który raportuje rzeczywiste tokeny na sekundę dla tej pary modeli, bo długość akceptacji jest tylko wskaźnikiem zastępczym, a nie benchmarkiem; oficjalne ogłoszenie lub lustro ModelScope potwierdzające, że wydanie jest finalne; oraz dostawcę hostingu, który zacznie oferować MiniCPM5-2B — jeśli któryś to zrobi, cena, jaką zapłacisz po naszej stronie, to cena katalogowa samego dostawcy z tego samego dnia, bo właśnie to oznacza pass-through. Tymczasem bardziej interesującym artefaktem z tych dwóch jest model proponujący (draft). To, że model docelowy przyjmuje średnio pięć i pół tokena z każdych siedmiu zaproponowanych przez pięciowarstwowy model proponujący, stanowi różnicę między małym modelem brzegowym, który wydaje się mały, a takim, który sprawia wrażenie większego modelu działającego na tym samym urządzeniu.