Tytuł karty hero do porównania „MiniCPM5-2B-DSpark vs Qwen3-8B” z podtytułem „Nowy lokalny stos 2.5B vs koń roboczy z otwartymi wagami”, pokazujący zarys telefonu po lewej stronie zawierający mały chip oznaczony „2.5B + draft” oraz szafę serwerową po prawej oznaczonej „8B workhorse”, z licznikiem przepustowości pamięci między nimi oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MiniCPM5-2B-DSpark kontra Qwen3-8B: nowy lokalny stack 2.5B kontra koń roboczy z otwartymi wagami

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Każde porównanie modeli skrywa pytanie o sprzęt, a MiniCPM5-2B-DSpark kontra Qwen3-8B to właśnie to pytanie w kostiumie benchmarku. Qwen3-8B to otwarto-wagowy koń roboczy Alibaba z kwietnia 2025 — około 8,2 mld gęstych parametrów, 119 języków, natywny kontekst 32K rozszerzalny do 131K, hybrydowe tryby myślenia i szesnaście miesięcy społecznościowych dowodów za sobą. MiniCPM5-2B-DSpark nie jest samodzielnym modelem, który można obok niego postawić: to draftowy punkt kontrolny DSpark o 323,8 mln parametrów, który OpenBMB po cichu opublikował na Hugging Face 6 września 2026, aby przyspieszyć MiniCPM5-2B — gęsty model 2,52B działający na urządzeniu, który ModelBest ogłosił na WAIC 19 lipca 2026. Zestaw te dwa modele razem, a na wierzch wypływa prawdziwe pytanie: czy obciążenie, które obecnie działa na 8B, powinno działać na sprzęcie zdolnym unieść tylko 2B — i czy 2,5B z darmowym draftem wystarczy, by dokonać tej zmiany?

Krótka odpowiedź brzmi: w przypadku większości obciążeń jeszcze nie, ale przyczyny są węższe, niż sugerowałaby różnica rozmiarów, a istnieje jedna kategoria wdrożeń, w której model 8B w ogóle nie ma odpowiedzi. Wszystkie dane ilościowe w tym tekście pochodzą od producentów — liczby MiniCPM to własne, niezależnie niepotwierdzone dane ModelBest; liczby Qwen3-8B to dane Alibaba, od dawna w powszechnym użyciu społeczności — więc etykiety liczą się bardziej niż same cyfry.

Dwa modele w różnych miejscach na krzywej pamięci

MiniCPM5-2B to gęsty przyczynowy transformer o jednej trzeciej rozmiaru modelu 8B — 42 warstwy, GQA (grouped-query attention), Apache-2.0 — stworzony z myślą o klasie urządzeń, do której duży model nie dotrze: telefonach, inteligentnych kokpitach i małych urządzeniach brzegowych, gdzie magistrala pamięci zadławiłaby się ośmioma miliardami wag. Materiały towarzyszące premierze kładą nacisk na pracę agentową i długi kontekst, a nie na surową szerokość kompetencji: natywny kontekst 128K oraz deklarację ModelBest, że w przygotowanej przez siebie suicie ewaluacyjnej model osiąga średnio 53,9. Według producenta to SOTA wśród open-source'owych modeli klasy 2B, w tym wynik 46,4 w SWE-bench Verified uzyskany w teście przeprowadzonym przez producenta — byłby on niezwykły jak na model 2B, gdyby przetrwał niezależne testy. Draft DSpark to odpowiedź w zakresie przepustowości na oczywisty zarzut, że mały gęsty model szybko się ładuje, ale wolno generuje, bo każdy token przeciąga swoje wagi przez magistralę pamięci. Draft proponuje do siedmiu tokenów naraz, a model docelowy ma je weryfikować; repozytorium podaje średnią zachłanną akceptację 5,52 tokena na krok weryfikacji — 6,11 dla kodu. Ta liczba świadczy o jakości draftu; jego przyspieszenie nie zostało jeszcze zmierzone, a żadna wartość tokenów na sekundę nie została dotąd opublikowana.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

Karta openbmb/MiniCPM5-2B-DSpark powyżej to cała publiczna odsłona cichego wydania z 6 września: narzędzie pomocnicze do serwowania raportujące długość akceptacji, bez ogłoszenia i bez przyspieszenia w czasie rzeczywistym.

Qwen3-8B należy do tej samej rodziny architektonicznej, ale jest trzy razy większy i szesnaście miesięcy starszy. To gęsty przyczynowy Transformer z grupowaną uwagą zapytań (GQA), trenowany na wielojęzycznym korpusie liczącym 36 bilionów tokenów, na licencji Apache-2.0. To jeden z najczęściej samodzielnie hostowanych i udostępnianych modeli 8B w świecie otwartych wag. Jego znakiem rozpoznawczym jest hybrydowy tryb rozumowania Qwen3 — myślenie włączane lub wyłączane dla każdego żądania — a jego profil jest celowo szeroki: MMLU w górnych latach 70., solidne wyniki w GSM8K i w kodowaniu, 119 języków. Wymaga prawdziwego GPU lub wydajnego urządzenia brzegowego: przy praktycznej kwantyzacji zajmuje kilka gigabajtów, mieści się wygodnie na jednej karcie średniej klasy, ale nie na telefonie.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B (reused from a published sibling) showing Alibaba's Apache-2.0 generalist model card with its 8.2B parameters, 119 languages, and hybrid thinking mode.

Powyższa karta modelu Qwen3-8B firmy Alibaba jest twarzą obecnego lidera: szesnaście miesięcy udokumentowanych, przetestowanych przez społeczność zachowań w 119 językach.

Gdzie 8B wciąż wygrywa

Przechodząc do niższej klasy wagowej, rezygnujesz z trzech konkretnych rzeczy. Po pierwsze, języki: Qwen3-8B obejmuje 119; karta i zbiory danych MiniCPM5-2B koncentrują się na angielskim i chińskim i nie deklarują szerokości wielojęzycznej. Dla produktu obsługującego długi ogon języków to twarda ściana, a nie miękka. Po drugie, dowody: liczby Qwen3-8B były testowane, kwantyzowane, dostrajane i udostępniane na dużą skalę przez szesnaście miesięcy; jego tryby awarii są znane, istnieją jego kwantyzacje, a ekosystem jest wszędzie. MiniCPM5-2B to wydanie z lipca 2026 r. z tabelą wyników prowadzoną przez dostawcę i bez niezależnej reprodukcji, a szkic ma jeden dzień. Po trzecie, stos serwowania: wszystko, co już rozmawia z Qwen3-8B — vLLM, SGLang, llama.cpp, tysiąc dostrojeń — rozmawia z dojrzałym celem, podczas gdy szkic MiniCPM wymaga zbudowania silnika dekodowania spekulacyjnego (algorytm DSPARK SGLang), który repo dokumentuje, ale szerszy ekosystem jeszcze go nie wchłonął.

Gdzie stos 2B jest jedyną opcją

Nic z tego nie ma znaczenia w tej klasie urządzeń, w której model 8B po prostu się nie mieści. Na telefonie albo płytce edge z kilkoma gigabajtami pamięci DRAM model Qwen3-8B nie konkuruje z MiniCPM5-2B — w ogóle nie da się go wdrożyć z użyteczną prędkością. To jest właśnie cały powód, dla którego stack 2B w ogóle istnieje, i dlatego draft (model szkicujący) jest nośnym elementem tego wydania, a nie ozdobnikiem. Dekodowanie spekulatywne jest najskuteczniejsze właśnie w gęstym, ograniczonym pamięciowo reżimie, w jakim żyje mały model na małym krzemie: kompaktowy model szkicujący proponuje blok, model docelowy weryfikuje go w jednym przebiegu, a koszt wczytywania wag jest ponoszony raz na blok, a nie raz na token. Metoda DSpark stworzona w DeepSeek (arXiv 2607.05147) została zaprojektowana dla systemów serwujących o wysokiej współbieżności, ale jej mechanika — oraz liczby akceptacji podane w tym repo — stanowią właściwą dźwignię dla modelu 2B, który na ograniczonym sprzęcie musi sprawiać wrażenie interaktywnego. Pamiętaj tylko o tym ważnym zastrzeżeniu: OpenBMB zmierzyło akceptację draftu, a nie jego przyspieszenie, więc faktyczny przyrost liczby tokenów na sekundę na twoim docelowym urządzeniu nadal musisz zmierzyć sam.

Tablica wyników, uczciwie oznaczona

• Premiera — MiniCPM5-2B: 19 lipca 2026 r. (ogłoszona); MiniCPM5-2B-DSpark: 6 września 2026 r., po cichu. Qwen3-8B: kwiecień 2025 r., ogłoszona.

• Rozmiar — MiniCPM5-2B: 2,52 mld gęstych parametrów, plus model draft o wielkości 324 mln. Qwen3-8B: ~8,2 mld gęstych parametrów.

• Kontekst — MiniCPM5-2B: 128K natywnie. Qwen3-8B: 32K natywnie, 131K poprzez YaRN.

• Języki — MiniCPM5-2B: skoncentrowany na angielskim/chińskim. Qwen3-8B: 119.

Rozumowanie — MiniCPM5-2B: hybrydowe tryby szybki/refleksyjny zgodnie z materiałami dotyczącymi premiery. Qwen3-8B: myślenie włączane lub wyłączane w zależności od żądania.

• Dowody — wyniki MiniCPM to deklaracje z karty ModelBest (średnia 53,9 we własnym zestawie; brak niezależnego uruchomienia). Wyniki Qwen3-8B są raportowane przez Alibaba i od szesnastu miesięcy poddawane weryfikacji społeczności.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Qwen3-8B: left column MiniCPM5-2B-DSpark with 'Release: Jul 19 + Sep 6 2026', size 2.52B plus 324M draft, 128K native context, English and Chinese centered languages, hybrid fast-and-deliberate reasoning, and own-suite average 53.9; right column Qwen3-8B with 'Release: April 2025', ~8.2B dense, 32K native / 131K YaRN context, 119 languages, thinking on or off, and 16 months of community-exposed evidence, with a footer reading 'MiniCPM figures vendor-reported; Qwen figures Alibaba-reported' and the OrcaRouter logo in the bottom-right corner.

Powyższe zestawienie to uczciwie przedstawiona rozbieżność: kolumny różnią się niemal pod każdym względem, poza otwartą licencją Apache-2.0, a klasa urządzenia, dla której tworzysz produkt, decyduje o tym, którą kolumnę w ogóle możesz wybrać.

Rzeczywistość routingu

Żaden z modeli nie znajduje się dziś w katalogu hostowanym na OrcaRouter, więc to porównanie odbywa się w całości w świecie samohostowanym — ale właśnie tam warstwa routingu wciąż ma rację bytu. Qwen3-8B jest udostępniany przez swojego producenta i kilka platform trzecich; MiniCPM5-2B i jego draft to coś, co uruchamiasz sam. Kiedy zespół chce sprawdzić, czy stos 2.5B może udźwignąć część obciążenia 8B, odwracalnym posunięciem jest skierowanie ścieżki testowej na samohostowaną kompilację SGLang z MiniCPM5-2B-plus-draft przez jedno API z automatycznym przełączaniem awaryjnym — produkcja pozostaje na dotychczasowym rozwiązaniu, nowy stos może utknąć bez powalania niczego, a cenniki dostawców w całym porównaniu przechodzą bez narzutu (0% marży), więc test A/B jest tani i odwracalny, a nie zakładem. Warstwa nie hostuje żadnego z modeli; sprawia jedynie, że eksperyment można bezpiecznie przeprowadzić.

Kto powinien się ruszyć, a kto powinien czekać

Zostań przy Qwen3-8B do wszystkiego, co wielojęzyczne, do wszystkiego, co wymaga szesnastu miesięcy znanego zachowania, lub do każdego obciążenia już obsługiwanego na sprzęcie, który bez trudu udźwiga 8B — różnica rozmiaru nie jest powodem do migracji, a luka w dowodach przemawia przeciwko niej. Poważnie przetestuj stos MiniCPM5-2B z jego draftem DSpark tylko wtedy, gdy Twoje urządzenie docelowe w ogóle nie udźwignie 8B, albo gdy model 2.5B, który dotrzymuje kroku w zadaniach agentowych i pracy nad długim kontekstem, pozwoliłby Ci ograniczyć zużycie pamięci i energii na sprzęcie, który już wysyłasz. A zanim zdecydujesz się na draft, przeprowadź pomiar, którego OpenBMB nie opublikował: długość akceptacji to nie opóźnienie, a zysk w tokenach na sekundę na Twoim urządzeniu to liczba, która faktycznie decyduje, czy ten cichy, mały checkpoint na Hugging Face był wart pobrania.