
MiniCPM5-2B-DSpark kontra Qwen3-8B: nowy lokalny stack 2.5B kontra koń roboczy z otwartymi wagami
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Każde porównanie modeli skrywa pytanie o sprzęt, a MiniCPM5-2B-DSpark kontra Qwen3-8B to właśnie to pytanie w kostiumie benchmarku. Qwen3-8B to otwarto-wagowy koń roboczy Alibaba z kwietnia 2025 — około 8,2 mld gęstych parametrów, 119 języków, natywny kontekst 32K rozszerzalny do 131K, hybrydowe tryby myślenia i szesnaście miesięcy społecznościowych dowodów za sobą. MiniCPM5-2B-DSpark nie jest samodzielnym modelem, który można obok niego postawić: to draftowy punkt kontrolny DSpark o 323,8 mln parametrów, który OpenBMB po cichu opublikował na Hugging Face 6 września 2026, aby przyspieszyć MiniCPM5-2B — gęsty model 2,52B działający na urządzeniu, który ModelBest ogłosił na WAIC 19 lipca 2026. Zestaw te dwa modele razem, a na wierzch wypływa prawdziwe pytanie: czy obciążenie, które obecnie działa na 8B, powinno działać na sprzęcie zdolnym unieść tylko 2B — i czy 2,5B z darmowym draftem wystarczy, by dokonać tej zmiany?
Krótka odpowiedź brzmi: w przypadku większości obciążeń jeszcze nie, ale przyczyny są węższe, niż sugerowałaby różnica rozmiarów, a istnieje jedna kategoria wdrożeń, w której model 8B w ogóle nie ma odpowiedzi. Wszystkie dane ilościowe w tym tekście pochodzą od producentów — liczby MiniCPM to własne, niezależnie niepotwierdzone dane ModelBest; liczby Qwen3-8B to dane Alibaba, od dawna w powszechnym użyciu społeczności — więc etykiety liczą się bardziej niż same cyfry.
Dwa modele w różnych miejscach na krzywej pamięci
MiniCPM5-2B to gęsty przyczynowy transformer o jednej trzeciej rozmiaru modelu 8B — 42 warstwy, GQA (grouped-query attention), Apache-2.0 — stworzony z myślą o klasie urządzeń, do której duży model nie dotrze: telefonach, inteligentnych kokpitach i małych urządzeniach brzegowych, gdzie magistrala pamięci zadławiłaby się ośmioma miliardami wag. Materiały towarzyszące premierze kładą nacisk na pracę agentową i długi kontekst, a nie na surową szerokość kompetencji: natywny kontekst 128K oraz deklarację ModelBest, że w przygotowanej przez siebie suicie ewaluacyjnej model osiąga średnio 53,9. Według producenta to SOTA wśród open-source'owych modeli klasy 2B, w tym wynik 46,4 w SWE-bench Verified uzyskany w teście przeprowadzonym przez producenta — byłby on niezwykły jak na model 2B, gdyby przetrwał niezależne testy. Draft DSpark to odpowiedź w zakresie przepustowości na oczywisty zarzut, że mały gęsty model szybko się ładuje, ale wolno generuje, bo każdy token przeciąga swoje wagi przez magistralę pamięci. Draft proponuje do siedmiu tokenów naraz, a model docelowy ma je weryfikować; repozytorium podaje średnią zachłanną akceptację 5,52 tokena na krok weryfikacji — 6,11 dla kodu. Ta liczba świadczy o jakości draftu; jego przyspieszenie nie zostało jeszcze zmierzone, a żadna wartość tokenów na sekundę nie została dotąd opublikowana.

Karta openbmb/MiniCPM5-2B-DSpark powyżej to cała publiczna odsłona cichego wydania z 6 września: narzędzie pomocnicze do serwowania raportujące długość akceptacji, bez ogłoszenia i bez przyspieszenia w czasie rzeczywistym.
Qwen3-8B należy do tej samej rodziny architektonicznej, ale jest trzy razy większy i szesnaście miesięcy starszy. To gęsty przyczynowy Transformer z grupowaną uwagą zapytań (GQA), trenowany na wielojęzycznym korpusie liczącym 36 bilionów tokenów, na licencji Apache-2.0. To jeden z najczęściej samodzielnie hostowanych i udostępnianych modeli 8B w świecie otwartych wag. Jego znakiem rozpoznawczym jest hybrydowy tryb rozumowania Qwen3 — myślenie włączane lub wyłączane dla każdego żądania — a jego profil jest celowo szeroki: MMLU w górnych latach 70., solidne wyniki w GSM8K i w kodowaniu, 119 języków. Wymaga prawdziwego GPU lub wydajnego urządzenia brzegowego: przy praktycznej kwantyzacji zajmuje kilka gigabajtów, mieści się wygodnie na jednej karcie średniej klasy, ale nie na telefonie.

Powyższa karta modelu Qwen3-8B firmy Alibaba jest twarzą obecnego lidera: szesnaście miesięcy udokumentowanych, przetestowanych przez społeczność zachowań w 119 językach.
Gdzie 8B wciąż wygrywa
Przechodząc do niższej klasy wagowej, rezygnujesz z trzech konkretnych rzeczy. Po pierwsze, języki: Qwen3-8B obejmuje 119; karta i zbiory danych MiniCPM5-2B koncentrują się na angielskim i chińskim i nie deklarują szerokości wielojęzycznej. Dla produktu obsługującego długi ogon języków to twarda ściana, a nie miękka. Po drugie, dowody: liczby Qwen3-8B były testowane, kwantyzowane, dostrajane i udostępniane na dużą skalę przez szesnaście miesięcy; jego tryby awarii są znane, istnieją jego kwantyzacje, a ekosystem jest wszędzie. MiniCPM5-2B to wydanie z lipca 2026 r. z tabelą wyników prowadzoną przez dostawcę i bez niezależnej reprodukcji, a szkic ma jeden dzień. Po trzecie, stos serwowania: wszystko, co już rozmawia z Qwen3-8B — vLLM, SGLang, llama.cpp, tysiąc dostrojeń — rozmawia z dojrzałym celem, podczas gdy szkic MiniCPM wymaga zbudowania silnika dekodowania spekulacyjnego (algorytm DSPARK SGLang), który repo dokumentuje, ale szerszy ekosystem jeszcze go nie wchłonął.
Gdzie stos 2B jest jedyną opcją
Nic z tego nie ma znaczenia w tej klasie urządzeń, w której model 8B po prostu się nie mieści. Na telefonie albo płytce edge z kilkoma gigabajtami pamięci DRAM model Qwen3-8B nie konkuruje z MiniCPM5-2B — w ogóle nie da się go wdrożyć z użyteczną prędkością. To jest właśnie cały powód, dla którego stack 2B w ogóle istnieje, i dlatego draft (model szkicujący) jest nośnym elementem tego wydania, a nie ozdobnikiem. Dekodowanie spekulatywne jest najskuteczniejsze właśnie w gęstym, ograniczonym pamięciowo reżimie, w jakim żyje mały model na małym krzemie: kompaktowy model szkicujący proponuje blok, model docelowy weryfikuje go w jednym przebiegu, a koszt wczytywania wag jest ponoszony raz na blok, a nie raz na token. Metoda DSpark stworzona w DeepSeek (arXiv 2607.05147) została zaprojektowana dla systemów serwujących o wysokiej współbieżności, ale jej mechanika — oraz liczby akceptacji podane w tym repo — stanowią właściwą dźwignię dla modelu 2B, który na ograniczonym sprzęcie musi sprawiać wrażenie interaktywnego. Pamiętaj tylko o tym ważnym zastrzeżeniu: OpenBMB zmierzyło akceptację draftu, a nie jego przyspieszenie, więc faktyczny przyrost liczby tokenów na sekundę na twoim docelowym urządzeniu nadal musisz zmierzyć sam.
Tablica wyników, uczciwie oznaczona
• Premiera — MiniCPM5-2B: 19 lipca 2026 r. (ogłoszona); MiniCPM5-2B-DSpark: 6 września 2026 r., po cichu. Qwen3-8B: kwiecień 2025 r., ogłoszona.
• Rozmiar — MiniCPM5-2B: 2,52 mld gęstych parametrów, plus model draft o wielkości 324 mln. Qwen3-8B: ~8,2 mld gęstych parametrów.
• Kontekst — MiniCPM5-2B: 128K natywnie. Qwen3-8B: 32K natywnie, 131K poprzez YaRN.
• Języki — MiniCPM5-2B: skoncentrowany na angielskim/chińskim. Qwen3-8B: 119.
Rozumowanie — MiniCPM5-2B: hybrydowe tryby szybki/refleksyjny zgodnie z materiałami dotyczącymi premiery. Qwen3-8B: myślenie włączane lub wyłączane w zależności od żądania.
• Dowody — wyniki MiniCPM to deklaracje z karty ModelBest (średnia 53,9 we własnym zestawie; brak niezależnego uruchomienia). Wyniki Qwen3-8B są raportowane przez Alibaba i od szesnastu miesięcy poddawane weryfikacji społeczności.

Powyższe zestawienie to uczciwie przedstawiona rozbieżność: kolumny różnią się niemal pod każdym względem, poza otwartą licencją Apache-2.0, a klasa urządzenia, dla której tworzysz produkt, decyduje o tym, którą kolumnę w ogóle możesz wybrać.
Rzeczywistość routingu
Żaden z modeli nie znajduje się dziś w katalogu hostowanym na OrcaRouter, więc to porównanie odbywa się w całości w świecie samohostowanym — ale właśnie tam warstwa routingu wciąż ma rację bytu. Qwen3-8B jest udostępniany przez swojego producenta i kilka platform trzecich; MiniCPM5-2B i jego draft to coś, co uruchamiasz sam. Kiedy zespół chce sprawdzić, czy stos 2.5B może udźwignąć część obciążenia 8B, odwracalnym posunięciem jest skierowanie ścieżki testowej na samohostowaną kompilację SGLang z MiniCPM5-2B-plus-draft przez jedno API z automatycznym przełączaniem awaryjnym — produkcja pozostaje na dotychczasowym rozwiązaniu, nowy stos może utknąć bez powalania niczego, a cenniki dostawców w całym porównaniu przechodzą bez narzutu (0% marży), więc test A/B jest tani i odwracalny, a nie zakładem. Warstwa nie hostuje żadnego z modeli; sprawia jedynie, że eksperyment można bezpiecznie przeprowadzić.
Kto powinien się ruszyć, a kto powinien czekać
Zostań przy Qwen3-8B do wszystkiego, co wielojęzyczne, do wszystkiego, co wymaga szesnastu miesięcy znanego zachowania, lub do każdego obciążenia już obsługiwanego na sprzęcie, który bez trudu udźwiga 8B — różnica rozmiaru nie jest powodem do migracji, a luka w dowodach przemawia przeciwko niej. Poważnie przetestuj stos MiniCPM5-2B z jego draftem DSpark tylko wtedy, gdy Twoje urządzenie docelowe w ogóle nie udźwignie 8B, albo gdy model 2.5B, który dotrzymuje kroku w zadaniach agentowych i pracy nad długim kontekstem, pozwoliłby Ci ograniczyć zużycie pamięci i energii na sprzęcie, który już wysyłasz. A zanim zdecydujesz się na draft, przeprowadź pomiar, którego OpenBMB nie opublikował: długość akceptacji to nie opóźnienie, a zysk w tokenach na sekundę na Twoim urządzeniu to liczba, która faktycznie decyduje, czy ten cichy, mały checkpoint na Hugging Face był wart pobrania.
