
MiniCPM5-2B-DSpark kontra Granite 4.2 3B: Dwa ciche wydania na licencji Apache-2.0 do małego, szybkiego, samodzielnie hostowanego serwowania
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sierpień i początek września 2026 r. przyniosły dwa ciche wydania na licencji Apache-2.0. Oba miały ten sam cel — małe modele, które serwujesz samodzielnie — ale podeszły do niego z przeciwnych stron. Granite 4.2 3B to laptopowy model rozumujący IBM-a. Jego wagi trafiły na Hugging Face na początku sierpnia, a karta modelu i wpis techniczny ukazały się 25 sierpnia 2026 r. MiniCPM5-2B-DSpark nie jest w ogóle modelem w tym samym sensie: to opublikowany przez OpenBMB 6 września 2026 r. bez żadnej zapowiedzi checkpoint modelu pomocniczego DSpark o 323,8 mln parametrów, zbudowany po to, aby MiniCPM5-2B — gęsty model on-device o 2,52 mld parametrów, który ModelBest zapowiedział na WAIC 19 lipca 2026 r. — szybciej generował tokeny dzięki dekodowaniu spekulacyjnemu. Jedno wydanie to samodzielny mały model rozumujący; drugie to akcesorium do przyspieszania małego modelu. Oba objęte są licencją Apache-2.0, oba są przeznaczone wyłącznie do samodzielnego hostowania i żadne z nich nie zostało jeszcze poddane niezależnemu benchmarkowi.
Po zdjęciu warstwy marketingowej praktyczne pytanie, przed którym stoi zespół, jest proste: czy przy małym, samodzielnie hostowanym obciążeniu serwowania modeli pod koniec 2026 r. wybrać wyspecjalizowany w rozumowaniu model 3B od IBM, czy zorientowany na agentów zestaw 2B od ModelBest z doczepionym darmowym modelem szkicującym? Materiał dowodowy jest uboższy, niż sugerowałaby karta specyfikacji któregokolwiek z dostawców, dlatego ten artykuł omawia fakty dotyczące wydań, jedyny istniejący komplet wyników z tej samej baterii testów oraz różnicę w charakterze obciążenia, która powinna przesądzić o wyborze.
Dwa wydania, co można wiedzieć
Granite 4.2 3B to najmniejszy model rozumujący IBM, douczony na bazie Granite-4.1-3B-Base. Jest gęsty i tekstowy — 40 warstw, grouped-query attention, natywny kontekst 128K rozszerzany do 512K w piątej fazie pretrenowania, oraz trzy tryby rozumowania: pełne myślenie domyślnie, tryb niskiego nakładu oraz ścieżka bez myślenia. Karta IBM wprost wskazuje, że model 3B celowo pominięto w bloku uczenia przez wzmacnianie agentowe, który otrzymały większe modele Granite 4.2, dlatego nie podaje wyników SWE-Bench i jest modelem rozumującym, a nie modelem-agentem. Model działa przez vLLM, SGLang, Transformers, GGUF i Ollama (granite4.2:3b) i nie ma hostowanego API. Jego główne liczby z karty — 78,33 na AIME 2025, 54,80 GPQA, 69,71 LiveCodeBench v6 — są podawane przez producenta i dotychczas niezreprodukowane.

Powyższa karta ibm-granite/granite-4.2-3b jest publicznym obliczem tego wydania: model 3B dostrojony do rozumowania, z długim kontekstem i bez deklaracji o zdolnościach agentowych.
MiniCPM5-2B-DSpark istnieje natomiast wyłącznie po to, by służyć swojemu modelowi docelowemu. Model szkicujący to pięć warstw pełnej uwagi o 323 776 001 parametrach, z rozmiarem bloku siedmiu tokenów kandydujących na jedno przejście w przód, trenowany przez sześć epok na 7,05 miliarda tokenów odpowiedzi wygenerowanych przez MiniCPM5-2B. Jego repozytorium podaje długość akceptacji — 5,52 zaakceptowanych tokenów na krok weryfikacji w ujęciu zbiorczym przy dekodowaniu zachłannym, 6,11 dla kodu — ale nie podaje liczby tokenów na sekundę. Przyspieszany przez niego model docelowy, MiniCPM5-2B, jest bardziej interesującym produktem: gęsty model o 2,52 mld parametrów, 42 warstwach i kontekście 128K, którego materiały premierowe podkreślają zdolności agentowe — mid-training agenta o skali 200B, duży zbiór agentowego SFT oraz dopasowanie agenta przez RL, według lipcowego ogłoszenia ModelBest — a także natywną obsługę długiego kontekstu i hybrydowe tryby szybki/refleksyjny. We własnym zestawie porównawczym ModelBest model docelowy osiąga średnią 53,9 względem otwartych modeli tej samej klasy. Każda z tych liczb pochodzi od producenta.

Karta openbmb/MiniCPM5-2B-DSpark powyżej to cała powierzchnia wydania: karta modelu, konfiguracja, jeden plik Safetensors i żadnego ogłoszenia.
To jedyne porównanie w obrębie tego samego pakietu, jakie istnieje.
Międzydostawcze tablice wyników to przeważnie porównanie jabłek do pomarańczy, ale jest jedno miejsce, gdzie Granite 4.2 3B i MiniCPM5-2B zmierzono razem: własna tabela ewaluacyjna ModelBest dla MiniCPM5-2B, która wymienia granite-4.2-3B wśród modeli bazowych. W tym zestawie MiniCPM5-2B osiąga średnio 53,9 wobec 42,7 dla Granite 4.2 3B. Czytaj ten wynik dokładnie tak, jakim jest — jeden dostawca uruchamia oba modele na jednym zestawie testów, bez niezależnej replikacji, dobranym tak, by jego własny model wypadł dobrze. To nie jest werdykt. To, co ci to mówi, to że ModelBest miał na tyle pewności, by umieścić konkurencyjny model 3B na karcie, a deklarowana przez niego przewaga jest największa dokładnie tam, gdzie szło jego własne szkolenie: w zadaniach długiego kontekstu i agentskich. Traktuj to jako wskaźnik kierunkowy, zweryfikuj na własnych danych i rozważ osobne deklaracje IBM na jego karcie, zanim podejmiesz na tej podstawie jakąkolwiek decyzję.
Tablica wyników, uczciwie oznaczona
• Co się ukazuje — MiniCPM5-2B-DSpark: draft 324M dla MiniCPM5-2B (gęsty cel 2,52B), nie samodzielny. Granite 4.2 3B: samodzielny gęsty model rozumowania ~3B.
• Role — stack MiniCPM5-2B: nacisk na agenta na urządzeniu i korzystanie z narzędzi, według ModelBest. Granite 4.2 3B: specjalista od rozumowania, celowo nieagentowy.
Kontekst — MiniCPM5-2B: natywnie 128K. Granite 4.2 3B: natywnie 128K, z możliwością rozszerzenia do 512K.
• Przyspieszenie — MiniCPM5-2B-DSpark: zewnętrzny szkic DSpark, siedem tokenów na przebieg, akceptacja zachłanna ~5,5 na krok (raportowane w repo). Granite 4.2 3B: brak w tym wydaniu.
• Licencja — obie Apache-2.0.
• Dowody — dane MiniCPM to deklaracje z karty modelu ModelBest (jego zestaw: 53,9 vs Granite 42,7); dane Granite to deklaracje z karty modelu IBM (AIME 2025: 78,33, GPQA: 54,80). Żaden z nich nie został niezależnie uruchomiony.

Powyższa tablica wyników ma to samo źródło co tekst: każda liczba na niej pochodzi od dostawcy, a jedyna liczba z tego samego zestawu, którą opublikował którykolwiek z dostawców, to własna liczba ModelBest.
Różnica, która przewyższa każdy benchmark
Zanim przejdziemy do wyników, zdecyduj, jakiego rodzaju małego modelu potrzebuje Twoje obciążenie robocze, ponieważ te dwie premiery odpowiadają na różne pytania. Granite 4.2 3B został zaprojektowany z myślą o rozumowaniu i długim kontekście na sprzęcie o ograniczonych zasobach: natywne okno kontekstu 128K rozszerzalne do 512K, trzy tryby myślenia na zapytanie, niewielki rozmiar pozwalający na uruchomienie na laptopie oraz świadoma decyzja o pominięciu treningu agentowego. Jeśli Twoim zadaniem jest analiza długich dokumentów, kontekst na skalę repozytorium lub niezawodne rozumowanie na małej maszynie, to jest to spójny wybór. MiniCPM5-2B kładzie nacisk na coś odwrotnego: zachowania agentowe i użycie narzędzi na urządzeniu — sam fakt istnienia modelu draft sygnalizuje, że ModelBest zakłada interaktywne działanie tego modelu i chce odzyskać tempo tokenów na sekundę. Jeśli Twoim zadaniem jest pętla agentowa na urządzeniu, która wywołuje narzędzia i prowadzi długie rozmowy, to właśnie ten zestaw jest skierowany do Ciebie.
Projekt zmienia ekonomikę tego drugiego wyboru w sposób, którego wydanie Granite nie obejmuje. MiniCPM5-2B to model gęsty, a dekodowanie spekulatywne opłaca się najbardziej właśnie w gęstym, ograniczonym pamięciowo reżimie — mały, stały model proponujący tokeny nieco większemu, również stałemu modelowi. Zewnętrzny model proponujący, który dodaje około 650 MB wag BF16 do modelu docelowego o wielkości ~5 GB, z udokumentowaną ścieżką serwowania SGLang i wskaźnikiem akceptacji zachłannej na poziomie około pięciu i pół tokena na krok weryfikacji, jest wiarygodną dźwignią przepustowości dla modelu serwowanego przy współbieżności pojedynczego żądania. Ale to zastrzeżenie jest nieuniknione: OpenBMB nie opublikował żadnego przyspieszenia end-to-end, więc dźwignia jest nieskalibrowana. IBM nie dostarcza równoważnego zewnętrznego modelu proponującego dla Granite 4.2 3B w ramach tego wydania — uruchamiasz go jako model gęsty, a jego historia szybkości sprowadza się po prostu do tego, że model 3B jest mały.
Kto czym powinien zarządzać?
• Uruchom Granite 4.2 3B, jeśli Twoja praca to rozumowanie długiego kontekstu na sprzęcie klasy laptopa — dokumenty, repozytoria, głęboka analiza jednowątkowa — i chcesz trzy tryby myślenia oraz pułap 512K w modelu na licencji Apache-2.0, nad którym masz pełną kontrolę. Zaakceptuj, że nie ma za nim treningu agentowego ani hostowanego API.
• Uruchom stos MiniCPM5-2B z jego draftem DSpark, jeśli Twoje obciążenie to interaktywny agent działający na urządzeniu i wywołujący narzędzia, a model docelowy mieści się w budżecie pamięci i chcesz odzyskać przepustowość, jaką może zapewnić draft. Zarezerwuj czas na zmierzenie rzeczywistego przyspieszenia, jakie draft zapewnia w Twojej własnej kompilacji SGLang, ponieważ nie opublikowano dla niego żadnych wartości liczbowych.
• Uruchom oba za warstwą routingu, jeśli naprawdę nie jesteś pewien. Żaden z modeli nie jest dziś dostępny w katalogu hostowanym — OrcaRouter również — oba to rozwiązania do samodzielnego hostingu, ale router stojący przed Twoimi własnymi endpointami z automatycznym przełączaniem awaryjnym pozwala nowemu szkicowi stosu działać na ścieżce testowej, podczas gdy produkcja pozostaje na sprawdzonym rozwiązaniu, a przepuszczanie hostowanych modeli wokół nich z zerową marżą sprawia, że porównanie A/B jest tanie. Sedno tkwi w odwracalności: zamień nazwę modelu, zmierz i przełącz z powrotem, jeśli checkpointer sprzed jednego dnia się zaciąga.
Co obejrzeć dalej
Dwie rzeczy rozstrzygną to starcie szybciej niż jakakolwiek opinia. Po pierwsze, niezależne uruchomienie MiniCPM5-2B, które potwierdzi lub obali średnią 53.9 i twierdzenia o zdolnościach agentowych — wynik na poziomie 2B, który uzyskałby tak dobrze w zadaniach w stylu SWE-Bench, byłby prawdziwie nowym punktem danych dla klasy modeli działających na urządzeniu. Po drugie, liczby IBM dotyczące własnego modelu rozumującego, które przetrwają reprodukcję przez społeczność; wynik 78.33 AIME 2025 dla modelu 3B to rodzaj twierdzenia, które zmienia się, gdy uruchomi je ktoś inny. Dopóki jedno z tych nie nastąpi, uczciwe stanowisko jest następujące: Granite 4.2 3B to dziś bezpieczniejszy, lepiej udokumentowany mały model, a stos MiniCPM5-2B to ciekawszy zakład — szybszy agent na urządzeniu, jeśli jego twierdzenia się utrzymają, z wersją roboczą, której opłacalności nie zmierzył jeszcze nawet sam producent.
