Karta tytułowa hero do porównania 'MiniCPM5-2B-DSpark vs Gemma 4 12B' z podtytułem 'Dwa sposoby szkicowania, dwie kategorie wagowe lokalnej AI', przedstawiająca po lewej stronie mały układ oznaczony '324M draft' zasilający blok oznaczony '2.5B on-device target', a po prawej szerszy panel oznaczony '11.95B multimodal generalist', z linią przepływu układów tokenów powyżej oznaczoną 'draft then verify' oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MiniCPM5-2B-DSpark kontra Gemma 4 12B: Dwa podejścia do szkicowania, dwie klasy wagowe lokalnej AI

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najszybszy sposób, by przekonać się, dlaczego MiniCPM5-2B-DSpark i Gemma 4 12B powinny znaleźć się na tej samej stronie, to na chwilę zignorować ich rozmiary i przyjrzeć się, jak każdy z nich pisze zdanie. Oba przechytrzają magistralę pamięci za pomocą draftera: mały model proponuje kilka kolejnych tokenów naraz, a właściwy model weryfikuje cały blok w jednym przebiegu, dzięki czemu krzem płaci koszt wczytywania wag raz na blok, a nie raz na token. MiniCPM5-2B-DSpark to draft, który OpenBMB po cichu opublikował na Hugging Face 6 września 2026 r. — towarzyszący checkpoint o 323,8 mln parametrów, przyspieszający MiniCPM5-2B, czyli gęsty model o 2,52 mld parametrów działający na urządzeniu, zapowiedziany przez ModelBest na WAIC 19 lipca 2026 r. Gemma 4 12B to multimodalny model ogólnego przeznaczenia Google bez enkodera, liczący 11,95 mld parametrów, wydany 3 czerwca 2026 r. z własnymi wbudowanymi drafterami i kontekstem 256 tys. tokenów. Jedno z tych rozwiązań oferuje draftera jako osobny checkpoint na licencji Apache-2.0, który samodzielnie wczytujesz; drugie ukrywa podobny trik wewnątrz pojedynczego dużego modelu, który po prostu uruchamiasz.

Nota o uczciwości, która przesądza o kształcie tego artykułu: MiniCPM5-2B-DSpark nie jest modelem, do którego można kierować prompty. Nie ma tokenizera, szablonu czatu ani samodzielnego wyjścia — to karta, która wymienia tylko model.safetensors, config i README. Jest to element warstwy serwującej dla celu klasy 2B, a prawdziwe porównanie, jakiego dokonuje czytelnik, dotyczy dwóch klas wag lokalnej AI: mieszczącego się w telefonie stosu 2B, który generuje tokeny, oraz 16-gigabajtowego generalisty 12B, który generuje tokeny. Wszystko poniżej to ta decyzja skonkretyzowana.

Czym MiniCPM5-2B-DSpark naprawdę jest

Karta modelu to cała publiczna powierzchnia wydania, więc to z niej pochodzi wszystko, co można o nim wiedzieć. MiniCPM5-2B-DSpark to punkt kontrolny (checkpoint) modelu draftowego DSpark: pięć warstw pełnej uwagi, 323 776 001 parametrów, grouped-query attention z 16 głowicami zapytań i 2 głowicami KV oraz rozmiar bloku równy 7. W każdym przejściu w przód proponuje do siedmiu tokenów kandydujących, które model docelowy MiniCPM5-2B ma zweryfikować. Konfiguracja deklaruje architekturę Qwen3DSparkModel z automatycznym mapowaniem na DSparkDraftModel; w modelu nadal włączone są głowica ufności i głowica Markowa z metody DSpark (arXiv 2607.05147, publikacja DeepSeek z lipca 2026 r.), czyli uwzględniający obciążenie weryfikator, który decyduje, kiedy sufiks nie jest wart sprawdzania. Model trenowano przez sześć epok na 7,05 miliarda tokenów odpowiedzi wygenerowanych przez MiniCPM5-2B na promptach ogólnych, matematycznych i dotyczących kodu.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

Karta openbmb/MiniCPM5-2B-DSpark powyżej to całość, która została wydana: karta modelu, konfiguracja, jeden plik Safetensors — bez ogłoszenia, bez wpisu na blogu, bez komunikatu prasowego. To po prostu ciche udostępnienie wag, które w chwili pisania tego tekstu ma jeden dzień.

To, czego karta nie zawiera, jest równie ważne jak to, co zawiera. Raportuje długość akceptacji — według własnej ewaluacji repozytorium: zagregowaną liczbę 5,52 zaakceptowanych tokenów na krok weryfikacji przy dekodowaniu zachłannym, z matematyką na poziomie 6,05 i kodem na poziomie 6,11 przy pułapie siedmiu tokenów — ale nie podaje przyspieszenia w czasie rzeczywistym, liczby tokenów na sekundę ani niezależnego benchmarku. Udokumentowaną ścieżką serwowania jest silnik DSPARK platformy SGLang, z draftem załadowanym obok modelu docelowego MiniCPM5-2B. Innymi słowy: jakość draftu jest skwantyfikowana, ale jego zysk — jeszcze nie; każdy, kto go wdraża, powinien mierzyć, zanim uwierzy.

Co Gemma 4 12B wnosi na drugą stronę

Gemma 4 12B to średnie dziecko rodziny G​emma 4 od Google i znajduje się w zupełnie innym punkcie krzywej lokalnej AI. To jeden gęsty model o wielkości 11,95B, który przyjmuje tekst, obraz, audio i wideo jako dane wejściowe bez osobnych enkoderów, natywnie obsługuje wywołania narzędzi i łączy rodzimy kontekst 256K z drafterami wielotokenowej predykcji, które wewnętrznie wykorzystują ten sam trik z magistralą pamięci — ale od środka checkpointu, więc nie musisz niczego dodatkowo pobierać ani podłączać. Jest na licencji Apache 2.0, w praktyce działa na laptopie z 16GB RAM i pojawił się z pełnym zapleczem Google: ewaluacjami startowymi, kartami modeli dla wariantów bazowego i instruowanego, wsparciem ekosystemu w Model Garden, LM Studio i Ollama. Ma za sobą miesiące wdrożeń społecznościowych, których jednotygodniowy szkic MiniCPM nie ma.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

Powyższa karta modelu Gemma 4 12B firmy Google to kontrast w jednym kadrze: dojrzały multimodalny generalista, którego draftujące modele są elementem wydania, a nie osobnym repozytorium.

Specyfikacje, uczciwie oznaczone.

Czytaj je, mając na uwadze pochodzenie: wyniki MiniCPM5-2B to deklaracje z karty ModelBest, niepotwierdzone; wyniki Gemma 4 12B to własne dane Google, od dawna używane przez społeczność.

• Co uruchamiasz — MiniCPM5-2B-DSpark: draft o 324 mln parametrów, działający tylko w parze z MiniCPM5-2B (gęsty model o 2,52 mld parametrów i 42 warstwach). Gemma 4 12B: jeden samodzielny gęsty model o 11,95 mld parametrów.

• Kontekst — MiniCPM5-2B: docelowo 128K natywnie. Gemma 4 12B: 256K natywnie.

• Modalność — stack MiniCPM5-2B: tylko tekst. Gemma 4 12B: tekst, obraz, audio i wideo na wejściu, bez enkodera.

Szkicowanie — MiniCPM5-2B-DSpark: zewnętrzny szkic DSpark, siedem tokenów na przebieg, silnik SGLang DSPARK. Gemma 4 12B: wewnętrzne modele szkicujące z przewidywaniem wielu tokenów, nic do instalowania.

• Rozmiar — MiniCPM5-2B zajmuje ok. 5 GB w BF16 plus ~650 MB plik pomocniczy; Gemma 4 12B ok. 18 GB w BF16, praktyczna na sprzęcie klasy 16 GB w wersji skwantowanej.

• Dowody — MiniCPM5-2B-DSpark: wyłącznie wskaźniki długości akceptacji z repozytorium, sprzed jednego dnia. Gemma 4 12B: ewaluacje z premiery oraz miesiące wdrożeń społecznościowych.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

Tablica wyników powyżej to ten sam portret w sześciu rzędach: dwie kolumny nie zgadzają się co do prawie wszystkiego, z wyjątkiem strategii, której obie używają, by szybko pisać.

Która kategoria wagowa pasuje do krzemu, który faktycznie masz?

Ponieważ MiniCPM5-2B-DSpark nie jest modelem, istotna różnica dotyczy klasy wagowej docelowego modelu względem Gemmy 4 12B — i ta różnica to w większości kwestia sprzętu. Telefon, płyta inteligentnego kokpitu lub małe urządzenie brzegowe z kilkoma gigabajtami DRAM nie uniosą modelu 11,95B przy użytecznej prędkości; szyna pamięci jest właśnie wąskim gardłem, które by go zdławiło. To jest świat, dla którego stworzono zestaw MiniCPM5-2B — gęsty model 2B, którego wagi mieszczą się w pamięci urządzenia, z dołączonym modelem szkicowym, który ma odzyskać część tokenów na sekundę, jakie małe gęste modele oddają. Dekodowanie spekulatywne jest najskuteczniejsze właśnie w tym gęstym, ograniczonym pamięcią trybie, dlatego model szkicowy jest interesującą częścią wydania, a nie chwytem.

Gemma 4 12B to odpowiedź o jedną klasę wagową wyżej. Jeśli twój sprzęt ma 16 GB lub więcej — laptop, stacja robocza, wydajny serwer brzegowy — możesz udźwignąć multimodalnego generalistę i zyskujesz trzy rzeczy, których stos 2B nie może zaoferować: wejście obrazu, dźwięku i wideo bez enkoderów i drugiego potoku; okno 256K do pracy w skali repozytorium lub dokumentu; oraz dojrzałość, której jednodniowy szkic checkpointu po prostu nie ma. Rezygnujesz z możliwości działania na najmniejszych urządzeniach i płacisz mniej więcej trzykrotnie większym zużyciem pamięci.

Rzeczywistość routingu dla obu

Żadna ze stron tego pojedynku nie znajduje się dziś w hostowanym katalogu — w tym w katalogu OrcaRouter. MiniCPM5-2B-DSpark jest z definicji dodatkiem do samodzielnego serwowania modeli: samodzielnie uruchamiasz stos SGLang, a draft istnieje tylko w Twoim lokalnym wdrożeniu. Gemma 4 12B ma otwarte wagi, więc możesz ją serwować samodzielnie albo korzystać z niej tam, gdzie już jest dostępna. To właśnie sytuacja, w której warstwa routingu zwraca swój koszt jako siatka bezpieczeństwa, a nie mechanizm dostarczania: gdy testujesz nową kompilację draftu pod kątem obciążenia, które już obsługujesz, skierowanie ścieżki testowej przez jedno API z automatycznym przełączaniem awaryjnym oznacza, że nieprzetestowany stos może się zatrzymać bez wyłączania produkcji, a ceny dostawców wokół niego są przekazywane dalej bez marży, więc zmiana ceny dowolnego hostowanego modelu, z którym porównujesz, pojawia się tego samego dnia. Jeśli chodzi o samo porównanie, uczciwy plan dla obu modeli jest taki sam: hostujesz samodzielnie, więc liczy się benchmark, który uruchamiasz na własnym sprzęcie.

Werdykt

MiniCPM5-2B-DSpark i Gemma 4 12B nie są konkurentami w żadnym sensie bezpośredniego pojedynku — to dwie kategorie wagowe lokalnej AI, które akurat łączy jedna sztuczka. Wybierz stos MiniCPM5-2B z jego draftem DSpark, gdy twoje urządzenie nie jest w stanie udźwignąć modelu 12B, a chcesz model zdolny do pracy z tekstem, na licencji Apache-2.0, nastawiony na agentów, który mieści się w pamięci urządzenia; draft to obiecujące darmowe przyspieszenie, ale zmierz go na własnej kompilacji SGLang, zanim mu zaufasz, bo jego korzyść wciąż nie została skwantyfikowana. Wybierz model Gemma 4 12B, gdy twój sprzęt ma odpowiedni zapas wydajności i chcesz jeden multimodalny model z oknem kontekstowym 256K oraz ekosystemem, który za nim stoi. Pytanie nie brzmi, który model jest mądrzejszy — tylko który z nich twój krzem faktycznie zdoła nakarmić.