
MiniCPM5-2B-DSpark kontra Gemma 4 12B: Dwa podejścia do szkicowania, dwie klasy wagowe lokalnej AI
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Najszybszy sposób, by przekonać się, dlaczego MiniCPM5-2B-DSpark i Gemma 4 12B powinny znaleźć się na tej samej stronie, to na chwilę zignorować ich rozmiary i przyjrzeć się, jak każdy z nich pisze zdanie. Oba przechytrzają magistralę pamięci za pomocą draftera: mały model proponuje kilka kolejnych tokenów naraz, a właściwy model weryfikuje cały blok w jednym przebiegu, dzięki czemu krzem płaci koszt wczytywania wag raz na blok, a nie raz na token. MiniCPM5-2B-DSpark to draft, który OpenBMB po cichu opublikował na Hugging Face 6 września 2026 r. — towarzyszący checkpoint o 323,8 mln parametrów, przyspieszający MiniCPM5-2B, czyli gęsty model o 2,52 mld parametrów działający na urządzeniu, zapowiedziany przez ModelBest na WAIC 19 lipca 2026 r. Gemma 4 12B to multimodalny model ogólnego przeznaczenia Google bez enkodera, liczący 11,95 mld parametrów, wydany 3 czerwca 2026 r. z własnymi wbudowanymi drafterami i kontekstem 256 tys. tokenów. Jedno z tych rozwiązań oferuje draftera jako osobny checkpoint na licencji Apache-2.0, który samodzielnie wczytujesz; drugie ukrywa podobny trik wewnątrz pojedynczego dużego modelu, który po prostu uruchamiasz.
Nota o uczciwości, która przesądza o kształcie tego artykułu: MiniCPM5-2B-DSpark nie jest modelem, do którego można kierować prompty. Nie ma tokenizera, szablonu czatu ani samodzielnego wyjścia — to karta, która wymienia tylko model.safetensors, config i README. Jest to element warstwy serwującej dla celu klasy 2B, a prawdziwe porównanie, jakiego dokonuje czytelnik, dotyczy dwóch klas wag lokalnej AI: mieszczącego się w telefonie stosu 2B, który generuje tokeny, oraz 16-gigabajtowego generalisty 12B, który generuje tokeny. Wszystko poniżej to ta decyzja skonkretyzowana.
Czym MiniCPM5-2B-DSpark naprawdę jest
Karta modelu to cała publiczna powierzchnia wydania, więc to z niej pochodzi wszystko, co można o nim wiedzieć. MiniCPM5-2B-DSpark to punkt kontrolny (checkpoint) modelu draftowego DSpark: pięć warstw pełnej uwagi, 323 776 001 parametrów, grouped-query attention z 16 głowicami zapytań i 2 głowicami KV oraz rozmiar bloku równy 7. W każdym przejściu w przód proponuje do siedmiu tokenów kandydujących, które model docelowy MiniCPM5-2B ma zweryfikować. Konfiguracja deklaruje architekturę Qwen3DSparkModel z automatycznym mapowaniem na DSparkDraftModel; w modelu nadal włączone są głowica ufności i głowica Markowa z metody DSpark (arXiv 2607.05147, publikacja DeepSeek z lipca 2026 r.), czyli uwzględniający obciążenie weryfikator, który decyduje, kiedy sufiks nie jest wart sprawdzania. Model trenowano przez sześć epok na 7,05 miliarda tokenów odpowiedzi wygenerowanych przez MiniCPM5-2B na promptach ogólnych, matematycznych i dotyczących kodu.

Karta openbmb/MiniCPM5-2B-DSpark powyżej to całość, która została wydana: karta modelu, konfiguracja, jeden plik Safetensors — bez ogłoszenia, bez wpisu na blogu, bez komunikatu prasowego. To po prostu ciche udostępnienie wag, które w chwili pisania tego tekstu ma jeden dzień.
To, czego karta nie zawiera, jest równie ważne jak to, co zawiera. Raportuje długość akceptacji — według własnej ewaluacji repozytorium: zagregowaną liczbę 5,52 zaakceptowanych tokenów na krok weryfikacji przy dekodowaniu zachłannym, z matematyką na poziomie 6,05 i kodem na poziomie 6,11 przy pułapie siedmiu tokenów — ale nie podaje przyspieszenia w czasie rzeczywistym, liczby tokenów na sekundę ani niezależnego benchmarku. Udokumentowaną ścieżką serwowania jest silnik DSPARK platformy SGLang, z draftem załadowanym obok modelu docelowego MiniCPM5-2B. Innymi słowy: jakość draftu jest skwantyfikowana, ale jego zysk — jeszcze nie; każdy, kto go wdraża, powinien mierzyć, zanim uwierzy.
Co Gemma 4 12B wnosi na drugą stronę
Gemma 4 12B to średnie dziecko rodziny Gemma 4 od Google i znajduje się w zupełnie innym punkcie krzywej lokalnej AI. To jeden gęsty model o wielkości 11,95B, który przyjmuje tekst, obraz, audio i wideo jako dane wejściowe bez osobnych enkoderów, natywnie obsługuje wywołania narzędzi i łączy rodzimy kontekst 256K z drafterami wielotokenowej predykcji, które wewnętrznie wykorzystują ten sam trik z magistralą pamięci — ale od środka checkpointu, więc nie musisz niczego dodatkowo pobierać ani podłączać. Jest na licencji Apache 2.0, w praktyce działa na laptopie z 16GB RAM i pojawił się z pełnym zapleczem Google: ewaluacjami startowymi, kartami modeli dla wariantów bazowego i instruowanego, wsparciem ekosystemu w Model Garden, LM Studio i Ollama. Ma za sobą miesiące wdrożeń społecznościowych, których jednotygodniowy szkic MiniCPM nie ma.

Powyższa karta modelu Gemma 4 12B firmy Google to kontrast w jednym kadrze: dojrzały multimodalny generalista, którego draftujące modele są elementem wydania, a nie osobnym repozytorium.
Specyfikacje, uczciwie oznaczone.
Czytaj je, mając na uwadze pochodzenie: wyniki MiniCPM5-2B to deklaracje z karty ModelBest, niepotwierdzone; wyniki Gemma 4 12B to własne dane Google, od dawna używane przez społeczność.
• Co uruchamiasz — MiniCPM5-2B-DSpark: draft o 324 mln parametrów, działający tylko w parze z MiniCPM5-2B (gęsty model o 2,52 mld parametrów i 42 warstwach). Gemma 4 12B: jeden samodzielny gęsty model o 11,95 mld parametrów.
• Kontekst — MiniCPM5-2B: docelowo 128K natywnie. Gemma 4 12B: 256K natywnie.
• Modalność — stack MiniCPM5-2B: tylko tekst. Gemma 4 12B: tekst, obraz, audio i wideo na wejściu, bez enkodera.
Szkicowanie — MiniCPM5-2B-DSpark: zewnętrzny szkic DSpark, siedem tokenów na przebieg, silnik SGLang DSPARK. Gemma 4 12B: wewnętrzne modele szkicujące z przewidywaniem wielu tokenów, nic do instalowania.
• Rozmiar — MiniCPM5-2B zajmuje ok. 5 GB w BF16 plus ~650 MB plik pomocniczy; Gemma 4 12B ok. 18 GB w BF16, praktyczna na sprzęcie klasy 16 GB w wersji skwantowanej.
• Dowody — MiniCPM5-2B-DSpark: wyłącznie wskaźniki długości akceptacji z repozytorium, sprzed jednego dnia. Gemma 4 12B: ewaluacje z premiery oraz miesiące wdrożeń społecznościowych.

Tablica wyników powyżej to ten sam portret w sześciu rzędach: dwie kolumny nie zgadzają się co do prawie wszystkiego, z wyjątkiem strategii, której obie używają, by szybko pisać.
Która kategoria wagowa pasuje do krzemu, który faktycznie masz?
Ponieważ MiniCPM5-2B-DSpark nie jest modelem, istotna różnica dotyczy klasy wagowej docelowego modelu względem Gemmy 4 12B — i ta różnica to w większości kwestia sprzętu. Telefon, płyta inteligentnego kokpitu lub małe urządzenie brzegowe z kilkoma gigabajtami DRAM nie uniosą modelu 11,95B przy użytecznej prędkości; szyna pamięci jest właśnie wąskim gardłem, które by go zdławiło. To jest świat, dla którego stworzono zestaw MiniCPM5-2B — gęsty model 2B, którego wagi mieszczą się w pamięci urządzenia, z dołączonym modelem szkicowym, który ma odzyskać część tokenów na sekundę, jakie małe gęste modele oddają. Dekodowanie spekulatywne jest najskuteczniejsze właśnie w tym gęstym, ograniczonym pamięcią trybie, dlatego model szkicowy jest interesującą częścią wydania, a nie chwytem.
Gemma 4 12B to odpowiedź o jedną klasę wagową wyżej. Jeśli twój sprzęt ma 16 GB lub więcej — laptop, stacja robocza, wydajny serwer brzegowy — możesz udźwignąć multimodalnego generalistę i zyskujesz trzy rzeczy, których stos 2B nie może zaoferować: wejście obrazu, dźwięku i wideo bez enkoderów i drugiego potoku; okno 256K do pracy w skali repozytorium lub dokumentu; oraz dojrzałość, której jednodniowy szkic checkpointu po prostu nie ma. Rezygnujesz z możliwości działania na najmniejszych urządzeniach i płacisz mniej więcej trzykrotnie większym zużyciem pamięci.
Rzeczywistość routingu dla obu
Żadna ze stron tego pojedynku nie znajduje się dziś w hostowanym katalogu — w tym w katalogu OrcaRouter. MiniCPM5-2B-DSpark jest z definicji dodatkiem do samodzielnego serwowania modeli: samodzielnie uruchamiasz stos SGLang, a draft istnieje tylko w Twoim lokalnym wdrożeniu. Gemma 4 12B ma otwarte wagi, więc możesz ją serwować samodzielnie albo korzystać z niej tam, gdzie już jest dostępna. To właśnie sytuacja, w której warstwa routingu zwraca swój koszt jako siatka bezpieczeństwa, a nie mechanizm dostarczania: gdy testujesz nową kompilację draftu pod kątem obciążenia, które już obsługujesz, skierowanie ścieżki testowej przez jedno API z automatycznym przełączaniem awaryjnym oznacza, że nieprzetestowany stos może się zatrzymać bez wyłączania produkcji, a ceny dostawców wokół niego są przekazywane dalej bez marży, więc zmiana ceny dowolnego hostowanego modelu, z którym porównujesz, pojawia się tego samego dnia. Jeśli chodzi o samo porównanie, uczciwy plan dla obu modeli jest taki sam: hostujesz samodzielnie, więc liczy się benchmark, który uruchamiasz na własnym sprzęcie.
Werdykt
MiniCPM5-2B-DSpark i Gemma 4 12B nie są konkurentami w żadnym sensie bezpośredniego pojedynku — to dwie kategorie wagowe lokalnej AI, które akurat łączy jedna sztuczka. Wybierz stos MiniCPM5-2B z jego draftem DSpark, gdy twoje urządzenie nie jest w stanie udźwignąć modelu 12B, a chcesz model zdolny do pracy z tekstem, na licencji Apache-2.0, nastawiony na agentów, który mieści się w pamięci urządzenia; draft to obiecujące darmowe przyspieszenie, ale zmierz go na własnej kompilacji SGLang, zanim mu zaufasz, bo jego korzyść wciąż nie została skwantyfikowana. Wybierz model Gemma 4 12B, gdy twój sprzęt ma odpowiedni zapas wydajności i chcesz jeden multimodalny model z oknem kontekstowym 256K oraz ekosystemem, który za nim stoi. Pytanie nie brzmi, który model jest mądrzejszy — tylko który z nich twój krzem faktycznie zdoła nakarmić.
