En hero-titelbild för jämförelsen ’MiniCPM5-2B-DSpark vs Gemma 4 12B’ med underrubriken ’Två sätt att skapa utkast, två viktklasser för lokal AI’, som till vänster visar ett litet chip märkt ’324M-utkast’ som matar ett block märkt ’2,5B-mål på enheten’ och till höger en bredare panel märkt ’11,95B multimodal generalist’, med en flödeslinje av token-chip ovanför märkt ’utkast först, verifiering sedan’ och OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

MiniCPM5-2B-DSpark mot Gemma 4 12B: Två sätt att skriva utkast, två viktklasser av lokal AI

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det snabbaste sättet att se varför MiniCPM5-2B-DSpark och Gemma 4 12B hör hemma på samma sida är att för ett ögonblick bortse från deras storlekar och se hur var och en skriver en mening. Båda kringgår minnesbussen med en drafter: en liten modell föreslår flera nästföljande tokens samtidigt, och den riktiga modellen verifierar blocket i en enda genomgång – så att processorn betalar kostnaden för att läsa in vikterna en gång per block i stället för en gång per token. MiniCPM5-2B-DSpark är den drafter som OpenBMB tyst lade upp på Hugging Face den 6 september 2026 – en medföljande checkpoint med 323,8 miljoner parametrar som accelererar MiniCPM5-2B, den täta on-device-modellen med 2,52 miljarder parametrar som ModelBest presenterade på WAIC den 19 juli 2026. Gemma 4 12B är Googles encoderfria multimodala generalist på 11,95 miljarder parametrar, lanserad den 3 juni 2026 med egna inbyggda drafters och ett kontextfönster på 256K. Den ena erbjuder draftern som en separat Apache-2.0-checkpoint som du laddar själv; den andra gömmer ett liknande knep i en enda stor modell som du bara kör.

Den ärliga noteringen som avgör formen på denna artikel: MiniCPM5-2B-DSpark är inte en modell som du kan prompta. Den har varken tokenizer, chattmall eller fristående utdata – ett kort som endast listar en model.safetensors, en config och en README. Det är ett tillbehör i serveringslagret för en målmodell i 2B-klassen, och den verkliga jämförelsen en läsare gör är mellan två lokala AI-viktklasser: en 2B-stack i telefonstorlek som genererar sina tokens, kontra en 16-gigabyte 12B-generalist som genererar sina tokens. Allt annat nedan är det beslutet konkretiserat.

Vad MiniCPM5-2B-DSpark faktiskt är

Modellkortet är hela releasens publika yta, så det är vad som går att veta från den. MiniCPM5-2B-DSpark är en DSpark draft-checkpoint: fem full-attention-lager, 323 776 001 parametrar, grupperad query-attention med 16 query-huvuden och 2 KV-huvuden samt en blockstorlek på sju — den föreslår upp till sju kandidattokens per forward pass, vilka MiniCPM5-2B-målmodellen ska verifiera. Konfigurationen deklarerar Qwen3DSparkModel-arkitekturen med en DSparkDraftModel auto-map, och den levereras med konfidenshuvudet och Markov-huvudet från DSpark-metoden (arXiv 2607.05147, DeepSeeks artikel från juli 2026) fortfarande aktiverade — den belastningsmedvetna verifieraren som avgör när ett suffix inte är värt att kontrollera. Den tränades i sex epoker på 7,05 miljarder tokens från MiniCPM5-2B-genererade svar för allmänna, matematiska och kodrelaterade promptar.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

Kortet för openbmb/MiniCPM5-2B-DSpark ovan är hela omfattningen av det som levererades: modellkort, konfiguration, en Safetensors-fil och inget tillkännagivande, inget blogginlägg, inget pressmeddelande — ett stilla viktsläpp som vid skrivande stund är en dag gammalt.

Vad kortet inte innehåller är lika viktigt som vad det innehåller. Det rapporterar acceptanslängd – på repons egen utvärdering, ett aggregerat mått på 5,52 accepterade tokens per verifieringssteg vid girig avkodning, med matematik på 6,05 och kod på 6,11 av taket på sju tokens – men det publicerar ingen verklig tidsvinst, ingen siffra för tokens per sekund och inget oberoende benchmark. SGLang:s DSPARK-motor är den dokumenterade serveringsvägen, med utkastet inläst bredvid MiniCPM5-2B-målet. Med andra ord: utkastets kvalitet är kvantifierad, men dess utdelning är det inte ännu, och den som inför det bör mäta innan den tror.

Vad Gemma 4 12B bidrar med på andra sidan

Gemma 4 12B är mellanbarnet i Googles G​emma 4-familj och befinner sig på en helt annan punkt på kurvan för lokal AI. Den är en enda tät modell på 11,95 miljarder parametrar som tar emot text, bild, ljud och video utan separata enkodare, hanterar verktygsanrop direkt ur lådan och kombinerar ett inbyggt 256K-kontextfönster med drafters för multi-token-prediktion. De gör samma minnesbusstrick internt – men inifrån checkpointen, så du behöver inte ladda ner eller koppla in något extra. Den är licensierad under Apache 2.0, körs i praktiken på en laptop med 16 GB RAM och kom med hela Googles maskineri: lanseringsutvärderingar, modellkort för bas- och instruktionsvarianterna samt ekosystemstöd inom Model Garden, LM Studio och Ollama. Den har månader av community-drift bakom sig, vilket den endagarsgamla MiniCPM-draften inte har.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

Googles modellkort för Gemma 4 12B ovan är kontrasten i en enda bild: en mogen multimodal generalist vars drafter-modeller är en del av releasen, inte ett separat repo.

Specifikationerna, ärligt märkta

Läs dessa med källorna i åtanke: MiniCPM5-2B-siffrorna är ModelBests kortpåståenden, ej reproducerade; Gemma 4 12B-siffrorna är Googles egna, länge utsatta för community-användning.

• Vad du kör — MiniCPM5-2B-DSpark: en 324M-draftmodell som bara fungerar tillsammans med MiniCPM5-2B (2,52B tät, 42 lager). Gemma 4 12B: en fristående 11,95B tät modell.

• Kontext — MiniCPM5-2B mål: 128K nativ. Gemma 4 12B: 256K nativ.

• Modalitet — MiniCPM5-2B-stacken: endast text. Gemma 4 12B: text-, bild-, ljud- och videoinmatning, encoderfri.

• Drafting — MiniCPM5-2B-DSpark: extern DSpark-draft, sju token per pass, SGLang DSPARK-motor. Gemma 4 12B: interna drafters för multi-token-prediktion, inget att installera.

• Fotavtryck — MiniCPM5-2B: cirka 5 GB i BF16 plus en ~650 MB-draftfil; Gemma 4 12B: cirka 18 GB i BF16, praktisk i kvantiserad form på hårdvara i 16 GB-klassen.

• Bevis — MiniCPM5-2B-DSpark: endast en dag gamla siffror för repots acceptanslängd. Gemma 4 12B: utvärderingar från lanseringen plus månader av communitydrift.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

Resultattavlan ovan är samma porträtt i sex rader: de två kolumnerna är oense om nästan allt utom den strategi som båda använder för att skriva snabbt.

Vilken viktklass passar det kisel du faktiskt har?

Eftersom MiniCPM5-2B-DSpark inte är en modell, är den meningsfulla skillnaden mellan målmodellens viktklass och Gemma 4 12B:s — och den skillnaden är mestadels en hårdvarufråga. En telefon, ett smart-cockpit-kort eller en liten edgebox med några gigabyte DRAM kan inte bära en modell på 11,95B i användbar hastighet; minnesbussen är just den flaskhals som skulle kväva den. Det är den värld som MiniCPM5-2B-stacken byggdes för — en tät 2B-modell vars vikter ryms i enhetens minne, med en draft påkopplad för att köpa tillbaka en del av de tokens per sekund som små täta modeller ger bort. Spekulativ avkodning är mest effektiv just i denna täta, minnesbundna regim, vilket är anledningen till att draften är den intressanta delen av releasen snarare än ett gimmick.

Gemma 4 12B är svaret en viktklass upp. Om din dator har 16 GB eller mer — en bärbar dator, en arbetsstation, en rejäl edge-server — kan du bära multimodalgeneralisten, och du får tre saker som 2B-stacken inte kan erbjuda: bild-, ljud- och videoinmatning utan encoder eller en andra pipeline; ett 256K-kontextfönster för arbete i repositorieskala eller dokumentskala; och en mognad som en dagsgammal utkast-checkpoint helt enkelt inte har. Du avstår från möjligheten att köra på de minsta enheterna och betalar ungefär tre gånger så mycket i minnesfotavtryck.

Routningsverkligheten för båda

Ingen av de två modellerna i denna jämförelse finns i en värdkatalog idag, OrcaRouters katalog inkluderad. MiniCPM5-2B-DSpark är per definition ett tillbehör för självhostad serving – du kör SGLang-stacken själv, och utkastet finns bara i din lokala driftsättning. Gemma 4 12B har öppna vikter, så du kan drifta den eller använda den där den redan finns tillgänglig. Det är precis den situation där ett routningslager gör skäl för sin plats som säkerhetsnät snarare än som leveransmekanism: när du testar en helt ny utkastsversion mot en arbetsbelastning du redan servar, innebär att leda testvägen genom ett API med automatisk failover att en oprövad stack kan stanna utan att ta ned produktionen, och leverantörernas listpriser kring det förs vidare med 0 % påslag, så en prisändring på en värdmodell du jämför med slår igenom samma dag. För själva jämförelsen är dock den ärliga planen densamma för båda modellerna: du selfhostar, så det benchmark som räknas är det du kör på din egen hårdvara.

Domen

MiniCPM5-2B-DSpark och Gemma 4 12B är inte konkurrenter i någon direkt jämförelse — de utgör två viktklasser av lokal AI som råkar dela ett knep. Välj MiniCPM5-2B-stacken med dess DSpark-draft när din enhet inte klarar av en 12B-modell och du vill ha en Apache-2.0-licensierad, agentorienterad modell som kan hantera text och får plats i enhetens minne; draften är en lovande kostnadsfri prestandaökning, men mät den med din egen SGLang-build innan du litar på den, eftersom den faktiska nyttan ännu inte har kvantifierats. Välj Gemma 4 12B när din hårdvara har utrymme och du vill ha en enda multimodal modell med ett kontextfönster på 256K och ett ekosystem bakom sig. Frågan är inte vilken modell som är smartare — det är vilken som din hårdvara faktiskt kan driva.