
MiniCPM5-2B-DSpark mot Gemma 4 12B: Två sätt att skriva utkast, två viktklasser av lokal AI
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Det snabbaste sättet att se varför MiniCPM5-2B-DSpark och Gemma 4 12B hör hemma på samma sida är att för ett ögonblick bortse från deras storlekar och se hur var och en skriver en mening. Båda kringgår minnesbussen med en drafter: en liten modell föreslår flera nästföljande tokens samtidigt, och den riktiga modellen verifierar blocket i en enda genomgång – så att processorn betalar kostnaden för att läsa in vikterna en gång per block i stället för en gång per token. MiniCPM5-2B-DSpark är den drafter som OpenBMB tyst lade upp på Hugging Face den 6 september 2026 – en medföljande checkpoint med 323,8 miljoner parametrar som accelererar MiniCPM5-2B, den täta on-device-modellen med 2,52 miljarder parametrar som ModelBest presenterade på WAIC den 19 juli 2026. Gemma 4 12B är Googles encoderfria multimodala generalist på 11,95 miljarder parametrar, lanserad den 3 juni 2026 med egna inbyggda drafters och ett kontextfönster på 256K. Den ena erbjuder draftern som en separat Apache-2.0-checkpoint som du laddar själv; den andra gömmer ett liknande knep i en enda stor modell som du bara kör.
Den ärliga noteringen som avgör formen på denna artikel: MiniCPM5-2B-DSpark är inte en modell som du kan prompta. Den har varken tokenizer, chattmall eller fristående utdata – ett kort som endast listar en model.safetensors, en config och en README. Det är ett tillbehör i serveringslagret för en målmodell i 2B-klassen, och den verkliga jämförelsen en läsare gör är mellan två lokala AI-viktklasser: en 2B-stack i telefonstorlek som genererar sina tokens, kontra en 16-gigabyte 12B-generalist som genererar sina tokens. Allt annat nedan är det beslutet konkretiserat.
Vad MiniCPM5-2B-DSpark faktiskt är
Modellkortet är hela releasens publika yta, så det är vad som går att veta från den. MiniCPM5-2B-DSpark är en DSpark draft-checkpoint: fem full-attention-lager, 323 776 001 parametrar, grupperad query-attention med 16 query-huvuden och 2 KV-huvuden samt en blockstorlek på sju — den föreslår upp till sju kandidattokens per forward pass, vilka MiniCPM5-2B-målmodellen ska verifiera. Konfigurationen deklarerar Qwen3DSparkModel-arkitekturen med en DSparkDraftModel auto-map, och den levereras med konfidenshuvudet och Markov-huvudet från DSpark-metoden (arXiv 2607.05147, DeepSeeks artikel från juli 2026) fortfarande aktiverade — den belastningsmedvetna verifieraren som avgör när ett suffix inte är värt att kontrollera. Den tränades i sex epoker på 7,05 miljarder tokens från MiniCPM5-2B-genererade svar för allmänna, matematiska och kodrelaterade promptar.

Kortet för openbmb/MiniCPM5-2B-DSpark ovan är hela omfattningen av det som levererades: modellkort, konfiguration, en Safetensors-fil och inget tillkännagivande, inget blogginlägg, inget pressmeddelande — ett stilla viktsläpp som vid skrivande stund är en dag gammalt.
Vad kortet inte innehåller är lika viktigt som vad det innehåller. Det rapporterar acceptanslängd – på repons egen utvärdering, ett aggregerat mått på 5,52 accepterade tokens per verifieringssteg vid girig avkodning, med matematik på 6,05 och kod på 6,11 av taket på sju tokens – men det publicerar ingen verklig tidsvinst, ingen siffra för tokens per sekund och inget oberoende benchmark. SGLang:s DSPARK-motor är den dokumenterade serveringsvägen, med utkastet inläst bredvid MiniCPM5-2B-målet. Med andra ord: utkastets kvalitet är kvantifierad, men dess utdelning är det inte ännu, och den som inför det bör mäta innan den tror.
Vad Gemma 4 12B bidrar med på andra sidan
Gemma 4 12B är mellanbarnet i Googles Gemma 4-familj och befinner sig på en helt annan punkt på kurvan för lokal AI. Den är en enda tät modell på 11,95 miljarder parametrar som tar emot text, bild, ljud och video utan separata enkodare, hanterar verktygsanrop direkt ur lådan och kombinerar ett inbyggt 256K-kontextfönster med drafters för multi-token-prediktion. De gör samma minnesbusstrick internt – men inifrån checkpointen, så du behöver inte ladda ner eller koppla in något extra. Den är licensierad under Apache 2.0, körs i praktiken på en laptop med 16 GB RAM och kom med hela Googles maskineri: lanseringsutvärderingar, modellkort för bas- och instruktionsvarianterna samt ekosystemstöd inom Model Garden, LM Studio och Ollama. Den har månader av community-drift bakom sig, vilket den endagarsgamla MiniCPM-draften inte har.

Googles modellkort för Gemma 4 12B ovan är kontrasten i en enda bild: en mogen multimodal generalist vars drafter-modeller är en del av releasen, inte ett separat repo.
Specifikationerna, ärligt märkta
Läs dessa med källorna i åtanke: MiniCPM5-2B-siffrorna är ModelBests kortpåståenden, ej reproducerade; Gemma 4 12B-siffrorna är Googles egna, länge utsatta för community-användning.
• Vad du kör — MiniCPM5-2B-DSpark: en 324M-draftmodell som bara fungerar tillsammans med MiniCPM5-2B (2,52B tät, 42 lager). Gemma 4 12B: en fristående 11,95B tät modell.
• Kontext — MiniCPM5-2B mål: 128K nativ. Gemma 4 12B: 256K nativ.
• Modalitet — MiniCPM5-2B-stacken: endast text. Gemma 4 12B: text-, bild-, ljud- och videoinmatning, encoderfri.
• Drafting — MiniCPM5-2B-DSpark: extern DSpark-draft, sju token per pass, SGLang DSPARK-motor. Gemma 4 12B: interna drafters för multi-token-prediktion, inget att installera.
• Fotavtryck — MiniCPM5-2B: cirka 5 GB i BF16 plus en ~650 MB-draftfil; Gemma 4 12B: cirka 18 GB i BF16, praktisk i kvantiserad form på hårdvara i 16 GB-klassen.
• Bevis — MiniCPM5-2B-DSpark: endast en dag gamla siffror för repots acceptanslängd. Gemma 4 12B: utvärderingar från lanseringen plus månader av communitydrift.

Resultattavlan ovan är samma porträtt i sex rader: de två kolumnerna är oense om nästan allt utom den strategi som båda använder för att skriva snabbt.
Vilken viktklass passar det kisel du faktiskt har?
Eftersom MiniCPM5-2B-DSpark inte är en modell, är den meningsfulla skillnaden mellan målmodellens viktklass och Gemma 4 12B:s — och den skillnaden är mestadels en hårdvarufråga. En telefon, ett smart-cockpit-kort eller en liten edgebox med några gigabyte DRAM kan inte bära en modell på 11,95B i användbar hastighet; minnesbussen är just den flaskhals som skulle kväva den. Det är den värld som MiniCPM5-2B-stacken byggdes för — en tät 2B-modell vars vikter ryms i enhetens minne, med en draft påkopplad för att köpa tillbaka en del av de tokens per sekund som små täta modeller ger bort. Spekulativ avkodning är mest effektiv just i denna täta, minnesbundna regim, vilket är anledningen till att draften är den intressanta delen av releasen snarare än ett gimmick.
Gemma 4 12B är svaret en viktklass upp. Om din dator har 16 GB eller mer — en bärbar dator, en arbetsstation, en rejäl edge-server — kan du bära multimodalgeneralisten, och du får tre saker som 2B-stacken inte kan erbjuda: bild-, ljud- och videoinmatning utan encoder eller en andra pipeline; ett 256K-kontextfönster för arbete i repositorieskala eller dokumentskala; och en mognad som en dagsgammal utkast-checkpoint helt enkelt inte har. Du avstår från möjligheten att köra på de minsta enheterna och betalar ungefär tre gånger så mycket i minnesfotavtryck.
Routningsverkligheten för båda
Ingen av de två modellerna i denna jämförelse finns i en värdkatalog idag, OrcaRouters katalog inkluderad. MiniCPM5-2B-DSpark är per definition ett tillbehör för självhostad serving – du kör SGLang-stacken själv, och utkastet finns bara i din lokala driftsättning. Gemma 4 12B har öppna vikter, så du kan drifta den eller använda den där den redan finns tillgänglig. Det är precis den situation där ett routningslager gör skäl för sin plats som säkerhetsnät snarare än som leveransmekanism: när du testar en helt ny utkastsversion mot en arbetsbelastning du redan servar, innebär att leda testvägen genom ett API med automatisk failover att en oprövad stack kan stanna utan att ta ned produktionen, och leverantörernas listpriser kring det förs vidare med 0 % påslag, så en prisändring på en värdmodell du jämför med slår igenom samma dag. För själva jämförelsen är dock den ärliga planen densamma för båda modellerna: du selfhostar, så det benchmark som räknas är det du kör på din egen hårdvara.
Domen
MiniCPM5-2B-DSpark och Gemma 4 12B är inte konkurrenter i någon direkt jämförelse — de utgör två viktklasser av lokal AI som råkar dela ett knep. Välj MiniCPM5-2B-stacken med dess DSpark-draft när din enhet inte klarar av en 12B-modell och du vill ha en Apache-2.0-licensierad, agentorienterad modell som kan hantera text och får plats i enhetens minne; draften är en lovande kostnadsfri prestandaökning, men mät den med din egen SGLang-build innan du litar på den, eftersom den faktiska nyttan ännu inte har kvantifierats. Välj Gemma 4 12B när din hårdvara har utrymme och du vill ha en enda multimodal modell med ett kontextfönster på 256K och ett ekosystem bakom sig. Frågan är inte vilken modell som är smartare — det är vilken som din hårdvara faktiskt kan driva.
