Una hero card per il confronto 'MiniCPM5-2B-DSpark vs Gemma 4 12B' con il sottotitolo 'Due modi di abbozzare, due classi di peso dell'IA locale', che mostra a sinistra un piccolo chip etichettato '324M draft' che alimenta un blocco etichettato '2.5B on-device target' e a destra un pannello più ampio etichettato '11.95B multimodal generalist', con una linea di flusso di chip di token al di sopra etichettata 'draft then verify', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

MiniCPM5-2B-DSpark vs Gemma 4 12B: Due modi di abbozzare, due classi di peso dell'IA locale

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il modo più rapido per capire perché MiniCPM5-2B-DSpark e Gemma 4 12B meritino di stare sulla stessa pagina è ignorare per un momento le loro dimensioni e osservare come ciascuno scrive una frase. Entrambi aggirano il bus di memoria con un drafter: un piccolo modello propone diversi token successivi in una volta sola e il modello reale verifica il blocco in un'unica passata, così il silicio paga il costo del caricamento dei pesi una volta per blocco invece che una volta per token. MiniCPM5-2B-DSpark è il drafter che OpenBMB ha pubblicato in sordina su Hugging Face il 6 settembre 2026 — un checkpoint complementare da 323,8 milioni di parametri che accelera MiniCPM5-2B, il modello on-device denso da 2,52 miliardi di parametri che ModelBest ha annunciato al WAIC il 19 luglio 2026. Gemma 4 12B è il generalista multimodale senza encoder da 11,95 miliardi di parametri di Google, lanciato il 3 giugno 2026 con drafter integrati e un contesto di 256K. Uno vende il drafter come checkpoint Apache-2.0 separato che carichi tu stesso; l'altro nasconde un trucco simile dentro un unico grande modello che ti basta eseguire.

La nota di onestà che determina la forma di questo articolo: MiniCPM5-2B-DSpark non è un modello a cui puoi rivolgere prompt. Non ha tokenizer, né chat template, né output autonomo — una scheda che elenca solo un model.safetensors, un config e un README. È un accessorio del livello di serving pensato per un target della classe 2B, e il vero confronto che il lettore sta facendo è tra due classi di peso di IA locale: uno stack 2B grande quanto un telefono che genera i propri token, contro un generalista 12B da 16 gigabyte che genera i propri token. Tutto il resto qui sotto è quella decisione resa concreta.

Che cos'è realmente MiniCPM5-2B-DSpark

La model card è l'intera superficie pubblica del rilascio, quindi è tutto ciò che se ne può conoscere. MiniCPM5-2B-DSpark è un checkpoint draft DSpark: cinque layer full-attention, 323.776.001 parametri, grouped-query attention con 16 teste di query e 2 teste KV e una dimensione del blocco di sette — propone fino a sette token candidati per forward pass che il target MiniCPM5-2B deve verificare. La configurazione dichiara l'architettura Qwen3DSparkModel con un auto-map DSparkDraftModel e include la testa di confidenza e la testa di Markov del metodo DSpark (arXiv 2607.05147, l'articolo D​eepSeek del luglio 2026) ancora abilitate — il verificatore load-aware che decide quando non vale la pena verificare un suffisso. È stato addestrato per sei epoche su 7,05 miliardi di token di risposte generate da MiniCPM5-2B a prompt generali, matematici e di codice.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

La scheda openbmb/MiniCPM5-2B-DSpark qui sopra rappresenta l'intera portata di ciò che è stato rilasciato: scheda del modello, configurazione, un file Safetensors, e nessun annuncio, nessun post sul blog, nessun comunicato stampa — un rilascio silenzioso di pesi, vecchio di un giorno al momento della scrittura.

Ciò che la scheda non contiene è importante quanto ciò che contiene. Riporta la lunghezza di accettazione — nella valutazione del repository stesso, una media di 5,52 token accettati per passo di verifica con decodifica greedy, con 6,05 per la matematica e 6,11 per il codice su un massimo di sette token — ma non pubblica alcuna accelerazione in termini di tempo reale, nessun valore di token al secondo e nessun benchmark indipendente. Il motore DSPARK di SGLang è il percorso di servizio documentato, con il draft caricato accanto al target MiniCPM5-2B. In altre parole: la qualità del draft è quantificata, il suo beneficio pratico non ancora, e chiunque lo adotti dovrebbe misurare prima di credere.

Cosa porta Gemma 4 12B dall'altra parte

Gemma 4 12B è il figlio di mezzo della famiglia Gemma 4 di Google e si colloca su un punto completamente diverso della curva dell'IA locale. È un unico modello denso da 11,95 miliardi di parametri che accetta in input testo, immagini, audio e video senza encoder separati, supporta nativamente le chiamate a strumenti e abbina un contesto nativo di 256K a drafter a predizione multi-token che replicano internamente lo stesso trucco del memory-bus — ma a partire dal checkpoint, quindi non c'è nulla di extra da scaricare o collegare. È sotto licenza Apache 2.0, in pratica gira su un portatile da 16 GB, ed è arrivato con l'intero apparato Google: valutazioni di lancio, model card per le varianti base e instruction, supporto dell'ecosistema in Model Garden, LM Studio e Ollama. Vanta mesi di diffusione nella community, cosa che il draft MiniCPM, nato da un giorno, non ha.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

La scheda del modello di Google per Gemma 4 12B qui sopra è il contrasto in un unico fotogramma: un generalista multimodale maturo i cui redattori sono una caratteristica del rilascio, non un repository separato.

Le specifiche, onestamente etichettate

Leggeteli tenendo conto della fonte: i dati di MiniCPM5-2B sono dichiarazioni della scheda di ModelBest, non riprodotte in modo indipendente; i dati di Gemma 4 12B provengono direttamente da Google e sono da tempo esposti all'uso da parte della community.

• Cosa esegui — MiniCPM5-2B-DSpark: un modello draft da 324M che funziona solo in abbinamento a MiniCPM5-2B (2,52B di parametri densi, 42 layer). Gemma 4 12B: un modello denso e autonomo da 11,95B.

• Contesto — MiniCPM5-2B target: 128K nativo. Gemma 4 12B: 256K nativo.

• Modalità — stack MiniCPM5-2B: solo testo. Gemma 4 12B: input di testo, immagini, audio e video, senza encoder.

- Drafting — MiniCPM5-2B-DSpark: draft esterno DSpark, sette token per passaggio, motore SGLang DSPARK. Gemma 4 12B: drafters interni a predizione multi-token, nulla da installare.

• Ingombro — MiniCPM5-2B punta a circa 5 GB in BF16, più un file draft di ~650 MB; Gemma 4 12B occupa circa 18 GB in BF16, ed è in pratica utilizzabile su hardware di classe 16 GB in versione quantizzata.

• Prove — MiniCPM5-2B-DSpark: solo dati sui tempi di accettazione del repository, risalenti a un giorno fa. Gemma 4 12B: eval di lancio più mesi di distribuzione nella community.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

Il tabellone qui sopra è lo stesso ritratto in sei righe: le due colonne non concordano su quasi nulla, tranne che sulla strategia che entrambe usano per scrivere veloce.

Quale classe di peso si adatta al silicone che hai effettivamente?

Poiché MiniCPM5-2B-DSpark non è un modello, il bivio significativo è tra la classe di peso del modello target e quella di Gemma 4 12B — e questo bivio è per lo più una questione hardware. Un telefono, una scheda per smart cockpit o un piccolo edge box con pochi gigabyte di DRAM non possono eseguire un modello da 11,95B a una velocità utile; il bus di memoria è esattamente il collo di bottiglia che lo strozzerebbe. È questo il mondo per cui è stato pensato lo stack MiniCPM5-2B: un modello denso da 2B i cui pesi stanno nella memoria del dispositivo, con un draft aggiunto per recuperare alcuni dei token al secondo che i piccoli modelli densi perdono. La decodifica speculativa è più efficace proprio in questo regime denso e limitato dalla memoria, ed è per questo che il draft è la parte interessante della release, non un trucco.

Gemma 4 12B è la risposta una categoria di peso più su. Se la tua macchina ha 16 GB o più — un laptop, una workstation, un server edge robusto — puoi eseguire il generalista multimodale e ottieni tre cose che lo stack da 2B non può offrire: input di immagini, audio e video senza encoder né una seconda pipeline; una finestra di contesto da 256K per lavorare su scala di repository o di documenti; e una maturità che un checkpoint di bozza di un giorno semplicemente non ha. Rinunci alla possibilità di girare sui dispositivi più piccoli e paghi un ingombro di memoria circa tre volte superiore.

La realtà del routing per entrambi

Nessuna delle due parti di questo confronto è oggi presente in un catalogo hosted, incluso quello di OrcaRouter. MiniCPM5-2B-DSpark è per definizione un componente accessorio di serving self-hosted: lo stack SGLang lo esegui tu, e il draft esiste solo nel tuo deployment locale. Gemma 4 12B è open-weight, quindi puoi servirlo tu oppure usarlo dove è già disponibile. Questa è esattamente la situazione in cui un routing layer dimostra il proprio valore come rete di sicurezza piuttosto che come meccanismo di erogazione: quando provi una build draft nuova di zecca su un carico di lavoro che già servi, instradare il percorso di test attraverso un'unica API con failover automatico significa che uno stack non collaudato può bloccarsi senza mandare giù la produzione, e i prezzi di listino dei provider coinvolti passano con un markup dello 0%, quindi una variazione di prezzo su qualsiasi modello hosted che confronti compare il giorno stesso. Per il confronto in sé, però, la strategia onesta per entrambi i modelli è la stessa: stai facendo self-hosting, quindi il benchmark che conta è quello che esegui sul tuo hardware.

Il verdetto

MiniCPM5-2B-DSpark e Gemma 4 12B non sono concorrenti in nessun confronto diretto — sono due categorie di peso dell'IA locale che condividono un trucco. Scegli lo stack MiniCPM5-2B con il suo draft DSpark quando il tuo dispositivo non può reggere un modello da 12B e vuoi un modello orientato agli agenti, in grado di gestire testo, con licenza Apache-2.0 e che stia nella memoria del dispositivo; il draft è una promettente accelerazione gratuita, ma misuralo sulla tua build di SGLang prima di fidartene, perché il suo beneficio non è ancora quantificato. Scegli Gemma 4 12B quando il tuo hardware ha il margine necessario e vuoi un unico modello multimodale con una finestra da 256K e un ecosistema alle spalle. La questione non è quale modello sia più intelligente — è quale il tuo silicio riesca davvero ad alimentare.