Una card titolo hero generata per MiniCPM5-2B-DSpark con il sottotitolo "OpenBMB ha reso pubblici in silenzio i pesi di MiniCPM5-2B — e ha rilasciato un piccolo modello draft per renderlo veloce", che mostra un telefono e un laptop, ciascuno con un chip "2B" dagli angoli arrotondati, un chip "Draft 0.3B" più piccolo che alimenta il chip più grande con sette token a freccia in avanti, un indicatore di velocità con l'ago rivolto verso l'alto e un'icona di campana disattivata, con il logo OrcaRouter incorporato nell'angolo in basso a destra.
Guides & Insights

MiniCPM5-2B-DSpark: OpenBMB rilascia silenziosamente i pesi di MiniCPM5-2B con un modello draft progettato per la velocità

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Sei settimane fa MiniCPM5-2B era una promessa. Presentato alla conferenza WAIC di Shanghai il 19 luglio 2026 come modello sub-4B in cima all'Artificial Analysis Index, era accompagnato da una nota di roadmap secondo cui i pesi aperti sarebbero arrivati "presto". Quel "presto" è arrivato questa settimana, senza alcun clamore. Il 6 settembre 2026 OpenBMB ha caricato il repository di punta MiniCPM5-2B su Hugging Face con licenza Apache-2.0 e, ventuno minuti dopo, ha caricato MiniCPM5-2B-DSpark — un checkpoint draft da 323,8 milioni di parametri il cui unico compito è rendere più veloce la decodifica di MiniCPM5-2B con l'algoritmo di decodifica speculativa DSpark. Il 7 settembre 2026 è seguita una build GPTQ. Al momento in cui scriviamo non c'è alcun annuncio, nessun post di lancio e nessuna voce di changelog che abbiamo potuto trovare; il rilascio è emerso con repository resi pubblici in silenzio nell'arco di undici giorni.

Questo è un articolo su ciò che sappiamo finora, e la cornice è importante. MiniCPM5-2B-DSpark non è un chatbot autonomo né un nuovo modello di punta — è un acceleratore: un modello piccolo e veloce che propone token prima di MiniCPM5-2B, il quale poi li verifica in parallelo. È inutile senza il suo target, e il target è il motivo per cui vale la pena interessarsene. Il rilascio open-weight di MiniCPM5-2B che OpenBMB aveva promesso a luglio ora è effettivamente su Hugging Face, e il modello draft distribuito insieme ad esso è il meccanismo che il fornitore raccomanda per eseguirlo a una velocità utile. Tutto ciò che non è esplicitamente attribuito di seguito è letto direttamente dalle due schede dei modelli e dai loro repository.

Cosa è stato spedito, e quando

La famiglia 2B è stata resa pubblica come un rilascio progressivo e non annunciato, con gli ultimi arrivi per primi:

2026-08-27 — Appaiono MiniCPM5-2B-Base e MiniCPM5-2B-SFT, i checkpoint grezzi pre-addestrati e con fine-tuning supervisionato.

• 2026-09-01 — MiniCPM5-2B-Midtrain, la fase di mid-training agentico.

• 2026-09-05 — MiniCPM5-2B-MLX e MiniCPM5-2B-GGUF, i formati Apple-Silicon e llama.cpp.

• 2026-09-06 — il repository di punta MiniCPM5-2B, poi MiniCPM5-2B-DSpark ventuno minuti dopo.

• 2026-09-07 — MiniCPM5-2B-GPTQ, il formato di serving quantizzato.

Tutti portano la licenza Apache-2.0, che ModelBest ha utilizzato per la famiglia MiniCPM5-1B a maggio, e i checkpoint precedenti nella sequenza mostrano ancora un segnale praticamente nullo dalla community — una manciata di download e mi piace ciascuno. Questo è il segno di un rilascio dei pesi in corso piuttosto che di un lancio coordinato: gli artefatti compaiono in ordine di dipendenza (prima base e SFT, poi formati quantizzati e draft per ultimi) senza che un singolo giorno funga da data di rilascio.

Che cos'è realmente MiniCPM5-2B-DSpark

La decodifica speculativa divide la generazione in un proponente economico e un verificatore costoso. Un piccolo modello di bozza predice i prossimi token; il modello grande controlla tutte le previsioni in un singolo passaggio in avanti e accetta quelle con cui concorda. Quando la bozza è ben calibrata, si ottiene l'output del modello grande a una frazione del costo; quando invece è sbagliata, si spreca solo un passo di verifica. DSpark è una ricetta specifica per questa idea, tratta da un articolo pubblicato il 6 luglio 2026 (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). Due scelte progettuali la distinguono: abbina un backbone parallelo per il drafter a un modulo sequenziale leggero, così che i token all'interno di un blocco proposto dipendano l'uno dall'altro anziché perdere accuratezza verso la fine del blocco, e dimensiona ogni run di verifica per richiesta in base a stime di confidenza e throughput del motore, invece di verificare sempre un blocco di lunghezza fissa.

Il modello draft DSpark rilasciato da OpenBMB è un Transformer a cinque layer con 323,8 milioni di parametri in BF16 (circa 648 MB). Si basa sulla famiglia di architetture Q​wen3 ma include aggiunte specifiche di DSpark: un proiettore che legge gli stati nascosti di MiniCPM5-2B da cinque dei layer del modello target (1, 10, 20, 30 e 39), una confidence head e una piccola Markov head che modella la distribuzione del token successivo. La sua configurazione propone un blocco di sette token per ogni forward pass. Con circa un ottavo dei 2,5 miliardi di parametri di MiniCPM5-2B, è uno dei modelli draft più piccoli rilasciati per un checkpoint open mainstream — ed è proprio questo il punto in un modello orientato all'edge: il draft deve essere abbastanza economico da far sì che eseguire due modelli su un unico dispositivo sia comunque più conveniente che eseguirne uno solo.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, text-generation, edge-ai and custom_code, the linked arxiv papers, the MiniCPM5 target reference, and the opening card line "MiniCPM5-2B-DSpark is a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer."

Il repository sopra è l'intera superficie pubblica del modello bozza: un README, una configurazione, un singolo file safetensors e una scheda del modello la cui descrizione dell'addestramento mostra 1.959.525 sequenze (7,05B token) generate da MiniCPM5-2B da prompt di carattere generale, matematico e di codice, addestrato per sei epoche con un obiettivo combinato di entropia incrociata, L1 e confidenza. Non vi è alcun utilizzo del checkpoint come modello generativo autonomo.

I numeri pubblicati da OpenBMB, onestamente etichettati.

La scheda del modello draft riporta una cifra che conta — la lunghezza di accettazione, il numero medio di token proposti che il target accetta da ogni blocco di sette token. La valutazione è stata eseguita sugli output di MiniCPM5-2B in tre domini, fino a 4.096 token generati:

• Matematica — in media 6.05 token accettati con decodifica greedy (T=0); 4.61 con campionamento a T=1.0.

• Codice — 6.11 con greedy; 4.44 con campionamento.

• Generale — 4.16 greedy; 3.10 campionato.

• Aggregato — 5.52 greedy; 4.05 campionato, su un massimo di sette.

Queste cifre sono dichiarate dal fornitore nella model card e non sono state riprodotte in modo indipendente. Descrivono inoltre l'hit rate del draft, non uno speedup a tempo di clock: la velocità è una misura di serving che dipende dal costo del passaggio di verifica del target rispetto al passaggio di proposta del draft, dall'occupazione del batch e dall'azione del confidence scheduler di DSpark, che riduce la lunghezza della verifica. OpenBMB non ha pubblicato alcun dato in token al secondo per la coppia. Per avere un'idea del tetto massimo del metodo, il paper di DSpark riporta una generazione per utente più veloce del 60–85% a parità di throughput rispetto alla baseline MTP-1 nel sistema di serving live di Deep​Seek — un punto di riferimento utile per ciò che l'algoritmo ha fatto altrove, non un'affermazione su MiniCPM5-2B sul tuo hardware.

A generated single-column scoreboard for MiniCPM5-2B-DSpark listing Draft params 323.8M, 5 layers; Draft tokens per forward pass 7; Target model MiniCPM5-2B, 42 layers; Greedy acceptance length 5.52 of 7; Confidence + Markov heads enabled; License Apache-2.0, with the footer "Acceptance figures from OpenBMB's model card; not independently reproduced" and the OrcaRouter logo composited in the bottom-right corner.

Il tabellone qui sopra è la scheda tecnica della release stessa. Leggi il dato di accettazione come un tasso di hit di bozza; il moltiplicatore sul throughput reale è ciò che un run SGLang indipendente deve ancora misurare.

Il modello che la bozza accelera.

MiniCPM5-2B è un Transformer denso da 2,5 miliardi di parametri — 2.516.756.480 in totale — con 42 layer, 16 query head e 2 KV head, un vocabolario di 130.560 token e una finestra di contesto di 131.072 token, in BF16 (circa 5 GB). Architettonicamente è volutamente convenzionale: una LlamaForCausalLM standard, senza kernel personalizzati e senza fork del codice del modello; ed è esattamente per questo che è portabile su moltissimi runtime e target di chip. Nella suite di benchmark interna di OpenBMB, la scheda del modello riporta una media di 53,9 su ragionamento, capacità di seguire le istruzioni, conoscenza, contesto lungo, uso di strumenti, coding e agenti di ricerca — davanti a Qwen3.5-4B (51,1) e a granite-4.2-3B (42,7) nella stessa tabella, con diverse celle (GPQA-Diamond 70,2, HLE 8,9 e varie righe su contesto lungo e attività agentiche) segnalate come provenienti da Artificial Analysis, non riprodotte internamente. Le principali celle per singolo task includono MATH-500 a 94,6, AIME 2025 e 2026 a 86,5, IFEval a 86,7, MMLU-Pro a 70,8 e SWE-bench Verified a 46,4. Questi sono i numeri del fornitore sulla suite del fornitore, e la scheda dichiara esplicitamente che alcune righe provengono da terze parti; trattate il mix di conseguenza.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, English, Chinese, long-context, tool-calling and edge-ai, the arxiv links, and the opening Highlights line "We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B."

Alla presentazione di luglio, i materiali di lancio di ModelBest citavano un punteggio Artificial Analysis Index di 17 — primo tra i modelli sotto i 4B di parametri — e la copertura di luglio menzionava una finestra di 512K token. I checkpoint effettivamente distribuiti configurano 131.072 token di contesto. Laddove una cifra di marketing del giorno del lancio e una configurazione distribuita divergono, è la configurazione il numero che determina ciò che puoi effettivamente eseguire, e questa discrepanza è bene conoscerla prima di pianificare un carico di lavoro a contesto lungo basandoti sulla cifra di marketing.

Eseguire MiniCPM5-2B con il suo modello draft

Il percorso indicato è SGLang, che supporta l'algoritmo DSpark a monte dalla v0.5.16 — la versione minima richiesta dalla scheda del modello. Il comando di servizio completo dalla scheda:

python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7

Sotto decodifica greedy (T=0), la verifica DSpark è senza perdite: l'output è identico al serving di MiniCPM5-2B da solo, il che rende il draft un puro vantaggio in termini di latenza. Con il campionamento abilitato, DSpark di SGLang usa per impostazione predefinita il campionamento del solo target, con campionamento a rifiuto opzionale. OpenBMB documenta anche il caricamento standard di Transformers (transformers ≥ 5.6) e il serving del target da solo con vLLM ≥ 0.21, oltre a un parser di chiamate agli strumenti minicpm5 per carichi di lavoro agentici; il percorso speculativo DSPARK in particolare è di SGLang.

Il calcolo hardware è la vera questione per una coppia di classe edge: circa 5GB per MiniCPM5-2B in BF16 più circa 0,65GB per il draft. La combinazione draft-più-target si adatta comodamente ovunque il solo modello da 2B era già utilizzabile, che è esattamente il motivo per cui conviene distribuire un draft così piccolo invece di un secondo modello più grande.

Cosa non è confermato

• Non esiste alcun annuncio che siamo riusciti a trovare — nessun blog di {{1}}OpenBMB{{/1}} o {{2}}ModelBest{{/2}}, nessun post social in inglese o cinese. La caratterizzazione {{3}}"rilasciato in silenzio"{{/3}} è letterale, e l'unica presenza pubblica è la collection di Hugging Face.

• Nessuna valutazione indipendente. Le lunghezze di accettazione della bozza e la media di suite del 53,9 di MiniCPM5-2B sono dichiarate dal fornitore e non riprodotte; le celle contrassegnate AA sono di terze parti, ma sono valori istantanei, non esecuzioni di questi pesi esatti.

• Nessuna API ospitata disponibile che riusciamo a trovare, quindi oggi l'adozione significa eseguire i checkpoint da soli. Un mirror ModelScope, promesso nella copertura di luglio dell'annuncio, non era visibile al momento della stesura.

• Nessuna cifra di accelerazione wall-clock per la coppia DSPARK. Una lunghezza di accettazione di 5.52 è un tasso di successo elevato, ma "quante volte più veloce" su una data GPU è esattamente il numero che OpenBMB non ha pubblicato.

• La suddetta ambiguità relativa alla finestra di contesto: i materiali di marketing indicavano 512K, la configurazione distribuita indica 131.072 e nulla nei repository collega i due valori.

Dove si colloca un tranquillo rilascio open-weight in uno stack

Oggi, la lettura onesta di MiniCPM5-2B è che {{1}}si tratta di una scommessa{{/1}}: numeri importanti dichiarati dal vendor, zero run indipendenti, nessuno storico di serving e un modello draft la cui accelerazione nel mondo reale non è stata misurata. {{2}}È esattamente questa la situazione{{/2}} per cui esiste un livello di routing. Un team che voglia verificare se l'output di un piccolo modello open source possa sostituire un modello hosted a cui già fa chiamate può eseguire il confronto da un'unica API — OrcaRouter dà accesso a oltre 200 modelli hosted al prezzo di listino del provider, senza alcun ricarico, quindi attivare una settimana di valutazione non costa nulla, e il failover automatico garantisce che {{3}}un checkpoint vecchio di pochi giorni non debba mai tenere in ostaggio un percorso di produzione{{/3}} mentre dimostra il proprio valore. Niente di tutto ciò richiede che MiniCPM5-2B sia ospitato da qualche parte; è la rete di sicurezza attorno ai modelli da cui già dipendi mentre decidi se un 2B self-hosted vale la GPU.

Osserva, in ordine di importanza: un run indipendente di SGLang DSPARK che riporti i token reali al secondo per la coppia, dato che la lunghezza di accettazione è un proxy, non un benchmark; un annuncio formale o un mirror su ModelScope che confermi che il rilascio è definitivo; e un provider di hosting che adotti MiniCPM5-2B — se lo fa, il prezzo che paghi dalla nostra parte è il prezzo di listino del provider, lo stesso giorno, perché è questo che significa pass-through. Nel frattempo, il modello draft è l'oggetto più interessante dei due. Un proposer a cinque livelli che il target accetta per cinque token e mezzo su sette è la differenza tra un piccolo modello edge che sembra piccolo e uno che sembra un modello più grande che gira sullo stesso dispositivo.