Una card con titolo principale per il confronto 'MiniCPM5-2B-DSpark vs LFM2.5-2.6B-Base' con il sottotitolo 'Uno è un ingrediente per il servizio, uno è un ingrediente per l'addestramento', che mostra uno scaffale con due barattoli — quello a sinistra etichettato 'componente aggiuntivo per il servizio' che contiene un piccolo chip e quello a destra etichettato 'substrato per l'addestramento' che contiene fogli stratificati — con una bilancia tra di loro e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

MiniCPM5-2B-DSpark vs LFM2.5-2.6B-Base: uno è un ingrediente per il serving, l'altro è un ingrediente per l'addestramento

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due dei rilasci di piccoli modelli più interessanti della fine dell'estate 2026 hanno questo in comune: nessuno dei due funziona così com'è, e entrambi i produttori lo dichiarano nelle prime frasi delle rispettive schede. MiniCPM5-2B-DSpark è il checkpoint draft DSpark che OpenBMB ha pubblicato in silenzio su Hugging Face il 6 settembre 2026 — un modello ausiliario da 323,8 milioni di parametri per MiniCPM5-2B, il modello denso da 2,52 miliardi pensato per l'on-device che ModelBest ha annunciato al WAIC il 19 luglio 2026 — e non fa nulla finché non viene caricato accanto al target in un motore di decodifica speculativa. LFM2.5-2.6B-Base è il checkpoint testuale pre-addestrato di Liquid AI, su Hugging Face dal 1° agosto 2026; la scheda di Liquid lo definisce «il checkpoint pre-addestrato di solo testo», raccomandato solo per attività che richiedono un fine-tuning intensivo. Uno è un ingrediente per servire più rapidamente un modello già finito; l'altro è un ingrediente per addestrare da zero il proprio modello. Si trovano su scaffali diversi, e l'errore dello sviluppatore sarebbe allungare la mano verso quello sbagliato.

Ciò che li rende degni di confronto è che mirano allo stesso hardware e alla stessa ambizione per il 2026 — un'IA capace su smartphone, laptop e dispositivi edge — ma da estremi opposti del processo di sviluppo. Se vuoi un modello on-device distribuibile e un'accelerazione gratuita, lo stack di OpenBMB ti consegna tutto in open. Se vuoi occuparti tu stesso del post-training, Liquid ti fornisce il substrato e il lavoro. Questo articolo parla di quale strato stai davvero andando a comprare.

Due carte che dicono "non per uso diretto" in dialetti diversi

Leggete le due schede dei modelli fianco a fianco: l'indizio sta nel linguaggio dell'abbinamento. La scheda di MiniCPM5-2B-DSpark è scritta interamente in termini di un altro modello: un target, un tokenizer che condivide, layer di draft, lunghezze di accettazione, un comando di avvio SGLang che accetta un percorso per il target e uno per il draft. Il draft non ha un'identità propria — cinque layer di attenzione completa, 323.776.001 parametri, una dimensione del blocco di sette, addestrato per sei epoche su 7,05 miliardi di token di risposte generate da MiniCPM5-2B, e rilasciato sotto Apache-2.0 con le confidence head e le Markov head del metodo DSpark (arXiv 2607.05147) abilitate. Il suo scopo è il throughput: proporre fino a sette token, far verificare il blocco in un'unica passata al target da 2,52B e trattenere ciò che accetta.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

La scheda openbmb/MiniCPM5-2B-DSpark qui sopra è l'intera superficie pubblica del rilascio: un accessorio di serving senza alcun annuncio allegato, che riporta la lunghezza di accettazione ma nessuna accelerazione end-to-end.

La scheda di LFM2.5-2.6B-Base è scritta in riferimento a un modello che non esiste ancora: il tuo. L'ibrido da 2.69B impila otto layer di grouped-query-attention su ventidue blocchi dual-gated short-convolution — l'architettura di Liquid per il deployment on-device — addestrato su circa 34 trilioni di token in 16 lingue, con una finestra di contesto di 128K. È un modello esclusivamente testuale, non è stato sottoposto ad alcun instruction tuning e non pubblica alcun benchmark proprio, perché una base pre-addestrata non viene valutata; a essere valutati sono i prodotti fine-tuned che ne derivano. Il suo compito è essere ulteriormente pre-addestrato o sottoposto a SFT sui tuoi dati, dopodiché qualsiasi cosa tu rilasci ne eredita i termini di licenza.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-2.6B-Base (reused from a published sibling) showing the model card with the family table contrasting the pre-trained base checkpoint with the post-trained LFM2.5-2.6B agentic model, the text-generation and Transformers tags, and the note that the base is the pre-trained text-only checkpoint.

La scheda LiquidAI/LFM2.5-2.6B-Base mostrata sopra presenta la tabella della famiglia — modello base rispetto al modello agentico LFM2.5-2.6B post-addestrato — e la nota "pre-trained text-only checkpoint" che definisce il modello base come materiale grezzo.

I repository, dimensione per dimensione

• Ruolo — MiniCPM5-2B-DSpark: accelera un target esistente e completo. LFM2.5-2.6B-Base: il substrato che sottoponi a post-training per ottenere un modello finito.

Parametri — MiniCPM5-2B-DSpark: bozza da 324M per un target denso da 2.52B. LFM2.5-2.6B-Base: ibrido da 2.69B (blocchi di attenzione + convoluzione breve).

• Contesto — MiniCPM5-2B target: 128K nativo. LFM2.5-2.6B-Base: 128K nativo.

• Cosa devi aggiungere — MiniCPM5-2B-DSpark: un motore di servizio (SGLang DSPARK) e il modello target. LFM2.5-2.6B-Base: una run di fine-tuning, una suite di valutazione e uno stack di inferenza.

• Benchmark — MiniCPM5-2B-DSpark: solo lunghezza di accettazione del repository (aggregato greedy 5.52 per passo), nessun dato di speedup. LFM2.5-2.6B-Base: nessun benchmark pubblicato per la base stessa.

• Licenza — MiniCPM5-2B-DSpark: Apache-2.0, senza vincoli. LFM2.5-2.6B-Base: LFM Open License v1.0 — uso commerciale gratuito fino a $10M di fatturato annuo, e il tetto si applica anche a qualsiasi modello tu metta a punto.

A two-column scoreboard for MiniCPM5-2B-DSpark vs LFM2.5-2.6B-Base: left column MiniCPM5-2B-DSpark with 'Role: serving add-on for MiniCPM5-2B', 324M draft / 2.52B target, 128K context, 'You add: SGLang DSPARK engine', draft-acceptance-only benchmarks, and Apache-2.0; right column LFM2.5-2.6B-Base with 'Role: pretrain substrate for your fine-tune', 2.69B hybrid params, 128K context, 'You add: fine-tune, eval, serving', no published benchmarks, and LFM Open License v1.0 with a $10M revenue cap, with a footer reading 'MiniCPM figures are card claims; LFM base has no published benchmarks' and the OrcaRouter logo in the bottom-right corner.

Il tabellone qui sopra è lo scaffale degli ingredienti rappresentato come una carta: una colonna è un componente aggiuntivo a servizio di un modello finito, l’altra è un substrato di addestramento per un modello che non esiste finché non lo costruisci.

La differenza di 10 milioni di dollari

Per chi sviluppa, la questione delle licenze è la voce meno affascinante, ma la più decisiva, di quell’elenco. ModelBest e OpenBMB hanno rilasciato MiniCPM5-2B e il suo modello draft sotto licenza Apache-2.0: puoi servire il modello target, eseguire il draft e costruirci sopra un prodotto commerciale senza tetto ai ricavi e senza obblighi ereditati oltre all’attribuzione. La LFM Open License v1.0 di Liquid consente l’uso commerciale, ma lo limita: gratuita al di sotto dei 10 milioni di dollari di fatturato annuo, e il tetto si trasmette alla tua opera derivata. Un prodotto ottenuto con il fine-tuning di LFM2.5-2.6B-Base porta con sé lo stesso tetto. Questo non rende irragionevole la licenza di Liquid; la rende una condizione che una startup intenzionata a superare il tetto deve pianificare fin dal primo giorno. Se il tuo progetto punta a ricavi contenuti o stai valutando un uso per la ricerca, il tetto non è un problema. Se invece stai costruendo qualcosa che intendi far crescere, Apache-2.0 è un altro tipo di materia prima.

Il bivio tra creare e acquistare per gli sviluppatori

Inquadratela come una decisione "build vs buy" sul modello stesso, e la scelta cessa di essere confusa. MiniCPM5-2B-DSpark è il percorso "buy": il lavoro difficile — il post-training di un modello on-device per attività agentiche e a contesto lungo — è già stato fatto in MiniCPM5-2B, e il draft è un livello di accelerazione sovrapposto senza licenze aggiuntive. Stai comprando un modello finito e un aumento di velocità, entrambi sotto Apache-2.0, e il lavoro che ti resta è il serving e la valutazione. La questione aperta è quantitativa: OpenBMB ha misurato l'accettazione del draft (5,52 token per passo di verifica in modalità greedy) ma non il suo beneficio in termini di tempo wall-clock, quindi devi comunque fare benchmark del deployment SGLang sul tuo hardware per sapere cosa hai comprato.

LFM2.5-2.6B-Base è il percorso "build": compri il substrato di pre-addestramento e fai da solo il post-addestramento, che è l'unico motivo onesto per scegliere una base invece del fratello post-addestrato LFM2.5-2.6B che Liquid vende già. Quel percorso ha senso quando hai un dominio, una lingua o un profilo comportamentale che i modelli standard non coprono — prendi l'architettura di Liquid e le fondamenta da 34 trilioni di token e le rendi tue. È strettamente più lavoro, parte con zero benchmark pubblicati e si porta avanti il tetto alle entrate. Il risultato è un modello che nessun altro ha.

La realtà del routing

Nessuno dei due checkpoint appare oggi in alcun catalogo ospitato, incluso quello di OrcaRouter — la bozza è per definizione un accessorio di servizio locale, e la base di Liquid è un progetto di fine-tuning self-hosted. È lì che un livello di routing resta utile senza fingere di ospitare nessuno dei due: una volta che hai servito o messo a punto uno dei due modelli, il livello davanti ai tuoi endpoint è ciò che rende reversibile la loro sperimentazione. Punta un percorso di test su una build SGLang di MiniCPM5-2B-plus-draft mentre la produzione resta su qualunque cosa serva oggi, lascia che il failover automatico intercetti lo stallo, e mantieni i prezzi di listino dei provider che passano attraverso con markup 0% per i modelli ospitati con cui confronti. Il punto del livello qui non è la consegna — è che nessuno dei due ingredienti ti impegna in modo irreversibile.

Su quale scaffale stai facendo acquisti?

Scegli MiniCPM5-2B-DSpark (con il suo target) quando vuoi un modello finito, Apache-2.0, on-device già oggi e un draft che potrebbe renderlo più veloce — accettando che devi misurare da solo l'accelerazione del draft, visto che il fornitore non l'ha fatto. Scegli LFM2.5-2.6B-Base quando intendi fare post-addestramento del tuo modello e vuoi l'architettura ibrida di Liquid e le basi in 16 lingue come pesi di partenza — accettando il conto del fine-tuning, il fatto che non ci sia alcun benchmark pubblicato e il tetto di ricavi di $10M che si porterà dietro qualunque cosa tu spedisca. I due non sono rivali per lo stesso lavoro; sono due lavori diversi sullo stesso hardware, e l'unica scelta sbagliata è comprarne uno credendo di comprare l'altro.