Una card hero con il titolo 'Liquid AI d1-3B vs MiniCPM5-2B' e il sottotitolo 'probabilità o prosa, su scala laptop', che mostra due card unite da un segno di uguale: d1-3B con un'icona a indicatore e un chip 'un'etichetta e una confidenza', e MiniCPM5-2B con un'icona a matita e un chip 'una risposta scritta', sopra un chip largo con scritto 'entrambi stanno su un laptop'.
Guides & Insights

Liquid AI d1-3B vs MiniCPM5-2B: probabilità o prosa, alla scala di un laptop

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli a pesi aperti, entrambi abbastanza piccoli da girare sulla macchina davanti a te, e non concordano su ciò che un modello dovrebbe restituire. Liquid AI d1-3B è il modello decisionale da 3,12B di Liquid AI, reso disponibile con pesi aperti il 7 ottobre 2026: legge uno stato e un insieme di domande denominate e restituisce un'etichetta, una probabilità per opzione e un valore di confidenza, in un'unica passata in avanti, senza generare nulla. MiniCPM5-2B è il modello denso da 2,52B di ModelBest e OpenBMB, presentato al World Artificial Intelligence Conference il 19 luglio e pubblicato in sordina su Hugging Face all'inizio di settembre 2026 con licenza Apache-2.0 — un assistente per ragionamento, programmazione e chiamata di strumenti che scrive risposte, chiama funzioni in XML e ha già oltre un milione di download. Il più piccolo ha una finestra di contesto quattro volte più ampia e una licenza molto più permissiva; il più grande non può produrre un token nemmeno se lo volessi. Quale di queste due forme debba entrare nella tua pipeline dipende interamente dal fatto che ciò che sta a valle della chiamata voglia un numero o una frase.

L'inversione che vale la pena notare per prima

Quasi ogni aspettativa intuitiva su questo abbinamento è ribaltata, quindi comincia da lì.

MiniCPM5-2B è il modello più piccolo e ha il contesto più lungo: 131.072 token contro 32.768 per Liquid AI d1-3B. È anche quello con la licenza più permissiva dei due — Apache-2.0, senza restrizioni, con i dataset di addestramento rilasciati insieme ai pesi come parte della famiglia UltraData. Liquid AI d1-3B viene distribuito con la licenza lfm1.0 di Liquid, che è scaricabile e consente il fine-tuning, ma è una licenza del fornitore anziché una licenza permissiva standard.

Liquid AI d1-3B è il modello più grande — 3,12B contro 2,52B in totale, anche se il confronto si ribalta di nuovo sui parametri non-embedding — ed è quello che non sa scrivere. Ha la visione; il MiniCPM è solo testo. È post-addestrato per esattamente una cosa; il MiniCPM è post-addestrato per molte cose. E mentre MiniCPM5-2B arriva con un grafico comparativo che lo colloca in cima alla sua classe di dimensioni, Liquid AI d1-3B arriva con un singolo punteggio di indice e una serie di tabelle di latenza.

Niente di tutto questo rende uno migliore dell'altro. Significa che i due sono pensati per compiti diversi, e l'indizio rivelatore è la forma della risposta che ciascuno restituisce.

Cosa ritorna sul filo

MiniCPM5-2B è un modello linguistico generativo. Ragiona, risponde in prosa ed emette chiamate a strumenti in stile XML che il parser minicpm5 integrato di SGLang converte in tool_calls compatibili con OpenAI senza un adattatore personalizzato. Il suo post-training è la parte interessante della sua storia: 400 miliardi di token di fine-tuning supervisionato di deep-thinking, poi reinforcement learning con un algoritmo basato su un critico preso in prestito da JustRL II, poi distillazione on-policy che ripiega sedici insegnanti RL specializzati — cinque dei quali agentici — in un'unica rete densa. La scheda attribuisce a RL più distillazione un guadagno medio di 10,96 punti su compiti di ragionamento e generali e 6,96 su quelli agentici, e riporta una media di 53,9 sul proprio insieme di confronto, superiore al modello più grande incluso in quell'insieme. Quelli sono i numeri di ModelBest, prodotti internamente, senza alcuna riproduzione indipendente pubblicata finora.

Liquid AI d1-3B restituisce una struttura. Una domanda sì/no viene restituita come P(sì) tra 0 e 1. Una domanda a scelta viene restituita come l'etichetta, una confidenza e una probabilità per opzione. Una domanda a punteggio viene restituita come un livello atteso su una scala ordinale da due a dieci con la sua distribuzione e legenda. L'oggetto usage riporta output_tokens: 0, e c'è un accessor grezzo per le probabilities, se vuoi i vettori non massaggiati. Il suo post-training era il tipo opposto di lavoro: mediare due checkpoint insieme, fare fine-tuning di diversi seed su diverse miscele di dati, unirli, poi dedicare lo sforzo all'addestramento su input lunghi, mescolare l'ordine delle opzioni di risposta e rimuovere le scorciatoie dai dati di addestramento — perché un modello decisionale che impara "l'opzione B è di solito quella giusta" invece di leggere lo stato è peggio che inutile.

L'uno chiede a un modello di pensare e poi dire qualcosa. L'altro chiede a un modello ciò che già crede.

A two-column scoreboard for Liquid AI d1-3B and MiniCPM5-2B. The d1-3B column reads: output label, confidence, probabilities; 3.12B parameters; 32,768-token context; text and image input; Liquid lfm1.0 licence; Decision Index 48.57 (vendor). The MiniCPM5-2B column reads: output generated text and tool calls; 2.52B dense parameters; 131,072-token context; text-only input; Apache-2.0 licence; Decision Index not scored. The footer reads 'Both sets vendor-reported; MiniCPM5-2B figures are ModelBest's own comparison set.'

Fianco a fianco, con la provenienza etichettata

Ogni dato riportato di seguito è dichiarato dal fornitore. I numeri di MiniCPM5-2B provengono dalla scheda di ModelBest stessa e dal suo set di confronto; quelli di Liquid AI d1-3B derivano dal fatto che Liquid ha eseguito direttamente lo scorer ufficiale del Decision Index anziché inviarli alla classifica pubblica. Al momento del rilascio open-weights, nessuno dei due modelli è stato sottoposto a benchmark indipendenti da terze parti.

• Parametri — Liquid AI d1-3B 3,12B totali con un encoder visivo SigLIP2 da 400M e un vocabolario da 128.000 token; MiniCPM5-2B 2.516.756.480 totali, 1.981.982.720 non-embedding, 42 livelli, con 16 teste di query e 2 teste KV, vocabolario 130.560.

• Contesto — 32.768 token per Liquid AI d1-3B; 131.072 per MiniCPM5-2B.

• Modalità di input — testo e immagini per Liquid AI d1-3B; solo testo per MiniCPM5-2B.

• Output — probabilità, etichette, confidenze e punteggi ordinati, con zero token di output, per Liquid AI d1-3B; testo generato, ragionamento e chiamate a strumenti XML per MiniCPM5-2B.

• Punteggio principale — Liquid AI d1-3B 48,57 su Decision Index 0.2.1, primo tra i modelli sotto i 10B nella tabella del fornitore; MiniCPM5-2B una media di 53,9 nel proprio set di confronto, che è un set diverso che misura cose diverse.

• Velocità — 8 ms per domanda su una RTX 4090, 26 ms su una Jetson AGX Orin 64 GB, 50 ms su una Jetson Orin Nano e 64 stati impacchettati per passaggio a 475 al secondo per Liquid AI d1-3B. La velocità di MiniCPM5-2B dipende da quanti token genera, quindi non c'è un singolo numero da mettere a confronto.

• Licenza — Apache-2.0, senza restrizioni, dati di addestramento rilasciati, per MiniCPM5-2B; lfm1.0 di Liquid per Liquid AI d1-3B.

• Prove — oltre un milione di download da Hugging Face e un mese di quantizzazione da parte della community per MiniCPM5-2B; due giorni di esistenza e nessuna esecuzione di terze parti per Liquid AI d1-3B.

Il lavoro in cui ciascuno è davvero bravo

C'è un flusso di lavoro che entrambi i modelli possono eseguire, e la differenza nel modo in cui lo fanno è tutto l'argomento.

Supponi di dover smistare ticket di supporto, o decidere se un passaggio recuperato risponde a una domanda, o valutare l'output di un LLM rispetto a una rubrica. MiniCPM5-2B può fare tutte e tre le cose: è un piccolo ma capace modello di ragionamento con chiamata di strumenti e un contesto lungo, e lo eseguiresti come qualsiasi altro assistente, chiedendo un'etichetta e poi analizzando qualunque cosa restituisca. A volte restituisce JSON pulito. A volte restituisce JSON con una spiegazione attorno. A volte restituisce la risposta giusta nella forma sbagliata, e quel mancato riconoscimento è un bug nel tuo parser, non nel modello.

Liquid AI d1-3B non può fare nient'altro, ed è esattamente questo il punto. Sulle stesse tre attività restituisce una probabilità e un'etichetta e nulla da analizzare, tre domande su un singolo stato costano 1,3 volte il tempo di una, e la modalità di errore si sposta da "il formato si è rotto" a "la confidenza era mal calibrata" — il che è almeno misurabile, perché la confidenza è proprio lì nella risposta.

Dove MiniCPM5-2B vince nettamente è in tutto ciò che sta a valle della decisione. Contiene 131K token, quindi lo stato può essere l'intero albero dei file di un repository o un documento lungo, anziché la prima pagina di quest'ultimo. Scrive chiamate agli strumenti in modo nativo. È un modello su cui puoi costruire un piccolo agente, ed è stato post-addestrato esplicitamente per il lavoro agentico. E la sua licenza Apache-2.0 significa che la solita conversazione con l'avvocato commercialista non avviene.

Dove Liquid AI d1-3B vince nettamente è nella soglia di latenza e nella modalità. Un dispositivo che esegue una decisione in 50 ms senza GPU non è un dispositivo che esegue MiniCPM5-2B; i due vivono in livelli hardware diversi nonostante il numero simile di parametri. E il 3B vede — il fornitore riporta 74,1 su undici benchmark pubblici di immagini letti come decisioni, contro 73,9 per il modello visione-linguaggio da cui è stato costruito, e riporta che rimuovendo le immagini le stesse domande crollano a 45,1, che è il loro modo di mostrare che le risposte provengono dai pixel. L'ispezione visiva di una linea di produzione non è affatto un compito che si possa affidare al 2B solo testo.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Eseguirli, e il layer attorno a loro

Entrambi riguardano il self-hosting, e per entrambi il lavoro di deployment è già stato svolto. Liquid AI d1-3B arriva con il supporto a llama.cpp fin dal primo giorno, l'intero stack NVIDIA da DGX a Jetson, la quantizzazione NVFP4, una build a 8 bit per pesi e attivazioni, e conversioni GGUF già pubblicate. MiniCPM5-2B è una semplice architettura LlamaForCausalLM che non richiede kernel personalizzati, un unico shard safetensors BF16, build GGUF e MLX nella famiglia più ampia, e una preferenza documentata per SGLang quando serve il parser per le chiamate agli strumenti. Nessuno dei due è presente nel nostro catalogo, e questo articolo non costituisce una dichiarazione di disponibilità per nessuno dei due.

Le alternative ospitate sono l'API del fornitore stesso e le piattaforme di terze parti. Liquid offre il d1 ospitato con tariffazione basata solo sui token di input a 0,04 $ per milione, con le immagini fatturate come input a 1,5 token per patch da 32×32 pixel e nessuna voce di output; MiniCPM5-2B non dispone di un'API di prima parte, il che è normale per un rilascio open-weights con licenza Apache-2.0.

Ciò in cui confluiscono entrambi è lo stesso problema architetturale. Un modello locale da 2B o 3B che gestisce classificazione, instradamento o controlli di guardrail si colloca davanti alle chiamate generative che non ospiti tu, e quel mix — inferenza di proprietà accanto a inferenza a noleggio — è la cosa che un livello di instradamento esiste per assorbire. Un unico endpoint su oltre 200 modelli, prezzi di listino dei provider passati a markup 0% così una variazione di prezzo di un fornitore è attiva lo stesso giorno, failover automatico quando un upstream peggiora. Possedere il modello piccolo rende la questione dell'instradamento più difficile, non più facile, perché ora il confine tra il tuo hardware e quello di qualcun altro è una decisione che devi prendere per ogni richiesta.

Scegli in base al tipo di risposta

Se ciò di cui hai bisogno è un'etichetta, una probabilità o una valutazione, e l'insieme di opzioni è noto in anticipo, Liquid AI d1-3B è lo strumento più onesto — è stato creato per quella richiesta e la risposta non arriverà malformata. Accetta la licenza del fornitore, il contesto da 32K e la traccia di prove vecchia di due giorni come prezzo.

Se ciò di cui hai bisogno è un piccolo modello che sappia ragionare, chiamare strumenti, gestire un documento lungo e rispondere a parole, MiniCPM5-2B è di gran lunga la macchina più capace, e arriva con Apache-2.0 e con alle spalle i test di altre persone per un milione di download.

Le squadre che trarranno il massimo dall'uno o dall'altro rilascio sono quelle che li eseguono entrambi: un modello decisionale davanti, dove la risposta è un numero e i millisecondi contano, e un piccolo modello generativo dietro, per le parti del lavoro che richiedono il linguaggio. Non sono concorrenti. Sono un filtro e una voce.

A capture of our own models catalogue page showing the filter rail for input modalities, context length, input price, status and series, a header reading '207 models, 16 providers, one API key, one bill', and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.