
Liquid AI d1-3B vs MiniCPM5-2B: probabilità o prosa, alla scala di un laptop
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Due modelli a pesi aperti, entrambi abbastanza piccoli da girare sulla macchina davanti a te, e non concordano su ciò che un modello dovrebbe restituire. Liquid AI d1-3B è il modello decisionale da 3,12B di Liquid AI, reso disponibile con pesi aperti il 7 ottobre 2026: legge uno stato e un insieme di domande denominate e restituisce un'etichetta, una probabilità per opzione e un valore di confidenza, in un'unica passata in avanti, senza generare nulla. MiniCPM5-2B è il modello denso da 2,52B di ModelBest e OpenBMB, presentato al World Artificial Intelligence Conference il 19 luglio e pubblicato in sordina su Hugging Face all'inizio di settembre 2026 con licenza Apache-2.0 — un assistente per ragionamento, programmazione e chiamata di strumenti che scrive risposte, chiama funzioni in XML e ha già oltre un milione di download. Il più piccolo ha una finestra di contesto quattro volte più ampia e una licenza molto più permissiva; il più grande non può produrre un token nemmeno se lo volessi. Quale di queste due forme debba entrare nella tua pipeline dipende interamente dal fatto che ciò che sta a valle della chiamata voglia un numero o una frase.
L'inversione che vale la pena notare per prima
Quasi ogni aspettativa intuitiva su questo abbinamento è ribaltata, quindi comincia da lì.
MiniCPM5-2B è il modello più piccolo e ha il contesto più lungo: 131.072 token contro 32.768 per Liquid AI d1-3B. È anche quello con la licenza più permissiva dei due — Apache-2.0, senza restrizioni, con i dataset di addestramento rilasciati insieme ai pesi come parte della famiglia UltraData. Liquid AI d1-3B viene distribuito con la licenza lfm1.0 di Liquid, che è scaricabile e consente il fine-tuning, ma è una licenza del fornitore anziché una licenza permissiva standard.
Liquid AI d1-3B è il modello più grande — 3,12B contro 2,52B in totale, anche se il confronto si ribalta di nuovo sui parametri non-embedding — ed è quello che non sa scrivere. Ha la visione; il MiniCPM è solo testo. È post-addestrato per esattamente una cosa; il MiniCPM è post-addestrato per molte cose. E mentre MiniCPM5-2B arriva con un grafico comparativo che lo colloca in cima alla sua classe di dimensioni, Liquid AI d1-3B arriva con un singolo punteggio di indice e una serie di tabelle di latenza.
Niente di tutto questo rende uno migliore dell'altro. Significa che i due sono pensati per compiti diversi, e l'indizio rivelatore è la forma della risposta che ciascuno restituisce.
Cosa ritorna sul filo
MiniCPM5-2B è un modello linguistico generativo. Ragiona, risponde in prosa ed emette chiamate a strumenti in stile XML che il parser minicpm5 integrato di SGLang converte in tool_calls compatibili con OpenAI senza un adattatore personalizzato. Il suo post-training è la parte interessante della sua storia: 400 miliardi di token di fine-tuning supervisionato di deep-thinking, poi reinforcement learning con un algoritmo basato su un critico preso in prestito da JustRL II, poi distillazione on-policy che ripiega sedici insegnanti RL specializzati — cinque dei quali agentici — in un'unica rete densa. La scheda attribuisce a RL più distillazione un guadagno medio di 10,96 punti su compiti di ragionamento e generali e 6,96 su quelli agentici, e riporta una media di 53,9 sul proprio insieme di confronto, superiore al modello più grande incluso in quell'insieme. Quelli sono i numeri di ModelBest, prodotti internamente, senza alcuna riproduzione indipendente pubblicata finora.
Liquid AI d1-3B restituisce una struttura. Una domanda sì/no viene restituita come P(sì) tra 0 e 1. Una domanda a scelta viene restituita come l'etichetta, una confidenza e una probabilità per opzione. Una domanda a punteggio viene restituita come un livello atteso su una scala ordinale da due a dieci con la sua distribuzione e legenda. L'oggetto usage riporta output_tokens: 0, e c'è un accessor grezzo per le probabilities, se vuoi i vettori non massaggiati. Il suo post-training era il tipo opposto di lavoro: mediare due checkpoint insieme, fare fine-tuning di diversi seed su diverse miscele di dati, unirli, poi dedicare lo sforzo all'addestramento su input lunghi, mescolare l'ordine delle opzioni di risposta e rimuovere le scorciatoie dai dati di addestramento — perché un modello decisionale che impara "l'opzione B è di solito quella giusta" invece di leggere lo stato è peggio che inutile.
L'uno chiede a un modello di pensare e poi dire qualcosa. L'altro chiede a un modello ciò che già crede.

Fianco a fianco, con la provenienza etichettata
Ogni dato riportato di seguito è dichiarato dal fornitore. I numeri di MiniCPM5-2B provengono dalla scheda di ModelBest stessa e dal suo set di confronto; quelli di Liquid AI d1-3B derivano dal fatto che Liquid ha eseguito direttamente lo scorer ufficiale del Decision Index anziché inviarli alla classifica pubblica. Al momento del rilascio open-weights, nessuno dei due modelli è stato sottoposto a benchmark indipendenti da terze parti.
• Parametri — Liquid AI d1-3B 3,12B totali con un encoder visivo SigLIP2 da 400M e un vocabolario da 128.000 token; MiniCPM5-2B 2.516.756.480 totali, 1.981.982.720 non-embedding, 42 livelli, con 16 teste di query e 2 teste KV, vocabolario 130.560.
• Contesto — 32.768 token per Liquid AI d1-3B; 131.072 per MiniCPM5-2B.
• Modalità di input — testo e immagini per Liquid AI d1-3B; solo testo per MiniCPM5-2B.
• Output — probabilità, etichette, confidenze e punteggi ordinati, con zero token di output, per Liquid AI d1-3B; testo generato, ragionamento e chiamate a strumenti XML per MiniCPM5-2B.
• Punteggio principale — Liquid AI d1-3B 48,57 su Decision Index 0.2.1, primo tra i modelli sotto i 10B nella tabella del fornitore; MiniCPM5-2B una media di 53,9 nel proprio set di confronto, che è un set diverso che misura cose diverse.
• Velocità — 8 ms per domanda su una RTX 4090, 26 ms su una Jetson AGX Orin 64 GB, 50 ms su una Jetson Orin Nano e 64 stati impacchettati per passaggio a 475 al secondo per Liquid AI d1-3B. La velocità di MiniCPM5-2B dipende da quanti token genera, quindi non c'è un singolo numero da mettere a confronto.
• Licenza — Apache-2.0, senza restrizioni, dati di addestramento rilasciati, per MiniCPM5-2B; lfm1.0 di Liquid per Liquid AI d1-3B.
• Prove — oltre un milione di download da Hugging Face e un mese di quantizzazione da parte della community per MiniCPM5-2B; due giorni di esistenza e nessuna esecuzione di terze parti per Liquid AI d1-3B.
Il lavoro in cui ciascuno è davvero bravo
C'è un flusso di lavoro che entrambi i modelli possono eseguire, e la differenza nel modo in cui lo fanno è tutto l'argomento.
Supponi di dover smistare ticket di supporto, o decidere se un passaggio recuperato risponde a una domanda, o valutare l'output di un LLM rispetto a una rubrica. MiniCPM5-2B può fare tutte e tre le cose: è un piccolo ma capace modello di ragionamento con chiamata di strumenti e un contesto lungo, e lo eseguiresti come qualsiasi altro assistente, chiedendo un'etichetta e poi analizzando qualunque cosa restituisca. A volte restituisce JSON pulito. A volte restituisce JSON con una spiegazione attorno. A volte restituisce la risposta giusta nella forma sbagliata, e quel mancato riconoscimento è un bug nel tuo parser, non nel modello.
Liquid AI d1-3B non può fare nient'altro, ed è esattamente questo il punto. Sulle stesse tre attività restituisce una probabilità e un'etichetta e nulla da analizzare, tre domande su un singolo stato costano 1,3 volte il tempo di una, e la modalità di errore si sposta da "il formato si è rotto" a "la confidenza era mal calibrata" — il che è almeno misurabile, perché la confidenza è proprio lì nella risposta.
Dove MiniCPM5-2B vince nettamente è in tutto ciò che sta a valle della decisione. Contiene 131K token, quindi lo stato può essere l'intero albero dei file di un repository o un documento lungo, anziché la prima pagina di quest'ultimo. Scrive chiamate agli strumenti in modo nativo. È un modello su cui puoi costruire un piccolo agente, ed è stato post-addestrato esplicitamente per il lavoro agentico. E la sua licenza Apache-2.0 significa che la solita conversazione con l'avvocato commercialista non avviene.
Dove Liquid AI d1-3B vince nettamente è nella soglia di latenza e nella modalità. Un dispositivo che esegue una decisione in 50 ms senza GPU non è un dispositivo che esegue MiniCPM5-2B; i due vivono in livelli hardware diversi nonostante il numero simile di parametri. E il 3B vede — il fornitore riporta 74,1 su undici benchmark pubblici di immagini letti come decisioni, contro 73,9 per il modello visione-linguaggio da cui è stato costruito, e riporta che rimuovendo le immagini le stesse domande crollano a 45,1, che è il loro modo di mostrare che le risposte provengono dai pixel. L'ispezione visiva di una linea di produzione non è affatto un compito che si possa affidare al 2B solo testo.

Eseguirli, e il layer attorno a loro
Entrambi riguardano il self-hosting, e per entrambi il lavoro di deployment è già stato svolto. Liquid AI d1-3B arriva con il supporto a llama.cpp fin dal primo giorno, l'intero stack NVIDIA da DGX a Jetson, la quantizzazione NVFP4, una build a 8 bit per pesi e attivazioni, e conversioni GGUF già pubblicate. MiniCPM5-2B è una semplice architettura LlamaForCausalLM che non richiede kernel personalizzati, un unico shard safetensors BF16, build GGUF e MLX nella famiglia più ampia, e una preferenza documentata per SGLang quando serve il parser per le chiamate agli strumenti. Nessuno dei due è presente nel nostro catalogo, e questo articolo non costituisce una dichiarazione di disponibilità per nessuno dei due.
Le alternative ospitate sono l'API del fornitore stesso e le piattaforme di terze parti. Liquid offre il d1 ospitato con tariffazione basata solo sui token di input a 0,04 $ per milione, con le immagini fatturate come input a 1,5 token per patch da 32×32 pixel e nessuna voce di output; MiniCPM5-2B non dispone di un'API di prima parte, il che è normale per un rilascio open-weights con licenza Apache-2.0.
Ciò in cui confluiscono entrambi è lo stesso problema architetturale. Un modello locale da 2B o 3B che gestisce classificazione, instradamento o controlli di guardrail si colloca davanti alle chiamate generative che non ospiti tu, e quel mix — inferenza di proprietà accanto a inferenza a noleggio — è la cosa che un livello di instradamento esiste per assorbire. Un unico endpoint su oltre 200 modelli, prezzi di listino dei provider passati a markup 0% così una variazione di prezzo di un fornitore è attiva lo stesso giorno, failover automatico quando un upstream peggiora. Possedere il modello piccolo rende la questione dell'instradamento più difficile, non più facile, perché ora il confine tra il tuo hardware e quello di qualcun altro è una decisione che devi prendere per ogni richiesta.
Scegli in base al tipo di risposta
Se ciò di cui hai bisogno è un'etichetta, una probabilità o una valutazione, e l'insieme di opzioni è noto in anticipo, Liquid AI d1-3B è lo strumento più onesto — è stato creato per quella richiesta e la risposta non arriverà malformata. Accetta la licenza del fornitore, il contesto da 32K e la traccia di prove vecchia di due giorni come prezzo.
Se ciò di cui hai bisogno è un piccolo modello che sappia ragionare, chiamare strumenti, gestire un documento lungo e rispondere a parole, MiniCPM5-2B è di gran lunga la macchina più capace, e arriva con Apache-2.0 e con alle spalle i test di altre persone per un milione di download.
Le squadre che trarranno il massimo dall'uno o dall'altro rilascio sono quelle che li eseguono entrambi: un modello decisionale davanti, dove la risposta è un numero e i millisecondi contano, e un piccolo modello generativo dietro, per le parti del lavoro che richiedono il linguaggio. Non sono concorrenti. Sono un filtro e una voce.

