
Liquid AI d1-3B vs Intern-Decision-4B: quale decisore calibrato ti serve davvero?
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Due modelli open-weight ora rispondono alle domande non scrivendo nulla, e finché non si mettono fianco a fianco i loro schemi di I/O sembrano la stessa idea ripetuta due volte. Liquid AI d1-3B, caricato su Hugging Face il 5 ottobre 2026 e annunciato da Liquid due giorni dopo, è un modello decisionale multimodale da 3,12B la cui card dice senza mezzi termini che "non è un modello di chat e non scrive testo". Intern-Decision-4B di InternLM, caricato in sordina sull'organizzazione InternLM il 26 settembre 2026 senza alcun post sul blog, alcun tweet e alcuna pagina di lancio a supporto, è un modello decisionale da 4B messo a punto da Qwen3.5-4B che allo stesso modo restituisce una distribuzione di risposte per ogni domanda in un singolo forward pass. Stesso contratto in superficie. Le differenze che stanno sotto — una licenza che ti complicherà la vita, un contratto che può scrivere testo per sbaglio e macchine che nessuno ha confrontato — sono ciò che decide quale dei due appartiene al tuo stack.
Quanto siano in realtà vicini
La prima cosa da chiarire è quanta parte di questo confronto sia un pareggio. Entrambi i modelli ricevono uno stato e uno schema di domande denominate, entrambi leggono il segnale dai logits in una posizione segnaposto anziché campionare, entrambi sono multimodali ed entrambi riferiscono di non aver scritto nulla. Quanto alla forma della chiamata, sono quasi identici, e le differenze interessanti stanno nei dettagli ai margini.
Dimensioni — Liquid AI d1-3B 3,12B in totale, basato su LFM2.5-VL-3B di Liquid; Intern-Decision-4B 4B (circa 4,54B secondo il conteggio dei tensori riportato nella scheda), messo a punto da Qwen3.5-4B
• Tipi di domanda — d1-3B e Intern-Decision-4B usano gli stessi tre: noul per sì/no, choice per uno di un insieme denominato, score per un punto su una scala ordinata
• Campi di risposta — d1-3B restituisce la risposta più confidenza e probabilità; lo schema InternLM restituisce distribuzioni più un valore di confidenza che la model card avverte non essere una probabilità calibrata
• 输入上限 — d1-3B 为 32,768 个 token 的上下文;Intern-Decision-4B 则有 8,192 个 token 的上限,超出该长度的请求会直接拒绝而非截断,图像也计入此限制
• Licenza — d1-3B con licenza Liquid's LFM Open License v1.0, Apache 2.0 sul lato InternLM
• Lingue — d1-3B ne elenca 16; la scheda di Intern-Decision-4B non ne dichiara nessuna
• Interfaccia — d1-3B viene distribuito come un modello che carichi e chiami con trust_remote_code=True; Intern-Decision-4B viene distribuito come una libreria Python che installi con pip install, con un backend implementato e il campo model della richiesta esplicitamente non in grado di cambiare checkpoint
• Punteggio proprio dei fornitori — d1-3B 48,57 sul split pubblico di Decision Index 0.2.1; Intern-Decision-4B 90,02 come media sulla propria tabella a sette set, con un Brier score di 0,347 e un errore di calibrazione atteso di 0,065
Quegli ultimi due numeri non sono confrontabili, e trattarli come un tabellone segnapunti sarebbe l'errore più facile in assoluto da commettere in questa pagina. Provengono da framework di valutazione diversi, set di domande diversi e sistemi di punteggio diversi.

La calibrazione è l'intero prodotto, e solo uno di loro la garantisce per iscritto.
Un modello decisionale vale la sua latenza solo se il numero che restituisce accanto alla risposta significa qualcosa. Questo è ciò che è la calibrazione: una confidenza dichiarata di 0,9 dovrebbe essere corretta circa nove volte su dieci, e un modello che è sicuro di sé e sbaglia è peggio di uno che dice di non sapere.
InternLM è quello che affronta la questione. La sua scheda documenta una temperatura adattata di 1,99241824, ottenuta mediante minimizzazione della log-verosimiglianza negativa su 1.728 casi di calibrazione designati, con 1.693 tenuti da parte per la validazione, e stampata con otto cifre decimali in modo che possa essere riprodotta. Pubblica anche uno studio pilota prima/dopo su 96 casi che mostra il meccanismo all'opera invece di limitarsi ad asserirlo: Brier 0,628 ed ECE 0,213 prima della calibrazione contro 0,550 e 0,089 dopo. Brier ed ECE sono le due misure standard per stabilire se le probabilità dichiarate sono oneste, e la direzione del cambiamento è netta.
Liquid non pubblica alcun equivalente. La scheda di d1-3B riporta benchmark in stile accuratezza — SQuAD 2.0 85.3, Civil Comments 93.0, MASSIVE intent 87.3, PubMedQA 66.0, BoolQ 86.7, XNLI 85.0, PAWS-X 76.9, una media di 77.1 — accanto al suo 48.57 sul Decision Index, e il punto di forza dichiarato del modello sono risposte tipizzate calibrate. Ma non c'è nessuna riga ECE, nessuna riga Brier e nessuna temperatura adattata pubblicata.
Quell'asimmetria non significa che il discendente di Qwen3.5-4B sia meglio calibrato di un 3B costruito su LFM2.5-VL-3B; significa che tra queste due schede, una ti fornisce l'aritmetica per riprodurre l'affermazione e l'altra ti fornisce solo l'affermazione. Se la tua pipeline applica una soglia a una confidenza — instrada sopra 0,8, escala sotto 0,4 — puoi validare il lato InternLM stasera e puoi solo fare controlli a campione sul lato Liquid.
La riserva vale in entrambe le direzioni. Entrambe le serie di numeri sono di prima parte. Nessuno dei due modelli è stato valutato da una parte indipendente, e le affermazioni sulla calibrazione di InternLM si basano sul pilot da 96 casi di InternLM stesso, confrontato con il fit sempre di InternLM.
La licenza che ti chiede un numero
Intern-Decision-4B è Apache 2.0, ereditata da Qwen3.5-4B, con gli avvisi upstream conservati — uso commerciale, ridistribuzione, fine-tuning, nessuna questione di ricavi in nessuna sua parte.
d1-3B è coperto dalla LFM Open License v1.0 di Liquid, e la Sezione 5 è la parte che nessuno legge finché non lo fa l'ufficio acquisti. L'uso commerciale è concesso solo a condizione che tu o la tua entità legale rimaniate al di sotto di una Soglia, definita in quello stesso documento come ricavi annui di dieci milioni di dollari statunitensi o più; l'uso al di sopra di essa semplicemente non è concesso in licenza. Le organizzazioni non profit e gli utenti della ricerca sono esclusi.
Per un singolo individuo o un piccolo team, entrambi sono gratuiti. Per chiunque abbia un reparto finanziario, i due repository sono prodotti diversi, e la differenza è un numero che o superi o non superi.
La coda della tabella di benchmark di d1-3B è la sua vera affermazione.
Il dato principale sulla scheda di Liquid è 48.57 sul Decision Index 0.2.1, davanti alle altre righe sotto i 10B in una tabella che va da Winnow-12B a 50.02 fino a Decider 2B a 28.97. Ciò che rende quel numero degno di essere citato è l'indice di discriminazione che si trova sotto di esso. Sui sottopunteggi del Decision Index, d1-3B ottiene 74.5 su Tools e 36.3 su Arts mentre riesce a ottenere solo 23.8 su Knowledge — contro Decider 35B-A3B, un modello mixture-of-experts da 36B, 12 volte più grande, che ottiene 56.5 su Tools, 32.6 su Arts e 31.8 su Knowledge.

In altre parole, il 3B non è un modello piccolo che è uniformemente un po' peggiore. È un modello piccolo insolitamente forte nelle decisioni strutturate in stile strumento e insolitamente debole nelle domande che richiedono conoscenza del mondo, e batte il 36B nelle due categorie che assomigliano di più al lavoro per cui è stato costruito. Se le tue decisioni sono "quale di queste cinque azioni denominate" e "questo è fondato sul passaggio recuperato", il divario di dimensioni conta meno di quanto ti aspetteresti. Se le tue decisioni si basano su fatti che il modello deve già possedere, aspettati che salti fuori il 23.8.
C'è una seconda versione di quell'argomento sul fronte della visione. d1-3B ha una media di 74.1 su undici benchmark pubblici di immagini contro 73.9 del suo stesso modello base, e con le immagini rimosse le stesse domande ottengono 45.1 — quindi sulle domande relative alle immagini le risposte provengono realmente dall'immagine. È pari al suo modello base anziché migliore di esso, e le righe per benchmark sono contrastanti: CV-Bench 82.1 contro 87.6, POPE 88.5 contro 90.1, BLINK 59.2 contro 58.7.
Vale la pena notare anche la pausa nella scheda di InternLM: il suo aggregato elevato deriva da attività guidate da domande come Typed Decision 80,55 e ToolACE 96,45, mentre Jevbench-Hard si attesta a 73,87. Dove lo schema diventa difficile, il punteggio cala.
Velocità: il divario non è dove te lo aspetti
d1-3B dichiara 8 ms per una singola domanda su una RTX 4090 e 9 ms su una MI325X, 21 ms per tre domande che condividono uno stato, 16 ms su un Jetson AGX Thor, e un throughput packed di 475 decisioni al secondo sulla 4090 e 1.106 sulla MI325X.
La scheda di Intern-Decision-4B misura 44,16 ms in media end-to-end sulla stessa RTX 4090, con una mediana di 44,03 ms e 44,60 ms al P95.
Sembra un guadagno di 5x e non lo è, perché i due stanno misurando cose diverse. I numeri di Liquid sono chiamate al modello a caldo, una richiesta alla volta, con selezione e compilazione dei kernel pagate in anticipo — la scheda dice esplicitamente che una singola domanda costa 16 ms sulla 4090 senza compilazione CUDA graph, e che la prima chiamata con una nuova forma paga la compilazione. I 44 ms di InternLM sono per query end-to-end attraverso una libreria Python il cui unico backend implementato è l'inferenza locale di Hugging Face, quindi si porta dietro il macchinario circostante. Nessuno dei due numeri è sbagliato. Metti entrambi sotto un unico harness, su una sola macchina, sulla stessa forma di richiesta, e il divario si riduce a qualcosa che vorresti misurare anziché dare per scontato.
Ciò che non è in discussione è il tetto. 8.192 token sono un rifiuto netto da parte di InternLM, e i token delle immagini attingono dallo stesso budget, quindi un documento lungo più uno screenshot è una richiesta che torna respinta anziché troncata. d1-3B ti mette a disposizione 32.768 token. Se i tuoi stati sono ticket e scambi brevi, quel divario non si fa mai sentire. Se sono grandi quanto una pagina, decide la questione prima di qualsiasi benchmark.
Eseguili come un pannello, non come uno scambio
Rispondere a un sì/no specifico e rispondere a «quale di sei cose nominate è questa, e quanto ne sei sicuro» sono richieste diverse, e le due schede sono abbastanza diverse nella forma — una con un tetto massimo rigido sull'input e un fit di calibrazione pubblicato, l'altra con 32K di contesto e una coda di punteggio migliore — che l'impiego utile per un team che valuta entrambe spesso non è una sostituzione ma un panel: lo stesso stato sottoposto a entrambi i modelli, con i disaccordi instradati a un umano o a un modello più grande.
Nessuno dei due modelli è nel nostro catalogo, e questa non è un'affermazione di disponibilità; entrambi sono artefatti self-hosted. Ma un pannello è esattamente la forma in cui è un livello di routing a fare il lavoro, non le carte. OrcaRouter espone più di 200 modelli dietro un'unica chiave API con i prezzi di listino dei provider trasferiti con markup allo 0% — così quando un fornitore che instradi tramite noi taglia il prezzo, la tua fattura si aggiorna lo stesso giorno — e il failover automatico tra provider impedisce che un pannello a due modelli diventi due singoli punti di guasto. I modelli che instradi oggi non sono questi due; sono i generalisti hosted che andresti a sostituire, come Qwen3.5-27B a $0,086 per milione di token in input e $0,688 per milione in output, che è il numero che un 3B self-hosted deve battere una volta che hai contato la GPU.
Cosa fare questa settimana
Se le tue decisioni sono stati brevi, la licenza deve superare la revisione della tua azienda e vuoi la più ampia gamma di target di build — llama.cpp, Ollama, LM Studio, un percorso batch compatto che fa passare 64 stati in una sola passata — d1-3B è il più prodottizzato dei due e la sua discriminazione tool-and-arts è la cosa più forte dimostrata da una delle due schede. Se le tue decisioni si estendono su stati lunghi, o ti serve una licenza senza clausola sui ricavi, o vuoi un fit di calibrazione che puoi riprodurre e un harness in cui il costo circostante è già conteggiato, Intern-Decision-4B è quello di cui puoi effettivamente verificare la documentazione.

La parte scomoda è la stessa per entrambi: nessuna parte indipendente ha eseguito nessuno dei due modelli, e non esiste alcun confronto di calibrazione che non sia stato commissionato dal fornitore che ha scritto la scheda. Per una classe di modelli il cui intero valore è il significato di un numero accanto a una risposta, è la lacuna che vale la pena colmare prima di imporre una soglia su qualsiasi cosa.
