Una card di titolo generata per Microsoft-Decision-1 vs Liquid AI d1-3B, con sottotitolo «gli unici due modelli decisionali che concordano sulla finestra di contesto», con chip che riportano 32.768 token su entrambi, solo testo vs testo, immagini e audio, 25 lingue vs 16, API ospitata vs pesi lfm1.0, e un piè di pagina che segnala che i dati di entrambi i fornitori sono autodichiarati e non verificati.
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B: stessa finestra da 32K, due sensi diversi

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Per una volta le specifiche coincidono. Microsoft-Decision-1, generalmente disponibile su Microsoft Foundry dall'8 ottobre 2026, accetta 32.768 token di contesto. Lo stesso vale per Liquid AI d1-3B, caricato su Hugging Face il 5 ottobre 2026 e annunciato da Liquid AI due giorni dopo. Entrambi accettano uno stato più un insieme di domande tipizzate — sì/no, scelta tra opzioni denominate, una posizione su una scala ordinata — ed entrambi rispondono in un singolo passaggio in avanti con una distribuzione di probabilità invece di testo generato; Laya, Intern-Decision-4B, Kev e il resto di questa nicchia non concordano tra loro sulla lunghezza del contesto, quindi questa è l'unica coppia in cui quella dimensione scompare e il confronto deve essere argomentato su qualcos'altro.

Quel qualcos'altro si rivela essere il canale di input. Il modello di Microsoft è esplicitamente solo testuale: "non accetta né produce contenuti immagine, audio o video". Quello di Liquid AI monta un encoder visivo SigLIP2 NaFlex da 400 milioni di parametri su un backbone linguistico da 2,6 miliardi di parametri e arriva a 3,12 miliardi di parametri in totale, ed è stato costruito esattamente per la cosa che Microsoft ha escluso: valutare uno screenshot, un modulo scansionato o un fotogramma della fotocamera rispetto a una domanda fissa. Questa separazione, insieme a una differenza di licenza che non ha nulla a che fare con le capacità, è l'intero confronto.

Dove i due concordano, il che è più di quanto ci si aspetterebbe.

• Finestra di contesto — 32.768 token per Microsoft-Decision-1 e 32.768 token per Liquid AI d1-3B.

• Forma dell'output — probabilità calibrate sulle opzioni fornite; nessuno dei due genera testo, e il contatore di utilizzo di Liquid AI riporta il fatto come output_tokens: 0.

• Tipi di domanda — sia scelta del documento, punteggio ordinato e sì/no binario, ed entrambi ti consentono di definire l'insieme di opzioni per richiesta invece di riaddestrare una testa del vocabolario.

• Astensione — opzioni esplicite di astensione come «non posso dirlo»; il Decision Index di Liquid AI supporta lo stesso tramite il suo

• Inferenza a passaggio singolo — una chiamata per decisione su entrambi i lati, ed è ciò che rende l'una o l'altra praticabile ai volumi di una pipeline.

Due modelli che concordano sulle due restrizioni più difficili di questo ambito meritano una pausa di riflessione. Una finestra da 32K è ciò che rende un decision scorer utilizzabile su un contratto completo, una policy di più pagine o un lungo thread di supporto; il checkpoint Laya inglese da 512 token e i limiti di domande per chiamata su Intern-Decision-4B no. Se il tuo input è breve, gran parte di questo campo è intercambiabile e la decisione riguarda l'hosting. Se il tuo input è lungo, il campo si restringe a questi due.

La sensazione che solo uno di loro ha

Liquid AI d1-3B è multimodale, e l'albero del modello rende chiara la discendenza: LFM2.5-2.6B-Base, poi LFM2.5-VL-3B, poi d1-3B post-addestrato per decisioni calibrate in singolo passaggio. Le immagini entrano tramite l'encoder SigLIP2 NaFlex, e la scheda riporta una media di 74,1 su undici benchmark pubblici di immagini contro 73,9 del modello visivo di base — quindi il tuning per le decisioni non è costato in qualità visiva. Riporta anche l'esperimento inverso: togli le immagini e le stesse domande scendono a 45,1, che è la prova più limpida che si possa avere che il canale percettivo è portante e non decorativo.

Microsoft-Decision-1 non ha un equivalente, e l'omissione è deliberata anziché incompiuta. La scheda di Microsoft elenca gli usi fuori ambito come generazione di testo, risposta a domande aperte, conversazione, traduzione e sintesi, e dichiara separatamente che il modello è esclusivamente testuale. Per una pipeline che deve valutare lo screenshot di un modulo rispetto a una rubrica, o stabilire se un fotogramma della telecamera contiene un evento di sicurezza, si tratta di un blocco invalicabile — nessun prompt engineering può recuperare una modalità che al modello non è mai stata data.

Il conteggio delle lingue va nella direzione opposta, e questa è la seconda vera divisione. Microsoft-Decision-1 elenca 25 lingue supportate, e l'azienda è schietta nel dire che copertura, qualità e calibrazione "possono variare da lingua a lingua", indicando le lingue non inglesi e in particolare quelle a basse risorse come area di sottoperformance. Liquid AI d1-3B dichiara 16 lingue. Sull'ampiezza Microsoft è avanti sulla carta; sull'onestà riguardo a cosa significhi l'ampiezza, entrambi i fornitori dicono qualcosa di simile, e nessuno dei due ha pubblicato la calibrazione per lingua.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

La scheda benchmark, di nuovo

La pagina Foundry di Microsoft-Decision-1 presenta una scheda Benchmarks con una sezione di metodologia e nessun dato numerico: benchmark decisionali pubblici e della community più set interni held-out, metriche che coprono accuratezza ed errore di calibrazione, ordine delle opzioni variato, test statistici appaiati, e l'affermazione che il modello «si comporta allo stesso livello dei principali modelli decisionali e davanti ad altri modelli decisionali aperti valutati con la stessa metodologia». Nulla da verificare, nulla da riprodurre.

Liquid AI d1-3B riporta 48,57 su Decision Index 0.2.1 — e il qualificatore conta più del numero, perché Decision Index è l'indice di Liquid AI e d1-3B è il modello di Liquid AI. È un risultato con punteggio assegnato dal fornitore su un benchmark redatto dal fornitore, presentato dall'azienda come il migliore tra i modelli decisionali sotto i 10B e davanti a un modello da 35B sulla stessa scala. Considera 48,57 come un'affermazione indicativa, non come un dato verificato. Accanto ad esso, la scheda elenca valutazioni interne sul formato decisionale con una media di 77,1, SQuAD 2.0 a 85,3, PAWS-X a 76,9 e DecisionBench 71,8 — tutte autodichiarate, e la formulazione "sotto i 10B" è un vero qualificatore, non una scappatoia, dato che il modello è 3,12B.

Quindi la questione della calibrazione si risolve allo stesso modo in tutto questo campo: Liquid AI ti fornisce un numero prodotto sulla propria scala, Microsoft ti fornisce una metodologia e nessun numero, e nessuno dei due ti fornisce una misurazione indipendente di terze parti. L'unico valore di calibrazione che conterà per il tuo deployment è quello che calcoli sui tuoi dati etichettati.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Servizio, licenze e ciò che stai effettivamente acquistando

La latenza di d1-3B è pubblicata ed è la ragione stessa per cui il modello esiste. Otto millisecondi per decisione su una RTX 4090, nove su una AMD MI325X, con un throughput packed di 475 e 1.106 al secondo a 64 stati. Su hardware edge: 30 ms su un Apple M5 Pro, 16 ms su un Jetson AGX Thor, 26 ms su un Jetson AGX Orin 64 GB, 50 ms su un Orin Nano. Microsoft-Decision-1 non pubblica alcun dato di latenza e le sue opzioni integrate — un'API Foundry ospitata con pay-as-you-go oppure con throughput con provisioning riservato, con l'inferenza in batch disabilitata — fanno sì che la si misuri attraverso il proprio deployment. Non è una lacuna di poco conto per un modello il cui scopo è essere invocato una volta per ogni documento recuperato o azione proposta.

È sulla licenza che i due divergono, in un modo che sorprende. Liquid AI d1-3B è etichettato lfm1.0, non Apache 2.0 — la stessa licenza di famiglia del resto della linea LFM di Liquid, che comporta condizioni d'uso che una licenza permissiva non prevede. Se la tua revisione legale lo interpreta come compatibile con OpenAI e senza vincoli, non è così, e vale la pena leggerla prima che il modello venga rilasciato, non dopo. Microsoft-Decision-1 non ha affatto pesi: è un endpoint ospitato nel portfolio Direct from Azure, con autenticazione Azure, fatturazione unificata, nessun download, e la questione della licenza sostituita da un contratto di servizio. Nessuno dei due modelli può essere fine-tuned attraverso i percorsi documentati dai fornitori, che è la limitazione più netta per un modello decisionale — uno scorer che non puoi adattare alle tue etichette è uno scorer i cui modi di errore non puoi correggere, puoi solo aggirarli.

Instradare attorno a essi è dove OrcaRouter si colloca in questo schema, e solo su un lato di esso. Non ospitiamo né Microsoft-Decision-1 né Liquid AI d1-3B: nessuno dei due restituisce testo, nessuno dei due è nel nostro catalogo, e un endpoint di scoring probabilistico non è un target di chat-completions. Ciò che forniamo è la metà generativa del ciclo — il modello che abbozza la risposta che il vostro scorer valuterà, estrae i campi che il vostro scorer giudicherà, o propone l'azione che il vostro scorer approverà. Si tratta di più di 200 modelli dietro un'unica chiave compatibile con OpenAI al prezzo di listino del provider passato con markup dello 0%, quindi una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno, e il failover automatico copre la chiamata di generazione in un ciclo che non ha latenza in eccesso per ritentarne una.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Due scelte nette, e una che non è affatto vicina

Scegli Liquid AI d1-3B se qualcosa nella tua pipeline è un'immagine. Triage di screenshot, estrazione di moduli, routing di QA visivo, un moderatore che valuta i fotogrammi della telecamera: Microsoft-Decision-1 non può essere indotto a farlo, e d1-3B è stato creato per questo, con benchmark di visione pubblicati a supporto dell'affermazione. Sceglilo anche se ti serve inferenza edge misurata in decine di millisecondi su un Jetson o un laptop, se vuoi il modello sul tuo hardware o se una licenza che puoi leggere basta per il tuo ufficio legale.

Scegli Microsoft-Decision-1 se il tuo input è testo, i tuoi documenti sono lunghi, il tuo gate è il procurement — autenticazione Azure, fatturazione unificata, una valutazione Responsible AI, un fornitore a cui fare escalation — oppure il tuo traffico copre più delle 16 lingue elencate da d1-3B. Accetta che la mancanza del suo valore di latenza e della sua tabella di benchmark significhi che le tue prime due settimane con esso sono misurazione, non integrazione.

L'unico caso che non lascia dubbi è il lavoro multimodale: lì, la scelta è stata fatta quando Microsoft ha scritto "solo testo" nella scheda del modello.