
Microsoft-Decision-1 vs Liquid AI d1-3B: stessa finestra da 32K, due sensi diversi
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
Per una volta le specifiche coincidono. Microsoft-Decision-1, generalmente disponibile su Microsoft Foundry dall'8 ottobre 2026, accetta 32.768 token di contesto. Lo stesso vale per Liquid AI d1-3B, caricato su Hugging Face il 5 ottobre 2026 e annunciato da Liquid AI due giorni dopo. Entrambi accettano uno stato più un insieme di domande tipizzate — sì/no, scelta tra opzioni denominate, una posizione su una scala ordinata — ed entrambi rispondono in un singolo passaggio in avanti con una distribuzione di probabilità invece di testo generato; Laya, Intern-Decision-4B, Kev e il resto di questa nicchia non concordano tra loro sulla lunghezza del contesto, quindi questa è l'unica coppia in cui quella dimensione scompare e il confronto deve essere argomentato su qualcos'altro.
Quel qualcos'altro si rivela essere il canale di input. Il modello di Microsoft è esplicitamente solo testuale: "non accetta né produce contenuti immagine, audio o video". Quello di Liquid AI monta un encoder visivo SigLIP2 NaFlex da 400 milioni di parametri su un backbone linguistico da 2,6 miliardi di parametri e arriva a 3,12 miliardi di parametri in totale, ed è stato costruito esattamente per la cosa che Microsoft ha escluso: valutare uno screenshot, un modulo scansionato o un fotogramma della fotocamera rispetto a una domanda fissa. Questa separazione, insieme a una differenza di licenza che non ha nulla a che fare con le capacità, è l'intero confronto.
Dove i due concordano, il che è più di quanto ci si aspetterebbe.
• Finestra di contesto — 32.768 token per Microsoft-Decision-1 e 32.768 token per Liquid AI d1-3B.
• Forma dell'output — probabilità calibrate sulle opzioni fornite; nessuno dei due genera testo, e il contatore di utilizzo di Liquid AI riporta il fatto come output_tokens: 0.
• Tipi di domanda — sia scelta del documento, punteggio ordinato e sì/no binario, ed entrambi ti consentono di definire l'insieme di opzioni per richiesta invece di riaddestrare una testa del vocabolario.
• Astensione — opzioni esplicite di astensione come «non posso dirlo»; il Decision Index di Liquid AI supporta lo stesso tramite il suo
• Inferenza a passaggio singolo — una chiamata per decisione su entrambi i lati, ed è ciò che rende l'una o l'altra praticabile ai volumi di una pipeline.
Due modelli che concordano sulle due restrizioni più difficili di questo ambito meritano una pausa di riflessione. Una finestra da 32K è ciò che rende un decision scorer utilizzabile su un contratto completo, una policy di più pagine o un lungo thread di supporto; il checkpoint Laya inglese da 512 token e i limiti di domande per chiamata su Intern-Decision-4B no. Se il tuo input è breve, gran parte di questo campo è intercambiabile e la decisione riguarda l'hosting. Se il tuo input è lungo, il campo si restringe a questi due.
La sensazione che solo uno di loro ha
Liquid AI d1-3B è multimodale, e l'albero del modello rende chiara la discendenza: LFM2.5-2.6B-Base, poi LFM2.5-VL-3B, poi d1-3B post-addestrato per decisioni calibrate in singolo passaggio. Le immagini entrano tramite l'encoder SigLIP2 NaFlex, e la scheda riporta una media di 74,1 su undici benchmark pubblici di immagini contro 73,9 del modello visivo di base — quindi il tuning per le decisioni non è costato in qualità visiva. Riporta anche l'esperimento inverso: togli le immagini e le stesse domande scendono a 45,1, che è la prova più limpida che si possa avere che il canale percettivo è portante e non decorativo.
Microsoft-Decision-1 non ha un equivalente, e l'omissione è deliberata anziché incompiuta. La scheda di Microsoft elenca gli usi fuori ambito come generazione di testo, risposta a domande aperte, conversazione, traduzione e sintesi, e dichiara separatamente che il modello è esclusivamente testuale. Per una pipeline che deve valutare lo screenshot di un modulo rispetto a una rubrica, o stabilire se un fotogramma della telecamera contiene un evento di sicurezza, si tratta di un blocco invalicabile — nessun prompt engineering può recuperare una modalità che al modello non è mai stata data.
Il conteggio delle lingue va nella direzione opposta, e questa è la seconda vera divisione. Microsoft-Decision-1 elenca 25 lingue supportate, e l'azienda è schietta nel dire che copertura, qualità e calibrazione "possono variare da lingua a lingua", indicando le lingue non inglesi e in particolare quelle a basse risorse come area di sottoperformance. Liquid AI d1-3B dichiara 16 lingue. Sull'ampiezza Microsoft è avanti sulla carta; sull'onestà riguardo a cosa significhi l'ampiezza, entrambi i fornitori dicono qualcosa di simile, e nessuno dei due ha pubblicato la calibrazione per lingua.

La scheda benchmark, di nuovo
La pagina Foundry di Microsoft-Decision-1 presenta una scheda Benchmarks con una sezione di metodologia e nessun dato numerico: benchmark decisionali pubblici e della community più set interni held-out, metriche che coprono accuratezza ed errore di calibrazione, ordine delle opzioni variato, test statistici appaiati, e l'affermazione che il modello «si comporta allo stesso livello dei principali modelli decisionali e davanti ad altri modelli decisionali aperti valutati con la stessa metodologia». Nulla da verificare, nulla da riprodurre.
Liquid AI d1-3B riporta 48,57 su Decision Index 0.2.1 — e il qualificatore conta più del numero, perché Decision Index è l'indice di Liquid AI e d1-3B è il modello di Liquid AI. È un risultato con punteggio assegnato dal fornitore su un benchmark redatto dal fornitore, presentato dall'azienda come il migliore tra i modelli decisionali sotto i 10B e davanti a un modello da 35B sulla stessa scala. Considera 48,57 come un'affermazione indicativa, non come un dato verificato. Accanto ad esso, la scheda elenca valutazioni interne sul formato decisionale con una media di 77,1, SQuAD 2.0 a 85,3, PAWS-X a 76,9 e DecisionBench 71,8 — tutte autodichiarate, e la formulazione "sotto i 10B" è un vero qualificatore, non una scappatoia, dato che il modello è 3,12B.
Quindi la questione della calibrazione si risolve allo stesso modo in tutto questo campo: Liquid AI ti fornisce un numero prodotto sulla propria scala, Microsoft ti fornisce una metodologia e nessun numero, e nessuno dei due ti fornisce una misurazione indipendente di terze parti. L'unico valore di calibrazione che conterà per il tuo deployment è quello che calcoli sui tuoi dati etichettati.

Servizio, licenze e ciò che stai effettivamente acquistando
La latenza di d1-3B è pubblicata ed è la ragione stessa per cui il modello esiste. Otto millisecondi per decisione su una RTX 4090, nove su una AMD MI325X, con un throughput packed di 475 e 1.106 al secondo a 64 stati. Su hardware edge: 30 ms su un Apple M5 Pro, 16 ms su un Jetson AGX Thor, 26 ms su un Jetson AGX Orin 64 GB, 50 ms su un Orin Nano. Microsoft-Decision-1 non pubblica alcun dato di latenza e le sue opzioni integrate — un'API Foundry ospitata con pay-as-you-go oppure con throughput con provisioning riservato, con l'inferenza in batch disabilitata — fanno sì che la si misuri attraverso il proprio deployment. Non è una lacuna di poco conto per un modello il cui scopo è essere invocato una volta per ogni documento recuperato o azione proposta.
È sulla licenza che i due divergono, in un modo che sorprende. Liquid AI d1-3B è etichettato lfm1.0, non Apache 2.0 — la stessa licenza di famiglia del resto della linea LFM di Liquid, che comporta condizioni d'uso che una licenza permissiva non prevede. Se la tua revisione legale lo interpreta come compatibile con OpenAI e senza vincoli, non è così, e vale la pena leggerla prima che il modello venga rilasciato, non dopo. Microsoft-Decision-1 non ha affatto pesi: è un endpoint ospitato nel portfolio Direct from Azure, con autenticazione Azure, fatturazione unificata, nessun download, e la questione della licenza sostituita da un contratto di servizio. Nessuno dei due modelli può essere fine-tuned attraverso i percorsi documentati dai fornitori, che è la limitazione più netta per un modello decisionale — uno scorer che non puoi adattare alle tue etichette è uno scorer i cui modi di errore non puoi correggere, puoi solo aggirarli.
Instradare attorno a essi è dove OrcaRouter si colloca in questo schema, e solo su un lato di esso. Non ospitiamo né Microsoft-Decision-1 né Liquid AI d1-3B: nessuno dei due restituisce testo, nessuno dei due è nel nostro catalogo, e un endpoint di scoring probabilistico non è un target di chat-completions. Ciò che forniamo è la metà generativa del ciclo — il modello che abbozza la risposta che il vostro scorer valuterà, estrae i campi che il vostro scorer giudicherà, o propone l'azione che il vostro scorer approverà. Si tratta di più di 200 modelli dietro un'unica chiave compatibile con OpenAI al prezzo di listino del provider passato con markup dello 0%, quindi una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno, e il failover automatico copre la chiamata di generazione in un ciclo che non ha latenza in eccesso per ritentarne una.

Due scelte nette, e una che non è affatto vicina
Scegli Liquid AI d1-3B se qualcosa nella tua pipeline è un'immagine. Triage di screenshot, estrazione di moduli, routing di QA visivo, un moderatore che valuta i fotogrammi della telecamera: Microsoft-Decision-1 non può essere indotto a farlo, e d1-3B è stato creato per questo, con benchmark di visione pubblicati a supporto dell'affermazione. Sceglilo anche se ti serve inferenza edge misurata in decine di millisecondi su un Jetson o un laptop, se vuoi il modello sul tuo hardware o se una licenza che puoi leggere basta per il tuo ufficio legale.
Scegli Microsoft-Decision-1 se il tuo input è testo, i tuoi documenti sono lunghi, il tuo gate è il procurement — autenticazione Azure, fatturazione unificata, una valutazione Responsible AI, un fornitore a cui fare escalation — oppure il tuo traffico copre più delle 16 lingue elencate da d1-3B. Accetta che la mancanza del suo valore di latenza e della sua tabella di benchmark significhi che le tue prime due settimane con esso sono misurazione, non integrazione.
L'unico caso che non lascia dubbi è il lavoro multimodale: lì, la scelta è stata fatta quando Microsoft ha scritto "solo testo" nella scheda del modello.
