Una card del titolo generata per Microsoft-Decision-1 vs Liquid AI d1-omni-600M, sottotitolata 'la più ampia superficie sensoriale della categoria contro la più ristretta lista di input', con chip che riportano 587M parametri con visione e audio, un'API Foundry solo testo, 30 secondi di parlato contro 32.768 token di testo, un encoder bidirezionale contro un decoder post-addestrato e nessuna calibrazione pubblicata da nessuna delle due parti.
Engineering & Research

Microsoft-Decision-Through AI d1-omni-600M: uno Scorer che ascolta contro uno Scorer che legge soltanto

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Stai instradando sinistri presso uno sportello assicurativo, e il fascicolo arriva sotto forma di tre cose: un PDF, una fotografia di una porta ammaccata e una telefonata di novanta secondi. Liquid AI d1-omni-600Mpuò leggere il documento, guardare la foto e ascoltare la chiamata, poi rispondere a una serie di domande che hai scritto in anticipo — è coperto, quale categoria, quanto è grave, su una scala da due a dieci — in un'unica passata, senza generare testo e senza nulla da analizzare. Microsoft-Decision-1può leggere il documento. È diventato disponibile a livello generale su Microsoft Foundry l'8 ottobre 2026 come valutatore ospitato, solo testo, post-addestrato su Qwen3.5-9B con una finestra di 32.768 token, e la sua superficie di input finisce lì: niente immagini, niente audio, niente video. Entrambi restituiscono probabilità calibrate sulle opzioni che fornisci, entrambi emettono zero token di output e nessuno dei due ha pubblicato un valore di calibrazione.

Quell'ultima frase condivisa è la parte scomoda di questo confronto. I due sono i modelli decisionali dal sensore più ampio e dal sensore più stretto a essere rilasciati questo mese, e nonostante tutta la distanza architetturale tra loro sono finiti esattamente nella stessa posizione probatoria: pesi reali o un endpoint reale, contratti documentati, e nessun numero che chiunque al di fuori del fornitore possa indicare quando qualcuno chiede se le probabilità siano affidabili.

Due ascendenze, non due taglie

La cifra di 587M invita a leggere Liquid AI d1-omni-600M come un parente ridotto dei modelli di cui questo blog si è occupato in precedenza. Non è così. Il modello è addestrato a partire da LFM2.5-Encoder-350M, un encoder bidirezionale, con un tronco condiviso e una testa decisionale da 381M, un encoder visivo da 94M preso dalla linea LFM2.5-VL-450M e un FastConformer a 17 livelli per l'audio. Microsoft-Decision-1 è un lignaggio completamente diverso: un decoder Qwen3.5-9B, post-addestrato da Microsoft, ospitato su Foundry, pesi non distribuiti e nessun percorso di fine-tuning offerto.

Bidirezionale versus decoder è il fatto architetturale che decide come ciascuno dei due si comporta, ed è anche il motivo per cui i conteggi dei parametri sono una distrazione. Un encoder bidirezionale legge l'intero stato in una volta, che è la forma giusta per un giudizio su un input fisso; un decoder post-addestrato rinuncia al percorso di generazione ma mantiene il tokenizer, la finestra e il packaging enterprise che accompagnano un deployment in foundry. Nessuno dei due è una versione scalata dell'altro, e non possono essere scambiati l'uno con l'altro, indipendentemente da come si interpreta una tabella di benchmark.

Cosa ti dà davvero la lista di input

È qui che il d1-omni-600M si discosta più nettamente da tutto il resto della categoria, ed è qui che un'affermazione va letta con attenzione.

• Parlato — Liquid AI d1-omni-600M accetta testo più fino a 30 secondi di parlato e restituisce una decisione su di esso, cosa che nessun valutatore solo testuale può fare con qualsiasi livello di accuratezza. Le modalità non testuali di Microsoft-Decision-1 non esistono.

• Mutua esclusione — il d1-omni-600M solleva un ValueError se immagini e audio arrivano nella stessa richiesta. La superficie sensoriale più ampia della categoria resta comunque una sola modalità non testuale alla volta, il che è un vero vincolo per quel banco sinistri.

• Trimming — la sua scheda indica 16.384 posizioni combinate per testo, immagini e audio, e aggiunge che, quando sono presenti immagini, i testi di stato e domanda vengono ridotti a 896 token per allinearsi all'addestramento. Qualunque documento a cui alleghi una foto è in competizione con quel taglio. I 32.768 token di Microsoft-Decision-1 sono tutti testo e non vengono ridotti.

• Formati — il d1-omni-600M ha tre tipi di domanda: noul per una decisione binaria che restituisce P(yes) tra 0 e 1, choice per un'etichetta da un insieme che indichi tu, con una confidenza e una probabilità per opzione, e score per una posizione su una scala ordinata da due a dieci livelli con la relativa distribuzione. Diverse domande fanno capo a un unico stato e vengono lette in un'unica passata, e il contatore di utilizzo riporta output_tokens: 0. Microsoft documenta forme sì/no, a scelta multipla, di valutazione, di classificazione e a rubrica, oltre a un'opzione di astensione esplicitamente supportata come "cannot tell" quando le prove sono insufficienti — l'unico dettaglio di progettazione nella pagina Microsoft che qui non ha un corrispettivo diretto.

• Runtime — il d1-omni-600M include codice personalizzato, richiede trust_remote_code=True, e la sua scheda raccomanda float16 su GPU avvertendo al contempo che bfloat16 ha modificato la risposta migliore su alcune righe. Si tratta di una sensibilità in fase di serving documentata dal fornitore, non di un difetto. Microsoft-Decision-1 è un endpoint gestito in cui la configurazione del deployment è l'unica variabile di runtime, e vale la pena notare che l'inferenza in batch è disabilitata: non esiste un canale offline attraverso cui ammortizzare uno scoring in blocco.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

Il divario probatorio, in entrambe le direzioni

Liquid AI ha pubblicato la famiglia open d1, inclusa d1-omni-600M, il 7 ottobre 2026 con un post di rilascio e un set di documentazione. Ciò che non è pubblicato è il numero che renderebbe concreta l'affermazione multimodale. Non esiste un benchmark di accuratezza specifico per la sua capacità principale — la qualità decisionale visione-e-audio che giustifica gli encoder da 94M e 112M — e la partizione visione è omessa dal materiale di valutazione rilasciato. Non è pubblicata nemmeno alcuna cifra di latenza, quindi il throughput del modello è qualcosa che scopri sul tuo hardware.

La posizione di Microsoft è strutturalmente identica e un passo più avanti. La sua scheda Benchmarks elenca le metriche — accuratezza, errore di calibrazione, richiamo di sicurezza, tassi di falsi positivi, coerenza dell'equità — dichiara che la valutazione è stata eseguita su benchmark decisionali pubblici e della community più set di test interni tenuti da parte e non utilizzati nell'addestramento, che l'ordine delle opzioni è stato variato, che sono stati applicati test statistici appaiati, e afferma che il modello "si comporta allo stesso livello dei principali modelli decisionali e meglio di altri modelli decisionali aperti valutati con la stessa metodologia". Non riporta nessuno dei risultati. Venticinque lingue sono elencate come supportate, tra cui giapponese, coreano, arabo, vietnamita, thai, turco, hindi, bengalese, swahili, ebraico, persiano e ucraino, con l'avvertenza schietta che copertura, qualità e calibrazione "possono variare da lingua a lingua" e che le lingue diverse dall'inglese, specialmente quelle a basse risorse, sono un punto debole. Anche il prezzo non è indicato nella pagina del modello; rimanda alla pagina dei prezzi di Microsoft.

Quindi il confronto tra questi due non è un confronto di prove contro prove. È una scelta tra due tipi di numero mancante. Liquid AI ha rilasciato la superficie del sensore e ha lasciato l'accuratezza di quella superficie non misurata pubblicamente. Microsoft ha rilasciato il percorso di approvvigionamento — autenticazione Azure, governance, una valutazione di IA responsabile, una metodologia — e ha lasciato non quantificata la calibrazione di un prodotto probabilistico.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

La domanda di calibrazione a cui nessuno dei due risponde

Per un modello decisionale, il prodotto è la probabilità. Tutto ciò che sta a valle è una soglia: 0,7 fa scattare l'escalation, 0,95 accetta automaticamente, e il costo di tracciare quella linea in modo sbagliato si paga in decisioni automatizzate scadenti anziché in token. In questa categoria c'è almeno una famiglia che pubblica i dati — i checkpoint Intern-Decision di InternLM riportano i numeri di Brier e di errore di calibrazione atteso sulle loro model card — e nessuno dei due modelli in questo articolo lo fa. Questa asimmetria è la ragione pratica per mantenere il campo ampio anziché impegnarsi sulla sola architettura.

La buona notizia è che il test è economico e non richiede la collaborazione del fornitore. Metti insieme un paio di centinaia di casi etichettati che assomiglino al tuo traffico reale, scrivi lo schema delle domande che la tua applicazione invierebbe realmente, esegui entrambi i modelli su di essi e calcola l'errore di calibrazione atteso sull'output. Saprai quindi due cose che nessuno al di fuori dei due fornitori attualmente sa: quanto bene le probabilità di Microsoft-Decision-1 seguono la sua accuratezza sulla tua distribuzione, e se i percorsi audio e immagine del d1-omni-600M valgono gli encoder che portano con sé. Anche le linee guida documentate di Microsoft vanno nella stessa direzione: convalidare su dati rappresentativi, impostare le soglie in base al costo dei tuoi errori, includere sempre un'opzione di astensione, randomizzare l'ordine delle opzioni, mantenere un essere umano nel ciclo per le decisioni conseguenti.

Dove appartiene ciascuno, e dove lo fa OrcaRouter

Microsoft-Decision-1 appartiene ovunque il materiale decisionale sia testo e l'ostacolo sia l'approvvigionamento: un lungo documento, un passaggio recuperato, una proposta di chiamata a strumento, una risposta generata valutata rispetto a una rubrica, con autenticazione Azure, fatturazione unificata e una valutazione del fornitore richieste prima che qualsiasi cosa raggiunga la produzione. È lo strumento più ristretto e quello più facile da approvare.

Liquid AI d1-omni-600M appartiene a ogni contesto in cui il materiale decisivo non è testo — una foto allegata a un modulo, la breve registrazione di una chiamata, uno screenshot — e ovunque tu voglia pesi lfm1.0 che puoi eseguire e mettere a punto all'interno di un confine che controlli. È lo strumento più ampio e quello più difficile da validare, perché l'affermazione multimodale è esattamente la parte che non ha alcun benchmark pubblicato alle spalle.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Nessuno dei due è nel nostro catalogo, e nulla di quanto qui riportato costituisce una dichiarazione di disponibilità per l'uno o per l'altro. Un modello che restituisce probabilità anziché testo non è qualcosa a cui instradare le completions della chat, e restare fuori dalla postazione di scoring è l'intero design dello strumento. Ciò che OrcaRouter offre è il lato generativo dello stesso ciclo: gli oltre 200 modelli dietro una chiave compatibile con OpenAI che scrivono la rubrica rispetto alla quale il tuo scorer valuta, trascrivono o riassumono il materiale prima che diventi uno stato, ed emettono la chiamata di tool che il tuo scorer approva prima che venga eseguita. Il prezzo di listino del provider viene passato al 0% di markup, così un taglio di prezzo del fornitore sul lato generativo è attivo sul nostro lo stesso giorno. Il failover automatico mantiene quel lato in vita quando un singolo provider si degrada — cosa che una pipeline che valuta ogni documento recuperato nota immediatamente — e se vuoi che vengano giudicati più writer anziché uno solo, il DSL di routing li compone in un'unica chiamata e il model fusion riporta il loro accordo come un campo che il tuo scorer può leggere come qualsiasi altro.

Il risultato finale

Microsoft-Decision-1 ha raggiunto la disponibilità generale su Microsoft Foundry l'8 ottobre 2026: solo testo, 32.768 token, basato su un Qwen3.5-9B post-addestrato, ospitato senza pesi, nessun prezzo sulla pagina del modello, nessun dato di latenza e una sezione benchmark che ne descrive la metodologia senza pubblicare un risultato. Liquid AI d1-omni-600M è stato caricato il 7 ottobre 2026 come modello decisionale con encoder bidirezionale da 587M che legge testo, immagini o 30 secondi di parlato — una modalità non testuale alla volta, con il testo ridotto a 896 token quando sono presenti immagini — con licenza lfm1.0, senza alcun benchmark di accuratezza per la sua capacità principale, nessuna suddivisione vision e nessuna latenza pubblicata. Scegli in base alla modalità e al controllo, non ai punteggi, perché i punteggi non esistono: se il tuo materiale è una fotografia o una telefonata, solo uno di questi può rispondere, e se è un documento di quaranta pagine con allegata una revisione degli approvvigionamenti, solo l'altro può essere implementato.

Ciò che OrcaRouter porta è il lato generativo dello stesso ciclo: i più di 200 modelli dietro un'unica chiave compatibile con OpenAI che scrivono la rubrica rispetto alla quale il tuo scorer valuta, trascrivono o riassumono il materiale prima che diventi uno stato, ed emettono la chiamata allo strumento che il tuo scorer approva prima che venga eseguita.