Ett genererat titelkort för Microsoft-Decision-1 mot Liquid AI d1-omni-600M med undertexten 'den bredaste sensorytan i kategorin mot den smalaste indatalistan', med chips som det står 587M parametrar med vision och ljud, ett Foundry-API endast för text, 30 sekunder tal mot 32 768 tokens text, en dubbelriktad encoder mot en eftertränad dekoder, och ingen publicerad kalibrering på någon av sidorna.
Engineering & Research

Microsoft-Decision-1 vs Liquid AI d1-omni-600M: En poängsättare som lyssnar mot en poängsättare som bara läser

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Du dirigerar skadeanmälningar vid en försäkringsdisk, och akten kommer in som tre saker: en PDF, ett fotografi av en bucklad dörr och ett nittio sekunder långt telefonsamtal. Liquid AI d1-omni-600M kan läsa dokumentet, titta på fotot och lyssna på samtalet och sedan besvara en uppsättning frågor som du har skrivit i förväg – täcks detta, vilken kategori, hur allvarligt, på en skala från två till tio – i en enda körning, utan att text genereras och utan något att tolka. Microsoft-Decision-1 kan läsa dokumentet. Den blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026 som en hostad, endast textbaserad scorer eftertränad på Qwen3.5-9B med ett fönster på 32 768 tokens, och dess indatayta upphör där: ingen bild, inget ljud, ingen video. Båda returnerar kalibrerade sannolikheter över de alternativ du anger, båda avger noll utdatatokens, och ingen av dem har publicerat ett kalibreringsvärde.

Den där sista gemensamma meningen är den obekväma delen av den här jämförelsen. De två är de beslutsmodeller med bredast respektive smalast sensor som släpps den här månaden, och trots allt det arkitektoniska avståndet mellan dem har de hamnat i exakt samma bevismässiga position: riktiga vikter eller en riktig slutpunkt, dokumenterade kontrakt, och ingen siffra som någon utanför leverantören kan peka på när någon frågar om sannolikheterna är tillförlitliga.

Två ursprung, inte två storlekar

Siffran 587M inbjuder dig att läsa Liquid AI d1-omni-600M som en förminskad släkting till de modeller som den här bloggen har tagit upp tidigare. Det är den inte. Modellen är tränad från LFM2.5-Encoder-350M, en dubbelriktad encoder, med en delad trunk på 381M och ett beslutshuvud, en visionsencoder på 94M hämtad från LFM2.5-VL-450M-serien och en 17-lagers FastConformer för ljud. Microsoft-Decision-1 är en helt annan härstamning: en Qwen3.5-9B-decoder, eftertränad av Microsoft, hostad på Foundry, vikterna distribueras inte och ingen finjusteringsväg erbjuds.

Dubbelriktad kontra avkodare är det arkitektoniska faktum som avgör hur var och en beter sig, och det är också därför parameterantalet är en distraktion. En dubbelriktad enkodare läser hela tillståndet på en gång, vilket är rätt form för ett omdöme över en fast indata; en eftertränad avkodare avstår från genereringsvägen men behåller tokeniseraren, fönstret och den företagspaketering som följer med en foundry-driftsättning. Ingetdera är en skalad version av det andra, och de kan inte bytas ut mot varandra oavsett hur en benchmarktabell läses.

Vad indatalistan faktiskt ger dig

Det är här som d1-omni-600M avviker kraftigast från allt annat i kategorin, och där ett påstående behöver läsas noga.

• Tal — Liquid AI d1-omni-600M tar emot text plus upp till 30 sekunders tal och rapporterar ett beslut om det, vilket ingen enbart textbaserad poängsättare kan göra med någon noggrannhet. Microsoft-Decision-1:s icke-textmodaliteter finns inte.

• Ömsesidig uteslutning — d1-omni-600M kastar ett ValueError om bilder och ljud anländer i samma begäran. Den bredaste sensorytan i kategorin är fortfarande en icke-textmodalitet i taget, vilket är en reell begränsning för den där skadehanteringsdisken.

• Trimning — dess kort anger 16 384 kombinerade text-, bild- och ljudpositioner, och tillägger att när bilder finns trimmas tillstånds- och frågetexten till 896 tokens för att matcha träningen. Oavsett vilket dokument du bifogar ett foto till konkurrerar det med den trimningen. Microsoft-Decision-1:s 32 768 tokens utgörs helt av text och trimmas inte.

• Format — d1-omni-600M har tre frågetyper: noul för ett binärt beslut som returnerar P(ja) mellan 0 och 1, val för en etikett från en mängd som du namnger med en konfidens och en sannolikhet per alternativ, och poäng för en position på en ordnad skala med två till tio nivåer med sin fördelning. Flera frågor är kopplade till ett tillstånd och läses i en enda genomkörning, och användningsräknaren rapporterar output_tokens: 0. Microsoft dokumenterar former för ja/nej, flerval, betyg, klassificering och bedömningsmallar, plus ett uttryckligen stött alternativ för avstående, som "kan inte avgöra", när underlaget är otillräckligt — den enda designdetaljen på Microsofts sida som inte har någon direkt motsvarighet här.

• Körtid — d1-omni-600M levererar egen kod, kräver trust_remote_code=True, och dess kort rekommenderar float16 på GPU samtidigt som det varnar för att bfloat16 ändrade det främsta svaret på vissa rader. Det är en känslighet vid serving som dokumenterats av leverantören, inte en defekt. Microsoft-Decision-1 är en hanterad endpoint där distributionens utformning är din enda körtidsvariabel, och det är värt att notera att batchinferens är inaktiverad: det finns ingen offlinekanal för att skriva av en bulk-körning för poängsättning genom.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

Evidensgapet, i båda riktningarna

Liquid AI publicerade den öppna d1-familjen, inklusive d1-omni-600M, den 7 oktober 2026 med ett lanseringsinlägg och en dokumentationsuppsättning. Det som inte publiceras är siffran som skulle göra multimodalitetsanspråket konkret. Det finns inget träffsäkerhetsbenchmark specifikt för dess egen främsta förmåga – den beslutsfattandekvalitet för bild och ljud som motiverar 94M- och 112M-encodrarna – och vision-delen undanhålls från det publicerade utvärderingsmaterialet. Ingen latenssiffra publiceras heller, så modellens genomströmning är något man upptäcker på sin egen hårdvara.

Microsofts position är strukturellt identisk och ett steg längre fram. Fliken Benchmarks namnger mätvärdena – noggrannhet, kalibreringsfel, säkerhetsrecall, falskpositiva frekvenser, rättvisekonsistens – och uppger att utvärderingen kördes på offentliga och gemenskapsbaserade beslutsbenchmarks plus undanhållna interna testset som inte använts i träningen, att alternativordningen varierades, att parade statistiska tester tillämpades, och hävdar att modellen "presterar i nivå med ledande beslutsmodeller och ligger före andra öppna beslutsmodeller som utvärderats med samma metodik." Den redovisar inget av resultaten. Tjugofem språk anges som stödda, inklusive japanska, koreanska, arabiska, vietnamesiska, thailändska, turkiska, hindi, bengaliska, swahili, hebreiska, persiska och ukrainska, med den uppriktiga varningen att täckning, kvalitet och kalibrering "kan variera mellan språk" och att icke-engelska, särskilt lågresursspråk, är en svag punkt. Prissättning finns inte heller på modellsidan; den länkar ut till Microsofts prissättningsyta.

Så jämförelsen mellan dessa två är inte en fråga om bevis mot bevis. Det är ett val mellan två slags saknade tal. Liquid AI har levererat sensorytan och lämnat noggrannheten hos den ytan omätt offentligt. Microsoft har levererat upphandlingsvägen – Azure-autentisering, styrning, en Responsible AI-bedömning, en dokumenterad metodik – och lämnat kalibreringen av en sannolikhetsprodukt okvantifierad.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Kalibreringsfrågan som ingen av dem besvarar

För en beslutsmodell är sannolikheten produkten. Allt nedströms är en tröskel: 0,7 eskalerar, 0,95 autogodkänner, och kostnaden för att sätta den gränsen fel betalas i dåliga automatiserade beslut snarare än i tokens. I den här kategorin finns det minst en familj som publicerar siffrorna – InternLM:s Intern-Decision-checkpoints anger Brier- och expected-calibration-error-siffror på sina modellkort – och ingen av modellerna i den här artikeln gör det. Den asymmetrin är det praktiska skälet att hålla fältet brett i stället för att binda sig vid enbart arkitektur.

Den goda nyheten är att testet är billigt och inte kräver leverantörens samarbete. Sätt samman ett par hundra märkta fall som liknar din verkliga trafik, skriv det frågeschema som din applikation faktiskt skulle skicka, kör båda modellerna över dem och beräkna förväntat kalibreringsfel på utdata. Då kommer du att veta två saker som ingen utanför de två leverantörerna för närvarande känner till: hur väl Microsoft-Decision-1:s sannolikheter följer dess noggrannhet på din fördelning, och huruvida d1-omni-600M:s ljud- och bildvägar är värda de kodare de bär. Microsofts egen dokumenterade vägledning pekar i samma riktning – validera på representativa data, sätt trösklar utifrån kostnaden för dina fel, inkludera alltid ett alternativ för att avstå, slumpa ordningen på alternativ, behåll en människa i loopen för konsekvensfulla beslut.

Där var och en hör hemma, och där OrcaRouter gör det

Microsoft-Decision-1 hör hemma varhelst det avgörande materialet är text och hindret är upphandling: ett långt dokument, en hämtad passage, ett föreslaget verktygsanrop, ett genererat svar som bedöms mot en bedömningsmatris, med Azure-autentisering, enhetlig fakturering och en leverantörsbedömning som krävs innan något når produktion. Det är det snävare instrumentet och det som är lättare att få godkänt.

Liquid AI d1-omni-600M hör hemma där det avgörande materialet inte är text — ett foto bifogat ett formulär, en kort samtalsinspelning, en skärmbild — och där du vill ha lfm1.0-vikter som du kan köra och finjustera inom en gräns du kontrollerar. Det är det bredare instrumentet och det svårare att validera, eftersom påståendet om multimodalitet är precis den del som inte har någon publicerad benchmark bakom sig.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Ingen av dem finns i vår katalog, och inget här är ett tillgänglighetsanspråk för någon av dem. En modell som returnerar sannolikheter i stället för text är inte något man dirigerar chattkompletteringar till, och att hålla sig borta från bedömningsstolen är hela designen av instrumentet. Det OrcaRouter tillhandahåller är den generativa sidan av samma loop: de över 200 modellerna bakom en OpenAI-kompatibel nyckel vilka skriver bedömningsmallen som din bedömare betygsätter mot, transkriberar och sammanfattar materialet innan det blir en, och skickar ut verktygsanropet som din bedömare godkänner innan det körs. Leverantörens listpris förs vidare med 0 % påslag, så en leverantörs prissänkning på den generativa sidan är live hos oss samma dag. Automatisk failover håller den sidan vid liv när en enskild leverantör degraderar — vilket en pipeline som bedömer varje hämtat dokument märker omedelbart — och om du vill att flera skribenter bedöms i stället för en, komponerar routing-DSL:en dem till ett enda anrop och modellfusion rapporterar deras överensstämmelse som ett fält din bedömare kan läsa som vilket annat som helst.

Slutsats

Microsoft-Decision-1 nådde allmän tillgänglighet på Microsoft Foundry den 8 oktober 2026: endast text, 32 768 token, byggd på en posttränad Qwen3.5-9B, hostad utan vikter, inget pris på modellsidan, ingen latenssiffra och ett benchmarkavsnitt som beskriver sin metodik utan att redovisa något resultat. Liquid AI d1-omni-600M laddades upp den 7 oktober 2026 som en 587M dubbelriktad encoder-beslutsmodell som läser text, bilder eller 30 sekunder tal – en icke-textmodalitet i taget, med texten nedskuren till 896 token när bilder finns – under licensen lfm1.0, utan något noggrannhetsbenchmark för dess främsta förmåga, ingen visionsdelning och ingen publicerad latens. Välj utifrån modalitet och kontroll snarare än utifrån poäng, eftersom poängen inte finns: om ditt material är ett fotografi eller ett telefonsamtal kan bara en av dessa svara, och om det är ett fyrtiosidigt dokument med en bifogad upphandlingsgranskning kan bara den andra driftsättas.

Det OrcaRouter bär är den generativa sidan av samma loop: fler än 200 modeller bakom en enda OpenAI-kompatibel nyckel som skriver bedömningsmallen som din poängsättare betygsätter mot, transkriberar eller sammanfattar materialet innan det blir ett tillstånd, och avger verktygsanropet som din poängsättare godkänner innan det körs.