Ett genererat titelkort för Microsoft-Decision-1 mot Liquid AI d1-3B med undertexten "de enda två beslutsmodellerna som är överens om kontextfönstret", med chips som visar 32 768 tokens på båda, endast text mot text, bilder och ljud, 25 språk mot 16, hostat API mot lfm1.0-vikter, och en notis om att båda leverantörernas siffror är självrapporterade och overifierade.
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B: Samma 32K-fönster, två olika betydelser

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

För en gångs skull stämmer specen. Microsoft-Decision-1, allmänt tillgänglig på Microsoft Foundry sedan den 8 oktober 2026, tar 32 768 tokens i kontext. Det gör även Liquid AI d1-3B, som laddades upp till Hugging Face den 5 oktober 2026 och tillkännagavs av Liquid AI två dagar senare. Båda tar emot ett tillstånd plus en uppsättning typade frågor – ja/nej, val bland namngivna alternativ, en position på en ordnad skala – och båda svarar i en enda framåtpassning med en sannolikhetsfördelning i stället för genererad text; Laya, Intern-Decision-4B, Kev och resten av den här nischen är oense om kontextlängden, så detta är den enda parningen där den dimensionen faller bort och jämförelsen måste avgöras utifrån något annat.

Det där något annat visar sig vara indatakanalen. Microsofts modell är uttryckligen endast textbaserad: den ”tar varken emot eller producerar bild-, ljud- eller videoinnehåll.” Liquid AI:s har en SigLIP2 NaFlex-visionskodare med 400 miljoner parametrar på en språklig stomme med 2,6 miljarder parametrar och når 3,12 miljarder parametrar totalt, och den byggdes för precis det som Microsoft uteslöt – att poängsätta en skärmbild, ett skannat formulär eller en kamerabild mot en fast fråga. Den uppdelningen, plus en licensskillnad som inte har något med förmåga att göra, är hela jämförelsen.

Där de två är överens, vilket är mer än man skulle förvänta sig

• Kontextfönster — 32 768 tokens för Microsoft-Decision-1 och 32 768 tokens för Liquid AI d1-3B.

• Utdatans form — kalibrerade sannolikheter över angivna alternativ; ingen av dem genererar text, och Liquid AI:s användningsräknare rapporterar faktumet som output_tokens: 0.

• Frågetyper — både dokumentval, ordnad poäng och binärt ja/nej, och båda låter dig definiera alternativuppsättningen per begäran i stället för att träna om ett vokabulärhuvud.

• Avstående — Microsoft dokumenterar explicita alternativ för avstående, såsom "kan inte avgöra"; Liquid AI:s Decision Index-schema stöder samma sak genom sin uppsättning alternativ.

• Inferens i ett enda pass — ett anrop per beslut på båda sidor, vilket är vad som gör att endera är genomförbar vid pipelinevolym.

Att två modeller är överens om de två svåraste begränsningarna i denna nisch är värt att stanna upp vid. Ett 32K-fönster är vad som gör en beslutsbedömare användbar på ett fullständigt avtal, en flersidig policy eller en lång supporttråd; det engelska Laya-checkpointet på 512 token och gränserna för frågor per anrop på Intern-Decision-4B gör det inte. Om din indata är kort är det mesta av detta fält utbytbart och beslutet handlar om hosting. Om din indata är lång smalnar fältet av till dessa två.

Känslan som bara en av dem har

Liquid AI d1-3B är multimodell, och modellträdet gör släktskapet tydligt: LFM2.5-2.6B-Base, sedan LFM2.5-VL-3B, sedan d1-3B eftertränad för kalibrerade beslut i en enda passage. Bilder kommer in via SigLIP2 NaFlex-kodaren, och kortet rapporterar ett medelvärde på 74,1 över elva offentliga bildbenchmarkar mot 73,9 för basvisionsmodellen — så beslutsfinjusteringen kostade den inte någon visionskvalitet. Det rapporterar också det omvända experimentet: tar man bort bilderna sjunker samma frågor till 45,1, vilket är det tydligaste beviset man kan få på att perceptionskanalen är bärande snarare än dekorativ.

Microsoft-Decision-1 har ingen motsvarighet, och utelämnandet är avsiktligt snarare än ofullbordat. Microsofts modellkort anger att användningsområdena utanför omfattningen är textgenerering, besvarande av öppna frågor, konversation, översättning och sammanfattning, och anger separat att modellen endast hanterar text. För en pipeline som behöver poängsätta en skärmbild av ett formulär mot en bedömningsmall, eller avgöra huruvida en kamerabild innehåller en säkerhetsrisk, är det ett hårt stopp – ingen promptteknik kan återskapa en modalitet som modellen aldrig har fått.

Språkräkningen går åt andra hållet, och detta är den andra verkliga skiljelinjen. Microsoft-Decision-1 listar 25 språk som stöds, och företaget är öppet med att täckning, kvalitet och kalibrering ”kan variera beroende på språk” och pekar ut icke-engelska och särskilt lågresursspråk som ett område med sämre prestanda. Liquid AI d1-3B anger 16 språk. När det gäller bredd ligger Microsoft före på papperet; när det gäller ärlighet om vad bredd innebär säger båda leverantörerna något liknande, och ingen av dem har publicerat kalibrering per språk.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

Fliken Benchmark, igen

Microsoft-Decision-1:s Foundry-sida har en flik med namnet Benchmarks, med ett avsnitt om metodik och inga siffror: offentliga och communitybaserade beslutsbenchmarkar plus interna set som hållits undan, mätvärden som täcker noggrannhet och kalibreringsfel, varierad ordning på alternativ, parade statistiska tester, och ett påstående att modellen "presterar i nivå med ledande beslutsmodeller och före andra öppna beslutsmodeller som utvärderats med samma metodik." Inget att kontrollera, inget att reproducera.

Liquid AI d1-3B publicerar 48,57 på Decision Index 0.2.1 — och kvalificeringen betyder mer än siffran, eftersom Decision Index är Liquid AI:s eget index och d1-3B är Liquid AI:s egen modell. Det är ett leverantörsbedömt resultat på ett leverantörsproducerat benchmark, positionerat av företaget som bäst bland beslutsmodeller under 10B och före en 35B-modell på samma skala. Betrakta 48,57 som ett riktningsvisande påstående, inte en granskad siffra. Vid sidan av detta listar kortet interna utvärderingar av beslutsformat med ett medelvärde på 77,1, SQuAD 2.0 på 85,3, PAWS-X på 76,9 och DecisionBench 71,8 — allt självrapporterat, och formuleringen ”under 10B” är en genuin kvalificering snarare än en undanmanöver, eftersom modellen är 3,12B.

Så kalibreringsfrågan löser sig på samma sätt som den gör inom hela det här området: Liquid AI ger dig en siffra som tagits fram på deras egen skala, Microsoft ger dig en metodik och ingen siffra, och ingen av dem ger dig en oberoende tredjepartsmätning. Den enda kalibreringssiffran som kommer att spela roll för din driftsättning är den du beräknar på dina egna märkta data.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Servering, licenser och vad du faktiskt köper

d1-3B:s latens är publicerad och det är anledningen till att modellen finns. Åtta millisekunder per beslut på ett RTX 4090, nio på ett AMD MI325X, med packad genomströmning på 475 respektive 1 106 per sekund vid 64 tillstånd. På edge-hårdvara: 30 ms på en Apple M5 Pro, 16 ms på en Jetson AGX Thor, 26 ms på en Jetson AGX Orin 64 GB, 50 ms på en Orin Nano. Microsoft-Decision-1 publicerar ingen latenssiffra alls, och dess inbyggda alternativ — ett hostat Foundry API med pay-as-you-go eller reserverad etablerad genomströmning, med batchinferens inaktiverad — innebär att du mäter den via din egen driftsättning. Det är inte ett litet glapp för en modell vars hela syfte är att anropas en gång per hämtat dokument eller föreslagen åtgärd.

Licensen är där de två skiljer sig åt på ett sätt som förvånar folk. Liquid AI d1-3B är taggad lfm1.0, inte Apache 2.0 – samma familjelicens som resten av Liquids LFM-serie, som medför användningsvillkor som en tillåtande licens inte gör. Om din juridiska granskning läser OpenAI-kompatibel-utan-förbehåll, är detta inte det, och det är värt att läsa innan modellen släpps snarare än efter. Microsoft-Decision-1 har inga vikter alls: det är en hostad slutpunkt under Direct from Azure-portföljen, med Azure-autentisering, enhetlig fakturering, ingen nedladdning och där licensfrågan ersätts av ett tjänsteavtal. Ingen av modellerna kan finjusteras via de vägar som leverantörerna dokumenterar, vilket är den skarpaste begränsningen för en beslutsmodell – en scorer du inte kan anpassa till dina egna etiketter är en scorer vars felmönster du inte kan åtgärda, bara kringgå.

Att routa dem är där OrcaRouter hör hemma i det här mönstret, och bara på ena sidan av det. Vi hostar varken Microsoft-Decision-1 eller Liquid AI d1-3B: ingen av dem returnerar text, ingen av dem finns i vår katalog, och en endpoint för sannolikhetsbedömning är inte ett mål för chat-completions. Det vi tillhandahåller är den genererande halvan av loopen – modellen som tar fram svaret som din bedömare ska betygsätta, extraherar fälten som din bedömare ska bedöma, eller föreslår åtgärden som din bedömare ska godkänna. Det är fler än 200 modeller bakom en enda OpenAI-kompatibel nyckel till leverantörens listpris som förs vidare med 0 % påslag, så en leverantörsprisändring är live hos oss samma dag, och automatisk failover täcker genereringsanropet i en loop som inte har någon ledig latens för att försöka igen.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Två säkra val, och ett som inte är i närheten.

Välj Liquid AI d1-3B om något i din pipeline är en bild. Triage av skärmdumpar, formulärextraktion, routning av visuell QA, en moderator som poängsätter kamerabildrutor – Microsoft-Decision-1 kan inte fås att göra detta, och d1-3B byggdes för det med publicerade visionsbenchmarkar som styrker påståendet. Välj den också om du behöver edge-inferens mätt i tiotals millisekunder på en Jetson eller en laptop, om du vill ha modellen på din egen hårdvara, eller om en licens du kan läsa räcker för ditt juridiska ombud.

Välj Microsoft-Decision-1 om din indata är text, dina dokument är långa, din grind är upphandling – Azure-autentisering, enhetlig fakturering, en bedömning av ansvarsfull AI, en leverantör att eskalera till – eller om din trafik omfattar fler än de 16 språk som d1-3B listar. Acceptera att dess saknade latenssiffra och saknade benchmark-tabell innebär att dina första två veckor med den handlar om mätning, inte integration.

Det enda fallet som inte är nära är multimodalt arbete: där fattades valet när Microsoft skrev "text-only" i modellkortet.