
Microsoft-Decision-1 vs Liquid AI d1-3B: Samma 32K-fönster, två olika betydelser
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
För en gångs skull stämmer specen. Microsoft-Decision-1, allmänt tillgänglig på Microsoft Foundry sedan den 8 oktober 2026, tar 32 768 tokens i kontext. Det gör även Liquid AI d1-3B, som laddades upp till Hugging Face den 5 oktober 2026 och tillkännagavs av Liquid AI två dagar senare. Båda tar emot ett tillstånd plus en uppsättning typade frågor – ja/nej, val bland namngivna alternativ, en position på en ordnad skala – och båda svarar i en enda framåtpassning med en sannolikhetsfördelning i stället för genererad text; Laya, Intern-Decision-4B, Kev och resten av den här nischen är oense om kontextlängden, så detta är den enda parningen där den dimensionen faller bort och jämförelsen måste avgöras utifrån något annat.
Det där något annat visar sig vara indatakanalen. Microsofts modell är uttryckligen endast textbaserad: den ”tar varken emot eller producerar bild-, ljud- eller videoinnehåll.” Liquid AI:s har en SigLIP2 NaFlex-visionskodare med 400 miljoner parametrar på en språklig stomme med 2,6 miljarder parametrar och når 3,12 miljarder parametrar totalt, och den byggdes för precis det som Microsoft uteslöt – att poängsätta en skärmbild, ett skannat formulär eller en kamerabild mot en fast fråga. Den uppdelningen, plus en licensskillnad som inte har något med förmåga att göra, är hela jämförelsen.
Där de två är överens, vilket är mer än man skulle förvänta sig
• Kontextfönster — 32 768 tokens för Microsoft-Decision-1 och 32 768 tokens för Liquid AI d1-3B.
• Utdatans form — kalibrerade sannolikheter över angivna alternativ; ingen av dem genererar text, och Liquid AI:s användningsräknare rapporterar faktumet som output_tokens: 0.
• Frågetyper — både dokumentval, ordnad poäng och binärt ja/nej, och båda låter dig definiera alternativuppsättningen per begäran i stället för att träna om ett vokabulärhuvud.
• Avstående — Microsoft dokumenterar explicita alternativ för avstående, såsom "kan inte avgöra"; Liquid AI:s Decision Index-schema stöder samma sak genom sin uppsättning alternativ.
• Inferens i ett enda pass — ett anrop per beslut på båda sidor, vilket är vad som gör att endera är genomförbar vid pipelinevolym.
Att två modeller är överens om de två svåraste begränsningarna i denna nisch är värt att stanna upp vid. Ett 32K-fönster är vad som gör en beslutsbedömare användbar på ett fullständigt avtal, en flersidig policy eller en lång supporttråd; det engelska Laya-checkpointet på 512 token och gränserna för frågor per anrop på Intern-Decision-4B gör det inte. Om din indata är kort är det mesta av detta fält utbytbart och beslutet handlar om hosting. Om din indata är lång smalnar fältet av till dessa två.
Känslan som bara en av dem har
Liquid AI d1-3B är multimodell, och modellträdet gör släktskapet tydligt: LFM2.5-2.6B-Base, sedan LFM2.5-VL-3B, sedan d1-3B eftertränad för kalibrerade beslut i en enda passage. Bilder kommer in via SigLIP2 NaFlex-kodaren, och kortet rapporterar ett medelvärde på 74,1 över elva offentliga bildbenchmarkar mot 73,9 för basvisionsmodellen — så beslutsfinjusteringen kostade den inte någon visionskvalitet. Det rapporterar också det omvända experimentet: tar man bort bilderna sjunker samma frågor till 45,1, vilket är det tydligaste beviset man kan få på att perceptionskanalen är bärande snarare än dekorativ.
Microsoft-Decision-1 har ingen motsvarighet, och utelämnandet är avsiktligt snarare än ofullbordat. Microsofts modellkort anger att användningsområdena utanför omfattningen är textgenerering, besvarande av öppna frågor, konversation, översättning och sammanfattning, och anger separat att modellen endast hanterar text. För en pipeline som behöver poängsätta en skärmbild av ett formulär mot en bedömningsmall, eller avgöra huruvida en kamerabild innehåller en säkerhetsrisk, är det ett hårt stopp – ingen promptteknik kan återskapa en modalitet som modellen aldrig har fått.
Språkräkningen går åt andra hållet, och detta är den andra verkliga skiljelinjen. Microsoft-Decision-1 listar 25 språk som stöds, och företaget är öppet med att täckning, kvalitet och kalibrering ”kan variera beroende på språk” och pekar ut icke-engelska och särskilt lågresursspråk som ett område med sämre prestanda. Liquid AI d1-3B anger 16 språk. När det gäller bredd ligger Microsoft före på papperet; när det gäller ärlighet om vad bredd innebär säger båda leverantörerna något liknande, och ingen av dem har publicerat kalibrering per språk.

Fliken Benchmark, igen
Microsoft-Decision-1:s Foundry-sida har en flik med namnet Benchmarks, med ett avsnitt om metodik och inga siffror: offentliga och communitybaserade beslutsbenchmarkar plus interna set som hållits undan, mätvärden som täcker noggrannhet och kalibreringsfel, varierad ordning på alternativ, parade statistiska tester, och ett påstående att modellen "presterar i nivå med ledande beslutsmodeller och före andra öppna beslutsmodeller som utvärderats med samma metodik." Inget att kontrollera, inget att reproducera.
Liquid AI d1-3B publicerar 48,57 på Decision Index 0.2.1 — och kvalificeringen betyder mer än siffran, eftersom Decision Index är Liquid AI:s eget index och d1-3B är Liquid AI:s egen modell. Det är ett leverantörsbedömt resultat på ett leverantörsproducerat benchmark, positionerat av företaget som bäst bland beslutsmodeller under 10B och före en 35B-modell på samma skala. Betrakta 48,57 som ett riktningsvisande påstående, inte en granskad siffra. Vid sidan av detta listar kortet interna utvärderingar av beslutsformat med ett medelvärde på 77,1, SQuAD 2.0 på 85,3, PAWS-X på 76,9 och DecisionBench 71,8 — allt självrapporterat, och formuleringen ”under 10B” är en genuin kvalificering snarare än en undanmanöver, eftersom modellen är 3,12B.
Så kalibreringsfrågan löser sig på samma sätt som den gör inom hela det här området: Liquid AI ger dig en siffra som tagits fram på deras egen skala, Microsoft ger dig en metodik och ingen siffra, och ingen av dem ger dig en oberoende tredjepartsmätning. Den enda kalibreringssiffran som kommer att spela roll för din driftsättning är den du beräknar på dina egna märkta data.

Servering, licenser och vad du faktiskt köper
d1-3B:s latens är publicerad och det är anledningen till att modellen finns. Åtta millisekunder per beslut på ett RTX 4090, nio på ett AMD MI325X, med packad genomströmning på 475 respektive 1 106 per sekund vid 64 tillstånd. På edge-hårdvara: 30 ms på en Apple M5 Pro, 16 ms på en Jetson AGX Thor, 26 ms på en Jetson AGX Orin 64 GB, 50 ms på en Orin Nano. Microsoft-Decision-1 publicerar ingen latenssiffra alls, och dess inbyggda alternativ — ett hostat Foundry API med pay-as-you-go eller reserverad etablerad genomströmning, med batchinferens inaktiverad — innebär att du mäter den via din egen driftsättning. Det är inte ett litet glapp för en modell vars hela syfte är att anropas en gång per hämtat dokument eller föreslagen åtgärd.
Licensen är där de två skiljer sig åt på ett sätt som förvånar folk. Liquid AI d1-3B är taggad lfm1.0, inte Apache 2.0 – samma familjelicens som resten av Liquids LFM-serie, som medför användningsvillkor som en tillåtande licens inte gör. Om din juridiska granskning läser OpenAI-kompatibel-utan-förbehåll, är detta inte det, och det är värt att läsa innan modellen släpps snarare än efter. Microsoft-Decision-1 har inga vikter alls: det är en hostad slutpunkt under Direct from Azure-portföljen, med Azure-autentisering, enhetlig fakturering, ingen nedladdning och där licensfrågan ersätts av ett tjänsteavtal. Ingen av modellerna kan finjusteras via de vägar som leverantörerna dokumenterar, vilket är den skarpaste begränsningen för en beslutsmodell – en scorer du inte kan anpassa till dina egna etiketter är en scorer vars felmönster du inte kan åtgärda, bara kringgå.
Att routa dem är där OrcaRouter hör hemma i det här mönstret, och bara på ena sidan av det. Vi hostar varken Microsoft-Decision-1 eller Liquid AI d1-3B: ingen av dem returnerar text, ingen av dem finns i vår katalog, och en endpoint för sannolikhetsbedömning är inte ett mål för chat-completions. Det vi tillhandahåller är den genererande halvan av loopen – modellen som tar fram svaret som din bedömare ska betygsätta, extraherar fälten som din bedömare ska bedöma, eller föreslår åtgärden som din bedömare ska godkänna. Det är fler än 200 modeller bakom en enda OpenAI-kompatibel nyckel till leverantörens listpris som förs vidare med 0 % påslag, så en leverantörsprisändring är live hos oss samma dag, och automatisk failover täcker genereringsanropet i en loop som inte har någon ledig latens för att försöka igen.

Två säkra val, och ett som inte är i närheten.
Välj Liquid AI d1-3B om något i din pipeline är en bild. Triage av skärmdumpar, formulärextraktion, routning av visuell QA, en moderator som poängsätter kamerabildrutor – Microsoft-Decision-1 kan inte fås att göra detta, och d1-3B byggdes för det med publicerade visionsbenchmarkar som styrker påståendet. Välj den också om du behöver edge-inferens mätt i tiotals millisekunder på en Jetson eller en laptop, om du vill ha modellen på din egen hårdvara, eller om en licens du kan läsa räcker för ditt juridiska ombud.
Välj Microsoft-Decision-1 om din indata är text, dina dokument är långa, din grind är upphandling – Azure-autentisering, enhetlig fakturering, en bedömning av ansvarsfull AI, en leverantör att eskalera till – eller om din trafik omfattar fler än de 16 språk som d1-3B listar. Acceptera att dess saknade latenssiffra och saknade benchmark-tabell innebär att dina första två veckor med den handlar om mätning, inte integration.
Det enda fallet som inte är nära är multimodalt arbete: där fattades valet när Microsoft skrev "text-only" i modellkortet.
