Een gegenereerde titelkaart voor Microsoft-Decision-1 vs Liquid AI d1-3B met als ondertitel 'de enige twee beslissingsmodellen die het eens zijn over het contextvenster', met chips die bij beide 32.768 tokens aangeven, alleen tekst vs tekst, afbeeldingen en audio, 25 talen vs 16, gehoste API vs lfm1.0-gewichten, en een voettekst die vermeldt dat de cijfers van beide leveranciers zelfgerapporteerd en niet-geverifieerd zijn.
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B: hetzelfde 32K-venster, twee verschillende betekenissen

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Voor de verandering klopt de specificatie. Microsoft-Decision-1, algemeen beschikbaar op Microsoft Foundry sinds 8 oktober 2026, heeft een context van 32.768 tokens. Hetzelfde geldt voor Liquid AI d1-3B, geüpload naar Hugging Face op 5 oktober 2026 en twee dagen later aangekondigd door Liquid AI. Beide accepteren een toestand plus een set getypeerde vragen — ja/nee, keuze uit benoemde opties, een positie op een geordende schaal — en beide antwoorden in één forward pass met een kansverdeling in plaats van gegenereerde tekst; Laya, Intern-Decision-4B, Kev en de rest van deze niche zijn het onderling oneens over contextlengte, dus dit is de enige combinatie waarbij die dimensie wegvalt en de vergelijking aan de hand van iets anders moet worden beargumenteerd.

Het 'iets anders' blijkt het invoerkanaal te zijn. Microsofts model is alleen tekst, expliciet: het 'accepteert of produceert geen beeld-, audio- of video-inhoud.' Dat van Liquid AI heeft een SigLIP2 NaFlex-beeldencoder met 400 miljoen parameters op een taalbackbone van 2,6 miljard parameters en komt in totaal uit op 3,12 miljard parameters, en het is gebouwd voor precies datgene wat Microsoft uitsloot — het beoordelen van een screenshot, een gescand formulier of een camerabeeld aan de hand van een vaste vraag. Die tweedeling, plus een licentieverschil dat niets met capaciteit te maken heeft, is de hele vergelijking.

Waar de twee het eens zijn, wat meer is dan je zou verwachten

• Contextvenster — 32.768 tokens voor Microsoft-Decision-1 en 32.768 tokens voor Liquid AI d1-3B.

• Uitvoervorm — gekalibreerde waarschijnlijkheden over de aangeleverde opties; geen van beide genereert tekst, en de gebruiksteller van Liquid AI rapporteert dit als output_tokens: 0.

• Vraagtypen — zowel documentkeuze, geordende score als binaire ja/nee, en beide laten je de optieset per aanvraag definiëren in plaats van een vocabulary-head te hertrainen.

• Onthouding — Microsoft documenteert expliciete onthoudingsopties zoals "kan het niet zeggen"; het Decision Index-schema van Liquid AI ondersteunt hetzelfde via zijn optieset.

• Inferentie in één pass — één aanroep per beslissing aan beide zijden, wat elk van beide haalbaar maakt bij pijplijnvolume.

Dat twee modellen het eens zijn over de twee moeilijkste beperkingen in deze niche, is het waard om even bij stil te staan. Een venster van 32K is wat een beslissingsscorer bruikbaar maakt op een volledig contract, een meerpagina-beleid of een lange supportthread; de Engelse Laya-checkpoint van 512 tokens en de limieten per aanroep voor vragen op Intern-Decision-4B doen dat niet. Als je invoer kort is, is het grootste deel van dit veld uitwisselbaar en gaat de beslissing over hosting. Als je invoer lang is, vernauwt het veld zich tot deze twee.

Het gevoel dat slechts één van hen heeft

Liquid AI d1-3B is multimodaal, en de modelstamboom maakt de afstamming duidelijk: LFM2.5-2.6B-Base, dan LFM2.5-VL-3B, dan d1-3B die post-getraind is voor gekalibreerde beslissingen in één enkele doorgang. Afbeeldingen komen binnen via de SigLIP2 NaFlex-encoder, en de modelkaart vermeldt een gemiddelde van 74,1 over elf publieke beeldbenchmarks tegenover 73,9 voor het basisvisiemodel — de beslissingsafstemming ging dus niet ten koste van de visiekwaliteit. Er wordt ook het omgekeerde experiment gerapporteerd: haal de afbeeldingen weg en dezelfde vragen zakken naar 45,1, wat het zuiverste bewijs is dat je zult krijgen dat het perceptiekanaal dragend is en niet decoratief.

Microsoft-Decision-1 heeft geen equivalent, en de weglating is bewust, niet onvoltooid. De kaart van Microsoft vermeldt de toepassingen buiten de scope als tekstgeneratie, open vraagbeantwoording, gesprek, vertaling en samenvatting, en stelt afzonderlijk dat het model alleen tekst aankan. Voor een pijplijn die een screenshot van een formulier moet beoordelen aan de hand van een rubric, of moet bepalen of een cameraframe een veiligheidsincident bevat, is dat een harde stop — geen enkele vorm van prompt engineering herstelt een modaliteit die het model nooit heeft gekregen.

De taalaantallen lopen de andere kant op, en dit is de tweede echte tweedeling. Microsoft-Decision-1 vermeldt 25 ondersteunde talen, en het bedrijf is openhartig dat dekking, kwaliteit en kalibratie "per taal kunnen verschillen", waarbij niet-Engelstalige en vooral talen met minder hulpbronnen als een onderpresterend gebied worden genoemd. Liquid AI d1-3B vermeldt 3 talen. Qua breedte ligt Microsoft op papier voorop; qua eerlijkheid over wat breedte betekent, zeggen beide leveranciers iets vergelijkbaars, en geen van beide heeft kalibratie per taal gepubliceerd.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

Het tabblad Benchmark, alweer

De Foundry-pagina van Microsoft-Decision-1 bevat een tabblad Benchmarks met een methodologiegedeelte en geen cijfers: openbare en community-beslissingsbenchmarks plus achtergehouden interne sets, metrieken voor nauwkeurigheid en kalibratiefout, gevarieerde optievolgorde, gepaarde statistische tests, en een bewering dat het model "presteert op het niveau van toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd." Niets om te controleren, niets om te reproduceren.

Liquid AI d1-3B publiceert 48,57 op Decision Index 0.2.1 — en de kwalificatie is belangrijker dan het getal, omdat Decision Index de eigen index van Liquid AI is en d1-3B het eigen model van Liquid AI is. Het is een door de leverancier gescoord resultaat op een door de leverancier opgestelde benchmark, door het bedrijf gepositioneerd als de beste onder beslissingsmodellen onder 10B en als voorloper op een 35B-model op dezelfde schaal. Beschouw 48,57 als een indicatieve bewering, niet als een gecontroleerd cijfer. Daarnaast vermeldt de kaart interne evaluaties van beslissingsformaat met een gemiddelde van 77,1, SQuAD 2.0 op 85,3, PAWS-X op 76,9 en DecisionBench 71,8 — allemaal zelfgerapporteerd, en de framing "onder 10B" is een echte kwalificatie in plaats van een ontwijking, aangezien het model 3,12B is.

Dus de kalibratievraag valt op dezelfde manier uit als in dit hele vakgebied: Liquid AI geeft je een getal dat op zijn eigen schaal is geproduceerd, Microsoft geeft je een methodologie en geen getal, en geen van beide geeft je een onafhankelijke meting door een derde partij. Het enige kalibratiecijfer dat voor jouw implementatie van belang zal zijn, is het cijfer dat je zelf berekent op je eigen gelabelde data.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Serveren, licenties en wat u eigenlijk koopt

De latentie van d1-3B is gepubliceerd en dat is de reden dat het model bestaat. Acht milliseconden per beslissing op een RTX 4090, negen op een AMD MI325X, met een packed throughput van 475 en 1.106 per seconde bij 64 toestanden. Op edge-hardware: 30 ms op een Apple M5 Pro, 16 ms op een Jetson AGX Thor, 26 ms op een Jetson AGX Orin 64 GB, 50 ms op een Orin Nano. Microsoft-Decision-1 publiceert helemaal geen latentiecijfer, en de ingebouwde opties — een gehoste Foundry-API op pay-as-you-go of gereserveerde provisioned throughput, met batch-inferentie uitgeschakeld — betekenen dat je het via je eigen deployment meet. Dat is geen kleine kloof voor een model waarvan het hele doel is om één keer per opgehaald document of voorgestelde actie te worden aangeroepen.

De licentie is waar de twee uiteenlopen op een manier die mensen verrast. Liquid AI d1-3B is getagd als lfm1.0, niet Apache 2.0 — dezelfde familie-licentie als de rest van Liquid's LFM-lijn, die gebruiksvoorwaarden met zich meebrengt die een permissieve licentie niet heeft. Als je juridische review dit leest als OpenAI-compatibel-zonder-verplichtingen, dan is dit dat niet, en het is de moeite waard om dit te lezen voordat het model wordt uitgebracht in plaats van erna. Microsoft-Decision-1 heeft helemaal geen gewichten: het is een gehost endpoint binnen het Direct from Azure-portfolio, met Azure-authenticatie, uniforme facturering, geen download, en de licentiequestie vervangen door een serviceovereenkomst. Geen van beide modellen kan worden gefinetuned via de paden die de leveranciers documenteren, wat de scherpste beperking is voor een beslissingsmodel — een scorer die je niet kunt aanpassen aan je eigen labels is een scorer waarvan je de foutmodi niet kunt oplossen, alleen omzeilen.

Om hen heen routeren is waar OrcaRouter in dit patroon thuishoort, en slechts aan één kant ervan. Wij hosten noch Microsoft-Decision-1 noch Liquid AI d1-3B: geen van beide retourneert tekst, geen van beide staat in onze catalogus, en een endpoint voor waarschijnlijkheidsscoring is geen chat-completions-doel. Wat wij leveren is de genererende helft van de lus — het model dat het antwoord opstelt dat jouw scorer beoordeelt, de velden extraheert die jouw scorer beoordeelt, of de actie voorstelt die jouw scorer goedkeurt. Dat zijn meer dan 200 modellen achter één OpenAI-compatibele sleutel tegen de lijstprijs van de provider, doorgegeven met 0% markup, dus een prijswijziging van een leverancier is dezelfde dag live aan onze kant, en automatische failover dekt de generatieaanroep in een lus die geen extra latentie heeft om er een opnieuw te proberen.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Twee duidelijke keuzes, en één die er niet in de buurt komt.

Neem Liquid AI d1-3B als iets in je pipeline een afbeelding is. Screenshot-triagem, formulierextractie, routering van visuele QA, een moderator die cameraframes beoordeelt — Microsoft-Decision-1 kan er niet toe worden gebracht om dit te doen, en d1-3B is ervoor gebouwd, met de visiebenchmarks die zijn gepubliceerd om die claim te onderbouwen. Neem het ook als je edge-inferentie nodig hebt, gemeten in tientallen milliseconden op een Jetson of een laptop, als je het model op je eigen hardware wilt, of als een licentie die je kunt lezen voldoende is voor je juridische adviseur.

Kies Microsoft-Decision-1 als je invoer tekst is, je documenten lang zijn, je gate inkoop is — Azure-authenticatie, uniforme facturering, een Responsible AI-beoordeling, een leverancier om naar te escaleren — of je verkeer meer dan de 16 talen bestrijkt die d1-3B vermeldt. Accepteer dat het ontbrekende latentiecijfer en de ontbrekende benchmarktabel betekenen dat je eerste twee weken ermee in het teken staan van meten, niet van integratie.

Het enige geval dat geen twijfelgeval is, is multimodaal werk: daar werd de keuze gemaakt toen Microsoft "text-only" in de modelkaart schreef.