
Microsoft-Decision-1 vs Liquid AI d1-omni-600M: een beoordelaar die luistert tegenover een beoordelaar die alleen maar leest
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens · 55 tok/s
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Je bent bij een verzekeringsbalie claims aan het routeren, en het dossier komt binnen als drie dingen: een pdf, een foto van een deuk in een deur, en een telefoongesprek van negentig seconden. Liquid AI d1-omni-600Mkan het document lezen, naar de foto kijken en naar het gesprek luisteren, en vervolgens in één doorgang een reeks vragen beantwoorden die je vooraf hebt opgesteld — is dit gedekt, welke categorie, hoe ernstig, op een schaal van twee tot tien — zonder dat er tekst wordt gegenereerd en zonder dat er iets te parsen valt. Microsoft-Decision-1kan het document lezen. Het werd algemeen beschikbaar op Microsoft Foundry op 8 oktober 2026 als een gehoste, alleen op tekst gerichte scorer die is nagetraind op Qwen3.5-9B met een venster van 32.768 tokens, en daar eindigt het invoeroppervlak: geen afbeelding, geen audio, geen video. Beide retourneren gekalibreerde waarschijnlijkheden over opties die jij aanlevert, beide produceren nul uitvoertokens, en geen van beide heeft een kalibratiecijfer gepubliceerd.
Die laatste gedeelde zin is het ongemakkelijke deel van deze vergelijking. De twee zijn de beslissingsmodellen met de breedste sensor en de smalste sensor die deze maand worden uitgebracht, en ondanks alle architectonische afstand tussen hen zijn ze in exact dezelfde bewijspositie beland: echte gewichten of een echt endpoint, gedocumenteerde contracten, en geen enkel getal waar iemand buiten de leverancier naar kan wijzen wanneer iemand vraagt of de waarschijnlijkheden betrouwbaar zijn.
Twee afkomsten, niet twee maten
Het getal van 587M nodigt je uit om Liquid AI d1-omni-600M te lezen als een verkleinde verwant van de modellen die deze blog eerder heeft behandeld. Dat is het niet. Het model is getraind op LFM2.5-Encoder-350M, een bidirectionele encoder, met een gedeelde trunk en decision head van 381M, een visie-encoder van 94M uit de LFM2.5-VL-450M-lijn en een 17-laagse FastConformer voor audio. Microsoft-Decision-1 behoort tot een heel andere afstamming: een Qwen3.5-9B-decoder, post-trained door Microsoft, gehost op Foundry, gewichten niet gedistribueerd en geen fine-tuningpad aangeboden.
Bidirectioneel versus decoder is het architectonische gegeven dat bepaalt hoe elk van beide zich gedraagt, en het is ook waarom de parameteraantallen een afleiding zijn. Een bidirectionele encoder leest de volledige toestand in één keer, wat de juiste vorm is voor een beoordeling over een vaste input; een post-trained decoder geeft het generatiepad op, maar behoudt de tokenizer, het venster en de enterprise-verpakking die bij een foundry-implementatie horen. Geen van beide is een opgeschaalde versie van de ander, en ze zijn niet onderling verwisselbaar, hoe een benchmarktabel ook wordt gelezen.
Wat de invoerlijst je daadwerkelijk oplevert
Dit is waar de d1-omni-600M het sterkst afwijkt van al het andere in de categorie, en waar een claim zorgvuldig moet worden gelezen.
• Spraak — Liquid AI d1-omni-600M accepteert tekst plus maximaal 30 seconden spraak en rapporteert daarover een beslissing, wat geen enkele scorer die alleen tekst gebruikt bij welke nauwkeurigheid dan ook kan. De niet-tekstuele modaliteiten van Microsoft-Decision-1 bestaan niet.
• Wederzijdse uitsluiting — de d1-omni-600M geeft een ValueError als afbeeldingen en audio in hetzelfde verzoek aankomen. Het breedste sensoroppervlak in de categorie is nog steeds één niet-tekstuele modaliteit tegelijk, wat een echte beperking is voor die claimsdesk.
• Trimmen — de kaart vermeldt 16.384 gecombineerde posities voor tekst, afbeelding en audio, en voegt toe dat wanneer er afbeeldingen aanwezig zijn, de status- en vraagtekst worden teruggebracht tot 896 tokens om overeen te komen met de training. Elk document waaraan je een foto toevoegt, concurreert met dat trimmen. De 32.768 tokens van Microsoft-Decision-1 bestaan allemaal uit tekst en worden niet getrimd.
• Formaten — de d1-omni-600M heeft drie vraagtypen: noul voor een binaire beslissing die P(yes) tussen 0 en 1 retourneert, choice voor één label uit een set die u noemt, met een betrouwbaarheid en een waarschijnlijkheid per optie, en score voor een positie op een geordende schaal van twee tot tien niveaus met de bijbehorende verdeling. Meerdere vragen hangen aan één toestand en worden in één keer gelezen, en de gebruiksteller rapporteert output_tokens: 0. Microsoft documenteert ja/nee-, meerkeuze-, beoordelings-, classificatie- en rubricvormen, plus een expliciet ondersteunde abstentieoptie zoals "kan het niet zeggen" wanneer het bewijs onvoldoende is — het enige ontwerpdetail op de Microsoft-pagina zonder directe tegenhanger hier.
• Runtime — de d1-omni-600M levert aangepaste code mee, heeft trust_remote_code=True, en de kaart beveelt float16 aan op GPU, terwijl er wordt gewaarschuwd dat bfloat16 het beste antwoord op sommige rijen veranderde. Dat is een door de leverancier gedocumenteerde gevoeligheid tijdens het serveren, geen defect. Microsoft-Decision-1 is een beheerd eindpunt waar de deploymentvorm je enige runtimevariabele is, en het is vermeldenswaard dat batch-inferentie is uitgeschakeld: er is geen offlinekanaal waarlangs een bulk-scoringsrun kan worden geamortiseerd.

De bewijskloof, in beide richtingen
Liquid AI publiceerde op 7 oktober 2026 de open d1-familie, waaronder d1-omni-600M, met een releasebericht en een documentatieset. Wat niet is gepubliceerd, is het getal dat de multimodale claim concreet zou maken. Er is geen nauwkeurigheidsbenchmark specifiek voor de eigen speerpuntcapaciteit — de beslissingskwaliteit voor visie en audio die de 94M- en 112M-encoders rechtvaardigt — en de visie-split wordt achtergehouden in het vrijgegeven evaluatiemateriaal. Er wordt ook geen latentiecijfer gepubliceerd, dus de doorvoer van het model is iets wat je op je eigen hardware ontdekt.
Microsofts positie is structureel identiek en een stap verder. Op het tabblad Benchmarks worden de metrieken genoemd — nauwkeurigheid, kalibratiefout, safety recall, percentages fout-positieven, consistentie van eerlijkheid — en wordt gesteld dat de evaluatie is uitgevoerd op publieke en community-beslissingsbenchmarks plus achtergehouden interne testsets die niet bij de training zijn gebruikt, dat de volgorde van opties is gevarieerd, dat gepaarde statistische toetsen zijn toegepast, en er wordt beweerd dat het model "presteert op het niveau van toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd." Geen van de resultaten wordt weergegeven. Vijfentwintig talen worden als ondersteund vermeld, waaronder Japans, Koreaans, Arabisch, Vietnamees, Thai, Turks, Hindi, Bengaals, Swahili, Hebreeuws, Perzisch en Oekraïens, met de openhartige waarschuwing dat dekking, kwaliteit en kalibratie "per taal kunnen verschillen" en dat niet-Engels, vooral talen met minder middelen, een zwak punt is. Prijzen staan ook niet op de modelpagina; er wordt gelinkt naar het prijzenoverzicht van Microsoft.
Dus de vergelijking tussen deze twee is er geen van bewijs tegenover bewijs. Het is een keuze tussen twee soorten ontbrekende getallen. Liquid AI heeft het sensoroppervlak opgeleverd en de nauwkeurigheid van dat oppervlak in het openbaar ongemeten gelaten. Microsoft heeft het inkooptraject opgeleverd — Azure-authenticatie, governance, een Responsible AI-beoordeling, een gedocumenteerde methodologie — en de kalibratie van een waarschijnlijkheidsproduct ongekwantificeerd gelaten.

De kalibratievraag die geen van beiden beantwoordt
Voor een beslissingsmodel is de waarschijnlijkheid het product. Alles daarna is een drempel: 0,7 escaleert, 0,95 accepteert automatisch, en de prijs voor het verkeerd trekken van die grens wordt betaald in slechte geautomatiseerde beslissingen in plaats van in tokens. In deze categorie is er ten minste één familie die de cijfers publiceert — de Intern-Decision-checkpoints van InternLM vermelden Brier- en expected-calibration-error-cijfers op hun modelkaarten — en geen van beide modellen in dit artikel doet dat. Die asymmetrie is de praktische reden om het veld breed te houden in plaats van je alleen op architectuur vast te leggen.
Het goede nieuws is dat de test goedkoop is en niet de medewerking van de leverancier vereist. Stel een paar honderd gelabelde gevallen samen die lijken op je echte verkeer, schrijf het vragenschema dat je applicatie daadwerkelijk zou versturen, laat beide modellen eroverheen lopen en bereken de verwachte kalibratiefout op de output. Dan weet je twee dingen die niemand buiten de twee leveranciers momenteel weet: hoe goed de waarschijnlijkheden van Microsoft-Decision-1 overeenkomen met de nauwkeurigheid ervan op jouw distributie, en of de audio- en beeldpaden van de d1-omni-600M de encoders die ze bevatten waard zijn. Microsofts eigen gedocumenteerde richtlijnen wijzen dezelfde kant op — valideer op representatieve data, stel drempels in op basis van de kosten van je fouten, neem altijd een abstentieoptie op, randomiseer de volgorde van opties, houd een mens in de lus voor beslissingen met grote gevolgen.
Waar elk thuishoort, en waar OrcaRouter dat doet
Microsoft-Decision-1 hoort overal waar het doorslaggevende materiaal tekst is en de belemmering inkoop is: een lang document, een opgehaalde passage, een voorgestelde toolaanroep, een gegenereerd antwoord dat aan de hand van een rubric wordt beoordeeld, met Azure-authenticatie, uniforme facturering en een leveranciersbeoordeling die nodig zijn voordat iets in productie gaat. Het is het nauwere instrument en het instrument dat gemakkelijker goedgekeurd wordt.
Liquid AI d1-omni-600M hoort thuis waar het doorslaggevende materiaal geen tekst is — een foto bij een formulier, een korte opname van een gesprek, een screenshot — en waar je lfm1.0-gewichten wilt die je kunt uitvoeren en fine-tunen binnen een grens die je zelf beheert. Het is het bredere instrument en het moeilijkere om te valideren, omdat de multimodale claim precies het deel is waar geen gepubliceerde benchmark achter zit.

Geen van beide staat in onze catalogus, en niets hier is een beschikbaarheidsclaim voor een van beide. Een model dat waarschijnlijkheden in plaats van tekst retourneert, is niet iets waarop je chatvoltooiingen routeert, en buiten de scorerstoel blijven is het hele ontwerp van het instrument. Wat OrcaRouter in huis heeft, is de generatieve kant van dezelfde lus: de meer dan 200 modellen achter één OpenAI-compatibele sleutel die de rubric schrijven waartegen je scorer beoordeelt, het materiaal transcriberen of samenvatten voordat het een state wordt, en de tool call uitzenden die je scorer goedkeurt voordat die wordt uitgevoerd. De lijstprijs van de aanbieder wordt doorgegeven met 0% opslag, dus een prijsverlaging van een leverancier aan de genererende kant is dezelfde dag live bij ons. Automatische failover houdt die kant in leven wanneer één aanbieder verslechtert — wat een pijplijn die elk opgehaald document scoort onmiddellijk opmerkt — en als je wilt dat meerdere schrijvers worden beoordeeld in plaats van één, componeert de routing-DSL ze tot één aanroep en rapporteert model fusion hun overeenstemming als een veld dat je scorer kan lezen als elk ander.
Kortom
Microsoft-Decision-1 bereikte algemene beschikbaarheid op Microsoft Foundry op 8 oktober 2026: alleen tekst, 32.768 tokens, gebouwd op een nagetrainde Qwen3.5-9B, gehost zonder gewichten, geen prijs op de modelpagina, geen latentiecijfer en een sectie met benchmarks die de methodologie beschrijft zonder een resultaat af te drukken. Liquid AI d1-omni-600M werd op 7 oktober 2026 geüpload als een beslissingsmodel met bidirectionele encoder van 587M dat tekst, afbeeldingen of 30 seconden spraak leest — één niet-tekstuele modaliteit per keer, waarbij tekst wordt teruggebracht tot 896 tokens wanneer er afbeeldingen aanwezig zijn — onder de lfm1.0-licentie, zonder nauwkeurigheidsbenchmark voor zijn belangrijkste capaciteit, geen vision-split en geen gepubliceerde latentie. Kies op basis van modaliteit en controle in plaats van op scores, want de scores bestaan niet: als uw materiaal een foto of een telefoongesprek is, kan slechts één van deze antwoorden, en als het een document van veertig pagina's is met een inkoopbeoordeling erbij, kan alleen de andere worden ingezet.
Wat OrcaRouter meebrengt, is de generatieve kant van dezelfde lus: meer dan 200 modellen achter één OpenAI-compatibele sleutel die de rubric schrijven waarmee je scorer beoordeelt, het materiaal transcriberen of samenvatten voordat het een state wordt, en de tool call uitzenden die je scorer goedkeurt voordat die wordt uitgevoerd.
