Een gegenereerde titelkaart voor Microsoft-Decision-1 versus Laya, met als ondertitel 'taaldekking tegenover contextlengte', met chips met de tekst 25 ondersteunde talen versus 100+ talen, een context van 32.768 tokens versus een venster van 1.024 tokens, alleen een gehoste API versus Apache-2.0-gewichten, en een voettekst die vermeldt dat de cijfers van beide leveranciers zelfgerapporteerd zijn.
Engineering & Research

Microsoft-Decision-1 vs Laya: 25 talen achter een API, 100+ achter een download van 322 MB

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Tel de talen en de vergelijking lijkt beslecht. Microsoft-Decision-1, algemeen beschikbaar op Microsoft Foundry sinds 8 oktober 2026, vermeldt 25 ondersteunde talen en stelt ronduit dat dekking, kwaliteit en kalibratie 'per taal kunnen verschillen', waarbij niet-Engelstalige en vooral talen met minder hulpbronnen worden genoemd als een gebied waar de prestaties tekortschieten. Laya, gepubliceerd door Convai Innovations op 18 september 2026 onder Apache 2.0, beschrijft zichzelf als meertalig in meer dan 100 talen en meldt dat 45 van de 51 geteste talen bruikbaar blijven met routering, tegenover 23 van de 51 voor zijn alleen-Engelse tegenhanger. De ene is een 9B-model achter een Azure-endpoint met een context van 32.768 tokens; de andere is een classifier met 421 miljoen parameters die op één enkele Tesla T4 gratis 32,8 milliseconden per beslissing draait. Beide weigeren een token te schrijven en beide geven waarschijnlijkheden terug over opties die je definieert.

Maar als je de twee modelkaarten volledig leest, is het aantal talen niet langer het interessante getal. Het is het kalibratieverhaal erachter, en de twee projecten vertellen dat verhaal in tegengestelde richtingen.

Laya publiceert het getal dat zijn eigen marketing ongemakkelijk maakt

De Laya-modelkaart vermeldt in zijn eigen beperkingensectie dat de basischeckpoints 0,362 zero-shot scoren op de typed-decisions-benchmark — onder de 0,461-baseline van de meerderheidsklasse. Dat is een kaart die je vertelt dat zijn model slechter is dan gokken op "het meest voorkomende antwoord" op die test. Er staat ook in dat de basischeckpoints zero-shot bijna op kansniveau liggen, dat het kopcijfer van 0,766 op typed-decisions fine-tuning vereist op de eigen split van die benchmark, dat ordinale scorevragen de zwakste primitieve zijn (SST-5 0,372), dat keuzevragen met hoge cardinaliteit eronder lijden omdat 77 opties ruwweg drie of vier tokens per stuk overlaten, dat noul zijn eigen labels kan volgen, en dat het action.act_probability-veld "nog geen bruikbaar signaal bevat" bij AUROC 0,30. Convai's eigen samenvattende zin is degene die je in elke evaluatie moet meenemen: Laya is een snelle basis om te specialiseren, geen zero-shot beslissingsengine.

Die openhartigheid is waardevoller dan ze klinkt, want ze vertelt je precies waarvoor Laya dient. Het is een encoder die je op je eigen labels fine-tunet — de hele architectuur is erop gebouwd zodat nieuwe schema's geen hertraining nodig hebben, maar goed presteren op een taak wel. Zo gebruikt zijn de gepubliceerde cijfers sterk: 0,766 tegen Jevs 0,727 op getypeerde beslissingen na fine-tuning, AG News 0,950 tegen 0,910, DAIR Emotion 0,595 tegen 0,480, en ECE 0,081 tegen Jevs 0,246 — met de eerlijke opmerking dat het te zelfverzekerd wordt geleverd en temperatuurherkalibratie nodig heeft, waardoor de gemiddelde ECE van 0,466 naar 0,081 gaat.

Microsoft publiceert de methodologie en houdt het resultaat achter

De Foundry-pagina van Microsoft-Decision-1 voert dezelfde oefening in de omgekeerde richting uit. Hij beschrijft de evaluatie in detail — openbare en community-beslissingsbenchmarks plus achtergehouden interne sets, metrieken waaronder nauwkeurigheid en kalibratiefout, gevarieerde optievolgorde, gepaarde statistische tests, identieke harness voor de vergeleken modellen — en meldt dat het model "presteert op het niveau van toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd." Hij noemt de sterke punten (redeneren, toepassing van regels, robuustheid tegen promptopmaak) en de zwakke punten (gespecialiseerde domeinkennis, niet-Engels).

En dan print het niets. Geen nauwkeurigheidscijfer, geen kalibratiefout, geen tabel per benchmark. De zelfgerapporteerde beperkingen zijn reëel en nuttig — scores verschuiven met formulering en volgorde van opties, een slecht geformuleerde vraag levert nog steeds een score op, kalibratie is het sterkst bij bekende taaktypen, er worden geen verklaringen gegeven — maar een lijst met beperkingen is geen meting. De afweging is dus ongewoon helder: Laya geeft je cijfers die je op je eigen data kunt proberen te weerleggen, en Microsoft geeft je een compliancehouding en een context van 32K waarin je een lang document kunt stoppen.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

Wat het grootteverschil daadwerkelijk oplevert

Het kleine formaat van Laya is hier geen compromis, het is het ontwerp. Omdat elke optie wordt gescoord op zijn eigen [MASK]-token en ge-softmaxd over de opties van die vraag, wordt de antwoordruimte samengesteld op het moment van het verzoek in plaats van ingebakken in een vocabulary-head — wat de reden is dat een schema dat je vanmiddag bedenkt geen hertraining nodig heeft, en waarom het model in 322 tot 421 miljoen parameters past. De meertalige checkpoint draait ongeveer 2,2 keer sneller dan de Engelse, de router detecteert het schrift in minder dan een halve milliseconde, en de gebatchte doorvoer bereikt 103 tot 332 vragen per seconde op één T4. Voor een workload die elk ticket, elk opgehaald document of elke voorgestelde actie scoort, is die doorvoer de functie, niet het aantal parameters.

De kosten van dat ontwerp zijn even specifiek en het is de moeite waard ze af te zetten tegen Microsofts alternatief. Het Engelse checkpoint neemt een venster van 512 tokens; het meertalige 1.024, uitbreidbaar tot 8K. Microsoft-Decision-1 neemt er 32.768. Een lange supportthread, een volledig contract of een meerpagina's beleidsdocument past helemaal niet in Laya's venster, en geen enkele hoeveelheid snelheid compenseert de afkapping. Laya beantwoordt één vragenreeks per forward pass met een gedocumenteerd tokenbudget per optie; Microsoft documenteert één enkele aanroep over maximaal 32K tokens zonder een limiet per vraag. En Laya's zwakke concurrentiepunt als classifier is het kennen waard: het scoort 0,425 op Banking77 tegenover Jev's 0,870, wat het soort fijnmazig intentieprobleem met hoge cardinaliteit is waar een specialisatieronde het meest uitmaakt.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

De kostenvergelijking die niet per token is

Laya is gratis op het moment van gebruik — self-hosted, Apache 2.0, vermeld met een self-hosted kostenpost van "$0" — en de echte prijs is de fine-tuningrun die je moet doen voordat het goed is in jouw taak. Microsoft-Decision-1 is een gehoste Foundry API met een tarief per token dat niet op de modelpagina staat, geen gewichten om te downloaden, geen fine-tuningtraject, en batch-inferentie uitgeschakeld. Het ene is een voorafgaand datalabelingsproject, het andere is een aanroep op basis van verbruik. Wat goedkoper is, hangt volledig af van het volume, en het omslagpunt ligt hoog: een 421M-encoder die 300 items per seconde scoort op een gehuurde T4 is per beslissing zeer moeilijk te verslaan zodra hij is getraind.

Dit is waar OrcaRouter zijn plek verdient in een pipeline die op een van beide modellen is gebouwd, en alleen aan de generatieve kant. We hosten noch Microsoft-Decision-1 noch Laya: beide retourneren waarschijnlijkheden in plaats van tekst, geen van beide staat in onze catalogus, en een scoring-endpoint is geen chat-completions-doel. Wat we wél aanbieden is het model dat produceert wat beoordeeld wordt — het conceptantwoord, de voorgestelde toolaanroep, het kandidaatantwoord dat de fine-tuned head van Laya vervolgens beoordeelt. Dat zijn meer dan 200 modellen achter één OpenAI-compatibele sleutel tegen de lijstprijs van de provider, doorgegeven met 0% opslag, met automatische failover wanneer een serveringspad degradeert. In een loop die alles scoort wat hij genereert, is de generatieaanroep het onderdeel dat kan uitvallen, en failover is wat de scoringswachtrij gevuld houdt.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

Welke moet je kiezen?

Kies Laya als je beslissingen in veel talen binnenkomen, als je volume hoog genoeg is dat prijs per token ertoe doet, als je labels hebt en een week om te fine-tunen, of als je scoring wilt draaien op hardware binnen je eigen grens. Accepteer het venster van 512 tot 1.024 tokens en het feit dat het basis-checkpoint bijna op kansniveau zal liggen totdat je het specialiseert, en je krijgt een beslissingsmodel dat eerlijk aangeeft dat het een startpunt is.

Kies Microsoft-Decision-1 als je invoer bestaat uit lange documenten in plaats van tickets, als je deployment-gate Azure is, met geünificeerde facturatie en een Responsible AI-pakket in plaats van een download, als 25 talen je verkeer dekken, of als je het model liever helemaal niet zelf in eigendom hebt. Accepteer dat je de eerste kalibratiecurve ervan zelf zult moeten opstellen, en reken op een middag met een gelabeld sample om dat te doen — want anders dan Laya zal deze je geen ECE-getal geven om over te discussiëren.