Ett genererat titelkort för Microsoft-Decision-1 vs Laya med underrubriken ”språktäckning mot kontextlängd”, med chips som anger 25 stödda språk vs 100+ språk, en kontext på 32 768 token vs ett fönster på 1 024 token, endast hostat API vs Apache-2.0-vikter, och en sidfot som noterar att båda leverantörernas siffror är självrapporterade.
Engineering & Research

Microsoft-Decision-1 vs Laya: 25 språk bakom ett API, 100+ bakom en nedladdning på 322 MB

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Räknar man språken ser jämförelsen avgjord ut. Microsoft-Decision-1, allmänt tillgänglig på Microsoft Foundry sedan den 8 oktober 2026, listar 25 språk som stöds och säger rent ut att täckning, kvalitet och kalibrering "kan variera beroende på språk" och pekar ut icke-engelska och särskilt språk med låga resurser som ett område med svag prestanda. Laya, publicerad av Convai Innovations den 18 september 2026 under Apache 2.0, beskriver sig som flerspråkig över 100+ språk och rapporterar att 45 av 51 testade språk förblir användbara med routing, jämfört med 23 av 51 för dess syskon som bara stöder engelska. Den ena är en 9B-modell bakom en Azure-slutpunkt med en kontext på 32 768 token; den andra är en klassificerare med 421 miljoner parametrar som körs på 32,8 millisekunder per beslut på en enda Tesla T4, gratis. Båda vägrar att skriva en token och båda returnerar sannolikheter över alternativ som du definierar.

Men läs de två modellkorten i sin helhet, så upphör språkantalet att vara den intressanta siffran. Det är kalibreringshistorien bakom, och de två projekten berättar den historien i motsatta riktningar.

Laya publicerar siffran som gör sin egen marknadsföring besvärlig

Layas modellkort anger i sitt eget avsnitt om begränsningar att bas-checkpointarna får 0,362 zero-shot på typed-decisions-benchmarken — under baslinjen 0,461 för majoritetsklassen. Det är ett kort som säger att dess modell är sämre än att gissa "det vanligaste svaret" på det testet. Det anger också att bas-checkpointarna ligger nära slumpen zero-shot, att typed-decisions-siffran 0,766 kräver finjustering på benchmarkens egen split, att ordinalpoängsfrågor är den svagaste primitiven (SST-5 0,372), att valfrågor med hög kardinalitet lider eftersom 77 alternativ ger ungefär tre eller fyra tokens vardera, att noul kan följa sina egna etiketter, och att action.act_probability-fältet "bär ännu ingen användbar signal" vid AUROC 0,30. Convais egen sammanfattande mening är den man bör ta med sig in i varje utvärdering: Laya är en snabb bas att specialisera, inte en zero-shot-beslutsmotor.

Den öppenheten är mer värdefull än den låter, eftersom den säger dig exakt vad Laya är till för. Det är en encoder som du finjusterar på dina egna etiketter — hela arkitekturen är byggd så att nya scheman inte kräver omträning, men att prestera bra på en uppgift gör det. Använd så är de publicerade siffrorna starka: 0,766 mot Jevs 0,727 på typade beslut efter finjustering, AG News 0,950 mot 0,910, DAIR Emotion 0,595 mot 0,480, och ECE 0,081 mot Jevs 0,246 — med den ärliga anmärkningen att den levereras överkonfident och behöver temperaturjustering, vilket flyttar medel-ECE från 0,466 till 0,081.

Microsoft publicerar metoden och undanhåller resultatet

Microsoft-Decision-1:s Foundry-sida kör samma övning i motsatt riktning. Den beskriver utvärderingen i detalj – offentliga och gemenskapsbaserade beslutsbenchmarker plus undanhållna interna set, mätvärden inklusive noggrannhet och kalibreringsfel, varierad ordning på alternativ, parade statistiska tester, identisk testram för de jämförda modellerna – och rapporterar att modellen "presterar i nivå med ledande beslutsmodeller och ligger före andra öppna beslutsmodeller som utvärderats med samma metodik." Den anger sina starka områden (resonemang, regeltillämpning, robusthet mot promptformatering) och sina svaga (specialiserad domänkunskap, icke-engelska).

Och sedan skriver den inte ut något. Ingen träffsäkerhetssiffra, inget kalibreringsfel, ingen tabell per benchmark. De självrapporterade begränsningarna är verkliga och användbara — poäng förändras med formulering och ordning på svarsalternativ, en dåligt formulerad fråga returnerar fortfarande en poäng, kalibreringen är starkast för bekanta uppgiftstyper, inga förklaringar ges — men en lista över begränsningar är inte en mätning. Så avvägningen är ovanligt ren: Laya ger dig siffror som du kan försöka falsifiera med dina egna data, och Microsoft ger dig en regelefterlevnadsprofil och en 32K-kontext som du kan stoppa in ett långt dokument i.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

Vad storleksskillnaden faktiskt ger

Layas litenhet är ingen kompromiss här, det är designen. Eftersom varje alternativ poängsätts vid sin egen [MASK]-token och softmaxas över den frågans alternativ, sätts svarsrymden samman vid förfrågningstillfället i stället för att bakas in i ett vokabulärhuvud — vilket är varför ett schema som du hittar på i eftermiddag inte kräver någon omträning, och varför modellen ryms i 322 till 421 miljoner parametrar. Den flerspråkiga checkpointen kör ungefär 2,2 gånger snabbare än den engelska, routern upptäcker skriftsystem på under en halv millisekund, och batchad genomströmning når 103 till 332 frågor per sekund på en T4. För en arbetsbelastning som poängsätter varje ärende, varje hämtat dokument eller varje föreslagen åtgärd är den genomströmningen själva finessen, inte antalet parametrar.

Kostnaderna för den utformningen är lika specifika och värda att ställas mot Microsofts alternativ. Den engelska checkpointen använder ett fönster på 512 token; den flerspråkiga 1 024, utbyggbart mot 8K. Microsoft-Decision-1 använder 32 768. En lång supporttråd, ett fullständigt avtal eller ett flersidigt policydokument får inte plats i Layas fönster över huvud taget, och ingen hastighet kompenserar för trunkering. Laya besvarar en frågeuppsättning per framåtpassning med en dokumenterad tokenbudget per alternativ; Microsoft dokumenterar ett enda anrop över upp till 32K token utan ett tak per fråga. Och Layas konkurrensmässiga svaghet som klassificerare är värd att känna till: den får 0,425 på Banking77 mot Jevs 0,870, vilket är den typ av finkornigt intent-problem med hög kardinalitet där en specialiseringspassning spelar störst roll.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

Kostnadsjämförelsen som inte är per token

Laya är gratis vid användningstillfället – självhostad, Apache 2.0, listad med en självhostad kostnad på "$0" – och det verkliga priset är den finjusteringskörning du måste göra innan den blir bra på din uppgift. Microsoft-Decision-1 är ett hostat Foundry-API med en taxa per token som inte står tryckt på modellsidan, inga vikter att ladda ner, ingen finjusteringsväg och batch-inferens inaktiverad. Den ena är ett inledande datamärkningsprojekt, den andra är ett anrop med förbrukningsbaserad debitering. Vilket som är billigare beror helt på volymen, och brytpunkten är hög: en 421M-encoder som poängsätter 300 objekt i sekunden på en hyrd T4 är mycket svår att slå per beslut när den väl har tränats.

Det är här OrcaRouter förtjänar sin plats i en pipeline byggd på endera modellen, och det är enbart den generativa sidan. Vi hostar varken Microsoft-Decision-1 eller Laya: båda returnerar sannolikheter snarare än text, ingen av dem finns i vår katalog, och en poängsättningsendpoint är inte ett chat-completions-mål. Det vi däremot tillhandahåller är modellen som producerar det som ska poängsättas – utkastet till svar, det föreslagna verktygsanropet, det kandidatsvar som Layas finjusterade head sedan poängsätter. Det är fler än 200 modeller bakom en enda OpenAI-kompatibel nyckel till leverantörens listpris som skickas vidare med 0 % påslag, med automatisk failover när en serving-väg försämras. I en loop som poängsätter allt är genereringsanropet den del som kan fallera, och failover är det som håller poängsättningskön matad.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

Vilken ska man välja?

Välj Laya om dina beslut kommer in på många språk, om din volym är tillräckligt hög för att prissättning per token ska spela roll, om du har etiketter och en vecka för att finjustera, eller om du behöver köra poängsättning på hårdvara inom din egen gräns. Acceptera fönstret på 512 till 1 024 token och det faktum att bascheckpointen kommer att vara nära slumpen tills du specialiserar den, och du får en beslutsmodell som är ärlig om att vara en utgångspunkt.

Ta Microsoft-Decision-1 om dina indata är långa dokument snarare än ärenden, om din driftsättningsgrind är Azure-autentisering, enhetlig fakturering och ett Responsible AI-paket snarare än en nedladdning, om 25 språk täcker din trafik, eller om du helst inte vill äga modellen alls. Acceptera att du själv kommer att rita dess första kalibreringskurva, och avsätt en eftermiddag på ett märkt urval för att göra det — för till skillnad från Laya kommer den här inte att ge dig ett ECE-nummer att argumentera emot.