Een gegenereerde titelkaart voor Microsoft-Decision-1 vs Kev, met als ondertitel 'een gehoste scorer tegenover een recept dat je opnieuw kunt trainen', met chips met de tekst 9B gehoste API vs een bevroren basis plus een 33,8M rank-16 LoRA-adapter, geen gepubliceerde benchmarks vs ECE 0,017 op transfer-v4, geen gewichten gedistribueerd vs Apache-2.0, en een voettekst met bronvermelding die aangeeft dat beide reeksen cijfers zelfgerapporteerd zijn.
Engineering & Research

Microsoft-Decision-1 vs Kev: een score kopen, of het recept bezitten dat er een voortbrengt

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Jared Palmer legde een bewijsstuk naast zijn model. De Kev-familie — Kev-0.8B, Kev-4B en Kev-9B, gebouwd op bevroren open-weight-basischeckpoints met een rank-16 LoRA-adapter en een kleine pointer-head — werd op 24 september 2026 uitgebracht, met haar trainingsrecept, haar data-aantallen per fase en haar evaluatiecijfers allemaal gepubliceerd, en de eerlijke hoofdboodschap voor iedereen die het vergelijkt met Microsoft-Decision-1 is dat Kev je veel meer vertelt over hoe je het kunt reproduceren. De scorer van Microsoft werd op 8 oktober 2026 algemeen beschikbaar gesteld op Microsoft Foundry: een Qwen3.5-9B-basis die door Microsoft is bijgetraind, context van 32.768 tokens, alleen tekst, gewichten niet gedistribueerd, een gepubliceerde evaluatiemethodologie en geen gepubliceerde resultaten. Beide nemen een toestand en een reeks getypeerde vragen en retourneren een gekalibreerde verdeling in plaats van gegenereerde tekst. De ene is een dienst, de andere is een methode die je vanavond in een notebook kunt draaien.

De reden dat dat onderscheid deze confrontatie beslist in plaats van capaciteit: Kev-4B rapporteert ECE 0.017 op zijn out-of-domain locked test en Microsoft-Decision-1 rapporteert niets, dus het kalibratieargument dat normaal gesproken een scorer-versus-scorer-vergelijking beslecht, heeft slechts één kant die zijn positie kenbaar maakt.

It looks like the actual text to be translated wasn't included in your message — I only see the translation instructions, ending with what appears to be a fragment ("Kev actually"). Please paste the source text (with its {{1}}...{{/1}} markers if applicable) and I'll translate it into Dutch, preserving all markers exactly as specified.

De modelkaart van Kev-4B is ongewoon specifiek, en die specificiteit is het hele punt. De backbone is Qwen3.5-4B-Base, bevroren op een genoemde revisie, met 24 lineaire-attentielagen van Gated DeltaNet en 8 volledige attentielagen op een verborgen grootte van 2.560. Daarbovenop zit een rank-16 LoRA-adapter — 33,8 miljoen trainbare parameters, toegepast op attention-, MLP- en DeltaNet-projecties — en een pointer-head die de afsluitende token van elke optie scoort tegen de laatste token van de vraag en daar softmax op toepast. Eén temperatuur, T = 2,41, is opgeslagen in het head-bestand en wordt toegepast bij het laden, en de modelkaart geeft de gefitte waarde en de bestandshash. De training verliep in fasen met gepubliceerde recordaantallen: een basisrecept van 12.576 records, 1.425 voor datums en ontbrekend bewijs, 5.219 echte CFPB-klachtnarratieven, 6.000 skill-records en 5.320 records voor developer-tooling, waarbij latere fasen eerdere opnieuw afspeelden. De modelkaart vermeldt ook wat niet is gebruikt: "Er is geen output van Jev (het gehoste beslissingsmodel van TypeSafe) gebruikt."

De benchmarktabel staat op dezelfde pagina, en wordt geleverd met de faalgevallen erbij, wat zeldzamer is dan de successen. Transfer-v4 afgesloten out-of-domain-test: nauwkeurigheid 0,838, Brier 0,224, ECE 0,017. Breadth-v1 over 14 achtergehouden datasets en 3.089 vragen: nauwkeurigheid 0,690, ECE 0,029. Hard-v1-test: 0,803. Documents-v1-test: 0,903. MMLU-Pro met tien opties: 0,565. Datumrekenkunde: 0,65, door de auteur genoemd als het zwakste gebied, met een preprocessor-vlag aangeboden als gedeeltelijke oplossing en een expliciete opmerking dat het niet opnieuw is gemeten. De sectie met beperkingen voegt toe dat de kalibratie een enkele in-distributietemperatuur is, zodat de dekking buiten het domein afneemt, dat de volgorde van opties een antwoord kan omdraaien, en dat lengtes boven 8.192 tokens wel worden bediend maar niet gevalideerd. Ook serveercijfers zijn gepubliceerd: 18,1 ms voor zes vragen over een korte state op een H100, 12,9 ms gecachet, 14,3 GB resident GPU-geheugen.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

Wat Microsoft in plaats daarvan publiceert

Microsoft-Decision-1 bestrijkt grotendeels hetzelfde terrein met een andere insteek. Het scoort ja/nee-, meerkeuze-, beoordelings-, classificatie- en rubricvragen, ondersteunt expliciete onthoudingsopties zoals 'kan het niet zeggen', retourneert JSON-waarschijnlijkheden en draait in één aanroep over maximaal 32K tokens — vier keer de context die Kev valideert. Het wordt gedistribueerd als een gehoste API in Microsoft Foundry onder het Direct from Azure-portfolio, met serverloze en unified-endpointimplementatie, standaard-SKU, Azure-authenticatie en een uniform facturatiepad. Batch-inferentie is uitgeschakeld, en er is geen gewichtsdownload en geen fine-tuningpad.

De evaluatiesectie beschrijft openbare en community-benchmarks voor besluitvorming plus achtergehouden interne sets, metrieken waaronder nauwkeurigheid en kalibratiefout, gevarieerde optievolgorde, gepaarde statistische tests, en de bewering dat het model "presteert op het niveau van toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd." Er is geen tabel. De modelkaart noemt zijn eigen beperkingen eerlijk — scores verschuiven met formulering en optievolgorde, kalibratie is het sterkst bij vertrouwde taaktypen, er wordt geen uitleg geproduceerd, en niet-Engelse dekking is het zwakst — maar een lijst met beperkingen is geen kalibratiemeting. Wie een auto-acceptdrempel van 0,9 instelt op Microsoft-Decision-1, stelt die op goed vertrouwen in en past die in productie aan.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

Het deel van de vergelijking dat geld kost

De economie van Kev is de reden dat deze match-up echt close is. Het recept is een bevroren basis plus een adapter van 33.8M, wat betekent dat het marginale model dat je traint rekenkracht van adapterformaat kost, niet rekenkracht van foundation-modelformaat. Je kunt de basis één keer in het geheugen houden en meerdere adapters laden — één per beslissingsdomein — een deploymentvorm die de gehoste API van Microsoft helemaal niet kan uitdrukken. Als je routeringsregels verschillen van die van een generieke judge, laat Kev je het verschil trainen; Microsoft-Decision-1 laat je een betere prompt schrijven en hopen.

Daar staat tegenover dat de gehoste API geen operationeel oppervlak met zich meebrengt. Er is geen adapter om bij te houden, geen serving-stack om warm te houden, geen kloof tussen gevalideerde en geserveerde context om over na te denken, en geen risico dat een temperatuur die op de ene dataset is gefit, zich op de uwe anders gedraagt. Voor een team met een bescheiden beslissingsvolume is de service het goedkopere artefact in engineeringuren, zelfs als de tokens geld kosten; voor een team dat miljoenen items per dag scoort, wint de zelfgehoste adapter op unitkosten zodra de GPU is betaald.

Er is een derde pad dat geen van beide modellen gebruikt voor het deel waar het het zwakst is, en daar zit OrcaRouter. Wij hosten Microsoft-Decision-1 of Kev niet — een scorer die waarschijnlijkheden retourneert is geen doelwit voor chat-completions en geen van beide modellen zit in onze catalogus. De generatieve helft van een besluitvormingspijplijn is wat wij aanbieden: het model dat het kandidaat-antwoord opstelt, de rubric schrijft of de tool call uitzendt die wordt gescoord. Dat alles zit achter één OpenAI-compatibele sleutel met meer dan 200 modellen erop tegen de lijstprijs van de provider, doorgegeven met 0% opslag, zodat een prijswijziging van een leverancier dezelfde dag bij ons live staat. Als je een beoordelings- of triagelus bouwt, is de schrijfaanroep routeerbaar en de scoring-aanroep niet, en die grens helder houden is wat voorkomt dat een scoring-pijplijn stilletjes een chat-pijplijn wordt.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

Hoe te beslissen

Kies Kev wanneer je cijfers nodig hebt voordat je uitbrengt, wanneer je wilt fine-tunen op je eigen beslissingslabels, wanneer je scoring binnen je eigen grens wilt draaien tegen nul marginale kosten, of wanneer je wilt dat meerdere beslissingsdomeinen één resident basismodel delen. De gepubliceerde ECE-cijfers zijn nog steeds de eigen metingen van de auteur op de eigen meetomgeving van de auteur — beschouw ze als een geloofwaardige zelfbeoordeling, niet als een geauditeerd resultaat van een derde partij — maar ze zijn op zijn minst een vermelde schaal die je kunt proberen te reproduceren, en het recept staat er precies om ze daarmee te reproduceren.

Kies Microsoft-Decision-1wanneer de beslissende factor inkoop of contextlengte is: een beheerd Azure-eindpunt met uniforme facturering en een Responsible AI-pakket, 32K invoer voor lange documenten, en een leverancier om naar te escaleren. Het ontbrekende benchmarkoverzicht is geen schandaal — heel wat gehoste modellen lanceren zonder — maar het betekent wel dat de eerste kalibratiecurve voor dit model door zijn gebruikers zal worden getekend, en je kunt maar beter van plan zijn er een van hen te zijn, op je eigen gelabelde data, voordat je er een productiedrempel op richt.