
Microsoft-Decision-1 vs Kev: een score kopen, of het recept bezitten dat er een voortbrengt
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Jared Palmer legde een bewijsstuk naast zijn model. De Kev-familie — Kev-0.8B, Kev-4B en Kev-9B, gebouwd op bevroren open-weight-basischeckpoints met een rank-16 LoRA-adapter en een kleine pointer-head — werd op 24 september 2026 uitgebracht, met haar trainingsrecept, haar data-aantallen per fase en haar evaluatiecijfers allemaal gepubliceerd, en de eerlijke hoofdboodschap voor iedereen die het vergelijkt met Microsoft-Decision-1 is dat Kev je veel meer vertelt over hoe je het kunt reproduceren. De scorer van Microsoft werd op 8 oktober 2026 algemeen beschikbaar gesteld op Microsoft Foundry: een Qwen3.5-9B-basis die door Microsoft is bijgetraind, context van 32.768 tokens, alleen tekst, gewichten niet gedistribueerd, een gepubliceerde evaluatiemethodologie en geen gepubliceerde resultaten. Beide nemen een toestand en een reeks getypeerde vragen en retourneren een gekalibreerde verdeling in plaats van gegenereerde tekst. De ene is een dienst, de andere is een methode die je vanavond in een notebook kunt draaien.
De reden dat dat onderscheid deze confrontatie beslist in plaats van capaciteit: Kev-4B rapporteert ECE 0.017 op zijn out-of-domain locked test en Microsoft-Decision-1 rapporteert niets, dus het kalibratieargument dat normaal gesproken een scorer-versus-scorer-vergelijking beslecht, heeft slechts één kant die zijn positie kenbaar maakt.
It looks like the actual text to be translated wasn't included in your message — I only see the translation instructions, ending with what appears to be a fragment ("Kev actually"). Please paste the source text (with its {{1}}...{{/1}} markers if applicable) and I'll translate it into Dutch, preserving all markers exactly as specified.
De modelkaart van Kev-4B is ongewoon specifiek, en die specificiteit is het hele punt. De backbone is Qwen3.5-4B-Base, bevroren op een genoemde revisie, met 24 lineaire-attentielagen van Gated DeltaNet en 8 volledige attentielagen op een verborgen grootte van 2.560. Daarbovenop zit een rank-16 LoRA-adapter — 33,8 miljoen trainbare parameters, toegepast op attention-, MLP- en DeltaNet-projecties — en een pointer-head die de afsluitende token van elke optie scoort tegen de laatste token van de vraag en daar softmax op toepast. Eén temperatuur, T = 2,41, is opgeslagen in het head-bestand en wordt toegepast bij het laden, en de modelkaart geeft de gefitte waarde en de bestandshash. De training verliep in fasen met gepubliceerde recordaantallen: een basisrecept van 12.576 records, 1.425 voor datums en ontbrekend bewijs, 5.219 echte CFPB-klachtnarratieven, 6.000 skill-records en 5.320 records voor developer-tooling, waarbij latere fasen eerdere opnieuw afspeelden. De modelkaart vermeldt ook wat niet is gebruikt: "Er is geen output van Jev (het gehoste beslissingsmodel van TypeSafe) gebruikt."
De benchmarktabel staat op dezelfde pagina, en wordt geleverd met de faalgevallen erbij, wat zeldzamer is dan de successen. Transfer-v4 afgesloten out-of-domain-test: nauwkeurigheid 0,838, Brier 0,224, ECE 0,017. Breadth-v1 over 14 achtergehouden datasets en 3.089 vragen: nauwkeurigheid 0,690, ECE 0,029. Hard-v1-test: 0,803. Documents-v1-test: 0,903. MMLU-Pro met tien opties: 0,565. Datumrekenkunde: 0,65, door de auteur genoemd als het zwakste gebied, met een preprocessor-vlag aangeboden als gedeeltelijke oplossing en een expliciete opmerking dat het niet opnieuw is gemeten. De sectie met beperkingen voegt toe dat de kalibratie een enkele in-distributietemperatuur is, zodat de dekking buiten het domein afneemt, dat de volgorde van opties een antwoord kan omdraaien, en dat lengtes boven 8.192 tokens wel worden bediend maar niet gevalideerd. Ook serveercijfers zijn gepubliceerd: 18,1 ms voor zes vragen over een korte state op een H100, 12,9 ms gecachet, 14,3 GB resident GPU-geheugen.

Wat Microsoft in plaats daarvan publiceert
Microsoft-Decision-1 bestrijkt grotendeels hetzelfde terrein met een andere insteek. Het scoort ja/nee-, meerkeuze-, beoordelings-, classificatie- en rubricvragen, ondersteunt expliciete onthoudingsopties zoals 'kan het niet zeggen', retourneert JSON-waarschijnlijkheden en draait in één aanroep over maximaal 32K tokens — vier keer de context die Kev valideert. Het wordt gedistribueerd als een gehoste API in Microsoft Foundry onder het Direct from Azure-portfolio, met serverloze en unified-endpointimplementatie, standaard-SKU, Azure-authenticatie en een uniform facturatiepad. Batch-inferentie is uitgeschakeld, en er is geen gewichtsdownload en geen fine-tuningpad.
De evaluatiesectie beschrijft openbare en community-benchmarks voor besluitvorming plus achtergehouden interne sets, metrieken waaronder nauwkeurigheid en kalibratiefout, gevarieerde optievolgorde, gepaarde statistische tests, en de bewering dat het model "presteert op het niveau van toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd." Er is geen tabel. De modelkaart noemt zijn eigen beperkingen eerlijk — scores verschuiven met formulering en optievolgorde, kalibratie is het sterkst bij vertrouwde taaktypen, er wordt geen uitleg geproduceerd, en niet-Engelse dekking is het zwakst — maar een lijst met beperkingen is geen kalibratiemeting. Wie een auto-acceptdrempel van 0,9 instelt op Microsoft-Decision-1, stelt die op goed vertrouwen in en past die in productie aan.

Het deel van de vergelijking dat geld kost
De economie van Kev is de reden dat deze match-up echt close is. Het recept is een bevroren basis plus een adapter van 33.8M, wat betekent dat het marginale model dat je traint rekenkracht van adapterformaat kost, niet rekenkracht van foundation-modelformaat. Je kunt de basis één keer in het geheugen houden en meerdere adapters laden — één per beslissingsdomein — een deploymentvorm die de gehoste API van Microsoft helemaal niet kan uitdrukken. Als je routeringsregels verschillen van die van een generieke judge, laat Kev je het verschil trainen; Microsoft-Decision-1 laat je een betere prompt schrijven en hopen.
Daar staat tegenover dat de gehoste API geen operationeel oppervlak met zich meebrengt. Er is geen adapter om bij te houden, geen serving-stack om warm te houden, geen kloof tussen gevalideerde en geserveerde context om over na te denken, en geen risico dat een temperatuur die op de ene dataset is gefit, zich op de uwe anders gedraagt. Voor een team met een bescheiden beslissingsvolume is de service het goedkopere artefact in engineeringuren, zelfs als de tokens geld kosten; voor een team dat miljoenen items per dag scoort, wint de zelfgehoste adapter op unitkosten zodra de GPU is betaald.
Er is een derde pad dat geen van beide modellen gebruikt voor het deel waar het het zwakst is, en daar zit OrcaRouter. Wij hosten Microsoft-Decision-1 of Kev niet — een scorer die waarschijnlijkheden retourneert is geen doelwit voor chat-completions en geen van beide modellen zit in onze catalogus. De generatieve helft van een besluitvormingspijplijn is wat wij aanbieden: het model dat het kandidaat-antwoord opstelt, de rubric schrijft of de tool call uitzendt die wordt gescoord. Dat alles zit achter één OpenAI-compatibele sleutel met meer dan 200 modellen erop tegen de lijstprijs van de provider, doorgegeven met 0% opslag, zodat een prijswijziging van een leverancier dezelfde dag bij ons live staat. Als je een beoordelings- of triagelus bouwt, is de schrijfaanroep routeerbaar en de scoring-aanroep niet, en die grens helder houden is wat voorkomt dat een scoring-pijplijn stilletjes een chat-pijplijn wordt.

Hoe te beslissen
Kies Kev wanneer je cijfers nodig hebt voordat je uitbrengt, wanneer je wilt fine-tunen op je eigen beslissingslabels, wanneer je scoring binnen je eigen grens wilt draaien tegen nul marginale kosten, of wanneer je wilt dat meerdere beslissingsdomeinen één resident basismodel delen. De gepubliceerde ECE-cijfers zijn nog steeds de eigen metingen van de auteur op de eigen meetomgeving van de auteur — beschouw ze als een geloofwaardige zelfbeoordeling, niet als een geauditeerd resultaat van een derde partij — maar ze zijn op zijn minst een vermelde schaal die je kunt proberen te reproduceren, en het recept staat er precies om ze daarmee te reproduceren.
Kies Microsoft-Decision-1wanneer de beslissende factor inkoop of contextlengte is: een beheerd Azure-eindpunt met uniforme facturering en een Responsible AI-pakket, 32K invoer voor lange documenten, en een leverancier om naar te escaleren. Het ontbrekende benchmarkoverzicht is geen schandaal — heel wat gehoste modellen lanceren zonder — maar het betekent wel dat de eerste kalibratiecurve voor dit model door zijn gebruikers zal worden getekend, en je kunt maar beter van plan zijn er een van hen te zijn, op je eigen gelabelde data, voordat je er een productiedrempel op richt.
