Ett genererat titelkort för Microsoft-Decision-1 mot Kev med undertexten ”en hostad scorer mot ett recept du kan träna om”, med kort som anger 9B hostat API mot en frusen bas plus en 33,8M rank-16 LoRA-adapter, inga publicerade benchmarks mot ECE 0,017 på transfer-v4, inga distribuerade vikter mot Apache-2.0, och en sidfot med källhänvisning som noterar att båda uppsättningarna av siffror är självrapporterade.
Engineering & Research

Microsoft-Decision-1 vs Kev: Att köpa en poäng, eller att äga receptet som producerar en

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Jared Palmer lade ett kvitto bredvid sin modell. Kev-familjen – Kev-0.8B, Kev-4B och Kev-9B, byggda på frysta bascheckpoints med öppna vikter, med en rank-16 LoRA-adapter och ett litet pointer-huvud – släpptes den 24 september 2026 med sitt träningsrecept, sina dataantal per steg och sina utvärderingssiffror – allt publicerat, och den ärliga rubriken för alla som jämför den med Microsoft-Decision-1 är att Kev berättar mycket mer för dig om hur man reproducerar den. Microsofts scorer blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026: en Qwen3.5-9B-bas eftertränad av Microsoft, kontext på 32 768 token, endast text, vikter som inte distribueras, en publicerad utvärderingsmetodik och inga publicerade resultat. Båda tar ett tillstånd och en uppsättning typade frågor och returnerar en kalibrerad fördelning i stället för genererad text. Den ena är en tjänst, den andra är en metod du kan köra i en notebook i kväll.

Anledningen till att den distinktionen avgör den här matchningen snarare än förmågan: Kev-4B rapporterar ECE 0.017 på sitt låsta test utanför domänen och Microsoft-Decision-1 rapporterar ingenting, så kalibreringsargumentet som vanligtvis avgör en jämförelse mellan scorer och scorer har bara en sida som anger sin position.

Vad Kev faktiskt publicerar

Kev-4B:s kort är ovanligt specifikt, och det specifika är själva poängen. Stommen är Qwen3.5-4B-Base, fryst vid en namngiven revision, med 24 linjära uppmärksamhetslager av Gated DeltaNet-typ och 8 fulla uppmärksamhetslager vid dold storlek 2 560. Ovanpå den sitter en LoRA-adapter av rang 16 – 33,8 miljoner träningsbara parametrar, tillämpade på attention-, MLP- och DeltaNet-projektioner – och ett pointer-huvud som poängsätter varje alternativs avslutande token mot frågans sista token och softmaxar. En temperatur, T = 2,41, lagras i huvudfilen och tillämpas vid laddning, och kortet anger det anpassade värdet och filens hash. Träningen kördes i steg med publicerade postantal: ett basrecept med 12 576 poster, 1 425 för datum och saknade belägg, 5 219 verkliga CFPB-klagomålsberättelser, 6 000 färdighetsposter och 5 320 poster för utvecklarverktyg, där senare steg återspelade tidigare. Kortet anger också vad som inte användes: "Ingen utdata från Jev (TypeSafe:s hostade beslutsmodell) användes."

Benchmarktabellen anges på samma sida, och den kommer med misslyckandefallen bifogade, vilket är mer sällsynt än framgångarna. Transfer-v4 låst test utanför domänen: noggrannhet 0,838, Brier 0,224, ECE 0,017. Breadth-v1 över 14 undanhållna dataset och 3 089 frågor: 0,690 noggrannhet, ECE 0,029. Hard-v1 test: 0,803. Documents-v1 test: 0,903. MMLU-Pro med tio alternativ: 0,565. Datumaritmetik: 0,65, utpekad av författaren som det svagaste området, med en förprocessorflagga som erbjuds som en partiell lösning och en uttrycklig not om att det inte mättes om. Avsnittet om begränsningar tillägger att kalibreringen är en enda in-distribution-temperatur, så täckningen försämras utanför domänen, att alternativens ordning kan vända ett svar, och att längder över 8 192 tokens serveras men inte valideras. Serveringssiffror publiceras också: 18,1 ms för sex frågor över ett kort tillstånd på en H100, 12,9 ms cachad, 14,3 GB resident GPU-minne.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

Vad Microsoft publicerar i stället

Microsoft-Decision-1 täcker till stor del samma område med en annan hållning. Den poängsätter ja/nej-, flervals-, betygs-, klassificerings- och rubricfrågor, stöder explicita avstå-alternativ som "kan inte avgöra", returnerar JSON-sannolikheter och körs i en enda anrop över upp till 32K tokens – fyra gånger den kontext som Kev validerar. Den distribueras som ett hostat API i Microsoft Foundry under portföljen Direct from Azure, med serverlös och enhetlig slutpunktsdistribution, standard-SKU, Azure-autentisering och en enhetlig faktureringsväg. Batchinferens är inaktiverad, och det finns ingen nedladdning av vikter och ingen väg för finjustering.

Utvärderingsavsnittet beskriver offentliga och gemenskapsbaserade beslutsbenchmark samt undanhållna interna uppsättningar, mätvärden inklusive träffsäkerhet och kalibreringsfel, att alternativordningen varierades, parade statistiska tester, och ett påstående att modellen "presterar i nivå med ledande beslutsmodeller och bättre än andra öppna beslutsmodeller som utvärderats med samma metodik." Det finns ingen tabell. Modellkortet redovisar sina egna begränsningar ärligt — poäng förskjuts med formulering och alternativordning, kalibreringen är starkast för bekanta uppgiftstyper, inga förklaringar produceras, och täckningen av andra språk än engelska är svagast — men en lista över begränsningar är inte en kalibreringsmätning. Den som sätter ett tröskelvärde på 0,9 för automatiskt godkännande på Microsoft-Decision-1 sätter det på tro och justerar det i produktion.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

Den del av jämförelsen som kostar pengar

Kevs ekonomi är anledningen till att den här matchningen är genuint jämn. Receptet är en fryst bas plus en 33,8M-adapter, vilket innebär att den marginella modell du tränar kostar adapterstor beräkningskraft, inte beräkningskraft i grundmodellsstorlek. Du kan hålla basen i minnet en gång och ladda flera adaptrar – en per beslutsdomän – vilket är en distributionsform som Microsofts hostade API inte alls kan uttrycka. Om dina routningsregler skiljer sig från en generisk domares låter Kev dig träna skillnaden; Microsoft-Decision-1 låter dig skriva en bättre prompt och hoppas.

Mot det har det hostade API:et ingen driftöveryta. Det finns ingen adapter att hålla reda på, ingen serving-stack att hålla varm, inget gap mellan validerad och serverad kontext att resonera kring, och ingen risk att en temperatur som anpassats på en datauppsättning beter sig annorlunda på din. För ett team med måttlig beslutsvolym är tjänsten den billigare artefakten i ingenjörstimmar även om tokens kostar pengar; för ett team som poängsätter miljontals objekt per dag vinner den självhostade adaptern på styckkostnad i samma stund som GPU:n är betald.

Det finns en tredje väg som inte använder någon av modellerna för den del där den är svagast, och det är där OrcaRouter ligger. Vi hostar inte Microsoft-Decision-1 eller Kev – en poängsättare som returnerar sannolikheter är inte ett mål för chat-completions, och ingen av modellerna finns i vår katalog. Den generativa halvan av en beslutspipeline är vad vi tillhandahåller: modellen som tar fram utkastet till kandidatsvaret, skriver bedömningsmallen eller skickar verktygsanropet som ska poängsättas. Allt detta ligger bakom en enda OpenAI-kompatibel nyckel med fler än 200 modeller på den till leverantörens listpris som förs vidare med 0 % påslag, så en prisförändring från leverantören slår igenom hos oss samma dag. Om du bygger en bedömnings- eller triageloop är skrivanropet routbart och poängsättningsanropet inte, och att hålla den gränsen tydlig är det som hindrar en poängsättningspipeline från att tyst bli en chattpipeline.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

Hur man bestämmer

Välj Kev när du behöver siffror innan du levererar, när du vill finjustera på dina egna beslutsetiketter, när du vill köra poängsättning inom din egen gräns till noll marginalkostnad, eller när du vill att flera beslutsdomäner ska dela en och samma residenta basmodell. Dess publicerade ECE-siffror är fortfarande författarens egna mätningar i författarens egen testmiljö – betrakta dem som en trovärdig självbedömning, inte som ett granskat tredjepartsresultat – men de är åtminstone en angiven skala som du kan försöka reproducera, och receptet finns precis där för att reproducera dem med.

Välj Microsoft-Decision-1 när avgörandet hänger på upphandling eller kontextlängd: en hanterad Azure-slutpunkt med enhetlig fakturering och ett Responsible AI-paket, 32K indata för långa dokument, och en leverantör att eskalera till. Att dess benchmarktabell saknas är inte en skandal — många värdbaserade modeller lanseras utan en — men det innebär att den första kalibreringskurvan för den här modellen kommer att ritas av dess användare, och du bör planera att vara en av dem, med dina egna märkta data, innan du riktar ett produktions-tröskelvärde mot den.