Eine generierte Titelkarte für Microsoft-Decision-1 vs. Kev mit dem Untertitel „ein gehosteter Scorer gegen ein Rezept, das Sie neu trainieren können“, mit Chips mit den Aufschriften „gehostete 9B-API vs. eine eingefrorene Basis plus einen 33,8M-Rank-16-LoRA-Adapter“, „keine veröffentlichten Benchmarks vs. ECE 0,017 auf transfer-v4“ und „keine verteilten Gewichte vs. Apache-2.0“ sowie einer Fußzeile mit Quellenangabe, die anmerkt, dass beide Zahlenreihen auf Selbstauskunft beruhen.
Engineering & Research

Microsoft-Decision-1 vs. Kev: Einen Score kaufen oder das Rezept besitzen, das einen hervorbringt

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Jared Palmer legte einen Beleg neben sein Modell. Die Kev-Familie — Kev-0.8B, Kev-4B und Kev-9B, aufgebaut auf eingefrorenen Open-Weight-Basis-Checkpoints mit einem Rank-16-LoRA-Adapter und einem kleinen Pointer-Head — erschien am 24. September 2026, wobei Trainingsrezept, Datenzahlen Stufe für Stufe und Evaluationswerte alle veröffentlicht wurden, und die ehrliche Schlagzeile für alle, die es mit Microsoft-Decision-1 vergleichen, ist, dass Kev weit mehr darüber verrät, wie man es selbst reproduziert. Microsofts Scorer wurde am 8. Oktober 2026 auf Microsoft Foundry allgemein verfügbar: eine von Microsoft nachtrainierte Qwen3.5-9B-Basis, 32.768-Token-Kontext, nur Text, Gewichte nicht verteilt, eine veröffentlichte Evaluationsmethodik und keine veröffentlichten Ergebnisse. Beide nehmen einen Zustand und eine Reihe typisierter Fragen entgegen und geben eine kalibrierte Verteilung statt generierten Text zurück. Das eine ist ein Dienst, das andere eine Methode, die man heute Abend in einem Notebook ausführen kann.

Der Grund, warum diese Unterscheidung dieses Duell entscheidet und nicht die Leistungsfähigkeit: Kev-4B meldet ECE 0,017 in seinem gesperrten Out-of-Domain-Test, während Microsoft-Decision-1 nichts meldet, sodass bei dem Kalibrierungsargument, das normalerweise einen Scorer-gegen-Scorer-Vergleich entscheidet, nur eine Seite ihre Position darlegt.

Was Kev tatsächlich veröffentlicht

Die Modellkarte von Kev-4B ist ungewöhnlich spezifisch, und die Spezifität ist der Punkt. Das Backbone ist Qwen3.5-4B-Base, eingefroren auf einer benannten Revision, mit 24 linearen Attention-Schichten von Gated DeltaNet und 8 Full-Attention-Schichten bei Hidden-Size 2.560. Darauf sitzt ein LoRA-Adapter mit Rang 16 – 33,8 Millionen trainierbare Parameter, angewendet auf Attention-, MLP- und DeltaNet-Projektionen – sowie ein Pointer-Head, der das Abschluss-Token jeder Option gegen das finale Token der Frage bewertet und darauf Softmax anwendet. Eine Temperatur, T = 2,41, ist in der Head-Datei gespeichert und wird beim Laden angewendet, und die Modellkarte gibt den angepassten Wert und den Datei-Hash an. Das Training lief in Stufen mit veröffentlichten Datensatzzahlen ab: ein Basisrezept mit 12.576 Datensätzen, 1.425 für Datumsangaben und fehlende Nachweise, 5.219 echte CFPB-Beschwerdenarrative, 6.000 Skill-Datensätze und 5.320 Entwickler-Tooling-Datensätze, wobei spätere Stufen frühere erneut durchspielten. Die Modellkarte gibt außerdem an, was nicht verwendet wurde: „Es wurde keine Ausgabe von Jev (das gehostete Entscheidungsmodell von TypeSafe) verwendet.“

Die Benchmark-Tabelle ist auf derselben Seite angegeben und enthält die Fehlerfälle direkt, was seltener ist als die Erfolge. Transfer-v4 gesperrter Out-of-Domain-Test: Genauigkeit 0,838, Brier 0,224, ECE 0,017. Breadth-v1 über 14 zurückgehaltene Datensätze und 3.089 Fragen: 0,690 Genauigkeit, ECE 0,029. Hard-v1-Test: 0,803. Documents-v1-Test: 0,903. MMLU-Pro mit zehn Optionen: 0,565. Datumsarithmetik: 0,65, vom Autor als schwächster Bereich bezeichnet, mit einem Preprocessor-Flag als teilweisem Fix und einem ausdrücklichen Hinweis, dass sie nicht erneut gemessen wurde. Der Abschnitt zu Einschränkungen ergänzt, dass die Kalibrierung eine einzelne In-Distribution-Temperatur ist, sodass die Abdeckung außerhalb der Domäne abnimmt, dass die Optionsreihenfolge eine Antwort umdrehen kann und dass Längen über 8.192 Token zwar ausgeliefert, aber nicht validiert werden. Auch Serving-Zahlen sind veröffentlicht: 18,1 ms für sechs Fragen über einen kurzen Zustand auf einer H100, 12,9 ms mit Cache, 14,3 GB residenter GPU-Speicher.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

Was Microsoft stattdessen veröffentlicht

Microsoft-Decision-1 deckt größtenteils dieselben Bereiche mit einer anderen Ausrichtung ab. Es bewertet Ja/Nein-, Multiple-Choice-, Bewertungs-, Klassifizierungs- und Rubrikfragen, unterstützt explizite Enthaltungsoptionen wie „kann nicht sagen“, gibt JSON-Wahrscheinlichkeiten zurück und läuft in einem Aufruf über bis zu 32K Token — viermal der Kontext, den Kev validiert. Es wird als gehostete API in Microsoft Foundry unter dem Direct from Azure Portfolio vertrieben, mit serverlosem und Unified-Endpoint-Deployment, Standard-SKU, Azure-Authentifizierung und einem einheitlichen Pfad. Batch-Inferenz ist deaktiviert, und es gibt keine Gewichte und keinen Fine-Tuning-Pfad.

Der Bewertungsabschnitt beschreibt öffentliche und Community-Entscheidungsbenchmarks sowie zurückgehaltene interne Sets, Metriken einschließlich Genauigkeit und Kalibrierungsfehler, variierte Optionsreihenfolge, gepaarte statistische Tests und die Behauptung, dass das Modell „mit führenden Entscheidungsmodellen mithält und vor anderen offenen Entscheidungsmodellen liegt, die mit derselben Methodik evaluiert wurden“. Es gibt keine Tabelle. Die Modellkarte benennt ihre eigenen Grenzen ehrlich – Punktzahlen verschieben sich mit Formulierung und Reihenfolge der Optionen, die Kalibrierung ist bei vertrauten Aufgabenarten am stärksten, es werden keine Erklärungen erzeugt, und die Abdeckung für Nicht-Englisch ist am schwächsten –, aber eine Liste von Einschränkungen ist keine Kalibrierungsmessung. Wer für Microsoft-Decision-1 einen Auto-Akzeptanz-Schwellenwert von 0,9 festlegt, legt ihn im Vertrauen fest und justiert ihn in der Produktion nach.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

Der Teil des Vergleichs, der Geld kostet

Kevs Kostenstruktur ist der Grund, warum dieses Duell wirklich knapp ist. Das Rezept besteht aus einer eingefrorenen Basis plus einem 33,8-Mio.-Adapter, was bedeutet, dass das zusätzliche Modell, das du trainierst, nur Rechenleistung im Umfang eines Adapters erfordert, nicht im Umfang eines Foundation-Modells. Du kannst die Basis einmal im Speicher halten und mehrere Adapter laden – einen pro Entscheidungsdomäne –, eine Deployment-Form, die Microsofts gehostete API überhaupt nicht abbilden kann. Wenn deine Routing-Regeln von denen eines generischen Judges abweichen, kannst du mit Kev die Differenz trainieren; Microsoft-Decision-1 lässt dich einen besseren Prompt schreiben und hoffen.

Dagegen bringt die gehostete API keine operative Oberfläche mit. Es gibt keinen Adapter, den man nachverfolgen müsste, keinen Serving-Stack, der warmgehalten werden muss, keine Lücke zwischen validiertem und ausgeliefertem Kontext, über die man nachdenken müsste, und kein Risiko, dass eine auf einem Datensatz angepasste Temperatur sich auf Ihrem anders verhält. Für ein Team mit überschaubarem Entscheidungsvolumen ist der Dienst das kostengünstigere Artefakt in Ingenieurstunden, auch wenn die Tokens Geld kosten; für ein Team, das täglich Millionen von Elementen bewertet, gewinnt der selbst gehostete Adapter bei den Stückkosten, sobald die GPU bezahlt ist.

Es gibt einen dritten Weg, der keines der beiden Modelle für den Teil nutzt, in dem es am schwächsten ist, und genau dort sitzt OrcaRouter. Wir hosten weder Microsoft-Decision-1 noch Kev — ein Scorer, der Wahrscheinlichkeiten zurückgibt, ist kein Chat-Completions-Ziel, und keines der beiden Modelle ist in unserem Katalog. Die generative Hälfte einer Entscheidungs-Pipeline ist das, was wir anbieten: das Modell, das die Kandidatenantwort entwirft, die Bewertungsrubrik schreibt oder den Tool-Call ausgibt, der bewertet wird. All das steht hinter einem einzigen OpenAI-kompatiblen Schlüssel mit mehr als 200 Modellen darauf zum Listenpreis des Anbieters, durchgereicht mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist. Wenn Sie eine Bewertungs- oder Triage-Schleife bauen, ist der schreibende Aufruf routbar und der bewertende Aufruf nicht, und diese Grenze klar zu halten ist das, was verhindert, dass eine Scoring-Pipeline sich still und leise in eine Chat-Pipeline verwandelt.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

Wie man entscheidet

Wähle Kev, wenn du Zahlen brauchst, bevor du auslieferst, wenn du anhand deiner eigenen Entscheidungslabels feinabstimmen möchtest, wenn du Scoring innerhalb deiner eigenen Grenze bei null Grenzkosten ausführen möchtest oder wenn du möchtest, dass sich mehrere Entscheidungsdomänen ein einziges residentes Basismodell teilen. Seine veröffentlichten ECE-Werte sind weiterhin die eigenen Messungen des Autors auf dessen eigenem Harness — behandle sie als glaubwürdige Selbsteinschätzung, nicht als auditiertes Drittanbieterergebnis —, aber sie sind zumindest ein angegebener Maßstab, den du zu reproduzieren versuchen kannst, und das Rezept ist direkt dort, mit dem du sie reproduzieren kannst.

Wählen Sie Microsoft-Decision-1, wenn das ausschlaggebende Kriterium Beschaffung oder Kontextlänge ist: ein verwalteter Azure-Endpunkt mit einheitlicher Abrechnung und einem Responsible-AI-Paket, 32K Eingabe für lange Dokumente und ein Anbieter, an den Sie eskalieren können. Dass die Benchmark-Tabelle fehlt, ist kein Skandal – viele gehostete Modelle starten ohne eine –, aber es bedeutet, dass die erste Kalibrierungskurve für dieses Modell von seinen Nutzern gezeichnet wird, und Sie sollten planen, einer von ihnen zu sein, mit Ihren eigenen gelabelten Daten, bevor Sie einen Produktionsschwellenwert darauf ansetzen.