Eine generierte Titelkarte für Microsoft-Decision-1 mit dem Untertitel „ein entscheidungsbewertendes Modell, das eine Wahrscheinlichkeit statt eines Satzes zurückgibt“, mit einem Badge mit der Aufschrift Microsoft Foundry, allgemein verfügbar am 8. Oktober 2026, und Chips mit der Aufschrift 9B-Basismodell, 32.768-Token-Kontext, Gewichte nicht verteilt und nur Text, keine Generierung.
Guides & Insights

Microsoft-Decision-1: Das Microsoft-Modell, das mit einer Zahl statt eines Satzes antwortet

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Microsoft-Decision-1 hat in seiner Modellkarte eine Zeile, die kein anderes Microsoft-Modell je getragen hat: nicht für Textgenerierung ausgelegt. Das Modell wurde auf Microsoft Foundry allgemein verfügbar am 8. Oktober 2026, und es ist eine bewusste Verengung dessen, wofür ein Sprachmodell gedacht ist. Man übergibt ihm eine Situation und eine Frage mit einer festen Liste von Antworten – Ja/Nein, eine Multiple-Choice-Auswahl, eine Bewertungsskala, ein Bewertungsraster – und es gibt für jede Option eine kalibrierte Wahrscheinlichkeit zurück. Keine Prosa. Keine Erklärung. Kein Begründungsfeld. Die Ausgabe besteht aus JSON-Zahlen und sonst nichts. Es basiert auf dem Open-Weight-Modell Qwen3.5-9B, von Microsoft nachtrainiert, und Microsoft sagt, dass es das Modell später auf andere Backbones rebasen wird, wobei es MAI und andere Partnermodelle nennt.

Das ist ein seltsameres Produkt, als es zunächst klingt. Microsofts Wettbewerbsposition im Jahr 2026 ruht auf Frontier-Chatmodellen und auf Copilot, und Microsoft-Decision-1 ist das Gegenteil von beidem: ein mittelgroßer, zweckgebundener Scorer, dessen einzige Aufgabe darin besteht, einer Anwendung mitzuteilen, welche Ihrer eigenen Optionen am wahrscheinlichsten korrekt ist und wie sicher er sich dabei ist. Die interessante Frage ist nicht, ob es gut im Schreiben ist – darin ist es ausdrücklich schlecht, und es versucht es auch gar nicht –, sondern ob eine Wahrscheinlichkeitsverteilung über Optionen ein nützlicheres Primitiv für die Workloads ist, die Unternehmen tatsächlich ausführen, als ein weiteres Allzweckmodell mit JSON-Modus.

Was es genau macht

Der Vertrag lautet: ein Aufruf hinein, eine Ausgabe heraus. Microsoft listet die unterstützten Frageformate als Ja/Nein, Multiple-Choice, Bewertung, Klassifizierung und klassifizierungsbasiert auf. Jede Option erhält eine Punktzahl. Das Modell läuft in einem einzigen Aufruf über Eingaben von bis zu 32K Tokens — 32.768 ist das angegebene Kontextfenster — und die praktische Obergrenze ist die Eingabe plus das Optionsset, nicht ein Generierungsbudget, denn es gibt keine Generierung.

Die veröffentlichten Use Cases sind genau die, die ein Plattform-Team sofort wiedererkennen würde:

• Bewertung von KI-Ausgaben — bewerten Sie eine generierte Antwort anhand einer vorgegebenen Bewertungsrurik oder entscheiden Sie, ob sie durch die ihr gegebenen Belege gestützt ist.

• Klassifizierung und Routing — eine Anfrage klassifizieren, Relevanz beurteilen, eine Warteschlange triagieren, einen Workflow-Zweig auswählen.

• Agenten-Guardrails — bewerten Sie einen vorgeschlagenen Tool-Aufruf oder eine Agentenaktion, bevor die integrierende Anwendung deren Ausführung zulässt.

• Prüfung auf Inhaltssicherheit — Inhalte anhand von Schwellenwerten markieren, die die Anwendung definiert, statt anhand einer festen Anbieterrichtlinie.

• Such- und Dokumentrelevanz — beurteilen, ob ein abgerufenes Dokument eine vorgegebene Frage beantwortet.

• Konfidenzbasierte Automatisierung — Ergebnisse mit hoher Konfidenz automatisch akzeptieren und den Rest an einen Menschen eskalieren.

Die Enthaltungsoption ist das Detail, das Beachtung verdient. Microsoft unterstützt ausdrücklich Optionen wie „kann nicht sagen“, wenn die bereitgestellten Belege nicht ausreichen, und das ist der Unterschied zwischen einem Scorer, der kalibriert ist, und einem, der lediglich zuversichtlich ist. Und weil Scores als Zahlen zurückkommen, ist die Eskalationsschwelle eine Entscheidung, die Sie selbst treffen — Sie legen fest, wo 0,7 etwas an eine Person weiterleitet und 0,95 nicht.

Was es nicht tun wird

Microsoft ist ungewöhnlich explizit in Bezug auf die Ausschlüsse, und diese sind für jeden, der dies für eine echte Pipeline dimensioniert, wichtiger als die Funktionsliste. Microsoft-Decision-1 ist nicht für Textgenerierung, die Beantwortung offener Fragen, Konversation, Übersetzung oder Zusammenfassung konzipiert. Es ist nicht für Aufgaben ohne eine geschlossene Frage und eine definierte Auswahl an Antwortoptionen gedacht oder für Aufgaben, die Wissen erfordern, das in der Eingabe nicht enthalten ist. Es ist ausschließlich Text: keine Bilder, kein Audio oder Video als Eingabe, nichts davon als Ausgabe. Es liefert keine Erklärungen oder Begründungen.

Liest man sie zusammen, zeigt sich eine Grenze, über die man leicht stolpert. Das ist kein Chatbot, den man bitten kann, auch Dinge zu klassifizieren, und kein Summarizer, an den man einfach eine Punktzahl anschrauben kann. Es ist eine Scoring-Funktion mit einem Token-Budget. Auch die Formulierung des Teams selbst – dass sie nicht die alleinige automatisierte Entscheidungsinstanz bei folgenreichen Entscheidungen über Menschen sein sollte und nicht die alleinige Grundlage für Entscheidungen über Kredite, Beschäftigung, Wohnen, Versicherungen, Bildung, Gesundheitsversorgung, gesetzliche Rechte „oder ähnlich folgenreiche Bereiche“ sein sollte – weist in dieselbe Richtung. Sie ist darauf ausgelegt, neben einer Entscheidung zu stehen, nicht diese zu sein.

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; weights hosted API only and not distributed; context window 32,768 tokens; output calibrated JSON probabilities with zero output tokens; published benchmarks none, methodology only; status generally available on Microsoft Foundry on October 8 2026. A footer line reads that all figures are Microsoft-reported and not independently reproduced.

Die Benchmark-Situation ist die Geschichte, die niemand drucken will.

Es gibt keine Zahlen. Die Microsoft Foundry-Katalogseite für Microsoft-Decision-1 hat einen Tab „Benchmarks“, und sie enthält keine Zahlenwerte. Stattdessen enthält sie einen Methodikabsatz und eine qualitative Aussage: Das Modell wurde „an öffentlichen und Community-Entscheidungs-Benchmarks sowie an internen Hold-out-Testsets, die nicht für das Training verwendet wurden, evaluiert“, Microsoft berichtet, dass es „mit geschlossenen Entscheidungsmodellen auf Augenhöhe abschneidet und vor anderen offenen Entscheidungsmodellen liegt, die mit derselben Methodik evaluiert wurden“, und die verwendeten Metriken waren Genauigkeit, Kalibrierungsfehler, Sicherheits-Recall, Falsch-Positiv-Raten und Fairness-Konsistenz, wobei die Optionsreihenfolge variiert und gepaarte statistische Tests angewendet wurden.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

Das ist eine ernstzunehmende Methodikbeschreibung, zu der null veröffentlichte Ergebnisse gehören. Das bedeutet, dass jede heutige Leistungsaussage über Microsoft-Decision-1 vom Anbieter stammt und nicht reproduziert ist, und die ehrliche Position für jeden, der es bewertet, ist, dass die Kalibrierung – die eine Eigenschaft, die eine Wahrscheinlichkeit überhaupt nützlich macht – außerhalb von Microsoft nicht verifiziert ist. Das Unternehmen benennt allerdings, wo das Modell seiner Ansicht nach am stärksten und am schwächsten ist, was nützlicher ist als eine Schlagzeilen-Punktzahl: am stärksten beim Reasoning, bei der Regelanwendung und bei der Robustheit gegenüber Prompt-Formatierung; wettbewerbsfähig bei Klassifizierung, Retrieval, Fairness, Tool-Nutzung und den meisten mehrsprachigen Aufgaben; schwächer bei Aufgaben mit spezialisiertem Domänenwissen.

Die selbstberichteten Einschränkungen sind lesenswert, bevor man sich die Funktionsliste ansieht. Bewertungen können sich je nach Formulierung und Reihenfolge der Optionen verändern, und eine schlecht formulierte Frage liefert trotzdem eine Bewertung. Die Kalibrierung ist bei vertrauten Aufgabentypen am stärksten. Es kann auf veraltetes Wissen zurückgreifen und liefert keine Erklärungen. Zur mehrsprachigen Abdeckung: 25 Sprachen werden als unterstützt aufgeführt, darunter Japanisch, Koreanisch, Arabisch, Vietnamesisch, Thailändisch, Türkisch, Hindi, Bengalisch, Swahili, Hebräisch, Persisch und Ukrainisch, aber Microsoft gibt an, dass Abdeckung, Qualität und Kalibrierung „je nach Sprache variieren können“, und nennt Nicht-Englisch – insbesondere ressourcenärmere Sprachen – als Bereich der Minderleistung. Das zugrunde liegende Qwen3.5-9B unterstützt mehr als 200 Sprachen; das nachtrainierte Modell unterstützt ein Viertel davon.

Wie Sie es bekommen und was es kostet

Microsoft-Decision-1 wird als gehostete API in Microsoft Foundry unter dem Portfolio „Direct from Azure“ bereitgestellt. Modellgewichte werden nicht verteilt – dies ist kein Open-Weights-Release, und es gibt kein Repository auf Hugging Face, aus dem es heruntergeladen werden könnte. Jede Anwendung, die HTTPS-Anfragen senden kann, kann mithilfe der Foundry-Endpunkte und der standardmäßigen Azure-Authentifizierung integriert werden. Die Bereitstellungsauflistung zeigt serverlose und Unified-Endpoint-Optionen mit Pay-as-you-go- oder reserviertem bereitgestelltem Durchsatz, Standard-SKU, mit deaktivierter Batch-Inferenz, und die Trainingsangaben geben an, dass das Trainingsdataset erstmals im September 2026 verwendet wurde, wobei die Sammlung noch andauert.

Die Preisgestaltung wird auf der Modellseite nicht veröffentlicht. Das Preisfeld des Katalogs verweist auf Microsofts Modellpreisseite, statt einen Eingabe- und Ausgabetarif auszuweisen. Die Kosten pro Token für einen Decision-1-Aufruf muss man daher in den Azure-Preisinformationen nachschlagen oder aus einer Rechnung ablesen. Das ist eine echte Lücke für alle, die Kosten pro Entscheidung bei hohem Volumen modellieren wollen, und das sollte man klar sagen, statt es zu schätzen. Zwei Dinge sollte man wissen, wenn man den Preis dafür ermittelt: 0 % der Kosten entfallen auf Ausgabe-Tokens, weil es keine gibt, und Batch-Inferenz ist deaktiviert, sodass man einen Bulk-Scoring-Lauf nicht über den Batch-Kanal amortisieren kann, wie man es bei einem generativen Modell tun würde.

Wo OrcaRouter hier ins Spiel kommt, ist auf der anderen Seite des Aufrufs. Wir hosten Microsoft-Decision-1 nicht, und es ist nicht in unserem Katalog – ein Modell, das Wahrscheinlichkeiten statt Text zurückgibt, ist kein Modell, an das man Chat-Completions routet. Was wir anbieten, ist die Hälfte des Musters, die tatsächlich generiert: die Modelle, die die Bewertungsrubrik schreiben, die Kandidatenantworten entwerfen oder den Tool-Call erzeugen, den Decision-1 dann bewertet. Diese laufen hinter einem einzigen OpenAI-kompatiblen Schlüssel mit über 200 Modellen, zum Listenpreis des Anbieters, durchgereicht mit 0 % Aufschlag, sodass eine Preissenkung eines Anbieters für ein Judge-Modell am selben Tag auf unserer Seite verfügbar ist. Wenn du eine Evaluierungsschleife baust, in der ein Modell schreibt und ein anderes bewertet, geht der Bewertungsaufruf an Microsoft und der Generierungsaufruf kann überallhingehen – auch über die Routing-DSL, die mehrere Modelle zu einem einzigen Aufruf zusammenführt, wenn du ein Panel statt eines einzelnen Judges möchtest.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Warum ein Scorer eine andere Wette ist als ein besserer Chatbot

Das Muster, das Microsoft hier verkauft, existiert bereits offen zugänglich. Intern-Decision-4B von InternLM, d1-3B von Liquid AI, Laya von Convai Innovations und die Kev-Familie von Jared Palmer geben alle kalibrierte Verteilungen über vorgegebene Optionen zurück, ohne Text zu generieren, und die meisten davon sind Apache-2.0-Gewichte, die man kostenlos auf eigener Hardware ausführen kann. Microsofts Angebot unterscheidet sich in drei Punkten, die nicht benchmarkabhängig sind: Es ist eine verwaltete API mit angehängter Azure-Authentifizierung, Abrechnung und Governance, sodass es in einen Beschaffungsweg für Unternehmen passt, was ein Hugging-Face-Download nicht tut; seine Basis ist ein 9B-Modell, größer als der Großteil dieses Feldes; und es kommt mit einer Responsible-AI-Bewertung und einer dokumentierten Evaluierungsmethodik, die oft die eigentliche Zulassungsanforderung für eine regulierte Bereitstellung ist.

Was ihm jedoch fehlt, ist eine Zahl. Im Gegensatz zu offenen Wettbewerbern, die Brier Scores und den erwarteten Kalibrierungsfehler veröffentlichen – die beiden Kennzahlen, die Aufschluss darüber geben, ob eine 0,8 tatsächlich 0,8 bedeutet –, hat Microsoft eine Methodik und keine Ergebnisse veröffentlicht. Solange keine unabhängigen Kalibrierungstests existieren, ist der vertretbare Weg, Microsoft-Decision-1 zu verwenden, der Weg, den die eigene Dokumentation empfiehlt: Validieren Sie mit Daten, die für Ihren Anwendungsfall repräsentativ sind, legen Sie Schwellenwerte auf Basis der Kosten Ihrer Fehler fest, schließen Sie stets eine Option zur Enthaltung ein, randomisieren Sie die Reihenfolge der Optionen, wenn die Reihenfolge die Antwort verzerren könnte, und beziehen Sie bei allem, was Folgen hat, einen Menschen ein. Das ist guter Rat für jeden Scorer. Er ist besonders guter Rat für einen, dessen Kalibrierung niemand außerhalb des Unternehmens gemessen hat.