
Decision 3.0 vs. Microsoft-Decision-1: Das eine ist ein Download, das andere eine SKU
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 71 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Die 9B-Klasse von Decision 3.0 und Microsoft-Decision-1 sind auf dem Papier dasselbe Produkt. Beide trainieren nachträglich Qwen3.5-9B zu einem Scorer, der eine feste Menge von Kandidatenantworten mit jeweils einer kalibrierten Wahrscheinlichkeit beantwortet, ohne jemals ein Token zu generieren. Beide sind auf dieselben Aufgaben ausgerichtet — das Routing einer Anfrage, die Bewertung einer Ausgabe anhand eines Bewertungsrasters, die Freigabe einer Agentenaktion, die Priorisierung einer Warteschlange. Beide erschienen innerhalb einer Woche voneinander: Microsoft-Decision-1 wurde am 8. Oktober 2026 auf Microsoft Foundry allgemein verfügbar gemacht und am nächsten Tag angekündigt, und d3-flash wurde am 10. Oktober 2026 um 17:23 UTC auf Hugging Face hochgeladen.
Der Unterschied ist nicht das Modell. Es ist das, was man damit tun darf. d3-flash ist ein Apache-2.0-Checkpoint mit 8,39 Milliarden Parametern, den man herunterlädt und ausführt, und steht an dritter Stelle in einer Familie, die bei 0,59B beginnt und bei 26,09B endet. Microsoft-Decision-1 ist ein gehosteter Endpunkt auf Foundry, mit Gewichten, die überhaupt nicht verteilt werden, in einer Produktlinie, die Microsoft zufolge später auf seine eigenen MAI-Modelle umgestellt werden soll. Eines davon ist ein Artefakt; das andere ist ein Dienst. Nahezu jede praktische Frage zu dem Paar folgt aus dieser einen Tatsache, einschließlich derer, die so aussehen, als gingen sie um Benchmarks.
Zwei Entscheidungen darüber, wozu ein Entscheidungsmodell dient
Microsofts Beitrag ist in Bezug auf den Umfang so explizit, wie es Modellkarten selten sind. Die unterstützten Frageformen sind Ja/Nein, Multiple-Choice, Bewertung, Klassifizierung und rubrikbasierte Benotung. Die Ausschlüsse werden ebenso deutlich aufgeführt: nicht für Textgenerierung, Beantwortung offener Fragen, Konversation, Übersetzung oder Zusammenfassung ausgelegt und nicht für Aufgaben gedacht, die Wissen erfordern, das in der Eingabe fehlt. Es führt einen Durchlauf über bis zu 32.768 Token aus und erzeugt null Ausgabe-Token, da es keine Decodierungsschleife gibt. Microsoft unterstützt auch eine Enthaltungsoption wie „cannot tell“, wenn die bereitgestellten Belege unzureichend sind, was das Detail ist, das die Schwellenwertbildung auf der Ausgabe überhaupt sinnvoll macht.
d3-flash befindet sich im selben konzeptionellen Rahmen – Choice-, Noul- (Ja/Nein-) und Score-Fragen, ein Vorwärtsdurchlauf pro Frage, eine Wahrscheinlichkeit pro Option, keine Generierung – und erweitert dann die Eingabeseite. Während Microsoft-Decision-1 konstruktionsbedingt nur Text verarbeitet, akzeptiert d3-flash Text oder JSON, mehrere Bilder pro Anfrage mit bis zu 1,6 Megapixeln pro Bild und mehrere Videos, die mit 2 Bildern pro Sekunde gelesen werden. Jede Frage in einer Anfrage sieht jedes Bild und jedes Video, das an sie angehängt ist. Es ist ein kleineres Modell, das mehr aus der Eingabe macht, die ihm gegeben wird.
Das ist die erste echte Trennung, und es ist keine Geschmacksfrage. Wenn die Entscheidung, die Sie treffen müssen, einen Screenshot, einen Beleg, ein Diagramm oder einen Clip aus einer Kamera betrifft, kann Microsoft-Decision-1 sie nicht treffen. Das ist eine Fähigkeitsgrenze, keine Qualitätslücke, und keine noch so große Genauigkeitsarbeit schließt sie.
Was jedes Einzelne veröffentlicht, und wie
Hier erbringen die beiden Releases wirklich unterschiedliche Arten von Nachweis, und es lohnt sich, sie zu trennen, statt Zahlen aneinanderzureihen.
Microsoft hat einen 36-Benchmark-Vergleich über fast 150.000 Fragen, die vom Training ferngehalten wurden, durchgeführt, der Routing, Ranking, Long-Context, mehrsprachige und Out-of-Distribution-Aufgaben, Reasoning und Sicherheit abdeckt, und erklärt, dass sein Modell über diese Sets hinweg am besten abschnitt. Es gibt die Latenz als Verhältnis statt als Zahl an — p50 etwa 35-mal schneller als GPT-6 Sol und 2,5-mal schneller als H2O-Lightning-4B v1.1, das es als Zweitplatzierten nennt. Es dokumentiert Robustheit als Verfahren: dieselbe Anfrage auf acht Arten verändert, eine durchschnittliche Entscheidungswechselrate von 1,3 % und keine Umkehrungen, wenn Optionsbeschreibungen umformuliert oder Optionen umgekehrt oder durchmischt werden. Es testete Sicherheit an 5.250 Anfragen über 11 Benchmarks hinweg, die schädliche Inhalte, Jailbreaking und Prompt-Injection abdecken. Es nennt den Kalibrierungsstandard, an den es sich selbst hält — eine 90-%-Vorhersage sollte bei repräsentativen Fällen in etwa neun von zehn Malen richtig sein.
vLLM-SR hat einen Index veröffentlicht. Der Jev Decision Index 0.3.1 platziert d3 bei 64,7, wobei d3-flash bei Public-Suite 57,79 liegt, ein beanspruchter Zuwachs von 11,0 gegenüber dem 9B-Modell von Decision 2.0 bei 46,76. Er behauptet außerdem, dass alle 140.178 öffentlichen Anfragen beantwortet wurden, ohne dass eine nicht unterstützt wurde, was eine Abdeckungsaussage und keine Genauigkeitsaussage ist. Die Karte legt offen, dass die eigene Zeile von d3 eine interne Evaluierung ist, während die Vergleichszeilen daneben — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — Live-Board-Daten sind. Und auf der multimodalen Seite melden Modelle der d3-Familie Perception-Test-Werte für alle 19.140 Validierungsfragen, wobei d3-flash bei 73,3 liegt gegenüber einer Zufallsbasis von 33,3 bei drei Optionen.
Also: Microsoft veröffentlicht einen Breitenanspruch mit dokumentierter Methode und einer Robustheitskennzahl – aber ohne Kalibrierungskennzahl pro Checkpoint. vLLM-SR veröffentlicht eine Ranglistenposition mit einer angegebenen Provenienzlücke zwischen der eigenen Zeile und den anderen, plus einem Videoergebnis, und ebenfalls ohne Kalibrierungskennzahl. Keine der beiden Karten enthält einen Brier-Score oder eine Kennzahl für den Expected Calibration Error für das jeweils beschriebene Modell. Für zwei Produkte, deren gesamtes Wertversprechen darin besteht, dass die zurückgegebene Zahl etwas bedeutet, ist das die gemeinsame Lücke, und es ist das mit Abstand Nützlichste, was einer der beiden Anbieter als Nächstes liefern könnte.

Distribution entscheidet mehr als das Datenblatt
Hier geht es nicht mehr nur um Modelle.
Mit d3-flash erhalten Sie Gewichte, eine decision_config.json, die die Basisrevision fixiert, ein SHA-256-Manifest pro Datei, benutzerdefinierten Modellierungscode, einen Readout-Head und einen dokumentierten Abhängigkeitssatz, der transformers==5.17.0 und ein optionales CUDA-Kernel-Paket für die Linear-Attention-Schichten enthält. Sie können es auf Ihrer eigenen Hardware ausführen, es feinabstimmen, quantisieren, in einer Air-Gap-Umgebung betreiben. Sie übernehmen außerdem die betriebliche Arbeit: Eine Python-Klasse ist kein Endpunkt, und die Modellkarte gibt kein Token-Budget für Zustand plus Fragen plus Kandidatenbeschreibungen an — max_length ist null in der ausgelieferten Konfiguration, also müssen Sie diese Obergrenze selbst entdecken.
Mit Microsoft-Decision-1 erhältst du einen Endpunkt innerhalb eines bestehenden Cloud-Kontos, mit der Authentifizierung, der regionalen Verfügbarkeit und den Bereitstellungssteuerungen, die damit einhergehen, und du bekommst nichts von der operativen Arbeit ab. Du bekommst auch keine der Kontrollmöglichkeiten. Es gibt kein Repository zum Herunterladen, keinen Fine-Tuning-Pfad und keine Self-Hosting-Option; der Lebenszyklus des Modells gehört Microsoft, nicht dir, und eine Abkündigungsmitteilung oder ein Rebase auf ein anderes Backbone ist eine Änderung, die du hinnimmst, statt einer, die du planst. Microsoft hat gesagt, dass ein Rebase auf seine eigenen MAI-Modelle kommt, was eine vernünftige Roadmap für ein Modell ist, dessen ganzer Sinn schnelles Single-Pass-Scoring ist, und außerdem bedeutet, dass der spezifische Checkpoint, den du gebenchmarkt hast, nicht unbedingt der ist, den du in einem Jahr aufrufen wirst.
Auch die Latenzgeschichte muss sorgfältig gelesen werden. Microsofts zentrale Kennzahl ist ein Verhältnis gegenüber einem deutlich größeren Allzweckmodell, was der richtige Vergleich für seine Argumentation ist – die Aufgabe eines Entscheidungsmodells besteht darin, einen teuren generativen Aufruf durch einen kostengünstigen Scoring-Aufruf zu ersetzen, und 35x gegenüber GPT-6 Sol bei p50 ist, wie diese Argumentation aussieht, wenn sie verfängt. Die Zahlen von vLLM-SR sind absolute Werte für einzelne Anfragen auf einer einzelnen GPU, und sie zeigen die Modalitätssteuer deutlich: Auf einer AMD Instinct MI325X dauert eine Textanfrage an d3-flash im Median 19,1 ms, dieselbe Anfrage mit einem Bild dauert 149,4 ms und mit einem zehnsekündigen Video 407,6 ms. Beide Datensätze sind Herstellerangaben, beruhen auf unterschiedlicher Hardware, und keiner von beiden wurde außerhalb des Labors reproduziert, das ihn erzeugt hat.

Wie man wählt
Die Entscheidungsregel ist kurz, was ein gutes Zeichen dafür ist, dass die beiden Produkte nicht wirklich um denselben Platz konkurrieren.
Wählen Sie Microsoft-Decision-1, wenn die Entscheidung rein textbasiert ist, wenn Sie bereits auf Foundry laufen und wenn der eigentliche Punkt ist, dass es sich um einen Aufruf und nicht um ein Deployment handelt — keine GPU zu kaufen, keinen Container zu betreiben, keinen Modell-Lebenszyklus zu verantworten. Microsofts Begleitmaterial ist für ein Plattformteam zudem das besser nutzbare der beiden: die Perturbationen, die Anzahl der Sicherheitstests und die Aussage, dass eine Enthaltungsoption unterstützt wird, sind genau die Dinge, die man braucht, um eine Schwellenwertrichtlinie zu schreiben, und die Obergrenze von 32.768 Token wird genannt, statt leer zu bleiben.
Nehmen Sie Decision 3.0 – realistischerweise d3-flash oder d3-mini –, wenn irgendein Teil der Entscheidung von einem Bild oder einem Clip abhängt, wenn Sie es an einem Ort ausführen müssen, den eine gehostete API nicht erreichen kann, oder wenn Sie den Scorer anhand Ihrer eigenen gelabelten Fälle feinabstimmen möchten. Die Apache-2.0-Lizenz und das Hash-Manifest auf Dateiebene machen das zu einer echten Option statt zu einer bloß theoretischen. Was Sie im Gegenzug akzeptieren, sind ein nicht angegebenes Eingabebudget, keine veröffentlichte Kalibrierung und die Tatsache, dass die Modellfamilie erst wenige Tage alt ist und praktisch keine externe Nutzung hinter sich hat.
Wenn Sie beides brauchen — einen gehosteten Scorer für den Routine-Textpfad und einen selbst gehosteten für die multimodalen oder Air-Gapped-Fälle, aufgerufen über dieselbe Schnittstelle —, dann ist die ehrliche Position, dass Ihnen das derzeit kein Anbieter bietet, und die beiden Anfrageformate sind ähnlich genug, um sie zu vereinheitlichen, aber nicht identisch.
Wo OrcaRouter steht – und wo nicht
typesafe/jev-1.13 ist das Entscheidungsmodell in unserem Katalog, bereitgestellt über POST /v1/systemone mit demselben Vertrag aus Zustand und benannten Fragen, den beide oben genannten Modelle implementieren: Text rein, strukturiertes JSON raus, bis zu etwa 64K Eingabe-Token, nicht streamend, 0,042 $ pro Million Eingabe-Token ohne Completion-Gebühr, da es nie eine erzeugt. Bemerkenswert: Die Frage nach dem Token-Budget im Android-Stil, die keine der beiden obigen Karten vollständig beantwortet, wird hier beantwortet.
Wir führen keines der beiden Modelle in diesem Vergleich. Die Checkpoints von Decision 3.0 werden als lokaler Inferenzpfad in einem Hugging-Face-Repository bereitgestellt und nicht als routingfähiger Endpunkt, und Microsoft-Decision-1 wird über Microsofts eigene Plattform und mehrere Drittplattformen vertrieben – nicht über uns. Nichts hiervon sollte als Verfügbarkeitsaussage für eines der beiden verstanden werden.
Was die Routing-Schicht in dieser Entscheidung tatsächlich wert ist, liegt auf der anderen Hälfte der Schleife. Ein Scorer ist konstruktionsbedingt günstig; das Modell, das auf seine Ausgabe reagiert, ist es nicht, und ein Entscheidungsmodell mit einem generativen zu kombinieren bedeutet normalerweise zwei Integrationen, zwei Abrechnungsbeziehungen und zwei Fehlerquellen. Beide über einen Schlüssel über mehr als 200 Modelle hinweg aufzurufen — mit automatischem Failover, wenn ein Anbieter wackelt, und den Listenpreisen der Anbieter, die mit 0 % Aufschlag weitergegeben werden, sodass eine Preisänderung eines Anbieters noch am selben Tag wirksam wird — bedeutet, dass Sie den Scorer austauschen können, ohne die Aufrufstelle anzufassen. Das ist hier wichtiger als sonst, denn beide dieser Modelle sind früh genug, dass die Entscheidung, die Sie diese Woche treffen, eine sein sollte, die Sie nächsten Monat rückgängig machen können.

Die Frage, die das in sechs Monaten entscheidet
Zwei Teams haben denselben Basis-Checkpoint in derselben Woche zu derselben Produktform nachtrainiert und zogen daraus gegensätzliche Schlüsse darüber, wie es einen Kunden erreichen sollte. Das ist weniger ein zeitlicher Zufall als vielmehr eine Weggabelung darin, wie die Kategorie verkauft wird: als Gewichte oder als Dienst, als etwas, das man besitzt, oder als etwas, das man aufruft.
Achten Sie auf drei Signale. Ob Microsofts Umstellung auf MAI oder auf seine eigenen Modelle das Genauigkeits- und Latenzverhalten verändert, das es derzeit verkauft – und wie viel Vorlaufzeit Kunden erhalten. Ob vLLM-SR ein Eingabebudget und einen Kalibrierungswert für Decision 3.0 veröffentlicht und damit die Lücke schließt, die verhindert, dass sein Index umsetzbar ist. Und ob jemand außerhalb der beiden Labore die öffentliche Suite auf den veröffentlichten d3-Gewichten laufen lässt, denn im Moment ist die einzige Zahl, die diesen Vergleich entscheiden würde, eine, die keiner der beiden Anbieter vorgelegt hat.
