Eine generierte Titelkarte für den Vergleich von Decision 3.0 und Microsoft-Decision-1, mit dem Untertitel „gleiches Qwen3.5-9B-Backbone, entgegengesetzte Wege, es zu kaufen“, mit Chips mit der Aufschrift „Gewichte Apache-2.0 vs. nur gehostet“, „Bilder und Video vs. nur Text“, „veröffentlicht 10. Okt. vs. GA 8. Okt.“ und einer Fußzeile mit der Aufschrift „Die Zahlen von Decision 3.0 sind vLLM-SRs eigene; die Zahlen von Microsoft-Decision-1 sind Microsofts eigene; keine von beiden ist unabhängig reproduziert.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Engineering & Research

Decision 3.0 vs. Microsoft-Decision-1: Das eine ist ein Download, das andere eine SKU

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die 9B-Klasse von Decision 3.0 und Microsoft-Decision-1 sind auf dem Papier dasselbe Produkt. Beide trainieren nachträglich Qwen3.5-9B zu einem Scorer, der eine feste Menge von Kandidatenantworten mit jeweils einer kalibrierten Wahrscheinlichkeit beantwortet, ohne jemals ein Token zu generieren. Beide sind auf dieselben Aufgaben ausgerichtet — das Routing einer Anfrage, die Bewertung einer Ausgabe anhand eines Bewertungsrasters, die Freigabe einer Agentenaktion, die Priorisierung einer Warteschlange. Beide erschienen innerhalb einer Woche voneinander: Microsoft-Decision-1 wurde am 8. Oktober 2026 auf Microsoft Foundry allgemein verfügbar gemacht und am nächsten Tag angekündigt, und d3-flash wurde am 10. Oktober 2026 um 17:23 UTC auf Hugging Face hochgeladen.

Der Unterschied ist nicht das Modell. Es ist das, was man damit tun darf. d3-flash ist ein Apache-2.0-Checkpoint mit 8,39 Milliarden Parametern, den man herunterlädt und ausführt, und steht an dritter Stelle in einer Familie, die bei 0,59B beginnt und bei 26,09B endet. Microsoft-Decision-1 ist ein gehosteter Endpunkt auf Foundry, mit Gewichten, die überhaupt nicht verteilt werden, in einer Produktlinie, die Microsoft zufolge später auf seine eigenen MAI-Modelle umgestellt werden soll. Eines davon ist ein Artefakt; das andere ist ein Dienst. Nahezu jede praktische Frage zu dem Paar folgt aus dieser einen Tatsache, einschließlich derer, die so aussehen, als gingen sie um Benchmarks.

Zwei Entscheidungen darüber, wozu ein Entscheidungsmodell dient

Microsofts Beitrag ist in Bezug auf den Umfang so explizit, wie es Modellkarten selten sind. Die unterstützten Frageformen sind Ja/Nein, Multiple-Choice, Bewertung, Klassifizierung und rubrikbasierte Benotung. Die Ausschlüsse werden ebenso deutlich aufgeführt: nicht für Textgenerierung, Beantwortung offener Fragen, Konversation, Übersetzung oder Zusammenfassung ausgelegt und nicht für Aufgaben gedacht, die Wissen erfordern, das in der Eingabe fehlt. Es führt einen Durchlauf über bis zu 32.768 Token aus und erzeugt null Ausgabe-Token, da es keine Decodierungsschleife gibt. Microsoft unterstützt auch eine Enthaltungsoption wie „cannot tell“, wenn die bereitgestellten Belege unzureichend sind, was das Detail ist, das die Schwellenwertbildung auf der Ausgabe überhaupt sinnvoll macht.

d3-flash befindet sich im selben konzeptionellen Rahmen – Choice-, Noul- (Ja/Nein-) und Score-Fragen, ein Vorwärtsdurchlauf pro Frage, eine Wahrscheinlichkeit pro Option, keine Generierung – und erweitert dann die Eingabeseite. Während Microsoft-Decision-1 konstruktionsbedingt nur Text verarbeitet, akzeptiert d3-flash Text oder JSON, mehrere Bilder pro Anfrage mit bis zu 1,6 Megapixeln pro Bild und mehrere Videos, die mit 2 Bildern pro Sekunde gelesen werden. Jede Frage in einer Anfrage sieht jedes Bild und jedes Video, das an sie angehängt ist. Es ist ein kleineres Modell, das mehr aus der Eingabe macht, die ihm gegeben wird.

Das ist die erste echte Trennung, und es ist keine Geschmacksfrage. Wenn die Entscheidung, die Sie treffen müssen, einen Screenshot, einen Beleg, ein Diagramm oder einen Clip aus einer Kamera betrifft, kann Microsoft-Decision-1 sie nicht treffen. Das ist eine Fähigkeitsgrenze, keine Qualitätslücke, und keine noch so große Genauigkeitsarbeit schließt sie.

Was jedes Einzelne veröffentlicht, und wie

Hier erbringen die beiden Releases wirklich unterschiedliche Arten von Nachweis, und es lohnt sich, sie zu trennen, statt Zahlen aneinanderzureihen.

Microsoft hat einen 36-Benchmark-Vergleich über fast 150.000 Fragen, die vom Training ferngehalten wurden, durchgeführt, der Routing, Ranking, Long-Context, mehrsprachige und Out-of-Distribution-Aufgaben, Reasoning und Sicherheit abdeckt, und erklärt, dass sein Modell über diese Sets hinweg am besten abschnitt. Es gibt die Latenz als Verhältnis statt als Zahl an — p50 etwa 35-mal schneller als GPT-6 Sol und 2,5-mal schneller als H2O-Lightning-4B v1.1, das es als Zweitplatzierten nennt. Es dokumentiert Robustheit als Verfahren: dieselbe Anfrage auf acht Arten verändert, eine durchschnittliche Entscheidungswechselrate von 1,3 % und keine Umkehrungen, wenn Optionsbeschreibungen umformuliert oder Optionen umgekehrt oder durchmischt werden. Es testete Sicherheit an 5.250 Anfragen über 11 Benchmarks hinweg, die schädliche Inhalte, Jailbreaking und Prompt-Injection abdecken. Es nennt den Kalibrierungsstandard, an den es sich selbst hält — eine 90-%-Vorhersage sollte bei repräsentativen Fällen in etwa neun von zehn Malen richtig sein.

vLLM-SR hat einen Index veröffentlicht. Der Jev Decision Index 0.3.1 platziert d3 bei 64,7, wobei d3-flash bei Public-Suite 57,79 liegt, ein beanspruchter Zuwachs von 11,0 gegenüber dem 9B-Modell von Decision 2.0 bei 46,76. Er behauptet außerdem, dass alle 140.178 öffentlichen Anfragen beantwortet wurden, ohne dass eine nicht unterstützt wurde, was eine Abdeckungsaussage und keine Genauigkeitsaussage ist. Die Karte legt offen, dass die eigene Zeile von d3 eine interne Evaluierung ist, während die Vergleichszeilen daneben — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — Live-Board-Daten sind. Und auf der multimodalen Seite melden Modelle der d3-Familie Perception-Test-Werte für alle 19.140 Validierungsfragen, wobei d3-flash bei 73,3 liegt gegenüber einer Zufallsbasis von 33,3 bei drei Optionen.

Also: Microsoft veröffentlicht einen Breitenanspruch mit dokumentierter Methode und einer Robustheitskennzahl – aber ohne Kalibrierungskennzahl pro Checkpoint. vLLM-SR veröffentlicht eine Ranglistenposition mit einer angegebenen Provenienzlücke zwischen der eigenen Zeile und den anderen, plus einem Videoergebnis, und ebenfalls ohne Kalibrierungskennzahl. Keine der beiden Karten enthält einen Brier-Score oder eine Kennzahl für den Expected Calibration Error für das jeweils beschriebene Modell. Für zwei Produkte, deren gesamtes Wertversprechen darin besteht, dass die zurückgegebene Zahl etwas bedeutet, ist das die gemeinsame Lücke, und es ist das mit Abstand Nützlichste, was einer der beiden Anbieter als Nächstes liefern könnte.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

Distribution entscheidet mehr als das Datenblatt

Hier geht es nicht mehr nur um Modelle.

Mit d3-flash erhalten Sie Gewichte, eine decision_config.json, die die Basisrevision fixiert, ein SHA-256-Manifest pro Datei, benutzerdefinierten Modellierungscode, einen Readout-Head und einen dokumentierten Abhängigkeitssatz, der transformers==5.17.0 und ein optionales CUDA-Kernel-Paket für die Linear-Attention-Schichten enthält. Sie können es auf Ihrer eigenen Hardware ausführen, es feinabstimmen, quantisieren, in einer Air-Gap-Umgebung betreiben. Sie übernehmen außerdem die betriebliche Arbeit: Eine Python-Klasse ist kein Endpunkt, und die Modellkarte gibt kein Token-Budget für Zustand plus Fragen plus Kandidatenbeschreibungen an — max_length ist null in der ausgelieferten Konfiguration, also müssen Sie diese Obergrenze selbst entdecken.

Mit Microsoft-Decision-1 erhältst du einen Endpunkt innerhalb eines bestehenden Cloud-Kontos, mit der Authentifizierung, der regionalen Verfügbarkeit und den Bereitstellungssteuerungen, die damit einhergehen, und du bekommst nichts von der operativen Arbeit ab. Du bekommst auch keine der Kontrollmöglichkeiten. Es gibt kein Repository zum Herunterladen, keinen Fine-Tuning-Pfad und keine Self-Hosting-Option; der Lebenszyklus des Modells gehört Microsoft, nicht dir, und eine Abkündigungsmitteilung oder ein Rebase auf ein anderes Backbone ist eine Änderung, die du hinnimmst, statt einer, die du planst. Microsoft hat gesagt, dass ein Rebase auf seine eigenen MAI-Modelle kommt, was eine vernünftige Roadmap für ein Modell ist, dessen ganzer Sinn schnelles Single-Pass-Scoring ist, und außerdem bedeutet, dass der spezifische Checkpoint, den du gebenchmarkt hast, nicht unbedingt der ist, den du in einem Jahr aufrufen wirst.

Auch die Latenzgeschichte muss sorgfältig gelesen werden. Microsofts zentrale Kennzahl ist ein Verhältnis gegenüber einem deutlich größeren Allzweckmodell, was der richtige Vergleich für seine Argumentation ist – die Aufgabe eines Entscheidungsmodells besteht darin, einen teuren generativen Aufruf durch einen kostengünstigen Scoring-Aufruf zu ersetzen, und 35x gegenüber GPT-6 Sol bei p50 ist, wie diese Argumentation aussieht, wenn sie verfängt. Die Zahlen von vLLM-SR sind absolute Werte für einzelne Anfragen auf einer einzelnen GPU, und sie zeigen die Modalitätssteuer deutlich: Auf einer AMD Instinct MI325X dauert eine Textanfrage an d3-flash im Median 19,1 ms, dieselbe Anfrage mit einem Bild dauert 149,4 ms und mit einem zehnsekündigen Video 407,6 ms. Beide Datensätze sind Herstellerangaben, beruhen auf unterschiedlicher Hardware, und keiner von beiden wurde außerhalb des Labors reproduziert, das ihn erzeugt hat.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Wie man wählt

Die Entscheidungsregel ist kurz, was ein gutes Zeichen dafür ist, dass die beiden Produkte nicht wirklich um denselben Platz konkurrieren.

Wählen Sie Microsoft-Decision-1, wenn die Entscheidung rein textbasiert ist, wenn Sie bereits auf Foundry laufen und wenn der eigentliche Punkt ist, dass es sich um einen Aufruf und nicht um ein Deployment handelt — keine GPU zu kaufen, keinen Container zu betreiben, keinen Modell-Lebenszyklus zu verantworten. Microsofts Begleitmaterial ist für ein Plattformteam zudem das besser nutzbare der beiden: die Perturbationen, die Anzahl der Sicherheitstests und die Aussage, dass eine Enthaltungsoption unterstützt wird, sind genau die Dinge, die man braucht, um eine Schwellenwertrichtlinie zu schreiben, und die Obergrenze von 32.768 Token wird genannt, statt leer zu bleiben.

Nehmen Sie Decision 3.0 – realistischerweise d3-flash oder d3-mini –, wenn irgendein Teil der Entscheidung von einem Bild oder einem Clip abhängt, wenn Sie es an einem Ort ausführen müssen, den eine gehostete API nicht erreichen kann, oder wenn Sie den Scorer anhand Ihrer eigenen gelabelten Fälle feinabstimmen möchten. Die Apache-2.0-Lizenz und das Hash-Manifest auf Dateiebene machen das zu einer echten Option statt zu einer bloß theoretischen. Was Sie im Gegenzug akzeptieren, sind ein nicht angegebenes Eingabebudget, keine veröffentlichte Kalibrierung und die Tatsache, dass die Modellfamilie erst wenige Tage alt ist und praktisch keine externe Nutzung hinter sich hat.

Wenn Sie beides brauchen — einen gehosteten Scorer für den Routine-Textpfad und einen selbst gehosteten für die multimodalen oder Air-Gapped-Fälle, aufgerufen über dieselbe Schnittstelle —, dann ist die ehrliche Position, dass Ihnen das derzeit kein Anbieter bietet, und die beiden Anfrageformate sind ähnlich genug, um sie zu vereinheitlichen, aber nicht identisch.

Wo OrcaRouter steht – und wo nicht

typesafe/jev-1.13 ist das Entscheidungsmodell in unserem Katalog, bereitgestellt über POST /v1/systemone mit demselben Vertrag aus Zustand und benannten Fragen, den beide oben genannten Modelle implementieren: Text rein, strukturiertes JSON raus, bis zu etwa 64K Eingabe-Token, nicht streamend, 0,042 $ pro Million Eingabe-Token ohne Completion-Gebühr, da es nie eine erzeugt. Bemerkenswert: Die Frage nach dem Token-Budget im Android-Stil, die keine der beiden obigen Karten vollständig beantwortet, wird hier beantwortet.

Wir führen keines der beiden Modelle in diesem Vergleich. Die Checkpoints von Decision 3.0 werden als lokaler Inferenzpfad in einem Hugging-Face-Repository bereitgestellt und nicht als routingfähiger Endpunkt, und Microsoft-Decision-1 wird über Microsofts eigene Plattform und mehrere Drittplattformen vertrieben – nicht über uns. Nichts hiervon sollte als Verfügbarkeitsaussage für eines der beiden verstanden werden.

Was die Routing-Schicht in dieser Entscheidung tatsächlich wert ist, liegt auf der anderen Hälfte der Schleife. Ein Scorer ist konstruktionsbedingt günstig; das Modell, das auf seine Ausgabe reagiert, ist es nicht, und ein Entscheidungsmodell mit einem generativen zu kombinieren bedeutet normalerweise zwei Integrationen, zwei Abrechnungsbeziehungen und zwei Fehlerquellen. Beide über einen Schlüssel über mehr als 200 Modelle hinweg aufzurufen — mit automatischem Failover, wenn ein Anbieter wackelt, und den Listenpreisen der Anbieter, die mit 0 % Aufschlag weitergegeben werden, sodass eine Preisänderung eines Anbieters noch am selben Tag wirksam wird — bedeutet, dass Sie den Scorer austauschen können, ohne die Aufrufstelle anzufassen. Das ist hier wichtiger als sonst, denn beide dieser Modelle sind früh genug, dass die Entscheidung, die Sie diese Woche treffen, eine sein sollte, die Sie nächsten Monat rückgängig machen können.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

Die Frage, die das in sechs Monaten entscheidet

Zwei Teams haben denselben Basis-Checkpoint in derselben Woche zu derselben Produktform nachtrainiert und zogen daraus gegensätzliche Schlüsse darüber, wie es einen Kunden erreichen sollte. Das ist weniger ein zeitlicher Zufall als vielmehr eine Weggabelung darin, wie die Kategorie verkauft wird: als Gewichte oder als Dienst, als etwas, das man besitzt, oder als etwas, das man aufruft.

Achten Sie auf drei Signale. Ob Microsofts Umstellung auf MAI oder auf seine eigenen Modelle das Genauigkeits- und Latenzverhalten verändert, das es derzeit verkauft – und wie viel Vorlaufzeit Kunden erhalten. Ob vLLM-SR ein Eingabebudget und einen Kalibrierungswert für Decision 3.0 veröffentlicht und damit die Lücke schließt, die verhindert, dass sein Index umsetzbar ist. Und ob jemand außerhalb der beiden Labore die öffentliche Suite auf den veröffentlichten d3-Gewichten laufen lässt, denn im Moment ist die einzige Zahl, die diesen Vergleich entscheiden würde, eine, die keiner der beiden Anbieter vorgelegt hat.