Eine generierte Titelkarte für Microsoft-Decision-1 vs. Liquid AI d1-3B mit dem Untertitel „die einzigen beiden Entscheidungsmodelle, die sich beim Kontextfenster einig sind“, mit Chips, die bei beiden 32.768 Token anzeigen, Nur-Text vs. Text, Bilder und Audio, 25 Sprachen vs. 16, gehostete API vs. lfm1.0-Gewichte, und einer Fußzeile, die darauf hinweist, dass die Angaben beider Anbieter selbst gemeldet und nicht verifiziert sind.
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B: Dasselbe 32K-Fenster, zwei unterschiedliche Bedeutungen

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ausnahmsweise passt die Spezifikation.Microsoft-Decision-1, seit dem 8. Oktober 2026 auf Microsoft Foundry allgemein verfügbar, umfasst 32.768 Token Kontext. Dasselbe gilt für Liquid AI d1-3B, am 5. Oktober 2026 auf Hugging Face hochgeladen und zwei Tage später von Liquid AI angekündigt. Beide akzeptieren einen Zustand plus eine Reihe typisierter Fragen – Ja/Nein, Auswahl unter benannten Optionen, eine Position auf einer geordneten Skala – und beide antworten in einem einzigen Vorwärtsdurchlauf mit einer Wahrscheinlichkeitsverteilung statt generiertem Text; Laya, Intern-Decision-4B, Kev und der Rest dieser Nische sind sich uneinig über die Kontextlänge, daher ist dies die einzige Paarung, bei der diese Dimension herausfällt und der Vergleich anhand von etwas anderem geführt werden muss.

Das Andere entpuppt sich als der Eingangskanal. Microsofts Modell ist reiner Text; ausdrücklich heißt es, es „akzeptiert oder erzeugt keine Bild-, Audio- oder Videoinhalte“. Liquid AIs Modell verfügt über einen 400-Millionen-Parameter-Vision-Encoder SigLIP2 NaFlex auf einem 2,6-Milliarden-Parameter-Sprach-Backbone und erreicht insgesamt 3,12 Milliarden Parameter, und es wurde genau für das gebaut, was Microsoft ausgeschlossen hat – einen Screenshot, ein gescanntes Formular oder ein Kamerabild gegen eine Frage zu bewerten. Diese Aufteilung, zusammen mit einem Lizenzunterschied, der nichts mit der Leistungsfähigkeit zu tun hat, macht das ganze Duell aus.

Wo die beiden übereinstimmen, was mehr ist, als man erwarten würde.

• Kontextfenster — 32.768 Token für Microsoft-Decision-1 und 32.768 Token für Liquid AI d1-3B.

• Ausgabeform — kalibrierte Wahrscheinlichkeiten für die bereitgestellten Optionen; keines von beiden erzeugt Text, und der Nutzungszähler von Liquid AI meldet dies als output_tokens: 0.

• Fragetypen — sowohl Dokumentauswahl, geordnete Bewertung als auch binäres Ja/Nein, und beide lassen Sie die Optionsmenge pro Anfrage definieren, statt einen Vokabular-Head neu zu trainieren.

• Enthaltung — Microsoft dokumentiert explizite Enthaltungsoptionen wie „cannot tell"; das Decision-Index-Schema von Liquid AI unterstützt dasselbe über sein Optionsset.

• Single-Pass-Inferenz — ein Aufruf pro Entscheidung auf beiden Seiten, was beide erst bei Pipeline-Volumen tragfähig macht.

Dass zwei Modelle bei den beiden härtesten Constraints in dieser Nische übereinstimmen, ist einen Moment des Innehaltens wert. Ein 32K-Fenster ist das, was einen Decision-Scorer auf einem vollständigen Vertrag, einer mehrseitigen Richtlinie oder einem langen Support-Thread nutzbar macht; der englische Laya-Checkpoint mit 512 Token und die Fragenlimits pro Aufruf bei Intern-Decision-4B tun das nicht. Wenn deine Eingabe kurz ist, ist der größte Teil dieses Felds austauschbar, und die Entscheidung dreht sich ums Hosting. Wenn deine Eingabe lang ist, verengt sich das Feld auf diese beiden.

Das Gefühl, das nur einer von ihnen hat

Liquid AI d1-3B ist multimodal, und der Modellbaum macht die Abstammungslinie deutlich: LFM2.5-2.6B-Base, dann LFM2.5-VL-3B, dann d1-3B, nachtrainiert für kalibrierte Entscheidungen im Einzeldurchlauf. Bilder gelangen über den SigLIP2-NaFlex-Encoder hinein, und die Modellkarte meldet einen Mittelwert von 74,1 über elf öffentliche Bild-Benchmarks gegenüber 73,9 für das Basis-Visionsmodell – das Entscheidungs-Tuning hat es also nicht an Bildqualität gekostet. Sie meldet auch das umgekehrte Experiment: Nimmt man die Bilder heraus, fallen dieselben Fragen auf 45,1 – der sauberste Beleg, den man dafür bekommen kann, dass der Wahrnehmungskanal tragend und nicht dekorativ ist.

Microsoft-Decision-1 hat keine Entsprechung, und das Weglassen ist beabsichtigt und nicht etwa unvollständig. In der Karte von Microsoft werden die nicht abgedeckten Verwendungszwecke als Textgenerierung, offene Fragebeantwortung, Konversation, Übersetzung und Zusammenfassung aufgeführt, und es wird separat angegeben, dass das Modell nur Text verarbeitet. Für eine Pipeline, die einen Screenshot eines Formulars anhand einer Rubrik bewerten oder entscheiden muss, ob ein Kamerabild ein Sicherheitsereignis enthält, ist das eine harte Grenze – durch Prompt-Engineering lässt sich keine Modalität wiederherstellen, die das Modell nie erhalten hat.

Die Sprachzahlen verhalten sich umgekehrt, und dies ist die zweite echte Kluft. Microsoft-Decision-1 listet 25 unterstützte Sprachen auf, und das Unternehmen gibt offen zu, dass Abdeckung, Qualität und Kalibrierung „je nach Sprache variieren können“, wobei es Nicht-Englisch und insbesondere ressourcenschwache Sprachen als Bereich der Minderleistung nennt. Liquid AI d1-3B gibt 16 Sprachen an. Was die Breite angeht, liegt Microsoft auf dem Papier vorn; was die Ehrlichkeit darüber betrifft, was Breite bedeutet, sagen beide Anbieter etwas Ähnliches, und keiner hat eine Kalibrierung pro Sprache veröffentlicht.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

Der Benchmark-Tab, schon wieder

Die Foundry-Seite von Microsoft-Decision-1 enthält einen Tab „Benchmarks“ mit einem Methodikabschnitt und ohne Zahlen: öffentliche und Community-Entscheidungs-Benchmarks plus zurückgehaltene interne Datensätze, Metriken zu Genauigkeit und Kalibrierungsfehler, variierte Optionsreihenfolge, gepaarte statistische Tests und die Behauptung, dass das Modell „auf Augenhöhe mit führenden Entscheidungsmodellen abschneidet und vor anderen offenen Entscheidungsmodellen liegt, die mit derselben Methodik bewertet wurden“. Nichts zu prüfen, nichts zu reproduzieren.

Liquid AI d1-3B veröffentlicht 48,57 auf dem Decision Index 0.2.1 — und die Einschränkung ist wichtiger als die Zahl, denn Decision Index ist der eigene Index von Liquid AI und d1-3B ist das eigene Modell von Liquid AI. Es ist ein vom Anbieter bewertetes Ergebnis auf einem vom Anbieter erstellten Benchmark, vom Unternehmen positioniert als bestes unter Entscheidungsmodellen unter 10B und vor einem 35B-Modell auf derselben Skala. Betrachten Sie 48,57 als richtungsweisende Aussage, nicht als geprüften Wert. Daneben führt die Modellkarte interne Evaluierungen zum Entscheidungsformat auf: einen Mittelwert von 77,1, SQuAD 2.0 mit 85,3, PAWS-X mit 76,9 und DecisionBench mit 71,8 — alle selbst angegeben, und die Formulierung „unter 10B“ ist eine echte Einschränkung und kein Ausweichmanöver, da das Modell 3,12B groß ist.

Die Frage der Kalibrierung löst sich also genauso, wie sie sich in diesem gesamten Feld löst: Liquid AI liefert Ihnen eine Zahl, die auf seiner eigenen Skala erzeugt wurde, Microsoft liefert Ihnen eine Methodik und keine Zahl, und keiner von beiden liefert Ihnen eine unabhängige Messung durch Dritte. Die einzige Kalibrierungszahl, die für Ihre Bereitstellung relevant sein wird, ist die, die Sie auf Ihren eigenen gelabelten Daten berechnen.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Bereitstellung, Lizenzen und was Sie tatsächlich kaufen

Die Latenz von d1-3B ist veröffentlicht, und sie ist der Grund, warum das Modell existiert. Acht Millisekunden pro Entscheidung auf einer RTX 4090, neun auf einer AMD MI325X, mit gepacktem Durchsatz von 475 und 1.106 pro Sekunde bei 64 Zuständen. Auf Edge-Hardware: 30 ms auf einem Apple M5 Pro, 16 ms auf einem Jetson AGX Thor, 26 ms auf einem Jetson AGX Orin 64 GB, 50 ms auf einem Orin Nano. Microsoft-Decision-1 veröffentlicht überhaupt keine Latenzangabe, und seine von vornherein vorgesehenen Optionen – eine gehostete Foundry-API mit Pay-as-you-go- oder reserviertem bereitgestelltem Durchsatz, wobei Batch-Inferenz deaktiviert ist – bedeuten, dass man sie über die eigene Bereitstellung messen muss. Das ist keine kleine Lücke für ein Modell, dessen gesamter Zweck darin besteht, einmal pro abgerufenem Dokument oder vorgeschlagener Aktion aufgerufen zu werden.

Die Lizenz ist der Punkt, an dem die beiden auf eine Weise voneinander abweichen, die Leute überrascht. Liquid AI d1-3B trägt die Kennzeichnung lfm1.0, nicht als Apache 2.0 — dieselbe Familienlizenz wie der Rest von Liquids LFM-Reihe, die Nutzungsbedingungen mit sich bringt, die eine permissive Lizenz nicht hat. Wenn Ihre Rechtsprüfung das als OpenAI-kompatibel-ohne-Fesseln liest, dann ist es das nicht, und es lohnt sich, das vor dem Ausliefern des Modells zu lesen statt danach. Microsoft-Decision-1 hat überhaupt keine Gewichte: Es ist ein gehosteter Endpunkt im Portfolio „Direct from Azure“, mit Azure-Authentifizierung, einheitlicher Abrechnung, keinem Download und der Lizenzfrage, die durch eine Dienstvereinbarung ersetzt wird. Keines der beiden Modelle kann über die von den Anbietern dokumentierten Wege feinabgestimmt werden, was die schärfste Einschränkung für ein Entscheidungsmodell ist — ein Scorer, den man nicht an die eigenen Labels anpassen kann, ist ein Scorer, dessen Fehlermodi man nicht beheben, sondern nur umgehen kann.

Das Routing um sie herum ist der Punkt, an dem OrcaRouter in diesem Muster hingehört, und zwar nur auf einer Seite davon. Wir hosten weder Microsoft-Decision-1 noch Liquid AI d1-3B: Keines gibt Text zurück, keines ist in unserem Katalog, und ein Endpunkt zur Wahrscheinlichkeitsbewertung ist kein Ziel für Chat-Completions. Was wir bereitstellen, ist die generierende Hälfte der Schleife – das Modell, das die Antwort entwirft, die Ihr Scorer bewertet, die Felder extrahiert, die Ihr Scorer beurteilt, oder die Aktion vorschlägt, die Ihr Scorer genehmigt. Das sind mehr als 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel zum Listenpreis des Anbieters, durchgereicht mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters am selben Tag auf unserer Seite live ist und automatisches Failover den Generierungsaufruf in einer Schleife abdeckt, die keine Latenzreserve hat, um ihn erneut zu versuchen.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Zwei klare Tipps und einer, der nicht knapp ist

Nehmen Sie Liquid AI d1-3B, wenn irgendetwas in Ihrer Pipeline ein Bild ist. Screenshot-Triage, Formularextraktion, Routing für visuelle QA, ein Moderator, der Kameraframes bewertet — Microsoft-Decision-1 lässt sich nicht dazu bringen, dies zu tun, und d1-3B wurde genau dafür entwickelt, mit veröffentlichten Vision-Benchmarks, die diese Behauptung stützen. Nehmen Sie es auch, wenn Sie Edge-Inferenz im zweistelligen Millisekundenbereich auf einem Jetson oder einem Laptop benötigen, wenn Sie das Modell auf Ihrer eigenen Hardware möchten oder wenn eine Lizenz, die Sie lesen können, für Ihren Rechtsbeistand ausreicht.

Wählen Sie Microsoft-Decision-1, wenn Ihre Eingabe Text ist, Ihre Dokumente lang sind, Ihr Gate die Beschaffung ist — Azure-Authentifizierung, einheitliche Abrechnung, eine Bewertung verantwortungsvoller KI, ein Anbieter, an den Sie eskalieren können — oder Ihr Datenverkehr mehr als die 16 Sprachen umfasst, die d1-3B auflistet. Akzeptieren Sie, dass die fehlende Latenzangabe und die fehlende Benchmark-Tabelle bedeuten, dass Ihre ersten zwei Wochen damit Messung, nicht Integration sind.

Der eine Fall, der nicht knapp ist, ist multimodale Arbeit: Dort wurde die Entscheidung getroffen, als Microsoft „text-only“ in die Modellkarte schrieb.