Eine generierte Titelkarte für Microsoft-Decision-1 vs Liquid AI d1-omni-600M mit dem Untertitel ‚die breiteste Sensoroberfläche der Kategorie gegen die schmalste Eingabeliste‘, mit Chips, die 587 Mio. Parameter mit Vision und Audio, eine reine Text-Foundry-API, 30 Sekunden Sprache gegen 32.768 Text-Token, einen bidirektionalen Encoder gegen einen nachtrainierten Decoder und keine veröffentlichte Kalibrierung auf beiden Seiten anzeigen.
Engineering & Research

Microsoft-Decision-1 vs. Liquid AI d1-omni-600M: Ein Scorer, der zuhört, gegen einen Scorer, der nur liest

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Sie leiten Schadensfälle an einem Versicherungsschalter weiter, und die Akte trifft als drei Dinge ein: ein PDF, ein Foto einer eingebeulten Tür und ein 90-sekündiger Telefonanruf. Liquid AI d1-omni-600M kann das Dokument lesen, das Foto ansehen und den Anruf anhören und dann eine Reihe von Fragen beantworten, die Sie im Voraus geschrieben haben – ist das abgedeckt, welche Kategorie, wie schwer, auf einer Skala von zwei bis zehn – in einem Durchgang, ohne generierten Text und ohne etwas parsen zu müssen. Microsoft-Decision-1 kann das Dokument lesen. Es wurde auf Microsoft Foundry am 8. Oktober 2026 als ein gehosteter, rein textbasierter Scorer allgemein verfügbar gemacht, nachtrainiert auf Qwen3.5-9B mit einem 32.768-Token-Fenster, und seine Eingabeoberfläche endet dort: kein Bild, kein Audio, kein Video. Beide geben kalibrierte Wahrscheinlichkeiten über von Ihnen vorgegebene Optionen zurück, beide erzeugen null Ausgabe-Token, und keines von beiden hat eine Kalibrierungszahl veröffentlicht.

Dieser letzte gemeinsame Satz ist der unangenehme Teil dieses Vergleichs. Die beiden sind die Entscheidungsmodelle mit dem breitesten und die mit dem schmalsten Sensor, die diesen Monat ausgeliefert werden, und trotz aller architektonischen Distanz zwischen ihnen sind sie in genau derselben Beweislage gelandet: echte Gewichte oder ein echter Endpunkt, dokumentierte Verträge – und keine Zahl, auf die irgendjemand außerhalb zeigen kann, wenn jemand fragt, ob die Wahrscheinlichkeiten vertrauenswürdig sind.

Zwei Abstammungen, nicht zwei Größen

Die Zahl 587M lädt dazu ein, Liquid AI d1-omni-600M als einen geschrumpften Verwandten der Modelle zu lesen, die dieser Blog zuvor behandelt hat. Das ist es nicht. Das Modell wird aus LFM2.5-Encoder-350M trainiert, einem bidirektionalen Encoder, mit einem 381M großen gemeinsamen Trunk und Entscheidungskopf, einem 94M großen Vision-Encoder aus der LFM2.5-VL-450M-Reihe und einem 17-schichtigen FastConformer für Audio. Microsoft-Decision-1 ist eine ganz andere Abstammungslinie: ein Qwen3.5-9B-Decoder, von Microsoft nachtrainiert, auf Foundry gehostet, Gewichte nicht verteilt und kein Fine-Tuning-Pfad angeboten.

Bidirektional versus Decoder ist die architektonische Tatsache, die entscheidet, wie sich jedes von beiden verhält, und sie ist auch der Grund, warum die Parameterzahlen eine Ablenkung sind. Ein bidirektionaler Encoder liest den gesamten Zustand auf einmal, was die richtige Form für ein Urteil über eine feste Eingabe ist; ein nachtrainierter Decoder gibt den Generierungspfad auf, behält aber den Tokenizer, das Fenster und die Enterprise-Paketierung, die mit einem Foundry-Deployment einhergehen. Keines ist eine skalierte Version des anderen, und sie lassen sich nicht gegeneinander austauschen, egal wie man eine Benchmark-Tabelle liest.

Was die Eingabeliste tatsächlich bringt

Hier weicht das d1-omni-600M am stärksten von allem anderen in dieser Kategorie ab – und hier muss eine Behauptung sorgfältig gelesen werden.

• Sprache – Liquid AI d1-omni-600M akzeptiert Text sowie bis zu 30 Sekunden Sprache und gibt darüber eine Entscheidung aus, was kein reiner Text-Scorer mit beliebiger Genauigkeit leisten kann. Die Nicht-Text-Modalitäten von Microsoft-Decision-1 existieren nicht.

• Gegenseitiger Ausschluss — das d1-omni-600M löst einen ValueError aus, wenn Bilder und Audio in derselben Anfrage eintreffen. Die breiteste Sensoroberfläche der Kategorie bleibt weiterhin auf eine Nicht-Text-Modalität gleichzeitig beschränkt, was eine echte Einschränkung für diesen Claims-Desk darstellt.

• Kürzung — seine Karte nennt 16.384 kombinierte Text-, Bild- und Audiopositionen und ergänzt, dass bei vorhandenen Bildern der Status- und der Fragetext auf 896 Token gekürzt werden, um zum Training zu passen. Jedes Dokument, an das Sie ein Foto anhängen, konkurriert mit dieser Kürzung. Die 32.768 Token von Microsoft-Decision-1 sind ausschließlich Text und werden nicht gekürzt.

• Formate — das d1-omni-600M hat drei Fragetypen: noul für eine binäre Entscheidung, die P(yes) zwischen 0 und 1 zurückgibt, choice für ein Label aus einer von Ihnen benannten Menge mit einer Konfidenz und einer Wahrscheinlichkeit pro Option, und score für eine Position auf einer geordneten Skala von zwei bis zehn Stufen samt ihrer Verteilung. Mehrere Fragen hängen an einem Zustand und werden in einem einzigen Durchlauf gelesen, und der Nutzungszähler meldet output_tokens: 0. Microsoft dokumentiert Ja/Nein-, Multiple-Choice-, Rating-, Klassifikations- und Rubrik-Formen sowie eine ausdrücklich unterstützte Enthaltungsoption wie „kann nicht sagen“, wenn die Evidenz nicht ausreicht — das einzige Design-Detail auf der Microsoft-Seite, für das es hier kein direktes Gegenstück gibt.

• Laufzeit — das d1-omni-600M wird mit benutzerdefiniertem Code ausgeliefert und benötigt trust_remote_code=True, und die zugehörige Modellkarte empfiehlt float16 auf der GPU, warnt jedoch davor, dass bfloat16 bei einigen Zeilen die Top-Antwort verändert hat. Dabei handelt es sich um eine vom Anbieter dokumentierte Empfindlichkeit zur Serving-Zeit, nicht um einen Defekt. Microsoft-Decision-1 ist ein verwalteter Endpunkt, bei dem die Deployment-Form Ihre einzige Laufzeitvariable ist, und es ist erwähnenswert, dass Batch-Inferenz deaktiviert ist: Es gibt keinen Offline-Kanal, über den sich ein Bulk-Scoring-Lauf amortisieren ließe.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

Die Evidenzlücke, in beide Richtungen

Liquid AI veröffentlichte die offene d1-Familie, einschließlich d1-omni-600M, am 7. Oktober 2026 mit einem Release-Beitrag und einem Dokumentationspaket. Nicht veröffentlicht ist die Zahl, die die multimodale Behauptung konkret machen würde. Es gibt keinen Genauigkeits-Benchmark speziell für die eigene Kernfähigkeit – die Entscheidungsqualität bei Vision und Audio, die die 94M- und 112M-Encoder rechtfertigt – und der Vision-Split wird aus dem veröffentlichten Evaluierungsmaterial zurückgehalten. Auch eine Latenzangabe wird nicht veröffentlicht, sodass der Durchsatz des Modells etwas ist, das man auf der eigenen Hardware selbst herausfindet.

Microsofts Position ist strukturell identisch und einen Schritt weiter. Auf seiner Registerkarte „Benchmarks“ werden die Metriken benannt – Genauigkeit, Kalibrierungsfehler, Safety-Recall, Falsch-Positiv-Raten, Fairness-Konsistenz –, es wird angegeben, dass die Evaluierung auf öffentlichen und Community-Entscheidungs-Benchmarks sowie auf zurückgehaltenen internen Testsets durchgeführt wurde, die nicht zum Training verwendet wurden, dass die Reihenfolge der Optionen variiert wurde und dass gepaarte statistische Tests angewendet wurden, und es wird behauptet, das Modell „schneide genauso gut ab wie führende Entscheidungsmodelle und besser als andere offene Entscheidungsmodelle, die mit derselben Methodik bewertet wurden“. Es werden keine der Ergebnisse angezeigt. Fünfundzwanzig Sprachen werden als unterstützt aufgeführt, darunter Japanisch, Koreanisch, Arabisch, Vietnamesisch, Thailändisch, Türkisch, Hindi, Bengalisch, Swahili, Hebräisch, Persisch und Ukrainisch, mit der freimütigen Warnung, dass Abdeckung, Qualität und Kalibrierung „je nach Sprache variieren können“ und dass Nicht-Englisch, insbesondere ressourcenschwache Sprachen, ein Schwachpunkt ist. Auch die Preisgestaltung findet sich nicht auf der Modellseite; sie verweist per Link auf Microsofts Preisübersicht.

Der Vergleich zwischen diesen beiden ist also kein Abwägen von Belegen gegen Belege. Es ist eine Wahl zwischen zwei Arten von fehlenden Zahlen. Liquid AI hat die Sensoroberfläche ausgeliefert und die Genauigkeit dieser Oberfläche öffentlich ungemessen gelassen. Microsoft hat den Beschaffungspfad ausgeliefert — Azure-Authentifizierung, Governance, eine Responsible-AI-Bewertung, eine dokumentierte Methodik — und die Kalibrierung eines Wahrscheinlichkeitsprodukts unquantifiziert gelassen.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Die Kalibrierungsfrage, die keiner von beiden beantwortet

Bei einem Entscheidungsmodell ist die Wahrscheinlichkeit das Produkt. Alles Nachgelagerte ist ein Schwellenwert: 0,7 eskaliert, 0,95 akzeptiert automatisch, und die Kosten dafür, diese Grenze falsch zu ziehen, werden in schlechten automatisierten Entscheidungen bezahlt, nicht in Tokens. In dieser Kategorie gibt es mindestens eine Familie, die die Zahlen veröffentlicht – die Intern-Decision-Checkpoints von InternLM geben Brier- und Expected-Calibration-Error-Werte auf ihren Modellkarten an – und keines der Modelle in diesem Artikel tut das. Diese Asymmetrie ist der praktische Grund, das Feld breit zu halten, statt sich allein aufgrund der Architektur festzulegen.

Die gute Nachricht: Der Test ist günstig und erfordert keine Mitwirkung des Anbieters. Stellen Sie ein paar hundert gelabelte Fälle zusammen, die Ihrem echten Traffic ähneln, schreiben Sie das Frageschema, das Ihre Anwendung tatsächlich senden würde, lassen Sie beide Modelle über sie laufen und berechnen Sie den erwarteten Kalibrierungsfehler auf der Ausgabe. Dann kennen Sie zwei Dinge, die derzeit niemand außerhalb der beiden Anbieter kennt: wie gut die Wahrscheinlichkeiten von Microsoft-Decision-1 dessen Genauigkeit auf Ihrer Verteilung widerspiegeln und ob die Audio- und Bildpfade des d1-omni-600M die Encoder wert sind, die sie mitbringen. Microsofts eigene dokumentierte Empfehlung weist in dieselbe Richtung – validieren Sie mit repräsentativen Daten, legen Sie Schwellenwerte anhand der Kosten Ihrer Fehler fest, schließen Sie stets eine Enthaltungsoption ein, randomisieren Sie die Reihenfolge der Optionen und halten Sie bei folgenreichen Entscheidungen einen Menschen im Entscheidungsprozess.

Wohin jedes gehört und wohin OrcaRouter gehört

Microsoft-Decision-1 gehört überall dorthin, wo das entscheidende Material Text ist und der Blocker die Beschaffung ist: ein langes Dokument, eine abgerufene Passage, ein vorgeschlagener Tool-Aufruf, eine generierte Antwort, die anhand einer Rubrik bewertet wird, mit Azure-Authentifizierung, einheitlicher Abrechnung und einer Anbieterbewertung, die erforderlich sind, bevor irgendetwas in Produktion geht. Es ist das engere Instrument und dasjenige, das leichter genehmigt werden kann.

Liquid AI d1-omni-600M gehört überall dorthin, wo das ausschlaggebende Material kein Text ist — ein Foto, das einem Formular beigefügt ist, eine kurze Anrufaufzeichnung, ein Screenshot — und wo immer Sie lfm1.0-Gewichte wollen, die Sie innerhalb einer von Ihnen kontrollierten Grenze ausführen und feinabstimmen können. Es ist das umfassendere Instrument und das schwerer zu validierende, denn die multimodale Behauptung ist genau der Teil, hinter dem kein veröffentlichter Benchmark steht.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Keines von beiden ist in unserem Katalog, und nichts hier ist eine Verfügbarkeitsaussage für eines von beiden. Ein Modell, das Wahrscheinlichkeiten statt Text zurückgibt, ist nichts, wohin man Chat-Completions routet, und sich aus der Bewertungsrolle herauszuhalten, ist das ganze Design des Instruments. Was OrcaRouter anbietet, ist die generative Seite derselben Schleife: die mehr als 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel, die den Bewertungsmaßstab schreiben, gegen den Ihr Scorer bewertet, das Material transkribieren oder zusammenfassen, bevor daraus ein Zustand wird, und den Tool-Aufruf ausgeben, den Ihr Scorer genehmigt, bevor er ausgeführt wird. Der Listenpreis des Anbieters wird mit 0 % Aufschlag durchgereicht, sodass eine Preissenkung eines Anbieters auf der generierenden Seite am selben Tag bei uns live ist. Automatisches Failover hält diese Seite am Leben, wenn ein einzelner Anbieter beeinträchtigt ist — was eine Pipeline, die jedes abgerufene Dokument bewertet, sofort bemerkt —, und wenn Sie möchten, dass mehrere Writer beurteilt werden statt nur einer, stellt die Routing-DSL sie zu einem einzigen Aufruf zusammen, und Modellfusion meldet ihre Übereinstimmung als Feld, das Ihr Scorer wie jedes andere lesen kann.

Fazit

Microsoft-Decision-1 erreichte am 8. Oktober 2026 die allgemeine Verfügbarkeit auf Microsoft Foundry: nur Text, 32.768 Token, auf einem nachtrainierten Qwen3.5-9B aufgebaut, gehostet ohne Gewichte, ohne Preis auf der Modellseite, ohne Latenzangabe und mit einem Benchmark-Abschnitt, der seine Methodik beschreibt, ohne ein Ergebnis auszugeben. Liquid AI d1-omni-600M wurde am 7. Oktober 2026 als bidirektionales Encoder-Entscheidungsmodell mit 587M hochgeladen, das Text, Bilder oder 30 Sekunden Sprache liest — jeweils nur eine Nicht-Text-Modalität, wobei Text auf 896 Token gekürzt wird, wenn Bilder vorhanden sind — unter der lfm1.0-Lizenz, ohne Genauigkeits-Benchmark für seine Kernfähigkeit, ohne Vision-Split und ohne veröffentlichte Latenz. Entscheiden Sie anhand von Modalität und Kontrolle statt anhand von Scores, denn die Scores existieren nicht: Wenn Ihr Material ein Foto oder ein Telefonanruf ist, kann nur eines von beiden antworten, und wenn es ein vierzigseitiges Dokument mit beigefügter Beschaffungsprüfung ist, kann nur das andere eingesetzt werden.

Was OrcaRouter bereitstellt, ist die generative Seite derselben Schleife: die mehr als 200 Modelle, die hinter einem einzigen OpenAI-kompatiblen Schlüssel das Bewertungsraster schreiben, gegen das dein Scorer bewertet, das Material transkribieren oder zusammenfassen, bevor es zu einem Zustand wird, und den Tool-Aufruf ausgeben, den dein Scorer genehmigt, bevor er ausgeführt wird.