Eine Hero-Titelkarte für die Open-Weight-Entscheidungsmodelle von Liquid AI, überschrieben mit „Zwei Modelle, die nie ein Wort schreiben“, mit dem Untertitel „Liquid AI d1-3B und d1-omni-600M, offene Gewichte, 7. Oktober 2026“, drei Chips mit den Bezeichnungen Ja/Nein, Label auswählen und Skala bewerten, sowie ein Diagramm, bei dem ein Zustand in einen einzelnen Forward-Pass eingeht, der eine Wahrscheinlichkeit, ein Label und einen Score zurückgibt.
Guides & Insights

Liquid AI d1-3B und d1-omni-600M: Offene Gewichte für Modelle, die niemals ein Wort schreiben

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Liquid AI d1-3B und Liquid AI d1-omni-600M wurden am 7. Oktober 2026 auf Hugging Face veröffentlicht, und die beiden Checkpoints haben eine Eigenschaft, die jede Vergleichstabelle, die Sie dieses Jahr gelesen haben, falsch aussehen lässt. Keines der beiden generiert Text. Sie übergeben Liquid AI d1-3B einen Zustand — ein Support-Ticket, eine JSON-Nutzlast, ein Foto oder alle drei gleichzeitig — und eine Reihe benannter Fragen, und es gibt Antworten zurück, die direkt aus der Verteilung des Modells über Ihre Optionen abgelesen werden. Ja/Nein als Wahrscheinlichkeit. Eine Auswahl unter Labels mit einer Konfidenz und einem vollständigen Wahrscheinlichkeitsvektor. Eine Position auf einer geordneten Skala. Es gibt keinen Sampling-Schritt, kein zu parsendes JSON, keine unkontrollierte Generierung, und der eigene Nutzungszähler des Anbieters meldet die Sache schlicht: output_tokens: 0. Das 3B-Modell ist die Schlagzeile — es erreicht 48,57 auf dem vom Anbieter bewerteten Decision Index 0.2.1, vor allen Modellen unter 10B und vor einem Entscheidungsmodell, das zwölfmal so groß ist. Das 600M-Geschwistermodell ist das, was man im Auge behalten sollte: Es liest Bilder und bis zu dreißig Sekunden Sprache über dieselben Trunk-Gewichte, und es ist als frühe Forschungsveröffentlichung gekennzeichnet.

Was ein Entscheidungsmodell ist, in einem Absatz.

Die Kategorie entwickelt sich seit einem Jahr unter Bezeichnungen wie System-1-Modelle und Klassifikatoren, die keine Klassifikatoren sind, und das d1-Paar ist die bisher klarste Formulierung davon. Ein generatives Modell wird gefragt und schreibt eine Antwort; die Antwort muss geparst werden, das Parsen kann fehlschlagen, und jedes Token, das es schreibt, kostet Geld und Zeit. Ein Entscheidungsmodell wird gefragt und berichtet, was es bereits glaubt. Liquids Fragen gibt es in drei Typen. noul ist eine Ja/Nein-Frage, beantwortet mit P(Ja) zwischen 0 und 1. Auswahl wählt ein Label aus einer benannten Menge und gibt das Label, eine Konfidenz und die Wahrscheinlichkeit jeder Option zurück. Bewertung ordnet den Zustand auf einer geordneten Skala von zwei bis zehn Stufen ein und gibt die erwartete Stufe mit ihrer Verteilung und Legende zurück. Ein Zustand kann mehrere Fragen gleichzeitig tragen, und der Zustand und seine Bilder werden einmal für alle gelesen.

Diese letzte Eigenschaft ist der ganze Business Case. Drei Fragen zu einem Ticket kosten das 1,3-Fache der Zeit einer Frage, nicht das 3-Fache, weil das Modell einen einzigen Vorwärtsdurchlauf über die Eingabe durchführt und mehrere Antworten daraus liest. Es gibt nichts zu schreiben, also gibt es nichts, was schlecht geschrieben werden könnte.

Das 3B und das 600M sind aus entgegengesetzten Richtungen gebaut

Hier wird die Veröffentlichung technisch interessant, und genau diesen Teil hat die Berichterstattung zum Launch größtenteils ausgelassen. Die beiden Modelle haben keine gemeinsame Abstammungslinie.

Liquid AI d1-3B stammt von LFM2.5-VL-3B ab, dem Decoder-only-Sprachmodell des Anbieters. Es bringt 3,12B Parameter mit, einen formoptimierten 400M-Vision-Encoder vom Typ SigLIP2 NaFlex, ein Kontextfenster von 32.768 Token, ein Vokabular von 128.000 Token und sechzehn dokumentierte Sprachen. Um es zu bauen, bildete Liquid den Mittelwert der Gewichte von LFM2.5-2.6B und des Text-Backbones von LFM2.5-VL-3B – beides feinabgestimmte Checkpoints aus mehreren zufälligen Seeds und Datenmischungen – und führte die Ergebnisse anschließend erneut zusammen. Die eigene Zusammenfassung des Anbieters darüber, was zählte, ist erfrischend unglamourös: das Training mit langen Eingaben, das Mischen der Reihenfolge der Antwortoptionen und die Jagd nach Abkürzungen in den Trainingsdaten bewirkten für die endgültige Zahl mehr als jede fortgeschrittene Technik.

Liquid AI d1-omni-600M stammt von LFM2.5-Encoder-350M ab, einem bidirektionalen Encoder – einer völlig anderen Art von Netzwerk. Es umfasst insgesamt 587 Mio. Parameter, aufgeteilt in einen 381 Mio. großen gemeinsamen Trunk und Entscheidungs-Head, einen 94 Mio. großen Vision-Encoder, der von LFM2.5-VL-450M übernommen wurde, und einen 112 Mio. großen Audio-Encoder, der aus einem 17-schichtigen FastConformer aufgebaut ist. Jede Modalität läuft durch dieselben Trunk-Gewichte. Sein Kontext umfasst 16.384 Token, die Text-, Bild- und Audiopositionen gemeinsam abdecken, und wenn Bilder angehängt werden, werden der Zustands- und der Fragetext auf 896 Token gekürzt, weil es darauf trainiert wurde. Für Audio gibt es eine Warnung, die die Modellkarte ohne Beschönigung nennt: Die Fähigkeit wurde mit Anfragen zwischen einem englischsprachigen Sprecher und einem Assistenten trainiert, und Clips werden bei dreißig Sekunden abgeschnitten.

Die Familie ist also nicht ein Modell in zwei Größen. Sie ist ein Decoder und ein Encoder, nachtrainiert, dieselbe Aufgabe mit zwei völlig unterschiedlichen Mechanismen zu erledigen, von denen einer sieht und einer hört.

A two-column scoreboard for Liquid AI d1-3B and d1-omni-600M showing d1-3B at Decision Index 48.57 with 3.12B parameters, text and image input and 8 ms per question on an RTX 4090, against d1-omni-600M at 15.95 with 587M parameters, text, image and audio input and no reported latency, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Die Zahlen – und wem sie gehören

Jede Zahl in diesem Abschnitt stammt von Liquid selbst. Die Decision-Index-Zeilen für die d1-Modelle wurden vom Anbieter mit dem offiziellen Scorer bewertet – nicht beim Leaderboard eingereicht –, während jede konkurrierende Zeile aus dem öffentlichen Leaderboard in Version v0.2.1 stammt. Bislang hat kein unabhängiges Labor etwas davon reproduziert, und die Modelle sind zum Zeitpunkt dieses Textes zwei Tage alt.

• Decision Index 0.2.1 — Liquid AI d1-3B erzielt 48,57 mit Teilwerten von Wissen 23,8, Sprache 56,4, Retrieval 52,8, Tools 74,5 und Arts 36,3. Liquid AI d1-omni-600M erzielt 15,95, mit Tools bei 15,1.

• Wo 48,57 steht — an erster Stelle von allem unter 10B in der vom Anbieter veröffentlichten Tabelle und vor Decider 35B-A3B mit 47,11. Insgesamt liegt es auf dem zweiten Platz, hinter Winnow-12B mit 50,02, das viermal so groß ist.

• Text-Benchmarks, laut Anbieter — d1-3B erzielt über sieben öffentliche Benchmarks hinweg einen Durchschnitt von 82,9 und liegt damit vor Decider 4B mit 81,1; d1-omni-600M kommt auf einen Durchschnitt von 78,4 und übertrifft damit Decider 2B mit 77,1 bei etwa einem Viertel der Parameteranzahl. Das 600M-Modell erzielt den besten Toxizitätswert der Tabelle (Civil Comments 95,8) und den besten Paraphrasen-Wert der Tabelle (PAWS-X 79,5).

• Vision, vom Anbieter angegeben — d1-3B erreicht im Durchschnitt 74,1 über elf öffentliche Bild-Benchmarks, gelesen als Entscheidungen über die Optionen des jeweiligen Benchmarks, gegenüber 73,9 für sein LFM2.5-VL-3B-Backbone. Werden die Bilder entfernt, fallen dieselben Fragen auf 45,1 ab, womit der Anbieter zeigt, dass die Antworten aus den Pixeln stammen.

• Latenz, vom Anbieter gemessen – eine Frage dauert 8 ms auf einer RTX 4090 und 9 ms auf einer AMD MI325X; 16 ms auf einem Jetson AGX Thor, 26 ms auf einem Jetson AGX Orin 64 GB, 50 ms auf dem kleinsten Jetson Orin Nano und 30 ms auf einem Apple M5 Pro. Vierundsechzig Zustände, in einem einzigen Durchlauf gebündelt, erreichen 475 pro Sekunde auf der 4090.

• Was fehlt — d1-omni-600M hat überhaupt keine Inferenztabelle. Liquid sagt, dass es sich in aktiver Entwicklung befindet, und meldet dafür schlicht keine Latenz. Außerdem gibt es nirgendwo in der Veröffentlichung einen Audio-Entscheidungs-Benchmark, denn laut Anbieter sind dedizierte Audio-Entscheidungs-Benchmarks derzeit ein offenes Problem.

Die Behauptung, die die Veröffentlichung wirklich aufstellt

Zwei Tage bevor die Gewichte veröffentlicht wurden, veröffentlichte Liquid die gehostete Version dieses Modells und ließ sie auf sechs Anwendungen gegen GPT-6.1 Sol und Claude Opus 5.5 laufen. Die Zusammenfassung: d1 erreicht oder übertrifft GPT-6.1 Sol bei vier von sechs, kostet 19-mal bis 200-mal weniger und antwortet bei jeder Aufgabe schneller. Die veröffentlichte Methodik sollte man lesen, bevor man irgendetwas davon wiederholt – jede Anwendung wurde am 5. Oktober 2026 einmal pro Modell ausgeführt, die Chat-Modelle antworteten in JSON mit ihrer standardmäßigen Reasoning-Einstellung, und die Kosten für d1 wurden mit 0,04 $ pro Million Eingabe-Tokens berechnet.

Die Demos sind die überzeugendere Hälfte. Das Sortieren von guten und defekten Teilen aus vier Produktionslinien – Leiterplatten, Kerzen, Cashewkerne, Kaugummi – mit 85 bis 97 % Genauigkeit, mit einem Modell, das für diese Aufgabe nie trainiert wurde und sie aus einer kurzen Beschreibung heraus verstanden hat. Ein SQL-Prädikat, das für jedes von 150 Support-Tickets Ja oder Nein liefert. Eine Kontext-Verdichtungsschleife, die jede Tool-Ausgabe in der Sitzung eines Coding-Agenten liest und sie behält, kürzt oder verwirft, wodurch 52 % der Token entfallen, während jede Ausgabe erhalten bleibt, die die Aufgabe benötigt. In Tetris hob das Hinzufügen des Bildschirms zu einem vollständig textbeschreibbaren Spiel die Punktzahl von 70 geräumten Reihen auf 81 – ein Vision-Ergebnis, das man von einem rein textbasierten Klassifikator nicht bekommen kann, egal wie gut er ist.

Das sind von Anbietern durchgeführte Demonstrationen mit von Anbietern ausgewählten Aufgaben, und der Methodikabschnitt sagt das auch. Sie sind immer noch das klarste Bild, das irgendjemand davon veröffentlicht hat, wofür ein Entscheidungsmodell da ist.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Wo es läuft und was ein Aufruf kostet

Die offenen Gewichte sind für die lokale Ausführung konzipiert, und der Anbieter hat die Integrationsarbeit im Vorfeld erledigt: Unterstützung für llama.cpp ab Tag eins, der vollständige NVIDIA-Stack von DGX bis hinunter zu Jetson, NVFP4-Quantisierung und eine 8-Bit-Variante für Gewichte/Aktivierungen, die zusammen mit dem Basis-Checkpoint veröffentlicht wurde. GGUF-Konvertierungen sind bereits auf Hugging Face verfügbar. Wenn Sie lieber nichts selbst hosten möchten, stellt Liquid das gehostete d1 über seine eigene API bereit — nur Eingabe-Tokens, keine Ausgabe-Tokens, wobei Bilder als Eingabe mit 1,5 Tokens pro 32×32-Pixel-Patch abgerechnet werden, was bei einem 1024×1024-Bild 1.536 Tokens ergibt. Reiner Textzugriff ist ebenfalls über Drittanbieter-Plattformen verfügbar.

Die ehrliche Routing-Anmerkung: Weder Liquid AI d1-3B noch Liquid AI d1-omni-600M stehen in unserem Katalog, und dieser Artikel ist keine Verfügbarkeitsaussage für eines der beiden. Was das d1-Paar für einen Router ändert, ist die Form der Pipeline drumherum. Ein Entscheidungsmodell, das in Millisekunden antwortet und nichts an Output-Tokens kostet, ist ein Filter, kein Ersatz — die Sortierung nach Gut und Defekt und die Ticket-Triage finden vor dem generativen Aufruf statt, und der generative Aufruf ist der Ort, an dem ein einzelner Endpunkt über 200+ Modelle, Listpreise zu 0 % Aufschlag durchgereicht, und automatisches Failoversich tatsächlich bezahlt machen. Andere Ebene, dieselbe Pipeline.

Was würde den Streit beilegen?

Drei Dinge sind ungeklärt, und alle drei sind von der Art, die nur die Zeit schließt.

Das erste ist die unabhängige Reproduktion. Die Zahlen des Decision Index wurden vom Anbieter mit dem offiziellen Scorer erzeugt, und jede Wettbewerberzeile wurde aus einem öffentlichen Leaderboard übernommen, was eine vertretbare Methode ist und nicht dasselbe, wie wenn ein Dritter Ihr Modell ausführt. Das zweite ist Audio. Ein 600M-Checkpoint, der einen Sprachbefehl in einem einzigen Forward-Pass routet, ist eine wirklich neue Fähigkeit, und es existiert kein Benchmark, der misst, wie gut er das macht. Das dritte ist die Kategorie selbst: Wenn die Antwort aus einer Verteilung abgelesen statt ausgeschrieben wird, können die üblichen Fehlermodi eines kleinen Modells – Schleifen, Abdriften, Verweigern, Halluzinieren eines Formats – schlicht nicht auftreten, und niemand hat eine gute Darstellung dessen veröffentlicht, was an ihre Stelle tritt. Kalibrierungsfehler ist der naheliegende Kandidat, und genau dazu lädt das Konfidenzfeld bei jeder Antwort Sie ein, selbst zu messen.

In einem öffentlichen Hugging Face Space lassen zehn Demos Liquid AI d1-3B in einer Schleife über Live-Kameraeingaben laufen – die günstigste Art, sich eine eigene Meinung zu bilden. Die Gewichte sind kostenlos und die Fragen sind konkret. Das ist eine bessere Ausgangsposition, als die meisten Veröffentlichungen dieses Jahres bieten.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert