
Liquid AI d1-omni-600M vs. Liquid AI d1-3B: Welche Hälfte der d1-Familie brauchst du wirklich?
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Liquid AI d1-omni-600M und Liquid AI d1-3B wurden am 5. Oktober 2026 innerhalb von acht Stunden zueinander auf Hugging Face hochgeladen und gemeinsam in derselben Ankündigung vom 7. Oktober veröffentlicht, was die übliche Frage – welche ist neuer, welche ist besser – zur falschen macht. Sie sind die beiden Enden einer bewussten Abwägung. Liquid AI d1-3B ist das fertige Produkt: 3,12B Parameter, ein Wert von 48,57 auf dem vom Anbieter bewerteten Decision Index 0.2.1, Benchmark-Tabellen, Latenz bis hinunter zu einem Jetson Orin Nano gemessen und ein Platz, der im Release-Post als die höchste Entscheidungsqualität seiner Größenklasse beschrieben wird. Liquid AI d1-omni-600M ist das Experiment: 587M Parameter, ein Wert von 15,95 auf demselben Index, Audioeingabe, die das 3B nicht hat, und eine Modellkarte, die unverblümt sagt, dass es sich um eine frühe Forschungsveröffentlichung ohne Inferenzzahlen handelt, weil es sich noch in aktiver Entwicklung befindet. Die Wahl zwischen ihnen ist keine Qualitätsentscheidung. Es ist eine Entscheidung darüber, ob Sie die zusätzlichen Modalitäten am unteren Ende der Familie oder die zusätzliche Genauigkeit am oberen Ende benötigen, und die Zahlen stützen diese Aufteilung, anstatt sie zu verwischen.
Alles Folgende stammt aus den beiden Modellkarten und dem Release-Post vom 7. Oktober, wobei die eigene Kennzeichnung des Release-Posts respektiert wird: Die d1-Zeilen im Decision Index wurden von Liquid AI mit dem offiziellen Scorer bewertet und nicht bei der öffentlichen Bestenliste eingereicht, und nichts hiervon wurde unabhängig reproduziert.
Zwei Backbones, die niemals konvergieren würden
Die d1-Familie hat kein einziges Rezept herunterskaliert. Die beiden Checkpoints starten von entgegengesetzten Enden von Liquids Modellkatalog und treffen sich in der Mitte.
Liquid AI d1-3B basiert auf LFM2.5-3B, dem Decoder-only-Vision-Language-Modell des Anbieters vom August 2026. Seine Basis wurde gebildet, indem die Gewichte von LFM2.5-2.6B mit dem Text-Backbone von LFM2.5-VL-3B gemittelt und anschließend Checkpoints unter verschiedenen Zufalls-Seeds und Datenmischungen feinabgestimmt wurden, bevor sie erneut zusammengeführt wurden. Es verfügt über einen formoptimierten 400M-Vision-Encoder SigLIP2 NaFlex, einen 32.768-Token-Kontext, ein 128.000-Token-Vokabular und sechzehn dokumentierte Sprachen.
Liquid AI d1-omni-600M kommt aus der anderen Richtung. Sein Trunk ist LFM2.5-Encoder-350M, ein bidirektionaler Encoder, der zuerst auf Entscheidungsaufgaben feinabgestimmt und dann schrittweise erweitert wurde – ein 17-schichtiger FastConformer-Encoder plus Adapter für Audio, wobei der Audio-Encoder später gegen ein eingefrorenes Text-Backbone feinabgestimmt wurde, dann ein SigLIP2-Turm, der aus LFM2.5-VL-450M übernommen wurde, mit einem Adapter und LoRA-Updates am Backbone für Vision. Das endgültige Modell wurde aus den LoRA-Updates zusammengeführt und mit dem vorherigen Checkpoint gemittelt. Insgesamt endet es bei 587M Parametern: ein gemeinsamer Trunk samt Entscheidungs-Head mit 381M, ein 94M-Vision-Encoder und ein 112M-Audio-Encoder.
Decoder-only versus bidirektional ist der Punkt, an dem man sich festhalten sollte. Das 3B liest einen Zustand und erzeugt eine Entscheidung, so wie ein Sprachmodell eine Token-Sequenz erzeugt – eine Richtung nach der anderen. Das 600M liest den gesamten Zustand auf einmal und entscheidet, was man von einem Encoder erwarten würde, der nie zum Generieren gebaut wurde. Beide sind darauf trainiert, Antworten direkt aus der Verteilung des Modells abzulesen, ohne Ausgabe-Tokens, aber die darunterliegende Maschinerie gehört nicht zur selben Modellklasse, und die Genauigkeitslücke unten ist der sichtbare Preis des kleineren, encoderförmigen Designs.
Die Spanne des Decision Index ist groß, und die Teilwerte sind interessanter als der Gesamtwert.
Auf dem Decision Index 0.2.1 meldet Liquid 48,57 für Liquid AI d1-3B und 15,95 für Liquid AI d1-omni-600M, gegenüber 50,02 für Winnow-12B. Das ist eine 32-Punkte-Lücke zwischen zwei Checkpoints, die am selben Tag vom selben Labor veröffentlicht wurden, und ein Blick auf die fünf Teilwerte erklärt, woher sie kommt.
• Wissen — 23,8 für Liquid AI d1-3B gegenüber 8,3 für Liquid AI d1-omni-600M
• Sprache — 56,4 gegen 12,9
• Abruf — 52,8 gegenüber 35,0
• Werkzeuge — 74.5 gegen 15.1
• Kunst — 36,3 gegen 6,8
Retrieval ist der eine Bereich, in dem sich das kleine Modell behauptet: Es verliert weniger als ein Drittel des 3B-Scores, während es in den anderen vier Kategorien 60 bis 80 Prozent verliert. Dieses Muster passt zu dem, was das 600M ist: ein trainierter Encoder mit echter Repräsentationskapazität, um einen Zustand gegen Inhalt abzugleichen, und deutlich weniger von der geschichteten Fähigkeit, die das 3B von einem Decoder erbt, der auf weit mehr Sprache vortrainiert wurde. Wenn Ihre Workload eine Retrieval-artige Entscheidung ist – beantwortet diese Passage diese Frage, welches dieser Dokumente relevant ist –, ist das Profil des 600M weniger schlecht, als sein Gesamtwert vermuten lässt. Wenn Ihre Workload eine Tool-Routing-Entscheidung ist, ist die 51-Punkte-Lücke in dieser Spalte die Zahl, die Sie anstarren sollten.
Die Text-Benchmark-Tabelle erzählt eine mildere Geschichte als der Index, was man wissen sollte, bevor eine der beiden Zahlen herangezogen wird, um ein Argument zu stützen. Bei sieben öffentlichen Benchmarks führt das 3B mit einem Mittelwert von 82,9 und das 600M erreicht 78,4. Das 600M verliert tatsächlich knapp bei SQuAD 2.0 (74,0 zu 85,3), PubMedQA (61,3 zu 66,0), BoolQ (77,7 zu 86,7) und XNLI (74,7 zu 85,0), gewinnt aber bei der Toxizitätserkennung von Civil Comments (95,8 zu 93,0) und bei der Paraphrasenerkennung von PAWS-X (79,5 zu 76,9). Liquids eigene Darstellung ist, dass das 600M mit einem Viertel der Parameter den 77,1-Mittelwert von Decider 2B übertrifft. Zwei Benchmark-Suites, zwei unterschiedliche scheinbare Urteile, beide vom Anbieter berichtet — mehr gibt die Evidenz nicht her.

Was das 600M hat, das das 3B nicht hat
Der Grund, einen Indexabstand von 32 Punkten zu tolerieren, ist, dass Liquid AI d1-omni-600M eine Sache kann, die Liquid AI d1-3B nicht kann, und es ist kein Unterschied bei der Wiedergabetreue.
• Audio — Liquid AI d1-omni-600M verarbeitet bis zu 30 Sekunden Sprache pro Anfrage über seinen FastConformer-Encoder; Liquid AI d1-3B verarbeitet keine.
• Modalitätsmischung — das 600M akzeptiert Text mit Bildern oder Text mit Audio und löst einen ValueError aus, wenn beide zusammen eintreffen; das 3B akzeptiert Text und Bilder
• Kontextfenster — 16.384 Token über Text-, Bild- und Audiopositionen hinweg für das 600M-Modell, wobei der Text auf 896 Token gekürzt wird, wenn Bilder vorhanden sind; 32.768 Token für das 3B-Modell
• Vokabular — 65.536 für das 600M, 128.000 für das 3B
• Präzision — die 600M-Karte empfiehlt float16 auf der GPU und warnt, dass bfloat16 bei einigen Zeilen die Top-Antwort verändert hat; das 3B wird mit 15 Quantisierungen ausgeliefert, darunter ein w8a8-Build
• Sprachen — das 600M listet 16 Sprachen in einer anderen Zusammenstellung auf als die 16 des 3B, und sein Audio wird als auf Interaktionen zwischen einem englischsprachigen Sprecher und einem Assistenten trainiert beschrieben, was nur ein schmaler Ausschnitt dessen ist, was ein Produktions-Audiofeed enthält
Der Hinweis zum Audiotraining ist leicht zu überfliegen und sollte es nicht sein. Ein Modell, das auf englischen Sprecher-zu-Assistent-Interaktionen trainiert wurde, hat nur eine Sprechergeometrie, eine Turn-Struktur und eine Akzentverteilung gesehen. Es auf Callcenter-Audio oder Feldaufnahmen einzusetzen, heißt, ein Verhalten zu verlangen, das die Karte nicht beansprucht, und im Release-Beitrag wird offen gesagt, dass es keinen Benchmark für Audio-Entscheidungen gibt, an dem man es prüfen könnte — Liquid nennt das „derzeit ein offenes Problem“ und lädt die Community ein, einen zu entwickeln.

Latenz: Das eine Geschwisterelement hat die Tabellen, das andere hat eine Fußnote.
Für Entscheidungsmodelle ist die interessante Kennzahl die End-to-End-Latenz, denn es gibt keine Dekodierung zu messen. Liquid veröffentlicht einen vollständigen Satz für das 3B und keinen für das 600M.
• Eine Frage — 8 ms auf einer RTX 4090, 9 ms auf einem MI325X, 16 ms auf einem Jetson AGX Thor, 26 ms auf einem Jetson AGX Orin 64 GB, 50 ms auf einem Orin Nano, 30 ms auf einem Apple M5 Pro
• Drei Fragen über einen Zustand — 21 ms auf der RTX 4090 und 20 ms auf dem AGX Thor, ungefähr 1,3-mal so viel wie eine einzelne Frage statt 3-mal so viel
• Ein Zustand mit 3,4K Token — 102 ms auf der 4090, 220 ms auf dem Thor, 1.640 ms auf dem Orin Nano
• Gepackter Durchsatz – 475 Entscheidungen pro Sekunde auf der RTX 4090, 1.106 pro Sekunde auf der MI325X
• Ein 384px-Bild — 17 ms auf der 4090, 18 ms auf der MI325X
Diese Zahlen beschreiben nur Liquid AI d1-3B. Für Liquid AI d1-omni-600M gibt die Modellkarte an, dass keine Inferenzzahlen angegeben werden, weil das Modell eine frühe Forschungsveröffentlichung ist, die sich in aktiver Entwicklung befindet. Es ist nicht so, dass das kleine Modell langsamer ist – das Gegenteil ist nahezu sicher, denn ein Fünftel der Parameter ist bei gleicher Präzision nicht langsamer –, sondern dass keine Zahl existiert, und dass es eine Fabrikation mit plausibler Form wäre, die Millisekunden des 3B für das 600M zu zitieren. Was sich sagen lässt, ohne irgendetwas zu erfinden, ist, dass bei der von der Karte empfohlenen float16-Präzision 587M Parameter in der Größenordnung von 1,2 GB an Gewichten vor Aktivierungen liegen, was Arithmetik auf Grundlage einer veröffentlichten Parameteranzahl und keine Messung ist.
Die Kaskade ist die eigentliche Antwort für die meisten Workloads
Da beide Checkpoints zusammen veröffentlicht wurden und dieselbe Art von Objekt zurückgeben – eine Wahrscheinlichkeit, ein Label mit einer Konfidenz oder einen geordneten Score –, lassen sie sich auf eine Weise kombinieren, wie es zwei beliebige Modelle nicht können. Das 600M kann vorfiltern, und das 3B kann abschließend entscheiden. Bewerte eingehende Elemente mit Liquid AI d1-omni-600M und eskaliere diejenigen, die es nahe der Mitte seiner Skala einordnet, an Liquid AI d1-3B für eine präzisere Entscheidung. Die Eskalationsregeln sind die Konfidenz und die Verteilung, die das 600M bereits zurückgibt, sodass die Routing-Logik kein zusätzliches Modell benötigt. Bei einer Arbeitslast mit einer starken Mehrheit einfacher Elemente erreicht der Großteil des Verkehrs nie das 3B, und der Großteil des Geldes wird nie ausgegeben.
Dieses Muster ist auch der Grund, warum es sich lohnt, die beiden Modelle hinter einem Router zu betreiben. Über OrcaRouter säßen beide hinter einem einzigen API-Schlüssel zum Listenpreis des jeweiligen Anbieters, durchgereicht mit 0 % Aufschlag, sodass die Kaskade eine Routing-Regel statt einer zweiten Integration ist, und eine Eskalation, die auf Anbieterebene fehlschlägt, wird auf einem Fallback erneut versucht, statt die Anfrage scheitern zu lassen. Automatisches Failover ist hier wichtiger als bei einem etablierten Modell, denn die eine Hälfte dieses Paares ist ein Checkpoint, dessen Verhalten der Anbieter selbst als in aktiver Entwicklung befindlich beschreibt.
Nichts davon ist eine Aussage zur Verfügbarkeit, und es lohnt sich, den Unterschied klar zu benennen: Die offenen d1-Checkpoints sind nicht in unserem Katalog. Der Weg des Anbieters besteht darin, die Gewichte herunterzuladen und sie lokal auszuführen – llama.cpp-Unterstützung war am ersten Tag für Hardware von Apple, AMD, Qualcomm und NVIDIA verfügbar – oder über die eigene API des Anbieters und Drittanbieterplattformen darauf zuzugreifen.
Auswählen in einem Durchgang
Wenn du Text und Bilder brauchst und die Antwort stimmen muss, nimm Liquid AI d1-3B. Es hat die Benchmarks, die Latenztabellen, den größeren Kontext, den größeren Wortschatz und die Quantisierungen, und es ist das Mitglied des Paares, das Liquid als den Qualitätsführer seiner Größe positioniert.
Wenn du Sprache im Entscheidungspfad brauchst, nimm Liquid AI d1-omni-600M, denn es ist die einzige Option mit offenen Gewichten in dieser Familie, die überhaupt Audio akzeptiert, und akzeptiere, dass du es auf Bauchgefühl und eine Demo hin übernimmst, bis jemand einen Audio-Entscheidungsbenchmark oder den zurückgehaltenen Vision-Split veröffentlicht.
Wenn Sie noch nicht wissen, welche davon Ihre Arbeitslast beschreibt, beginnen Sie mit dem 3B und instrumentieren Sie die Konfidenz, die er zurückgibt. Die Teilwerte sind der entscheidende Hinweis: Eine Aufgabe, die in den Spalten Tools oder Language angesiedelt ist, wird vom 600M schlecht bedient, während etwas Retrieval-Förmiges der eine Fall ist, in dem der kleine Checkpoint näher liegt, als sein Gesamtwert vermuten lässt. Die Familie existiert, damit Sie Genauigkeit gegen Footprint eintauschen können, und der Tausch ist nur sicher, wenn Sie wissen, welche Spalte Ihre Aufgabe belegt.

Über OrcaRouter stehen beide Modelle hinter einem einzigen API-Schlüssel bei einer Routing-Regel statt einer zweiten Integration, und eine Eskalation, die auf der Anbieterebene fehlschlägt, wird stattdessen auf einem Fallback erneut versucht, anstatt die Anfrage fehlschlagen zu lassen.
