
Liquid AI d1-omni-600M vs. LFM2.5-VL-3B: Einer entscheidet, einer beschreibt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Liquid AI d1-omni-600M und LFM2.5-VL-3B sind beide klein, beide multimodal, beide vom selben Labor auf Hugging Face unter derselben lfm1.0-Lizenz veröffentlicht – und sie zu paaren ist ein Kategorienfehler, der sich als nützlich erweist. LFM2.5-VL-3B erschien am 12. August 2026 als Edge-Vision-Language-Modell von Liquid AI: 3,1B Parameter, ein 32.768-Token-Fenster und eine Ausgabe, die Prosa ist. Gib ihm eine gescannte Seite, und es liefert die Transkription samt Layout als Text zurück. Liquid AI d1-omni-600M wurde am 7. Oktober 2026 zusammen mit dem Rest der offenen d1-Familie hochgeladen und macht mit denselben Eingaben das Gegenteil. Es ist ein Entscheidungsmodell mit 587M Parametern: Du hängst benannte Fragen an einen Zustand, und es meldet, was es bereits glaubt – P(yes), ein gewähltes Label mit einer Konfidenz, eine Position auf einer geordneten Zwei-bis-zehn-Skala – in einem einzigen Vorwärtsdurchlauf, mit null Ausgabe-Token und nichts, was nachgelagert geparst werden muss. Wenn du nach „dem kleinen multimodalen Liquid-Modell“ gesucht hast, liegen jetzt zwei Formen vor dir, und die Form ist die Entscheidung.
Diese Seite ist das, was die beiden Modellkarten, der Release-Post vom 7. Oktober und die Repositories selbst tatsächlich belegen. Sie macht auch ausdrücklich klar, wo sie enden. Nichts in diesem Vergleich wurde außerhalb von Liquid AI reproduziert, und für eines der beiden Modelle hat der Anbieter überhaupt keinen Genauigkeits-Benchmark veröffentlicht, der spezifisch für dessen eigene Hauptfähigkeit ist.
Die beiden Kontrollpunkte, Seite an Seite
Die Datenblätter weichen in fast jeder Hinsicht voneinander ab, was man von zwei Modellen erwarten würde, die nie dafür gedacht waren, um denselben Platz zu konkurrieren.
• Was es ist — LFM2.5-VL-3B ist ein generatives Vision-Language-Modell, das Text schreibt; Liquid AI d1-omni-600M ist ein Entscheidungsmodell, das strukturierte Antworten zurückgibt und keine Tokens ausgibt
• Parameter — 3,1B in BF16 für LFM2.5-VL-3B gegenüber 587M für Liquid AI d1-omni-600M, das selbst aus einem 381M großen gemeinsamen Trunk und Decision Head sowie einem 94M großen Vision-Encoder und einem 112M großen Audio-Encoder besteht
• Backbone — LFM2.5-VL-3B kombiniert ein LFM2.5-2.6B-Sprachmodell mit einem SigLIP2-NaFlex-formoptimierten 400M-Vision-Encoder; Liquid AI d1-omni-600M wird aus LFM2.5-Encoder-350M trainiert, einem bidirektionalen Encoder, mit einem SigLIP2-Turm aus LFM2.5-VL-450M und einem 17-schichtigen FastConformer für Audio
• Eingaben — Text und Bilder für LFM2.5-VL-3B; Text plus Bilder oder Text plus bis zu 30 Sekunden Sprache für Liquid AI d1-omni-600M, das einen ValueError auslöst, wenn Bilder und Audio in derselben Anfrage eintreffen
• Kontext — 32.768 Token für LFM2.5-VL-3B gegenüber 16.384 kombinierten Text-, Bild- und Audiopositionen für Liquid AI d1-omni-600M, wobei auf dessen Karte ergänzt wird, dass bei vorhandenen Bildern der Zustands- und Fragetext auf 896 Token gekürzt wird, um dem Training zu entsprechen
• Vokabular — 128.000 Tokens für LFM2.5-VL-3B, 65.536 für Liquid AI d1-omni-600M
Laufzeit — LFM2.5-VL-3B läuft in transformers und vLLM und verfügt über ein separates DSpark-Draft-Modell für spekulative Dekodierung; Liquid AI d1-omni-600M liefert eigenen Code mit, erfordert trust_remote_code=True, und die zugehörige Modellkarte empfiehlt float16 auf der GPU, warnt jedoch, dass bfloat16 bei einigen Zeilen die beste Antwort verändert hat
• Lizenz — lfm1.0 für beide, was Fine-Tuning und Deployment ermöglicht
Eine Zeile in dieser Liste leistet mehr Arbeit als der Rest. Liquid AI d1-omni-600M basiert auf einem bidirektionalen Encoder statt auf einem Decoder. Das ist keine Größenreduktion von LFM2.5-VL-3B; es ist eine andere Abstammung, und es ist der architektonische Grund, warum die beiden Modelle nicht füreinander ausgetauscht werden können, egal wie man die Benchmark-Tabellen liest.
Der Output-Vertrag entscheidet mehr als die Benchmarks.
Stellen Sie LFM2.5-VL-3B eine Frage zu einem Bild, und Sie bekommen Sprache zurück. Das ist Geld wert, wenn die Antwort von einer Person gelesen, als String protokolliert oder einem Schritt zugeführt werden muss, der Prosa erwartet. Es ist zugleich ein Risiko, gegen das Sie technisch anarbeiten müssen: Generierte Ausgabe kann abschweifen, eine JSON-förmige Anfrage kann anders geformt zurückkommen, als Sie sie gestellt haben, und jeder Token wird abgerechnet und kostet Wartezeit. Das Modell ist ausdrücklich ausgelegt für Single-Turn-Vision-Arbeit mit hohem Durchsatz und niedriger Latenz — Batch-OCR von gescannten Dokumenten, Echtzeiterkennung in einem Fahrzeug, Übersetzung von Beschilderung auf dem Gerät — und ausdrücklich weg von langkontextigen, stark auf Schlussfolgerungen ausgerichteten Fragen wie „Was stimmt mit diesem Bauplan nicht?“ gelenkt.
Liquid AI d1-omni-600M beantwortet eine strikt engere Frage in einem strikt zuverlässigeren Rahmen. Seine Schnittstelle ist ein Zustand — Text, JSON, ein oder mehrere Bilder oder bis zu 30 Sekunden Sprache — plus eine Menge benannter Fragen, die jeweils ihren eigenen Typ deklarieren. Eine noul Frage ist eine Ja/Nein-Frage und kommt als P(ja) zwischen 0 und 1 zurück. Eine choice Frage wählt eine Bezeichnung aus einer von Ihnen benannten Menge aus und gibt die Bezeichnung, eine Konfidenz und die Wahrscheinlichkeit jeder Option zurück. Eine score Frage ordnet den Zustand auf einer geordneten Skala von zwei bis zehn Stufen ein und gibt die erwartete Stufe samt ihrer Verteilung zurück. Mehrere Fragen können an einen Zustand angehängt sein und werden in einem einzigen Durchlauf gelesen, sodass der Nutzungszähler der Modellkarte output_tokens: 0 meldet. Es gibt keinen Generierungsschritt, was bedeutet, dass es so etwas wie Ausgaben, die nicht geparst werden können, nicht gibt.
Was Sie aufgeben, ist alles, was eine generierte Antwort trägt, was ein Label nicht hat: die Begründung, die Relativierung, die Formulierung, die Sie in ein Ticket einfügen können, die Möglichkeit, in derselben Konversation nachzufragen. Liquid sagt es unverblümt – das Modell ist kein Chat-Modell und schreibt keinen Text. Wenn Ihre Pipeline eine Erklärung neben dem Urteil braucht, ist Liquid AI d1-omni-600M die falsche Hälfte des Paares, und die ehrliche Antwort ist, beides laufen zu lassen: LFM2.5-VL-3B, um die Lesart des Bildes zu erzeugen, Liquid AI d1-omni-600M, um die Entscheidung darüber zu erzeugen.

Es gibt keine direkte Vergleichszahl für die Sehleistung, und das ist der Befund.
Der instinktive nächste Schritt ist, die Vision-Benchmarks aufzureihen. Das geht nicht. Für LFM2.5-VL-3B veröffentlicht der Anbieter einen vollständigen Satz – RefCOCO Macro Precision@1 bei 87,9, ScreenSpot-v2 bei 80,7, ChartQA bei 81,3, POPE bei 88,7, MMStar bei 63,3, BLINK bei 61,5, MuirBench bei 58,3, ToolSandBox bei 59,5, OCRBench v2 English bei 47,5 und einen RealWorldQA-Wert von 73,1, der den Wert 71,1 des vorherigen LFM2-VL-3B knapp übertrifft. Alle diese Werte sind Anbieterangaben, keine davon wurde unabhängig erneut ausgeführt, und dennoch sind es konkrete Aussagen über konkrete Fähigkeiten, an denen ein Leser das Labor beim Wort nehmen kann.
Für Liquid AI d1-omni-600M heißt es im Release-Post, der Decision Index v0.3 enthalte einen privaten Vision-Split, „über den wir in diesem Release nicht berichten“, und dass Liquid stattdessen validiert habe, dass der 600M-Checkpoint „alle drei Modalitäten verarbeitet“, wobei die Belege in Playground-Demos zu finden sind. Das ist der gesamte veröffentlichte Vision-Nachweis. Es gibt keine Bild-Benchmark-Zahl für diesen Checkpoint, weder in seiner Modellkarte noch im Launch-Post. Derselbe Post bestätigt sogar noch direkter, was auf der Audio-Seite fehlt: dedizierte Audio-Decision-Benchmarks sind, mit den Worten des Anbieters, „derzeit ein offenes Problem“.
Die korrekte Lesart dieses Vergleichs ist asymmetrisch und sollte auch so formuliert werden. LFM2.5-VL-3B hat nachgewiesene Vision-Fähigkeit, mit Zahlen unterlegt. Liquid AI d1-omni-600M hat einen von einem Schwestermodell ausgeliehenen Vision-Encoder, einen gegen ein eingefrorenes Backbone trainierten Adapter, eine Demo und ein Versprechen. Wenn Ihr Deployment diesen Monat darauf angewiesen ist, dass das Modell bei Bildern richtig liegt, ist das 3B das einzige der beiden, das überhaupt etwas hat, worauf es sich stützen kann.
Geschwindigkeit: Nur eine davon wurde gemessen.
Da ein Entscheidungsmodell nichts generiert, ist die Latenz die entscheidende Zahl, und auch hier ist nur eine Seite dokumentiert. LFM2.5-VL-3B wird mit 228 Tokens pro Sekunde auf einem Apple M5 Max und 116 Tokens pro Sekunde auf einem AMD Ryzen AI Max+ 395 angegeben, beide innerhalb von 3,3 GB Speicher, mit etwa 20 Tokens pro Sekunde auf einem Galaxy S26 Ultra und ungefähr 11.000 Tokens pro Sekunde auf einer einzelnen H100 unter vLLM. Diese Zahlen beschreiben den Decode-Durchsatz, das richtige Maß für ein Modell, das schreibt.
Für Liquid AI d1-omni-600M gibt die Modellkarte an, dass keine Inferenzzahlen berichtet werden, da das Modell eine frühe Forschungsveröffentlichung ist und sich in aktiver Entwicklung befindet. Das d1-3B-Geschwistermodell in derselben Familie hat jedoch Latenztabellen – 8 ms für eine Frage auf einer RTX 4090, 16 ms auf einem Jetson AGX Thor, 26 ms auf einem Jetson AGX Orin 64 GB, 50 ms auf einem Orin Nano, wobei drei Fragen über einen Zustand etwa 1,3-mal so viel Zeit wie eine Frage kosten. Diese Zahlen gehören zum 3B-Entscheidungsmodell und dürfen nicht auf das 600M übertragen werden. Für Liquid AI d1-omni-600M ist die ehrliche Einschätzung, dass die Architektur ein kleines, schnelles Modell nahelegt und niemand außerhalb des Labors einen Millisekundenwert veröffentlicht hat.
Der Weight-Footprint lässt sich zumindest schätzen. Bei der von der Karte empfohlenen float16-Präzision sind 587 Mio. Parameter grob 1,2 GB an Gewichten vor Aktivierungen – eine Rechnung anhand der veröffentlichten Parameteranzahl, keine Herstellermessung – gegenüber den weniger als 3,3 GB, die Liquid für LFM2.5-VL-3B angibt. Auf einem Gerät, auf dem Megabyte die Einschränkung darstellen, ist dieser Unterschied das Argument für die 600M-Variante.

Wie man zwischen ihnen wählt
Die Entscheidung löst sich sauber auf, sobald der Ausgabe-Vertrag als feststehend statt als verhandelbar behandelt wird.
Setzen Sie auf LFM2.5-VL-3B, wenn das Ergebnis Text ist: OCR über die ganze Seite mit Layout-Annotation, Grounding und Detektion aus natürlichsprachlichen Abfragen, Übersetzung von Beschilderung auf einem Gerät, jeder Schritt, in dem ein Mensch oder ein nachgelagertes Sprachmodell die Antwort verarbeitet. Es hat außerdem den breiteren Kontext bei 32.768 Tokens und die in der Praxis tiefere Sprachabdeckung, weil seine Antworten Sprache statt Labels sind.
Setzen Sie auf Liquid AI d1-omni-600M, wenn am Ende eine Entscheidung steht: ein Ticket weiterleiten, einen Frame triagieren, einen Clip moderieren, einen Guardrail steuern, eine Antwort auf einer Skala von zwei bis zehn bewerten — und, einzigartig unter diesen beiden, wenn die Eingabe Sprache ist. Es ist das einzige der beiden, das überhaupt Audio entgegennimmt, bis zu 30 Sekunden pro Anfrage, obwohl in seiner Modellkarte steht, dass das Audio mit Dialogen zwischen einem englischsprachigen Sprecher und einem Assistenten trainiert wurde, was eine enge Beschreibung der Welt ist, aus der Ihre Aufrufe kommen werden.
Greifen Sie zu keinem von beiden und bleiben Sie bei einem allgemeinen Vision-Language-Modell, wenn die Aufgabe Schlussfolgerungen über das Bild erfordert statt eines Auslesens oder eines Urteils darüber. Beide Modellkarten deuten nicht auf diesen Anwendungsfall hin, und Liquid AI d1-omni-600M hat keinen Mechanismus, um dies zu versuchen.
Einen experimentellen Checkpoint ausprobieren, ohne die Pipeline darauf zu setzen
Liquid AI d1-omni-600M ist, nach der eigenen Bezeichnung des Anbieters, eine frühe Forschungsveröffentlichung, und sein Vision- und Audioverhalten ist nicht benchmark-getestet. Das ist genau das Profil eines Modells, das man hinter einem Fallback evaluieren möchte, statt vor Kundinnen und Kunden. OrcaRouter routet 200+ Modelle über einen einzigen API-Schlüssel mit automatischem Failover zwischen Anbietern, was der günstige Weg ist, einen Checkpoint wie diesen auf einen Live-Pfad zu bringen: Wenn die experimentelle Route schlechter wird oder ein Anbieter ausfällt, landet die Anfrage ohne Codeänderung auf dem Fallback. Derselbe Schlüssel bedient jedes Modell, an das die Pipeline übergibt, zum Listenpreis des jeweiligen Anbieters, durchgereicht mit 0 % Aufschlag, sodass eine Preissenkung eines Anbieters noch am selben Tag Ihr Preis ist.
Eine Einschränkung, die genannt sei, weil sie von tragender Bedeutung ist: Die offenen d1-Modelle und die LFM2.5-VL-Familie sind heute nicht in unserem Katalog. Das Selbsthosting der Gewichte ist der Weg, den der Anbieter für beide empfiehlt, mit llama.cpp-Unterstützung ab dem ersten Tag auf Hardware von Apple, AMD, Qualcomm und NVIDIA, und sie auf einem gehosteten Endpunkt auszuführen bedeutet die eigene API des Anbieters oder Drittanbieterplattformen. Diese Seite als Verfügbarkeitsaussage zu lesen, wäre ein Fehler.

Was zu sehen
Die interessante Frage ist nicht, ob das 600M irgendwann das 3B bei irgendetwas schlägt — das wird es nicht, und dafür wurde es nicht gebaut. Sie lautet, ob Liquid AI den privaten Vision-Split veröffentlicht, den sie zurückgehalten hat, und ob jemand den Audio-Entscheidungs-Benchmark baut, von dem das Labor sagt, dass es ihn noch nicht gibt. Bis eines davon eintrifft, ist ein Vergleich zwischen Liquid AI d1-omni-600M und LFM2.5-VL-3B ein Vergleich zwischen einem gemessenen Modell und einem plausiblen. Für nicht gemessene Arbeit — Sprache rein, Urteil raus, klein genug, um auf dem Gerät Platz zu finden — ist das 600M der einzige Open-Weight-Checkpoint in dieser Familie, der es versucht, und als Erster dazustehen, ohne Anzeigetafel, heißt immer noch, Erster zu sein.
OrcaRouter leitet über 200 Modelle über einen einzigen API-Schlüssel weiter, wobei der Listenpreis jedes Anbieters mit 0 % Aufschlag weitergegeben wird, sodass eine Preissenkung des Anbieters noch am selben Tag Ihr Preis ist.
