
Liquid AI d1-3B vs. LFM2.5-2.6B-Base: Das Entscheidungsmodell und sein eigener Vorfahre
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Das ist kein Duell zwischen zwei Rivalen. Liquid AI d1-3B, das Open-Weight-Entscheidungsmodell, das Liquid AI am 7. Oktober 2026 veröffentlichte, wurde auf einer Basis aufgebaut, die der Anbieter konstruierte, indem er die Gewichte von LFM2.5-2.6B mit dem Text-Backbone von LFM2.5-VL-3B mittelte. LFM2.5-2.6B-Base ist dieses erste Elternmodell – der rohe vortrainierte Checkpoint, den Liquid am 1. August 2026 hochlud: 2,69 Mrd. Parameter, 34 Billionen Trainings-Tokens, 131.072-Token-Kontext, kein Instruction-Tuning und keine Chat-Vorlage. Die ehrliche Einordnung dieses Vergleichs ist also Nachfahre gegen Vorfahre: ein Modell, das auf eine ganz bestimmte Aufgabe nachtrainiert wurde und neben dem ungeformten Substrat steht, aus dem es geformt wurde. Eines von ihnen beantwortet heute Abend Fragen. Das andere ist der Ausgangspunkt, wenn die Frage, deren Antwort Sie brauchen, noch von niemandem gestellt wurde.
Was jedes einzelne tatsächlich ist
Die beiden Modellkarten lesen sich wie Dokumente aus verschiedenen Phasen einer Produktionslinie, und die Unterschiede sind nicht stilistischer Natur.
Liquid AI d1-3B verfügt über 3,12 Mrd. Parameter, einen SigLIP2-NaFlex-Vision-Encoder mit 400 M, ein Kontextfenster von 32.768 Tokens, einen Wortschatz von 128.000 Tokens und sechzehn dokumentierte Sprachen. Es ist ein Entscheidungsmodell: Man übergibt ihm einen Zustand und benannte Fragen, und es liefert eine Ja/Nein-Wahrscheinlichkeit, ein ausgewähltes Label mit Konfidenz und eine vollständige Optionsverteilung oder einen geordneten Score – in einem einzigen Vorwärtsdurchlauf, ohne generierte Ausgabe-Tokens. Es bietet einen system_one-Aufruf für einen Zustand mit mehreren Fragen, eine gebatchte Variante, die viele Anfragen ohne Padding bündelt, und einen rohen probabilities-Accessor für die zugrunde liegenden Verteilungen. Es ist kein Chat-Modell und schreibt keinen Text, und die Karte sagt es mit genau diesen Worten.
LFM2.5-2.6B-Base trägt 2,69 Mrd. Parameter in 30 Schichten — 22 doppelt gegatete Short-Convolution-Blöcke und 8 Grouped-Query-Attention-Blöcke — trainiert auf 34 Billionen Token und während des Midtrainings auf einen Kontext von 131.072 Token erweitert, mit demselben Vokabular von 128.000 Token und denselben sechzehn Sprachen. Es ist ein vortrainierter, rein textbasierter Checkpoint ohne Instruction-Tuning, ohne Benchmarks auf seiner Modellkarte und mit einer Empfehlung, die wie eine Warnung klingt: Verwenden Sie es nur für Aufgaben, die umfangreiches Fine-Tuning erfordern. Es vervollständigt Text. Es befolgt keine Anweisungen.
Beide sind Downloads ohne Zugangsschranke unter der eigenen offenen Lizenz von Liquid. Bei beiden steht der Text im Vordergrund. Keines von beiden ist in unserem Katalog, und nichts hier ist eine Verfügbarkeitsaussage für eines der beiden.

Die Abstammung ist der interessante Teil
Liquid hat kein frisches Modell feinabgestimmt, um die d1-Veröffentlichung zu erstellen. Es hat zwei Checkpoints – LFM2.5-2.6B und den Text-Tower von LFM2.5-VL-3B – gemittelt, um einen besseren Ausgangspunkt zu erhalten, und dann mehrere Läufe mit unterschiedlichen Zufalls-Seeds und Datenmischungen feinabgestimmt und diese wieder zusammengeführt. Die Darstellung des Anbieters, was das Ergebnis verbessert habe, ist auffällig frei von exotischer Technik: Training mit langen Eingaben, das Durchmischen der Reihenfolge, in der Antwortoptionen erscheinen, und das Entfernen von Abkürzungen aus den Trainingsdaten bewirkten mehr als jede fortgeschrittene Methode, die sie ausprobiert haben.
Dieses Detail der Shortcut-Entfernung verdient einen Moment des Innehaltens, weil es genau den Fehler benennt, den diese Kategorie zu vermeiden sucht. Ein Modell, das darauf trainiert wird, Multiple-Choice-Fragen zu beantworten, lernt bereitwillig, dass Option B normalerweise richtig ist oder dass die längste Option gewinnt. Das Durchmischen der Optionsreihenfolge während des Trainings ist das, was das verhindert. Ein Entscheidungsmodell, das einen Positions-Prior gelernt hat, statt den Zustand zu lesen, ist schlimmer als nutzlos — es irrt mit großer Zuversicht im großen Maßstab — und genau das unterscheidet ein echtes Entscheidungsmodell von einem Klassifikator mit einem Prompt.
Es gibt außerdem eine Regression, die es wert ist, klar benannt zu werden, weil der Anbieter das nicht tut: Der Basis-Checkpoint hat ein Kontextfenster von 131.072 Token, und Liquid AI d1-3B hat 32.768. Das Post-Training zu einem Entscheidungsmodell kostete drei Viertel des nutzbaren Kontexts. Wenn Sie annahmen, dass der Nachkomme seinen Vorfahren auf jeder Achse strikt dominiert: Tut er nicht, und Entscheidungen bei langen Dokumenten sind die Achse, auf der der ältere Checkpoint mehr Spielraum hat – prinzipiell, obwohl er keinen Entscheidungs-Head besitzt, um ihn zu nutzen.
Die Anzeigetafel, mit der beigefügten Asymmetrie
Diese beiden anhand von Benchmarks zu vergleichen, ist ein Kategorienfehler, aber es ist ein Kategorienfehler mit einer aufschlussreichen Form, also hier ist er, mit den entsprechenden Vorbehalten. Jeder Wert zu d1-3B stammt von Liquid selbst, wurde vom Anbieter mit dem offiziellen Scorer bewertet, statt bei einem öffentlichen Leaderboard eingereicht zu werden, und wurde von keiner dritten Partei reproduziert. Jeder Wert zu LFM2.5-2.6B-Base fehlt, weil ein Basismodell nichts zu messen hat.
• Decision Index 0.2.1 — Liquid AI d1-3B 48.57, an der Spitze von allem unter 10B in der Tabelle des Anbieters und vor einem Entscheidungsmodell, das zwölfmal so groß ist. LFM2.5-2.6B-Base — nicht bewertet, ohne einen Decision Head nicht bewertbar.
• Text-Benchmarks — Liquid AI d1-3B erreicht einen Durchschnitt von 82,9 über sieben öffentliche Benchmarks hinweg, die Verständnis, Toxizität, Intent, medizinische QA und sprachübergreifendes Verständnis abdecken. LFM2.5-2.6B-Base veröffentlicht überhaupt keine Benchmark-Tabelle.
• Vision — Liquid AI d1-3B erreicht im Durchschnitt 74,1 über elf Bild-Benchmarks, die als Entscheidungen ausgewertet werden; entfernt man die Bilder, sinken dieselben Fragen auf 45,1. LFM2.5-2.6B-Base ist rein textbasiert, ohne Vision-Tower.
• Parameter — 3,12 Mrd. gegenüber 2,69 Mrd. Das Entscheidungsmodell ist das größere der beiden, was das Gegenteil der üblichen Post-Training-Erzählung ist.
• Kontext — 32.768 Token gegen 131.072. Der Vorfahre gewinnt diese Zeile, und es ist die einzige Zeile, die er gewinnt.
• Latenz — Liquid AI d1-3B beantwortet eine einzelne Frage in 8 ms auf einer RTX 4090 und in 50 ms auf einem Jetson Orin Nano und verarbeitet auf der 4090 64 gepackte Zustände mit 475 pro Sekunde. LFM2.5-2.6B-Base hat keine Latenz zu nennen, bis Sie es zu etwas fine-tunen, das eine Frage beantwortet – dann ist die Zahl die Ihres Fine-Tunings.

Woraus Sie in der Praxis wählen
Die Entscheidungsregel ist hier ungewöhnlich sauber, weil die beiden Kontrollpunkte nicht um dieselbe Haushaltslinie konkurrieren.
Verwenden Sie Liquid AI d1-3B, wenn die Frage bereits existiert und eine der drei Formen annimmt, die ein Entscheidungsmodell verarbeitet: ein Ja oder Nein, eine Auswahl aus einer benannten Menge oder eine Bewertung auf einer geordneten Skala. Die veröffentlichten Anwendungen sind allesamt erkennbare Produktionsaufgaben – Triage und Routing, Moderation, Intent- und Themenklassifizierung, Extraktionsprüfungen, Reranking, Agent-Guardrails und visuelle Inspektion. Die vom Anbieter am 5. Oktober ermittelten Demo-Zahlen stellten d1 gegen GPT-6.1 Sol und Claude Opus 5.5 bei sechs solchen Aufgaben und behaupten, dass es GPT-6.1 Sol bei vier erreicht oder übertrifft, während es 19-mal bis 200-mal weniger kostet; die Methodikseite stellt klar, dass jede Anwendung einmal pro Modell ausgeführt wurde, also behandeln Sie die Form der Behauptung als den Befund, nicht die Nachkommastellen. Die wirklich auffällige ist die Inspektionsdemo: die Sortierung von einwandfreien versus defekten Teilen über vier Produktionslinien hinweg mit 85 bis 97 % Genauigkeit bei einer Aufgabe, für die das Modell nie trainiert wurde und die aus einer kurzen Beschreibung heraus verstanden wurde.
Nimm LFM2.5-2.6B-Base, wenn es die Frage noch nicht gibt. Es ist der günstigere Ausgangspunkt für ein Fine-Tuning, das du besitzen willst – ein domänenspezifischer Entscheidungs-Head, ein maßgeschneiderter Klassifikator, eine Aufgabe, für die niemand einen Checkpoint hat. Du erbst die Architektur, den Tokenizer und den langen Kontext, und du zahlst mit Rechenleistung, Daten und Evaluation. Zwei der vier Anwendungen, die der Anbieter rund um d1 gebaut hat, begannen mit Open-Source-Projekten statt bei null, was ein faires Bild davon ist, was ein Basis-Checkpoint plus Disziplin tatsächlich hervorbringt.
Die praktische Falle besteht darin, den Basis-Checkpoint als Drop-in-Ersatz zu behandeln. Er ist kein Assistent, er wird keinen Prompt befolgen, und als Chat-Modell bewertet erzielt er nahezu null Punkte – was keine Aussage über seine Qualität ist, sondern eine Aussage darüber, was „Base“ bedeutet.
Eines der beiden selbst hosten und die Ebene darüber.
Beide liegen als Gewichte vor, und der Anbieter hat die Deployment-Arbeit für die d1-Seite übernommen: llama.cpp-Unterstützung ab dem ersten Tag, der vollständige NVIDIA-Stack von DGX bis hinunter zu Jetson, NVFP4-Quantisierung, eine 8-Bit-Variante für Gewichte und Aktivierungen sowie GGUF-Konvertierungen auf Hugging Face. Der Basis-Checkpoint hat über die breitere LFM2.5-Familie eigene GGUF-, ONNX- und MLX-Varianten. Wenn Sie lieber nichts selbst hosten möchten, stellt Liquid das gehostete d1 über die eigene API bereit, die nur nach Input-Tokens abgerechnet wird, wobei Bilder mit 1,5 Tokens pro 32×32-Pixel-Patch berechnet werden; reiner Textzugriff ist auch über Drittanbieter-Plattformen verfügbar.
Was keiner der beiden Wege ändert, ist der Rest des Stacks. Ein Modell, das du selbst hostest, ist ein Modell, das du am Leben halten, versionieren und mit Failover betreiben musst — und die Entscheidungen, die es speist, landen trotzdem neben den generativen Aufrufen, die du nicht hostest. Genau diese Mischung bündelt ein Router zu einer Ebene: ein Endpunkt über 200+ Modelle hinweg, Anbieter-Listenpreise mit 0 % Aufschlag durchgereicht, sodass eine Preisänderung eines Anbieters bei dir noch am selben Tag wirksam wird, und automatisches Failover, damit ein schlechter Nachmittag eines Upstream-Anbieters nicht zu deinem Ausfall wird. Ein 3B-Entscheidungsmodell daneben selbst zu hosten, macht die Routing-Frage eher schärfer als weicher, denn jetzt besitzt du die eine Hälfte der Pipeline und mietest die andere.
Welches, für wen?
Wenn die Frage, die diese Woche beantwortet werden muss, eine der drei Formen ist, die ein Entscheidungsmodell annimmt, und es eine Frage ist, die sich bereits jemand anderes ausgedacht hat, ist der Nachfahre fertig und kostenlos und läuft in 50 ms auf einem Gerät ohne GPU – nimm Liquid AI d1-3B und damit hat es sich.
Wenn du das Ding baust, das eine Frage beantwortet, die noch niemand gestellt hat, und du die Daten und die Rechenleistung hast, um es zu besitzen, dann ist LFM2.5-2.6B-Base der ehrliche Ausgangspunkt, und es ist gut zu wissen, dass der Nachkomme in diesem Artikel aus ihm auf genau dem Weg entstanden ist, den du gleich einschlagen wirst.
Und wenn man nicht sicher ist, in welcher der beiden Situationen man sich befindet, ist die Antwort fast immer die erste. Post-Training in einen Decision Head ist der teure Schritt; den von jemand anderem laufen zu lassen ist kostenlos.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
