Eine Hero-Titelkarte mit der Überschrift „Liquid AI d1-3B vs MiniCPM5-2B“ und dem Untertitel „Wahrscheinlichkeiten oder Prosa, im Laptop-Maßstab“, die zwei durch ein Gleichheitszeichen verbundene Karten über einem breiten Chip mit der Aufschrift „beide passen auf einen Laptop“ zeigt: d1-3B mit einem Tacho-Symbol und einem Chip „ein Label und eine Konfidenz“, und MiniCPM5-2B mit einem Bleistift-Symbol und einem Chip „eine schriftliche Antwort“.
Guides & Insights

Liquid AI d1-3B vs MiniCPM5-2B: Wahrscheinlichkeiten oder Prosa, im Laptop-Maßstab

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Modelle mit offenen Gewichten, beide klein genug, um auf dem Rechner direkt vor Ihnen zu laufen, und sie sind sich uneinig darüber, was ein Modell zurückgeben sollte. Liquid AI d1-3B ist das 3,12B-Entscheidungsmodell von Liquid AI, am 7. Oktober 2026 mit offenen Gewichten veröffentlicht: Es liest einen Zustand und eine Reihe benannter Fragen und gibt in einem einzigen Vorwärtsdurchlauf ein Label, eine Wahrscheinlichkeit je Option und eine Konfidenz zurück, ohne dabei etwas zu generieren. MiniCPM5-2B ist das dichte 2,52B-Modell von ModelBest und OpenBMB, vorgestellt auf der World Artificial Intelligence Conference am 19. Juli und Anfang September 2026 still und leise unter Apache-2.0 auf Hugging Face veröffentlicht – ein Assistent für Reasoning, Coding und Tool-Calling, der Antworten schreibt, Funktionen in XML aufruft und bereits über eine Million Downloads hat. Das kleinere hat ein viermal so großes Kontextfenster und eine weitaus permissivere Lizenz; das größere kann nicht einmal ein Token erzeugen, selbst wenn Sie es wollten. Welche der beiden Formen in Ihre Pipeline gehört, hängt ganz davon ab, ob das, was dem Aufruf nachgelagert ist, eine Zahl oder einen Satz erwartet.

Die Umkehrung, die es zuerst zu beachten gilt

Fast jede intuitive Erwartung an diese Paarung ist genau umgekehrt, also fangen Sie dort an.

MiniCPM5-2B ist das kleinere Modell und hat den längeren Kontext: 131.072 Token gegenüber 32.768 bei Liquid AI d1-3B. Es ist außerdem von den beiden das mit der freizügigeren Lizenz — Apache-2.0, ohne Zugangsbeschränkung, wobei die Trainingsdatensätze zusammen mit den Gewichten als Teil der UltraData-Familie veröffentlicht werden. Liquid AI d1-3B wird unter Liquids eigener lfm1.0-Lizenz ausgeliefert, die herunterladbar und feinabstimmbar ist, aber eine Herstellerlizenz und keine standardmäßig permissive Lizenz ist.

Liquid AI d1-3B ist das größere Modell – 3,12B gegenüber 2,52B insgesamt, wobei der Vergleich bei Nicht-Embedding-Parametern wieder kippt – und es ist dasjenige, das nicht schreiben kann. Es verfügt über Bildverständnis; das MiniCPM ist ausschließlich textbasiert. Es ist für genau eine Sache nachtrainiert; das MiniCPM ist für viele nachtrainiert. Und während MiniCPM5-2B mit einem Vergleichsdiagramm daherkommt, das es an die Spitze seiner Größenklasse setzt, kommt Liquid AI d1-3B mit einem einzelnen Indexwert und einer Reihe von Latenztabellen.

Nichts davon macht eines besser. Es bedeutet, dass die beiden auf unterschiedliche Aufgaben ausgerichtet sind, und das verräterische Zeichen ist die Form der Antwort, die jedes zurückgibt.

Was kommt über die Leitung zurück?

MinCPM5-2B ist ein generatives Sprachmodell. Es denkt nach, es antwortet auf Fragen und gibt XML-ähnliche Ausgaben aus, die von SGLangs integriertem minicpm Parser in OpenAI-kompatible tool_calls umgewandelt werden, ohne einen benutzerdefinierten Adapter. Sein Post-Training ist der interessante Teil seiner Geschichte: 400 Milliarden Token Deep-Thinking-Supervised-Fine-Tuning, dann Reinforcement Learning mit einem kritikerbasierten Algorithmus, der von JustRL II übernommen wurde, dann On-Policy-Distillation, die sechzehn spezialisierte RL-Lehrer – fünf davon agentisch – zurück in ein dichtes Netzwerk faltet. Die Karte schreibt RL plus Distillation einen durchschnittlichen Gewinn von 10,96 Punkten bei Reasoning- und allgemeinen Aufgaben und 6,96 bei agentischen zu und berichtet einen Durchschnitt von 53,9 über ihr eigenes Vergleichsset, über dem größten in diesem Set enthaltenen Modell. Das sind ModelBests Zahlen, intern erstellt, ohne dass bisher eine unabhängige Reproduktion veröffentlicht wurde.

Liquid AI d1-3B gibt Struktur zurück. Eine noul-Frage kommt als P(yes) zwischen 0 und 1 zurück. Eine choice-Frage kommt als das Label, eine Konfidenz und eine Wahrscheinlichkeit pro Option zurück. Eine score-Frage kommt als erwartete Stufe auf einer geordneten Skala von zwei bis zehn mit ihrer Verteilung und Legende zurück. Das Usage-Objekt meldet output_tokens: 0, und es gibt einen rohen probabilities-Accessor, wenn Sie die unverarbeiteten Vektoren möchten. Sein Post-Training war die entgegengesetzte Art von Arbeit: zwei Checkpoints miteinander mitteln, mehrere Seeds über verschiedene Datenmischungen fein abstimmen, sie mergen, dann den Aufwand in das Long-Input-Training stecken, die Reihenfolge der Antwortoptionen durchmischen und Shortcuts aus den Trainingsdaten entfernen — denn ein Entscheidungsmodell, das lernt, „Option B ist meistens richtig“, statt den Zustand zu lesen, ist schlimmer als nutzlos.

Bei dem einen wird ein Modell gebeten, zu denken und dann etwas zu sagen. Bei dem anderen wird ein Modell gefragt, was es bereits glaubt.

A two-column scoreboard for Liquid AI d1-3B and MiniCPM5-2B. The d1-3B column reads: output label, confidence, probabilities; 3.12B parameters; 32,768-token context; text and image input; Liquid lfm1.0 licence; Decision Index 48.57 (vendor). The MiniCPM5-2B column reads: output generated text and tool calls; 2.52B dense parameters; 131,072-token context; text-only input; Apache-2.0 licence; Decision Index not scored. The footer reads 'Both sets vendor-reported; MiniCPM5-2B figures are ModelBest's own comparison set.'

Seite an Seite, mit gekennzeichneter Herkunft

Alle unten aufgeführten Zahlen sind vom Anbieter gemeldet. Die Zahlen von MiniCPM5-2B stammen aus ModelBests eigener Model Card und dem eigenen Vergleichsset; die von Liquid AI d1-3B stammen daher, dass Liquid den offiziellen Decision-Index-Scorer selbst ausgeführt hat, statt sich am öffentlichen Leaderboard zu beteiligen. Keines der beiden Modelle wurde zum Zeitpunkt der Open-Weights-Veröffentlichung von unabhängiger dritter Seite gebenchmarkt.

• Parameter — Liquid AI d1-3B 3,12B insgesamt mit einem 400M SigLIP2 Vision-Encoder und 128.000-Token-Vokabular; MiniCPM5-2B 2.516.756.480 insgesamt, 1.981.982.720 ohne Embedding, 42 Schichten, 16 Query-Heads zu 2 KV-Heads, Vokabular 130.560.

• Kontext — 32.768 Token für Liquid AI d1-3B; 131.072 für MiniCPM5-2B.

• Eingabemodalitäten — Text und Bilder für Liquid AI d1-3B; nur Text für MiniCPM5-2B.

• Ausgabe — Wahrscheinlichkeiten, Labels, Konfidenzwerte und geordnete Scores, bei null Ausgabe-Tokens, für Liquid AI d1-3B; generierter Text, Reasoning und XML-Tool-Aufrufe für MiniCPM5-2B.

• Schlagzeilen-Ergebnis — Liquid AI d1-3B 48,57 auf dem Decision Index 0.2.1, Erster unter Modellen unter 10B in der Tabelle des Anbieters; MiniCPM5-2B durchschnittlich 53,9 über den eigenen Vergleichssatz, bei dem es sich um einen anderen Satz handelt, der andere Dinge misst.

• Geschwindigkeit — 8 ms pro Frage auf einer RTX 4090, 26 ms auf einer Jetson AGX Orin 64 GB, 50 ms auf einer Jetson Orin Nano und 64 gepackte Zustände pro Durchlauf bei 475 pro Sekunde für Liquid AI d1-3B. Die Geschwindigkeit von MiniCPM5-2B hängt davon ab, wie viele Tokens es generiert, daher gibt es keine einzelne Zahl, die man ihm gegenüberstellen kann.

• Lizenz — Apache-2.0, ohne Zugangsbeschränkung, Trainingsdaten veröffentlicht, für MiniCPM5-2B; Liquid's lfm1.0 für Liquid AI d1-3B.

• Belege — über eine Million Downloads auf Hugging Face und einen Monat Community-Quantisierung für MiniCPM5-2B; zwei Tage seit Bestehen und kein Drittanbieter-Lauf für Liquid AI d1-3B.

Die Aufgabe, in der jeder Einzelne wirklich gut ist

Es gibt einen Workflow, den beide Modelle ausführen können, und der Unterschied darin, wie sie ihn ausführen, ist das ganze Argument.

Angenommen, Sie triagieren Support-Tickets, entscheiden, ob eine abgerufene Passage eine Frage beantwortet, oder bewerten die Ausgabe eines LLM anhand eines Bewertungsrasters. MiniCPM5-2B kann alle drei — es ist ein fähiger kleiner Reasoner mit Tool-Calling und langem Kontext, und Sie würden es wie jeden anderen Assistenten ausführen, eine Kennzeichnung anfordern und dann parsen, was auch immer zurückkommt. Manchmal gibt es sauberes JSON zurück. Manchmal gibt es JSON zurück, in das eine Erklärung eingehüllt ist. Manchmal gibt es die richtige Antwort in der falschen Form zurück, und dieses Verfehlen ist ein Fehler in Ihrem Parser und nicht im Modell.

Liquid AI d1-3B kann nichts anderes tun, und genau darum geht es. Bei denselben drei Aufgaben liefert es eine Wahrscheinlichkeit und ein Label und nichts zu parsen, drei Fragen über einen Zustand kosten das 1,3-Fache der Zeit von einer, und der Fehlermodus verschiebt sich von „das Format ist kaputtgegangen“ zu „die Konfidenz war fehlkalibriert“ – was zumindest messbar ist, denn die Konfidenz steht direkt in der Antwort.

Wo MiniCPM5-2B eindeutig punktet, ist alles, was auf die Entscheidung folgt. Es fasst 131K Token, sodass der Zustand ein kompletter Repository-Dateibaum oder ein langes Dokument sein kann statt nur dessen erste Seite. Es schreibt Tool-Aufrufe nativ. Es ist ein Modell, auf dem man einen kleinen Agenten aufbauen kann, und es wurde explizit für agentisches Arbeiten nachtrainiert. Und seine Apache-2.0-Lizenz bedeutet, dass das übliche Gespräch mit dem Wirtschaftsanwalt nicht stattfindet.

Wo Liquid AI d1-3B klar gewinnt, sind es die Latenzuntergrenze und die Modalität. Ein Gerät, das eine Entscheidung in 50 ms ohne GPU ausführt, ist kein Gerät, das MiniCPM5-2B ausführt; die beiden liegen trotz ähnlicher Parameterzahlen in unterschiedlichen Hardware-Klassen. Und das 3B sieht – der Anbieter meldet 74,1 über elf öffentliche Bild-Benchmarks, ausgewertet als Entscheidungen, gegenüber 73,9 für das Vision-Language-Modell, auf dem es basiert, und berichtet, dass das Entfernen der Bilder dieselben Fragen auf 45,1 zusammenbrechen lässt, was ihre Art ist zu zeigen, dass die Antworten aus den Pixeln stammen. Die visuelle Inspektion einer Produktionslinie ist überhaupt keine Aufgabe, die man dem rein textbasierten 2B übergeben kann.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Sie auszuführen und die Schicht um sie herum

Bei beiden handelt es sich um Self-Hosting-Geschichten, und bei beiden wurde die Deployment-Arbeit erledigt. Liquid AI d1-3B wird mit llama.cpp-Unterstützung ab Tag eins ausgeliefert, dem vollständigen NVIDIA-Stack von DGX bis Jetson, NVFP4-Quantisierung, einem 8-Bit-Gewichts-und-Aktivierungs-Build und bereits veröffentlichten GGUF-Konvertierungen. MiniCPM5-2B ist eine einfache LlamaForCausalLM-Architektur, die keine benutzerdefinierten Kernel erfordert, mit einem BF16-safetensors-Shard, GGUF- und MLX-Builds in der breiteren Familie und einer dokumentierten Präferenz für SGLang, wenn Sie den Tool-Call-Parser benötigen. Keines von beiden ist in unserem Katalog, und dieser Artikel ist kein Verfügbarkeitsanspruch für eines von beiden.

Die gehosteten Alternativen sind die eigene API des Anbieters und Plattformen Dritter. Liquid bietet das gehostete d1 an, das ausschließlich auf Basis von Eingabe-Tokens mit 0,04 $ pro Million bepreist wird, wobei Bilder als Eingabe mit 1,5 Tokens pro 32×32-Pixel-Patch abgerechnet werden und es gar keine Ausgabezeile gibt; MiniCPM5-2B hat keine eigene API, was für ein Open-Weights-Release unter Apache-2.0 normal ist.

Worauf beide hinauslaufen, ist dasselbe Architekturproblem. Ein lokales 2B- oder 3B-Modell, das Klassifizierung, Routing oder Guardrail-Prüfungen übernimmt, sitzt vor den generativen Aufrufen, die Sie nicht selbst hosten, und diese Mischung – eigene Inferenz neben gemieteter Inferenz – ist genau das, was eine Routing-Schicht auffangen soll. Ein Endpunkt über 200+ Modelle hinweg, Anbieter-Listenpreise zu 0 % Aufschlag durchgereicht, sodass eine Preisänderung eines Anbieters noch am selben Tag wirksam wird, automatisches Failover, wenn ein Upstream an Leistung verliert. Das kleine Modell selbst zu betreiben macht die Routing-Frage schwieriger, nicht einfacher, denn nun ist die Grenze zwischen Ihrer Hardware und der von jemand anderem eine Entscheidung, die Sie bei jeder Anfrage treffen müssen.

Nach Antworttyp auswählen

Wenn es sich bei dem, was Sie brauchen, um ein Label, eine Wahrscheinlichkeit oder eine Bewertung handelt und die Optionsmenge im Voraus bekannt ist, ist Liquid AI d1-3B das ehrlichere Instrument – es wurde für genau diese Anfrage gebaut, und die Antwort wird nicht fehlerhaft ankommen. Akzeptieren Sie die Anbieterlizenz, den 32K-Kontext und die zwei Tage alte Beweiskette als Preis.

Wenn Sie ein kleines Modell brauchen, das logisch schlussfolgern, Tools aufrufen, ein langes Dokument im Kontext behalten und in Worten antworten kann, ist MiniCPM5-2B die um Längen leistungsfähigere Maschine, und sie bringt Apache-2.0 sowie die Testerfahrung anderer Leute aus einer Million Downloads mit.

Die Teams, die aus dem einen oder anderen Release am meisten herausholen, sind die, die beide laufen lassen: ein Entscheidungsmodell davor, wo die Antwort eine Zahl ist und Millisekunden zählen, und ein kleines generatives Modell dahinter, für die Teile der Aufgabe, die Sprache brauchen. Sie sind keine Konkurrenten. Sie sind ein Filter und ein Sprecher.

A capture of our own models catalogue page showing the filter rail for input modalities, context length, input price, status and series, a header reading '207 models, 16 providers, one API key, one bill', and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.