Eine Hero-Titelkarte mit der Überschrift „Liquid AI d1-3B vs Granite 4.2 3B“ und der Unterüberschrift „einer entscheidet, einer schreibt“, die links eine Karte mit der Bezeichnung d1-3B und einem Checklisten-Symbol zeigt, mit der Beschriftung „3.12B - 32,768 Tokens“ und Chips mit der Aufschrift Wahrscheinlichkeit, Label und Score, sowie rechts eine Karte mit der Bezeichnung Granite 4.2 3B und einem Sprechblasen-Symbol, mit der Beschriftung „3B - 128K Tokens“ und einem Chip mit der Aufschrift „eine geschriebene Antwort“.
Guides & Insights

Liquid AI d1-3B vs. Granite 4.2 3B: Zwei 3B-Modelle, die niemals dieselbe Aufgabe erledigen

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Setzt man Liquid AI d1-3B und Granite 4.2 3B auf ein und dieselbe GPU, bekommen beide bequem Platz — 3,12B Parameter auf der einen Seite, 3B auf der anderen. Sie werden sich außerdem so verhalten, als kämen sie aus unterschiedlichen Disziplinen. Granite 4.2 3B, das laut der eigenen Modellkarte von IBM auf den 25. August 2026 datiert ist, ist ein Reasoning-Modell: drei Denkmodi, ein <think>-Block und eine Antwort, die man liest. Liquid AI d1-3B, am 5. Oktober 2026 auf Hugging Face hochgeladen und zwei Tage später von Liquid angekündigt, ist ein Entscheidungsmodell: Es nimmt einen Zustand plus eine explizite Menge typisierter Fragen und gibt in einem einzigen Vorwärtsdurchlauf eine Wahrscheinlichkeit, ein Label oder eine Position auf einer Skala zurück und meldet dabei output_tokens: 0, weil es nie etwas schreibt. Die nützliche Frage ist nicht, welches von beiden besser ist. Sie lautet, welcher deiner Aufrufe tatsächlich eine Entscheidung ist, denn die beiden Repos sind für die entgegengesetzten Hälften dieser Aufteilung gebaut.

Was ist tatsächlich in jedem Repository enthalten?

Alles Folgende stammt aus den beiden Modellkarten und Liquid's Ankündigungsbeitrag. Nichts davon wurde unabhängig reproduziert, kein Dritter hat eines der beiden Modelle mit demselben Harness bewertet, und die Zahlen in den Karten stammen von den Anbietern selbst.

• Größe — Liquid AI d1-3B: 3,12B insgesamt, basiert auf Liquid's LFM2.5-VL-3B; Granite 4.2 3B: ein dichter Decoder-only-Transformer mit 3B, basiert auf granite-4.1-3b-base

• Ausgabe — d1-3B gibt Wahrscheinlichkeiten, Labels und Konfidenzwerte zurück und schreibt überhaupt keinen Text; Granite 4.2 3B generiert Tokens, einschließlich einer optionalen Gedankenkette innerhalb von <think>-Tags

• Kontext — d1-3B 32.768 Token; Granite 4.2 3B 128K nativ, mit einer Langkontext-Erweiterung auf 512K auf der Karte

• Eingabe — d1-3B Text, JSON, Bilder oder eine Mischung, durch einen SigLIP2 NaFlex 400M Vision-Encoder; Granite 4.2 3B nur Text

• Lizenz — d1-3B unter Liquid's LFM Open License v1.0; Granite 4.2 3B unter Apache 2.0

• Sprachen — d1-3B listet 16 auf; Granite 4.2 3B listet zwölf getestete auf, wobei die Karte anmerkt, dass andere nicht getestet sind

• Bereitstellung — d1-3B wird mit benutzerdefiniertem Code ausgeliefert (trust_remote_code=True, transformers>=5.14), mit GGUF- und w8a8-Repos in derselben Familie und für llama.cpp, Ollama und LM Studio dokumentierte Modellkarten; Granite 4.2 3B läuft unter vLLM 0.20+ oder SGLang 0.5.18+ mit einem benutzerdefinierten Thinking-Parser

Zwei dieser Zeilen leisten mehr als der Rest. Die Output-Zeile ist das ganze Argument dieses Artikels, und die Lizenz-Zeile ist diejenige, die niemand in die Vergleichstabelle aufnimmt.

A two-column scoreboard for Liquid AI d1-3B and Granite 4.2 3B. The d1-3B column reads: job answers a typed question; parameters 3.12B; output tokens billed 0; context 32,768 tokens; image input yes; one question 8 ms on an RTX 4090. The Granite 4.2 3B column reads: job writes a reasoned answer; parameters 3B; output tokens billed every token it writes; context 128K, to 512K extended; image input no; one question a full thinking pass. The footer reads 'Both columns vendor-reported, neither independently scored.'

Der eine schreibt eine Gedankenkette, der andere weigert sich zu schreiben.

Granite 4.2 3B verdient seine Daseinsberechtigung, indem es laut denkt. Seine Model Card dokumentiert drei Modi: standardmäßig aktives Denken, Nicht-Denken und einen Low-Effort-Modus, der den Reasoning-Trace beibehält, aber verkürzt. Die Serving-Stacks trennen den Trace von der endgültigen Antwort, sodass Ihre Anwendung sauberen Inhalt plus ein separates Reasoning-Feld erhält. Das ist ein gutes Design für eine Frage, die ausgearbeitet werden muss – ein Matheproblem, ein Zweig der Logik, ein Stück Code, das geschrieben werden muss, bevor es beurteilt werden kann.

d1-3B has no such mode, and its card says so bluntly: "It is not a chat model and does not write text." A call declares questions with a type. noul is a yes/no returning P(yes) between 0 and 1. choice picks one label from a named option set and returns the label, a confidence and a probability per option. score places the state on an ordered two-to-ten scale and returns the expected level with its distribution and legend. The signal is read from the logits at a placeholder position in one pass, not sampled token by token, which is why the usage block can report zero output tokens without lying.

Dieser Unterschied verändert Ihre Rechnung, bevor er Ihre Genauigkeit verändert. Ein Granite-Klassifizierungsaufruf, der über 400 Tokens nachdenkt, ist ein Aufruf, für den Sie 400 Ausgabe-Tokens bezahlen, und das gewünschte Label ist in Prosa begraben, die ein Parser dann herausholen muss. Ein d1-3B-Aufruf berechnet nur die Eingabe. Wenn es bei dem Großteil Ihres Traffics um ein Label mit einer angehängten Regel geht, haben Sie für das Reasoning bezahlt, unabhängig davon, ob es das Label geändert hat.

Wo Granite 4.2 3B eindeutig die bessere Wahl ist

Nimmt man die Reasoning-Benchmarks für bare Münze – sie stammen von IBM selbst, laufen durch eine interne Pipeline des NeMo Evaluator, und keine externe Instanz hat sie reproduziert –, dann ist das 3B-Modell für seine Größe ungewöhnlich stark: AIME25 78,33, HMMT Februar 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78 und RULER 64K 67,52, was bei 128K auf 55,30 fällt.

Aus dieser Liste ergeben sich vier Aufgaben, und d1-3B ist in keiner davon enthalten.

• Ein 128K-nativer Kontext, erweiterbar auf 512K, gegenüber 32.768 Token bei d1-3B — wenn es sich bei Ihrem Zustand um ein langes Dokument handelt, ist die Wahl für Sie bereits getroffen

• Agentisches Tool-Calling mit einem dokumentierten Parser und Harness-Integrationen für OpenCode, Pi und OpenHands, wofür ein Entscheidungsmodell kein Äquivalent hat

• Jede Aufgabe, deren Antwort ein Absatz ist: Zusammenfassung, Textentwurf, Extraktion in eine freie Struktur, Code-Generierung

• Feintuning und Weiterverbreitung ohne Umsatzobergrenze, da Apache 2.0 keine Schwellenwertklausel hat

Beachten Sie, was nicht auf der Granite-Karte steht: Die SWE-Bench- und Terminal-Bench-Zeilen sind für das 3B mit NA gekennzeichnet. IBMs agentische Reinforcement-Learning-Phase wurde nur auf die 8B- und 30B-Mitglieder der Familie angewendet, daher trägt das kleinste Modell nicht die agentischen Scores, die seine größeren Geschwister aufweisen. Ein Team, das „Granite 4.2“ liest und annimmt, dass das 3B das agentische Profil der Familie erbt, wird überrascht sein.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that releases d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57 and the claim that it is ahead of every model under 10B, and its latency of 8 ms on an NVIDIA GeForce RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Wo d1-3B gewinnt, bevor Granite mit dem Denken fertig ist

Liquids eigene Latenztabelle, im warmen Zustand gemessen, eine Anfrage nach der anderen, ist der stärkste Teil seiner Argumentation: eine einzelne Frage in 8 ms auf einer RTX 4090 und 9 ms auf einer AMD MI325X, 16 ms auf einem Jetson AGX Thor und 26 ms auf einem Jetson AGX Orin 64GB, wobei 64 Zustände in einem Durchgang mit 475/s auf der 4090 und 1.106/s auf der MI325X gepackt werden. Zum Vergleich: Das ist ungefähr die Zeit, die Granite 4.2 3B braucht, um ein paar Tokens seiner Reasoning-Trace auszugeben.

Drei Fragetypen über einen Zustand kosten d1-3B 21 ms auf der 4090 statt drei separater Aufrufe, weil der Zustand und seine Bilder einmal für alle Fragen gelesen werden. In einem Moderations- oder Routing-Stack, der früher eine HTTP-Anfrage pro Regel auslöste, ist das der Unterschied zwischen einer Warteschlange von Aufrufen und einem einzigen.

Es sieht ebenfalls. d1-3B erzielt einen Mittelwert von 74,1 über elf öffentliche Bild-Benchmarks gegenüber 73,9 für sein Basismodell, und die Karte merkt an, dass dieselben Fragen ohne die Bilder 45,1 erzielen — die Antworten kommen aus dem Bild, nicht aus dem Text-Prompt. Einzelne Zeilen fallen gemischt aus (CV-Bench 82,1 gegenüber 87,6 des Basismodells, POPE 88,5 gegenüber 90,1), sodass die Vision-Behauptung „auf Augenhöhe mit dem Basismodell“ lautet, nicht „besser als dieses“.

Das ehrliche Gegengewicht: Die 48,57 von d1-3B auf dem Decision Index 0.2.1 wurden von Liquid erzeugt, das den offiziellen Scorer selbst laufen ließ, und nicht durch eine Leaderboard-Einreichung, und die konkurrierenden Zeilen stammen aus dem öffentlichen Leaderboard. Sein Mittelwert von 77,1 über acht Benchmark-als-Entscheidungs-Aufgaben und seine 71,8 bei DecisionBench stammen ebenfalls aus erster Hand. Alles auf der d1-Seite dieses Vergleichs ist unverifiziert.

A capture of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the Apache 2.0 licence, the 3B parameter count, the decoder-only dense architecture built on Granite-4.1-3B-Base, the 128K native context with long-context extension to 512K, bfloat16 precision, the tested-language list and the built-in chain-of-thought reasoning mode.

Warum ein 3B-Reasoner kein 3B-Entscheidungsmodell ist

Der verlockende Zug ist, Granite 4.2 3B als billigeren Ersatz für d1-3B zu behandeln, oder umgekehrt. Beide scheitern, und das Scheitern ist strukturell und keine Frage der Qualität.

Bitten Sie Granite zu entscheiden, erhalten Sie eine Generierung, die Sie parsen müssen, eine Rechnung, die damit skaliert, wie schwer die Frage für das Modell war, und eine Latenz, die vom gewählten Denkmodus abhängt. Bitten Sie d1-3B zu schlussfolgern, erhalten Sie überhaupt nichts – es hat keinen Token-Stream, in dem es schlussfolgern könnte. Die beiden Modelle liegen auf entgegengesetzten Seiten einer Linie, die die meisten Pipelines mehrmals pro Anfrage überschreiten: Etwas muss entscheiden, und etwas muss sprechen. d1-3B gehört nach vorn, wo eine Triage-Regel eine Route auswählt und eine kalibrierte Konfidenz zurückgibt. Granite 4.2 3B gehört dahinter, in den Zweig, in dem eine Antwort geschrieben werden muss.

Es gibt eine zweite, leisere Falle. Der Wert eines Entscheidungsmodells liegt in der Kalibrierung – eine Konfidenz von 0,9, die in neun von zehn Fällen richtig ist. Die Modellkarte von Granite 4.2 3B veröffentlicht keine Kalibrierungsmetriken und keine Wahrscheinlichkeiten; sie veröffentlicht Genauigkeits- und Reasoning-Scores. Ein Vergleich der beiden in einer Benchmark-Bestenliste sagt Ihnen nichts darüber, welchem von ihnen Sie bei einem Schwellenwert vertrauen sollten.

Die Lizenzzeile, die niemand in die Tabelle einträgt

Granite 4 3B steht unter Apache 2.0. d1-3B steht unter der LFM Open License v1.0, die bis Abschnitt 5 permissiv erscheint: Kommerzielle Nutzung wird unter der Bedingung gewährt, dass Sie oder Ihre juristische Person unter einer Schwelle bleiben, die im selben Dokument als Jahresumsatz von zehn Millionen US-Dollar oder mehr definiert ist, und jede kommerzielle Nutzung oberhalb dieser Grenze ist schlicht nicht lizenziert. Gemeinnützige Organisationen und Forschungsnutzer sind ausgenommen.

Für einen Hobbyisten oder ein Startup ist das kein Problem. Für ein Unternehmen, das diese Grenze mitten im Jahr überschreitet — oder das von einem solchen übernommen werden könnte —, sind die beiden Repos keine gleichwertigen Artefakte, egal wie ähnlich ihre Parameterzahlen aussehen, und die Lizenzprüfung erfolgt lange, nachdem jemand den Prototyp bereits ausgeliefert hat. Es ist das Billigste auf dieser Seite, das sich früh prüfen lässt.

Das Paar als eine Pipeline ausführen

Keines der beiden Modelle ist heute in unserem Katalog, daher ist dies keine Verfügbarkeitsaussage: Beide sind selbst gehostete Artefakte, und Granite 4.2 3B insbesondere hat auf seiner Karte überhaupt keine Inferenz-Anbieter aufgeführt. Aber das Muster, bei dem ein Team tatsächlich landet, ist ein Aufruf, der entscheidet, und ein anderer, der spricht, und genau in diesem Muster verdient sich eine Routing-Schicht ihren Platz. OrcaRouter stellt mehr als 200 Modelle hinter einen einzigen API-Schlüssel mit Anbieter-Listenpreisen, die mit 0 % Aufschlag weitergegeben werden, sodass eine Preissenkung eines Anbieters noch am selben Tag auf Ihrer Rechnung ankommt und nicht erst bei der nächsten Vertragsverlängerung, und automatisches Failover über Anbieter hinweg bedeutet, dass die gemeinsame Komponente in der Mitte einer Pipeline nicht zu einem Single Point of Failure wird, während Sie sie noch evaluieren. Wenn Sie d1-3B gegen einen gehosteten Generalisten mit Ihrem eigenen Traffic per A/B-Test vergleichen möchten, bevor Sie sich für ein selbst gehostetes Deployment entscheiden, ist der nächstgelegene geroutete Nachbar aus Granites Abstammungslinie Gemma 4 31B bei 0,13 $ pro Million Eingabe-Token und 0,38 $ pro Million Ausgabe-Token — ein deutlich größeres Modell, aber dieselbe Rolle als „Generalist, der schreibt" in der Pipeline.

Das Urteil, als Regel formuliert

Wenn Sie eine Einschätzung brauchen – Spam oder nicht, welche Warteschlange, wie dringend, passt dieses Bild zu dieser Beschreibung –, ist d1-3B das einzige der beiden, das die Aufgabe in einem Durchgang erledigt, und das in einstelligen Millisekunden. Wenn Sie eine schriftliche Antwort, das Lesen eines langen Dokuments, einen Tool-Aufruf oder ein Stück Code brauchen, ist Granite 4.2 3B derjenige, der überhaupt einen Token-Stream hat, und die Reasoning-Werte des 3B sind für seine Größe wirklich beeindruckend – in IBMs eigenen Evals, die allerdings noch niemand überprüft hat.

Was das Bild ändern würde, ist nicht eine neue Benchmark-Zeile. Es ist ein Dritter, der beide Modelle an demselben Kalibrierungs-Harness bewertet, denn die Eigenschaft, die entscheidet, ob man für ein Modell einen Schwellenwert festlegen kann, ist genau die, die man mit keiner der beiden Modellkarten heute vergleichen kann.