
Liquid AI d1-3B vs. Gemma 4 12B: Ein Entscheidungsmodell gegen einen Generalisten
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Der schnellste Weg, diesen Vergleich falsch hinzubekommen, ist, Liquid AI d1-3B und Gemma 4 12B auf denselben Benchmark zu setzen und auf einen Sieger zu warten. Sie beantworten nicht dieselbe Frage. Liquid AI d1-3B ist ein 3,12B-Entscheidungsmodell, das am 7. Oktober 2026 als offene Gewichte veröffentlicht wurde: Man gibt ihm einen Zustand und eine Menge benannter Fragen, und es liefert Wahrscheinlichkeiten, ein gewähltes Label und eine Konfidenz zurück – mit null Ausgabe-Tokens und ohne Generierungsschritt. Gemma 4 12B ist Googles encoder-freier Any-to-Any-Generalist, ein 11,96B-Checkpoint, der Text, Bild, Audio und Video entgegennimmt und über ein 256.000-Token-Fenster in mehr als 140 Sprachen eine Antwort schreibt. Das eine sagt dir, welche von vier Dingen eine Leiterplatte ist. Das andere sagt dir, warum. Vergleicht man sie nur anhand der Qualität, lernt man nichts, weil die Ausgaben nicht miteinander vergleichbar sind – und die Anbieter haben sie nie gegeneinander gebenchmarkt. Vergleicht man sie danach, was ein Aufruf tatsächlich zurückgibt, was er kostet und wo jeder von beiden nicht mehr weiterkommt, wird das Paar zu einem wirklich nützlichen Grenztest.
Zwei verschiedene Ausgabeverträge
Der Unterschied, der hier die ganze Arbeit leistet, ist das, was über die Leitung zurückkommt.
Liquid AI d1-3B gibt ein strukturiertes Antwortobjekt zurück. Jede Frage in einer Anfrage deklariert einen Typ – noul für Ja/Nein mit P(Ja), choice für eine aus einer benannten Optionsmenge mit einer Konfidenz und einer Wahrscheinlichkeit pro Option oder score für eine Position auf einer geordneten Skala mit zwei bis zehn Stufen zusammen mit der erwarteten Stufe und ihrer Verteilung. Das Modell meldet output_tokens: 0, weil nichts geschrieben wird. Mehrere Fragen zu einem Zustand werden aus einem einzigen Vorwärtsdurchlauf gelesen, und der Zustand und seine Bilder werden einmal für alle von ihnen kodiert.
Gemma 4 12B gibt Prosa zurück. Manchmal gibt es das JSON zurück, das Sie angefordert haben, manchmal gibt es JSON zurück, das Sie nicht genau angefordert haben, und es kann vor der Antwort nachdenken. Es ist zuallererst ein Sprachmodell: Alles, was es zu klassifizieren weiß, drückt es als Text aus. Das ist ein Vorteil, wenn die Antwort einem Menschen erklärt werden muss oder in einen nachgelagerten Schritt eingespeist wird, der Sprache erwartet, und ein Preis, wenn das Einzige, was Sie brauchten, eine Wahrscheinlichkeit war.
Alles Nachgelagerte folgt daraus. Eine d1-3B-Antwort kann nicht am Parsen scheitern. Sie kann sich auch nicht selbst erklären, und die Model Card sagt es direkt: Sie ist kein Chat-Modell und sie schreibt keinen Text.
Wo die Beweisspuren stehen
Die Herkunft der beiden Zahlensätze ist nicht gleichwertig, und das zählt hier mehr als die Zahlen selbst.
• Decision Index 0.2.1 — Liquid AI d1-3B erreicht 48,57, bewertet vom Anbieter mit dem offiziellen Scorer, an erster Stelle unter den Modellen unter 10B und vor Decider 35B-A3B mit 47,11. Gemma 4 12B wird im Decision Index überhaupt nicht bewertet, daher hat diese Zeile kein Gegenstück.
• Reasoning-Benchmarks — Gemma 4 12B erzielt 77,5 bei AIME 2026, 78,8 bei GPQA Diamond und 1.659 Codeforces-ELO und weist einen Artificial Analysis Intelligence Index von 22 im Reasoning-Modus und 13 bei deaktiviertem Reasoning auf. Liquid AI d1-3B hat keinen Reasoning-Benchmark, weil ein Entscheidungsmodell keine Reasoning-Spur erzeugt, die bewertet werden kann.
• Langer Kontext — Gemma 4 12B akzeptiert 256.000 Token und erzielt 43,4 % bei MRCR v2 eight-needle mit 128k auf Googles eigener Modellkarte. Liquid AI d1-3B akzeptiert 32.768 Token. Wenn Ihr „State“ aus einem vierzigseitigen Dokument plus Scans besteht, ist diese Lücke die ganze Entscheidung – und sie ist alles andere als knapp.
• Vision — Liquid AI d1-3B erzielt über elf öffentliche Bild-Benchmarks hinweg einen Durchschnitt von 74,1, wenn man diese als Entscheidungen über das jeweilige Optionsset des Benchmarks liest, gegenüber 73,9 für das LFM2.5-VL-3B-Backbone, aus dem es hervorgegangen ist; der Anbieter berichtet, dass das Entfernen der Bilder dieselben Fragen auf 45,1 sinken lässt. Die Vision von Gemma 4 12B ist stärker und breiter, sie wird jedoch als Generierungsqualität ausgewiesen, nicht als Entscheidungsgenauigkeit über benannte Optionen.
• Sprachen — sechzehn dokumentiert für Liquid AI d1-3B; mehr als 140 für Gemma 4 12B.
• Geschwindigkeit — Liquid AI d1-3B beantwortet eine Frage in 8 ms auf einer RTX 4090, 16 ms auf einem Jetson AGX Thor, 26 ms auf einem Jetson AGX Orin 64 GB und 50 ms auf einem Jetson Orin Nano und packt 64 Zustände in einem einzigen Durchlauf mit 475 pro Sekunde auf der 4090. Gemma 4 12B generiert, daher ist seine Latenz eine Funktion davon, wie viele Tokens es schreibt.
• Qualität der Belege — Die Ergebnisse von Gemma 4 12B stammen von Google, wurden im Juni 2026 veröffentlicht und seitdem von einer großen Community begutachtet, quantisiert und erneut ausgeführt. Die von Liquid AI d1-3B stammen von Liquid, wurden vor zwei Tagen veröffentlicht und von niemandem außerhalb des Labors reproduziert. Lesen Sie die zweite Spalte entsprechend.

Die einzige Stelle, an der sie wirklich konkurrieren.
Es gibt eine echte Überschneidung, und sie liegt nicht auf einem Leaderboard. Es ist der LLM-as-a-judge-Aufruf.
Viele Produktions-Pipelines setzen bereits einen mittelgroßen Generalisten als Bewertungsschicht ein: die Dringlichkeit dieses Tickets bewerten, entscheiden, ob diese Ausgabe ein Bewertungsraster besteht, auswählen, welches Tool der Agent als Nächstes aufrufen soll, prüfen, ob eine abgerufene Passage die Frage beantwortet. Heute gehen die meisten dieser Aufrufe an ein generatives Modell, das gebeten wird, eine Zahl oder ein Label als Text auszugeben, und die Zahl, die es ausgibt, ist das, was der Sampler produziert hat, und nicht ein Softmax über Ihre Optionsmenge. Das ist der Workflow, den Liquid AI d1-3B durch Post-Training ersetzen sollte, und die veröffentlichten Demos sind alle Varianten davon — ein SQL-Prädikat, das für 150 Support-Tickets Ja oder Nein antwortet, eine Agenten-Kontextkomprimierungsschleife, die jede Tool-Ausgabe behält, kürzt oder verwirft und 52 % der Tokens entfernt, eine App zur visuellen Inspektion, die gute und defekte Teile aus vier Produktionslinien mit 85 bis 97 % Genauigkeit bei einer Aufgabe sortierte, für die sie nie trainiert wurde.
Gemma 4 12B erledigt all diese Aufgaben und noch mehr als das. Es kann auch die Zusammenfassung schreiben, ein 256K-Dokument im Blick behalten, einen aufgezeichneten Telefonanruf als Eingabe verarbeiten und in einer von über 140 Sprachen antworten. Wenn Ihre Pipeline eine Bewertung und eine Erzählung braucht, erledigt das 12B zwei Aufgaben mit einem Aufruf, und das 3B-Entscheidungsmodell erledigt eine davon.
Die Grenze sind Kontextlänge und Ausgabeform. Langer Zustand, gesprochene Eingabe, viele Sprachen oder eine Erklärung, die der Leser erwartet – Gemma 4 12B, keine Frage. Kurzer Zustand, eine feste Optionsmenge, ein Latenzbudget pro Anfrage im einstelligen Millisekundenbereich oder eine harte Garantie, dass die Antwort geparst werden kann – das ist die d1-3B-Spalte, und der Generalist zahlt für Fähigkeiten, die Sie nicht nutzen werden.
Was es kostet, jeden Einzelnen anzurufen
Keines der beiden Modelle ist in unserem Katalog, daher gibt es für keines von beiden einen Routing-Preis, den wir nennen könnten — Gemma 4 12B gehört nicht zu den Gemma-Größen, die wir anbieten, und Liquid AI d1-3B sind offene Gewichte, die Sie selbst hosten oder über die eigene API des Anbieters und Drittanbieterplattformen erreichen. Zur Einordnung auf der Gemini-nahen Seite dieser Familie: Die beiden Gemma 4-Größen, die wir tatsächlich routen, sind mit 0,06 $ pro Million Eingabe- und 0,33 $ pro Million Ausgabe-Token für Gemma 4 26B A4B sowie mit 0,13 $ und 0,38 $ für Gemma 4 31B gelistet, beide mit Kontexten von 262.144 Token und Text-, Bild- und Videoeingabe. Der Median der Anbieterpreise, der anderswo für Gemma 4 12B genannt wird, liegt bei etwa 0,10 $ und 0,30 $.
Liquids gehostetes d1 berechnet nur Input-Tokens, zu 0,04 $ pro Million, wobei Bilder als Input mit 1,5 Tokens pro 32×32-Pixel-Patch gezählt werden. Eine Entscheidungsanfrage hat daher überhaupt keine Output-Token-Zeile, was der strukturelle Grund dafür ist, dass der eigene Kostenvergleich des Anbieters mit deutlich größeren Modellen dort landet, wo er landet. Die offenen Gewichte haben keinen Preis pro Aufruf; bezahlt wird mit Hardware. Beide müssen in derselben Pipeline sitzen wie alles andere, was Sie aufrufen, und das ist genau die Ebene, für die ein Router existiert — eine API über 200+ Modelle, Anbieter-Listenpreise zu 0 % Aufschlag durchgereicht, und automatisches Failover, damit ein einzelner Upstream-Aussetzer nicht zu Ihrem Ausfall wird. Das ist die Infrastruktur rund um den Vergleich, nicht der Vergleich.

Wie man sich entscheidet, ehrlich gesagt
Gehe vom Antwortformat aus, nicht vom Modell. Wenn das nachgelagerte System eine Wahrscheinlichkeit, ein Label, eine Konfidenz verarbeiten kann und die Antwortmenge klein und bekannt ist, ist Liquid AI d1-3B kein Downgrade gegenüber einem 12B, sondern ein anderes Instrument, und die Latenzzahlen machen es zu einem kategorisch anderen Deployment: 50 ms auf einem Jetson Orin Nano ist ein Gerät, das auf keinen Fall ein 12B ausführen sollte.
Wenn die Antwort ein Satz sein muss, oder der Zustand länger als zweiunddreißigtausend Token ist, oder jemand ihn vorlesen wird, oder die Ausgabesprache Bengali ist, dann ist Gemma 4 12B die einzige der beiden, die die Aufgabe erledigen kann, und der Vergleich ist vorbei, bevor er beginnt.
Die wirklich nützliche Position für die meisten Teams ist beides, an unterschiedlichen Stellen. Ein Entscheidungsmodell vor dem teuren Aufruf, das die Triage, das Routing und die Guardrail-Prüfungen übernimmt, die keine Sprache benötigen; ein Generalist dahinter für die Arbeit, die sie benötigt. Das ist dieselbe Pipeline, das eine ist ein Filter und das andere die Nutzlast – und die Teams, die am meisten aus dem d1-Release herausholen werden, sind die, die bereits ein 12B dafür bezahlen, Ja oder Nein zu beantworten.

