
Liquid AI d1-3B vs. Qwen 3 8B: Sollte eine 8B-Klassifizierungs-Workload auf ein Entscheidungsmodell umziehen?
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Somewhere in most production stacks there is a Qwen 3 8B being paid to answer yes or no. It moderates a comment, tags a support ticket, decides whether a retrieved passage is relevant, or scores another model's output against a rubric — and it does that by generating text which something downstream then parses. Liquid AI d1-3B, the 3.12B decision model Liquid AI open-weighted on October 7, 2026, exists to do exactly that job without generating anything: a state in, a set of named questions in, and probabilities, labels and confidences out in a single forward pass with zero output tokens. Qwen 3 8B is the vendor's April 2025 open-weights workhorse — roughly 8.2B dense parameters, 119 languages, thinking on or off per request, and sixteen months of community deployment behind it. The question this pairing actually asks is narrow and practical: for the slice of your traffic that is a classification, is an 8B generalist the cheapest way to get a label in 2026, or has the shape of that job changed underneath it?
Wofür du tatsächlich ein 8B bezahlst
Stellt man die beiden Output-Verträge nebeneinander, ist die Ineffizienz struktureller und nicht inkrementeller Natur.
Ein Klassifizierungsaufruf von Qwen 3 8B ist eine Generierung. Du schreibst einen Prompt, der die Labels beschreibt, das Modell denkt optional über die Eingabe nach – und bei diesem Modell kannst du dieses Reasoning pro Anfrage ein- oder ausschalten, was der mit Abstand nützlichste Regler ist, den es für diese Art von Arbeit hat – und dann schreibt es eine Antwort zurück. Diese Antwort ist Text. Wenn du um JSON gebeten hast, bekommst du normalerweise JSON, und gelegentlich bekommst du JSON in einem Satz, oder eine Präambel, oder eine nachgestellte Erklärung, die du nicht wolltest. Das Label, das dich interessiert, ist irgendwo im Token-Stream, und ein Parser holt es heraus. Dir wird jedes Token in Rechnung gestellt, das das Modell schreibt, einschließlich derer, die du wegwirfst.
Liquid AI d1-3B hat keinen Token-Stream. Fragen werden mit einem Typ deklariert: noul für Ja/Nein, beantwortet als P(yes) zwischen 0 und 1; choice für ein Label aus einer benannten Optionsmenge, beantwortet als das Label plus eine Konfidenz plus eine Wahrscheinlichkeit pro Option; score für eine Position auf einer geordneten Skala von zwei bis zehn, beantwortet als die erwartete Stufe mit ihrer Verteilung und Legende. Die Antwort enthält eine laufende Gesamtsumme, die output_tokens: 0 anzeigt. Es gibt nichts zu parsen, weil nichts geschrieben wurde, und es gibt einen rohen probabilities-Accessor, wenn Sie die ungerundete Verteilung statt des Argmax möchten.
Der Teil, der Ihre Rechnung verändert, ist das, was bei mehreren Fragen passiert. Ein Zustand kann viele tragen: Handelt es sich um eine Rückerstattungsanfrage, welches Team sollte sie übernehmen, wie dringend ist sie. Der Zustand und seine Bilder werden einmal gelesen, und Liquid berichtet, dass drei Fragen über einen Zustand das 1,3-fache der Zeit einer einzelnen kosten statt des 3-fachen. Was es nicht zusammenfaltet, ist die Eingabegebühr — die Abrechnungsnotiz des Anbieters ist explizit, dass jede Frage als eigener Prompt abgerechnet wird, einschließlich ihres Textes und all ihrer Bilder. Weniger Latenz, gleiche Eingabe-Tokens. Das ist ein ehrliches Sternchen an der Schlagzeile, und es ist die Art von Sache, die man nur findet, wenn man den Preisabsatz liest statt den Benchmark.

Was dir sechzehn Monate Qwen 3 8B bringen
Bevor Sie das kleinere Modell als Upgrade betrachten, seien Sie präzise, wenn es darum geht, was das bisherige Modell mitbringt, denn es ist mehr als die Parameteranzahl.
• Kontext — Qwen 3 8B verarbeitet nativ 32.768 Token und lässt sich auf 131.072 erweitern, validiert durch YaRN. Liquid AI d1-3B verarbeitet konstant 32.768 Token, ohne dokumentierten Erweiterungspfad. Für einen Zustand, der ein langes Dokument ist, ist das 8B das einzige der beiden, das ihn aufnehmen kann.
• Sprachen — 119 Sprachen und Dialekte für Qwen 3 8B gegenüber sechzehn dokumentierten für Liquid AI d1-3B.
• Reasoning-Steuerung — Qwen 3 8B ermöglicht es dir, das Denken pro Anfrage ein- oder auszuschalten. Liquid AI d1-3B hat keinen Reasoning-Modus zur Steuerung, was – je nachdem, wofür du das Denken verwendet hast – entweder eine Vereinfachung oder eine Einschränkung ist.
• Bandbreite — das 8B-Modell schreibt, erklärt, fasst zusammen, übersetzt und programmiert. Liquid AI d1-3B tut nichts davon. Auf der Modellkarte steht es unmissverständlich: Es ist kein Chat-Modell und es schreibt keinen Text.
• Belege — Qwen 3 8B kann auf sechzehn Monate öffentliches Benchmarking, Quantisierung, Fine-Tuning und Produktionseinsatz zurückblicken. Der Decision Index Score von Liquid AI d1-3B (48,57) wurde von Liquid mithilfe des offiziellen Scorers erzeugt, statt bei der öffentlichen Bestenliste eingereicht zu werden, und er ist erst wenige Tage alt, ohne Reproduktion durch Dritte.
• Vision — bei dieser Zeile ist es umgekehrt. Liquid AI d1-3B verarbeitet Bilder, wobei der Anbieter 74,1 über elf öffentliche Bild-Benchmarks hinweg meldet, die als Entscheidungen über die Optionsmenge des jeweiligen Benchmarks gelesen werden, und meldet, dass das Entfernen der Bilder dieselben Fragen auf 45,1 einbrechen lässt. Das reine Text-Qwen 3 8B benötigt für all das ein separates Vision-Modell davor.
• Geschwindigkeit — eine Frage in 8 ms auf einer RTX 4090, 16 ms auf einem Jetson AGX Thor, 50 ms auf einem Jetson Orin Nano und 64 gepackte Zustände pro Durchlauf bei 475 pro Sekunde auf der 4090. Ein generierungsbasierter Klassifikator hat keine vergleichbare Zahl, weil seine Latenz davon abhängt, wie lang die Antwort ist.
Ehrlich zusammengefasst ist das 8B das bessere allgemeine Instrument, und das 3B-Entscheidungsmodell ist das bessere spezialisierte, und die einzige Frage, die zählt, ist, wie viel Ihres Traffics der spezialisierte Fall ist.
Die Kostenrechnung, sorgfältig durchgeführt
Hier zeigt sich, ob sich der Vergleich bezahlt macht oder nicht, deshalb lohnt es sich, ihn mit echter Struktur statt mit einem Slogan anzugehen.
Die Behauptung, die Liquid zwei Tage vor der Open-Weights-Veröffentlichung veröffentlichte, lautet, dass sein gehostetes Entscheidungsmodell GPT-6.1 Sol bei vier von sechs realen Anwendungen erreicht oder übertrifft, bei 19- bis 200-fach niedrigeren Kosten, und bei jeder Aufgabe schneller antwortet. Lesen Sie die Methodik, bevor Sie sie wiederholen: Jede Anwendung wurde am 5. Oktober 2026 einmal pro Modell ausgeführt, die Chat-Modelle antworteten in JSON mit ihrer Standard-Reasoning-Einstellung, und die Kosten von d1 wurden mit 0,04 $ pro Million Eingabe-Token berechnet. Dieser Wert von 0,04 $ ist der gehostete d1-Eingabepreis, und er ist der einzige Preis, der existiert — es gibt keine Ausgabezeile, die hinzugefügt werden müsste.
Erstellen Sie jetzt dieselbe Form einer Schätzung für einen Qwen 3 8B-Klassifikator, und die Asymmetrie ist sichtbar, ohne die Preise irgendeines Anbieters zu nennen. Das 8B hat zwei abrechenbare Positionen, wo das Entscheidungsmodell eine hat, und die zweite Position ist diejenige, die wächst: Eine Klassifikation, die zuerst argumentiert, bezahlt für die Argumentation, und eine Klassifikation, die ihr JSON auffüllt, bezahlt für das Auffüllen. Die Eingabegebühr des Entscheidungsmodells ist durch den Zustand und die Fragen festgelegt. Die des 8B ist durch nichts festgelegt, was Sie allein aus dem Zustand vorhersagen können.
Zwei Gegengewichte verhindern, dass daraus eine Abfuhr wird. Erstens rechnet das Entscheidungsmodell jede Frage als eigenen Prompt ab, sodass fünf Fragen zu einem langen Dokument den Input verfünffachen – das 8B stellt alle fünf in einem Aufruf und zahlt nur einmal für das Dokument. Zweitens, und das wiegt schwerer, kann ein Entscheidungsmodell nur Fragen beantworten, für die es in dieser Form nachtrainiert wurde. Alles, was eine Erklärung, eine Zusammenfassung oder ein in Worte gefasstes Urteil erfordert, bringt dich zurück zum Generalisten und in der Praxis dazu, wieder für beides zu zahlen.

Worin die beiden wirklich gut sind
Rechnet man das Benchmarking heraus, ist die Aufteilung sauberer, als die Parameterzahlen vermuten lassen.
Liquid AI d1-3B ist für das Ja/Nein, die Auswahl aus einer Liste und die Bewertung gedacht – bei einer Latenzuntergrenze, die nichts Generatives erreicht, auf Hardware, zu der ein Jetson Orin Nano mit 50 ms und ein Laptop gehören. Die Anwendungen, die Liquid im Oktober vorstellte, waren allesamt Varianten dieser Form – ein SQL-Prädikat, das für 150 Support-Tickets Ja oder Nein antwortet, eine Agent-Schleife zur Kontextverdichtung, die jede Tool-Ausgabe behält, kürzt oder verwirft und 52 % der Tokens entfernt, eine Inspektions-App, die auf vier Produktionslinien gute und defekte Teile sortiert, mit 85 bis 97 % Genauigkeit bei einer Aufgabe, für die sie nie trainiert worden war und die sie aus einer kurzen Beschreibung verstanden hatte. Diese letzte Demo ist die klarste Aussage darüber, wofür diese Kategorie gedacht ist: eine Aufgabe, bei der die Antwort eine von wenigen Möglichkeiten ist, der Zustand ein Bild ist und nie eine Erklärung verlangt wurde.
Qwen 3 8B ist für die Arbeit, die als Sprache zurückkommen, oder 119 Sprachen umfassen, oder ein Dokument mit mehr als 32.000 Tokens aufnehmen, oder laut nachdenken muss, bevor man sich festlegt. Es ist auch die richtige Antwort, wenn die Klassifizierung nicht eine der drei oben genannten Formen ist – wenn das Label-Set offen ist, wenn die Kriterien so nuanciert sind, dass man das Denken wollte, wenn derselbe Aufruf den leichten und den schweren Fall bewältigen muss, ohne dass man zwischen zwei Modellen routen muss. Und es ist die sichere Wahl, wenn ein Prüfer fragt, welche unabhängigen Benchmarks es gibt, denn die Antwort lautet: eine Menge, die eineinhalb Jahre zurückreicht.
Die Teams, die das richtig machen, wählen nicht aus. Sie schalten das Entscheidungsmodell dem Generalisten vor, auf dem Teil des Traffics, bei dem die Antwort eine Zahl ist, und überlassen dem 8B alles, was einen Satz braucht. Der Filter ist 3B und 8 ms; der 8B bleibt für die Payload.
Das Paar wird bereitgestellt
Liquid AI d1-3B kommt als Gewichte, bei denen die Deployment-Arbeit bereits erledigt ist: llama.cpp-Unterstützung ab Tag eins, der vollständige NVIDIA-Stack von DGX bis hinunter zu Jetson, NVFP4-Quantisierung, eine 8-Bit-Variante für Gewichte und Aktivierungen sowie GGUF-Konvertierungen auf Hugging Face. Qwen 3 8B hat das tiefste Self-Hosting-Ökosystem aller Modelle in dieser Gewichtsklasse. Keines der beiden steht in unserem Katalog, und nichts hiervon ist eine Verfügbarkeitsaussage für eines der beiden – der gehostete Weg für Liquid AI d1-3B führt über die eigene API des Anbieters und Drittanbieter-Plattformen, wo das gehostete d1 nur auf Basis von Input-Tokens mit $0,04 pro Million berechnet wird, während Bilder mit 1,5 Tokens pro 32×32-Pixel-Patch abgerechnet werden.
Sobald beide in derselben Pipeline stecken, ist das Routing-Problem nicht mehr theoretisch. Sie haben ein kleines Modell, das Ihnen gehört, ein 8B-Modell, das Sie hosten oder mieten können, und die generativen Aufrufe, die Sie sicher mieten – und pro Anfrage zu entscheiden, welche davon eine gegebene Eingabe treffen soll, ist genau die Entscheidung, für die eine Routing-Schicht existiert. Ein Endpunkt über 200+ Modelle hinweg, Anbieter-Listenpreise zu 0 % Aufschlag weitergegeben sodass eine Preisänderung eines Anbieters bei Ihnen noch am selben Tag live ist, automatisches Failover damit ein schlechter Nachmittag eines Upstreams nicht zu Ihrem Ausfall wird. Wenn Ihr Klassifizierungsverkehr in Milliarden von Aufrufen pro Jahr gemessen wird, ist diese Schicht der Ort, an dem die Einsparungen durch ein 3B-Entscheidungsmodell tatsächlich eingezogen werden.
Das Urteil
Wenn Ihrem 8B geschlossene Fragen gestellt werden – ist das toxisch, ist das relevant, in welche Warteschlange gehört das, wie dringend ist es –, zahlen Sie die zweizeilige Rechnung eines Generalisten und die Latenz einer Generierung für ein Label, und Liquid AI d1-3B ist ein direkter Ersatz mit einer schwächeren Belegkette und einem echten Lizenzunterschied, der abzuwägen ist. Akzeptieren Sie die 32K-Kontextobergrenze, die sechzehn Sprachen und die Tatsache, dass niemand außerhalb von Liquid es bisher bewertet hat.
Wenn Ihr 8B darum gebeten wird, zu erklären, zusammenzufassen, zu übersetzen, ein langes Dokument zu halten oder vor einer Entscheidung zu schlussfolgern, gilt dieser Vergleich für Sie nicht. Behalten Sie das 8B, und betrachten Sie das Entscheidungsmodell nur als Vorfilter für den Traffic, den Sie im Voraus als die einfache Art identifizieren können.
Die interessante Zahl, auf die man achten sollte, ist nicht der Benchmark-Wert des einen oder anderen Modells. Es ist, wie schnell die erste unabhängige Reproduktion des d1 Decision Index vorliegt, denn das ist der Moment, in dem der Vergleich aufhört, eine Behauptung eines Anbieters zu sein, und beginnt, eine Tatsache zu sein, mit der man planen kann.

