Eine Hero-Titelkarte mit der Überschrift 'Liquid AI d1-3B vs Intern-Decision-4B' und dem Untertitel 'Welchen kalibrierten Entscheider brauchen Sie?', die links eine mit d1-3B beschriftete Karte mit den Chips '32.768 Token' und '8 ms auf einer RTX 4090' zeigt, rechts eine mit Intern-Decision-4B beschriftete Karte mit den Chips '8.192-Token-Obergrenze' und '44 ms auf einer RTX 4090', und darunter einen breiten Streifen über beiden mit der Aufschrift 'beide geben Wahrscheinlichkeiten zurück, keinen Text'.
Guides & Insights

Liquid AI d1-3B vs. Intern-Decision-4B: Welchen kalibrierten Entscheider brauchst du wirklich?

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Open-Weight-Modelle beantworten Fragen jetzt, indem sie nichts schreiben, und solange man ihre I/O-Schemata nicht nebeneinanderlegt, wirken sie wie dieselbe Idee zweimal. Liquid AI d1-3B, am 5. Oktober 2026 auf Hugging Face hochgeladen und zwei Tage später von Liquid angekündigt, ist ein multimodales Entscheidungsmodell mit 3,12B, dessen Modellkarte unmissverständlich feststellt, dass es „kein Chat-Modell ist und keinen Text schreibt“. InternLMs Intern-Decision-4B, am 26. September 2026 unauffällig in die InternLM-Organisation hochgeladen, ohne Blogbeitrag, ohne Tweet und ohne dahinterstehende Launch-Seite, ist ein 4B-Entscheidungsmodell, das auf Qwen3.5-4B feinabgestimmt wurde und ebenfalls für jede Frage in einem einzigen Vorwärtsdurchlauf eine Antwortverteilung zurückgibt. An der Oberfläche derselbe Vertrag. Die Unterschiede darunter – eine Lizenz, die Ihnen Schwierigkeiten bereiten wird, ein Vertrag, der versehentlich Text schreiben kann, und Maschinen, die noch niemand verglichen hat – entscheiden darüber, welches in Ihren Stack gehört.

Wie nah sich die beiden tatsächlich sind

Als Erstes gilt es zu klären, wie viel an diesem Vergleich ein Unentschieden ist. Beide Modelle nehmen einen Zustand und ein Schema benannter Fragen entgegen, beide lesen das Signal aus den Logits an einer Platzhalterposition, statt zu sampeln, beide sind multimodal, und beide berichten, dass sie nichts geschrieben haben. Was die Form des Aufrufs betrifft, sind sie nahezu identisch, und die interessanten Unterschiede liegen in den Details an den Rändern.

• Größe — Liquid AI d1-3B 3,12B insgesamt, aufgebaut auf Liquids LFM2.5-VL-3B; Intern-Decision-4B 4B (etwa 4,54B nach der Tensor-Anzahl, die die Karte ausgibt), feinabgestimmt auf Basis von Qwen3.5-4B

• Fragetypen — d1-3B und Intern-Decision-4B verwenden dieselben drei: noul für Ja/Nein, choice für eines aus einer benannten Menge, score für einen Punkt auf einer geordneten Skala

• Antwortfelder — d1-3B gibt die Antwort plus Konfidenz und Wahrscheinlichkeiten zurück; das InternLM-Schema gibt Verteilungen plus einen Konfidenzwert zurück, bei dem die Modellkarte davor warnt, dass er keine kalibrierte Wahrscheinlichkeit ist

• Eingabeobergrenze — d1-3B 32.768 Kontext-Tokens; Intern-Decision-4B eine Obergrenze von 8.192 Token, die längere Anfragen rundheraus ablehnt, anstatt sie abzuschneiden, wobei Bilder darauf angerechnet werden

• Lizenz — d1-3B unter Liquid's LFM Open License v1.0, Apache 2.0 auf der InternLM-Seite

Sprachen — d-3B listet 16 auf; die Angaben von Intern-4B

• Schnittstelle — d1-3B wird als Modell ausgeliefert, das Sie laden und mit trust_remote_code=True aufrufen; Intern-Decision-4B wird als Python-Bibliothek ausgeliefert, die Sie per pip install installieren, mit einem implementierten Backend und dem eigenen model-Feld der Anfrage, das ausdrücklich nicht in der Lage ist, Checkpoints zu wechseln

• Eigener Score der Anbieter — d1-3B 48,57 auf dem öffentlichen Split von Decision Index 0.2.1; Intern-Decision-4B 90,02, gemittelt über die eigene Tabelle mit sieben Sets, mit einem Brier-Score von 0,347 und einem erwarteten Kalibrierungsfehler von 0,065

Diese letzten beiden Zahlen sind nicht vergleichbar, und sie als Anzeigetafel zu behandeln, wäre der einfachste Fehler schlechthin, den man auf dieser Seite machen kann. Sie stammen aus unterschiedlichen Test-Harnessen, unterschiedlichen Fragensets und unterschiedlichen Bewertungssystemen.

A two-column scoreboard for Liquid AI d1-3B and Intern-Decision-4B. The d1-3B column reads: Decision Index 48.57; parameters 3.12B; context 32,768 tokens; licence LFM Open License v1.0; calibration metric not published; one question 8 ms on an RTX 4090. The Intern-Decision-4B column reads: Decision Index not scored on it; parameters about 4.54B; context 8,192-token cap; licence Apache 2.0; calibration metric Brier 0.347, ECE 0.065; one question 44 ms on an RTX 4090. The footer reads 'Both columns vendor-reported from different harnesses; not comparable, not independently scored.'

Die Kalibrierung ist das ganze Produkt, und nur einer von ihnen steht schriftlich dafür ein.

Ein Entscheidungsmodell ist seine Latenz nur wert, wenn die Zahl, die es neben der Antwort zurückgibt, etwas bedeutet. Das ist Kalibrierung: Eine angegebene Konfidenz von 0,9 sollte in etwa neun von zehn Fällen richtig sein, und ein Modell, das selbstsicher und falsch ist, ist schlechter als eines, das sagt, dass es etwas nicht weiß.

InternLM ist dasjenige, das sich damit befasst. Seine Modellkarte dokumentiert eine angepasste Temperatur von 1,99241824, die durch Minimierung der negativen Log-Likelihood über 1.728 designierte Kalibrierungsfälle, von denen 1.693 für die Validierung zurückgehalten wurden, abgeleitet und auf acht Nachkommastellen genau angegeben wurde, damit sie reproduziert werden kann. Außerdem veröffentlicht es einen Vorher-Nachher-Pilotversuch über 96 Fälle, der zeigt, dass der Mechanismus funktioniert, statt ihn nur zu behaupten: Brier 0,628 und ECE 0,213 vor der Kalibrierung gegenüber 0,550 und 0,089 danach. Brier und ECE sind die beiden Standardmaße dafür, ob angegebene Wahrscheinlichkeiten ehrlich sind, und die Veränderung ist groß.

Liquid veröffentlicht kein Äquivalent. Die eigene Modellkarte von d1-3B enthält Genauigkeits-Benchmarks – SQuAD 2.0 85,3, Civil Comments 93,0, MASSIVE intent 87,3, PubMedQA 66,0, BoolQ 86,7, XNLI 85,0, PAWS-X 76,9, einen Mittelwert von 77,1 – neben seinen 48,57 auf dem Decision Index, und das angegebene Verkaufsargument des Modells besteht in kalibrierten typisierten Antworten. Doch es gibt keine ECE-Zeile, keine Brier-Zeile und keine veröffentlichte angepasste Temperatur.

Diese Asymmetrie bedeutet nicht, dass der Abkömmling von Qwen3.5-4B besser kalibriert ist als ein auf LFM2.5-VL-3B aufgebautes 3B-Modell; sie bedeutet, dass von diesen beiden Karten eine dir die Arithmetik liefert, um die Behauptung nachzurechnen, und die andere dir die Behauptung liefert. Wenn deine Pipeline einen Schwellenwert auf eine Konfidenz setzt — über 0.8 weiterleiten, unter 0.4 eskalieren —, kannst du die InternLM-Seite heute Nacht validieren, und die Liquid-Seite kannst du nur stichprobenartig überprüfen.

Der Vorbehalt gilt in beide Richtungen. Beide Zahlenwerke sind Eigenangaben. Keines der Modelle wurde von einer unabhängigen Stelle bewertet, und die InternLM-Kalibrierung stellt InternLMs eigenen 96-Fälle-Pilot gegen InternLMs eigenen Fit.

Die Lizenz, die Sie nach einer Nummer fragt

Intern-Decision-4B steht unter Apache 2.0, übernommen von Qwen3.5-4B, wobei die Upstream-Hinweise beibehalten wurden – kommerzielle Nutzung, Weiterverbreitung, Feintuning, nirgends eine Umsatzfrage darin.

d1-3B steht unter Liquid's LFM Open License v1.0, und Abschnitt 5 ist der Teil, den niemand liest, bis die Beschaffung es tut. Die kommerzielle Nutzung wird nur unter der Bedingung gewährt, dass Sie oder Ihre juristische Person unter einem Schwellenwert bleiben, der in demselben Dokument als Jahresumsatz von zehn Millionen US-Dollar oder mehr definiert ist; eine Nutzung darüber ist schlicht nicht lizenziert. Non-Profit-Organisationen und Forschungsnutzer sind ausgenommen.

Für eine Einzelperson oder ein kleines Team sind beide kostenlos. Für alles mit einer Finanzabteilung sind die beiden Repos unterschiedliche Produkte, und der Unterschied ist eine Zahl, über der man entweder liegt oder nicht.

Das Ende der Benchmark-Tabelle von d1-3B ist seine eigentliche Aussage.

Die Schlagzeilenzahl auf der Karte von Liquid ist 48,57 auf dem Decision Index 0.2.1 und liegt damit vor den anderen Sub-10B-Zeilen in einer Tabelle, die von Winnow-12B mit 50,02 bis hinunter zu Decider 2B mit 28,97 reicht. Was diese Zahl zitierenswert macht, ist der Diskriminierungsindex, der darunter steht. Bei den eigenen Teilwerten des Decision Index erzielt d1-3B 74,5 bei Tools und 36,3 bei Arts, bringt es aber nur auf 23,8 bei Knowledge — gegenüber Decider 35B-A3B, einem 36B-Mixture-of-Experts-Modell mit der 12-fachen Größe, das 56,5 bei Tools, 32,6 bei Arts und 31,8 bei Knowledge erzielt.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the paragraph that releases d1-3B and d1-omni-600M as open-weight models, the Decision Index v0.2.1 score of 48.57 with the claim that it is ahead of every model under 10B and on par with Decider 35B-A3B, and the 8 ms RTX 4090 latency line.

Mit anderen Worten: Das 3B ist kein kleines Modell, das einfach durchgängig ein bisschen schlechter ist. Es ist ein kleines Modell, das ungewöhnlich stark bei strukturierten Entscheidungen im Tool-Stil und ungewöhnlich schwach bei Fragen ist, die Weltwissen erfordern, und es schlägt das 36B in den beiden Kategorien, die am ehesten nach der Aufgabe schmecken, für die es gebaut wurde. Wenn es bei deinen Entscheidungen um „Welche dieser fünf benannten Aktionen?“ und „Ist dies in der abgerufenen Passage verankert?“ geht, spielt der Größenunterschied eine geringere Rolle als du erwarten würdest. Wenn deine Entscheidungen auf Fakten angewiesen sind, die das Modell bereits mitbringen muss, dann rechne damit, dass das 23.8 auftaucht.

Es gibt eine zweite Version dieses Arguments auf der Vision-Seite. d1-3B erreicht über elf öffentliche Bild-Benchmarks hinweg durchschnittlich 74,1 gegenüber 73,9 für sein eigenes Basismodell, und ohne die Bilder erzielen dieselben Fragen 45,1 – auf Bildfragen stammen die Antworten also tatsächlich aus dem Bild. Es liegt mit seinem Basismodell gleichauf, statt besser zu sein, und die einzelnen Benchmark-Zeilen fallen in beide Richtungen aus: CV-Bench 82,1 gegenüber 87,6, POPE 88,5 gegenüber 90,1, BLINK 59,2 gegenüber 58,7.

Erwähnenswert ist auch die Pause in der InternLM-Karte: Ihr hoher Gesamtwert stammt aus fragengetriebenen Aufgaben wie Typed Decision mit 80,55 und ToolACE mit 96,45, während Jevbench-Hard bei 73,87 liegt. Wo das Schema schwierig wird, sinkt die Punktzahl.

Geschwindigkeit: Die Lücke ist nicht dort, wo man sie erwartet

d1-3B gibt 8 ms für eine einzelne Frage auf einer RTX 4090 und 9 ms auf einer MI325X an, 21 ms für drei Fragen, die sich einen Zustand teilen, 16 ms auf einem Jetson AGX Thor sowie einen gepackten Durchsatz von 475 Entscheidungen pro Sekunde auf der 4090 und 1.106 auf der MI325X.

Die Karte von Intern-Decision-4B misst auf derselben RTX 4090 im Mittel 44,16 ms End-to-End, mit einem Median von 44,03 ms und 44,60 ms bei P95.

Das sieht nach einem 5-fachen Gewinn aus und ist keiner, weil die beiden unterschiedliche Dinge messen. Die Zahlen von Liquid sind Warm-Model-Aufrufe, jeweils eine Anfrage nach der anderen, wobei Kernel-Auswahl und Kompilierung im Voraus bezahlt werden – die Karte sagt ausdrücklich, dass eine einzelne Frage auf der 4090 ohne CUDA-Graph-Kompilierung 16 ms kostet und dass der erste Aufruf mit einer neuen Shape die Kompilierung bezahlt. Die 44 ms von InternLM sind pro Query End-to-End durch eine Python-Bibliothek, deren einzig implementiertes Backend lokale Hugging-Face-Inferenz ist, also trägt sie die umgebende Maschinerie mit. Keine der beiden Zahlen ist falsch. Setzt man beide unter ein einziges Harness, auf eine Maschine, bei derselben Art von Anfrage, schrumpft die Lücke auf etwas, das man messen statt annehmen möchte.

Was nicht zur Debatte steht, ist die Obergrenze. 8.192 Token sind eine harte Ablehnung auf der InternLM-Seite, und Bild-Token gehen zulasten desselben Budgets, sodass ein langes Dokument plus ein Screenshot eine Anfrage ist, die abgelehnt statt gekürzt zurückkommt. d1-3B stellt Ihnen 32.768 Token zur Verfügung. Wenn Ihre Zustände Tickets und kurze Austausche sind, wird diese Lücke nie zum Problem. Wenn sie seitenfüllend sind, entscheidet sie die Frage, noch bevor es ein Benchmark tut.

Führe sie als Panel aus, nicht als Swap

Eine spezifische Ja/Nein-Frage zu beantworten und die Frage zu beantworten, „welches von sechs benannten Dingen ist dies, und wie sicher sind Sie“, sind unterschiedliche Anforderungen, und die beiden Karten sind so unterschiedlich gestaltet – eine mit einer harten Eingabeobergrenze und einer veröffentlichten Kalibrierungsanpassung, die andere mit 32K Kontext und einem besseren Bewertungs-Tail –, dass der nützliche Einsatz für ein Team, das beide bewertet, oft kein Ersatz, sondern ein Panel ist: derselbe Zustand wird beiden Modellen vorgelegt, und Uneinigkeiten werden an einen Menschen oder an ein größeres Modell weitergeleitet.

Keines der beiden Modelle steht in unserem Katalog, und dies ist keine Aussage zur Verfügbarkeit; beide sind selbst gehostete Artefakte. Aber ein Panel ist genau die Form, bei der eine Routing-Schicht die Arbeit übernimmt statt der Papierkram. OrcaRouter stellt mehr als 200 Modelle hinter einem einzigen API-Schlüssel bereit, mit Anbieter-Listenpreisen, die mit 0 % Aufschlag durchgereicht werden – wenn also ein Anbieter, den Sie über uns routen, seinen Preis senkt, ändert sich Ihre Rechnung noch am selben Tag – und automatischem Failover über Anbieter hinweg, das verhindert, dass aus einem Panel mit zwei Modellen zwei Single Points of Failure werden. Die Modelle, die Sie heute routen, sind nicht diese beiden; es sind die gehosteten Generalisten, die Sie ersetzen würden, etwa Qwen3.5-27B für 0,086 US-Dollar pro Million Input-Tokens und 0,688 US-Dollar pro Million Output-Tokens – die Zahl, die ein selbst gehostetes 3B-Modell schlagen muss, wenn man die GPU mitgerechnet hat.

Was diese Woche zu tun ist

Wenn Ihre Entscheidungen kurze Zustände sind, die Lizenz die Prüfung durch Ihr Unternehmen überstehen muss und Sie die breiteste Palette an Build-Zielen wünschen — llama.cpp, Ollama, LM Studio, ein gepackter Batch-Pfad, der 64 Zustände in einem Durchlauf verarbeitet —, dann ist d1-3B die stärker produktisierte der beiden, und ihre Tool-and-Arts-Unterscheidungsfähigkeit ist das Stärkste, was eine der beiden Karten zeigt. Wenn Ihre Entscheidungen sich über lange Zustände erstrecken, oder Sie eine Lizenz ohne Umsatzklausel benötigen, oder Sie einen Kalibrierungs-Fit, den Sie reproduzieren können, und eine Harness wünschen, bei der die umgebenden Kosten bereits eingerechnet sind, dann ist Intern-Decision-4B diejenige, deren Unterlagen Sie tatsächlich überprüfen können.

A capture of the Hugging Face model card for internlm/Intern-Decision-4B, showing the Apache 2.0 licence, the 5B safetensors file size, the description of a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution for every question in one forward pass, the download count of 2,756 for the last month, and the tags qwen3_5, decision-making and multimodal.

Der unangenehme Teil ist bei beiden derselbe: Keine unabhängige Instanz hat eines der beiden Modelle ausgeführt, und es gibt keinen Kalibrierungsvergleich, der nicht von dem Anbieter in Auftrag gegeben wurde, der die Karte geschrieben hat. Für eine Modellklasse, deren ganzer Wert in der Bedeutung einer Zahl neben einer Antwort liegt, ist das die Lücke, die es zu schließen gilt, bevor man irgendwo einen Schwellenwert ansetzt.