Eine Titelkarte für einen Vergleichsartikel mit der Aufschrift Intern-Decision-4B vs Qwen 3.8, untertitelt mit Ein 44-Millisekunden-Vorwärtsdurchlauf gegen 2,4 Billionen Parameter, mit drei flachen Linien-Icons, die einen kleinen, schnellen Scorer, ein großes Reasoning-Modell und einen Kostenvergleich andeuten.
Engineering & Research

Intern-Decision-4B vs. Qwen 3.8: Ein 44-Millisekunden-Vorwärtsdurchlauf gegen 2,4 Billionen Parameter

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

InternLM hat Intern-Decision-4B am Morgen des 26. September 2026 auf Hugging Face veröffentlicht — kein Launch-Post, kein Blogeintrag, ein GitHub-Link auf der eigenen Model Card, der 404 zurückgibt, und ein Demo-Space, der 401 zurückgibt. Die Gewichte sind echt und herunterladbar; die Ankündigung fehlt. Und das Modell darunter ist ein Fine-Tune von Qwen3.5-4B, weshalb der Vergleich mit dem gehosteten Flaggschiff mehr wert ist als ein Datenblatt. Diese beiden sind keine Rivalen. Sie sind die beiden Enden einer einzigen Pipeline, und die ganze Frage ist, wo die Grenze zwischen ihnen verläuft. Der zugrunde liegende Kern ist das Modell mit 2,4 Billionen Parametern, das der Anbieter im August veröffentlicht hat und nun als Qwen3.8-Max betreibt, abgerechnet mit 2,00 und 6,00 US-Dollar pro Million Token; Intern-Decision-4B ist ein Neuaufbau mit 4,54 Milliarden Parametern dieses sieben Monate alten Basismodells, das überhaupt keine Token ausgibt, bis zu sechzehn typisierte Fragen in einem einzigen Forward Pass beantwortet und pro Aufruf nichts kostet, weil es keine Ausgabe gibt, für die abgerechnet werden könnte.

Die Ein-Satz-Antwort: Wenn Ihre Aufgabe eine Entscheidung mit einer geschlossenen Antwortmenge ist, ist Intern-Decision-4B pro Entscheidung etwa fünfzigmal schneller und strukturell kostengünstiger, und kein Frontier-Modell wird es auf dieser engen Achse übertreffen. Wenn Ihre Aufgabe etwas anderes ist – Reasoning, langer Kontext, Tool-Nutzung, alles, bei dem die Antwort nicht bereits in Ihrem Prompt aufgezählt ist –, ist Qwen 3.8 nicht bloß besser, sondern das einzige der beiden, das die Aufgabe überhaupt bewältigen kann. Alles Folgende dreht sich darum, diese Grenze präzise zu finden.

Was ist tatsächlich bestätigt, und was nicht

Beginne mit den Belegen, denn die Einordnung ist entscheidend. Es gibt keine Anbieterankündigung für Intern-Decision-4B. Keine Pressemitteilung, kein Paper, keine Repository-Beschreibung zum Lesen. Was heute existiert, ist ein Repository von Hugging Face, das heute Morgen unter der internlm-Organisation veröffentlicht wurde — Intern Large Models, die Gruppe des Shanghai AI Laboratory —, das die Apache-2.0-Lizenz trägt, wobei die vorgelagerte Qwen-Lizenz daneben als LICENSE-QWEN erhalten bleibt. Zwei Schwester-Checkpoints erschienen innerhalb von vierzig Sekunden voneinander: Intern-Decision-0.8B mit 853 Millionen Parametern und Intern-Decision-2B mit 2,21 Milliarden. Alle drei tragen dieselben Tags — Entscheidungsfindung, multimodal, strukturierte Vorhersage — und alle drei liegen unter einer Modelsammlung, die sich öffentlich noch nicht auflösen lässt.

Was nicht bestätigt ist: ob dies das fertige Release oder ein früher Push ist. Das Repository wurde um 05:36 UTC erstellt und noch vor 08:00 UTC am selben Tag erneut geändert, und weitere öffentliche Aktivität an den Schwester-Checkpoints hielt über 09:00 Uhr hinaus an. InternLM hat nicht gesagt, wie die beabsichtigte Bereitstellung aussehen soll, hat das Repository, auf das verwiesen wird, nicht veröffentlicht und nicht gesagt, ob ein gehosteter Endpunkt kommt. Betrachten Sie jede Benchmark-Zahl in diesem Artikel als vom Anbieter gemeldet und nicht reproduziert – denn zum Zeitpunkt dieses Schreibens wurde buchstäblich nichts anderes über dieses Modell irgendwo geschrieben. Drei separate Suchwege liefern nichts zu diesem Namen.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

Die architektonische Wette: ein Scorer, kein Generator

Der wichtigste Satz in Intern-Decision-4Bs eigener Dokumentation ist eine Verneinung: Der Inferenzpfad „ruft generate() nicht auf“ oder sampelt keinen Freitext. Das ist kein Implementierungsdetail, es ist das gesamte Design, und genau das unterscheidet dies davon, Qwen3.8-Max mit einem JSON-Schema aufzurufen und zu hoffen, dass die Klammer schließt.

Hier ist der Mechanismus, wie ihn die Karte beschreibt. Sie übergeben dem Modell einen gemeinsamen Zustand, ein Schema benannter Fragen und optional bis zu acht Bilder. Jede Frage ist einem von drei Typen zugeordnet: choice (wählen Sie eine aus einer geordneten Menge von Optionen aus), score (auf einer ordinalen Skala bewerten, zurückgegeben als wahrscheinlichkeitsgewichteter Erwartungswert), oder noul (ein binäres Nein/Ja). Der System-Prompt, der Zustand, das Schema und ein vollständiges JSON-Gerüst des Assistenten werden mit einem Platzhalter pro Feld gerendert. Dann — und das ist der Trick — führt das Modell einen kausalen Vorwärtsdurchlauf aus, und die Logits werden an der Position unmittelbar vor jedem Platzhalter gelesen. Es wird eine Softmax nur über die zulässigen Kandidatensymbole dieses Felds gebildet, die Kalibrierung des Checkpoints wird angewendet, und die Symbole werden auf Ihre ursprünglichen Optionswerte zurückgeführt.

Die Konsequenzen sind konkret. Weil der Antwortraum jedes Feldes pro Anfrage zusammengestellt wird, statt in einen Vokabular-Head eingebacken zu sein, braucht ein Schema, das Sie heute Nachmittag erfinden, kein erneutes Training — fügen Sie eine Frage hinzu, werden die Optionen zu Kandidatensymbolen für dieses Feld. Weil es keine Decodierungsschleife gibt, gibt es kein Ausgabe-Token, keine geschweifte Klammer, die man vergessen könnte, und keine Wiederholungslogik bei fehlerhaftem JSON. Und weil alle Fragen auf Grundlage derselben Zustandslesung bewertet werden, kosten sechzehn Fragen einen Vorwärtsdurchlauf, nicht sechzehn.

Die Grenzen sind ebenso konkret, und die Karte benennt sie ohne Umschweife. Eine bis sechzehn Fragen, bis zu 62 Optionen pro Frage, bis zu acht Bilder. Ein Standardmaximum von 8.192 Tokens – und Eingaben, die es überschreiten, werden ohne Kürzung zurückgewiesen. Diese letzte Klausel ist eine Designentscheidung, über die es sich nachzudenken lohnt: Stille Kürzung ist der Weg, auf dem ein Klassifikator still und leise beginnt, eine andere Frage zu beantworten als die, die man gestellt hat, und InternLM hat sich stattdessen dafür entschieden, laut zu scheitern. Das ist die richtige Entscheidung, und zugleich eine operative Falle, denn ein langer Ticket-Thread plus ein Schema plus Bilder werden die 8.192 früher überschreiten, als man erwartet, und es gibt keinen eleganten Weg – man bekommt einen Fehler.

Wo Intern-Decision-4B gewinnt, und zwar nicht knapp

Zwei Achsen, und beide sind struktureller Natur, nicht inkrementell.

• Latenz pro Entscheidung — 44,16 ms Mittelwert, 44,03 ms Median, 44,60 ms bei p95, gemessen auf einer einzelnen RTX 4090 über den lokalen Hugging-Face-Pfad. Gegen Qwen3.8-Max, dessen Live-Sieben-Tage-Fenster in unserem eigenen Playground ein p50 von 2.474 ms und ein p95 von 9.789 ms bei 55,4 Ausgabe-Tokens pro Sekunde zeigt. Das ist ungefähr 56× beim Median, und der Vergleich ist nicht so sehr unfair, sondern vielmehr einer zwischen zwei verschiedenen Vorgängen: Das eine Modell klassifiziert, das andere schlussfolgert und schreibt dann. Die Lücke ist real, und der Grund dafür ist es auch.

• Kosten pro Entscheidung – und dies ist Arithmetik, keine Meinung. Nehmen wir einen realistischen Support-Triage-Aufruf: 800 Eingabe-Tokens für Status und Schema sowie 150 Ausgabe-Tokens für strukturiertes JSON. Auf Qwen3.8-Max sind das 800 × 2,00 $/M plus 150 × 6,00 $/M, also etwa 0,0025 $ pro Entscheidung, bevor auch nur ein einziges Reasoning-Token anfällt – und Qwen3.8-Max ist ein Reasoning-Modell, weshalb die Ausgabeseite optimistisch klein angesetzt ist. Eine Million Entscheidungen kostet ungefähr 2.500 $. Dieselbe Million Entscheidungen kostet auf Intern-Decision-4B null Tokens und etwa 12,3 Stunden RTX-4090-Zeit. Intern-Decision-4B hat keinen Ausgabepreis, weil es keine Ausgabe hat.

Der Handel ist ehrlich und offensichtlich: Das 4B braucht eine GPU, die du besitzt oder mietest, es belegt diese GPU, und es kann immer nur eine Sache tun. Aber wenn diese eine Sache das ist, was dein Produkt millionenfach am Tag tut, dann ist die obige Rechnung der gesamte Business Case, und keine noch so große Leistungsfähigkeit von Frontier-Modellen ändert etwas daran.

Die Zahl, die Qwen 3.8 nicht veröffentlicht: Kalibrierung

Das ist der stille Unterschied – und genau derjenige, den die meisten Vergleiche übersehen werden, weil er nicht wie ein Benchmark aussieht.

Intern-Decision-4B gibt eine Verteilung über deine Optionswerte zurück, nicht nur ein Label — plus einen Konfidenzwert, und für noul Fragen die kalibrierte Wahrscheinlichkeit für Ja. InternLM meldet einen Brier-Score von 0,347 und einen erwarteten Kalibrierungsfehler von 0,065 über die eigene Suite und liefert die angepasste Temperatur im Checkpoint mit: 1,99241824, separat für diese Größe durch Minimierung der negativen Log-Likelihood an 1.728 designierten Kalibrierungsfällen mit 1.693 zurückgehaltenen Validierungsfällen angepasst. Die Labels der Testsuite wurden nicht verwendet, um die Temperatur auszuwählen. Es gibt ein zweites, unabhängiges Diagnoseverfahren mit 96 Fällen in der Modellkarte, das exakte Referenzverteilungen statt gesampelter Labels verwendet, und es zeigt, dass sich der Brier/ECE insgesamt von 0,628 / 0,213 vor der Kalibrierung auf 0,550 / 0,089 danach verschiebt — wobei der Kalibrierungsschritt den erwarteten Fehler um weit mehr als die Hälfte senkt.

Schauen Sie jetzt auf der Qwen-3.8-Seite nach derselben Kennzahl. Sie ist nicht da. Alibaba veröffentlicht Werte des Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking und Long-Context-Recall – allesamt Fähigkeitsmaße. Für kein Mitglied der Qwen-3.8-Familie veröffentlicht es eine Kalibrierungskennzahl, weil die Konfidenz eines generativen Modells keine Größe ist, die der Anbieter mitliefert. Wenn Ihr System eine Wahrscheinlichkeit benötigt, auf die es einen Schwellenwert anwenden oder auf die es routen kann, statt einer Antwort, der es vertrauen muss, ist dieser Unterschied keine Frage des Grades. Das eine Modell liefert Ihnen eine Zahl mit einer dokumentierten Fehlerrate; das andere liefert Ihnen Text, und Sie bauen Ihre eigene Konfidenzschätzung darum herum auf.

Wo Qwen 3.8 gewinnt, und das nicht knapp.

Stellt man die beiden im Hinblick darauf nebeneinander, wozu sie aufgefordert werden können, hören die Grenzen auf, subtil zu sein.

• Kontext — Qwen3.8-Max verfügt über ein 1.000.000-Token-Fenster. Intern-Decision-4B lehnt alles jenseits von 8.192 ab. Das entspricht dem Faktor 122, und es gibt keinen Workaround, weil die Eingabegrenze durchgesetzt und nicht abgeschnitten wird.

• Eingabemodalität — Qwen3.8-Max verarbeitet Text, Bild und Video. Intern-Decision-4B verarbeitet Text und Bilder, bis zu acht, wobei die Bild-Tokens auf dasselbe Budget von 8.192 angerechnet werden.

• Reasoning und Tools — Qwen3.8-Max führt Tool-Nutzung, JSON-Modus und Reasoning unter seinen angegebenen Fähigkeiten und erreicht einen Artificial Analysis Intelligence Index von 45,4, Platz 15 von 145 indexierten Modellen, mit einem AA-Coding-Score von 76,2 auf Platz neun von 138. Das sind unabhängige, von Artificial Analysis veröffentlichte Zahlen, keine Angaben des Anbieters. Intern-Decision-4B hat keinen Eintrag bei Artificial Analysis, keinerlei unabhängige Bewertung und keine Fähigkeit zu schlussfolgern, zu planen oder irgendetwas aufzurufen.

• Offene Ausgabe — Qwen3.8-Max schreibt. Intern-Decision-4B kann keinen Absatz, keine Begründung und keinen Plan erstellen. Es kann nur die Optionen bewerten, die Sie bereits aufgelistet haben.

Auch auf der Open-Weights-Seite ist anzumerken: Wenn du den Qwen-3.8-Kern selbst willst und nicht die gehostete Route, ist Qwen3.8-27B das dichte Geschwistermodell – 27,8 Milliarden Parameter, Apache 2.0, ein Kontext von 262.144 Token und ungefähr $0,33 / $2,40 pro Million Token dort, wo es bereitgestellt wird. Es erreicht 33,7 im AA Intelligence Index. Es ist immer noch eine Größenordnung größer als Intern-Decision-4B, immer noch generativ und immer noch das falsche Werkzeug für eine Entscheidung mit geschlossenem Set in großem Umfang – aber es ist die ehrliche mittlere Option und die einzige der drei, die zugleich wirklich günstig und wirklich leistungsfähig ist.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

InternLMs eigene Benchmark-Tabelle ehrlich lesen

Die Modellkarte von Intern-Decision-4B enthält eine Vergleichstabelle, und was fehlt, ist aussagekräftiger als das, was darin steht. Die Zeilen sind Jev, Laya, SemIf, Kev, JevK5 sowie InternLMs eigene 0.8B und 2B. Jeder einzelne davon ist ein weiterer System-One- oder Entscheidungsmodell-Eintrag – Jev von TypeSafe AI, Laya von Convai Innovations und drei weitere. Jede Zahl wurde vom Anbieter auf InternLMs eigenen Testumgebungen angegeben. In der Tabelle gibt es überhaupt kein Frontier-Modell.

Das ist kein Versehen. Es ist der ehrliche Geltungsbereich der Behauptung. Der Headline-Durchschnitt von Intern-Decision-4B mit 90,02 über sieben Suiten — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — ist ein Anspruch darauf, die Kategorie der Entscheidungsmodelle anzuführen, was es in dieser Tabelle auch tut, und dabei Jevs 88,74 und Layas 57,77 übertrifft. Es ist kein Anspruch, mit Qwen 3.8 zu konkurrieren, und InternLM erhebt diesen Anspruch nirgendwo. Die Modellkarte ist auf ihre eigene Kategorie beschränkt, und einen Kategoriensieg als einen Sieg bei den Fähigkeiten zu deuten, ist der Fehler, den dieser Abschnitt verhindern soll.

Noch zwei Warnhinweise. Die Latenzwerte – 44 ms im Mittel auf einer 4090 – sind vom Anbieter gemessen, von Arbeitslast und Hardware abhängig, und ein Forward-Pass auf einer einzelnen GPU ist nicht dieselbe Messung wie ein gehosteter API-Aufruf einschließlich Netzwerk-Roundtrip und Warteschlangenbildung. Und der Kalibrierungspilot umfasst 96 Fälle: eine Diagnose, kein Benchmark, und das steht auch auf der Karte.

Die Deployment-Frage, die die eigentliche Weggabelung ist

Vergiss für einen Moment die Benchmarks und frag dich, was jede einzelne operativ von dir verlangt.

Intern-Decision-4B ist unter bf16 ungefähr 9,1 GB auf der Festplatte groß — zwei Sprach-Shards mit 4,26 GB und 4,15 GB, ein Vision-Tower mit 612 MB und ein Projektor mit 54 MB. Es lädt über eine 16 KB große inference.py, die im Repository selbst mitgeliefert wird, mit einer DecisionEngine-Klasse, die du einmal instanziierst und wiederverwendest. Ein Python-Dict hinein, ein Antwort-Dict heraus, mit der Voraussetzung Python 3.12+. Es läuft in 44 ms auf einer 4090, und das 0,8B-Geschwister ist klein genug, um mit weit weniger Hardware betrieben zu werden. Aber das Modul ist die Schnittstelle — es gibt keinen Server, keinen OpenAI-kompatiblen Endpunkt und keine gehostete API. Du baust den Dienst darum herum, und wenn du zwei davon für Failover brauchst, baust du das auch.

Die generative Seite derselben Pipeline ist eine ganz andere Entscheidung, und genau dafür ist ein Router da. Qwen3.8-Max und Qwen3.8-27B sind beide auf OrcaRouter hinter demselben OpenAI-kompatiblen Key aufrufbar, zum Listenpreis des Anbieters mit 0 % Aufschlag, der durchgereicht wird — wenn Alibaba also einen Qwen-Preis ändert, ist das bei uns noch am selben Tag live und nicht erst zum nächsten Abrechnungszyklus. Intern-Decision-4B ist keine unserer Routen und wird es auch nicht sein, solange InternLM es nicht irgendwo hostet; wir werden nicht so tun, als wäre es anders. Was wir abdecken, ist die Hälfte dieser Pipeline, die ein Netzwerkaufruf ist: ein Key für über 200 Modelle, automatisches Failover, falls Qwen3.8-Max schwächelt — seine aktuelle Sieben-Tage-Fehlerrate liegt bei 1,78 % — und die Möglichkeit, die beiden Qwen-3.8-Stufen im selben Anfragepfad gegeneinander A/B-zu-testen, bevor Sie sich für eine von beiden entscheiden.

Das ist das Muster, das man mitnehmen sollte. Führe den Scorer lokal aus, weil er günstig und schnell ist und eine einzige klar umrissene Aufgabe gut erledigt. Route den Reasoning-Schritt, denn dort finden der Anbieterwechsel, die Preissenkungen und die Ausfälle tatsächlich statt.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Welche du tatsächlich wählen solltest

Wähle Intern-Decision-4B, wenn deine Entscheidung geschlossen ist, deine Antworten in einem Prompt aufzählbar sind, du dieselbe Entscheidung in großem Umfang ausführst und dir die Wahrscheinlichkeit genauso wichtig ist wie das Label. Ticket-Routing, Inhaltsmoderation gegen eine feste Taxonomie, strukturierte Extraktion in ein Schema, das du kontrollierst, Bewertungsrubriken, binäre Gates – alles, wo ein Mensch die Optionsliste im Voraus hätte schreiben können. Die 4,54 Milliarden Parameter sind ehrlich über die Obergrenze: Die Karte selbst zeigt die 4B bei 73,87 auf Jevbench-Hard gegenüber 100,00 auf Easy, je schwieriger also die Entscheidungsform, desto mehr gibt das kleine Modell auf.

Wähle Qwen 3.8 — das heißt Qwen3.8-Max, wenn du den gehosteten Kern willst, Qwen3.8-27B, wenn du Gewichte willst, die du selbst in der Hand hast — wenn die Antwort nicht im Voraus aufzählbar ist, wenn die Eingabe länger als 8.192 Token ist, wenn du eine Begründung brauchst, die du einem Menschen zeigen kannst, wenn du Tool-Aufrufe brauchst oder wenn du Video brauchst. Wähle es auch, wenn du einfach keine GPU betreiben möchtest: 12,3 Stunden 4090-Zeit pro Million Entscheidungen sind nur dann günstig, wenn du die 4090 bereits hast und an den anderen 363 Tagen etwas anderes damit vorhast.

Nehmen Sie beides, wenn Ihre Pipeline die Form hat, die die meisten Pipelines tatsächlich haben – einen günstigen Closed-Set-Klassifikator vorne und ein Frontier-Modell dahinter für die Fälle, bei denen der Klassifikator unsicher ist. Das ist die Konfiguration, für die die kalibrierte Konfidenz von Intern-Decision-4B entwickelt wurde, und es ist der Grund, warum die oben genannte ECE-Zahl mehr zählt als der Durchschnitt in der Schlagzeile.

Was zu sehen

Drei offene Fragen, die sich alle innerhalb von Tagen beantworten lassen. Veröffentlicht InternLM das GitHub-Repository, auf das die eigene Karte verlinkt – derzeit ein 404 –, und damit auch eine Trainingsbeschreibung? Folgt auf die Gewichte eine Ankündigung, die einen stillen Push in ein dokumentiertes Release verwandelt? Und reproduziert irgendetwas Unabhängiges den Durchschnitt von 90.02 oder den Brier-Wert von 0.347 auf Hardware, die nicht von InternLM stammt?

Eine kleine Unstimmigkeit ist anzumerken, während Sie warten, denn sie ist genau die Art von Sache, die zählt, wenn Sie ein Deployment dimensionieren. Das Modell heißt 4B. Die Parameteranzahl beträgt 4.539.265.536 — 4,54 Milliarden. Das 0.8B-Schwestermodell hat 853 Millionen Parameter und das 2B-Schwestermodell 2,21 Milliarden; beide runden nur um eine Haaresbreite auf oder ab. Nur das 4B rundet um mehr als eine halbe Milliarde nach unten. Das ist kein Problem. Es ist eine Erinnerung daran, dass bei einem nicht angekündigten Release die Doku die einzige Spezifikation ist, die Sie haben, und selbst die Doku wird noch bearbeitet.