
Intern-Decision-2B wurde still und leise auf Hugging Face veröffentlicht. Der GitHub-Link auf seiner Karte gibt seit Kurzem keinen 404 mehr zurück.
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 584 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Heute früh verwies die Modellkarte für internlm/Intern-Decision-2B auf drei Stellen mit weiteren Informationen, und zwei davon waren tot: der Demo-Space antwortete mit HTTP 401, und github.com/internlm/Intern-Decision lieferte jedem, der darauf klickte, einen 404. Seit 08:58 UTC existiert das Repository hinter dem zweiten Link — öffentlich, drei Commits tief, mit Trainingscode, zwei Inferenz-Backends, einem Evaluationspaket mit 10.751 Testzeilen, einem Kalibrierungs-Benchmark mit 96 Fällen und der Reproduktionsanleitung. Das ist das Einzige, was sich an diesem Modell geändert hat, seit es am 26. September 2026 um 05:36 UTC auf Hugging Face erschien, und es genügt, um Intern-Decision-2B von „einem Checkpoint mit einer unzugänglichen README“ zu „einem Checkpoint, den man tatsächlich inspizieren, gegen den man reproduzieren und mit dem man streiten kann“ zu befördern.
Die Gewichte selbst sind unverändert und eindeutig. Intern-Decision-2B ist ein multimodales strukturiertes Entscheidungsmodell mit 2.213.241.664 Parametern, feinabgestimmt auf Basis von Qwen/Qwen3.5-2B — die Alibaba-Basis vom 28. Februar 2026 — veröffentlicht unter Apache-2.0, wobei die Upstream-Qwen-Lizenz daneben beibehalten wird als LICENSE-QWEN. Es ist die mittlere von drei Größen, die InternLM in vierzig Sekunden veröffentlichte: Intern-Decision-0.8B um 05:35:57, dieses Modell um 05:36:19 und Intern-Decision-4B um 05:36:37. Nach wie vor steht hinter keiner von ihnen irgendeine Ankündigung.
Was die mittlere Größe einen eigenen Artikel wert macht, ist, dass sie der Punkt ist, an dem die Familie aufhört, sich vorhersehbar zu verhalten. Laut InternLMs eigenen Zahlen ist sie die schnellste der drei und die am schlechtesten kalibrierte der drei, und beide Fakten sind es wert, verstanden zu werden, bevor man viereinhalb Gigabyte von irgendetwas herunterlädt.
Was ist bestätigt, und was ist nur das Gerede des Anbieters
Zwei Kategorien, und die müssen auseinandergehalten werden.
Bestätigt, weil es sich um eine Dateiliste oder eine HTTP-Antwort handelt: die Parameteranzahl (2.592 F32 plus 2.213.239.072 BF16-Gewichte); die Shard-Zuordnung (ein 3,76 GB großer Sprach-Shard, ein 612,5 MB großer Vision-Tower, ein 50,3 MB großer Projektor, etwa 4,43 GB Tensoren und rund 4,46 GB Repository); das Lizenzpaar; das Basismodell; die zugrunde liegende Architektur (ein Qwen3_5ForConditionalGeneration mit 24 Schichten, Hidden-Size 2.048, 8 Query-Heads gegenüber 2 Key-Value-Heads, Head-Dimension 256, einem sich wiederholenden Muster von drei Linear-Attention-Schichten zu einer Full-Attention-Schicht, einer beibehaltenen Multi-Token-Prediction-Schicht und einer Einbettungsobergrenze von 262.144 Positionen); die Existenz des Repositorys; und die Tatsache, dass die Modellsammlung unter huggingface.co/collections/internlm/intern-decision nun aufgelöst wird und alle drei Checkpoints auflistet.
Vom Anbieter gemeldet und nicht reproduziert: jede Genauigkeitszahl, jeder Latenzwert und die Kalibrierungstemperatur. Es gibt kein Paper, keinen arXiv-Eintrag, keinen Launch-Post, kein Changelog und keine unabhängige Evaluierung — eine Suche nach der Zeichenkette „Intern-Decode“ liefert nichts, was sich auf dieses Modell bezieht. Der Demo-Space antwortet weiterhin mit 401, was bedeutet, dass er nicht öffentlich ist, nicht dass er defekt ist. Der 2B-Checkpoint hat ein Like und null Downloads. Niemand außerhalb von InternLM hat ihn ausgeführt.

Der Inferenzvertrag, in der Reihenfolge, in der er abläuft
Die aussagekräftigste Datei im Repository ist nicht die Modellkarte. Sie ist src/inference/engine.py und die mitgelieferte inference.py auf dem Hub, denn zusammen dokumentieren sie einen Vertrag und nicht einen Prompt.
• Sie liefern state — das zu bewertende Material — ein questions-Schema und optional bis zu acht Bilder. Eine bis sechzehn Fragen, bis zu 62 Optionen pro Frage.
• Die Optionen jeder Frage werden auf Single-Token-Symbole abgebildet: A–Z, dann a–z, dann 0–9. Die Obergrenze von 62 Optionen ist keine Designpräferenz, sondern genau die Anzahl der Single-Token-Symbole, die der Vertrag adressieren kann.
• Der System-Prompt, der Zustand, das Schema und ein vollständiges Assistant-JSON-Skelett werden mit einem <decision> Platzhalter pro Feld gerendert. Das Chat-Template des Checkpoints und der leere Thinking-Block bleiben unverändert erhalten.
• Ein kausaler Vorwärtsdurchlauf wird ausgeführt. Logits werden an der Position unmittelbar vor jedem Platzhalter ausgelesen — nicht danach, nicht an einem generierten Token.
• Eine Softmax-Funktion wird nur über die zulässigen Kandidatensymbole dieses Felds gebildet, die Kalibrierung des Checkpoints wird angewendet, und die Symbole werden zurück auf Ihre ursprünglichen Optionswerte abgebildet.
Die Karte ist unverblümt, was das betrifft: „Diese API führt strukturierte Kandidatenbewertung durch. Sie ruft nicht generate() auf und erzeugt auch keine Stichproben aus frei formuliertem Text.“ Eine DecisionEngine(max_length=8192) lehnt übergroße Eingaben ab, anstatt sie zu kürzen, sodass eine Anfrage, die nicht passt, laut fehlschlägt, statt still ihren letzten Absatz zu verlieren. Auch die Backend-Liste ist ehrlich — backend="hf" ist die Standardeinstellung und die einzige, die im Hugging Face-Repository implementiert ist, was man wissen sollte, denn das GitHub-Release liefert zusätzlich ein XTuner-Backend mit, und die beiden sind nicht numerisch identisch. InternLMs eigener Evaluierungsleitfaden sagt dazu: „Kernel- und BF16-Unterschiede können Wahrscheinlichkeiten und gelegentlich auch Labels verändern.“
Die Anomalie im Text
Setze die drei Checkpoints in InternLMs eigener Tabelle nebeneinander, und die Form ist seltsam genug, um die Geschichte zu sein.
• Durchschnitt über sieben Suiten — Intern-Decision-0.8B 79.38, Intern-Decision-2B 84.68, Intern-Decision-4B 90.02. Geordnet, wie man es beim Vergrößern der Gewichte erwarten würde.
• Latenz auf einer RTX 4090 – 33,98 ms im Mittel für die 0,8B-Variante, 33,28 ms für die 2B-Variante, 44,16 ms für die 4B-Variante. Die mittlere Größe ist die schnellste der drei, mit einem Vorsprung, der klein genug ist, um auf einer einzelnen GPU Rauschen zu sein, aber konsistent über Mittelwert, Median (33,15 ms) und P95 (33,55 ms).
• Brier-Score, niedriger ist besser — 0,530; 0,437; 0,347. Monoton bezüglich der Größe, wie es für eine echte Scoring-Regel üblich ist.
• Erwarteter Kalibrierungsfehler, niedriger ist besser — 0,066 für das 0,8B-Modell, 0,100 für dieses 2B-Modell, 0,065 für das 4B-Modell. Die mittlere Größe ist am schlechtesten, und sie ist schlechter als das Modell mit der halben Größe.
Die letzte Zeile ist die interessante, und die angepassten Temperaturen untermauern sie eher, statt sie zu erklären. Jeder Checkpoint trägt seine eigene NLL-angepasste Temperatur: 2,747760550703 für den 0,8B, 2,100509348278 für den 2B, 1,992418 für den 4B. Jede einzelne wurde an 1.728 designierten Kalibrierungsfällen angepasst, wobei 1.693 zurückgehalten wurden, indem die negative Log-Likelihood über eine Suche nach der inversen Temperatur in [0,01; 100] minimiert wurde, während die Labels der Testsuite bewusst aus der Anpassung herausgehalten wurden. Die Temperatur des 2B liegt zwischen denen seiner beiden Geschwister, was man erwarten würde, wenn die Anomalie ein Artefakt der Anpassung wäre. Das ist sie nicht: Der angepasste Wert ist monoton mit der Größe, der Fehler nach der Kalibrierung hingegen nicht. Nach InternLMs eigener Messung ist der Checkpoint mit 2,2 Milliarden Parametern der am wenigsten vertrauenswürdige der drei, wenn er Ihnen sagt, wie sicher er ist.
Zwei Einschränkungen, bevor daraus ein Schluss wird. ECE mit zehn gleich breiten Bins und Maximalwahrscheinlichkeits-Konfidenz ist eine verrauschte Statistik für die kleine Suite, die diese Tabelle verwendet – Jevbench-Hard, 111 Aufgaben, sodass die gesamte ECE-Spalte auf gut hundert Fragen und der Wahl der Bins beruht. Und internlm/Intern-Decision-2Bist die eine Karte der drei, die nichtden zusätzlichen Kalibrierungsabschnitt enthält, den die 4B-Karte hat, sodass es hier weniger Dokumentation gibt, nicht mehr. Lies die 0,100 als Grund, eine eigene Temperatur zu fitten, und nicht als Urteil über die Gewichte.

Was das Repository hinzufügt und was es weiterhin vorenthält
Das GitHub-Release ist vollständiger als die Modellkarte, die selbst schon informativ ist – ein Labor, das ein Paper-Artefakt beabsichtigte, liefert üblicherweise nicht zusammen mit dem Trainings-Launcher einen deterministischen Kalibrierungsgenerator und ein hash-verifizierendes Evaluationspaket aus.
Was jetzt öffentlich ist: der Trainingscode und das Masked-Next-Token-Ziel (Ground-Truth-Antwortsymbole erscheinen nur in den Labels, nie in der Eingabe; die Antwort jedes Feldes wird durch den Logit unmittelbar vor seinem Marker vorhergesagt, und alle Felder teilen sich einen Forward-Pass); die sieben Genauigkeits-Suites mit SHA-256-verifizierten Hashes und Zeilenanzahlen; der Bewertungscode; die Temperature-Fitting- und Replay-Skripte, wobei behauptet wird, dass Replay null Entscheidungen ändert; der 96-Fälle-Benchmark zur Verteilungskalibrierung mit seinem Generator und Offline-Scorer; und eine auf Loopback bereitgestellte Browser-Demo mit POST /v1/decisions (aliasiert als /v1/jev).
Was explizit ausgeschlossen wird, mit den eigenen Worten des Repositorys: „Trainingsdaten, private Kalibrierungs-/Validierungsaufzeichnungen, Bilder, Vorbereitungspipelines und Modellgewichte sind nicht enthalten.“ Das Repository enthält überhaupt keine Lizenzdatei, daher sind die Bedingungen des Codes nicht angegeben, obwohl die Gewichte unter Apache-2.0 stehen. Und die Zusammensetzung des Kalibrierungs-Splits — welche 1.728 Fälle, woher — bleibt unveröffentlicht, was die einzige Auslassung ist, die einschränkt, wie weit die ECE-Zahlen überprüft werden können.
Die Größen, die wir tatsächlich routen, und die eine, die wir nicht routen.
Intern-Decision-2B ist nicht auf OrcaRouter. Unsere Modellseite dafür liefert einen 404, es gibt nirgendwo einen gehosteten Endpunkt dafür, den wir finden konnten, und nichts hier sollte als Verfügbarkeitsaussage gelesen werden. Die einzige Möglichkeit, es heute aufzurufen, ist der Download des Checkpoints und das Ausführen von inference.py neben den Gewichten.
Das ist wichtig für die Entscheidung, um die es in diesem Artikel eigentlich geht, denn ein Scorer, den niemand bereitstellt, ist ein Scorer, den Sie selbst betreiben müssen. Wenn die Closed-Set-Entscheidung, die Sie treffen möchten, in ihrer Form dem ähnelt, was diese Familie tut — ein Zustand, typisierte Fragen, kalibrierte Wahrscheinlichkeiten — ist der gehostete Vergleich TypeSafe's Jev 1.13, das Modell, gegen das InternLM bewusst gebenchmarkt hat und das auf OrcaRouter für 0,042 $ pro Million Input-Token mit einem 65K-Kontext und einer P50-Zeit bis zum ersten Token von 178 ms verfügbar ist.

Einen Checkpoint mit 2,2 Milliarden Parametern lokal auszuführen und einen gehosteten Klassifikator aufzurufen, sind nicht derselbe Kauf, aber sie sind dasselbe Problem, und beides auf einem Schlüssel zu haben, mit Anbieter-Listenpreis, der mit 0 % Aufschlag durchgereicht wird, ist der Grund, den Vergleich offen zu halten, statt die Architektur auf eines von beiden zu setzen.
Was würde dieses Bild verändern?
Drei Dinge, der Reihe nach.
Jemand außerhalb von InternLM muss den Durchschnitt von 84,68 und die ECE von 0,100 reproduzieren, und das Repository ist jetzt das, was das möglich macht – was hier die eigentliche Neuigkeit ist. Die Prüfung ist öffentlich und hash-verifiziert; nur das Antwortblatt fehlt, und das Antwortblatt ist der Checkpoint, den jetzt jeder herunterladen kann.
Der Anbieter muss sagen, wofür das gedacht ist. Ein Modell mit einem funktionierenden Trainings-Stack, einem veröffentlichten Evaluations-Bundle und keiner Ankündigung, keiner Lizenz für seinen Code und keinem gehosteten Endpunkt wirkt wie ein Research-Release, bei dem noch nicht entschieden wurde, ob daraus ein Produkt wird. Die Apache-2.0-Gewichte deuten in die eine Richtung; die fehlende Code-Lizenz und der 401 Space deuten in die andere.
Und die mittlere Größe braucht eine Daseinsberechtigung. Wenn der Geschwindigkeitsvorteil des 2B gegenüber dem 0.8B real, aber marginal ist und seine Kalibrierung bei jedem von InternLM veröffentlichten Maß die schwächste der drei ist, dann lautet die ehrliche Empfehlung für die meisten Leser, den 2,6-fachen Speicherplatz für das 4B in Kauf zu nehmen oder die schwächere Genauigkeit des kleineren Modells zu akzeptieren. Das Argument für das 2B ist, dass es zufällig das schnellste der schnellen Modelle ist – und das ist ein dünneres Argument, als das marketinggeprägte Framing der Modellfamilie nahelegt.
