
Intern-Decision-4B: InternLM hat ein Entscheidungsmodell veröffentlicht, das antwortet, ohne ein Token zu schreiben
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 592 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Drei Modell-Repositories erschienen am 26. September 2026 innerhalb von vierzig Sekunden auf der Hugging Face-Seite von InternLM: Intern-Decision-0.8B um 05:35:57 UTC, Intern-Decision-2B um 05:36:19, und internlm/Intern-Decision-4B um 05:36:37. Das 4B ist das Interessante. Es ist ein Fine-Tuning von Qwen3.5-4B, das einen gemeinsamen Zustand, ein Schema benannter Fragen und optionale Bilder akzeptiert und in einem einzigen Vorwärtsdurchlauf eine kalibrierte Antwortverteilung für jede Frage zurückgibt. Es generiert nie Text. Die eigenen Versionshinweise sagen es unumwunden: „Diese API führt strukturiertes Kandidaten-Scoring durch. Sie ruft generate() nicht auf und sampelt keinen Freitext.“ Vierzig Sekunden voller Uploads und keine einzige Ankündigungszeile irgendwo — kein Blogbeitrag, kein Tweet, kein Changelog, keine Launch-Seite. Was existiert, ist eine Modellkarte, eine inference.py und vier safetensors-Shards.

Was ausgeliefert wurde und was nicht
Die Familie ist das Erste, was stimmen muss, denn die Modellkarte des 4B trägt sie still mit sich. Ihre Benchmark-Tabelle veröffentlicht Zeilen für Intern-Decision-0.8B und Intern-Decision-2B neben den eigenen, und alle drei Checkpoints landeten innerhalb derselben Minute auf dem Hub. Das 2B-Repository wird nie von der Modellkarte des 4B aus verlinkt — man muss es über den Upload-Feed der Organisation finden.
Was nicht ausgeliefert wurde, ist fast alles, was ein Release normalerweise mit sich bringt:
• Keine Ankündigung — null Berichterstattung im Web, keine Herstellererklärung in irgendeiner Sprache, die wir finden konnten.
• Keine Demo – die Karte verlinkt einen Space unter huggingface.co/spaces/internlm/intern-decision; dieser Endpunkt antwortet mit HTTP 401, was bedeutet, dass er nicht öffentlich ist und nicht, dass er defekt ist.
• Keine Sammlung — die beworbene Modellsammlung unter huggingface.co/collections/internlm/intern-decision gibt ebenfalls 401 zurück.
• Kein Code-Repository – der GitHub-Link der Karte, github.com/internlm/Intern-Decision, ist ein 404, und die Repository-Liste der InternLM-Organisation enthält kein derartiges Projekt.
• Keine Übernahme – zum Zeitpunkt des Schreibens verzeichnet das 4B einen Like und null Downloads.
Das ist die gesamte erkennbare Oberfläche. Behandle jede unten stehende Zahl als vom Anbieter selbst stammend, denn niemand sonst hat dieses Ding bisher laufen lassen.

Der Inferenzvertrag ist das Produkt
Der größte Teil der Karte entfällt auf eine fünfstufige Prozedur, die dir zeigt, wohin die Entwicklungsarbeit geflossen ist. Fragen und Optionen behalten ihre Reihenfolge. Die Optionen jeder Frage werden auf Ein-Token-Symbole abgebildet — A bis Z, dann a bis z, dann 0 bis 9. Das sind 62 Symbole, und genau deshalb begrenzt die Karte eine Frage auf 62 Optionen. Der Prompt wird aus dem ursprünglichen System-Prompt, dem Zustand, dem Entscheidungsschema und einem vollständigen Assistant-JSON-Skelett gerendert, mit einem <decision>-Platzhalter pro Feld, wobei die Chat-Vorlage des Checkpoints und ein leerer Denkblock beibehalten werden. Dann ein kausaler Forward-Pass. Logits werden an der Position unmittelbar vor jedem Platzhalter gelesen, eine Softmax läuft nur über die erlaubten Kandidatensymbol-Logits des jeweiligen Felds, eine Kalibrierung wird angewendet, und Symbole werden zurück auf deine Optionswerte abgebildet.
Die Konsequenz ist eine feste Form: keine Decodierungsschleife, kein Sampling, kein Parser, keine Halluzinationsoberfläche und eine harte Obergrenze von einer Entscheidung pro Frage pro Durchlauf. Drei Fragetypen werden unterstützt – Auswahl mit einer geordneten Kriterienzuordnung, Punktzahl mit einer Liste oder einer Zuordnung mit numerischen Schlüsseln und noul, ein binäres Nein/Ja.
Das Datenblatt-Detail, auf das es am meisten ankommt
Die Modellkarte stellt ausdrücklich klar, dass Eingaben „ohne Kürzung abgelehnt“ werden, wenn sie oberhalb von DecisionEngine(max_length=8192) liegen. Liest man das neben der Konfiguration, tritt etwas Merkwürdiges zutage: Der zugrunde liegende Text-Tower deklariert max_position_embeddings von 262.144. Das Backbone kann eine Viertelmillion Tokens adressieren; der veröffentlichte Wrapper lehnt alles jenseits von 8.192 ab. Dies ist kein Long-Context-Modell mit konservativem Standard — es ist ein Entscheidungsbewertungsmodell, dessen eigener Harness die Evidenz begrenzt, die man ihm übergeben darf. Wenn Ihre Routing-Frage von mehr als ungefähr achttausend State-Tokens abhängt, wird dieser Checkpoint in der ausgelieferten Form sie nicht beantworten, und er wird lieber ablehnen, als Ihre Eingabe zu kürzen.
Bis zu acht Bilder sind erlaubt, und die Karte merkt an, dass Bild-Tokens auf dasselbe Limit von 8.192 angerechnet werden.

In den Gewichten
Vier Shards, 4,54 Milliarden BF16-Parameter und eine Konfiguration, die die Größenbezeichnung erklärt: Es gibt einen Text-Turm, einen Vision-Turm mit ungefähr zwei Dutzend Schichten und einer Patch-Größe von 16 Pixeln sowie einen Projektor dazwischen. Die Textseite besteht aus 32 Schichten mit einer Hidden-Size von 2.560, mit 16 Attention-Heads gegenüber 4 Key-/Value-Heads, einem Vokabular von 248.320 Token und gebundenen Embeddings. Die Schichttypen wechseln in einem festen Intervall – drei Linear-Attention-Schichten, dann eine Full-Attention-Schicht, wiederholt. Nur die Full-Attention-Schichten tragen globale Attention, und das Rotary-Embedding ist mit einem Faktor von 0,25 partiell. Zum Laden braucht es Python 3.12 oder neuer, PyTorch 2.9.1 und Transformers 5.14.1, und die Dateiliste enthält weiterhin die Tokenizer-, Merges- und Vokabular-Dateien, statt sich auf einen Hub-seitigen Tokenizer zu verlassen.
Die Zahlen und wer sie erstellt hat
Alles in diesem Abschnitt wurde von InternLM gemessen und auf der Modellkarte veröffentlicht. Nichts davon wurde von einem Dritten reproduziert, und es gibt nirgendwo einen Artificial Analysis-Eintrag, keine Arena-Bewertung und keine Leaderboard-Zeile für dieses Modell.
Über sieben Evaluationssets hinweg erreicht das 4B im Durchschnitt 90,02, bei einem Brier-Score von 0,347 und einem erwarteten Kalibrierungsfehler von 0,065. Dieselbe Tabelle listet Intern-Decision-0.8B mit 79,38 und Intern-Decision-2B mit 84,68 auf, die Familie kurvt also mit der Größe nach oben — 4,7 Punkte von 0.8B zu 2B, dann noch 5,3 bis 4B. Die Tabelle enthält außerdem fünf Zeilen, die der Anbieter nicht trainiert hat: Jev mit 88,74, JevK5 mit 85,16, SemIf mit 84,23, Kev mit 79,56 und Laya mit 57,77. Diese wurden von InternLM auf dem Harness von InternLM gegen den Checkpoint von InternLM ausgeführt. Sie sind nicht die eigenen Zahlen dieser Projekte, und sie als solche zu lesen, ist der einfachste Fehler, der hier möglich ist.
Die Latenz wird auf einer einzelnen RTX 4090 über den lokalen Hugging-Face-Pfad gemessen, und die Karte kennzeichnet die Werte als arbeitslast- und hardwareabhängig. Das 4B-Modell kommt auf 44,16 ms im Mittel, 44,03 ms im Median und 44,60 ms bei P95 — eine Streuung von deutlich unter einer Millisekunde zwischen Median und Tail, was typisch für einen Forward-Pass mit fester Form ist. Die beiden kleineren Checkpoints liegen beide bei etwa 33 ms, wobei das 2B-Modell beim Mittelwert und beim Median knapp vor dem 0.8B-Modell liegt, was man bemerken sollte, anstatt es zu glätten: Diese beiden liegen nah genug beieinander, dass sie innerhalb des Messrauschens des jeweils anderen liegen.
Kalibrierung und die ehrlichen Vorbehalte darin
Der Checkpoint wird mit einer Standardtemperatur von 1,99241824 ausgeliefert, die für dieses Modell separat durch Minimierung der negativen Log-Likelihood an 1.728 designierten Kalibrierungsfällen angepasst wurde, wobei 1.693 für die Validierung zurückgehalten wurden. Die Modellkarte gibt an, dass die Test-Suite-Labels nicht verwendet wurden, um sie auszuwählen. Bei der Implementierung handelt es sich um eine Kandidatenwahrscheinlichkeitskalibrierung, keine Sampling-Temperatur: Sie verschiebt die Konfidenz, die binäre Wahrscheinlichkeit und den erwarteten Score, lässt dabei aber die Argmax-Entscheidung unberührt.
Eine separate 96-Fälle-Diagnose berichtet dann über den Effekt. In InternLMs eigenen Vorher-Nachher-Spalten bewegen sich der Gesamt-Brier und die ECE des 4B von 0,628 / 0,213 auf 0,550 / 0,089, gegenüber 0,595 / 0,130 für Jev. Zwei ehrliche Lesarten dieser Tabelle: Die Kalibrierung funktioniert eindeutig, und die „Vorher“-Spalte ist nicht das, was irgendein Nutzer jemals sehen würde, da die ausgelieferte Standardeinstellung die gefittete Temperatur ist. Ebenfalls erwähnenswert — zwei der sechs Diagnosekategorien sind für den 4B schlechter als für Jev, und die schlechteste von ihnen, tägliche Evidenz und Beobachtungsbias, verbessert sich auf 0,575 / 0,210, liegt aber weiterhin hinter Jevs 0,603 / 0,114 zurück. In diesem Ausschnitt verkleinert die Kalibrierung die Lücke, ohne sie zu schließen.
Wo ein Router passt und wo noch nicht
Das praktische Hindernis bei der Nutzung dieses Modells ist nicht die Genauigkeit, sondern die Verpackung. Das Release liefert eine Python-Klasse, die man nach dem Herunterladen von vier Shards importiert, nicht einen HTTP-Endpunkt, den man aufrufen kann. Genau diese Lücke soll eine Routing-Schicht schließen — ein Schlüssel für über 200 Modelle, Anbieter-Listenpreis mit 0 % Aufschlag weitergegeben, und automatisches Failover, wenn ein Anbieter wackelt — aber wir sollten deutlich sagen, dass OrcaRouter derzeit Intern-Decision-4B oder irgendein Modell seiner Art nicht führt. Unser Katalog listet es nicht auf, und nichts hier sollte als Verfügbarkeitsaussage verstanden werden. Was wir anbieten können, ist die günstigere Entscheidung: Wenn Sie einen Entscheidungs-Scorer mit 4,5 Milliarden Parametern vor einem Produktionspfad ausprobieren möchten, können Sie ihn in einen Router mit einem Fallback auf ein allgemeines Modell einbauen, sodass ein schlechter Kalibrierungstag Sie einen erneuten Versuch statt eines Ausfalls kostet.
Was würde das Bild verändern?
Drei Dinge, in der Reihenfolge ihrer Wichtigkeit. Jemand außerhalb von InternLM muss den Durchschnitt von 90.02 und den erwarteten Kalibrierungsfehler von 0.065 reproduzieren — Kalibrierungsbehauptungen, die noch nie einem fremden Testsatz begegnet sind, sind die am schlechtesten übertragbaren Zahlen im maschinellen Lernen. Der eigene Fußabdruck der Karte muss erscheinen: der Space, die Sammlung, das GitHub-Repository. Und der Anbieter muss sagen, ob dies ein Produkt oder ein Paper-Artefakt ist, denn eine Nur-Forschungs-Lizenz und eine Apache-2.0-Lizenz sind nicht dieselbe Verpflichtung, und das 4B hat Apache-2.0 gewählt, wobei die Qwen-Lizenz daneben erhalten blieb. Bis dahin ist die richtige Einordnung die, die der Upload selbst nahelegt: Dies ist ein echter Checkpoint mit einem echten Inferenzvertrag und einer völlig ungeprüften Scorecard, veröffentlicht, ohne dass irgendjemand informiert wurde.
Vorerst ist die ehrliche Zusammenfassung eng umrissen und nützlich. Wenn dein Problem lautet: „Wähle eines von fünf Routing-Labels aus und sag mir, wie sicher du bist“, dann ist ein 4,5B-Modell, das 62 Logits und keinen Fließtext ausgibt, eine vertretbare Ausgestaltung für die Evaluierung. Wenn dein Problem ein langes Dokument, mehr als acht Bilder oder jeglichen Bedarf umfasst, die Antwort in Worten zu erklären, ist dieser Checkpoint im Auslieferungszustand das falsche Werkzeug, und kein noch so großer Feinschliff an den Hersteller-Benchmarks ändert daran etwas.
