
Intern-Decision-2B vs. MiniCPM5-2B: Zwei 2B-Checkpoints, zwanzig Tage auseinander, entgegengesetzte Wege, die Parameter zu verausgaben
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 584 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
internlm/Intern-Decision-2B und openbmb/MiniCPM5-2B sind gleich groß, wurden mit zwanzig Tagen Abstand veröffentlicht, auf dieselbe Weise lizenziert und für nichts gebaut, das auch nur entfernt derselben Aufgabe ähnelt. Der Checkpoint von InternLM ist ein Decision-Scorer mit 2.213.241.664 Parametern: Er nimmt einen Zustand und typisierte Fragen entgegen, führt einen einzigen Forward-Pass aus und gibt kalibrierte Wahrscheinlichkeiten zurück, ohne ein Token zu generieren, wobei er jede Eingabe jenseits von 8.192 Token ablehnt. Der von OpenBMB ist ein dichter Generalist mit 2.516.756.480 Parametern: ein 42-schichtiges Llama, abgeleitet vom MiniCPM5-Rezept, das 131.072 Token Kontext verarbeitet, Code schreibt, Tools aufruft und Mathematik betreibt, mit einem Artificial Analysis Intelligence Index von 12,5 und 726.518 Downloads im letzten Monat. Sie kosten beim Herunterladen gleich viel und kaufen dafür völlig unterschiedliche Dinge.
Das Interessante an dieser Paarung ist nicht die Benchmark-Lücke – es gibt kaum einen überlappenden Benchmark zum Vergleich. Es ist, wofür ein Budget von 2,2 Milliarden und eines von 2,5 Milliarden Parametern jeweils ausgegeben werden kann und was die Wahl darüber verrät, welches von beiden fertig ist. MiniCPM5-2B ist das zweite Modell seiner Reihe, nach MiniCPM5-1B vom Mai, und es kam mit einem vollständigen Release-Apparat. Intern-Decision-2B ist die mittlere von drei Größen, die InternLM am 26. September 2026 um 05:36 UTC ohne Ankündigung auf Hugging Face hochgeladen hat, und sein Release-Apparat – eine Trainings-Codebasis, ein hash-verifiziertes Evaluierungsbundle, ein Kalibrierungs-Benchmark mit 96 Fällen – wurde erst heute Morgen um 08:58 UTC öffentlich.
Wohin die beiden Budgets gingen
Beide Modelle sind Feinabstimmungen der Architektur von jemand anderem, und beide haben etwa 2,5 Milliarden Parameter. Dort endet die Ähnlichkeit.

MiniCPM5-2B ist ein dichter Transformer mit 42 Schichten, einer Hidden-Size von 2.048, 16 Attention-Heads, einer Intermediate-Size von 6.144, einem Vokabular von 130.560 Tokens und einem Kontext von 131.072 Tokens, trainiert auf einer Mischung offener Korpora, die OpenBMB zusammen mit ihm veröffentlicht hat: UltraX für Web-Pretraining, UltraData-Code mit gestaffelter Codeverwaltung L0–L3, UltraData-Math und 500.000 Agent-SFT-Samples mit über 80.000 RL-Samples in UltraData-RL-2609. Sein Post-Training durchläuft SFT, dann spezialisierte RL-Lehrer in Mathematik, Code und agentischen Aufgaben und anschließend On-Policy-Distillation zurück in ein einziges Modell. Es ist ein Allzweckmodell, dessen gesamtes Parameterbudget als Fähigkeit offengelegt ist, die sich per Prompt abrufen lässt.
Intern-Decision-2B ist ein Qwen3_5ForConditionalGeneration mit 24 Schichten – ein sich wiederholendes Muster aus drei Linear-Attention-Schichten zu einer Full-Attention-Schicht – Hidden-Size 2.048, 8 Query-Heads gegenüber 2 Key-Value-Heads, Head-Dimension 256, eine beibehaltene Multi-Token-Vorhersageschicht und eine Embedding-Obergrenze von 262.144 Positionen. Es wird mit einem 612,5 MB großen Vision-Tower und einem 50,3 MB großen Projektor ausgeliefert. Nahezu nichts von diesem Budget steht Ihnen als Prompt zur Verfügung: Das Modell beantwortet ein festes Schema von Fragen, und seine Architektur ist der Übertragungsmechanismus für ein Softmax, nicht ein Textgenerator.
Ein Detail aus dem neu veröffentlichten Repository von InternLM lohnt es, herauszugreifen, denn es ordnet das Multimodal-Etikett auf der Modellkarte neu ein. Das Decision-Tuning „feintunt den Sprach-Backbone von Qwen3.5, während der Vision-Tower und der Projektor eingefroren werden". Sowohl der 2B- als auch der 4B-Decision-Checkpoint tragen ein Vision-Shard von genau 612.517.440 Bytes – in beiden dieselbe Größe –, was damit zusammenpasst, dass diese Komponenten von der Qwen-Basis geerbt und nicht trainiert wurden. Der Bildpfad ist real und er ist nutzbar, aber er ist nicht das, worauf InternLMs Decision-Tuning seine Anstrengungen verwendet hat. Wenn Ihre Workload reines Text-Decision-Scoring ist, tun rund 660 MB dieses 4,46 GB großen Downloads nichts für Sie.
Anzeigetafel

• Parameter — Intern-Decision-2B 2.213.241.664 in BF16 plus circa 660 MB Vision-Tower und Projektor, etwa 4,46 GB Repository; MiniCPM5-2B 2.516.756.480 in BF16, eine 5,03 GB große safetensors-Datei.
• Kontext — 8.192 Tokens für Intern-Decision-2B, darüber ohne Trunkierung abgelehnt; 131.072 Tokens für MiniCPM5-2B.
• Ausgabe — eine kalibrierte Verteilung plus ein Argmax pro Feld, überhaupt kein Text; generierter Text, Token für Token.
• Training — Decision-Tuning eines Qwen3.5-2B-Backbones mit eingefrorenem Vision-Tower, Trainingsdaten nicht offengelegt; ein vollständiger Pre-Train-, Mid-Train- und 400-Milliarden-Token-Deep-Thinking-SFT-Durchlauf, gefolgt von RL und On-Policy-Distillation, wobei die Korpora begleitend veröffentlicht wurden.
• Veröffentlichte Belege — eine Herstellertabelle mit sieben Suiten, die im Durchschnitt 84,68 erreicht, mit Brier 0,437 und ECE 0,100, von keiner dritten Partei reproduziert, ein Like und null Downloads; eine OpenBMB-Karte, die innerhalb ihres eigenen Vergleichssatzes durchschnittlich 53,9 erreicht, und ein unabhängiger Artificial Analysis Intelligence Index von 12,5, bei 726.518 Downloads im letzten Monat.
• Lizenz — Apache-2.0, wobei die Qwen-Bedingungen des Upstreams als LICENSE-QWEN erhalten bleiben, und im Code-Repository überhaupt keine Lizenz angegeben; durchgängig Apache-2.0, Code eingeschlossen.
Worin jedes Einzelne tatsächlich besser ist, und zwar nicht knapp.
Der Vergleich ist asymmetrisch bis hin zu einem Kategorienfehler, daher ist es sinnvoller, die Tätigkeiten zu benennen.
MiniCPM5-2B gewinnt alles, bei dem es darum geht, eine Antwort zu produzieren statt eine auszuwählen. Es schreibt Code; Intern-Decision-2B hat keinen Code-Pfad. Es verarbeitet einen Kontext von 131.072 Token; Intern-Decision-2B endet bei 8.192 und schlägt lautstark fehl. Es ruft Tools auf, mit einem BFCL-v4-Wert von 66,6 in OpenBMBs eigener Tabelle, und es beherrscht Mathematik, mit MATH-500 bei 94,6 und GPQA-Diamond bei 70,2 — Zahlen von der Karte des Anbieters, wobei die GPQA-Zeile eine Fußnote trägt, die die Karte selbst liefert. Es erzielt 70,8 bei MMLU-Pro und 84,7 bei MMLU-Redux. Es läuft in llama.cpp und MLX, wird in GGUF-, GPTQ- und DSpark-Varianten ausgeliefert und hat einen Demo-Space auf dem Hub, der öffentlich ist, anders als der 401, auf den die Karte von Intern-Decision verweist.
Intern-Decision-2B kann genau zwei Dinge für sich verbuchen, und sie sind der Grund für seine Existenz. Erstens: Eine Entscheidung mit geschlossenem Kandidatensatz und einem Schema, das Sie schreiben, liefert eine Wahrscheinlichkeit, die Sie schwellenwertbasiert auswerten können, in einem einzigen Vorwärtsdurchlauf, in etwa 33 Millisekunden, ohne Parser und ohne Sampling – eine Form, die MiniCPM5-2B nicht erzeugen kann, außer indem sie Text generiert und hofft, dass die darin enthaltene Zahl gutartig ist. Zweitens ist es ein reproduzierbares Artefakt: Das Repository enthält jetzt das Trainingsziel, die sieben Genauigkeits-Suiten mit SHA-256-Hashes und Zeilenanzahlen pro Suite, den Bewertungscode, die Skripte zur Temperature-Anpassung und zum Replay sowie einen 96-Fälle-Benchmark zur Verteilungskalibrierung mit eigenem Generator und Offline-Scorer. Der Evaluationsleitfaden von InternLM weist darauf hin, dass die veröffentlichten Presets an das XTuner-Backend gebunden sind und dass HF-Ergebnisse als eine andere Ausführungseinstellung angegeben werden sollten – was genau die Art von Vorbehalt ist, die ein Reproduktionskit überprüfbar machen soll.

Wer sollte was herunterladen?
Wenn Sie eine Aufgabe haben, bei der etwas Langes gelesen, etwas geschrieben oder eine Frage beantwortet werden muss, deren Optionen Sie nicht im Voraus aufgelistet haben, dann ist MiniCPM5-2B das Modell, und es gibt keine Entscheidung zu treffen. Es ist ein fertiger Generalist der 2B-Klasse mit einem echten Ökosystem, offenen Daten dahinter und einer unabhängigen Bewertungsliste, und es kostet nichts, ihn auszuprobieren — GGUF- und MLX-Builds gibt es bereits auf dem Hub.
Wenn man eine Aufgabe hat, bei der es wirklich um eine Auswahl unter bekannten Antworten geht – das Routing eines Tickets, die Klassifizierung einer Support-E-Mail, die Kennzeichnung eines Kandidaten, die Bewertung einer Absicht auf einer ordinalen Skala –, dann ist ein Generierungsmodell das falsche Instrument, und Intern-Decision-2B ist von den beiden das interessantere, obwohl es fast niemand ausgeführt hat. Eine Wahrscheinlichkeit, die man schwellenwertmäßig behandeln kann, ist im Betrieb günstiger, leichter zu auditieren und nicht halluzinierbar, und die Tatsache, dass der Checkpoint mit einem Reproduktionskit statt mit einem Leaderboard-Beitrag ankam, macht ihn zum besser dokumentierten der beiden auf der Achse, die zählt, wenn man die Entscheidung verteidigen muss.
Keines der beiden Modelle ist auf OrcaRouter verfügbar. Unsere Modellseite für Intern-Decision-2B liefert einen 404-Fehler, und es gibt keine MiniCPM5-2B-Route; nichts hiervon ist eine Verfügbarkeitsaussage, und beides bedeutet, die eigene Inferenz selbst zu betreiben. Die praktische Alternative findet sich bei den gehosteten Entscheidungsmodellen: TypeSafes Jev 1.13, das Modell, an dem InternLM seine gesamte Familie gemessen hat, ist im Katalog für 0,042 $ pro Million Eingabe-Tokens bei einem 65K-Kontext und einer P50-Zeit bis zum ersten Token von 178 ms verfügbar. Und wenn Sie eigentlich einen Generalisten in derselben Größenklasse wie MiniCPM-2B brauchen, ohne den operativen Aufwand, dann ist unsere kleinste gehostete Qwen-Route zwar um ein Vielfaches größer, aber sie ist ein einziger Schlüssel unter mehr als 200 Modellen – zu durchgereichtem Listenpreis des Anbieters ohne Aufschlag und automatischem Failover dahinter.
Die eine Zahl, die den Ausschlag gibt
Es handelt sich nicht um 84,68 gegenüber 53,9. Diese beiden Durchschnittswerte stammen aus verschiedenen Suiten, gemessen von verschiedenen Laboren, und in einem Fall von einem Labor, dessen Zahlen nie überprüft wurden. Die Zahl, die den Ausschlag gibt, ist 8.192. Wenn Ihr Zustand in achttausend Token passt und Ihre Antwort bereits eine Liste ist, ist Intern-Decision-2B ein präzises Instrument mit einem Reproduktionskit und einer Kalibrierungsanomalie, die Sie kennen sollten – sein erwarteter Kalibrierungsfehler von 0,100 ist der schlechteste der drei von InternLM veröffentlichten Größen, gegenüber 0,066 für das halb so große Modell, also passen Sie Ihre eigene Temperatur an, bevor Sie einem Konfidenzwert vertrauen. Wenn Ihr Zustand nicht passt, ist die Frage vorbei, bevor die Benchmarks beginnen, und MiniCPM5-2B ist die Antwort.
