Eine generierte Titelkarte für Microsoft-Decision-1 vs. Intern-Decision-2B mit dem Untertitel „der mittlere Checkpoint, der am schnellsten antwortet und am schlechtesten darin ist, zu sagen, wie sicher er ist“, mit Chips, die 2.213.241.664 Parameter, eine Temperatur von 2,100509348278, ECE 0,100, 33,28 ms auf einer 4090 und eine 8.192-Token-Obergrenze anzeigen.
Engineering & Research

Microsoft-Decision-1 vs. Intern-Decision-2B: Neun Millisekunden schneller und messbar schlechter kalibriert

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Es gibt eine Zahl in InternLMs eigener Tabelle, die es nicht geben dürfte, und sie ist der Grund, warum dieser Vergleich mehr wert ist als das Datenblatt. Intern-Decision-2B — 2.213.241.664 Parameter, feinabgestimmt von Qwen/Qwen3.5-2B, am 26. September 2026 um 05:36:19 UTC ohne Ankündigung auf Hugging Face hochgeladen — verzeichnet eine mittlere Latenz von 33,28 ms pro Anfrage auf einer einzelnen RTX 4090, was geringfügig schneller ist als das eigene Geschwistermodell mit 852 Millionen Parametern bei 33,98 ms. Außerdem verzeichnet es die schlechteste Kalibrierung seiner Familie: einen erwarteten Kalibrierungsfehler von 0,100 gegenüber 0,066 beim 0,8B, bei einer angepassten Temperatur von 2,100509348278 gegenüber 2,747760550703 beim 0,8B. In der Zwischenzeit Microsoft-Decision-1, das seit 8. Oktober 2026 allgemein auf Microsoft Foundry verfügbar ist, veröffentlicht weder eine Latenzzahl noch überhaupt einen Kalibrierungsfehler — nur einen Methodikabsatz, der beschreibt, wie beide gemessen wurden. Die Frage, die dieser Vergleich wirklich aufwirft, ist also nicht, welcher der beiden besser ist. Sie lautet: Was kauft man, wenn man bei irgendetwas die mittlere Größe kauft.

Beide Modelle sind Entscheidungs-Scorer: Zustand als Eingabe, begrenzte Fragenmenge als Eingabe, kalibrierte Wahrscheinlichkeiten als Ausgabe, kein generierter Text und keine Token zum Parsen. Dieser gemeinsame Vertrag ist es, der die Unterschiede lesbar macht. Microsoft-Decision-1 ist eine gehostete Foundry-API nur für Text auf Basis von Qwen3.5-9B mit einem 32.768-Token-Fenster, ohne verteilte Gewichte und ohne Fine-Tuning-Pfad. Intern-Decision-2B ist ein Apache-2.0-Checkpoint, bei dem die Upstream-Qwen-Lizenz als LICENSE-QWEN beibehalten wird, mit etwa 4,46 GB Repository, benutzerdefiniertem Inferenzcode und ohne gehosteten Endpunkt – nirgendwo.

Wofür die mittlere Größe eigentlich gedacht ist

InternLM hat in vierzig Sekunden drei Checkpoints veröffentlicht: das 0.8B um 05:35:57, dieses hier um 05:36:19, das 4B um 05:36:37. Beim anbietereigenen Durchschnitt über sieben Suiten steigt die Familie in der Reihenfolge, die man sich erhofft – 79,38, 84,68, 90,02 –, was der einzige Punkt ist, an dem das 2B wie ein vernünftiger Kauf wirkt. Überall sonst wirkt es wie die Größe, die niemand absichtlich gewählt hätte.

Die Prompt-Verarbeitung dominiert einen Entscheidungsaufruf, und das ist die mechanische Erklärung für die Latenz-Inversion statt eines Rätsels. Ein Scorer führt genau einen Forward-Pass über einen Prompt durch, dessen Länge durch den Zustand, das Schema und die Optionsbeschreibungen festgelegt wird – niemals durch irgendetwas, das das Modell schreibt, denn es schreibt nichts. In diesem Regime ist die Parameteranzahl ein Kostenfaktor zweiter Ordnung, daher trifft der übliche Grund, zum kleinsten Checkpoint zu greifen, nicht zu: Man spart keine Zeit, man spart Speicher. Das gesamte Repository des 0,8B-Modells umfasst etwa 1,73 GB gegenüber 4,46 GB bei diesem Modell, und das ist der ehrliche Grund, es vorzuziehen. Der einzige echte Anspruch des 2B-Modells ist, dass es zufällig das schnellste der Schnellen ist – mit einem Vorsprung, der klein genug ist, um als Rauschen zu gelten.

Gegen Microsoft-Decision-1 gehalten, ist diese Behauptung nahezu irrelevant, weil die beiden Modelle nicht im selben Latenzregime liegen. Die Geschwindigkeit eines gehosteten Endpunkts ist eine Funktion Ihrer Bereitstellungsform – serverlos versus bereitgestellter Durchsatz auf derselben Standard-SKU –, bevor sie eine Funktion des Modells ist, und Microsoft veröffentlicht keine Pro-Aufruf-Zahl zum Vergleich. Was Microsoft jedoch veröffentlicht, ist eine harte betriebliche Einschränkung, die in die andere Richtung wirkt: Batch-Inferenz ist deaktiviert. Es gibt keinen Offline-Kanal, über den sich ein Massen-Scoring-Lauf amortisieren ließe, sodass eine Microsoft-Decision-1-Pipeline die interaktiven Kosten jeder Entscheidung trägt, während ein selbst gehosteter Checkpoint in GPU-Stunden zahlt, unabhängig davon, ob er gerade scored.

Die Kalibrierungsspalte, in der die Mitte verliert

Liest man die drei Intern-Decision-Karten zusammen, verhält sich die Modellfamilie nicht mehr vorhersagbar. Die Genauigkeit ist monoton bezüglich der Größe; die Kalibrierung nicht. Das 2B weist eine ECE von 0,100 auf – den schwächsten Wert der drei – und eine gefitete Temperatur von 2,100509348278, deutlich unter dem Wert des 0,8B-Modells von 2,747760550703. Die Karte weist einen an, das Inferenzmodul zu verwenden, das mit der heruntergeladenen Größe mitgeliefert wurde, weil die Standardkalibrierungen pro Checkpoint gelten; wer einen Wrapper von einem Geschwistermodell auf ein anderes kopiert, wendet stillschweigend die falsche Temperatur an.

Die Transformation selbst sollte man verstehen, bevor man diese 0,100 als Urteil über die Gewichte betrachtet. Sie ist ein Softmax über die Kandidaten-Logits des Feldes, gefolgt von einem zweiten Softmax über den Logarithmus dieser Verteilung geteilt durch die Temperatur. Da sie nach dem ersten Softmax läuft und die Reihenfolge erhält, kann sie das Argmax überhaupt nicht verändern. Sie verschiebt die Konfidenz, die Ja-Wahrscheinlichkeit und den Erwartungswert einer Score-Frage und lässt das Label identisch. Wenn Ihre Pipeline Labels liest, ist die Temperatur ein No-Op und die ECE eine Kuriosität. Wenn Ihre Pipeline Wahrscheinlichkeiten liest — sie mit Schwellenwerten versieht, nach ihnen sortiert, sie in eine Erwartungswertberechnung einspeist —, dann ist eine ECE von 0,100 der Unterschied zwischen einem Schwellenwert, der bedeutet, was Sie geschrieben haben, und einem, der es nicht tut. Die richtige Reaktion ist, Ihre eigene Temperatur auf Ihren eigenen gelabelten Fällen anzupassen, statt zu schlussfolgern, die Gewichte seien schlecht.

Microsoft-Decision-1 verlangt genau dieselbe Arbeit, mit weniger Ausgangsmaterial. Sein Tab „Benchmarks“ gibt an, dass Genauigkeit, Kalibrierungsfehler, Safety-Recall, Falsch-Positiv-Raten und Fairness-Konsistenz auf öffentlichen und Community-Entscheidungs-Benchmarks sowie zurückgehaltenen internen Testsets gemessen wurden, dass die Optionsreihenfolge variiert wurde, dass gepaarte statistische Tests angewendet wurden und dass das Modell „mit führenden Entscheidungsmodellen mithält und vor anderen offenen Entscheidungsmodellen liegt, die mit derselben Methodik bewertet wurden“. Kein ECE. Kein Brier. Keine Temperatur. Keine Genauigkeitstabelle. Das Modell, dessen gesamtes Wertversprechen eine vertrauenswürdige Wahrscheinlichkeit ist, ist in diesem Vergleich dasjenige, für das überhaupt keine veröffentlichte Kalibrierungszahl vorliegt.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-2B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; context 32,768 tokens; modalities text only; batch inference disabled; calibration error not published; latency not published. Right column Intern-Decision-2B rows read: availability uploaded September 26, 2026; context 8,192 tokens with oversize input rejected; modalities text plus up to eight images; batch inference not applicable, self-hosted; ECE 0.100, the worst of its three siblings; 33.28 ms mean on a single RTX 4090, the fastest of the three. A footer line reads that the InternLM figures are vendor-reported and the 2B's fitted temperature is 2.100509348278.

Vertragsgrenzen: vier Dinge, die das gehostete Modell nicht tun wird

Die beiden Modelle treffen scheinbar dieselbe Entscheidung, und die Abweichungen liegen an deren Rändern.

• Modalität — Microsoft-Decision-1 ist explizit textbasiert und akzeptiert weder Bilder noch Audio oder Video. Intern-Decision-2B akzeptiert bis zu acht Bilder zusammen mit dem Zustand, was es zu einem Kandidaten für Screenshot-Triage und Layout-Prüfungen macht, die die gehostete API mit keinerlei Genauigkeit bereitstellen kann.

• Eingabeobergrenze und Fehlerverhalten — Microsoft-Decision-1 führt einen einzelnen Aufruf über bis zu 32.768 Token aus. Intern-Decision-2B deklariert DecisionEngine(max_length=8192) und weist zu große Eingaben zurück, statt sie abzuschneiden, was für einen Scorer korrektes Verhalten und zugleich eine harte Grenze ist, weil der Zustand, das Schema und das Skelett in einem Durchgang vorhanden sein müssen; keine Chunking-Strategie wahrt den Vertrag.

• Fragenformat — InternLM dokumentiert ein bis sechzehn Fragen pro Aufruf mit bis zu 62 Optionen jeweils über drei Feldtypen (choice, score, noul), wobei noul ein binäres Ja/Nein ist, das eine Wahrscheinlichkeit zurückgibt, und score einen wahrscheinlichkeitsgewichteten Erwartungswert auf einer Skala zurückgibt, die Sie benennen. Microsoft dokumentiert die Formate — Ja/Nein, Multiple-Choice, Bewertung, Klassifizierung, Rubrik — plus eine explizit unterstützte Enthaltungsoption wie „cannot tell", wenn die Belege nicht ausreichen, was die mit Abstand nützlichste Zeile auf der Seite für alle ist, die Eskalationslogik schreiben.

• Preis — Die Modellseite von Microsoft-Decision-1 nennt keinen Tarif; die Preisangaben verlinken auf Microsofts Preisoberfläche, sodass die Kosten pro Entscheidung etwas sind, das man aus Azure oder einer Rechnung abliest, wobei 0 % davon auf Ausgabe-Tokens entfallen, weil es keine gibt. Intern-Decision-2B kostet nichts pro Aufruf und alles in GPU-Zeit, und es hat keinen gehosteten Anbieter. Sein Speicherbedarf beträgt ungefähr 4,46 GB, verteilt auf einen 3,76 GB großen Sprach-Shard, einen 612,5 MB großen Vision-Tower und einen 50,3 MB großen Projektor.

Was ist bestätigt, und was ist nur das Gerede des Anbieters

Diese beiden Kategorien getrennt zu halten, ist die ganze Disziplin bei dieser Familie. Bestätigt durch eine Dateiauflistung oder eine HTTP-Antwort: die Parameteranzahl, die Shard-Map, das Lizenzpaar, das Basismodell, die darunterliegende Architektur — eine Qwen3_5ForConditionalGeneration mit 24 Schichten, einer Hidden-Size von 2.048, 8 Query-Heads gegenüber 2 Key-Value-Heads, einer Head-Dimension von 256, einem wiederkehrenden Muster von drei Linear-Attention-Schichten auf eine Full-Attention-Schicht, einer beibehaltenen Multi-Token-Prediction-Schicht und einer Embedding-Obergrenze von 262.144 Positionen, die die 8.192-Token-Engine-Obergrenze praktisch irrelevant macht.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Vom Anbieter gemeldet und nicht reproduziert: jeder Genauigkeitswert, jeder Latenzwert und die Temperatur. Es gibt kein Paper, keinen arXiv-Eintrag, keinen Launch-Post, kein Changelog und keine unabhängige Evaluierung. Der Demo-Space antwortet mit 401, was bedeutet, dass er nicht öffentlich und nicht etwa defekt ist. Das GitHub-Repository, das nach dem Modell auftauchte – drei Commits, Trainingscode, zwei Inferenz-Backends, ein Evaluierungspaket mit 10.751 Testzeilen, ein Kalibrierungs-Benchmark mit 96 Fällen und eine Reproduktionsanleitung –, ist mehr Dokumentation, als die meisten stillen Releases bekommen, und es enthält keine Gewichte, keine Trainingsdaten und keine Code-Lizenz. Microsoft befindet sich in einer anderen, aber benachbarten Position: Seine Methodik ist real und seine Behauptung ist qualitativ, und keines der beiden Unternehmen ist derzeit in der Lage, seine zentrale Zahl von irgendjemandem außer Ihnen überprüfen zu lassen.

Wo OrcaRouter in einer Pipeline wie dieser sitzt

Keines der beiden Modelle steht in unserem Katalog, und nichts hier sollte als Verfügbarkeitszusage gelesen werden. Ein Modell, das Wahrscheinlichkeiten statt Text zurückgibt, ist nichts, wohin man Chat-Completions routet, und das gilt für beide. Was wir anbieten, ist die generative Hälfte der Schleife, für die diese Scorer existieren: die über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel, die die Rubrik schreiben, die Kandidatenantworten entwerfen und den Tool-Aufruf ausgeben, den ein Scorer anschließend bewertet, bevor er ausgeführt wird.Der Listenpreis des Anbieters wird mit 0 % Aufschlag weitergegeben, sodass eine Preissenkung eines Anbieters auf der generierenden Seite am selben Tag auch bei uns gilt, und wenn Sie Ihren Schwellenwert lieber nicht auf einen einzigen Judge setzen möchten, setzt die Routing-DSL mehrere Modelle zu einem einzigen Aufruf zusammen, und Model Fusion meldet deren Übereinstimmung als ein Feld, das Sie bewerten können. Automatisches Failover hält diese Seite am Leben, wenn ein einzelner Anbieter an Leistung verliert, was in einer Schleife, die alles bewertet, was sie sieht, mehr zählt als in einer, die einem Nutzer ab und zu antwortet.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Fazit

Microsoft-Decision-1 ist seit dem 8. Oktober 2026 allgemein verfügbar auf Microsoft Foundry: gehostet, nur Text, 32.768 Token, eine von Microsoft nachtrainierte Qwen3.5-9B-Basis, keine verteilten Gewichte und ein Benchmark-Abschnitt, der seine Methodik dokumentiert, ohne eine Zahl zu nennen — einschließlich keiner Latenz, mit abgeschalteter Batch-Inferenz. Intern-Decision-2B ist ein Apache-2.0-Checkpoint mit 2.213.241.664 Parametern vom 26. September 2026, der schnellste seiner drei Geschwistermodelle mit 33,28 ms auf einer 4090 und der am schlechtesten kalibrierte mit einem ECE von 0,100, mit einer angepassten Temperatur von 2,100509348278, die kein Label ändern kann, aber jede Konfidenz verändert, auf die Sie einen Schwellenwert anwenden. Wenn Sie die mittlere Größe wollen, ist die ehrliche Begründung dafür dünn: Zahlen Sie die zusätzlichen 2,7 GB für die Genauigkeit des 4B oder akzeptieren Sie den Speicherbedarf des 0,8B, und kalibrieren Sie in beiden Fällen selbst, bevor ein Schwellenwert überhaupt in die Nähe der Produktion kommt.

Was wir bereitstellen, ist die generative Hälfte der Schleife, der diese Scorer dienen: die mehr als 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel, die das Bewertungsraster schreiben, die Kandidatenantworten entwerfen und den Tool-Aufruf ausgeben, den ein Scorer dann bewertet, bevor er ausgeführt wird.