
Microsoft-Decision-1 vs. Intern-Decision-4B: Das eine veröffentlicht seine Kalibrierung, das andere seine Methodik
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Setzt man Microsoft-Decision-1 neben Intern-Decision-4B, erhält man einen Vergleich, der weniger durch Leistungsfähigkeit entschieden wird als dadurch, was jeder Anbieter zu veröffentlichen bereit war. Microsofts Modell erreichte am 8. Oktober 2026 auf Microsoft Foundry die allgemeine Verfügbarkeit: eine Qwen3.5-9B-Basis, von Microsoft nachtrainiert, nur Text, 32.768-Token-Kontext, Gewichte nicht verteilt, eine Evaluierungsmethodik, die Genauigkeit, Kalibrierungsfehler und gepaarte statistische Tests beschreibt – und kein einziges Ergebnis. InternLMs Intern-Decision-4B wurde am 26. September 2026 um 05:36:37 UTC auf Hugging Face hochgeladen, ohne Ankündigung dahinter, ist von Qwen3.5-4B feinabgestimmt, akzeptiert Bilder ebenso wie Text, läuft in 44 Millisekunden auf einer einzelnen RTX 4090 und gibt eine vollständige Tabelle mit Brier- und Expected-Calibration-Error-Werten aus. Beide geben eine Wahrscheinlichkeitsverteilung über die von Ihnen angegebenen Optionen zurück. Nur eines von ihnen sagt Ihnen, wie gut es das tut.
Diese Umkehrung – das größere, besser finanzierte Modell ist das undurchsichtige – macht die gesamte Gestalt dieses Duells aus, und sie entscheidet für die meisten Teams die Wahl schneller als jede Spec-Zeile.
Die eine Zahl, die sie trennt
InternLM meldet Brier 0.347 und ECE 0.065 für Intern-Decision-4B über seine Benchmark-Suite hinweg, mit einer durchschnittlichen Punktzahl von 90.02 über Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) und WildJailBreak (89.86). Dabei handelt es sich um vom Anbieter gemeldete Zahlen auf dem eigenen Harness des Anbieters, und insbesondere die Jevbench-Zeilen stammen aus der eigenen Benchmark-Familie des Projekts — lesen Sie sie als Selbsteinschätzung, nicht als unabhängige Verifikation. Aber es sind Zahlen mit einer angegebenen Skala, und insbesondere ECE ist die Kennzahl, die Ihnen sagt, ob ein zurückgegebener Wert von 0.8 es wert ist, darauf zu reagieren.
Microsoft veröffentlicht kein Äquivalent. Der Tab „Benchmarks“ auf der Katalogseite von Microsoft-Decision-1 beschreibt, was gemessen wurde, und behauptet, das Modell „schneide genauso gut ab wie führende Entscheidungsmodelle und besser als andere offene Entscheidungsmodelle, die mit derselben Methodik bewertet wurden“, wobei als stärkste Bereiche Reasoning, Regelanwendung und Robustheit gegenüber Prompt-Formaten und als schwächster Bereich spezialisiertes Domänenwissen genannt werden. Kein Brier, kein ECE, keine Genauigkeitstabelle. Wenn Ihre Einführungsentscheidung eine Kalibrierungskennzahl benötigt, bevor Sie eine Eskalationsschwelle dimensionieren können, dann liefert eines dieser beiden Modelle sie Ihnen, während das andere Sie auffordert, sie selbst zu messen.

Wo sich die beiden Verträge tatsächlich unterscheiden
Oberflächlich betrachtet nehmen diese Modelle denselben Aufruf entgegen. Man liefert einen Zustand, ein Schema benannter Fragen und eine feste Menge von Optionen; zurück bekommt man eine Wahrscheinlichkeit pro Option, ohne ein Token generierten Texts. Die Unterschiede zeigen sich an den Rändern dieses Vertrags.
• Modalität — Microsoft-Decision-1 ist ausdrücklich rein textbasiert und akzeptiert oder erzeugt keine Bild-, Audio- oder Videoinhalte. Intern-Decision-4B akzeptiert optional Bilder zusammen mit dem Status, bis zu acht pro Aufruf, was es zu einem Kandidaten für Screenshot-Triage, Prüfungen des Dokumentlayouts und Visual-QA-Routing macht.
• Fragenanzahl — InternLM dokumentiert 1 bis 16 Fragen pro Aufruf, jeweils bis zu 62 Optionen, über drei Feldtypen hinweg (Auswahl, Punktwert, noul). Microsoft dokumentiert die Formate — Ja/Nein, Multiple-Choice, Bewertung, Klassifizierung, Rubrik — und einen einzelnen Aufruf über bis zu 32K Token, aber keine Obergrenze für die Anzahl der Fragen pro Aufruf.
• Kontext — Microsoft gibt 32.768 Token an. Die Karte von Intern-Decision-4B nennt ihre Grenzen in Fragen, Optionen und Bildern statt als eine einzelne Kontextzahl, sodass sich die beiden nicht an einer einzigen Zahl ausrichten lassen.
• Verbreitung — Microsoft-Decision-1 ist eine gehostete Foundry API; Modellgewichte werden nicht verteilt und es gibt keinen Download. Intern-Decision-4B ist Apache-2.0 auf Hugging Face, wobei die Qwen-Lizenz aus dem Upstream als LICENSE-QWEN, was bedeutet, dass Sie diese Lizenz und die Upstream-Hinweise beibehalten müssen, wenn Sie es weiterverbreiten.
• Kostenprofil — InternLMs Gewichte verursachen keine Betriebskosten und werden mit 44,16 ms Mittelwert, 44,60 ms P95 auf einer einzigen RTX 4090 angegeben. Microsofts Preis pro Token wird auf der Modellseite überhaupt nicht genannt.
• Governance — Microsoft liefert eine Bewertung für verantwortungsvolle KI, dokumentierte Bereitstellungspraktiken und explizite Ausschlüsse (nicht für Textgenerierung, offene Fragenbeantwortung, Konversation, Übersetzung oder Zusammenfassung; nicht als alleiniger automatisierter Entscheidungsträger bei folgenreichen Entscheidungen über Menschen). InternLM liefert eine Modellkarte, die offen über die Herkunft ist — Gewichte „durch Decision Tuning modifiziert“ — und nichts, was einem Compliance-Paket ähnelt.

Zwei sehr unterschiedliche Gründe, warum die Latenzwerte schwer zu vergleichen sind
Microsoft-Decision-1 veröffentlicht keine Latenzangabe, es gibt also nichts, was man neben den Mittelwert von 44,16 ms von InternLM stellen könnte. Das ist für diese Arbeitslast keine kleine Auslassung. Diese Modelle existieren, um innerhalb einer Pipeline viele Male aufgerufen zu werden – einmal pro abgerufenem Dokument, einmal pro vorgeschlagenem Tool-Aufruf, einmal pro zu bewertender Antwort –, und der Unterschied zwischen vier Entscheidungen pro Sekunde und vierzig ist der Unterschied zwischen dem Bewerten einer Stichprobe und dem Bewerten von allem. InternLMs Zahl ist heute auf Hardware erreichbar, die man stundenweise mieten kann; Microsofts Zahl muss über Ihre eigene Foundry-Bereitstellung gemessen werden, und die Bereitstellungsform, die Sie wählen (nutzungsabhängig serverlos versus bereitgestellter Durchsatz), wird sie stärker verändern als das Modell.
Dies ist auch der Punkt, an dem OrcaRouters Hälfte des Musters relevant wird, und zwar ausschließlich die generative Hälfte. Wir hosten weder Microsoft-Decision-1 noch Intern-Decision-4B – ein Modell, das Wahrscheinlichkeiten statt Text zurückgibt, ist kein Ziel, an das man Chat-Completions routet, und keines der beiden taucht in unserem Katalog auf. Was hinter unserem einen OpenAI-kompatiblen Schlüssel steckt, ist der Pool aus mehr als 200 Modellen, der das Schreiben übernimmt: der von einem Modell entworfene Judge-Prompt, die von zwei anderen erzeugten Kandidatenantworten, der Tool-Aufruf, der bewertet wird, bevor er ausgeführt wird. Der Listenpreis des Anbieters wird mit 0 % Aufschlag durchgereicht, sodass eine Preissenkung bei einem Generator bei uns noch am selben Tag wirksam ist, und automatisches Failover hält die Generierungsseite einer Scoring-Schleife am Leben, wenn ein einzelner Anbieter Leistungseinbußen hat – was hier mehr als üblich zählt, weil eine Pipeline, die alles bewertet, was sie sieht, keinen Spielraum hat, einen ins Stocken geratenen Aufruf zu wiederholen.

Wer sollte welches nehmen
Nehmen Sie Intern-Decision-4B, wenn einer der folgenden Punkte zutrifft: Sie müssen Bilder ebenso wie Text bewerten, Sie benötigen eine Kalibrierungszahl, bevor Sie ausliefern können, Sie möchten die Option, das Modell auf Ihrer eigenen Hardware innerhalb einer von Ihnen kontrollierten Grenze auszuführen, oder Sie möchten es feinabstimmen. Der letzte Punkt verdient besondere Betonung — ein 4B-Scorer mit offenen Gewichten und einem dokumentierten Wrapper ist ein Modell, das Sie an Ihre eigenen Labels anpassen können, und Microsoft-Decision-1 ist eine gehostete API ohne Fine-Tuning-Pfad und ohne Gewichte, die angepasst werden könnten.
Nehmen Sie Microsoft-Decision-1, wenn der Blocker die Beschaffung und nicht die Leistung ist: Sie brauchen Azure-Authentifizierung, einheitliche Abrechnung, Governance und eine Responsible-AI-Bewertung durch den Anbieter, bevor irgendetwas in Produktion geht, und Sie brauchen einen 32K-Kontext für lange Dokumente, bei denen die Pro-Aufruf-Limits des 4B problematisch sind. Das Fehlen veröffentlichter Benchmarks ist ein echter Kostenfaktor, aber es ist ein Kostenfaktor, den Sie an einem Nachmittag abbauen können, indem Sie Ihren eigenen gelabelten Datensatz durch beide Modelle laufen lassen und ECE vergleichen — was Sie ohnehin tun würden, bevor Sie der Tabelle eines der beiden Anbieter vertrauen.
Die unbequeme Antwort ist, dass beide so günstig zu testen sind, dass sich die Diskussion kaum lohnt. Intern-Decision-4B braucht eine GPU, die Sie wahrscheinlich bereits haben. Microsoft-Decision-1 braucht eine Foundry-Bereitstellung und eine Stichprobe Ihrer eigenen gelabelten Entscheidungen. Lassen Sie Ihre Daten durch beide laufen, berechnen Sie die Kalibrierung auf der Teilmenge, die für Sie zählt, und lassen Sie die Zahlen entscheiden — was, passenderweise, genau das ist, wofür diese Modelle gedacht sind.
