
Microsoft-Decision-1 vs. Intern-Decision-0.8B: Eine halbe Unze Jailbreak-Ärger gegen ein gehostetes Blank
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 55 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Beginnen wir mit der Spalte, die ein Launch-Post weggelassen hätte. Intern-Decision-0.8B — InternLMs Entscheidungsmodell mit 852.985.920 Parametern, feinabgestimmt aus Qwen3.5-0.8B und am 26. September 2026 auf Hugging Face hochgeladen, ohne Ankündigung, ohne Paper und mit einem GitHub-Link, der noch immer 404 zurückgibt — wird mit 64,48 bei WildJailBreak gemessen, gegenüber einem Referenzwert von 96,29 für Jev 1.13 von TypeSafe. Das ist kein Rundungsunterschied. Es ist ein Kollaps der Verweigerungsrobustheit bei einem Modell, dessen ganze Aufgabe darin besteht, Eingaben zu beurteilen, veröffentlicht auf der Model Card des Anbieters selbst, in einer Tabelle, deren Benchmark einem Wettbewerber gehört. Stellen Sie das neben Microsoft-Decision-1, das am 8. Oktober 2026 auf Microsoft Foundry allgemein verfügbar wurde, als reiner Text-Scorer, nachtrainiert auf Qwen3.5-9B, mit einer dokumentierten Evaluierungsmethodik und keinem einzigen darunter abgedruckten Ergebnis, und Sie haben die wahre Gestalt dieses Duells. Eines dieser Modelle nennt Ihnen eine Zahl, die es schlecht aussehen lässt. Das andere sagt Ihnen, welche Metriken es verwendet hätte.
Diese Umkehrung ist mehr wert als das Datenblatt. Beide Modelle nehmen einen Zustand und eine begrenzte Fragenmenge entgegen und geben Wahrscheinlichkeiten über Ihre Optionen zurück – keines generiert Text, und auf dieser Achse sind sie dieselbe Art von Instrument. Die Unterschiede, die zählen, sind, wer es betreibt, wie groß es ist, wie viel Sie verifizieren können, und eine Sicherheitsspalte, die das kleinere, leisere, vollständig herunterladbare Modell trotzdem veröffentlichte.
Was jedes Einzelne tatsächlich zurückgibt
Microsoft-Decision-1 ist eine gehostete API, und das ist der erste strukturelle Unterschied. Gewichte werden nicht verteilt – kein Download, kein Repository, kein Fine-Tuning-Pfad – und die Integration bedeutet ein Foundry-Deployment mit Azure-Authentifizierung, Abrechnung und Governance. Es verarbeitet in einem Durchgang bis zu 32.768 Tokens, unterstützt Ja/Nein-, Multiple-Choice-, Bewertungs-, Klassifizierungs- und Fragen im Rubrikformat und nimmt nur Text entgegen und gibt Zahlen aus. Es unterstützt ausdrücklich eine Enthaltungsoption wie „kann nicht sagen“, wenn die Beweislage unzureichend ist, was einen Schwellenwert erst sinnvoll macht.
Intern-Decision-0.8B ist die umgekehrte Anordnung. Es sind Apache-2.0-Gewichte, wobei die Upstream-Qwen-Lizenz daneben als LICENSE-QWEN erhalten bleibt, etwa 1,73 GB Repository verteilt auf drei Shards – ein 1,50 GB großer Sprach-Shard, ein 176 MB großer Vision-Shard und ein 25 MB großer Projektor –, was auf eine einzelne Consumer-GPU oder einen gut ausgestatteten Laptop passt. Es nimmt einen Zustand entgegen, ein Schema aus ein bis sechzehn benannten Fragen mit jeweils bis zu 62 Optionen und optional bis zu acht Bilder, und das mitgelieferte inference.py dokumentiert den Vertrag detaillierter, als sich die meisten veröffentlichten Modelle die Mühe machen: Optionen werden auf Einzel-Token-Symbole A–Z, dann a–z, dann 0–9 abgebildet; Logits werden an der Position unmittelbar vor jedem <decision>-Platzhalter in einem vorgerenderten Skelett ausgelesen; eine Softmax wird nur über die zulässigen Kandidaten dieses Feldes gebildet; eine angepasste Temperatur wird angewendet.
Die beiden Lizenzen sind nicht dasselbe Kaufgeschäft. Microsoft-Decision-1 gibt Ihnen einen verwalteten Endpunkt und kein Artefakt, das Ihnen gehört. Intern-Decision-0.8B gibt Ihnen ein Artefakt, das Ihnen gehört, aber ohne Endpunkt, ohne Supportvertrag und ohne Dokumentation, die über das Repository selbst hinausgeht.

Die Obergrenze, und die Kalibrierung, die Sie auditieren können
Zwei Zahlen entscheiden über die meisten echten Integrationen, und beide gehören zum kleinen Modell.
Die erste ist 8.192 Token. Die Inferenz-Engine von Intern-Decision-0.8B verweigert übergroße Eingaben, anstatt sie abzuschneiden, was das korrekte Verhalten für einen Scorer und zugleich eine harte Grenze ist: Es gibt keine Chunking-Strategie, die den Vertrag einhält, weil der Zustand, das Schema und das Skelett alle in einem Durchgang vorliegen müssen. Die Obergrenze von Microsoft-Decision-1 ist mit 32.768 viermal höher, und es ist ein gehostetes Limit, das Sie durch eine andere Bereitstellung erhöhen können, statt eine Konstante in einer Python-Datei zu sein.
Die zweite ist die Kalibrierung, und hier kehrt sich die Richtung um. InternLM veröffentlicht eine angepasste Temperatur von 2.747760550703 für das 0.8B, ausgewählt durch NLL-Minimierung über 1.728 festgelegte Kalibrierungsfälle, von denen 1.693 zur Validierung zurückgehalten wurden, wobei in der Modellkarte ausdrücklich steht, dass die Labels der Testsuite nicht zu ihrer Auswahl verwendet wurden. Die angewandte Transformation ist eine Softmax über die Kandidaten-Logits des Feldes, gefolgt von einer zweiten Softmax über den Logarithmus dieser Verteilung geteilt durch die Temperatur. Da die Transformation nach der ersten Softmax läuft und die Reihenfolge beibehält, kann sie das Argmax überhaupt nicht ändern – sie verschiebt die Konfidenz, die Ja-Wahrscheinlichkeit und den Erwartungswert einer Score-Frage und lässt das Label identisch. Wenn Ihre Pipeline das Label liest, ist die Temperatur ein No-op. Wenn sie die Wahrscheinlichkeit liest, sie mit einem Schwellenwert versieht oder sie in eine Erwartungswertberechnung einspeist, ist die Temperatur der Unterschied zwischen einer Zahl, die etwas bedeutet, und einer, die nichts bedeutet. Die Übergabe von temperature=1 liefert die unkalibrierte Verteilung zurück, wenn Sie lieber Ihre eigene anpassen möchten.
Microsoft-Decision-1 hat kein äquivalentes Artefakt. Auf der Registerkarte „Benchmarks“ heißt es, dass Genauigkeit, Kalibrierungsfehler, Safety-Recall, Falsch-Positiv-Raten und Fairness-Konsistenz an öffentlichen und Community-Entscheidungsbenchmarks sowie zurückgehaltenen internen Testsets gemessen wurden, dass die Optionsreihenfolge variiert wurde, dass gepaarte statistische Tests angewendet wurden und dass das Modell „auf Augenhöhe mit führenden Entscheidungsmodellen und vor anderen offenen Entscheidungsmodellen abschneidet, die mit derselben Methodik bewertet wurden“. Es wird kein Kalibrierungsfehler ausgegeben, keine Temperatur zum Inspizieren angegeben und kein Validierungs-Split beschrieben. Die eine Eigenschaft, die eine Wahrscheinlichkeit nützlich macht – ob 0,8 auch 0,8 bedeutet –, wird behauptet und nicht quantifiziert.
Liest man diese beiden Absätze gegeneinander, geht es bei dem Vergleich nicht mehr um Größe. Ein Checkpoint mit 0,8 Milliarden Parametern, dessen Kalibrierung man einsehen und dessen Software man ausführen kann, ist für ein Evaluierungsteam ein besser handhabbares Objekt als eine gehostete API, deren Kalibrierung ein Satz ist. Das kleine Modell hat außerdem einen dokumentierten Latenzwert — 33,98 ms Mittelwert, 33,44 ms Median, 37,50 ms p95 pro Abfrage auf einer einzelnen RTX 4090 über den lokalen Hugging-Face-Pfad, in der eigenen Messung von InternLM —, während der von Microsoft etwas ist, das man über das eigene Deployment ermittelt, wobei die Wahl zwischen Serverless und provisioniertem Durchsatz die Zahl stärker verändern wird als das Modell.

Wo das kleine Modell verliert
Nichts des oben Genannten macht Intern-Decision-0.8B zur sicheren Wahl, und dieselbe veröffentlichte Tabelle sagt, warum. WildJailBreak bei 64.48 gegenüber Jevs 96.29 ist eine Lücke bei der Verweigerungsrobustheit von dreißig Punkten genau in der Kategorie, in der ein Scorer auf nicht vertrauenswürdige Eingaben trifft. Ein Entscheidungsmodell ist oft die Komponente, die entscheidet, ob eine vorgeschlagene Aktion erlaubt ist; eines, bei dem man leicht vorbeireden kann, ist auf diesem Posten ein Risiko. Ob das Defizit von der Qwen3.5-0.8B-Basis, vom Ziel des Entscheidungs-Tunings oder von der geringen Parameterzahl kommt, sagt Ihnen das Repository nicht, und es gibt kein Paper, kein Trainingsrezept und keine Datenoffenlegung, die das tun würde.
Der Rest von InternLMs eigener Tabelle ist schmeichelhafter als diese Spalte und dennoch bescheiden. Der Durchschnitt über sieben Suiten liegt bei 79,38 für das 0,8B-Modell gegenüber 84,68 für sein eigenes 2B-Schwestermodell und 90,02 für das 4B-Modell — die Modellfamilie steigt mit der Größe steil an, was ein leichter Hinweis darauf ist, dass die Tabelle nicht eigens so konstruiert wurde, um das Flaggschiff zu schmeicheln. AG News landet bei 88,61 gegenüber Jevs 89,57, praktisch gleichauf bei der vierklassigen Themenklassifikation. Bei der Kalibrierung meldet das 0,8B-Modell einen Brier-Wert von 0,530 und einen erwarteten Kalibrierungsfehler von 0,066, gegenüber Jevs 0,358 und 0,095 — besserer ECE, deutlich schlechtere Genauigkeit. Das ist ein plausibles Profil für ein kleines Modell mit einer bewusst angepassten Temperatur, und es ist keine Kombination, die ein Marketingteam versehentlich veröffentlichen würde.
Außerdem gibt es kein Veröffentlichungsdatum, keine Ankündigung, keine Sammlung, die die drei Checkpoints bündelt, nirgends einen gehosteten Endpunkt und keinerlei unabhängige Evaluierung. Der Demo Space antwortet mit 401. Die korrekte Beschreibung von Intern-Decision-0.8B lautet: ein veröffentlichter Checkpoint mit ungeprüften Behauptungen – was besser ist als eine API mit Warteliste, weil Sie ihn an einem Nachmittag messen können, aber es bedeutet, dass die Validierungslast vollständig bei Ihnen liegt.
Auswahl, und wo OrcaRouter steht
Wählen Sie Microsoft-Decision-1, wenn der Blocker Beschaffung oder Skalierung ist: Sie brauchen Azure-Authentifizierung, einheitliche Abrechnung und eine Responsible-AI-Bewertung, bevor irgendetwas in Produktion geht; Sie brauchen einen 32K-Kontext; Sie brauchen einen Endpunkt, den Sie nicht selbst betreiben; oder Sie brauchen einen von vornherein vorgesehenen statt selbst gestrickten Abstention-Pfad. Nehmen Sie im Gegenzug in Kauf, dass Sie es nicht ausführen, nicht feinabstimmen, seine Kalibrierung nicht prüfen können und seine zentrale Behauptung selbst messen werden.
Nimm Intern-Decision-0.8B, wenn der Knackpunkt Kosten, Speicher oder Kontrolle ist: Du willst einen Apache-2.0-Scorer, der in 1,73 GB passt, auf Hardware läuft, die du bereits besitzt, jedes Mal dasselbe Label liefert und sich durch Ändern eines Checkpoint-Pfads gegen sein 2B- oder 4B-Geschwister austauschen lässt. Nimm dafür die 8.192-Token-Mauer, die WildJailBreak-Spalte und die Tatsache in Kauf, dass niemand außerhalb von InternLM irgendetwas auf der Karte reproduziert hat.
Die ehrliche Empfehlung lautet, beides zu tun, denn sie sind günstig genug, dass sich die Diskussion kaum lohnt. Der Scoring-Aufruf selbst ist nichts, was wir routen – ein Modell, das Wahrscheinlichkeiten statt Text zurückgibt, ist keine Chat-Completion, und keines von beiden steht in unserem Katalog. Was OrcaRouter bereitstellt, ist die andere Hälfte der Schleife: die mehr als 200 Modelle hinter einem OpenAI-kompatiblen Schlüssel, die den Bewertungsmaßstab entwerfen, die Kandidatenantworten generieren oder den Tool-Call ausgeben, den Ihr Scorer gleich bewerten wird, zum Listenpreis des Anbieters, durchgereicht mit 0 % Aufschlag, sodass eine Preissenkung eines Anbieters für einen Generator am selben Tag bei uns live ist. Automatisches Failover ist hier wichtiger als sonst, weil eine Pipeline, die alles bewertet, was sie sieht, keinen Spielraum hat, einen hängengebliebenen Aufruf erneut zu versuchen, und die Routing-DSL es Ihnen ermöglicht, einen Judge-Prompt an mehrere Schreiber zu senden und deren Übereinstimmung zu fusionieren, statt einem einzigen zu vertrauen.

Fazit
Microsoft-Decision-1 wurde am 8. Oktober 2026 auf Microsoft Foundry allgemein verfügbar: gehostet, nur Text, 32.768 Tokens, auf Qwen3.5-9B aufgebaut, mit einem Methodikabsatz anstelle einer Benchmark-Tabelle. Intern-Decision-0.8B ist ein 1,73 GB großer Apache-2.0-Checkpoint, der am 26. September 2026 hochgeladen wurde und einen Brier-Wert von 0,530, eine ECE von 0,066, eine angepasste Temperatur von 2,747760550703, 33,98 ms auf einer 4090 — und einen WildJailBreak-Score von 64,48 veröffentlicht, den niemand von ihm zu drucken verlangt hat. Wenn Sie vor der Einführung eines der beiden nur eine einzige Sache validieren können, dann validieren Sie die Kalibrierung anhand Ihrer eigenen beschrifteten Fälle; das ist die Zahl, die beide Anbieter Ihnen zum Finden überlassen haben.
