
Microsoft-Decision-1 vs Intern-Decision-0.8B: Een half onsje jailbreak-ellende tegenover een gehoste blanco
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens · 55 tok/s
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Begin met de kolom die een lanceringspost zou hebben weggelaten. Intern-Decision-0.8B — het beslissingsmodel van InternLM met 852.985.920 parameters, fijngetuned op Qwen3.5-0.8B en op 26 september 2026 geüpload naar Hugging Face zonder aankondiging, zonder paper en met een GitHub-link die nog steeds een 404 geeft — wordt gemeten op 64,48 op WildJailBreak tegen een referentie van 96,29 voor TypeSafe's Jev 1.13. Dat is geen afrondingsverschil. Het is een instorting van de weigeringsrobuustheid in een model wiens hele taak het is om inputs te beoordelen, gepubliceerd op de kaart van de leverancier zelf, in een tabel waarvan de benchmark aan een concurrent toebehoort. Zet dat naast Microsoft-Decision-1, dat algemeen beschikbaar werd op Microsoft Foundry op 8 oktober 2026 als een scorer voor uitsluitend tekst, nagetraind op Qwen3.5-9B, met een gedocumenteerde evaluatiemethodologie en geen enkel resultaat dat eronder is afgedrukt, en dan heb je de echte vorm van deze confrontatie. Een van deze modellen vertelt je een getal dat het er slecht uit laat zien. Het andere vertelt je welke metrics het zou hebben gebruikt.
Die inversie is meer waard dan het specificatieblad. Beide modellen nemen een toestand en een afgebakende set vragen en leveren waarschijnlijkheden over je opties op — geen van beide genereert tekst, en op dat vlak zijn het hetzelfde soort instrument. De verschillen die ertoe doen, zijn wie het draait, hoe groot het is, hoeveel je kunt verifiëren, en één veiligheidskolom die het kleinere, stilere, volledig downloadbare model toch besloot te publiceren.
Wat elk ervan daadwerkelijk teruggeeft
Microsoft-Decision-1 is een gehoste API, en dat is het eerste structurele verschil. Gewichten worden niet gedistribueerd — geen download, geen repository, geen pad voor fine-tuning — en integratie betekent een Foundry-implementatie met Azure-authenticatie, facturering en governance eraan gekoppeld. Het voert één pass uit over maximaal 32.768 tokens, ondersteunt ja/nee-, meerkeuze-, beoordelings-, classificatie- en rubriekvormige vragen, en heeft alleen tekst als invoer en numerieke uitvoer. Het ondersteunt expliciet een onthoudingsoptie zoals "kan het niet zeggen" wanneer er onvoldoende bewijs is, wat een drempelwaarde zinvol maakt.
Intern-Decision-0.8B is de tegenovergestelde opzet. Het zijn Apache 2.0-gewichten met daarnaast de upstream Qwen-licentie bewaard als LICENSE-QWEN, ongeveer 1,73 GB aan repository verdeeld over drie shards — een taalshard van 1,50 GB, een visieshard van 176 MB en een projector van 25 MB — wat op één enkele consumenten-GPU of een goed uitgeruste laptop past. Het accepteert een toestand, een schema van één tot zestien benoemde vragen met elk maximaal 62 opties, en optioneel maximaal acht afbeeldingen, en de meegeleverde inference.py documenteert het contract in meer detail dan waar de meeste gelanceerde modellen zich druk om maken: opties worden toegewezen aan single-token-symbolen A–Z, dan a–z, dan 0–9; logits worden gelezen op de positie direct vóór elke <decision> placeholder in een vooraf gerenderd skelet; een softmax wordt alleen genomen over de geldige kandidaten van dat veld; een gefitte temperatuur wordt toegepast.
De twee licenties zijn niet dezelfde aankoop. Microsoft-Decision-1 geeft je een beheerd endpoint en geen artefact dat je bezit. Intern-Decision-0.8B geeft je een artefact dat je bezit, zonder endpoint, zonder ondersteuningscontract en zonder documentatie buiten de repository zelf.

Het plafond, en de kalibratie die u kunt auditen
Twee getallen bepalen de meeste echte integraties, en beide horen bij het kleine model.
De eerste is 8.192 tokens. De inferentie-engine van Intern-Decision-0.8B weigert te grote input in plaats van deze af te kappen, wat het correcte gedrag is voor een scorer en tegelijk een harde grens: er is geen chunkingstrategie die het contract behoudt, omdat de state, het schema en het skelet allemaal in één pass moeten. Het plafond van Microsoft-Decision-1 is vier keer hoger op 32.768, en het is een gehoste limiet die je kunt verhogen door anders te provisioneren in plaats van een constante in een Python-bestand.
De tweede is kalibratie, en hier keert de richting zich om. InternLM publiceert een gefitte temperatuur van 2.747760550703 voor de 0.8B, geselecteerd via NLL-minimalisatie over 1.728 aangewezen kalibratiegevallen, met 1.693 achtergehouden voor validatie, waarbij de modelkaart expliciet vermeldt dat de labels van de testsuite niet zijn gebruikt om die te selecteren. De toegepaste transformatie is een softmax over de kandidaat-logits van het veld, gevolgd door een tweede softmax over het logaritme van die verdeling gedeeld door de temperatuur. Omdat de transformatie na de eerste softmax loopt en de ordening behoudt, kan ze de argmax helemaal niet veranderen — ze verschuift het vertrouwen, de ja-waarschijnlijkheid en de verwachte waarde van een scorevraag, en laat het label identiek. Als je pijplijn het label leest, is de temperatuur een no-op. Als die de waarschijnlijkheid leest, er een drempel op toepast of die in een berekening van de verwachte waarde stopt, is de temperatuur het verschil tussen een getal dat iets betekent en een getal dat niets betekent. Het doorgeven van temperature=1 geeft de ongekalibreerde verdeling terug als je liever je eigen verdeling wilt fitten.
Microsoft-Decision-1 heeft geen gelijkwaardig artefact. Op het tabblad Benchmarks staat dat nauwkeurigheid, kalibratiefout, veiligheidsrecall, fout-positieve percentages en fairness-consistentie werden gemeten op publieke en community-beslissingsbenchmarks plus achtergehouden interne testsets, dat de volgorde van de opties werd gevarieerd, dat gepaarde statistische toetsen werden toegepast, en dat het model "presteert op hetzelfde niveau als toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd." Er wordt geen kalibratiefout weergegeven, er valt geen temperatuur te inspecteren en er wordt geen validatiesplit beschreven. De enige eigenschap die een waarschijnlijkheid nuttig maakt — of 0,8 daadwerkelijk 0,8 betekent — wordt beweerd en niet gekwantificeerd.
Lees die twee paragrafen tegen elkaar af en de vergelijking gaat niet meer over omvang. Een checkpoint van 0,8 miljard parameters waarvan je de kalibratie kunt inspecteren en waarvan je de software kunt draaien, is voor een evaluatieteam een beter hanteerbaar object dan een gehoste API waarvan de kalibratie één zin is. Het kleine model heeft ook een latentiecijfer op het record staan — 33,98 ms gemiddeld, 33,44 ms mediaan, 37,50 ms p95 per query op een enkele RTX 4090 via het lokale Hugging Face-pad, in de eigen meting van InternLM — terwijl die van Microsoft iets is dat je via je eigen deployment meet, waar de keuze tussen serverless en provisioned throughput het getal meer zal verschuiven dan het model.

Waar het kleine model verliest
Niets van het bovenstaande maakt Intern-Decision-0.8B de veilige keuze, en dezelfde gepubliceerde tabel zegt waarom. WildJailBreak op 64,48 tegenover Jev's 96,29 is een kloof van dertig punten in robuustheid tegen weigeringen in precies de categorie waarin een scorer onbetrouwbare invoer tegenkomt. Een beslissingsmodel is vaak het onderdeel dat bepaalt of een voorgestelde actie is toegestaan; een model dat makkelijk te omzeilen is, is een risico in die rol. Of het tekort voortkomt uit de Qwen3.5-0.8B-basis, uit de doelstelling van de beslissingsafstemming of uit het kleine aantal parameters, vertelt de repository je niet, en er is geen paper, geen trainingsrecept en geen openbaarmaking van de data die dat zou doen.
De rest van de eigen tabel van InternLM is vleiender dan die kolom en nog steeds bescheiden. Het gemiddelde over zeven suites is 79,38 voor de 0.8B tegenover 84,68 voor zijn eigen 2B-broertje en 90,02 voor de 4B — de familie stijgt steil naarmate de omvang toeneemt, wat een zwak signaal is dat de tabel niet is reverse-engineered om het vlaggenschip te vleien. AG News komt uit op 88,61 tegenover Jev's 89,57, praktisch gelijk op vierweg-onderwerpclassificatie. Wat kalibratie betreft rapporteert de 0.8B een Brier van 0,530 en een verwachte kalibratiefout van 0,066, tegenover Jev's 0,358 en 0,095 — betere ECE, wezenlijk slechtere nauwkeurigheid. Dat is een plausibel profiel voor een klein model met een bewust gefitte temperatuur, en het is geen combinatie die een marketingteam per ongeluk zou publiceren.
Er is ook geen releasedatum, geen aankondiging, geen collectie die de drie checkpoints samenbrengt, nergens een gehost endpoint, en geen enkele onafhankelijke evaluatie. De demo-Space antwoordt met 401. De juiste beschrijving van Intern-Decision-0.8B is een uitgebracht checkpoint met niet-geauditeerde claims — wat een betere situatie is dan een API met wachtlijst, omdat je het in een middag kunt meten, maar het betekent dat de validatielast volledig bij jou ligt.
Kiezen, en waar OrcaRouter staat
Kies Microsoft-Decision-1 als de blokkade inkoop of opschaling is: je hebt Azure-authenticatie, geünificeerde facturering en een Responsible AI-assessment nodig voordat er iets in productie gaat; je hebt een 32K-context nodig; je hebt een endpoint nodig dat je niet zelf beheert; of je hebt het onthoudingspad liever ontworpen dan zelf gebouwd. Accepteer in ruil daarvoor dat je het niet kunt draaien, niet kunt fine-tunen, de kalibratie niet kunt inspecteren, en de kernclaim ervan zelf zult moeten meten.
Kies Intern-Decision-0.8B als de belemmering kosten, geheugen of controle is: je wilt een Apache-2.0-scorer die in 1,73 GB past, draait op hardware die je al bezit, elke keer hetzelfde label oplevert en door een checkpointpad te wijzigen kan worden omgewisseld voor zijn 2B- of 4B-variant. Accepteer in ruil daarvoor de grens van 8.192 tokens, de WildJailBreak-kolom en het feit dat niemand buiten InternLM iets op de kaart heeft gereproduceerd.
De eerlijke aanbeveling is om beide te doen, want ze zijn goedkoop genoeg dat de discussie erover nauwelijks de moeite waard is. De scoring-aanroep zelf is niet iets wat wij routeren — een model dat waarschijnlijkheden retourneert in plaats van tekst is geen chatcompletion, en geen van beide staat in onze catalogus. Wat OrcaRouter levert, is de andere helft van de lus: de meer dan 200 modellen achter één OpenAI-compatibele sleutel die de rubric opstellen, de kandidaatantwoorden genereren of de tool call uitzenden die je scorer op het punt staat te beoordelen, tegen de lijstprijs van de provider, doorgegeven met 0% opslag, dus een prijsverlaging van een leverancier op een generator is dezelfde dag live aan onze kant. Automatische failover is hier belangrijker dan gewoonlijk, omdat een pijplijn die alles wat hij ziet scoort geen ruimte heeft om een vastgelopen aanroep opnieuw te proberen, en de routing-DSL laat je één judgeprompt naar meerdere schrijvers sturen en hun overeenstemming samenvoegen in plaats van één enkele te vertrouwen.

Kortom
Microsoft-Decision-1 werd op 8 oktober 2026 algemeen beschikbaar op Microsoft Foundry: gehost, alleen tekst, 32.768 tokens, gebouwd op Qwen3.5-9B, met een methodologieparagraaf in plaats van een benchmarktabel. Intern-Decision-0.8B is een Apache-2.0-checkpoint van 1,73 GB dat op 26 september 2026 is geüpload en een Brier van 0,530 publiceert, een ECE van 0,066, een gefitte temperatuur van 2,747760550703, 33,98 ms op een 4090 — en een WildJailBreak-score van 64,48 die niemand had gevraagd af te drukken. Als je slechts één ding kunt valideren voordat je een van beide in gebruik neemt, valideer dan de kalibratie op je eigen gelabelde gevallen; dat is het getal dat beide leveranciers voor jou hebben achtergelaten om te vinden.
