
Microsoft-Decision-1 vs Intern-Decision-4B: de een publiceert zijn kalibratie, de ander publiceert zijn methodologie
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Zet Microsoft-Decision-1 naast Intern-Decision-4B en je krijgt een vergelijking die minder door capaciteit wordt bepaald dan door wat elke leverancier bereid was te publiceren. Het model van Microsoft bereikte algemene beschikbaarheid op Microsoft Foundry op 8 oktober 2026: een Qwen3.5-9B-basis, door Microsoft nagetraind, alleen tekst, een context van 32.768 tokens, gewichten niet gedistribueerd, een evaluatiemethodologie die nauwkeurigheid, calibratiefout en gepaarde statistische toetsen beschrijft — en geen enkel resultaat. Intern-Decision-4B van InternLM verscheen op Hugging Face op 26 september 2026 om 05:36:37 UTC zonder dat er een aankondiging aan te pas kwam, is gefinetuned op basis van Qwen3.5-4B, accepteert zowel afbeeldingen als tekst, draait in 44 milliseconden op één RTX 4090, en print een volledige tabel met Brier- en verwachte-calibratiefoutwaarden. Beide retourneren een kansverdeling over de opties die je aanlevert. Slechts één van hen vertelt je hoe goed het dat doet.
Die inversie — het grotere, beter gefinancierde model dat juist het ondoorzichtige is — bepaalt de hele vorm van deze confrontatie, en beslist voor de meeste teams sneller dan welke specificatieregel dan ook.
Het ene getal dat hen scheidt
InternLM rapporteert Brier 0,347 en ECE 0,065 voor Intern-Decision-4B in zijn benchmarksuite, met een gemiddelde score van 90,02 over Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) en WildJailBreak (89,86). Dat zijn door de leverancier gerapporteerde cijfers op het eigen testharnas van de leverancier, en vooral de Jevbench-rijen vormen de eigen benchmarkfamilie van het project — lees ze als zelfbeoordeling, niet als onafhankelijke verificatie. Maar het zijn cijfers met een vermelde schaal, en vooral ECE is het cijfer dat je vertelt of een teruggegeven 0,8 het waard is om op te handelen.
Microsoft publiceert geen equivalent. Het tabblad Benchmarks op de cataloguspagina van Microsoft-Decision-1 beschrijft wat er is gemeten en beweert dat het model "presteert op het niveau van toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd", waarbij redeneren, regels toepassen en robuustheid van promptformaat als sterkste gebieden worden genoemd, en gespecialiseerde domeinkennis als zwakste. Geen Brier, geen ECE, geen nauwkeurigheidstabel. Als uw adoptiebeslissing een kalibratiewaarde nodig heeft voordat u een escalatiedrempel kunt bepalen, krijgt u die van een van deze twee modellen en vraagt het andere u die zelf te meten.

Waar de twee contracten daadwerkelijk verschillen
Op het eerste gezicht gebruiken deze modellen dezelfde aanroep. Je levert een toestand, een schema van benoemde vragen en een vaste set opties aan; je krijgt een waarschijnlijkheid per optie terug zonder één token gegenereerde tekst. De verschillen komen naar voren aan de randen van dat contract.
• Modaliteit — Microsoft-Decision-1 is expliciet alleen-tekst en accepteert of produceert geen afbeeldings-, audio- of videocontent. Intern-Decision-4B accepteert optionele afbeeldingen naast de status, tot acht per aanroep, en dat maakt het een kandidaat voor screenshot-triage, controles van documentindelingen en het routeren van visuele QA.
• Aantal vragen — InternLM documenteert 1 tot 16 vragen per aanroep, elk met maximaal 62 opties, over drie veldtypen (choice, score, noul). Microsoft documenteert de formaten — ja/nee, meerkeuze, beoordeling, classificatie, rubric — en een enkele aanroep over maximaal 32K tokens, maar geen limiet op het aantal vragen per aanroep.
• Context — Microsoft vermeldt 32.768 tokens. De Intern-Decision-4B-kaart vermeldt zijn limieten in vragen, opties en afbeeldingen in plaats van als één contextgetal, dus je kunt de twee niet op één getal met elkaar vergelijken.
• Distributie — Microsoft-Decision-1 is een gehoste Foundry API; modelgewichten worden niet gedistribueerd en er is geen download. Intern-Decision-4B is Apache-2.0 op Hugging Face met behoud van de upstream Qwen-licentie als LICENSE-QWEN, wat betekent dat u die licentie en upstream-kennisgevingen moet behouden als u het opnieuw distribueert.
• Kostenprofiel — De gewichten van InternLM kosten niets om te draaien en worden opgegeven als 44,16 ms gemiddeld, 44,60 ms P95, op één RTX 4090. De prijs per token van Microsoft staat helemaal niet op de modelpagina vermeld.
• Governance — Microsoft levert een Responsible AI-assessment, gedocumenteerde implementatiepraktijken en expliciete uitsluitingen (niet voor tekstgeneratie, open-ended QA, conversatie, vertaling of samenvatting; niet als enige geautomatiseerde besluitvormer bij beslissingen met verstrekkende gevolgen over mensen). InternLM levert een modelkaart die openhartig is over herkomst — gewichten "gewijzigd door decision tuning" — en niets van een compliancepakket.

Twee heel verschillende redenen waarom de latency-cijfers moeilijk te vergelijken zijn
Microsoft-Decision-1 publiceert geen latentiecijfer, dus er is niets om naast het gemiddelde van 44,16 ms van InternLM te zetten. Dat is geen kleine omissie voor deze workload. Deze modellen bestaan om vele malen binnen een pipeline te worden aangeroepen — één keer per opgehaald document, één keer per voorgestelde toolaanroep, één keer per te beoordelen antwoord — en het verschil tussen vier beslissingen per seconde en veertig is het verschil tussen één sample scoren en alles scoren. Het cijfer van InternLM is vandaag haalbaar op hardware die je per uur kunt huren; dat van Microsoft moet via je eigen Foundry-implementatie worden gemeten, en de implementatievorm die je kiest (pay-as-you-go serverless versus provisioned throughput) zal het meer veranderen dan het model zelf.
Dit is ook waar OrcaRouter's helft van het patroon relevant wordt, en het is uitsluitend de generatieve helft. We hosten Microsoft-Decision-1 noch Intern-Decision-4B — een model dat waarschijnlijkheden in plaats van tekst retourneert, is niet iets waarnaar je chatcompletions routeert, en geen van beide staat in onze catalogus. Wat achter onze ene OpenAI-compatibele sleutel zit, is de pool van meer dan 200 modellen die het schrijfwerk doen: de judge-prompt die door één model wordt opgesteld, de kandidaatantwoorden die door twee andere modellen worden geproduceerd, de toolaanroep die wordt gescoord voordat die wordt uitgevoerd. De lijstprijs van de provider wordt met 0% opslag doorgegeven, dus een prijsverlaging op een generator is dezelfde dag nog live aan onze kant, en automatische failover houdt de generatiezijde van een scoringslus in leven wanneer één enkele provider degradeert — wat hier meer dan gebruikelijk van belang is, omdat een pipeline die alles wat hij ziet scoort geen ruimte heeft om een vastgelopen aanroep opnieuw te proberen.

Wie moet welke nemen
Kies Intern-Decision-4B als een van deze waar is: u zowel afbeeldingen als tekst moet scoren, u een kalibratiegetal nodig hebt voordat u kunt uitrollen, u de optie wilt om het model op uw eigen hardware te draaien binnen een grens die u beheert, of u het wilt fine-tunen. Het laatste punt verdient nadruk — een 4B open-weights scorer met een gedocumenteerde wrapper is een model dat u aan uw eigen labels kunt aanpassen, en Microsoft-Decision-1 is een gehoste API zonder fine-tuningpad en zonder gewichten om aan te passen.
Kies Microsoft-Decision-1 als het knelpunt inkoop is en niet prestatie: je hebt Azure-authenticatie, uniforme facturering, governance en een Responsible AI-beoordeling door de leverancier nodig voordat er iets in productie gaat, en je hebt een 32K-context nodig voor lange documenten, die de limieten per aanroep van de 4B bemoeilijken. Het ontbreken van gepubliceerde benchmarks is een echte kostenpost, maar het is een kostenpost die je in een middag kunt wegwerken door je eigen gelabelde set door beide modellen te laten lopen en ECE te vergelijken — wat je toch zou doen voordat je op de tabel van een van beide leveranciers vertrouwt.
Het ongemakkelijke antwoord is dat beide goedkoop genoeg zijn om te testen, waardoor de discussie nauwelijks de moeite waard is. Intern-Decision-4B heeft een GPU nodig die je waarschijnlijk al hebt. Microsoft-Decision-1 heeft een Foundry-implementatie nodig en een steekproef van je eigen gelabelde beslissingen. Laat je data door beide lopen, bereken calibratie op de subset die voor jou belangrijk is, en laat de cijfers beslissen — wat, toepasselijk genoeg, precies is waarvoor deze modellen bedoeld zijn.
