Een gegenereerde titelkaart voor Microsoft-Decision-1 vs Intern-Decision-4B, met als ondertitel 'twee scorers, één met cijfers en één zonder', met chips met de tekst 9B vs 4B, gehoste API vs open gewichten, geen gepubliceerde benchmarks vs Brier 0.347 en ECE 0.065, en een bronvoetnoot die vermeldt dat de cijfers van Microsoft niet zijn gereproduceerd en de cijfers van InternLM door de leverancier zijn gerapporteerd.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-4B: de een publiceert zijn kalibratie, de ander publiceert zijn methodologie

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Microsoft-Decision-1 naast Intern-Decision-4B en je krijgt een vergelijking die minder door capaciteit wordt bepaald dan door wat elke leverancier bereid was te publiceren. Het model van Microsoft bereikte algemene beschikbaarheid op Microsoft Foundry op 8 oktober 2026: een Qwen3.5-9B-basis, door Microsoft nagetraind, alleen tekst, een context van 32.768 tokens, gewichten niet gedistribueerd, een evaluatiemethodologie die nauwkeurigheid, calibratiefout en gepaarde statistische toetsen beschrijft — en geen enkel resultaat. Intern-Decision-4B van InternLM verscheen op Hugging Face op 26 september 2026 om 05:36:37 UTC zonder dat er een aankondiging aan te pas kwam, is gefinetuned op basis van Qwen3.5-4B, accepteert zowel afbeeldingen als tekst, draait in 44 milliseconden op één RTX 4090, en print een volledige tabel met Brier- en verwachte-calibratiefoutwaarden. Beide retourneren een kansverdeling over de opties die je aanlevert. Slechts één van hen vertelt je hoe goed het dat doet.

Die inversie — het grotere, beter gefinancierde model dat juist het ondoorzichtige is — bepaalt de hele vorm van deze confrontatie, en beslist voor de meeste teams sneller dan welke specificatieregel dan ook.

Het ene getal dat hen scheidt

InternLM rapporteert Brier 0,347 en ECE 0,065 voor Intern-Decision-4B in zijn benchmarksuite, met een gemiddelde score van 90,02 over Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) en WildJailBreak (89,86). Dat zijn door de leverancier gerapporteerde cijfers op het eigen testharnas van de leverancier, en vooral de Jevbench-rijen vormen de eigen benchmarkfamilie van het project — lees ze als zelfbeoordeling, niet als onafhankelijke verificatie. Maar het zijn cijfers met een vermelde schaal, en vooral ECE is het cijfer dat je vertelt of een teruggegeven 0,8 het waard is om op te handelen.

Microsoft publiceert geen equivalent. Het tabblad Benchmarks op de cataloguspagina van Microsoft-Decision-1 beschrijft wat er is gemeten en beweert dat het model "presteert op het niveau van toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd", waarbij redeneren, regels toepassen en robuustheid van promptformaat als sterkste gebieden worden genoemd, en gespecialiseerde domeinkennis als zwakste. Geen Brier, geen ECE, geen nauwkeurigheidstabel. Als uw adoptiebeslissing een kalibratiewaarde nodig heeft voordat u een escalatiedrempel kunt bepalen, krijgt u die van een van deze twee modellen en vraagt het andere u die zelf te meten.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

Waar de twee contracten daadwerkelijk verschillen

Op het eerste gezicht gebruiken deze modellen dezelfde aanroep. Je levert een toestand, een schema van benoemde vragen en een vaste set opties aan; je krijgt een waarschijnlijkheid per optie terug zonder één token gegenereerde tekst. De verschillen komen naar voren aan de randen van dat contract.

• Modaliteit — Microsoft-Decision-1 is expliciet alleen-tekst en accepteert of produceert geen afbeeldings-, audio- of videocontent. Intern-Decision-4B accepteert optionele afbeeldingen naast de status, tot acht per aanroep, en dat maakt het een kandidaat voor screenshot-triage, controles van documentindelingen en het routeren van visuele QA.

• Aantal vragen — InternLM documenteert 1 tot 16 vragen per aanroep, elk met maximaal 62 opties, over drie veldtypen (choice, score, noul). Microsoft documenteert de formaten — ja/nee, meerkeuze, beoordeling, classificatie, rubric — en een enkele aanroep over maximaal 32K tokens, maar geen limiet op het aantal vragen per aanroep.

• Context — Microsoft vermeldt 32.768 tokens. De Intern-Decision-4B-kaart vermeldt zijn limieten in vragen, opties en afbeeldingen in plaats van als één contextgetal, dus je kunt de twee niet op één getal met elkaar vergelijken.

• Distributie — Microsoft-Decision-1 is een gehoste Foundry API; modelgewichten worden niet gedistribueerd en er is geen download. Intern-Decision-4B is Apache-2.0 op Hugging Face met behoud van de upstream Qwen-licentie als LICENSE-QWEN, wat betekent dat u die licentie en upstream-kennisgevingen moet behouden als u het opnieuw distribueert.

• Kostenprofiel — De gewichten van InternLM kosten niets om te draaien en worden opgegeven als 44,16 ms gemiddeld, 44,60 ms P95, op één RTX 4090. De prijs per token van Microsoft staat helemaal niet op de modelpagina vermeld.

• Governance — Microsoft levert een Responsible AI-assessment, gedocumenteerde implementatiepraktijken en expliciete uitsluitingen (niet voor tekstgeneratie, open-ended QA, conversatie, vertaling of samenvatting; niet als enige geautomatiseerde besluitvormer bij beslissingen met verstrekkende gevolgen over mensen). InternLM levert een modelkaart die openhartig is over herkomst — gewichten "gewijzigd door decision tuning" — en niets van een compliancepakket.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Twee heel verschillende redenen waarom de latency-cijfers moeilijk te vergelijken zijn

Microsoft-Decision-1 publiceert geen latentiecijfer, dus er is niets om naast het gemiddelde van 44,16 ms van InternLM te zetten. Dat is geen kleine omissie voor deze workload. Deze modellen bestaan om vele malen binnen een pipeline te worden aangeroepen — één keer per opgehaald document, één keer per voorgestelde toolaanroep, één keer per te beoordelen antwoord — en het verschil tussen vier beslissingen per seconde en veertig is het verschil tussen één sample scoren en alles scoren. Het cijfer van InternLM is vandaag haalbaar op hardware die je per uur kunt huren; dat van Microsoft moet via je eigen Foundry-implementatie worden gemeten, en de implementatievorm die je kiest (pay-as-you-go serverless versus provisioned throughput) zal het meer veranderen dan het model zelf.

Dit is ook waar OrcaRouter's helft van het patroon relevant wordt, en het is uitsluitend de generatieve helft. We hosten Microsoft-Decision-1 noch Intern-Decision-4B — een model dat waarschijnlijkheden in plaats van tekst retourneert, is niet iets waarnaar je chatcompletions routeert, en geen van beide staat in onze catalogus. Wat achter onze ene OpenAI-compatibele sleutel zit, is de pool van meer dan 200 modellen die het schrijfwerk doen: de judge-prompt die door één model wordt opgesteld, de kandidaatantwoorden die door twee andere modellen worden geproduceerd, de toolaanroep die wordt gescoord voordat die wordt uitgevoerd. De lijstprijs van de provider wordt met 0% opslag doorgegeven, dus een prijsverlaging op een generator is dezelfde dag nog live aan onze kant, en automatische failover houdt de generatiezijde van een scoringslus in leven wanneer één enkele provider degradeert — wat hier meer dan gebruikelijk van belang is, omdat een pipeline die alles wat hij ziet scoort geen ruimte heeft om een vastgelopen aanroep opnieuw te proberen.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Wie moet welke nemen

Kies Intern-Decision-4B als een van deze waar is: u zowel afbeeldingen als tekst moet scoren, u een kalibratiegetal nodig hebt voordat u kunt uitrollen, u de optie wilt om het model op uw eigen hardware te draaien binnen een grens die u beheert, of u het wilt fine-tunen. Het laatste punt verdient nadruk — een 4B open-weights scorer met een gedocumenteerde wrapper is een model dat u aan uw eigen labels kunt aanpassen, en Microsoft-Decision-1 is een gehoste API zonder fine-tuningpad en zonder gewichten om aan te passen.

Kies Microsoft-Decision-1 als het knelpunt inkoop is en niet prestatie: je hebt Azure-authenticatie, uniforme facturering, governance en een Responsible AI-beoordeling door de leverancier nodig voordat er iets in productie gaat, en je hebt een 32K-context nodig voor lange documenten, die de limieten per aanroep van de 4B bemoeilijken. Het ontbreken van gepubliceerde benchmarks is een echte kostenpost, maar het is een kostenpost die je in een middag kunt wegwerken door je eigen gelabelde set door beide modellen te laten lopen en ECE te vergelijken — wat je toch zou doen voordat je op de tabel van een van beide leveranciers vertrouwt.

Het ongemakkelijke antwoord is dat beide goedkoop genoeg zijn om te testen, waardoor de discussie nauwelijks de moeite waard is. Intern-Decision-4B heeft een GPU nodig die je waarschijnlijk al hebt. Microsoft-Decision-1 heeft een Foundry-implementatie nodig en een steekproef van je eigen gelabelde beslissingen. Laat je data door beide lopen, bereken calibratie op de subset die voor jou belangrijk is, en laat de cijfers beslissen — wat, toepasselijk genoeg, precies is waarvoor deze modellen bedoeld zijn.