Ett genererat titelkort för Microsoft-Decision-1 vs Intern-Decision-4B med undertexten 'två poängsättare, en med siffror och en utan', med brickor som visar 9B vs 4B, hostad API vs öppna vikter, inga publicerade benchmarks vs Brier 0.347 och ECE 0.065, samt en källhänvisning i sidfoten som noterar att Microsofts siffror är icke-reproducerade och InternLM:s siffror är leverantörsrapporterade.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-4B: Den ena publicerar sin kalibrering, den andra publicerar sin metodik

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ Microsoft-Decision-1 bredvid Intern-Decision-4B och du får en jämförelse som avgörs mindre av förmåga än av vad respektive leverantör var beredd att publicera. Microsofts modell blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026: en Qwen3.5-9B-bas, eftertränad av Microsoft, endast text, 32 768-tokenkontext, vikter distribueras inte, en utvärderingsmetodik som beskriver noggrannhet, kalibreringsfel och parade statistiska tester – och inte ett enda resultat. InternLMs Intern-Decision-4B lades upp på Hugging Face den 26 september 2026 kl. 05:36:37 UTC utan något tillkännagivande bakom sig, är finjusterad från Qwen3.5-4B, tar emot bilder såväl som text, körs på 44 millisekunder på ett enda RTX 4090 och visar en fullständig tabell med siffror för Brier och förväntat kalibreringsfel. Båda returnerar en sannolikhetsfördelning över alternativ som du anger. Endast en av dem berättar hur bra den gör det.

Den inversionen – att den större, bättre finansierade modellen är den ogenomskinliga – är hela formen för den här duellen, och den avgör valet för de flesta team snabbare än någon specifikationsrad.

Det enda numret som skiljer dem åt

InternLM rapporterar Brier 0,347 och ECE 0,065 för Intern-Decision-4B över hela sin benchmark-svit, med ett genomsnittligt resultat på 90,02 över Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) och WildJailBreak (89,86). Det är siffror som leverantören själv rapporterar i leverantörens egen testrigg, och särskilt Jevbench-raderna tillhör projektets egen benchmarkfamilj — läs dem som självbedömning, inte som oberoende verifiering. Men det är tal med en angiven skala, och särskilt ECE är den siffra som talar om för dig huruvida ett returnerat 0,8 är värt att agera på.

Microsoft publicerar ingen motsvarighet. Fliken Benchmarks på katalogsidan för Microsoft-Decision-1 beskriver vad som mättes och hävdar att modellen ”presterar i nivå med ledande beslutsmodeller och ligger före andra öppna beslutsmodeller som utvärderats med samma metodik”, där de starkaste områdena anges vara resonemang, regeltillämpning och robusthet för promptformat, och det svagaste området anges vara specialiserad domänkunskap. Ingen Brier, ingen ECE, ingen noggrannhetstabell. Om ditt införandebeslut behöver ett kalibreringsvärde innan du kan dimensionera en eskaleringsgräns, ger en av dessa två modeller den till dig och den andra ber dig mäta den själv.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

Där de två kontrakten faktiskt skiljer sig åt.

Vid en första anblick tar dessa modeller samma anrop. Du skickar in ett tillstånd, ett schema med namngivna frågor och en fast uppsättning alternativ; du får tillbaka en sannolikhet per alternativ utan en enda genererad texttoken. Skillnaderna visar sig i kanterna av det kontraktet.

• Modalitet — Microsoft-Decision-1 är uttryckligen endast text och accepterar eller producerar inte bild-, ljud- eller videoinnehåll. Intern-Decision-4B accepterar valfria bilder tillsammans med tillståndet, upp till åtta per anrop, vilket är det som gör den till en kandidat för skärmbildstriage, kontroller av dokumentlayout och visuell QA-routning.

• Frågekardinalitet — InternLM dokumenterar 1 till 16 frågor per anrop, upp till 62 alternativ vardera, över tre fälttyper (choice, score, noul). Microsoft dokumenterar formaten — ja/nej, flerval, betygsskala, klassificering, bedömningsmatris — och ett enda anrop över upp till 32K tokens, men inget tak för antalet frågor per anrop.

• Kontext — Microsoft anger 32 768 tokens. Intern-Decision-4B-kortet anger sina gränser i frågor, alternativ och bilder i stället för som ett enda kontextnummer, så du kan inte jämföra de två utifrån en enda siffra.

• Distribution — Microsoft-Decision-1 är ett hostat Foundry-API; modellvikter distribueras inte och det finns ingen nedladdning. Intern-Decision-4B är Apache-2.0 på Hugging Face med den uppströms Qwen-licensen bevarad som LICENSE-QWEN, vilket innebär att behålla den licensen och meddelanden från uppströmmen om du distribuerar vidare.

• Kostnadsbild — InternLM:s vikter kostar inget att köra och anges till 44,16 ms i medel, 44,60 ms P95, på ett RTX 4090. Microsofts pris per token finns inte alls utskrivet på modellsidan.

• Styrning — Microsoft levererar en ansvarsfull AI-bedömning, dokumenterade driftsättningsrutiner och uttryckliga uteslutningar (inte för textgenerering, öppna frågor och svar, konversation, översättning eller sammanfattning; inte för att vara den enda automatiserade beslutsfattaren vid konsekvensrika beslut om människor). InternLM levererar ett modellkort som är uppriktigt om härkomsten — vikter "modifierade genom beslutsjustering" — och inget som liknar ett regelefterlevnadspaket.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Två mycket olika anledningar till att latenssiffrorna är svåra att jämföra

Microsoft-Decision-1 publicerar ingen latenssiffra, så det finns inget att ställa bredvid InternLM:s medelvärde på 44,16 ms. Det är inte en liten utelämning för den här arbetsbelastningen. Dessa modeller finns för att anropas många gånger i en pipeline – en gång per hämtat dokument, en gång per föreslaget verktygsanrop, en gång per svar som graderas – och skillnaden mellan fyra beslut per sekund och fyrtio är skillnaden mellan att poängsätta ett sampel och att poängsätta ett sampel. InternLM:s siffra är uppnåelig i dag på hårdvara du kan hyra per timme; Microsofts måste mätas via din egen Foundry-driftsättning, och den driftsättningsform du väljer (server med betalning per användning kontra provisionerad genomströmning) kommer att förändra den mer än vad modellen gör.

Det är också här som OrcaRouters halva av mönstret blir relevant, och det är endast den generativa halvan. Vi hostar inte Microsoft-Decision-1 eller Intern-Decision-4B – en modell som returnerar sannolikheter i stället för text är inte något man dirigerar chattkompletteringar till, och ingen av dem finns i vår katalog. Det som ligger bakom vår enda OpenAI-kompatibla nyckel är poolen med fler än 200 modeller som står för skrivandet: domarprompten som utformas av en modell, kandidatsvaren som produceras av två andra, verktygsanropet som poängsätts innan det körs. Leverantörens listpris förs vidare med 0 % påslag, så en prissänkning på en generator är aktiv hos oss samma dag, och automatisk failover håller generationssidan av en poängsättningsloop vid liv när en enskild leverantör försämras – vilket spelar större roll än vanligt här, eftersom en pipeline som poängsätter allt den ser inte har något utrymme att försöka igen med ett anrop som har fastnat.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Vem ska ta vilken

Välj Intern-Decision-4B om något av följande stämmer: du behöver kunna poängsätta bilder likväl som text, du behöver ett kalibreringstal innan du kan släppa, du vill ha möjligheten att köra modellen på din egen hårdvara inom en gräns du kontrollerar, eller så vill du finjustera den. Den sista punkten förtjänar eftertryck — en 4B-scorer med öppna vikter och en dokumenterad wrapper är en modell du kan anpassa till dina egna etiketter, och Microsoft-Decision-1 är ett hostat API utan väg till finjustering och utan vikter att anpassa.

Välj Microsoft-Decision-1 om hindret är upphandling snarare än prestanda: du behöver Azure-autentisering, enhetlig fakturering, styrning och en leverantörsbedömning av ansvarsfull AI innan något når produktion, och du behöver en 32K-kontext för långa dokument som 4B:ans gränser per anrop försvårar. Avsaknaden av publicerade benchmarks är en verklig kostnad, men det är en kostnad du kan eliminera på en eftermiddag genom att köra din egen märkta datamängd genom båda modellerna och jämföra ECE – vilket är vad du ändå skulle göra innan du litar på någon av leverantörernas tabeller.

Det obekväma svaret är att båda dessa är tillräckligt billiga att testa för att argumentet knappt är värt att föra. Intern-Decision-4B behöver en GPU som du förmodligen redan har. Microsoft-Decision-1 behöver en Foundry-driftsättning och ett urval av dina egna märkta beslut. Kör dina data genom båda, beräkna kalibrering på den delmängd som spelar roll för dig, och låt siffrorna avgöra — vilket, passande nog, är precis vad dessa modeller är till för.