
Microsoft-Decision-1 vs Intern-Decision-4B: Den ena publicerar sin kalibrering, den andra publicerar sin metodik
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Ställ Microsoft-Decision-1 bredvid Intern-Decision-4B och du får en jämförelse som avgörs mindre av förmåga än av vad respektive leverantör var beredd att publicera. Microsofts modell blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026: en Qwen3.5-9B-bas, eftertränad av Microsoft, endast text, 32 768-tokenkontext, vikter distribueras inte, en utvärderingsmetodik som beskriver noggrannhet, kalibreringsfel och parade statistiska tester – och inte ett enda resultat. InternLMs Intern-Decision-4B lades upp på Hugging Face den 26 september 2026 kl. 05:36:37 UTC utan något tillkännagivande bakom sig, är finjusterad från Qwen3.5-4B, tar emot bilder såväl som text, körs på 44 millisekunder på ett enda RTX 4090 och visar en fullständig tabell med siffror för Brier och förväntat kalibreringsfel. Båda returnerar en sannolikhetsfördelning över alternativ som du anger. Endast en av dem berättar hur bra den gör det.
Den inversionen – att den större, bättre finansierade modellen är den ogenomskinliga – är hela formen för den här duellen, och den avgör valet för de flesta team snabbare än någon specifikationsrad.
Det enda numret som skiljer dem åt
InternLM rapporterar Brier 0,347 och ECE 0,065 för Intern-Decision-4B över hela sin benchmark-svit, med ett genomsnittligt resultat på 90,02 över Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) och WildJailBreak (89,86). Det är siffror som leverantören själv rapporterar i leverantörens egen testrigg, och särskilt Jevbench-raderna tillhör projektets egen benchmarkfamilj — läs dem som självbedömning, inte som oberoende verifiering. Men det är tal med en angiven skala, och särskilt ECE är den siffra som talar om för dig huruvida ett returnerat 0,8 är värt att agera på.
Microsoft publicerar ingen motsvarighet. Fliken Benchmarks på katalogsidan för Microsoft-Decision-1 beskriver vad som mättes och hävdar att modellen ”presterar i nivå med ledande beslutsmodeller och ligger före andra öppna beslutsmodeller som utvärderats med samma metodik”, där de starkaste områdena anges vara resonemang, regeltillämpning och robusthet för promptformat, och det svagaste området anges vara specialiserad domänkunskap. Ingen Brier, ingen ECE, ingen noggrannhetstabell. Om ditt införandebeslut behöver ett kalibreringsvärde innan du kan dimensionera en eskaleringsgräns, ger en av dessa två modeller den till dig och den andra ber dig mäta den själv.

Där de två kontrakten faktiskt skiljer sig åt.
Vid en första anblick tar dessa modeller samma anrop. Du skickar in ett tillstånd, ett schema med namngivna frågor och en fast uppsättning alternativ; du får tillbaka en sannolikhet per alternativ utan en enda genererad texttoken. Skillnaderna visar sig i kanterna av det kontraktet.
• Modalitet — Microsoft-Decision-1 är uttryckligen endast text och accepterar eller producerar inte bild-, ljud- eller videoinnehåll. Intern-Decision-4B accepterar valfria bilder tillsammans med tillståndet, upp till åtta per anrop, vilket är det som gör den till en kandidat för skärmbildstriage, kontroller av dokumentlayout och visuell QA-routning.
• Frågekardinalitet — InternLM dokumenterar 1 till 16 frågor per anrop, upp till 62 alternativ vardera, över tre fälttyper (choice, score, noul). Microsoft dokumenterar formaten — ja/nej, flerval, betygsskala, klassificering, bedömningsmatris — och ett enda anrop över upp till 32K tokens, men inget tak för antalet frågor per anrop.
• Kontext — Microsoft anger 32 768 tokens. Intern-Decision-4B-kortet anger sina gränser i frågor, alternativ och bilder i stället för som ett enda kontextnummer, så du kan inte jämföra de två utifrån en enda siffra.
• Distribution — Microsoft-Decision-1 är ett hostat Foundry-API; modellvikter distribueras inte och det finns ingen nedladdning. Intern-Decision-4B är Apache-2.0 på Hugging Face med den uppströms Qwen-licensen bevarad som LICENSE-QWEN, vilket innebär att behålla den licensen och meddelanden från uppströmmen om du distribuerar vidare.
• Kostnadsbild — InternLM:s vikter kostar inget att köra och anges till 44,16 ms i medel, 44,60 ms P95, på ett RTX 4090. Microsofts pris per token finns inte alls utskrivet på modellsidan.
• Styrning — Microsoft levererar en ansvarsfull AI-bedömning, dokumenterade driftsättningsrutiner och uttryckliga uteslutningar (inte för textgenerering, öppna frågor och svar, konversation, översättning eller sammanfattning; inte för att vara den enda automatiserade beslutsfattaren vid konsekvensrika beslut om människor). InternLM levererar ett modellkort som är uppriktigt om härkomsten — vikter "modifierade genom beslutsjustering" — och inget som liknar ett regelefterlevnadspaket.

Två mycket olika anledningar till att latenssiffrorna är svåra att jämföra
Microsoft-Decision-1 publicerar ingen latenssiffra, så det finns inget att ställa bredvid InternLM:s medelvärde på 44,16 ms. Det är inte en liten utelämning för den här arbetsbelastningen. Dessa modeller finns för att anropas många gånger i en pipeline – en gång per hämtat dokument, en gång per föreslaget verktygsanrop, en gång per svar som graderas – och skillnaden mellan fyra beslut per sekund och fyrtio är skillnaden mellan att poängsätta ett sampel och att poängsätta ett sampel. InternLM:s siffra är uppnåelig i dag på hårdvara du kan hyra per timme; Microsofts måste mätas via din egen Foundry-driftsättning, och den driftsättningsform du väljer (server med betalning per användning kontra provisionerad genomströmning) kommer att förändra den mer än vad modellen gör.
Det är också här som OrcaRouters halva av mönstret blir relevant, och det är endast den generativa halvan. Vi hostar inte Microsoft-Decision-1 eller Intern-Decision-4B – en modell som returnerar sannolikheter i stället för text är inte något man dirigerar chattkompletteringar till, och ingen av dem finns i vår katalog. Det som ligger bakom vår enda OpenAI-kompatibla nyckel är poolen med fler än 200 modeller som står för skrivandet: domarprompten som utformas av en modell, kandidatsvaren som produceras av två andra, verktygsanropet som poängsätts innan det körs. Leverantörens listpris förs vidare med 0 % påslag, så en prissänkning på en generator är aktiv hos oss samma dag, och automatisk failover håller generationssidan av en poängsättningsloop vid liv när en enskild leverantör försämras – vilket spelar större roll än vanligt här, eftersom en pipeline som poängsätter allt den ser inte har något utrymme att försöka igen med ett anrop som har fastnat.

Vem ska ta vilken
Välj Intern-Decision-4B om något av följande stämmer: du behöver kunna poängsätta bilder likväl som text, du behöver ett kalibreringstal innan du kan släppa, du vill ha möjligheten att köra modellen på din egen hårdvara inom en gräns du kontrollerar, eller så vill du finjustera den. Den sista punkten förtjänar eftertryck — en 4B-scorer med öppna vikter och en dokumenterad wrapper är en modell du kan anpassa till dina egna etiketter, och Microsoft-Decision-1 är ett hostat API utan väg till finjustering och utan vikter att anpassa.
Välj Microsoft-Decision-1 om hindret är upphandling snarare än prestanda: du behöver Azure-autentisering, enhetlig fakturering, styrning och en leverantörsbedömning av ansvarsfull AI innan något når produktion, och du behöver en 32K-kontext för långa dokument som 4B:ans gränser per anrop försvårar. Avsaknaden av publicerade benchmarks är en verklig kostnad, men det är en kostnad du kan eliminera på en eftermiddag genom att köra din egen märkta datamängd genom båda modellerna och jämföra ECE – vilket är vad du ändå skulle göra innan du litar på någon av leverantörernas tabeller.
Det obekväma svaret är att båda dessa är tillräckligt billiga att testa för att argumentet knappt är värt att föra. Intern-Decision-4B behöver en GPU som du förmodligen redan har. Microsoft-Decision-1 behöver en Foundry-driftsättning och ett urval av dina egna märkta beslut. Kör dina data genom båda, beräkna kalibrering på den delmängd som spelar roll för dig, och låt siffrorna avgöra — vilket, passande nog, är precis vad dessa modeller är till för.
