
Microsoft-Decision-1 vs Intern-Decision-0.8B: Ett halvt uns jailbreak-besvär mot en hostad tomhet
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens · 55 tok/s
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Börja med kolumnen som ett lanseringsinlägg skulle ha utelämnat. Intern-Decision-0.8B — InternLMs beslutsmodell med 852 985 920 parametrar, finjusterad från Qwen3.5-0.8B och uppladdad till Hugging Face den 26 september 2026 utan tillkännagivande, utan artikel och med en GitHub-länk som fortfarande ger 404 — är uppmätt till 64.48 på WildJailBreak mot ett referensvärde på 96.29 för TypeSafes Jev 1.13. Det är inte en avrundningsskillnad. Det är en kollaps i vägransrobusthet hos en modell vars hela uppgift är att bedöma indata, publicerad på leverantörens eget modellkort, i en tabell vars benchmark tillhör en konkurrent. Ställ det bredvid Microsoft-Decision-1, som blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026 som en textbaserad scorer eftertränad på Qwen3.5-9B med en dokumenterad utvärderingsmetodik och inte ett enda resultat tryckt under den, och du har den verkliga formen av den här matchningen. En av dessa modeller kommer att ge dig en siffra som får den att se dålig ut. Den andra berättar vilka mätvärden den skulle ha använt.
Den inversionen är värd mer än specifikationsbladet. Båda modellerna tar ett tillstånd och en avgränsad uppsättning frågor och returnerar sannolikheter över dina alternativ – ingen av dem genererar text, och på den axeln är de samma typ av instrument. De skillnader som spelar roll är vem som kör den, hur stor den är, hur mycket du kan verifiera, och en säkerhetskolumn som den mindre, tystare, helt nedladdningsbara modellen ändå valde att publicera.
Vad var och en faktiskt lämnar tillbaka
Microsoft-Decision-1 är ett hostat API, och det är den första strukturella skillnaden. Vikter distribueras inte – ingen nedladdning, inget arkiv, ingen väg för finjustering – och integration innebär en Foundry-distribution med Azure-autentisering, fakturering och styrning kopplade till sig. Den kör en genomgång över upp till 32 768 tokens, stöder ja/nej, flerval, betygssättning, klassificering och bedömningsmatrisformade frågor, och är endast text in och numeriskt ut. Den stöder uttryckligen ett avståalternativ som "kan inte avgöra" när bevisningen är otillräcklig, vilket är det som gör ett tröskelvärde meningsfullt.
Intern-Decision-0.8B är den motsatta konstruktionen. Det är Apache 2.0-vikter med den ursprungliga Qwen-licensen bevarad bredvid dem som LICENSE-QWEN, omkring 1,73 GB av ett förråd uppdelat på tre shards – en språk-shard på 1,50 GB, en vision-shard på 176 MB och en projektor på 25 MB – som får plats på en enda konsument-GPU eller en välutrustad bärbar dator. Den tar emot ett tillstånd, ett schema med en till sexton namngivna frågor med upp till 62 alternativ vardera, och valfritt upp till åtta bilder, och dess medföljande inference.py dokumenterar kontraktet mer ingående än de flesta lanserade modeller bemödar sig om: alternativ mappas till symboler med en enda token A–Z, sedan a–z, sedan 0–9; logits läses vid positionen omedelbart före varje <decision>-platshållare i ett förrenderat skelett; en softmax beräknas endast över det fältets giltiga kandidater; en anpassad temperatur tillämpas.
De två licenserna är inte samma köp. Microsoft-Decision-1 ger dig en hanterad slutpunkt och ingen artefakt som du äger. Intern-Decision-0.8B ger dig en artefakt som du äger, utan slutpunkt, utan supportavtal och utan dokumentation utöver själva repositoryt.

Taket, och kalibreringen du kan granska
Två tal avgör de flesta verkliga integrationer, och båda tillhör den lilla modellen.
Den första är 8 192 tokens. Intern-Decision-0.8B:s inferensmotor vägrar för stora indata i stället för att trunkera dem, vilket är korrekt beteende för en scorer och även en hård vägg: det finns ingen chunkningsstrategi som bevarar kontraktet, eftersom tillståndet, schemat och skelettet alla måste vara i ett enda pass. Microsoft-Decision-1:s tak är fyra gånger högre vid 32 768, och det är en hostad gräns som du kan höja genom att provisionera på ett annat sätt i stället för en konstant i en Python-fil.
Den andra är kalibrering, och här vänds riktningen. InternLM publicerar en anpassad temperatur på 2.747760550703 för 0.8B, vald genom NLL-minimering över 1 728 utsedda kalibreringsfall, med 1 693 avsatta för validering, där modellkortet uttryckligen anger att testsvitens etiketter inte användes för att välja den. Den tillämpade transformen är en softmax över fältets kandidatlogits följd av en andra softmax över logaritmen av den fördelningen dividerad med temperaturen. Eftersom transformen körs efter den första softmaxen och bevarar ordningen kan den inte ändra argmax alls — den flyttar konfidensen, ja-sannolikheten och det förväntade värdet för en poängfråga, och lämnar etiketten oförändrad. Om din pipeline läser etiketten är temperaturen en no-op. Om den läser sannolikheten, tillämpar en tröskel på den eller matar in den i en beräkning av förväntat värde, är temperaturen skillnaden mellan ett tal som betyder något och ett som inte gör det. Att skicka temperature=1 returnerar den okalibrerade fördelningen om du hellre vill anpassa din egen.
Microsoft-Decision-1 har ingen motsvarande artefakt. På fliken Benchmarks anges att accuracy, kalibreringsfel, safety recall, andel falska positiva och fairness-konsistens mättes på offentliga och community-baserade beslutsbenchmarkar samt på interna testset som hållits undan, att alternativordningen varierades, att parade statistiska tester tillämpades, och att modellen "presterar i nivå med ledande beslutsmodeller och före andra öppna beslutsmodeller som utvärderats med samma metodik". Det finns inget kalibreringsfel utskrivet, ingen temperatur att inspektera och ingen valideringsdelning beskriven. Den enda egenskap som gör en sannolikhet användbar — huruvida 0,8 betyder 0,8 — påstås och kvantifieras inte.
Läs de två styckena mot varandra, och jämförelsen slutar handla om storlek. En checkpoint med 0,8 miljarder parametrar vars kalibrering du kan granska och vars programvara du kan köra är, för ett utvärderingsteam, ett mer hanterbart objekt än ett hostat API vars kalibrering är en mening. Den lilla modellen har också en latenssiffra dokumenterad — 33,98 ms i medelvärde, 33,44 ms i median, 37,50 ms p95 per fråga på ett enda RTX 4090 via den lokala Hugging Face-vägen, i InternLMs egen mätning — medan Microsofts är något man mäter genom sin egen distribution, där valet mellan serverlös och provisionerad genomströmning kommer att påverka siffran mer än vad modellen gör.

Där den lilla modellen förlorar
Inget av ovanstående gör Intern-Decision-0.8B till det säkra valet, och samma publicerade tabell säger varför. WildJailBreak på 64.48mot Jevs 96.29 är en avvisningsrobusthetsklyfta på trettio punkter i precis den kategori där en bedömare möter obetrodd indata. En beslutsmodell är ofta den komponent som avgör huruvida en föreslagen åtgärd är tillåten; en som är lätt att prata förbi är en belastning i den rollen. Huruvida underskottet kommer från Qwen3.5-0.8B-basen, från beslutsfinjusteringens målfunktion eller från det låga parameterantalet är inget som repot berättar för dig, och det finns ingen artikel, inget träningsrecept och ingen dataöppenhet som skulle göra det.
Resten av InternLMs egen tabell är mer smickrande än den kolumnen och fortfarande måttfull. Genomsnittet över sju testsviter är 79,38 för 0,8B mot 84,68 för dess egen 2B-syskonmodell och 90,02 för 4B — familjen klättrar brant med storleken, vilket är en svag signal om att tabellen inte var baklängeskonstruerad för att smickra flaggskeppet. AG News landar på 88,61 mot Jevs 89,57, i praktiken lika på fyrakategorisk ämnesklassificering. När det gäller kalibrering rapporterar 0,8B ett Brier-värde på 0,530 och ett förväntat kalibreringsfel på 0,066, mot Jevs 0,358 och 0,095 — bättre ECE, betydligt sämre noggrannhet. Det är en trovärdig profil för en liten modell med en medvetet anpassad temperatur, och det är inte en kombination som ett marknadsföringsteam skulle välja att publicera av misstag.
Det finns inte heller något releasedatum, inget tillkännagivande, ingen samling som samlar de tre checkpointerna, ingen hostad endpoint någonstans och ingen oberoende utvärdering av något slag. Demo Space svarar 401. Den korrekta beskrivningen av Intern-Decision-0.8B är en publicerad checkpoint med ogranskade påståenden – vilket är en bättre situation än ett API på väntelista, eftersom du kan mäta den på en eftermiddag, men det innebär att valideringsbördan är helt och hållet din.
Att välja, och var OrcaRouter befinner sig
Ta Microsoft-Decision-1 om hindret är upphandling eller skalning: du behöver Azure-autentisering, enhetlig fakturering och en bedömning av ansvarsfull AI innan något når produktion; du behöver en kontext på 32K; du behöver en slutpunkt som du inte själv driver; eller du behöver att vägen för att avstå är inbyggd från början i stället för hemmagjord. Acceptera i gengäld att du inte kan köra den, inte kan finjustera den, inte kan inspektera dess kalibrering och själv kommer att mäta dess centrala påstående.
Välj Intern-Decision-0.8B om hindret är kostnad, minne eller kontroll: du vill ha en Apache-2.0-scorer som ryms i 1,73 GB, körs på hårdvara du redan äger, ger samma etikett varje gång och kan bytas ut mot sitt 2B- eller 4B-syskon genom att ändra en checkpoint-sökväg. Acceptera i utbyte 8 192-tokensväggen, WildJailBreak-kolumnen och det faktum att ingen utanför InternLM har reproducerat något på kortet.
Den ärliga rekommendationen är att göra båda, eftersom de är tillräckligt billiga för att argumentet knappt är värt att föra. Själva poängsättningsanropet är inte något vi dirigerar – en modell som returnerar sannolikheter i stället för text är ingen chattkomplettering, och ingen av dem finns i vår katalog. Det OrcaRouter tillhandahåller är den andra halvan av loopen: de mer än 200 modeller bakom en enda OpenAI-kompatibel nyckelsom utformar bedömningskriterierna, genererar kandidatsvaren eller skickar det verktygsanrop som din poängsättare ska betygsätta, till leverantörens listpris vidarebefordrat med 0 % påslag, så en leverantörs prissänkning på en generator är live hos oss samma dag. Automatisk failover spelar större roll än vanligt här, eftersom en pipeline som poängsätter allt den ser inte har utrymme att försöka igen med ett anrop som har fastnat, och routnings-DSL:en låter dig skicka en domarprompt till flera skribenter och slå samman deras samstämmighet i stället för att lita på en enda.

Slutsats
Microsoft-Decision-1 nådde allmän tillgänglighet på Microsoft Foundry den 8 oktober 2026: hostad, endast text, 32 768 tokens, byggd på Qwen3.5-9B, med ett metodstycke i stället för en benchmark-tabell. Intern-Decision-0.8B är en 1,73 GB Apache-2.0-checkpoint som laddades upp den 26 september 2026 och som publicerar ett Brier på 0,530, ett ECE på 0,066, en anpassad temperatur på 2,747760550703, 33,98 ms på en 4090 – och en WildJailBreak-poäng på 64,48 som ingen bad den skriva ut. Om du bara kan validera en enda sak innan du antar någon av dem, validera kalibreringen på dina egna märkta fall; det är siffran som båda leverantörerna har lämnat åt dig att hitta.
