
Intern-Decision-2B vs Qwen 3.8: En gemensam stomme, två väldigt olika uppgifter
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 584 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Öppna konfigurationen för internlm/Intern-Decision-2B och konfigurationen för Qwen/Qwen3.5-2B sida vid sida, och nästan ingenting skiljer sig. Samma 24 lager, samma dolda storlek på 2 048, samma 8 query-huvuden mot 2 key-value-huvuden, samma huvuddimension på 256, samma inbäddningstak på 262 144 positioner, samma vokabulär på 248 320 tokens, samma upprepade mönster med tre linjära attention-lager mot ett fullt attention-lager. Intern-Decision-2B är inte en ny arkitektur. Det är den ryggraden med sin textgenereringsförmåga borttagen och sin konfidens kalibrerad – och just den subtraktionen är vad som gör jämförelsen mot Qwen3.8-Max, flaggskeppet med 2,4 biljoner parametrar som hela familjenamnet "Qwen 3.8" syftar på i toppklassen, värd mer än en parameterräkning.
De två är inte konkurrenter och matchen är inte en tävling. Intern-Decision-2B är en finjustering av Qwen3.5-2B med 2 213 241 664 parametrar, uppladdad till Hugging Face kl. 05:36 UTC den 26 september 2026 bland tre oannonserade syskon, och den avger inga tokens: den tar ett tillstånd och typade frågor, kör en kausal framåtpassning, läser logits vid fasta platshållarpositioner och returnerar en kalibrerad fördelning per fält. Qwen3.8-Max är Alibabas hostade flaggskepp, en gles mixture-of-experts-modell med ungefär 95 miljarder aktiva parametrar per token, ett multimodalt kontextfönster på 1 miljon tokens och ett listpris på 2,00 USD per miljon indatatoken och 6,00 USD per miljon utdatatoken. Den ena är en komponent. Den andra är en tjänst. Den användbara frågan är var sömmen mellan dem hör hemma i en pipeline som du redan betalar för.
Subtraktionen, precis
Vad beslutstuning förändrade är värt att ange exakt, eftersom det klargör vad basmodellen redan hade med sig.
Uppgiften kallas i repositoriet för autoregressiv maskerad språkmodellering. Assistentens indata innehåller ett komplett JSON-skelett med en <decision>-token per fält; facitets svarssymboler förekommer bara i etiketterna, aldrig i indata. Träningen använder vanlig kausal nästa-token-alignering, där logiten omedelbart före en markör förutsäger fältets svar, och alla fält delar en och samma framåtpassning. Vid inferens begränsas logiterna till de giltiga svarsymbolerna som utgörs av en enda token — A–Z, a–z, 0–9, vilket är varifrån taket på 62 alternativ kommer — genomgår sedan softmax och mappas tillbaka till dina etiketter.
Så basmodellens nästa-token-maskineri är intakt och oförändrat. Det som tränades in är en preferens för att inta en av en handfull svarspositioner i stället för att fortsätta en mening, plus en kontrollpunktspecifik temperatur på 2,100509348278 anpassad genom negativ log-likelihood över 1 728 utsedda kalibreringsfall med 1 693 som hölls utanför. Kortet säger otvetydigt att generering inte är aktuellt: API:et "utför strukturerad kandidatpoängsättning. Det anropar inte generate() eller samplar fritext."
Repositoriet dokumenterar också vad finjusteringen inte rörde: den "finjusterar språkryggraden i Qwen3.5 medan vision-tornet och projektorn hålls frysta." Den 612 517 440 byte stora vision-sharden på 2B har samma byteantal som på 4B-beslutscheckpointen, vilket passar ärvda snarare än tränade komponenter. Bildvägen fungerar; den var helt enkelt inte vad beslutsomgången lade sin budget på.

Vad 2,2 miljarder parametrar inte kan göra, och vad 2,4 biljoner gör i stället
Allt separeras längs en enda axel: huruvida ditt svar redan finns som en lista.
Intern-Decision-2B besvarar en sluten uppsättning. En till sexton frågor, upp till 62 alternativ vardera, upp till åtta bilder, allt inom en budget på 8 192 tokens som motorn vägrar snarare än trunkerar. Returneras som sannolikheter. Vid 33,28 ms i genomsnitt per begäran på ett enda RTX 4090 med en P95 på 33,55 ms, och inget debiteras per anrop eftersom det inte finns någon utdata att debitera för.
Qwen3.8-Max skriver. En kontext på 1 miljon tokens, text-, bild- och videoinmatning, resonemang med ett tankeläge, inbyggt verktygsanrop, strukturerade utdata, upp till 131 000 utdatatokens på den daterade 0902-versionen. Den kan också i princip fatta samma routningsbeslut som Intern-Decision-2B fattar – du kan prompta den att välja bland alternativ och returnera JSON. Tre saker går fel när du gör det. Du betalar för de tokens den spenderar på att besluta. Du får en sträng vars parsning kan lyckas eller misslyckas. Och talet i den strängen är vad samplern producerade, inte en softmax som du kan sätta en tröskel på 0,8 för och agera utifrån.
Båda redogörelserna är sanna och ingen av dem upphäver den andra. Flaggskeppet med 2,4 biljoner parametrar finns eftersom de flesta problem inte är slutna mängder. 2,2-miljardersscorern finns eftersom den delmängd som är det förtjänar ett billigare instrument.
Resultattavla

• Parametrar — Intern-Decision-2B 2 213 241 664 i BF16 plus ett visionstorn och en projektor, cirka 4,46 GB på disk; Qwen3.8-Max ungefär 2,4 biljoner totalt med omkring 95 miljarder aktiva per token, serveras, inte laddas ned.
• Kontext — 8 192 token, avvisades ovan; 1 000 000 token med 131 000 maximal utdata i 0902-bygget.
• Utdata — kalibrerade sannolikheter och en argmax, ingen genererad text; genererad text inklusive ett resonemangsspår.
• Modaliteter som indata — text plus upp till åtta bilder; text, bild och video.
• Kostnad — ingen avgift per anrop, och du äger GPU:n; $2.00 per miljon indatatoken, $6.00 per miljon utdatatoken, med cacheläsningar till $0.25 och cacheskrivningar till $2.50.
• Publicerad evidens — en leverantörstabell med sju sviter med ett genomsnitt på 84,68, Brier 0,437 och ECE 0,100 över 10 751 testrader, inte reproducerad av någon utanför InternLM, på en checkpoint med en gilla-markering och noll nedladdningar; ett Artificial Analysis Intelligence Index på 45,4 på plats 15 av 145 och ett AA Coding-index på 76,2 på plats 9 av 138, båda oberoende uppmätta.
• Latens — 33,28 ms i genomsnitt per förfrågan på ett RTX 4090, och sjunker i takt med att batchning läggs till; 2,655 sekunder P50 till första token enligt vad katalogen rapporterar, och ökar med belastningen.
Bevisraderna är inte likvärdiga och bör inte skrivas ut som om de vore det. Alibabas flaggskepp har en oberoende indexpoäng bakom sig. InternLM:s checkpoint har en tabell som dess egna författare har tagit fram, och särskilt kalibreringssiffran bör läsas som en väl dokumenterad avsikt tills den möter någon annans data – i synnerhet här, eftersom just denna storlek uppvisar det sämsta förväntade kalibreringsfelet av de tre som InternLM släppte: 0,100 mot 0,066 för modellen som är hälften så stor och 0,065 för den som är nästan dubbelt så stor.
Sömmen, och hur man kör den
Pipelinen som är vettig är inte ett val mellan dessa två utan en uppdelning: scorern hanterar de uppräknade besluten, och en frontiermodell hanterar allt vars svar inte är en lista. En supporttriage som dirigerar till ett av sex team och skattar brådska på en tregradig skala behöver inte 95 miljarder aktiva parametrar; den behöver en sannolikhet och ett tröskelvärde. Eskaleringsvägen som till slut skriver ett svar till kunden gör det.
Den uppdelningen har en operativ form. Intern-Decision-2B finns inte på OrcaRouter – vår modellsida för den returnerar 404 och det finns ingen hostad route någonstans som vi kunde hitta – så den körs på din egen hårdvara, vilket innebär att den är en komponent som du driftsätter och övervakar. Qwen3.8-Max är en route: en nyckel över 200-plus modeller, leverantörens listpris vidarebefordras utan påslag, vilket innebär att en leverantörsprisändring på flaggskeppet når din faktura samma dag som den landar. Att lägga pipelineens hostade del bakom den enda ytan är det som håller den billigare delen billig: scorern håller samtalsvolymen nere, och frontmodellen nås bara för de fall som verkligen behöver den.

Om du fortfarande utvärderar vilken scorer som hör hemma i den platsen – den här har ingen oberoende utvärdering, och dess kalibrering är svagast i sin egen familj – automatisk redundansväxling mellan leverantörer sättet att prova den i en sökväg som redan har ett fungerande alternativ bakom sig i stället för att ersätta det alternativet helt.
Den ärliga domen
Om ditt problem är ett beslut över en uppsättning svar som du kan räkna upp, och tillståndet ryms inom åtta tusen tokens, kommer Intern-Decision-2B att göra det på trettiotre millisekunder utan kostnad per anrop, och ingen frontier-modell kommer att slå den på den axeln oavsett hur många parametrar du hyr. Skaffa din egen kalibrering på den innan du förlitar dig på den konfidens den rapporterar.
Om ditt problem är något annat – resonemang, lång kontext, verktygsanvändning, video, ett dokument på en miljon tokens, eller helt enkelt ett svar som ännu inte har skrivits – är Qwen3.8-Max inte bara bättre. Det är den enda av de två som över huvud taget kan göra jobbet.
Och om du ännu inte kan säga vilken av de två du har, är svaret förmodligen att du har båda, i samma pipeline, vilket är den arkitektur som parameterantalen hela tiden tyst har sagt dig.
