Ett genererat titelkort med texten 'Intern-Decision-2B vs Qwen 3.8', med undertexten 'En stomme, två mycket olika jobb', med märkena '2,2B-poängsättare, 33 ms' och '2,4T flaggskepp, 1M kontext', med OrcaRouter-logotypen kompositerad i hörnet.
Guides & Insights

Intern-Decision-2B vs Qwen 3.8: En gemensam stomme, två väldigt olika uppgifter

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Öppna konfigurationen för internlm/Intern-Decision-2B och konfigurationen för Qwen/Qwen3.5-2B sida vid sida, och nästan ingenting skiljer sig. Samma 24 lager, samma dolda storlek på 2 048, samma 8 query-huvuden mot 2 key-value-huvuden, samma huvuddimension på 256, samma inbäddningstak på 262 144 positioner, samma vokabulär på 248 320 tokens, samma upprepade mönster med tre linjära attention-lager mot ett fullt attention-lager. Intern-Decision-2B är inte en ny arkitektur. Det är den ryggraden med sin textgenereringsförmåga borttagen och sin konfidens kalibrerad – och just den subtraktionen är vad som gör jämförelsen mot Qwen3.8-Max, flaggskeppet med 2,4 biljoner parametrar som hela familjenamnet "Qwe​n 3.8" syftar på i toppklassen, värd mer än en parameterräkning.

De två är inte konkurrenter och matchen är inte en tävling. Intern-Decision-2B är en finjustering av Qwen3.5-2B med 2 213 241 664 parametrar, uppladdad till Hugging Face kl. 05:36 UTC den 26 september 2026 bland tre oannonserade syskon, och den avger inga tokens: den tar ett tillstånd och typade frågor, kör en kausal framåtpassning, läser logits vid fasta platshållarpositioner och returnerar en kalibrerad fördelning per fält. Qwen3.8-Max är Alibabas hostade flaggskepp, en gles mixture-of-experts-modell med ungefär 95 miljarder aktiva parametrar per token, ett multimodalt kontextfönster på 1 miljon tokens och ett listpris på 2,00 USD per miljon indatatoken och 6,00 USD per miljon utdatatoken. Den ena är en komponent. Den andra är en tjänst. Den användbara frågan är var sömmen mellan dem hör hemma i en pipeline som du redan betalar för.

Subtraktionen, precis

Vad beslutstuning förändrade är värt att ange exakt, eftersom det klargör vad basmodellen redan hade med sig.

Uppgiften kallas i repositoriet för autoregressiv maskerad språkmodellering. Assistentens indata innehåller ett komplett JSON-skelett med en <decision>-token per fält; facitets svarssymboler förekommer bara i etiketterna, aldrig i indata. Träningen använder vanlig kausal nästa-token-alignering, där logiten omedelbart före en markör förutsäger fältets svar, och alla fält delar en och samma framåtpassning. Vid inferens begränsas logiterna till de giltiga svarsymbolerna som utgörs av en enda token — A–Z, a–z, 0–9, vilket är varifrån taket på 62 alternativ kommer — genomgår sedan softmax och mappas tillbaka till dina etiketter.

Så basmodellens nästa-token-maskineri är intakt och oförändrat. Det som tränades in är en preferens för att inta en av en handfull svarspositioner i stället för att fortsätta en mening, plus en kontrollpunktspecifik temperatur på 2,100509348278 anpassad genom negativ log-likelihood över 1 728 utsedda kalibreringsfall med 1 693 som hölls utanför. Kortet säger otvetydigt att generering inte är aktuellt: API:et "utför strukturerad kandidatpoängsättning. Det anropar inte generate() eller samplar fritext."

Repositoriet dokumenterar också vad finjusteringen inte rörde: den "finjusterar språkryggraden i Qwen3.5 medan vision-tornet och projektorn hålls frysta." Den 612 517 440 byte stora vision-sharden på 2B har samma byteantal som på 4B-beslutscheckpointen, vilket passar ärvda snarare än tränade komponenter. Bildvägen fungerar; den var helt enkelt inte vad beslutsomgången lade sin budget på.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

Vad 2,2 miljarder parametrar inte kan göra, och vad 2,4 biljoner gör i stället

Allt separeras längs en enda axel: huruvida ditt svar redan finns som en lista.

Intern-Decision-2B besvarar en sluten uppsättning. En till sexton frågor, upp till 62 alternativ vardera, upp till åtta bilder, allt inom en budget på 8 192 tokens som motorn vägrar snarare än trunkerar. Returneras som sannolikheter. Vid 33,28 ms i genomsnitt per begäran på ett enda RTX 4090 med en P95 på 33,55 ms, och inget debiteras per anrop eftersom det inte finns någon utdata att debitera för.

Qwen3.8-Max skriver. En kontext på 1 miljon tokens, text-, bild- och videoinmatning, resonemang med ett tankeläge, inbyggt verktygsanrop, strukturerade utdata, upp till 131 000 utdatatokens på den daterade 0902-versionen. Den kan också i princip fatta samma routningsbeslut som Intern-Decision-2B fattar – du kan prompta den att välja bland alternativ och returnera JSON. Tre saker går fel när du gör det. Du betalar för de tokens den spenderar på att besluta. Du får en sträng vars parsning kan lyckas eller misslyckas. Och talet i den strängen är vad samplern producerade, inte en softmax som du kan sätta en tröskel på 0,8 för och agera utifrån.

Båda redogörelserna är sanna och ingen av dem upphäver den andra. Flaggskeppet med 2,4 biljoner parametrar finns eftersom de flesta problem inte är slutna mängder. 2,2-miljardersscorern finns eftersom den delmängd som är det förtjänar ett billigare instrument.

Resultattavla

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• Parametrar — Intern-Decision-2B 2 213 241 664 i BF16 plus ett visionstorn och en projektor, cirka 4,46 GB på disk; Qwen3.8-Max ungefär 2,4 biljoner totalt med omkring 95 miljarder aktiva per token, serveras, inte laddas ned.

• Kontext — 8 192 token, avvisades ovan; 1 000 000 token med 131 000 maximal utdata i 0902-bygget.

• Utdata — kalibrerade sannolikheter och en argmax, ingen genererad text; genererad text inklusive ett resonemangsspår.

• Modaliteter som indata — text plus upp till åtta bilder; text, bild och video.

• Kostnad — ingen avgift per anrop, och du äger GPU:n; $2.00 per miljon indatatoken, $6.00 per miljon utdatatoken, med cacheläsningar till $0.25 och cacheskrivningar till $2.50.

• Publicerad evidens — en leverantörstabell med sju sviter med ett genomsnitt på 84,68, Brier 0,437 och ECE 0,100 över 10 751 testrader, inte reproducerad av någon utanför InternLM, på en checkpoint med en gilla-markering och noll nedladdningar; ett Artificial Analysis Intelligence Index på 45,4 på plats 15 av 145 och ett AA Coding-index på 76,2 på plats 9 av 138, båda oberoende uppmätta.

• Latens — 33,28 ms i genomsnitt per förfrågan på ett RTX 4090, och sjunker i takt med att batchning läggs till; 2,655 sekunder P50 till första token enligt vad katalogen rapporterar, och ökar med belastningen.

Bevisraderna är inte likvärdiga och bör inte skrivas ut som om de vore det. Alibabas flaggskepp har en oberoende indexpoäng bakom sig. InternLM:s checkpoint har en tabell som dess egna författare har tagit fram, och särskilt kalibreringssiffran bör läsas som en väl dokumenterad avsikt tills den möter någon annans data – i synnerhet här, eftersom just denna storlek uppvisar det sämsta förväntade kalibreringsfelet av de tre som InternLM släppte: 0,100 mot 0,066 för modellen som är hälften så stor och 0,065 för den som är nästan dubbelt så stor.

Sömmen, och hur man kör den

Pipelinen som är vettig är inte ett val mellan dessa två utan en uppdelning: scorern hanterar de uppräknade besluten, och en frontiermodell hanterar allt vars svar inte är en lista. En supporttriage som dirigerar till ett av sex team och skattar brådska på en tregradig skala behöver inte 95 miljarder aktiva parametrar; den behöver en sannolikhet och ett tröskelvärde. Eskaleringsvägen som till slut skriver ett svar till kunden gör det.

Den uppdelningen har en operativ form. Intern-Decision-2B finns inte på OrcaRouter – vår modellsida för den returnerar 404 och det finns ingen hostad route någonstans som vi kunde hitta – så den körs på din egen hårdvara, vilket innebär att den är en komponent som du driftsätter och övervakar. Qwen3.8-Max är en route: en nyckel över 200-plus modeller, leverantörens listpris vidarebefordras utan påslag, vilket innebär att en leverantörsprisändring på flaggskeppet når din faktura samma dag som den landar. Att lägga pipelineens hostade del bakom den enda ytan är det som håller den billigare delen billig: scorern håller samtalsvolymen nere, och frontmodellen nås bara för de fall som verkligen behöver den.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

Om du fortfarande utvärderar vilken scorer som hör hemma i den platsen – den här har ingen oberoende utvärdering, och dess kalibrering är svagast i sin egen familj – automatisk redundansväxling mellan leverantörer sättet att prova den i en sökväg som redan har ett fungerande alternativ bakom sig i stället för att ersätta det alternativet helt.

Den ärliga domen

Om ditt problem är ett beslut över en uppsättning svar som du kan räkna upp, och tillståndet ryms inom åtta tusen tokens, kommer Intern-Decision-2B att göra det på trettiotre millisekunder utan kostnad per anrop, och ingen frontier-modell kommer att slå den på den axeln oavsett hur många parametrar du hyr. Skaffa din egen kalibrering på den innan du förlitar dig på den konfidens den rapporterar.

Om ditt problem är något annat – resonemang, lång kontext, verktygsanvändning, video, ett dokument på en miljon tokens, eller helt enkelt ett svar som ännu inte har skrivits – är Qwen3.8-Max inte bara bättre. Det är den enda av de två som över huvud taget kan göra jobbet.

Och om du ännu inte kan säga vilken av de två du har, är svaret förmodligen att du har båda, i samma pipeline, vilket är den arkitektur som parameterantalen hela tiden tyst har sagt dig.