
Intern-Decision-2B vs Qwen 3.8: Eén backbone, twee heel verschillende taken
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 584 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 187 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Open de config van internlm/Intern-Decision-2B en de config van Qwen/Qwen3.5-2B naast elkaar en er verschilt bijna niets. Dezelfde 24 lagen, dezelfde verborgen grootte van 2.048, dezelfde 8 query-heads tegenover 2 key-value-heads, dezelfde head-dimensie van 256, hetzelfde embedding-plafond van 262.144 posities, dezelfde vocabulaire van 248.320 tokens, hetzelfde zich herhalende patroon van drie linear-attention-lagen op één full-attention-laag. Intern-Decision-2B is geen nieuwe architectuur. Het is die backbone waaruit het vermogen om tekst te genereren is weggehaald en waarvan de confidence is gekalibreerd — en juist die ene aftrekking maakt de vergelijking met Qwen3.8-Max, het vlaggenschip met 2,4 biljoen parameters waarnaar de hele familienaam "Qwen 3.8" aan de top verwijst, meer waard dan een aftelling van parameters.
De twee zijn geen concurrenten en de confrontatie is geen wedstrijd. Intern-Decision-2B is een fine-tune van Qwen3.5-2B met 2.193.241.664 parameters, geüpload naar Hugging Face om 05:36 UTC op 26 september 2026, te midden van drie niet-aangekondigde zustermodellen, en het genereert geen tokens: het neemt een state en getypeerde vragen, voert één causale forward pass uit, leest logits op vaste placeholderposities en retourneert een gekalibreerde verdeling per veld. Qwen3.8-Max is het gehoste vlaggenschip van Alibaba, een sparse mixture-of-experts-model met ruwweg 95 miljard parameters actief per token, een multimodaal contextvenster van 1 miljoen tokens en een lijstprijs van $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens. De ene is een component. De andere is een dienst. De nuttige vraag is waar de naad tussen hen hoort in een pipeline waarvoor je al betaalt.
De aftrekking, precies
Wat decision tuning veranderde, is het waard om precies te benoemen, omdat het duidelijk maakt wat het basismodel al met zich meedroeg.
De taak staat in de repository bekend als autoregressieve gemaskeerde taalmodellering. De invoer van de assistent bevat een compleet JSON-skelet met één <decision>-token per veld; de ground-truth-antwoordsymbolen komen alleen in de labels voor, nooit in de invoer. Training gebruikt gewone causale next-token-uitlijning, waarbij de logit direct vóór een marker het antwoord van dat veld voorspelt, en alle velden één forward pass delen. Bij inferentie worden de logits beperkt tot de toegestane antwoordsymbolen van één token — A–Z, a–z, 0–9, waar het plafond van 62 opties vandaan komt — waarna softmax wordt toegepast en ze terug naar je labels worden toegewezen.
Het next-tokenmechanisme van het basismodel is dus intact en ongewijzigd. Wat erin is getraind, is een voorkeur om een van een handjevol antwoordposities in te nemen in plaats van een zin voort te zetten, plus een checkpointspecifieke temperatuur van 2,100509348278 die via negatieve log-likelihood is gefit over 1.728 aangewezen kalibratiecases, met 1.693 achtergehouden gevallen. De kaart laat er geen twijfel over bestaan dat generatie niet aan de orde is: de API "voert gestructureerde kandidaatscoring uit. Hij roept generate() niet aan en samplet geen vrije tekst."
De repository legt ook vast wat de tuning niet heeft aangeraakt: deze "fine-tunet de taalbackbone van Qwen3.5 terwijl deze de vision-toren en projector bevriest." De vision-shard van 612.517.440 bytes op de 2B heeft hetzelfde aantal bytes als op het 4B-beslissingscheckpoint, wat past bij overgenomen in plaats van getrainde componenten. Het afbeeldingspad werkt; het was simpelweg niet waar de beslissingsronde zijn budget aan besteedde.

Wat 2,2 miljard parameters niet kunnen doen, en wat 2,4 biljoen in plaats daarvan doen
Alles scheidt zich op één as: of je antwoord al bestaat als een lijst.
Intern-Decision-2B beantwoordt een gesloten set. Eén tot zestien vragen, tot 62 opties per vraag, tot acht afbeeldingen, allemaal binnen een budget van 8.192 tokens, waarbij de engine liever weigert dan afkapt. Teruggegeven als waarschijnlijkheden. Met een gemiddelde van 33,28 ms per verzoek op één RTX 4090 met een P95 van 33,55 ms, en niets gefactureerd per aanroep omdat er geen output is om voor te factureren.
Qwen3.8-Max schrijft. Een context van 1 miljoen tokens, tekst-, beeld- en video-invoer, redeneren met een denkmodus, native tool calling, gestructureerde outputs, tot 131.000 outputtokens in de build van 0902. Het kan in principe ook dezelfde routeringsbeslissing nemen als Intern-Decision-2B — je kunt het vragen om uit de opties te kiezen en JSON terug te sturen. Er gaan drie dingen mis wanneer je dat doet. Je betaalt voor de tokens die het besteedt aan het nemen van de beslissing. Je krijgt een string waarvan het parseren wel of niet lukt. En het getal in die string is wat de sampler toevallig heeft geproduceerd, niet een softmax waarop je een drempel van 0,8 kunt toepassen en waarop je kunt afgaan.
Beide verklaringen zijn waar en ze heffen elkaar niet op. Het vlaggenschip met 4 biljoen parameters bestaat omdat de meeste problemen geen gesloten verzamelingen zijn. De scorer met 2,2 miljard parameters bestaat omdat de deelverzameling die dat wel is een goedkoper instrument verdient.
Scorebord

• Parameters — Intern-Decision-2B 2.213.241.664 in BF16 plus een visietoren en projector, ongeveer 4,46 GB op schijf; Qwen3.8-Max ongeveer 2,4 biljoen totaal met ongeveer 95 miljard actief per token, geserveerd, niet gedownload.
• Context — 8.192 tokens, hierboven afgewezen; 1.000.000 tokens met 131.000 maximale uitvoer in de 0902-build.
• Uitvoer — gekalibreerd en een argmax, geen gegenereerde tekst; gegenereerde tekst inclusief een redeneerspoor.
• Modaliteiten in — tekst plus tot acht afbeeldingen; tekst, afbeelding en video.
• Kosten — geen kosten per oproep, en je bent eigenaar van de GPU; $2,00 per miljoen invoertokens, $6,00 per miljoen uitvoertokens, met cache-leesacties tegen $0,25 en cache-schrijfacties tegen $2,50.
• Gepubliceerd bewijs — een leverancierstabel met zeven suites die gemiddeld 84,68, Brier 0,437 en ECE 0,100 scoort over 10.751 testrijen, door niemand buiten InternLM gereproduceerd, op een checkpoint met één like en nul downloads; een Artificial Analysis Intelligence Index van 45,4 op rang 15 van 145 en een AA Coding index van 76,2 op rang 9 van 138, beide onafhankelijk gemeten.
• Latentie — 33,28 ms gemiddeld per verzoek op één RTX 4090, wat afneemt naarmate er batching wordt toegevoegd; 2,655 seconden P50 tot het eerste token zoals de catalogus het rapporteert, wat toeneemt bij belasting.
De bewijsrijen zijn niet gelijkwaardig en moeten niet worden afgedrukt alsof dat wel zo is. Het vlaggenschip van Alibaba heeft een onafhankelijke indexscore achter zich. De checkpoint van InternLM heeft een tabel die de eigen auteurs hebben geproduceerd, en vooral het kalibratiecijfer moet worden gelezen als een goed gedocumenteerde intentie totdat het de data van iemand anders tegenkomt — des te meer hier, omdat deze specifieke grootte de slechtste verwachte kalibratiefout van de drie die InternLM heeft uitgebracht laat zien, 0,100 tegen 0,066 voor het model dat half zo groot is en 0,065 voor het model dat bijna twee keer zo groot is.
De naad, en hoe je die uitvoert
De pijplijn die logisch is, is geen keuze tussen deze twee maar een opsplitsing: de scorer behandelt de opgesomde beslissingen, en een frontier model behandelt alles waarvan het antwoord geen lijst is. Een supporttriage die naar een van zes teams routeert en urgentie op een driepuntsschaal beoordeelt, heeft geen 95 miljard actieve parameters nodig; die heeft een waarschijnlijkheid en een drempel nodig. Het escalatiepad dat uiteindelijk een antwoord aan de klant schrijft, heeft die wel nodig.
Die splitsing heeft een operationele vorm. Intern-Decision-2B staat niet op OrcaRouter — onze modelpagina ervoor geeft een 404 en er is nergens een gehoste route te vinden — dus het draait op je eigen hardware, wat betekent dat het een component is die jij beheert en monitort. Qwen3.8-Max is een route: één sleutel voor meer dan 200 modellen, de adviesprijs van de provider wordt zonder opslag doorgegeven, wat betekent dat een prijswijziging van een leverancier voor het vlaggenschip dezelfde dag nog op je factuur terechtkomt. Het gehoste deel van de pijplijn achter dat ene oppervlak plaatsen, is wat het goedkopere deel goedkoop houdt: de scorer houdt het callvolume laag, en het frontiermodel wordt alleen bereikt voor de gevallen die het echt nodig hebben.

Als je nog aan het afwegen bent welke scorer op die plek thuishoort — deze heeft geen onafhankelijke evaluatie, en zijn kalibratie is de zwakste binnen zijn eigen familie — automatische failover over meerdere providers heen is de manier om het uit te proberen in een pad dat al een werkend alternatief achter de hand heeft, in plaats van dat alternatief zonder meer te vervangen.
Het eerlijke oordeel
Als je probleem een beslissing is over een verzameling antwoorden die je kunt opsommen, en de toestand past binnen achtduizend tokens, dan doet Intern-Decision-2B het in drieëndertig milliseconden voor niets per aanroep, en geen enkel frontiermodel zal het op die as verslaan, ongeacht hoeveel parameters je huurt. Zet er je eigen kalibratie op voordat je afgaat op de confidence die het rapporteert.
Als je probleem iets anders is — redeneren, een lange context, toolgebruik, video, een document van een miljoen tokens, of gewoon een antwoord dat nog niet is geschreven — dan is Qwen3.8-Max niet alleen maar beter. Het is de enige van de twee die het werk überhaupt aankan.
En als je nog niet kunt zeggen welke van die twee je hebt, is het antwoord waarschijnlijk dat je beide hebt, in dezelfde pipeline, wat de architectuur is die de parameteraantallen je al die tijd stilletjes vertelden.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
