
Intern-Decision-0.8B vs Qwen 3.8: 853 miljoen parameters en een gesloten set antwoorden
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 592 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 187 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Intern-Decision-0.8B is de kleinste van de drie beslissingsmodellen die InternLM op de ochtend van 26 september 2026 naar Hugging Face pushte, en het is niet de snelste van de drie. Dat is het eerste dat het weten waard is. Volgens de eigen metingen van het lab loopt het 2B-broertje marginaal sneller — 33,28 ms tegen 33,98 ms — en scoort het zes punten hoger op hetzelfde gemiddelde over zeven suites, dus de gebruikelijke reden om naar een checkpoint van minder dan een miljard parameters te grijpen, ruwe snelheid, geldt hier niet. Wat wel geldt, is grootte: 852.985.920 parameters, 1,71 GB aan bf16-gewichten, klein genoeg om permanent in de marge te zitten van een machine die iets anders te doen heeft. Zet dat tegenover Qwen3.8-Max — de gehoste levering van de sparse mixture-of-experts-kern met 2,4 biljoen parameters die de leverancier in augustus publiceerde, geprijsd op $2,00 en $6,00 per miljoen tokens — en de twee concurreren niet om dezelfde taak. De een geeft een kansverdeling terug over opties die je vooraf hebt aangeleverd. De ander schrijft.
Het korte antwoord: Intern-Decision-0.8B is de moeite waard als je een closed-setbeslissing nodig hebt die gescoord wordt op hardware die je al bezit, en als 1,71 GB in plaats van 4,43 GB het verschil is tussen wel of niet uitbrengen. Het is niet de moeite waard als je de nauwkeurigste kleine scorer wilt die InternLM deze week heeft uitgebracht — dat is de 4B — of als je antwoord niet al in je prompt is opgesomd, in welk geval geen van deze twee het juiste hulpmiddel is en Qwen 3.8 de enige van het tweetal is die de klus überhaupt aankan.
Wat de repository zegt, en wat niets anders doet
Begin bij het bewijs, want er is heel weinig van. InternLM heeft geen aankondiging voor dit model gedaan. Geen lanceringsbericht, geen paper, geen repositorybeschrijving. De Hugging Face-kaart linkt naar een demo-Space en een GitHub-repository, en op het moment van schrijven geeft de Space een 401 terug en de GitHub-link een 404 — de twee plekken waar de kaart je naartoe verwijst voor meer informatie, zijn gesloten. Drie checkpoints verschenen binnen veertig seconden na elkaar rond 05:36 UTC op 26 september: Intern-Decision-0.8B, Intern-Decision-2B en Intern-Decision-4B, allemaal met dezelfde tags — decision-making, multimodal, structured-prediction — en allemaal fine-tunes van Qwen-checkpoints, in dit geval Qwen3.5-0.8B.
Wat kenbaar is uit de repository is ongewoon precies voor een niet-aangekondigde release, omdat het lab zijn eigen inferentiemodule samen met de gewichten heeft meegeleverd. De 0.8B laadt via een 16 KB inference.py in de modelmap, vereist Python 3.12 of nieuwer en torch 2.9.1 met transformers 5.14.1, en stelt een DecisionEngine-klasse beschikbaar die je één keer instantieert en hergebruikt. Eén Python-dict in, één response-dict uit. Wat niet kenbaar is: of dit een afgeronde release is of een vroege push, of er een gehost endpoint aankomt, en of de twee checkpoints waartussen het ligt bedoeld zijn als hetzelfde product in verschillende groottes of drie verschillende producten die toevallig dezelfde naam delen. Niemand buiten InternLM heeft er een van uitgevoerd.

Het zusterprobleem: de 2B is sneller en beter
Hier is het deel van de eigen gepubliceerde tabel van InternLM dat de 0.8B moeilijk te plaatsen maakt. Als je de drie groottes langs dezelfde zeven suites van boven naar beneden leest:
• Snelheid — 0,8B: 33,98 ms gemiddelde, 33,44 ms mediaan, 37,50 ms bij p95. 2B: 33,28 ms, 33,15 ms, 33,55 ms. 4B: 44,16 ms, 44,03 ms, 44,60 ms. Allemaal per query gemeten op één enkele RTX 4090 via het lokale Hugging Face-pad.
• Gemiddelde van zeven suites — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.
• Kalibratie — 0,8B: Brier 0,530, ECE 0,066. 2B: Brier 0,437, ECE 0,100. 4B: Brier 0,347, ECE 0,065.
• Schijfgebruik bij bf16 — 0,8B: 1,71 GB. 2B: 4,43 GB. 4B: 9,08 GB.
De 2B is gemiddeld sneller, dramatisch strakker in de staart en nauwkeuriger, allemaal tegelijk. Dus "kleiner betekent sneller" is onwaar binnen deze familie — en dat tweemaal, aangezien de 4B langzamer is dan beide. De enige as waarop de 0.8B onbetwist wint, is degene die niemand benchmarkt: 1,71 GB tegen 4,43 GB van de 2B en 9,08 GB van de 4B. Als je een scorer in een vast geheugenbudget plaatst — een klein always-on apparaat, een multi-tenant-GPU, een edge-node waarop een taalmodel al het grootste deel van de kaart in beslag neemt — dan is dat het hele argument, en het is een reëel argument.
De rest van de tabel is een studie naar waar kleine modellen ongelijkmatig afbreken. De Typed Decision-score van de 0,8B is 77,35 tegen 80,55 voor de 4B — drie punten verschil bij een vijfde van het aantal parameters. Maar Jevbench-Original daalt van 98,61 naar 80,56 en WildJailBreak stort in van 89,86 naar 64,48. Wat die twee suites ook meten — de kaart zegt het niet, en de kaart geeft helemaal geen suitesdefinities — zij zijn degene die het kleine checkpoint het hardst straffen. Een model dat standhoudt op één as en van een klif valt op twee andere is geen uniform zwakker model. Het is een model met een specifieke competentiegrens, en je zou willen weten waar je workload zich bevindt voordat je de vloot eraan vastlegt.
Nog een waarschuwing over de calibratierij. De ECE van de 0.8B, 0.066, is zijn beste cijfer — beter dan de 0.095 van Jev op dezelfde testsuite — terwijl zijn Brier-score van 0.530 slechter is dan de 0.358 van Jev. Gekalibreerde fout en gemiddelde kwadratische waarschijnlijkheidsfout zijn niet dezelfde meting, en een tabel waarin de ene sterk en de andere zwak lijkt, vertelt je dat de verdeling goed gevormd is rond haar betrouwbaarheidspieken en in het tussenliggende gebied dikker is dan zou moeten. Als je systeem een drempel op betrouwbaarheid hanteert, is dat onderscheid belangrijker dan het gemiddelde.
Wat 1,71 GB daadwerkelijk oplevert
Het inferentiepad in dit model is een scorer, niet een generator, en het verschil in kosten is structureel in plaats van incrementeel. Je geeft het een gedeelde toestand, een schema van benoemde vragen, en optioneel tot acht afbeeldingen. Elke vraag is een van drie types: choice (een van een geordende set opties), score (een ordinale schaal, teruggegeven als een kansgewogen verwachte waarde), of noul (binair nee/ja). De toestand, het schema en een compleet assistant-JSON-skelet worden gerenderd met één placeholder per veld, het model voert één causale forward pass uit, en de logits worden gelezen op de positie direct vóór elke placeholder. Er wordt een softmax genomen over alleen de toegestane kandidaatsymbolen van dat veld, de gefitte kalibratie van het checkpoint wordt toegepast, en de symbolen worden teruggezet naar je optiewaarden.
Daaruit volgen drie consequenties. Er is geen outputtoken en dus ook geen outputprijs — een miljoen beslissingen kosten niets aan tokens. Er is geen decoderingslus en geen accolade om te vergeten, dus misvormde JSON is geen faalmodus. En omdat de antwoordruimte van elk veld per verzoek wordt samengesteld, hoeft een schema dat je vanmiddag bedenkt niet opnieuw te worden getraind: voeg een vraag toe en de bijbehorende opties worden kandidaatsymbolen voor dat veld.
De limieten worden net zo duidelijk vermeld. Eén tot zestien vragen, maximaal 62 opties per vraag, maximaal acht afbeeldingen, en een standaardlimiet van 8.192 tokens — waarbij invoer die daarboven uitkomt wordt geweigerd in plaats van afgekapt. Die laatste clausule is een ontwerpbeslissing die het overdenken waard is, want stille afkapping is de manier waarop een classificator ongemerkt een andere vraag begint te beantwoorden dan degene die je hebt gesteld. InternLM faalt in plaats daarvan luidruchtig, wat correct is en tegelijk een operationele valkuil: een lange ticketthread plus een schema plus afbeeldingen overschrijden de 8.192 eerder dan je verwacht, en er is geen elegante route wanneer dat gebeurt.
En de 1,71 GB levert runtime-economie op die je kunt doorrekenen. Bij 33,98 ms per beslissing is een miljoen beslissingen 9,44 uur op één RTX 4090. De 4B heeft 12,3 uur nodig voor hetzelfde miljoen, en levert tien en een halve punt nauwkeurigheid in in ruil voor de 7,37 GB die je niet had. Geen van beide getallen omvat de kosten van de machine, en geen van beide omvat het deel dat mensen vergeten: je exploiteert een service, en er is geen server in de repository.

Qwen 3.8 is niet één model, en het is het goedkope uiteinde dat opvalt
Qwen 3.8, als op zichzelf staande naam beschouwd, is Qwen3.8-2.4T-A95B: de sparse mixture-of-experts-kern met 2,4 biljoen parameters die Alibaba op 12 augustus 2026 als open gewichten publiceerde, met ongeveer 95 miljard actieve parameters per token en een aangepaste licentie in plaats van Apache 2.0. De gehoste levering van diezelfde kern is Qwen3.8-Max, sinds 3 augustus algemeen beschikbaar via een betaalde API en vernieuwd als een gedateerde snapshot van 2 september. Het is één brein dat op twee manieren wordt verkocht, en de tweede levering is degene die de meeste mensen daadwerkelijk zullen aanroepen.
Op basis van onafhankelijke cijfers meet Artificial Analysis de septembermomentopname van Qwen3.8-Max op een Intelligence Index van 45,4 — op de vijftiende plaats van 145 geïndexeerde modellen — met een AA Coding-score van 76,2 op de negende plaats van 138, GPQA Diamond op 92,8, Humanity's Last Exam op 43,1 en een lange-context-recallscore van 80,3. Het open checkpoint blijft achter bij de API waaruit het is gedistilleerd, op 39,9. In ons eigen playgroundvenster van zeven dagen zit Qwen3.8-Max op een p50 van 2.578 ms en een p95 van 9.539 ms bij 55,5 outputtokens per seconde, met een foutpercentage van 1,57%. Qwen3.8-Max is aanroepbaar op OrcaRouter tegen de lijstprijs van de provider, met 0% markup toegevoegd, dus een prijswijziging van Alibaba is dezelfde dag nog live aan onze kant in plaats van bij de volgende factureringscyclus.
De dense variant is degene die je moet afwegen tegen een lokaal checkpoint van 1,71 GB, want het is de goedkoopste manier om algemene capaciteit binnen deze familie te kopen. Qwen3.8-27B is Apache 2.0, heeft een native context van 262.144 tokens, en Qwen3.8-27B kost $0,33 en $2,40 per miljoen tokens in onze catalogus. De Artificial Analysis Intelligence Index is 33,7. Het heeft ongeveer tweeëndertig keer zoveel parameters als Intern-Decision-0.8B, is nog steeds generatief, en nog steeds het verkeerde instrument voor een closed-setbeslissing op volume — maar het is de eerlijke middenoptie, en het enige lid van deze vergelijking dat tegelijkertijd echt goedkoop en echt algemeen is.
Scorer tegenover generator, eenvoudig gesteld.
• Context — Qwen3.8-Max heeft een contextvenster van 1.000.000 tokens. Intern-Decision-0.8B weigert alles boven 8.192. Een factor 122, afgedwongen in plaats van afgekapt.
• Invoer — Qwen3.8-Max accepteert tekst, afbeelding en video. Intern-Decision-0.8B accepteert tekst en maximaal acht afbeeldingen, en de afbeeldingstokens tellen mee binnen hetzelfde budget van 8.192.
• Output — Qwen3.8-Max schrijft, redeneert, roept tools aan en genereert JSON op verzoek. Intern-Decision-0.8B kan geen alinea, geen onderbouwing en geen plan produceren. Het kan alleen de opties scoren die je al had bedacht om op te sommen.
• Kosten per aanroep — een realistische triage-aanroep van 800 invoertokens en 150 uitvoertokens kost ongeveer $0,0025 op Qwen3.8-Max, vóór eventuele redeneertokens, en de uitvoerzijde is optimistisch klein omdat het een redeneermodel is. Een miljoen zulke aanroepen kost ongeveer $2.500. Intern-Decision-0.8B heeft helemaal geen tokenprijs: een miljoen beslissingen is 9,44 uur op een 4090 die je bezit of huurt.
• Latentie — 2.578 ms mediaan op Qwen3.8-Max over de afgelopen zeven dagen, inclusief netwerk en wachtrijen. De 33,98 ms van Intern-Decision-0.8B is een kale forward pass op een lokale kaart en is niet dezelfde meting; de eerlijke vergelijking is één orde van grootte, niet tachtig keer.
• Bewijs — elk hier vermeld cijfer voor Intern-Decision-0.8B is door de leverancier opgegeven op basis van de eigen evaluatieharnassen van InternLM en is door niemand gereproduceerd, inclusief de latentie. Elk cijfer voor Qwen 3.8 is ofwel afkomstig van Alibaba zelf, ofwel een meting van Artificial Analysis, en ze zijn hierboven afzonderlijk gelabeld.
• Onafhankelijke score — Qwen3.8-Max heeft er een. Intern-Decision-0.8B heeft er geen enkele, van welke soort dan ook, en geen enkele inferentieprovider zet het in.

Twee manieren om deze pipeline te draaien
De operationele fork is scherper dan de benchmark-fork. Intern-Decision-0.8B is een module, geen service. Er is geen OpenAI-compatibel endpoint, geen batchserver, geen healthcheck, geen retrybeleid en geen tweede replica, tenzij je er zelf een bouwt. Het wordt in één proces geladen en verwerkt één dict per keer, en als je failover nodig hebt, ben jij de failover. Dat is een eerlijke beschrijving van een onderzoekscheckpoint met 853 miljoen parameters dat zonder lanceringsnotitie is gepubliceerd, en dat zou dienovereenkomstig in de beslissing moeten worden meegewogen.
De generatieve helft van dezelfde pipeline is een netwerkaanroep, en een netwerkaanroep is waar een router voor dient. Zowel Qwen3.8-Max als Qwen3.8-27B zijn bereikbaar achter één OpenAI-compatibele sleutel, en automatische failover betekent dat een gedegradeerde upstream niet jouw incident wordt — de moeite waard om hier te noemen, want het live foutenpercentage over zeven dagen van Qwen3.8-Max aan onze kant is 1,57%, wat laag is totdat het jouw verzoek is. Het patroon dat zinvol is, is het patroon dat deze combinatie al die tijd stilzwijgend beschrijft: voer de goedkope scorer met gesloten set lokaal uit, want die is snel en kost niets per aanroep, en routeer de redeneerstap, want daar vinden de prijsverlagingen, de modelwisselingen en de storingen daadwerkelijk plaats.
Twee dingen die we niet zullen beweren. Intern-Decision-0.8B is geen van onze routes en zal dat ook niet zijn totdat InternLM het ergens host — we gaan niet anders suggereren. En we hosten vandaag helemaal geen InternLM-model, dus niets in dit artikel is een pitch om het onderwerp via ons te draaien.
Wat zou het antwoord veranderen
Drie open vragen, allemaal binnen enkele dagen te beantwoorden. Publiceert InternLM de GitHub-repository waarnaar zijn eigen modelkaart verwijst, en daarmee een beschrijving van hoe deze gewichten zijn afgestemd? Volgt er een lanceringsbericht na de checkpoints, waarmee een stille push wordt omgezet in een gedocumenteerde release met een uiteengezet deploymentverhaal? En reproduceert iemand onafhankelijk het gemiddelde van 79,38 of de kalibratiefout van 0,066 op hardware die niet van InternLM is?
Totdat een van die dingen er komt, is de eerlijke lezing van Intern-Decision-0.8B smal en specifiek: het is de goedkoopste closed-setscorer in een familie van drie, op een voetafdruk die past waar zijn eigen snellere en nauwkeurigere broer dat niet doet, gepubliceerd zonder aankondiging en zonder het ene artefact dat je zou vertellen waarvoor hij is afgestemd. Als je beslissing closed-set is, je antwoorden opsombaar zijn in een prompt, en 1,71 GB het getal is waar het bij je deployment daadwerkelijk om draait, dan is het de juiste keuze en is er niets anders zoals het op die grootte. Als je antwoord niet vooraf opsombaar is, of je state voorbij 8.192 tokens loopt, of je een onderbouwing nodig hebt die je aan een mens kunt laten zien, dan was de vergelijking nooit close — en het model dat je wilt, was nooit het model met 853 miljoen parameters.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
